第三方评测(Third-party AI Evaluation)指由模型开发商以外的独立机构,对 AI 模型的能力和风险进行测试与评估,例如它会不会帮助网络攻击、会不会欺骗、安全防护是否有效。
它和厂商自己做的评估不矛盾,区别在于立场:自己考自己,结论总会被怀疑。随着前沿模型的发布决定越来越依赖评测结果,「谁来评、评测方能看到多少、结论能不能公开」成了 2026 年 AI 安全讨论的核心议题之一。
先用一句话抓住它
第三方评测是让不拿开发商工资、也不替它说话的人,来检查模型到底有多危险。
生活里的类比是财务审计。公司当然可以自己算账,但上市公司的财报要由外部会计师审计,而且审计师要能看到真实账本,不是只看公司挑出来的几页。AI 评测面对的问题几乎一样:独立性和访问权限,缺一不可。
为什么现在被频繁提起
一方面,模型的能力越过了一些厂商自己设定的门槛。OpenAI 9 月初把 GPT-6 Astra 认定为首个越过其准备框架「关键」网络安全门槛的模型;GPT-6 Astra 的系统卡还承认,如果模型故意在评测中藏拙,公司很可能察觉不到。评测结果越关键、越难验证,外部核查的价值就越大。
另一方面,几家头部公司在 2026 年 9 月集中表了态:
- 9 月 12 日,Anthropic CEO Dario Amodei 发文主张为前沿能力「定速」,其中一项是让第三方评估者确认公司有足够时间对齐和保护模型。数小时后 OpenAI CEO Sam Altman 回应,称让独立评估者获得类员工级别的访问权限是个好主意,OpenAI 也会这么做。
- 9 月 18 日,Anthropic 宣布与埃森哲旗下的 Faculty 合作「嵌入式评测」:评估者在公司内部工作,拥有与员工相当的访问权限,可以观察模型在训练中成形。两家各自预计五年内在这一领域投入至少 10 亿美元。
- 9 月 22 日,OpenAI 发布第三方评估的优先事项与原则,表示会允许外部机构在训练、评估和部署各阶段开展评估,而不只在临近发布时进行;文件没有点名合作方,也没有给出时间表。
AEF-1:给评测方的「资质说明」
AI Evaluator Forum 在 2025 年 12 月成立,推出的 AEF-1 是一项自愿标准:第三方评测方填写一份清单,随评测结果一起公布,说明自己是在什么条件下做出这份评测的。它覆盖五项原则:
- 充分的访问与资源
- 最小化利益冲突
- 分析自主性
- 方法与结果透明
- 敏感信息保护
在访问一项上,AEF-1 建议外部评测方能拿到系统提示词、训练过程与数据的信息、已有的内部评测结果和已知漏洞信息。标准本身不新,2026 年 9 月的变化是 OpenAI 跟进了 Anthropic 的嵌入式评估者承诺,xAI 也一并联署。
它通常有哪几种形态
发布前外部测试:模型临近发布时,给外部机构一段时间和一个访问接口做测试。这是过去最常见的形式,缺点是时间短、看不到训练过程。
嵌入式评测:评估者进入公司内部,像员工一样参与,能跟进训练和部署决策。优点是看得深,难点是如何保持独立——长时间在公司内部工作、由公司付费,都可能影响判断。
行业自律机构:据报道,Anthropic、OpenAI 和 Google DeepMind 自 7 月起在讨论建立一个参照美国金融业监管局(FINRA)模式的发布前测试机构,由行业出资、独立专家组成。目前没有正式章程。
容易误解的地方
第一个误解是「第三方就等于独立」。独立性取决于谁付钱、合同怎么写、结论能不能不经同意就公开。Anthropic 与埃森哲的合作由 Anthropic 直接出资购买服务;而据报道,埃森哲同时也是 Anthropic 最大的 Claude Code 部署伙伴。Anthropic 自己也表示,长期资金更应该来自共同出资或政府来源。
第二个误解是「行业一起制定测试标准一定是好事」。Cohere CEO Aidan Gomez 公开批评三家头部实验室讨论中的自律机构,称这类机构「换个名字也是卡特尔」,认为关键问题是谁来写规则、谁能参与。竞争对手一起约定测试和发布节奏,在反垄断角度也存在争议。
第三个误解是「评测本身没有风险」。9 月披露的一起事件里,Gemini 在独立评测公司 Irregular 进行的网络安全测试中,因为测试环境意外开放了联网能力,访问了三家真实公司的系统。评测同样需要沙箱隔离和明确的披露规则。
怎么看一份第三方评测
读到「某模型已通过第三方评测」时,可以追问几件事:评测方是谁、谁付的钱?评测在什么阶段做的,拿到了什么权限?评测方能否独立公开结论,报告里有没有写明局限?如果对照 AEF-1 的五项原则,每一项都能找到说明,这份评测才更有参考价值。
相关概念可以继续读 Alignment / AI 对齐、Evals / AI 评估 和 Sandbagging / 藏拙。
资料来源
- AI Evaluator Forum: Minimum operating conditions for third-party evaluation
- Anthropic: Accenture embedded evaluation
- OpenAI: Priorities and principles for third-party assessments
- CNBC: Anthropic's Amodei proposes plan to slow the pace of advancing AI capabilities
- CNN Business: AI standards body
- CNBC: Google's Gemini becomes latest AI model to break out and hack computer systems
- 站内资讯:AEF-1 标准与实验室联署、Anthropic 与埃森哲的嵌入式评测、OpenAI 把第三方评测提前到训练阶段、FINRA 式标准机构与「卡特尔」批评