Anthropic 把独立评估者请进了自己公司:埃森哲拿到类员工级访问权限,双方各投至少 10 亿美元

Anthropic 于 9 月 18 日宣布与埃森哲就前沿 AI 的独立评测建立合作,由埃森哲旗下专业 AI 业务 Faculty 牵头,工作内容包括模型评测与红队、对齐评估和安全防护测试。这套做法被称为「嵌入式评测」:与在被评测公司之外工作的既有外部评测机构不同,嵌入式评估者在公司内部工作,拥有与员工相当的访问权限,可以观察模型在训练中成形、跟进模型如何构建与部署的决策,并直接与员工交谈。资金上,两家各自预计未来五年在该领域投入至少 10 亿美元,合计不低于 20 亿美元;本次合作由 Anthropic 直接出资购买埃森哲的工作。Anthropic 表示,按其 6 月发布的框架,独立评测的长期资金应来自共同出资或政府来源,在缺少这类机制的情况下才与不同评估者按不同安排合作;公司同时表示正与 METR 等非营利评测机构商谈,用对方自有资金试点嵌入式评测的部分环节。该合作为非排他:Anthropic 称未来数周还会宣布其他评估者,埃森哲也会以类似身份与其他 AI 开发者合作。此项工作是两家 2025 年 12 月 9 日宣布的多年合作的延伸。

四天前才被说出口的那句话,现在签成了合同

本站 9 月 14 日写过 Amodei 呼吁行业放慢那条,当时 Altman 在回应里认领的具体一项,正是「让独立评估者拿到类员工级别的访问权限」。 9 月 18 日,Anthropic 把这句话变成了一纸合作。四天。这个速度本身就值得记一笔——它说明这件事不是当天临时提出的设想,而是早就在谈、只是那天被说了出来。 也正因为落地得快,评判标准就该从「愿景」切换到「条款」。而条款里最值得看的是访问权限这一条:外部评测机构只能看到模型的输出,嵌入式评估者能看到模型在训练中怎么成形、构建和部署的决策怎么做出、以及能直接问员工。**这是评测能力的实质提升,不是措辞上的进步。**能看到过程和能看到结果,是两种完全不同的评测。

昨天那个结构性问题,在这里以最彻底的形式出现

本站 9 月 18 日写 AEF-1 时指出过一个结构性问题:评估者的收入来自被评估者。今天这条把它推到了极致——评估者不仅收被评估方的钱,还坐在被评估方的楼里、用着被评估方给的权限。 必须同时记下的是,Anthropic 自己在公告里把这点写明了:按其 6 月发布的框架,独立评测的长期资金应当来自共同出资或政府来源;是在缺少这类机制的情况下,它才选择按不同安排与不同评估者合作。**这是一份承认自己是次优解的公告**,这一点在同类发布里并不常见,该给它记上。 但承认不等于解决。公告里没有公开的利益冲突处理条款——评估者发现问题后能不能对外说、说到什么程度、被否决了怎么办,这些是「独立」二字真正落在哪里的地方,目前都没有写。这也是接下来最该追问的。 另外一个不该模糊的区别:埃森哲不是非营利机构。它是一家同时在向大量企业销售 AI 落地服务的咨询公司,和 METR 这类机构的处境不一样。Anthropic 说正与 METR 等商谈用对方自有资金试点——那条路径如果成形,独立性比这条强,因为付钱的和被评的终于不是同一方。

「各投 10 亿」是什么钱,要读准

很容易把「各投至少 10 亿美元」读成「花 10 亿请人做评测」。按公告口径,这是两家各自预计未来五年**在这一领域建设能力**的投入,不是付给这次评测工作的费用。 同样要按口径读的还有 Faculty 的位置:它是埃森哲收购来的应用 AI 公司,此前有为大型 AI 实验室做模型测试评估、以及在政府、国防、医疗和基础设施这类高风险场景里做系统的经验。这份履历解释了为什么是它,但也说明这是一个做甲方生意起家的团队转过来做评估。 接下来几周有两件事可以对照着看:Anthropic 说还会宣布其他评估者——名单里有没有不拿它钱的机构,是判断这套安排成色的第一个信号;以及 METR 那条用自有资金的试点能不能真的落地。在那之前,这份合作的准确定性是:**评测能力确实往前走了一大步,独立性的制度保障还欠一份公开条款。**

via: Anthropic 官方公告Unite.AI 报道Adgully 报道Pulse 2.0 报道