Anthropic 第二份风险报告:用来判断「模型能否顶替自家研究员」的内部基准已经饱和

2 查看

Anthropic 于 8 月 14 日发布第二份公司级风险报告,186 页,首次把未发布的内部模型一并纳入评估。报告把「高风险场景下失准造成灾难性伤害」的评级从「极低」上调到「低」,并直言用来盯 AI 研发自动化门槛的内部基准 CoBench 已经饱和——最具体的任务型评测不再能反映能力增量。报告同时披露了一个不打算发布的内部模型 Model 2。

尺子先到头了

CoBench 是 Anthropic 的内部基准,用来评估模型是否逼近「可以顶替自家研究科学家与工程师」的门槛,对应其负责任扩展政策(RSP v3.4)里那条 AI 研发自动化红线。报告的措辞很直白:判定仍是「低」,两条 RSP 标准都不认为已满足,但「我们对这一判断的信心低于以往的风险报告,因为我们最具体的任务型评测已经『饱和』」。报告同时提到公司内部已看到加速的早期迹象:Claude 现在写下并合入生产代码库的比例占绝大多数,AI 辅助的研发明显快于无辅助,但还没到两倍。换句话说,被监控的对象在加速,而监控它的仪表停在了刻度顶端。

评级上调,但原因不是某项测试没过

失准风险从 2 月首份报告的「极低」升到「低」,触发点不是安全测试失败,而是近期网络安全评测中的事故披露抬高了整体不确定性;Anthropic 自己也写明,底层论证「大概仍支持『极低』」。上调的其实是对自身判断的把握程度,不是关于模型行为的新结论。报告覆盖 2026 年 2 月 24 日至 7 月 15 日。

Model 2、生物风险缺口,以及被整段删掉的那件事

截至覆盖期,公司内部握有三个未发布的前沿或接近前沿模型:Claude Opus 5(此后已发布)、使用量较低的 Model 1,以及 Model 2。Model 2 在 CoBench 上拿到 62.8%,高于已发布旗舰 Mythos 5 的 50.3%,但没有公开发布计划。生物化学风险维持「低,但高于此前估计」:Anthropic 发现 2025 年 5 月至 2026 年 4 月间,人类反馈供应商侧约 5 万名承包商产生的 1.33 亿次交互全程没有经过其生物类拦截分类器,事后已修补,未发现滥用证据。另有一起事故在公开版中被整段删除——Anthropic 让 Mythos 自己评审了这份报告,模型的反馈是:被删掉的那件事属于所有未公开材料里最重要的几项之一。

via: Anthropic 官方《Risk Report: August 2026》SiliconANGLE 报道Unite.AI 报道;核实于 2026-08-16