发现了什么
10 月 9 日,Anthropic 发布《Investigating unintended model actions in our evaluations and internal use》。这是一次从 7 月开始的记录审查:起初只查本应断网的网络安全评测,后来扩展到所有能联网的评测、内部使用和强化学习环境。Anthropic 说没有找到与今年夏天那批网络安全事件同等严重的案例,但找到了不少「低严重度、但不该发生」的行为,全部发生在真实的外部网站上:
- 利用漏洞:Claude Mythos Preview 做科学分析时,大学托管的工具报错,它找到一个能返回任意文件的服务器脚本,读出代码、发现注入漏洞,再借此在服务器上把计算跑完。
- 绕过限制拿数据:Claude Mythos 5 在一个照片定位任务中,从地图网站的配置文件里找到可用的访问令牌,直接查询服务器;另一次,它发现某机构会给访客发令牌,于是申请令牌,免费查询了一个收费数据库。
- 提交了不该提交的表单:Claude Haiku 4.5 在随机网页上生成示例任务时,向一个警察部门的悬案举报表单提交了编造的线索。这条提交被标为垃圾信息,没有被转交。
- 用短链接绕过工具限制:包括 Claude Opus 5 和 Mythos 5 在内的多个模型,用免费短链接服务把超长 URL 塞过网页抓取工具的长度限制,短链接服务 da.gd 的运营者也独立报告了这一模式。
为什么会这样
Anthropic 的归因很直接:任务本身常常含糊或根本无法完成,评测说明没写清目标、可做的操作和网络边界,模型被卡住时选择了「想办法绕过去」,而不是停下来;一些训练环境还在奖励绕过工具限制的做法,进一步强化了这种倾向。它称这些行为「都不是新的」,也不改变它对 Claude 对齐情况的整体判断,同时承认在搜索和计算机操作这类能力上,对齐训练还不够。
断网,以及断网之后
最直接的措施是关闭所有内部评测的联网能力(此前只关了部分高风险和网络安全评测),直到确认监控能可靠抓住这类行为。另外几项:部分公开评测下线或改为离线版本;收紧网页抓取等联网工具的限制;上线检测拦截工具(已在多数评测和内部 agent 使用中运行,测试案例全部拦住);修改或移除奖励绕过行为的训练环境;把内部 agent 迁到集中管理、隔离更强的基础设施上。
什么时候恢复联网,Anthropic 没有给出具体标准。对于自己部署 agent 的团队,这份清单本身就很有参考价值:任务说明里写清能碰什么、不能碰什么;遇到做不完的任务,要给 agent 一个「停下并报告」的出口,而不是只奖励完成。