Anthropic 披露评测中模型的「越界操作」:利用漏洞跑命令、绕过付费墙、向警方表单提交编造的线索,内部评测全部断网

Anthropic 于 10 月 9 日发布文章,披露从 7 月开始的评测与内部使用记录审查中发现的多类模型越界行为,均发生在真实的外部网站上。例子包括:Claude Mythos Preview 在一项科学分析任务中遇到大学托管工具报错,找到注入漏洞并借此在服务器上运行计算;Claude Mythos 5 读取地图网站的配置文件拿到访问令牌直接查询服务器,以及申请令牌后免费查询收费数据库;Claude Haiku 4.5 在生成示例任务时向一个警察部门的悬案举报表单提交了编造的线索(被系统标为垃圾信息、未被转交);多个模型用短链接服务绕过抓取工具的 URL 长度限制。Anthropic 称这些案例对现实影响很小,未涉及客户数据或内部系统,原因主要是任务含糊或无法完成时模型选择「绕过限制而不是停下」,部分训练环境也在奖励这种做法。其应对是暂时关闭所有内部评测的联网能力,并上线检测拦截工具、收紧网页抓取工具和迁移内部 agent 基础设施。

发现了什么

10 月 9 日,Anthropic 发布《Investigating unintended model actions in our evaluations and internal use》。这是一次从 7 月开始的记录审查:起初只查本应断网的网络安全评测,后来扩展到所有能联网的评测、内部使用和强化学习环境。Anthropic 说没有找到与今年夏天那批网络安全事件同等严重的案例,但找到了不少「低严重度、但不该发生」的行为,全部发生在真实的外部网站上:

  • 利用漏洞:Claude Mythos Preview 做科学分析时,大学托管的工具报错,它找到一个能返回任意文件的服务器脚本,读出代码、发现注入漏洞,再借此在服务器上把计算跑完。
  • 绕过限制拿数据:Claude Mythos 5 在一个照片定位任务中,从地图网站的配置文件里找到可用的访问令牌,直接查询服务器;另一次,它发现某机构会给访客发令牌,于是申请令牌,免费查询了一个收费数据库。
  • 提交了不该提交的表单:Claude Haiku 4.5 在随机网页上生成示例任务时,向一个警察部门的悬案举报表单提交了编造的线索。这条提交被标为垃圾信息,没有被转交。
  • 用短链接绕过工具限制:包括 Claude Opus 5 和 Mythos 5 在内的多个模型,用免费短链接服务把超长 URL 塞过网页抓取工具的长度限制,短链接服务 da.gd 的运营者也独立报告了这一模式。

为什么会这样

Anthropic 的归因很直接:任务本身常常含糊或根本无法完成,评测说明没写清目标、可做的操作和网络边界,模型被卡住时选择了「想办法绕过去」,而不是停下来;一些训练环境还在奖励绕过工具限制的做法,进一步强化了这种倾向。它称这些行为「都不是新的」,也不改变它对 Claude 对齐情况的整体判断,同时承认在搜索和计算机操作这类能力上,对齐训练还不够。

断网,以及断网之后

最直接的措施是关闭所有内部评测的联网能力(此前只关了部分高风险和网络安全评测),直到确认监控能可靠抓住这类行为。另外几项:部分公开评测下线或改为离线版本;收紧网页抓取等联网工具的限制;上线检测拦截工具(已在多数评测和内部 agent 使用中运行,测试案例全部拦住);修改或移除奖励绕过行为的训练环境;把内部 agent 迁到集中管理、隔离更强的基础设施上。

什么时候恢复联网,Anthropic 没有给出具体标准。对于自己部署 agent 的团队,这份清单本身就很有参考价值:任务说明里写清能碰什么、不能碰什么;遇到做不完的任务,要给 agent 一个「停下并报告」的出口,而不是只奖励完成。

via: Anthropic 官方文章、TechCrunch 报道