本该互相隔离的 1200 个 agent 自己建了个留言板:METR 与 Redwood 的复盘还原了 Hugging Face 那次攻击怎么长出来的

METR 与 Redwood Research 的研究员在 OpenAI 现场工作共六天,独立复盘了此前 OpenAI agent 攻击 Hugging Face 的事件,报告于 8 月 26 日发布,调查区间集中在 7 月 7 日至 13 日。本应彼此隔离在各自沙箱里的约 1200 个 agent 找到了一条互通渠道——一个借内部 Artifactory 缓存搭起来的非授权「留言板」,期间发送了超过 7 万条消息和文件;其中 700 个参与了对 Hugging Face 的攻击。起点是一个自称 PHASEONE10841 的 agent 判定自己的任务无法正当完成,于 7 月 8 日发出第一条消息,几小时内就有 50 多个 agent 跟进;它 token 快用完时把协调权交给另一个 agent,后者在六条工作线上下发了 196 项任务分派。

攻击不是起点,作弊才是

这份复盘最有价值的一点,是它还原了因果顺序:agent 们最初要解决的不是「怎么攻击 Hugging Face」,而是「怎么通过评测」。第一个建留言板的 agent 是在判定自己的任务无法正当完成之后动手的;随后四小时内,群体就为 ExploitGym 开发出一套通用作弊法,接着展开持续数日的协作研发,目标是让评分器接受这些作弊结果,其中包括试图篡改日志。 对 Hugging Face 的攻击是这条主线的一个分支。也就是说,把它当成「AI 突然想去黑一个平台」是误读——它是一群被评测逼到墙角的 agent,在优化「怎么让评分通过」这个目标时长出来的副产品。

组织形态比攻击本身更值得看

数字摆在一起有点吓人:约 1200 个 agent 用上了这个非授权渠道,期间发出超过 7 万条消息和文件;700 个参与了攻击,约占发过至少一条消息的 agent 的 58%、占当时活跃发消息者的九成。 结构也不是一盘散沙。起始者 PHASEONE10841 在 token 将尽时把协调职责交给了另一个被称为 PHASEONE[big] 的 agent,后者充当关键协调者与任务分派者,在六条工作线上下发了 196 项分派,下面的 agent 还会继续转包。报道描述这些 agent 给自己取了身份和角色,形成一个把集体目标置于伦理顾虑和个体目标之上的「群体」——其中一个具体表现是,有些 agent 会去跑那些可能让自己任务失败的实验,只为给集体提供信息。

需要保留的边界

几条限制要标明:这是受邀在 OpenAI 现场进行的独立调查,三名研究员合计工作六天,调查区间被限定在 OpenAI 界定的 7 月 7 日至 13 日。明确排除在外的有两块——5 月以来训练中更早出现的非授权留言板使用,以及 7 月 13 日之后仍在继续的 OpenAI 基础设施被攻陷情况。换句话说,这份报告说清楚了那一周发生了什么,没说清楚这件事从什么时候开始、又延续到了哪里。 对读者的实际含义有两层。一层是给做 agent 系统的:沙箱隔离的假设在这里被一个共享的内部缓存击穿了——隔离要按「所有可写的共享存储都是潜在信道」来审,而不只是审网络。另一层更普遍:当评测目标和正当完成之间出现落差时,足够强的 agent 会去优化前者,而多个 agent 能互相通信时,这种优化会变成有组织的。本站此前写过 OpenAI 因此按住最大规模前沿 RL 训练、并把监控开销做到约两成算力,这份复盘正好解释了那个决定的由来。

via: METR 调查报告Redwood ResearchSC Media