「模型跑出评测沙箱」连爆多起,OpenAI、Anthropic、Meta 的说明里指向同一家评测公司

CNBC 8 月 9 日梳理指出,过去两周 OpenAI、Anthropic、Meta 相继承认模型在网络安全评测中越界访问了本不该碰的系统,三家的说明里都出现同一个名字——评测公司 Irregular。OpenAI 8 月 4 日的博文称其测试环境存在「配置错误」,让模型接触到公网;Meta 的措辞几乎相同。Irregular 回应称这几起事故源自「同一个评测环境问题」,不涉及沙箱逃逸或复杂的网络攻击手法,并正在编写安全运行网络评测的白皮书。

一个供应商,串起三家实验室的事故

三家披露的时间点各不相同:Anthropic 7 月 30 日说排查了 14 万余次评测运行、确认三起模型接触到真实系统的事故;OpenAI 8 月 4 日发博文承认自家评测环境的配置问题;Meta 8 月 5 日说旗下模型也在测试中入侵了第三方服务,发言人称「Irregular 的一处配置错误意外让我们的模型在评测期间访问了互联网」,并承诺事实查清后给出完整复盘。CNBC 把这条共同线索拎出来后,故事的重心从「模型失控」挪到了「测试台是谁搭的」。

Irregular 的说法:不是逃逸,是同一个环境问题

Irregular 对 CNBC 表示,这些事故都来自「同一个评测环境问题」,也就是 Anthropic 最先披露的那一个,「不涉及沙箱逃逸,也不是复杂的网络行动」,并称「目前没有未决问题」。公司正在写一份白皮书,分享隔离与安全运行网络评测的做法。Anthropic 和 OpenAI 都表示仍在与 Irregular 合作推进复盘。Irregular 前身是 Pattern Labs,2023 年成立,团队约 35 人,去年拿到 Sequoia 与 Redpoint 领投的 8000 万美元融资、估值 4.5 亿美元,主营就是为前沿模型搭建攻防评测环境。

影响判断

前沿实验室不愿意「自己给自己判卷」,于是把攻防评测外包给少数几家专业机构——同类里被提到的还有 METR 和 Apollo Research。好处是独立性,代价是这几家的测试台成了整个行业共享的单点:一处出网配置写错,几家实验室一起中招。目前没有公开标准规定评测沙箱该如何隔离、如何记录日志、由谁审计。对自建 agent 评测环境的团队,可直接抄的作业只有两条:出网默认拒绝、按白名单放行,以及把出站流量监控做成能实时掐断实验的开关,而不是事后翻日志才发现。

via: CNBC《Israeli startup Irregular linked to AI hacks at OpenAI, Anthropic, Meta》Engadget 报道 Meta 的披露TechCrunch 报道 Anthropic 的复盘;核实于 2026-08-10