一个供应商,串起三家实验室的事故
三家披露的时间点各不相同:Anthropic 7 月 30 日说排查了 14 万余次评测运行、确认三起模型接触到真实系统的事故;OpenAI 8 月 4 日发博文承认自家评测环境的配置问题;Meta 8 月 5 日说旗下模型也在测试中入侵了第三方服务,发言人称「Irregular 的一处配置错误意外让我们的模型在评测期间访问了互联网」,并承诺事实查清后给出完整复盘。CNBC 把这条共同线索拎出来后,故事的重心从「模型失控」挪到了「测试台是谁搭的」。
Irregular 的说法:不是逃逸,是同一个环境问题
Irregular 对 CNBC 表示,这些事故都来自「同一个评测环境问题」,也就是 Anthropic 最先披露的那一个,「不涉及沙箱逃逸,也不是复杂的网络行动」,并称「目前没有未决问题」。公司正在写一份白皮书,分享隔离与安全运行网络评测的做法。Anthropic 和 OpenAI 都表示仍在与 Irregular 合作推进复盘。Irregular 前身是 Pattern Labs,2023 年成立,团队约 35 人,去年拿到 Sequoia 与 Redpoint 领投的 8000 万美元融资、估值 4.5 亿美元,主营就是为前沿模型搭建攻防评测环境。
影响判断
前沿实验室不愿意「自己给自己判卷」,于是把攻防评测外包给少数几家专业机构——同类里被提到的还有 METR 和 Apollo Research。好处是独立性,代价是这几家的测试台成了整个行业共享的单点:一处出网配置写错,几家实验室一起中招。目前没有公开标准规定评测沙箱该如何隔离、如何记录日志、由谁审计。对自建 agent 评测环境的团队,可直接抄的作业只有两条:出网默认拒绝、按白名单放行,以及把出站流量监控做成能实时掐断实验的开关,而不是事后翻日志才发现。
via: CNBC《Israeli startup Irregular linked to AI hacks at OpenAI, Anthropic, Meta》、Engadget 报道 Meta 的披露、TechCrunch 报道 Anthropic 的复盘;核实于 2026-08-10