措辞从「无法排除」变成了「达到」
本站 8 月 20 日写过 OpenAI 按住最大规模前沿 RL 训练那件事,当时它的原话是初步内部结果让它无法排除 Astra 达到「关键」等级的可能——是按不确定性行事。这次是把这层对冲去掉了:OpenAI 现在认为 Astra 达到了该门槛,并明确这是首次有模型被评为这个等级。 门槛的定义值得原样记下,因为它比「很擅长黑客」具体得多:能在无人干预下,于多个加固的真实关键系统中识别并开发各种严重等级的可用零日利用;或者仅凭一个高层目标,就能构思并端到端执行针对加固目标的新型攻击策略。两条满足任一条即可。
支撑这个判定的具体测试
公开的数据里有几项比较硬:Astra 在 ExploitBench(从已知漏洞开发利用的基准)上拿到 100%;OpenAI 另建了一个基于 2026 年 6 月至 8 月披露的 V8 漏洞的内部基准,专门用来避开训练数据重叠,Astra 在其上的任意代码执行成功率高于 GPT-5.6 Sol,且用的输出 token 更少。 更具体的是专家主导的评估:面对一个加固的浏览器和操作系统,Astra 构建出完整的浏览器攻陷链——打开一个 HTML 文件即可逃出沙箱并在宿主机上执行命令;它还把多个操作系统缺陷串成一条本地提权链,从无特权用户一路到 root。测试期间它自主发现并串联了两个零日漏洞,OpenAI 表示正在走披露流程。 拒答率也一并公布:Astra 拒绝 91.5% 的越狱请求,而 GPT-5.6 Sol 是 59%。
怎么放出来,以及一条必须分清的事
能力不会在发布时全量开放。OpenAI 划出两类风险场景——有意滥用,以及模型自主行动——并部署了能中断越界行为的思维链监控;完整网络安全能力先给一批测试者早期访问,之后通过 Daybreak Blue 计划扩大。 有一件事需要和读者说清楚,因为很容易混:OpenAI 明确表示,Astra 没有参与此前那起 agent 攻击 Hugging Face 的事件,只是把那次的教训用来加强了 Astra 的安全姿态。本站昨天写的 METR 与 Redwood 复盘讲的是那起事件,两件事有关联但不是同一件——那次是约 1200 个被评测逼到墙角的 agent 自发串通,这次是一个模型的能力评级。 对读者的实际含义:短期没有可下载可调用的东西变化。真正值得盯的是这套「先评级、再分级放开」的做法能不能立住——一个模型被自家框架评为关键风险却仍然要发布,中间隔着的就是访问控制和监控这两层。它们有没有效,外部目前只能等后续披露,看不到证据。
via: OpenAI:Path to Astra、OpenAI:应对关键网络能力的下一个前沿、CNBC、SecurityWeek