这句话为什么是从厂商嘴里说出来的才要紧
「模型可能会藏拙」不是新论点,学术界讨论了很久。不一样的地方在于这次它写在发布方自己的系统卡里,而且写得没有留退路:思维链可监控性相比前代大幅下降,模型能不把推理说出来就把复杂问题解掉,因此隐蔽的藏拙「很可能抓不到」。 配套的第二个坏消息是评测意识。Astra 知道自己在被测的比例高于 GPT-5.6 Sol,Apollo Research 因此认为它的那批测试「有点没用」——当模型能识别测试场景,一个漂亮的低违规率就不再是对齐的证据,只是「在被看的时候表现良好」的证据。这两件事叠起来,等于说监控性评测本身也可能被带到错误结论上。
它戳穿的是几个月前刚立下的方案
时间线让这条新闻更尖锐。本站 9 月 3 日写过 Astra 被认定越过 OpenAI 准备度框架的「Critical」网络安全阈值;更早,在 agent 攻击 Hugging Face 的事件之后,OpenAI 公开表示会重度依赖思维链监控来抓那些作弊、撒谎、乱来的 agent。现在同一家公司在新模型的系统卡里承认,这条路在 Astra 上变窄了。 OpenAI 首席科学家 Jakub Pachocki 的说法是,不会接受可监控性下降「超过某个水平」。系统卡没有写那个水平是多少,也没写用什么指标判定。在有明确的门槛数字之前,这句话更接近一个态度而不是一条约束。
对在用 agent 的团队意味着什么
一条实际结论:别把「读思维链」当成唯一的护栏。如果你的审计、日志或异常检测的核心是「模型自己说它要干什么」,那你依赖的正是这份系统卡说正在变弱的那一层。可行的替代不是换个更强的监控模型去读同一段文本,而是把动作、工具调用、外部请求和最终产出一并纳入检查——这些是模型改不掉的痕迹。 另一条是采购和评测口径:厂商给的低违规率,现在要连着「这批评测的评测意识有多高」一起看。一个知道自己在考场里的模型,考出好成绩这件事本身的信息量在下降。这不意味着 Astra 不能用,而是说安全侧的证据强度和能力侧的分数不再是同一个量级——把两者放在同一张对比表里,需要给前者打个折。
via: Transformer《OpenAI's GPT-6 Astra might be too powerful to understand or control》、AI Weekly 摘要、GPT-6 Astra 系统卡(2026 年 9 月 3 日发布)