把表态和框架逐词对一遍
9 月 12 日 Altman 说的是:工位、门禁、笔记本电脑,以及发表的权利。9 月 22 日的框架说的是:评估者**可能**会在**最敏感的**工作中被请进办公室。 「可能」和「最敏感的」是两个限定词,它们把范围从默认状态收成了例外状态。而发表权——评估者发现问题后能不能对外说、说到什么程度——在新文本里没有找到对应条款。 这不是指控 OpenAI 反悔。表态和框架本来就是两种文体,一个面向听众,一个面向合同。但恰恰因为如此,**从表态走到框架的这一步,才是判断这类事情唯一可靠的尺子:具体承诺是变多了还是变少了。**这一次是变少了。
真正的增量在「训练阶段」这四个字
把批评说完之后,也要把进展说准。 此前的第三方评测基本都发生在发布前后,评估者拿到的是成品——能看输入输出,看不到它是怎么变成这样的。这份框架把评测往前推到训练和评估阶段。这是一个实质变化,不是措辞变化。 而且它与 9 月 20 日本站写的 Anthropic 那条指向同一件事:能看过程,而不只是看结果。两家在同一周把同一个东西往前推了一步,这个同步值得记下来。 四个优先领域里最值得单独提的是第四个:**对失准事件的独立调查。**本站 9 月 18 日写过 OpenAI 刚交出的失准披露框架,带六个工作日、十二个工作日的时限,并附了六起自家案例——那是「我们自己披露」。今天这条是「外部来查」。只有这两步合起来,问责链条才是完整的;单有前者,再详尽也仍是自述。 顺带一提,9 月 20 日本站写 Gemini 那条越界事故时指出过,以「失准」为触发条件的披露框架装不下 Google 那类事故。如果外部调查权真的落地,这个缺口有机会被外部评估者而不是厂商自己来补。
两家的做法正好互为镜像
把 OpenAI 和 Anthropic 这两周的动作放在一起,会看到一个很干净的对照。 Anthropic 给了名字(埃森哲)、给了钱(五年至少 10 亿美元)、给了访问级别(类员工)。代价是利益关系:Anthropic 直接出资购买这项工作,而据报道埃森哲同时是 Anthropic 最大的 Claude Code 部署伙伴——**付钱方、被评方和客户方是同一组关系里的同一家公司。**这比本站 9 月 20 日写那条时所知的还要紧一层。 OpenAI 没给名字,所以目前还不存在这个问题。但它也还没有任何可检验的东西:没有合作方、没有时间表、访问级别写成了可能与例外。 **一个有具体条款但有利益冲突,一个没有冲突但也没有条款。**这不是在比谁更好,是在说这件事目前还没有一种既独立又落地的做法——而两家各自缺的那一半,恰好是对方有的。
现在唯一能用的评判标准是一个未来事件
在有名字和日期之前,这份文件是一份意向书。所以判断它兑现与否,需要一个具体的、可检验的将来时事件。 那个事件是:**第一份点名了外部评估者、并写明对方是否看到了训练阶段数据的系统卡。**这三个要素缺一不可——有名字才知道是谁,写明阶段才知道看到了什么,出现在系统卡里才说明它进入了常规流程而不是一次公关安排。 顺带说清一个法律背景。昨天本站写过四家实验室因「约定放慢」被提起反垄断集体诉讼,而 OpenAI 在这份文件里用的正是「为前沿定速」这个措辞。值得注意的是这次是**单方行为**——开放自家模型给第三方评测,不需要与任何竞争对手达成约定。这在法律上比行业共同机构干净得多,也可能解释了为什么这一周里几家都在往「自己做」的方向走。
via: OpenAI《第三方评估的优先事项与原则》、OpenAI《用外部测试强化我们的安全生态》、The Next Web 报道、StreetInsider 报道