OpenAI 把第三方评测提前到训练阶段,但十天前承诺的工位和发表权没有写进框架

OpenAI 于 9 月 22 日(周二)发布一份关于第三方评测的优先事项与原则文件,表示将允许外部机构在模型的训练、评估和部署各阶段开展技术安全评估,而不再只在接近发布时进行。文件列出四个优先领域:覆盖训练与部署的安全论证评估、关键安全防护措施的评测、与其「准备度框架」挂钩的能力评测复核,以及对失准事件的独立调查;并给出七条原则,包括在评估开始前就把所要检验的主张范围界定清楚,以及与之相称的系统和数据访问权限。公司称让这类评审有效的关键在于强有力的独立性机制、科学严谨性、稳健的安全实践和清晰的责任划分,并把此举纳入其「为前沿定速」的努力,表示访问权限应当让评估方有能力质疑公司自己的假设、对安全防护是否有效得出独立结论。该公告没有点名任何合作方,也没有给出时间表;据报道 OpenAI 正与 METR 和 Redwood Research 接触,而文件措辞为评估者「可能会在最敏感的工作中被请进办公室」。作为对照,Sam Altman 在十天前的 9 月 12 日曾承诺给评估者工位、门禁和笔记本电脑并附带发表权。另一侧,Anthropic 已于 9 月 18 日点名埃森哲并给出五年至少 10 亿美元的投入规模,而据报道埃森哲同时是 Anthropic 最大的 Claude Code 部署伙伴。

把表态和框架逐词对一遍

9 月 12 日 Altman 说的是:工位、门禁、笔记本电脑,以及发表的权利。9 月 22 日的框架说的是:评估者**可能**会在**最敏感的**工作中被请进办公室。 「可能」和「最敏感的」是两个限定词,它们把范围从默认状态收成了例外状态。而发表权——评估者发现问题后能不能对外说、说到什么程度——在新文本里没有找到对应条款。 这不是指控 OpenAI 反悔。表态和框架本来就是两种文体,一个面向听众,一个面向合同。但恰恰因为如此,**从表态走到框架的这一步,才是判断这类事情唯一可靠的尺子:具体承诺是变多了还是变少了。**这一次是变少了。

真正的增量在「训练阶段」这四个字

把批评说完之后,也要把进展说准。 此前的第三方评测基本都发生在发布前后,评估者拿到的是成品——能看输入输出,看不到它是怎么变成这样的。这份框架把评测往前推到训练和评估阶段。这是一个实质变化,不是措辞变化。 而且它与 9 月 20 日本站写的 Anthropic 那条指向同一件事:能看过程,而不只是看结果。两家在同一周把同一个东西往前推了一步,这个同步值得记下来。 四个优先领域里最值得单独提的是第四个:**对失准事件的独立调查。**本站 9 月 18 日写过 OpenAI 刚交出的失准披露框架,带六个工作日、十二个工作日的时限,并附了六起自家案例——那是「我们自己披露」。今天这条是「外部来查」。只有这两步合起来,问责链条才是完整的;单有前者,再详尽也仍是自述。 顺带一提,9 月 20 日本站写 Gemini 那条越界事故时指出过,以「失准」为触发条件的披露框架装不下 Google 那类事故。如果外部调查权真的落地,这个缺口有机会被外部评估者而不是厂商自己来补。

两家的做法正好互为镜像

把 OpenAI 和 Anthropic 这两周的动作放在一起,会看到一个很干净的对照。 Anthropic 给了名字(埃森哲)、给了钱(五年至少 10 亿美元)、给了访问级别(类员工)。代价是利益关系:Anthropic 直接出资购买这项工作,而据报道埃森哲同时是 Anthropic 最大的 Claude Code 部署伙伴——**付钱方、被评方和客户方是同一组关系里的同一家公司。**这比本站 9 月 20 日写那条时所知的还要紧一层。 OpenAI 没给名字,所以目前还不存在这个问题。但它也还没有任何可检验的东西:没有合作方、没有时间表、访问级别写成了可能与例外。 **一个有具体条款但有利益冲突,一个没有冲突但也没有条款。**这不是在比谁更好,是在说这件事目前还没有一种既独立又落地的做法——而两家各自缺的那一半,恰好是对方有的。

现在唯一能用的评判标准是一个未来事件

在有名字和日期之前,这份文件是一份意向书。所以判断它兑现与否,需要一个具体的、可检验的将来时事件。 那个事件是:**第一份点名了外部评估者、并写明对方是否看到了训练阶段数据的系统卡。**这三个要素缺一不可——有名字才知道是谁,写明阶段才知道看到了什么,出现在系统卡里才说明它进入了常规流程而不是一次公关安排。 顺带说清一个法律背景。昨天本站写过四家实验室因「约定放慢」被提起反垄断集体诉讼,而 OpenAI 在这份文件里用的正是「为前沿定速」这个措辞。值得注意的是这次是**单方行为**——开放自家模型给第三方评测,不需要与任何竞争对手达成约定。这在法律上比行业共同机构干净得多,也可能解释了为什么这一周里几家都在往「自己做」的方向走。

via: OpenAI《第三方评估的优先事项与原则》OpenAI《用外部测试强化我们的安全生态》The Next Web 报道StreetInsider 报道