Amodei 写文章主张放慢,Altman 几小时后认领了其中一条:让独立评估者拿到「类员工级别的访问权限」

9 月 12 日(周六),Anthropic CEO Dario Amodei 在个人网站发表约 3800 字的《We Must Pace the Frontier》,主张业界刻意放慢提升模型能力的速度,理由是进展已经快于研究者理解和控制它们的能力。他给的定义很克制:「pacing 不是停止模型训练或技术进步,而是确保公司有足够时间去对齐和保护它们的模型,并让第三方评估者确认这一点。」文章提出一个三步计划,称不以牺牲商业优势为代价,Anthropic 称自己已经走完第一步,而最后一步的跨方协调被他本人形容为最难执行;他同时警告,失控 agent 的集群可能在短至六个月内控制互联网的大部分。数小时后,OpenAI CEO Sam Altman 在 X 上表示同意,并明确认领了其中一条具体承诺:「让独立评估者获得类员工级别的访问权限是个好主意,我们也会这么做。」他称这个议题近几周是 OpenAI 内部的主要讨论话题。Elon Musk 亦公开表示认同。

整周表态里,只有一条是能被后续检验的

呼吁放慢这件事本身很难证伪,也很难兑现。这一周里真正产生了可核对内容的只有一句话——Altman 认领的那条:让独立评估者拿到类员工级别的访问权限。 这句话之所以有分量,是因为它可以被拆成四个具体问题:评估者是谁、访问到什么程度(能不能看训练过程、内部评测、被拒绝的实验)、结果公开到什么程度、从哪个模型开始。四个答案都没有之前,它仍然只是一句话;但它已经具备了「将来可以被对照」的形状,这是同期其他表态没有的。 Amodei 那篇文章本身的定义也值得照抄一遍,因为它常被转述成「停止训练」:pacing 不是停训,是让对齐和防护跟上,并且让第三方确认跟上了。这中间的差别决定了它是否可行——前者没有公司会做,后者至少是个可以谈的工程与流程安排。

把这周的三条新闻并排看

本站 9 月 8 日写过 OpenAI 同一天发的两篇文章:一篇公布内部提速的度量(8 月中每 1 个人类工作日配 3.1 个 agent 工作日),另一篇是首席科学家 Jakub Pachocki 说没有任何实验室把对齐和监控解决到足以长期全速扩张的程度。当时那是一家公司内部的自相矛盾。 现在 Amodei 把这个矛盾整理成一份对外的提案,Altman 认领了其中一条。从「内部担忧」到「公开承诺」用了不到一周,这个速度本身是新闻。 第三条来自昨天:GreyNoise 记录的那场攻击里,数百个 agent 在 26 秒内打下 11 家组织。Amodei 说 agent 集群可能在六个月内控制互联网的大部分——这听起来像预测,但把它放在那份报告旁边,会发现区别只在规模和意图,机制已经跑通了。这条警告的时间坐标比它读起来更近。

没有执行机制这件事要说清楚

最大的保留意见很简单:pacing 是自愿的。除非被写成有约束力的规则,几家公司的公开表态不构成任何人的义务,而「我们已经走完第一步」是企业自述,没有第三方核验。 背景也该记一笔:这篇文章发布前几天,一名 Anthropic 员工公开辞职并警告行业处理风险的方式;报道称有两名员工因进展过快离职。所以这轮表态不是凭空出现的,它前面有一周的内部压力。 对读者的现实含义有限但确实存在:如果独立评估真的落地,它会改变的是发布节奏和系统卡里能看到的东西——也就是你未来判断一个模型能不能进生产时,手上有多少不是厂商自测的证据。这值得追一年。

via: CNBC 报道Axios 报道NBC News 报道