3.1 这个数字的分母是人的时间,不是产出
先把口径掰清楚,因为它极容易被读成「AI 干了三倍的活」。这个比值的分子是 agent 的总运行时长,分母是人的总工时,衡量的是「每投入一个人天,配套烧掉多少机器时间」,不是产出比。 OpenAI 自己给的限定也不含糊:agent 输出里高层规划仍然很少;4 到 8 小时的成功任务中,超过一半至少需要一次人工介入。另有独立的对照可以参考——arXiv 上《The Shift to Agentic AI: Evidence from Codex》显示,2026 年 6 月 11 日中位数员工的 Codex 运行时长是 2.5 小时,而 99 分位近期约为每天 71 小时。中位与头部差着两个量级,说明「3.1」是一个被少数重度用户拉起来的平均数,别当成典型研究员的日常。 真正能当产出看的只有一项:8 月每个活跃实验者的实验数创下 2025 年 1 月以来的新高。这个指标比 3.1 有说服力,因为它数的是做成了多少次实验,而不是烧了多少机时。
值得记的是花钱曲线和文化副作用
按 API 价格计,中位数研究员每天 600 美元、90 分位每天 7000 美元的推理开销,配上 token 输出 124 倍的增长,说明这条路线的成本结构已经变了形状:以前研究的边际成本主要是人,现在多了一项和人力同量级、且还在快速抬升的机器开销。想在自己团队复制这种工作方式的人,该先算这笔账。 另一处细节容易被跳过:内部互相求助的支持频道安静了,办公时间的出席率下降,有团队干脆停办。也就是说,研究员不再问同事,改问 agent。这件事的长期影响是好是坏还看不出来,但它确实在改变知识在组织里怎么流动。
两篇文章放在同一天,本身就是内容
Pachocki 那篇《An Alien Mind》的核心句是:目前他认为没有任何实验室把对齐和监控解决到了足以负责任地长时间以最高速度扩张的程度;他还写这是一个需要极度谨慎的时刻,担心没有人为机器智能持续快速上升的后果做好准备。OpenAI 把内部度量公开称作一次透明度实践,并认为这类披露最终该成为强制要求;另外提到有 20% 的算力用于安全监控。 这两篇并排着看,是「我们加速的证据」和「行业该减速」的组合。本站 9 月 6 日写过 Astra 系统卡里那句「如果它故意藏拙,我们大概率抓不到」——三条放一起,同一家公司在一周内既承认新模型的可监控性变差,又公布了内部提速的曲线,还呼吁行业慢下来。 有分析指出的一处反讽也值得记:出于网络安全考虑把 Astra 的算力配额砍掉 59.2% 之后,算力转移到了其他模型,抵消了其中 85% 的削减。如果一家公司内部的限制只是把资源挪个地方,那么靠自愿减速来降低整体扩张速度这条路,比文章里写的更难走。
via: The Next Web 报道、OpenAI 官方博客于 2026 年 9 月 6 日发布的两篇文章(内部研究度量与《An Alien Mind》)、arXiv《The Shift to Agentic AI: Evidence from Codex》