先看量表,再看 26%
这个数字极容易被读成「26% 的研发被自动化了」。它不是。26% 指的是**达到第 4 级的那部分工作的占比**,而第 4 级的定义是:人设定大方向、AI 自主完成大部分工作。所以更准确的说法是「26% 的研发进入了人只管方向的模式」。 同一句公告里「端到端完成」和「仍在人类监督下」能并存,靠的正是这套 0 到 5 的分级。读这类数字的通用办法就是先去找量表定义——没有量表,「主导」「协作」这些词可以指任何东西。 超过 90% 的工作达到或超过「协作」级这一条也值得配着读:协作级的定义是「在紧密人类指导下处理大块工作」。也就是说绝大多数研发已经有模型参与,但参与程度大部分仍在人盯着的那一档,真正放手的是那 26%。
1/47000 同时证明了两件事
十亿个决策里拦下约两万个,筛查系统显然在工作。但把另一个数字放进来——人类每周直接复核约 50 个高优先级案例,对照每月十亿量级的决策,人看到的比例在 10⁻⁷ 这个量级。 这不是批评,是规模的必然:3 万个并发 agent 不可能靠人盯。但它明确了「人类监督」在这个量级上的实际含义——**自动筛查加极小比例抽样,不是人在看。**任何把自家 agent 规模往上推的团队都会遇到同一个转变,而这份数据把那条界限量出来了:到了十亿次决策,监督必须是程序,人只能处理被程序挑出来的那几十个。 6% 那个数字也要按口径读:它是安全相关研究占 **AI 研发算力**的比例,不是占全部算力;而且统计窗口是 7 月 13 至 20 日一周,不是长期均值。
把这一周的三条放在一起
本站 9 月 14 日写过 Amodei 呼吁行业放慢、并由 Altman 认领「让独立评估者拿到类员工级别访问权限」;9 月 18 日写过 OpenAI 交出失准披露框架并附六起自家案例;今天是 Anthropic 公布自家研发中 AI 占比从不足 1% 涨到 26% 的曲线。 同一批公司在同一周里既公开呼吁减速,又公开自己加速的证据。公司给的理由是缩小信息差——这个理由本身站得住,而且这份数据确实提供了此前没有的东西:一个可以逐月追踪的公开指标。但它不消解那个张力,只是把张力摆到了台面上。 真正该盯的是下一次更新。既然量表、级别定义和统计口径都公开了,这条曲线就具备了被连续对照的条件:26% 之后是什么、90% 那一档会不会整体上移、1/47000 这个拦截率随规模怎么变。有了第一组数字,后面每一组都能被检验——这比任何一次表态都更有用。
via: The Washington Post 报道、The Korea Times 报道、Digital Today 报道、Technology.org 报道