把 1 亿 token 拆成并行会话,比一次长跑多 264 Elo:一篇论文量出了 agent 停滞的那个拐点

9 月 14 日提交到 arXiv 的论文《When Agents Slow Down》(2609.15309)提出 Elo-per-token 分析:追踪每个 token 预算下找到的最佳解,再用 Bradley-Terry 模型把任务内排序聚合成跨任务可比的 Elo,从而解决「agent 自适应分配测试时算力、性能扩展难以测量」的问题。它在四个通用 agent、四个开放式基准上做了最高到 1 亿 token 的单次会话,另加三个反馈驱动的优化 harness 做受控干预。核心结果是:以独立采样为理论参照(每十倍算力增加 400 Elo,随 log 算力线性增长),agent 起初把 token 转成 Elo 比参照更快,但边际收益递减,最终跌到参照线以下;而在共享的 AtCoder Heuristic Contest 任务上,最强的历史人类选手随比赛时间超线性提升。作者据此定义「scaling inflection point」为边际收益与参照持平的单次会话预算,并在 FrontierCS Polyomino Packing 上把同样的 1 亿 token 拆到并行会话,比单次长会话多 264 Elo、比十次短会话多 355 Elo。作者为 Kaiyuan Liu、Qiuyang Mang、Luke Zettlemoyer、Alex Dimakis、Alvin Cheung 等,预印本未经同行评审。

它给的不只是结论,是一个能测出来的旋钮

「agent 跑久了会停滞」不是新观察,但这篇把它变成了一个可以量的量。方法上的关键是选了一个有理论刻画的参照物:独立采样——反复独立抽样并取最好的那次,它的 Elo 随算力的对数线性增长,每十倍算力增加 400 Elo。 有了这条基准线,「agent 的编排到底有没有加值」就成了一个可判定的问题。答案是分段的:前期有,agent 把 token 换成 Elo 的效率高于独立采样;后期是负的,边际收益一路递减,最终掉到参照线以下。也就是说到了某个预算之后,继续让同一个会话跑下去,还不如直接多抽几次独立样本。 那个交点就是论文定义的 scaling inflection point:边际 Elo 收益与独立采样参照持平的单次会话预算。

既不是越长越好,也不是越碎越好

最实用的一组数字来自 FrontierCS Polyomino Packing 上的拆分实验。同样的 1 亿 token 总预算,拆到并行会话上比**单次长会话多 264 Elo**,也比**拆成十次短会话多 355 Elo**。 两个方向都被否掉了:一次跑到底会越过拐点、浪费后半段的算力;切得太碎则每次都还没爬到 agent 效率最高的那一段就结束了。中间存在一个能测出来的最优,而测法就是先在自己的任务上找到拐点。 对按 token 付费跑 agent 的人,这直接翻译成一条实践:**别先问「要不要给它更多时间」,先测出你这类任务的拐点在哪,再据此决定单次会话的预算和并行度。**这比「加长思考」和「多跑几次取最好」都更省,而且它是一个可以一次测完、长期复用的参数。

人类那条对照线是这篇最有分量的部分

论文没有停在 agent 之间的比较。在共享的 AtCoder Heuristic Contest 任务上,最强的历史人类选手随比赛时间**超线性**提升——越做越快地变好,而 agent 越做越慢。作者的博客把这一点写得更具体:在一个两周的编程马拉松上,当前 agent 在 24 小时左右走平(即便单次试验用掉 1 亿 token),而顶尖人类起步更慢,最终大幅反超。 这不是情绪化的「人类更强」,而是把持续学习这件事的差距量化了:人类在过程中改变了自己的方法,agent 在同一个会话里主要是在重复和微调。作者也据此指出,agent 停滞之后还有可观的提升空间——这是个乐观结论,只是它要靠新的测试时策略去拿,而不是靠再加预算。 本站 9 月 8 日写过 OpenAI 公布的内部数据:8 月中每 1 个人类工作日配 3.1 个 agent 工作日,而 4 到 8 小时的成功任务里超过一半至少需要一次人工介入。这篇论文从机制侧给了那个现象一个解释——不是介入的时机有什么讲究,是长会话本身会停滞,所以人必须在某个点上进来。 边界照抄作者的口径:预印本,未经同行评审;覆盖四个 agent、四个开放式基准,人类对照来自 AtCoder Heuristic Contest 的历史选手数据,拐点的具体位置随任务和 agent 而变,论文给的是方法而不是一个通用数字。

via: arXiv:2609.15309《When Agents Slow Down》Hugging Face 论文页作者博客《Humans Still Beat AI in the Long Horizon》