题目设计得比结论更值得看
这套基准问的问题很朴素:把一篇论文发表之前那批文献摆在你面前,你能不能想出这篇论文后来提出了什么。为做到这一点,作者给每篇种子论文构造一份「盲」参考语境,只包含严格早于该论文发表日期的文献;生成阶段模型看不到种子论文的标题和摘要,之后由一个 LLM 裁判把模型给出的假设与被扣下的真实想法做比对,主指标是匹配率。 防泄题做了三层:时间上的引用截止、匿名化的文献编号、每篇论文冻结的书目。匿名编号这一层专门堵一个捷径——认出某个课题组的研究轨迹,然后顺着猜下一步。 结果是六个学科、643 篇论文上,七个前沿模型的匹配率约 3–15%。作者随后测了一套只用参考文献、不做外部检索的多智能体流程,用跨模型互评加上瑞士轮在对齐的假设槽位间比较,把匹配率显著推高;媒体报道的数字约为 42%、相对最佳单模型约 2.4 倍,论文本身把它表述为一个观察到的相关性,还需候选匹配与等算力对照来确认。
它戳的是评测条件,不是模型能力
这条结论真正的分量在方法论上。市面上不少把大模型当「假设生成引擎」卖的产品,其证据来自允许模型看到论文全文、作者信息或发表后信号的评测——Reconstruction 把这些信息全部排除,所以更宽松条件下的高分不能被默认为推理能力。同一个模型,换一套信息约束,成绩可以差出一个数量级,这件事本身比 3% 还是 15% 更值得记住。
边界
作者自己列了限制:只覆盖六个领域(机器学习加五个 Nature 系方向),这版更像是给协议、防泄题设计和当前结果打一个 arXiv 时间戳。而且 Reconstruction 只是中间站——他们真正想做的是 Generation 模式,让模型提出前瞻的、可行的新方向,那时候就没有「标准答案」可比了。 对在选型的人来说,有一条可以直接用:如果某个科研类 AI 产品给你看的评测让模型接触了论文全文或作者信息,那个分数回答的是检索与复述能力,不是它能不能替你想出下一个课题。