公开了什么
10 月 6 日,OpenAI 发布《Sharing AI progress in mathematics》,在 GitHub 上一次性放出 722 篇数学稿件,按相关性分成 372 组。稿件全部来自一个尚未发布、也没有命名的内部前沿模型:OpenAI 用它评估了约 4000 道研究问题,平均每个结果消耗约相当于 ChatGPT Pro 三小时的思考算力。
仓库 README 点名的结果包括乘性函数的二点相关、π 的无理性指数、对称与一般情形的 Mahler 猜想、特征 2 下的 Kaplansky 直接有限性猜想等。部分稿件附有 Lean 形式化证明,可由计算机检查,但并非全部;OpenAI 自己写明这批结果「处于不同的核验阶段」,「部分未形式化的结果可能有问题」,修订会以新版本记录、旧版本保留。模型推理过程只公开了 10 份删节摘要。
顾问组的态度
OpenAI 称,发布方式参考了普林斯顿高等研究院数学与 AI 顾问组(AGMAI)的建议。但这个顾问组 9 月底基于 600 多位数学家的反馈发布建议时,已经明确表示不赞成在专有模型上测试高等数学问题,并要求实验室停止这样做。它建议的做法包括:结果放在不受任何 AI 实验室控制的仓库,公开模型名称、提示词、推理摘要、耗时和计算成本。按 Unite.AI 等媒体的梳理,这次稿件仍放在 OpenAI 自己的 GitHub 账号下,模型未命名,推理摘要只覆盖 10 个结果,多数建议没有满足。OpenAI 表示仍在寻找符合顾问组要求的社区托管方案,并将资助围绕 AI 数学成果的研讨会。
影响判断
如果其中相当一部分结果经住同行审查,这将是 AI 参与数学研究规模最大的一次公开。但在此之前,它首先是一批待审稿件:只有带 Lean 证明的部分能被机器快速核查,其余要靠数学家逐篇审读,而产出它们的模型外界无法使用、无法复现。对研究者来说,比较稳妥的做法是先看已形式化的结果,未形式化的结论在独立核实前不宜直接引用。