OpenAI 一次公开 722 篇未发布内部模型写的数学稿件:部分有 Lean 形式化,顾问组明确「不背书」

OpenAI 于 10 月 6 日在 GitHub 公开 722 篇由一个未发布、未命名的内部前沿模型产出的数学稿件,分为 372 组相关结果,来自约 4000 道研究问题的评估;官方称每个结果平均消耗约相当于 ChatGPT Pro 三小时的思考算力。仓库附有部分结果的 Lean 形式化证明和 10 份删节版推理摘要,OpenAI 承认「部分未形式化的结果可能有问题」,结果处于不同的核验阶段。OpenAI 称发布方式参考了普林斯顿高等研究院数学与 AI 顾问组的建议,但该顾问组此前已表示不赞成在专有模型上测试高等数学问题,其提出的公开模型名称、提示词、全部推理摘要与计算成本、使用社区托管仓库等建议,这次多数没有满足。

公开了什么

10 月 6 日,OpenAI 发布《Sharing AI progress in mathematics》,在 GitHub 上一次性放出 722 篇数学稿件,按相关性分成 372 组。稿件全部来自一个尚未发布、也没有命名的内部前沿模型:OpenAI 用它评估了约 4000 道研究问题,平均每个结果消耗约相当于 ChatGPT Pro 三小时的思考算力。

仓库 README 点名的结果包括乘性函数的二点相关、π 的无理性指数、对称与一般情形的 Mahler 猜想、特征 2 下的 Kaplansky 直接有限性猜想等。部分稿件附有 Lean 形式化证明,可由计算机检查,但并非全部;OpenAI 自己写明这批结果「处于不同的核验阶段」,「部分未形式化的结果可能有问题」,修订会以新版本记录、旧版本保留。模型推理过程只公开了 10 份删节摘要。

顾问组的态度

OpenAI 称,发布方式参考了普林斯顿高等研究院数学与 AI 顾问组(AGMAI)的建议。但这个顾问组 9 月底基于 600 多位数学家的反馈发布建议时,已经明确表示不赞成在专有模型上测试高等数学问题,并要求实验室停止这样做。它建议的做法包括:结果放在不受任何 AI 实验室控制的仓库,公开模型名称、提示词、推理摘要、耗时和计算成本。按 Unite.AI 等媒体的梳理,这次稿件仍放在 OpenAI 自己的 GitHub 账号下,模型未命名,推理摘要只覆盖 10 个结果,多数建议没有满足。OpenAI 表示仍在寻找符合顾问组要求的社区托管方案,并将资助围绕 AI 数学成果的研讨会。

影响判断

如果其中相当一部分结果经住同行审查,这将是 AI 参与数学研究规模最大的一次公开。但在此之前,它首先是一批待审稿件:只有带 Lean 证明的部分能被机器快速核查,其余要靠数学家逐篇审读,而产出它们的模型外界无法使用、无法复现。对研究者来说,比较稳妥的做法是先看已形式化的结果,未形式化的结论在独立核实前不宜直接引用。

via: OpenAI 官方文章、GitHub 仓库、OpenAI 关于顾问组的说明、Unite.AI 报道