OpenAI 放出 722 篇数学手稿:值钱的不是答案,是「可验证」

结论先说:这次发布的意义不在「AI 会做数学」
OpenAI 把 722 篇论文手稿、覆盖 372 个结果族一次性放到 GitHub(openai/math),并说明这些结果来自一款尚未发布的内部前沿模型。社交媒体上最热的讨论是「AI 是不是要抢数学家的饭碗」,但我认为更值得关注的其实是另一件事:这批成果里相当一部分用 Lean 做了形式化,也就是说,证明可以被机器逐步检验。
这是整个事件的关键门槛。数学是这个世界上为数不多的「答案可被低成本验证」的领域之一,所以它天然适合被强化学习反复打磨。真正被验证的不是「模型理解了数学」,而是「模型能在有可靠判分器的环境里持续迭代」。
三个值得注意的细节
- 算力有刻度。 OpenAI 给出的口径是:每个结果平均消耗约相当于 3 小时 ChatGPT Pro 思考的算力,评估期间模型一共被投喂约 4000 个研究问题。把它换算成时间和钱,比任何「智能爆炸」的修辞都更有信息量。
- 成果分两类。 一类是流水线批量产出,同一流程生成;另一类是个例,比如黎曼 zeta 函数零点自由区域(Re(s) > 11/12)和 CM 阿贝尔簇上的 Hodge 猜想相关工作,前者经过人工编辑以提升可读性。区分「批量」与「个案」,是判断可信度的第一步。
- 理论突破不等于工程提速。 矩阵乘法的已证明指数从约 n^2.371177(AlphaEvolve 今年 8 月的记录)降到约 n^2.25,但这是理论界的结果,尚未转化为真实 GPU 负载上可直接调用的例程。标题里的「更快矩阵乘法」,读者需要自己打个折扣。
一个可复用的判断标准:看到「AI 解决了 X」,先问三句——有没有形式化验证?是批量产出还是个案?能不能落到工程?
对你意味着什么
如果你在工程或研究岗位,这件事的短期影响接近于零:这批成果不会直接改善你的代码或产品。但它透露两条长期信号。
第一,可验证任务会持续跑得比不可验证任务快。数学、代码、竞赛题因为有自动判分器,进步速度会明显领先于写作、设计、战略判断这类没有标准答案的领域。你的工作有多少比例落在前者,会越来越影响你的效率上限。
第二,发布规范正在被追问。独立咨询小组 AGMAI 明确呼吁通过学术渠道发布,并披露模型名称、提示词和算力开销。这套要求值得直接抄进企业的 AI 采购问卷——如果一个结论不告诉你用了多少算力、哪个模型,你很难判断它可不可复现。
最后提醒:仓库声明「持续更新」,且部分结果尚无 Lean 形式化。这意味着这批材料应当被当作待审阅的草稿,而不是已被学界确证的定理。
参考来源
- OpenAI:Sharing AI progress in mathematics — https://openai.com/index/sharing-ai-progress-in-mathematics/
- 成果仓库 — https://github.com/openai/math
- The Verge:OpenAI math release on GitHub — https://www.theverge.com/ai-artificial-intelligence/1005004/openai-math-release-github
- IT之家:OpenAI 公布前沿模型数学研究成果 — https://www.ithome.com/1/010/137.htm
延伸阅读:不会写代码也能做游戏:Manus 2.0 的 Game Dev 值钱的不是「生成」 · Mistral Large 4 的 1T 参数和 49B 激活:欧洲拿出的不是「最强」,是「另一种选项」 · 辛顿要 AI 过「FDA 那道门」:监管真正难的不是门槛,是拿什么当证据