2026年8月,数学圈被一份249页的PDF炸开了锅。OpenAI内部模型Astra一次性给出10个悬置十年以上的数学难题的新结果,覆盖高维几何、编码理论、算术电路复杂度、群论、算子代数、量子复杂度、格密码与极值组合等多个领域。
这不是付费墙后的闭门评估。OpenAI同步公开了论文、证明页面,还在GitHub开源了全部Lean证明代码。网址指向openai.com/index/ten-advances-in-mathematics/,任何人都能逐行核查。
27年悬案被一个构造终结
10项成果里最硬核的一项,是Astra对1999年Gromov提出的非sofic群问题的回答。Gromov是Abel奖得主,这个奖项常被称作数学界的诺贝尔奖。
问题本身可以这样理解:一个无限大的复杂群,能否被有限置换完美近似?27年来,无数顶尖数学家尝试构造反例,全部失败。Astra的答案干净利落——直接从数学文献库中拎出一个现成结构:二元Leavitt代数的单位群。然后证明,这个群永远无法被有限置换逼近。
证明手法极其大胆。AI把Kun-Thom扩张图理论与著名的Thompson群V强行结合,推导出逻辑矛盾。整个过程像一位数学大师在多个领域之间自由切换,做降维式证明。罗格斯大学杰出教授、美国数学会会士Alex Kontorovich看完只留下两个感叹号。曼彻斯特大学皇家学会研究员Thomas Bloom评价:这次突破比OpenAI此前推翻单位距离猜想更重要。
Lean 4形式化验证:机器盖章,无懈可击
这份成果的可信度来自Lean 4。每一步推理都经过形式化验证,附带机器可独立检验的证书。”感觉上是对的”这种侥幸空间被彻底清零。
按Epoch AI的OpenMath评分标准,GPT-5.6 Sol Pro与Fable 5 Max两位裁判模型给出判断:多数成果将被同行评为”Major Advance”,第三项成果有望冲击年度最佳数学成就,评级”Breakthrough”。Caltech一位数学博士的评语更直白——菲尔兹奖级别。
2000美元账单:一个猜想等于一个研究生的周末补助
成本数据最能说明问题。按Sol API价格折算,生成这10项证明的总token开销约2000美元。平摊到每项成果,约200美元。解决一个有科学价值的猜想,花费约等于研究生一个周末的工作补助。
对比一下传统科研路径:一个博士团队攻关一个开放问题,周期以年计,经费以十万计。AI把边际成本压到白菜价。OpenAI推理模型核心缔造者Noam Brown还补了一句:测试期间算力远未触顶,百万美元级别的世界级难题也有被攻下的可能。他同时坦承,团队试过黎曼猜想这个级别的千禧年难题,暂时没有成功。
意外的副产品,清晰的信号
一个细节容易被忽略:这些结果是评估未发布模型时的意外收获。Astra是OpenAI下一代旗舰,Sam Altman正在向美国国会演示。年初公司还预言AI将在两年内拿下诺贝尔奖级突破。5月公布的Erdős单位距离猜想反例,现在确认也出自Astra之手。
行业逻辑正在变化。模型竞赛的战场从刷排行榜转向硬核推理。数学证明是天然试金石:对错二元、可验证、无法靠数据污染蒙混。Polymarket上”2026年AI拿IMO金牌”的预测市场概率已冲到82%。
对开发者与科研团队,启示很实际。第一,形式化验证工具链(Lean 4、Coq)正在成为AI科研标配,值得提前布局。第二,模型选型时,硬核推理能力与通用对话能力正在分化,跑分之外要看真实任务表现。第三,验证成本正在坍缩,团队可以用极低预算试探开放问题,开辟新的研究管线。
数学还剩多少人类独有的荣耀?这个问题2026年被回答的方式,比答案本身更值得记住。
苏公网安备32010502011527号
发表回复