2026 年 5 月最后一周,Google DeepMind 发布了一项在 AI 推理领域具有里程碑意义的成果——AlphaProof Nexus 系统在一周内自主攻克了 9 道 Erdős 开放数学难题,其中 2 道困扰了数学界长达 56 年。每道题的推理成本仅为几百美元,全部证明过程和代码已经开源。

这个成就的分量,需要放在一个更长的背景下来理解。Erdős 问题是匈牙利数学家 Paul Erdős 在其职业生涯中提出的一系列开放性数学难题,几十年悬而未决。过去,数学界普遍认为"AI 解决开放数学问题"仍是一个遥远的目标——AlphaProof 前代版本虽然在 IMO 题目上表现出色,但 IMO 题目是设计好的"有解竞赛题",与真正的开放研究问题之间隔着一条鸿沟。

AlphaProof Nexus 打破了这条鸿沟。

从 IMO 到开放问题的关键跃迁

AlphaProof 的前身——在 2024 年 IMO 上获得银牌的系统——已经展示了 AI 在形式化数学推理上的潜力。但当时的 AlphaProof 仍然依赖人类提供的形式化问题表述,且解题范围局限于已知的竞赛题。这种"在已知边界内解题"的能力,与数学家所从事的"探索未知边界"的研究工作,本质上是两回事。

AlphaProof Nexus 的突破在于三个方面:

第一,自主探索能力。 Nexus 能够自主扫描大量数学文献,识别出可以应用自身推理能力的开放问题,而不需要人类预先指定。"发现问题"甚至比"解决问题"更难——它要求系统具备对数学问题结构和难度的高层次理解,而不仅仅是符号推导能力。

第二,证明链的自动构造。 对于 Erdős 级别的开放问题,证明往往需要依赖多条定理、多个中间引理,构成一个复杂的推理链。Nexus 通过强化学习不断尝试构建和验证这些推理链,在失败中学习策略调整。

第三,极低的推理成本。 每道题的推理成本仅为几百美元。这个数字在 AI 领域堪称"廉价"——相比训练一个大模型动辄数千万美元的开销,几百美元解决一个困扰学界半世纪的问题,ROI 高到令人瞩目。

对 AI 智能体赛道意味着什么

AlphaProof Nexus 的突破不仅仅是一个数学新闻,它对整个 AI 智能体赛道有着深远的启示:

"推理"正在成为 Agent 的下一个前沿。 当前 AI Coding Agent 的核心能力集中在代码生成、Bug 修复、工具调用等相对"低层次"的认知任务上。AlphaProof Nexus 展示了模型在复杂推理链上的自主构建能力——这正是下一代 AI Agent 从"工具型助手"进化到"研究型助手"所需的核心能力。

"低成本推理"打开了新的应用空间。 当解决一个需要科学家数月甚至数年的推理问题只需要几百美元时,AI 不再仅是一个效率工具,而是开始触及人类智力劳动的核心——创造新知识。虽然目前仅限于数学领域,但这条路径的逻辑是通用的。

强化学习在推理中的价值被重新确认。 近来,大模型的主流路线是"更大数据集 + 更大参数 + 更多算力"的 Scaling Law 路径。AlphaProof Nexus 的成功提醒行业:强化学习驱动的推理能力提升,可能在特定领域提供一条比单纯增大模型更高效的路径。英伟达此前开源的 Polar 框架将强化学习应用于编码 Agent 训练,也让 Codex 性能飙升 594.7%,正是同一逻辑的印证。

开源:加速 AI 数学研究的催化剂

DeepMind 将 AlphaProof Nexus 的全部证明代码和结果开源,这一决定对学术界的意义不亚于技术突破本身。数学社区现在可以复现、验证和扩展 Nexus 的成果,甚至可以将该方法应用于其他未解决的数学难题。

在 AI 大模型公司愈发封闭的趋势下——Anthropic 封杀 OpenClaw、多家头部公司收紧 API 策略——DeepMind 的开源姿态显得格外引人注目。对于数学家和理论计算机科学家而言,这相当于获得了一个可以持续调用的"AI 研究生助手",其影响力可能在未来几年持续发酵。

当然也有冷静的声音值得倾听。部分数学家指出,被攻克的 9 道问题虽然属于 Erdős 开放问题,但并非其中最难的级别。Nexus 的真正考验还在后面——当它面对那些连顶尖数学家在数十年内都毫无头绪的核心问题时,还能否给出同样漂亮的答案?但无论如何,从 0 到 9 的这一步,已经跨越了那条被认为最难跨越的界线。

← 上一篇:阶跃星辰开源 Step 3.7 Flash 下一篇:AI API 价格战再升级 →