OpenAI 这次没有发布新模型,而是把内部前沿模型在数学开放问题上的推理结果连同 Lean 形式化证明一起放到了 GitHub 上。

发生了什么

据 OpenAI 公布的信息,其内部前沿模型在一批数学开放问题上给出了新的结果,并同步公开了两类材料:一是 Lean 证明形式化,二是相关研究细节。Lean 是当前数学界主流的交互式定理证明器,把自然语言证明翻译成 Lean 代码,意味着每一步推理都要通过机器检查,证明成立与否不再依赖读者信任,而是由内核逐行验证。

换句话说,这次公开的重点不是「模型答对了几道题」,而是「答案被写成了可被机器验证的形式」。

为什么重要

数学一直是检验大模型推理能力的硬骨头。过去两年,模型在竞赛题(如 IMO 级别的题目)上的表现提升很快,但竞赛题有标准答案、有明确边界,和真正的研究级开放问题不是一回事。开放问题没有已知解,模型给出的结论无法靠对答案来判定,只能靠证明本身是否成立。

Lean 形式化恰好补上了这个缺口。它把「模型说自己证出来了」变成「任何人都能跑一遍验证」。这也是 AI 数学研究近年的共同方向:DeepMind 此前用 AlphaGeometry、AlphaProof 在几何与竞赛数学上推进,并强调形式化验证;学界也在推动把更多数学成果沉淀为 Lean 库。OpenAI 此次公开形式化证明,等于把自己放进了这条「可验证 AI 数学」的路线里。

另一个信号是「内部前沿模型」。OpenAI 明确说明结果来自尚未公开的模型,而非已发布的产品。这既是在展示研究储备,也暗示这类能力短期内未必会以 API 形式直接开放。

影响与看点

对数学研究者而言,可直接复用的部分是 Lean 证明与 GitHub 上的细节,可以自行验证、挑错、在此基础上继续推进。对 AI 研究者而言,值得关注的是方法层面:模型如何与 Lean 这类形式化工具配合,是人类写提示、模型生成证明、编译器反馈迭代,还是更自动化的搜索流程,这些细节决定了方案能否规模化。

对开发者来说,短期内更现实的影响不在「用 AI 解数学难题」,而在形式化验证这套范式的外溢——当模型能稳定产出可被机器检查的代码与证明,软件验证、硬件验证、协议正确性证明等场景都可能被重新审视。

需要克制的一点是:开放问题的「新结果」是否真正推进了数学,仍需数学界同行评估,形式化只保证证明过程无误,不保证结论有足够的研究价值。

我的判断是:这次发布的价值更多在方法论示范——把大模型的推理能力接到可验证的轨道上,比单纯刷高竞赛分数更能说明问题。