当 AI 开始批量产出可被机器验证的数学证明,数学界要面对的不只是效率问题,而是这门学科该如何继续提问。

发生了什么

OpenAI 在 GitHub 上公开了 372 项由 AI 生成的数学结果,并为它们提供了 Lean 形式化,以便机器逐行验证。据 The Decoder 报道,这些结果平均每项消耗约三小时的 ChatGPT Pro 算力。与此同时,25 位菲尔兹奖得主发出警告:大规模生产数学真理,可能摧毁孕育新思想的土壤,而不是带来真正的新想法。

为什么重要

这件事的关键不在数量,而在“可验证”。Lean 这类证明助手把数学陈述翻译成机器可检查的形式语言,证明对错不再依赖同行评议的漫长周期,而是由内核判定。这等于把数学产出的一部分,变成了可流水线处理的工程任务。

问题也随之而来。数学的价值从来不只是“正确命题的集合”。一个被验证的结论,如果缺少动机、直觉和与其他领域的连接,往往只是孤立的真命题。菲尔兹奖得主们的担忧正指向这里:当 AI 能以极低成本填满证明空间,人类研究者可能被淹没在大量正确但无趣的结果里,而真正需要长期孕育的猜想和框架反而得不到关注。

另一个现实是算力成本。每项结果约三小时 ChatGPT Pro 算力,意味着这套流程并非零成本,但它已经便宜到可以批量执行。对比人类数学家数月甚至数年的攻关,这种量级差异会改变研究资源的分配逻辑。

影响与看点

对数学界,短期看是工具升级:Lean 形式化会加速验证、减少错误,也可能催生新的合作模式。中期看是评价体系受冲击——如果“发表一个可验证定理”变得廉价,学术评价必须转向判断问题的价值,而非产出的数量。

对 AI 行业,这是一次能力边界的公开测试。数学证明是推理能力的硬指标,OpenAI 把结果直接放到 GitHub 而非论文期刊,本身就是在向学术流程喊话:验证方式该更新了。

值得关注的点有三个:这批结果中有多少是真正的新定理,而非已知结论的重新形式化;Lean 社区会如何接纳这批机器产物;以及学术机构是否会调整对 AI 辅助成果的认定标准。

一个独立判断是:AI 批量证明不会让数学家失业,但会让“什么算好问题”变得比“什么算正确答案”更稀缺。