OpenAI 宣称一个内部模型在约一个月训练后解出 100 多道长期未解的数学开放问题,同时资助外部独立顾问组,却把自身研究节奏排除在顾问范围之外。

发生了什么

据 The Decoder 报道,OpenAI 表示一个内部模型在仅约一个月的训练后,解决了 100 多道长期悬而未决的数学开放问题。面对数学界人士的质疑,公司选择资助高等研究院(Institute for Advanced Study)下设的一个独立顾问组。但报道同时指出,OpenAI 将自身的研究节奏排除在该顾问组的建议范围之外——也就是说,这个顾问组可以就相关议题提供意见,却无权过问 OpenAI 推进研究的快慢。

为什么重要

数学开放问题长期被视为检验机器推理能力的硬指标:它们没有现成答案,也难以靠检索或模式匹配蒙混过关。若模型真能在短时间内批量推进这类问题,意味着 AI 在形式化推理与长链条思考上可能迈过了某个门槛。

但“宣称”与“验证”之间隔着一条河。数学界对 AI 解题声明的警惕由来已久:问题是否被真正理解、证明是否可被独立复核、成果是否只是对已有文献的重新组合,都需要同行评议来回答。OpenAI 选择资助独立顾问组,可以看作对这类质疑的一种回应姿态;然而把研究节奏排除在顾问范围之外,又让这种回应打了折扣——顾问组能看什么、不能看什么,本身就是一个值得追问的边界。

影响与看点

对研究者而言,真正的看点不是“解了多少题”这个数字,而是这些解法能否被公开、被复核、被复用。如果成果停留在公司内部,它对数学共同体的价值就有限;如果部分公开,则可能改变形式化数学、定理证明工具乃至自动推理研究的走向。

对开发者与行业来说,这件事再次把“能力声明”与“外部监督”的张力摆上台面。前沿实验室越来越倾向于用独立机构来分担信任成本,但监督的范围、深度与独立性,往往在设立之初就被划定了边界。一个只能提建议、不能触及研究节奏的顾问组,更像是一种声誉管理安排,而非真正的治理机制。

值得关注的是:OpenAI 是否会公开具体问题清单与证明过程,数学界能否独立验证,以及这个顾问组未来会不会获得更大的知情权。在这些问题得到回答之前,对“一个月解出百题”的合理态度是:承认其潜在分量,同时保留验证的耐心。