两家机构,一个结论:AI 能执行科研流程,却还不会做科研。

发生了什么

Epoch AI 与 Anthropic 分别开展研究,却得出了同一个判断:以 GPT-5.6 Sol、Claude Fable 5 为代表的当前模型,已经可以运行实验、走完流程,但在科学自我批判和真正的创造性思维上明显不足。

最能说明问题的是分数。表现最好的 Sol 只达到人类参考分的 15%,而且这 15% 并非来自新方法——它用的仍是研究者早已知道的路径。换句话说,模型是在复现已知解法,而不是在提出新假设。研究指出的最大短板,是模型无法批判性地质疑自己的结论。

为什么重要

过去一年,围绕“AI 科学家”“自主研究代理”的叙事不断升温,厂商演示里模型能读论文、写代码、跑实验、出报告,看上去一条龙。但这次的关键不在于能力上限有多高,而在于两家立场不同的机构——一家独立评测机构,一家头部模型厂商——在互不通气的情况下指向了同一个缺陷。

这比单一榜单更有说服力。它说明问题不是某个模型调得不好,而是当前范式的共性:模型擅长在给定框架内优化,不擅长跳出框架反思“我是不是错了”。科研的核心恰恰是后者——设计能证伪自己的实验、在数据不支持时放弃原有假设。缺少自我批判,实验跑得再多也只是自动化的体力活。

影响与看点

对开发者而言,这意味着把代理直接放进科研闭环仍需人类把关,尤其是在结论验证环节。可落地的做法是把代理定位为“实验执行者”和“假设生成器”,而非“结论裁定者”,并在流程中强制加入对抗性审查。

对行业而言,评测口径值得关注。如果后续基准开始把“自我纠错”“方法新颖性”纳入打分,而不只看任务完成率,那么当前一批主打自主科研的产品叙事会被重新校准。15% 这个数字本身不是终点,但它提示:从“能跑实验”到“会做研究”之间,隔着的不是算力,而是批判性。

一个独立判断:短期内,最有价值的 AI 科研应用不是替代科学家,而是把科学家从重复实验中解放出来,同时把“质疑结论”这一步牢牢留给人。