导语
一项新研究给AI科研自动化的热潮泼了冷水:即便给足算力和资金,前沿模型独立完成的论文仍被专家否定,自主科研之路比想象中漫长。
发生了什么
这项研究让AI智能体(基于Claude Opus 4.8和GPT-5.6 Sol)在六天内,使用3000美元API额度和GPU资源,独立撰写AI研究论文。论文主题来自NeurIPS尚未发表的原始研究。结果显示,这些智能体能够完成从文献调研到实验设计、代码实现、论文撰写的完整流程,但最终成果被原作者一致评为“Reject”(拒绝)。研究由普林斯顿大学和英国AI安全研究所合作进行,直接针对Anthropic和OpenAI此前宣称的“自主AI研究即将实现”的观点。
为什么重要
Anthropic和OpenAI近期频繁释放信号,称其模型已具备自主进行科研的能力,甚至能独立完成从假设到论文的全过程。这种宣传不仅影响公众认知,也引导着资本和人才流向。然而,这项研究用严格的同行评议标准检验了这些声明,发现模型在“跑通流程”和“产出有价值成果”之间存在巨大鸿沟。原作者拒绝论文的原因可能包括:研究问题缺乏新意、实验设计有缺陷、结果分析不深入、或结论缺乏支撑。这提醒我们,AI在科研中的角色目前更接近“高级工具”而非“独立研究者”,距离真正自主发现知识还有关键瓶颈。
影响与看点
对AI公司而言,这项研究是及时的纠偏,避免市场对AI科研能力过度期待。对开发者来说,它意味着AI智能体在科研场景的落地应聚焦于辅助人类(如文献综述、代码生成、实验建议),而非全自动替代。未来值得关注的是,模型在哪些具体环节表现最弱(如问题定义、假设生成),以及随着推理能力和长程规划提升,能否突破这些瓶颈。我的判断是:短期内,AI在科研中的价值在于加速“执行”而非“思考”,真正的自主科研需要模型具备更强的创造性、批判性和对未知的探索能力,这远超当前技术范式。



