当 AI 智能体开始自己读论文、提假设,而由人类去湿实验台上验证时,“AI 是否做出了科学发现”就不再是哲学问题,而是一个需要被定义的操作性问题。
发生了什么
据 MIT Tech Review 报道,Anthropic 上周三宣布,它已于今年早些时候启动了一个分子生物学实验室。在这个实验室里,Claude 智能体负责阅读文献、对困难的生物学问题提出猜想,人类科学家则负责围绕这些猜想设计和执行实验。
需要说明的是,目前公开的信息仅限于这一框架性描述:Anthropic 没有披露具体的研究课题、实验规模、已产出的结果,也没有说明哪些环节的结论被归功于模型、哪些归功于人类。换言之,这是一个“组织形式”的公布,而非一项成果的公布。
为什么重要
过去两年,AI 在科研中的角色基本停留在加速器层面:做文献综述、生成候选分子、预测蛋白质结构、辅助写代码和数据分析。这些工作价值明确,但边界也明确——AI 输出的是候选物和中间产物,判断权和署名权仍在人类手里。
Anthropic 这次的做法把边界往前推了一步:让模型承担“提出可检验假设”这一环。这是科学方法中最难被自动化、也最容易被高估的部分。假设的质量不取决于生成速度,而取决于它是否新颖、是否可证伪、是否值得花几周湿实验去验证。
这也正是标题中那个问题的由来。“AI 做出科学发现”目前没有公认标准。是模型提出了关键假设就算,还是必须由模型独立完成从假设到验证的闭环才算?如果假设由 AI 提出、实验由人类执行、论文由人类撰写,这项发现的归属如何界定?Anthropic 把实验室建起来,某种程度上是在用工程实践倒逼这些定义问题。
影响与看点
对行业而言,这条消息的信号意义大于技术细节。它意味着头部模型公司开始把“AI for science”从 API 调用和合作论文,推进到自建实验能力——因为只有掌握湿实验环节,才能形成假设到验证的闭环,也才能拿到判断模型科研能力的真实反馈。
对开发者和研究者,值得关注的是这套流程的可复现性。如果 Claude 提出的假设最终被证明有相当比例是有效的,那么“智能体 + 自动化实验平台”可能成为一种新的科研基础设施;如果命中率平平,它就更像一次高成本的品牌叙事。
一个独立的判断是:在可预见的阶段内,AI 更可能成为“假设的批量生产者”,而不是“发现的独立完成者”。真正的瓶颈不在模型能力,而在于验证环节的物理速度——湿实验不会因为模型变快而变快。因此,衡量这类项目是否成功,关键指标或许不是模型提出了多少假设,而是有多少假设值得被送进实验室。



