一位物理学家用开源工具加通用大模型,三个月写出横跨粒子物理到语言学的三十余篇论文草稿——这件事的价值不在于数量,而在于它暴露了AI做精确科学计算时,能力边界究竟卡在哪里。
发生了什么
据The Decoder报道,哈佛物理学家Matthew Schwartz使用开源工具BootLoops,配合Anthropic的Claude模型,在三个月内产出了36篇论文草稿,覆盖18个研究领域,从粒子物理延伸到语言学。BootLoops的定位是一个“harness”(承载框架/套壳工具),用来引导AI模型执行精确的科学计算,而非泛泛的文本生成。
值得注意的是Schwartz本人的态度。他并没有把产出直接等同于科学成果,而是表示这些结果“往往只有在人类专家介入之后,才真正具有科学价值”,并给出了一句相当直白的提醒:“所有东西你都得自己看一遍。”
为什么重要
大模型做科研这件事,过去一年多的讨论大多集中在两个极端:要么是“AI将取代研究者”的夸张叙事,要么是“模型连算术都算不准”的轻视。BootLoops这类工具代表的是第三条路径——不指望模型自己变可靠,而是用外部框架把模型的推理约束到可验证的计算流程里。
这背后是一个关键区分:语言上的流畅和科学上的正确是两回事。模型可以生成结构完整、术语准确的论文段落,但物理量纲是否自洽、推导步骤是否成立、数值是否可复现,这些必须靠计算框架和人工复核来兜底。Schwartz的做法实际上把AI定位成“高产的研究助手”而非“独立研究者”,产出的是待验证的草稿,而不是可直接发表的结论。
开源这一点同样关键。科研场景对可复现性要求极高,闭源黑箱很难让同行信任其计算过程;BootLoops开放出来,意味着其他研究者可以检查、复现甚至改进这套约束机制。
影响与看点
对科研工作者而言,这类工具的现实价值在于压缩“从想法到初步结果”的时间,把人力集中到判断和验证环节。对开发者而言,BootLoops提示了一个更普遍的产品思路:与其等待模型自身能力提升,不如在模型外围搭建结构化的工作流,用工具调用、步骤校验和中间检查点来提升可靠性——这套逻辑在代码生成、数据分析等场景同样适用。
需要保持清醒的是,36篇这个数字本身不构成科学贡献的证明。真正值得追踪的问题是:这些草稿中有多少经得起同行评审?人类专家介入的比例有多高?如果大部分工作量最终仍落在人工验证上,那么效率提升的实际幅度就需要重新评估。
一个独立判断:AI在科研中的角色,短期内更可能是“把草稿成本降到接近零”,而不是“把验证成本降到零”。谁能解决后者,谁才真正改变了科研的生产方式。



