当大模型在语言任务上逼近人类时,生物学家面对的问题却依然棘手。Basecamp Research 试图用另一条路径切入:把自然界数十亿年进化积累的基因信息,变成可训练的数据资产。
发生了什么
据 The Decoder 报道,总部位于伦敦的 Basecamp Research 已完成 1.4 亿美元融资,投资方包括英伟达以及 Anthropic 旗下的 Anthology Fund。公司从雨林、海洋和热泉等极端环境中采集遗传物质,用这些数据训练 AI 模型,用于设计抗生素和细胞疗法所需的工具。在接受 The Decoder 采访时,CTO Phil Lorenz 解释了他为何认为生物学对 AI 而言是比语言大得多的问题,以及为何论文上的高分并不等于真实能力。
为什么重要
这笔融资的看点不在金额本身,而在投资方的构成。英伟达代表算力与基础设施侧,Anthropic 的基金则代表模型能力侧——两者同时出现在同一家生物 AI 公司的股东名单里,说明「生物数据」正在被当作下一类稀缺资源看待。
Lorenz 的核心论点值得展开:语言是人类的发明,规则相对有限、语料近乎无限;而生物学是自然演化出的系统,数据分布极度不均衡——人类已经测序的物种只是地球生命总量中极小的一部分,且高度偏向少数模式生物和病原体。这意味着生物 AI 面临的不只是算力问题,更是数据覆盖问题。谁能拿到别人拿不到的样本,谁就拥有别人复制不了的训练集。
Basecamp Research 的模式正是围绕这一点构建:不是去爬公开数据库,而是自己组织采集,把「自然界」变成专有语料。这与语言模型依赖公开互联网文本的逻辑截然不同,也更接近一种数据护城河生意。
影响与看点
对行业而言,这条路线把 AI 制药的竞争从「谁的模型更大」推向「谁的数据更独特」。过去几年,生物大模型多在公开序列数据上做预训练,同质化严重;专有采集数据如果真能转化为可验证的分子设计能力,会形成明显差异化。
对开发者,值得关注的是 Lorenz 对评测的批评:论文指标好看并不代表模型能解决真实生物问题。这与当前 AI 领域对 benchmark 可信度的普遍质疑相呼应,也提示做生物方向的人,别把公开榜单当成能力上限。
需要保持克制的是,从基因数据到真正上市的抗生素或细胞疗法,中间隔着漫长的湿实验验证与监管流程。融资和叙事可以很快,生物学不会。
一个独立判断:这类公司的真正价值,可能不在于最终做出哪款药,而在于它是否能把「不可复制的数据采集能力」沉淀为长期资产——如果只是把公开数据换个方式重训一遍,护城河并不存在。



