当大模型在文本和图像领域卷到白热化,一场更安静、但可能更具颠覆性的竞赛正在生命科学领域展开。
发生了什么
由马克·扎克伯格与普莉希拉·陈支持的科研组织Biohub,正在协调一项总额18亿美元的计划,目标是训练能够预测细胞行为的AI模型。参与方包括Meta、Google DeepMind、Isomorphic Labs以及美国能源部,它们将分别提供数据、实验室设备和算力支持。据披露,首批数据集预计在约一年后准备就绪。
为什么重要
细胞行为预测是生物学中典型的“难问题”:基因表达、蛋白质折叠、细胞对刺激的响应,背后是高度非线性且充满噪声的复杂系统。传统实验方法成本高、周期长,而AI模型一旦能在虚拟环境中可靠模拟细胞反应,药物研发、疾病机理研究乃至合成生物学的效率都可能被重新定义。
这一计划的特殊之处在于其“联盟”属性。Meta和Google DeepMind带来的是大模型训练与多模态学习的工程经验;Isomorphic Labs(Alphabet旗下)专注AI驱动的药物发现;美国能源部则拥有国家实验室体系中的超级计算资源与生物数据积累。Biohub的角色更接近协调者与数据标准制定者,而非单一技术提供方。
从更宏观的视角看,这是“AI for Science”从论文走向大规模基础设施建设的标志性事件。过去几年,AlphaFold在蛋白质结构预测上的突破已经证明,AI可以成为基础科学发现的核心工具。但细胞行为比单一蛋白质结构更动态、更依赖上下文,对数据规模和质量的要求也更高。18亿美元的投入,本质上是在为下一代生物基础模型铺设数据与算力底座。
影响与看点
对行业而言,最直接的影响是生物数据的标准化与开放化。如果Biohub能推动形成类似ImageNet之于计算机视觉的基准数据集,那么细胞行为预测模型的迭代速度将大幅提升。对开发者来说,这意味着未来可能出现更多面向生物领域的预训练模型和API,降低跨学科创新的门槛。
值得关注的还有时间线。首批数据集“约一年就绪”是一个相对激进的承诺,反映出各方对数据工程难度的乐观估计。真正的挑战不在于模型架构,而在于实验数据的可重复性、标注一致性以及跨实验室的协议统一。
一个独立的判断是:这项计划的价值可能不在于最终模型有多准,而在于它能否建立起一套被广泛接受的“细胞行为数据语言”。谁定义了数据标准,谁就掌握了下一代生物AI的底层话语权。



