世界模型是机器人领域的前沿方向,但通常依赖大量动作标注数据。北京智源人工智能研究院(BAAI)最新发布的Orca模型,以纯视频训练的方式打破了这一限制。

发生了什么

BAAI 发布了名为 Orca 的世界模型,它不预测像素或 token,而是直接预测抽象的“世界状态”。该模型在12.5万小时的机器人操作视频上训练,且这些视频没有任何动作标签。在五项机器人任务(如抓取、放置等)的基准测试中,Orca 的性能与专门训练的 π0.5 系统持平。π0.5 是此前在机器人领域表现突出的专用模型,需要大量标注数据。

为什么重要

机器人学习长期受困于数据瓶颈:获取带动作标签的真实世界数据成本高昂且耗时。Orca 的核心突破在于,它证明了仅通过观察视频(无监督学习)就能学到有效的世界模型,从而大幅降低数据获取门槛。这一思路与近年视觉语言模型(VLM)利用互联网规模图像文本对进行预训练类似,但 Orca 将其扩展到了机器人领域。此外,Orca 由中国机构发布,也反映了全球范围内世界模型研究的加速竞争。

影响与看点

  • 对机器人开发者:Orca 提供了一种新的预训练范式,开发者可以先用海量无标签视频训练基础世界模型,再针对具体任务微调,有望显著降低标注成本。
  • 对行业格局:如果 Orca 的方法可扩展,可能改变机器人领域依赖昂贵数据采集的现状,加速通用机器人系统的落地。
  • 值得关注的点:Orca 目前仅在模拟和有限真实任务上验证,其泛化到复杂动态环境的能力尚待检验。此外,与 π0.5 的对比是基准测试,实际部署中还需考虑计算效率和实时性。

总体而言,Orca 是向数据高效机器人学习迈出的重要一步,但其能否成为机器人领域的“GPT 时刻”,还需更多开源和后续研究来验证。