把世界模型从「一个领域一套配方」变成「一套配方适配多个领域」,是这项工作的核心主张。

发生了什么

JEPA(联合嵌入预测架构)此前的典型做法,是让模型在潜空间中预测一个整体性的目标表示。JEPA-Anything 改变了这个结构:它把原本单一的潜空间目标拆成四个正交因子,并为每个因子配置独立的预测器。

这套设计在七个不同领域上做了测试,在全部十项动力学任务上都优于参数匹配的 JEPA 基线。其中在 Interventional Pong 这一干预式任务上,干预误差下降了 34.8%。作者将其定位为「超越领域特定世界模型」的一次尝试,即用同一套方法而非逐领域定制。

为什么重要

世界模型近年来的主流路线,基本是「一个领域、一套架构、一轮调参」。机器人、视频、物理仿真各自为战,方法之间难以迁移,复现成本高,也很难判断某个设计到底是在建模世界,还是只是在拟合某个数据集。

JEPA 本身的意义在于绕开像素级重建,直接在表示空间做预测,从而更接近「理解动力学」而非「记住外观」。但它长期面对一个结构性问题:单一潜目标把位置、外观、交互、时间演化等异质信息纠缠在一起,预测器很难分辨哪些变化是本质的、哪些只是噪声。

JEPA-Anything 的思路是把这种纠缠显式解开。四个正交因子相当于给模型一组分工明确的预测通道,每个通道只负责一类变化。这既降低了单个预测器的负担,也让不同领域可以共享同一套因子分解逻辑——领域差异体现在因子的具体内容上,而不是架构本身。

如果这一结论在更大规模上成立,它指向的是一种「通用世界模型配方」:不必为每个新领域重新设计预测目标,只需沿用同一套分解方式。

影响与看点

对做世界模型和具身智能的研究者来说,最直接的价值是可迁移性。正交因子分解如果确实稳定,意味着跨领域迁移、干预实验和因果式评估都有了更清晰的接口,而不是继续堆叠领域特定的工程技巧。

对工程侧而言,独立预测器带来的额外参数与训练开销需要权衡。论文强调的是与「匹配基线」的对比,这在一定程度上控制了参数量差异,但多预测器在推理时的成本、以及因子数量是否必须为四,仍是值得追问的问题。

需要保持克制的地方也很明确:七个领域、十项任务的覆盖面固然比单领域工作更广,但「正交」是否在表示层面真正成立,通常需要消融和可视化证据来支撑,仅凭下游指标领先并不足以完全证明因子之间没有冗余。

一个独立判断:这项工作的真正贡献可能不在某个具体数字,而在于它把「世界模型该预测什么」这个问题,从架构选择重新表述为表示分解问题——这比多刷几个 benchmark 更可能影响后续研究的方向。