把多模态能力塞进一个网络并不新鲜,但把机器人控制也当作 token 一起训练,是 Rho-1 最值得注意的地方。
发生了什么
Reka AI 发布了 Rho-1,一个 190 亿参数的 omni-model。按照官方披露,它在单个神经网络内同时处理和生成文本、图像、视频以及机器人控制动作,训练使用了 320 张 H100,耗时约三个月。
架构上的关键选择是:不做任务路由。多数所谓“多模态系统”实际上是一个调度器加若干专用模型,遇到图像调视觉模型,遇到动作调控制策略。Rho-1 则把所有模态都编码成 token,放进同一个共享上下文窗口里处理。这意味着不同模态之间不是通过接口拼接,而是在同一套注意力机制内直接交互。
为什么重要
过去两年,多模态的主流路线是“更大、更专、更多模块”。视觉、语音、视频各有一条独立技术栈,再靠工程手段粘合。这种做法的代价是:跨模态推理能力弱,系统复杂度高,延迟和成本都堆在路由层。
Rho-1 代表的是另一条路线——统一 token 空间。它的价值不在于参数量,190 亿在当下并不算大,而在于用相对克制的算力验证了“一个网络处理所有模态”的可行性。如果这条路走得通,模型能力的扩展就不再依赖模块数量的堆叠,而是依赖单一网络对异构数据的吸收效率。
把机器人控制纳入同一上下文,是更进一步的信号。控制动作本质上是连续、时序、与物理世界强耦合的数据,传统上属于强化学习和控制论的领地。让它和文本、图像共享表征,意味着模型可能学会从视觉输入直接推导动作序列,而不需要单独的训练管线。这对具身智能方向有直接参考价值。
影响与看点
对开发者而言,统一上下文窗口意味着更简单的调用范式:一套 API、一种输入格式,跨模态任务不再需要拼接多个服务。但也要注意,单网络处理所有模态在推理效率上未必占优,具体延迟和吞吐表现需要实测数据支撑。
对行业而言,Rho-1 的算力账本更值得关注。320 张 H100、三个月,这个量级远低于当前头部模型的训练投入。如果性能可接受,它会强化一个判断:多模态能力的门槛正在从“算力规模”转向“数据组织方式”。
需要保持克制的是,目前公开信息集中在架构和训练配置,缺少与其他模型的可比评测。统一架构是否在单项任务上牺牲了精度,机器人控制的泛化能力如何,都还没有答案。
一个初步判断:Rho-1 的意义不在于它现在有多强,而在于它把“全模态单网络”从概念推进到了可运行的系统。接下来要看的是,这条路线的 scaling 曲线是否比模块化路线更陡。


