Reka 近日发布 Rho-1,一个从零训练的 19B 全能推理模型,试图用单一网络统一多模态理解与生成,并首次将机器人动作纳入输出空间。
发生了什么
Rho-1 的核心设计是“一个网络、共享 KV 缓存”。它同时处理文本、图像、视频的输入与输出,并直接生成机器人动作。这意味着模型不再需要为不同模态拼接独立模块,而是在同一套注意力机制下完成跨模态推理。Reka 还提供了一个蒸馏版本,生成一段 5.3 秒的视频片段大约只需一秒,推理效率显著提升。目前该模型以研究预览形式发布,未公开权重,外界无法直接复现或商用。
为什么重要
多模态模型长期面临“理解”与“生成”割裂的问题:视觉语言模型擅长读图,视频生成模型擅长造片,机器人策略模型则自成体系。Rho-1 尝试用共享 KV 缓存把这三者串起来,让模型在同一个推理过程中既看懂画面,又生成后续视频,还能输出动作指令。这种“全能推理”路线如果成立,将大幅降低多模态系统的工程复杂度。
从行业背景看,Reka 此前已推出多款多模态模型,但 Rho-1 的 19B 参数规模和“从零训练”的表述值得注意——它没有走主流的大模型微调路线,而是重新设计训练目标。机器人动作作为输出模态,也暗示 Reka 可能瞄准具身智能场景,而非单纯的内容生成。
影响与看点
对开发者而言,Rho-1 目前无法直接使用,但它的架构思路——共享 KV 缓存下的多模态统一——可能影响后续开源模型的设计。蒸馏版一秒生成 5.3 秒视频的效率,如果属实,对实时视频生成和机器人仿真有参考价值。
对行业来说,Reka 选择“研究预览、不公开权重”的策略,既展示了技术能力,又保留了商业化空间。这与当前开源与闭源并行的多模态竞争格局一致。
值得关注的三个点:一是共享 KV 缓存能否在更大规模上保持稳定;二是机器人动作输出的精度和泛化能力,目前没有公开评测数据;三是 Reka 后续是否会开放权重或 API。
一个独立判断:Rho-1 的“全能”叙事在概念上吸引人,但多模态统一模型的实际表现往往受限于数据质量和模态间的冲突。在缺乏公开评测和权重的情况下,它更像是一次技术宣言,而非可验证的里程碑。真正的考验在于,当开发者拿到它时,它能否在真实任务中同时做好理解、生成和动作控制。


