以文生图模型 FLUX 闻名的 Black Forest Labs,正在把「世界模型」的触角伸向机器人控制。

发生了什么

Black Forest Labs 发布了名为 FLUX 3 Action 的机器人 AI 模型,并选择开源。根据 The Decoder 的报道,这是一个「开放世界动作模型」(open-world-action model):它接收摄像头画面作为输入,预测机器人下一步应当执行的动作。该模型参数量为 70 亿,在 RoboLab-120 基准测试上取得了当前最好成绩,同时运行速度最高可达此前最佳模型的 3.95 倍。

为什么重要

Black Forest Labs 此前最广为人知的身份是图像生成模型 FLUX 的开发者。从生成图像到驱动机器人,表面看是跨赛道,底层逻辑却一脉相承:两者都依赖对视觉世界的理解与预测能力。把视觉语言模型的能力迁移到「看画面、出动作」的决策任务上,是当前具身智能领域的一条主流技术路径。

FLUX 3 Action 的两个卖点值得拆开看。其一是「开放世界」——意味着模型不局限于特定实验室环境或固定任务,而是试图泛化到更广泛的场景。其二是效率:70 亿参数在当下的大模型语境里属于轻量级,却能在基准上领先,且推理速度快出数倍。对机器人而言,速度不是锦上添花,而是硬约束——控制回路要求模型在极短时间内完成感知到动作的转换,慢半拍就可能让动作失效。

更关键的是「开源」这个选择。机器人基础模型目前仍处在各家跑马圈地的阶段,头部玩家多选择闭源或有限开放。Black Forest Labs 以开源姿态切入,等于把一块有竞争力的基座直接交到研究社区和中小团队手里。

影响与看点

对开发者而言,最直接的价值是获得一个可本地部署、可微调的机器人动作基座。70 亿参数的体量意味着它对算力的要求相对友好,个人研究者或小团队也有机会在自有硬件上跑起来,并针对特定机器人形态或任务做适配。

对行业来说,这一发布进一步印证了「视觉模型公司向具身智能延伸」的趋势。图像生成积累的视觉表征能力,正在成为机器人策略学习的一项资产。如果 FLUX 3 Action 的泛化能力经得起真实场景检验,它可能推动更多团队放弃从零训练,转向在开源基座上做垂直优化。

需要保持克制的是,基准成绩与真实机器人上的表现之间往往存在落差。RoboLab-120 上的领先,能否转化为复杂、动态、非结构化环境中的稳定控制,仍需社区复现与实测来回答。此外,开源模型的实际可用性,也取决于配套的工具链、仿真环境和硬件适配是否跟得上。

一个值得关注的判断是:机器人基础模型的竞争,正在从「谁的模型更强」转向「谁的生态更开放、迭代更快」。Black Forest Labs 用开源换社区,赌的是生态的复利。