如果视频生成不再需要等待渲染完成,而是像直播一样持续输出、随时可改,创作流程会发生什么变化?Runway 给出的答案是:把生成过程本身变成可实时操控的流。

发生了什么

据 The Decoder 报道,Runway 正在推动一种新的 AI 视频形态:不再让用户提交提示后等待一段成品片段,而是以流式方式持续生成视频,用户可以在生成过程中不断输入提示、实时影响画面走向。

这一思路建立在此前发布的 GWM-1 之上。按 Runway 的描述,GWM-1 是一个“世界模型”,其特点是逐帧生成视频,而不是一次性合成整段内容。逐帧生成的机制天然适合流式输出——每一帧都可以在上一帧的基础上继续推演,从而支撑起“边提示边生成”的交互方式。

除了创意工具,Runway 还提到这一能力在机器人和自动驾驶领域的潜在用途。

为什么重要

当前主流的 AI 视频产品,交互范式基本是“提示—等待—成品”:用户写一段描述,等模型渲染出一段几秒到几十秒的片段,不满意再改提示重来。这种模式把生成过程封装成黑箱,用户只能在结果层面做取舍。

Runway 想改变的是这个范式本身。当视频以帧为单位持续生成,提示就不再是“一次性指令”,而更像一个可以随时调节的控制信号。这更接近游戏引擎或实时渲染管线的逻辑,而不是传统视频剪辑的逻辑。

选择“世界模型”这个定位也值得注意。逐帧预测下一帧,本质上是在学习环境如何随时间演化,这与机器人、自动驾驶所需的“预测接下来会发生什么”是同一类问题。Runway 把创意工具和具身智能放在同一套技术叙事里,说明它并不只想做一家视频生成公司。

影响与看点

对创作者而言,实时流式生成意味着工作方式从“抽卡”转向“操控”。如果提示能即时反馈到画面上,试错成本会大幅下降,视频生成可能更像使用一台摄像机,而不是提交一份订单。但这也对交互设计提出新要求:如何在不打断生成的前提下修改提示,如何保存和回放一段“生成过程”,都还没有成熟答案。

对行业而言,真正的门槛在于延迟和一致性。逐帧生成要实时输出,算力成本和推理速度是硬约束;同时,长时间流式生成很容易出现画面漂移或语义遗忘,如何维持前后帧的连贯性是核心难题。Runway 目前披露的是方向而非成品,实际体验与稳定性仍需观察。

对开发者和机器人领域来说,如果世界模型能以低延迟持续预测画面,它就可能成为仿真与规划的基础组件。不过从视频生成到可用的机器人控制之间,还隔着动作空间、物理精度和安全性等大量工程问题。

一个独立判断:Runway 这次押注的不是“更好的视频”,而是“视频生成的新交互层”。谁先把实时可控的生成流做稳,谁就可能在创意工具之外,拿到具身智能的入场券。