Adobe Research的研究人员通过结合状态空间模型(SSMs)进行高效的长距离依赖建模,以及密集局部注意力来保证连贯性,并采用扩散强制和帧局部注意力等训练策略,成功克服了视频生成中长期记忆的难题。这一突破使得视频世界模型能够更好地处理长时间序列中的信息。