字节跳动近日发布 Seedance 2.5,这是一款能够同时生成视频和音频的 AI 模型,单次生成时长可达 30 秒。该模型支持用户输入多张图片、视频和音频作为参考,为创意制作提供了新的可能性。

发生了什么

Seedance 2.5 的核心能力是“视频+音频”一体化生成。与以往需要分别生成画面和声音、再进行后期合成的流程不同,该模型在生成视频的同时自动匹配音频,减少了制作环节。其单次生成时长达到 30 秒,是谷歌 Gemini Omni Flash 的三倍。此外,模型支持多模态输入,用户可提供数十张图片、视频片段或音频文件作为参考,以控制生成内容的方向和风格。

为什么重要

视频生成领域长期面临“画面与声音分离”的痛点。此前,AI 视频模型大多只输出无声视频,声音需要额外工具生成并手动同步,不仅耗时,还容易出现音画不同步的问题。Seedance 2.5 将音频生成内置于视频生成流程,简化了制作链路。

30 秒的生成时长也值得关注。此前多数模型只能生成几秒到十几秒的短视频,30 秒已接近广告短片、社交媒体内容等常见场景的时长需求。对于广告团队而言,这或许意味着可以一次性生成完整的素材片段,而无需再拼接多个短片段。

影响与看点

Seedance 2.5 对创意行业的影响可能首先体现在广告和短视频制作上。传统广告制作需要脚本、拍摄、剪辑、配音等多个环节,而该模型有望将部分流程压缩为“输入参考素材-生成成片”两步。不过,实际效果是否达到商业可用级别,仍需观察。

值得关注的看点包括:

  • 多模态参考的实际控制力:模型对图片、视频、音频参考的理解程度,决定了创意人员能否精准控制生成内容。
  • 音画同步质量:内置音频是否能与画面自然匹配,尤其是口型、动作与声音的对应关系。
  • 对现有工作流的冲击:如果生成质量足够高,可能会改变广告制作公司的人力配置和工具链。

独立判断:Seedance 2.5 的发布标志着视频生成从“单模态”向“多模态一体化”迈进,但能否真正取代传统制作流程,还取决于生成的一致性和可控性,而不仅是时长和音频的叠加。