Adobe 正在将其 Firefly 平台从图像生成扩展到音频领域,并引入 Google 的多模态模型,这标志着 AI 创意工具正在向更全面的方向演进。
发生了什么
Adobe 宣布在 Firefly 中全面推出三款 AI 音频工具:Generate Music(音乐生成)、Generate Speech(语音生成)和 Generate Sound Effects(音效生成)。这些工具旨在为视频项目提供免版税的音乐、配音和音效。同时,Firefly 平台还集成了 Google 的 Gemini Omni Flash 模型,该模型具备多模态能力,可能为平台带来更强大的内容理解和生成能力。
为什么重要
此次更新是 Adobe 在生成式 AI 领域战略布局的延续。Firefly 最初以图像生成和编辑工具闻名,并已扩展到视频和设计领域。如今,音频工具的加入使 Firefly 成为一个更完整的创意内容生成平台,覆盖视觉和听觉两大维度。这反映了行业趋势:AI 创意工具正从单一模态走向多模态融合,以满足创作者对一体化工作流的需求。此外,集成 Gemini Omni Flash 表明 Adobe 正在整合外部先进模型,以增强其平台的技术实力,这也可能意味着 Adobe 在自研模型之外,采取更开放的生态策略。
影响与看点
对于视频创作者和内容制作团队来说,这三款音频工具可能简化音频制作流程,降低对专业录音和音乐制作资源的依赖。免版税的特性也减少了版权风险。值得关注的是,这些工具的质量和可控性如何,以及它们如何与现有的 Premiere Pro 等视频编辑软件集成。集成 Gemini Omni Flash 则可能为 Firefly 带来更强大的多模态理解能力,例如更精准的文本到内容生成,或更智能的素材管理。然而,目前关于 Gemini Omni Flash 的具体应用场景和性能细节尚未披露,其实际效果有待观察。独立判断:Adobe 此举意在构建一个覆盖图像、视频、音频的全面 AI 创意平台,但面对 Runway、Suno 等垂直领域玩家的竞争,其整合效果和用户体验将是关键。


