
Suno 新增 Speech 功能:AI 音乐生成器开始做「有配乐的朗读」
Suno 在其 AI 音乐生成器中加入 Speech 功能,可在单条音轨内生成朗读文本并自动匹配背景音乐,官方定位为诗歌、冥想与睡前故事等场景,但未披露模型训练方式。
文本转语音

Suno 在其 AI 音乐生成器中加入 Speech 功能,可在单条音轨内生成朗读文本并自动匹配背景音乐,官方定位为诗歌、冥想与睡前故事等场景,但未披露模型训练方式。

AI 音乐生成平台 Suno 推出语音生成功能,进入公开测试,可在网页与移动端根据脚本或提示词生成旁白,并同时产出配套背景音乐。

AI 语音公司 ElevenLabs 在一笔 3 亿美元的员工股权要约中估值翻倍至 220 亿美元,由 Wellington 与 T. Rowe Price 联合领投。这既是语音赛道被重新定价的信号,也折射出 AI 公司用老股交易替代传统融资的新常态。

Hugging Face 推出 Open TTS Leaderboard,为多语言文本转语音与声音克隆提供可扩展的横向评测基准,试图填补开源语音模型长期缺乏统一比较标准的空白。

ElevenLabs 推出新一代语音模型 Eleven v4,在笑声、耳语等副语言线索上跟随更准,长内容中的音色一致性显著提升;Turbo 变体首字延迟低至 150 毫秒,面向实时语音智能体。

语音 AI 公司 Modulate 完成 2500 万美元融资,其模型既用于语音生成,也用于检测深伪、欺诈与诈骗,把「造假」与「打假」放在同一条技术栈上。

TechCrunch与ElevenLabs CEO对谈,这家据报估值220亿美元的AI语音公司正支撑大量客服通话;CEO认为企业应当告知用户对面是机器,直到人们习以为常为止。

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音合成模型,支持超 100 种语言,可通过文字描述凭空生成新音色,并能在单份脚本中生成双人对话。

Google DeepMind 放出 Gemini 3.8 文本转语音的预告,延续 Gemini 系列多模态能力向语音端的延伸。本文梳理这次发布的位置、TTS 赛道的竞争格局,以及它对开发者和产品方的实际意义。

阿里 Qwen 团队推出 Qwen-Audio-3.1 系列五款模型,覆盖语音识别、语音合成与实时交互,并大幅下调 AI 音频服务价格,最高降幅达 95%。

冰岛语音模拟平台 Treble 完成 1800 万美元融资,其产品被语音 AI 模型开发者、AI 可穿戴设备与机器人公司用于生成和测试语音交互场景。

安全研究员在分析一款名为 Dora 的欺诈约会应用时,收到了一位“41 岁红发女性”的来电。这起案例揭示 AI 正让约会诈骗从文字聊天升级为语音甚至视频互动。