
估值220亿美元的ElevenLabs:AI语音该不该自报身份?
TechCrunch与ElevenLabs CEO对谈,这家据报估值220亿美元的AI语音公司正支撑大量客服通话;CEO认为企业应当告知用户对面是机器,直到人们习以为常为止。
语音合成、识别与音乐生成

TechCrunch与ElevenLabs CEO对谈,这家据报估值220亿美元的AI语音公司正支撑大量客服通话;CEO认为企业应当告知用户对面是机器,直到人们习以为常为止。

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音合成模型,支持超 100 种语言,可通过文字描述凭空生成新音色,并能在单份脚本中生成双人对话。

Google DeepMind 放出 Gemini 3.8 文本转语音的预告,延续 Gemini 系列多模态能力向语音端的延伸。本文梳理这次发布的位置、TTS 赛道的竞争格局,以及它对开发者和产品方的实际意义。

YouTube 在 Made On YouTube 活动上为 YouTube Music 推出“Ask Music”对话式工具和“Your Podcast Lineup”个性化播客列表,旨在让用户通过自然语言更轻松地发现音乐、探索艺人并找到可能错过的播客。

NVIDIA 在 Hugging Face 发布 Nemotron 3 Diarization,把“谁在什么时候说话”这一能力带入实时多说话人场景,为会议转写、语音助手和客服分析提供可用的开源基础组件。

阿里 Qwen 团队推出 Qwen-Audio-3.1 系列五款模型,覆盖语音识别、语音合成与实时交互,并大幅下调 AI 音频服务价格,最高降幅达 95%。

腾讯 Gander 用可替换的“大脑”执行搜索、写代码等复杂任务,用“小脑”维持对话不中断,用户可随时打断或改任务;基准中打断率仅 8%,但任务准确率落后于对手。

冰岛语音模拟平台 Treble 完成 1800 万美元融资,其产品被语音 AI 模型开发者、AI 可穿戴设备与机器人公司用于生成和测试语音交互场景。

安全研究员在分析一款名为 Dora 的欺诈约会应用时,收到了一位“41 岁红发女性”的来电。这起案例揭示 AI 正让约会诈骗从文字聊天升级为语音甚至视频互动。

谷歌 DeepMind 推出 Gemini 3.8 Live 与 Live Extended Thinking 两款实时语音模型,登顶语音到语音榜单,并以每小时 1.38 美元的对话成本明显低于 OpenAI 的 GPT-Live-1。


ElevenLabs 发布 AI 音乐生成模型 Music v2.5,同步开放应用与 API,提供免费与专业档位;近 4.8 万组盲测对比中听众更偏好新版本,公司称模型仅使用授权音乐训练。