
微软发布 MAI-Transcribe-2-Streaming:实时语音转写拿下榜单第一,每小时 0.54 美元
微软 AI 推出首个实时语音转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 流式评测中位列 38 个模型之首,最终转写与首次部分结果均为 2.5% WER,覆盖 60 种语言,现已公开预览。
语音合成、识别与音乐生成

微软 AI 推出首个实时语音转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 流式评测中位列 38 个模型之首,最终转写与首次部分结果均为 2.5% WER,覆盖 60 种语言,现已公开预览。

曾因 Napster 与唱片业为敌的肖恩·帕克,如今带着唱片公司的授权与资金重回音乐赛道,试图围绕音乐重建 Stability AI。

Suno 在其 AI 音乐生成器中加入 Speech 功能,可在单条音轨内生成朗读文本并自动匹配背景音乐,官方定位为诗歌、冥想与睡前故事等场景,但未披露模型训练方式。

AI 音乐生成平台 Suno 推出语音生成功能,进入公开测试,可在网页与移动端根据脚本或提示词生成旁白,并同时产出配套背景音乐。

微软 AI 推出 MAI-Transcribe-2-Streaming 实时转写模型,并同步更新语音智能体所需的文本转语音模型,补齐语音交互链路的关键一环。

AI 语音公司 ElevenLabs 在一笔 3 亿美元的员工股权要约中估值翻倍至 220 亿美元,由 Wellington 与 T. Rowe Price 联合领投。这既是语音赛道被重新定价的信号,也折射出 AI 公司用老股交易替代传统融资的新常态。

Hugging Face 推出 Open TTS Leaderboard,为多语言文本转语音与声音克隆提供可扩展的横向评测基准,试图填补开源语音模型长期缺乏统一比较标准的空白。

ElevenLabs 推出新一代语音模型 Eleven v4,在笑声、耳语等副语言线索上跟随更准,长内容中的音色一致性显著提升;Turbo 变体首字延迟低至 150 毫秒,面向实时语音智能体。

语音 AI 公司 Modulate 完成 2500 万美元融资,其模型既用于语音生成,也用于检测深伪、欺诈与诈骗,把「造假」与「打假」放在同一条技术栈上。

音乐硬件初创公司 Thoughtful Things 在 Kickstarter 上发布首款产品 Engram,一款用 AI 扭曲音频、甚至生成幻觉音色的采样器与 groovebox。它刻意不做“一键出歌”的 Suno 盒子。

英伟达发布 Nemotron 3 Diarization,一个仅 1 亿参数、可实时识别对话中最多八位说话人的开源模型,把原本昂贵的说话人分离能力下放到轻量级部署场景。

索尼与环球音乐再次起诉 Suno,指控其新一代 v6 模型仍侵犯版权,理由是它基于此前模型的用户输出训练,而旧模型本身使用了未经授权的音乐素材。