
微软发布 MAI-Transcribe-2-Streaming:实时语音转写拿下榜单第一,每小时 0.54 美元
微软 AI 推出首个实时语音转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 流式评测中位列 38 个模型之首,最终转写与首次部分结果均为 2.5% WER,覆盖 60 种语言,现已公开预览。
语音转文本

微软 AI 推出首个实时语音转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 流式评测中位列 38 个模型之首,最终转写与首次部分结果均为 2.5% WER,覆盖 60 种语言,现已公开预览。

微软 AI 推出 MAI-Transcribe-2-Streaming 实时转写模型,并同步更新语音智能体所需的文本转语音模型,补齐语音交互链路的关键一环。

英伟达发布 Nemotron 3 Diarization,一个仅 1 亿参数、可实时识别对话中最多八位说话人的开源模型,把原本昂贵的说话人分离能力下放到轻量级部署场景。

NVIDIA 在 Hugging Face 发布 Nemotron 3 Diarization,把“谁在什么时候说话”这一能力带入实时多说话人场景,为会议转写、语音助手和客服分析提供可用的开源基础组件。

阿里 Qwen 团队推出 Qwen-Audio-3.1 系列五款模型,覆盖语音识别、语音合成与实时交互,并大幅下调 AI 音频服务价格,最高降幅达 95%。

腾讯 Gander 用可替换的“大脑”执行搜索、写代码等复杂任务,用“小脑”维持对话不中断,用户可随时打断或改任务;基准中打断率仅 8%,但任务准确率落后于对手。

Meta的Superintelligence Labs推出Muse Voice Transcribe,以80毫秒分块处理语音,支持说话人区分和句界检测,据称在流式转录中兼具最高准确率和最低价格。该模型被视为构建持续聆听的个性化AI代理的基础组件。

Hugging Face 的 Open ASR Leaderboard 新增首个全球南方语言,标志着语音识别评测正从英语中心转向更广泛的语言覆盖,对技术公平性和模型实用性具有深远影响。

Google 推出 Gemini 3.5 Transcribe,支持 85 种语言,流式转写词错率 4.0%,延迟比前代低 70%,并可通过函数调用与其他模型协作。

Google DeepMind 推出 Gemini 3.5 Transcribe,将语音转写从单纯识别提升到理解层面,为会议记录、内容生成等场景带来新可能。

Google 更新 Gemini Audio,引入 Gemini 3.5 系列模型,提升转录精度,自动识别专业术语并去除语气词,支持 85 种以上语言。
