实时语音转写长期是语音领域最难啃的一块:延迟压下去,准确率往往就掉下来。微软这次把两者同时摆上了台面。

发生了什么

微软 AI 发布了 MAI-Transcribe-2-Streaming,这是其首个实时语音转写模型。据官方信息,该模型在 Artificial Analysis 的 AA-WER Streaming 榜单上排名第一,参与对比的共有 38 个模型。

具体指标上,最终转写的词错误率为 2.5%,对应延迟 0.13 秒;首次部分结果(first partials)同样是 2.5% 的词错误率,延迟 0.12 秒。模型覆盖 60 种语言,支持连续语言检测,即无需手动切换即可在对话中识别语言变化。定价方面,介绍期价格为每小时 0.54 美元。目前该模型已进入公开预览阶段。

为什么重要

流式语音转写的核心矛盾在于「等」与「准」。传统方案要么等一句话说完再输出,牺牲实时性换取准确率;要么边听边出字,但部分结果频繁回改,体验割裂。首次部分结果与最终结果错误率持平,意味着模型在开口不久就能给出接近终稿质量的文本,这比单纯刷新一个 WER 数字更有实际意义。

另一个值得注意的信号是微软的模型策略。MAI 系列是微软自研模型线,此前更多出现在图像等方向,语音转写长期由 Whisper 系生态主导。推出自有的流式转写模型,说明微软希望在实时语音这条链路上掌握底层能力,而不是只做上层封装。

榜单层面,Artificial Analysis 的流式评测本身也是较新的维度。过去语音模型的对比多集中在离线整段转写上,流式场景的评测标准并不统一,AA-WER Streaming 的出现让「低延迟下的准确率」有了可横向比较的坐标。

影响与看点

对开发者而言,最直接的变化是接入成本与工程复杂度。每小时 0.54 美元的介绍期定价,加上公开预览的可用状态,让实时字幕、会议记录、语音助手这类场景的试错门槛降低。60 种语言加连续语言检测,则对多语种会议、跨境客服等混合语言场景更友好。

需要保持克制的地方同样存在。公开预览不等于生产可用,介绍期价格通常也不是长期价格,实际稳定性、并发能力、长时音频下的表现都还需要真实业务验证。榜单第一说明的是特定评测集上的表现,不等于所有口音、噪声环境、专业术语场景都能维持同一水平。

一个独立判断:实时语音转写的竞争重心,正在从「谁的 WER 更低」转向「谁能在低延迟下保持稳定输出」。当头部模型的错误率都压到个位数百分比区间,差距会越来越体现在工程细节——首字延迟、回改频率、语言切换的平滑度,以及价格。微软这次把这几项一起摆出来,说明它清楚战场在哪里。