Google 的 Gemini 3.5 Transcribe 将语音转写提升到了一个新高度,但它的意义远不止于更快的听写。
发生了什么
据 The Decoder 报道,Google 发布了 Gemini 3.5 Transcribe,这是其语音识别模型的重大升级。该模型支持 85 种以上语言的实时转写,并具备两项独特的后处理能力:自动去除语气词(如“嗯”“啊”)和纠正口误。在流式模式下,其词错率(WER)为 4.0%,延迟比前代 Chirp 3 降低了 70%。此外,通过函数调用,该模型可以将任务无缝转交给其他 Gemini 模型处理。
为什么重要
语音识别早已是成熟技术,但 Gemini 3.5 Transcribe 的突破点在于“理解”而非“转录”。自动纠错和去除语气词意味着模型不再只是声音到文本的转换器,而是能理解语义并优化输出。这背后是端到端深度学习与大规模预训练的进步。更关键的是函数调用能力:语音转写不再是孤立任务,而是可以作为多模态 AI 工作流中的一环,例如将会议记录直接交给摘要模型或任务管理代理。这标志着语音交互从“工具”向“平台”演进。
影响与看点
对开发者而言,4.0% 的流式词错率和 70% 的延迟降低意味着实时应用(如字幕、会议转录)的体验将大幅提升。自动纠错功能可能改变语音助手的交互方式,用户无需刻意清晰发音。但值得关注的是,纠错功能是否会在非标准口音或专业术语上产生误判?函数调用能力打开了新的集成场景,但也会增加系统复杂性和成本。独立判断:Gemini 3.5 Transcribe 的真正价值不在于转写本身,而在于它作为语音交互入口的生态潜力。未来,语音转写将不再是终点,而是 AI 工作流的起点。



