Google 正在用新的 Gemini 3.5 模型升级其音频转录功能,让 AI 不仅能听懂你在说什么,还能忽略那些“嗯”和“啊”。
发生了什么
据 The Verge 报道,Google 更新了 Gemini Audio,并引入三款新模型:Gemini 3.5 Live、3.5 Live Experimental 和 3.5 Transcribe。这些模型旨在提升语音控制 AI 的精度,尤其针对嘈杂环境或口齿不清的场景。新能力包括自动识别专业术语,并支持超过 85 种语言。最直观的变化是,转录结果会自动去除“um”和“ah”等语气词,让文字记录更干净、更可读。
为什么重要
语音交互一直是 AI 落地的关键场景,但转录质量长期受限于背景噪音、口音和口语习惯。Google 这次更新并非简单调参,而是用新一代模型从底层优化识别逻辑。去除语气词看似小事,实则反映模型对语音内容的理解已从“逐字转写”升级为“语义过滤”——这背后是对上下文和语言结构的更深层建模。同时,支持 85 种以上语言意味着 Gemini 的语音能力正在向全球化扩展,这对非英语用户尤其有意义。
影响与看点
对开发者而言,Gemini 3.5 Transcribe 可能成为构建语音应用的新底座,尤其是需要处理专业术语的领域(如医疗、法律)。对普通用户,这意味着更流畅的语音助手体验,但也要注意:过度清理可能丢失语气中的情绪信息,未来是否提供“保留语气词”的选项值得关注。此外,Google 强调“背景噪音”下的表现,这暗示其模型在信号分离上有所突破,但具体效果仍需实测。我的判断是,这次更新是 Google 在语音 AI 上的一次重要补强,但真正的竞争焦点将转向“语义理解”而非单纯的“字词识别”。



