谷歌 DeepMind 把 Gemini 的实时能力又往前推了一步:Gemini 3.8 Live 正式引入 Live Avatar,让模型不再只是“能听会说”的语音接口,而是拥有一个可实时驱动的虚拟形象。

发生了什么

根据 Google DeepMind 公布的信息,Gemini 3.8 Live 是在原有 Live 实时交互能力基础上的新版本,核心新增点是 Live Avatar。它把实时语音对话与视觉化形象结合起来,使模型在交互时能够以虚拟形象的形式出现,而不再局限于纯语音或纯文本的回应方式。官方目前披露的信息集中在能力发布层面,具体的技术细节、可用范围和接入方式仍以官方说明为准。

为什么重要

过去一年,实时多模态模型的竞争焦点集中在“延迟”和“自然度”:谁能更快地听懂、更流畅地接话,谁就更接近真人对话体验。但语音助手式的交互始终缺一块——存在感。用户面对的是一个没有面孔的声音,难以建立持续的关系感。

Live Avatar 补上的正是这块。它把实时对话从“功能”变成“在场”:模型有了可被看见的形象,交互从信息交换转向拟人化的陪伴与协作。这对谷歌的意义在于,Gemini 的实时能力开始从底层模型能力,向产品化的交互形态延伸。数字人并非新概念,但把它嵌进一个通用实时大模型的对话循环里,和过去独立的虚拟主播、客服 Avatar 是两条路线——前者是模型能力的一部分,后者是外挂的应用层。

影响与看点

对开发者而言,最值得关注的是接入形态:Live Avatar 是作为 API 能力开放,还是绑定在特定产品中?这决定了它是能被二次开发的基础设施,还是又一个封闭的演示。如果可编程,教育、客服、陪伴类应用会最先受益,因为它们对“有形象的实时对话”需求最直接。

对用户而言,体验的分水岭在于自然度:口型、表情、打断后的反应是否跟得上实时语音的节奏。数字人最容易翻车的地方不是长相,而是“接不住话”带来的割裂感。

对行业而言,这条路线会加剧一个正在成型的判断:实时多模态的终局不是语音助手,而是可交互的代理形象。Meta、OpenAI 以及一批数字人创业公司都在往这个方向靠,谷歌这次是把 Avatar 直接做进了模型层。

一个克制的判断:Live Avatar 的价值不取决于形象多逼真,而取决于它是否真的降低了实时交互的摩擦。如果用户发现自己更愿意和它多聊几句,这项能力才算真正成立。