AI 视频数字人正在跨过一条此前难以逾越的线:让人在短时间内分辨不出对面是不是真人。

发生了什么

Tavus 发布了名为 Griffin 的新系统,公司将其称为首个“人类交互模型”(Human Interaction Model)。与以往偏重“生成一段视频”的数字人不同,Griffin 主打实时视频通话:在对话过程中同步处理面部表情、语气和手势,让交互更接近真人交流的节奏。

Tavus 公布的一项内部研究给出了一个醒目的对比:在一分钟通话后,48% 的受试者认为 Griffin 是真人;而据该公司说法,此前的系统在这一指标上最高只有 2%。从 2% 到 48%,是数量级上的变化,也是这次发布最值得注意的地方。

需要说明的是,这组数据来自 Tavus 自己的研究,受试规模、测试条件和判定方式均未在摘要中披露,因此应视为厂商自述的初步结果,而非独立验证的结论。

为什么重要

过去几年,AI 数字人产品的评价标准大多停留在“像不像”:口型是否对得上、表情是否自然、延迟是否可接受。但这些指标衡量的是生成质量,而不是交互质量。一个数字人可以在短视频里以假乱真,却很难在实时对话中维持住“真人感”——因为实时对话要求系统同时理解对方的语气、表情和停顿,并即时给出匹配的回应。

Griffin 的定位正是把重心从“生成”转向“交互”。它把表情、语音和手势放进同一个实时回路里处理,这更接近多模态模型的思路,而不是传统的视频合成管线。如果这条路走通,数字人就不再只是营销素材的生产工具,而可能成为可以“坐下来谈”的交互界面。

48% 这个数字之所以关键,是因为它触及了图灵测试式的门槛:当接近一半的人在短暂接触后无法分辨,说明“可被识别的破绽”已经被压缩到相当小的窗口内。

影响与看点

对行业而言,最直接的影响是应用场景的迁移。实时视频数字人一旦足够可信,客服、销售、在线教育、远程面试等需要“人对人”信任感的环节都会成为候选场景,而这些场景此前对预录式数字人普遍持保留态度。

对开发者来说,值得关注的是接口形态:如果 Griffin 以实时 API 的形式提供,那么它竞争的就不只是视频生成模型,而是实时音视频交互栈——延迟、并发、成本都会成为关键指标,而这些恰恰是厂商通稿里最容易含糊的部分。

对普通用户而言,真正的问题不是技术有多像,而是当它足够像时,我们靠什么确认对面是人。48% 这个数字的另一面,是身份验证与内容披露机制需要同步跟上。

一个独立的判断:这次发布的意义不在于“AI 更像人”,而在于实时交互这条赛道的评价标准正在被重新定义。接下来真正需要第三方验证的,不是它能不能骗过一分钟,而是它能否在十分钟、半小时的对话里维持住可信度——短时欺骗和持续交互,难度完全不在一个量级。