OpenAI正在升级ChatGPT的语音模式,新模型旨在让AI更像“与另一个人交谈”。
发生了什么
OpenAI对ChatGPT的语音模式进行了重大升级,推出了名为GPT-Live-1的新模型。该模型的核心改进在于减少打断行为——当用户说话时,AI会更少地插话;如果用户中途停顿,AI会等待用户继续,而不是立即接话。在媒体简报会上,OpenAI研究员负责人Kundan Kumar称GPT-Live-1是公司“迄今为止最自然的语音模型”。
为什么重要
此前,ChatGPT的语音模式常被用户诟病为“过于急切”,频繁打断用户发言,破坏了对话的流畅感。这种问题在实时语音交互中尤为突出,因为人类对话中自然的停顿、犹豫和思考节奏被AI忽略。GPT-Live-1的调整意味着OpenAI开始重视对话中的“沉默”价值——停顿不再被视为发言结束的信号,而是思考或继续的间隙。这背后是模型对对话状态和用户意图的更精细建模,可能涉及更复杂的上下文跟踪和等待策略。
影响与看点
对于普通用户,GPT-Live-1将带来更接近真人对话的体验,减少因AI抢话而产生的挫败感。对于开发者,这一改进可能通过API或模型更新影响第三方语音应用,促使更多产品优化对话节奏。值得关注的是,OpenAI如何在“减少打断”和“保持响应及时性”之间取得平衡——过度等待可能导致对话拖沓。此外,这一升级是否仅针对英语,还是支持多语言,尚待明确。从行业趋势看,语音交互正从“问答式”向“对话式”演进,GPT-Live-1是重要一步。



