
谷歌发布 Gemini 3.8 Live,语音对话价格压到 OpenAI 的三分之一
谷歌 DeepMind 推出 Gemini 3.8 Live 与 Live Extended Thinking 两款实时语音模型,登顶语音到语音榜单,并以每小时 1.38 美元的对话成本明显低于 OpenAI 的 GPT-Live-1。
文本转语音

谷歌 DeepMind 推出 Gemini 3.8 Live 与 Live Extended Thinking 两款实时语音模型,登顶语音到语音榜单,并以每小时 1.38 美元的对话成本明显低于 OpenAI 的 GPT-Live-1。

OpenAI 推出全双工语音模型 GPT-Live-1 的开发者 API,交互性测试得分从上一代的 45.4% 提升至 80.1%,定价为每分钟 0.05 美元。

印度音频平台 Pocket FM 借助 AI 将内容生产成本降低约 80 倍,营收运行率翻倍至 5 亿美元,AI 已驱动其 93% 的音频内容生产。

OpenAI 将 GPT-Live-1 开放至 API,带来自然全双工语音对话、更强的指令遵循、自定义音色与电话线路支持,语音应用的开发门槛被进一步拉低。

NVIDIA 发布 Magpie TTS,一款开放权重、可完全部署控制的低延迟多语言语音合成模型,为构建实时语音代理提供了新可能。

Smallest.ai 完成 1300 万美元融资,专注于构建超快速、拟人化的语音模型,目标是让 AI 电话通过图灵测试。

AI语音初创公司Fish Audio宣布获得5000万美元种子轮融资,其开源及托管模型已吸引超800万用户,年经常性收入达2100万美元。

阿里巴巴的Qwen Audio 3.0 TTS Plus在Artificial Analysis的Speech Arena排行榜中夺得第一,支持16种语言和自然语言风格控制,但生成速度仅每秒16字符,远慢于竞品。

Hugging Face 推出 Real World VoiceEQ 框架,旨在量化评估语音 AI 的自然度和人类感知质量,推动行业从技术指标转向用户体验导向的评测。

巴黎AI语音初创公司Gradium宣布完成1亿美元种子轮融资,英伟达参与投资,公司定位为ElevenLabs的竞争对手。

OpenAI 发布 GPT-Live 功能,采用全双工架构实现实时语音对话,复杂问题可后台调用 GPT-5.5 提升回答质量。付费用户即日可用,免费版有 mini 版本,API 即将开放。
