
OpenAI 发布 GPT-Live-1 API:语音模型从“轮流说”走向“同时听”
OpenAI 推出全双工语音模型 GPT-Live-1 的开发者 API,交互性测试得分从上一代的 45.4% 提升至 80.1%,定价为每分钟 0.05 美元。
语音合成、识别与音乐生成

OpenAI 推出全双工语音模型 GPT-Live-1 的开发者 API,交互性测试得分从上一代的 45.4% 提升至 80.1%,定价为每分钟 0.05 美元。

印度音频平台 Pocket FM 借助 AI 将内容生产成本降低约 80 倍,营收运行率翻倍至 5 亿美元,AI 已驱动其 93% 的音频内容生产。

环球音乐与ElevenLabs达成多年授权合作,将推出AI音乐平台,让用户基于其正版曲库生成混音、串烧与改编版本。这是唱片巨头从诉讼转向授权变现的关键一步。

OpenAI 将 GPT-Live-1 开放至 API,带来自然全双工语音对话、更强的指令遵循、自定义音色与电话线路支持,语音应用的开发门槛被进一步拉低。


Suno推出新一代AI音乐模型v6,与三大唱片公司合作,支持文本指令局部修改和多模态生成,同时关闭所有旧模型。

面对多起版权诉讼,Suno 发布新模型 v6,宣称不再使用此前版本训练所用的未授权音乐数据,转向授权内容训练。

Google 发布 Lyria 3.5 音乐生成模型,集成至 Gemini 应用及 API,强调仅使用授权内容训练,提供更富表现力的歌声与编排。

Meta的Superintelligence Labs推出Muse Voice Transcribe,以80毫秒分块处理语音,支持说话人区分和句界检测,据称在流式转录中兼具最高准确率和最低价格。该模型被视为构建持续聆听的个性化AI代理的基础组件。

Roland 发布 Melody Flip,一款面向 DAW 的生成式 AI 音乐插件,提供约 250 个风格化“调色板”,标志着传统乐器厂商正式拥抱生成式 AI 音乐创作。

索尼等唱片公司起诉Anthropic,指控其员工在内部聊天中讨论盗版下载,并利用盗版内容训练AI音乐模型,引发对AI训练数据合法性的新一轮争议。
