
StemDeck:免费开源的本地AI分轨工具,音乐制作人的新选择
StemDeck是一款免费、开源、本地运行的AI分轨工具,可将音乐分离为人声、鼓、贝斯等独立音轨,无需上传数据,保护隐私。
语音合成、识别与音乐生成

StemDeck是一款免费、开源、本地运行的AI分轨工具,可将音乐分离为人声、鼓、贝斯等独立音轨,无需上传数据,保护隐私。

DJ 市场 Beatport 宣布立即生效,禁止完全或大部分由 AI 生成的音乐上架,成为首个明确抵制 AI 音乐的主流电子音乐平台。

Hugging Face 的 Open ASR Leaderboard 新增首个全球南方语言,标志着语音识别评测正从英语中心转向更广泛的语言覆盖,对技术公平性和模型实用性具有深远影响。

Google 推出 Gemini 3.5 Transcribe,支持 85 种语言,流式转写词错率 4.0%,延迟比前代低 70%,并可通过函数调用与其他模型协作。

Google DeepMind 推出 Gemini 3.5 Transcribe,将语音转写从单纯识别提升到理解层面,为会议记录、内容生成等场景带来新可能。

Google 更新 Gemini Audio,引入 Gemini 3.5 系列模型,提升转录精度,自动识别专业术语并去除语气词,支持 85 种以上语言。

Adobe 将三款 AI 音频工具(音乐生成、语音生成、音效生成)全面引入 Firefly 平台,同时新增 Google 的 Gemini Omni Flash 模型,进一步丰富其创意生成生态。

英国一诊所的AI接待系统因无法理解约克郡口音导致患者挂断电话,凸显语音识别在方言和口音上的脆弱性,以及医疗场景中AI应用的现实挑战。

Meta 发布 macOS 版 AI 助手应用,其语音听写功能由自研 Muse Spark 模型驱动,标志着 Meta 在端侧 AI 与多模态交互上的新尝试。

一项新观察显示,消费者在不知情时偏爱AI生成的音乐,但一旦被告知是AI创作,态度便发生转变。这揭示了AI内容在现实中的接受度与标注之间的微妙关系。

Suno推出Studio 2.0,为Premier订阅用户提供完整制作工具,支持通过聊天创建乐器和插件,并开放MIDI导入与32位导出,但无限导出与平台反垃圾下载限制形成矛盾。