阿里通义千问团队一次性放出五款音频模型,同时把价格打到原来的零头。
发生了什么
Qwen 团队发布了 Qwen-Audio-3.1 系列,包含五款模型,覆盖语音识别(ASR)、文本转语音(TTS)和实时交互三类任务。
其中,ASR 模型重点提升了多语言与方言识别能力,并能自动清理口语中的填充词和重复表达。ASR-Next 进一步支持多说话人识别,可输出带时间戳的转写结果,同时检测情绪、环境音和机器噪声。TTS 模型则负责语音合成。与模型发布同步,阿里将 AI 音频相关服务的价格下调,最高降幅达 95%。
为什么重要
语音交互正在从“能用”走向“好用”,而过去一年,这个赛道的竞争焦点集中在两件事:识别准不准、合成像不像。Qwen-Audio-3.1 的升级方向,恰好对应了真实场景中的几个硬骨头——方言、多人对话、噪声环境,以及口语转写时的“净化”需求。
自动清理填充词和重复,看似是小功能,却直接影响会议记录、字幕生成、客服质检等场景的可用性。多说话人识别加时间戳,则让转写结果可以直接用于结构化分析。情绪与环境音检测,为后续的智能摘要、风险预警提供了信号。
更值得关注的是价格。95% 的降幅不是常规促销,而是把音频 AI 的调用成本压到了接近“基础设施”的水平。当语音识别和合成的边际成本足够低,开发者才愿意把它嵌入到更多长尾场景里,比如实时翻译、无障碍工具、教育陪练。
影响与看点
对开发者而言,这次发布降低了构建语音应用的门槛。多语言和方言能力意味着可以覆盖更广的用户群,而价格下探让高频调用不再是一道成本红线。ASR-Next 的情绪与噪声检测,则打开了新的产品思路——比如自动标记通话中的情绪波动,或过滤背景机器噪声。
对行业来说,阿里此举进一步加剧了音频 AI 的价格竞争。当头部厂商主动把价格压到极低,中小玩家的生存空间会被压缩,但整个市场的采用速度会加快。
一个值得关注的判断是:音频模型的竞争正在从“单点能力”转向“全链路体验”。识别、合成、实时交互打包发布,说明厂商希望开发者在一个体系内完成所有语音功能,而不是拼凑多家服务。这种整合趋势,可能会重塑语音技术栈的选择逻辑。
接下来要看的是,这些能力在中文方言、嘈杂环境下的实际表现,以及降价后服务质量的稳定性。毕竟,价格可以一夜之间降下来,但体验的差距需要时间才能抹平。



