阿里Qwen-Audio-3.0-TTS登顶全球榜单,AI语音合成进入细粒度“表演时代”
2026/07/20 17:05阅读量 2
阿里巴巴发布Qwen-Audio-3.0-TTS语音合成大模型,包含Flash(低延迟)和Plus(高质量)两个版本。Plus版本在Artificial Analysis语音合成榜单夺冠。新模型支持细粒度标签控制(如[gasp]标记)、16种语言和20种方言,语音克隆可抗噪声,输出48kHz音频,最长3分钟。已在阿里云百炼开放调用。
7月20日,阿里巴巴发布新一代语音合成大模型Qwen-Audio-3.0-TTS,包含两款版本:
- Flash版本:面向实时交互,首包延时在300毫秒级别。
- Plus版本:面向高质量生成,已在全球第三方权威榜单Artificial Analysis斩获冠军。
该模型在多个维度实现系统性提升:
细粒度标签控制:用户可直接在文本中嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等结构化标记,将情绪控制精度从整句细化到具体字词,适用于叙事、游戏、配音等需要精确细节的场景。
多语种与方言覆盖:支持中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语、菲律宾语。在CV3-Eval多语种基准测试中,词/字错误率评测方面,Qwen-Audio-3.0-TTS家族在10种语言上达到SOTA,其中韩语和马来语领先幅度最大;说话人相似度评测中,Plus版本在全部16种语言上取得最优,Flash版本取得15项第二。
方言方面,经过专门设计的强化训练,模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言。
复杂声学鲁棒性:语音克隆功能不再要求原始参考音频必须在安静环境录制。通过真实声学仿真训练,模型能在高噪声、高混响条件下过滤干扰,精准提取音色。
高品质输出:内置精品音色库,音频输出采样率从24kHz提升至48kHz,达到录音棚/影视配音规格;单次合成最长可达3分钟。
即日起,两款模型已在阿里云百炼平台开放调用。
