7月20日,阿里巴巴旗下的通义千问团队正式发布全新语音合成大模型Qwen-Audio-3.0-TTS。该模型提供两个版本:针对实时交互优化的Flash版,首包延迟仅需300毫秒;以及专注高品质音频输出的Plus版。
据官方介绍,新版模型在精细化情感控制、自由风格指令执行、多语言及方言兼容、复杂声学环境适应性等方面实现了显著提升,使合成语音不再只是简单的发声工具,而是拥有了更丰富的情感表达能力。在国际权威评测平台ArtificialAnalysis的评比中,Qwen-Audio-3.0-TTS-Plus以优异表现位列综合排名第一。
Qwen-Audio-3.0-TTS支持文本嵌入结构化标签,用户可以添加抽气、轻笑、愤怒等个性化标记,精确控制语音的情感、语调和呼吸细节,从而实现更细腻的语音表现。
该模型还配备了即用型优质音色库,将多语言、方言、指令控制等核心功能转化为可直接调用的音色资源。未来将逐步增加风格指令、20种方言、细粒度控制以及14种以上小语种音色。同时,音频输出规格已从24KHz升级至48KHz,达到录音棚和影视配音级别的音质,单次可支持最长3分钟的连续语音合成。
在多语言适配方面,Qwen-Audio-3.0-TTS-Plus经过专门优化,共支持中、英、日、韩、德等16种语言,新增了阿拉伯语、越南语、马来语、菲律宾语等。方言覆盖范围广泛,包括广东、重庆、东北、陕西、上海、四川、云南等20种主流方言。





