7月20日,阿里巴巴旗下通义千问正式发布新一代语音合成大模型Qwen-Audio-3.0-TTS。该模型提供两个版本选择:一个是针对实时互动场景优化的Flash版本,首包延迟时间仅为300毫秒;另一个是专注高品质音频输出的Plus版本。
据官方介绍,新版模型在情感表达细腻度、风格指令灵活度、多语言及方言支持能力、以及复杂声学环境适应性等方面均实现了显著提升,使合成语音不再只是简单的发声,而是能够传递丰富的情感色彩。在国际权威评测平台ArtificialAnalysis的测试中,Qwen-Audio-3.0-TTS-Plus以优异成绩位列综合排行榜首位。
Qwen-Audio-3.0-TTS引入了文本嵌入结构化标签功能,用户可以通过添加抽气、轻笑、愤怒等个性化标记,精确控制语音的情绪、语调和呼吸细节,从而实现高度精细化的语音表达效果。
此外,该模型还配备了即用型优质音色库,将多语言、方言、指令控制等核心功能转化为可直接调用的音色资源。后续还将陆续推出风格指令、20种方言、细粒度调控以及14种以上小语种音色。同时,音频输出规格从24KHz提升至48KHz,达到录音棚和影视配音的音质标准,单次可支持最长3分钟的连续语音合成。
在多语言适配方面,Qwen-Audio-3.0-TTS-Plus经过专门优化,共支持中文、英语、日语、韩语、德语等16种语言,并新增了阿拉伯语、越南语、马来语、菲律宾语等语种;方言覆盖范围广泛,包括广东话、重庆话、东北话、陕西话、上海话、四川话、云南话等20种主流方言。





