Qwen-Audio-3.0-TTS 发布
通义实验室宣布正式发布 Qwen-Audio-3.0-TTS 实时语音合成模型。本次更新主要集中在:更广的语言覆盖、更自然的指令控制、更精细的标签控制,以及在参考音频不清晰时的鲁棒性。 本次发布包含两个版本: Flash:面向实时交互,首包延迟在 300ms 左右。 Plus:面向高质量生成,在自然度和音色还原度上表现更佳。 Qwen-Audio-3.0-TTS 能力总览: 目前,Qwen-Audio-3.0-TTS 已全面开放;并在全球第三方权威榜单 Artificial Analysis 中斩获冠军。
