跳到正文
北京时间
原文
Qwen· @Alibaba_Qwen · X·· 2026-07-23精选AI 评分79
AI 导读

阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。

推荐理由

TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。

正文 · 原文

Introducing the Qwen-Audio-3.0-TTS.

Our latest text-to-speech model, in two flavors:
• Flash: real-time interaction
• Plus: high-quality generation

What's new:
• Fine-grained inline tags-steer [whisper], [angry], [breaths] & [laughs]
• Free-style natural-language control-“read this slowly, like a bedtime story”
• 16 languages
• Clean output even from noisy reference audio
• One-pass long-form up to 3 min

now #1 on the Artificial Analysis TTS Leaderboard.

Blog: https://funaudiollm.github.io/qwen-audio-3.0-tts/
API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide

来源:Qwen · x.com