Alibaba Cloud の Qwen チームが、音声生成モデル「Qwen3-TTS」ファミリーをオープンソース化した。1.7B と 0.6B の 2 サイズがあり、音声クローン、音声デザイン、テキストからの音声生成などに対応する。
日本語を含む 10 言語に対応し、12Hz マルチコードブック音声エンコーダで圧縮と復元を行う。Dual-Track モデリングにより、最初の文字処理後すぐに音声パケットを出すストリーミング生成ができる。GitHub および Hugging Face で公開されている。
Hugging FaceにQwen3-TTS Demoが公開されている。