EchoraEchora
モデル一覧に戻る

Qwen3-TTS:0.1秒未満で応答を始める音声モデル

2026年8月29日
•
読了目安:7分

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

多くの音声クローンのデモでは、音声が始まるまで一拍待たされます。それだけの間があると、会話している感覚にはなかなかなりません。Alibaba の Qwen チームが開発したオープンソース音声モデル Qwen3-TTS は、この間を埋めるために作られました。デュアルトラック構成で音声をエンドツーエンドに生成し、最初の音声パケットまでの遅延は最短 97 ミリ秒。リアルタイム音声エージェントの後段に置いても、それ自体が目立つ遅延を加えないほど高速です。

Qwen3-TTS とは

Qwen3-TTS は、500万時間を超える音声データでトレーニングされたオープンソースのテキスト読み上げモデルです。Apache 2.0 ライセンスで公開され、Hugging Face と GitHub から重みを入手できます。中核となるのは独自の音声 tokenizer「Qwen3-TTS-Tokenizer-12Hz」と、独立した diffusion や vocoder の段階を経由せず、音声を直接生成するハイブリッドストリーミング構成です。この設計によって、低遅延と、長い入力テキストやノイズの多い入力に対する安定性を両立しています。

対応する主要言語は、中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語の10言語で、複数の中国語方言の音声プロファイルも用意されています。オープンウェイトは2サイズあり、最高品質を目指した 1.7B パラメータ版と、性能を大きく損なわずに限られたハードウェアで動かせる軽量な 0.6B 版から選べます。

音声を生成する3つの方法

Qwen3-TTS は1つの使い方に限定されません。手元に何があるかに応じて、3つの異なる方法で音声を生成できるよう設計されています。

3秒の音声から声をクローンする。 短い参照クリップと、それに正確に対応する文字起こしを渡すと、その話者の声で新しいテキストを読み上げます。現在のオープンソース音声クローンモデルの中でも、必要な参照音声が特に短いモデルの1つです。

テキストの説明から声を設計する。 録音が手元になくても問題ありません。年齢、性別、口調、性格を自然な言葉で説明すれば、Qwen3-TTS が説明に合う新しい声を生成します。音声の参照は一切必要ありません。特徴のあるキャラクターボイスが必要でも、素材を探したり、ライセンスを取得したり、先に録音したりしたくない場合に、本当に役立つ選択肢です。

用意済みのプリセットを選ぶ。 設定なしですぐに使える良質な声だけが必要なプロジェクトには、ホスト型 API で複数のキャラクター向けに用意された49種類のプリセット音声が提供されています。さまざまな年齢、性別、性格を持つ名前付きペルソナとして用意され、追加設定なしで即座に切り替えられます。

3つのモードすべてで、モデルは文脈をよく読み取ります。テキスト自体の意味に応じて、口調、テンポ、感情表現を調整し、乱雑な入力や書式が不完全な入力に対しても、同じファミリーの旧世代音声モデルより安定して動作します。

Qwen3-TTS の始め方

  1. セルフホストと API のどちらを使うか決める。 オープンウェイトをセルフホストすれば、すべてを制御でき、文字単位の料金もかかりません。GPU インフラを管理したくない場合は、高速・低遅延生成向けの qwen3-tts-flash や、自然言語による指示制御が必要なときの qwen3-tts-instruct-flash など、ホスト型 API の方がすぐに始められます。
  2. パッケージをインストールする。 pip install qwen-tts を実行すると、ローカルでモデルを読み込み、推論を動かすために必要な Qwen3TTSModel クラスを利用できます。
  3. ハードウェアに合うサイズの checkpoint を選ぶ。 Qwen/Qwen3-TTS-12Hz-1.7B-Base は完全な品質を備えたモデルで、約 6–8GB の VRAM が必要です。0.6B 版は 4–6GB で余裕を持って動き、サイズの差から想像するほど品質は下がりません。
  4. クローン音声を生成する。 generate_voice_clone() に、読み上げるテキスト、言語コード、参照音声ファイル、それに対応する文字起こしを渡します。
  5. 繰り返し生成する場合は参照 prompt をキャッシュする。 同じクローン音声から複数のクリップを作る場合、呼び出しのたびに計算し直さず、計算済みの prompt 特徴量を再利用してください。バッチ生成が目に見えて速くなります。
  6. 本番環境のスループット向上には vLLM を使う。 Qwen チームは公開当初から Qwen3-TTS の vLLM 対応を提供しています。小規模なテストを超える用途では、通常の PyTorch 推論ループより vLLM を使う価値があります。

セットアップせずに試す方法

公式の Hugging Face Space と ModelScope のデモでは、どちらもインストール不要で、ブラウザから音声クローンと音声設計を直接試せます。Alibaba Cloud は、Model Studio API でモデルを試す開発者向けに無料の文字数枠も提供してきました。Replicate や DeepInfra などのサードパーティープラットフォームもオープンウェイトモデルをホストしているため、ローカルインフラや有料 API プランに投資すると決める前に、少ない手間で品質を評価できます。

より良い結果を得るためのヒント

  • クローン用の参照文字起こしを完全に一致させる。 クローン品質は、参照テキストと音声で実際に話されている内容が一致するかどうかに大きく左右されます。文字起こしの不一致は、録音品質が多少低い場合よりも結果を大きく損ないます。
  • 実際の参照クリップがないときは音声設計を使う。 「十分近い」既存クリップを探すより、求める声を言葉で説明する方が必要な結果に近づけることが多く、実在する録音音声をめぐるライセンス上の疑問も回避できます。
  • ハードウェアに不安がある場合は 0.6B モデルから始める。 1.7B 版のおよそ半分のフットプリントでありながら、大半の用途で十分な品質を保ちます。追加の忠実度が明確に必要な場合にだけ、上位版へ移行してください。
  • リアルタイム用途では、ホスト型の低遅延モデルを使う。 バッチコンテンツ生成よりも音声エージェントに近いものを構築するなら、API の高速・低遅延オプションはまさにその用途向けに作られています。セルフホスト推論を自分で最適化する必要はありません。

Qwen3-TTS と他のオープンソース音声クローンモデルの比較

Qwen3-TTSCosyVoice3Chatterbox
開発元Alibaba(Qwen チーム)Alibaba(FunAudioLLM)Resemble AI
パラメータ数0.6B / 1.7B0.5B~0.5B
クローン用参照クリップ約3秒約3~10秒5~10秒
初回パケット遅延約97ms約150ms(ホスト型)主な最適化対象ではない
テキストからの音声設計対応非対応非対応
言語109 + 中国語方言18種英語(多言語版:23)
ライセンスApache 2.0オープン、ホスト型 API ありMIT

Qwen3-TTS ならではの強みは、本当に低い遅延と、クローン、テキストベースの音声設計、用意済みプリセットという3つの生成方法を、単一のオープンウェイトリリースで組み合わせた点です。同程度の規模を持つ単一用途のクローンモデルの大半よりも、幅広い機能を備えています。

よくある質問

Qwen-TTS と Qwen3-TTS は同じモデルですか?

厳密には異なります。Qwen-TTS は Alibaba の旧世代音声モデルで、公開された重みはなく、ホスト型 Qwen API からのみ利用できました。Qwen3-TTS はより新しい世代で、ダウンロード可能な重みと、さらに幅広い機能を備えたオープンソースモデルです。セルフホストやファインチューニングをしたい場合は、Qwen3-TTS を選びます。

qwen3-tts-flash とは何ですか?

Alibaba Cloud の API から利用できる、Qwen3-TTS のホスト・管理型バージョンの名称です。セルフホストなしで、高速かつ低遅延に生成できるよう調整されています。オープンウェイト版と同じ基盤モデルファミリーを、マネージドサービスとして実行します。

Qwen3-TTS は無料で使えますか?

オープンウェイトは Apache 2.0 ライセンスの下で無料でセルフホストできます。ホスト型 API では、新規開発者に無料の文字数枠が提供され、その超過分が有料になってきました。正確な上限は Alibaba Cloud の現在の料金を確認してください。

0.6B モデルと 1.7B モデルの実用上の違いは何ですか?

1.7B モデルは出力品質が高く、より多くの VRAM(約 6–8GB)が必要です。0.6B モデルは軽量(4–6GB)で、パラメータ数の差から想像するほど品質の低下は大きくありません。

何もインストールせずに Qwen3-TTS を試せますか?

はい。公式の Hugging Face Space と ModelScope のデモはどちらもブラウザで動作し、Replicate や DeepInfra などのホスティングプラットフォームでも、ローカル設定なしで API を利用できます。

参照音声から似た声の音声を生成

参照音声と新しいテキストから似た声を生成する同様のワークフローには、Echoraの音声クローンを利用できます。自分の声、または使用について明示的な許可を得た参照音声をアップロードし、最大5,000文字の新しいテキストを入力すると、参照音声に似た新しい音声を生成できます。

音声クローンを作成 →