EchoraEchora
モデル一覧に戻る

IndexTTS2:口の動きに合わせられる初のTTSモデル

2026年8月28日
•
約7分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

多くのTTSモデルで動画を吹き替えると、いずれ同じ壁にぶつかります。生成されたセリフが0.5秒長くなり、音声が画面上のキャラクターの口の動きとずれてしまうのです。音声tokenを1つずつ生成し、最も自然に聞こえる傾向がある自己回帰型TTSモデルは、生成する長さを事前に固定できないため、歴史的にこの問題が最も顕著でした。BilibiliのIndexチームが開発したIndexTTS2は、この特定の問題を解決するために作られた初の自己回帰型TTSモデルです。生成されるセリフの実際の長さをミリ秒単位で正確に制御できます。

IndexTTS2の新機能

IndexTTS 2はBilibiliによる初代IndexTTSの後継です。段階的な更新というより、プロフェッショナルな吹き替えとコンテンツローカライゼーションのワークフローを正面から狙った再構築になっています。初代モデルは、感情表現の幅が限られていることと指示による生成に対応しないことを未解決の課題として明示していました。IndexTTS2はその両方に直接取り組み、さらに初代にはまったくなかった機能、すなわち生成されるセリフの長さを正確に制御する機能を追加しています。

中国語、英語、日本語にまたがる約55,000時間の多言語音声データでトレーニングされたIndexTTS2は、既存のzero-shot TTSシステムと比べ、単語誤り率、話者類似度、感情の忠実度という3つの指標すべてで同時に最先端の結果を達成したと著者らは説明しています。他のモデルでは、これら3つの指標は互いを犠牲にして改善されることが少なくありません。

正確な長さ制御:最大の特徴

これはIndexTTS2の中核となる貢献であり、自己回帰型TTSの構造的な制約を直接対象にしています。この種のモデルは固定された目標長なしに音声をtoken単位で生成するため、特定の長さに合わせること、たとえば吹き替えたセリフを既存の動画クリップに収めるため正確に3.2秒にすることには、従来、試行錯誤や再生成、あるいは音質を劣化させる後処理でのタイムストレッチが必要でした。

IndexTTS2は、2つの異なる生成モードを持つ長さ適応方式を導入しています。

  • 指定長モード。 生成するtoken数を明示的に設定して、正確な目標長に到達させます。セリフを厳密な時間枠内に収め、口の動きやシーンのタイミングに合わせる必要がある映像吹き替え向けのモードです。
  • 自由長モード。 token数の制約を設けずモデルに自然に生成させながら、入力promptの韻律的な特徴を忠実に再現します。正確な長さに合わせることよりも自然なペースが重要な場合に適しています。

特筆すべきことに、著者らはこれをIndexTTS2だけの限定的な仕掛けではなく、IndexTTS2以外の自己回帰型TTSアーキテクチャにも適用できる汎用的な手法として設計しています。

感情と音色の分離

2つ目の大きな追加機能は、声が「誰のように聞こえるか」と「どのような感情に聞こえるか」を切り離すことです。多くのクローンモデルでは、指定する参照クリップが話者のアイデンティティと、暗黙のうちにその感情的なトーンの両方を決めます。落ち着いた話者の声をクローンして、怒ったセリフを説得力のある形で話させることは簡単ではありません。IndexTTS2はこの2つの次元を分離し、まったく異なる2つの参照クリップを使う場合も含め、音色のソースと感情のソースを個別に指定できるようにします。

感情入力は4つの異なる方法に対応します。参照音声のみ、異なる対象テキストと組み合わせた別の感情音声prompt、平易な言葉による感情の説明(例:「不安げで慌てているように」)、または感情ベクトルの直接指定です。自然言語による説明の経路では、soft instruction layerとして機能するファインチューニング済みQwen3モデルを使用します。これは、ユーザーがベクトルベースのパラメータを理解しなくても感情を制御できるよう、そのハードルを下げる目的で特別に設計されています。強い感情によって明瞭度が低下するという一般的な問題を避け、激しい感情表現でも音声を明瞭に保つため、モデルは感情的な負荷のもとで安定性を維持することを目的としたGPT潜在表現を組み込んでいます。

IndexTTS2の始め方

  1. リポジトリをクローンします。 git clone https://github.com/index-tts/index-tts.gitを実行し、続行する前にgitとgit-lfsの両方がシステムにインストールされていることを確認します。
  2. uvで依存関係をインストールします。 プロジェクトは、pip/condaを手動でセットアップするよりもuvパッケージマネージャーを推奨しています。uv sync --all-extrasで依存関係一式を取得できます。
  3. IndexTTS2のcheckpointをダウンロードします。 hf download IndexTeam/IndexTTS-2 --local-dir=checkpointsで、このモデルの重みを取得します。IndexTTS-1.5のcheckpointディレクトリは再利用しないでください。両者に互換性はありません。
  4. v2推論クラスを使います。 Pythonでは、初代のinferモジュールではなくindextts.infer_v2からimportし、話者音声promptと対象テキストを指定して.infer()を呼び出し、基本的なクリップを生成します。
  5. 吹き替え作業向けに長さまたは感情の制御を加えます。 基本的な生成が動作したら、推論呼び出しに目標の長さまたは感情音声promptを追加します。IndexTTS2の吹き替えに特化した利点が実際に現れるのは、デフォルトの単発生成ではなく、この段階です。

IndexTTS2を最大限に活用するためのヒント

  • 映像上の時間制約があるものには指定長モードを使います。 自由長モードは単独のナレーションには適していますが、吹き替え、再吹き替え、ローカライズ広告など、音声を既存の動画に同期するプロジェクトでは、後処理でタイミングを直すのではなく、最初から明示的なtoken数モードを使うべきです。
  • 音色と感情のソースを意図的に分けます。 特定の人物のクローン音声に、参照クリップには自然に含まれていない感情的なトーンでセリフを話させる必要があるなら、平坦な1つの参照クリップから感情を無理に引き出そうとするのではなく、別の感情音声promptを指定します。
  • オーディオエンジニアでなければ、まずテキスト説明による感情入力を試します。 Qwen3を利用した自然言語指示の経路は感情ベクトルより使いやすいように作られています。数値パラメータを手動調整する必要があると考える前に、まずはこちらから始めてください。
  • 強い感情を生成するときは明瞭さを確認します。 IndexTTS2のGPT潜在表現は、強い感情表現でも明瞭度を保つよう設計されていますが、あらゆる感情と言語の組み合わせで均一だと決めつけず、実際のコンテンツで明瞭さを抜き取り確認する価値があります。
  • 商用吹き替え作業の前にライセンス条項を確認します。 初代IndexTTSと同様に、モデルの重みにはBilibiliのモデル使用ライセンスが適用され、商用利用には許可が必要です。これを使った有料のローカライゼーションまたは吹き替え製品を公開する前に、自分のプロジェクトが許可の対象になるか確認してください。

IndexTTS2とIndexTTS(初代)の比較

IndexTTS2IndexTTS(1.0 / 1.5)
長さ制御ミリ秒単位で正確(2モード)非対応
感情制御音色から分離、4つの入力方法限定的、弱点として明記
指示による生成対応、自然言語の説明を使用非対応
トレーニングデータ約55,000時間、中国語/英語/日本語約10,000時間以上、中国語/英語
最適な用途動画吹き替え、ローカライゼーション、感情的なナレーション一般的なzero-shotクローン、中国語の発音精度
リリース2025年9月2025年3月(1.0)/ 2025年5月(1.5)

プロジェクトが厳密なタイミング要件のない汎用的な音声クローンなら、初代IndexTTSは今も高性能でよりシンプルな選択肢です。セリフを特定の時間枠内に収める必要がある動画コンテンツの吹き替えや、参照クリップにはなかった感情をクローン音声に説得力のある形で表現させる必要がある場合、IndexTTS2はまさにその作業向けに作られたバージョンです。

よくある質問

IndexTTS2の「長さ制御」とは、実際にはどういう意味ですか?

生成されるセリフで使用するtoken数、したがっておおよその時間を正確に指定できるという意味です。モデルが自然に生成した長さで再生するのではなく、既存の動画のタイミングにセリフを合わせる必要がある吹き替え作業には欠かせません。

IndexTTS2はクローン音声に参照クリップとは異なる感情を持たせられますか?

はい。これが感情と音色の分離機能です。音色の参照とは独立した感情のソース(音声、テキスト説明、感情ベクトル)を指定できるので、落ち着いた参照音声でも不安げな、または興奮したセリフを話せます。

IndexTTS2と「IndexTTS 2」は同じものですか?

はい、同じモデルを指します。IndexTTS2(IndexTTS 2と表記される場合もあります)はBilibiliの第2世代リリースで、初代IndexTTS(1.0/1.5)とは異なります。

IndexTTS2はどの言語に対応していますか?

トレーニングデータは、約55,000時間の多言語音声からなる中国語、英語、日本語を対象としています。

IndexTTS2は無料で商用利用できますか?

コードはオープンソースですが、モデルの重みには商用利用前の許可を求めるBilibiliのモデル使用ライセンス契約が適用されます。有料製品に導入する前に、現在のライセンス条項を確認してください。

Echoraでテキストを音声に変換

テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。

テキストから音声を生成 →