EchoraEchora
モデル一覧に戻る

VibeVoice:一文ではなく、ポッドキャスト一本のために設計されたモデル

2026年9月7日
•
約7分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

ほとんどの TTS モデルは、1回の発話を単位に設計されています。この声でこの一文を生成したら、そこで終了です。一方、Microsoft のオープンソース音声フレームワーク VibeVoice は、まったく異なるコンテンツ単位、つまりエピソード一本を基準に設計されました。最大4人の異なる話者がそれぞれの声の一貫性と自然なターンテイキングを最後まで保ちながら、最長90分の連続したマルチスピーカー会話音声を一度に生成します。これは、一文のために作られたモデルと、ポッドキャストのために作られたモデルの違いです。

VibeVoice とは?

VibeVoice は、Microsoft が公開した MIT ライセンスのオープンソースフレームワークで、表現力豊かな長時間のマルチスピーカー会話音声を生成します。ポッドキャスト、オーディオドラマ、インタビューを明確な対象として設計されています。2つのサイズで公開されており、VibeVoice-1.5B は Qwen2.5-1.5B 言語モデルを基盤とし、VibeVoice-Large はより大きな Qwen2.5-7B を基盤として、相応に大きな計算コストと引き換えに高い忠実度を実現します。どちらもプロジェクトの GitHub コードとともに公開ホスティングされています(microsoft/VibeVoice-1.5B および Large バリアント)。

VibeVoice の機能面の強み

  • 90分の連続生成。 1回で最長90分の一貫した音声を生成し、その間ずっと話者の一貫性と物語のまとまりを維持できます。多くの TTS モデルが対象とする短いクリップの範囲をはるかに超えています。
  • 最大4人の異なる話者を自然に扱える。 マルチスピーカー対話は、別々に生成した単一音声をつなぎ合わせる回避策ではなく、中核機能です。長時間のセッション全体を通じて、発話の交替と話者の人物性が一貫します。
  • 極めて効率的な音声圧縮。 7.5Hz のトークン化レートにより、忠実度を保ちながら生音声を約3,200分の1にダウンサンプリングします。これによって初めて、90分の音声生成が計算上現実的になります。
  • 創発的な言語間転移と歌唱。 どちらも専用の学習は行われていませんが、創発的な振る舞いとして現れます。声のアクセントを別の言語へ引き継いだり、歌唱を試みたりできますが、どちらも品質にはばらつきがあります。
  • 責任ある AI の保護策を標準で内蔵。 すべての出力に、聞き取れる免責告知と知覚できないウォーターマークの両方が含まれます。任意で有効にする設定ではなく、自動的に適用されます。
  • 量子化版を含む複数の規模で利用可能。 基本の 1.5B および Large チェックポイントに加えて、コミュニティ製の 4-bit および 8-bit 量子化版により、制約のあるハードウェアで必要な VRAM を大幅に削減できます。
  • 逆方向の処理を担う関連モデル。 VibeVoice-ASR は同じファミリーを音声認識へ広げているため、このプロジェクトは生成だけに限定されません。

内部の仕組み

VibeVoice のパイプラインは、連携する3つの要素に分かれます。非常に低い 7.5Hz のフレームレートで動作する連続音響・意味トークナイザーは、生音声を、計算コストを爆発的に増やすことなく真に長いシーケンスを処理できるほど効率的な表現へ圧縮します。次に、事前学習済み Qwen2.5 言語モデル(使用するチェックポイントに応じて 1.5B または 7B)が、対話そのものの意味、流れ、話者のターン構造をモデル化し、何を誰が話すべきかを条件付けます。軽量な4層の拡散ヘッドと VAE デコーダーの組み合わせが、LLM の構造化した内容に高忠実度の音響的ディテールを補い、推論時には classifier-free guidance を使って、出力を参照音声の声色にどの程度近づけるかを制御します(一般に推奨される cfg_scale は 1.3 前後です)。

学習は意図的に段階化されています。トークナイザー自体は凍結し、実際に学習するのは LLM と拡散ヘッドだけです。短いシーケンスから始めて徐々に 65,000 トークンまで伸ばすカリキュラム学習を採用しています。これにより、極めて長い生成でも途中で流れがずれたり話者の一貫性を失ったりせず、モデルが全体を首尾一貫して維持できます。

VibeVoice-ASR:このファミリーで「聞く」役割を担うモデル

2026年1月に公開された VibeVoice-ASR は、同じファミリーを反対方向へ拡張した、テキスト読み上げではなく統合型の音声認識モデルです。最長60分の長時間音声を一度に処理し、誰が話したか(話者ダイアライゼーション)、いつ話したか(正確なタイムスタンプ)、何を話したかを記録した構造化文字起こしを生成します。ユーザーがカスタマイズしたコンテキストや、分野固有のホットワードにも対応します。その後、Hugging Face Transformers ライブラリと Microsoft の Azure AI Foundry Labs に直接統合され、専用の推論環境を構築せずに導入しやすくなりました。

エッジへの導入に特化した VibeVoice-ASR-BitNet は、異種量子化(音声エンコーダーに I8_S、言語モデルに I2_S)によってモデルを 4.62GB から 1.58GB へ圧縮し、Qwen2.5-7B 基盤を軽量な Qwen2.5-1.5B に置き換えながら、単語誤り率の絶対値増加をわずか 1~4% に抑えています。ggml フレームワーク内のカスタム SIMD カーネルと演算子融合を基盤とする専用の VibeASR.cpp ランタイムと組み合わせることで、GPU を使わず、わずか3つの CPU スレッドでリアルタイム文字起こし(RTF 1 未満)を実現し、同等のモデルサイズの Whisper.cpp より 1.6~2.3 倍高速に動作します。

より良い結果を得るためのヒント

  • モデルが実際に求める形式で台本を書く。 構造のない段落ではなく、プレーンな文字起こしの中で、ラベル付きの発話ターン(Speaker 1: ... Speaker 2: ...)として入力を構成してください。これにより VibeVoice は発話順を正しく割り当て、話者ごとの一貫性を維持できます。
  • Large が必要だと決めつける前に、1.5B モデルから始める。 計算量と VRAM 要件が大幅に増えるため、7B チェックポイントを選ぶ前に、小さいモデルでもコンテンツに十分対応できないか確認してください。
  • 制約のあるハードウェアでは、その場で量子化せず事前量子化済みチェックポイントを使う。 事前量子化済みの 4-bit または 8-bit モデルは読み込みが速く、実行のたびに行う量子化のオーバーヘッドも避けられます。
  • 創発的な歌唱や言語間出力を本番コンテンツで頼りにしない。 どちらも専用の学習や最適化を受けていないため、成功した結果は信頼できる機能ではなく追加の成果と考えてください。特にこれらの効果を狙う場合は、繰り返しサンプリングする余裕も見込む必要があります。
  • 用途に応じて、聞き取れる免責告知とウォーターマークを考慮する。 どちらもすべての出力へ自動的に埋め込まれるため、AI 生成音声の開示に関する製品ドキュメントでは、この点を考慮してください。

VibeVoice と他のマルチスピーカー・長時間モデルの比較

VibeVoiceCosyVoice3一般的な単一話者 TTS
セッションあたりの最大話者数4クリップ単位のゼロショットであり、セッション単位ではない1
最大連続時間約90分専用の重点項目ではない短いクリップ
中核アーキテクチャQwen2.5 LLM + 拡散ヘッド + 7.5Hz トークナイザー教師あり意味トークン + flow matchingさまざま
関連 ASR モデルあり(VibeVoice-ASR)なしなし
量子化版あり(コミュニティ製 4-bit/8-bit + ASR 用公式 BitNet)なしさまざま
ライセンスMITオープン、ホスト型 API ありさまざま

VibeVoice の具体的な強みは、一文ごとの表現力ではなく、出力の規模にあります。プロジェクトで一行の台詞だけを生成するなら、このサイトにある他のモデルの多くで十分です。複数のホストが参加するポッドキャストのエピソード全体を生成するなら、VibeVoice はまさにそのコンテンツ単位のために設計されています。

よくある質問

VibeVoice-1.5B と VibeVoice-Large の違いは何ですか?

1.5B は Qwen2.5-1.5B を基盤とする、より軽量で高速な選択肢です。Large は Qwen2.5-7B を使用し、計算量と VRAM のコストが増える代わりに高い忠実度を実現します。

VibeVoice は実際にどのくらい長い音声クリップを生成できますか?

話者の声を全体で一貫して保ちながら、最長90分の連続した一貫性のある音声を一度に生成できます。

VibeVoice-ASR とは何ですか? VibeVoice TTS と同じものですか?

いいえ。VibeVoice-ASR は同じファミリーに属する別の関連モデルで、テキスト読み上げではなく音声認識を行います。話者ダイアライゼーションとタイムスタンプを含め、最長60分の音声を処理できます。

VibeVoice-Large はコンシューマー向け GPU で実行できますか?

量子化すれば可能です。事前量子化済みの 4-bit チェックポイントにより、VRAM 要件は約 10GB まで下がりますが、完全精度と比べると生成速度は低下します。

VibeVoice は商用でも無料で使えますか?

はい。オープンソース TTS モデルの中でも比較的制約の少ない MIT ライセンスで公開されています。

複数話者の台本を会話音声に変換

複数話者の完成した台本がある場合は、Echoraのテキストから会話音声を利用できます。合計5,000文字まで、最大12個の会話ブロックを追加し、各ブロックに音声を割り当て、対応している話し方タグ、安定性、話者強調を調整できます。完成した会話はプレビューしてダウンロードできます。

会話音声を生成 →