VALL-E:音声をテキストのように扱い始めたモデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
GPT モデルは連続信号を回帰して言語を理解するのではありません。シーケンス内の次のトークンを何度も予測し続けるだけであり、その単純な発想が驚くほどうまくスケールします。Microsoft が開発した VALL-E は、テキスト読み上げも同じように機能させたらどうなるかを問いかけました。音声を離散トークンに変換し、言語モデルに単語と同じように予測させるのです。この捉え直しにより、VALL-E は従来型の TTS システムではなくニューラルコーデック言語モデルと呼ばれています。また、VALL-E 2 や VALL-E X をはじめ、その後の世代の音声クローンモデルが直接受け継いだアーキテクチャの出発点でもあります。
VALL-E とは?
VALL-E は Microsoft が2023年1月の論文で発表したモデルです。その決定的な転換は、従来のニューラル TTS システムが依存していた連続信号の回帰ではなく、離散音声コードを対象とする条件付き言語モデリングのタスクとしてテキスト読み上げを扱ったことです。これを可能にするため、VALL-E は残差ベクトル量子化に基づくニューラルオーディオコーデック EnCodec を使用します。実際の音声波形を、話者の識別情報と音響特性の両方を持つ離散トークンへ変換し、後から高品質な音声にデコードして戻せます。
このモデルは約60,000時間の英語音声で学習されました。当時の TTS システムが通常使用していた量の数百倍にあたる学習データです。その規模がもたらしたのは、音声クローンのためのインコンテキスト学習という真に新しい能力でした。VALL-E が一度も聞いたことのない話者の3秒の音響プロンプトを与えるだけで、その声による新しい発話を生成できます。大規模言語モデルが追加学習なしに短いプロンプトからパターンをつかむのと同じです。
音声が言語モデリングの問題になる仕組み
VALL-E のアーキテクチャは自己回帰(AR)と非自己回帰(NAR)のモデリングを組み合わせ、コーデックトークンの階層構造に分けて処理します。EnCodec が音声フレームごとに生成するのは、単一のトークン列ではありません。フレームごとに8層のコードブックを生成し、それぞれが段階的に細かな音響情報を捉えます。VALL-E の AR コンポーネントは、入力テキストの音素列を条件として、最初の最も重要なコードブック層を順番に予測します。ここが、従来の言語モデルがトークンを1つずつ生成する動作に最も近い部分です。続いて NAR コンポーネントが、AR モデルの生成結果を条件に残り7層を並列で埋めます。AR モデルの柔軟性を一部手放す代わりに、全体の明瞭度への影響が比較的小さい層で生成を大幅に高速化しています。
注目すべき副作用:感情と環境も引き継がれる
このモデルは抽象化された話者埋め込みではなく、本物の音響プロンプトを使用します。そのため VALL-E は、3秒の参照クリップから声の識別情報だけでなく、話者の感情的な調子や、プロンプト自体に含まれる音響環境(部屋の残響や背景の特徴)まで引き継ぐ傾向があると分かりました。これは明示的に設計された機能というより、識別情報だけに圧縮した表現ではなく、実際の音響トークンを直接条件に使うことで生じた創発的な性質です。そもそもテキストベースの言語モデルでインコンテキスト学習が注目されたのと同じ種類の創発的な挙動です。
VALL-E の性能
当時公開されていた最強のゼロショット TTS システム YourTTS と比較した当初の評価では、LibriSpeech と VCTK のベンチマークにおいて、VALL-E は音声の自然さと話者類似度の両方で大幅に優れた結果を示しました。また、常に1つの決定論的な結果へ収束するのではなく、サンプリングに基づくデコードを別々に実行することで、同じ入力から多様な出力を生成できることも実証しました。
現在 VALL-E を使い始めるには
最初に知っておくべき重要な点があります。3秒の音声から極めて説得力のある音声クローンを作れることによる悪用の可能性を理由に、Microsoft は VALL-E の学習コードやモデルの重みを一度も公開していません。一般公開されているのは研究論文とデモサンプルであり、公式にダウンロードできるチェックポイントではありません。現在、実際に利用するにはコミュニティの取り組みが頼りになります。
- 独立した PyTorch 再実装を使用する。 GitHub の
lifeiteng/vall-eなどのプロジェクトは論文のアーキテクチャを再現していますが、すぐに使える学習済みの重みを提供するのではなく、通常は LibriTTS などのデータセットで自分のモデルを学習する必要があります。 - すぐに使える重みが必要なら、VALL-E X のコミュニティ再現を検討する。 VALL-E X は同じ中核的な発想を言語横断へ拡張したもので、これも元は公式に一般公開されなかった Microsoft の研究プロジェクトです。人気のコミュニティ再現(
Plachtaa/VALL-E-X)は学習済みの重みを実際に提供しています。ゼロから学習せずにこのアーキテクチャ群の動作を聞いてみたい場合、よりすぐに使える出発点になります。 - ゼロから学習する場合は、必要な規模を現実的に見積もる。 元のモデルが60,000時間規模で学習されたことを考えると、自分のハードウェアで同等の品質を再現するには相当な計算資源と、大規模でクリーンな音声データセットが必要です。これは研究レベルの取り組みであり、週末だけで終えられるプロジェクトではありません。
- より実用的な後継モデルとして VALL-E 2 に注目する。 Microsoft の後続研究は VALL-E で知られていた堅牢性と速度の問題に直接対処しており、同じ中核的アプローチをより洗練したバージョンです。元のアーキテクチャを研究することより本番環境での実用性を重視するなら、特に検討する価値があります。
VALL-E を扱う際のヒント
- デプロイ可能なモデルではなく、アーキテクチャの基準点として捉える。 公式な一般公開がないため、現在の実用的価値の多くは VALL-E が切り開いたニューラルコーデック言語モデルの手法を理解することにあります。この手法は、より新しい多くのオープンソース音声クローンモデルにさまざまな形で現れています。
- プロンプトの感情や環境も引き継がれると考える。 再実装を利用していて、出力に参照クリップの背景ノイズや感情的な調子が思いがけず残った場合、それは使用中の実装のバグではなく、このアーキテクチャ群で記録されている特性です。
- ゼロから学習する再実装では、本格的な学習時間を確保する。 学習済みの重みがないコミュニティ実装で元の論文が報告した品質に近づくには、大量のデータと計算資源が必要です。
- 再実装ごとのライセンスとデータセットの由来を確認する。 これらは公式リリースではなくコミュニティが学習したモデルなので、ライセンス条件や学習データの出所はプロジェクトによって異なります。商用利用する前に、使用するリポジトリを個別に確認してください。
VALL-E と同時代および後続モデルの比較
| VALL-E | YourTTS(同時代のベースライン) | 後のフローマッチングモデル(E2 TTS、F5-TTS) | |
|---|---|---|---|
| 中核的アプローチ | 離散コーデックトークン + 言語モデリング | 従来型ニューラル TTS | フローマッチング、非自己回帰 |
| 学習データの規模 | 約60,000時間 | 大幅に小さい | 同程度または小さく、重点が異なる |
| 音声クローン用プロンプトの長さ | 約3秒 | 通常はより長い音声が必要 | 約5~15秒 |
| 自然さ/類似度(報告値) | YourTTS を上回る | 比較のベースライン | 一般に収束が速く、アラインメントが安定 |
| 公式公開の重み | なし | あり | あり(F5-TTS)、なし(E2 TTS) |
| 感情/環境の引き継ぎ | 顕著な創発的特性 | 主要機能としては強調されていない | あまり強調されていない |
VALL-E の本当の遺産は、ダウンロードできるチェックポイントではありません。TTS をトークン予測の問題として捉え直したことです。現在のオープンソース音声クローンモデルの多くが、何らかの形で今なおその上に構築されています。
よくある質問
Microsoft から VALL-E の公式モデルの重みをダウンロードできますか?
いいえ。Microsoft は研究論文とデモ音声サンプルを公開しましたが、短いクリップによる極めて説得力のある音声クローンが悪用されるリスクを理由に、学習コードやモデルの重みを公開していません。
「ニューラルコーデック言語モデル」とは実際にはどういう意味ですか?
EnCodec のようなニューラルオーディオコーデックから得た離散音声トークンを、言語モデルがテキストトークンを予測するのと同じように予測し、音声を生成するという意味です。従来の TTS システムのように連続音声信号を直接回帰するわけではありません。
VALL-E の音声クローンにはどれくらいの参照音声が必要ですか?
最短3秒です。インコンテキスト学習を使い、追加のファインチューニングなしでその声による新しい発話を生成します。
VALL-E と VALL-E X の違いは何ですか?
VALL-E X は同じ中核アーキテクチャの言語横断拡張です。これも元は公式に一般公開されなかった Microsoft の研究プロジェクトですが、学習済みですぐに使える重みを提供する人気のコミュニティ再現があります。
自分で学習せずに VALL-E を実際に動かす方法はありますか?
Plachtaa/VALL-E-X などのコミュニティ再現は多言語版の学習済みの重みを提供しています。一方、lifeiteng/vall-e のような元の VALL-E の再実装では、完成済みの重みをダウンロードするのではなく、自分でモデルを学習する必要があるのが一般的です。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。