VALL-E 2:2つ直しただけで、突然、人間の声と区別できないレベルへ
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
モデルを「人間の音声に驚くほど近い」状態から「人間の音声と区別できないと報告される」状態へ進めるために、必ずしも新しいアーキテクチャが必要とは限りません。ときには、オリジナルの足をひそかに引っ張っていた2つの具体的な問題を直すだけで十分です。Microsoft が VALL-E の後継として開発した VALL-E 2 は、同じ中核設計に、狙いを絞った変更を2つだけ加えました。その結果、ゼロショットのテキスト音声変換システムとして初めて人間同等の性能に達したとされました。この主張は、ほかのモデルとの比較だけでなく、実際の人間の録音を相手に直接検証されたものです。
VALL-E 2 とは?
VALL-E 2 は、VALL-E のニューラルコーデック言語モデリング手法を直接土台としています。これは、離散的なオーディオコードに対する token 予測として音声生成を扱うという同じ中核アイデアであり、自己回帰(AR)と非自己回帰(NAR)の Transformer を組み合わせた同じハイブリッドアーキテクチャを使用します。テキスト埋め込み層、コード埋め込み層、コード予測層は両方のコンポーネントで共有されます。変わったのは基盤ではありません。その上に、オリジナルモデルの具体的な弱点をそれぞれ狙った2つの仕組みが追加されました。
決定的な差を生んだ2つの改善
反復認識サンプリング(Repetition Aware Sampling)。 VALL-E の元のデコード処理は単純なランダムサンプリングを使用していたため、出力が不安定になったり、無限ループに陥って同じ音やフレーズを延々と繰り返したりすることがありました。VALL-E 2 は、デコード履歴における token の反復を追跡し、各ステップでランダムサンプリングと nucleus sampling を適応的に切り替えることで、この問題を修正します。反復率が定められたしきい値を超えると、反復する経路をそのまま進む代わりに、元の確率分布からランダムに再サンプリングした token に置き換えます。その結果、サンプリングによる生成がもたらす自然なばらつきを損なわずに、デコードの安定性が大きく向上します。
グループ化コードモデリング(Grouped Code Modeling)。 VALL-E 2 は、個々のコーデックコードをそれぞれ独立したステップとしてモデル化するのではなく、コーデックコードをまとめ、AR 生成処理の1フレーム内で各グループをモデル化します。これにより、モデルが処理しなければならない実効シーケンス長が短くなります。推論を高速化すると同時に、長いシーケンスが元のアーキテクチャにもたらしていた難しさへ直接対処します。
どちらの変更も、VALL-E が導入したニューラルコーデック言語モデルという根本的な考え方には手を加えていません。デコードの安定性とシーケンス長に狙いを定めた工学的な修正であり、この2つを組み合わせることで、「非常に優秀」から、具体的に検証できる「人間同等」という主張まで到達しました。
人間同等という結果を文脈とともに見る
評価には2つの異なるテストセットが使われ、より難しい方の結果が特に重要です。LibriSpeech test-clean では、異なる40人の話者それぞれについて、1つの参照発話をクローン用 prompt として使用しました。VALL-E 2 は、話者類似度(SMOS)と音声品質(CMOS)の両方で元の VALL-E を上回りました。VCTK は、はるかに多様なアクセントを持つ60人の話者を収録したかなり難しいベンチマークで、ゼロショットクローンの難度も大きく上がります。ここでも VALL-E 2 は VALL-E を上回っただけでなく、話者1人につきわずか3秒の prompt を使って、実際の正解となる人間の録音と同等またはそれ以上の結果を示しました。より難しく、アクセントも多様なデータセットで得られたこの具体的な結果が、人間同等という主張の根拠です。
論文では、元のモデルが苦手としていた複雑な文も、VALL-E 2 なら安定して合成できると報告されています。具体的には、特殊な言い回しや難しい音素列を含み、以前は Repetition Aware Sampling がまさに修正対象とした不安定性を引き起こしていた文です。
VALL-E 2 をダウンロードできない理由
これは、このモデルについて実用上もっとも重要な点です。Microsoft は珍しいほど明確に説明しています。VALL-E 2 は、公開モデルや製品として意図的にリリースされませんでした。研究者は、これほど説得力のあるシステムから当然想定される悪用のリスク、つまり音声のなりすましや、同意なしに特定の話者を装う行為を理由に挙げています。研究論文そのものも、あらゆる合成において、ユーザーが対象話者の同意を得ているという前提で実験を位置づけています。研究発表としては特に明確な倫理上のガードレールであり、チームが自ら作ったものの影響をどれほど真剣に捉えていたかが表れています。
実際のところ、これは公式 checkpoint が存在しないことを意味します。また、学習済みの重みを公開した、人気が高く完全に利用可能なコミュニティ再現版がある VALL-E X とは異なり、VALL-E 2 固有の Repetition Aware Sampling と Grouped Code Modeling を同程度に完全な形で再現したオープンソース実装は、この記事の執筆時点で登場していません。公開されているのは研究論文、デモ音声を掲載した Microsoft のプロジェクトページ、そして複雑な生成タスクを処理するモデルの能力を LibriSpeech や VCTK とともに評価するために使われた ELLA-V などの評価フレームワークです。
VALL-E 2 を評価しているなら、これは何を意味するのか
ニューラルコーデック言語モデルの最先端を理解したいなら、VALL-E 2 の貢献は確かに研究する価値があります。厳密でアクセントの多様なベンチマークにおいて、「印象的」と「人間同等」を分けるものが、モデルの大型化やデータの増量だけではなく、デコード戦略の修正であり得ると示したからです。実際に何かをデプロイしたいなら、現実的な道は公開されたモデルを通ります。クロスリンガル用途なら VALL-E X のコミュニティ再現版、実運用ならまったく別のオープンソースクローンモデル(F5-TTS、Chatterbox、CosyVoice3)が候補になります。VALL-E 2 自体は実行可能な形で公開されていないためです。
VALL-E 2、VALL-E、VALL-E X の比較
| VALL-E 2 | VALL-E(オリジナル) | VALL-E X | |
|---|---|---|---|
| 中核となる改善 | Repetition Aware Sampling + Grouped Code Modeling | ニューラルコーデック言語モデルという元の発想 | VALL-E のクロスリンガル拡張 |
| デコードの安定性 | 大きく改善し、無限ループの問題を修正 | 一部の入力で不安定になる既知の問題 | VALL-E の手法を継承 |
| 主張された結果 | LibriSpeech と VCTK で人間同等 | YourTTS ベースラインを上回る | 高品質なクロスリンガル転移 |
| 参照 prompt の長さ | 約3秒 | 約3秒 | 約3~10秒 |
| 公式公開 | なし | なし | なし |
| 利用可能なコミュニティ再現版 | 広く利用できるものはなし | 自前での学習が必要 | あり、学習済み重みも公開 |
VALL-E 2 の本当の意義は、すぐ使えるツールというより研究上のマイルストーンであることです。VALL-E が始めたニューラルコーデック言語モデルの手法は、適切にデコードを改良すれば、聞き手が実際の録音と確実には区別できないゼロショット音声を生成できるという、これまででもっとも明確な証拠です。
よくある質問
VALL-E 2 をダウンロードしたり使用したりできますか?
できません。Microsoft は公式コードも学習済みの重みも公開していません。VALL-E X とは異なり、VALL-E 2 固有の技術を再現した、広く利用できるコミュニティ版もこの記事の執筆時点では存在しません。公開されているのは研究論文とデモ音声です。
ここでいう「人間同等」とは何ですか?
特定のベンチマーク評価、つまり LibriSpeech と、アクセントがより多様な VCTK データセットにおいて、話者1人につきわずか3秒のクローン用 prompt を使った VALL-E 2 の生成音声が、実際の正解となる人間の録音と同等またはそれ以上に聞き手から評価されたという意味です。
Repetition Aware Sampling と Grouped Code Modeling とは何ですか?
Repetition Aware Sampling は、token の反復履歴に基づいてデコード処理を適応的に調整し、不安定な出力やループを防ぎます。Grouped Code Modeling は、コーデックコードをまとめて実効シーケンス長を短縮し、推論速度と長いシーケンスを扱う能力の両方を改善します。
Microsoft が VALL-E 2 を公開しないと決めたのはなぜですか?
研究者は、クローン結果が非常に説得力のあるものであるため、悪用されるリスクがあると説明しています。音声のなりすましや、本人の同意なしに特定の話者を装うことなどが具体的な懸念として挙げられています。
VALL-E 2 は VALL-E X とどう違いますか?
VALL-E 2 は、Repetition Aware Sampling と Grouped Code Modeling により、元の VALL-E の同一言語内におけるデコードの安定性と音声品質を改善します。別系統の研究である VALL-E X は、VALL-E をクロスリンガル音声転移へ特化して拡張したもので、VALL-E 2 とは異なり、学習済みの重みを公開した利用可能なコミュニティ再現版があります。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。