Voicebox:音声をゼロから生成するだけでなく、編集するために作られたモデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
自己回帰型TTSモデルは、クリップが終わった位置から続きを生成することしかできません。途中にある単語を修正しようとすれば、それ以降をすべて生成し直す必要があります。Meta傘下のFAIRによる研究モデルVoiceboxは、これとは根本的に異なるタスクを中心に設計されました。周囲の音声コンテキストと対象テキストを与え、クリップ内のどの位置でも欠けた部分を補います。画像の端から先を描き足すだけでなく、インペインティングで画像中央を編集するような方法です。
Voiceboxとは?
Voiceboxは、フィルタリングも補正も行っていない5万時間以上の音声で学習した非自己回帰型のフローマッチングモデルです。学習データは、英語、フランス語、ドイツ語、スペイン語、ポーランド語、ポルトガル語によるパブリックドメインのオーディオブックから収集されました。Metaは、TTSシステムが通常それぞれ特化する多数の個別タスクを直接学習させるのではなく、テキストに基づく音声補完という、より汎用的な単一の目的でVoiceboxを学習させました。この一つのタスクだけで、実際に人々が音声モデルへ求める機能の大半を包含できることがわかりました。これは、明示的に学習していないタスクでもGPTを役立つものにしたのと同種の文脈内学習によるものです。
補完が可能性を変える理由
Voiceboxは、周囲の音声と対象テキストの両方を使って、マスクされた音声区間を再構成するよう学習しています。そのため、構造上クリップ末尾からしか生成できない自己回帰型モデルとは異なり、与えられたサンプルのどの部分でも変更できます。この柔軟性により、一つのタスクだけで学習した単一モデルが、実用上は異なる複数の能力へ汎化できます。わずか2秒の参照音声によるゼロショットのテキスト読み上げ合成、参照話者のスタイルを保ったまま、対応する6言語のうち別の言語で文章を読み上げる言語横断スタイル転送、ノイズ除去、内容編集、与えられた発話の多様な再サンプリングです。これらはすべて、後から付け加えた別々の専用モードではなく、同じ基礎的な補完タスクの一例です。
背後にある技術:条件付きフローマッチング
Voiceboxの非自己回帰型の中核は、Conditional Flow Matching(CFM)に基づいています。これは、フレーム単位の言語情報とマスクされた音声コンテキストの両方を条件として、連続時間変数上で単純な初期分布(ガウスノイズ)を対象の音声分布へ変換する手法です。拡散モデルに一般的な定式化とは明確に異なります。当時Meta自身が行った比較では、ゼロショットTTSの明瞭度と音声類似度でVALL-Eを上回り、同時期の主要な自己回帰型モデルよりも約20倍速く音声を生成したことが示されました。
フローマッチングという技術はVoiceboxだけにとどまりませんでした。同じ中心的な発想は、後にE2 TTSとF5-TTSが採用したアプローチの土台にもなっています。どちらもVoiceboxが確立に貢献した「パディングまたはマスクを行い、その後に生成する」という同じ考え方に基づいており、CosyVoice2やCosyVoice3などのモデルで使われるフローマッチングデコーダーとも概念的に近い関係にあります。これらのいずれかを使ったことがあるなら、Voiceboxが大規模に実証したアプローチの直接の後継を使ったことになります。
Voiceboxと、そのオープンソースのアーキテクチャ後継モデルの比較
| Voicebox | E2 TTS | F5-TTS | |
|---|---|---|---|
| 中核技術 | 条件付きフローマッチング | フローマッチング、フラットなU-Net Transformer | 条件付きフローマッチング + Diffusion Transformer |
| 学習タスクの枠組み | 汎用的なテキストベースの音声補完 | テキスト・音声補完(持続時間モデル/アライナーなし) | 同じ中核的アプローチを、アライメントの堅牢性向上のため改良 |
| ゼロショットプロンプトの長さ | 約2秒 | 同程度 | 約5~15秒 |
| タスクの汎用性 | 一つのモデルでTTS、ノイズ除去、編集、再サンプリング | 主にTTSに特化 | 主にTTSに特化 |
| 一般公開 | なし(研究論文のみ) | なし(F5-TTSリポジトリによるコミュニティ再現あり) | あり(GitHubおよびHugging Face) |
| 言語 | 6 | 英語中心 | 主に英語中心 |
Voiceboxの長期的な意義は、真に大規模なデータで学習した単一の汎用的な補完目標によって、複数の異なる音声タスクで専用システムと同等、またはそれ以上の成果を同時に出せると示した点にあります。これは、その後もこの分野の少なからぬ部分が発展させてきたひな型です。
よくある質問
「音声補完」とは何ですか?
周囲のコンテキストと対象テキストを使って、音声クリップの欠けた部分やマスクされた部分を生成することです。自己回帰型モデルのように末尾から続きを生成するだけでなく、サンプルのどの部分でも編集できます。
VoiceboxはE2 TTSやF5-TTSなどのモデルとどのような関係にありますか?
どちらも、Voiceboxが実証した同じ条件付きフローマッチング手法に基づくアーキテクチャ上の後継です。E2 TTSはVoiceboxの補完という考え方を直接共有し、F5-TTSは同じ系譜を引き継ぎながら、学習の安定性とアライメントをさらに改善しました。
Voiceboxはいくつの言語に対応していますか?
学習データに基づく6言語、つまり英語、フランス語、ドイツ語、スペイン語、ポーランド語、ポルトガル語です。
MetaはVoiceboxの悪用リスクに対処しましたか?
はい。Metaの研究では、生成モデルと併せて、本物の音声とVoiceboxが生成した音声を区別できる分類器を構築したことが明記されています。これは、モデルが悪用される可能性に対する、文書化された安全対策です。
参照音声から似た声の音声を生成
参照音声と新しいテキストから似た声を生成する同様のワークフローには、Echoraの音声クローンを利用できます。自分の声、または使用について明示的な許可を得た参照音声をアップロードし、最大5,000文字の新しいテキストを入力すると、参照音声に似た新しい音声を生成できます。