VoiceCraft:リスナーが実際の録音より好んだ編集音声
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
VoiceCraft自身が実施した自然さの一対比較では、人間のリスナーが実際の元録音よりも編集後の音声を好んだ割合は48%でした。つまり、本物のクリップと、モデルが単語を1つ置き換えて再生成したクリップのどちらを選ぶかは、ほぼコイントスだったということです。この結果は、VoiceCraftが本来何を目的に作られたのかを最も明確に示しています。単に音声を一から生成するのではなく、継ぎ目がわからなくなるほど自然に既存の音声を編集するためのモデルなのです。
VoiceCraftとは?
VoiceCraftは、テキサス大学オースティン校とRembrandの研究者が開発した、トークン補完型のニューラルコーデック言語モデルです。データ、コード、モデルウェイトのすべてがGitHubとHugging Faceで公開され、完全なオープンソースとしてリリースされています。Transformerデコーダーとして構築され、リリース時には音声編集とゼロショット音声合成の両方で最先端の結果を達成しました。評価には、クリーンなスタジオ録音ではなく、オーディオブック、YouTube動画、Spotifyポッドキャストといった実環境の音声が用いられています。未知の声のクローンにも既存録音の編集にも、必要な参照音声はわずか数秒です。
技術上の仕掛け:因果マスキングと遅延スタッキング
これは理解しておく価値があります。音声を一から生成するだけでなく、実際の編集を可能にする仕組みだからです。標準的な自己回帰モデルは厳密に左から右へ生成するため、編集位置より後ろをすべて再生成せずに、既存のシーケンスの途中へ新しい内容を挿入するのは得意ではありません。VoiceCraftは、2段階のトークン再配置手順でこの問題を解決します。1つは、テキストと画像の共同モデリングで成果を上げた手法を取り入れた因果マスキング、もう1つは、ニューラル音声コーデックのマルチコードブック構造を効率よく扱う遅延スタッキングです。この2つを組み合わせることで、VoiceCraftは前後両方向の文脈を条件とする補完生成を行いながら、内部では自己回帰生成プロセスを維持できます。一般的な補完モデルが頼る完全な非自己回帰方式は必要ありません。
1つのモデルに2つの能力
このアーキテクチャにより、VoiceCraftは同じ基盤メカニズムで、本質的に異なる2つのタスクを扱います。音声編集では、既存の録音に対して挿入、削除、置換、複数区間の変更ができます。録り直すことなく、単語を訂正したり、フレーズを置き換えたり、文を調整したりでき、モデルはクリップ全体ではなく影響を受ける区間だけを再生成します。ゼロショットボイスクローンは、同じ補完能力を逆向きに使います。未知の話者の声を数秒与えるだけで、その声によるまったく新しい音声を生成します。多くのTTSモデルはどちらか一方のタスク向けに作られていますが、VoiceCraftは両者を同じ基盤問題として捉え、同じモデルで解決します。
REALEDITベンチマーク
VoiceCraftチームは、音声編集を専用に評価するため、同種として初の現実的なベンチマークとされるREALEDITを構築しました。オーディオブック、YouTube動画、Spotifyポッドキャストから集めた5~12秒の実世界の例を310件収録し、挿入、削除、置換に加えて、1~16語にわたる複数区間の編集を含みます。前述の48%という選好結果、つまり一対比較で本物の元録音より編集音声が選ばれた結果は、このベンチマークによるテストから直接得られたものです。都合のよいデモクリップを選んだ数字ではなく、意味のある信頼性を持つ理由の1つでもあります。
VoiceCraftを始める
VoiceCraftを試す最も簡単な方法は、環境設定まで処理してくれるプロジェクトのDockerベースのセットアップを使うことです。環境が起動したら、ゼロショットTTS生成を試すための文書化された出発点はinference_tts.ipynb notebookです。独自データでファインチューニングや学習を行う場合、プロジェクトには個別のセットアップ資料と学習資料があり、ゼロからの学習よりファインチューニングを安定させるためにAdamWが特に推奨されています。モデルウェイトは2024年3月からHugging Faceで公開されているため、多くの用途では、ゼロから学習するのではなく、事前学習済みcheckpointをダウンロードするのが現実的な出発点です。
より良い結果を得るためのヒント
- 編集は全面的な書き直しではなく、局所的な修正に使いましょう。 VoiceCraftの編集能力は、フレーズや短い区間を狙って挿入、削除、置換することに強みがあります。内容全体を変更する場合は、標準的なゼロショット生成で一から作る方が適しています。
- クローン用の参照クリップはクリーンに保ちましょう。 必要なのは数秒の音声だけなので、その長さの明瞭で良好に録音されたサンプルは、同程度の長さでノイズが多いものより良い結果を生みます。
- ベンチマーク性能がそのまま移行すると考える前に、実際に使う音声の種類でテストしましょう。 REALEDITはクリーンなスタジオ音声ではなく、ポッドキャストやYouTube動画などの実環境ソースから作られており、意味のある現実的なテスト環境です。ただし、自分のコンテンツ固有のノイズ特性や録音品質については、やはり直接検証する価値があります。
- 依存関係を手動管理する明確な理由がなければ、Dockerを使いましょう。 コーデック、音素処理、Transformerデコーダーなど、多数のコンポーネントを正しく揃える必要があるため、Dockerを使うことで一般的なセットアップ問題のかなりの部分を避けられます。
- 英語以外の言語が必要ならVoiceCraft-Xを確認しましょう。 後継モデルは、同じ中核的な編集・クローン手法を11言語に拡張し、音声表記を収録した発音辞書を必要とせず、大規模言語モデルで言語横断テキストを処理します。プロジェクトの言語要件が英語中心の原版を超えたなら、確認する価値があります。
VoiceCraftと生成専用クローンモデルの比較
| VoiceCraft | F5-TTS | E2 TTS | |
|---|---|---|---|
| 音声編集(既存音声への挿入・削除・置換) | 対応、中核機能 | 非対応、生成のみ | 非対応、生成のみ |
| ゼロショットボイスクローン | 対応、数秒の参照音声 | 対応、約5~15秒 | 対応、同程度 |
| 中核メカニズム | 双方向文脈のための因果マスキングと遅延スタッキングを備えた自己回帰方式 | 非自己回帰flow matching | 非自己回帰flow matching |
| 一般公開 | データ、コード、ウェイトをすべて公開 | コードとウェイトを公開 | 非公開、研究論文のみ |
| ベンチマークの重点 | 実環境音声(オーディオブック、YouTube、ポッドキャスト) | 標準TTSベンチマーク | 標準TTSベンチマーク |
VoiceCraftならではの領域は、既存録音の編集と新しい音声の生成を同じ基盤問題として扱う、数少ないオープンモデルの1つであることです。このサイトにあるモデルの多くは生成専用で、すでに存在する音声を扱う仕組みを備えていません。
よくある質問
VoiceCraftはクリップ全体を再生成せずに録音を編集できますか?
はい。それが中核的な設計目標です。VoiceCraftは因果マスキングと遅延スタッキングにより、クリップ全体を作り直すことなく、挿入、削除、置換する単語やフレーズなど、対象区間だけを再生成します。
VoiceCraftに必要な参照音声はどのくらいですか?
未知の話者をゼロショットでクローンする場合も、既存の録音を編集する場合も、わずか数秒です。
REALEDITベンチマークとは何ですか?
VoiceCraftチームが音声編集のために専用設計した現実的な評価データセットです。オーディオブック、YouTube動画、ポッドキャストから集めた実世界の例を310件収録し、挿入、削除、置換、複数区間の編集を網羅しています。
VoiceCraftは無料のオープンソースですか?
はい。データ、コード、事前学習済みモデルウェイトはすべてGitHubとHugging Faceで公開されています。プロジェクトが定める倫理的な利用要件以外に制限はなく、その要件では、許可のない音声生成や、同意を得ずに他人の声を操作することが明確に禁止されています。
VoiceCraftに多言語版はありますか?
はい。後継モデルのVoiceCraft-Xは、同じ統一的な編集・クローン手法を11言語に拡張しています。言語ごとに別々の発音辞書を必要とせず、大規模言語モデルで言語横断テキストを扱います。
参照音声から似た声の音声を生成
参照音声と新しいテキストから似た声を生成する同様のワークフローには、Echoraの音声クローンを利用できます。自分の声、または使用について明示的な許可を得た参照音声をアップロードし、最大5,000文字の新しいテキストを入力すると、参照音声に似た新しい音声を生成できます。