EchoraEchora
モデル一覧に戻る

GPT-SoVITS:単なるモデルではなく、総合的な音声クローンスタジオ

2026年9月2日
•
読了目安:7分

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

多くのオープンソース音声クローンモデルは、checkpoint と Python スクリプトを渡して終わりです。対して GPT-SoVITS が提供するのは、ボーカル分離、自動文字起こし、データセットの分割、学習、推論までをブラウザベースの1つのインターフェースにまとめた完全なワークフローです。その基盤にあるデータ要件は本当に少なく、5秒の音声から実用的なクローンを作り、わずか1分あれば本格的に微調整できます。

GPT-SoVITS とは?

GPT-SoVITS は、開発者 RVC-Boss が作成した MIT ライセンスのオープンソース音声クローン/テキスト読み上げプロジェクトです。GPT ベースのセマンティックテキストモデリングと、VITS ベースの音響・音声変換システムである SoVITS を1つのパイプラインに組み合わせています。GPT コンポーネントがテキストをセマンティックトークンに変換し、続いて SoVITS コンポーネントが参照音声を手掛かりとして、そのトークンを最終的な波形に変換します。この分業により、同じ基盤アーキテクチャで、即時のゼロショット生成と、より踏み込んだ少数ショット微調整の両方を実現しています。

中国語、英語、日本語、韓国語、広東語にまたがるクロスリンガル生成に対応し、特に中国語と日本語の出力品質で高い評価を得ています。

2段階のクローン:5秒と1分

これは目玉となる機能なので、各段階で実際に何が得られるのかを正確に押さえる価値があります。ゼロショットモードは5秒の参照クリップを受け取り、学習工程なしですぐにその声の音声を生成します。開発者によるテストでは、この段階で対象音声との類似度はおよそ80-95%とされ、簡単なテストや重要度の低いコンテンツには利用できる水準です。少数ショット微調整はさらに先へ進みます。対象音声のデータを約1分用意してモデルを微調整すると、ゼロショットの基準を超えて類似度と自然さが目に見えて向上し、参照話者の実際の声との残る差の大部分を埋められます。

バージョンの歴史:v1 から v4 まで

GPT-SoVITS は最初のリリース以降、アーキテクチャの異なる複数の世代を経てきました。自分の状況に合うものを知ることは、単に「最新版」を選ぶことより重要です。

  • v1 と v2 は、独立したボコーダー段階を設けず、VQ-VAE デコーダーで波形を直接生成するという同じ基本アーキテクチャを共有しています。v2 では、より広い言語対応と、より多くの事前学習データが追加されました。
  • v2Pro / v2ProPlus は、v2 のハードウェア要件と推論速度を保ちながら、安定性と互換性をさらに改善しました。プロジェクト自身の比較では、実行コストを抑えたまま、一部の面で v4 を上回っています。
  • v3 は、中心となる音響アーキテクチャを shortcut Conditional Flow Matching Diffusion Transformer(shortcut-CFM-DiT)に置き換えました。これにより、参照音声との音色の類似性が明らかに向上し、GPT 側の繰り返しや欠落のエラーが減り、感情表現も豊かになりました。学習には、拡張され、品質で選別された約7,000時間のデータセットが使われています。このバージョンの生成は完全なエンドツーエンドではないため、オープンソースの BigVGAN v2 ボコーダーを使ってメルスペクトログラム出力を24kHz音声へ変換しますが、整数倍ではないアップサンプリングによって金属的なアーティファクトが生じることがあります。
  • v4 は、この特定の金属音の問題を修正し、24kHzではなく48kHz音声をネイティブ出力します。これにより、24kHz信号をアップサンプリングしたときに生じ得る、わずかにこもった音質を回避しています。プロジェクトの作者自身は、v4 を v3 の実用的な差し替え版と説明しています。

実際の判断基準は次のとおりです。v1、v2、v2Pro は、品質が低い、またはノイズのある学習データで良い結果を出す傾向があります。そのアーキテクチャが学習セット全体の平均からより強い影響を受けるためです。v3 と v4 は、クリーンで高品質な参照音声に限ってより良い結果を出します。データセット全体で平均化するより、その参照を忠実に再現することに比重を置くためです。ただし、元の録音がそもそもクリーンでなければ、v1/v2 を下回る場合もあります。

WebUI:学習パイプラインを手作業で組まない人のための設計

GPT-SoVITS のインターフェースには、推論だけでなく、データセット準備の全ワークフローがまとまっています。背景音楽やノイズからボーカルを分離する UVR5、文字起こし用の自動音声認識(中国語 ASR は専用モデル、英語と日本語は Faster Whisper Large V3)、長い録音を学習に使える区間へ分ける自動音声分割が含まれます。5〜10分程度の小規模データセットでは、「ワンクリック三連」ボタンが複数の前処理工程を自動的につなぎます。データパイプラインをゼロからスクリプト化することに慣れていない人にとって、使いやすさを大きく高める利点です。

GPT-SoVITS の始め方

  1. Windows を使っているなら、Windows 統合パッケージを利用します。 ビルド済みパッケージを直接ダウンロードできます。go-webui.bat をダブルクリックすれば、環境を手動設定せずに完全な WebUI が起動します。
  2. Linux/Mac を使う場合、または制御の自由度が必要な場合は手動で設定します。 Python 3.10 の仮想環境を(uv または conda で)作成し、リポジトリをクローンして、pip install -r requirements.txt で依存関係をインストールします。
  3. 目的のバージョンに合う事前学習済みモデルをダウンロードします。 各バージョン(v2、v2Pro、v3、v4)には、Hugging Face でホストされている専用の checkpoint ファイルがあります。事前学習済みモデルのバージョンと WebUI で選ぶ学習バージョンを必ず一致させてください。一致しないと、生成が失敗したり品質が低下したりします。
  4. 組み込みツールで参照音声を準備します。 素材に背景ノイズや音楽がある場合は、まず UVR5 を実行し、その後、手作業で文字起こしやクリップ分割をする代わりに、自動分割と ASR アノテーションのツールを使います。
  5. 素材音声の品質に応じてバージョンを選びます。 ノイズが多い録音や平均的な品質の録音には v1/v2/v2Pro を使います。参照音声がクリーンなスタジオ品質で、その声を最大限忠実に再現したい場合に限り、v3 または v4 を使います。
  6. 16シリーズ GPU の問題に注意します。 古い NVIDIA 16シリーズのカードには Tensor Core がなく、学習中に CUDA 設定エラーが発生することがあります。プロジェクトの config.py がこれを自動検出し、回避策として FP32 精度を強制します。

より良い結果を得るためのヒント

  • 微調整に取り組む前に、ゼロショットから始めます。 5秒の短いテストで、ベースモデルのゼロショット類似度が用途に十分かどうかを確認できます。そのうえで、1分間の学習音声を集めて準備するために時間をかけるか判断できます。
  • 新しさではなく、データ品質に正直にバージョンを合わせます。 最新だからという理由で v4 を選ぶと、元の録音にノイズがある場合はかえって出力品質が落ちることがあります。完全にクリーンではない音声には、v2Pro のほうが実用的な選択となることが少なくありません。
  • 学習後ではなく、学習前にデータセットをきれいにします。 最初に UVR5 で背景ノイズと音楽を取り除いてください。特に v3 と v4 は、入力する素材の忠実度に大きく左右されます。
  • 中国語と日本語での強みを意識的に活用します。 プロジェクトの主要言語が中国語または日本語なら、GPT-SoVITS はその言語に特に強いオープンソース候補の1つです。英語だけのコンテンツでは、他のモデルが優位な場合があります。
  • 特別な理由がない限り、v3 より v4 を選びます。 v4 は v3 で知られている金属的なアーティファクトを修正し、より高いネイティブサンプルレートの音声を出力します。v3 ベースの設定を特にトラブルシューティングしているのでなければ、差し替え版として扱うという作者自身の案内に従うのが妥当な既定選択です。

GPT-SoVITS と他の少数ショットクローンモデルの比較

GPT-SoVITSXTTS-v2Fish Speech
実用的なクローンに必要な最小データ5秒(ゼロショット)約6秒約10〜30秒
微調整への対応あり、約1分のデータあり、コミュニティスクリプト経由あり、ネイティブ対応
最も得意な言語中国語、日本語17言語を幅広くカバー英語、中国語、日本語
組み込みのデータ準備ツールあり(ボーカル分離、ASR、自動分割)なしなし
ライセンスMITCoqui Public Model License(非商用)研究/非商用寄り

GPT-SoVITS の独自の立ち位置は、本当に少ないデータ要件と、データ準備から学習までを扱うオールインワン WebUI の組み合わせにあります。特に中国語と日本語のコンテンツでは、この組み合わせをひとまとめにした他のプロジェクトを見つけるのは困難です。

よくある質問

GPT-SoVITS で声をクローンするには、実際にどれくらいの音声が必要ですか?

即時のゼロショットクローンなら最短5秒、類似度と自然さを明らかに改善した微調整済みモデルなら約1分の参照音声が必要です。

v2、v3、v4 のどれを使うべきですか?

学習音声が平均的な品質、またはノイズを含む場合は v2 か v2Pro を使います。参照録音がクリーンなスタジオ品質なら v3 か v4 を使ってください。これらのバージョンは、その参照を正確に再現することに強く比重を置いているためです。v3 と v4 の比較では、v4 が既知の金属的なアーティファクトの問題を修正し、より高品質な音声をネイティブ出力するため、実用上の既定選択に向いています。

GPT-SoVITS は中国語以外の言語にも適していますか?

はい。中国語に加え、英語、日本語、韓国語、広東語に対応しています。ただし、最も高い評価を築いてきたのは中国語と日本語です。

GPT-SoVITS は商用でも無料で使えますか?

はい。オープンソースの音声クローンプロジェクトの中でも特に寛容な選択肢の1つである MIT ライセンスで公開されています。

学習データセットを自分で手作業で準備する必要がありますか?

必ずしも必要ではありません。WebUI にはボーカル分離、自動文字起こし、音声分割のツールが含まれ、小規模データセット向けには複数の前処理工程を自動的につなぐワンクリック機能もあります。

参照音声から似た声の音声を生成

参照音声と新しいテキストから似た声を生成する同様のワークフローには、Echoraの音声クローンを利用できます。自分の声、または使用について明示的な許可を得た参照音声をアップロードし、最大5,000文字の新しいテキストを入力すると、参照音声に似た新しい音声を生成できます。

音声クローンを作成 →