EchoraEchora
モデル一覧に戻る

MetaVoice:言葉だけでなく、感情のリズムまで正確に捉えるためのモデル

2026年9月7日
•
読了目安:7分

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

多くの TTS モデルはすべての単語を正しく発音しても、買い物リストを読み上げているように聞こえます。metavoice.io のチームによる MetaVoice は、もっと狭く具体的な優先事項、つまり英語音声における感情のリズムとトーンを軸に作られました。独自のドキュメントにも明記されている設計目標は、ハルシネーションを起こさないことです。できるだけ多くの言語を網羅するのではなく、単に正しく読むだけでなく、本当に感情が伝わる英語の話し方に集中しています。

MetaVoice とは?

MetaVoice は、10万時間の音声データで学習した12億パラメータのオープンソース音声合成モデルです。使用制限のない、完全に寛容な Apache 2.0 ライセンスで公開されています。内部では、テキストと話者情報から EnCodec の音声トークンを多段階のパイプラインで予測します。因果的な GPT 形式のコンポーネント、非因果 Transformer、マルチバンド拡散が連携して最終波形を再構成し、KV キャッシュとバッチ処理も組み込むことで、研究用途だけにとどまらない実用的な推論を実現しています。

米国英語と英国英語向けのゼロショットクローン

MetaVoice ですぐに最も使いやすい機能は、米国英語と英国英語のアクセントに特化して調整されたゼロショット音声クローンです。わずか30秒の参照音声から、微調整を行わずに対象話者の声を再現できます。幅広い多言語音声バンクではなく、アクセントを狭く絞っているのは意図的なトレードオフです。多くの言語を浅くカバーする代わりに、十分なデータがある2つの英語アクセントを深く扱います。

微調整による言語横断の音声クローン

英語のゼロショット機能に加えて、MetaVoice は言語をまたぐ音声クローンにも対応します。ただし、この方法には微調整が必要で、すぐにそのまま使えるわけではありません。プロジェクトのドキュメントでは、インド訛りの話者にモデルを適応させた際、わずか1分の学習データで成功したと報告しています。言語横断の適応タスクとしては、本当に少ないデータ量です。これが実際に何を意味するのかを正確に理解しておく必要があります。ベースモデル自体は、最初から多数の言語で学習したモデルのようなネイティブの多言語モデルではありません。中心となる米国英語と英国英語以外へ広げるには、自分の参照データを使って自ら適応させる必要があり、任意の言語ですぐ使える機能として提供されているわけではありません。

速度とデプロイ方法

MetaVoice は短いクリップのクローンだけでなく長文合成にも対応し、音質をある程度犠牲にして推論を高速化する実験的な量子化モード(int4 と int8)も用意しています。int4 は標準的な bf16/fp16 精度のおよそ2倍の速度で動作します。量子化による高速化が必要なら、こちらの方が実用的です。int8 は、プロジェクトでも原因を完全には解明できていないものの、実際にはフル精度より遅いと報告されているためです。最新の GPU アーキテクチャ(Ampere、Ada Lovelace、Hopper)では、モデルを推論用にコンパイルした後、つまりハードウェアによって約30〜90秒かかる1回限りの起動処理を終えると、リアルタイム係数が1.0未満となり、リアルタイムより速く生成できます。

MetaVoice の始め方

セットアップでは、プロジェクトのリポジトリをクローンし、ドキュメントに記載されたインストール手順に従います。対話型 Python 推論セッションを直接実行する方法、付属の API サーバーを Docker Compose でデプロイする方法、内蔵 Web UI を立ち上げてブラウザで操作する方法があります。推論サーバーを使えば主要なクラウドプロバイダーにデプロイできるため、ローカルでのテストでも本番規模の運用でも、セルフホスティングは容易です。torch.compile のウォームアップがあるため、コールドスタート直後の即時生成を期待せず、初回実行時の起動遅延を見込んでください。

より良い結果を得るためのヒント

  • ゼロショットクローンには、本当にクリーンな30秒の参照クリップを使います。 これは米国英語と英国英語アクセントの中心的な対応ワークフローなので、ほぼ同じ長さで適切に録音したサンプルは、より短いクリップやノイズの多いクリップより良い結果になります。
  • 言語横断の適応は、切り替えるだけのフラグではなく、微調整プロジェクトとして扱います。 ベースモデルが中心とする米国英語/英国英語以外の声やアクセントが必要なら、ゼロショットで動くと期待せず、独自の小規模な参照データセットを集め、文書化された微調整手順を進める時間を確保してください。
  • 最高品質より速度が重要な場合に、int4 量子化を選びます。 標準精度に比べておよそ2倍高速なので、推論速度がボトルネックなら、最初に試す量子化方式として最も合理的です。
  • 本番計画には初回コンパイルの遅延を含めます。 起動時にモデルをコンパイルし、その後はリアルタイムより速く推論する仕組みなので、デプロイ時のコールドスタート遅延には、この1回限りの時間を織り込んでください。

MetaVoice とアクセント重視の他のクローンモデルの比較

MetaVoiceXTTS-v2Chatterbox
中心となる言語英語(米国、英国)17言語英語(Multilingual 版:23言語)
ゼロショットクローン対応、参照音声約30秒対応、参照音声約6秒対応、参照音声5〜10秒
言語横断/アクセント適応微調整による(例:インド英語)ネイティブ対応、ベースモデルに内蔵ネイティブ対応、Multilingual 版による
感情表現力設計上の最優先事項参照エンコーダーで自動対応明示的な exaggeration パラメータ
パラメータ数1.2B公には重視されていない約0.5B
ライセンスApache 2.0Coqui Public Model License(非商用)MIT

MetaVoice が狙う特定の領域は、広さより深さです。言語数を競うのではなく、感情的に説得力のある英語音声に集中し、追加作業を引き受けるチームには、微調整によって言語横断へ広げる道を用意しています。

よくある質問

MetaVoice は中国語や中国語と英語のコードスイッチングに対応していますか?

そのままでは対応していません。文書化されている中心言語は米国英語と英国英語で、言語横断機能は独自データによる微調整を通じてのみ利用できます。ベースモデルに中国語や混合言語のコードスイッチングをネイティブ対応するとした文書はありません。

MetaVoice で声をクローンするには、参照音声がどれくらい必要ですか?

米国英語または英国英語の声をゼロショットでクローンするには約30秒です。微調整による言語横断やアクセント適応は、わずか1分のデータでも動作したと報告されています。

MetaVoice は商用でも無料で使えますか?

はい。使用制限のない Apache 2.0 ライセンスで公開されており、オープンソース TTS モデルの中でも特に寛容な選択肢の1つです。

設計目標としての「ハルシネーションなし」とは、ここでは何を意味しますか?

入力テキストにない意図しない単語、音、アーティファクトをモデルが生成しないようにするという、具体的なエンジニアリング上の優先事項を指します。感情表現力と並ぶ信頼性重視の目標であり、起こり得るすべての生成エラーをなくすという主張ではありません。

量子化は音質に影響しますか?

はい。int4 と int8 のどちらの量子化モードも、一部の音質と引き換えに推論を高速化します。int4 は標準精度よりおよそ2倍高速です。

参照音声から似た声の音声を生成

参照音声と新しいテキストから似た声を生成する同様のワークフローには、Echoraの音声クローンを利用できます。自分の声、または使用について明示的な許可を得た参照音声をアップロードし、最大5,000文字の新しいテキストを入力すると、参照音声に似た新しい音声を生成できます。

音声クローンを作成 →