EchoraEchora
モデル一覧に戻る

VALL-E X:1文を入力し、あらゆる言語で出力

2026年9月1日
•
読了時間: 約7分

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

VALL-E は、同じ言語内で声をクローンするには3秒のクリップで十分だと証明しました。そこから生まれる当然の疑問は、さらに難しいものでした。同じ短いクリップを使って、その人が実際には一度も話したことのない言語を話させることはできるのでしょうか。Microsoft が開発した言語横断型の後継モデル VALL-E X は、できると答えます。単一言語話者による1文を使い、その人が対象言語を実際に話した録音を一度も必要とせず、まったく異なる言語で同じ声の自然かつ流暢な音声を生成します。

VALL-E X とは?

VALL-E X は、Microsoft の研究者がオリジナルの VALL-E アーキテクチャを直接拡張する形で発表した、言語横断型のニューラル音声コーデック言語モデルです。短いプロンプトから追加学習なしで声を捉えるという VALL-E の中核的なインコンテキスト学習能力を継承し、複数分野にまたがる大規模な多言語・複数話者の音声データで学習することにより、その能力を言語横断生成向けに特化して拡張しています。

実際には、話者の母語による1文を渡すと、VALL-E X はその人の声の個性、感情的な調子、さらには元のクリップに含まれる音響環境まで保ちながら、同じ声で対象言語の音声を生成します。その話者が両方の言語で録音したペアデータは不要です。モデルは、その人が対象言語を話す音声を一度も聞いたことがなくてもかまいません。

言語横断転送の実際の仕組み

この仕組みは、VALL-E の音素と音響トークンを用いる手法を、言語横断の場面に合わせて自然に拡張したものです。VALL-E X は、原文と対象テキストの両方から得た音素列に加え、元の話者の音響トークン(ニューラル音声コーデックを使って参照クリップから抽出)を受け取ります。そして、これらを組み合わせたプロンプトとして用い、対象言語の音響トークンを生成します。出力トークンは、VALL-E のオリジナルアーキテクチャと同じ方法で実際の音声波形へデコードされます。

学習に、同じ話者による言語横断の対応データは必要ありません。その代わり、モデルは異なる言語の音素列と音響トークン列を連結した多言語データセットから学習し、そこに、その時点でどの言語を生成するのかを伝える言語 ID 信号を加えます。この言語 ID の仕組みにより、VALL-E X にはもう1つ、より遊び心のある機能も備わっています。それは、アクセントを意図的に制御することです。完全にネイティブらしい結果だけを目指すのではなく、明らかな英語アクセントの中国語音声を生成したり、その逆を行ったりできます。

声だけではない情報を保持

オリジナルの VALL-E と同様に、抽象化された話者埋め込みではなく実際の音響トークンを扱うため、VALL-E X が言語の切り替えを越えて引き継ぐのは声の個性だけではありません。元のクリップの感情的な調子や音響環境も、対象言語の出力に残る傾向があります。これは吹き替えやコンテンツのローカライズといった用途で実用上重要な点です。言語を切り替えたときに話者の感情表現が失われてしまえば、そもそもその人の実際の声を使う意義が損なわれるからです。

VALL-E X の評価方法

Microsoft の評価では、LibriSpeech に EMIME と AISHELL-3 の各データセットを組み合わせ、英語と中国語の双方向で言語横断生成をテストしました。中国語話者をプロンプトとして英語音声を生成する場合と、英語話者をプロンプトとして中国語音声を生成する場合の両方です。報告された結果では、高品質なゼロショット言語横断合成を実現し、従来の言語横断 TTS 手法で長く弱点となっていた外国語アクセントのアーティファクトを大きく低減しました。また、同じ基盤アーキテクチャを音声間翻訳タスクへ拡張できることも示されました。

現在 VALL-E X を使い始める方法

オリジナルの VALL-E と同様に、Microsoft は研究成果を発表しましたが、公式コードや学習済みモデルの重みは公開しませんでした。ただし最初のモデルとは異なり、こちらに対するコミュニティの取り組みからは、よりすぐに使えるものが生まれています。

  1. Plachtaa/VALL-E-X のコミュニティ再現版を使う。 このオープンソース実装は独自のモデルをゼロから学習し、特筆すべきことに、その学習済みの重みを実際に公開しました。ゼロからの学習が必要な VALL-E の再現版と比べ、より実用的な出発点です。
  2. 3言語に対応している点を押さえる。 コミュニティモデルは英語、中国語、日本語に対応し、3言語すべてで自然かつ表現力のある合成と、言語間の生成が可能です。
  3. 3〜10秒の参照音声から声をクローンする。 これは、言語横断生成を試す前段階のゼロショット音声クローン向けに、この再現版が想定している実用的な長さです。
  4. デコーダーが元の設計から更新されている点を把握する。 コミュニティ実装では、音質向上を目的として EnCodec デコーダーを Vocos デコーダーに置き換え、さらに安定した生成結果を得るためにバッチ AR デコードを追加しました。原論文を文字どおり再現しただけではない、実質的な改善です。
  5. 音声間翻訳が組み込まれているとは考えない。 Microsoft の原研究では S2ST 拡張が説明されましたが、別途学習が必要なため、コミュニティ再現版にはそのモジュールが含まれていません。標準的な翻訳 API(Google Translate など)と組み合わせ、生成前に原文を対象言語へ翻訳する方法が、文書化された代替策です。
  6. アクセント制御を直接試す。 通常の言語横断クローンにとどまらず、対象の出力言語と言語 ID 信号を意図的に一致させず、アクセント制御が働く様子を確かめてみてください。ある言語を別の言語のアクセントで話すという、ほとんどのクローンモデルと比べても本当に特徴的な機能です。

より良い結果を得るためのヒント

  • ノイズがなく、1文だけの参照クリップを用意する。 言語横断転送のすべてが1つの原言語プロンプトにかかっているため、その録音品質は対象言語の出力の忠実度にとりわけ大きく影響します。
  • 具体的な言語ペアを双方向で試す。 言語横断の品質は必ずしも対称ではありません。言語 A の話者から言語 B を生成する場合と、その逆では結果が異なることがあるため、プロジェクトで実際に必要な方向を検証してください。
  • アクセントが創作上の目的なら、言語 ID を意図的に使う。 これは単に許容すべき副作用ではありません。様式化されたアクセントが実際に望ましいコンテンツ(たとえば、特有の話し方を持つキャラクター)では、言語 ID の仕組みは精度設定にとどまらない、本格的な創作ツールになります。
  • 完全な音声間翻訳が必要なら、翻訳工程を別に計画する。 コミュニティ再現版には S2ST が組み込まれていないため、モデルだけで原文から対象テキストへの変換まで処理できると期待せず、パイプラインに外部翻訳の工程を用意してください。
  • 利用するコミュニティ再現版のライセンスを確認する。 研究モデルの非公式な再現版と同様に、商用利用の前に、採用する実装の学習データの出所とライセンス条件を確認してください。

VALL-E X、VALL-E、その他の多言語クローンモデルの比較

VALL-E XVALL-E(オリジナル)XTTS-v2
中核機能言語横断音声転送同一言語でのゼロショットクローン17言語対応の多言語クローン
言語をまたいだ同一話者はい、中核的な設計目標非対応はい
アクセント制御はい、言語 ID による該当なし専用機能ではない
参照クリップの長さ約3〜10秒約3秒約6秒
公式公開の重みなしなしあり
利用可能なコミュニティ再現版あり、学習済みの重みも公開自前での学習が必要該当なし、公式公開済み
感情/環境の引き継ぎあり、言語をまたいで保持あり、同一言語内参照エンコーダーにより自動

VALL-E X の具体的な貢献は、言語横断音声転送に同じ話者が両方の言語を話した対応学習データは不要だと証明したことです。同一言語でのクローンよりも明らかに難しい問題を、オリジナルの VALL-E を有名にしたのと同じインコンテキスト学習の手法で解決しました。

よくある質問

Microsoft から VALL-E X の公式な重みをダウンロードできますか?

いいえ。オリジナルの VALL-E と同様に、Microsoft は VALL-E X を説明する研究を発表しましたが、公式コードや学習済みモデルを公開しませんでした。現在このアーキテクチャを実際に使う方法は、すぐに利用できる学習済みの重みを提供するコミュニティ再現版 Plachtaa/VALL-E-X です。

VALL-E X はどの言語に対応していますか?

Microsoft の原研究では、英語と中国語の言語横断生成を中心に評価しました。広く使われているコミュニティ再現版では、英語、中国語、日本語へ対応範囲を広げています。

VALL-E X には同じ話者が両方の言語を話した録音が必要ですか?

いいえ。それこそが、このモデルが解決する中心的な問題です。話者の原言語による参照クリップだけを使って、その人の声による対象言語の音声を生成します。その特定の話者について、言語横断で対応した学習データは必要ありません。

VALL-E X ではアクセントを意図的に制御できますか?

はい。言語 ID の仕組みにより、外国語アクセントを抑えて自然でネイティブらしい音声にすることも、英語アクセントで中国語を話すといった特定のアクセント効果を意図的に作ることもできます。

VALL-E X には音声間翻訳が含まれますか?

Microsoft の原研究ではこの機能への拡張が説明されましたが、広く使われているコミュニティ再現版には標準では含まれていません。別の翻訳工程と組み合わせる方法が、文書化された代替策です。

Echoraでテキストを音声に変換

テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。

テキストから音声を生成 →