EchoraEchora
モデル一覧に戻る

Parler-TTS:録音する代わりに、欲しい声を記述する

2026年9月4日
•
7分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

どのクローンモデルも、最初に同じものを求めます。参照用の音声クリップです。Hugging Faceが開発したParler-TTSは、その要件を完全に省きます。音声サンプルの代わりに、欲しい声を説明する一文を書くと、モデルがその説明に合う音声を生成します。「やや低めの声を持つ女性話者が、明瞭な近接録音で速く話す」という文だけで、ここでは完全な音声仕様になります。マイクは必要ありません。

Parler-TTSとは?

Parler-TTSはHugging Faceによるオープンソースのテキスト読み上げプロジェクトです。もともとStability AIとエディンバラ大学が行った、自然言語による指示を用いた高忠実度TTSの研究を再現するものとして構築されました。この分野の多くのオープンソース公開物と比べて際立つのは、実際にどこまで完全に公開されているかです。最終チェックポイントだけでなく、データセット、前処理パイプライン、学習コード、モデルの重みがすべて寛容なライセンスの下で公開されています。これは大半のTTSプロジェクトよりも明らかに透明性の高い公開方法であり、コミュニティがブラックボックスで推論を実行するだけでなく、再学習、ファインチューニング、またはプロジェクトの結果を完全に再現できる理由でもあります。

自然言語による音声制御の実際の仕組み

Parler-TTSが受け取るのは、1つではなく2つの独立したテキスト入力です。読み上げたいテキストと、どのように聞こえるべきかを自然言語で記述した文です。その記述によって、話者の性別、ピッチ、話す速さに加え、背景雑音や残響といった録音特性も制御できます。数値スライダーや参照音声ではなく、すべて通常の文章で指定します。「男性話者が雑音のある録音で、単調なスピーチを速いペースで行う」といった記述が解析され、生成結果へ直接適用されます。

これを実現するには、現実的なデータ上の問題を解決する必要がありました。音声データセットには自然言語の説明が付いていません。Hugging Faceはこの隔たりを埋めるために、関連プロジェクトDataSpeechを構築しました。DataSpeechは音声サンプルに客観的な特徴ラベル(雑音レベル、発話速度、残響、そのほか同様の属性)を付け、そのラベルを大規模言語モデルへ渡して、自然な説明文を生成させます。LLMが生成した説明と対応する音声の組み合わせが、記述的な言葉と実際の音響特性を関連付けるようParler-TTSに教える学習データになります。

実際に制御できること

ベースモデルは、性別、ピッチ、発話速度、音響環境(背景雑音、残響、録音の明瞭さ)を記述によって制御できます。これらは、ほぼどの話者にも共通する属性です。感情表現はさらに一歩進んだ、ファインチューニングに基づく能力です。Hugging Faceは、4名の話者を収録した高品質な表現音声コーパスであるExpressoデータセットでファインチューニングしたバージョンを公開しました。これは、感情や演技スタイルのプロンプトに従うことをモデルに教えるためのもので、同じ自然言語制御の仕組みを、ベースモデルが標準で扱う範囲よりも表現豊かな領域へ広げています。

モデルファミリー

Parler-TTSには、サイズと学習規模が異なるいくつかのバージョンが公開されています。それぞれがデータまたは能力の面で一段階進んだものです。

  • Parler-TTS Mini v0.1 — 最初のリリース。約10,500時間の音声で学習され、自然言語で記述する中核的な手法を確立しました。
  • Parler-TTS Mini v1 / v1.1 — より大規模な45,000時間のデータセットで学習されています。v1.1では、将来の多言語学習を簡素化するため、プロンプト用トークナイザー(Llama 2トークナイザーをベースに、語彙を拡大し、バイトフォールバック処理に対応)が特に改善されました。それ以外の基盤モデルと学習データはv1と同一です。
  • Parler-TTS Large v1 — 22億パラメーターのモデルで、同じく45,000時間のデータセットで学習されています。計算負荷も相応に大きくなりますが、ファミリー内で最高の品質水準を提供します。

Parler-TTSを使い始める

  1. ライブラリをインストールします。 pip install git+https://github.com/huggingface/parler-tts.gitを実行すると、ソースリポジトリから推論パッケージを直接取得できます。
  2. 選んだモデルとトークナイザーを読み込みます。 ParlerTTSForConditionalGeneration.from_pretrained()に目的のチェックポイント(Mini v0.1、Mini v1.1、Large v1)を指定し、対応するAutoTokenizerと組み合わせます。
  3. 2つのプロンプトを別々に書きます。 1つの変数に読み上げたいテキストを入れ、もう1つに声と話し方の自然言語による記述を入れます。両方を個別にトークン化してから生成処理へ渡します。
  4. v1.1以降を使う場合は2つのトークナイザーを使用します。 以前のバージョンと異なり、Mini v1.1とLarge v1では、記述と読み上げるテキストにそれぞれ別のトークナイザーを使います。どのバージョンのドキュメントを参照しているか確認してください。v0.1の単一トークナイザー方式と新しいチェックポイントを混同すると問題が起きます。
  5. 特定の能力が必要なら、独自のアノテーション済みデータセットでファインチューニングします。 DataSpeechパイプラインは、新しい音声スタイル、言語、表現能力に向けてParler-TTSをファインチューニングするために必要な自然言語の記述を生成できるよう、専用に設計されています。Expressoでファインチューニングしたバージョンの作成にも同じ手法が使われました。

より良い結果を得るためのヒント

  • 声の記述は曖昧にせず、具体的にします。 「やや低めの声を持つ女性話者が、非常に明瞭な近接録音で、少し速く言葉を話す」という記述は、「普通の声」よりもはるかに多くの情報をモデルに与えます。それぞれの制御可能な要素(性別、ピッチ、速度、録音品質)を具体的にするほど、結果は一貫しやすくなります。
  • プロンプトで国籍を記述しないようにします。 コミュニティによるファインチューニングの取り組みでは、学習データや推論プロンプトに国籍を含めると、アクセントの精度が上がるどころか、出力品質が低下する場合があると分かっています。国籍は省き、ほかの表現(アクセント、声の調子、テンポ)にその情報を担わせてください。
  • 感情や演技スタイルのプロンプトには、Expressoファインチューニングを明確に選びます。 ベースモデルは、より普遍的な属性(性別、ピッチ、速度、環境)向けに調整されています。プロジェクトで特定の感情表現が必要なら、汎用ベースモデルではなく、そのために作られたExpressoベースのチェックポイントを使います。
  • 品質要件にモデルサイズを合わせます。 大半のプロジェクトでは、Mini v1.1がより実用的なデフォルトです。推論速度やリソース使用量よりも最高品質が重要な場合に限って、Large v1の2.2Bパラメーターを選びます。
  • 英語以外の言語では、独自のファインチューニングを学習することも検討します。 Parler-TTSのベースモデルは主に英語に重点を置いていますが、コミュニティの取り組み(フランス語のファインチューニングは文書化された一例)から、DataSpeechとファインチューニングを組み合わせる手法でほかの言語へ拡張できることが示されています。ただし、公開データセットの品質と量は、依然として実用上の主なボトルネックです。

Parler-TTSと参照音声クローンモデルの比較

Parler-TTSXTTS-v2F5-TTS
音声の制御方法自然言語によるテキスト記述参照音声クリップ(約6秒)参照音声クリップ(約5~15秒)
音声サンプルが不要はいいいえいいえ
特定の実在人物の声をクローン設計目標ではないはい、それが中核的な目的はい、それが中核的な目的
パイプライン全体を公開(データ + コード + 重み)はいコードと重みのみコードと重みのみ
モデルサイズMini(10.5K/45K時間)からLarge(2.2Bパラメーター)現行バージョンは1つ現行バージョンは1つ
ライセンスApache 2.0Coqui Public Model License(非商用)CC-BY-NC(非商用)

Parler-TTSの明確な得意分野は、実際の録音をクローンに使うことなく、もっともらしく、仕様を明確に定めた声を必要に応じて生成することです。特定人物のアイデンティティを再現するよりも、声の特性を制御したい場合に役立ちます。また、完全に公開された学習パイプラインは、この規模のプロジェクトでは本当にまれです。

よくある質問

Parler-TTSを使うには参照音声クリップが必要ですか?

いいえ。音声クローンモデルとは異なり、Parler-TTSは、目的の声と話し方を自然言語で記述したテキストに基づいて音声を生成するため、音声サンプルは必要ありません。

実際にどのような声の特性を制御できますか?

ベースモデルでは、性別、ピッチ、発話速度、背景雑音や残響などの音響環境要因を制御でき、すべて自然言語の記述で指定します。感情表現は、Expressoでファインチューニングしたバージョンを通じて提供されます。

Parler-TTSは商用でも無料で使えますか?

はい。オープンソースTTSモデルの中でも寛容な選択肢の1つであるApache 2.0ライセンスで公開され、コード、学習パイプライン、重みのすべてが対象です。

Mini v1とMini v1.1の違いは何ですか?

両者は同じ設定で、同一のデータを使って学習されています。v1.1で変更されたのは、語彙を拡大してバイトフォールバックに対応し、将来の多言語学習を簡素化するために改良されたプロンプト用トークナイザーだけです。

Parler-TTSは特定の実在人物の声をクローンできますか?

それは中核的な設計ではありません。Parler-TTSは、特定の参照話者のアイデンティティを再現するのではなく、テキストの記述に合う声を生成することを中心に構築されています。実在人物の声をクローンするなら、専用のクローンモデルの方が適しています。

Echoraでテキストを音声に変換

テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。

テキストから音声を生成 →