EchoraEchora
モデル一覧に戻る

Llasa:音声合成もLLaMAが身につけた能力の一つ

2026年9月6日
•
7分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

香港科技大学のAudio Labが開発したLlasaは、ある明確な仮説を真正面から検証しています。テキストをトークン化するのと同じように音声をトークンへ変換すれば、既存の大規模言語モデルは音声生成のために専用アーキテクチャを必要とせず、新しい語彙を学ぶだけでよいという仮説です。Llasaは3つの異なる規模でLLaMAモデルを直接拡張し、音声を独自システムが必要な別モダリティではなく、研究でいう「特殊な言語」として扱います。

Llasaとは?

Llasaは、テキストベースのLLaMA言語モデルにXCodec2コードブックの音声トークンを組み込み、1B、3B、8Bのパラメータ規模へ拡張したテキスト読み上げシステムです。このコードブックには65,536種類のトークンが含まれます。学習には25万時間の中国語・英語音声データが使われ、その内訳はオープンソースコーパス(LibriHeavy、Emilia、WenetSpeech4TTS)の約16万時間と、社内データ9万時間です。この手法は標準のLLaMAフレームワークとシームレスに互換性を持つよう設計されています。音声を単一コードブックのトークンに変換し、言語モデルが予測を学べるもう一つの系列として扱うため、TTS専用ツールを一から構築しなくても、既存のLLM圧縮、アクセラレーション、ファインチューニング技術をLlasaへ直接適用できます。

1B、3B、8Bの選び方

同じ基本手法に3つのサイズが用意されていることは、実用上の明確な利点です。単一の固定された規模に縛られず、実際のハードウェアと品質要件に合わせてモデル規模を選べます。

  • Llasa-1B は最も軽量な選択肢です。最高品質を極限まで追求することよりリソース制約が重要な場合に最も実用的で、新しい言語や方言向けに追加のファインチューニングを行う際のベースとして最もよく使われるバージョンでもあります。
  • Llasa-3B は中間に位置し、コミュニティのデモや比較で最も頻繁に取り上げられるバージョンです。どのサイズが用途に合うかわからない場合の妥当な初期選択になります。
  • Llasa-8B は最大かつ最も高性能なバージョンで、複雑なテキスト理解と繊細な音声生成をさらに高める一方、計算コストも相応に大きくなります。

音声生成における推論時計算量のスケーリング

これはLlasaで最も特徴的な研究上の貢献であり、近年のテキストLLMの進歩を牽引した潮流を直接取り入れています。より大きなモデルやより多くのデータで学習することだけで品質を高めるのではなく、Llasaの研究では推論時の計算量を増やすことも検討しています。「より長く考える」ことで優れた回答を出す推論モデルの背景にある大きな考え方を、テキスト推論ではなく音声生成へ応用したものです。そのためLlasaの貢献は、モデルアーキテクチャ自体と同じくらい、推論時の戦略によって固定されたモデルからより多くを引き出す方法にもあります。

高いテキスト理解力

Llasaは、音響モデルにテキストから音素へのパイプラインを後付けしたものではなく、本物の言語モデルを直接基盤としているため、多くの専用TTSシステムがつまずく構造的に複雑なテキストも高い理解力で処理します。プロジェクト自身の例では、番号付きリスト、文中の句読点、引用された会話を含む複数節の文が、Llasa-8Bがつまずかず正しく読み進められるテキストとして特に示されています。

音声プロンプトによる音声クローン

Llasaは、入力テキストだけから自身の一般的な声質で音声を生成することも、音声プロンプトで条件付けして音声をクローンすることもできます。報告では、わずか15秒の参照音声で対象話者の声色と感情的な特徴を捉えられます。この2モード設計により、必要がなければ特定の声をクローンする必要はありません。通常のテキスト読み上げは、付随機能ではなく主要モードとして利用できます。

知っておきたい実用上の特性

Llasa-3Bを使用する場合は、モデルが16kHzの音声入力を想定している点に注意してください。異なるサンプルレートの音声を入力すると結果が悪化することが文書化されています。期待外れの生成結果を見てから不一致に気づくのではなく、推論前に参照クリップを適合するサンプルレートへリサンプリングすることを、標準の前処理手順にする価値があります。

Llasaの始め方

  1. 最初にXCodec2をインストールします。 Llasaの音声トークン化はXCodec2へ直接依存するため、推論や学習を試す前にこの依存関係を動作させてください。
  2. Hugging Faceでモデルサイズを選びます。 HKUSTAudio/Llasa-1B、HKUSTAudio/Llasa-3B、HKUSTAudio/Llasa-8Bはそれぞれ個別にダウンロードできます。常に最大のモデルを選ぶのではなく、ハードウェアの予算と品質要件に合わせて選択してください。
  3. テストには専用の推論リポジトリを使います。 GitHubプロジェクトzhenye234/LLaSA_inferenceは、学習コードベースとは別に、テスト時の計算量スケーリングを実行、検証するために専用設計されています。
  4. ファインチューニングやゼロからの学習には学習リポジトリを使います。 zhenye234/LLaSA_trainingには、ベースの学習プロセスを再現または拡張するために必要なスクリプトと、文書化されたオープンソースのトークン化済みデータセット(LibriHeavy、Emilia、WenetSpeech4TTSの合計約16万時間)が用意されています。
  5. 参照音声のサンプルレートをモデルの要件に合わせます。 特にLlasa-3Bには文書化された16kHz要件があるため、どのサンプルレートも同じように使えると考えず、生成前に音声プロンプトをリサンプリングしてください。
  6. ベース学習の範囲外にある言語や方言には、Llasa-1Bのファインチューニングを検討します。 小さいモデルはファインチューニングの出発点としてより一般的で、広東語などの追加言語へ拡張したコミュニティの取り組みも文書化されています。対象言語が中国語・英語のベース学習で十分にカバーされていない場合、現実的な選択肢です。

より良い結果を得るためのヒント

  • 最初に試すサイズがわからない場合はLlasa-3Bから始めます。 コミュニティでの使用例やデモで最も頻繁に取り上げられているため、あまり言及されない1Bや8Bのチェックポイントより、比較対象やトラブルシューティング情報を見つけやすくなります。
  • 本当の強みを見るため、実際に複雑なテキストを入力します。 高いテキスト理解力は明確に強調されている能力です。単純で整った文だけを試しても、より基本的なTTSパイプラインとLlasaの違いは見えてきません。
  • クローンには15秒以上のクリーンな参照クリップを使います。 対象音声の声色と感情的な特徴を安定して捉えるための実用上の最短時間として、一般的に挙げられています。
  • 中国語・英語以外で、ファインチューニングなしに高い性能が出るとは考えないでください。 たとえば広東語の独立評価では、ベースのLlasa-1Bは広東語データで専用のファインチューニングを行うまで、広東語専用モデルや多言語モデルを明確に下回りました。対象言語が中国語でも英語でもない場合は、ファインチューニング工程を見込んでください。
  • 共通のLLaMAアーキテクチャを生かし、LLM向けの手法を活用します。 Llasaは実際にLLaMAフレームワーク上に構築されているため、量子化、LoRAファインチューニングなど、確立されたLLM最適化手法は、まったく異なるTTSアーキテクチャよりも素直に転用できる可能性が高くなります。

Llasaと他のLLMベースTTS手法の比較

LlasaOuteTTSCosyVoice3
ベースアーキテクチャLLaMA(1B/3B/8B)+ XCodec2トークンLLaMA/Qwen + DACトークン教師ありセマンティックトークン + フローマッチング
モデルサイズの選択肢1B、3B、8B350M–1B0.5B
言語中国語、英語23(v1.0)9言語 + 18の中国語方言
音声クローン対応、約15秒の音声プロンプト対応、約10秒の参照音声対応、約3〜10秒の参照音声
llama.cpp / GGUFでの実行主要な導入方法ではないネイティブ対応非対応
初期状態での方言性能中国語・英語以外はファインチューニングが必要英語重視中国語方言への強力なネイティブ対応

Llasaの明確な立ち位置は、「純粋な言語モデリングとしてのTTS」という手法の中で、1Bから8Bまで実際にモデルサイズを柔軟に選べることと、推論時計算量のスケーリングに研究の重点を置いていることです。3つとも似たアーキテクチャの系統に属しますが、llama.cppを優先するOuteTTSの導入方針や、方言の広さを重視するCosyVoice3とは力点が異なります。

よくある質問

Llasaの1B、3B、8Bは何が違いますか?

基礎となる手法は同じで、規模が段階的に大きくなります。1Bは最も軽量で、ファインチューニングの出発点として最も一般的です。3Bはコミュニティのデモで最も頻繁に使われ、8Bは最大のモデルとして、より高い計算コストで最も強いテキスト理解力と生成品質を提供します。

Llasaで音声をクローンするには、どの程度の参照音声が必要ですか?

対象話者の声色と感情的な特徴を捉えるには、約15秒のクリーンな参照音声で十分だと一般にされています。

Llasaは中国語と英語以外でも高い性能を発揮しますか?

初期状態では高くありません。たとえば広東語の独立テストでは、その言語のデータで専用のファインチューニングを行うまで、ベースモデルは広東語専用システムや多言語システムを下回りました。

Llasaにおける「テスト時コンピュートのスケーリング」とは何ですか?

学習時の規模だけに頼らず、推論時に追加の計算を使って出力品質を高めることです。推論重視の言語モデルが推論時の計算を増やして優れた回答を生成する考え方を、音声生成へ応用したものです。

Llasa-3Bが16kHzの音声入力を特に必要とするのはなぜですか?

そのチェックポイントに文書化された要件です。他のサンプルレートの音声を入力すると結果が悪化することが知られているため、参照クリップを事前に16kHzへリサンプリングすることを標準手順にする価値があります。

Echoraでテキストを音声に変換

テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。

テキストから音声を生成 →