Sesame CSM 1B:テキストだけでなく、会話に根ざした音声
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
多くの TTS モデルは、1つの文を受け取って読み上げます。Sesame の CSM 1B は、それまでの会話全体、つまり書き起こしだけでなく、実際に発話された音声を受け取り、その文脈に基づいて次のセリフを生成します。すでに会話で形づくられたテンポ、ピッチ、感情のトーンまで合わせます。この違いこそが CSM の前提そのものであり、Sesame が「voice presence(声の存在感)」と呼ぶものです。その目標は、音声によるやり取りを単なる読み上げではなく、現実味があり、理解されていると感じられるものにすることです。
CSM 1B とは?
CSM(Conversational Speech Model)は、元 Oculus CEO の Brendan Iribe らが共同創業したサンフランシスコのスタートアップ、Sesame AI によるオープンウェイトの音声生成モデルです。2025年3月に10億パラメータのチェックポイントとして、制約がきわめて緩い Apache 2.0 ライセンスで公開されました。CSM は、テキストだけでなく、交互に並ぶテキストと音声の履歴から直接音声を生成します。その仕組みには、LLaMA をバックボーンとする2つの Transformer で構成されたアーキテクチャが使われています。
内部の仕組み:2つの Transformer と Mimi コーデック
CSM のアーキテクチャは、生成処理を2つの LLaMA 形式の自己回帰デコーダーに分担させます。より大きなバックボーンデコーダーが、交互に並ぶテキストと音声の文脈を処理し、次の音声断片に対する最初のコードブックトークンを予測します。次に、より小さなデプスデコーダーが、そのバックボーンの隠れ状態を受け取り、完全に理解可能な音声の復元に必要な残りの音響コードブックトークンを生成します。
どちらのデコーダーも、Kyutai が開発した分割残差ベクトル量子化(RVQ)音声コーデック、Mimi のトークンを扱います。Mimi は高い音声忠実度を保ちながら、12.5Hz のフレームレートで音声を約 1.1kbps まで圧縮します。これは、より複雑な音響パイプラインに必要な大きな計算負荷をかけずに CSM を実行できるほど効率的な表現です。
本当の違い:音声を実際の会話に根づかせる
ここは少し立ち止まって考える価値があります。小さなアーキテクチャ上の違いとして過小評価しやすいからです。バックボーンデコーダーが過去の音声と過去のテキストの両方へ同時にアクセスできるため、CSM は次の発話を、それまでの会話における実際の音響スタイルに根づかせることができます。そこには、話者のピッチ曲線、テンポ、感情状態も含まれます。単にテキストが示す「こう聞こえるはず」という情報だけから応答を生成するわけではありません。ユーザーが疲れた様子ならそのエネルギーに合わせ、興奮していればより生き生きと話し、会話のテンポが落ちればより自然に間を取れるのは、この具体的な仕組みによるものです。従来の実用音声システムの多くは、やり取りの中で実際に起きた直前の出来事を音響的な根拠にせず、テキスト表現だけから生成します。
率直な注意点:公開チェックポイントと話題になったデモの違い
実際に何が得られるのかは、正確に理解しておく価値があります。CSM のファインチューニング版は、Sesame がホストする音声コンパニオンの Maya と Miles を動かしています。そのデモは、従来の商用 TTS システムよりも本物の会話相手に近く聞こえるとして、2025年2月に大きな話題となりました。一般公開された CSM 1B チェックポイントは、その体験の基盤となるオープンソースのベースモデルであり、話題になったデモ自体を動かしていた正確なファインチューニング版ではありません。それに応じて期待値を調整してください。ベースモデルが本当に有能な土台であることに変わりはありませんが、見出しを飾ったデモ特有の完成度には、Sesame がオープンウェイトとして公開していない追加のファインチューニングが関わっています。
CSM にできないこと
これを中心にシステムを構築する前に、知っておくべき制限がいくつかあります。CSM は汎用マルチモーダル LLM ではなく、音声生成モデルとして特化して学習されています。つまり、テキストは生成できません。CSM が音声に変換する前に、実際の応答内容を作る別の言語モデルと組み合わせる必要があります。また、主に英語向けのモデルでもあります。学習データの混入によって他の言語を多少扱えることはありますが、本格的な英語以外の用途で頼れる機能ではありません。
Sesame は許容される用途についても明確にしています。プロジェクトのガイドラインでは、本人の明示的な同意なく実在する人物になりすます音声を生成すること、偽ニュースや詐欺電話のような欺瞞的または誤解を招くコンテンツを作ること、そしてこの技術を違法または有害な用途に使うことを禁止しています。
CSM 1B の使い始め方
- リポジトリをクローンする。
git clone [email protected]:SesameAILabs/csm.gitを実行し、Python 3.10 の仮想環境を用意して、pip install -r requirements.txtで依存関係をインストールします。 - Hugging Face でゲート付きの両モデルへのアクセス権を得る。 CSM のバックボーンは Llama チェックポイントに依存するため、
sesame/CSM 1Bとmeta-llama/Llama-3.2-1Bの両方について承認済みのアクセス権が必要です。どちらかをダウンロードする前に、huggingface-cli loginでログインしてください。 - Mimi の遅延コンパイルを無効にする。 環境変数
NO_TORCH_COMPILE=1の設定は、Mimi コーデックのコンポーネントに固有のコンパイル問題を避けるため、手順として文書化されています。 - Windows では標準の
tritonの代わりにtriton-windowsを使う。 標準のtritonパッケージは Windows にインストールできず、プロジェクトのドキュメントでもこの代替パッケージが明記されています。 - 完全な会話パイプラインには、別の LLM と組み合わせる。 CSM は音声しか生成しないため、パイプラインの上流にテキスト生成モデルを用意し、CSM が音声化する実際の対話内容を生成させます。
- すぐに使える、より完全なインターフェースが必要ならコミュニティフォークを検討する。
akashjss/sesame-csmなどのプロジェクトは、ベースモデルに Gradio UI と OpenAI 互換 API を追加し、CUDA、MLX、CPU の各デバイスをサポートしています。ベースリポジトリから自作するよりも、利用可能なインターフェースを素早く得られます。
より良い結果を得るためのヒント
- 話してほしい一文だけでなく、実際の会話履歴を与える。 CSM の中核的な強みは、根拠となるテキストと音声の文脈を交互に与えたときに初めて現れます。その履歴なしに一文用の TTS モデルとして使うだけでは、本来の設計目的を十分に活かせません。
- ベースチェックポイントに、話題になった Maya/Miles のデモとまったく同じ品質を期待しない。 あの体験には Sesame がオープンソース化していないファインチューニング版が使われています。公開版 CSM 1B は、話題になった体験の完全な複製ではなく、開発やファインチューニングのための強力な土台として捉えてください。
- CSM が音声のみを生成することを前提にパイプラインを設計する。 CSM が対話の生成と音声化を1ステップで処理すると期待せず、CSM に入力する別のテキスト生成モデルを予算と構成に組み込みます。
- 本番環境で重要な用途には英語だけを使う。 英語以外の能力は偶発的で信頼できないため、このモデルが実際に設計・テストされた唯一の言語は英語だと考えてください。
- 同意となりすましに関する明確な利用ガイドラインを守る。 CSM の出力が文脈を認識しているように説得力ある形で聞こえるからこそ、同意のない声のなりすましに対するプロジェクト独自の制限を、単なる定型文としてではなく真剣に受け止めてください。
CSM 1B と Llama バックボーンの他の音声モデルの比較
| CSM 1B | Orpheus TTS | 一般的な参照音声クローンモデル | |
|---|---|---|---|
| 中核となる入力 | 交互に並ぶテキスト + 音声の会話履歴 | テキスト(任意で音声参照も使用) | テキスト + 1つの固定参照クリップ |
| バックボーン | 2つの Transformer による LLaMA アーキテクチャ | Llama-3B | モデルにより異なる(拡散、フローマッチングなど) |
| コーデック | Mimi(Kyutai)、12.5Hz、1.1kbps | SNAC | モデルにより異なる |
| テキスト生成 | 不可、音声のみ | 不可、音声のみ | 不可 |
| 文脈認識 | 中核的な設計目標 | 主な重点ではない | 主な重点ではない |
| ライセンス | Apache 2.0 | Apache 2.0 | モデルにより異なる |
CSM 1B が特化しているのは、本当の意味で会話に根づかせることです。各セリフを孤立した生成タスクとして扱うのではなく、進行中のやり取りの音響的な現実に合わせます。これは、ナレーション重視のモデルや参照クリップによる音声クローンとは、明確に異なる設計目標です。
よくある質問
CSM は何の略ですか?
Conversational Speech Model の略です。文脈のない孤立した発話を生成するのではなく、対話全体で文脈認識を保つという中核的な設計目標を表しています。
CSM 1B はテキストの応答を単独で生成できますか?
いいえ。CSM は音声生成モデルとして特化して学習されており、テキストは生成できません。CSM が音声に変換する前の対話内容は、別の言語モデルと組み合わせて生成してください。
オープンソースの CSM 1B は、Sesame の話題になった音声デモを動かしているモデルと同じですか?
厳密には異なります。CSM のファインチューニング版が、Sesame の話題になったデモでホストされている音声コンパニオン、Maya と Miles を動かしています。公開版 CSM 1B はそのシステムの基盤となるオープンソースのベースモデルであり、特定のファインチューニング版そのものではありません。
Mimi コーデックとは何ですか?
Mimi は Kyutai が開発した分割残差ベクトル量子化音声コーデックです。CSM はこれを使って音声を離散トークンへ符号化し、高い忠実度を保ちながら約 1.1kbps で音声へ復号します。
CSM 1B は商用でも無料で使えますか?
ライセンス上は可能です。Apache 2.0 ライセンスで公開されています。ただし、Sesame の利用ガイドラインは、同意のない声のなりすましや欺瞞的な利用を明示的に禁止しています。これは、コードのライセンスが制約の緩いものであっても適用されます。
複数話者の台本を会話音声に変換
複数話者の完成した台本がある場合は、Echoraのテキストから会話音声を利用できます。合計5,000文字まで、最大12個の会話ブロックを追加し、各ブロックに音声を割り当て、対応している話し方タグ、安定性、話者強調を調整できます。完成した会話はプレビューしてダウンロードできます。