EchoraEchora
モデル一覧に戻る

Bark:音声を数ある音の一つとして扱うモデル

2026年8月31日
•
7分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

一般的なTTSモデルに笑い声を求めると、何も聞こえないか、効果音ライブラリから雑に貼り付けたような音が返ってきます。SunoのオープンソースモデルBarkは、最初から狭義のテキスト読み上げエンジンとして作られたわけではないため、異なる方法で処理します。Barkはテキストから音を生成するモデルであり、話し声はたまたま得意とするものの一つにすぎません。文章に [laughs] を入れると、Barkは前後の言葉を生成するのと同じように、文脈に沿って自ら笑い声を演じます。

Barkとは?

BarkはSunoが開発し、MITライセンスで公開したTransformerベースの生成オーディオモデルです。テキストから音素、音響特徴量、波形へと進む従来のTTSパイプラインとは異なり、テキストトークンの代わりにオーディオトークンを出力する言語モデルのように動作します。3段階の自己回帰パイプラインを通じて、記述されたプロンプトを24kHzの波形へ直接変換します。まず意図した内容を表す意味トークンを生成し、次に粗い音響トークン、最後に細かい音響トークンを生成します。基盤となるオーディオトークン化にはMetaのEnCodecを使用します。どの段階にも音素変換はありません。テキストが入力されると、次第に詳細になる音声表現がエンドツーエンドで出力されます。

角括弧タグ:笑い声やため息が実際に機能する仕組み

これはBarkを特徴づける機能で、実際にとても簡単に使えます。入力テキストへタグを直接挿入すると、非言語音や感情の合図が発動します。[laughter]、[sighs]、[gasps] などのマーカーを入れると、モデルは文中のその位置で音を生成し、別の音声クリップを差し込むのではなく、その時点で話している声が演じます。角括弧タグに加えて、Barkは通常の書式も話し方の合図として読み取ります。単語を大文字にすると強調する方向へ働きかけ、文末を「...」で濁すと自然なためらいが生まれます。どちらの効果にも専用パラメーターは不要です。

音声だけではない

Barkは話し声に限定せず、音全般を生成するため、テキストプロンプトから簡単な音楽、背景の環境音、基本的な効果音も直接作れます。これは専用TTSモデルの設計範囲を完全に超える機能です。自然なコードスイッチングで12を超える言語に対応しているため、文の途中で言語が切り替わる台本でも生成を分ける必要はありません。また、単一のデフォルト音声ではなく、さまざまな声のスタイルを網羅する複数の話者プリセットが用意されています。

Barkにできないこと(始める前に必ず確認)

Barkが実際に何を得意とするかを左右するため、いくつかの率直な制限を事前に知っておく価値があります。

主目的は音声クローンではありません。 クローン重視の多くのシステムとは異なり、Barkの標準ワークフローは、短いクリップから任意の参照音声を再現するのではなく、内蔵の話者プリセットを中心に構成されています。特定の人物の声をクローンすることが中心要件なら、その目的のために作られたモデルの方が適しています。

出力が本当に予想外になることがあります。 Barkは制約されたTTSシステムではなく完全な生成モデルなので、フレーズを飛ばしたり、求めていない音を加えたり、入力したとおりに発話しなかったりと、予想外の形で入力プロンプトから外れる場合があります。これはアーキテクチャの構造的な性質で、設定によって取り除けるバグではありません。

遅く、1回あたりの生成時間にも制限があります。 Barkの自己回帰パイプラインでは、GPUを使っても1文の生成に通常5〜15秒かかります。また、各生成呼び出しは約13-14秒の音声に制限されています。長いコンテンツは1回で生成せず、複数の呼び出しに分割する必要があります。

Barkを始める

  1. pipでインストールするか、リポジトリをクローンする。 pip install git+https://github.com/suno-ai/bark.git ですぐに始められます。コードを確認または変更したい場合は、リポジトリを直接クローンすることもできます。
  2. PyTorchとCUDAのバージョンを確認する。 BarkにはPyTorch 2.0以降が必要です。GPUで実行する場合はCUDA 11.7または12.0への対応も必要です。
  3. VRAMが限られている場合は小型モデルを使う。 モデルを読み込む前に環境変数 SUNO_USE_SMALL_MODELS=True を設定すると、出力品質が多少下がる代わりに、約8GBのVRAMでBarkを実行できます。
  4. プロンプト内にタグを直接書く。 基本的な生成は数行で済みます。モデルを読み込み、使いたい角括弧タグを含むテキスト文字列を渡し、生成された波形を書き出します。非言語の合図自体に別の設定手順は必要ありません。
  5. 長い台本は複数回の生成に分ける。 1回あたり約13-14秒という制限があるため、長いナレーションは文または段落単位に分割し、生成した音声を連結してください。1回の呼び出しで段落全体を処理できるとは考えない方がよいでしょう。
  6. 単独リポジトリを使いたくない場合は、Hugging Face Transformers統合を試す。 Barkはバージョン4.31.0以降のTransformersに対応しています。プロジェクトがすでにこのライブラリに依存している場合、統合を簡単にできます。

より良い結果を得るためのヒント

  • タグは控えめに、文脈に合わせて使う。 台本で本当に面白い内容の直後に [laughs] タグを置くと自然に聞こえます。非言語タグをあちこちに散らすと効果が薄れ、反応しているというより台本どおりに演じているように感じられます。
  • カスタム音声が必要だと決める前に、話者プリセットを試す。 Barkはゼロショットクローンを中心に作られていないため、任意の参照音声をパイプラインに無理に入れるより、まず内蔵の話者プリセットを確認する方が通常は速く済みます。
  • 予測不能な出力と格闘するより、再生成する。 Barkの生成的な性質を考えると、時折生じる奇妙な結果は、プロンプトエンジニアリングだけで防ごうとするより、同じプロンプトでもう一度生成する方が早く修正できることがよくあります。
  • 最初から1回あたりの長さ制限を考慮する。 長い文章を書き終え、プロジェクトの途中で長さの上限に気づくより、あらかじめ台本を自然な区切りで構成しておく方が手戻りを減らせます。
  • 正確さより表現力が重要な場面に絞って使う。 キャラクターの声の演技、アニメーションコンテンツ、クリエイティブな音声プロジェクトでは、Barkの非言語表現の幅が本領を発揮します。正確で予測可能なナレーションには、より一般的なTTSモデルが適している場合があります。

Barkと他の表現力豊かなTTSモデルの比較

BarkChatterboxCosyVoice3
主な目的生成型テキスト音声感情制御付き音声クローン方言対応の多言語クローン
非言語音ネイティブの角括弧タグ、音楽・効果音にも対応パラ言語タグ(Turboバリアント)専用機能ではない
音声クローン主なワークフローではない対応、ゼロショット対応、ゼロショット
出力の予測可能性プロンプトから外れる場合があるより一貫しているより一貫している
言語13+英語(Multilingual: 23)9言語 + 18の中国語方言
ライセンスMITMITオープン、ホスト型APIあり

Barkが特に強いのは、特定の一人の声を再現することより、笑い声、ため息、声調の変化が重要となる、表現豊かでキャラクター中心の音声です。その用途において、これほど自然に非言語音を生成するオープンソースモデルはほとんどありません。

よくある質問

Barkに笑い声やため息を生成させるには?

音を入れたい位置に、[laughter] や [sighs] などの角括弧タグを入力テキストへ直接挿入します。Barkは別の効果音を必要とせず、現在の話者の声でその音を演じます。

Barkは特定の人物の声をクローンできますか?

主目的としては設計されていません。Barkは参照クリップからのゼロショットクローンではなく、一連のプリセット音声を中心に構成されています。特定の実在する声をクローンするなら、専用のクローンモデルがより適しています。

Barkは商用利用も無料ですか?

はい。BarkはMITライセンスで公開されており、ロイヤリティや別途のライセンス契約なしで商用利用できます。

Barkが入力と違う内容を生成することがあるのはなぜですか?

Barkは制約されたTTSシステムではなく完全な生成音声モデルなので、正確なプロンプトから外れる場合があります。これは設定の問題ではなく、アーキテクチャで知られている特性です。

Barkは1回でどのくらいの長さを生成できますか?

各生成呼び出しは約13-14秒の音声に制限されています。長いコンテンツは複数の部分に分割し、それぞれ生成する必要があります。

Echoraでテキストを音声に変換

テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。

テキストから音声を生成 →