Resemble AI:セキュリティチームの発想で作られた音声クローン
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
多くの音声クローンツールは、セキュリティを後付けで扱います。つまり製品機能ではなく、利用規約に記載する一項目にすぎません。Resemble AI は逆の発想で事業を築きました。ほかのプラットフォームと同様に短いサンプルから声をクローンしますが、生成するすべてのクリップには目に見えない電子透かしが入り、さらに同じ会社が、ほかのツールで作られたディープフェイクを見つけるための検出技術も販売しています。ブランド音声、俳優やタレントの声の再現、あるいは「本物らしく聞こえること」と同じくらい「本物だと証明できること」が重要なコンテンツを扱うなら、Resemble AIがクローンと出所証明を組み合わせる仕組みは、詳しく理解する価値があります。
Resemble AIとは?
Resemble AIは、Zohaib AhmedとSaqib Muhammadが2019年に設立した音声AI企業です。トロントで創業し、現在はサンフランシスコ・ベイエリアに本社を置いています。同社は5回の資金調達ラウンドで約2,500万ドルを調達しており、その中には2025年12月にGoogle AI Futures Fund、Sony Innovation Fund、KDDI、Okta Venturesが出資した1,300万ドルの戦略ラウンドも含まれます。これらの投資家自身が不正防止や通信セキュリティに関心を持っていることは、Resembleの製品ページと同じくらい、その位置づけを物語っています。顧客はエンターテインメントスタジオ、Fortune 500の通信事業者、政府機関に及びます。同社は1つのプラットフォームのもとで、生成音声スタジオと、単体でも販売するディープフェイク検出・電子透かしスイートという、相互に関連する2つの事業を運営しています。Resemble AIは、商用クローンツールのセルフホスト代替として多くのチームが利用する、MITライセンスのオープンソースTTSモデルChatterboxの開発元でもあります。
Resemble AIの機能上の強み
- 短いサンプルから声をクローンし、そこから継続して活用できます — Resembleは約30〜60秒の元音声から実用的な音声クローンを作成し、本番用途向けには再現度が高い「Pro」クローン階層も提供します。
- 生成されるすべてのクリップに標準で電子透かしが入ります — ResembleのPerTH電子透かしは、知覚できない改ざん耐性のある信号を各出力に埋め込みます。そのため、再エンコードや形式変換の後でも、後から出所を検証できます。
- ほとんどの競合には存在すらしないディープフェイク検出エンジン — Resemble Detect(DETECT-3B OmniやDETECT-Worldなどのモデルを基盤とする)は、音声、動画、画像コンテンツをリアルタイムでフレームごとに分析し、合成または加工されたメディアを検出します。音声生成の追加機能としても、単独のセキュリティ製品としても販売されています。
- 月額プランを強制しない従量課金 — Flexプランでは、TTS、音声クローン、検出を秒単位で課金し、クレジットに有効期限はありません。他人の利用パターンに合わせた規模のサブスクリプションに縛られずに済みます。
- クローンの流れに組み込まれた同意確認 — 他人の声をクローンする場合は、作成時に同意を確認する必要があります。無断利用を事後に検出するものと同じ電子透かし・検出技術スタックが、この仕組みを支えています。
Resemble AI音声クローンの仕組み
クリーンな参照録音をアップロードすると、実用的なクローンならわずか30〜60秒の音声から、任意のテキストで発話させられる音声モデルが生成され、話す速さや感情表現も調整できます。低価格の「Rapid」クローン階層は簡易プロトタイプや単発プロジェクトに向いています。「Pro」クローン階層は月額料金が高くなりますが、継続利用するブランド音声や、許諾を得た俳優・タレントの声の再現に必要な高い再現度を実現します。リアルタイムの音声変換も利用でき、テキストから生成する代わりに、話者が話している最中にその声を対象の声へ変換できます。
Resemble AIのセキュリティ技術スタックの実際の仕組み
これはResembleをほとんどの音声クローン競合と分ける部分であり、連携するよう設計された2つの独立した技術で動作します。
**電子透かし(PerTH)**は、生成時に聞こえない信号を音声波形へ直接埋め込みます。電子透かしは、圧縮、再エンコード、さらには別のモデルの学習データとしての利用といった一般的な変換に耐えるよう作られています。そのため、再アップロード、編集、メタデータの削除が行われた後でも、後からスキャンしてクリップがResemble由来であることを確認できます。
**検出(Resemble Detect)**はその逆の機能です。Resembleが生成したコンテンツに印を付けるのではなく、あらゆるソースのコンテンツを分析し、AI生成または加工された可能性を示します。現在の検出モデルであるDETECT-3B Omniと、より新しいDETECT-Worldは、音声、動画、画像をフレームごとに分析し、既知の合成パターンだけでなく、照明や連続性といった物理的一貫性の信号も確認します。これにより、DETECT-Worldは専用の学習対象ではなかった生成器の出力も検出できます。検出はAPI経由の並行プロセスとして実行されるため、監視対象のライブ通話やストリームに遅延を加えません。
電子透かしと検出は一体となって、Resembleが「トラストスタック」と呼ぶものを形成します。自分のコンテンツについて証明可能な出所情報を提供し、自分が生成していないコンテンツを調べる方法も提供します。俳優・タレントの声やブランド音声、あるいは法的リスクを伴うものをクローンするチームにとって、これは「この音声が自社のものか(そうでないか)をどう証明するのか」という問いに対する実用的な答えです。
Resemble AI APIの始め方
- アカウントを作成し、APIページを開きます。 app.resemble.aiで登録し、Account → APIへ移動して、自分専用のAPI tokenを確認します。
- APIキーをコピーします。 Resembleは1回だけ表示するのではなく、そのページにtokenを直接表示します。プロジェクトへハードコードせず、環境変数として保存してください。
- 使用言語向けのSDKをインストールします。 公式ライブラリは、
pip install resemble(Python)、npm install @resemble/node(Node.js)、bundle add resemble(Ruby)で利用できます。 - リクエストの種類を選びます。 ResembleのAPIはAsync、Sync、Streamingの3つの合成モードをサポートしているため、用途に応じて即時再生、バッチ生成、連続ストリーミングを選べます。
- 最初の呼び出しを行います。 一般的な流れでは、
Resemble.api_key('YOUR_API_KEY')で認証し、プロジェクトと音声UUIDを取得してから、テキストを指定してclipsエンドポイントを呼び出し、音声を生成します。
Resemble AIでより良い結果を得るためのヒント
- 静かな場所で、マイクとの距離を一定に保って元サンプルを録音します。 30〜60秒の短いサンプルでも、長い台本でクローン音声に一貫性がなくなる最も一般的な原因は背景ノイズです。
- 継続的に使うものにはProクローン階層を選びます。 Rapid階層は単発テストには十分ですが、ブランド音声や継続登場するキャラクターには、より再現度の高い選択肢が適しています。
- Flexを大規模に採用する前に利用量を試算します。 秒単位の課金は最初こそ安価ですが、利用の多いIVRなど大規模なワークロードでは、定額サブスクリプションより高くなる可能性があります。安いと決めつける前に、月間利用秒数を見積もってください。
- 公開チャンネルに配信するならDetectを有効にします。 自社出力への電子透かしと、受信または第三者コンテンツへの検出を組み合わせれば、問題の半分だけでなく全体をカバーできます。
- 他人の声をクローンする前に、文書による同意を取得します。 Resemble自身の利用規約で求められており、電子透かし・検出技術スタックも、その要件を事後に実施する目的を一部担っています。
Resemble AIとElevenLabsの比較
| Resemble AI | ElevenLabs | |
|---|---|---|
| 料金モデル | 秒単位の従量課金、月間最低額なし | 定額の月額サブスクリプション階層 |
| 音声クローン | 約30〜60秒のサンプル、Rapid/Pro階層 | Instant(1〜3分)/ Professional(30分〜3時間)階層 |
| 組み込み電子透かし | あり — PerTHを標準適用 | 限定的で、製品の中心的な注力分野ではない |
| ディープフェイク検出 | あり — Resemble Detectを単独販売 | 製品としては提供していない |
| 効果音/吹き替え | 中心的な製品ではない | あり — 専用の効果音・吹き替えツール |
| 最適な用途 | セキュリティと出所情報を重視する用途 | TTS、クローン、音声を含む幅広いコンテンツ制作 |
どちらかが絶対的に優れているわけではありません。両者は異なる優先事項に最適化されています。ElevenLabsは、より多くのクリエイティブツール(効果音、吹き替え、大規模な音声ライブラリ)を1つの定額サブスクリプションにまとめています。Resemble AIは焦点をクローンとその周囲の信頼レイヤーに絞っています。音声コンテンツが本物であると証明できる必要がある場合、つまりブランド音声、許諾を得た俳優・タレントの声、または合成音声をめぐる争いが法的問題になり得るものでは、その違いが最も重要になります。
よくある質問
Resemble AIは何に使われますか?
Resemble AIは、音声クローン、リアルタイム音声変換、ブランドやキャラクター音声の作成、Detectと電子透かしツールを使ったディープフェイク検出またはコンテンツ認証に利用されます。
Resemble AIは無料ですか?
Flexプランは0ドルから始まり、月間契約のない従量課金制です。生成量に応じて秒単位で課金され、使用中として維持する音声クローンごとに少額の月額料金が加わります。
Resemble AIの電子透かしはどのように機能しますか?
Resembleは、生成するすべてのクリップに知覚できない改ざん耐性のある電子透かし(PerTH)を埋め込みます。この電子透かしは再エンコードや形式変更に耐えるよう設計されているため、ファイルが編集されたり別の場所へ再アップロードされたりしても、後から出所を確認できます。
Resemble AIで声をクローンするには、どのくらいの元音声が必要ですか?
実用的なクローンは、わずか30〜60秒のクリーンな参照音声から作成できます。本番やブランド音声用途には、再現度が高いPro階層も用意されています。
Resemble AIで声をクローンするには同意が必要ですか?
はい。許可なく他人の声をクローンすることはResemble AIの利用規約に違反し、プラットフォームもクローン作成時に同意の確認を求めます。
Resemble AIのAPIキーはどうすれば取得できますか?
app.resemble.aiへログインし、Account → APIに移動して表示されたtokenをコピーします。このtokenはResembleのAsync、Sync、Streamingエンドポイントで利用できます。
参照音声から似た声の音声を生成
参照音声と新しいテキストから似た声を生成する同様のワークフローには、Echoraの音声クローンを利用できます。自分の声、または使用について明示的な許可を得た参照音声をアップロードし、最大5,000文字の新しいテキストを入力すると、参照音声に似た新しい音声を生成できます。