Respeecher:ハリウッド作品で実際にクレジットされる音声技術
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
『マンダロリアン』 でルーク・スカイウォーカーが再び若い頃の声で話し、『オビ=ワン・ケノービ』 でダース・ベイダーの声が戻ってきたとき、その裏にいたのはAI業界で誰もが知るスタジオではありませんでした。キーウで活動する小さなチーム、Respeecher だったのです。どちらも実際にクレジットされた仕事であり、Lucasfilmが公に認めています。しかも後者は、2022年の侵攻時にチームがロシア軍の爆撃を避けて避難する中で完成させたものでした。このツールが仕事をしているのは、そういう水準の現場です。短いクリップを手早く作る一般消費者向けアプリではなく、デモ映像だけでなく完成した映画でも通用する仕上がりが求められるときに、スタジオが頼る音声変換技術なのです。
Respeecherとは?
Respeecherは2018年2月、Alex Serdiuk、Dmytro Bielievtsov、Grant Reaberによってウクライナのキーウで設立されました。その歴史の大半を、大衆向けアプリの開発を優先するのではなく、映画やテレビの制作現場と直接仕事をすることに費やしてきました。実際にクレジットされた実績には、『マンダロリアン』 の若いルーク・スカイウォーカーの声、Disney+の複数の『スター・ウォーズ』シリーズでのJames Earl Jonesによるダース・ベイダーの声の再現、そして 『ブルータリスト』 でのAdrien BrodyとFelicity Jonesのハンガリー語の台詞の調整があります。『ブルータリスト』はその後アカデミー賞を3部門で受賞し、Respeecherが支援した作品は合計で20件を超えるアカデミー賞ノミネートを獲得しています。同社はロシアによるウクライナへの全面侵攻の間も制作業務を納品し続け、爆撃を避けて避難しながら 『オビ=ワン・ケノービ』 のベイダーの音声を完成させました。AI音声業界の宣伝には、実際の条件下で示された実績よりも将来の構想を語るものが多いだけに、知っておく価値のあるエピソードです。
Respeecherの機能上の強み
- テキストから演技を生成するのではなく、実際の演技を変換します。 Respeecherは台本ではなく音響領域で処理するため、実際のテイクに含まれる感情、息遣い、タイミング、非言語音を引き継ぎます。こうした細かな表現は、テキスト読み上げでは直接受け継ぐことができず、近似して作り出す必要があります。
- 台本を変更しても、再現する声の本人に再び収録を依頼する必要がありません。 ターゲット音声の学習が済めば、新しい台詞は元の出演者による再録ではなく、ソース側の演者の読みで作れます。スタジオが高額な撮り直しや追加収録を避けるために使う、実務上の理由です。
- テキストベースのTTSがつまずく問題を回避します。 発音辞書ではなく音声を使うため、珍しい名前、略語、笑いやあえぎ声などの非言語音を自然に引き継げます。辞書ベースのシステムが直面する発音ミスや低リソース言語の問題を避けられます。
- プロジェクトの規模に合った2つの利用形態があります。 セルフサービスのVoice MarketplaceとAPIは、ゲームの台詞、YouTubeコンテンツ、インディー作品の吹き替えなど、小規模なクリエイターの案件に対応します。一方、専任のVoice Labチームは、映画やテレビの本格的な制作を手厚い個別サポートで支えます。
- 古い録音や劣化した録音を復元する音声超解像ツールがあります。 保存されていたテープ、古いSkype通話、低ビットレートのMP3を、変換前に使用可能な品質へ修復できます。不完全な元資料から歴史上の人物や故人の声をよみがえらせる場合に、特に重要な機能です。
Respeecherの音声変換は実際にどう動くのか
Respeecherの中核技術は、テキスト読み上げではなく音声から音声への変換(STS)です。この違いは、言葉から受ける印象以上に重要です。どのプロジェクトも2つの声から始まります。ターゲット音声は最終出力で再現したい人物の声、ソース音声は実際のタイミング、感情、表現を込めて台詞を読む演者の声です。通常は、ターゲット音声のきれいな録音が約1時間あれば変換モデルを学習できます。ターゲットとソースの両方の録音で、最終出力に求める感情の幅をカバーする必要があります。平板で中立的な読みだけでは、後から説得力のある叫び声やささやき声を出せるクローンにはなりません。
Respeecher自身の特許出願によると、変換処理は敵対的な改良ループで動きます。まず生成モデルが、ソースの演技をターゲット音声の声質に対応付けた候補音声を作ります。次に、別の識別モデルがその候補をターゲット音声の実際の録音と照合し、不整合を検出します。この評価では、単一の参照クリップだけでなく、多数の異なる声を含む、より広い声質データ空間を用います。検出した不整合を生成器に戻すと、生成器は改良された候補を作り、説得力のある出力になるまでこのループを繰り返します。処理全体が、テキストを先に音素へ変換するのではなく音響信号そのものを扱うため、Respeecherは笑い声、息遣い、感情に伴う抑揚を引き継げます。辞書ベースのTTSシステムなら、これらを一から再構築する必要があります。また、制作の途中で台本を編集した場合に再録するのがソース側の俳優の読みであり、ターゲットの声の本人ではないのも、このためです。
Respeecherの料金
Respeecherには、実際に何をしたいかに応じて3つの料金体系があります。そのうちセルフサービスで利用できるのは一部だけだという点を、明確にしておく必要があります。
- Voice Marketplace(セルフサービスのSTS/TTS): 生成音声の分数に応じて課金される従量制クレジット、または利用量が多く継続的に使う場合の月額プランを選べます。第三者の価格調査サービスによると、月額プランはおおよそ150〜450米ドルの範囲です。ただしRespeecherは固定の公開料金表を出していないため、決済画面で確認するまでは、具体的な金額は概算として扱ってください。契約前に無料トライアルを利用でき、期間は約3日間と報告されています。
- リアルタイムTTS API: 従量制で、公開情報ではリアルタイムのテキスト読み上げ生成が1時間あたり約2米ドルとされています。200ms未満の応答時間が必要なゲームの台詞などの用途を想定しています。
- 映画、テレビ、カスタムVoice Labプロジェクト: Respeecherの営業チームによる個別見積もりのみで、公開料金表はありません。実際にこの手続きを経験した第三者のレビュアーによると、プロ向け案件は単一の音声変換で2,000〜5,000米ドル程度から始まることが多く、長編映画全体の台詞の置き換えでは数万米ドルに達する場合があります。ただし、Respeecher自体はこれらの金額を公表しておらず、実際の費用は音声の長さ、声の複雑さ、同意取得や確認作業にかかる負担に大きく左右されます。
実務的には、技術を試したい場合や小規模なクリエイターの案件であれば、MarketplaceとAPIを使うことで、営業と話さずに実際の利用量に基づく金額を把握できます。映画やテレビの仕事を計画している場合は、決済ページで購入することを想定するよりも、営業との相談を予算策定に組み込んでください。この製品の上位サービスは、実際にそうした形で販売されています。
Respeecherでより良い結果を得るコツ
- ソース音声は未加工・非圧縮で録音します。 Respeecher自身のガイドでは、48kHz/16-bitのクリーンで未処理の音声を求めています。エフェクト、圧縮、そのほかの後処理は、後からきれいに分離して取り除けないため、提出前には加えないでください。
- ノイズ除去は変換後ではなく、変換前に行います。 背景ノイズ、ハム音、アーティファクトは、AIと、AIが分離すべき音声信号の間にある汚れのように作用します。Marketplaceの内蔵ツールでも外部ソフトでも、変換前にノイズ除去を行うほうが、後から出力を修正するより明らかにきれいな結果になります。
- ターゲットとソースの両方で、必要な感情の幅をすべて録音します。 平板で中立的な読みでは、後から説得力のある叫び声、ささやき声、苦悩の表現を出すことをモデルに教えられません。最初の録音セッションで、落ち着いたナレーションだけでなく、プロジェクトが実際に求める範囲をカバーしてください。
- 古い録音や劣化した録音を、使えないと決めつけないでください。 保存されていたテープ、昔の通話、低ビットレートのファイルは、変換前に音声超解像で修復できることがよくあります。新たなスタジオ録音ではなく、不完全な歴史的資料を使う場合に重要です。
- 最初の変換前に、音声のキャリブレーションを丁寧に完了します。 キャリブレーションは平均ピッチなどの基準特性を設定します。急いで済ませると、初めから正しく設定した場合よりも、変換後に多くの修正が必要になります。
RespeecherとPlay.htの比較
| Respeecher | Play.ht | |
|---|---|---|
| 中核技術 | 音声から音声への変換(STS):実際の演技を変換 | 即時クローンに対応したテキスト読み上げ、ストリーミング向けに最適化 |
| 最も適した用途 | 映画、テレビ、ゲーム:台本があり、繊細な感情表現を伴うコンテンツ | リアルタイムの音声エージェント、IVR、対話型アプリケーション |
| レイテンシー | リアルタイムの対話向けには設計されていない | 1秒未満、リアルタイム用途に特化 |
| ソース素材 | ソース側の俳優による演技のテイクが必要 | 入力されたテキストから直接生成 |
| 利用形態 | セルフサービスのMarketplace/APIと、個別見積もりの映画案件 | 完全セルフサービス、公開された月額プラン |
この2つのツールが解決する課題は、ほぼ正反対です。Play.htは、リアルタイムの会話の中でクローン音声を即座に応答させるために存在します。変換される本当の「演技」はなく、テキストが入り、可能な限り速く音声がストリーミング出力されるだけです。Respeecherは、すでに行われた演技を保ち、その感情の質感を別の声へ移すために存在します。対象は、リアルタイムで話しかけるものではなく、完成作品として見たり聞いたりするコンテンツです。音声エージェントのプロジェクトなら、Respeecherのアーキテクチャはまったく適していません。特定の俳優が演じたように聞こえる場面が必要なら、まさにその課題を解決するためにRespeecherは作られました。
よくある質問
Respeecherは何に使われますか?
Respeecherは映画やテレビの吹き替え、声の復元や若返り、ゲームキャラクターの声、多言語ローカライズに使われます。特定の声による演技を、別の人物の声や言語で保つ必要があるあらゆる場面が対象です。
Respeecherの音声クローンはテキスト読み上げと同じですか?
いいえ。Respeecherの中核技術は音声から音声への変換です。多くのTTSベースのクローンツールのように入力テキストから音声を生成するのではなく、すでに録音された演技をターゲットの声へ変換します。
Respeecherの料金はいくらですか?
利用する製品によって異なります。セルフサービスのVoice Marketplaceは従量制クレジットまたは月額プラン、リアルタイムTTS APIは1時間あたり約2米ドルです。映画やテレビ向けのカスタム音声クローン案件はRespeecherの営業チームによる個別見積もりのみで、公開料金表はありません。
Respeecherで誰の声でもクローンできますか?
いいえ。Respeecherはどのプロジェクトでも開始前に同意の証明を求めており、存命の一般個人や俳優の声を、本人の明示的な許可なくクローンすることはありません。ただし、独自の倫理方針に基づき、一部の歴史上の人物や公人の声については、人を欺かない用途での利用を認めています。
Respeecherはリアルタイムで動作しますか?
Voice Marketplaceの変換は現在リアルタイムではありません。一方、Respeecherが別途提供するTTS APIは低レイテンシー用途向けに設計されており、ゲームの台詞などの用途で約200ミリ秒で音声を生成します。
Echoraで録音の声を変える
ブラウザで同様の音声から音声への変換を試すには、Echoraのボイスチェンジャーに発話の録音をアップロードし、内蔵の声を選ぶか、ターゲットの声の参照録音を追加します。Echoraは元の録音の発話内容と演技をもとに、別の声のバージョンを生成します。生成した音声は試聴してダウンロードできます。