EchoraEchora
モデル一覧に戻る

WellSaid Labs:誰の声もクローンさせないAI音声プラットフォーム

2026年9月16日
•
8分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

WellSaid Labsを検討する前に、知っておくべきことがあります。ここではサンプルをアップロードして声をクローンすることはできません。自分の声でも、他人の声でも同じです。 これは機能の欠落ではありません。WellSaidのプラットフォーム全体は、その逆の前提に基づいています。すべての音声アバターは、募集に応じて参加し、報酬を受け取り、自分の声をAIモデルにすることに書面で明確に同意した、実在するプロの声優に由来します。組織でナレーションを使う際に「この声は法的にどこから来たのか」という問いへ明快に答える必要があるなら、その制約こそが、この製品の本質です。

WellSaid Labsとは?

WellSaid Labsは、シアトルのAllen Institute for AI(AI2)からスピンアウトした企業です。共同創業者のMatt HockingとMichael Petrochukは、そこで2018年に敵対的ネットワークに基づく音声合成の開発を始め、2019年に独立企業として正式に発足しました。FUSEが主導するシリーズAでは1,000万ドルの資金調達を受けています。その後、同社は意図的に市場の高価格帯に位置づけてきました。価格や機能の幅で競うのではなく、調達部門や法務部門が難なく承認できるAI音声ベンダーであることを目指しています。顧客の顔ぶれにも、それが表れています。Coursera、BambooHR、McKinsey、GoFundMe、Boeing、Bristol Myers Squibbは、企業研修、製品ナレーション、社内コミュニケーションにWellSaidを利用しています。また、プラットフォームはSOC 2 Type II認証を取得しており、GDPRおよびHIPAAに関連する保護措置も備えています。

WellSaid Labsの機能上の強み

  • すべての声は、同意し、報酬を受け取った実在の声優のもの。スクレイピングしたデータは一切使いません。 WellSaidのモデルは、明確な書面による同意を得て収集した、ライセンス付きのスタジオ録音だけで学習します。これが、企業の購買担当者に法的リスクの低減を訴求する根拠のすべてです。
  • 120種類以上のスタジオ品質の音声アバターを提供するサービスであり、セルフサービスのクローンツールではありません。 自分や他人のサンプルをアップロードするのではなく、厳選されたカタログから選びます。これは大半の音声クローンプラットフォームとは、製品として本質的に異なります。
  • ブランド専用アバターも、ライセンスに基づいて制作します。 企業はWellSaidのチームに専用音声を依頼できますが、カスタムアバターであっても、契約を結び同意した声優の録音から作られます。顧客がアップロードした音声から作るわけではありません。
  • 再録音せずに、読み方を細かく調整できます。 テンポ、発音、強調、息継ぎの位置を一行ごとに調整でき、回数無制限のリテイクも含まれているため、台本を修正するたびにスタジオを予約し直す必要はありません。
  • 音声学的な推測に頼るだけでなく、書記素に基づく発音システムを備えています。 WellSaidのRespellingsとReplacementsでは、単語を音節に分けて強勢を示すことで、発音を正確に修正できます。「triiodothyronine」を「try-yuh-uh-doo-THY-ruh-neen」と表記するほど細かく指定でき、大半のTTSプラットフォームが提供する発音記号だけに基づくツールよりも精密に制御できます。
  • すでに使っているコンテンツ制作工程に組み込めます。 REST APIとAdobe PremiereやCanvaなどのツールとの連携により、ナレーションを独立した手作業の工程にすることなく、既存の制作ワークフロー内で大量に生成できます。

WellSaid Labsは実際にどう音声アバターを作るのか

ここが、WellSaidのプロセスが大半のクローンツールと本当に異なる部分です。出発点はアップロードボタンではなく、人です。WellSaidのタレント担当チームはプロの声優を募集し、録音を行う前に、明確な書面による同意の手続きを進めます。これは利用規約のチェックボックスではありません。自分の声が商用AI製品になると理解したうえで声優が参加する、明確に定められた受け入れプロセスです。声優との契約後、WellSaidのVoice Program Managerは、テキスト読み上げモデルに必要な音声学的・韻律的な範囲を収録するために作られた専用台本を使い、録音セッションを計画します。これはポッドキャストのインタビューや通常のナレーション収録とは、データ収集の目的が大きく異なります。台本は、さまざまな単語、感情、文構造においてその声優の声がどう変化するかを、モデルが十分に網羅できるようにするために存在するからです。

その録音データを使って、非公開の独自モデルを学習させます。WellSaidは、ウェブから収集した音声や顧客が送信した入力で学習することは一切ないと明言しています。また、各アバターの基盤となるモデルは、その一人の声優のライセンス付きデータセットから構築され、共有の基盤モデルをユーザーごとにファインチューニングする方式ではありません。同社は自社の進化について、従来のテキスト読み上げ生成器から、同社が「音声基盤モデル」と呼ぶものへの移行だと公に説明しています。これは単にテキストを音素に対応させるのではなく、訓練を受けた声優が実際に台詞を演じる方法に近い形で読み方を表現するシステムです。Studioエディターのテンポ、息継ぎ、強調の制御は、アーキテクチャ上そこに由来します。汎用TTSに後からUIのスライダーを付け足しただけではありません。

収益の循環は顧客だけで完結せず、声優にも還元されます。声優は契約で定められたロイヤルティ体系に基づき、アバターの利用に応じて継続的な収益分配を受け、どのプロジェクトで自分の声が使われているかを把握でき、プラットフォームからの削除も求められます。企業向けカスタムアバターの場合も、WellSaid側で同じ工程を繰り返します。声優の募集または選定、専用の録音セッション、新たな非公開モデルの学習を行うのであって、企業が自社役員の声のサンプルをアップロードし、セルフサービスでクローンを受け取る仕組みではありません。

WellSaid Labsでより良い結果を得るためのヒント

  • 引用符で強調を制御します。ただし、使いすぎないこと。 単語やフレーズを引用符で囲むと、AIにそこを強調するよう指示できます。重要な用語やメリットを目立たせるには効果的ですが、一文の中であまりに多くの語を囲むと、自然になるどころか強調の効果が薄れます。
  • 単に珍しいだけでなく、実際に読み方が曖昧な単語にはRespellingsを使います。 難しい語を音節に分けて強勢を示すと、綴りだけではモデルが判断できない発音の誤りを解消できます。たとえば、"produce"を動詞ではなく野菜の意味で使う場合に、"PRO"duceと表記する方法です。
  • 句読点のない長い文は、短い文に分けます。 WellSaid自身の案内も、この点をはっきり示しています。カンマやピリオドのない長い連続文は、モデルが強調やテンポを配置する際に混乱を招きます。句読点は文法上の役割だけでなく、実際にタイミングを制御しています。
  • モデルが推測するのを待たず、省略記号や空行で間を作ります。 「...」は自然な息継ぎの余裕を作り、改行をいくつか重ねると少し長い間になります。発音と同じくらいテンポが重要な、台本のある研修コンテンツに役立ちます。
  • 一つに決める前に、実際の台本で複数のアバターを試聴します。 アバター間の読み方の違いは、名前やサンプル音声から想像する以上に大きいものです。デモ用の一文ではなく実際のコンテンツで試すことで、その声がプロジェクトに合うかどうかが分かります。

WellSaid LabsとResemble AIの比較

WellSaid LabsResemble AI
声の出所WellSaidが厳選した、ライセンス契約と同意のあるプロの声優話者の同意を得てクローンする、ユーザーがアップロードしたサンプル
自分で声をクローンできるかできない。カタログと受注制作のアバターのみできる。約30–60秒の音声からセルフサービスでクローン可能
同意を確保する方法WellSaidが声優を直接募集し、契約アップロード時に同意の確認が必要
出所の保護策ライセンス付きデータだけで学習した非公開モデル透かし(PerTh)とディープフェイク検出ツール
想定顧客企業の人材育成、コーポレートコミュニケーション、ブランドリスクに敏感なチーム真正性を証明できる、自分たちのクローン音声が必要なチーム

両プラットフォームは、声の出所が正当であることを証明するという同じ課題を出発点にしていますが、正反対の方向から解決しています。Resemble AIは誰でも声をクローンできるようにし、その後で透かしと検出によって真正性を証明します。WellSaidは、そもそも顧客に元の声を提供させないことで、その問題自体をなくしています。すべてのアバターは、カタログに載る前にすでに権利処理を済ませています。特定の人の声をクローンする必要があるなら、それが自分の声であっても、WellSaidは設計上対応できません。一方、編集画面を開く前から元の声の法的な扱いが確定しているナレーションが必要なら、まさにそのニーズを満たすために作られたサービスです。

よくある質問

WellSaid Labsで自分の声をクローンできますか?

いいえ。WellSaidは、自分の声も含め、どの声についてもセルフサービスの音声クローンを提供していません。アバターはすべて、明確に同意したプロの声優のライセンス音声から作られています。

WellSaid Labsの声はどこから来ていますか?

すべての音声アバターは、募集・契約を経て継続的な収益分配を受ける、実在するプロの声優の録音で学習しています。スクレイピングした音声や、顧客が提出したサンプルは一切使いません。

企業はWellSaid Labsでブランド専用のカスタム音声を作れますか?

はい。カスタムアバターの制作を依頼できます。ただし、その場合もWellSaidのチームが管理する、ライセンスを受けた声優の録音から作られます。企業が誰かの声のサンプルを直接アップロードする方式ではありません。

WellSaid Labsは個人クリエイターも利用できますか、それとも企業専用ですか?

WellSaidの設計と価格設定は、企業研修、eラーニング、社内コミュニケーションなどの企業・ビジネス用途に向けられています。個人のコンテンツクリエイター向けの低価格ツールとして作られているわけではありません。

WellSaid Labsは英語以外の言語に対応していますか?

標準プランは英語のみです。多言語の音声生成はEnterpriseプランだけで利用できます。

Echoraで台本をナレーションに

同様の「テキストからナレーションへ」というワークフローを試したい場合は、ブラウザーでEchoraのテキスト読み上げ機能を利用できます。最大5,000文字のテキストを入力して声を選ぶと、一人の話者による音声を生成し、試聴・ダウンロードできます。

テキストからナレーションを生成する →