EchoraEchora
モデル一覧に戻る

LOVO AI (Genny):ブラウザの一つのタブでナレーション、動画制作、音声クローンを実現

2026年9月17日
•
約6分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

LOVO AI はカリフォルニア州バークレーに拠点を置く企業で、Charlie Choi と Tom Lee が2019年に設立しました。2021年8月には Kakao Entertainment と LG CNS が主導する Pre-Series A ラウンドで450万ドルを調達しています。同社の製品 Genny が解決しようとしたのは、具体的なワークフローの問題です。ナレーション付きの動画を完成させるには、通常、テキスト読み上げツール、動画エディター、字幕ツールを行き来し、各工程でファイルを書き出しては読み込み直す必要があります。Genny は、台本作成、音声生成、動画編集、自動字幕をすべてブラウザ上の一つのワークスペースにまとめています。動画を一本完成させるために三つのサービスを個別に契約・管理したくない、ソーシャルメディアのクリエイター、マーケティング担当者、eラーニングチームを対象とした製品です。

LOVO AI (Genny) の機能面での強み

  • 音声生成と動画編集を同じワークスペースで行えます。 生成したナレーションは、映像素材や音楽と同じタイムラインに直接配置されるため、別のツールから書き出して読み込み直す必要がありません。
  • 規模が大きく、幅広い用途をカバーする音声ライブラリ。 100以上の言語にわたる500以上の音声と、30以上の感情スタイルのプリセットが用意されており、音声をクローンしなくても多様なアクセントや用途に対応できます。
  • Pro V2 の自然言語による演技指示は、従来とは明確に異なるインターフェースです。 ピッチ、速度、強調のスライダーを少しずつ動かす代わりに、[sobbing]、[british accent]、[speak more slowly and sound nervous] のような角括弧付きの指示を台本に直接書き込み、モデルがその内容を解釈します。
  • 短いサンプルから音声をクローンできます。 約1分の録音からカスタム音声を作成でき、この機能を含むプランでは、プロジェクト数の制限なく繰り返し利用できます。
  • 同じ音声生成呼び出しに連動した自動字幕。 ナレーションと同じ台本およびタイミングデータから字幕を生成するため、別途文字起こしを実行する必要がありません。
  • 同じタブに AI 台本作成ツールと画像生成ツールも備わっています。 短尺コンテンツなら、音声生成を始める前の段階から、ワークスペースを離れずに台本の下書きや背景ビジュアルを作成できます。

Genny の指示に応じる音声とエディターの実際の仕組み

技術面で特に興味深いのは、2025年5月に登場した Pro V2 です。音声への演技指示を、パラメーター調整ではなく言語の問題として捉え直しています。従来の TTS インターフェースは、LOVO 自身の初期の音声も含め、感情や話し方を台本とは別のスライダーやプリセットで調整する仕組みでした。一方、Pro V2 は、対象となるテキストの直前に角括弧で書き込まれたインラインの指示を受け付けます。たとえば、[laughing and joking around] hahaha, and he said what? や [super embarrassed] I can't believe I just did that. といった形です。モデルは、俳優がト書きを読むように角括弧内の指示を読み取り、それに合わせて話し方、テンポ、笑いやすすり泣きといった非言語音を調整します。同じ台詞から複数のテイクを生成することもできるので、最初の出力をそのまま採用するのではなく、最もよい読み方を選べます。

Genny の動画機能も、同じ「単一の呼び出し」という原則を中心に構築されています。ナレーション、そのタイミングデータ、台本がすべて一度の生成工程から生まれるため、後から音声認識を別途実行しなくても、そのデータから直接自動字幕を作成できます。また、タイムラインエディターは、手作業の同期工程なしに、生成音声を映像素材に対して正確に配置できます。これが一体型アーキテクチャの実用的な価値です。個々の機能が同分野で最高かどうかよりも、別々の三社が開発した TTS ツール、動画エディター、字幕生成ツールをつなぎ合わせる際の、書き出しと位置合わせのやり直しという手間を取り除くことに重点があります。

Genny の音声でよりよい結果を得るコツ

  • 角括弧内の指示は、感情ラベルではなくト書きのように書きましょう。 [speak warmly, as if reassuring a nervous client] は、[nervous] のような単語一つよりも、モデルが判断に使える情報を多く与えます。固定の感情リストから項目を選ぶのではなく、自然言語を解釈しているためです。
  • 感情が大きな意味を持つ台詞は、複数のテイクを生成しましょう。 Pro V2 が台詞ごとの複数テイクに対応しているのは、生成のたびに表現が変わり得るからです。語調が特に重要な台詞では、最初の結果を完成版ではなく下書きとして扱ってください。
  • プロジェクトで使う音声を決める前に、500以上の音声から複数を試聴しましょう。 レビューでは、厳選された音声を提供するプラットフォームに比べ、LOVO のライブラリ内では品質のばらつきが大きいと一貫して指摘されています。したがって、コンテンツにとって「最適」な音声が、最初のほうに並ぶものや初期選択の音声とは限りません。
  • 技術的には1分で足りても、クローン用の元音声は静かな部屋で、ある程度品質のよいマイクを使って録音しましょう。 短いサンプルを使うほかのクローン手法と同様、その1分間に含まれる背景ノイズは、生成される音声にそのまま取り込まれます。
  • レンダリングには余裕を持たせましょう。特に長い1080p動画を書き出す場合は注意が必要です。 クラウドのレンダリング速度はサーバー負荷によって変わり、利用が集中する時間帯には、長い動画の書き出しに目立って時間がかかるという報告があります。

LOVO AI (Genny) と Descript Overdub の比較

LOVO AI (Genny)Descript Overdub
中心となるワークフロー一つのワークスペースで台本から音声、動画へ文字起こしを使った既存録音の編集
音声クローン約1分、本人の同意を得た音声なら利用可能自分の音声のみ、設計上、同意確認を必須としている
動画の扱い新しい動画を作るためのタイムラインエディターを内蔵文字起こしを通じて既存の動画や音声を編集
最も適した用途台本とナレーションを基にゼロから動画を作成録音・録画済みのコンテンツの修正やナレーション追加
感情表現の指示角括弧内の自然言語による指示(Pro V2)実際の収録テイクに、つなぎ目を合わせて音声を挿入

どちらのツールも、音声生成を単独の機能として提供するのではなく、より広い編集環境に組み込んでいますが、対象とする制作段階は異なります。Genny は、台本、音声、ビジュアル、字幕をまとめて生成し、何もないところから動画を作るための製品です。Overdub は、すでに録音した音声を修正したり、ナレーションを加えたりするための製品で、LOVO が現在抱える法的問題の中心にある同意の問題を避けるため、クローン対象を自分の音声に限定しています。白紙から始めるワークフローには、Genny の一体型アプローチがより直接的に合います。既存の録音に修正を加えるだけなら、Overdub はその限定された具体的な問題を解決します。

よくある質問

LOVO AI (Genny) は今も運営されていますか?

本稿執筆時点で、Lovo Inc. は無断で音声をクローンした疑いをめぐる集団訴訟に直面する中、Chapter 7 に基づく破産を申請しています。これは清算手続きであり、その結果、訴訟は停止されています。ウェブサイトには引き続きアクセスできますが、サービスの信頼性やアカウントへのアクセスについては報告がまちまちです。有償案件や本番制作で頼る前に、現在の状況を確認してください。

LOVO AI (Genny) は何に使うものですか?

Genny は、ナレーション付き動画を最初から最後まで制作するために使われます。台本作成、テキスト読み上げによるナレーション、音声クローン、動画編集、自動字幕生成を、ブラウザ上の一つのワークスペースで行えます。

LOVO AI の音声クローンはどのように動作しますか?

約1分の録音からカスタム音声を作成できます。この機能を含むプランでは、作成した音声モデルをその後の生成で繰り返し利用できます。

Pro V2 の音声とは何ですか?

Pro V2 は、LOVO が2025年5月に公開した、指示に応じて話し方を変えられるテキスト読み上げエンジンです。感情やテンポを別のコントロールで調整する代わりに、[sobbing] や [british accent] など、台本内に角括弧で直接書き込んだ自然言語の指示を受け付けます。

LOVO AI (Genny) はいくつの音声と言語に対応していますか?

ライブラリには100以上の言語にわたる500以上の音声があり、Pro V2 の自然言語による演技指示に加えて、標準音声では30以上の感情スタイルのプリセットを利用できます。

Echora で動画用のナレーションを作成

ブラウザで同様の「台本から音声へ」というワークフローを試したい場合は、Echora のテキスト読み上げを利用できます。最大5,000文字のテキストを入力し、声を選んでナレーションを生成します。結果を試聴して MP3 をダウンロードすれば、お使いの動画エディターで利用できます。

台本を音声に変換する →