Edge TTS:エンタープライズ級ニューラル音声への無料の裏口
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
Microsoft Edgeブラウザには「音声で読み上げる」というアクセシビリティ機能があり、実に高品質なニューラル音声がひっそりと使われています。その品質は、Microsoftが有料のAzure Speechサービスを通じて販売している音声と同等です。Edge TTSは、その同じ無料ブラウザサービスへ直接アクセスするオープンソースのPythonツールであり、ブラウザを開くことも、Windowsをインストールすることも、APIキーを取得するために登録することもなく、数百種類のニューラル音声をスクリプトから利用できます。
Edge TTSとは?
Edge TTSは、独立系開発者rany2が作成したPythonモジュール兼コマンドラインツールです。Edge、Windows、APIキーを必要とせず、自分のコードやコマンドラインからMicrosoft Edgeのオンラインテキスト読み上げサービスを利用できます。これが実際には何なのかを正確に理解しておく価値があります。これはMicrosoftの公式製品でも、サポート対象のAPIでもありません。Edgeブラウザが「音声で読み上げる」アクセシビリティ機能のために内部で使用しているものと同じバックエンドサービスへ接続し、同じ音声エンジンを外部から無料で使えるようにするコミュニティ製ツールです。
Edge TTSの機能上の利点
- 本当に無料で、APIキーもアカウント登録も不要です。同じ基盤音声技術を、認証情報が必要な従量課金APIの背後で提供するMicrosoft自身の有料Azure Speech Servicesとは、実質的に異なります。
- 数十の言語と地域ロケールにわたる数百種類のニューラル音声を備えています。言語ごとに汎用音声が1つだけではなく、アラビア語のような言語には複数の地域バリエーションもあります。
- EdgeブラウザやWindowsから独立して動作し、インターネット接続があるあらゆるプラットフォームでスタンドアロンのPythonツールとして実行できます。
- 速度、音量、ピッチを調整可能で、コマンドラインのフラグから直接設定できます。完全なマークアップ言語を使わずに、基本的な韻律制御が可能です。
- 字幕生成を内蔵し、音声出力と同時にSRTまたはVTT字幕ファイルを生成します。動画ナレーション、eラーニングコンテンツ、アクセシビリティのワークフローに実際に役立ちます。
- シンプルなCLIと非同期Python APIがあり、手早い単発コマンドにも、大規模なアプリケーションへのスクリプト化されたバッチ式の統合にも対応します。
実際の位置づけに関する重要な注意点
これを基盤に本格的なものを構築する前に、明確に理解しておくべき点があります。Edge TTSは、Microsoft Edgeの「音声で読み上げる」機能を動かしているものと同じオンラインエンドポイントへ接続することで機能します。これは無料のブラウザアクセシビリティ機能であり、文書化され、契約上のサポートがある公開APIではありません。この違いは、実務上2つの意味を持ちます。第一に、非公式であるため、Microsoftは予告なくいつでもそのエンドポイントを変更または制限でき、コミュニティが対応するまでツールが動かなくなる可能性があります。第二に、Microsoftは自社の公式ツールが生成したものではないSSMLをすべてブロックするため、カスタムSSMLマークアップのサポートがプロジェクトから明示的に削除されました。そのため、本物の文書化された音声APIと比べて、実際に行える細かな制御は限られます。Edge TTSは、個人プロジェクト、プロトタイピング、重要度の低いコンテンツに適した、本当に有用な無料ツールとして扱ってください。商用製品への利用を考えているなら、Microsoft自身の規約を直接確認してください。Azure Speech Servicesのようにライセンスされた商用APIではないためです。
Edge TTSを使い始める
- pipまたはpipxでインストールします。 一般的な用途には
pip install edge-ttsを利用できます。スクリプト用のPythonライブラリではなく、コマンドラインツールだけが必要なら、システムのPython環境を汚さずに済む、文書化されたよりクリーンな代替手段としてpipx install edge-ttsがあります。 - 選ぶ前に利用可能な音声を一覧表示します。
edge-tts --list-voicesは、性別、コンテンツカテゴリ、パーソナリティタグを含む完全な音声カタログを表示します。特定の音声名に決める前に、適切な地域バリエーションを見つけるのに役立ちます。 - 最初の音声ファイルを生成します。
edge-tts --voice en-US-AriaNeural --text "Hello, world!" --write-media hello.mp3 --write-subtitles hello.srtを実行すると、1つのコマンドで音声ファイルと、それに対応する字幕ファイルの両方が生成されます。 - 対応するフラグで速度、音量、ピッチを調整します。 文書化されている構文は
--rate=-50%、--volume=-50%、--pitch=-50Hzです。特に負の値には=記号が必要で、付けないとコマンドラインがフラグを誤って解釈する点に注意してください。 - Windows以外のシステムで直接再生したい場合は
mpvをインストールします。edge-playbackコマンドは生成した音声をファイルへ保存せず、すぐに再生します。ただし、LinuxとmacOSではコマンドラインプレーヤーmpvを別途インストールする必要があります(Windowsではこの追加手順は不要です)。 - 単発のCLIコマンドを超える用途には非同期Python APIを使います。 ライブラリをPythonコードへ直接インポートすれば、CLIをシェルから何度も呼び出す代わりに、Webバックエンドやバッチ処理パイプラインに適したプログラム制御が得られます。
より良い結果を得るためのヒント
--list-voicesの出力を調べ、対象ユーザーに合う地域バリエーションを探します。 多くの言語に複数の方言オプションがあるため、アルファベット順で最初に出てくる音声をそのまま使うより、最も近い地域の音声を選ぶほうが明らかに自然に聞こえます。- 非常に長いテキストは、1つの巨大なリクエストとして送らず分割します。 厳密に文書化された上限はありませんが、長いコンテンツを小さなまとまりに分けるほうが、一貫した出力を得るためのより確実な方法です。
- 細かな制御をカスタムSSMLに頼らないでください。 Microsoftは自社ツールが生成したものではないSSMLをブロックするため、独自のマークアップを試すのではなく、ライブラリがサポートする速度、音量、ピッチのフラグを韻律調整に使ってください。
- 本番利用には代替策を用意します。 これは契約されたAPIではなく、無料ブラウザ機能との非公式な統合です。基盤となるアクセス方法が変わった場合に備えた代替策なしに、ビジネス上重要なパイプラインを全面的に依存させないでください。
- 字幕出力は特に動画プロジェクトで活用します。 同じコマンドで音声と一緒に同期済みのSRT/VTTファイルを生成すれば、多くの無料TTSツールには組み込まれていない別途の字幕作成工程を省けます。
Edge TTSとMicrosoft公式音声サービス、自社ホスト型代替手段の比較
| Edge TTS | Azure Speech Services(公式) | Piper(自社ホスト) | |
|---|---|---|---|
| コスト | 無料 | 有料、使用量に応じた従量課金 | 無料、自社ホスト |
| APIキー/アカウントが必要 | いいえ | はい | いいえ |
| 公式のサポート対象API | いいえ—非公式コミュニティツール | はい | 該当なし、オープンソースプロジェクト |
| 音声品質 | 高い(同じ基盤ニューラル音声) | 高い(同じ基盤ニューラル音声) | 堅実で軽量 |
| カスタムSSML対応 | なし(Microsoftがブロック) | あり | 中核機能ではない |
| 信頼性の保証 | なし—エンドポイントが予告なく変更される可能性あり | SLAによる保証 | 自身のインフラに全面的に依存 |
Edge TTS固有の立ち位置は、個人プロジェクト、プロトタイピング、カジュアルなコンテンツ向けに、本当に高品質なニューラル音声を無料かつ登録なしで利用できることです。商用上重要な用途や稼働時間の保証が必要な用途には、同じ音声技術を正式なライセンスのもとで使用するMicrosoft自身の有料Azure Speech Servicesのほうが適しています。
よくある質問
Edge TTSはMicrosoftの公式製品ですか?
いいえ。Microsoft Edgeブラウザの「音声で読み上げる」機能を動かすものと同じバックエンドサービスへ接続する、独立したオープンソースツールです。Microsoftが公式に文書化またはサポートしているAPIではありません。
Edge TTSを使うにはMicrosoft EdgeやWindowsのインストールが必要ですか?
いいえ。EdgeブラウザやWindowsオペレーティングシステムとは独立し、インターネット接続があるあらゆるプラットフォームでスタンドアロンのPythonツールとして動作します。
Edge TTSは本当に無料ですか?
はい。APIキー、アカウント、支払いはいずれも不要です。類似する基盤音声技術を従量課金APIの背後で提供するMicrosoft自身の有料Azure Speech Servicesとは、実質的に異なります。
Edge TTSを商用製品に使えますか?
慎重に進めてください。これはライセンスされた商用APIではなく、無料のブラウザアクセシビリティ機能へアクセスする非公式ツールです。Microsoftの規約を直接確認し、ビジネス上重要な用途にはAzure Speech Servicesを検討してください。
Windowsの設定でTTS音声をダウンロードするのとは何が違いますか?
両者は別のシステムです。Windowsに組み込まれたナレーター音声(設定からダウンロード可能)はオペレーティングシステム自体の一部です。一方、Edge TTSはEdgeブラウザのクラウドベースのニューラル音声へ特にアクセスします。インターネット接続が必要ですが、一般により自然に聞こえます。
Echoraでオンライン音声を作成
同じような目的のブラウザベースのワークフローには、Echoraのテキスト読み上げを利用できます。最大5,000文字を1人の話者による音声に変換し、結果をプレビューして、完成したMP3をダウンロードできます。