Piper:GPUなしで成り立つTTSモデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
ほぼすべての音声クローンモデルは、GPUと余裕のあるVRAMがあり、おそらく予備としてホスト型APIに接続できるインターネット環境もあることを前提としています。Piperには、そのどれも必要ありません。CPUだけを使い、Raspberry Piほど小規模なハードウェアでもリアルタイムに動作するよう構築されています。クラウドとの往復も、CUDAへの依存も、待ち時間もありません。プロジェクトの実際の制約が「インターネット接続のない小型ボードで動かす必要がある」というものなら、Piperは、その現実に後から適応させたのではなく、最初からそのために作られた数少ないオープンソースTTSの選択肢です。
Piperとは?
Piperは、開発者Michael HansenがRhasspy音声アシスタントプロジェクトのもとで作成したオープンソースのニューラル音声合成システムで、最初のコミットは2022年11月にさかのぼります。Piperの各音声は、ONNXランタイム向けにエクスポートされたVITSベースのモデルで、小さなJSON設定ファイルと組み合わせて使います。ニューラルネットワークが実際の音声を生成する前に、espeak-ngが入力テキストを音素へ変換します。コンパクトでONNXに最適化されたモデルと軽量な音素化器の組み合わせによって、Piperは専用のグラフィックス処理能力をまったく持たないハードウェア上でも、自然な音声と真の高速動作を両立しています。
これほど軽量な理由
一般的なPiperの音声モデルは約1500万パラメーターで動作します。これは、他で取り上げられるクローン重視モデルの大半と比べてごくわずかなサイズです。中品質の音声は、数十メガバイトの単一ONNXファイルに収まります。音声には4つの品質段階があり、x_lowとlow(16kHz出力)は最小の容量と最速の生成に、mediumとhigh(22.05kHz)は単純な速度より音質を重視する場合に向いています。この段階設計により、どこへデプロイする場合も固定された1つのモデルサイズに縛られるのではなく、具体的なハードウェア制約に応じて、品質と容量を意図的に交換できます。
速度の数値も「超軽量」という位置づけを直接裏付けています。PiperはCPUだけを使ってRaspberry Pi 4または5上でリアルタイムに合成し、最新のデスクトップCPUではリアルタイムのおよそ10倍の速度で動作します。GPUアクセラレーションが単なるオプションというだけでなく、そもそも設計に含まれていないほど十分に高速です。
対応言語と音声
Piperには、英語、ドイツ語、フランス語、スペイン語、イタリア語、ポルトガル語、オランダ語、ポーランド語、ロシア語、中国語、アラビア語、トルコ語、ウクライナ語など、35を超える言語にまたがる100種類以上の事前学習済み音声があり、すべてHugging Faceで公開ホストされています。音声ファイルは一貫した命名規則(<language>_<region>-<name>-<quality>)に従うため、毎回ドキュメントを調べなくても、特定の言語、地域アクセント、品質段階を簡単に見分けて切り替えられます。
Piperが実際に使われる場所:Home Assistantとその先
Piperの実利用は、その軽量設計が狙う用途にまさに集中しています。ホームオートメーション、オフライン音声アシスタント、アクセシビリティツール、そしてスタジオ級の音声の磨き上げよりも、レイテンシ、プライバシー、継続的なホスティング費用がゼロであることを重視する組み込みキオスクです。PiperはHome Assistantでネイティブかつ公式にサポートされているテキスト読み上げオプションで、Wyomingプロトコルを介して通信し、インストール後は自動検出されます。デフォルト音声はen_US-lessac-mediumです。これは、このプロジェクトがコンテンツ制作よりも、ローカルでプライバシーを重視するスマートホーム環境に特化して、いかに深く採用されているかを示す強い証拠です。
知っておくべきメンテナンス上の詳細
Piperの元のリポジトリは2025年10月にアーカイブされ、その後の活発な開発はOpen Home FoundationのVoiceチームが管理するforkへ移りました。これが実務上重要な理由は2つあります。第一に、古いチュートリアルやドキュメントを参照している場合、それがアーカイブ済みの元リポジトリを示しているのか、活発に管理されているforkを示しているのか確認してください。第二に、その過程でライセンスが変更されました。元のプロジェクトはMITライセンスでしたが、現在の開発forkはGPL-3.0で公開されています。商用利用が計画に含まれるなら、両者の条件には意味のある違いがあります。Piperを基盤に製品を構築する前に、デプロイするバージョンへ実際に適用されるリポジトリとライセンスを確認してください。
Piperを使い始める
- 仮想環境内でpipを使ってインストールする。
python3 -m venv .venv && source .venv/bin/activate && pip install piper-ttsを使えば、システム管理のPythonインストールとの競合を避けられます。これは特にRaspberry Pi OSで、インストール時の問題を引き起こしやすい原因です。 - 音声モデルと、それに対応する設定をダウンロードする。 各音声には、Hugging Faceの音声リポジトリにある
.onnxモデルファイルと、対応する.json設定ファイルの両方が必要です。両方を取得し、正しく組み合わせてください。 - 手順がどのリポジトリを参照しているか確認する。 2025年のforkを踏まえ、ガイドが元の
rhasspy/piperプロジェクト向けなのか、現在のOHF-Voice/piper1-gplfork向けなのかを確認してください。セットアップの詳細が両者でわずかに異なる可能性があります。 - 最初に簡単な合成テストを実行する。 PiperのCLIは、1つのコマンドで文字列からWAVファイルを生成できます。より大きなプロジェクトに接続する前に、モデルと設定ファイルが正しく組み合わされていることを確認する最速の方法です。
- 対象プラットフォームがHome Assistantなら公式アドオンを使う。 Piperをスマートホーム環境へ手動で統合するのではなく、公式アドオンにWyomingプロトコル経由の検出と設定を自動処理させます。
- 理想だけでなく、ハードウェアに品質段階を合わせる。 本当に制約の厳しいデバイスでは、x_lowまたはlow品質の音声によって生成を高速に保ち、リソース使用量を最小限にできます。mediumまたはhigh段階は、もう少し余裕のあるハードウェア向けに残してください。
より良い結果を得るためのヒント
- ソースからビルドする明確な理由がない限り、まずpipのインストール方法を使う。 各プラットフォームで行われた幅広いコミュニティテストによれば、Raspberry Pi OS、Ubuntu、WindowsのWSLでは、こちらの方が速く信頼できる方法です。
- 最高品質の段階を自動的なデフォルトにしない。 多くの組み込み用途では22.05kHz出力が必要ないため、x_low/low段階が用意されています。本当にリソースが限られたハードウェアへデプロイするなら、まず低い段階を試してください。
- Piperをコンテンツ上の制約ではなく、デプロイ上の制約を解決するツールとして扱う。 表現力があり、感情豊かなナレーションを優先するなら、クローン重視のより大きなモデルの方が適しています。Piperの価値提案のすべては、それらの大きなモデルがまったく動かないハードウェアでの信頼性と小さな容量にあります。
- 商用デプロイの前に、対象リポジトリのライセンスを確認する。 元のMITライセンス版プロジェクトと現在のGPL-3.0 forkに分かれているため、特に商用製品では、想定で済ませず実際に確認すべき重要な点です。
- スマートホームプロジェクトでは、特にWyomingプロトコルの統合経路を使う。 Home Assistantや類似の音声アシスタントエコシステムに関連するものを構築するなら、確立されたWyomingベースの統合を介する方が、独自実装より保守しやすくなります。
Piperと他の軽量・CPU対応モデルの比較
| Piper | Kokoro-82M | 一般的なGPUクローンモデル | |
|---|---|---|---|
| パラメーター | ~15M | 82M | 350M–1.7B+ |
| CPUのみで動作 | はい、設計上の前提 | はい、ネイティブ | できてもオプション程度で、GPUを強く推奨 |
| Raspberry Pi上でリアルタイム | はい | 主要な設計目標ではない | いいえ |
| 音声クローン | いいえ、固定音声一覧 | いいえ、固定音声一覧 | はい、通常は中核機能 |
| 言語 | 35+ | 8 | さまざま。この広さを持つものは少ないことが多い |
| 最適な用途 | 組み込みデバイス、スマートホーム、オフラインキオスク | コスト重視のサーバー側ナレーション | 表現力のあるクローン、対話、制作コンテンツ |
Piperが特に得意とするのは、デプロイの範囲において最も小さく、リソース制約が最も厳しい端です。Kokoroが「CPUサーバー上で安価に動作する」ために作られているなら、Piperは「ファンすら付いていないかもしれないデバイス上で動作する」ために作られています。
よくある質問
Piperは本当にGPUをまったく必要としませんか?
その通りです。Piperは設計上CPUのみで動作し、VRAMを使いません。Raspberry Piのような組み込みハードウェアで、オフラインかつリアルタイムに動くよう特別に構築されており、それこそが狙っている用途です。
Piperは特定の人物の声をクローンできますか?
いいえ。Piperは、参照クリップからゼロショットで音声をクローンするのではなく、35を超える言語にまたがる100種類以上の固定された事前学習済み音声を使います。クローンが中核要件なら、別のモデルの方が適しています。
Piperは現在も活発にメンテナンスされていますか?
はい。ただし、開発は元のrhasspy/piperリポジトリ(2025年10月にアーカイブ)から、Open Home FoundationのVoiceチームが管理するforkへ移りました。このforkは異なるライセンスで公開されています(元のMITではなくGPL-3.0)。
Piperには実際にどのようなハードウェアが必要ですか?
CPUだけを使ってRaspberry Pi 4または5上でリアルタイムに動作し、一般的な最新デスクトップCPUではリアルタイムのおよそ10倍の速度で動作します。どの時点でもGPUやCUDAのセットアップは必要ありません。
Piperは商用利用でも無料ですか?
使用するリポジトリとバージョンによります。元のプロジェクトはMITライセンスでしたが、活発に管理されているforkはGPL-3.0であり、異なる義務が伴います。商用利用の前に、デプロイするバージョン固有のライセンスを確認してください。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。