Piper: o modelo TTS que não precisa de GPU para existir
- O que é Piper?
- Por que ele é tão leve
- Cobertura de idiomas e vozes
- Onde Piper realmente é usado: Home Assistant e além
- Um detalhe de manutenção que vale conhecer
- Como começar com Piper
- Dicas para obter melhores resultados
- Piper versus outros modelos leves e adequados para CPU
- Perguntas frequentes
- Transforme texto em voz com a Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Quase todo modelo de clonagem de voz pressupõe que você tenha uma GPU, VRAM de sobra e, provavelmente, uma conexão com a internet para recorrer a uma API hospedada como alternativa. Piper não pressupõe nada disso. Ele foi criado para rodar inteiramente em CPU, em tempo real, em hardware tão modesto quanto um Raspberry Pi: sem ida e volta para a nuvem, sem dependência de CUDA e sem espera. Se a limitação real do seu projeto é “isto precisa rodar em uma placa pequena sem conexão com a internet”, Piper é uma das poucas opções TTS open source criadas especificamente para essa realidade, em vez de adaptadas a ela posteriormente.
O que é Piper?
Piper é um sistema neural open source de texto para fala criado pelo desenvolvedor Michael Hansen no projeto de assistente de voz Rhasspy, com seu primeiro commit datado de novembro de 2022. Cada voz do Piper é um modelo baseado em VITS exportado para o runtime ONNX e acompanhado de um pequeno arquivo de configuração JSON; o espeak-ng cuida da conversão do texto de entrada em fonemas antes de a rede neural gerar o áudio propriamente dito. Essa combinação de um modelo compacto, otimizado para ONNX, com um fonemizador leve é o que faz o Piper soar natural e ser realmente rápido em hardware sem qualquer processamento gráfico dedicado.
Por que ele é tão leve
Um modelo de voz típico do Piper roda com aproximadamente 15 milhões de parâmetros — uma fração do tamanho da maioria dos modelos voltados à clonagem tratados em outros artigos —, e uma voz de qualidade média é compactada em um único arquivo ONNX de apenas algumas dezenas de megabytes. As vozes são distribuídas em quatro níveis de qualidade: x_low e low (saída de 16kHz) para o menor espaço ocupado e a geração mais rápida, e medium e high (22.05kHz) quando a qualidade do áudio importa mais do que a velocidade bruta. Esse projeto em níveis permite trocar deliberadamente qualidade por tamanho de acordo com as limitações específicas do seu hardware, em vez de ficar preso a um único tamanho fixo de modelo, independentemente do dispositivo em que você fará a implantação.
Os números de velocidade sustentam diretamente o posicionamento “ultraleve”: Piper sintetiza em tempo real em um Raspberry Pi 4 ou 5 usando apenas a CPU e roda aproximadamente uma ordem de grandeza mais rápido do que o tempo real em uma CPU moderna de desktop. Ele é tão rápido que a aceleração por GPU não é apenas opcional; ela simplesmente não faz parte do projeto.
Cobertura de idiomas e vozes
Piper inclui mais de 100 vozes pré-treinadas em mais de 35 idiomas, incluindo inglês, alemão, francês, espanhol, italiano, português, holandês, polonês, russo, chinês, árabe, turco e ucraniano, entre outros, todos hospedados abertamente no Hugging Face. Os arquivos de voz seguem uma convenção de nomes consistente (<language>_<region>-<name>-<quality>), o que facilita identificar e alternar entre idiomas, sotaques regionais e níveis de qualidade específicos sem precisar vasculhar a documentação a cada vez.
Onde Piper realmente é usado: Home Assistant e além
Na prática, a presença do Piper se concentra exatamente nos casos de uso aos quais seu projeto leve se destina: automação residencial, assistentes de voz offline, ferramentas de acessibilidade e quiosques embarcados nos quais latência, privacidade e a ausência de custos contínuos de hospedagem importam mais do que um refinamento vocal de nível de estúdio. Ele é uma opção nativa de texto para fala com suporte oficial no Home Assistant, comunica-se pelo protocolo Wyoming e é descoberto automaticamente após a instalação, com en_US-lessac-medium como voz padrão. Isso é um forte indício de quanto o projeto foi adotado especificamente em configurações de casa inteligente locais e preocupadas com a privacidade, e não para produção de conteúdo.
Um detalhe de manutenção que vale conhecer
O repositório original do Piper foi arquivado em outubro de 2025 e, desde então, o desenvolvimento ativo mudou para um fork mantido pela equipe Voice da Open Home Foundation. Isso importa por dois motivos práticos: primeiro, se você está seguindo tutoriais ou documentos antigos, confirme se eles apontam para o repositório original arquivado ou para o fork mantido ativamente. Segundo, a licença mudou ao longo do caminho: o projeto original usava a licença MIT, enquanto o fork de desenvolvimento atual é lançado sob GPL-3.0, um conjunto de termos significativamente diferente se o uso comercial fizer parte dos seus planos. Antes de criar um produto em torno do Piper, verifique qual repositório e qual licença realmente se aplicam à versão que você está implantando.
Como começar com Piper
- Instale com pip dentro de um ambiente virtual.
python3 -m venv .venv && source .venv/bin/activate && pip install piper-ttsevita conflitos com instalações de Python gerenciadas pelo sistema, uma fonte comum de dificuldades de instalação, especialmente no Raspberry Pi OS. - Baixe um modelo de voz e sua configuração correspondente. Cada voz exige tanto o arquivo de modelo
.onnxquanto o arquivo de configuração.jsoncorrespondente do repositório de vozes do Hugging Face; baixe os dois e confira se estão pareados corretamente. - Confirme qual repositório suas instruções mencionam. Dado o fork de 2025, verifique se determinado guia foi escrito para o projeto original
rhasspy/piperou para o fork atualOHF-Voice/piper1-gpl, pois os detalhes de configuração podem apresentar pequenas diferenças entre eles. - Execute primeiro um teste rápido de síntese. A CLI do Piper consegue gerar um arquivo WAV a partir de uma string de texto em um único comando, a forma mais rápida de confirmar que o modelo e os arquivos de configuração estão pareados corretamente antes de conectá-los a um projeto maior.
- Use o complemento oficial do Home Assistant se essa for sua plataforma de destino. Em vez de integrar o Piper manualmente a uma configuração de casa inteligente, o complemento oficial cuida automaticamente da descoberta e da configuração pelo protocolo Wyoming.
- Ajuste o nível de qualidade ao seu hardware, não apenas às suas ambições. Em dispositivos realmente limitados, vozes x_low ou low mantêm a geração rápida e o uso de recursos mínimo; reserve os níveis medium ou high para hardware com um pouco mais de folga.
Dicas para obter melhores resultados
- Comece pela instalação com pip, a menos que você tenha um motivo específico para compilar a partir do código-fonte. É o caminho mais rápido e confiável no Raspberry Pi OS, Ubuntu e WSL no Windows, com base nos amplos testes da comunidade nessas plataformas.
- Não use automaticamente o nível mais alto de qualidade como padrão. Os níveis x_low/low existem especificamente porque muitos casos de uso embarcados não precisam de saída em 22.05kHz; teste primeiro os níveis mais baixos se você estiver implantando em hardware realmente limitado.
- Trate Piper como a ferramenta para a limitação de implantação, não para a limitação de conteúdo. Se a sua prioridade é uma narração expressiva e rica em emoção, um modelo maior voltado à clonagem servirá melhor. Toda a proposta de valor do Piper está na confiabilidade e no tamanho reduzido em hardware que simplesmente não consegue rodar esses modelos maiores.
- Confira a licença do repositório de destino antes da implantação comercial. Dada a divisão entre o projeto original sob licença MIT e o fork atual GPL-3.0, esse é um detalhe realmente importante para verificar, e não presumir, especialmente em qualquer produto comercial.
- Use especificamente o caminho de integração pelo protocolo Wyoming para projetos de casa inteligente. Se você está criando algo relacionado ao Home Assistant ou a ecossistemas semelhantes de assistentes de voz, trabalhar por meio da integração estabelecida baseada em Wyoming é mais fácil de manter do que uma implementação personalizada.
Piper versus outros modelos leves e adequados para CPU
| Piper | Kokoro-82M | Modelos típicos de clonagem em GPU | |
|---|---|---|---|
| Parâmetros | ~15M | 82M | 350M–1.7B+ |
| Roda apenas em CPU | Sim, por projeto | Sim, nativamente | Opcional na melhor das hipóteses; GPU fortemente recomendada |
| Tempo real no Raspberry Pi | Sim | Não é um objetivo principal de projeto | Não |
| Clonagem de voz | Não, catálogo fixo de vozes | Não, catálogo fixo de vozes | Sim, geralmente o recurso principal |
| Idiomas | 35+ | 8 | Varia; costuma ter menos com tamanha abrangência |
| Melhor para | Dispositivos embarcados, casa inteligente, quiosques offline | Narração no servidor sensível a custos | Clonagem expressiva, diálogo, conteúdo de produção |
O nicho específico do Piper é a ponta menor e com mais limitações de recursos do espectro de implantação: se Kokoro foi criado para “rodar barato em um servidor com CPU”, Piper foi criado para “rodar em um dispositivo que talvez nem tenha ventoinha”.
Perguntas frequentes
Piper realmente não precisa de GPU alguma?
Correto. Piper funciona apenas em CPU por projeto e não usa VRAM. Ele foi criado especificamente para rodar offline e em tempo real em hardware embarcado como um Raspberry Pi, que é exatamente o caso de uso ao qual se destina.
Piper consegue clonar a voz de uma pessoa específica?
Não. Piper trabalha com um catálogo fixo de mais de 100 vozes pré-treinadas em mais de 35 idiomas, em vez de clonagem de voz zero-shot a partir de um clipe de referência. Se a clonagem é o seu requisito principal, outro modelo será mais adequado.
Piper ainda é mantido ativamente?
Sim, embora o desenvolvimento tenha passado do repositório original rhasspy/piper (arquivado em outubro de 2025) para um fork mantido pela equipe Voice da Open Home Foundation, lançado sob uma licença diferente (GPL-3.0 em vez da MIT original).
De qual hardware Piper realmente precisa?
Ele roda em tempo real em um Raspberry Pi 4 ou 5 usando apenas a CPU e aproximadamente dez vezes mais rápido do que o tempo real em uma CPU moderna de desktop comum, sem exigir GPU ou configuração de CUDA em nenhum momento.
Piper é gratuito para uso comercial?
Depende do repositório e da versão que você está usando: o projeto original tinha licença MIT, mas o fork mantido ativamente está sob GPL-3.0, que traz obrigações diferentes. Confira a licença específica da versão que você implantar antes do uso comercial.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.