Kyutai Pocket TTS: o modelo que testou aceleração por GPU e descobriu que não precisava dela
- O que é o Kyutai Pocket TTS?
- Vantagens funcionais do Kyutai Pocket TTS
- Como a modelagem contínua de áudio evita o gargalo da tokenização
- Um teste de audição que merece ser interpretado com cuidado
- Primeiros passos com o Kyutai Pocket TTS
- Dicas para obter resultados melhores
- Kyutai Pocket TTS em comparação com modelos leves e de streaming relacionados
- Perguntas frequentes
- Transforme texto em voz com a Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
A equipe da Kyutai fez algo que a maioria dos laboratórios de TTS nem se dá ao trabalho de tentar: executou benchmarks do Pocket TTS em uma GPU para descobrir quanto ele ficaria mais rápido. A resposta foi: não houve nenhum ganho significativo de velocidade. Com batch size igual a um, a sobrecarga de transferir dados de e para uma GPU chega a superar qualquer benefício que o poder computacional adicional poderia oferecer a um modelo com um projeto tão eficiente. Isso não é transformar uma limitação em argumento de venda; é um sinal verdadeiro de que o Pocket TTS foi construído desde o início para ser excelente em CPU, e não apenas aceitável nela.
O que é o Kyutai Pocket TTS?
O Kyutai Pocket TTS é um modelo de texto para fala com 100 milhões de parâmetros e licença MIT, lançado em 13 de janeiro de 2026 pelo laboratório Kyutai, sediado em Paris. O modelo-base em inglês foi treinado exclusivamente em conjuntos de dados públicos, totalizando 88.000 horas de áudio. Mais tarde, o projeto ampliou a cobertura de idiomas com a versão v2.0.0, lançada em abril de 2026, que adicionou francês, alemão, espanhol, português e italiano. Ele foi desenvolvido especificamente como a contraparte para execução no dispositivo do modelo de streaming maior da Kyutai, o Kyutai TTS 1.6B — usado no produto Unmute do laboratório —, que continua sendo a alternativa mais adequada para implantações no servidor quando a GPU já faz parte da infraestrutura.
Vantagens funcionais do Kyutai Pocket TTS
- Realmente nativo de CPU, e não apenas compatível com CPU. A arquitetura foi otimizada especificamente para execução em CPU, a ponto de a aceleração por GPU ter sido testada e não apresentar nenhum ganho real de velocidade para o projeto deste modelo.
- Latência extremamente baixa: entrega o primeiro trecho de áudio em cerca de 200ms e gera áudio a aproximadamente 6 vezes a velocidade de tempo real em uma CPU de uso doméstico — benchmark realizado em um MacBook Air M4 — usando apenas 2 núcleos de CPU.
- Clonagem de voz zero-shot, que captura uma voz-alvo a partir de um breve clipe de referência sem exigir qualquer etapa de ajuste fino.
- Arquitetura de streaming que processa textos de comprimento arbitrário, em vez de ficar limitada a gerações curtas e de tamanho fixo.
- Cobertura de seis idiomas desde a versão v2.0.0: inglês, francês, alemão, espanhol, português e italiano; alguns deles também contam com variantes mais leves de 6 camadas para restrições de implantação ainda mais rígidas.
- Ampla flexibilidade de implantação, incluindo uma implementação do lado do cliente que roda no navegador por meio de WebAssembly, além da API Python e da CLI padrão.
Como a modelagem contínua de áudio evita o gargalo da tokenização
Esta escolha arquitetural específica é o que viabiliza a eficiência do Pocket TTS, e sua filosofia básica é semelhante à de outras abordagens sem tokenizer da área. O Pocket TTS se baseia em Continuous Audio Language Modeling (CALM), herdando a linhagem técnica do codec Mimi da própria Kyutai, mas trabalha com vetores latentes contínuos durante todo o processo de geração, em vez de tokens discretos. A maioria dos codecs de áudio neurais depende de quantização vetorial residual (RVQ) para produzir tokens discretos que um modelo de linguagem possa prever. Essa é uma compensação razoável em grande escala, mas se torna um gargalo desproporcionalmente caro à medida que o modelo diminui, pois o mecanismo de codebook discreto não é reduzido com a mesma facilidade que o restante da arquitetura. Ao prever vetores contínuos diretamente em vez de escolher entre um vocabulário fixo de códigos discretos, o Pocket TTS evita completamente esse gargalo. Isso é parte importante do motivo pelo qual um modelo de 100M de parâmetros consegue igualar ou se aproximar da qualidade de sistemas várias vezes maiores.
Um teste de audição que merece ser interpretado com cuidado
Na avaliação da própria Kyutai, participantes que usaram comparações em pares no estilo Elo deram à qualidade de áudio do Pocket TTS a pontuação 2016, contra 1884 para as gravações humanas reais de referência com as quais ele foi comparado. Ou seja, os ouvintes avaliaram o áudio sintético como melhor. Vale interpretar isso no contexto correto, em vez de tomar o resultado como uma afirmação geral: gravações reais têm coloração do microfone, eco do ambiente, sons de respiração e níveis irregulares que um áudio sintético limpo simplesmente não apresenta; além disso, a Kyutai limpou especificamente os prompts de referência antes do teste. O resultado reflete uma descoberta real e específica em determinada métrica de qualidade percebida e em um conjunto de teste concreto, e não uma afirmação universal de que o Pocket TTS “soa mais humano do que os humanos” em todos os sentidos.
Primeiros passos com o Kyutai Pocket TTS
- Instale com
uvou pip. Ouvé o instalador recomendado porque gerencia automaticamente as dependências em um ambiente isolado, emborapip install pocket-ttsfuncione como alternativa manual direta. O projeto oferece suporte do Python 3.10 ao 3.14 e exige PyTorch 2.5 ou mais recente. O ponto crucial é que a versão padrão do PyTorch, sem GPU, é tudo de que você precisa. - Carregue o modelo e selecione uma voz. Use
from pocket_tts import TTSModele, depois,tts_model = TTSModel.load_model()para carregar o modelo principal;tts_model.get_state_for_audio_prompt("alba")seleciona pelo nome uma das vozes predefinidas integradas — Alba é uma das opções padrão documentadas. - Use seu próprio clipe de referência para a clonagem ou obtenha um do Hugging Face. Você pode fornecer o caminho de um arquivo WAV local ou um URI
hf://que aponte para um clipe de referência hospedado — por exemplo, da coleção de vozes Expresso da própria Kyutai — da mesma forma que selecionaria o nome de uma voz predefinida. - Gere áudio com
generate_audio().audio = tts_model.generate_audio(voice_state, "Hello world, this is a test.")retorna um tensor unidimensional do PyTorch com dados de áudio PCM, que você pode salvar em um arquivo WAV usando uma biblioteca comoscipy.io.wavfile. - Mantenha o modelo e os estados de voz residentes na memória para reutilização. Tanto
load_model()quantoget_state_for_audio_prompt()são operações relativamente lentas. Carregá-los uma vez e reutilizá-los em várias chamadas de geração evita sobrecarga desnecessária em qualquer aplicação de longa duração. - Experimente primeiro a demonstração no navegador se você só quiser ouvir o resultado. A Kyutai hospeda em seu site uma versão que roda no navegador, na qual você pode testar a entrada de texto e diferentes vozes sem instalar nada antes de se comprometer com uma configuração local.
Dicas para obter resultados melhores
- Não disponibilize uma GPU para este modelo específico. Como os benchmarks da própria Kyutai não mostraram ganho de velocidade com aceleração por GPU e batch size igual a um, o esforço gasto na infraestrutura de GPU especificamente para o Pocket TTS seria mais bem aplicado em outra parte.
- Armazene os estados de voz em cache, em vez de recarregá-los a cada solicitação. Como tanto o carregamento do modelo quanto a preparação do estado de voz são etapas relativamente lentas, organize qualquer serviço de produção para mantê-los na memória, em vez de recalculá-los a cada nova solicitação.
- Verifique se há uma variante leve de 6 camadas para o idioma desejado. Em implantações em hardware com restrições particularmente severas, essas versões menores para cada idioma trocam um pouco de qualidade por uma ocupação ainda mais reduzida.
- Mantenha expectativas realistas de qualidade em relação a modelos muito maiores. A limitação de 100M de parâmetros é o que torna possível o desempenho em tempo real na CPU. Embora ele se saia muito bem diante de sistemas muito maiores, não há garantia de que iguale todos os modelos grandes dependentes de GPU em cada aspecto da naturalidade. Teste com seu próprio conteúdo, em vez de presumir paridade em todos os casos.
- Espere alguma variação em arquiteturas de CPU antigas ou embarcadas. Os benchmarks publicados refletem hardware moderno, como o MacBook Air M4. O desempenho pode ser diferente em processadores mais antigos ou plataformas embarcadas especializadas; portanto, faça a validação no dispositivo-alvo real antes de finalizar o plano de implantação.
Kyutai Pocket TTS em comparação com modelos leves e de streaming relacionados
| Pocket TTS | Kyutai TTS 1.6B | KaniTTS | |
|---|---|---|---|
| Parâmetros | 100M | 1.6B | 350M–450M |
| Implantação-alvo | CPU, no dispositivo, edge | Streaming no servidor (usado no Unmute) | GPU com pouca VRAM |
| Latência do primeiro trecho | ~200ms | Otimizado para streaming em escala de servidor | <300ms (modo streaming) |
| Clonagem de voz | Sim, zero-shot | Sim | Sim (Kani-TTS-2) |
| Representação principal | Contínua (CALM), sem tokenização discreta | Arquitetura de streaming baseada em Mimi | Tokens discretos por NanoCodec |
| Licença | MIT | Consulte os termos atuais | Apache 2.0 |
O nicho específico do Pocket TTS está no extremo do espectro de implantação que funciona realmente só com CPU. Para uma infraestrutura de servidor que já tenha capacidade de GPU, o modelo maior de 1.6B da própria Kyutai é a opção mais natural. Porém, em dispositivos edge, aplicativos offline e implantações no navegador onde simplesmente não há GPU, o Pocket TTS foi desenvolvido exatamente para essa restrição, em vez de ser adaptado a ela depois.
Perguntas frequentes
O Kyutai Pocket TTS realmente não se beneficia de uma GPU?
Segundo os testes da própria Kyutai, é isso mesmo. Com batch size igual a um, a sobrecarga da transferência de dados da GPU supera qualquer vantagem computacional para o projeto eficiente deste modelo específico. Portanto, a implantação em CPU não é uma concessão; é o caminho previsto.
De quanto áudio de referência o Pocket TTS precisa para clonar uma voz?
Um clipe curto é suficiente para a clonagem zero-shot, sem exigir qualquer etapa de ajuste fino. Você também pode escolher em um catálogo de vozes prontas se não precisar clonar uma referência específica.
Quais idiomas o Pocket TTS oferece?
Inglês no lançamento; a versão v2.0.0 de abril de 2026 ampliou o suporte para francês, alemão, espanhol, português e italiano, e alguns idiomas contam com variantes mais leves de 6 camadas para implantações com restrições maiores.
O Pocket TTS é gratuito para uso comercial?
Sim. Ele é disponibilizado sob a licença MIT, uma das opções mais permissivas entre os modelos TTS de código aberto.
Como a qualidade do Pocket TTS se compara à de modelos TTS muito maiores?
Ele foi projetado para igualar ou se aproximar da qualidade de modelos várias vezes maiores e apresentou resultados excepcionais nos testes de audição da própria Kyutai. Ainda assim, como acontece com qualquer modelo muito compacto, os resultados podem variar conforme o caso de uso. Vale a pena testá-lo com seu próprio conteúdo antes de presumir paridade com sistemas maiores em todos os cenários.
Transforme texto em voz com a Echora
Para um fluxo no navegador com objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.