EchoraEchora
Voltar a Modelos

Kokoro TTS: a prova de que um modelo TTS não precisa de GPU para soar bem

27 de agosto de 2026
7 min de leitura

Transforme texto e gravações em obras que se ouvem

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A maioria dos modelos de voz open source presume que você tem uma GPU ociosa. Kokoro não faz essa suposição: com 82 milhões de parâmetros, é pequeno o suficiente para rodar confortavelmente em uma CPU, inclusive em um notebook de anos atrás, e ainda assim chegou ao topo do ranking TTS Arena do Hugging Face contra modelos muitas vezes maiores. Se o seu projeto precisa de fala natural sem provisionar infraestrutura de GPU, este é o modelo feito para essa restrição.

O que é Kokoro?

Kokoro-82M é um modelo de texto para fala com pesos abertos, lançado pelo desenvolvedor hexgrad sob a licença Apache 2.0. Isso significa que ele é gratuito para uso comercial, modificação e auto-hospedagem, sem royalties e sem restrições para implantação de código fechado. Ele usa uma arquitetura somente de decodificador que combina StyleTTS 2 e ISTFTNet e, apesar de pesar aproximadamente 327MB, produz áudio limpo em 24kHz que se mantém competitivo com modelos várias vezes maiores desde o lançamento da v1.0.

O próprio nome significa “coração” ou “espírito” em japonês, uma referência ao objetivo do projeto de obter fala genuinamente expressiva de um modelo pequeno o bastante para rodar em qualquer lugar.

Modelo pequeno, capacidade real

O número de destaque do Kokoro são os 82 milhões de parâmetros, mas os números mais úteis são os benefícios que esse tamanho entrega:

  • 54 vozes em 8 idiomas, incluindo inglês americano e britânico, francês, japonês, coreano e mandarim, todas reunidas em um único arquivo de pesos de cerca de 327MB, em vez de downloads separados por idioma.
  • Desempenho nativo em CPU. Kokoro roda em velocidade de tempo real ou superior em hardware de CPU comum e, se houver uma GPU disponível, usa menos de 2GB de VRAM: uma fração do que modelos de qualidade comparável normalmente exigem.
  • Janela de geração de 510 tokens por passada, suficiente para trechos substanciais de narração sem precisar transmitir token a token.
  • Suporte a ONNX para desempenho quase em tempo real mesmo em hardware limitado, como Apple Silicon, por meio do pacote comunitário kokoro-onnx.

Vale conhecer antecipadamente a contrapartida desse tamanho: Kokoro não oferece clonagem de voz zero-shot, seu alcance emocional é mais estreito do que o de modelos expressivos maiores e a qualidade em idiomas que não sejam inglês é, em geral, menos refinada do que a saída em inglês. Ele é otimizado para narração eficiente e confiável, não para interpretação dramática ou clonagem instantânea de voz.

Como começar com Kokoro

  1. Instale primeiro a dependência do sistema. Kokoro depende de espeak-ng para fonemização: instale-o pelo gerenciador de pacotes do sistema (apt-get install espeak-ng no Debian/Ubuntu) antes de instalar o pacote Python, ou a configuração falhará silenciosamente na conversão de texto em fonemas.
  2. Instale o pacote Kokoro. pip install kokoro soundfile cobre as dependências principais; adicione misaki[ja] ou misaki[zh] se precisar especificamente de suporte a japonês ou chinês.
  3. Inicialize um pipeline e gere. Carregue KPipeline com um código de idioma ('a' para inglês americano, 'b' para inglês britânico e assim por diante), passe o texto e um nome de voz como af_heart ou bm_george, e o Kokoro retorna áudio diretamente: normalmente são cinco linhas de Python desde a instalação até um arquivo .wav.
  4. Considere o caminho ONNX ou Docker para produção. Em ambientes somente com CPU ou para uma implantação mais simples, o pacote mantido pela comunidade kokoro-onnx ou a imagem Docker kokoro-fastapi (que expõe um endpoint de fala compatível com OpenAI) colocam um serviço em funcionamento mais rapidamente do que conectar o pipeline bruto por conta própria.
  5. Teste cedo o hardware de destino. Kokoro é realmente utilizável em hardware tão modesto quanto uma CPU de uma década atrás, mas confirmar uma latência aceitável no destino real de implantação antes de adotá-lo evita surpresas depois.

Dicas para obter melhores resultados

  • Fique atento a entradas isoladas de uma única palavra. O fonemizador do Kokoro é ajustado para o contexto de frases naturais: uma palavra ou número isolado (como “six” sozinho) pode ocasionalmente ser pronunciado de forma incorreta ou receber uma ênfase estranha. Usar frases completas em vez de fragmentos evita isso.
  • Divida conteúdos longos. Para narração de livros ou artigos, divida o texto em trechos do tamanho de parágrafos ou capítulos, em vez de uma entrada enorme. Isso torna a geração previsível e evita exceder a janela de tokens por passada.
  • Escolha vozes de propósito, não por padrão. Com 54 vozes disponíveis, vale a pena gastar alguns minutos testando duas ou três candidatas com o conteúdo real do seu roteiro. A qualidade varia visivelmente de acordo com o nome, e a melhor opção nem sempre é a primeira que você experimenta.
  • Não espere clonagem zero-shot. Se o requisito central do seu projeto é clonar a voz de uma pessoa específica, Kokoro não é o modelo base adequado. Combine-o com um modelo focado em clonagem ou reserve Kokoro para narração em que um repertório fixo de vozes seja suficiente.
  • Use o wrapper de API compatível com OpenAI se estiver substituindo um fornecedor TTS em nuvem. kokoro-fastapi é criado especificamente para ser um substituto local direto de chamadas de API TTS no estilo OpenAI, o que minimiza mudanças no código de integração existente.

Kokoro versus outros modelos leves e focados em clonagem

Kokoro-82MChatterbox TurboChatterbox / Dia
Parâmetros82M350M500M–1.6B
Roda em CPUSim, nativamenteVoltado para GPUVoltado para GPU
Clonagem de vozNãoSim, zero-shotSim
Idiomas8InglêsInglês (Multilingual: 23)
Melhor paraNarração offline, dispositivos de borda, implantação sensível a custoAgentes de voz em tempo realDiálogo expressivo, vozes clonadas
LicençaApache 2.0MITApache 2.0 / MIT

Kokoro não está tentando competir em clonagem ou alcance emocional: toda a sua proposta de valor é oferecer TTS sólido e confiável em hardware onde outros modelos simplesmente não conseguem rodar. Se clonagem ou expressividade dramática é a prioridade, um modelo maior é a melhor escolha; se a prioridade é “rodar barato, em qualquer lugar e para sempre”, é difícil superar o Kokoro.

Perguntas frequentes

Kokoro realmente pode rodar sem GPU? Sim. Kokoro foi criado especificamente para rodar com eficiência em hardware de CPU, inclusive em máquinas mais antigas, em velocidade de tempo real ou quase real: uma GPU é opcional, não obrigatória.

Kokoro oferece clonagem de voz? Não. Kokoro traz um conjunto fixo de 54 vozes integradas, em vez de clonagem zero-shot a partir de um clipe de referência. Para casos de clonagem, um modelo como Chatterbox é mais adequado.

Quais idiomas o Kokoro suporta? Oito, incluindo inglês americano, inglês britânico, francês, japonês, coreano e mandarim; o inglês em geral oferece a qualidade de saída mais refinada.

Kokoro é gratuito para uso comercial? Sim. Ele é lançado sob a licença Apache 2.0, que permite implantação comercial, modificação e integração de código fechado sem royalties.

Quanto custa rodar Kokoro em escala? Quando auto-hospedado, Kokoro é barato de executar: relatos da comunidade apontam custos de apenas alguns centavos por hora em instâncias de GPU econômicas, e provedores de API já o ofereceram por menos de US$ 1 por milhão de caracteres de texto de entrada.

Experimente um recurso comparável de texto para fala

Kokoro está disponível por sua implementação open source e ferramentas da comunidade. Se quiser criar fala no navegador, experimente Texto para fala como um recurso comparável. Ele não é Kokoro e não oferece suas vozes, perfil de execução ou opções de auto-hospedagem específicos, mas permite criar áudio de voz com IA sem configurar o modelo localmente.

Explorar Texto para fala →