EchoraEchora
Voltar a Modelos

Dia TTS: o modelo de código aberto que gera diálogos reais, não apenas frases

17 de agosto de 2026
8 min de leitura

Transforme texto e gravações em obras que se ouvem

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A maioria dos mecanismos de texto para fala foi criada para ler uma frase em voz alta. O Dia TTS foi criado para fazer algo mais difícil: gerar uma conversa inteira — dois falantes, emoções sobrepostas e uma risada no momento certo — em uma única geração, a partir de um roteiro simples. Se você está criando um podcast, um audiolivro, um personagem de jogo ou um agente de IA que precisa soar como pessoas conversando, e não como um narrador lendo, este é o modelo desenvolvido especificamente para essa tarefa.

O que é o Dia TTS (Dia 1.6B)?

O Dia, também conhecido como Dia-1.6B ou Dia 1.6B, é um modelo de texto para fala com 1,6 bilhão de parâmetros, desenvolvido pela Nari Labs, uma pequena equipe sul-coreana fundada por dois desenvolvedores universitários. Lançado sob a licença Apache 2.0, o Dia tem pesos totalmente abertos: os checkpoints ficam hospedados no Hugging Face e o código de inferência é público no GitHub.

O que diferencia o Dia das arquiteturas TTS convencionais não é apenas a quantidade de parâmetros, mas o objetivo de treinamento. Em vez de otimizar a narração limpa de frases isoladas, o Dia foi projetado de ponta a ponta para síntese de diálogos: vários falantes, alternância natural e a textura não verbal que as conversas reais têm. As primeiras comparações da comunidade o colocam como uma alternativa open source relevante a sistemas comerciais fechados, como ElevenLabs e Sesame CSM-1B — especialmente em casos com muito diálogo, nos quais esses modelos ainda soam claramente mais “lidos” do que “falados”.

O Dia continua sendo um dos poucos sistemas de pesos abertos criados especificamente em torno da conversa, em vez de adaptados de modelos de narração de um único falante.

Como o Dia funciona?

O Dia recebe uma transcrição em texto simples e a converte diretamente em uma forma de onda de áudio finalizada — sem um pipeline separado de clonagem de voz e sem juntar manualmente clipes de cada falante. Três mecanismos conduzem o resultado:

Marcação de falantes. Envolver as falas com as tags [S1] e [S2] informa ao modelo qual voz deve dizer cada linha. O Dia mantém o timbre de cada falante marcado consistente durante todo o roteiro, evitando que uma conversa de ida e volta perca a identidade vocal, como costuma acontecer com clipes de um único falante unidos posteriormente.

Geração não verbal. Essa é a capacidade mais característica do Dia. Indicações inseridas no texto, como (laughs), são renderizadas como risadas, tosse ou pigarro reais — não como um “haha” sintetizado e colocado no áudio depois. Esse detalhe faz uma conversa gerada soar como duas pessoas conversando, e não como dois roteiros sendo lidos.

Condicionamento de áudio. Ao fornecer um pequeno clipe de referência junto com o texto, você pode orientar o tom emocional, o ritmo e a interpretação da saída, ou clonar uma voz específica para mantê-la consistente em um projeto. Sem um clipe de referência, o Dia gera vozes variadas aleatoriamente a cada execução; fixar uma semente aleatória ou fornecer um prompt de áudio produz um falante reproduzível e consistente.

Como usar o Dia TTS?

Há três passos práticos, dependendo de você querer avaliar a ideia ou construir algo com o modelo:

  1. Explore online uma funcionalidade de diálogo comparável. O Text to Dialogue permite testar a ideia geral de usar várias vozes na mesma cena antes de se comprometer com uma configuração local do Dia. Ele é uma alternativa com capacidade comparável, não o próprio Dia, e não executa a sintaxe [S1]/[S2] do Dia.
  2. Execute o Dia localmente para produção. Clone o repositório nari-labs/dia do GitHub, configure um ambiente virtual Python e instale as dependências listadas. Os pesos do modelo são baixados automaticamente do Hugging Face na primeira execução, ou o Dia pode ser carregado diretamente pela biblioteca Transformers do Hugging Face.
  3. Verifique o hardware primeiro. O Dia funciona confortavelmente em uma única GPU com cerca de 8–10 GB de VRAM; uma placa de consumo ou uma instância na nuvem, como uma Colab T4, é suficiente para executar a inferência sem técnicas de quantização.

Dicas para obter resultados melhores

  • Mantenha as tags de falante consistentes. Use o mesmo esquema de identificação [S1]/[S2] em todo o roteiro; misturar convenções no meio do texto confunde a atribuição dos turnos.
  • Coloque as indicações não verbais onde elas ocorreriam naturalmente. (laughs) logo depois de uma piada tem um resultado diferente da mesma indicação no meio de uma frase. Trate essas tags como instruções de direção, não como decoração.
  • Fixe uma semente para repetir as vozes. Se você precisa da mesma voz de personagem em várias gerações (por exemplo, um NPC recorrente de um jogo), fixe a semente aleatória ou reutilize o mesmo prompt de áudio em vez de começar do zero todas as vezes.
  • Lembre-se da limitação ao inglês. Atualmente, o Dia só gera fala em inglês. Planeje projetos multilíngues levando essa restrição em conta, em vez de descobri-la depois de executar o modelo.
  • Use um clipe de referência curto e limpo para a clonagem. A qualidade do condicionamento de áudio depende bastante de a amostra de referência ser clara e não conter ruído de fundo.

Dia vs. outros modelos TTS

Dia 1.6BElevenLabsSesame CSM-1B
LicençaPesos abertos (Apache 2.0)API comercial fechadaPesos abertos
Diálogo com vários falantes em uma geraçãoSim, nativoExige atribuir uma voz separada a cada linhaLimitado
Sons não verbais (risadas, tosse)Gerados nativamente a partir de tags de textoNormalmente exige edição manual do áudioNão é um recurso central
Clonagem de vozSim, por condicionamento de áudioSimSim
Auto-hospedagemSim, implantação local completaNãoSim
Suporte a idiomasApenas inglêsMultilíngueFocado em inglês

A vantagem do Dia está exatamente onde o diálogo importa: na alternância entre falantes e no realismo não verbal. Se o seu caso de uso é narração de um único falante em vários idiomas, uma API comercial multilíngue ainda pode ser mais adequada; mas, para áudio em inglês com vários personagens, é difícil igualar o foco do Dia em diálogos open source neste tamanho de modelo.

Perguntas frequentes

O Dia TTS é gratuito?

Sim. O Dia é distribuído sob a licença Apache 2.0, portanto os pesos e o código podem ser usados, modificados e hospedados por você gratuitamente, inclusive em projetos comerciais, desde que os termos da licença sejam respeitados.

O Dia 1.6B oferece suporte a idiomas além do inglês?

Ainda não. O Dia gera apenas fala em inglês; roteiros em outros idiomas não são oficialmente suportados.

De qual hardware preciso para executar o Dia 1.6B localmente?

Uma GPU com aproximadamente 8–10 GB de VRAM é suficiente para a inferência. Tanto uma GPU de consumo quanto uma instância T4 na nuvem funcionam sem otimização adicional.

Onde encontro o repositório do Dia 1.6B no GitHub?

O código oficial e as instruções de configuração são mantidos em nari-labs/dia no GitHub, enquanto os pesos do modelo ficam hospedados separadamente no Hugging Face.

O Dia pode clonar uma voz específica?

Sim. Ao fornecer um clipe de referência como prompt de condicionamento de áudio, o Dia consegue combinar uma voz e um tom emocional desejados, além da geração padrão de vozes aleatórias.

Experimente uma funcionalidade de diálogo comparável

Se você quiser ouvir áudio com vários falantes no navegador, experimente o Text to Dialogue como uma alternativa comparável. Ele não é o Dia TTS, mas permite prototipar cenas com dois falantes antes de configurar o Dia localmente.

Explorar o Text to Dialogue →