EchoraEchora
Voltar aos modelos

Llasa: síntese de voz como mais uma habilidade que o LLaMA aprendeu

6 de setembro de 2026
•
7 min de leitura

O Llasa, desenvolvido pelo Audio Lab da Universidade de Ciência e Tecnologia de Hong Kong, leva a sério uma aposta específica: se a voz for convertida em tokens da mesma forma que o texto é tokenizado, um grande modelo de linguagem existente não precisa de uma arquitetura especializada para gerá-la — só precisa aprender um novo vocabulário. O Llasa amplia diretamente modelos LLaMA em três escalas diferentes e trata a voz como aquilo que sua própria pesquisa descreve como “uma linguagem especial”, não como uma modalidade separada que exige um sistema próprio e específico.

O que é o Llasa?

O Llasa é um sistema de texto para fala que amplia o modelo de linguagem LLaMA baseado em texto — disponível em tamanhos de 1B, 3B e 8B parâmetros — ao incorporar tokens de voz do codebook XCodec2, que contém 65.536 tokens distintos. Ele foi treinado em 250 mil horas de dados de voz em chinês e inglês, combinando cerca de 160 mil horas de corpora open source (LibriHeavy, Emilia e WenetSpeech4TTS) com outras 90 mil horas de dados internos. O método foi criado para ser perfeitamente compatível com o framework LLaMA padrão: o áudio é convertido em tokens de um único codebook e tratado apenas como mais uma sequência que um modelo de linguagem pode aprender a prever. Assim, técnicas existentes de compressão, aceleração e ajuste fino de LLMs podem ser aplicadas diretamente ao Llasa, em vez de exigir ferramentas específicas para TTS construídas do zero.

Como escolher entre 1B, 3B e 8B

Ter três tamanhos da mesma abordagem subjacente é uma vantagem prática real, pois permite adequar a escala do modelo ao hardware disponível e às necessidades de qualidade, em vez de ficar preso a uma única dimensão fixa:

  • Llasa-1B é a opção mais leve, a escolha mais prática quando as limitações de recursos importam mais do que extrair a qualidade máxima e a versão usada com maior frequência como base para ajustes posteriores em novos idiomas ou dialetos.
  • Llasa-3B ocupa a posição intermediária e é a versão mais citada em demonstrações e comparações da comunidade — uma escolha padrão razoável quando não se sabe qual tamanho atende melhor ao caso de uso.
  • Llasa-8B é a versão maior e mais capaz, avançando na compreensão de textos complexos e na geração de voz com nuances, com um custo computacional proporcionalmente maior.

Escalando a computação em tempo de teste para voz

Esta é a contribuição de pesquisa mais característica do Llasa, emprestada diretamente de uma tendência que recentemente impulsionou o progresso dos LLMs de texto: em vez de melhorar a qualidade apenas treinando um modelo maior ou com mais dados, a pesquisa do Llasa também explora o aumento da computação durante a inferência. É a mesma ideia geral por trás de modelos de raciocínio que “pensam por mais tempo” para produzir respostas melhores, aplicada aqui à geração de voz em vez do raciocínio textual. Assim, a contribuição do Llasa trata tanto de como extrair mais de um modelo fixo por meio de estratégias de inferência quanto da própria arquitetura do modelo.

Forte compreensão de texto

Como o Llasa é construído diretamente sobre a base de um verdadeiro modelo de linguagem, em vez de adicionar um pipeline de texto para fonemas a um modelo acústico, ele processa textos com estruturas complexas em um nível de compreensão que faz muitos sistemas TTS dedicados tropeçarem. Os próprios exemplos do projeto destacam especificamente listas numeradas, pontuação incorporada e frases com várias orações e diálogos entre aspas como textos que o Llasa-8B percorre corretamente, em vez de se atrapalhar.

Clonagem de voz por prompts de voz

O Llasa gera voz apenas a partir do texto de entrada, usando suas próprias características gerais de voz, ou condiciona a geração a um prompt de voz para fazer clonagem — segundo relatos, apenas 15 segundos de áudio de referência podem bastar para capturar o timbre e o caráter emocional da pessoa-alvo. Esse design de dois modos significa que não é preciso clonar uma voz específica quando isso não é necessário: o texto para fala convencional está disponível como um modo principal, não como algo secundário.

Uma particularidade prática que vale conhecer

Ao trabalhar especificamente com o Llasa-3B, é importante observar que o modelo espera áudio de entrada em 16kHz. O uso de áudio com outra taxa de amostragem é uma causa documentada de resultados piores; portanto, vale a pena reamostrar os clipes de referência antes da inferência como uma etapa padrão de pré-processamento, em vez de descobrir a incompatibilidade depois de uma geração decepcionante.

Primeiros passos com o Llasa

  1. Instale primeiro o XCodec2. Como a tokenização de voz do Llasa depende diretamente dele, faça essa dependência funcionar antes de tentar qualquer inferência ou treinamento.
  2. Escolha o tamanho do modelo no Hugging Face. HKUSTAudio/Llasa-1B, HKUSTAudio/Llasa-3B e HKUSTAudio/Llasa-8B estão disponíveis como downloads separados — escolha de acordo com o orçamento de hardware e as necessidades de qualidade, em vez de selecionar o maior por padrão.
  3. Use o repositório de inferência dedicado para testes. O projeto zhenye234/LLaSA_inference no GitHub foi criado especificamente para executar e experimentar com a expansão da computação em tempo de teste, separado da base de código de treinamento.
  4. Use o repositório de treinamento para fazer ajuste fino ou treinar do zero. O zhenye234/LLaSA_training fornece os scripts e os conjuntos de dados open source tokenizados e documentados — cerca de 160 mil horas entre LibriHeavy, Emilia e WenetSpeech4TTS — necessários para reproduzir ou ampliar o processo de treinamento básico.
  5. Faça a taxa de amostragem do áudio de referência corresponder ao que o modelo espera. Especialmente por causa do requisito documentado de 16kHz do Llasa-3B, reamostre o áudio do prompt de voz antes da geração, em vez de presumir que qualquer taxa funcionará da mesma forma.
  6. Considere ajustar o Llasa-1B para idiomas ou dialetos além do treinamento básico. Como o modelo menor é o ponto de partida mais comum para ajuste fino e há trabalhos documentados da comunidade que o ampliam para outros idiomas, como cantonês, esse é um caminho realista quando o idioma desejado não está bem coberto pelo treinamento básico em chinês e inglês.

Dicas para obter resultados melhores

  • Comece com o Llasa-3B se não souber qual tamanho testar primeiro. É a versão citada com maior frequência no uso e nas demonstrações da comunidade, o que facilita encontrar referências para comparação e ajuda na solução de problemas em relação aos checkpoints 1B ou 8B, menos discutidos.
  • Forneça textos realmente complexos para enxergar seu ponto forte. A forte compreensão de texto é uma capacidade destacada especificamente; testar apenas frases simples e bem formatadas não mostra onde o Llasa realmente se diferencia de pipelines TTS mais básicos.
  • Use um clipe de referência limpo com 15 segundos ou mais para clonagem. Esse é o mínimo prático geralmente citado para capturar com confiança o timbre e o caráter emocional de uma voz-alvo.
  • Não espere um bom desempenho imediato em idiomas fora do treinamento em chinês e inglês. Uma avaliação independente em cantonês, por exemplo, mostrou que o modelo básico Llasa-1B tinha desempenho consideravelmente pior que modelos dedicados multilíngues ou de cantonês até receber ajuste fino específico com dados em cantonês. Planeje uma etapa de ajuste fino se o idioma desejado não for chinês nem inglês.
  • Aproveite técnicas de LLM graças à arquitetura LLaMA compartilhada. Como o Llasa é de fato construído sobre o framework LLaMA, abordagens estabelecidas de otimização de LLMs — quantização, ajuste fino com LoRA e técnicas semelhantes — têm mais chance de serem transferidas com facilidade do que teriam em uma arquitetura TTS fundamentalmente diferente.

Llasa em comparação com outras abordagens TTS baseadas em LLMs

LlasaOuteTTSCosyVoice3
Arquitetura básicaLLaMA (1B/3B/8B) + tokens XCodec2LLaMA/Qwen + tokens DACTokens semânticos supervisionados + flow matching
Opções de tamanho1B, 3B, 8B350M–1B0.5B
IdiomasChinês, inglês23 (v1.0)9 + 18 dialetos chineses
Clonagem de vozSim, prompt de voz de ~15 segundosSim, referência de ~10 segundosSim, referência de ~3–10 segundos
Execução por llama.cpp / GGUFNão é o principal caminho de implantaçãoSim, nativamenteNão
Desempenho imediato em dialetosExige ajuste fino além de chinês e inglêsFoco em inglêsForte suporte nativo a dialetos chineses

O nicho específico do Llasa é oferecer flexibilidade real de tamanho — de 1B a 8B — dentro da abordagem de “TTS como modelagem pura de linguagem”, junto com uma pesquisa voltada a escalar a computação durante a inferência. É uma ênfase diferente da estratégia de implantação do OuteTTS, que prioriza llama.cpp, ou do foco do CosyVoice3 na amplitude de dialetos, embora os três pertençam a uma família de arquiteturas semelhante.

Perguntas frequentes

Qual é a diferença entre o Llasa 1B, 3B e 8B?

Eles usam a mesma abordagem subjacente em escalas crescentes: 1B é o mais leve e o ponto de partida mais comum para ajuste fino; 3B é a versão usada com maior frequência em demonstrações da comunidade; e 8B é o maior, oferecendo a melhor compreensão de texto e qualidade de geração por um custo computacional superior.

De quanto áudio de referência o Llasa precisa para clonar uma voz?

Geralmente, considera-se que cerca de 15 segundos de áudio de referência limpo bastam para capturar o timbre e o caráter emocional da pessoa-alvo.

O Llasa funciona bem em idiomas além do chinês e do inglês?

Não de imediato. Testes independentes em cantonês, por exemplo, mostraram que o modelo básico tinha desempenho inferior ao de sistemas dedicados ao cantonês ou multilíngues até receber ajuste fino específico com dados desse idioma.

O que significa “escalar a computação em tempo de teste” para o Llasa?

Significa melhorar a qualidade da saída usando computação adicional durante a inferência, e não apenas por meio da escala do treinamento. É um conceito semelhante ao uso de computação adicional em inferência por modelos de linguagem voltados ao raciocínio para produzir respostas melhores, aplicado aqui à geração de voz.

Por que o Llasa-3B precisa especificamente de áudio de entrada em 16kHz?

Esse é um requisito documentado desse checkpoint específico. Inserir áudio com outras taxas de amostragem é uma causa conhecida de resultados piores, por isso vale a pena reamostrar previamente os clipes de referência para 16kHz como prática padrão.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →