VALL-E: O modelo que começou a tratar a fala como texto
- O que é o VALL-E?
- Como a fala se torna um problema de modelagem da linguagem
- Um efeito colateral notável: a emoção e o ambiente também são preservados
- Desempenho do VALL-E
- Como começar a usar o VALL-E hoje
- Dicas para trabalhar com o VALL-E
- VALL-E em comparação com modelos contemporâneos e posteriores
- Perguntas frequentes
- Transforme texto em voz com a Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Os modelos GPT não entendem a linguagem fazendo regressão de sinais contínuos — eles preveem repetidamente o próximo token de uma sequência, e essa ideia simples escala de forma extraordinária. Desenvolvido pela Microsoft, o VALL-E questionou o que aconteceria se a conversão de texto para voz funcionasse do mesmo modo: converter o áudio em tokens discretos e deixar que um modelo de linguagem os previsse como prevê palavras. Essa reformulação explica por que o VALL-E é descrito como um modelo de linguagem com codec neural, e não como um sistema TTS convencional, e é o ponto de partida arquitetônico sobre o qual toda uma geração posterior de modelos de clonagem de voz — VALL-E 2, VALL-E X e outros — foi construída diretamente.
O que é o VALL-E?
O VALL-E foi apresentado pela Microsoft em um artigo de janeiro de 2023, e sua mudança decisiva foi tratar a conversão de texto para voz como uma tarefa de modelagem condicional da linguagem sobre códigos discretos de áudio, em vez da regressão de sinais contínuos usada pelos sistemas TTS neurais anteriores. Para tornar isso possível, o VALL-E usa o EnCodec — um codec neural de áudio baseado em quantização vetorial residual — para converter ondas de fala reais em tokens discretos que carregam tanto a identidade do falante quanto suas características acústicas e que, depois, podem ser decodificados novamente como áudio de alta qualidade.
O modelo foi treinado com cerca de 60.000 horas de fala em inglês — centenas de vezes mais dados de treinamento do que os sistemas TTS costumavam usar na época — e essa escala trouxe uma capacidade realmente nova: aprendizado em contexto para clonagem de voz. Basta fornecer ao VALL-E um prompt acústico de 3 segundos de um falante que ele nunca ouviu para que gere uma nova fala naquela voz, da mesma forma que um grande modelo de linguagem consegue captar um padrão em um prompt curto sem nenhum treinamento adicional.
Como a fala se torna um problema de modelagem da linguagem
A arquitetura do VALL-E combina modelagem autorregressiva (AR) e não autorregressiva (NAR), distribuídas pela estrutura em camadas dos tokens de codec. O EnCodec não produz apenas um fluxo de tokens por quadro de áudio — ele gera oito camadas de codebook por quadro, cada uma capturando detalhes acústicos progressivamente mais precisos. O componente AR do VALL-E prevê em sequência a primeira e mais importante camada de codebook, condicionado à sequência de fonemas do texto de entrada; essa é a etapa que mais se parece com um modelo de linguagem tradicional gerando um token por vez. Em seguida, o componente NAR preenche as outras sete camadas em paralelo, condicionado ao que o modelo AR já gerou. Assim, abre mão de parte da flexibilidade do modelo AR em troca de uma geração significativamente mais rápida nas camadas menos importantes para a inteligibilidade geral.
Um efeito colateral notável: a emoção e o ambiente também são preservados
Como o modelo parte de um prompt acústico real, e não de um embedding abstrato do falante, constatou-se que o VALL-E preserva muito mais do que a identidade vocal do clipe de referência de 3 segundos: ele também tende a carregar o tom emocional do falante e até o ambiente acústico presente no próprio prompt, como a reverberação do cômodo e as características do fundo. Isso não foi exatamente um recurso criado de forma explícita, mas uma propriedade emergente de condicionar o modelo diretamente com tokens acústicos reais em vez de uma representação comprimida que contenha apenas a identidade. É o mesmo tipo de comportamento emergente que tornou o aprendizado em contexto tão relevante nos modelos de linguagem baseados em texto.
Desempenho do VALL-E
Em sua avaliação original contra o YourTTS — o sistema TTS zero-shot mais avançado disponível publicamente na época —, o VALL-E apresentou resultados significativamente melhores tanto em naturalidade da fala quanto em semelhança do falante nos benchmarks LibriSpeech e VCTK. Ele também demonstrou a capacidade de gerar resultados diversos para a mesma entrada por meio de diferentes execuções de decodificação baseadas em amostragem, em vez de sempre convergir para um único resultado determinístico.
Como começar a usar o VALL-E hoje
É importante saber desde o início: a Microsoft nunca publicou o código de treinamento nem os pesos do VALL-E, mencionando o risco de uso indevido diante do realismo da clonagem de voz com apenas 3 segundos. O que existe publicamente é o artigo de pesquisa e as amostras de demonstração, não um checkpoint oficial para download. Hoje, o acesso prático depende de iniciativas da comunidade:
- Use uma reimplementação independente em PyTorch. Projetos no GitHub como
lifeiteng/vall-ereproduzem a arquitetura do artigo, mas, em geral, exigem que você treine seu próprio modelo em um conjunto de dados como o LibriTTS, em vez de fornecer pesos pré-treinados prontos para uso. - Considere as reproduções comunitárias do VALL-E X se quiser pesos prontos para usar. O VALL-E X — uma extensão entre idiomas da mesma ideia central e também, originalmente, um projeto de pesquisa da Microsoft sem lançamento público oficial — tem uma reprodução popular da comunidade (
Plachtaa/VALL-E-X) que inclui pesos pré-treinados. Isso o torna um ponto de partida mais imediato se você quiser ouvir essa família de arquiteturas em ação sem treinar tudo do zero. - Ajuste as expectativas de treinamento se escolher começar do zero. Considerando a escala de 60.000 horas de treinamento do modelo original, reproduzir uma qualidade comparável no seu próprio hardware exige capacidade computacional significativa e um conjunto de dados de fala grande e limpo. É um projeto de nível de pesquisa, não algo para concluir em um fim de semana.
- Consulte o VALL-E 2 se quiser um sucessor mais prático. O trabalho posterior da Microsoft abordou diretamente os problemas conhecidos de robustez e velocidade do VALL-E e representa uma versão mais refinada do mesmo método central. Vale a pena conhecê-lo se a viabilidade em produção for mais importante para você do que estudar a arquitetura original.
Dicas para trabalhar com o VALL-E
- Trate-o como uma referência arquitetônica, não como um modelo pronto para implantação. Diante da ausência de um lançamento público oficial, grande parte do valor prático atual está em entender a abordagem de modelo de linguagem com codec neural criada pelo VALL-E, que aparece de diferentes formas em muitos modelos open source de clonagem mais recentes.
- Espere que a emoção e o ambiente do clipe de prompt sejam preservados. Se você trabalhar com uma reprodução e o resultado trouxer inesperadamente o ruído de fundo ou o tom emocional do clipe de referência, essa é uma característica documentada desta família de arquiteturas, não um erro da implementação específica que você estiver usando.
- Reserve tempo de treinamento real ao usar uma reimplementação do zero. Implementações da comunidade sem pesos pré-treinados precisam de uma quantidade substancial de dados e recursos computacionais para chegar perto da qualidade relatada no artigo original.
- Verifique a licença e a procedência do conjunto de dados de cada reprodução. Como são modelos treinados pela comunidade, e não um lançamento oficial, as condições de licença e a origem dos dados de treinamento variam entre os projetos. Revise o repositório específico que pretende usar antes de qualquer aplicação comercial.
VALL-E em comparação com modelos contemporâneos e posteriores
| VALL-E | YourTTS (referência contemporânea) | Modelos posteriores de flow matching (E2 TTS, F5-TTS) | |
|---|---|---|---|
| Abordagem central | Tokens discretos de codec + modelagem da linguagem | TTS neural tradicional | Flow matching, não autorregressivo |
| Escala dos dados de treinamento | ~60.000 horas | Consideravelmente menor | Comparável ou menor, com outro foco |
| Duração do prompt para clonagem de voz | ~3 segundos | Geralmente requer mais tempo | ~5–15 segundos |
| Naturalidade/semelhança (resultados publicados) | Superou o YourTTS | Referência da comparação | Em geral, convergência mais rápida e alinhamento mais estável |
| Pesos oficiais públicos | Não | Sim | Sim (F5-TTS); não (E2 TTS) |
| Preservação de emoção/ambiente | Notável e emergente | Não é um recurso destacado | Menos enfatizada |
O verdadeiro legado do VALL-E não é um checkpoint que você possa baixar, mas a reformulação do TTS como um problema de previsão de tokens, na qual grande parte dos atuais modelos open source de clonagem ainda se baseia de uma forma ou de outra.
Perguntas frequentes
Posso baixar os pesos oficiais do modelo VALL-E da Microsoft?
Não. A Microsoft publicou o artigo de pesquisa e amostras de áudio de demonstração, mas nunca disponibilizou publicamente o código de treinamento nem os pesos do modelo, devido ao risco de uso indevido de uma clonagem de voz tão convincente com clipes curtos.
O que significa, na prática, “modelo de linguagem com codec neural”?
Significa que o modelo trata a geração de fala como a previsão de tokens discretos de áudio, obtidos de um codec neural como o EnCodec, do mesmo modo que um modelo de linguagem prevê tokens de texto, em vez de fazer a regressão direta de um sinal contínuo de áudio como os sistemas TTS anteriores.
Quanto áudio de referência o VALL-E precisa para clonar uma voz?
Apenas 3 segundos. Ele usa o aprendizado em contexto para gerar uma nova fala naquela voz, sem nenhum ajuste adicional.
Qual é a diferença entre VALL-E e VALL-E X?
O VALL-E X é uma extensão entre idiomas da mesma arquitetura central. Também surgiu como um projeto de pesquisa da Microsoft sem lançamento público oficial, mas tem uma reprodução popular da comunidade que fornece pesos pré-treinados e prontos para uso.
Existe alguma forma de realmente executar o VALL-E sem treiná-lo por conta própria?
Reproduções da comunidade como Plachtaa/VALL-E-X fornecem pesos pré-treinados para a variante multilíngue; já as reproduções do VALL-E original, como lifeiteng/vall-e, normalmente exigem que você treine seu próprio modelo em vez de baixar pesos já treinados.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.