VALL-E 2: dois ajustes e, de repente, a voz ficou indistinguível da humana
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Levar um modelo de “impressionantemente próximo da fala humana” a “supostamente indistinguível dela” nem sempre exige uma arquitetura nova — às vezes, basta corrigir as duas questões específicas que silenciosamente limitavam o original. O VALL-E 2, sucessor do VALL-E desenvolvido pela Microsoft, fez exatamente duas mudanças direcionadas no mesmo projeto central, e o resultado foi descrito como o primeiro sistema zero-shot de texto para fala a atingir desempenho equivalente ao humano — uma afirmação testada diretamente em comparação com gravações humanas reais, não apenas com outros modelos.
O que é o VALL-E 2?
O VALL-E 2 se baseia diretamente na abordagem de modelagem de linguagem com codec neural do VALL-E — a mesma ideia central de tratar a geração de fala como previsão de tokens sobre códigos discretos de áudio, usando a mesma arquitetura Transformer híbrida autorregressiva (AR) e não autorregressiva (NAR), com uma camada de embeddings de texto, uma camada de embeddings de códigos e uma camada de previsão de códigos compartilhadas pelos dois componentes. O que mudou não foi a base, mas dois mecanismos específicos acrescentados sobre ela, cada um voltado para uma fraqueza concreta do modelo original.
As duas melhorias que fizeram a diferença
Amostragem sensível a repetições (Repetition Aware Sampling). O processo de decodificação original do VALL-E usava uma amostragem aleatória direta, que às vezes podia produzir uma saída instável ou entrar em um loop infinito, repetindo o mesmo som ou frase indefinidamente. O VALL-E 2 corrige isso acompanhando a repetição de tokens no histórico de decodificação e alternando de forma adaptativa entre amostragem aleatória e nucleus sampling a cada etapa — se a taxa de repetição ultrapassa um limite definido, o modelo substitui o token por outro, reamostrado aleatoriamente da distribuição de probabilidade original, em vez de continuar no caminho repetitivo. O resultado é uma decodificação significativamente mais estável sem sacrificar a variação natural proporcionada pela geração baseada em amostragem.
Modelagem de códigos agrupados (Grouped Code Modeling). Em vez de modelar cada código de codec como uma etapa separada, o VALL-E 2 reúne os códigos de codec em grupos e modela cada grupo dentro de um único frame durante o processo de geração AR. Isso reduz o comprimento efetivo da sequência que o modelo precisa processar, o que acelera a inferência e resolve diretamente a dificuldade que sequências longas criavam para a arquitetura original.
Nenhuma das mudanças altera a ideia fundamental de modelo de linguagem com codec neural introduzida pelo VALL-E — são correções de engenharia direcionadas à estabilidade da decodificação e ao comprimento das sequências e, juntas, foram suficientes para avançar de “muito bom” para uma afirmação específica e verificável de desempenho equivalente ao humano.
Os resultados em nível humano, em contexto
A avaliação usou dois conjuntos de testes distintos, e o mais difícil oferece o resultado mais revelador. No LibriSpeech test-clean, com 40 falantes diferentes e uma fala de referência usada como prompt de clonagem para cada um, o VALL-E 2 superou o VALL-E original tanto nas pontuações de similaridade do falante (SMOS) quanto nas de qualidade da fala (CMOS). No VCTK — um benchmark consideravelmente mais difícil, com 60 falantes e sotaques muito mais diversos, o que torna a clonagem zero-shot significativamente mais complexa —, o VALL-E 2 não apenas voltou a superar o VALL-E, como igualou ou superou as gravações humanas reais usadas como referência, utilizando apenas um prompt de 3 segundos por falante. Esse resultado específico no conjunto de dados mais difícil e com maior diversidade de sotaques é a base da afirmação de desempenho equivalente ao humano.
O artigo também informou que o VALL-E 2 conseguia sintetizar de forma confiável frases complexas que eram um desafio conhecido para o modelo original — frases com construções incomuns ou sequências de fonemas difíceis, que antes provocavam exatamente a instabilidade que a Repetition Aware Sampling foi projetada para corrigir.
Por que você não pode baixar o VALL-E 2
Este é o aspecto prático mais importante a entender sobre o modelo, e a Microsoft foi incomumente direta a respeito: o VALL-E 2 deliberadamente não foi lançado como modelo ou produto público. Os pesquisadores citaram exatamente os riscos de uso indevido que se esperaria de um sistema tão convincente — falsificação de voz e imitação de uma pessoa específica sem seu consentimento. O próprio artigo de pesquisa enquadra os experimentos pressupondo que os usuários tenham o consentimento da pessoa-alvo de qualquer síntese, uma proteção ética especialmente explícita para uma publicação científica e que reflete a seriedade com que a equipe tratou as implicações do que havia criado.
Na prática, isso significa que não há um checkpoint oficial e que — ao contrário do VALL-E X, que tem uma reprodução comunitária popular e plenamente utilizável, com pesos pré-treinados publicados — nenhuma recriação open source igualmente completa das técnicas específicas do VALL-E 2, Repetition Aware Sampling e Grouped Code Modeling, surgiu até o momento da redação deste artigo. O que está disponível publicamente é o artigo de pesquisa, a página do projeto da própria Microsoft com amostras de áudio e frameworks de avaliação como o ELLA-V, usados junto ao LibriSpeech e ao VCTK para avaliar como o modelo lida com tarefas complexas de geração.
O que isso significa se você está avaliando o VALL-E 2
Se o seu interesse é compreender o estado da arte em modelos de linguagem com codec neural, a contribuição do VALL-E 2 realmente merece ser estudada: ela demonstra que correções na estratégia de decodificação, e não apenas modelos maiores ou mais dados, podem ser a diferença entre “impressionante” e “desempenho equivalente ao humano” em um benchmark rigoroso e com diversidade de sotaques. Se o seu interesse é de fato implantar algo, o caminho prático passa pelos modelos que foram lançados — a reprodução comunitária do VALL-E X para trabalhos entre idiomas ou modelos open source de clonagem totalmente diferentes (F5-TTS, Chatterbox e CosyVoice3) para uso em produção, já que o próprio VALL-E 2 nunca foi disponibilizado para execução.
VALL-E 2 vs. VALL-E vs. VALL-E X
| VALL-E 2 | VALL-E (original) | VALL-E X | |
|---|---|---|---|
| Principal melhoria | Amostragem sensível a repetições + modelagem de códigos agrupados | Conceito original de modelo de linguagem com codec neural | Extensão interlinguística do VALL-E |
| Estabilidade da decodificação | Melhora significativa; corrige o problema do loop infinito | Instabilidade conhecida com algumas entradas | Herda a abordagem do VALL-E |
| Resultado declarado | Desempenho equivalente ao humano no LibriSpeech e no VCTK | Superou o baseline YourTTS | Transferência entre idiomas de alta qualidade |
| Duração do prompt de referência | ~3 segundos | ~3 segundos | ~3–10 segundos |
| Lançamento público oficial | Não | Não | Não |
| Reprodução comunitária utilizável | Nenhuma amplamente disponível | Exige treinamento próprio | Sim, com pesos pré-treinados publicados |
A verdadeira importância do VALL-E 2 está em ser um marco de pesquisa, e não uma ferramenta pronta para baixar e usar — é a evidência mais clara até agora de que a abordagem de modelo de linguagem com codec neural iniciada pelo VALL-E pode, com os aperfeiçoamentos certos na decodificação, produzir fala zero-shot que os ouvintes não conseguem distinguir de forma confiável de uma gravação real.
Perguntas frequentes
Posso baixar ou usar o VALL-E 2?
Não. A Microsoft não publicou código oficial nem pesos pré-treinados e, ao contrário do VALL-E X, não há até o momento da redação deste artigo uma reprodução comunitária amplamente disponível das técnicas específicas do VALL-E 2. O que está disponível publicamente é o artigo de pesquisa e as amostras de áudio.
O que significa “desempenho equivalente ao humano” neste contexto?
Significa que, em avaliações de benchmark específicas — o LibriSpeech e o conjunto VCTK, com maior diversidade de sotaques —, as notas dos ouvintes para a fala gerada pelo VALL-E 2 igualaram ou superaram as notas das gravações humanas reais usadas como referência, utilizando apenas um prompt de clonagem de 3 segundos por falante.
O que são Repetition Aware Sampling e Grouped Code Modeling?
Repetition Aware Sampling ajusta de forma adaptativa o processo de decodificação com base no histórico de repetição dos tokens para evitar saídas instáveis ou em loop. Grouped Code Modeling reúne códigos de codec em grupos para reduzir o comprimento efetivo da sequência, melhorando tanto a velocidade de inferência quanto a capacidade do modelo de lidar com sequências mais longas.
Por que a Microsoft decidiu não lançar o VALL-E 2?
Os pesquisadores citaram o risco de uso indevido devido ao poder de convencimento dos resultados de clonagem, mencionando especificamente questões como falsificação de voz e imitação de uma pessoa específica sem seu consentimento.
Qual é a diferença entre o VALL-E 2 e o VALL-E X?
O VALL-E 2 melhora a estabilidade da decodificação e a qualidade de fala do VALL-E original dentro de um mesmo idioma por meio de Repetition Aware Sampling e Grouped Code Modeling. O VALL-E X, uma linha de trabalho separada, amplia o VALL-E especificamente para transferência de voz entre idiomas e, ao contrário do VALL-E 2, conta com uma reprodução comunitária utilizável e com pesos pré-treinados publicados.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.