EchoraEchora
Voltar aos modelos

VALL-E 2: dois ajustes e, de repente, a voz ficou indistinguível da humana

1 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Levar um modelo de “impressionantemente próximo da fala humana” a “supostamente indistinguível dela” nem sempre exige uma arquitetura nova — às vezes, basta corrigir as duas questões específicas que silenciosamente limitavam o original. O VALL-E 2, sucessor do VALL-E desenvolvido pela Microsoft, fez exatamente duas mudanças direcionadas no mesmo projeto central, e o resultado foi descrito como o primeiro sistema zero-shot de texto para fala a atingir desempenho equivalente ao humano — uma afirmação testada diretamente em comparação com gravações humanas reais, não apenas com outros modelos.

O que é o VALL-E 2?

O VALL-E 2 se baseia diretamente na abordagem de modelagem de linguagem com codec neural do VALL-E — a mesma ideia central de tratar a geração de fala como previsão de tokens sobre códigos discretos de áudio, usando a mesma arquitetura Transformer híbrida autorregressiva (AR) e não autorregressiva (NAR), com uma camada de embeddings de texto, uma camada de embeddings de códigos e uma camada de previsão de códigos compartilhadas pelos dois componentes. O que mudou não foi a base, mas dois mecanismos específicos acrescentados sobre ela, cada um voltado para uma fraqueza concreta do modelo original.

As duas melhorias que fizeram a diferença

Amostragem sensível a repetições (Repetition Aware Sampling). O processo de decodificação original do VALL-E usava uma amostragem aleatória direta, que às vezes podia produzir uma saída instável ou entrar em um loop infinito, repetindo o mesmo som ou frase indefinidamente. O VALL-E 2 corrige isso acompanhando a repetição de tokens no histórico de decodificação e alternando de forma adaptativa entre amostragem aleatória e nucleus sampling a cada etapa — se a taxa de repetição ultrapassa um limite definido, o modelo substitui o token por outro, reamostrado aleatoriamente da distribuição de probabilidade original, em vez de continuar no caminho repetitivo. O resultado é uma decodificação significativamente mais estável sem sacrificar a variação natural proporcionada pela geração baseada em amostragem.

Modelagem de códigos agrupados (Grouped Code Modeling). Em vez de modelar cada código de codec como uma etapa separada, o VALL-E 2 reúne os códigos de codec em grupos e modela cada grupo dentro de um único frame durante o processo de geração AR. Isso reduz o comprimento efetivo da sequência que o modelo precisa processar, o que acelera a inferência e resolve diretamente a dificuldade que sequências longas criavam para a arquitetura original.

Nenhuma das mudanças altera a ideia fundamental de modelo de linguagem com codec neural introduzida pelo VALL-E — são correções de engenharia direcionadas à estabilidade da decodificação e ao comprimento das sequências e, juntas, foram suficientes para avançar de “muito bom” para uma afirmação específica e verificável de desempenho equivalente ao humano.

Os resultados em nível humano, em contexto

A avaliação usou dois conjuntos de testes distintos, e o mais difícil oferece o resultado mais revelador. No LibriSpeech test-clean, com 40 falantes diferentes e uma fala de referência usada como prompt de clonagem para cada um, o VALL-E 2 superou o VALL-E original tanto nas pontuações de similaridade do falante (SMOS) quanto nas de qualidade da fala (CMOS). No VCTK — um benchmark consideravelmente mais difícil, com 60 falantes e sotaques muito mais diversos, o que torna a clonagem zero-shot significativamente mais complexa —, o VALL-E 2 não apenas voltou a superar o VALL-E, como igualou ou superou as gravações humanas reais usadas como referência, utilizando apenas um prompt de 3 segundos por falante. Esse resultado específico no conjunto de dados mais difícil e com maior diversidade de sotaques é a base da afirmação de desempenho equivalente ao humano.

O artigo também informou que o VALL-E 2 conseguia sintetizar de forma confiável frases complexas que eram um desafio conhecido para o modelo original — frases com construções incomuns ou sequências de fonemas difíceis, que antes provocavam exatamente a instabilidade que a Repetition Aware Sampling foi projetada para corrigir.

Por que você não pode baixar o VALL-E 2

Este é o aspecto prático mais importante a entender sobre o modelo, e a Microsoft foi incomumente direta a respeito: o VALL-E 2 deliberadamente não foi lançado como modelo ou produto público. Os pesquisadores citaram exatamente os riscos de uso indevido que se esperaria de um sistema tão convincente — falsificação de voz e imitação de uma pessoa específica sem seu consentimento. O próprio artigo de pesquisa enquadra os experimentos pressupondo que os usuários tenham o consentimento da pessoa-alvo de qualquer síntese, uma proteção ética especialmente explícita para uma publicação científica e que reflete a seriedade com que a equipe tratou as implicações do que havia criado.

Na prática, isso significa que não há um checkpoint oficial e que — ao contrário do VALL-E X, que tem uma reprodução comunitária popular e plenamente utilizável, com pesos pré-treinados publicados — nenhuma recriação open source igualmente completa das técnicas específicas do VALL-E 2, Repetition Aware Sampling e Grouped Code Modeling, surgiu até o momento da redação deste artigo. O que está disponível publicamente é o artigo de pesquisa, a página do projeto da própria Microsoft com amostras de áudio e frameworks de avaliação como o ELLA-V, usados junto ao LibriSpeech e ao VCTK para avaliar como o modelo lida com tarefas complexas de geração.

O que isso significa se você está avaliando o VALL-E 2

Se o seu interesse é compreender o estado da arte em modelos de linguagem com codec neural, a contribuição do VALL-E 2 realmente merece ser estudada: ela demonstra que correções na estratégia de decodificação, e não apenas modelos maiores ou mais dados, podem ser a diferença entre “impressionante” e “desempenho equivalente ao humano” em um benchmark rigoroso e com diversidade de sotaques. Se o seu interesse é de fato implantar algo, o caminho prático passa pelos modelos que foram lançados — a reprodução comunitária do VALL-E X para trabalhos entre idiomas ou modelos open source de clonagem totalmente diferentes (F5-TTS, Chatterbox e CosyVoice3) para uso em produção, já que o próprio VALL-E 2 nunca foi disponibilizado para execução.

VALL-E 2 vs. VALL-E vs. VALL-E X

VALL-E 2VALL-E (original)VALL-E X
Principal melhoriaAmostragem sensível a repetições + modelagem de códigos agrupadosConceito original de modelo de linguagem com codec neuralExtensão interlinguística do VALL-E
Estabilidade da decodificaçãoMelhora significativa; corrige o problema do loop infinitoInstabilidade conhecida com algumas entradasHerda a abordagem do VALL-E
Resultado declaradoDesempenho equivalente ao humano no LibriSpeech e no VCTKSuperou o baseline YourTTSTransferência entre idiomas de alta qualidade
Duração do prompt de referência~3 segundos~3 segundos~3–10 segundos
Lançamento público oficialNãoNãoNão
Reprodução comunitária utilizávelNenhuma amplamente disponívelExige treinamento próprioSim, com pesos pré-treinados publicados

A verdadeira importância do VALL-E 2 está em ser um marco de pesquisa, e não uma ferramenta pronta para baixar e usar — é a evidência mais clara até agora de que a abordagem de modelo de linguagem com codec neural iniciada pelo VALL-E pode, com os aperfeiçoamentos certos na decodificação, produzir fala zero-shot que os ouvintes não conseguem distinguir de forma confiável de uma gravação real.

Perguntas frequentes

Posso baixar ou usar o VALL-E 2?

Não. A Microsoft não publicou código oficial nem pesos pré-treinados e, ao contrário do VALL-E X, não há até o momento da redação deste artigo uma reprodução comunitária amplamente disponível das técnicas específicas do VALL-E 2. O que está disponível publicamente é o artigo de pesquisa e as amostras de áudio.

O que significa “desempenho equivalente ao humano” neste contexto?

Significa que, em avaliações de benchmark específicas — o LibriSpeech e o conjunto VCTK, com maior diversidade de sotaques —, as notas dos ouvintes para a fala gerada pelo VALL-E 2 igualaram ou superaram as notas das gravações humanas reais usadas como referência, utilizando apenas um prompt de clonagem de 3 segundos por falante.

O que são Repetition Aware Sampling e Grouped Code Modeling?

Repetition Aware Sampling ajusta de forma adaptativa o processo de decodificação com base no histórico de repetição dos tokens para evitar saídas instáveis ou em loop. Grouped Code Modeling reúne códigos de codec em grupos para reduzir o comprimento efetivo da sequência, melhorando tanto a velocidade de inferência quanto a capacidade do modelo de lidar com sequências mais longas.

Por que a Microsoft decidiu não lançar o VALL-E 2?

Os pesquisadores citaram o risco de uso indevido devido ao poder de convencimento dos resultados de clonagem, mencionando especificamente questões como falsificação de voz e imitação de uma pessoa específica sem seu consentimento.

Qual é a diferença entre o VALL-E 2 e o VALL-E X?

O VALL-E 2 melhora a estabilidade da decodificação e a qualidade de fala do VALL-E original dentro de um mesmo idioma por meio de Repetition Aware Sampling e Grouped Code Modeling. O VALL-E X, uma linha de trabalho separada, amplia o VALL-E especificamente para transferência de voz entre idiomas e, ao contrário do VALL-E 2, conta com uma reprodução comunitária utilizável e com pesos pré-treinados publicados.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →