EchoraEchora
Voltar aos modelos

NaturalSpeech 3: a fala não é uma coisa só — então por que gerá-la como se fosse?

3 de setembro de 2026
•
6 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A maioria dos modelos TTS trata a fala como um único sinal emaranhado que deve ser gerado de uma só vez — conteúdo, entonação, voz e textura agrupados e produzidos em uma única passagem. O NaturalSpeech 3, versão mais recente da linha de pesquisa NaturalSpeech da Microsoft, parte de outra premissa: primeiro separar esses fios, gerar cada um de acordo com suas próprias características e depois recombiná-los. É uma abordagem de dividir para conquistar aplicada à síntese de fala, e é exatamente em torno dela que o NaturalSpeech 3 foi construído.

O que é o NaturalSpeech 3?

O NaturalSpeech 3 é um sistema zero-shot de texto para fala desenvolvido pela Microsoft Research Asia e pela Microsoft Azure Speech, em colaboração com pesquisadores da Universidade de Ciência e Tecnologia da China, da Universidade Chinesa de Hong Kong e da Universidade de Zhejiang. É a versão mais recente da linha de pesquisa NaturalSpeech — depois que o NaturalSpeech original estabeleceu um benchmark de qualidade equivalente à humana com um único falante e o NaturalSpeech 2 ampliou a escala para síntese zero-shot, com vários falantes e de canto por meio de difusão latente — e enfrenta um problema para o qual nenhum de seus antecessores foi projetado especificamente: a qualidade da fala ainda ficava aquém em semelhança e controlabilidade, em parte porque conteúdo, prosódia, timbre e textura acústica eram todos modelados como uma única representação emaranhada.

O movimento central do NaturalSpeech 3 é a fatorização: decompor a fala em subespaços separados que representam atributos distintos, modelar cada um individualmente e combiná-los no final. Dois componentes tornam isso possível — um codec neural criado especificamente para realizar o desentrelaçamento e um modelo de difusão desenvolvido para gerar, em sequência, cada atributo fatorizado.

FACodec: um codec neural criado para separar, não apenas comprimir

A maioria dos codecs neurais de áudio é projetada para comprimir a fala em tokens com a maior eficiência possível, sem uma preocupação especial com o que esses tokens realmente representam em termos semânticos. O FACodec, codec apresentado pelo NaturalSpeech 3, foi projetado em torno do objetivo oposto: usando Factorized Vector Quantization (FVQ), ele decompõe deliberadamente uma forma de onda de fala em subespaços distintos de conteúdo, prosódia, timbre e detalhes acústicos, em vez de criar um único fluxo de códigos indiferenciado.

Alcançar uma separação realmente limpa entre esses subespaços — em vez de permitir que cada um vazasse informações pelas quais os outros deveriam ser responsáveis — exigiu a combinação de várias técnicas específicas durante o treinamento: um gargalo de informação para remover atributos que não pertencem a determinado subespaço, perdas supervisionadas dedicadas que ensinam explicitamente a cada subespaço o atributo pretendido, treinamento adversarial e inversão de gradiente para desestimular ainda mais a contaminação entre os subespaços. Na etapa de decodificação, o subespaço de timbre é reintroduzido por meio de normalização condicional de camadas durante a reconstrução da forma de onda final, em vez de ser simplesmente concatenado com todo o restante.

O modelo de difusão fatorizada

Depois que a fala pode ser dividida de forma confiável nesses subespaços de atributos, o NaturalSpeech 3 os gera com um modelo de difusão construído especificamente para essa estrutura fatorizada — produzindo duração, prosódia, conteúdo e detalhes acústicos em sequência, cada um condicionado aos atributos já gerados e à entrada de texto no nível dos fonemas. A duração é modelada explicitamente como uma etapa independente — em vez de ser incorporada à prosódia — justamente porque o sistema é não autorregressivo e precisa de um sinal temporal explícito como base.

O benefício prático desse projeto é uma controlabilidade independente real: como cada atributo possui seu próprio subespaço e sua própria etapa de geração, é possível condicionar atributos diferentes com prompts diferentes. Um clipe de referência pode fornecer o timbre desejado enquanto outro sinal define a prosódia — um nível de controle granular que uma representação única e emaranhada simplesmente não consegue oferecer, pois ajustar qualquer elemento em um sistema indiferenciado pode acabar arrastando todos os outros atributos com ele.

Os números dos benchmarks

O NaturalSpeech 3 registrou um novo resultado de ponta em semelhança de falante: pontuação Sim-O de 0.67 e SMOS (similarity mean opinion score) de 4.01, contra 0.64 de Sim-O e 3.69 de SMOS do sistema de referência mais forte da época. Esse avanço significativo foi atribuído especificamente à separação mais limpa que o FACodec faz entre o timbre e todo o restante. De modo mais amplo, o sistema superou os sistemas TTS de ponta anteriores em qualidade, semelhança, prosódia e inteligibilidade, e relatou alcançar qualidade equivalente à de gravações humanas reais. A arquitetura também foi validada em escala: os resultados melhoraram ao chegar a aproximadamente 1 bilhão de parâmetros e 200.000 horas de dados de treinamento — um salto importante em relação ao conjunto de treinamento já substancial de 44.000 horas do NaturalSpeech 2.

Como o NaturalSpeech 3 se encaixa na série

Cada geração dessa linha de pesquisa resolveu um problema progressivamente diferente. O NaturalSpeech original estabeleceu uma definição rigorosa e estatisticamente testável de qualidade equivalente à humana e atingiu esse patamar em um benchmark de um único falante. O NaturalSpeech 2 ampliou essa ambição para geração com vários falantes, zero-shot e a partir de dados do mundo real — incluindo, notavelmente, síntese de canto zero-shot — ao substituir a geração autorregressiva de tokens discretos por difusão latente contínua. O NaturalSpeech 3 trata de uma fraqueza totalmente diferente: mesmo com uma clonagem zero-shot robusta, a controlabilidade e a separação nítida de atributos ainda eram limitadas, e foi exatamente para corrigir isso que os codecs fatorizados e a difusão fatorizada foram criados.

NaturalSpeech 3 vs. NaturalSpeech 2 vs. NaturalSpeech

NaturalSpeech 3NaturalSpeech 2NaturalSpeech (original)
Abordagem centralCodec fatorizado (FACodec) + difusão fatorizadaLatentes contínuos + difusão latenteBaseado em VAE, de ponta a ponta
Problema resolvidoControle independente de atributos, semelhançaVários falantes, zero-shot, cantoQualidade equivalente à humana com um único falante
Semelhança de falante (Sim-O)0.67 (novo estado da arte no lançamento)Métrica sem comparação diretaNão se aplica (um único falante)
Controle independente de atributosSim, por meio de subespaços e prompts separadosLimitado a um prompt geral de falante/estiloNão se aplica
Escala de treinamento1 bilhão de parâmetros, 200.000 horas44.000 horasConjunto de benchmark de um único falante
Lançamento público oficialNão (apenas o artigo de pesquisa)Não (existe uma reimplementação da comunidade)Não (existe uma reimplementação da comunidade)

A contribuição específica do NaturalSpeech 3 é provar que tratar a fala como atributos separáveis — em vez de um único sinal indivisível — melhora simultaneamente a qualidade e a controlabilidade, dando continuidade ao fio condutor da série: definir com precisão uma fraqueza específica e depois construir uma arquitetura projetada para fechar exatamente essa lacuna.

Perguntas frequentes

O que significa “fatorizado” no NaturalSpeech 3?

Significa decompor a fala em subespaços separados e desemaranhados — conteúdo, prosódia, timbre e detalhes acústicos —, cada um modelado e gerado de forma relativamente independente, em vez de tratar a fala como uma única representação emaranhada gerada de uma só vez.

O que é o FACodec?

O FACodec é o codec neural de fala apresentado pelo NaturalSpeech 3. Ele usa Factorized Vector Quantization para dividir uma forma de onda de fala em subespaços distintos de conteúdo, prosódia, timbre e detalhes acústicos, empregando técnicas como gargalos de informação e treinamento adversarial para manter esses subespaços claramente separados.

Como o NaturalSpeech 3 se compara ao NaturalSpeech 2?

O NaturalSpeech 2 se concentrou em ampliar a clonagem zero-shot para dados com vários falantes, do mundo real e para síntese de canto usando difusão latente contínua. O NaturalSpeech 3 parte dessa escala, mas mira especificamente a semelhança e a controlabilidade independente, usando seu codec fatorizado e sua abordagem de difusão para alcançar uma nova pontuação de ponta em semelhança de falante.

Posso baixar ou executar o NaturalSpeech 3?

Não oficialmente. A Microsoft não publicou código nem pesos pré-treinados e, ao contrário do NaturalSpeech 2, nenhuma reimplementação consolidada da arquitetura específica do NaturalSpeech 3 feita pela comunidade está amplamente disponível no momento em que este artigo foi escrito.

O NaturalSpeech 3 alcança qualidade equivalente à humana como o NaturalSpeech original?

Os resultados publicados relatam qualidade equivalente à de gravações humanas, ampliando a ambição original da série de alcançar qualidade equivalente à humana para um cenário zero-shot e controlável em vários atributos, muito mais difícil do que o benchmark de um único falante do modelo original.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →