NaturalSpeech 2: ele faz cantar uma voz que nunca chegou a cantar
- Que problema o NaturalSpeech 2 realmente buscava resolver?
- O mecanismo de amostra de voz por trás da geração zero-shot
- Entenda a síntese de canto zero-shot
- Desempenho
- Como começar a usar o NaturalSpeech 2 hoje
- Dicas para entender o NaturalSpeech 2
- NaturalSpeech 2 vs. NaturalSpeech vs. VALL-E
- Perguntas frequentes
- Transforme texto em voz com a Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Este é o detalhe que mais se destaca no NaturalSpeech 2: forneça alguns segundos de uma pessoa simplesmente falando — sem canto, sem melodia, sem absolutamente nada musical — e ele consegue gerar essa mesma voz cantando uma obra completamente diferente, afinada e no tempo certo. O sucessor do NaturalSpeech original desenvolvido pela Microsoft foi criado para resolver um problema muito mais difícil que o de seu antecessor: ampliar a qualidade equivalente à humana para além de uma única voz gravada em estúdio, chegando a falantes e estilos arbitrários e, como se descobriu, a um modo de performance vocal totalmente diferente.
Que problema o NaturalSpeech 2 realmente buscava resolver?
O NaturalSpeech original demonstrou que era possível alcançar qualidade equivalente à humana em um benchmark com um único falante e gravações de estúdio. Levar essa mesma qualidade a conjuntos de dados grandes, diversos e coletados em condições reais — cobrindo diferentes identidades de falantes, prosódias e estilos como o canto — mostrou-se um problema genuinamente diferente. Na época, a maioria dos sistemas TTS de grande escala lidava com isso quantizando a fala em tokens discretos e gerando-os um a um com um modelo de linguagem autorregressivo — a mesma abordagem geral que tornou o VALL-E conhecido. No entanto, essa abordagem tende a sofrer com prosódia instável e com a omissão ou repetição de palavras, além de apresentar queda na qualidade da voz à medida que aumenta a diversidade dos dados de treinamento.
O NaturalSpeech 2 segue um caminho estruturalmente diferente: em vez de tokens discretos previstos de forma autorregressiva, ele usa um codec de áudio neural com quantizadores vetoriais residuais para produzir vetores latentes contínuos e gera esses vetores com um modelo de difusão latente condicionado ao texto de entrada. É a mesma filosofia não autorregressiva usada por seu antecessor, aplicada a um ambiente de dados muito mais difícil e diverso.
O mecanismo de amostra de voz por trás da geração zero-shot
Para fazer a geração zero-shot funcionar de maneira confiável nessa escala, o NaturalSpeech 2 introduz um mecanismo dedicado de amostra de voz, projetado especificamente para viabilizar o aprendizado em contexto tanto no modelo de difusão latente quanto em um preditor separado de duração e altura. Na prática, isso significa que um clipe curto de referência não condiciona apenas a etapa final da geração de áudio: ele também orienta a forma como o modelo prevê o tempo e o contorno de altura do novo conteúdo. Esse projeto é significativamente diferente de simplesmente anexar um embedding de falante a uma única etapa do pipeline.
Entenda a síntese de canto zero-shot
Essa é a capacidade mencionada no próprio subtítulo do NaturalSpeech 2 — “sintetizadores naturais e zero-shot de fala e canto” — e vale a pena entender como ela realmente funciona, em vez de tratá-la como um truque de caixa-preta.
O modelo foi ampliado para um conjunto de treinamento combinado com cerca de 44.000 horas de dados de fala e canto. A parte cantada foi reunida a partir de gravações vocais coletadas na web: músicas de fundo e acompanhamentos foram removidos por um processo dedicado de separação de áudio, e amostras desalinhadas foram filtradas com uma verificação baseada em ASR. O resultado foi um total de aproximadamente 30 horas de dados de canto, que passaram por sobreamostragem e foram misturados ao conjunto de treinamento de fala mais amplo.
Para gerar de fato uma performance cantada, o modelo aproveita o contorno real de altura e duração de uma referência de canto existente e aplica uma amostra de voz escolhida para reproduzir essa melodia e esse tempo no timbre de um cantor específico. A descoberta realmente notável é que a amostra de voz não precisa vir de uma gravação cantada: uma amostra de voz falada basta para o NaturalSpeech 2 gerar uma nova voz cantada com o timbre daquele falante, estendendo a geração zero-shot a um modo de performance que o falante de referência nunca foi efetivamente gravado realizando.
Desempenho
Nas avaliações zero-shot com falantes desconhecidos, o NaturalSpeech 2 superou por uma margem substancial os sistemas TTS anteriores de grande escala em semelhança de prosódia e timbre, robustez e qualidade geral da voz. Ele demonstrou uma semelhança prosódica particularmente forte com a amostra de referência nas condições de teste do LibriSpeech e do VCTK, e os resultados permaneceram significativamente bons mesmo com amostras de apenas 3 segundos.
Como começar a usar o NaturalSpeech 2 hoje
Assim como aconteceu com o NaturalSpeech original, a Microsoft não publicou código oficial nem pesos pré-treinados do NaturalSpeech 2; o que está disponível é o artigo de pesquisa e as amostras de áudio na página de demonstração do projeto. Iniciativas da comunidade preenchem essa lacuna, embora existam algumas ressalvas importantes:
- Conheça a reimplementação
lucidrains/naturalspeech2-pytorch. Trata-se de uma implementação em PyTorch da arquitetura descrita que permanece em desenvolvimento ativo, construída em torno do EnCodec como codec neural e usando difusão de remoção de ruído no processo generativo. - Entenda que este é um framework para treinamento do zero, não um modelo pré-treinado. Como ocorre com a maioria das reproduções comunitárias de trabalhos publicados apenas como pesquisa, você precisará do seu próprio conjunto de dados e de uma execução de treinamento; não existe checkpoint oficial nem treinado pela comunidade que ofereça imediatamente a qualidade relatada no artigo.
- Confira o status de desenvolvimento do próprio projeto antes de depender dele. A documentação lista trabalhos em andamento — incluindo refinamentos na previsão de duração e altura durante o treinamento e outras melhorias no mecanismo de atenção —, portanto trate-o como uma ferramenta de pesquisa em evolução, não como uma versão pronta e estável.
- Prepare-se para montar seu próprio conjunto de dados de canto se esse for o seu objetivo específico. Como a capacidade de canto do NaturalSpeech 2 veio de dados coletados na web, cuidadosamente selecionados e filtrados, e misturados a um corpus de fala muito maior, reproduzir esse resultado específico exige uma coleta de dados igualmente deliberada, e não apenas o treinamento em um conjunto genérico de fala.
Dicas para entender o NaturalSpeech 2
- Separe as duas principais afirmações ao avaliá-lo. A clonagem de voz zero-shot em grande escala e a síntese de canto zero-shot a partir somente de uma amostra de fala são dois resultados distintos e individualmente relevantes; não os confunda ao decidir o que realmente importa para o seu caso de uso.
- Reconheça a aposta arquitetônica contrária à modelagem de linguagem com tokens discretos. A escolha do NaturalSpeech 2 pela difusão latente contínua, em vez da abordagem de codec discreto mais modelo de linguagem autorregressivo usada por contemporâneos como o VALL-E, é uma resposta direta à instabilidade e aos problemas de omissão de palavras que essa abordagem pode produzir. É um ponto de comparação útil se você estiver avaliando arquiteturas de forma mais ampla.
- Leve a duração da amostra a sério se estiver estudando ou reproduzindo o sistema. A pesquisa mediu especificamente como a semelhança de prosódia muda conforme a duração da amostra (testando amostras de 3, 5 e 10 segundos), e amostras mais longas geralmente produziram resultados com maior correspondência. É um detalhe que merece ser considerado ao adaptar técnicas semelhantes.
- Trate a estrutura de IA responsável como uma restrição real, não como texto padrão. Considerando a eficácia dessa abordagem em reproduzir a identidade vocal em um contexto de performance totalmente diferente — o canto —, as salvaguardas de consentimento e detecção descritas pela Microsoft são diretamente relevantes para qualquer uso responsável de técnicas semelhantes, e não apenas linguagem jurídica a ser ignorada.
NaturalSpeech 2 vs. NaturalSpeech vs. VALL-E
| NaturalSpeech 2 | NaturalSpeech (original) | VALL-E | |
|---|---|---|---|
| Abordagem central | Representações latentes contínuas + difusão latente | Baseado em VAE, de ponta a ponta | Tokens discretos de codec + modelo de linguagem autorregressivo |
| Cenário mais adequado | Vários falantes, zero-shot, condições reais, canto | Um único falante, qualidade de estúdio | Clonagem zero-shot com amostras curtas |
| Síntese de canto | Sim, zero-shot, até mesmo com uma amostra apenas de fala | Não é o foco | Não é o foco |
| Escala de treinamento | ~44.000 horas (fala + canto) | Benchmark menor com um único falante | ~60.000 horas |
| Problemas conhecidos de robustez | Projetado especificamente para evitar a instabilidade dos tokens discretos | Não é autorregressivo, portanto não se aplica | Repetição/instabilidade tratada posteriormente no VALL-E 2 |
| Lançamento público oficial | Não (apenas demonstração de pesquisa) | Não (apenas reimplementação comunitária) | Não |
A verdadeira contribuição do NaturalSpeech 2 é mostrar que o caminho autorregressivo de tokens discretos popularizado pelo VALL-E não era a única forma de ampliar o TTS zero-shot: uma abordagem de difusão latente contínua podia igualá-lo ou superá-lo em robustez e qualidade, além de viabilizar uma capacidade realmente inédita de transferência de performance vocal entre modalidades.
Perguntas frequentes
O NaturalSpeech 2 realmente pode fazer cantar alguém que nunca cantou?
Sim, segundo a pesquisa publicada: gerar uma nova performance cantada no timbre de um falante usando apenas uma amostra de voz falada é uma das capacidades especificamente destacadas e testadas do modelo.
Qual é a diferença entre o NaturalSpeech 2 e o NaturalSpeech?
O NaturalSpeech original se concentrou e foi avaliado na síntese de um único falante com qualidade de estúdio. O NaturalSpeech 2 aborda o problema muito mais difícil de síntese em grande escala, com vários falantes, zero-shot e em condições reais, usando uma abordagem de difusão latente em vez do projeto baseado em VAE do original.
Por que a Microsoft usou difusão em vez de um modelo de linguagem autorregressivo como o VALL-E?
A geração autorregressiva sobre tokens discretos de fala pode apresentar prosódia instável e omissão ou repetição de palavras, principalmente em grande escala. A abordagem de difusão latente contínua do NaturalSpeech 2 foi projetada especificamente para evitar esses modos de falha.
O NaturalSpeech 2 levanta preocupações de consentimento relacionadas à clonagem de voz?
Sim, e a Microsoft trata disso diretamente: a pesquisa foi realizada sob a premissa de que os usuários consentem em ser o falante-alvo, e a implantação no mundo real é descrita como dependente de um protocolo de consentimento e de salvaguardas para a detecção de fala sintetizada.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.