Voicebox: um modelo criado para editar fala, não apenas gerá-la do zero
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Um modelo TTS autorregressivo só consegue prolongar um clipe a partir do ponto em que ele terminou — não pode voltar e corrigir uma palavra no meio sem gerar novamente tudo o que vem depois. O Voicebox, modelo de pesquisa da Meta desenvolvido pela FAIR, foi criado em torno de uma tarefa fundamentalmente diferente: dado o contexto de áudio ao redor e um texto de destino, preencher o trecho ausente em qualquer ponto do clipe, como usar inpainting para editar o meio de uma imagem em vez de apenas continuar pintando além de sua borda.
O que é o Voicebox?
O Voicebox é um modelo não autorregressivo de flow matching treinado com mais de 50.000 horas de fala sem filtragem nem aprimoramento, extraídas de audiolivros em domínio público em inglês, francês, alemão, espanhol, polonês e português. Em vez de treiná-lo diretamente para as diversas tarefas separadas nas quais os sistemas TTS costumam se especializar, a Meta o treinou para um objetivo único e mais geral: preenchimento de fala guiado por texto. Essa única tarefa acabou abrangendo a maior parte do que as pessoas realmente esperam de um modelo de voz, por meio do mesmo tipo de aprendizado em contexto que tornou o GPT útil em tarefas para as quais nunca havia sido treinado explicitamente.
Por que o preenchimento muda o que é possível
Como o Voicebox é treinado para reconstruir um trecho de áudio mascarado usando tanto a fala ao redor quanto o texto de destino, ele consegue modificar qualquer parte de uma determinada amostra — e não apenas o fim de um clipe, como os modelos autorregressivos estão estruturalmente limitados a fazer. Essa flexibilidade permite que um único modelo, treinado em uma só tarefa, se generalize para várias capacidades distintas na prática: síntese de texto para fala zero-shot com apenas 2 segundos de áudio de referência; transferência de estilo entre idiomas (ler uma passagem em outro de seus seis idiomas compatíveis preservando o estilo do falante de referência); remoção de ruído; edição de conteúdo; e diferentes reamostragens de um determinado enunciado. Todas elas são instâncias da mesma tarefa subjacente de preenchimento, e não modos especializados separados adicionados posteriormente.
A técnica por trás dele: flow matching condicional
O núcleo não autorregressivo do Voicebox é construído com Conditional Flow Matching (CFM), um método que transforma uma distribuição inicial simples (ruído gaussiano) na distribuição da fala de destino ao longo de uma variável de tempo contínua, condicionado tanto pelas informações linguísticas quadro a quadro quanto pelo contexto de áudio mascarado. Isso é significativamente diferente da formulação típica de um modelo de difusão. As comparações da própria Meta na época mostraram que ele superava o VALL-E em inteligibilidade e similaridade de áudio no TTS zero-shot, além de gerar fala cerca de 20 vezes mais rápido que os principais modelos autorregressivos daquele período.
O flow matching como técnica não ficou restrito ao Voicebox. A mesma ideia central fundamenta a abordagem usada mais tarde pelo E2 TTS e pelo F5-TTS. Ambos se baseiam na filosofia de “preencher ou mascarar e depois gerar” que o Voicebox ajudou a estabelecer, e ela é uma parente conceitual próxima dos decodificadores de flow matching usados em modelos como CosyVoice2 e CosyVoice3. Se você já usou qualquer um deles, usou um descendente direto da abordagem que o Voicebox demonstrou em grande escala.
Voicebox vs. seus descendentes arquitetônicos de código aberto
| Voicebox | E2 TTS | F5-TTS | |
|---|---|---|---|
| Técnica central | Flow matching condicional | Flow matching, Transformer U-Net plano | Flow matching condicional + Diffusion Transformer |
| Formulação da tarefa de treinamento | Preenchimento geral de fala guiado por texto | Preenchimento de texto e áudio (sem modelo de duração/alinhador) | Mesma abordagem central, refinada para melhorar a robustez do alinhamento |
| Duração do prompt zero-shot | ~2 segundos | Semelhante | ~5–15 segundos |
| Generalidade das tarefas | TTS, remoção de ruído, edição e reamostragem em um único modelo | Foco principal em TTS | Foco principal em TTS |
| Lançamento público | Não (apenas artigo de pesquisa) | Não (reprodução da comunidade pelo repositório do F5-TTS) | Sim, no GitHub e no Hugging Face |
| Idiomas | 6 | Foco em inglês | Foco principal em inglês |
A importância duradoura do Voicebox está mais em demonstrar que um único objetivo geral de preenchimento, treinado em grande escala, poderia igualar ou superar sistemas especializados em várias tarefas distintas de voz ao mesmo tempo, um padrão que uma parcela significativa do setor continuou desenvolvendo desde então.
Perguntas frequentes
O que significa “preenchimento de fala”?
Significa gerar uma parte ausente ou mascarada de um clipe de áudio usando o contexto ao redor e um texto de destino. Isso permite que o modelo edite qualquer parte de uma amostra, em vez de apenas prolongá-la a partir do ponto final, como ocorre com os modelos autorregressivos.
Qual é a relação entre o Voicebox e modelos como E2 TTS e F5-TTS?
Ambos são descendentes arquitetônicos baseados na mesma abordagem de flow matching condicional demonstrada pelo Voicebox. O E2 TTS compartilha diretamente sua filosofia de preenchimento, e o F5-TTS refinou essa mesma linhagem com melhorias adicionais na estabilidade do treinamento e no alinhamento.
A quantos idiomas o Voicebox oferece suporte?
Seis, com base nos dados de treinamento: inglês, francês, alemão, espanhol, polonês e português.
A Meta abordou o risco de uso indevido do Voicebox?
Sim. Além do modelo generativo, a pesquisa da Meta descreve especificamente a criação de um classificador capaz de distinguir fala autêntica de fala gerada pelo Voicebox, como uma proteção documentada contra o potencial de uso indevido do modelo.
Gere uma voz semelhante a partir de um áudio de referência
Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.