VoiceCraft: a fala editada que os ouvintes preferiram à gravação real
- O que é o VoiceCraft?
- O truque técnico: mascaramento causal e empilhamento atrasado
- Duas capacidades em um único modelo
- O benchmark REALEDIT
- Como começar a usar o VoiceCraft
- Dicas para obter resultados melhores
- VoiceCraft versus modelos de clonagem que apenas geram
- Perguntas frequentes
- Gere uma voz semelhante a partir de um áudio de referência
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Na comparação lado a lado de naturalidade feita pelo próprio VoiceCraft, ouvintes humanos preferiram a fala editada à gravação original real em 48% das vezes — praticamente um cara ou coroa entre um clipe verdadeiro e outro em que uma palavra foi trocada e regenerada por um modelo. Esse resultado é a evidência mais clara do que o VoiceCraft realmente foi criado para fazer: não apenas gerar fala do zero, mas editar áudio existente de forma convincente o bastante para que a emenda desapareça.
O que é o VoiceCraft?
O VoiceCraft é um modelo de linguagem de codec neural baseado no preenchimento de tokens, desenvolvido por pesquisadores da Universidade do Texas em Austin e da Rembrand e lançado inteiramente como código aberto — dados, código e pesos do modelo estão disponíveis publicamente no GitHub e no Hugging Face. Ele foi construído como um decodificador Transformer e, no lançamento, alcançou resultados de ponta tanto em edição de fala quanto em texto para fala zero-shot. A avaliação foi feita especificamente com áudio do mundo real — audiolivros, vídeos do YouTube e podcasts do Spotify —, e não com gravações limpas de estúdio. Tanto clonar uma voz desconhecida quanto editar uma gravação existente exige apenas alguns segundos de áudio de referência.
O truque técnico: mascaramento causal e empilhamento atrasado
Vale a pena entender esse ponto, pois é o que realmente torna possível editar, e não apenas gerar do zero. Modelos autorregressivos convencionais geram estritamente da esquerda para a direita, o que os torna pouco adequados para inserir conteúdo novo no meio de uma sequência existente sem regenerar tudo o que vem depois do ponto de edição. O VoiceCraft resolve isso com um procedimento de reorganização de tokens em duas etapas: mascaramento causal, emprestado de técnicas bem-sucedidas na modelagem conjunta de texto e imagem, e empilhamento atrasado, que lida com eficiência com a estrutura de múltiplos codebooks dos codecs neurais de fala. Juntos, eles permitem que o VoiceCraft faça geração por preenchimento condicionada ao contexto nas duas direções, sem deixar de usar internamente um processo de geração autorregressivo, em vez de exigir a abordagem totalmente não autorregressiva da qual os modelos de preenchimento normalmente dependem.
Duas capacidades em um único modelo
Graças a essa arquitetura, o VoiceCraft executa duas tarefas realmente distintas por meio do mesmo mecanismo subjacente. A edição de fala permite inserir, excluir, substituir ou fazer alterações em vários trechos de uma gravação existente — corrigindo uma palavra, trocando uma frase ou ajustando uma sentença sem regravar nada, enquanto o modelo regenera apenas o trecho afetado, e não o clipe inteiro. A clonagem de voz zero-shot usa a mesma capacidade de preenchimento ao contrário: com poucos segundos da voz de um falante desconhecido, gera uma fala completamente nova nessa voz. A maioria dos modelos TTS é criada para uma tarefa ou para a outra; o VoiceCraft trata as duas como o mesmo problema subjacente, resolvido pelo mesmo modelo.
O benchmark REALEDIT
Para avaliar especificamente a edição de fala, a equipe do VoiceCraft criou o REALEDIT, descrito como o primeiro benchmark realista desse tipo: 310 exemplos do mundo real obtidos de audiolivros, vídeos do YouTube e podcasts do Spotify, com duração de 5 a 12 segundos, cobrindo inserções, exclusões, substituições e edições em vários trechos de 1 a 16 palavras. O resultado de preferência de 48% — a fala editada escolhida em vez da gravação original genuína numa comparação lado a lado — veio diretamente dos testes com esse benchmark. Por isso, é um número com credibilidade relevante, e não um clipe de demonstração escolhido a dedo.
Como começar a usar o VoiceCraft
O caminho mais direto para testar o VoiceCraft é usar a configuração do projeto baseada em Docker, que cuida da preparação do ambiente para você; quando o ambiente estiver funcionando, o notebook inference_tts.ipynb é o ponto de partida documentado para testar a geração TTS zero-shot. Se você pretende fazer ajuste fino ou treinar com seus próprios dados, o projeto fornece documentação separada de configuração e treinamento, com o AdamW recomendado especificamente para dar mais estabilidade ao ajuste fino do que ao treinamento do zero. Os pesos do modelo estão disponíveis publicamente no Hugging Face desde março de 2024, portanto, baixar um checkpoint pré-treinado, em vez de treinar do zero, é o ponto de partida prático para a maioria dos casos de uso.
Dicas para obter resultados melhores
- Use a edição para correções cirúrgicas, não para reescritas completas. O ponto forte da edição do VoiceCraft está em inserções, exclusões e substituições direcionadas de uma frase ou trecho curto; para mudanças completas de conteúdo, o modo convencional de geração zero-shot do zero é mais apropriado.
- Mantenha o clipe de referência limpo para a clonagem. Como são necessários apenas alguns segundos de áudio, uma amostra nítida e bem gravada dessa duração terá um resultado melhor que outra de duração semelhante com mais ruído.
- Teste com o seu tipo real de áudio antes de presumir que o desempenho do benchmark será transferido diretamente. O REALEDIT foi criado especificamente com fontes do mundo real, como podcasts e vídeos do YouTube, em vez de áudio limpo de estúdio, o que oferece um ambiente de teste significativamente realista; ainda assim, vale a pena validar diretamente o perfil de ruído e a qualidade de gravação específicos do seu conteúdo.
- Use o Docker, a menos que você tenha um motivo específico para gerenciar dependências manualmente. Como muitos componentes — codec, processamento de fonemas e decodificador Transformer — precisam estar corretamente alinhados, o caminho do Docker evita uma parcela considerável dos problemas comuns de configuração.
- Confira o VoiceCraft-X se você precisar de outros idiomas além do inglês. Um modelo posterior amplia a mesma abordagem central de edição e clonagem para 11 idiomas, usando um modelo de linguagem grande no processamento de texto entre idiomas sem exigir léxicos de pronúncia fonética. Vale a pena conferir se as necessidades linguísticas do seu projeto já ultrapassaram o foco em inglês da versão original.
VoiceCraft versus modelos de clonagem que apenas geram
| VoiceCraft | F5-TTS | E2 TTS | |
|---|---|---|---|
| Edição de fala (inserir/excluir/substituir em áudio existente) | Sim, capacidade central | Não, apenas geração | Não, apenas geração |
| Clonagem de voz zero-shot | Sim, poucos segundos de referência | Sim, ~5–15 segundos | Sim, semelhante |
| Mecanismo central | Autorregressivo com mascaramento causal e empilhamento atrasado para contexto bidirecional | Flow matching não autorregressivo | Flow matching não autorregressivo |
| Lançamento público | Sim, dados, código e pesos, todos abertos | Sim, código e pesos | Não, apenas artigo de pesquisa |
| Foco do benchmark | Áudio do mundo real (audiolivros, YouTube, podcasts) | Benchmarks TTS convencionais | Benchmarks TTS convencionais |
O nicho específico do VoiceCraft é ser um dos poucos modelos abertos que tratam a edição de uma gravação existente e a geração de uma nova como o mesmo problema subjacente — a maioria dos modelos deste site foi criada apenas para geração e não tem nenhum mecanismo para trabalhar com áudio que já existe.
Perguntas frequentes
O VoiceCraft consegue editar uma gravação sem regenerar o clipe inteiro?
Sim — esse é seu principal objetivo de projeto. Usando mascaramento causal e empilhamento atrasado, o VoiceCraft regenera apenas o trecho desejado — uma palavra ou frase inserida, excluída ou substituída —, em vez de exigir que todo o clipe seja recriado.
De quanto áudio de referência o VoiceCraft precisa?
Apenas alguns segundos, tanto para a clonagem zero-shot de um falante desconhecido quanto para a edição de uma gravação existente.
O que é o benchmark REALEDIT?
É um conjunto de dados realista de avaliação de edição de fala, criado pela equipe do VoiceCraft especificamente para essa finalidade. Ele contém 310 exemplos do mundo real vindos de audiolivros, vídeos do YouTube e podcasts e abrange inserções, exclusões, substituições e edições em vários trechos.
O VoiceCraft é gratuito e de código aberto?
Sim. Os dados, o código e os pesos pré-treinados do modelo estão disponíveis publicamente no GitHub e no Hugging Face, sem restrições além das expectativas de uso ético declaradas pelo projeto, que proíbem explicitamente a geração de fala sem autorização ou a manipulação da voz de alguém sem consentimento.
Existe uma versão multilíngue do VoiceCraft?
Sim. O VoiceCraft-X, um modelo posterior, amplia a mesma abordagem unificada de edição e clonagem para 11 idiomas, usando um modelo de linguagem grande para lidar com texto entre idiomas em vez de exigir léxicos fonéticos separados para cada língua.
Gere uma voz semelhante a partir de um áudio de referência
Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.