VibeVoice: feito para um podcast inteiro, não apenas para uma frase
- O que é o VibeVoice?
- Vantagens funcionais do VibeVoice
- Como funciona por dentro
- VibeVoice-ASR: a metade da família que escuta
- Dicas para obter melhores resultados
- VibeVoice em comparação com outros modelos de longa duração e múltiplos falantes
- Perguntas frequentes
- Transforme um roteiro com vários locutores em áudio
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Quase todos os modelos de TTS são delimitados em torno de uma única fala: gere esta frase, nesta voz, e pare. O VibeVoice, framework de fala open source da Microsoft, foi concebido em torno de uma unidade de conteúdo completamente diferente: um episódio inteiro. Ele gera até 90 minutos de áudio conversacional contínuo com múltiplos falantes em uma única execução, com até quatro falantes distintos mantendo a identidade consistente e a alternância natural durante todo o conteúdo — a diferença entre um modelo criado para uma frase e outro criado para um podcast.
O que é o VibeVoice?
O VibeVoice é um framework open source da Microsoft, licenciado sob a MIT, para gerar áudio conversacional expressivo, de longa duração e com múltiplos falantes — podcasts, dramas em áudio e entrevistas são os cenários para os quais ele foi desenvolvido explicitamente. Ele foi lançado em dois tamanhos: o VibeVoice-1.5B, construído sobre um modelo de linguagem Qwen2.5-1.5B, e o VibeVoice-Large, baseado no Qwen2.5-7B maior para oferecer fidelidade superior com um custo computacional proporcionalmente mais alto. Ambos estão hospedados publicamente (microsoft/VibeVoice-1.5B e a variante Large), junto com o código do projeto no GitHub.
Vantagens funcionais do VibeVoice
- 90 minutos de geração contínua. Uma única execução pode produzir até 90 minutos de áudio coerente e manter a consistência dos falantes e da narrativa durante todo o conteúdo — muito além dos clipes curtos para os quais a maioria dos modelos TTS foi criada.
- Até quatro falantes distintos, com naturalidade. O diálogo com múltiplos falantes é uma capacidade de primeira classe, não uma solução improvisada que junta gerações separadas de uma única voz — a alternância e a identidade dos falantes permanecem consistentes durante uma sessão longa inteira.
- Compressão de áudio extremamente eficiente. Uma taxa de tokenização de 7.5Hz alcança uma redução de aproximadamente 3.200 vezes em relação ao áudio bruto, preservando a fidelidade. É isso que torna computacionalmente viável gerar 90 minutos de áudio.
- Transferência entre idiomas e canto como capacidades emergentes. Nenhuma das duas capacidades foi treinada especificamente, mas ambas aparecem como comportamentos emergentes — o modelo consegue transportar o sotaque de uma voz entre idiomas e até tentar cantar, embora a qualidade varie nos dois casos.
- Proteções de IA responsável integradas por padrão. Cada saída inclui tanto um aviso audível quanto uma marca d'água imperceptível, aplicados automaticamente em vez de serem uma configuração opcional.
- Disponível em diversas escalas, incluindo variantes quantizadas. Além dos checkpoints básicos 1.5B e Large, versões quantizadas em 4 e 8 bits produzidas pela comunidade reduzem bastante os requisitos de VRAM para hardware limitado.
- Um modelo complementar para a direção inversa. O VibeVoice-ASR amplia a mesma família para fala em texto, portanto o projeto não se limita apenas à geração.
Como funciona por dentro
O pipeline do VibeVoice se divide em três partes que trabalham em conjunto. Os tokenizadores acústicos e semânticos contínuos, que operam naquela taxa de quadros extremamente baixa de 7.5Hz, comprimem o áudio bruto em uma representação eficiente o bastante para processar sequências realmente longas sem que o custo computacional exploda. Em seguida, um modelo de linguagem Qwen2.5 pré-treinado (1.5B ou 7B, dependendo do checkpoint usado) modela o próprio diálogo — semântica, fluxo e estrutura dos turnos — condicionando o que deve ser dito e por quem. Por fim, uma cabeça de difusão leve de quatro camadas combinada a um decodificador VAE preenche os detalhes acústicos de alta fidelidade sobre o que o LLM estruturou, usando orientação livre de classificador durante a inferência para controlar o quanto a saída adere ao timbre de uma voz de referência (um cfg_scale em torno de 1.3 é a configuração geralmente recomendada).
O treinamento é deliberadamente dividido em etapas: os próprios tokenizadores permanecem congelados, e apenas o LLM e a cabeça de difusão são efetivamente treinados por meio de aprendizado curricular, que começa com sequências mais curtas e avança progressivamente até 65.000 tokens. É justamente isso que permite ao modelo manter a coerência durante uma geração realmente longa, em vez de se desviar ou perder a consistência dos falantes no meio do processo.
VibeVoice-ASR: a metade da família que escuta
Lançado em janeiro de 2026, o VibeVoice-ASR amplia a mesma família na direção oposta — um modelo unificado de fala em texto, não de texto em fala. Ele processa até 60 minutos de áudio longo em uma única execução e produz transcrições estruturadas que registram quem falou (por meio da diarização de falantes), quando (com timestamps precisos) e o que foi dito, além de aceitar contexto personalizado pelo usuário e hotwords específicas de um domínio. Desde então, ele foi integrado diretamente à biblioteca Hugging Face Transformers e ao Azure AI Foundry Labs da Microsoft, facilitando a adoção sem uma configuração de inferência própria.
Especificamente para implantação na borda, o VibeVoice-ASR-BitNet comprime o modelo de 4.62GB para 1.58GB por meio de quantização heterogênea (I8_S para o codificador de áudio e I2_S para o modelo de linguagem), troca a base Qwen2.5-7B por uma versão Qwen2.5-1.5B mais leve e aumenta o valor absoluto da taxa de erro de palavras em apenas 1–4%. Combinado ao runtime dedicado VibeASR.cpp — construído sobre kernels SIMD personalizados e fusão de operadores no framework ggml —, ele oferece transcrição em tempo real (RTF abaixo de 1) com apenas 3 threads de CPU, sem exigir GPU, e funciona de 1.6 a 2.3 vezes mais rápido que o Whisper.cpp com um modelo de tamanho comparável.
Dicas para obter melhores resultados
- Escreva o roteiro no formato que o modelo realmente espera. Estruture a entrada como turnos rotulados (
Speaker 1: ... Speaker 2: ...) em uma transcrição de texto simples, em vez de usar um parágrafo sem estrutura — é isso que permite ao VibeVoice atribuir corretamente os turnos e manter a consistência de cada falante. - Comece com o modelo 1.5B antes de presumir que precisa do Large. Como há um salto considerável nos requisitos de computação e VRAM, confirme se o modelo menor já é suficiente para o seu conteúdo antes de se comprometer com o checkpoint de 7B.
- Use um checkpoint pré-quantizado em hardware limitado em vez de quantizar durante a execução. Modelos pré-quantizados em 4 ou 8 bits carregam mais rápido e evitam o custo de quantização em cada execução.
- Não dependa do canto emergente nem das saídas entre idiomas em conteúdo de produção. Como nenhuma dessas capacidades foi treinada ou otimizada especificamente, trate os resultados bem-sucedidos como um bônus, e não como um recurso confiável; se você busca expressamente um desses efeitos, reserve espaço para repetir a amostragem.
- Considere o aviso audível e a marca d'água no seu caso de uso. Como ambos são incorporados automaticamente a todas as saídas, leve isso em conta em qualquer documentação do produto sobre a divulgação de áudio gerado por IA.
VibeVoice em comparação com outros modelos de longa duração e múltiplos falantes
| VibeVoice | CosyVoice3 | TTS típico de um único falante | |
|---|---|---|---|
| Máximo de falantes por sessão | 4 | Zero-shot por clipe, não baseado em sessão | 1 |
| Duração contínua máxima | ~90 minutos | Não é um foco específico | Clipes curtos |
| Arquitetura central | LLM Qwen2.5 + cabeça de difusão + tokenizadores de 7.5Hz | Tokens semânticos supervisionados + flow matching | Varia |
| Modelo ASR complementar | Sim (VibeVoice-ASR) | Não | Não |
| Variantes quantizadas disponíveis | Sim (4/8 bits da comunidade + BitNet oficial para ASR) | Não | Varia |
| Licença | MIT | Aberto, com API hospedada disponível | Varia |
O nicho específico do VibeVoice é a escala da saída, não a expressividade de cada frase — se o seu projeto gera uma única linha de diálogo, a maioria dos outros modelos deste site atenderá bem; se você está gerando um episódio inteiro de podcast com vários apresentadores, o VibeVoice foi criado especificamente para essa unidade de conteúdo.
Perguntas frequentes
Qual é a diferença entre o VibeVoice-1.5B e o VibeVoice-Large?
O 1.5B é baseado no Qwen2.5-1.5B e representa a opção mais leve e rápida; o Large usa o Qwen2.5-7B para oferecer maior fidelidade com custos mais altos de computação e VRAM.
Qual é a duração real de um clipe de áudio que o VibeVoice pode gerar?
Até 90 minutos de áudio contínuo e coerente em uma única execução, mantendo a identidade consistente dos falantes durante todo o conteúdo.
O que é o VibeVoice-ASR? Ele é igual ao VibeVoice TTS?
Não. O VibeVoice-ASR é um modelo complementar e separado da mesma família que converte fala em texto, não texto em fala, e processa até 60 minutos de áudio com diarização de falantes e timestamps.
Posso executar o VibeVoice-Large em uma GPU de consumo?
Sim, com quantização — checkpoints pré-quantizados em 4 bits reduzem os requisitos de VRAM para cerca de 10GB, embora haja alguma perda de velocidade de geração em relação à precisão completa.
O VibeVoice é gratuito para uso comercial?
Sim. Ele é lançado sob a licença MIT, uma das opções mais permissivas entre os modelos TTS de código aberto.
Transforme um roteiro com vários locutores em áudio
Se você já tem um roteiro pronto com vários locutores, use o Texto para diálogo da Echora. Adicione até 12 blocos de diálogo e 5.000 caracteres no total, atribua uma voz a cada bloco, inclua tags de interpretação compatíveis e ajuste a estabilidade ou o reforço do locutor. Depois, você pode ouvir e baixar a conversa completa.