EchoraEchora
Voltar aos modelos

WhisperSpeech: executando um modelo de transcrição ao contrário

8 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

O Whisper da OpenAI é um dos modelos de reconhecimento de fala mais confiáveis que existem. Ele foi treinado com uma enorme quantidade de áudio multilíngue para transformar fala em texto preciso. A Collabora, equipe por trás do WhisperSpeech, analisou esse modelo e fez uma pergunta realmente engenhosa: se o Whisper entende tão bem o significado da fala, o que acontece ao executá-lo ao contrário? O WhisperSpeech é a resposta — um sistema de texto para fala construído ao inverter a própria arquitetura do Whisper, em vez de projetar um pipeline de TTS do zero.

O que é o WhisperSpeech?

O WhisperSpeech é um sistema TTS de código aberto da Collabora, antes desenvolvido sob o nome spear-tts-pytorch e posteriormente rebatizado. A ambição declarada do projeto é direta: ser para a fala o que o Stable Diffusion se tornou para as imagens — poderoso, modificável e seguro para a criação de produtos comerciais. Esse último ponto é deliberado e específico: todo o código do WhisperSpeech é lançado sob Apache-2.0/MIT, e seus modelos são treinados exclusivamente com dados de fala devidamente licenciados — o conjunto de dados LibreLight em inglês no caso da versão atual —, em vez de dados de procedência mais obscura e coletados indiscriminadamente, que prejudicam a viabilidade comercial de boa parte da pesquisa aberta em TTS.

Como a inversão do Whisper realmente funciona

A arquitetura do próprio Whisper é dividida em duas partes: um codificador que transforma o áudio em um fluxo contínuo de embeddings, capturando significado contextual e prosódia durante o processo, e um decodificador que usa atenção cruzada para converter esses embeddings em palavras reais, ou seja, em uma transcrição. O WhisperSpeech executa a mesma estrutura na direção oposta: parte do texto, gera os embeddings equivalentes e depois transforma esses embeddings em som, em vez de extraí-los do som.

A parte realmente engenhosa é o que essa abordagem reutiliza. O codificador do Whisper, treinado com um enorme volume de áudio multilíngue, produz uma representação semântica excepcionalmente forte do conteúdo da fala. Arquiteturas como o SPEAR-TTS do Google e o VALL-E dependem internamente de um tipo semelhante de extração de tokens semânticos, mas seus codificadores semânticos específicos nunca foram disponibilizados ao público. Ao reaproveitar o próprio codificador do Whisper nessa função, o WhisperSpeech oferece um equivalente de código aberto que pode substituir diretamente um componente mantido fechado por sistemas comparáveis. Isso ajuda a explicar por que o projeto se descreve como uma solução para uma lacuna real, e não apenas como a reprodução de um trabalho existente com uma marca nova.

O pipeline de duas etapas

O WhisperSpeech segue o mesmo padrão amplo, baseado em tokens e dividido em duas etapas, popularizado pelo AudioLM, SPEAR-TTS e MusicGen da Meta. Em vez de uma única etapa monolítica, a síntese de fala é separada em uma fase de “leitura” e outra de “fala”. A etapa de texto para semântica (T2S) usa a abordagem derivada do Whisper para transformar o texto de entrada em tokens semânticos. Em seguida, a etapa de semântica para acústica (S2A) converte esses tokens em áudio real, usando o EnCodec da Meta para modelagem acústica e o vocoder Vocos — da Charactr — para renderizar a forma de onda final em alta qualidade. Em vez de criar cada componente do zero, o projeto se apoiou deliberadamente em peças consolidadas de código aberto em todas as etapas: Whisper para compreensão semântica, EnCodec para representação acústica e Vocos como vocoder. Assim, montou algo novo a partir de componentes que já haviam sido comprovados de forma independente.

Velocidade e capacidade multilíngue emergente

Depois de adicionar suporte a torch.compile, KV-caching e ajustes direcionados nas camadas, o WhisperSpeech chegou a uma geração cerca de 12 vezes mais rápida que o tempo real em uma RTX 4090 de consumo. Foi uma otimização relevante que levou o sistema da velocidade de pesquisa a uma inferência realmente prática em hardware acessível. Na frente multilíngue, a equipe realizou uma prova de conceito: treinou um pequeno modelo S2A com um conjunto de dados misto em inglês, polonês e francês e conseguiu clonar vozes francesas usando tokens semânticos que haviam sido treinados apenas com inglês e polonês. Esse resultado é um sinal importante — sugere que um único Tokenizer compartilhado poderia abranger muitos idiomas, em vez de exigir um modelo separado treinado para cada língua. No entanto, o trabalho ainda é inicial e exploratório, não uma versão multilíngue concluída.

Primeiros passos com o WhisperSpeech

A maneira mais rápida de ouvir o WhisperSpeech é pelo notebook do Google Colab fornecido pelo projeto, que executa a inferência sem nenhuma configuração local. Se preferir executá-lo por conta própria, tanto os modelos pré-treinados quanto os respectivos conjuntos de dados de treinamento convertidos estão disponíveis no Hugging Face. Assim, você pode executar a inferência localmente ou usá-los como ponto de partida para treinar a sua própria variante. A comunidade do projeto no Discord, hospedada no canal de geração de áudio do servidor da LAION, é um espaço ativo para tirar dúvidas de configuração ou acompanhar o desenvolvimento multilíngue em andamento.

Dicas para obter melhores resultados

  • Verifique a cobertura atual de idiomas antes de presumir que o suporte multilíngue está pronto para produção. A versão estável continua voltada para o inglês — por meio do LibreLight —; o resultado promissor de clonagem em francês veio de um pequeno modelo de prova de conceito, não da versão principal. Confirme o estado atual do projeto antes de planejar uma cobertura linguística mais ampla.
  • Use primeiro o notebook do Colab para validar a qualidade com o seu conteúdo. É uma maneira mais simples de ouvir a saída real no seu caso específico antes de se comprometer com a instalação e a configuração locais.
  • Aproveite as otimizações de velocidade de inferência se estiver implantando em escala. O resultado de 12 vezes o tempo real em uma RTX 4090 reflete otimizações específicas — torch.compile e KV-caching. Garanta que a sua própria implantação também as aplique, em vez de executar uma configuração básica sem otimização.
  • Considere a vantagem do licenciamento se a implantação comercial for uma preocupação. Como o projeto foi criado especificamente em torno de dados de treinamento devidamente licenciados e licenças de código permissivas, ele é um ponto de partida com risco realmente menor do que projetos TTS com procedência de dados menos transparente. Vale levar isso em conta em qualquer seleção de fornecedor ou modelo na qual a análise jurídica seja importante.

WhisperSpeech versus outros modelos de clonagem totalmente abertos

WhisperSpeechVoiceCraftF5-TTS
Ideia central da arquiteturaPipeline de ASR do Whisper executado ao contrárioPreenchimento de tokens para edição e clonagemDiffusion Transformer + flow matching
Procedência dos dados de treinamentoExclusivamente dados devidamente licenciados (LibreLight)Fontes abertas e de ambientes reaisConjunto de dados Emilia (licença não comercial)
Licença do códigoApache-2.0 / MITAbertoCódigo aberto, pesos CC-BY-NC
Uso comercialProjetado explicitamente para ser seguroAberto, consulte os termos de uso éticoExige autorização separada
Velocidade de inferência~12 vezes o tempo real (RTX 4090, otimizado)Não é o foco principalFator de tempo real de ~0,15
Cobertura atual de idiomasInglês (multilíngue em testes iniciais)Voltado para o inglêsVoltado principalmente para o inglês

O nicho específico do WhisperSpeech é a combinação de uma ideia arquitetônica elegante e eficiente no uso de recursos — reaproveitar o Whisper em vez de treinar um novo codificador semântico do zero — com um foco realmente deliberado em licenças claras para os dados. Essa combinação é especialmente importante para equipes nas quais “podemos lançar isso legalmente?” é uma pergunta tão importante quanto “o som é bom?”.

Perguntas frequentes

Como a “inversão do Whisper” realmente produz fala?

O Whisper normalmente converte áudio em embeddings e depois em texto por meio de sua estrutura de codificador e decodificador. O WhisperSpeech inverte esse fluxo: parte do texto, gera os embeddings equivalentes e os converte em áudio, em vez de extraí-los dele.

Qual era o nome anterior do WhisperSpeech?

Ele foi desenvolvido originalmente sob o nome spear-tts-pytorch, que refletia a inspiração arquitetônica na pesquisa SPEAR-TTS do Google, antes de passar a se chamar WhisperSpeech.

É seguro usar o WhisperSpeech em um produto comercial?

Esse é um objetivo explícito do projeto: o código é lançado sob Apache-2.0/MIT, e os modelos são treinados apenas com dados de fala devidamente licenciados, justamente para evitar o risco de procedência dos dados que afeta muitos projetos TTS abertos treinados com áudio coletado ou de licença incerta.

O WhisperSpeech oferece suporte a outros idiomas além do inglês?

A versão estável atual é treinada com o conjunto de dados LibreLight em inglês. Um modelo multilíngue de prova de conceito — inglês, polonês e francês — demonstrou resultados promissores de clonagem de voz entre idiomas, mas o suporte multilíngue mais amplo ainda estava em desenvolvimento nas atualizações públicas mais recentes do projeto.

Com que velocidade o WhisperSpeech gera áudio?

Depois de otimizações específicas — torch.compile, KV-caching e ajustes nas camadas —, o projeto relatou uma geração cerca de 12 vezes mais rápida que o tempo real em uma GPU RTX 4090 de consumo.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →