EchoraEchora
Voltar aos modelos

Respeecher: a tecnologia de voz que Hollywood realmente inclui nos créditos

16 de setembro de 2026
•
9 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Quando Luke Skywalker voltou a falar com sua voz de jovem em The Mandalorian, e quando a voz de Darth Vader retornou em Obi-Wan Kenobi, o estúdio por trás disso não era um nome conhecido por todos no mundo da IA: era o Respeecher, uma pequena equipe que trabalhava em Kyiv. Os dois trabalhos são reais, ambos foram reconhecidos publicamente pela Lucasfilm, e o segundo foi concluído enquanto a equipe se abrigava dos bombardeios russos durante a invasão de 2022. É nesse nível que a ferramenta atua: não como um aplicativo de consumo para criar clipes rápidos, mas como a tecnologia de conversão de voz à qual os estúdios recorrem quando o resultado precisa funcionar em um filme pronto, não apenas em um vídeo de demonstração.

O que é o Respeecher?

O Respeecher foi fundado em Kyiv, na Ucrânia, em fevereiro de 2018 por Alex Serdiuk, Dmytro Bielievtsov e Grant Reaber. Ao longo da maior parte de sua história, trabalhou diretamente com produções de cinema e TV, em vez de priorizar a criação de um aplicativo para o grande público. Sua lista de trabalhos reais e creditados inclui a voz do jovem Luke Skywalker em The Mandalorian, a recuperação da voz de James Earl Jones como Darth Vader em várias séries de Star Wars do Disney+ e o refinamento dos diálogos em húngaro de Adrien Brody e Felicity Jones em O Brutalista. Esse filme viria a ganhar três Oscars, e os projetos realizados com a ajuda do Respeecher acumularam mais de 20 indicações ao Oscar. A empresa continuou entregando trabalhos de produção durante toda a invasão russa em larga escala da Ucrânia, inclusive concluindo o áudio de Vader para Obi-Wan Kenobi enquanto a equipe se abrigava dos bombardeios. É um detalhe que vale conhecer, considerando quanto do marketing da indústria de voz com IA se baseia em aspirações, e não em resultados demonstrados em condições reais.

Vantagens funcionais do Respeecher

  • Converte uma interpretação real em vez de gerar uma a partir de texto. Como o Respeecher trabalha no domínio acústico, e não a partir de um roteiro, ele preserva a emoção, a respiração, o ritmo e os sons não verbais de uma tomada real: nuances que a síntese de voz precisa aproximar, em vez de herdar diretamente.
  • Alterações no roteiro não exigem agendar novamente com a pessoa cuja voz está sendo reproduzida. Depois que a voz de destino é treinada, as novas falas são produzidas a partir da leitura de um intérprete de origem, sem que o artista original precise gravar novamente. Esse é o motivo prático pelo qual os estúdios usam a ferramenta para evitar refilmagens e regravações caras.
  • Evita os problemas que atrapalham o TTS baseado em texto. Trabalhar com áudio em vez de um dicionário de pronúncia permite preservar naturalmente nomes pouco conhecidos, siglas e sons não verbais, como risadas ou suspiros ofegantes, sem os erros de pronúncia e os problemas com idiomas de poucos recursos enfrentados pelos sistemas baseados em dicionários.
  • Dois níveis de acesso adequados à escala do projeto. O Voice Marketplace e a API, ambos de autosserviço, atendem projetos menores de criadores, como diálogos de jogos, conteúdo para YouTube e dublagem independente. Já uma equipe dedicada do Voice Lab cuida de produções completas de cinema e TV com suporte personalizado de ponta a ponta.
  • Uma ferramenta de super-resolução de áudio para recuperar gravações antigas ou degradadas. Fitas de arquivo, chamadas antigas do Skype ou MP3s de baixa taxa de bits podem ser restaurados até uma qualidade utilizável antes da conversão. Isso importa especialmente para reviver vozes de figuras históricas ou pessoas falecidas a partir de material de origem imperfeito.

Como a conversão de voz do Respeecher realmente funciona

A tecnologia central do Respeecher é a conversão de voz para voz (STS), não a síntese de voz a partir de texto, e essa diferença importa mais do que parece. Todo projeto começa com duas vozes: a voz de destino, que é a identidade vocal desejada para o resultado final, e a voz de origem, de um intérprete que lê as falas com ritmo, emoção e expressividade reais. Em geral, cerca de uma hora de gravações limpas da voz de destino é suficiente para treinar um modelo de conversão. Tanto as gravações de destino quanto as de origem precisam cobrir a amplitude emocional esperada no resultado final: uma leitura monótona e neutra não produzirá um clone capaz de gritar ou sussurrar de forma convincente depois.

Segundo os próprios pedidos de patente do Respeecher, a conversão funciona em um ciclo de refinamento adversarial: um modelo generativo produz um áudio candidato que mapeia a interpretação de origem para o timbre da voz de destino, e um modelo discriminativo separado compara esse candidato com gravações reais da voz de destino para identificar inconsistências. A avaliação considera um espaço mais amplo de dados de timbre de muitas vozes diferentes, não apenas um único clipe de referência. Essas inconsistências são devolvidas ao gerador, que produz um candidato refinado, e o ciclo se repete até que a saída seja convincente. Como todo esse processo opera sobre o sinal acústico, em vez de primeiro converter texto em fonemas, o Respeecher consegue preservar risadas, respirações e inflexões emocionais que um sistema TTS baseado em dicionários teria de reconstruir do zero. É também por isso que editar o roteiro no meio da produção exige regravar a leitura do ator de origem, sem precisar regravar a voz de destino.

Preços do Respeecher

O Respeecher tem três modalidades de preço diferentes, dependendo do que você quer fazer, e é bom deixar claro que apenas parte delas funciona por autosserviço:

  • Voice Marketplace (STS/TTS de autosserviço): Créditos de pagamento por uso, cobrados por minuto de áudio gerado, ou planos de assinatura mensal para uso mais intenso e recorrente. Serviços independentes de acompanhamento de preços relatam planos de aproximadamente US$ 150 a US$ 450 por mês, mas o Respeecher não publica uma tabela pública fixa. Por isso, trate qualquer valor específico como aproximado até confirmá-lo na finalização da compra. Há um teste gratuito antes da contratação, com duração relatada de cerca de 3 dias.
  • API de TTS em tempo real: Pagamento por uso, com preço citado publicamente de cerca de US$ 2 por hora de geração de voz a partir de texto em tempo real, voltada a aplicações como diálogos de jogos que precisam de tempos de resposta abaixo de 200ms.
  • Cinema, TV e projetos personalizados do Voice Lab: Somente mediante orçamento da equipe comercial do Respeecher, sem nenhuma tabela pública de preços. Avaliadores independentes que passaram pelo processo relatam que projetos profissionais costumam começar na faixa de US$ 2.000 a US$ 5.000 para uma única conversão de voz e podem chegar a dezenas de milhares de dólares para substituir todos os diálogos de um longa-metragem. O próprio Respeecher não publica esses valores, e o custo real depende muito da duração do áudio, da complexidade da voz e dos custos de obter consentimento e fazer as verificações.

Na prática, se você está testando a tecnologia ou trabalhando em um projeto menor de criação de conteúdo, o Marketplace e a API permitem obter valores reais baseados no uso sem conversar com a equipe de vendas. Se estiver planejando um trabalho de cinema ou TV, inclua uma conversa comercial no planejamento do orçamento, em vez de esperar uma página de pagamento: é assim que os serviços mais especializados desse produto são vendidos.

Dicas para obter melhores resultados com o Respeecher

  • Grave o áudio de origem sem processamento e sem compressão. As próprias orientações do Respeecher pedem áudio limpo e não processado em 48kHz/16-bit. Evite efeitos, compressão e qualquer pós-processamento antes de enviar o arquivo, pois não será possível separar esses tratamentos do áudio de forma limpa depois.
  • Remova o ruído antes da conversão, não depois. Ruído de fundo, zumbidos ou artefatos funcionam como manchas entre a IA e o sinal vocal que ela precisa isolar. Aplicar uma etapa de redução de ruído antes da conversão, seja com a ferramenta integrada do Marketplace ou com um software externo, gera um resultado consideravelmente mais limpo do que tentar corrigir a saída depois.
  • Grave os áudios de destino e de origem com toda a amplitude emocional de que você vai precisar. Uma leitura monótona e neutra não ensinará o modelo a gritar, sussurrar ou expressar angústia de forma convincente depois. Cubra a amplitude real exigida pelo projeto na sessão inicial de gravação, não apenas uma narração calma.
  • Não presuma que gravações antigas ou degradadas são inutilizáveis. Fitas de arquivo, chamadas antigas e arquivos de baixa taxa de bits muitas vezes podem ser restaurados com super-resolução de áudio antes da conversão. Isso importa se você trabalha com material histórico imperfeito, em vez de uma nova gravação de estúdio.
  • Conclua a calibração de voz com cuidado antes da primeira conversão. A calibração estabelece características de referência, como a altura tonal média. Fazer essa etapa com pressa produz conversões que exigem mais correções posteriores do que seriam necessárias se ela tivesse sido feita corretamente desde o início.

Respeecher vs. Play.ht

RespeecherPlay.ht
Tecnologia centralVoz para voz (STS): converte uma interpretação realSíntese de voz a partir de texto com clonagem instantânea, otimizada para streaming
Mais indicado paraCinema, TV e jogos: conteúdo roteirizado com nuances emocionaisAgentes de voz em tempo real, IVR e aplicações de conversação
LatênciaNão foi desenvolvido para interação em tempo realInferior a um segundo, desenvolvido especificamente para uso ao vivo
Material de origemExige uma tomada interpretada por um ator de origemGera diretamente a partir de texto digitado
Modelo de acessoMarketplace/API de autosserviço e projetos de cinema somente mediante orçamentoTotalmente de autosserviço, com planos de assinatura publicados

Essas duas ferramentas resolvem problemas quase opostos. O Play.ht existe para fazer uma voz clonada responder instantaneamente dentro de uma conversa ao vivo: não há uma “interpretação” real sendo convertida, apenas texto entrando e áudio saindo em streaming o mais rápido possível. O Respeecher existe para preservar uma interpretação que já aconteceu, levando sua textura emocional a outra voz para um conteúdo que será assistido ou ouvido como uma obra finalizada, não algo com que se conversa em tempo real. Se o seu projeto é um agente de voz, a arquitetura do Respeecher é totalmente inadequada; se é uma cena que precisa soar como se tivesse sido interpretada por um ator específico, esse é exatamente o problema que o Respeecher foi criado para resolver.

Perguntas frequentes

Para que o Respeecher é usado?

O Respeecher é usado em dublagem para cinema e TV, restauração e rejuvenescimento de vozes, vozes de personagens de videogames e localização multilíngue: qualquer situação em que a interpretação de uma voz específica precise ser preservada em outra identidade ou idioma.

A clonagem de voz do Respeecher é a mesma coisa que a síntese de voz a partir de texto?

Não. A tecnologia central do Respeecher é a conversão de voz para voz: ela transforma uma interpretação já gravada em uma voz de destino, em vez de gerar fala a partir de texto digitado, como faz a maioria das ferramentas de clonagem baseadas em TTS.

Quanto custa o Respeecher?

Depende do produto usado. O Voice Marketplace, de autosserviço, funciona com créditos de pagamento por uso ou assinaturas mensais; a API de TTS em tempo real custa cerca de US$ 2 por hora; e os projetos personalizados de clonagem de voz para cinema ou TV só recebem orçamento pela equipe comercial do Respeecher, sem tabela pública de preços.

Posso clonar a voz de qualquer pessoa com o Respeecher?

Não. O Respeecher exige comprovação de consentimento antes de iniciar qualquer projeto e não clona a voz de uma pessoa comum ou de um ator, enquanto estiverem vivos, sem sua permissão explícita. No entanto, sua própria política de ética permite o uso não enganoso das vozes de algumas figuras históricas e públicas.

O Respeecher funciona em tempo real?

A conversão do Voice Marketplace atualmente não é em tempo real, mas a API de TTS oferecida separadamente pelo Respeecher foi criada para uso com baixa latência e gera áudio em cerca de 200 milissegundos para aplicações como diálogos de jogos.

Mude a voz da sua gravação com o Echora

Para experimentar um processo semelhante de conversão de voz para voz no navegador, envie uma gravação de fala ao modificador de voz do Echora e escolha uma voz integrada ou adicione uma gravação de referência da voz de destino. O Echora usa o conteúdo falado e a interpretação da gravação original para gerar uma versão com outra voz, que você pode ouvir e baixar.

Converter sua gravação →