EchoraEchora
Voltar aos modelos

LOVO AI (Genny): locução, vídeo e clonagem de voz em uma única aba do navegador

17 de setembro de 2026
•
6 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A LOVO AI é uma empresa sediada em Berkeley, na Califórnia, fundada em 2019 por Charlie Choi e Tom Lee, que captou US$ 4,5 milhões em uma rodada Pre-Series A em agosto de 2021, liderada pela Kakao Entertainment e pela LG CNS. Seu produto, Genny, foi criado para resolver um problema específico de fluxo de trabalho: produzir um vídeo finalizado com locução normalmente exige alternar entre uma ferramenta de texto para voz, um editor de vídeo e uma ferramenta de legendagem, exportando e reimportando arquivos a cada etapa. O Genny reúne tudo — escrita de roteiros, geração de voz, edição de vídeo e legendas automáticas — em um único espaço de trabalho no navegador, voltado a criadores de redes sociais, profissionais de marketing e equipes de e-learning que preferem não gerenciar três assinaturas separadas para concluir um único vídeo.

Vantagens funcionais do LOVO AI (Genny)

  • A geração de voz e a edição de vídeo compartilham o mesmo espaço de trabalho. A locução gerada entra diretamente na linha do tempo, ao lado das cenas e da música, sem precisar ser exportada de uma ferramenta e reimportada em outra.
  • Uma biblioteca de vozes ampla e variada. Mais de 500 vozes em mais de 100 idiomas e mais de 30 estilos emocionais predefinidos atendem a uma grande variedade de sotaques e casos de uso, sem a necessidade de clonar nenhuma voz.
  • A direção por linguagem natural do Pro V2 oferece uma interface realmente diferente. Em vez de ajustar aos poucos controles deslizantes de altura da voz, velocidade e ênfase, você escreve diretamente no roteiro instruções entre colchetes, como [sobbing], [british accent] ou [speak more slowly and sound nervous], e o modelo interpreta a orientação.
  • Clonagem de voz a partir de uma amostra curta. É possível criar uma voz personalizada com aproximadamente um minuto de áudio gravado e reutilizá-la em um número ilimitado de projetos nos planos que incluem o recurso.
  • Legendas automáticas vinculadas à mesma chamada de geração de voz. As legendas são produzidas a partir do mesmo roteiro e dos mesmos dados de tempo da locução, sem exigir uma etapa separada de transcrição.
  • Um redator de roteiros e um gerador de imagens com IA na mesma aba. Para conteúdo curto, é possível produzir um rascunho do roteiro e imagens de fundo sem sair do espaço de trabalho, mesmo antes de iniciar a geração de voz.

Como funcionam as vozes que aceitam direção e o editor do Genny

A parte técnica mais interessante é o Pro V2, lançado em maio de 2025, que reformula a direção de voz como um problema de linguagem, em vez de um problema de ajuste de parâmetros. Interfaces de TTS mais antigas — incluindo as primeiras vozes da própria LOVO — apresentam emoção e interpretação como controles deslizantes ou predefinições separados, ajustados fora do roteiro. O Pro V2, por sua vez, aceita instruções escritas no próprio texto, entre colchetes, imediatamente antes do trecho ao qual se aplicam: [laughing and joking around] hahaha, and he said what? ou [super embarrassed] I can't believe I just did that. O modelo lê a orientação entre colchetes como um ator leria uma rubrica, ajustando a interpretação, o ritmo e sons não verbais, como risos ou soluços de choro, para corresponder à instrução. Ele também pode gerar várias tomadas da mesma fala, permitindo que você escolha a melhor leitura em vez de aceitar a primeira saída.

O lado de vídeo do Genny é construído em torno do mesmo princípio de uma "única chamada": como a locução, seus dados de tempo e o roteiro vêm da mesma etapa de geração, as legendas automáticas podem ser derivadas diretamente desses dados, sem executar depois um processo separado de voz para texto, e o editor de linha do tempo pode posicionar o áudio gerado com precisão em relação às cenas, sem uma etapa manual de sincronização. Esse é o valor prático da arquitetura integrada: o foco está menos em uma função específica ser a melhor da categoria e mais em eliminar o atrito de exportar e realinhar que surge ao combinar uma ferramenta de TTS, um editor de vídeo e um gerador de legendas criados por três empresas diferentes.

Dicas para obter melhores resultados com as vozes do Genny

  • Escreva as instruções entre colchetes como rubricas de atuação, não como rótulos de humor. [speak warmly, as if reassuring a nervous client] dá ao modelo mais informação para trabalhar do que uma única palavra como [nervous], já que ele está interpretando linguagem natural, e não selecionando uma opção de uma lista fixa de emoções.
  • Gere várias tomadas das falas que tenham um peso emocional importante. O Pro V2 permite várias tomadas por fala justamente porque a interpretação pode variar entre gerações: nos trechos em que o tom mais importa, trate o primeiro resultado como rascunho, não como versão final.
  • Teste a qualidade de várias das mais de 500 vozes antes de escolher uma para o projeto. As avaliações apontam de forma consistente uma variação maior de qualidade na biblioteca da LOVO do que em plataformas com uma curadoria mais rigorosa; por isso, a "melhor" voz para seu conteúdo não será necessariamente uma das primeiras nem a opção padrão.
  • Grave o áudio de origem para a clonagem em um ambiente silencioso e com um microfone decente, mesmo que um minuto seja tecnicamente suficiente. Como em qualquer método de clonagem com amostras curtas, o ruído de fundo daquele minuto é incorporado diretamente à voz resultante.
  • Reserve uma margem de tempo para a renderização, especialmente em exportações mais longas em 1080p. A velocidade de renderização na nuvem varia conforme a carga do servidor, e há relatos de que exportações de vídeos mais longos demoram consideravelmente mais nos períodos de maior uso.

LOVO AI (Genny) vs. Descript Overdub

LOVO AI (Genny)Descript Overdub
Fluxo de trabalho principalDo roteiro à voz e ao vídeo em um único espaço de trabalhoEdição de gravações existentes a partir da transcrição
Clonagem de vozCerca de 1 minuto, qualquer voz para a qual você tenha consentimentoApenas a sua própria voz, com exigência de consentimento incorporada ao projeto
Tratamento de vídeoEditor de linha do tempo integrado para criar novos vídeosEdita vídeo ou áudio existente por meio da transcrição
Mais indicado paraCriar um vídeo do zero a partir de um roteiro e de uma locuçãoCorrigir conteúdo que você já gravou ou adicionar narração a ele
Direção emocionalInstruções em linguagem natural entre colchetes (Pro V2)Inserção em tomadas reais com ajuste nos pontos de emenda

As duas ferramentas integram a geração de voz a um ambiente de edição mais amplo, em vez de oferecê-la como um recurso isolado, mas resolvem etapas diferentes da produção. O Genny foi feito para criar um vídeo do zero: roteiro, voz, elementos visuais e legendas gerados em conjunto. O Overdub foi feito para corrigir áudios que você já gravou ou adicionar narração a eles, e restringe a clonagem à sua própria voz especificamente para evitar as questões de consentimento que estão no centro da situação jurídica atual da LOVO. Se seu fluxo de trabalho começa com uma página em branco, a abordagem integrada do Genny é a opção mais direta; se começa com uma gravação existente que só precisa de uma correção, o Overdub resolve um problema mais delimitado e específico.

Perguntas frequentes

O LOVO AI (Genny) ainda está em operação?

No momento da redação deste artigo, a Lovo Inc. entrou com um pedido de falência sob o Chapter 7 (um processo de liquidação) enquanto enfrenta uma ação coletiva por suposta clonagem de voz não autorizada, e a ação foi suspensa em consequência disso. O site continua acessível, mas os relatos sobre a confiabilidade do serviço e o acesso às contas são inconsistentes; verifique a situação atual antes de depender dele para trabalhos remunerados ou de produção.

Para que serve o LOVO AI (Genny)?

O Genny é usado para produzir vídeos com locução de ponta a ponta — escrita de roteiros, narração por texto para voz, clonagem de voz, edição de vídeo e geração automática de legendas — em um único espaço de trabalho no navegador.

Como funciona a clonagem de voz da LOVO AI?

É possível criar uma voz personalizada a partir de aproximadamente um minuto de áudio gravado; depois, o modelo de voz resultante pode ser reutilizado em outras gerações nos planos que incluem o recurso.

O que são as vozes Pro V2?

O Pro V2 é o mecanismo de texto para voz da LOVO que aceita direção, lançado em maio de 2025. Ele recebe instruções em linguagem natural escritas entre colchetes — como [sobbing] ou [british accent] — diretamente no roteiro, em vez de exigir controles separados de emoção ou ritmo.

Quantas vozes e idiomas o LOVO AI (Genny) oferece?

A biblioteca abrange mais de 500 vozes em mais de 100 idiomas, com mais de 30 estilos emocionais predefinidos nas vozes padrão, além da direção por linguagem natural do Pro V2.

Crie uma locução para seu vídeo com a Echora

Para um fluxo semelhante de roteiro para voz no navegador, use o Texto para voz da Echora. Insira até 5.000 caracteres, escolha uma voz e gere sua narração. Ouça o resultado e baixe um MP3 para usar no seu editor de vídeo.

Transforme seu roteiro em voz →