LOVO AI (Genny): locución, vídeo y clonación de voz en una sola pestaña del navegador
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
LOVO AI es una empresa con sede en Berkeley, California, fundada en 2019 por Charlie Choi y Tom Lee, que recaudó 4,5 millones de dólares en una ronda Pre-Series A en agosto de 2021, liderada por Kakao Entertainment y LG CNS. Su producto, Genny, se propuso resolver un problema concreto del flujo de trabajo: producir un vídeo terminado con locución suele implicar ir y venir entre una herramienta de texto a voz, un editor de vídeo y una herramienta de subtitulado, exportando y volviendo a importar archivos en cada paso. Genny reúne todo —redacción de guiones, generación de voz, edición de vídeo y subtítulos automáticos— en un único espacio de trabajo en el navegador, dirigido a creadores de redes sociales, profesionales del marketing y equipos de formación online que prefieren no gestionar tres suscripciones distintas para terminar un solo vídeo.
Ventajas funcionales de LOVO AI (Genny)
- La generación de voz y la edición de vídeo comparten un espacio de trabajo. La locución generada se coloca directamente en una línea de tiempo junto al metraje y la música, sin tener que exportarla de una herramienta e importarla en otra.
- Una biblioteca de voces amplia y variada. Más de 500 voces en más de 100 idiomas y más de 30 estilos emocionales predefinidos cubren una gran variedad de acentos y casos de uso sin necesidad de clonar nada.
- La dirección mediante lenguaje natural de Pro V2 ofrece una interfaz realmente distinta. En lugar de ir ajustando controles deslizantes de tono, velocidad y énfasis, escribes directamente en el guion instrucciones entre corchetes como
[sobbing],[british accent]o[speak more slowly and sound nervous], y el modelo interpreta la indicación. - Clonación de voz a partir de una muestra breve. Se puede crear una voz personalizada con aproximadamente un minuto de audio grabado y reutilizarla en un número ilimitado de proyectos con los planes que incluyen esta función.
- Subtítulos automáticos vinculados a la misma llamada de generación de voz. Los subtítulos se producen a partir del mismo guion y los mismos datos de tiempo que la locución, sin necesidad de una transcripción aparte.
- Un redactor de guiones y un generador de imágenes con IA en la misma pestaña. Para contenido breve, se pueden crear un borrador del guion e imágenes de fondo sin salir del espacio de trabajo, incluso antes de empezar a generar la voz.
Cómo funcionan las voces dirigibles y el editor de Genny
La parte técnica más interesante es Pro V2, lanzado en mayo de 2025, que replantea la dirección de voz como un problema de lenguaje en vez de uno de ajuste de parámetros. Las interfaces de TTS anteriores —incluidas las primeras voces de la propia LOVO— presentan la emoción y la interpretación como controles deslizantes o preajustes independientes que se modifican fuera del guion. Pro V2, en cambio, acepta instrucciones escritas en el propio texto, entre corchetes, justo antes del fragmento al que se aplican: [laughing and joking around] hahaha, and he said what? o [super embarrassed] I can't believe I just did that. El modelo lee la indicación entre corchetes como un actor leería una acotación, ajustando la interpretación, el ritmo y los sonidos no verbales, como risas o sollozos, para que encajen. Además, puede generar varias tomas de la misma frase, de modo que puedas elegir la mejor lectura en lugar de aceptar el primer resultado.
La parte de vídeo de Genny se basa en el mismo principio de «una sola llamada»: como la locución, sus datos de tiempo y el guion proceden de un mismo paso de generación, los subtítulos automáticos pueden obtenerse directamente de esos datos sin ejecutar después un proceso separado de voz a texto, y el editor de línea de tiempo puede colocar con precisión el audio generado respecto al metraje sin una sincronización manual. Ese es el valor práctico de la arquitectura todo en uno: importa menos que una función concreta sea la mejor de su categoría y más eliminar la fricción de exportar y volver a alinear que surge al combinar una herramienta de TTS, un editor de vídeo y un generador de subtítulos desarrollados por tres empresas distintas.
Consejos para obtener mejores resultados con las voces de Genny
- Escribe las indicaciones entre corchetes como acotaciones, no como etiquetas de estado de ánimo.
[speak warmly, as if reassuring a nervous client]le da al modelo más información con la que trabajar que una sola palabra como[nervous], porque está interpretando lenguaje natural en lugar de seleccionar una opción de una lista fija de emociones. - Genera varias tomas de las frases que tengan un peso emocional importante. Pro V2 admite varias tomas por frase precisamente porque la interpretación puede variar entre generaciones: en las frases donde el tono sea decisivo, trata el primer resultado como un borrador, no como la versión final.
- Prueba la calidad de varias de las más de 500 voces antes de elegir una para un proyecto. Los análisis señalan de forma consistente una mayor variación de calidad dentro de la biblioteca de LOVO que en plataformas con una selección más rigurosa, así que la «mejor» voz para tu contenido no tiene por qué ser una de las primeras ni la opción predeterminada.
- Graba el audio de origen para la clonación en una habitación silenciosa y con un micrófono decente, aunque técnicamente baste con un minuto. Como ocurre con cualquier método de clonación a partir de muestras breves, el ruido de fondo de ese minuto queda incorporado directamente a la voz resultante.
- Deja un margen de tiempo para el renderizado, sobre todo en exportaciones largas a 1080p. La velocidad de renderizado en la nube varía según la carga del servidor, y se ha informado de que las exportaciones de vídeos largos tardan bastante más en las horas de mayor uso.
LOVO AI (Genny) frente a Descript Overdub
| LOVO AI (Genny) | Descript Overdub | |
|---|---|---|
| Flujo de trabajo principal | Del guion a la voz y al vídeo en un mismo espacio de trabajo | Edición de grabaciones existentes a partir de su transcripción |
| Clonación de voz | Aproximadamente 1 minuto, cualquier voz para la que tengas consentimiento | Solo tu propia voz, con un requisito de consentimiento incorporado en el diseño |
| Tratamiento del vídeo | Editor de línea de tiempo integrado para crear vídeos nuevos | Edita vídeo o audio existente a través de su transcripción |
| Uso más adecuado | Crear un vídeo desde cero a partir de un guion y una locución | Corregir contenido que ya has grabado o añadirle una narración |
| Dirección emocional | Indicaciones en lenguaje natural entre corchetes (Pro V2) | Inserción en tomas reales con ajuste en los puntos de unión |
Ambas herramientas integran la generación de voz en un entorno de edición más amplio en lugar de ofrecerla como una función independiente, pero resuelven etapas de producción diferentes. Genny está pensado para crear un vídeo desde cero: guion, voz, imágenes y subtítulos generados en conjunto. Overdub está diseñado para corregir audio que ya has grabado o añadirle una narración, y restringe la clonación a tu propia voz precisamente para evitar las cuestiones de consentimiento que están en el centro de la situación legal actual de LOVO. Si tu flujo de trabajo parte de una página en blanco, el enfoque todo en uno de Genny encaja de forma más directa; si parte de una grabación existente que solo necesita una corrección, Overdub resuelve un problema más acotado y específico.
Preguntas frecuentes
¿LOVO AI (Genny) sigue funcionando?
En el momento de escribir este artículo, Lovo Inc. ha solicitado la bancarrota bajo el Chapter 7 (un procedimiento de liquidación) mientras afronta una demanda colectiva por una presunta clonación de voces no autorizada, y el caso ha quedado suspendido como consecuencia. El sitio web sigue siendo accesible, pero los informes sobre la fiabilidad del servicio y el acceso a las cuentas son dispares; verifica su estado actual antes de depender de él para trabajos remunerados o de producción.
¿Para qué se utiliza LOVO AI (Genny)?
Genny se utiliza para producir vídeos con locución de principio a fin —redacción de guiones, narración de texto a voz, clonación de voz, edición de vídeo y generación automática de subtítulos— en un único espacio de trabajo en el navegador.
¿Cómo funciona la clonación de voz de LOVO AI?
Se puede crear una voz personalizada a partir de aproximadamente un minuto de audio grabado; después, el modelo de voz resultante puede reutilizarse en distintas generaciones con los planes que incluyen esta función.
¿Qué son las voces Pro V2?
Pro V2 es el motor de texto a voz dirigible de LOVO, lanzado en mayo de 2025, que acepta instrucciones en lenguaje natural escritas entre corchetes —como [sobbing] o [british accent]— directamente dentro del guion, sin requerir controles de emoción o ritmo por separado.
¿Cuántas voces e idiomas admite LOVO AI (Genny)?
La biblioteca abarca más de 500 voces en más de 100 idiomas, con más de 30 estilos emocionales predefinidos para las voces estándar, además de la dirección mediante lenguaje natural de Pro V2.
Crea una locución para tu vídeo con Echora
Para un flujo similar de guion a voz en el navegador, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz y genera tu narración. Escucha el resultado y descarga un MP3 para utilizarlo en tu editor de vídeo.