Respeecher: la tecnología de voz que Hollywood sí incluye en sus créditos
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Cuando Luke Skywalker volvió a hablar con su voz de joven en The Mandalorian, y cuando la voz de Darth Vader regresó en Obi-Wan Kenobi, el estudio responsable no era un nombre conocido por todo el mundo en la IA: era Respeecher, un pequeño equipo que trabajaba desde Kyiv. Ambos trabajos son reales, ambos han sido reconocidos públicamente por Lucasfilm, y el segundo se terminó mientras el equipo se refugiaba de los bombardeos rusos durante la invasión de 2022. Ese es el nivel al que opera esta herramienta: no es una aplicación de consumo para crear clips rápidos, sino la tecnología de conversión de voz a la que recurren los estudios cuando el resultado tiene que estar a la altura de una película terminada, no solo de una demostración.
¿Qué es Respeecher?
Respeecher fue fundada en Kyiv, Ucrania, en febrero de 2018 por Alex Serdiuk, Dmytro Bielievtsov y Grant Reaber, y ha dedicado la mayor parte de su trayectoria a trabajar directamente con producciones de cine y televisión, en lugar de empezar por una aplicación para el gran público. Entre sus trabajos reales y acreditados figuran dar voz al joven Luke Skywalker en The Mandalorian, recuperar la voz de James Earl Jones como Darth Vader en varias series de Star Wars de Disney+ y pulir los diálogos en húngaro de Adrien Brody y Felicity Jones en The Brutalist. Esta última película acabaría ganando tres premios Óscar, y los proyectos realizados con ayuda de Respeecher han acumulado más de 20 nominaciones a los Óscar. La empresa siguió entregando trabajos de producción durante la invasión rusa a gran escala de Ucrania, incluida la finalización del audio de Vader para Obi-Wan Kenobi mientras el equipo se refugiaba de los bombardeos. Es un detalle que conviene conocer, dado que buena parte del marketing de la industria de la voz con IA habla de aspiraciones en lugar de capacidades demostradas en condiciones reales.
Ventajas funcionales de Respeecher
- Convierte una interpretación real en vez de generarla a partir de texto. Como Respeecher trabaja en el dominio acústico y no a partir de un guion, conserva la emoción, la respiración, los tiempos y los sonidos no verbales de una toma real: matices que la síntesis de voz tiene que aproximar en lugar de heredar directamente.
- Los cambios de guion no obligan a volver a contratar a la persona cuya voz estás reproduciendo. Una vez entrenada la voz de destino, las nuevas frases se generan a partir de la lectura de un intérprete de origen, sin que el talento original tenga que volver a grabar. Esa es la razón práctica por la que los estudios la utilizan para evitar costosos rodajes adicionales y sesiones de regrabación.
- Evita los problemas que dificultan el TTS basado en texto. Trabajar con audio en lugar de un diccionario de pronunciación permite conservar de forma natural nombres poco conocidos, siglas y sonidos no verbales, como risas o jadeos, en vez de sufrir los errores de pronunciación y los problemas con idiomas de pocos recursos que encuentran los sistemas basados en diccionarios.
- Dos niveles de acceso adaptados a la escala del proyecto. Voice Marketplace y la API, ambos de autoservicio, atienden proyectos de creadores de menor escala, como diálogos de videojuegos, contenido de YouTube y doblaje independiente, mientras que un equipo especializado de Voice Lab se encarga de producciones completas de cine y televisión con asistencia personalizada de principio a fin.
- Una herramienta de superresolución de audio para recuperar grabaciones antiguas o deterioradas. Las cintas de archivo, las llamadas antiguas de Skype o los MP3 de baja tasa de bits pueden restaurarse hasta alcanzar una calidad utilizable antes de la conversión. Esto importa especialmente al recuperar voces de figuras históricas o personas fallecidas a partir de material de origen imperfecto.
Cómo funciona realmente la conversión de voz de Respeecher
La tecnología central de Respeecher es la conversión de voz a voz (STS), no la síntesis de voz a partir de texto, y la diferencia importa más de lo que parece. Cada proyecto empieza con dos voces: la voz de destino, que es la identidad a la que quieres que se parezca el resultado final, y la voz de origen, la de un intérprete que lee las frases con tiempos, emoción y una interpretación reales. Normalmente basta con alrededor de una hora de grabaciones limpias de la voz de destino para entrenar un modelo de conversión. Tanto las grabaciones de destino como las de origen deben cubrir el rango emocional que se espera del resultado final: una lectura plana y neutra no producirá un clon capaz de gritar o susurrar de forma convincente después.
Según las propias solicitudes de patente de Respeecher, la conversión utiliza un ciclo de refinamiento adversarial: un modelo generativo produce un audio candidato que traslada la interpretación de origen al timbre de la voz de destino, y otro modelo discriminativo contrasta ese candidato con grabaciones reales de la voz de destino para detectar incoherencias. La evaluación se realiza en un espacio más amplio de datos de timbre que abarca muchas voces distintas, no solo un clip de referencia. Esas incoherencias se devuelven al generador, que produce un candidato mejorado, y el ciclo se repite hasta que el resultado es convincente. Como todo el proceso opera sobre la señal acústica, en lugar de convertir primero el texto en fonemas, Respeecher puede conservar risas, respiraciones e inflexiones emocionales que un sistema TTS basado en diccionarios tendría que reconstruir desde cero. Por eso también, si se modifica el guion a mitad de la producción, lo que se vuelve a grabar es la lectura del actor de origen, sin necesidad de regrabar la voz de destino.
Precios de Respeecher
Respeecher ofrece tres modalidades de precios distintas según lo que quieras hacer, y conviene dejar claro que solo una parte se puede contratar por autoservicio:
- Voice Marketplace (STS/TTS de autoservicio): Créditos de pago por uso facturados por minuto de audio generado, o suscripciones mensuales para un uso más intenso y recurrente. Los servicios externos de seguimiento de precios sitúan los planes de suscripción aproximadamente entre 150 y 450 USD al mes, aunque Respeecher no publica una lista fija de precios, por lo que cualquier cifra concreta debe considerarse aproximada hasta confirmarla al pagar. Antes de contratar hay una prueba gratuita disponible, que según la información publicada dura unos 3 días.
- API de TTS en tiempo real: Pago por uso, con un precio citado públicamente de unos 2 USD por hora de generación de voz a partir de texto en tiempo real, dirigida a aplicaciones como diálogos de videojuegos que necesitan tiempos de respuesta inferiores a 200ms.
- Cine, televisión y proyectos personalizados de Voice Lab: Solo mediante presupuesto del equipo comercial de Respeecher; aquí no hay ninguna lista pública de precios. Evaluadores externos que han pasado por el proceso afirman que los proyectos profesionales suelen partir de entre 2.000 y 5.000 USD por una sola conversión de voz y pueden alcanzar decenas de miles de dólares para sustituir todos los diálogos de un largometraje. Respeecher no publica estas cifras, y el coste real depende mucho de la duración del audio, la complejidad de la voz y los costes de obtener el consentimiento y realizar las verificaciones.
En la práctica, si estás probando la tecnología o trabajando en un proyecto de creador de menor escala, Marketplace y la API te permiten obtener cifras reales basadas en el uso sin hablar con ventas. Si planeas un trabajo de cine o televisión, cuenta con una conversación comercial al preparar el presupuesto, en vez de esperar una página de pago: así es como se vende realmente la parte más especializada de este producto.
Consejos para obtener mejores resultados con Respeecher
- Graba el audio de origen en bruto y sin comprimir. Las propias indicaciones de Respeecher piden audio limpio y sin procesar a 48kHz/16-bit. Evita los efectos, la compresión y cualquier posprocesamiento antes de enviarlo, porque después no se pueden separar limpiamente del audio.
- Elimina el ruido antes de convertir, no después. El ruido de fondo, los zumbidos y los artefactos actúan como manchas entre la IA y la señal vocal que necesita aislar. Aplicar una reducción de ruido antes de la conversión, ya sea con la herramienta integrada de Marketplace o con software externo, produce un resultado considerablemente más limpio que intentar corregir la salida después.
- Graba tanto el audio de destino como el de origen con todo el rango emocional que vas a necesitar. Una lectura plana y neutra no enseñará al modelo a gritar, susurrar o expresar angustia de forma convincente más adelante. Cubre el rango real que exige tu proyecto durante la sesión de grabación inicial, no solo una narración tranquila.
- No des por hecho que las grabaciones antiguas o deterioradas son inutilizables. Las cintas de archivo, las llamadas antiguas y los archivos de baja tasa de bits a menudo pueden restaurarse mediante superresolución de audio antes de la conversión. Esto importa si trabajas con material histórico imperfecto en lugar de una grabación nueva de estudio.
- Completa con cuidado la calibración de voz antes de tu primera conversión. La calibración establece características de referencia, como el tono medio. Hacerla con prisas genera conversiones que requieren más correcciones posteriores de las que habrían sido necesarias si se hubiera hecho bien desde el principio.
Respeecher frente a Play.ht
| Respeecher | Play.ht | |
|---|---|---|
| Tecnología central | Voz a voz (STS): convierte una interpretación real | Síntesis de voz a partir de texto con clonación instantánea, optimizada para streaming |
| Uso más adecuado | Cine, televisión y videojuegos: contenido con guion y matices emocionales | Agentes de voz en directo, IVR y aplicaciones conversacionales |
| Latencia | No está diseñado para la interacción en tiempo real | Inferior a un segundo, diseñado específicamente para uso en directo |
| Material de origen | Requiere una toma interpretada por un actor de origen | Genera directamente a partir de texto escrito |
| Modalidad de acceso | Marketplace/API de autoservicio y proyectos cinematográficos solo bajo presupuesto | Totalmente de autoservicio, con planes de suscripción publicados |
Estas dos herramientas resuelven problemas casi opuestos. Play.ht existe para que una voz clonada responda al instante dentro de una conversación en directo: no se convierte ninguna «interpretación» real, solo entra texto y sale audio en streaming lo más rápido posible. Respeecher existe para conservar una interpretación que ya tuvo lugar y trasladar su textura emocional a otra voz, para contenido que se verá o escuchará como una obra terminada, no con el que se conversará en tiempo real. Si tu proyecto es un agente de voz, la arquitectura de Respeecher no encaja en absoluto; si es una escena que debe sonar como si la hubiera interpretado un actor concreto, ese es precisamente el problema que Respeecher se creó para resolver.
Preguntas frecuentes
¿Para qué se utiliza Respeecher?
Respeecher se utiliza para doblaje de cine y televisión, restauración y rejuvenecimiento de voces, voces de personajes de videojuegos y localización multilingüe: cualquier situación en la que haya que conservar la interpretación de una voz concreta en otra identidad o idioma.
¿La clonación de voz de Respeecher es lo mismo que la síntesis de voz a partir de texto?
No. La tecnología central de Respeecher es la conversión de voz a voz: transforma una interpretación ya grabada en una voz de destino, en lugar de generar voz a partir de texto escrito como hacen la mayoría de las herramientas de clonación basadas en TTS.
¿Cuánto cuesta Respeecher?
Depende del producto que utilices. Voice Marketplace, de autoservicio, funciona con créditos de pago por uso o suscripciones mensuales; la API de TTS en tiempo real cuesta alrededor de 2 USD por hora; y los proyectos personalizados de clonación de voz para cine o televisión solo se presupuestan a través del equipo comercial de Respeecher, sin una lista pública de precios.
¿Puedo clonar la voz de cualquier persona con Respeecher?
No. Respeecher exige una prueba de consentimiento antes de iniciar cualquier proyecto y no clona la voz de una persona particular o de un actor que esté vivo sin su permiso explícito. No obstante, su propia política ética permite usos no engañosos de las voces de algunas figuras históricas y públicas.
¿Respeecher funciona en tiempo real?
La conversión de Voice Marketplace no es actualmente en tiempo real, pero la API de TTS que Respeecher ofrece por separado está diseñada para baja latencia y genera audio en unos 200 milisegundos para aplicaciones como diálogos de videojuegos.
Cambia la voz de tu grabación con Echora
Para probar un proceso similar de conversión de voz a voz en tu navegador, sube una grabación de voz al cambiador de voz de Echora y elige una voz integrada o añade una grabación de referencia de la voz de destino. Echora utiliza el contenido hablado y la interpretación de la grabación original para generar una versión con otra voz, que puedes escuchar y descargar.