EchoraEchora
Volver a los modelos

Resemble AI: clonación de voz creada con la mentalidad de un equipo de seguridad

15 de septiembre de 2026
•
8 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de las herramientas de clonación de voz tratan la seguridad como una idea de última hora: una cláusula en los términos de servicio, no una función del producto. Resemble AI construyó su negocio al revés: clona voces a partir de una muestra breve como cualquier otra plataforma, pero cada clip que genera lleva una marca de agua invisible, y la misma empresa vende la tecnología de detección que se utiliza para identificar deepfakes creados con otras herramientas. Si tu caso de uso incluye voces de marca, imitaciones de intérpretes o cualquier contenido en el que «demostrar que esto es auténtico» sea tan importante como «hacer que suene real», merece la pena conocer en detalle la combinación de clonación y acreditación de origen de Resemble AI.

¿Qué es Resemble AI?

Resemble AI es una empresa de IA de voz fundada en 2019 por Zohaib Ahmed y Saqib Muhammad. Comenzó en Toronto y ahora tiene su sede en el área de la bahía de San Francisco. La empresa ha recaudado aproximadamente 25 millones de dólares en cinco rondas de financiación, incluida una ronda estratégica de 13 millones de dólares en diciembre de 2025 respaldada por Google AI Futures Fund, Sony Innovation Fund, KDDI y Okta Ventures. El propio interés de estos inversores en la prevención del fraude y la seguridad de las telecomunicaciones dice tanto sobre el posicionamiento de Resemble como sus páginas de producto. Sus clientes abarcan estudios de entretenimiento, proveedores de telecomunicaciones de la lista Fortune 500 y organismos gubernamentales. La empresa opera dos negocios conectados bajo una misma plataforma: un estudio de voz generativa y un conjunto de herramientas de detección de deepfakes y marcas de agua que también vende por separado. Resemble AI también creó Chatterbox, el modelo TTS open source con licencia MIT que muchos equipos utilizan como alternativa autoalojada a las herramientas comerciales de clonación.

Ventajas funcionales de Resemble AI

  • Clona una voz a partir de una muestra breve y sigue trabajando desde ahí: Resemble crea un clon de voz utilizable con unos 30–60 segundos de audio de origen y ofrece un nivel de clonación «Pro» de mayor fidelidad para producción.
  • Todos los clips generados llevan una marca de agua por defecto: la tecnología PerTH de Resemble incorpora a cada resultado una señal imperceptible y resistente a manipulaciones, de modo que su origen pueda verificarse posteriormente incluso después de recodificarlo o convertirlo a otro formato.
  • Un motor de detección de deepfakes que la mayoría de los competidores ni siquiera tiene: Resemble Detect, creado sobre modelos como DETECT-3B Omni y DETECT-World, analiza en tiempo real y fotograma a fotograma el contenido de audio, vídeo e imágenes para señalar medios sintéticos o manipulados. Se vende como complemento de la generación de voz y también como producto de seguridad independiente.
  • Precios por uso sin obligarte a contratar un nivel mensual: el plan Flex factura por segundo el TTS, la clonación de voz y la detección, con créditos que nunca caducan, en lugar de encerrarte en una suscripción dimensionada para el patrón de uso de otra persona.
  • Verificación del consentimiento integrada en el proceso de clonación: clonar la voz de otra persona exige confirmar su consentimiento al crearla, con el respaldo de la misma tecnología de marcas de agua y detección que se utiliza después para identificar usos no autorizados.

Cómo funciona la clonación de voz de Resemble AI

Sube una grabación de referencia limpia —bastan entre 30 y 60 segundos para obtener un clon utilizable— y Resemble generará un modelo de voz que puedes controlar con cualquier texto, ajustando a medida que avanzas el ritmo y la expresión emocional. El nivel de clonación «Rapid», de menor coste, es adecuado para prototipos rápidos y proyectos puntuales, mientras que el nivel «Pro» cuesta más al mes, pero produce el resultado de mayor fidelidad necesario para una voz de marca recurrente o la imitación autorizada de un intérprete. También está disponible la conversión de voz a voz en tiempo real, que permite transformar la voz de una persona en la voz objetivo mientras habla, en lugar de generarla a partir de texto.

Cómo funciona realmente la tecnología de seguridad de Resemble AI

Esta es la parte de la plataforma que distingue a Resemble de la mayoría de sus competidores en clonación de voz. Funciona mediante dos tecnologías separadas diseñadas para trabajar conjuntamente:

La marca de agua (PerTH) incorpora una señal inaudible directamente en la forma de onda del audio durante la generación. Está diseñada para resistir transformaciones habituales —compresión, recodificación e incluso su uso como datos de entrenamiento para otro modelo—, de modo que un análisis posterior pueda confirmar que un clip se originó en Resemble, aunque se haya vuelto a subir, editado o despojado de sus metadatos.

La detección (Resemble Detect) ofrece la capacidad inversa: en lugar de marcar el contenido generado por Resemble, analiza contenido de cualquier fuente para indicar si probablemente fue generado por IA o manipulado. Los modelos de detección actuales —DETECT-3B Omni y el más reciente DETECT-World— realizan un análisis fotograma a fotograma de audio, vídeo e imágenes. Comprueban tanto patrones de síntesis conocidos como señales de coherencia física, por ejemplo la iluminación y la continuidad, lo que permite a DETECT-World identificar resultados de generadores para los que no se entrenó específicamente. La detección se ejecuta como un proceso paralelo a través de una API, por lo que no añade latencia a la llamada o transmisión en directo que supervisa.

Juntas, la marca de agua y la detección forman lo que Resemble denomina una «pila de confianza»: procedencia demostrable para tu propio contenido y una forma de comprobar el contenido que no has generado. Para los equipos que clonan voces de intérpretes, voces de marca o cualquier material sujeto a riesgos jurídicos, esta es la respuesta práctica a «cómo demostramos que este audio es (o no es) nuestro».

Primeros pasos con la API de Resemble AI

  1. Crea una cuenta y abre la página de la API. Regístrate en app.resemble.ai y ve a Account → API para encontrar tu token único de API.
  2. Copia tu clave de API. Resemble muestra el token directamente en esa página en lugar de revelarlo una sola vez; guárdalo como variable de entorno en vez de incluirlo directamente en el código del proyecto.
  3. Instala el SDK para tu lenguaje. Las bibliotecas oficiales están disponibles mediante pip install resemble (Python), npm install @resemble/node (Node.js) y bundle add resemble (Ruby).
  4. Elige un tipo de solicitud. La API de Resemble admite tres modos de síntesis —Async, Sync y Streaming—, para que puedas escoger reproducción inmediata, generación por lotes o transmisión continua según el caso de uso.
  5. Realiza tu primera llamada. Un flujo habitual se autentica con Resemble.api_key('YOUR_API_KEY'), obtiene un proyecto y el UUID de una voz y, a continuación, llama al endpoint de clips con tu texto para generar audio.

Consejos para obtener mejores resultados con Resemble AI

  • Graba la muestra de origen en un lugar silencioso y a una distancia constante del micrófono. Incluso con 30–60 segundos, el ruido de fondo es la causa más habitual de que un clon suene irregular en guiones más largos.
  • Usa el nivel de clonación Pro para todo lo que vaya a repetirse. El nivel Rapid sirve para una prueba puntual, pero una voz de marca o un personaje recurrente merecen la opción de mayor fidelidad.
  • Modela el uso antes de adoptar Flex a gran escala. La facturación por segundo es económica al principio, pero puede superar una suscripción de tarifa plana en cargas de gran volumen, como un IVR con mucho tráfico. Calcula tus segundos mensuales antes de asumir que es la opción más barata.
  • Activa Detect si publicas en canales públicos. Combinar las marcas de agua de tus propios resultados con la detección aplicada a contenido entrante o de terceros cierra el círculo, en vez de cubrir solo la mitad del problema.
  • Obtén un consentimiento documentado antes de clonar la voz de cualquier otra persona. Los propios términos de servicio de Resemble lo exigen, y su tecnología de marcas de agua y detección existe en parte para hacerlo cumplir posteriormente.

Resemble AI frente a ElevenLabs

Resemble AIElevenLabs
Modelo de preciosPago por segundo, sin mínimo mensualNiveles de suscripción mensual con tarifa plana
Clonación de vozMuestra de ~30–60 s, niveles Rapid/ProNiveles Instant (1–3 min) / Professional (30 min–3 h)
Marca de agua integradaSí: PerTH, aplicada por defectoLimitada; no es un objetivo central del producto
Detección de deepfakesSí: Resemble Detect, vendido por separadoNo se ofrece como producto
Efectos de sonido/doblajeNo es una oferta centralSí: herramientas específicas de efectos de sonido y doblaje
Más adecuado paraCasos de uso sensibles a la seguridad y la procedenciaProducción amplia de contenido con TTS, clonación y audio

Ninguna plataforma es estrictamente mejor: están optimizadas para prioridades diferentes. ElevenLabs reúne más herramientas creativas —efectos de sonido, doblaje y una gran biblioteca de voces— en una suscripción de tarifa plana. Resemble AI concentra su enfoque en la clonación y en la capa de confianza que la rodea, algo especialmente importante cuando el contenido de voz debe tener una autenticidad demostrable: voces de marca, intérpretes con licencia o cualquier caso en el que una disputa sobre audio sintético pueda convertirse en una cuestión jurídica.

Preguntas frecuentes

¿Para qué se utiliza Resemble AI?

Resemble AI se utiliza para clonación de voz, conversión de voz a voz en tiempo real, creación de voces de marca y personajes, y detección de deepfakes o autenticación de contenido mediante sus herramientas Detect y de marcas de agua.

¿Resemble AI es gratis?

El plan Flex parte de 0 $ con precios de pago por uso y sin compromiso mensual: solo pagas por lo que generas, por segundo, más una pequeña tarifa mensual por cada clon de voz que mantengas activo.

¿Cómo funciona la marca de agua de Resemble AI?

Resemble incorpora a cada clip generado una marca de agua (PerTH) imperceptible y resistente a manipulaciones. Está diseñada para sobrevivir a la recodificación y a los cambios de formato, por lo que su origen puede verificarse posteriormente aunque el archivo se haya editado o vuelto a subir en otro lugar.

¿Cuánto audio de origen necesita Resemble AI para clonar una voz?

Bastan entre 30 y 60 segundos de audio de referencia limpio para producir un clon utilizable, y hay un nivel Pro de mayor fidelidad para producción o uso como voz de marca.

¿Resemble AI exige consentimiento para clonar una voz?

Sí. Clonar la voz de otra persona sin permiso infringe los términos de servicio de Resemble AI, y la plataforma exige confirmar el consentimiento durante el proceso de creación del clon.

¿Cómo consigo una clave de API de Resemble AI?

Inicia sesión en app.resemble.ai, ve a Account → API y copia el token que aparece allí; funciona con los endpoints Async, Sync y Streaming de Resemble.

Genera una voz similar desde un audio de referencia

Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.

Crear una voz clonada →