Chatterbox TTS: clonación de voz de código abierto que superó a ElevenLabs en una prueba a ciegas
Convierte texto y grabaciones en obras que se escuchan
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
La mayoría de las afirmaciones que presentan un modelo como “alternativa de código abierto a ElevenLabs” no resisten una comparación directa. La de Chatterbox sí. En una evaluación a ciegas realizada a través de Podonos, los participantes escucharon pares de muestras de Chatterbox y ElevenLabs sin etiquetas, contexto ni indicación de qué modelo había generado cada clip. El 63,75 % de las veces prefirieron la salida de Chatterbox. Ese resultado, sumado a una licencia MIT permisiva que admite el uso comercial, explica por qué Chatterbox se ha convertido en uno de los modelos TTS de pesos abiertos más comentados del año.
¿Qué es Chatterbox?
Chatterbox es la familia de modelos de texto a voz de código abierto de Resemble AI. Fue desarrollada por un equipo de tres personas y se publica bajo la licencia MIT. Destaca especialmente en dos tareas: la clonación de voz zero-shot a partir de un breve audio de referencia y el control de la exageración emocional, un parámetro que permite pasar de una voz plana y contenida a una interpretación muy expresiva. Resemble AI presenta esta última capacidad como una novedad en el TTS de código abierto.
La familia Chatterbox ha crecido más allá del modelo original en inglés y ahora incluye tres variantes, cada una optimizada para una prioridad distinta:
- Chatterbox (original) — el modelo base en inglés, optimizado para la calidad y la amplitud emocional.
- Chatterbox Multilingual (V3) — un modelo de 500 millones de parámetros compatible con más de 20 idiomas. Está diseñado para conservar el timbre, el acento y el ritmo de una voz clonada cuando el mismo hablante cambia de idioma, en lugar de derivar hacia un acento genérico.
- Chatterbox Turbo — una variante de 350 millones de parámetros optimizada para la velocidad, con unos 75 ms de latencia y una generación aproximadamente seis veces más rápida que el tiempo real. Está orientada a asistentes de voz y otras aplicaciones donde el tiempo de respuesta importa más que la máxima expresividad.
Cómo funciona: clonación, emoción y marcas de agua
Clonación zero-shot. Chatterbox puede reproducir una voz objetivo con tan solo 5–10 segundos de audio de referencia, sin ajuste fino ni entrenamiento independiente. Basta con proporcionar un clip para que el modelo aplique inmediatamente esa voz a un texto nuevo.
Dos parámetros ajustables. La salida depende principalmente de dos valores: exaggeration, que controla la intensidad emocional, y cfg_weight, que equilibra la fidelidad a la voz de referencia frente al texto de entrada. El valor predeterminado de 0,5 para ambos funciona bien en muchos casos; aumentar exaggeration produce la interpretación dramática característica de Chatterbox.
Etiquetas paralingüísticas. Chatterbox Turbo incorpora etiquetas de texto para suspiros, jadeos, tos y reacciones similares. El modelo las interpreta directamente con la voz clonada y el tono emocional correspondiente, sin necesidad de añadir después un efecto de sonido grabado por separado.
Marca de agua integrada. Cada clip generado incluye desde el momento de su creación la marca de agua PerTh (Perceptual Threshold) de Resemble AI. Es inaudible para el público, pero está diseñada para resistir la compresión y la edición básica, ayudando a rastrear el audio hasta su origen. Es una medida de confianza importante al incorporar clonación de voz en productos donde importa la procedencia del contenido.
Cómo empezar a usar Chatterbox
- Prepara el entorno. Instala Chatterbox mediante
pip. El proyecto se desarrolla y prueba con Python 3.11, y la configuración oficial recomienda un entornocondapara mantener consistentes las versiones de las dependencias. - Obtén el código o el modelo. Clona
resemble-ai/chatterboxdesde GitHub o carga directamente un checkpoint desde Hugging Face si no necesitas una copia local del repositorio. - Elige la variante adecuada. Usa el Chatterbox original para narración expresiva en inglés, Chatterbox Multilingual cuando una voz clonada deba mantenerse entre idiomas o Chatterbox Turbo cuando la prioridad sea reducir la latencia.
- Pruébalo antes de integrarlo. Resemble AI ofrece una demostración oficial con Gradio en Hugging Face Spaces, donde puedes probar la clonación de voz y el parámetro
exaggerationdesde el navegador antes de escribir código de integración. - Amplía el despliegue cuando sea necesario. Resemble AI también ofrece un servicio TTS alojado basado en la misma familia de modelos para equipos que necesitan escalado gestionado sin operar sus propias GPU.
Consejos para mejorar los resultados de Chatterbox
- Haz coincidir el audio de referencia con el idioma objetivo. En Chatterbox Multilingual, comprueba que la etiqueta de idioma del audio de referencia coincide con el idioma que vas a generar. De lo contrario, la salida puede heredar el acento del clip de referencia en vez de adoptar la pronunciación natural del idioma objetivo. Establecer
cfg_weighten 0 puede ayudar cuando no hay una coincidencia exacta. - Empieza con el nivel de exageración predeterminado. El valor 0,5 está ajustado para funcionar con una gran variedad de prompts. Considera los valores superiores una decisión creativa para lograr una interpretación dramática, no el punto de partida automático.
- Usa Turbo en aplicaciones interactivas. Si una persona está esperando una respuesta, como en un agente de voz, un asistente o una demostración en directo, los aproximadamente 75 ms de latencia de Turbo pueden importar más que la pequeña mejora de calidad de un modelo mayor.
- Ten en cuenta la marca de agua al planificar el cumplimiento. Como todas las salidas incluyen una marca PerTh de forma predeterminada, conviene explicarlo en la documentación y las políticas del producto sobre la divulgación de audio generado por IA.
- Proporciona clips limpios de entre 7 y 20 segundos. Resemble AI utilizó este intervalo en sus pruebas comparativas. Aunque el modelo puede funcionar con muestras más cortas, suele ser un punto de partida fiable para la calidad de clonación zero-shot.
Chatterbox frente a ElevenLabs y otros modelos abiertos
| Chatterbox | ElevenLabs | Otros TTS abiertos (Dia, Dia2) | |
|---|---|---|---|
| Licencia | MIT (permisiva) | API comercial cerrada | Apache 2.0 |
| Clonación de voz | Zero-shot, referencia de 5–10 segundos | Sí, limitada por la suscripción | Varía, con acondicionamiento de audio |
| Control emocional | Parámetro exaggeration explícito | Controles de estilo limitados | No es una función principal |
| Marca de agua | Integrada de forma predeterminada (PerTh) | No es estándar | No es estándar |
| Autoalojamiento | Sí, despliegue local completo | No | Sí |
| Preferencia a ciegas frente a ElevenLabs | Elegido el 63,75 % de las veces en el estudio de Podonos | — | Sin comparación directa |
La principal diferencia de Chatterbox no consiste solo en competir en calidad percibida con un líder comercial cerrado. Combina ese resultado con una licencia MIT, una marca de agua integrada y la posibilidad de autoalojarlo por completo, capacidades que la API de ElevenLabs no reúne en una misma oferta.
Preguntas frecuentes
¿Chatterbox se puede usar gratis en proyectos comerciales?
Sí. Chatterbox se publica bajo la licencia MIT, una de las licencias de código abierto más permisivas. Permite el uso comercial, la modificación y la distribución, siempre que se cumplan las condiciones relativas al aviso de licencia y los derechos de autor.
¿Cómo se compara la calidad real de Chatterbox con la de ElevenLabs?
En una evaluación a ciegas realizada mediante Podonos con textos y clips de referencia idénticos, sin mostrar las etiquetas de los modelos, los participantes prefirieron la salida de Chatterbox frente a ElevenLabs el 63,75 % de las veces.
¿Qué diferencia hay entre Chatterbox, Chatterbox Multilingual y Chatterbox Turbo?
El Chatterbox original es el modelo base en inglés y ofrece un amplio rango emocional. Chatterbox Multilingual extiende la clonación de voz a más de 20 idiomas preservando la identidad del hablante. Chatterbox Turbo prioriza la velocidad, con unos 75 ms de latencia para usos en tiempo real.
¿Chatterbox añade una marca de agua al audio?
Sí. Cada generación incluye automáticamente la marca PerTh de Resemble AI. Está integrada de forma que resulta inaudible para el público, pero puede detectarse para verificar la procedencia y autenticidad del audio.
¿Cuánto audio de referencia necesita Chatterbox para clonar una voz?
Puede funcionar con tan solo 5–10 segundos y la clonación zero-shot no requiere entrenamiento ni ajuste fino adicional. En la práctica, un clip limpio de entre 7 y 20 segundos es un buen objetivo para obtener resultados más consistentes.
Prueba una función similar de clonación de voz
Chatterbox se utiliza mediante la implementación de código abierto y la demostración oficial de Resemble AI. Si quieres explorar la clonación de voz en el navegador, prueba Clonación de voz como una función similar. No es Chatterbox ni ejecuta su modelo, pero te permite probar un flujo de clonación parecido antes de decidir cómo desplegar Chatterbox.
Clona únicamente voces que te pertenezcan o para las que tengas permiso explícito.