EchoraEchora
Volver a Modelos

Chatterbox Multilingual: una voz clonada, 23 idiomas y sin deriva del acento

26 de agosto de 2026
7 min de lectura

Convierte texto y grabaciones en obras que se escuchan

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Clona una voz en inglés con la mayoría de los sistemas TTS multilingües, cámbiala después al español y algo falla: el acento deriva, el ritmo cambia y el resultado empieza a sonar como una persona totalmente distinta. Chatterbox Multilingual se creó para resolver precisamente ese problema: un único modelo de código abierto que clona una voz una vez y mantiene su identidad —timbre, acento y cadencia— en 23 idiomas, sin volver a entrenar ni cambiar de modelo para cada mercado.

¿Qué es Chatterbox Multilingual?

Chatterbox Multilingual es el modelo multilingüe de texto a voz de uso general de Resemble AI. Forma parte de la misma familia Chatterbox de código abierto y con licencia MIT que el modelo original en inglés y la variante Turbo de baja latencia. La versión actual, V3, conserva la misma arquitectura de 500 millones de parámetros que su predecesora y mejora específicamente tres aspectos: la similitud del hablante al cambiar de idioma, la reducción de alucinaciones (menos repeticiones no deseadas o continuaciones ajenas al prompt) y una interpretación más natural y conversacional en todos los idiomas compatibles.

Admite 23 idiomas de forma nativa: árabe, chino, danés, neerlandés, inglés, finés, francés, alemán, griego, hebreo, hindi, italiano, japonés, coreano, malayo, noruego, polaco, portugués, ruso, español, suajili, sueco y turco. Así, una misma versión cubre tanto idiomas muy hablados como otros con menor oferta, como el suajili y el malayo.

La función que realmente importa: transferencia de voz entre idiomas

La mayoría del marketing de TTS «multilingüe» significa que el proveedor entrega un modelo distinto —o un ajuste fino diferente— para cada idioma, sin garantizar que la identidad de la voz sobreviva al cambio. Chatterbox Multilingual funciona de otra manera: proporcionas un clip de referencia en cualquier idioma y el modelo puede generar voz en cualquiera de los otros 22 manteniendo las características vocales del hablante original. Clona a una persona que habla inglés y haz que hable francés. Toma un clip de referencia en hindi y genera alemán. El idioma del audio de referencia no tiene que coincidir con el idioma que generas: esa es precisamente la finalidad de un solo modelo entre idiomas en lugar de 23 modelos separados.

Para proyectos que necesitan un control más preciso de un mercado concreto, Resemble AI también ofrece un Single Language Pack: ajustes finos específicos para seis idiomas prioritarios y variantes regionales (chino mandarín, español latinoamericano, español de España, portugués de Brasil, portugués de Portugal e hindi), destinados a casos en los que la precisión dialectal o la pronunciación regional importan más que una cobertura amplia.

Cómo empezar a usar Chatterbox Multilingual

  1. Instala el paquete. pip install chatterbox-tts incluye toda la familia Chatterbox, incluida la clase multilingüe; no hace falta buscar un paquete independiente.
  2. Carga explícitamente el modelo multilingüe. Importa ChatterboxMultilingualTTS desde chatterbox.mtl_tts (en lugar de la clase estándar ChatterboxTTS, utilizada para generar solo en inglés) y cárgalo con t3_model="v3" para usar la versión actual.
  3. Proporciona un clip de referencia y un ID de idioma. Pasa una muestra de audio de 5–10 segundos (o más) como referencia de voz, junto con un código de idioma de dos letras (fr, ja, ru, etc.) para el idioma de salida.
  4. Ajusta cfg_weight para generar entre idiomas. Establecer cfg_weight en 0.0 minimiza la transferencia no deseada del acento del idioma original del clip de referencia; el valor predeterminado 0.5 está optimizado para generar en el mismo idioma, no para transferir entre idiomas.
  5. Pruébalo en el navegador antes de configurar el entorno local. Resemble AI aloja un Space de Hugging Face para el modelo multilingüe, útil para validar la calidad de la voz y del idioma antes de incorporarlo a un pipeline.

Consejos para obtener mejores resultados entre idiomas

  • Haz coincidir la etiqueta de idioma del clip de referencia cuando sea posible. Si tu objetivo no es la transferencia entre idiomas, un clip de referencia en el mismo idioma que vas a generar ofrece resultados más previsibles que depender de ajustes de cfg_weight para salvar la diferencia.
  • Usa un clip limpio de 5–20 segundos. El ruido de fondo del audio de referencia se propaga a todos los idiomas que generes a partir de él, por lo que merece la pena preparar bien el clip original una sola vez en vez de solucionar artefactos idioma por idioma.
  • Elige el Single Language Pack cuando un mercado requiera precisión. Si un idioma concreto es fundamental para tu producto —y no solo uno más de los admitidos—, un ajuste fino dedicado normalmente superará al modelo multilingüe general en precisión dialectal y pronunciación regional.
  • Cuenta con cierta variación al principio. Las pruebas de la comunidad han detectado artefactos ocasionales o incoherencias en la transferencia del acento según el clip de referencia. Considera las primeras generaciones de cada idioma una fase de calibración, no el resultado final.
  • Reserva una cantidad moderada de VRAM. Pruebas reales han mostrado que la generación multilingüe funciona con soltura en torno a 4 GB de VRAM en una GPU moderna, un hardware claramente accesible para un modelo de 23 idiomas.

Chatterbox Multilingual frente al resto de la familia

Chatterbox MultilingualChatterbox (original)Chatterbox Turbo
Idiomas23Solo inglésSolo inglés
Parámetros500 millonesAproximadamente 500 millones350 millones
Transferencia de voz entre idiomasSí, función principalNo aplicableNo aplicable
Más indicado paraContenido global/localizado, agentes multilingüesNarración en inglés, expresividad creativaAgentes de voz en tiempo real sensibles a la latencia
Marca de aguaPerTh integradaPerTh integradaPerTh integrada
LicenciaMITMITMIT

Si tu producto necesita hablar más de un idioma con una sola voz clonada, Multilingual es el modelo diseñado específicamente para esa tarea; las variantes original y Turbo solo admiten inglés por diseño.

Preguntas frecuentes

¿Cuántos idiomas admite realmente Chatterbox Multilingual?

El modelo V3 de uso general admite 23 idiomas, desde lenguas muy habladas como el español, el chino y el árabe hasta otras con menor oferta, como el suajili, el malayo y el danés.

¿Puedo clonar una voz en un idioma y generar voz en otro?

Sí. Esta transferencia de voz entre idiomas es la función principal de Chatterbox Multilingual. Proporciona un clip de referencia en cualquier idioma compatible y genera el resultado en cualquier otro manteniendo la identidad vocal del hablante. Establecer cfg_weight en 0.0 produce los resultados más limpios entre idiomas.

¿Cuánto audio de referencia requiere la clonación de voz?

Bastan 5–10 segundos, aunque los clips más largos (hasta unos 20 segundos) suelen producir resultados más estables, sobre todo en la transferencia entre idiomas.

¿Qué diferencia hay entre el modelo multilingüe general y el Single Language Pack?

El modelo general (V3) cubre los 23 idiomas con un solo conjunto de pesos. El Single Language Pack ofrece ajustes finos específicos para seis idiomas prioritarios —chino mandarín, tres variantes regionales de español/portugués e hindi— destinados a casos que requieren mayor precisión dialectal que la ofrecida por el modelo general.

¿Chatterbox Multilingual se puede usar gratis en proyectos comerciales?

Sí. Como el resto de la familia Chatterbox, se publica bajo la licencia MIT, y cada clip generado incluye la marca de agua PerTh integrada de Resemble AI para acreditar su procedencia.

Prueba una función similar de clonación de voz multilingüe

Chatterbox Multilingual está disponible mediante la implementación de código abierto y la demostración oficial de Resemble AI. Si quieres explorar la clonación de voz multilingüe en el navegador, prueba Clonación de voz como una función similar. No es Chatterbox Multilingual ni ejecuta el modelo Chatterbox, pero permite probar un flujo de clonación parecido sin configurar el modelo localmente.

Clona únicamente voces que te pertenezcan o para las que tengas permiso explícito.

Explorar Clonación de voz →