EchoraEchora
Volver a los modelos

MeloTTS: el modelo que no tropieza cuando una frase cambia de idioma

3 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Di una frase en chino fluido con el nombre de una marca en inglés en medio y la mayoría de los modelos TTS pronunciarán mal la palabra inglesa o impondrán una pausa incómoda a su alrededor. MeloTTS, desarrollado conjuntamente por el MIT y MyShell.ai, se creó específicamente para afrontar justo esa situación: su modelo de voz china lee con naturalidad texto mixto en chino e inglés y cambia de pronunciación en plena frase como lo haría una persona realmente bilingüe, sin tratarlo como un caso límite que haya que esquivar.

¿Qué es MeloTTS?

MeloTTS es una biblioteca multilingüe de texto a voz, de código abierto y bajo licencia MIT, construida sobre las arquitecturas VITS y VITS2. Incorpora características lingüísticas basadas en BERT para captar con mayor naturalidad la prosodia y el fraseo. Cubre inglés, español, francés, chino, japonés y coreano y, algo especialmente notable para un proyecto de este tamaño, incluye cinco variantes distintas de acento inglés: estadounidense, británico, indio, australiano y uno general predeterminado, todas dentro del mismo proyecto subyacente y sin exigir modelos separados para cada acento.

Conviene entender la extracción de características lingüísticas basada en BERT como algo más que una nota técnica: en vez de depender únicamente de un fonemizador basado en reglas para convertir el texto en unidades de pronunciación, MeloTTS obtiene comprensión lingüística contextual de un modelo de estilo BERT. Esto explica en parte por qué su prosodia y su fraseo suelen sonar más naturales que los de los sistemas TTS que solo emplean una conversión más sencilla de grafemas a fonemas.

Cambio nativo entre chino e inglés

Esta es la capacidad más distintiva de MeloTTS y resuelve un problema muy común y realmente molesto. El contenido bilingüe o con mezcla de códigos —una frase en chino que menciona un producto, un término técnico o una cita en inglés— hace tropezar a la mayoría de los sistemas TTS. Por lo general, estos esperan que la entrada esté siempre en un único idioma y pronuncian mal el fragmento extranjero o te obligan a dividirlo en varias generaciones. El modelo de hablante chino de MeloTTS procesa directamente texto mixto en chino e inglés y cambia de pronunciación con naturalidad dentro de una misma frase y una única generación, sin que tengas que etiquetar manualmente los idiomas ni dividir el texto.

Rendimiento en tiempo real en CPU

Al igual que un par de modelos ligeros que merece la pena conocer si has comparado opciones en este ámbito, MeloTTS está diseñado para funcionar cómodamente solo con CPU. La propia documentación del proyecto indica de forma explícita que una CPU basta para la inferencia en tiempo real, mientras que la compatibilidad con GPU (cuda, cuda:0 o mps en Apple Silicon) es un acelerador opcional, no un requisito. Esto lo convierte en una alternativa real para los equipos que quieren cobertura multilingüe sin desplegar infraestructura de GPU. No obstante, conviene señalar que MeloTTS prioriza una cobertura más amplia de idiomas y acentos frente al tamaño absolutamente mínimo de un modelo como Piper, que sacrifica amplitud multilingüe para ser extremadamente ligero en hardware periférico con recursos limitados.

Primeros pasos con MeloTTS

  1. Clona el repositorio e instala las dependencias. Haz git clone del proyecto myshell-ai/MeloTTS desde GitHub y sigue los pasos de instalación documentados antes de ejecutar cualquier código de inferencia.
  2. Usa la sencilla API de Python para una generación básica. Ejecuta from melo.api import TTS y crea después una instancia con un código de idioma (EN, ES, FR, ZH, JP, KR o la variante más reciente EN_NEWEST) y un dispositivo (cpu, cuda, cuda:0, mps o auto para que lo elija automáticamente).
  3. Selecciona el acento inglés concreto si corresponde. Como MeloTTS ofrece variantes diferenciadas de inglés estadounidense, británico, indio y australiano, elige la que coincida con tu público objetivo en lugar de usar por defecto el modelo general de inglés.
  4. Ajusta el parámetro de velocidad a tu contenido. La velocidad de generación se puede modificar directamente en la llamada a la API, algo útil para hacer coincidir el ritmo de una narración con los tiempos de un vídeo o con tus preferencias sin necesitar un paso posterior de procesamiento.
  5. Usa la WebUI o la CLI aportadas por la comunidad para probar más rápido. Ambas fueron añadidas por una persona de la comunidad sobre la biblioteca central y permiten probar voces e idiomas sin escribir un script de Python para cada experimento.
  6. Busca variantes regionales y ampliadas por la comunidad si tu idioma no cuenta con soporte nativo. Los forks de la comunidad —una variante específica para vietnamita es un ejemplo— han extendido el enfoque de MeloTTS a idiomas con rasgos fonológicos, como los seis tonos del vietnamita, para los que el fonemizador original no fue diseñado.

Consejos para obtener mejores resultados

  • Aprovecha deliberadamente la capacidad multilingüe. Si tu contenido incluye de forma natural expresiones bilingües —nombres de productos, términos técnicos o citas en otro idioma—, introducirlo como una sola frase con idiomas mezclados, en vez de separarlo en llamadas por idioma, es exactamente el flujo para el que se creó el modelo chino de MeloTTS.
  • Elige desde el principio el acento inglés adecuado para tu público. Escoger inglés británico para un proyecto dirigido al Reino Unido o inglés indio para ese mercado encaja mucho mejor que usar el modelo general con tendencia estadounidense y esperar que suene neutral.
  • Prueba la inferencia en CPU en el hardware de destino antes de asumir que necesitas una GPU. Dado que el proyecto está diseñado explícitamente para trabajar en tiempo real en CPU, merece la pena comprobar el rendimiento en la máquina prevista para el despliegue antes de aprovisionar unos recursos de GPU que quizá no necesites.
  • Consulta primero los forks de la comunidad si necesitas un idioma fuera de los seis principales. En lugar de forzar un idioma no compatible a través del fonemizador predeterminado de MeloTTS, busca una extensión comunitaria existente: hay varias precisamente porque el procesamiento de texto predeterminado no gestiona correctamente de fábrica la fonología de todos los idiomas.
  • Usa la variante más reciente EN_NEWEST para contenido en inglés si la calidad es prioritaria. Las versiones iterativas específicas para inglés (v2, v3) sugieren que ese idioma sigue recibiendo mejoras; merece la pena compararlas con el modelo EN original en lugar de asumir que son intercambiables.

MeloTTS frente a otros modelos multilingües aptos para CPU

MeloTTSPiperKokoro-82M
Organización responsableMIT + MyShell.aiRhasspy / Open Home FoundationIndependiente (hexgrad)
Idiomas principales6 (más 5 variantes de acento inglés)35+8
ArquitecturaVITS/VITS2 + características lingüísticas BERTVITS + ONNX + espeak-ngStyleTTS 2 + ISTFTNet
Mezcla de idiomas (cambio de código)Sí, nativa en el modelo chinoNo es una función específicaNo es una función específica
Tiempo real en CPUSíSí, incluido Raspberry PiSí
Clonación de vozNo, catálogo fijo de vocesNo, catálogo fijo de vocesNo, catálogo fijo de voces
LicenciaMITMIT (original) / GPL-3.0 (fork actual)Apache 2.0

El nicho específico de MeloTTS entre las opciones TTS aptas para CPU y sin clonación es la profundidad frente a la amplitud en una dirección concreta: menos idiomas totales que Piper, pero una sofisticación lingüística real —prosodia basada en BERT y cambio de código nativo— en los idiomas que sí admite, especialmente para contenido bilingüe en chino e inglés.

Preguntas frecuentes

¿Quién desarrolló MeloTTS?

MeloTTS fue desarrollado conjuntamente por el MIT y MyShell.ai. El proyecto se publicó por primera vez en 2023 y desde entonces se mantiene activamente en GitHub y Hugging Face.

¿Qué hace que MeloTTS sea especialmente bueno para contenido en chino e inglés?

Su modelo de hablante chino procesa de forma nativa texto mixto en chino e inglés y cambia correctamente de pronunciación dentro de una misma frase y generación, algo que la mayoría de los sistemas TTS no puede hacer sin dividir manualmente los idiomas.

¿Necesita MeloTTS una GPU?

No. Está diseñado explícitamente para inferencia en tiempo real en CPU, con GPU como acelerador opcional y no como requisito.

¿Puede MeloTTS clonar la voz de una persona concreta?

No. Utiliza un conjunto fijo de voces de hablantes por idioma y acento, en lugar de clonación de voz zero-shot a partir de un clip de referencia.

¿MeloTTS es gratuito para uso comercial?

Sí. Se publica bajo la licencia MIT, que permite tanto el uso comercial como el no comercial sin regalías.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →