ChatTTS: creado para conversar, no para leer en voz alta
- ¿Qué es ChatTTS?
- Control prosódico detallado: risas, pausas e interjecciones
- Generación multihablante mediante muestreo gaussiano
- Una nota sincera sobre lo que está realmente disponible
- Primeros pasos con ChatTTS
- Consejos para obtener mejores resultados
- ChatTTS frente a otros modelos expresivos y bilingües
- Preguntas frecuentes
- Convierte un guion con varios hablantes en audio
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
La mayoría de los modelos TTS están optimizados para leer un pasaje de texto de forma clara y agradable, justo el objetivo equivocado para un chatbot o asistente de voz que debe sonar como si realmente estuviera hablando contigo. Una conversación real está llena de pequeñas pausas, alguna risa ocasional y un «eh» que no aparece en el guion. ChatTTS, desarrollado por el equipo de 2noise, se creó específicamente en torno a esa diferencia: no se optimizó para la narración, sino para la textura más desordenada y natural de un diálogo real.
¿Qué es ChatTTS?
ChatTTS es un modelo generativo de voz con 300 millones de parámetros, diseñado expresamente para situaciones conversacionales —diálogos de asistentes LLM, voces de chatbots y aplicaciones de voz interactivas— y no para narración general o lectura al estilo de un audiolibro. Admite chino e inglés, y el modelo completo se entrenó con más de 100.000 horas de datos conversacionales bilingües, con el objetivo específico de capturar cómo suena la gente cuando habla de verdad, no solo cómo suena un texto cuando se lee.
Control prosódico detallado: risas, pausas e interjecciones
Esta es la capacidad que define a ChatTTS, y está integrada en el proceso de generación central del modelo en vez de añadirse como efecto de posprocesamiento. El modelo puede predecir y controlar directamente rasgos prosódicos detallados —risas, pausas naturales e interjecciones conversacionales— como parte de la propia generación de voz, sin obligarte a insertar manualmente etiquetas de efectos sonoros como ocurre con otros modelos expresivos. Según las comparaciones del propio proyecto, el resultado es una prosodia que supera a la mayoría de las alternativas TTS de código abierto precisamente por lo natural y conversacional que se percibe la salida, no por la claridad con la que lee.
Generación multihablante mediante muestreo gaussiano
ChatTTS admite varios hablantes para conversaciones multiparticipante verdaderamente interactivas, algo útil en situaciones como diálogos simulados o interacciones con asistentes de varios personajes. Conviene entender su enfoque para variar los hablantes: en lugar de exigir un clip de audio de referencia para cada voz, puede muestrear hablantes directamente de una distribución gaussiana dentro del propio proceso de inferencia del modelo. Así ofrece una forma sencilla de generar distintas voces sin necesitar una biblioteca de clips de referencia pregrabados para cada una.
Una nota sincera sobre lo que está realmente disponible
Antes de crear algo sobre ChatTTS conviene conocer dos detalles, ya que determinan lo que puedes esperar de forma realista de una instalación autoalojada.
El checkpoint de código abierto no es el modelo completo. La versión interna de ChatTTS con mejor rendimiento se entrenó con el conjunto completo de más de 100.000 horas de datos y después se sometió a ajuste fino supervisado (SFT). La versión publicada en Hugging Face es un checkpoint preentrenado con 40.000 horas y sin ese paso de SFT: un modelo base realmente capaz, pero no la misma versión que respalda las comparaciones de demostración más pulidas del proyecto.
El código y los pesos tienen licencias distintas. El código de ChatTTS se publica bajo AGPLv3+, mientras que los pesos del modelo se distribuyen con una licencia CC BY-NC 4.0, lo que restringe los pesos preentrenados a usos no comerciales. Si tus planes incluyen un despliegue comercial, conviene revisar este punto detenidamente antes de crear un producto basado en el checkpoint público.
Primeros pasos con ChatTTS
- Clona el repositorio.
git clone https://github.com/2noise/ChatTTS.gitdescarga el código y las instrucciones de configuración; también está documentada la instalación mediantepip install chattts-fork, aunque la primera instalación descarga cerca de un gigabyte de contenido. - Carga el modelo y ejecuta una generación básica. Unas pocas líneas de Python —
import ChatTTS,chat = ChatTTS.Chat(),chat.load_models()— bastan para obtener tu primer clip generado; definircompile=Trueal cargar el modelo mejora el rendimiento de la inferencia a cambio de una carga inicial más larga. - Presta mucha atención a las reglas de puntuación. La entrada de texto de ChatTTS espera específicamente comas y puntos ingleses como signos de puntuación; otros signos se consideran entradas no válidas. Es una causa habitual de fallos inesperados para quienes empiezan a migrar textos que usan otras convenciones de puntuación.
- Muestrea hablantes de la distribución gaussiana para obtener variedad. En lugar de buscar clips de referencia para cada voz que quieras, utiliza el muestreo de hablantes integrado en el modelo para generar directamente una gama de voces distintas.
- Prueba con hardware modesto antes de dar por hecho que necesitas una GPU potente. Un benchmark de la comunidad realizado en el mini-PC LattePanda Sigma registró la generación de un clip de 22 segundos en unos 39 segundos: una proporción de procesamiento aproximada de 1:2 que se ha descrito como comparable al rendimiento de una máquina equipada con una RTX 4090. Esto sugiere que el modelo tolera mejor el hardware limitado de lo que podría indicar su número de parámetros.
- Comprueba las condiciones de licencia vigentes antes de usarlo con fines comerciales. Dada la combinación de licencias AGPLv3+/CC BY-NC 4.0, confirma que tu caso de uso concreto está cubierto, sobre todo si los pesos preentrenados forman parte de un producto de pago.
Consejos para obtener mejores resultados
- Diseña el texto específicamente para una conversación, no para una narración. ChatTTS está ajustado para contenido dialogado; alimentarlo con una prosa rígida y de estructura formal no mostrará aquello para lo que realmente se creó. Una redacción conversacional con pausas naturales sacará más partido de su modelado prosódico.
- Limpia la puntuación antes de generar. Dadas las estrictas expectativas del modelo sobre comas y puntos ingleses, pasar rápidamente el texto de entrada por un proceso de limpieza que elimine la puntuación no admitida evita un fallo habitual y fácil de prevenir.
- Utiliza el muestreo gaussiano de hablantes para crear rápidamente prototipos con varias voces. Es una forma más rápida de probar situaciones de diálogo multihablante que buscar y preparar de antemano clips de referencia para cada personaje.
- Ajusta tus expectativas a la capacidad del checkpoint público. Como el modelo publicado es la versión previa al SFT entrenada con 40.000 horas, y no el modelo completo ajustado con más de 100.000 horas, calibra tus expectativas de calidad en consecuencia en vez de suponer que obtendrás exactamente el modelo mostrado en los mejores clips de demostración del proyecto.
- Reserva un tiempo de generación realista para hardware limitado. El benchmark de LattePanda Sigma es un dato útil si estás valorando un despliegue en el edge o en un mini-PC: planifica un procesamiento de aproximadamente 2 veces la duración en tiempo real en vez de asumir una generación instantánea en hardware que no sea de categoría GPU.
ChatTTS frente a otros modelos expresivos y bilingües
| ChatTTS | Bark | CosyVoice3 | |
|---|---|---|---|
| Objetivo principal de diseño | Diálogo conversacional, chatbots/asistentes | Texto a audio generativo (voz, música, efectos) | Clonación multilingüe con dialectos |
| Idiomas | Chino, inglés | 13+ | 9 + 18 dialectos chinos |
| Sonidos no verbales | Predicción nativa (risas, pausas, interjecciones) | Etiquetas entre corchetes ([laughter], [sighs]) | No es una función específica |
| Varios hablantes | Sí, mediante muestreo gaussiano | Voces predefinidas | Clonación zero-shot |
| Parámetros | 300M | No se ha revelado oficialmente a esta escala | 0.5B |
| Licencia de los pesos | CC BY-NC 4.0 (no comercial) | MIT | Abiertos, API alojada disponible |
El nicho específico de ChatTTS es un diseño que prioriza el diálogo en exactamente dos idiomas: en lugar de perseguir una cobertura multilingüe amplia o el máximo rango expresivo, se concentra en lograr que la voz conversacional en chino e inglés suene como una conversación real. Para quien crea la voz de un asistente o chatbot, este es un punto de comparación más relevante que el mero número de idiomas.
Preguntas frecuentes
¿Qué diferencia a ChatTTS de un modelo TTS de uso general?
Está optimizado específicamente para voz conversacional y dialogada, no para narración: predice directamente pausas naturales, risas e interjecciones como parte de la generación, un ajuste orientado a casos de uso de chatbots y asistentes en vez de a leer un texto en voz alta con claridad.
¿El modelo ChatTTS disponible públicamente es la versión completa?
No exactamente. El modelo interno completo se entrenó con más de 100.000 horas de datos y se sometió a ajuste fino supervisado. El checkpoint publicado en Hugging Face es una versión preentrenada con 40.000 horas sin ese paso de ajuste fino.
¿ChatTTS es gratuito para uso comercial?
El código está bajo AGPLv3+, pero los pesos del modelo se publican con una licencia CC BY-NC 4.0 que restringe su uso comercial. Revisa detenidamente las condiciones vigentes antes de cualquier despliegue comercial.
¿Por qué ChatTTS rechaza algunos signos de puntuación de mi texto de entrada?
El procesamiento de texto del modelo espera específicamente comas y puntos ingleses; otros signos de puntuación se consideran entradas no válidas, por lo que limpiar previamente el texto evita fallos de generación habituales.
¿ChatTTS admite clonación de voz?
No del modo en que lo hacen los modelos dedicados a la clonación. Admite generación multihablante mediante el muestreo gaussiano de características de hablantes, en lugar de reproducir una voz de referencia específica a partir de un clip de audio.
Convierte un guion con varios hablantes en audio
Si ya tienes un guion terminado con varios hablantes, utiliza Texto a diálogo de Echora. Añade hasta 12 bloques de diálogo y 5.000 caracteres en total, asigna una voz a cada bloque, incorpora etiquetas de interpretación compatibles y ajusta la estabilidad o el refuerzo del hablante. Después podrás escuchar y descargar la conversación completa.