FireRedTTS: un modelo fundacional creado para dos tareas muy distintas
- ¿Qué es FireRedTTS?
- Ventajas funcionales de FireRedTTS
- Cómo funciona el sistema fundacional
- Dos aplicaciones reales: doblaje y chatbots
- La familia FireRedTTS
- Primeros pasos con FireRedTTS
- Consejos para obtener mejores resultados
- FireRedTTS frente a otros sistemas TTS fundacionales de equipos chinos
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
El FireRed Team de Xiaohongshu no se propuso crear un modelo de demostración limitado: construyó un framework fundacional, con una canalización de datos explícita y dos aplicaciones posteriores concretas que lo ponen a prueba: clonar una voz para doblaje y generar una voz coloquial y humana para un chatbot. Son problemas realmente distintos —uno exige sonar como una persona concreta y el otro, como un interlocutor natural—, y FireRedTTS se creó específicamente para demostrar que el mismo sistema fundacional podía resolver bien ambos.
¿Qué es FireRedTTS?
FireRedTTS es un framework de texto a voz de código abierto y basado en modelos de lenguaje, desarrollado por el FireRed Team de Xiaohongshu y presentado en un artículo de septiembre de 2024. Se estructura en tres partes conectadas: una canalización de procesamiento de datos que transforma audio sin procesar en un conjunto de datos TTS a gran escala y con abundantes anotaciones; un sistema TTS fundacional construido con esos datos; y aplicaciones posteriores demostradas que prueban el alcance práctico del modelo fundacional. Ese planteamiento en tres partes —datos, modelo fundacional y aplicaciones— es más deliberado y orientado a la industria que el de una publicación de investigación típica dedicada a un único propósito.
Ventajas funcionales de FireRedTTS
- Un verdadero sistema fundacional, no un modelo limitado a una sola tarea. La misma arquitectura subyacente admite tanto clonación zero-shot como generación de voz conversacional ajustada mediante instrucciones.
- Aprendizaje en contexto sólido. El modelo sintetiza de forma estable voz coherente tanto con el texto del prompt como con el estilo del audio del prompt, la misma capacidad general que hace útiles a los grandes modelos de lenguaje en tareas para las que no se ajustaron expresamente.
- Ajuste fino con pocas muestras para obtener calidad de estudio, que logra personajes de voz expresivos y de calidad profesional con solo una hora de grabación del hablante objetivo.
- Construido de forma transparente sobre componentes abiertos consolidados, entre ellos un método de tokenización de texto procedente de Fish Speech, el códec de voz BigCodec, el diseño de convolución causal de Encodec, ECAPA-TDNN de SpeechBrain y un modelo HuBERT preentrenado en chino.
Cómo funciona el sistema fundacional
FireRedTTS comprime la voz en tokens semánticos discretos mediante un tokenizador de voz sensible a la semántica, y un modelo de lenguaje genera esos tokens directamente a partir del texto y el audio del prompt. Este es el mecanismo de aprendizaje en contexto que permite al modelo captar el estilo de una voz objetivo solo con la referencia. Después, un generador de forma de onda en dos etapas decodifica esos tokens semánticos y produce una forma de onda de audio de alta fidelidad. El código incluye dos configuraciones distintas de decodificador entre las que se puede elegir: un decodificador LLM acústico y otro de flow matching. Así se puede escoger un método de generación según qué combinación de velocidad, estabilidad y carácter sonoro encaje mejor en cada caso de uso.
Dos aplicaciones reales: doblaje y chatbots
Aquí es donde el planteamiento de FireRedTTS como modelo fundacional demuestra su valor práctico. Para doblaje, el modelo admite clonación de voz zero-shot apropiada para escenarios UGC (contenido generado por usuarios), de modo que puede clonar sobre la marcha una voz objetivo sin entrenamiento adicional. También permite un ajuste fino con pocas muestras y alrededor de una hora de grabación del hablante objetivo para alcanzar una calidad de voz expresiva y de estudio en proyectos PUGC (contenido profesional generado por usuarios), donde importa un acabado de producción superior. Para chatbots, FireRedTTS recurre al ajuste mediante instrucciones para producir una voz controlable, humana y de registro coloquial, incluidos comportamientos paralingüísticos y matices emocionales. Está ajustado específicamente al registro que necesita un agente conversacional hablado, no al estilo más formal que suele requerir el doblaje.
La familia FireRedTTS
La publicación original de 2024 ha seguido creciendo hasta formar un linaje más amplio. FireRedTTS-1S (2025) actualizó el sistema con generación verdaderamente en streaming y permite elegir entre un método de modelo de lenguaje multistream de menor latencia y otro de flow matching con menor factor de tiempo real, según qué métrica importe más en el despliegue. FireRedTTS-2 (2025) amplió la arquitectura específicamente hacia la generación de diálogos largos con varios hablantes para pódcasts y chatbots, añadió un tokenizador de streaming de 12.5Hz y comunicó resultados líderes del sector frente a sistemas comparables de síntesis de diálogo. FireRedTTS3 (2026) avanzó aún más hacia la generación y edición unificadas al incorporar diseño de voz controlado mediante instrucciones y la posibilidad de editar con precisión fragmentos concretos de una voz existente. Si un proyecto necesita expresamente streaming, diálogos de estilo pódcast con varios hablantes o edición de voz, probablemente uno de estos lanzamientos posteriores sea un punto de partida más adecuado que el modelo fundacional original.
Primeros pasos con FireRedTTS
- Crea un entorno conda dedicado.
conda create --name redtts python=3.10configura la versión de Python necesaria antes de instalar lo demás. - Instala una versión de PyTorch que coincida con tu versión de CUDA. El proyecto documenta comandos de instalación específicos para CUDA 11.8 y CUDA 12.1. Elegir la versión incorrecta es una causa habitual de errores en tiempo de ejecución, así que debe corresponderse con la configuración real de tus controladores.
- Instala FireRedTTS desde el código fuente. Ejecuta
cd fireredtts && pip install -e .y despuéspip install -r requirements.txtpara completar la instalación principal. - Descarga los archivos de modelo desde Model_Lists del proyecto y colócalos en
pretrained_models. - Elige el decodificador en el código. Importa
from fireredtts.fireredtts import FireRedTTSe inicializa el decodificador LLM acústico conconfig_path="configs/config_24k.json", o el decodificador de flow matching conconfig_path="configs/config_24k_flow.json". Elige según si priorizas la estabilidad de la generación o las características sonoras concretas de la salida mediante flow matching.
Consejos para obtener mejores resultados
- Usa la clonación zero-shot para doblajes rápidos de estilo UGC y el ajuste fino con pocas muestras para trabajos destinados a estudio. La ruta de ajuste fino con alrededor de una hora de grabación está documentada expresamente para alcanzar una voz expresiva de calidad profesional; no esperes que el método zero-shot por sí solo iguale ese acabado en contenido prémium.
- Aprovecha el ajuste mediante instrucciones para obtener una salida de estilo chatbot. Si el objetivo es la voz de un agente conversacional y no una narración o un doblaje, la capacidad de producir un registro coloquial y tener en cuenta elementos paralingüísticos es precisamente lo que FireRedTTS ajustó para ese caso.
- Elige el decodificador de forma deliberada, no por defecto. Prueba tanto el decodificador LLM acústico como el de flow matching con tu contenido real, ya que el proyecto incluye ambos precisamente porque representan compromisos diferentes, no porque uno sea estrictamente superior al otro.
FireRedTTS frente a otros sistemas TTS fundacionales de equipos chinos
| FireRedTTS | IndexTTS | CosyVoice | |
|---|---|---|---|
| Organización responsable | Xiaohongshu (FireRed Team) | Bilibili | Alibaba (FunAudioLLM) |
| Arquitectura principal | Tokenizador semántico + LM + decodificador de forma de onda en dos etapas | Basada en XTTS/Tortoise, estilo GPT | Tokens semánticos supervisados + flow matching |
| Aplicaciones demostradas | Doblaje (zero-shot + pocas muestras) y voz para chatbots | Clonación zero-shot general, precisión de pronunciación en chino | Clonación multilingüe zero-shot |
| Ajuste fino para calidad de estudio | Sí, ~1 hora de datos | No es el objetivo principal | No es el objetivo principal |
| Licencia / restricciones de uso | Se indica expresamente que es para investigación académica | Los pesos requieren autorización para uso comercial | Abierto, con API alojada disponible |
El nicho concreto de FireRedTTS consiste en haber sido validado de forma explícita en dos trabajos posteriores realmente distintos con un mismo sistema fundacional. La mayoría de los lanzamientos TTS comparables de equipos chinos destacan un único caso de uso principal, mientras que el artículo de FireRedTTS presenta el doblaje y la voz para chatbots como pruebas de igual importancia.
Preguntas frecuentes
¿Qué diferencia hay entre FireRedTTS y versiones posteriores como FireRedTTS-2?
El FireRedTTS original es el sistema fundacional y se demostró para doblaje y voz de chatbots. FireRedTTS-2 se dirige específicamente a generar diálogos largos con varios hablantes para pódcasts, mientras que FireRedTTS3 incorpora generación unificada y edición de voz. Antes de partir del modelo original, comprueba qué versión coincide con tu caso de uso real.
¿Puede FireRedTTS clonar una voz sin entrenamiento adicional?
Sí, mediante clonación zero-shot adecuada para situaciones de doblaje rápido de estilo UGC. Para obtener una calidad expresiva superior y de estudio, el proyecto también documenta un método de ajuste fino con pocas muestras que utiliza alrededor de una hora de grabación del hablante objetivo.
¿FireRedTTS es gratuito para uso comercial?
Su función de clonación de voz zero-shot está destinada exclusivamente a la investigación académica y prohíbe expresamente los usos ilícitos. Consulta directamente los términos vigentes de licencia y uso antes de cualquier despliegue comercial.
¿Qué decodificador debo usar, el LLM acústico o el de flow matching?
Se proporcionan ambos porque representan compromisos diferentes, no porque uno sea estrictamente mejor. Pruébalos con tu contenido concreto para averiguar cuál encaja con tus prioridades de estabilidad de generación y carácter sonoro de la salida.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.