EchoraEchora
Volver a los modelos

FireRedTTS: un modelo fundacional creado para dos tareas muy distintas

12 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

El FireRed Team de Xiaohongshu no se propuso crear un modelo de demostración limitado: construyó un framework fundacional, con una canalización de datos explícita y dos aplicaciones posteriores concretas que lo ponen a prueba: clonar una voz para doblaje y generar una voz coloquial y humana para un chatbot. Son problemas realmente distintos —uno exige sonar como una persona concreta y el otro, como un interlocutor natural—, y FireRedTTS se creó específicamente para demostrar que el mismo sistema fundacional podía resolver bien ambos.

¿Qué es FireRedTTS?

FireRedTTS es un framework de texto a voz de código abierto y basado en modelos de lenguaje, desarrollado por el FireRed Team de Xiaohongshu y presentado en un artículo de septiembre de 2024. Se estructura en tres partes conectadas: una canalización de procesamiento de datos que transforma audio sin procesar en un conjunto de datos TTS a gran escala y con abundantes anotaciones; un sistema TTS fundacional construido con esos datos; y aplicaciones posteriores demostradas que prueban el alcance práctico del modelo fundacional. Ese planteamiento en tres partes —datos, modelo fundacional y aplicaciones— es más deliberado y orientado a la industria que el de una publicación de investigación típica dedicada a un único propósito.

Ventajas funcionales de FireRedTTS

  • Un verdadero sistema fundacional, no un modelo limitado a una sola tarea. La misma arquitectura subyacente admite tanto clonación zero-shot como generación de voz conversacional ajustada mediante instrucciones.
  • Aprendizaje en contexto sólido. El modelo sintetiza de forma estable voz coherente tanto con el texto del prompt como con el estilo del audio del prompt, la misma capacidad general que hace útiles a los grandes modelos de lenguaje en tareas para las que no se ajustaron expresamente.
  • Ajuste fino con pocas muestras para obtener calidad de estudio, que logra personajes de voz expresivos y de calidad profesional con solo una hora de grabación del hablante objetivo.
  • Construido de forma transparente sobre componentes abiertos consolidados, entre ellos un método de tokenización de texto procedente de Fish Speech, el códec de voz BigCodec, el diseño de convolución causal de Encodec, ECAPA-TDNN de SpeechBrain y un modelo HuBERT preentrenado en chino.

Cómo funciona el sistema fundacional

FireRedTTS comprime la voz en tokens semánticos discretos mediante un tokenizador de voz sensible a la semántica, y un modelo de lenguaje genera esos tokens directamente a partir del texto y el audio del prompt. Este es el mecanismo de aprendizaje en contexto que permite al modelo captar el estilo de una voz objetivo solo con la referencia. Después, un generador de forma de onda en dos etapas decodifica esos tokens semánticos y produce una forma de onda de audio de alta fidelidad. El código incluye dos configuraciones distintas de decodificador entre las que se puede elegir: un decodificador LLM acústico y otro de flow matching. Así se puede escoger un método de generación según qué combinación de velocidad, estabilidad y carácter sonoro encaje mejor en cada caso de uso.

Dos aplicaciones reales: doblaje y chatbots

Aquí es donde el planteamiento de FireRedTTS como modelo fundacional demuestra su valor práctico. Para doblaje, el modelo admite clonación de voz zero-shot apropiada para escenarios UGC (contenido generado por usuarios), de modo que puede clonar sobre la marcha una voz objetivo sin entrenamiento adicional. También permite un ajuste fino con pocas muestras y alrededor de una hora de grabación del hablante objetivo para alcanzar una calidad de voz expresiva y de estudio en proyectos PUGC (contenido profesional generado por usuarios), donde importa un acabado de producción superior. Para chatbots, FireRedTTS recurre al ajuste mediante instrucciones para producir una voz controlable, humana y de registro coloquial, incluidos comportamientos paralingüísticos y matices emocionales. Está ajustado específicamente al registro que necesita un agente conversacional hablado, no al estilo más formal que suele requerir el doblaje.

La familia FireRedTTS

La publicación original de 2024 ha seguido creciendo hasta formar un linaje más amplio. FireRedTTS-1S (2025) actualizó el sistema con generación verdaderamente en streaming y permite elegir entre un método de modelo de lenguaje multistream de menor latencia y otro de flow matching con menor factor de tiempo real, según qué métrica importe más en el despliegue. FireRedTTS-2 (2025) amplió la arquitectura específicamente hacia la generación de diálogos largos con varios hablantes para pódcasts y chatbots, añadió un tokenizador de streaming de 12.5Hz y comunicó resultados líderes del sector frente a sistemas comparables de síntesis de diálogo. FireRedTTS3 (2026) avanzó aún más hacia la generación y edición unificadas al incorporar diseño de voz controlado mediante instrucciones y la posibilidad de editar con precisión fragmentos concretos de una voz existente. Si un proyecto necesita expresamente streaming, diálogos de estilo pódcast con varios hablantes o edición de voz, probablemente uno de estos lanzamientos posteriores sea un punto de partida más adecuado que el modelo fundacional original.

Primeros pasos con FireRedTTS

  1. Crea un entorno conda dedicado. conda create --name redtts python=3.10 configura la versión de Python necesaria antes de instalar lo demás.
  2. Instala una versión de PyTorch que coincida con tu versión de CUDA. El proyecto documenta comandos de instalación específicos para CUDA 11.8 y CUDA 12.1. Elegir la versión incorrecta es una causa habitual de errores en tiempo de ejecución, así que debe corresponderse con la configuración real de tus controladores.
  3. Instala FireRedTTS desde el código fuente. Ejecuta cd fireredtts && pip install -e . y después pip install -r requirements.txt para completar la instalación principal.
  4. Descarga los archivos de modelo desde Model_Lists del proyecto y colócalos en pretrained_models.
  5. Elige el decodificador en el código. Importa from fireredtts.fireredtts import FireRedTTS e inicializa el decodificador LLM acústico con config_path="configs/config_24k.json", o el decodificador de flow matching con config_path="configs/config_24k_flow.json". Elige según si priorizas la estabilidad de la generación o las características sonoras concretas de la salida mediante flow matching.

Consejos para obtener mejores resultados

  • Usa la clonación zero-shot para doblajes rápidos de estilo UGC y el ajuste fino con pocas muestras para trabajos destinados a estudio. La ruta de ajuste fino con alrededor de una hora de grabación está documentada expresamente para alcanzar una voz expresiva de calidad profesional; no esperes que el método zero-shot por sí solo iguale ese acabado en contenido prémium.
  • Aprovecha el ajuste mediante instrucciones para obtener una salida de estilo chatbot. Si el objetivo es la voz de un agente conversacional y no una narración o un doblaje, la capacidad de producir un registro coloquial y tener en cuenta elementos paralingüísticos es precisamente lo que FireRedTTS ajustó para ese caso.
  • Elige el decodificador de forma deliberada, no por defecto. Prueba tanto el decodificador LLM acústico como el de flow matching con tu contenido real, ya que el proyecto incluye ambos precisamente porque representan compromisos diferentes, no porque uno sea estrictamente superior al otro.

FireRedTTS frente a otros sistemas TTS fundacionales de equipos chinos

FireRedTTSIndexTTSCosyVoice
Organización responsableXiaohongshu (FireRed Team)BilibiliAlibaba (FunAudioLLM)
Arquitectura principalTokenizador semántico + LM + decodificador de forma de onda en dos etapasBasada en XTTS/Tortoise, estilo GPTTokens semánticos supervisados + flow matching
Aplicaciones demostradasDoblaje (zero-shot + pocas muestras) y voz para chatbotsClonación zero-shot general, precisión de pronunciación en chinoClonación multilingüe zero-shot
Ajuste fino para calidad de estudioSí, ~1 hora de datosNo es el objetivo principalNo es el objetivo principal
Licencia / restricciones de usoSe indica expresamente que es para investigación académicaLos pesos requieren autorización para uso comercialAbierto, con API alojada disponible

El nicho concreto de FireRedTTS consiste en haber sido validado de forma explícita en dos trabajos posteriores realmente distintos con un mismo sistema fundacional. La mayoría de los lanzamientos TTS comparables de equipos chinos destacan un único caso de uso principal, mientras que el artículo de FireRedTTS presenta el doblaje y la voz para chatbots como pruebas de igual importancia.

Preguntas frecuentes

¿Qué diferencia hay entre FireRedTTS y versiones posteriores como FireRedTTS-2?

El FireRedTTS original es el sistema fundacional y se demostró para doblaje y voz de chatbots. FireRedTTS-2 se dirige específicamente a generar diálogos largos con varios hablantes para pódcasts, mientras que FireRedTTS3 incorpora generación unificada y edición de voz. Antes de partir del modelo original, comprueba qué versión coincide con tu caso de uso real.

¿Puede FireRedTTS clonar una voz sin entrenamiento adicional?

Sí, mediante clonación zero-shot adecuada para situaciones de doblaje rápido de estilo UGC. Para obtener una calidad expresiva superior y de estudio, el proyecto también documenta un método de ajuste fino con pocas muestras que utiliza alrededor de una hora de grabación del hablante objetivo.

¿FireRedTTS es gratuito para uso comercial?

Su función de clonación de voz zero-shot está destinada exclusivamente a la investigación académica y prohíbe expresamente los usos ilícitos. Consulta directamente los términos vigentes de licencia y uso antes de cualquier despliegue comercial.

¿Qué decodificador debo usar, el LLM acústico o el de flow matching?

Se proporcionan ambos porque representan compromisos diferentes, no porque uno sea estrictamente mejor. Pruébalos con tu contenido concreto para averiguar cuál encaja con tus prioridades de estabilidad de generación y carácter sonoro de la salida.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →