EchoraEchora
Volver a los modelos

F5-TTS: entra texto, sale voz, sin mecanismos adicionales

29 de agosto de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de los procesos de clonación de voz incorporan más componentes de los necesarios: un predictor de duración para estimar cuánto debe durar la salida, un alineador de fonemas para asociar el texto con el sonido y un codificador de texto específico entrenado por separado del resto del sistema. F5-TTS elimina todo eso. Rellena el texto de entrada hasta que coincide con la duración del habla objetivo y deja el resto en manos de un Diffusion Transformer. El resultado es un proceso realmente más sencillo que, además, es rápido: en las pruebas de los propios investigadores, F5-TTS alcanzó un factor de tiempo real (RTF) de solo 0,15.

¿Qué es F5-TTS?

F5-TTS es un sistema de texto a voz totalmente no autorregresivo basado en flow matching y con un Diffusion Transformer (DiT) como arquitectura principal. Fue desarrollado por investigadores de la Universidad Jiao Tong de Shanghái, la Universidad de Cambridge y el Instituto de Investigación de Geely Automobile, y se publicó como código abierto con el nombre SWivid/F5-TTS. En lugar de predecir la voz token a token como los modelos autorregresivos, F5-TTS trata la generación como un proceso de eliminación de ruido: parte de ruido y utiliza el DiT para transformarlo de forma iterativa en un espectrograma mel condicionado por el texto de entrada y una voz de referencia.

Cómo funciona: por qué F5-TTS es rápido

Tokens de relleno en lugar de modelado de duración. En vez de predecir cuánto debe durar cada palabra, F5-TTS simplemente añade tokens de relleno al texto de entrada hasta que su longitud coincide con la del habla objetivo y deja que el proceso de flow matching resuelva la alineación durante la eliminación de ruido. Así elimina un componente completo —el modelo de duración— que la mayoría de las arquitecturas TTS considera esencial.

ConvNeXt V2 para representar el texto. Este es uno de los principales perfeccionamientos de F5-TTS respecto a su predecesor directo. Los primeros métodos de flow matching tenían dificultades para alinear de forma fiable el texto y la voz, lo que provocaba palabras omitidas o frases repetidas. F5-TTS procesa primero el texto con ConvNeXt V2 y produce una representación que el Diffusion Transformer puede alinear mucho más fácilmente con el audio correspondiente.

Sway Sampling. Es una estrategia de inferencia que ajusta cómo se muestrean los pasos de flujo durante la generación, mejorando tanto la calidad de salida como la velocidad de inferencia sin necesidad de volver a entrenar. Cabe destacar que la técnica no es exclusiva de la arquitectura concreta de F5-TTS: se puede generalizar a otros modelos condicionales de flow matching como una mejora de inferencia que se incorpora directamente.

El efecto combinado de estas decisiones es un proceso realmente ligero: sin modelo de duración, sin alineador de fonemas, sin codificador de texto entrenado por separado y con un factor de tiempo real (RTF) publicado de 0,15. Esto significa que genera audio unas 6–7 veces más rápido que el tiempo real, a la altura de sistemas TTS de producción muy optimizados.

La relación con E2 TTS

F5-TTS no inventó desde cero el método de «rellenar el texto y después eliminar el ruido»: se basa directamente en E2 TTS, un modelo anterior que demostró por primera vez que esta estrategia mínima y sin alineador podía funcionar. E2 TTS probó que el concepto era viable, pero sufría una convergencia lenta durante el entrenamiento y problemas de robustez en la alineación que dificultaban un despliegue fiable. F5-TTS se creó específicamente para corregir esos problemas, utilizando ConvNeXt V2 y Sway Sampling para resolver precisamente los fallos expuestos por E2 TTS. De hecho, el repositorio oficial de F5-TTS incluye un checkpoint E2TTS_Base junto a los modelos F5 para que los investigadores puedan reproducir y comparar directamente ambas arquitecturas, en lugar de depender únicamente de las cifras publicadas en el artículo original.

Clonación de voz zero-shot y entre idiomas

La clonación de voz con F5-TTS funciona a partir de un clip de referencia corto —se suele citar un intervalo de 5 a 15 segundos, aunque algunas configuraciones funcionan con apenas 6 segundos—, sin necesidad de realizar un ajuste fino para obtener un resultado útil. También admite la clonación entre idiomas: se puede proporcionar un clip de referencia en inglés y generar una salida en español —u otro idioma compatible— con esa misma voz clonada; la documentación oficial del modelo destaca expresamente esta capacidad.

Para los equipos que necesitan más consistencia de la que ofrece el zero-shot, F5-TTS también admite ajuste fino y su ciclo de entrenamiento es relativamente sencillo: no requiere una etapa de preprocesamiento del códec ni un proceso de varias etapas que gestionar, solo audio preparado y transcripciones alineadas. Esta sencillez relativa contribuye a que sea un punto de partida habitual para equipos que experimentan con el entrenamiento de voces personalizadas en una sola GPU de consumo, en lugar de utilizar un clúster de entrenamiento completo.

Primeros pasos con F5-TTS

  1. Clona el repositorio. Ejecuta git clone https://github.com/SWivid/F5-TTS.git, después cd F5-TTS y pip install -e .; añade el paso opcional para obtener los submódulos de forma recursiva solo si piensas utilizar BigVGAN como vocoder.
  2. Instala la versión de PyTorch correspondiente a tu versión de CUDA. La documentación del proyecto especifica las versiones exactas de PyTorch y torchaudio para cada versión de CUDA. Respetar estas correspondencias evita la mayoría de los problemas de instalación.
  3. Ejecuta la inferencia mediante la CLI. f5-tts_infer-cli --model F5TTS_v1_Base --ref_audio "your_clip.wav" --ref_text "transcript of the clip" --gen_text "the text you want spoken" genera un clip directamente. Si dejas --ref_text vacío, un modelo ASR transcribirá automáticamente la referencia, a costa de utilizar más memoria de la GPU.
  4. Usa la WebUI de Gradio para realizar pruebas rápidas. f5-tts_infer-gradio —o el comando equivalente de Docker— abre una interfaz en el navegador para probar la clonación antes de integrarla en un proceso.
  5. Comprueba que tu VRAM cumpla las especificaciones recomendadas. F5-TTS funciona en cualquier GPU NVIDIA con unos 16GB de VRAM; 24GB —tarjetas de la clase RTX 3090/4090— ofrecen un margen cómodo. Confirma que tu hardware sea adecuado antes de planificar un despliegue en producción.
  6. Utiliza la vía TensorRT-LLM/Triton para servir a escala de producción. El proyecto documenta una ruta de despliegue con Triton y TensorRT-LLM que permite una decodificación considerablemente más rápida al atender muchas solicitudes, en lugar de ejecutar el script básico de inferencia en Python a gran escala.

Consejos para obtener mejores resultados

  • Mantén limpio el clip de referencia y dentro del intervalo recomendado. En comparación con un modelo basado exclusivamente en tokens acústicos, el ruido de fondo y los clips que se alejan claramente del intervalo recomendado de 5–15 segundos suelen perjudicar más la calidad de la clonación.
  • Proporciona una transcripción exacta de la referencia siempre que sea posible. Dejar que el modelo ASR integrado transcriba automáticamente resulta cómodo, pero una transcripción verificada manualmente evita que los posibles errores de ASR se propaguen al propio proceso de clonación.
  • Prueba la clonación entre idiomas con tu par de idiomas concreto antes de adoptarla. La documentación confirma esta capacidad, pero la calidad varía según la combinación específica de idioma de origen y destino. Valida el par que tu proyecto necesita realmente.
  • Utiliza la configuración predeterminada de Sway Sampling antes de ajustar nada manualmente. Está diseñada para mejorar los resultados directamente sin volver a entrenar. Considera el ajuste manual de los pasos de flujo como una optimización posterior y no como un requisito inicial.
  • Lee los términos de la licencia antes de cualquier uso comercial. Los pesos preentrenados de F5-TTS se publican bajo una licencia CC-BY-NC como consecuencia directa de haberse entrenado con el conjunto de datos Emilia recopilado en entornos reales. Esta licencia permite la investigación y el uso no comercial, pero un despliegue comercial requiere una autorización independiente.

F5-TTS frente a E2 TTS y otros modelos de clonación

F5-TTSE2 TTS (predecesor)CosyVoice3
ArquitecturaDiffusion Transformer + flow matchingTransformer U-Net planoTokens semánticos supervisados + flow matching
¿Necesita modelo de duración/alineador?NoNo (pero es menos robusto)No
Convergencia del entrenamientoMás rápida y robustaLenta, con problemas de alineaciónN/A (familia de arquitectura diferente)
Duración del clip de referencia~5–15 segundosSimilar~3–10 segundos
Clonación entre idiomasSíLimitadaSí
Velocidad de inferencia (RTF)~0,15Más lentaSimilar; variantes alojadas con ~150 ms de latencia
LicenciaCC-BY-NC (no comercial)Uso para investigaciónAbierta, con API alojada disponible

La aportación específica de F5-TTS a esta familia es demostrar que el método mínimo y sin alineador iniciado por E2 TTS podía llegar a ser rápido y fiable. Su arquitectura es más sencilla que la de la mayoría de los modelos de clonación competidores, y la velocidad del benchmark refleja directamente esa sencillez en lugar de proceder de optimizaciones adicionales añadidas posteriormente.

Preguntas frecuentes

En la práctica, ¿qué significa «no autorregresivo» para F5-TTS?

Significa que el modelo no genera la voz de forma secuencial, token a token. En su lugar, parte de ruido y elimina el ruido de toda la salida mediante el Diffusion Transformer, algo que ayuda a explicar por qué la inferencia puede ser más rápida que la generación autorregresiva token a token.

¿Qué relación existe entre F5-TTS y E2 TTS?

E2 TTS fue el modelo anterior que demostró por primera vez que un método TTS sin modelo de duración ni alineador podía funcionar, pero sufría una convergencia lenta durante el entrenamiento y problemas de robustez en la alineación. F5-TTS se creó específicamente para resolver esos problemas mediante la representación de texto de ConvNeXt V2 y Sway Sampling, y el repositorio oficial incluye checkpoints de F5-TTS y E2TTS_Base para compararlos directamente.

¿Cuánto audio de referencia necesita F5-TTS para clonar una voz?

La recomendación habitual es utilizar entre 5 y 15 segundos, aunque algunas configuraciones consiguen resultados útiles con solo 6 segundos de audio de referencia limpio.

¿F5-TTS es gratuito para uso comercial?

No sin una autorización independiente. Los pesos del modelo preentrenado se publican bajo una licencia CC-BY-NC debido a los términos de licencia del conjunto de datos de entrenamiento Emilia. Esto cubre la investigación y el uso no comercial, pero un despliegue comercial exige comprobar directamente los términos vigentes.

¿Qué hardware necesito para ejecutar F5-TTS?

Funciona cualquier GPU NVIDIA con unos 16GB de VRAM; se recomiendan 24GB —una tarjeta de la clase RTX 3090 o 4090— para disponer de un margen cómodo, especialmente si piensas realizar ajuste fino.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →