EchoraEchora
Volver a los modelos

Tortoise TTS: El modelo lento del que aprendieron todos los demás

30 de agosto de 2026
•
7 min de lectura

Antes de que la clonación zero-shot se volviera rápida y desechable, hubo un modelo que hizo una apuesta completamente distinta: tardar todo lo necesario, pero conseguir un resultado verdaderamente convincente. Tortoise TTS se ganó el nombre con sinceridad; el desarrollador lo eligió precisamente porque el modelo es, según sus propias palabras, absurdamente lento. A cambio de esa paciencia ofrece una calidad de voz que, en 2022, constituyó una de las primeras demostraciones open source de que el TTS neuronal podía competir de tú a tú con los sistemas comerciales. Su ADN arquitectónico todavía se aprecia en modelos más recientes construidos, en parte, sobre las ideas que Tortoise demostró que funcionaban.

¿Qué es Tortoise TTS?

Tortoise TTS es un sistema open source y multivoz de texto a voz creado por el desarrollador James Betker, cuyo primer commit se remonta a enero de 2022. Está documentado en el artículo de Betker «Better Speech Synthesis Through Scaling», que explica cómo tomó técnicas que acababan de transformar la generación de imágenes —Transformers autorregresivos y modelos probabilísticos de difusión con eliminación de ruido (DDPM)— y las aplicó a la voz.

Cabe destacar que Betker desarrolló Tortoise por completo con su propio hardware, sin depender de ninguna empresa para la que trabajara, y lo publicó bajo la licencia Apache 2.0, totalmente permisiva. Es una elección realmente favorable para el uso comercial que sobresale entre varios modelos de clonación más recientes, cuyas licencias de investigación no comercial restringen ese tipo de uso.

La arquitectura: primero un Transformer autorregresivo y después un modelo de diffusion

El planteamiento de Tortoise está inspirado en DALL-E, y su pipeline de dos etapas explica tanto sus virtudes como su lentitud. En primer lugar, un Transformer autorregresivo —de arquitectura similar a GPT— genera tokens discretos de voz condicionados por el texto de entrada y una muestra de voz de referencia. En lugar de detenerse ahí, Tortoise pasa esos tokens a un modelo de diffusion que los refina de forma iterativa hasta convertirlos en la onda de audio final de alta fidelidad.

Es la misma lógica en dos pasos que impulsó el salto de calidad en la generación de imágenes unos años antes: una primera pasada generativa seguida de un proceso de refinamiento que intercambia tiempo de cómputo por fidelidad. En el caso de Tortoise, ese intercambio produce una prosodia y una entonación realmente excelentes —pausas naturales, énfasis y una textura vocal propia del hablante— a costa de una velocidad de generación notablemente inferior a la de la mayoría de las alternativas modernas.

Clonación multivoz, de forma deliberada

Tortoise permite clonar voces a partir de un conjunto de clips de audio de referencia y está diseñado específicamente para trabajar bien con múltiples voces, en vez de estar optimizado para un único hablante predeterminado. Proporcionas varios clips de referencia de una voz objetivo y el modelo los usa en conjunto para captar las características de ese hablante. La preparación es algo más laboriosa que la clonación zero-shot con un solo clip de modelos más recientes, pero históricamente ha producido una transferencia de identidad más estable y natural que los sistemas más rápidos que llegaron después.

La influencia de Tortoise en modelos posteriores

Conviene saberlo si estás comparando Tortoise con opciones más recientes: sus ideas arquitectónicas no se quedaron dentro de un único proyecto. Tanto el diseño autorregresivo al estilo GPT de XTTS como IndexTTS de Bilibili se apoyan explícitamente en bases que Tortoise ayudó a establecer. La combinación de un modelo de lenguaje autorregresivo para generar el contenido y una etapa de refinamiento independiente para mejorar la calidad del audio se convirtió en una plantilla que una parte importante del ecosistema TTS open source adaptó y perfeccionó. Si has utilizado un modelo de clonación más reciente que combina un Transformer con una fase independiente de refinamiento acústico, es bastante probable que una parte de su linaje de diseño se remonte hasta aquí.

Primeros pasos con Tortoise TTS

  1. Configura un entorno de conda dedicado. Ejecuta conda create --name tortoise python=3.9 numba inflect, actívalo e instala PyTorch, torchvision y torchaudio en versiones compatibles con tu versión de CUDA.
  2. Fija exactamente la versión de transformers. Tortoise requiere específicamente transformers==4.29.2; es probable que una versión más reciente rompa la compatibilidad, así que no omitas este pin durante la configuración.
  3. Clona el repositorio e instala el modelo. Ejecuta git clone https://github.com/neonbjb/tortoise-tts.git, después cd tortoise-tts y python setup.py install (o instala directamente la última versión de desarrollo con pip install git+https://github.com/neonbjb/tortoise-tts).
  4. Elige un preset de velocidad/calidad. La generación admite presets como fast, standard y ajustes de mayor calidad. Empieza con fast para las primeras pruebas antes de pasar a presets más lentos y de mayor fidelidad para el resultado final.
  5. Activa kv_cache y la media precisión para acelerar de forma considerable la generación. Inicializar TextToSpeech(kv_cache=True) o TextToSpeech(half=True) acelera la inferencia de manera perceptible frente a la configuración predeterminada, sin una pérdida drástica de calidad.
  6. Prueba la demo alojada antes de comprometerte con una instalación local. Hay una demo disponible en Hugging Face Spaces. Ten en cuenta que necesita un Space con GPU, ya que las instancias que solo disponen de CPU no ejecutan el pipeline de inferencia de Tortoise.

Consejos para obtener mejores resultados

  • Reserva tiempo real para la generación, sobre todo con los ajustes de mayor calidad. El nombre de Tortoise no es irónico: incluso con kv_cache y media precisión activados, no es el modelo que debes elegir si necesitas resultados casi instantáneos. Está pensado para procesos offline que priorizan la calidad, como la narración de audiolibros, y no para la interacción en directo.
  • Proporciona varios clips de referencia, no uno solo. La clonación multivoz de Tortoise se diseñó para usar conjuntamente varias muestras de la voz objetivo. Depender de un único clip corto, como hacen los modelos zero-shot más nuevos, suele impedir que demuestre todo lo que puede ofrecer.
  • Resérvalo para contenido en el que la calidad importe más que el tiempo de entrega. La ventaja de Tortoise en prosodia se aprecia especialmente en narraciones largas, audiolibros y contenido premium. Para agentes en directo o iteraciones rápidas, un modelo más reciente de baja latencia dará mejor resultado.
  • Confirma que dispones de unos 8GB de VRAM antes de planificar un despliegue. Es el punto de partida que se cita habitualmente para ejecutar Tortoise con comodidad. Comprueba tu preset y los ajustes de batch concretos antes de dar por hecho que bastará una GPU más pequeña.
  • No esperes la misma experiencia de instalación que ofrece un modelo en desarrollo activo. Como el ritmo de desarrollo de Tortoise se ha ralentizado desde sus primeras versiones, respetar estrictamente las versiones de dependencias documentadas —en especial la versión fijada de transformers— te ahorrará más tiempo de resolución de problemas que asumir que funcionará la última versión de todo.

Tortoise TTS frente a modelos de clonación más recientes

Tortoise TTSXTTS-v2F5-TTS
ArquitecturaTransformer autorregresivo + diffusionTransformer autorregresivo (estilo GPT-2) + VQ-VAEDiffusion Transformer + flow matching
Velocidad de generaciónLenta, prioriza la calidadModeradaRápida (~0.15 RTF)
Clonación de vozReferencia con varios clipsUn solo clip de ~6 segundosUn solo clip de ~5–15 segundos
Compatibilidad multilingüePrincipalmente inglés17 idiomasCentrado principalmente en inglés
LicenciaApache 2.0 (totalmente permisiva)Coqui Public Model License (no comercial)CC-BY-NC (no comercial)
Opción idealAudiolibros, narración premium y trabajo offline que prioriza la calidadClonación multilingüe generalGeneración en tiempo real o de alto rendimiento

El nicho concreto de Tortoise en la actualidad son los proyectos donde el tiempo de generación de verdad no importa y la calidad del audio sí. Además, sigue siendo uno de los pocos modelos de clonación conocidos con una licencia lo bastante permisiva para utilizarlo comercialmente sin un acuerdo independiente.

Preguntas frecuentes

¿Por qué se llama «Tortoise TTS»?

El nombre es una referencia deliberada y humorística a la lentitud del modelo. Su creador ha explicado que es «absurdamente lento» por diseño, porque prioriza la calidad del resultado por encima de la velocidad de generación.

¿Quién creó Tortoise TTS?

James Betker creó Tortoise TTS de forma independiente, con su propio hardware y sin la participación de ninguna empresa para la que trabajara. Tanto el modelo como su código y sus pesos son completamente open source.

¿Tortoise TTS es gratis para uso comercial?

Sí. Se publica bajo la licencia Apache 2.0, una de las opciones más permisivas entre los modelos TTS open source, sin restricciones que exijan un acuerdo comercial independiente.

¿En qué se diferencia la arquitectura de Tortoise TTS de los modelos más recientes basados en diffusion?

Tortoise combina un Transformer autorregresivo —que genera tokens discretos de voz de forma similar a como GPT genera tokens de texto— con un modelo de diffusion que refina esos tokens hasta obtener el audio final. Es un diseño de dos etapas inspirado en técnicas de generación de imágenes, en lugar de los pipelines únicos de flow matching o Diffusion Transformer utilizados por algunos modelos más recientes.

¿Influyó Tortoise TTS en otros modelos TTS?

Sí. Su combinación de un modelo de lenguaje autorregresivo con una etapa independiente de refinamiento de la calidad del audio se ha citado como influencia arquitectónica en modelos posteriores, incluidos XTTS e IndexTTS.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →