Tortoise TTS: El modelo lento del que aprendieron todos los demás
- ¿Qué es Tortoise TTS?
- La arquitectura: primero un Transformer autorregresivo y después un modelo de diffusion
- Clonación multivoz, de forma deliberada
- La influencia de Tortoise en modelos posteriores
- Primeros pasos con Tortoise TTS
- Consejos para obtener mejores resultados
- Tortoise TTS frente a modelos de clonación más recientes
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Antes de que la clonación zero-shot se volviera rápida y desechable, hubo un modelo que hizo una apuesta completamente distinta: tardar todo lo necesario, pero conseguir un resultado verdaderamente convincente. Tortoise TTS se ganó el nombre con sinceridad; el desarrollador lo eligió precisamente porque el modelo es, según sus propias palabras, absurdamente lento. A cambio de esa paciencia ofrece una calidad de voz que, en 2022, constituyó una de las primeras demostraciones open source de que el TTS neuronal podía competir de tú a tú con los sistemas comerciales. Su ADN arquitectónico todavía se aprecia en modelos más recientes construidos, en parte, sobre las ideas que Tortoise demostró que funcionaban.
¿Qué es Tortoise TTS?
Tortoise TTS es un sistema open source y multivoz de texto a voz creado por el desarrollador James Betker, cuyo primer commit se remonta a enero de 2022. Está documentado en el artículo de Betker «Better Speech Synthesis Through Scaling», que explica cómo tomó técnicas que acababan de transformar la generación de imágenes —Transformers autorregresivos y modelos probabilísticos de difusión con eliminación de ruido (DDPM)— y las aplicó a la voz.
Cabe destacar que Betker desarrolló Tortoise por completo con su propio hardware, sin depender de ninguna empresa para la que trabajara, y lo publicó bajo la licencia Apache 2.0, totalmente permisiva. Es una elección realmente favorable para el uso comercial que sobresale entre varios modelos de clonación más recientes, cuyas licencias de investigación no comercial restringen ese tipo de uso.
La arquitectura: primero un Transformer autorregresivo y después un modelo de diffusion
El planteamiento de Tortoise está inspirado en DALL-E, y su pipeline de dos etapas explica tanto sus virtudes como su lentitud. En primer lugar, un Transformer autorregresivo —de arquitectura similar a GPT— genera tokens discretos de voz condicionados por el texto de entrada y una muestra de voz de referencia. En lugar de detenerse ahí, Tortoise pasa esos tokens a un modelo de diffusion que los refina de forma iterativa hasta convertirlos en la onda de audio final de alta fidelidad.
Es la misma lógica en dos pasos que impulsó el salto de calidad en la generación de imágenes unos años antes: una primera pasada generativa seguida de un proceso de refinamiento que intercambia tiempo de cómputo por fidelidad. En el caso de Tortoise, ese intercambio produce una prosodia y una entonación realmente excelentes —pausas naturales, énfasis y una textura vocal propia del hablante— a costa de una velocidad de generación notablemente inferior a la de la mayoría de las alternativas modernas.
Clonación multivoz, de forma deliberada
Tortoise permite clonar voces a partir de un conjunto de clips de audio de referencia y está diseñado específicamente para trabajar bien con múltiples voces, en vez de estar optimizado para un único hablante predeterminado. Proporcionas varios clips de referencia de una voz objetivo y el modelo los usa en conjunto para captar las características de ese hablante. La preparación es algo más laboriosa que la clonación zero-shot con un solo clip de modelos más recientes, pero históricamente ha producido una transferencia de identidad más estable y natural que los sistemas más rápidos que llegaron después.
La influencia de Tortoise en modelos posteriores
Conviene saberlo si estás comparando Tortoise con opciones más recientes: sus ideas arquitectónicas no se quedaron dentro de un único proyecto. Tanto el diseño autorregresivo al estilo GPT de XTTS como IndexTTS de Bilibili se apoyan explícitamente en bases que Tortoise ayudó a establecer. La combinación de un modelo de lenguaje autorregresivo para generar el contenido y una etapa de refinamiento independiente para mejorar la calidad del audio se convirtió en una plantilla que una parte importante del ecosistema TTS open source adaptó y perfeccionó. Si has utilizado un modelo de clonación más reciente que combina un Transformer con una fase independiente de refinamiento acústico, es bastante probable que una parte de su linaje de diseño se remonte hasta aquí.
Primeros pasos con Tortoise TTS
- Configura un entorno de conda dedicado. Ejecuta
conda create --name tortoise python=3.9 numba inflect, actívalo e instala PyTorch, torchvision y torchaudio en versiones compatibles con tu versión de CUDA. - Fija exactamente la versión de transformers. Tortoise requiere específicamente
transformers==4.29.2; es probable que una versión más reciente rompa la compatibilidad, así que no omitas este pin durante la configuración. - Clona el repositorio e instala el modelo. Ejecuta
git clone https://github.com/neonbjb/tortoise-tts.git, despuéscd tortoise-ttsypython setup.py install(o instala directamente la última versión de desarrollo conpip install git+https://github.com/neonbjb/tortoise-tts). - Elige un preset de velocidad/calidad. La generación admite presets como
fast,standardy ajustes de mayor calidad. Empieza confastpara las primeras pruebas antes de pasar a presets más lentos y de mayor fidelidad para el resultado final. - Activa
kv_cachey la media precisión para acelerar de forma considerable la generación. InicializarTextToSpeech(kv_cache=True)oTextToSpeech(half=True)acelera la inferencia de manera perceptible frente a la configuración predeterminada, sin una pérdida drástica de calidad. - Prueba la demo alojada antes de comprometerte con una instalación local. Hay una demo disponible en Hugging Face Spaces. Ten en cuenta que necesita un Space con GPU, ya que las instancias que solo disponen de CPU no ejecutan el pipeline de inferencia de Tortoise.
Consejos para obtener mejores resultados
- Reserva tiempo real para la generación, sobre todo con los ajustes de mayor calidad. El nombre de Tortoise no es irónico: incluso con
kv_cachey media precisión activados, no es el modelo que debes elegir si necesitas resultados casi instantáneos. Está pensado para procesos offline que priorizan la calidad, como la narración de audiolibros, y no para la interacción en directo. - Proporciona varios clips de referencia, no uno solo. La clonación multivoz de Tortoise se diseñó para usar conjuntamente varias muestras de la voz objetivo. Depender de un único clip corto, como hacen los modelos zero-shot más nuevos, suele impedir que demuestre todo lo que puede ofrecer.
- Resérvalo para contenido en el que la calidad importe más que el tiempo de entrega. La ventaja de Tortoise en prosodia se aprecia especialmente en narraciones largas, audiolibros y contenido premium. Para agentes en directo o iteraciones rápidas, un modelo más reciente de baja latencia dará mejor resultado.
- Confirma que dispones de unos 8GB de VRAM antes de planificar un despliegue. Es el punto de partida que se cita habitualmente para ejecutar Tortoise con comodidad. Comprueba tu preset y los ajustes de batch concretos antes de dar por hecho que bastará una GPU más pequeña.
- No esperes la misma experiencia de instalación que ofrece un modelo en desarrollo activo. Como el ritmo de desarrollo de Tortoise se ha ralentizado desde sus primeras versiones, respetar estrictamente las versiones de dependencias documentadas —en especial la versión fijada de
transformers— te ahorrará más tiempo de resolución de problemas que asumir que funcionará la última versión de todo.
Tortoise TTS frente a modelos de clonación más recientes
| Tortoise TTS | XTTS-v2 | F5-TTS | |
|---|---|---|---|
| Arquitectura | Transformer autorregresivo + diffusion | Transformer autorregresivo (estilo GPT-2) + VQ-VAE | Diffusion Transformer + flow matching |
| Velocidad de generación | Lenta, prioriza la calidad | Moderada | Rápida (~0.15 RTF) |
| Clonación de voz | Referencia con varios clips | Un solo clip de ~6 segundos | Un solo clip de ~5–15 segundos |
| Compatibilidad multilingüe | Principalmente inglés | 17 idiomas | Centrado principalmente en inglés |
| Licencia | Apache 2.0 (totalmente permisiva) | Coqui Public Model License (no comercial) | CC-BY-NC (no comercial) |
| Opción ideal | Audiolibros, narración premium y trabajo offline que prioriza la calidad | Clonación multilingüe general | Generación en tiempo real o de alto rendimiento |
El nicho concreto de Tortoise en la actualidad son los proyectos donde el tiempo de generación de verdad no importa y la calidad del audio sí. Además, sigue siendo uno de los pocos modelos de clonación conocidos con una licencia lo bastante permisiva para utilizarlo comercialmente sin un acuerdo independiente.
Preguntas frecuentes
¿Por qué se llama «Tortoise TTS»?
El nombre es una referencia deliberada y humorística a la lentitud del modelo. Su creador ha explicado que es «absurdamente lento» por diseño, porque prioriza la calidad del resultado por encima de la velocidad de generación.
¿Quién creó Tortoise TTS?
James Betker creó Tortoise TTS de forma independiente, con su propio hardware y sin la participación de ninguna empresa para la que trabajara. Tanto el modelo como su código y sus pesos son completamente open source.
¿Tortoise TTS es gratis para uso comercial?
Sí. Se publica bajo la licencia Apache 2.0, una de las opciones más permisivas entre los modelos TTS open source, sin restricciones que exijan un acuerdo comercial independiente.
¿En qué se diferencia la arquitectura de Tortoise TTS de los modelos más recientes basados en diffusion?
Tortoise combina un Transformer autorregresivo —que genera tokens discretos de voz de forma similar a como GPT genera tokens de texto— con un modelo de diffusion que refina esos tokens hasta obtener el audio final. Es un diseño de dos etapas inspirado en técnicas de generación de imágenes, en lugar de los pipelines únicos de flow matching o Diffusion Transformer utilizados por algunos modelos más recientes.
¿Influyó Tortoise TTS en otros modelos TTS?
Sí. Su combinación de un modelo de lenguaje autorregresivo con una etapa independiente de refinamiento de la calidad del audio se ha citado como influencia arquitectónica en modelos posteriores, incluidos XTTS e IndexTTS.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.