EchoraEchora
Volver a los modelos

KaniTTS: generación de voz en tiempo real con una GPU que apenas merece llamarse así

11 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de los modelos TTS modernos al estilo de los LLM de voz dan por hecho que tienes una GPU de verdad disponible: 8 GB por aquí, 16 GB por allá. KaniTTS, de NineNineSix.ai, se creó a partir de una premisa mucho más modesta: 3 GB de VRAM, el tipo de margen que puede ofrecer una RTX 3060 o 4050 de consumo, bastan para generar voz natural en tiempo real. Esa eficiencia no es fruto de recortar el modelo hasta dejarlo en un compromiso: procede de una arquitectura deliberadamente compacta, construida específicamente para no cargar con el peso que el modelo no necesita.

¿Qué es KaniTTS?

KaniTTS es un sistema open source de texto a voz basado en un pipeline de dos etapas: un gran modelo de lenguaje troncal genera representaciones comprimidas de tokens a partir del texto y un códec neuronal de audio eficiente expande rápidamente esos tokens hasta convertirlos en una forma de onda real. El modelo troncal es LFM2 de LiquidAI, un modelo de 350 millones de parámetros elegido específicamente por su eficiencia frente a un Transformer estándar de capacidad comparable, combinado con NanoCodec de NVIDIA para la parte de audio. Esta filosofía de «la voz como lenguaje» —tratar la generación de audio como una tarea de predicción de tokens, del mismo modo que un modelo de chat predice palabras— se inspira directamente en Orpheus TTS y Sesame CSM, pero KaniTTS lleva la misma idea central a un consumo de recursos sensiblemente menor que cualquiera de los dos.

Ventajas funcionales de KaniTTS

  • Requisitos de VRAM realmente bajos: la versión Kani-TTS-2 funciona con tan solo 3 GB, por lo que es compatible con GPU de consumo básicas en lugar de exigir una tarjeta específica para estaciones de trabajo.
  • Generación rápida: tiene un factor de tiempo real cercano a 0,2, lo que significa que unos 10 segundos de audio se generan en aproximadamente 2 segundos, y una latencia documentada inferior a 300 ms para el primer fragmento de audio en modo streaming.
  • Clonación de voz zero-shot mediante embeddings de hablante en la versión Kani-TTS-2: basta un breve clip de referencia para extraer las características de una voz y aplicarlas al instante, sin necesidad de fine-tuning.
  • Varios checkpoints de idiomas y soporte multihablante: cuenta con variantes específicas del modelo que cubren por separado inglés, árabe, coreano y otros idiomas, en lugar de estirar un único modelo para que los abarque todos.
  • Licencia Apache 2.0, que permite el uso comercial sin un acuerdo independiente.
  • Servicio listo para producción mediante vLLM, con un servidor de API compatible con OpenAI disponible de inmediato para los equipos que quieran desplegarlo igual que cualquier otro servicio basado en LLM.

Cómo logra esta eficiencia el pipeline de dos etapas

La decisión fundamental de eficiencia consiste en elegir LFM2 como modelo troncal, precisamente porque los Liquid Foundation Models están diseñados para ser más ligeros en términos computacionales que un Transformer convencional de capacidad similar. Es una ventaja importante cuando el objetivo consiste en minimizar el consumo de recursos y no en maximizar la capacidad bruta. Generar una representación comprimida de tokens con este modelo troncal ligero y entregársela después a NanoCodec para expandirla rápidamente hasta obtener una forma de onda evita la mayor sobrecarga computacional que supone generar formas de onda de audio directamente mediante un modelo de lenguaje a gran escala. Es la misma lógica general de dos etapas que emplean otros sistemas de LLM de voz, pero aquí se construye con componentes elegidos deliberadamente por su reducido consumo en cada etapa, en lugar de optimizarlos exclusivamente para obtener la máxima calidad de salida.

Los datos de entrenamiento reflejan una atención similar a la eficiencia adecuada para cada fin: en lugar de los corpus de estilo audiolibro y lectura formal con los que se entrenan muchos modelos TTS, KaniTTS recurre a fuentes como Emilia (un gran conjunto de datos multilingüe con etiquetas emocionales de LAION) y Expresso-Conversational (grabaciones de diálogos naturales). Esa es una de las razones por las que su resultado suele parecerse más a una conversación relajada que a un narrador leyendo un párrafo en voz alta, algo especialmente apropiado para asistentes y usos conversacionales.

Primeros pasos con KaniTTS

  1. Instala el paquete y fija la versión necesaria de transformers. Ejecuta pip install kani-tts y después pip install -U "transformers==4.57.1": esta versión concreta es necesaria para la compatibilidad con LFM2, y omitirla es una causa documentada de fallos de carga.
  2. Carga un checkpoint específico para el idioma desde Hugging Face. Usa nineninesix/kani-tts-400m-en para inglés o el checkpoint equivalente para los demás idiomas compatibles (árabe, coreano y otros están disponibles como modelos específicos independientes). Elige según el idioma objetivo en lugar de asumir que un checkpoint sirve para todo.
  3. Genera audio con unas pocas líneas. Ejecuta from kani_tts import KaniTTS, seguido de model = KaniTTS('nineninesix/kani-tts-400m-en') y audio, text = model("Hello, world!") para obtener directamente una forma de onda; model.save_audio(audio, "output.wav") la guarda en el disco.
  4. Utiliza el repositorio kanitts-vllm para ofrecer el modelo a escala de producción. Este proyecto independiente (nineninesix-ai/kanitts-vllm en GitHub) envuelve el modelo en un servidor FastAPI con un endpoint compatible con OpenAI, respaldado por el motor asíncrono de vLLM y la optimización de caché KV. Es la vía documentada para todo lo que vaya más allá de las pruebas locales.
  5. Comprueba los requisitos de hardware de tu ruta de despliegue concreta. El modelo principal funciona con holgura en 3 GB de VRAM, pero la documentación del servidor de producción basado en vLLM recomienda un entorno CUDA 12.8+ con 12 GB o más de VRAM para disponer de margen suficiente a escala. Confirma qué configuración corresponde a tu caso real antes de asumir que la cifra mínima se aplica en todas partes.
  6. Prueba la versión cuantizada en GGUF o el nodo de ComfyUI para otros flujos de trabajo. Existen opciones mantenidas por la comunidad tanto para despliegues basados en llama.cpp como para pipelines creativos basados en nodos, por si alguna encaja mejor con tus herramientas actuales que el paquete básico de Python.

Consejos para obtener mejores resultados

  • Haz coincidir el checkpoint con el idioma objetivo en lugar de usar inglés por defecto. Como KaniTTS distribuye modelos específicos por idioma en vez de un único checkpoint multilingüe universal, utilizar el adecuado para el contenido dará mejores resultados que forzar texto no inglés a través del modelo ajustado para inglés.
  • Apuesta por una redacción natural y conversacional en lugar de una narración formal. Debido al énfasis de los datos de entrenamiento en los diálogos, KaniTTS suele sonar más natural con contenido de asistentes o conversaciones que cuando se le pide interpretar prosa dramática y narrada formalmente.
  • Utiliza específicamente Kani-TTS-2 si necesitas clonación de voz. La clonación zero-shot mediante embeddings de hablante es una función de esa versión concreta: si reproducir una voz de referencia específica forma parte del proyecto, confirma que utilizas el checkpoint correcto.
  • Pasa a la ruta del servidor vLLM cuando termines los experimentos locales. El paquete básico de Python es excelente para hacer pruebas, pero el servidor específico kanitts-vllm es la vía documentada y más robusta para atender tráfico de usuarios reales.
  • Respeta las restricciones explícitas de uso ético del proyecto. Los términos de licencia de KaniTTS prohíben expresamente generar contenido engañoso que suplante a otra persona sin su consentimiento, además de otros usos dañinos o ilegales. Trátalas como restricciones reales del despliegue, no como texto estándar que se puede pasar por alto.

KaniTTS frente a otros modelos al estilo de los LLM de voz

KaniTTSOrpheus TTSChatterbox
Modelo troncalLiquidAI LFM2 (350M)Llama-3BBasado en difusión
VRAM mínima~3 GB (Kani-TTS-2)~8 GB (GGUF cuantizado)Menor, pero no es su objetivo principal
Factor de tiempo real~0,2No es la principal métrica publicadaNo es la principal métrica publicada
Clonación de vozSí, zero-shot mediante embeddings de hablante (Kani-TTS-2)Sí, zero-shotSí, zero-shot
Prioridad de diseñoConsumo mínimo de recursosExpresividad competitiva con sistemas comerciales cerradosControl de exageración emocional
LicenciaApache 2.0Apache 2.0MIT

La contrapartida concreta de KaniTTS consiste en sacrificar parte del matiz emocional y del registro dramático que ofrecen modelos más grandes y pesados como Orpheus TTS a cambio de un funcionamiento fiable en tiempo real sobre hardware verdaderamente modesto. Es la opción adecuada cuando la latencia y la facilidad de despliegue importan más que alcanzar el máximo rango expresivo.

Preguntas frecuentes

¿Cuál es la cantidad mínima de VRAM que realmente necesita KaniTTS?

La versión Kani-TTS-2 funciona con tan solo 3 GB de VRAM, lo que la hace compatible con GPU de consumo básicas como las RTX 3060 o 4050. Sin embargo, la documentación del servidor basado en vLLM recomienda más margen (12 GB o más) para lograr un throughput cómodo a escala de producción.

¿KaniTTS admite clonación de voz?

Sí, en la versión Kani-TTS-2, mediante embeddings de hablante extraídos de un breve clip de referencia. No se necesita fine-tuning para reproducir las características de una voz objetivo.

¿Qué velocidad alcanza KaniTTS?

Declara un factor de tiempo real aproximado de 0,2, lo que significa que unos 10 segundos de audio se generan en alrededor de 2 segundos, con una latencia inferior a 300 ms para el primer fragmento de audio en modo streaming.

¿KaniTTS es gratuito para uso comercial?

Sí. Se publica bajo la licencia Apache 2.0, que permite el uso comercial sin un acuerdo de licencia independiente, aunque su uso sigue sujeto a las restricciones éticas explícitas del proyecto sobre suplantación y contenido dañino.

¿Qué idiomas admite KaniTTS?

Se distribuye mediante checkpoints específicos e independientes para cada idioma. El inglés es la opción principal y más sólida, con modelos adicionales disponibles por separado para árabe, coreano y otros idiomas, en lugar de un único modelo multilingüe universal.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →