Kokoro TTS: la prueba de que un modelo TTS no necesita GPU para sonar bien
Convierte texto y grabaciones en obras que se escuchan
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
La mayoría de los modelos de voz de código abierto dan por hecho que tienes una GPU sin usar. Kokoro no hace esa suposición: con 82 millones de parámetros, es lo bastante pequeño para funcionar cómodamente en una CPU, incluso en un portátil de hace años, y aun así llegó a la cima de la clasificación TTS Arena de Hugging Face frente a modelos muchas veces mayores. Si tu proyecto necesita voz natural sin aprovisionar infraestructura de GPU, este es el modelo diseñado para esa limitación.
¿Qué es Kokoro?
Kokoro-82M es un modelo de texto a voz de pesos abiertos publicado por el desarrollador hexgrad bajo la licencia Apache 2.0, lo que significa que es gratuito para uso comercial, modificación y autoalojamiento, sin regalías ni restricciones para despliegues de código cerrado. Está construido con una arquitectura de solo decodificador que combina StyleTTS 2 e ISTFTNet y, pese a pesar aproximadamente 327MB, produce audio limpio a 24kHz que ha competido con modelos varias veces más grandes desde su lanzamiento v1.0.
El propio nombre significa «corazón» o «espíritu» en japonés, una referencia al objetivo del proyecto de obtener voz genuinamente expresiva con un modelo lo bastante pequeño para ejecutarse en cualquier lugar.
Modelo pequeño, capacidad real
La cifra principal de Kokoro son 82 millones de parámetros, pero las cifras más útiles son las ventajas que aporta ese tamaño:
- 54 voces en 8 idiomas, incluidos inglés estadounidense y británico, francés, japonés, coreano y mandarín, reunidas en un único archivo de pesos de unos 327MB en vez de descargas separadas por idioma.
- Rendimiento nativo en CPU. Kokoro funciona a velocidad en tiempo real o superior en hardware de CPU normal y, si dispones de GPU, usa menos de 2GB de VRAM: una fracción de lo que suelen requerir los modelos de calidad comparable.
- Ventana de generación de 510 tokens por pasada, suficiente para fragmentos sustanciales de narración sin necesidad de transmitir token por token.
- Compatibilidad con ONNX para un rendimiento casi en tiempo real incluso en hardware limitado como Apple Silicon, mediante el paquete comunitario
kokoro-onnx.
Conviene conocer de antemano la contrapartida de ese tamaño: Kokoro no admite clonación de voz de cero muestras, su rango emocional es más limitado que el de modelos expresivos más grandes y la calidad en idiomas distintos del inglés suele estar menos refinada que su salida en inglés. Está optimizado para narración eficiente y fiable, no para interpretación dramática ni clonación instantánea de voz.
Primeros pasos con Kokoro
- Instala primero la dependencia del sistema. Kokoro usa
espeak-ngpara la fonemización; instálalo mediante el gestor de paquetes de tu sistema (apt-get install espeak-ngen Debian/Ubuntu) antes de instalar el paquete de Python, o la configuración fallará de forma silenciosa en la conversión de texto a fonemas. - Instala el paquete de Kokoro.
pip install kokoro soundfilecubre las dependencias principales; añademisaki[ja]omisaki[zh]si necesitas específicamente compatibilidad con japonés o chino. - Inicializa una canalización y genera. Carga
KPipelinecon un código de idioma ('a'para inglés estadounidense,'b'para inglés británico, etc.), pasa el texto y un nombre de voz comoaf_heartobm_george, y Kokoro devuelve audio directamente: normalmente bastan cinco líneas de Python desde la instalación hasta un archivo.wav. - Considera la ruta ONNX o Docker para producción. Para entornos solo CPU o un despliegue más simple, el paquete comunitario
kokoro-onnxo la imagen Dockerkokoro-fastapi(que expone un endpoint de voz compatible con OpenAI) permiten poner en marcha un servicio más rápido que conectar la canalización sin procesar por tu cuenta. - Prueba pronto el hardware objetivo. Kokoro es realmente utilizable en hardware tan modesto como una CPU de hace una década, pero confirmar una latencia aceptable en el destino real antes de comprometerte evita sorpresas más adelante.
Consejos para obtener mejores resultados
- Presta atención a entradas aisladas de una sola palabra. El fonemizador de Kokoro está ajustado para el contexto de frases naturales: una palabra o un número aislado (como «six» por sí solo) puede pronunciarse mal u obtener un énfasis extraño en ocasiones. Usar frases completas en lugar de fragmentos evita esto.
- Divide el contenido largo en partes. Para narración de longitud de libro o artículo, divide el texto en fragmentos del tamaño de un párrafo o capítulo en lugar de una entrada enorme; así la generación es predecible y no se supera la ventana de tokens por pasada.
- Elige las voces deliberadamente, no por defecto. Con 54 voces disponibles, merece la pena dedicar unos minutos a probar dos o tres candidatas con tu guion real: la calidad varía de forma apreciable según el nombre y la mejor opción no siempre es la primera que pruebas.
- No esperes clonación de cero muestras. Si el requisito central de tu proyecto es clonar la voz de una persona concreta, Kokoro no es el modelo base adecuado: combínalo con un modelo centrado en clonación o reserva Kokoro para narración donde baste un repertorio fijo de voces.
- Usa el envoltorio de API compatible con OpenAI si sustituyes un proveedor TTS en la nube.
kokoro-fastapiestá diseñado específicamente como sustituto local directo de llamadas a API TTS de estilo OpenAI, lo que reduce al mínimo los cambios al código de integración existente.
Kokoro frente a otros modelos ligeros y centrados en clonación
| Kokoro-82M | Chatterbox Turbo | Chatterbox / Dia | |
|---|---|---|---|
| Parámetros | 82M | 350M | 500M–1.6B |
| Funciona en CPU | Sí, de forma nativa | Orientado a GPU | Orientado a GPU |
| Clonación de voz | No | Sí, de cero muestras | Sí |
| Idiomas | 8 | Inglés | Inglés (Multilingual: 23) |
| Mejor para | Narración sin conexión, dispositivos de borde, despliegue sensible al coste | Agentes de voz en tiempo real | Diálogo expresivo, voces clonadas |
| Licencia | Apache 2.0 | MIT | Apache 2.0 / MIT |
Kokoro no intenta competir en clonación ni en rango emocional: toda su propuesta de valor es ofrecer TTS sólido y fiable en hardware donde otros modelos sencillamente no pueden ejecutarse. Si la prioridad es la clonación o la expresividad dramática, un modelo más grande encaja mejor; si la prioridad es «funciona barato, en todas partes y para siempre», es difícil superar a Kokoro.
Preguntas frecuentes
¿Puede Kokoro funcionar realmente sin GPU? Sí. Kokoro está diseñado específicamente para funcionar de forma eficiente en hardware de CPU, incluidas máquinas antiguas, a velocidad en tiempo real o casi en tiempo real: la GPU es opcional, no necesaria.
¿Kokoro admite clonación de voz? No. Kokoro ofrece un conjunto fijo de 54 voces integradas en lugar de clonación de cero muestras a partir de un clip de referencia. Para casos de clonación, un modelo como Chatterbox encaja mejor.
¿Qué idiomas admite Kokoro? Ocho, incluidos inglés estadounidense, inglés británico, francés, japonés, coreano y mandarín; el inglés suele ofrecer la calidad de salida más refinada.
¿Kokoro es gratuito para uso comercial? Sí. Se publica bajo la licencia Apache 2.0, que permite despliegue comercial, modificación e integración de código cerrado sin regalías.
¿Cuánto cuesta ejecutar Kokoro a gran escala? Autoalojado, Kokoro es económico de ejecutar: informes de la comunidad sitúan los costes en apenas unos céntimos por hora en instancias de GPU económicas, y proveedores de API lo han ofrecido por menos de 1 dólar por millón de caracteres de texto de entrada.
Prueba una función de texto a voz comparable
Kokoro está disponible mediante su implementación de código abierto y herramientas de la comunidad. Si quieres crear voz en el navegador, prueba Texto a voz como una función comparable. No es Kokoro ni ofrece sus voces, perfil de ejecución u opciones de autoalojamiento específicos, pero te permite crear audio de voz con IA sin configurar el modelo localmente.