EchoraEchora
Volver a los modelos

Orpheus TTS: qué ocurre cuando un LLM aprende la prosodia como aprende la gramática

5 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Canopy Labs creó Orpheus TTS a partir de una apuesta concreta: si se proporciona a un modelo de lenguaje competente el tokenizador de voz adecuado y un corpus de voz seleccionado lo bastante amplio, aprenderá prosodia, ritmo y emoción de forma natural, igual que aprende gramática a partir del texto. Orpheus pone a prueba esa apuesta con 3.000 millones de parámetros sobre una arquitectura Llama: no es un pipeline TTS al que se ha añadido un modelo de lenguaje, sino un auténtico LLM de voz que predice tokens de audio del mismo modo en que un modelo de chat predice la palabra siguiente.

¿Qué es Orpheus TTS?

Orpheus TTS es un sistema de texto a voz de código abierto que Canopy Labs publicó en marzo de 2025, construido sobre una arquitectura Llama-3B y distribuido bajo la licencia Apache 2.0, totalmente permisiva. Desde el punto de vista arquitectónico, es un modelo autorregresivo que genera tokens de audio, que después el códec neuronal SNAC decodifica en una forma de onda: el mismo paradigma generativo general que impulsa los LLM modernos basados en texto, aplicado directamente a la voz en vez de adaptado desde una tradición distinta de modelado acústico. Se entrenó con más de 100.000 horas de datos de voz en inglés, y las propias comparaciones de Canopy Labs lo enfrentan a sistemas comerciales cerrados como ElevenLabs y PlayHT, no solo a otras alternativas de código abierto.

Etiquetas de emoción y clonación zero-shot

Orpheus admite etiquetas de emoción e interpretación insertadas directamente en el texto de entrada —<laugh>, <sigh>, <yawn>, <gasp> y muletillas naturales como «um»— para que el modelo interprete esa reacción en contexto en vez de tratarla como un efecto de audio independiente añadido después. Como es la arquitectura de LLM de voz del modelo la que sitúa de forma natural estas reacciones dentro de una frase, suelen aparecer con una sincronización más acorde al contexto que la que normalmente consiguen los efectos de sonido incorporados en posproducción. Además, Orpheus permite clonar voces mediante zero-shot sin ningún ajuste previo: clona una voz directamente a partir de una referencia, como se invocaría cualquier otra capacidad de un LLM competente mediante un prompt.

Streaming de baja latencia

Esta es la otra gran capacidad de Orpheus, y las cifras son concretas: alrededor de 200ms de latencia en streaming para aplicaciones en tiempo real, que pueden reducirse a unos 100ms al activar el streaming de entrada. Es lo bastante rápido como para funcionar detrás de un agente de voz en directo o una aplicación interactiva sin que el retraso de generación se convierta en el cuello de botella de la conversación; un objetivo de diseño realmente distinto al de los modelos optimizados exclusivamente para la calidad de narración sin conexión.

La ruta práctica de despliegue: GGUF, llama.cpp y FastAPI

Para la mayoría de los usos con alojamiento propio, la configuración que se ha consolidado como estándar no consiste en ejecutar directamente el modelo completo, sino en usar un pipeline cuantizado y más eficiente en recursos. Orpheus está disponible en forma de pesos cuantizados en GGUF (Q4_K_M o Q8_0, con una versión Q8_0 de unos 4GB), servidos mediante un backend de llama.cpp, que caben cómodamente en unos 8GB de VRAM. Sobre esa base, el servidor Orpheus-FastAPI, creado por la comunidad, coloca un endpoint /v1/audio/speech compatible con OpenAI delante del modelo GGUF cargado. Esto permite apuntar directamente el código existente escrito para la API TTS de OpenAI a una instancia local de Orpheus, con ocho voces en inglés disponibles en esa configuración, y cambiar de proveedor con modificaciones mínimas en el código.

Si se busca el máximo rendimiento en vez de la menor carga local posible, el paquete oficial de Python orpheus-speech utiliza vLLM internamente. Es la mejor opción si se quiere optimizar el servicio de muchas solicitudes simultáneas en lugar de ejecutar el modelo cómodamente en una única GPU de consumo.

Primeros pasos con Orpheus TTS

  1. Elige la ruta de despliegue según tu prioridad. Usa GGUF con llama.cpp para obtener la menor carga local en hardware de consumo; utiliza el paquete oficial orpheus-speech, basado en vLLM, si lo que quieres optimizar es el rendimiento a escala.
  2. Para la ruta GGUF, descarga un checkpoint cuantizado. Descarga los pesos GGUF Q4_K_M o Q8_0 y cárgalos mediante llama.cpp o una interfaz compatible como LM Studio.
  3. Añade el servidor Orpheus-FastAPI para lograr una integración compatible con OpenAI. Obtendrás un endpoint /v1/audio/speech estándar, que permite usar Orpheus allí donde tu código ya espera una API TTS al estilo de OpenAI, con ocho voces en inglés incluidas y listas para usar.
  4. Para el paquete oficial, instala mediante pip. pip install orpheus-speech incorpora la ruta de inferencia basada en vLLM; clona primero el repositorio canopyai/Orpheus-TTS si también quieres los scripts de procesamiento de datos y los conjuntos de datos de ejemplo para el ajuste fino.
  5. Elige entre los checkpoints Pretrained y Finetuned Prod. El modelo Finetuned Prod está ajustado para casos de uso TTS cotidianos; el modelo base Pretrained, entrenado con el corpus completo de más de 100.000 horas, es el mejor punto de partida si planeas realizar tu propio ajuste en vez de usar Orpheus directamente.
  6. Activa el streaming de entrada si necesitas la menor latencia posible. El salto de unos 200ms a 100ms requiere específicamente configurar el streaming de entrada; no es el comportamiento predeterminado.

Consejos para obtener mejores resultados

  • Usa las etiquetas de emoción donde una persona realmente haría una pausa o reaccionaría. Colocar <laugh> o <sigh> en un momento natural de la conversación resulta más convincente que repartir etiquetas sin tener en cuenta dónde se produciría una reacción real dentro de la frase.
  • Adapta la ruta de despliegue a tu limitación real. Si la VRAM es escasa, la ruta de GGUF con llama.cpp es la opción más práctica; si atiendes muchas solicitudes simultáneas, el paquete oficial basado en vLLM escalará mejor que una configuración cuantizada de una sola instancia.
  • Realiza el ajuste fino desde el checkpoint Pretrained para casos de uso no estándar. Si tu proyecto necesita un idioma, estilo o ámbito distinto de los que cubre el modelo general Finetuned Prod, empezar desde el modelo base preentrenado con tu propio conjunto de datos es la ruta documentada para la que Canopy Labs proporciona scripts.
  • Usa el servidor FastAPI si estás migrando desde una API TTS comercial. Como reproduce la estructura de endpoints de OpenAI, normalmente requiere menos cambios en el código que adaptarse a una interfaz de inferencia totalmente personalizada.
  • Reserva unos 8GB de VRAM para un despliegue GGUF local. Es el mínimo práctico para obtener un rendimiento cómodo con cuantización Q4/Q8; confirma que tu hardware cumple este requisito antes de decidirte por una configuración propia en vez de una API alojada.

Orpheus TTS frente a otros modelos expresivos y ligeros

Orpheus TTSChatterboxKokoro-82M
Arquitectura principalLLM de voz Llama-3B + códec SNACBasada en difusiónStyleTTS 2 + ISTFTNet
Parámetros3B~0.5B82M
Etiquetas de emoción/reacciónSí, insertadas en línea (<laugh>, <sigh>, etc.)Parámetro de exageraciónNo es una función específica
Clonación de vozSí, zero-shotSí, zero-shotNo, catálogo fijo de voces
Latencia en streaming~200ms (~100ms con streaming de entrada)No es un objetivo principalNo aplicable (centrado en narración por CPU)
Uso de VRAM~8GB (GGUF cuantizado)MenorMínimo, apto para CPU
LicenciaApache 2.0MITApache 2.0

Orpheus intercambia una carga considerablemente mayor que la de modelos como Kokoro o Chatterbox por un resultado que Canopy Labs creó y ajustó específicamente para competir con sistemas comerciales cerrados en expresividad y naturalidad. Si tu hardware puede dedicar la VRAM necesaria y tu caso de uso valora ese rango emocional y el streaming de baja latencia, su resultado se sitúa realmente en un nivel distinto al de las opciones más ligeras de este sitio.

Preguntas frecuentes

¿Qué significa que Orpheus sea un «LLM de voz»?

Significa que Orpheus es, en términos de arquitectura, un modelo de lenguaje autorregresivo estándar, pero entrenado para predecir tokens de audio, que el códec SNAC decodifica en una forma de onda, en vez de tokens de texto: el mismo enfoque generativo subyacente que impulsa los LLM basados en texto, aplicado directamente a la voz.

¿Qué latencia real alcanza Orpheus?

Alrededor de 200ms con streaming estándar, que pueden reducirse a unos 100ms cuando se activa específicamente el streaming de entrada; lo bastante rápido para aplicaciones interactivas en tiempo real.

¿Qué es Orpheus-FastAPI?

Es un servidor creado por la comunidad que coloca un endpoint /v1/audio/speech compatible con OpenAI delante de un modelo Orpheus cuantizado en GGUF y ejecutado localmente, lo que facilita sustituir por Orpheus el código escrito originalmente para la API TTS de OpenAI.

¿Cuánta VRAM necesita Orpheus para ejecutarse localmente?

Alrededor de 8GB de VRAM con cuantización GGUF Q4_K_M o Q8_0 mediante un backend de llama.cpp; solo los pesos Q8_0 ocupan unos 4GB.

¿Orpheus TTS es gratuito para uso comercial?

Sí. Se publica bajo la licencia Apache 2.0, una de las opciones más permisivas entre los modelos TTS de código abierto, sin restricciones que exijan un acuerdo comercial independiente.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →