EchoraEchora
Volver a los modelos

Piper: el modelo TTS que no necesita una GPU para existir

3 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Casi todos los modelos de clonación de voz dan por hecho que tienes una GPU, VRAM de sobra y, probablemente, conexión a internet para recurrir a una API alojada como alternativa. Piper no presupone nada de eso. Está creado para funcionar por completo en una CPU, en tiempo real y en hardware tan modesto como una Raspberry Pi: sin viajes de ida y vuelta a la nube, sin dependencia de CUDA y sin esperas. Si la limitación real de tu proyecto es «esto tiene que funcionar en una placa pequeña sin conexión a internet», Piper es una de las pocas opciones TTS de código abierto creadas específicamente para esa realidad, en vez de adaptarse a ella a posteriori.

¿Qué es Piper?

Piper es un sistema neuronal de texto a voz de código abierto creado por el desarrollador Michael Hansen dentro del proyecto de asistente de voz Rhasspy, cuyo primer commit se remonta a noviembre de 2022. Cada voz de Piper es un modelo basado en VITS exportado al runtime de ONNX y acompañado de un pequeño archivo de configuración JSON; espeak-ng se encarga de convertir el texto de entrada en fonemas antes de que la red neuronal genere el audio real. Esa combinación de un modelo compacto y optimizado para ONNX con un fonemizador ligero es lo que permite que Piper suene natural y sea realmente rápido en hardware que no dispone de ningún procesamiento gráfico dedicado.

Por qué es tan ligero

Un modelo de voz típico de Piper tiene alrededor de 15 millones de parámetros —una fracción del tamaño de la mayoría de los modelos centrados en clonación descritos en otros artículos—, y una voz de calidad media se empaqueta en un único archivo ONNX de apenas decenas de megabytes. Las voces se distribuyen en cuatro niveles de calidad: x_low y low (salida de 16kHz) para ocupar el mínimo espacio y generar más rápido, y medium y high (22.05kHz) cuando la calidad del audio importa más que la velocidad bruta. Este diseño por niveles te permite intercambiar deliberadamente calidad por tamaño según las restricciones concretas de tu hardware, en lugar de quedar atado a un único tamaño de modelo independientemente del dispositivo en el que lo despliegues.

Las cifras de velocidad respaldan directamente su posicionamiento «ultraligero»: Piper sintetiza en tiempo real en una Raspberry Pi 4 o 5 usando solo la CPU y funciona aproximadamente un orden de magnitud más rápido que el tiempo real en una CPU de escritorio moderna. Es lo bastante rápido como para que la aceleración por GPU no solo sea opcional, sino que ni siquiera forme parte del diseño.

Cobertura de idiomas y voces

Piper incluye más de 100 voces preentrenadas que abarcan más de 35 idiomas, entre ellos inglés, alemán, francés, español, italiano, portugués, neerlandés, polaco, ruso, chino, árabe, turco y ucraniano, todos alojados abiertamente en Hugging Face. Los archivos de voz siguen una convención de nombres coherente (<language>_<region>-<name>-<quality>), lo que facilita identificar y cambiar entre idiomas, acentos regionales y niveles de calidad concretos sin tener que rebuscar en la documentación cada vez.

Dónde se usa Piper realmente: Home Assistant y más allá

La presencia práctica de Piper se concentra exactamente en los casos de uso a los que apunta su diseño ligero: automatización doméstica, asistentes de voz sin conexión, herramientas de accesibilidad y quioscos integrados donde la latencia, la privacidad y la ausencia de costes continuos de alojamiento importan más que un acabado vocal de estudio. Es una opción de texto a voz nativa con soporte oficial en Home Assistant, se comunica mediante el protocolo Wyoming y se detecta automáticamente una vez instalada, con en_US-lessac-medium como voz predeterminada. Es una señal clara de hasta qué punto este proyecto se ha adoptado específicamente para instalaciones domésticas inteligentes locales y centradas en la privacidad, en vez de para la producción de contenidos.

Un detalle de mantenimiento que conviene conocer

El repositorio original de Piper se archivó en octubre de 2025 y, desde entonces, el desarrollo activo se trasladó a un fork mantenido por el equipo Voice de Open Home Foundation. Esto importa por dos razones prácticas: primero, si sigues tutoriales o documentación antiguos, confirma si apuntan al repositorio original archivado o al fork que se mantiene activamente. Segundo, la licencia cambió durante el proceso: el proyecto original tenía licencia MIT, mientras que el fork de desarrollo actual se publica bajo GPL-3.0, un conjunto de condiciones sustancialmente distinto si entre tus planes está el uso comercial. Antes de crear un producto alrededor de Piper, comprueba qué repositorio y qué licencia se aplican realmente a la versión que vas a desplegar.

Primeros pasos con Piper

  1. Instálalo con pip dentro de un entorno virtual. python3 -m venv .venv && source .venv/bin/activate && pip install piper-tts evita conflictos con instalaciones de Python administradas por el sistema, una causa habitual de problemas de instalación, especialmente en Raspberry Pi OS.
  2. Descarga un modelo de voz y su configuración correspondiente. Cada voz necesita tanto el archivo de modelo .onnx como el archivo de configuración .json correspondiente del repositorio de voces de Hugging Face; descarga ambos y asegúrate de emparejarlos correctamente.
  3. Confirma a qué repositorio se refieren tus instrucciones. Debido al fork de 2025, verifica si una guía concreta está escrita para el proyecto original rhasspy/piper o para el fork actual OHF-Voice/piper1-gpl, ya que los detalles de configuración pueden variar ligeramente entre ambos.
  4. Ejecuta primero una prueba rápida de síntesis. La CLI de Piper puede generar un archivo WAV a partir de una cadena de texto con un solo comando, la forma más rápida de confirmar que el modelo y los archivos de configuración están bien emparejados antes de conectarlos a un proyecto más amplio.
  5. Usa el complemento oficial de Home Assistant si esa es tu plataforma de destino. En vez de integrar Piper manualmente en una instalación doméstica inteligente, el complemento oficial gestiona automáticamente la detección y la configuración mediante el protocolo Wyoming.
  6. Ajusta el nivel de calidad al hardware, no solo a tus aspiraciones. En dispositivos realmente limitados, las voces x_low o low mantienen la generación rápida y reducen al mínimo el uso de recursos; reserva los niveles medium o high para hardware con algo más de margen.

Consejos para obtener mejores resultados

  • Empieza por la instalación con pip, salvo que tengas un motivo concreto para compilar desde el código fuente. Es la vía más rápida y fiable en Raspberry Pi OS, Ubuntu y WSL en Windows, según las numerosas pruebas de la comunidad en esas plataformas.
  • No selecciones automáticamente el nivel de calidad más alto. Los niveles x_low/low existen precisamente porque muchos casos de uso integrados no necesitan una salida de 22.05kHz; si vas a desplegarlo en hardware realmente limitado, prueba primero los niveles inferiores.
  • Considera Piper una herramienta para la restricción de despliegue, no para la restricción de contenido. Si tu prioridad es una narración expresiva y cargada de emoción, te servirá mejor un modelo más grande centrado en clonación. Toda la propuesta de valor de Piper consiste en su fiabilidad y tamaño en hardware que no puede ejecutar esos modelos más grandes en absoluto.
  • Comprueba la licencia del repositorio de destino antes de un despliegue comercial. Dada la división entre el proyecto original con licencia MIT y el fork actual bajo GPL-3.0, es un detalle verdaderamente importante que debes verificar en vez de presuponer, sobre todo para cualquier producto comercial.
  • Utiliza específicamente la vía de integración del protocolo Wyoming para proyectos de hogar inteligente. Si creas algo relacionado con Home Assistant o con ecosistemas de asistentes de voz similares, trabajar mediante la integración establecida basada en Wyoming es más fácil de mantener que una implementación personalizada.

Piper frente a otros modelos ligeros y compatibles con CPU

PiperKokoro-82MModelos típicos de clonación en GPU
Parámetros~15M82M350M–1.7B+
Funciona solo con CPUSí, por diseñoSí, de forma nativaOpcional en el mejor de los casos; se recomienda encarecidamente una GPU
Tiempo real en Raspberry PiSíNo es un objetivo principal de diseñoNo
Clonación de vozNo, catálogo fijo de vocesNo, catálogo fijo de vocesSí, normalmente es la función principal
Idiomas35+8Varía; con esta amplitud, suelen ser menos
Mejor opción paraDispositivos integrados, hogar inteligente, quioscos sin conexiónNarración en servidor sensible al costeClonación expresiva, diálogo, contenido de producción

El nicho específico de Piper se encuentra en el extremo más pequeño y con menos recursos del espectro de despliegue: si Kokoro está creado para «funcionar de forma económica en un servidor con CPU», Piper está creado para «funcionar en un dispositivo que quizá ni siquiera tenga ventilador».

Preguntas frecuentes

¿Piper realmente no necesita ninguna GPU?

Correcto. Piper está diseñado para funcionar solo con CPU y no usa VRAM: se creó específicamente para ejecutarse sin conexión y en tiempo real en hardware integrado como una Raspberry Pi, que es precisamente el caso de uso al que apunta.

¿Puede Piper clonar la voz de una persona concreta?

No. Piper usa un catálogo fijo de más de 100 voces preentrenadas en más de 35 idiomas, en vez de clonación de voz zero-shot a partir de un clip de referencia. Si la clonación es tu requisito principal, otro modelo encajará mejor.

¿Piper todavía se mantiene activamente?

Sí, aunque el desarrollo se trasladó del repositorio original rhasspy/piper (archivado en octubre de 2025) a un fork mantenido por el equipo Voice de Open Home Foundation y publicado bajo una licencia distinta (GPL-3.0 en vez de la licencia MIT original).

¿Qué hardware necesita Piper realmente?

Funciona en tiempo real en una Raspberry Pi 4 o 5 usando solo la CPU y aproximadamente diez veces más rápido que el tiempo real en una CPU de escritorio moderna típica, sin requerir GPU ni configuración de CUDA en ningún momento.

¿Piper es gratuito para uso comercial?

Depende del repositorio y de la versión que uses: el proyecto original tenía licencia MIT, pero el fork que se mantiene activamente está bajo GPL-3.0, lo que conlleva obligaciones distintas. Comprueba la licencia concreta de la versión que despliegues antes de utilizarla comercialmente.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →