WhisperSpeech: un modelo de transcripción funcionando al revés
- ¿Qué es WhisperSpeech?
- Cómo funciona realmente la inversión de Whisper
- El pipeline de dos etapas
- Velocidad y capacidad multilingüe emergente
- Primeros pasos con WhisperSpeech
- Consejos para obtener mejores resultados
- WhisperSpeech frente a otros modelos de clonación totalmente abiertos
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Whisper de OpenAI es uno de los modelos de reconocimiento de voz más fiables que existen: se entrenó con una cantidad enorme de audio multilingüe para convertir la voz en texto preciso. Collabora, el equipo detrás de WhisperSpeech, observó ese modelo y planteó una pregunta realmente ingeniosa: si Whisper entiende tan bien lo que significa el habla, ¿qué ocurre al ejecutarlo al revés? WhisperSpeech es la respuesta: un sistema de texto a voz construido mediante la inversión de la propia arquitectura de Whisper, en lugar de diseñar un pipeline TTS desde cero.
¿Qué es WhisperSpeech?
WhisperSpeech es un sistema TTS de código abierto de Collabora, desarrollado anteriormente bajo el nombre spear-tts-pytorch antes de adoptar su denominación actual. La ambición declarada del proyecto es directa: convertirse para la voz en lo que Stable Diffusion llegó a ser para las imágenes, es decir, una herramienta potente, modificable y segura sobre la que construir productos comerciales. Este último punto es deliberado y concreto: todo el código de WhisperSpeech se publica bajo Apache-2.0/MIT y sus modelos se entrenan exclusivamente con datos de voz que cuentan con las licencias adecuadas —el conjunto de datos LibreLight en inglés para la versión actual—, en vez de emplear datos de procedencia más turbia y recopilados indiscriminadamente que enturbian la viabilidad comercial de buena parte de la investigación abierta en TTS.
Cómo funciona realmente la inversión de Whisper
La arquitectura de Whisper se divide en dos partes: un codificador que convierte el audio en un flujo continuo de embeddings, capturando a la vez el significado contextual y la prosodia, y un decodificador que utiliza atención cruzada para convertir esos embeddings en palabras reales, es decir, en una transcripción. WhisperSpeech ejecuta esa misma estructura en sentido contrario: parte del texto, genera los embeddings equivalentes y después los transforma en sonido, en lugar de extraerlos del sonido.
Lo verdaderamente ingenioso es lo que logra reutilizar. El codificador de Whisper, entrenado con un volumen enorme de audio multilingüe, produce una representación semántica del contenido hablado extraordinariamente sólida. Arquitecturas como SPEAR-TTS de Google y VALL-E se basan internamente en un tipo similar de extracción de tokens semánticos, pero sus codificadores semánticos concretos nunca se publicaron. Al reutilizar el propio codificador de Whisper para esta función, WhisperSpeech ofrece un equivalente de código abierto y directamente intercambiable para un componente que sistemas comparables habían mantenido cerrado. Esta es una de las razones por las que el proyecto se describe como una solución a una carencia real y no como una mera reproducción del trabajo existente con una marca nueva.
El pipeline de dos etapas
WhisperSpeech sigue el mismo patrón general de dos etapas basado en tokens que popularizaron AudioLM, SPEAR-TTS y MusicGen de Meta: divide la síntesis de voz en una fase de «lectura» y otra de «habla», en lugar de resolverla en un único paso monolítico. La etapa de texto a semántica (T2S) utiliza el enfoque derivado de Whisper para convertir el texto de entrada en tokens semánticos. La etapa de semántica a acústica (S2A) transforma después esos tokens en audio real, utilizando EnCodec de Meta para el modelado acústico y el vocoder Vocos —de Charactr— para renderizar la onda final de alta calidad. En lugar de construir cada uno de estos componentes desde cero, el proyecto se apoyó deliberadamente en piezas de código abierto consolidadas para cada etapa: Whisper para la comprensión semántica, EnCodec para la representación acústica y Vocos como vocoder. Así ensambló algo nuevo a partir de componentes que ya habían demostrado su validez de forma independiente.
Velocidad y capacidad multilingüe emergente
Después de añadir compatibilidad con torch.compile, KV-caching y ajustes específicos en las capas, WhisperSpeech alcanzó una generación aproximadamente 12 veces más rápida que el tiempo real en una RTX 4090 de consumo. Fue una optimización importante que lo llevó de la velocidad propia de la investigación a una inferencia realmente práctica en hardware accesible. En el ámbito multilingüe, el equipo realizó una prueba de concepto: entrenó un modelo S2A pequeño con un conjunto de datos combinado en inglés, polaco y francés, y consiguió clonar voces francesas utilizando tokens semánticos que solo se habían entrenado con inglés y polaco. El resultado es una señal relevante: sugiere que un único tokenizador compartido podría cubrir muchos idiomas en vez de necesitar uno distinto entrenado para cada lengua, aunque sigue siendo un trabajo exploratorio y temprano, no una versión multilingüe terminada.
Primeros pasos con WhisperSpeech
La forma más rápida de escuchar WhisperSpeech es utilizar el notebook de Google Colab proporcionado por el proyecto, que ejecuta la inferencia sin ninguna configuración local. Si prefieres ejecutarlo por tu cuenta, tanto los modelos preentrenados como sus correspondientes conjuntos de datos de entrenamiento convertidos están disponibles en Hugging Face, por lo que puedes realizar inferencia localmente o utilizarlos como punto de partida para entrenar tu propia variante. La comunidad de Discord del proyecto, alojada en el canal de generación de audio del servidor de LAION, es un lugar activo donde plantear dudas de configuración o seguir el desarrollo multilingüe en curso.
Consejos para obtener mejores resultados
- Comprueba la cobertura de idiomas actual antes de asumir que el soporte multilingüe está listo para producción. La versión estable sigue centrada en el inglés —mediante LibreLight—; el prometedor resultado de clonación en francés procedía de un pequeño modelo de prueba de concepto, no de la versión principal. Verifica el estado actual del proyecto antes de planificar un uso con una cobertura lingüística más amplia.
- Utiliza primero el notebook de Colab para validar la calidad con tu contenido. Es una forma más sencilla de escuchar la salida real en tu caso concreto antes de comprometerte con la instalación y configuración local.
- Aprovecha las optimizaciones de velocidad de inferencia si vas a desplegar a escala. La cifra de 12 veces el tiempo real en una RTX 4090 refleja optimizaciones específicas —torch.compile y KV-caching—; asegúrate de aplicarlas también en tu despliegue, en vez de ejecutar una configuración base sin optimizar.
- Ten en cuenta la ventaja de las licencias si te preocupa el despliegue comercial. Como el proyecto se creó específicamente en torno a datos de entrenamiento con las licencias adecuadas y licencias de código permisivas, constituye un punto de partida con un riesgo realmente menor que los proyectos TTS con una procedencia de datos menos transparente. Conviene incluir este aspecto en cualquier selección de proveedor o modelo donde la revisión legal sea importante.
WhisperSpeech frente a otros modelos de clonación totalmente abiertos
| WhisperSpeech | VoiceCraft | F5-TTS | |
|---|---|---|---|
| Idea arquitectónica central | Pipeline ASR de Whisper ejecutado al revés | Relleno de tokens para edición y clonación | Diffusion Transformer + flow matching |
| Procedencia de los datos de entrenamiento | Exclusivamente datos con las licencias adecuadas (LibreLight) | Fuentes abiertas y reales | Conjunto de datos Emilia (licencia no comercial) |
| Licencia del código | Apache-2.0 / MIT | Abierto | Código abierto, pesos CC-BY-NC |
| Uso comercial | Diseñado expresamente para que sea seguro | Abierto, consultar las condiciones de uso ético | Requiere autorización independiente |
| Velocidad de inferencia | ~12 veces el tiempo real (RTX 4090, optimizado) | No es su prioridad principal | Factor de tiempo real de ~0,15 |
| Cobertura de idiomas actual | Inglés (multilingüe en pruebas iniciales) | Centrado en el inglés | Centrado principalmente en el inglés |
El nicho específico de WhisperSpeech es la combinación de una idea arquitectónica elegante y eficiente en recursos —reutilizar Whisper en lugar de entrenar un codificador semántico nuevo desde cero— con una apuesta realmente deliberada por licencias de datos claras. Esta combinación importa especialmente a los equipos para los que «¿podemos publicar esto legalmente?» es una pregunta tan importante como «¿suena bien?».
Preguntas frecuentes
¿Cómo genera voz exactamente la «inversión de Whisper»?
Whisper convierte normalmente el audio en embeddings y después en texto mediante su estructura de codificador y decodificador. WhisperSpeech invierte ese flujo: parte del texto, genera los embeddings equivalentes y los convierte en audio, en vez de extraerlos de él.
¿Cómo se llamaba WhisperSpeech anteriormente?
Se desarrolló originalmente con el nombre spear-tts-pytorch, que reflejaba la inspiración arquitectónica tomada de la investigación SPEAR-TTS de Google, antes de pasar a llamarse WhisperSpeech.
¿Es seguro utilizar WhisperSpeech en un producto comercial?
Ese es un objetivo de diseño explícito: el código se publica bajo Apache-2.0/MIT y los modelos se entrenan únicamente con datos de voz que cuentan con las licencias adecuadas, precisamente para evitar el riesgo de procedencia de datos que afecta a muchos proyectos TTS abiertos entrenados con audio recopilado o con licencias poco claras.
¿Admite WhisperSpeech otros idiomas además del inglés?
La versión estable actual se entrena con el conjunto de datos LibreLight en inglés. Un modelo multilingüe de prueba de concepto —inglés, polaco y francés— ha demostrado resultados prometedores en clonación de voz entre idiomas, pero el soporte multilingüe más amplio seguía en desarrollo en las actualizaciones públicas más recientes del proyecto.
¿Con qué rapidez genera audio WhisperSpeech?
Después de aplicar optimizaciones específicas —torch.compile, KV-caching y ajustes en las capas—, el proyecto comunicó una generación aproximadamente 12 veces más rápida que el tiempo real en una GPU RTX 4090 de consumo.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.