EchoraEchora
Volver a los modelos

Voxtral TTS: un desafío de pesos abiertos al mercado cerrado de API de voz

10 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Todos los grandes actores de la IA de voz comercial —ElevenLabs entre ellos— operan con un negocio propietario y centrado en la API: alquilas la voz, pero no posees el modelo que hay detrás. La entrada de Mistral AI en este espacio rompe directamente ese patrón. Voxtral TTS se distribuye con todos sus pesos abiertos, lo que permite a una empresa descargarlo, ejecutarlo por completo en su propia infraestructura y no enviar ni un solo fotograma de audio a terceros: una propuesta realmente distinta de alquilar el acceso al modelo cerrado de otra compañía.

¿Qué es Voxtral TTS?

Voxtral TTS es un modelo de texto a voz de 4.000 millones de parámetros y pesos abiertos, publicado por Mistral AI el 26 de marzo de 2026 y distribuido como mistralai/Voxtral-4B-TTS-2603, con pesos BF16 y un conjunto de voces de referencia listas para usar. Es la pieza de generación de voz que completa la familia Voxtral más amplia de Mistral, que comenzó en julio de 2025 como una línea de modelos de comprensión del habla (transcripción, traducción de voz a texto, resumen y respuesta a preguntas sobre audio) y después se amplió con el modelo ASR específico Voxtral Transcribe 2. Al incorporar TTS, Voxtral abarca ahora el ciclo completo —entrada de voz, comprensión del lenguaje y salida de voz— como una sola familia de modelos conectados, en lugar de lanzamientos separados y sin relación entre sí.

Ventajas funcionales de Voxtral TTS

  • Pesos realmente abiertos, que permiten alojarlo en tu propia infraestructura en vez de depender de una API cerrada, como exigen la mayoría de los modelos de voz de calidad comercial comparables.
  • Clonación de voz zero-shot con solo 2 o 3 segundos de audio de referencia, que captura emoción, estilo de habla y acento únicamente a partir de esa breve muestra.
  • Generación “voz como instrucción” (Voice-as-instruction), que sigue directamente la entonación, el ritmo y el carácter emocional del clip de referencia, sin necesidad de etiquetas manuales de prosodia o emoción.
  • Cobertura de nueve idiomas —inglés, francés, alemán, español, neerlandés, portugués, italiano, hindi y árabe—, con clonación de voz entre idiomas y compatibilidad con texto que mezcla lenguas.
  • Streaming de baja latencia, con unos 90ms de latencia de procesamiento del modelo y un factor de tiempo real de aproximadamente 9.7x, lo que significa que sintetiza el audio casi diez veces más rápido de lo que tarda en reproducirse la voz resultante.
  • Comparación directa con ElevenLabs: las evaluaciones de la propia Mistral informan de una tasa de preferencia del 68.4% frente a ElevenLabs Flash v2.5 en pruebas de clonación de voz zero-shot, y de resultados iguales o mejores en similitud del hablante frente a ElevenLabs v3.

Cómo funciona realmente “Voice-as-instruction”

Esta es la decisión de diseño más distintiva de Voxtral TTS, y supone un enfoque significativamente diferente de los sistemas de etiquetas entre corchetes que utilizan otros modelos expresivos. Voxtral TTS separa el contenido semántico del habla (lo que se dice) de su textura acústica (cómo suena) mediante una representación factorizada. Esa separación permite al modelo aplicar el timbre, el tono y la altura de una voz de referencia a cualquier texto generado, mientras mantiene de forma independiente la prosodia lingüística correcta para el idioma del texto; también hace que el propio audio de referencia transmita indicaciones emocionales y estilísticas, en vez de obligarte a anotar el texto con marcadores de estilo separados. En la práctica, esto significa que el clip de referencia no es solo una muestra de timbre: funciona como una instrucción interpretativa que el modelo sigue directamente.

Parte de una pila de voz más amplia

Voxtral TTS no existe de forma aislada: es la pieza más reciente de una familia que también incluye Voxtral Mini, el modelo original de comprensión del habla centrado en la transcripción y la comprensión de audio, y Voxtral Transcribe 2, que añadió reconocimiento automático del habla tanto por lotes como en tiempo real. Si tu proyecto necesita la dirección inversa (audio de entrada y texto o comprensión de salida), en lugar de TTS, los modelos Voxtral anteriores son los que debes considerar. El objetivo declarado de Mistral es ofrecer un flujo de trabajo de voz completo y propiedad de la empresa, que no obligue a combinar proveedores distintos para la entrada, la comprensión y la salida.

Primeros pasos con Voxtral TTS

  1. Descarga la tarjeta del modelo desde Hugging Face. mistralai/Voxtral-4B-TTS-2603 aloja los pesos BF16 y las voces de referencia incluidas; es el punto de partida de cualquier despliegue autoalojado.
  2. Instala vLLM y vLLM-Omni para un servicio de nivel de producción. Mistral trabajó directamente con el equipo de vLLM-Omni para dar soporte a este modelo; necesitarás vllm >= 0.18.0 y vllm-omni >= 0.18.0, que puedes instalar con uv pip install vllm-omni --upgrade.
  3. Utiliza la imagen de Docker lista para usar si prefieres evitar la configuración manual del entorno. Hay una imagen precompilada en Docker Hub que ofrece una vía más rápida para poner en marcha el despliegue.
  4. Usa la API alojada o Mistral Studio si el autoalojamiento no es tu prioridad. Voxtral TTS también está disponible directamente mediante la API de Mistral y su interfaz Studio, con un precio de $0.016 por cada 1.000 caracteres: un punto de partida con menos fricción para evaluar la calidad antes de comprometerse con infraestructura local.
  5. Comprueba las condiciones de licencia de las voces de referencia incluidas antes del uso comercial. Se distribuyen bajo CC BY-NC 4.0, la misma licencia que hereda el modelo en su conjunto; revísala con atención si tu plan de despliegue es comercial en lugar de interno o de evaluación.

Consejos para obtener mejores resultados

  • Trata el clip de referencia como una indicación interpretativa, no solo como una muestra de timbre. Como el modelo interpreta directamente la entonación y el carácter emocional del prompt, un clip de referencia que ya tenga el estilo de entrega deseado te acercará más al resultado objetivo que una muestra plana y neutra, confiando en que el texto por sí solo transmita el tono correcto.
  • Prueba la clonación entre idiomas con tu par de lenguas concreto antes de adoptarla. La capacidad es real y está documentada, pero, como ocurre con la mayoría de los sistemas multilingües, la calidad puede variar según la combinación exacta de idioma de origen y de destino; valida el par que necesita tu proyecto.
  • Utiliza la ruta de streaming para cualquier aplicación conversacional. Gracias a la baja latencia y al alto factor de tiempo real del modelo, resulta especialmente adecuado para agentes de voz en directo y situaciones de traducción en tiempo real, no solo para generar contenido por lotes.
  • Lee detenidamente las condiciones de CC BY-NC 4.0 si estás desarrollando un producto comercial. Aunque el modelo se presenta para flujos de trabajo de voz empresariales, las voces de referencia incluidas y la licencia heredada del modelo no permiten el uso comercial; confirma qué exige realmente tu caso concreto antes de suponer que “pesos abiertos” significa “uso comercial sin restricciones”.
  • Haz pruebas comparativas con tu contenido real en vez de depender únicamente de las comparaciones publicadas por Mistral. Los benchmarks comunicados por el proveedor, incluidos los de ElevenLabs, son una señal útil, pero varían según el idioma y la métrica; prueba tus propios guiones antes de elegir un modelo definitivamente.

Voxtral TTS frente a ElevenLabs y Chatterbox

Voxtral TTSElevenLabsChatterbox
DesplieguePesos abiertos, autoalojableCerrado, solo APIPesos abiertos, autoalojable
Clip de referencia para clonar2–3 segundosVariable5–10 segundos
Control de estilo/emociónVoz como instrucción (sin etiquetas)Controles de estilo limitadosParámetro Exaggeration
Idiomas9Multilingüe (mayor cantidad)Inglés (Multilingual: 23)
LicenciaCC BY-NC 4.0 (no comercial)Propietaria, API comercialMIT

El posicionamiento específico de Voxtral TTS consiste en llevar una calidad realmente empresarial y competitiva con ElevenLabs a un paquete de pesos abiertos y autoalojable, una combinación que sigue siendo relativamente poco común, aunque su licencia no comercial implica que “abierto” no significa automáticamente “sin restricciones para despliegues comerciales”.

Preguntas frecuentes

¿Voxtral TTS es gratuito para uso comercial?

No sin una revisión previa. El modelo y las voces de referencia incluidas se publican bajo CC BY-NC 4.0, una licencia no comercial. A pesar de estar orientado a casos de uso empresariales, un despliegue comercial requiere consultar directamente con Mistral las condiciones de licencia vigentes, en lugar de asumir que los pesos abiertos permiten un uso sin restricciones.

¿Cómo se compara Voxtral TTS con ElevenLabs?

En las evaluaciones publicadas por la propia Mistral, Voxtral TTS logró una tasa de preferencia del 68.4% frente a ElevenLabs Flash v2.5 en pruebas de clonación de voz zero-shot y alcanzó resultados iguales o mejores en similitud del hablante frente a ElevenLabs v3, aunque los resultados varían según el idioma y la métrica concreta de ambos sistemas.

¿Qué diferencia hay entre Voxtral TTS y los demás modelos Voxtral?

Voxtral TTS se ocupa específicamente de la generación de voz. Voxtral Mini y Voxtral Transcribe 2 se encargan de la dirección inversa —comprensión del habla, transcripción y traducción— y conforman el resto de la misma familia más amplia de modelos de voz Voxtral.

¿Cuánto audio de referencia necesita Voxtral TTS para clonar una voz?

Tan solo de 2 a 3 segundos, de los que captura emoción, estilo de habla y acento.

¿Qué velocidad tiene Voxtral TTS?

Unos 90ms de latencia de procesamiento del modelo y un factor de tiempo real de aproximadamente 9.7x, lo que lo hace adecuado para aplicaciones de streaming de baja latencia, como agentes de voz en directo y traducción en tiempo real.

Genera una voz similar desde un audio de referencia

Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.

Crear una voz clonada →