Amazon Polly: texto a voz en la nube de AWS, cuatro motores
Amazon Polly es el servicio TTS en la nube de AWS y ofrece cuatro motores de voz distintos, desde voces Standard económicas hasta narración Long-Form prémium, todo integrado en AWS.
Guías sobre modelos de voz con IA de código abierto y populares, y cómo probar capacidades comparables en Echora.
Amazon Polly es el servicio TTS en la nube de AWS y ofrece cuatro motores de voz distintos, desde voces Standard económicas hasta narración Long-Form prémium, todo integrado en AWS.
Azure AI Speech es el servicio TTS oficial en la nube de Microsoft, con cientos de voces neuronales, entrenamiento de voces personalizadas y control SSML completo a escala real.
Edge TTS es una herramienta gratuita y de código abierto que accede a las mismas voces en línea de la función Leer en voz alta de Microsoft Edge, sin necesidad de clave de API ni cuenta.
SeamlessM4T es un modelo de código abierto de Meta que unifica reconocimiento de voz, traducción y síntesis de voz en un solo sistema para hasta 100 idiomas.
MaskGCT es un modelo TTS no autorregresivo de Amphion que prescinde por completo de la alineación y la predicción de duración, y clona una voz con solo 5 segundos de audio.
FireRedTTS es un framework TTS fundacional de Xiaohongshu que ofrece clonación de voz zero-shot para doblaje y voz coloquial ajustada con instrucciones para chatbots de IA.
Spark-TTS utiliza BiCodec, un códec de voz de flujo único basado en Qwen2.5, para la clonación de voz zero-shot y la creación de voces totalmente sintéticas en un único modelo abierto.
NeuTTS Air es un modelo TTS de Neuphonic para ejecutarse en el dispositivo, con menos de 1.000 millones de parámetros, que clona una voz con solo 3 segundos de audio y funciona en teléfonos y Raspberry Pi.
Kyutai Pocket TTS es un modelo de 100M de parámetros con licencia MIT que ejecuta síntesis de voz en tiempo real y clonación de voz zero-shot solo con CPU, sin necesidad de GPU.
KaniTTS combina un modelo de lenguaje LFM2 compacto con un códec neuronal de audio eficiente y ejecuta síntesis de voz en tiempo real con solo 3 GB de VRAM de GPU en total.
VoxCPM es un modelo TTS de OpenBMB sin tokenizador para chino e inglés que alcanza un factor de tiempo real de 0,17 en una GPU de consumo y genera prosodia automática según el contexto.
Voxtral TTS es un modelo de pesos abiertos de 4B de Mistral AI que clona una voz a partir de 2–3 segundos de audio y se ha comparado directamente con ElevenLabs en calidad.