EchoraEchora
Volver a los modelos

Amazon Polly: cuatro niveles de precio para pagar solo por la calidad que realmente necesitas

14 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de las API de TTS ofrecen un solo nivel de calidad de voz y un único precio, tanto si generas un breve mensaje de IVR como un capítulo completo de un audiolibro. Amazon Polly, el servicio de texto a voz de AWS, adopta deliberadamente un enfoque distinto: cuatro motores de voz independientes, cada uno dirigido a un equilibrio diferente entre calidad y coste. Así, un sistema de notificaciones de gran volumen no paga tarifas prémium por una expresividad que no necesita, y un proyecto centrado en la narración no tiene que conformarse con un resultado robótico para ahorrar dinero.

¿Qué es Amazon Polly?

Amazon Polly es el servicio de texto a voz en la nube de AWS. Utiliza aprendizaje profundo para convertir texto escrito en habla natural en decenas de idiomas. Está concebido como un servicio central de AWS, por lo que se integra de forma nativa con el resto de su ecosistema —S3 para almacenar audio, CloudWatch para supervisar e IAM para controlar el acceso—, en lugar de funcionar como un producto independiente añadido a AWS a posteriori.

Ventajas funcionales de Amazon Polly

  • Cuatro motores de voz distintos con cuatro precios diferentes, para ajustar de forma deliberada el coste a la calidad que realmente necesita cada contenido, en lugar de pagar una única tarifa prémium por todo.
  • Amplia cobertura de idiomas, con decenas de lenguas y variantes regionales de voz.
  • Profunda integración nativa con AWS, que funciona directamente con S3, CloudWatch, IAM y Lambda para los equipos que ya desarrollan sobre la infraestructura de AWS.
  • Un nivel gratuito de 12 meses realmente generoso, con una asignación significativa de caracteres para los cuatro motores, no solo para el más barato.
  • Un compromiso de privacidad declarado: Amazon Polly no conserva el contenido de los textos enviados.
  • Compatibilidad completa con SSML, que permite controlar directamente la pronunciación, el ritmo y el énfasis en todos los niveles de motor.

Los cuatro motores: cómo elegir el nivel adecuado para tu contenido

Esta estructura por niveles es la característica que define a Polly, y elegir correctamente importa más que optar por defecto por la alternativa más cara. Las voces Standard son el nivel original y más asequible: resultan sólidas para notificaciones básicas, mensajes de IVR y otros casos de gran volumen y pocos matices en los que la claridad importa más que una expresividad natural. Las voces Neural, basadas en aprendizaje profundo, son el nivel que se recomienda con más frecuencia para producción: ofrecen una entonación más fluida, un ritmo más natural y un tratamiento notablemente mejor de las frases complejas, con un sobrecoste real pero justificado frente a Standard. Las voces Generative, incorporadas en 2024 y ampliadas de forma significativa en marzo de 2026, utilizan un modelo Transformer de mil millones de parámetros para avanzar aún más en una interpretación expresiva y matizada. Es el nivel indicado cuando el contenido se beneficia de verdad de una actuación más natural que la que ofrece Neural. Las voces Long-Form se han creado específicamente para un problema completamente distinto: la escucha prolongada. En vez de optimizar una sola línea o párrafo, Long-Form se ajusta específicamente para reducir la fatiga del oyente en contenidos realmente largos, como audiolibros o artículos completos. Es el nivel de mayor coste, reservado para contenidos en los que esa optimización concreta para una escucha extensa compensa de verdad.

Lo que Polly no hace

Conviene saberlo con claridad antes de construir en torno al servicio: Amazon Polly no ofrece clonación de voz como capacidad principal, a diferencia de algunos proveedores de nube competidores que han añadido funciones de clonación restringidas. Las reseñas independientes también señalan una carencia real a la hora de crear voces de marca muy diferenciadas sin recurrir a opciones de personalización más avanzadas y con precio independiente, y que los competidores especializados en TTS expresivo todavía pueden superar al nivel más expresivo de Polly en interpretaciones realmente dramáticas y cargadas de emoción. Si el requisito central de tu proyecto es reproducir una voz real concreta o maximizar al límite la amplitud emocional, merece la pena comparar directamente el nivel Generative de Polly con esas alternativas antes de decidirse, en vez de asumir que el motor más reciente cubre todas las carencias.

Primeros pasos con Amazon Polly

  1. Configura una cuenta de AWS y credenciales de IAM. Como se accede a Polly mediante la autenticación estándar de AWS, antes de realizar llamadas a la API necesitarás una clave de acceso y una clave secreta con los permisos de Polly adecuados asociados a tu usuario o rol de IAM.
  2. Instala el SDK de AWS para tu lenguaje. En Python, boto3 es la biblioteca cliente estándar: pip install boto3 permite empezar, y hay SDK equivalentes para JavaScript, Java y otros lenguajes compatibles.
  3. Llama a synthesize_speech con el texto y el motor elegido. Una llamada básica en Python se parece a polly_client.synthesize_speech(Text="your text", OutputFormat="mp3", VoiceId="Joanna", Engine="neural"). El parámetro Engine es donde eliges específicamente Standard, Neural, Generative o Long-Form.
  4. Comprueba qué voces admite cada motor antes de dar por supuesta la compatibilidad total. No todas las voces están disponibles en los cuatro motores: confirma que el VoiceId elegido admite realmente el nivel que necesitas antes de construir un pipeline alrededor de esa combinación.
  5. Usa etiquetas SSML directamente en el texto de entrada para conseguir un control más preciso. Al envolver la entrada en marcado SSML, obtienes control de pronunciación, ritmo y énfasis en cualquiera de los cuatro motores.
  6. Supervisa el uso con CloudWatch y presupuesta los costes relacionados con AWS. Además del precio por carácter de cada motor, ten en cuenta las tarifas de transferencia de datos y el coste de almacenamiento en S3 si guardas los archivos de audio generados, ya que se facturan por separado del uso principal de Polly.

Consejos para obtener mejores resultados

  • Usa Neural por defecto para la mayoría del contenido de producción, no Standard. Dado que Neural suena de forma notablemente más natural por un incremento moderado de coste frente a Standard, es la opción predeterminada más razonable para cualquier contenido orientado al cliente, en lugar de tratar Standard como el punto de partida seguro.
  • Reserva Generative y Long-Form para contenido que se beneficie específicamente de ellos. Tanto la expresividad de Generative como el ajuste de Long-Form para reducir la fatiga son ventajas reales, pero tienen un coste por carácter notablemente superior. Ajusta el nivel al contenido que realmente necesita esa calidad concreta, en lugar de usar siempre el más alto.
  • Prueba la combinación concreta de voz y motor antes de comprometerte. Como no todas las voces son compatibles con los cuatro motores, valida pronto la disponibilidad para el idioma y la voz que buscas, en vez de descubrir una incompatibilidad después de construir el pipeline alrededor de ella.
  • Consulta directamente los precios actuales antes de elaborar un presupuesto a escala. Amazon ha ajustado los precios de los motores de Polly con el tiempo, y las tarifas por carácter citadas pueden variar según la fuente. Confirma las cifras actuales en la propia página de precios de AWS en vez de depender de un dato citado que podría estar desactualizado.
  • Busca otra opción si la clonación de voz es un requisito central. Como Polly no la ofrece como capacidad integrada, un proveedor que admita específicamente la clonación, con el consentimiento y las salvaguardas adecuados, encaja de forma más directa con esa necesidad concreta.

Amazon Polly frente a Azure AI Speech y Edge TTS

Amazon PollyAzure AI SpeechEdge TTS
Estructura de preciosCuatro niveles ($4–$100+ por 1 millón de caracteres)Dos niveles principales (Neural, Neural HD)Gratis
Clonación de vozNo es una función principalSí, mediante Personal Voice restringidoNo aplicable
Integración con el ecosistemaIntegración profunda con AWS (S3, CloudWatch, IAM)Integración profunda con Azure/FoundryNinguna: herramienta independiente
Nivel gratuitoSí, 12 meses, asignación generosaSí, asignación mensualIlimitado, gratuito por naturaleza
API oficial y con licenciaSíSíNo: herramienta comunitaria no oficial
Mejor opción paraEquipos que ya usan AWS y control de costes por nivelesEquipos que necesitan SSML avanzado y entrenamiento de voces personalizadasPrototipos y proyectos personales

El nicho específico de Amazon Polly es la combinación de una segmentación deliberada de costes y una profunda integración nativa con AWS. Es la opción predeterminada adecuada para cualquier equipo que ya desarrolle sobre la infraestructura de AWS y quiera controlar de forma explícita la relación entre precio y calidad, en vez de aceptar una tarifa fija para todos los casos de uso.

Preguntas frecuentes

¿Qué diferencia hay entre los cuatro motores de voz de Polly?

Standard es el más asequible y resulta más apropiado para notificaciones básicas e IVR. Neural ofrece una entonación y un ritmo notablemente más naturales por un sobrecoste moderado, y se recomienda para la mayoría del contenido de producción. Generative utiliza un modelo Transformer de mil millones de parámetros para ofrecer una interpretación más expresiva y matizada. Long-Form está ajustado específicamente para reducir la fatiga del oyente en contenidos largos como audiolibros.

¿Amazon Polly admite la clonación de voz?

No como función principal disponible de forma general. Si clonar una voz concreta es un requisito central, encaja mejor un proveedor que ofrezca esa capacidad directamente, con las salvaguardas de consentimiento adecuadas.

¿Amazon Polly se puede usar gratis?

Ofrece un nivel gratuito de 12 meses para nuevos clientes de AWS, con asignaciones de caracteres que varían según el motor. La asignación de Standard es considerablemente mayor que la de Generative o Long-Form. Después del nivel gratuito, es un servicio de pago por uso facturado por carácter.

¿Amazon Polly conserva el texto que envío?

No. Amazon declara directamente que Polly no conserva el contenido de los textos enviados.

¿Qué motor debería usar para una aplicación orientada al cliente?

Neural suele ser el punto de partida recomendado para contenido orientado al cliente, porque equilibra la calidad natural de la voz con el coste. Reserva Generative específicamente para contenido en el que su expresividad añadida justifique el precio superior.

Crea voz online con Echora

Para un flujo en el navegador con un objetivo similar, usa la herramienta de Texto a voz de Echora. Convierte hasta 5.000 caracteres en audio de un solo hablante, escucha el resultado y descarga el MP3 final.

Convertir texto en voz →