Amazon Polly: quatro níveis de preço para pagar apenas pela qualidade de que você realmente precisa
- O que é o Amazon Polly?
- Vantagens funcionais do Amazon Polly
- Os quatro mecanismos: como escolher o nível certo para o seu conteúdo
- O que o Polly não faz
- Como começar a usar o Amazon Polly
- Dicas para obter resultados melhores
- Amazon Polly em comparação com Azure AI Speech e Edge TTS
- Perguntas frequentes
- Crie voz online com a Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
A maioria das APIs de TTS oferece um único nível de qualidade de voz e um só preço, seja para gerar uma mensagem curta de URA ou um capítulo inteiro de audiolivro. O Amazon Polly, serviço de texto para fala da AWS, adota deliberadamente uma abordagem diferente: quatro mecanismos de voz separados, cada um voltado para uma relação distinta entre qualidade e custo. Assim, um sistema de notificações de alto volume não paga valores premium por uma expressividade de que não precisa, e um projeto centrado em narração não fica preso a uma saída robótica apenas para economizar.
O que é o Amazon Polly?
O Amazon Polly é o serviço de texto para fala baseado em nuvem da AWS e usa aprendizado profundo para converter texto escrito em fala natural em dezenas de idiomas. Ele foi criado como um serviço central da AWS, o que significa que se integra de forma nativa ao restante do ecossistema — S3 para armazenamento de áudio, CloudWatch para monitoramento e IAM para controle de acesso —, em vez de funcionar como um produto independente anexado à AWS posteriormente.
Vantagens funcionais do Amazon Polly
- Quatro mecanismos de voz distintos com quatro preços diferentes, permitindo combinar deliberadamente o custo com a qualidade que o conteúdo específico realmente exige, em vez de pagar uma única tarifa premium por tudo.
- Ampla cobertura de idiomas, abrangendo dezenas de línguas e variantes regionais de voz.
- Integração nativa profunda com a AWS, funcionando diretamente com S3, CloudWatch, IAM e Lambda para equipes que já desenvolvem na infraestrutura da AWS.
- Um nível gratuito de 12 meses realmente generoso, com uma cota significativa de caracteres em todos os quatro mecanismos, não apenas no mais barato.
- Um compromisso de privacidade declarado: o Amazon Polly não retém o conteúdo dos textos enviados.
- Compatibilidade abrangente com SSML, oferecendo controle direto sobre pronúncia, ritmo e ênfase em todos os níveis de mecanismo.
Os quatro mecanismos: como escolher o nível certo para o seu conteúdo
Essa estrutura em níveis é a característica que define o Polly, e escolher corretamente importa mais do que usar por padrão a opção mais cara. As vozes Standard são o nível original e mais acessível — uma opção sólida para notificações básicas, mensagens de URA e outros casos de uso de alto volume e pouca nuance, nos quais a clareza importa mais do que a expressividade natural. As vozes Neural, desenvolvidas com aprendizado profundo, são o nível mais recomendado para uso em produção — entonação mais suave, ritmo mais natural e um tratamento claramente melhor de frases complexas, com um custo adicional real, mas justificável, em relação ao Standard. As vozes Generative, adicionadas em 2024 e ampliadas significativamente em março de 2026, usam um modelo Transformer de um bilhão de parâmetros para avançar ainda mais em uma interpretação expressiva e cheia de nuances — é o nível indicado quando o conteúdo realmente se beneficia de um desempenho mais natural do que o Neural oferece. As vozes Long-Form foram criadas especificamente para um problema totalmente diferente: a escuta prolongada. Em vez de otimizar uma única linha ou parágrafo, o Long-Form é ajustado especificamente para reduzir a fadiga do ouvinte em conteúdos realmente longos, como audiolivros ou artigos completos — é o nível de maior custo, reservado para conteúdos nos quais essa otimização específica para duração da escuta realmente compensa.
O que o Polly não faz
Vale a pena saber isso com franqueza antes de desenvolver em torno do serviço: o Amazon Polly não oferece clonagem de voz como recurso principal, ao contrário de alguns provedores de nuvem concorrentes que adicionaram funções restritas de clonagem. Avaliações independentes também apontam uma lacuna real na criação de vozes de marca altamente distintas sem recorrer a opções de personalização mais avançadas e cobradas separadamente, além de observarem que concorrentes especializados em TTS expressivo ainda podem superar o nível mais expressivo do Polly em interpretações realmente dramáticas e carregadas de emoção. Se o requisito central do seu projeto é reproduzir uma voz real específica ou maximizar a amplitude emocional bruta, vale comparar diretamente o nível Generative do Polly com essas alternativas antes de decidir, em vez de presumir que o mecanismo mais recente elimina todas as lacunas.
Como começar a usar o Amazon Polly
- Configure uma conta da AWS e credenciais do IAM. Como o acesso ao Polly usa a autenticação padrão da AWS, você precisará de uma chave de acesso e uma chave secreta com as permissões adequadas do Polly vinculadas ao usuário ou função do IAM antes de fazer qualquer chamada de API.
- Instale o SDK da AWS para a sua linguagem. Em Python,
boto3é a biblioteca cliente padrão —pip install boto3permite começar, e há SDKs equivalentes para JavaScript, Java e outras linguagens compatíveis. - Chame
synthesize_speechcom o texto e o mecanismo escolhido. Uma chamada básica em Python se parece compolly_client.synthesize_speech(Text="your text", OutputFormat="mp3", VoiceId="Joanna", Engine="neural")— é no parâmetroEngineque você seleciona especificamente Standard, Neural, Generative ou Long-Form. - Confira quais vozes são compatíveis com cada mecanismo antes de presumir compatibilidade total. Nem toda voz está disponível nos quatro mecanismos — confirme se o
VoiceIdescolhido realmente aceita o nível desejado antes de desenvolver um pipeline em torno dessa combinação. - Use tags SSML diretamente no texto de entrada para obter um controle mais preciso. Envolver a entrada em marcação SSML oferece controle de pronúncia, ritmo e ênfase em qualquer um dos quatro mecanismos.
- Monitore o uso pelo CloudWatch e inclua no orçamento os custos relacionados à AWS. Além do preço por caractere de cada mecanismo, considere as tarifas de transferência de dados e os custos de armazenamento no S3 se você salvar os arquivos de áudio gerados, pois eles são cobrados separadamente do uso principal do Polly.
Dicas para obter resultados melhores
- Use Neural como padrão para a maioria dos conteúdos de produção, não Standard. Como o Neural soa claramente mais natural por um aumento moderado de custo em relação ao Standard, ele é o padrão mais sensato para qualquer conteúdo voltado ao cliente, em vez de tratar o Standard como ponto de partida seguro.
- Reserve Generative e Long-Form para conteúdos que se beneficiem especificamente deles. Tanto a expressividade do Generative quanto o ajuste do Long-Form para reduzir a fadiga são vantagens reais, mas têm um custo por caractere significativamente maior — combine o nível com o conteúdo que realmente precisa daquela qualidade específica, em vez de usar sempre o mais alto.
- Teste a combinação específica de voz e mecanismo antes de se comprometer. Como nem todas as vozes são compatíveis com os quatro mecanismos, valide cedo a disponibilidade para o idioma e a voz desejados, em vez de descobrir uma incompatibilidade depois de desenvolver o pipeline em torno dela.
- Confira diretamente os preços atuais antes de montar um orçamento em escala. A Amazon ajustou os preços dos mecanismos do Polly ao longo do tempo, e as tarifas por caractere citadas podem variar conforme a fonte — confirme os números atuais na própria página de preços da AWS em vez de confiar em um valor citado que talvez esteja desatualizado.
- Procure outra opção se a clonagem de voz for um requisito central. Como o Polly não oferece esse recurso de forma integrada, um provedor que seja especificamente compatível com clonagem, com o consentimento e as proteções adequados, é mais indicado para essa necessidade concreta.
Amazon Polly em comparação com Azure AI Speech e Edge TTS
| Amazon Polly | Azure AI Speech | Edge TTS | |
|---|---|---|---|
| Estrutura de preços | Quatro níveis (US$ 4–US$ 100+ por 1 milhão de caracteres) | Dois níveis principais (Neural, Neural HD) | Gratuito |
| Clonagem de voz | Não é um recurso principal | Sim, pelo Personal Voice restrito | Não se aplica |
| Integração com o ecossistema | Integração profunda com a AWS (S3, CloudWatch, IAM) | Integração profunda com Azure/Foundry | Nenhuma — ferramenta independente |
| Nível gratuito | Sim, 12 meses, cota generosa | Sim, cota mensal | Ilimitado, gratuito por natureza |
| API oficial e licenciada | Sim | Sim | Não — ferramenta comunitária não oficial |
| Mais indicado para | Equipes que já usam AWS e controle de custos em níveis | Equipes que precisam de SSML avançado e treinamento de voz personalizada | Protótipos e projetos pessoais |
O nicho específico do Amazon Polly é a combinação de uma divisão deliberada dos custos em níveis com uma profunda integração nativa à AWS — a escolha padrão certa para qualquer equipe que já desenvolva na infraestrutura da AWS e queira controlar explicitamente a relação entre preço e qualidade, em vez de aceitar uma tarifa fixa para todos os casos de uso.
Perguntas frequentes
Qual é a diferença entre os quatro mecanismos de voz do Polly?
O Standard é o mais acessível e mais indicado para notificações básicas e URA. O Neural oferece entonação e ritmo claramente mais naturais por um custo adicional moderado, sendo recomendado para a maioria dos conteúdos de produção. O Generative usa um modelo Transformer de um bilhão de parâmetros para uma interpretação mais expressiva e cheia de nuances. O Long-Form é ajustado especificamente para reduzir a fadiga do ouvinte em conteúdos prolongados, como audiolivros.
O Amazon Polly é compatível com clonagem de voz?
Não como recurso principal e disponível de modo geral. Se clonar uma voz específica for um requisito central, um provedor que ofereça essa capacidade diretamente, com as proteções adequadas de consentimento, será mais indicado.
O uso do Amazon Polly é gratuito?
Ele oferece um nível gratuito de 12 meses para novos clientes da AWS, com cotas de caracteres que variam conforme o mecanismo — a cota do Standard é consideravelmente maior que a do Generative ou Long-Form. Depois do nível gratuito, é um serviço de pagamento conforme o uso, cobrado por caractere.
O Amazon Polly retém o texto que eu envio?
Não. A Amazon declara diretamente que o Polly não retém o conteúdo dos textos enviados.
Qual mecanismo devo usar em uma aplicação voltada ao cliente?
O Neural costuma ser o ponto de partida recomendado para conteúdo voltado ao cliente, equilibrando a qualidade natural da voz e o custo. Reserve o Generative especificamente para conteúdos em que a expressividade adicional compense o preço mais alto.
Crie voz online com a Echora
Para um fluxo no navegador com objetivo semelhante, use o Texto para fala da Echora. Transforme até 5.000 caracteres em áudio com um único locutor, ouça o resultado e baixe o MP3 final.