EchoraEchora
Voltar aos modelos

EmotiVoice: defina o clima apenas escrevendo

9 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A maioria dos modelos TTS “emocionais” oferece um pequeno menu de rótulos fixos de emoção. O EmotiVoice, disponibilizado como open source pela NetEase Youdao, adota uma abordagem mais flexível: você descreve o clima desejado em um prompt de estilo, como faria ao dirigir um ator de voz, e o modelo o interpreta. Esse projeto orientado por prompts, em vez de um conjunto fechado de controles, é a característica que define o modelo, construído sobre uma base bilíngue em inglês e chinês e com uma biblioteca de vozes realmente ampla à disposição.

O que é o EmotiVoice?

O EmotiVoice é um mecanismo open source de texto para fala, lançado pela NetEase Youdao em novembro de 2023 sob a licença Apache 2.0. Ele é um sistema baseado em Transformer, diretamente inspirado na abordagem de pesquisa PromptTTS e treinado nos conjuntos de dados LibriTTS e Hi-Fi TTS. O projeto se apresenta explicitamente como um mecanismo multivoz controlado por prompts — e as duas partes dessa descrição são igualmente importantes para aquilo que o torna diferente.

Vantagens funcionais do EmotiVoice

  • Mais de 2.000 vozes predefinidas em inglês e chinês, cobrindo uma variedade realmente ampla de idades, tons e características vocais, em vez de apenas algumas opções genéricas.
  • Interpretação emocional controlada por prompts — estados como felicidade, empolgação, tristeza, raiva e outros são definidos por um prompt de estilo, e não por um sistema rígido de rótulos fixos.
  • Outros fatores de estilo além da emoção, incluindo tom, velocidade e energia, que podem ser ajustados de forma independente junto com o clima.
  • Clonagem de voz a partir das suas próprias gravações, adicionada pouco depois do lançamento inicial, permitindo ampliar a biblioteca predefinida com uma voz personalizada.
  • Vários caminhos de integração: uma interface web interativa, uma interface de scripts para geração em lote e uma API TTS compatível com a OpenAI para incorporar o mecanismo às ferramentas existentes com mudanças mínimas.
  • Totalmente aberto e auto-hospedável, com funcionamento offline depois de implantado e sob uma licença sem restrições comerciais.

Como o controle de estilo por prompts realmente funciona

Baseada na abordagem PromptTTS, a implementação atual do EmotiVoice usa quatro fatores de estilo para moldar a interpretação: tom, velocidade, energia e emoção. Vale destacar que gênero não está incluído. A própria documentação do projeto ressalta especificamente que esse fator foi excluído do conjunto atual de controles de estilo, embora observe que ele poderia ser acrescentado sem grande dificuldade caso houvesse demanda. Na prática, isso significa que a característica fundamental de gênero de uma voz vem da voz predefinida escolhida, enquanto o prompt molda tudo o que diz respeito a como essa voz pronuncia uma frase: sua coloração emocional, ritmo e intensidade. Vale a pena entender essa divisão antes de começar a escrever prompts: primeiro escolha a voz para definir a identidade; depois escreva o prompt para dirigir a interpretação.

Como começar com o EmotiVoice

O caminho mais rápido para experimentar o EmotiVoice é sua imagem Docker, que exige uma máquina com GPU NVIDIA e o NVIDIA Container Toolkit configurado. A execução da imagem fornecida inicia uma demonstração web interativa que pode ser usada diretamente no navegador. Se preferir fazer a configuração manualmente, há documentação para uma instalação local em um ambiente Python 3.8 via conda, oferecendo mais controle sobre configurações e dependências. Para uso programático, o servidor de API compatível com a OpenAI, contribuído pela comunidade, pode ser instalado com uma pequena lista de pacotes Python e executado junto ao mecanismo principal. Assim, você pode chamar o EmotiVoice a partir de qualquer cliente já criado para o formato da API TTS da OpenAI com mudanças mínimas no código.

Dicas para obter melhores resultados

  • Escreva prompts de estilo como se estivesse dirigindo uma interpretação, não apenas nomeando uma emoção. Como o sistema é orientado por prompts, não por rótulos, uma instrução mais descritiva que inclua intensidade e ritmo além da emoção central tende a produzir resultados mais precisos do que um rótulo de uma só palavra.
  • Escolha a voz predefinida antes de escrever o prompt emocional. Como o gênero e a identidade vocal central vêm da escolha da voz, não do prompt de estilo, defina primeiro a voz adequada e depois refine o prompt até obter a interpretação desejada.
  • Use a interface de scripts para trabalhos em grande volume. Se você estiver gerando mais do que alguns clipes, ela evita o trabalho de operar manualmente a interface web para cada um.
  • Recorra à clonagem de voz especificamente quando nenhuma das mais de 2.000 opções predefinidas servir. Como a biblioteca existente já é muito grande, vale a pena explorar primeiro as vozes disponíveis. A clonagem existe para os casos em que você precisa de uma voz real específica, não como ponto de partida padrão.
  • Use a API compatível com a OpenAI se estiver substituindo um fornecedor comercial de TTS. Como ela reproduz o formato de requisição dessa API, migrar o código de uma integração existente costuma exigir uma mudança menor do que adaptar tudo a uma interface completamente personalizada.

EmotiVoice versus outros modelos bilíngues expressivos

EmotiVoiceChatTTSChatterbox
Organização responsávelNetEase Youdao2noiseResemble AI
IdiomasInglês, chinêsChinês, inglêsInglês (multilíngue: 23)
Método de controle emocionalPrompt de estilo em formato livrePrevisto nativamente durante a geraçãoParâmetro explícito de exagero
Quantidade de vozes predefinidasMais de 2.000Multilocutor por amostragem gaussianaFoco em clonagem zero-shot
Clonagem de vozSim, a partir de gravações pessoaisNão é o fluxo principalSim, zero-shot
LicençaApache 2.0AGPLv3+ (código) / CC BY-NC 4.0 (pesos)MIT

O nicho específico do EmotiVoice está na combinação da flexibilidade dos prompts com a enorme escala de vozes predefinidas. Enquanto o ChatTTS incorpora a prosódia de conversa diretamente à geração e o Chatterbox oferece um único controle de exagero, o EmotiVoice permite descrever a interpretação com suas próprias palavras em um catálogo de vozes realmente amplo.

Perguntas frequentes

Como controlo a emoção no EmotiVoice?

Por meio de um prompt de estilo escrito em linguagem comum, em vez de escolher entre um conjunto fixo de rótulos de emoção. O modelo interpreta o prompt para moldar a forma de falar, junto com os controles de tom, velocidade e energia, que podem ser ajustados separadamente.

O EmotiVoice consegue controlar o gênero de uma voz por meio de prompts?

Não atualmente. O gênero vem da voz predefinida escolhida, e não do prompt de estilo, pois a implementação atual de controle de estilo exclui deliberadamente esse fator, embora ele seja mencionado como algo que poderia ser adicionado no futuro.

O EmotiVoice oferece clonagem de voz?

Sim, a partir das suas próprias gravações, além da biblioteca com mais de 2.000 vozes predefinidas.

Quais idiomas o EmotiVoice oferece?

Inglês e chinês, com suporte adicional a idiomas, incluindo japonês e coreano, mencionado no roadmap do projeto.

O EmotiVoice é gratuito para uso comercial?

Sim. Ele é disponibilizado sob a licença Apache 2.0, que permite uso comercial sem royalties ou contratos de licença separados.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →