EchoraEchora

Modelos de IA

Guias sobre modelos de voz com IA de código aberto e populares, e como testar capacidades comparáveis na Echora.

7 min de leitura

Silero TTS: modelos leves e pré-treinados de texto para fala

Silero TTS é um modelo pré-treinado leve, sob licença MIT, que pode ser carregado em uma linha pelo PyTorch Hub e oferece ampla cobertura de russo, línguas da CEI e idiomas índicos.

Silero TTStexto para falaTTS leveTTS multilínguePyTorch
Ler mais
8 min de leitura

VITS: explicação da arquitetura clássica de TTS ponta a ponta

O VITS é o modelo de TTS de 2021 baseado em VAE condicional e fluxos que provou que a geração em uma única etapa poderia igualar sistemas de duas etapas, dando origem a incontáveis variantes.

VITStexto para vozTTS ponta a pontaVAE condicionalfluxos de normalizaçãocódigo aberto
Ler mais
7 min de leitura

YourTTS: TTS multivoz zero-shot e conversão de voz

O YourTTS é um modelo de pesquisa da Coqui baseado em VITS, o primeiro sistema TTS multivoz zero-shot e multilíngue que também realiza conversão de voz zero-shot.

YourTTSTTS multivozconversão de vozTTS zero-shotTTS multilíngueVITS
Ler mais
7 min de leitura

WhisperSpeech: texto para fala ao inverter o Whisper

O WhisperSpeech inverte a arquitetura de reconhecimento de fala Whisper, da OpenAI, para gerar voz a partir de texto, usando apenas dados devidamente licenciados e seguros para uso comercial.

WhisperSpeechtexto para falaWhisperdados licenciadoscódigo abertosíntese de voz
Ler mais
7 min de leitura

VoiceCraft: edição de fala e clonagem de voz zero-shot

O VoiceCraft edita falas existentes e clona vozes com poucos segundos de áudio; os clipes editados foram preferidos à gravação original em 48% das vezes.

VoiceCraftedição de falaclonagem de vozTTS zero-shotpreenchimento de falacódigo aberto
Ler mais
5 min de leitura

Voicebox: IA de voz não autorregressiva com flow matching da Meta

O Voicebox é um modelo de pesquisa da Meta AI que preenche trechos de fala a partir de texto e contexto de áudio, usando flow matching para TTS zero-shot, edição e remoção de ruído.

VoiceboxMeta AIpreenchimento de falaflow matchingTTS zero-shotclonagem de voz
Ler mais
7 min de leitura

MetaVoice: clonagem de voz em inglês com expressão emocional

O MetaVoice é um modelo TTS sob a licença Apache 2.0, criado para fala emocional em inglês e capaz de clonar vozes americanas e britânicas com apenas 30 segundos de áudio de referência.

MetaVoiceclonagem de vozTTS emocionalTTS em inglêsclonagem de voz zero-shotopen source
Ler mais