EchoraEchora

Modelos de IA

Guias sobre modelos de voz com IA de código aberto e populares, e como testar capacidades comparáveis na Echora.

7 min de leitura

SeamlessM4T: modelo completo de tradução de fala da Meta

SeamlessM4T é um modelo de código aberto da Meta que unifica reconhecimento de fala, tradução e síntese de voz em um único sistema para até 100 idiomas.

tradução de falafala multilínguetradução de fala para falareconhecimento automático de falaSeamlessM4T
Ler mais
7 min de leitura

Spark-TTS: clonagem de voz zero-shot com um único codec

O Spark-TTS usa o BiCodec, um codec de voz de fluxo único baseado no Qwen2.5, para clonagem de voz zero-shot e criação de vozes totalmente sintéticas em um único modelo aberto.

TTSclonagem de vozclonagem de voz zero-shotBiCodecSpark-TTS
Ler mais
7 min de leitura

NeuTTS Air: modelo leve de clonagem de voz no dispositivo

NeuTTS Air é um modelo TTS da Neuphonic para execução no dispositivo, com menos de 1 bilhão de parâmetros, que clona uma voz com apenas 3 segundos de áudio e roda em celulares e Raspberry Pi.

NeuTTS AirTTS no dispositivoclonagem de vozTTS leveGGUFRaspberry PiNeuphonic
Ler mais
7 min de leitura

VoxCPM: modelo TTS bilíngue, de baixa latência e sem tokenizador

O VoxCPM é um modelo TTS da OpenBMB sem tokenizador para chinês e inglês que atinge fator de tempo real de 0,17 em uma GPU de consumo e gera prosódia automática de acordo com o contexto.

VoxCPMTTSsíntese de voz sem tokenizadorTTS bilínguestreaming de baixa latênciaOpenBMB
Ler mais