EchoraEchora

Modelos de IA

Guias sobre modelos de voz com IA de código aberto e populares, e como testar capacidades comparáveis na Echora.

7 min de leitura

Step-Audio: compreensão unificada de fala + TTS da StepFun

Step-Audio é um modelo open source da StepFun que unifica reconhecimento de fala, diálogo e geração de voz em um só sistema, eliminando a passagem de ASR para TTS.

Step-Audiointeração por vozcompreensão de falatexto para vozagentes de vozopen source
Ler mais
7 min de leitura

OuteTTS: um modelo de voz que roda pelo llama.cpp

O OuteTTS trata a fala como pura modelagem de linguagem, por isso roda nativamente no llama.cpp via GGUF, clonando uma voz com 10 segundos de áudio em um total de 23 idiomas.

OuteTTSllama.cppGGUFtexto para vozclonagem de vozTTS multilíngue
Ler mais
7 min de leitura

Parler-TTS: modelo de voz da Hugging Face descrita por texto

Parler-TTS é um modelo TTS open source da Hugging Face que controla voz, tom e estilo de fala por meio de uma descrição em linguagem natural, sem precisar de áudio.

Parler-TTStexto para vozHugging Facecontrole de voz por linguagem naturalsíntese de vozopen source
Ler mais
7 min de leitura

MeloTTS: o TTS multilíngue da MyShell que roda em CPU

O MeloTTS é o TTS multilíngue open source da MyShell, com inferência em tempo real em CPU e alternância nativa entre chinês e inglês dentro de uma única frase falada.

MeloTTSTTS multilíngueTTS em CPUalternância de códigosíntese de vozcódigo aberto
Ler mais
7 min de leitura

Piper TTS: síntese de voz ultraleve para Raspberry Pi

Piper TTS é um modelo neural de voz com 15 milhões de parâmetros que roda em tempo real apenas em CPU, criado para Raspberry Pi e outros dispositivos de borda sem precisar de GPU.

Piper TTStexto para vozRaspberry PiIA de bordaTTS em CPU
Ler mais
6 min de leitura

NaturalSpeech 3: TTS zero-shot fatorizado da Microsoft

O NaturalSpeech 3 divide a fala em subespaços separados de conteúdo, prosódia, timbre e detalhes, permitindo que o modelo TTS da Microsoft controle cada um de forma independente.

NaturalSpeech 3TTSFACodecdifusão fatorizadasíntese de fala zero-shotMicrosoft Research
Ler mais