Step-Audio: compreensão unificada de fala + TTS da StepFun
Step-Audio é um modelo open source da StepFun que unifica reconhecimento de fala, diálogo e geração de voz em um só sistema, eliminando a passagem de ASR para TTS.
Guias sobre modelos de voz com IA de código aberto e populares, e como testar capacidades comparáveis na Echora.
Step-Audio é um modelo open source da StepFun que unifica reconhecimento de fala, diálogo e geração de voz em um só sistema, eliminando a passagem de ASR para TTS.
O Zonos é um modelo TTS de pesos abertos da Zyphra, treinado com mais de 200 mil horas de voz, que clona uma voz em segundos e oferece controle preciso de emoção, tom e velocidade da fala.
Orpheus TTS é um LLM de voz da Canopy Labs baseado em Llama-3B, com latência de streaming de 200ms, tags de emoção e clonagem zero-shot, que pode ser implantado por um servidor FastAPI.
O OuteTTS trata a fala como pura modelagem de linguagem, por isso roda nativamente no llama.cpp via GGUF, clonando uma voz com 10 segundos de áudio em um total de 23 idiomas.
O GLM-TTS é o TTS open source da Zhipu AI que combina um LLM com flow matching, clona uma voz a partir de 3 segundos e usa RL para aprimorar emoção e pronúncia.
Parler-TTS é um modelo TTS open source da Hugging Face que controla voz, tom e estilo de fala por meio de uma descrição em linguagem natural, sem precisar de áudio.
O ChatTTS é um modelo TTS da 2noise otimizado para diálogos de chatbots e assistentes em chinês e inglês, gerando risadas, pausas e interjeições naturais.
O MeloTTS é o TTS multilíngue open source da MyShell, com inferência em tempo real em CPU e alternância nativa entre chinês e inglês dentro de uma única frase falada.
Piper TTS é um modelo neural de voz com 15 milhões de parâmetros que roda em tempo real apenas em CPU, criado para Raspberry Pi e outros dispositivos de borda sem precisar de GPU.
O NaturalSpeech 3 divide a fala em subespaços separados de conteúdo, prosódia, timbre e detalhes, permitindo que o modelo TTS da Microsoft controle cada um de forma independente.
O NaturalSpeech 2 usa difusão latente em códigos contínuos de áudio, permitindo que o modelo TTS da Microsoft gere canto zero-shot apenas com uma amostra de voz falada.
O NaturalSpeech é o modelo TTS da Microsoft baseado em VAE que definiu formalmente a qualidade de nível humano e depois passou no próprio teste estatístico no conjunto de dados LJSpeech.