Silero TTS: modelos leves e pré-treinados de texto para fala
Silero TTS é um modelo pré-treinado leve, sob licença MIT, que pode ser carregado em uma linha pelo PyTorch Hub e oferece ampla cobertura de russo, línguas da CEI e idiomas índicos.
Guias sobre modelos de voz com IA de código aberto e populares, e como testar capacidades comparáveis na Echora.
Silero TTS é um modelo pré-treinado leve, sob licença MIT, que pode ser carregado em uma linha pelo PyTorch Hub e oferece ampla cobertura de russo, línguas da CEI e idiomas índicos.
O VITS é o modelo de TTS de 2021 baseado em VAE condicional e fluxos que provou que a geração em uma única etapa poderia igualar sistemas de duas etapas, dando origem a incontáveis variantes.
O MockingBird clona uma voz com apenas 5 segundos de áudio para sintetizar mandarim em tempo real e continua sendo um dos repositórios de TTS em chinês mais populares.
EmotiVoice é um mecanismo TTS open source da NetEase Youdao com mais de 2.000 vozes em inglês e chinês, permitindo definir o clima por meio de um simples prompt de texto.
O YourTTS é um modelo de pesquisa da Coqui baseado em VITS, o primeiro sistema TTS multivoz zero-shot e multilíngue que também realiza conversão de voz zero-shot.
O WhisperSpeech inverte a arquitetura de reconhecimento de fala Whisper, da OpenAI, para gerar voz a partir de texto, usando apenas dados devidamente licenciados e seguros para uso comercial.
O VoiceCraft edita falas existentes e clona vozes com poucos segundos de áudio; os clipes editados foram preferidos à gravação original em 48% das vezes.
O Voicebox é um modelo de pesquisa da Meta AI que preenche trechos de fala a partir de texto e contexto de áudio, usando flow matching para TTS zero-shot, edição e remoção de ruído.
O MetaVoice é um modelo TTS sob a licença Apache 2.0, criado para fala emocional em inglês e capaz de clonar vozes americanas e britânicas com apenas 30 segundos de áudio de referência.
O VibeVoice é o TTS open source da Microsoft que gera 90 minutos de áudio de podcast com 4 falantes, acompanhado do modelo VibeVoice-ASR e de variantes quantizadas em 4 bits.
O Sesame CSM 1B gera fala a partir de um histórico intercalado de texto e áudio, acompanhando o ritmo e a emoção reais de uma conversa em vez de ler um texto sem expressão.
O Llasa amplia os modelos LLaMA de 1B, 3B e 8B com tokens de voz do XCodec2 e foi treinado em 250 mil horas de áudio em chinês e inglês para clonagem de voz e texto para fala.