Silero TTS: modelos preentrenados y ligeros de texto a voz
Silero TTS es un modelo preentrenado ligero con licencia MIT que se carga en una línea mediante PyTorch Hub y ofrece una sólida cobertura de ruso, lenguas de la CEI e idiomas índicos.
Guías sobre modelos de voz con IA de código abierto y populares, y cómo probar capacidades comparables en Echora.
Silero TTS es un modelo preentrenado ligero con licencia MIT que se carga en una línea mediante PyTorch Hub y ofrece una sólida cobertura de ruso, lenguas de la CEI e idiomas índicos.
VITS es el modelo TTS de 2021 basado en un VAE condicional y flujos que demostró que la generación en una sola etapa podía igualar a los sistemas de dos etapas, dando lugar a innumerables variantes.
MockingBird clona una voz con solo 5 segundos de audio para sintetizar mandarín en tiempo real y sigue siendo uno de los repositorios de TTS en chino más populares.
EmotiVoice es un motor TTS de código abierto de NetEase Youdao con más de 2.000 voces en inglés y chino que permite definir el estado de ánimo mediante un sencillo prompt de texto.
YourTTS es un modelo de investigación de Coqui basado en VITS, el primer sistema TTS multilingüe, multihablante y zero-shot que también realiza conversión de voz zero-shot.
WhisperSpeech invierte la arquitectura de reconocimiento de voz Whisper de OpenAI para generar voz a partir de texto, utilizando únicamente datos con las licencias adecuadas y aptos para uso comercial.
VoiceCraft edita voz existente y clona voces a partir de unos segundos de audio; los clips editados fueron preferidos a la grabación original el 48 % de las veces.
Voicebox es un modelo de investigación de Meta AI que rellena fragmentos de voz a partir de texto y contexto de audio, y utiliza flow matching para ofrecer TTS zero-shot, edición y eliminación de ruido.
MetaVoice es un modelo TTS con licencia Apache 2.0 creado para producir habla en inglés con emoción y clonar voces estadounidenses y británicas con solo 30 segundos de audio de referencia.
VibeVoice es el TTS de código abierto de Microsoft que genera 90 minutos de audio de pódcast con 4 hablantes, acompañado del modelo VibeVoice-ASR y variantes cuantizadas de 4 bits.
Sesame CSM 1B genera voz a partir de un historial intercalado de texto y audio, adaptándose al ritmo y la emoción reales de una conversación en lugar de leer un texto sin expresividad.
Llasa amplía los modelos LLaMA de 1B, 3B y 8B con tokens de voz de XCodec2 y se entrenó con 250.000 horas de audio en chino e inglés para clonación de voz y texto a voz.