EchoraEchora

Modelos de IA

Guías sobre modelos de voz con IA de código abierto y populares, y cómo probar capacidades comparables en Echora.

7 min de lectura

Silero TTS: modelos preentrenados y ligeros de texto a voz

Silero TTS es un modelo preentrenado ligero con licencia MIT que se carga en una línea mediante PyTorch Hub y ofrece una sólida cobertura de ruso, lenguas de la CEI e idiomas índicos.

Silero TTStexto a vozTTS ligeroTTS multilingüePyTorch
Leer más
8 min de lectura

VITS: explicación de la arquitectura TTS clásica de extremo a extremo

VITS es el modelo TTS de 2021 basado en un VAE condicional y flujos que demostró que la generación en una sola etapa podía igualar a los sistemas de dos etapas, dando lugar a innumerables variantes.

VITStexto a vozTTS de extremo a extremoVAE condicionalflujos de normalizacióncódigo abierto
Leer más
7 min de lectura

YourTTS: TTS multihablante zero-shot y conversión de voz

YourTTS es un modelo de investigación de Coqui basado en VITS, el primer sistema TTS multilingüe, multihablante y zero-shot que también realiza conversión de voz zero-shot.

YourTTSTTS multihablanteconversión de vozTTS zero-shotTTS multilingüeVITS
Leer más
7 min de lectura

WhisperSpeech: texto a voz mediante la inversión de Whisper

WhisperSpeech invierte la arquitectura de reconocimiento de voz Whisper de OpenAI para generar voz a partir de texto, utilizando únicamente datos con las licencias adecuadas y aptos para uso comercial.

WhisperSpeechtexto a vozWhisperdatos con licenciacódigo abiertosíntesis de voz
Leer más
7 min de lectura

VoiceCraft: edición de voz y clonación de voz zero-shot

VoiceCraft edita voz existente y clona voces a partir de unos segundos de audio; los clips editados fueron preferidos a la grabación original el 48 % de las veces.

VoiceCraftedición de vozclonación de vozTTS zero-shotrelleno de vozcódigo abierto
Leer más
5 min de lectura

Voicebox: la IA de voz no autorregresiva con flow matching de Meta

Voicebox es un modelo de investigación de Meta AI que rellena fragmentos de voz a partir de texto y contexto de audio, y utiliza flow matching para ofrecer TTS zero-shot, edición y eliminación de ruido.

VoiceboxMeta AIrelleno de vozflow matchingTTS zero-shotclonación de voz
Leer más
7 min de lectura

MetaVoice: clonación de voz en inglés con expresividad emocional

MetaVoice es un modelo TTS con licencia Apache 2.0 creado para producir habla en inglés con emoción y clonar voces estadounidenses y británicas con solo 30 segundos de audio de referencia.

MetaVoiceclonación de vozTTS emocionalTTS en inglésclonación de voz zero-shotopen source
Leer más