EchoraEchora

Modelos de IA

Guías sobre modelos de voz con IA de código abierto y populares, y cómo probar capacidades comparables en Echora.

7 min de lectura

Step-Audio: comprensión unificada del habla + TTS de StepFun

Step-Audio es un modelo de código abierto de StepFun que unifica reconocimiento de voz, diálogo y generación de voz en un solo sistema, evitando el traspaso de ASR a TTS.

Step-Audiointeracción por vozcomprensión del hablatexto a vozagentes de vozcódigo abierto
Leer más
7 min de lectura

Zonos TTS: modelo de voz expresiva de pesos abiertos de Zyphra

Zonos es un modelo TTS de pesos abiertos de Zyphra, entrenado con más de 200 000 horas de voz, que clona una voz en segundos y permite controlar con precisión la emoción, el tono y la velocidad del habla.

TTSTTS de pesos abiertosclonación de vozvoz expresivaZonos
Leer más
7 min de lectura

OuteTTS: un modelo de voz que funciona mediante llama.cpp

OuteTTS trata el habla como modelado puro del lenguaje, por lo que se ejecuta de forma nativa en llama.cpp mediante GGUF y clona una voz con 10 segundos de audio en un total de 23 idiomas.

OuteTTSllama.cppGGUFtexto a vozclonación de vozTTS multilingüe
Leer más
7 min de lectura

Parler-TTS: modelo de Hugging Face para describir voces con texto

Parler-TTS es un modelo TTS de código abierto de Hugging Face que controla la voz, el tono y el estilo del habla mediante una descripción en lenguaje natural, sin necesidad de audio.

Parler-TTStexto a vozHugging Facecontrol de voz con lenguaje naturalsíntesis de vozcódigo abierto
Leer más
7 min de lectura

MeloTTS: el TTS multilingüe de MyShell que funciona en CPU

MeloTTS es el TTS multilingüe de código abierto de MyShell, con inferencia en tiempo real en CPU y cambio nativo entre chino e inglés dentro de una misma frase hablada.

MeloTTSTTS multilingüeTTS en CPUcambio de códigosíntesis de vozcódigo abierto
Leer más
7 min de lectura

Piper TTS: síntesis de voz ultraligera para Raspberry Pi

Piper TTS es un modelo neuronal de voz de 15 millones de parámetros que funciona en tiempo real solo con CPU, creado para Raspberry Pi y otros dispositivos de borde sin necesidad de GPU.

Piper TTStexto a vozRaspberry PiIA en el bordeTTS en CPU
Leer más
6 min de lectura

NaturalSpeech 3: TTS zero-shot factorizado de Microsoft

NaturalSpeech 3 separa el habla en subespacios de contenido, prosodia, timbre y detalle, lo que permite al modelo TTS de Microsoft controlar cada uno de forma independiente.

NaturalSpeech 3TTSFACodecdifusión factorizadasíntesis de voz zero-shotMicrosoft Research
Leer más
7 min de lectura

NaturalSpeech 2: el modelo TTS de Microsoft para canto zero-shot

NaturalSpeech 2 aplica difusión latente a códigos de audio continuos, lo que permite al modelo TTS de Microsoft generar canto zero-shot a partir de una simple muestra de voz hablada.

TTSNaturalSpeech 2síntesis de canto zero-shotclonación de vozdifusión latenteMicrosoft Research
Leer más