EchoraEchora
Volver a los modelos

EmotiVoice: define el estado de ánimo con solo escribirlo

9 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de los modelos TTS «emocionales» ofrecen un breve menú de etiquetas de emoción fijas. EmotiVoice, publicado como código abierto por NetEase Youdao, adopta un enfoque más flexible: describes el estado de ánimo que quieres en un prompt de estilo, como si dirigieras a un actor de voz, y el modelo lo interpreta. Ese diseño basado en prompts, en lugar de un conjunto cerrado de controles, es el rasgo que define al modelo, construido sobre una base bilingüe de inglés y chino y con una biblioteca de voces realmente amplia entre la que elegir.

¿Qué es EmotiVoice?

EmotiVoice es un motor de texto a voz de código abierto con licencia Apache 2.0, publicado por NetEase Youdao en noviembre de 2023. Es un sistema basado en Transformer inspirado directamente en el enfoque de investigación PromptTTS y entrenado con los conjuntos de datos LibriTTS y Hi-Fi TTS. El proyecto se presenta expresamente como un motor multivoz controlado mediante prompts, y ambas partes de esa descripción son igual de importantes para entender qué lo hace diferente.

Ventajas funcionales de EmotiVoice

  • Más de 2.000 voces predefinidas en inglés y chino, con una variedad realmente amplia de edades, tonos y personalidades vocales, en lugar de unos pocos ajustes genéricos.
  • Interpretación emocional controlada mediante prompts: estados como alegría, entusiasmo, tristeza, enfado y otros se definen con un prompt de estilo, no mediante un sistema rígido de etiquetas fijas.
  • Otros factores de estilo además de la emoción, como el tono, la velocidad y la energía, que se pueden ajustar de forma independiente junto con el estado de ánimo.
  • Clonación de voz a partir de tus propias grabaciones, añadida poco después de la versión inicial, para ampliar la biblioteca predefinida con una voz personalizada.
  • Varias vías de integración: una interfaz web interactiva, una interfaz de scripting para generación por lotes y una API TTS compatible con OpenAI que se incorpora a herramientas existentes con cambios mínimos.
  • Totalmente abierto y autoalojable, con funcionamiento sin conexión una vez desplegado y bajo una licencia sin restricciones comerciales.

Cómo funciona realmente el control de estilo mediante prompts

Basada en el enfoque PromptTTS, la implementación actual de EmotiVoice utiliza cuatro factores de estilo para moldear la interpretación: tono, velocidad, energía y emoción. Cabe destacar que no incluye el género, algo que la propia documentación del proyecto señala expresamente como excluido del conjunto actual de controles de estilo, aunque indica que podría añadirse sin demasiada dificultad si hubiera demanda. En la práctica, esto significa que la característica fundamental de género de una voz procede de la voz predefinida que eliges, mientras que el prompt determina todo lo relativo a cómo pronuncia la frase: su matiz emocional, ritmo e intensidad. Conviene entender esta separación antes de empezar a escribir prompts: elige primero la voz para definir la identidad y después escribe el prompt para dirigir la interpretación.

Primeros pasos con EmotiVoice

La forma más rápida de probar EmotiVoice es su imagen de Docker, que requiere un equipo con una GPU NVIDIA y NVIDIA Container Toolkit configurado. Al ejecutar la imagen proporcionada se inicia una demo web interactiva que puedes usar directamente en el navegador. Si prefieres configurarlo manualmente, la documentación explica una instalación local con un entorno Python 3.8 mediante conda, lo que ofrece mayor control sobre la configuración y las dependencias. Para uso programático, el servidor de API compatible con OpenAI aportado por la comunidad puede instalarse con una breve lista de paquetes de Python y ejecutarse junto al motor principal. Así puedes llamar a EmotiVoice desde cualquier cliente ya creado para el formato de la API TTS de OpenAI con cambios mínimos en el código.

Consejos para obtener mejores resultados

  • Escribe los prompts de estilo como si dirigieras una interpretación, no como si solo asignaras una emoción. Como el sistema se basa en prompts y no en etiquetas, una indicación más descriptiva que incluya intensidad y ritmo además de la emoción principal suele producir resultados más precisos que una etiqueta de una sola palabra.
  • Elige la voz predefinida antes de escribir el prompt emocional. Como el género y la identidad vocal principal dependen de la voz elegida y no del prompt de estilo, selecciona primero la voz adecuada y después itera sobre el prompt para conseguir la interpretación que buscas.
  • Usa la interfaz de scripting para trabajos de gran volumen. Si vas a generar más de unos pocos clips, esta interfaz evita el esfuerzo de operar manualmente la interfaz web para cada uno.
  • Recurre a la clonación de voz específicamente cuando ninguna de las más de 2.000 voces predefinidas encaje. Dado el tamaño de la biblioteca existente, merece la pena explorar primero las voces disponibles. La clonación está pensada para los casos en los que necesitas una voz real concreta, no como punto de partida predeterminado.
  • Utiliza la API compatible con OpenAI si vas a sustituir a un proveedor comercial de TTS. Como reproduce el formato de solicitudes de esa API, migrar el código de una integración existente suele requerir menos cambios que adaptarlo a una interfaz completamente personalizada.

EmotiVoice frente a otros modelos bilingües expresivos

EmotiVoiceChatTTSChatterbox
Organización responsableNetEase Youdao2noiseResemble AI
IdiomasInglés, chinoChino, inglésInglés (multilingüe: 23)
Método de control emocionalPrompt de estilo de formato librePredicción nativa durante la generaciónParámetro explícito de exageración
Cantidad de voces predefinidasMás de 2.000Multihablante mediante muestreo gaussianoCentrado en clonación zero-shot
Clonación de vozSí, a partir de grabaciones personalesNo es el flujo de trabajo principalSí, zero-shot
LicenciaApache 2.0AGPLv3+ (código) / CC BY-NC 4.0 (pesos)MIT

El nicho específico de EmotiVoice es la combinación de la flexibilidad de los prompts con la enorme escala de sus voces predefinidas. Mientras ChatTTS incorpora la prosodia conversacional directamente en la generación y Chatterbox ofrece un único control de exageración, EmotiVoice permite describir la interpretación con tus propias palabras sobre un catálogo de voces realmente amplio.

Preguntas frecuentes

¿Cómo controlo la emoción en EmotiVoice?

Mediante un prompt de estilo escrito en lenguaje corriente, en lugar de elegir entre un conjunto fijo de etiquetas de emoción. El modelo interpreta el prompt para moldear la interpretación junto con los ajustes de tono, velocidad y energía, que se pueden controlar por separado.

¿Puede EmotiVoice controlar el género de una voz mediante prompts?

Actualmente no. El género procede de la voz predefinida que eliges, no del prompt de estilo, porque la implementación actual de control de estilo excluye deliberadamente el género como factor, aunque se señala como algo que podría añadirse en el futuro.

¿EmotiVoice admite clonación de voz?

Sí, a partir de tus propias grabaciones, además de su biblioteca de más de 2.000 voces predefinidas.

¿Qué idiomas admite EmotiVoice?

Inglés y chino; la hoja de ruta del proyecto menciona además compatibilidad futura con otros idiomas, incluidos japonés y coreano.

¿Se puede usar EmotiVoice gratis con fines comerciales?

Sí. Se publica bajo la licencia Apache 2.0, que permite el uso comercial sin regalías ni acuerdos de licencia independientes.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →