EchoraEchora
Volver a los modelos

Fish Speech: el proyecto TTS que ofrece dos caminos hacia una voz mejor

29 de agosto de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de los modelos de clonación ofrecen exactamente un camino para conseguir una voz personalizada: introducir un clip de referencia y esperar que el resultado zero-shot sea lo bastante bueno. Fish Speech, el proyecto open source de texto a voz de Fish Audio, ofrece una segunda opción —ajustar el modelo directamente con una voz cuando el zero-shot no es lo bastante preciso— junto con un nivel de control emocional y estilístico que va mucho más allá de una narración plana.

¿Qué es Fish Speech?

Fish Speech se basa en una arquitectura DualAR —un diseño de Transformer autorregresivo dual— y se entrenó con bastante más de un millón de horas de audio multilingüe. La versión 1.5 del proyecto abarca 13 idiomas, entre ellos inglés, chino y japonés, y obtuvo sólidos resultados en pruebas independientes: una puntuación ELO de 1339 en TTS Arena (ocupaba el primer puesto entre los modelos open source en ese momento), una tasa de error de palabras del 3,5 % y una tasa de error de caracteres del 1,2 % en inglés, además de una tasa de error de caracteres del 1,3 % en chino.

El proyecto ha seguido evolucionando más allá de la versión 1.5. Desde entonces, Fish Audio Text to Speech ha lanzado nuevas generaciones dentro de su serie OpenAudio, con Fish Audio S2 como actual modelo insignia: se entrenó con más de 10 millones de horas de audio y actualmente ocupa los primeros puestos en evaluaciones como EmergentTTS-Eval, Seed-TTS Eval y Audio Turing Test. Si buscas específicamente Fish Speech 1.5, sigue siendo una opción realmente sólida, más ligera y apta para el autoalojamiento; si la prioridad es la calidad pura y el control emocional preciso, S2 es la nueva generación creada para eso.

Clonación zero-shot y ajuste fino, no solo una opción u otra

Este es el rasgo que distingue a Fish Speech de muchos competidores centrados en la clonación. La clonación zero-shot funciona como cabría esperar: basta un clip de referencia de 10 a 30 segundos para capturar el timbre, el estilo y la tendencia emocional general de una persona, sin necesidad de entrenamiento. Pero Fish AI Text to Speech también permite realizar un verdadero ajuste fino sobre esa base: cuando una voz necesita más precisión o consistencia de la que la clonación zero-shot puede ofrecer de forma fiable —una voz de marca recurrente o un personaje concreto a lo largo de un proyecto extenso—, puedes ajustar directamente el modelo base con tus propios datos de audio en vez de conformarte con lo que produzca el clip de referencia.

Este enfoque doble importa en la práctica: el zero-shot es rápido y suficiente para la mayoría de las necesidades puntuales, pero los equipos de producción recurren al ajuste fino cuando una voz debe ser fiable a lo largo de cientos de generaciones y no solo en un único clip.

Control emocional verdaderamente preciso

Mientras muchos modelos TTS ofrecen como mucho un único control deslizante de «exageración», Fish Audio S2 permite controlar la prosodia y la emoción a nivel de subpalabra mediante etiquetas en lenguaje natural insertadas directamente en el texto —como [whisper], [excited] o [angry]—. Así, una misma frase puede cambiar de tono a mitad de la locución en lugar de aplicar un único ajuste emocional a todo el clip. El modelo también gestiona de forma nativa la generación de conversaciones con varios hablantes y múltiples turnos, y durante el entrenamiento evalúa su propia salida frente a varias señales de recompensa: precisión semántica, seguimiento de instrucciones, calidad acústica y similitud del timbre. Esto ayuda a explicar por qué su interpretación emocional se sostiene, en vez de sonar como si se hubiera añadido una sola etiqueta a una narración que, por lo demás, sigue siendo plana.

Como la arquitectura Dual-AR subyacente es estructuralmente similar a un modelo de lenguaje estándar, S2 también admite de forma nativa técnicas de inferencia LLM de alto rendimiento como el procesamiento por lotes continuo, la caché KV paginada y la caché de prefijos. Es una ventaja importante si atiendes solicitudes de generación a gran escala en lugar de producir clips aislados.

Primeros pasos con Fish Speech

  1. Elige la versión según tu prioridad. Fish Speech 1.5 es la opción más ligera y mejor documentada para autoalojar en hardware modesto; Fish Audio S2 es el actual modelo insignia para obtener la máxima calidad y un control emocional preciso.
  2. Clona el repositorio. git clone https://github.com/fishaudio/fish-speech te proporciona el código, la documentación y las instrucciones de instalación de la versión que elijas.
  3. Compara tu hardware con los requisitos del modelo. Fish Speech 1.5 necesita como mínimo unos 12GB de VRAM (se recomiendan 24GB para cargas de producción); comprueba que tu GPU sea adecuada antes de comprometerte con un plan de despliegue.
  4. Prueba primero la clonación zero-shot. Proporciona un clip de referencia de 10–30 segundos y genera directamente, sin entrenamiento, antes de decidir si el ajuste fino es realmente necesario para tu caso de uso.
  5. Haz el ajuste fino solo cuando el zero-shot no sea lo bastante preciso. Si una voz concreta debe mantener la consistencia en un gran volumen de contenido, sigue la documentación de ajuste fino del proyecto en vez de regenerar una y otra vez desde un único clip de referencia con la esperanza de obtener consistencia.
  6. Utiliza el servidor SGLang o vLLM-Omni para desplegar S2 en producción. Ambos están documentados específicamente para Fish Audio S2 y aprovechan su arquitectura similar a la de un LLM para ofrecer un rendimiento considerablemente mayor que un script de inferencia básico.

Consejos para obtener mejores resultados

  • Adapta la duración del clip de referencia a tu objetivo. Los clips más cortos dentro del intervalo de 10–30 segundos suelen bastar para una prueba zero-shot rápida; si el resultado no es lo bastante estable, es la señal para pasar al ajuste fino en lugar de probar clips de referencia cada vez más largos.
  • Usa las etiquetas de emoción con intención, no en todas partes. Insertar [whisper] o [excited] en cada frase diluye el efecto; reserva las etiquetas para los momentos concretos en los que un cambio de interpretación realmente aporte algo al contenido.
  • No omitas la revisión de la licencia. Históricamente, los pesos de Fish Speech se han publicado con licencias orientadas a la investigación y con inclinación no comercial (los pesos de la versión 1.5 bajo CC BY-NC-SA y S2 bajo la licencia de investigación propia de Fish Audio). Lee atentamente las condiciones vigentes antes de cualquier despliegue comercial, pues difieren de forma sustancial de una licencia permisiva como MIT o Apache 2.0.
  • Aprovecha la gestión de idiomas combinados si tu contenido cambia de forma natural. Fish Speech está diseñado para leer con fluidez texto mixto en chino e inglés sin configuración adicional. Resulta útil para guiones bilingües y evita tener que dividir y unir el audio de dos generaciones separadas.
  • Evalúa ambas versiones con tu contenido real antes de elegir. Las clasificaciones de TTS Arena y las tasas de error publicadas son una señal inicial útil, pero la calidad de voz depende del contenido. Prueba 1.5 y S2 con el estilo concreto de tus guiones antes de comprometerte con un flujo de producción.

Fish Speech frente a otros modelos centrados en la clonación

Fish Speech (1.5 / S2)ChatterboxCosyVoice3
Clonación zero-shotSí, referencia de 10–30 sSí, referencia de 5–10 sSí, referencia de 3–10 s
Ajuste finoSí, nativoNo es un flujo principalNo es un flujo principal
Control emocionalEtiquetas a nivel de subpalabra (S2)Parámetro de exageraciónBasado en instrucciones
Idiomas13 (1.5) / más amplio (S2)Inglés (versión multilingüe: 23)9 + 18 dialectos chinos
ArquitecturaTransformer autorregresivo dualBasada en difusiónTokens semánticos supervisados
LicenciaInvestigación/inclinación no comercialMITAbierta, con API alojada disponible

El nicho específico de Fish Speech son los equipos que necesitan una voz más consistente de lo que un único clip de referencia puede garantizar. La vía del ajuste fino es el elemento diferenciador que la mayoría de los modelos de clonación zero-shot de propósito único no ofrecen en absoluto.

Preguntas frecuentes

¿Cuál es la diferencia entre Fish Speech 1.5 y Fish Audio S2?

Fish Speech 1.5 es la versión anterior y más ligera dentro del mismo linaje del proyecto, muy adecuada para el autoalojamiento en hardware modesto. Fish Audio S2 es el actual modelo insignia, entrenado con muchos más datos y con un control emocional más preciso mediante etiquetas en lenguaje natural; actualmente ocupa los primeros puestos de varias evaluaciones TTS independientes.

¿Se puede realizar realmente un ajuste fino de Fish Speech o solo admite clonación zero-shot?

Admite ambas opciones. La clonación zero-shot funciona con un clip de referencia de 10–30 segundos sin ningún paso de entrenamiento; el ajuste fino está disponible cuando necesitas que una voz concreta sea más consistente de lo que puede ofrecer de forma fiable la clonación zero-shot.

¿Cómo funcionan las etiquetas de emoción de Fish Audio S2?

Colocas etiquetas en lenguaje natural como [whisper], [excited] o [angry] directamente en el texto de entrada, y el modelo ajusta la interpretación en ese punto concreto de la frase en lugar de aplicar una única configuración emocional a toda la salida.

¿Fish Speech es gratuito para uso comercial?

Comprueba cuidadosamente la licencia vigente antes de darlo por sentado. Los pesos de Fish Speech 1.5 se han publicado bajo una licencia CC BY-NC-SA (no comercial), mientras que Fish Audio S2 se rige por la licencia de investigación propia de Fish Audio. Ninguna es tan permisiva como MIT o Apache 2.0, por lo que las condiciones de despliegue comercial deben verificarse directamente.

¿Qué hardware necesito para autoalojar Fish Speech?

Fish Speech 1.5 necesita como mínimo unos 12GB de VRAM, con 24GB recomendados para cargas de producción. Consulta la documentación vigente para conocer los requisitos concretos de S2, ya que su mayor escala de entrenamiento suele implicar necesidades de hardware superiores.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →