EchoraEchora
Volver a los modelos

Llasa: la síntesis de voz como otra cosa más que LLaMA aprendió a hacer

6 de septiembre de 2026
•
7 min de lectura

Llasa, desarrollado por el Audio Lab de la Universidad de Ciencia y Tecnología de Hong Kong, se toma en serio una apuesta concreta: si conviertes la voz en tokens del mismo modo que tokenizas el texto, un modelo de lenguaje grande existente no necesita una arquitectura especializada para generarla; solo tiene que aprender un vocabulario nuevo. Llasa amplía directamente modelos LLaMA en tres escalas distintas y trata la voz como lo que su propia investigación describe como «un lenguaje especial», en lugar de una modalidad separada que requiera un sistema propio y específico.

¿Qué es Llasa?

Llasa es un sistema de texto a voz que amplía el modelo de lenguaje LLaMA basado en texto —disponible en tamaños de 1B, 3B y 8B parámetros— mediante la incorporación de tokens de voz del libro de códigos XCodec2, que contiene 65.536 tokens distintos. Se entrenó con 250.000 horas de datos de voz en chino e inglés: unas 160.000 horas procedentes de corpus de código abierto (LibriHeavy, Emilia y WenetSpeech4TTS), más otras 90.000 horas de datos internos. El método está diseñado para ser plenamente compatible con el framework LLaMA estándar: el audio se convierte en tokens de un único libro de códigos y se trata como una secuencia más que un modelo de lenguaje puede aprender a predecir. Esto permite aplicar directamente a Llasa las técnicas existentes de compresión, aceleración y ajuste fino de LLM, en vez de tener que crear desde cero herramientas específicas para TTS.

Cómo elegir entre 1B, 3B y 8B

Contar con tres tamaños del mismo enfoque subyacente supone una ventaja práctica real: permite adaptar la escala del modelo al hardware y a la calidad que necesitas, en lugar de quedar atado a un único tamaño fijo:

  • Llasa-1B es la opción más ligera, la más práctica cuando las limitaciones de recursos importan más que exprimir la máxima calidad y la versión que se usa con mayor frecuencia como base para ajustes posteriores en nuevos idiomas o dialectos.
  • Llasa-3B ocupa el punto intermedio y es la versión citada con mayor frecuencia en demostraciones y comparativas de la comunidad; una elección predeterminada razonable si no sabes qué tamaño encaja con tu caso de uso.
  • Llasa-8B es la versión más grande y capaz, con mayor alcance en la comprensión de textos complejos y la generación de voz matizada, a cambio de un coste computacional también mayor.

Escalar el cómputo en tiempo de prueba para la voz

Esta es la aportación de investigación más distintiva de Llasa y toma directamente una tendencia que ha impulsado recientemente el progreso de los LLM de texto: en lugar de mejorar la calidad únicamente entrenando un modelo mayor o con más datos, la investigación de Llasa también explora cómo escalar el cómputo durante la inferencia. Es la misma idea general que hay detrás de los modelos de razonamiento que «piensan durante más tiempo» para producir mejores respuestas, aplicada aquí a la generación de voz en vez de al razonamiento textual. Así, la aportación de Llasa trata tanto de cómo obtener más rendimiento de un modelo fijo mediante estrategias de inferencia como de la propia arquitectura del modelo.

Comprensión sólida del texto

Como Llasa se construye directamente sobre la base de un auténtico modelo de lenguaje, en lugar de añadir un pipeline de texto a fonemas a un modelo acústico, maneja textos de estructura compleja con un nivel de comprensión que hace tropezar a muchos sistemas TTS especializados. Los propios ejemplos del proyecto destacan expresamente listas numeradas, signos de puntuación incrustados y oraciones con varias cláusulas y diálogos entrecomillados como textos que Llasa-8B recorre correctamente en vez de atascarse.

Clonación de voz mediante prompts de voz

Llasa genera voz únicamente a partir del texto de entrada, usando sus características de voz generales, o bien condiciona la generación con un prompt de voz para clonar una voz; según lo publicado, bastan 15 segundos de audio de referencia para captar el timbre y el carácter emocional de la persona objetivo. Este diseño de dos modos evita que tengas que clonar una voz concreta si no lo necesitas: el texto a voz convencional está disponible como modo principal, no como una función secundaria.

Una particularidad práctica que conviene conocer

Si trabajas específicamente con Llasa-3B, ten en cuenta que el modelo espera una entrada de audio a 16kHz. Está documentado que proporcionar audio con otra frecuencia de muestreo degrada los resultados, por lo que merece la pena remuestrear los clips de referencia antes de ejecutar la inferencia como paso estándar de preprocesamiento, en lugar de descubrir la incompatibilidad después de una generación decepcionante.

Primeros pasos con Llasa

  1. Instala primero XCodec2. Como la tokenización de voz de Llasa depende directamente de este componente, asegúrate de que funcione antes de intentar cualquier inferencia o entrenamiento.
  2. Elige el tamaño del modelo en Hugging Face. HKUSTAudio/Llasa-1B, HKUSTAudio/Llasa-3B y HKUSTAudio/Llasa-8B están disponibles como descargas independientes; elige según tu presupuesto de hardware y tus requisitos de calidad, en lugar de usar por defecto el mayor.
  3. Utiliza el repositorio de inferencia dedicado para las pruebas. El proyecto de GitHub zhenye234/LLaSA_inference está creado específicamente para ejecutar y experimentar con el escalado del cómputo en tiempo de prueba, por separado de la base de código de entrenamiento.
  4. Utiliza el repositorio de entrenamiento si vas a ajustar el modelo o a entrenarlo desde cero. zhenye234/LLaSA_training proporciona los scripts y los conjuntos de datos tokenizados de código abierto documentados —unas 160.000 horas entre LibriHeavy, Emilia y WenetSpeech4TTS— necesarios para reproducir o ampliar el proceso de entrenamiento base.
  5. Haz coincidir la frecuencia de muestreo del audio de referencia con lo que espera el modelo. En especial por el requisito documentado de 16kHz de Llasa-3B, remuestrea el audio del prompt de voz antes de la generación, en vez de suponer que cualquier frecuencia funcionará igual.
  6. Considera ajustar Llasa-1B para idiomas o dialectos que no cubra su entrenamiento base. El modelo pequeño es el punto de partida más habitual para el ajuste fino y existen trabajos documentados de la comunidad que lo amplían a otros idiomas, como el cantonés. Por tanto, es una vía realista si tu idioma objetivo no está bien cubierto por el entrenamiento base en chino e inglés.

Consejos para obtener mejores resultados

  • Empieza con Llasa-3B si no sabes qué tamaño probar primero. Es la versión mencionada con mayor frecuencia en usos y demostraciones de la comunidad, por lo que resulta más fácil encontrar referencias de comparación y ayuda para resolver problemas que con los checkpoints 1B u 8B, menos comentados.
  • Dale textos realmente complejos para ver su verdadera fortaleza. La buena comprensión del texto es una capacidad destacada expresamente; probar solo frases sencillas y limpias no mostrará en qué se diferencia Llasa de pipelines TTS más básicos.
  • Usa para la clonación un clip de referencia limpio de 15 segundos o más. Es el mínimo práctico citado habitualmente para captar de forma fiable el timbre y el carácter emocional de una voz objetivo.
  • No esperes un rendimiento sólido de fábrica en idiomas ajenos a su entrenamiento en chino e inglés. Una evaluación independiente en cantonés, por ejemplo, mostró que el modelo base Llasa-1B rendía considerablemente peor que modelos específicos multilingües o de cantonés hasta que se ajustó expresamente con datos de ese idioma. Si tu idioma objetivo no es chino ni inglés, planifica una fase de ajuste fino.
  • Aprovecha técnicas propias de los LLM gracias a la arquitectura LLaMA compartida. Como Llasa está realmente construido sobre el framework LLaMA, es más probable que métodos consolidados de optimización de LLM —cuantización, ajuste fino con LoRA y técnicas similares— se transfieran sin problemas que en una arquitectura TTS completamente distinta.

Llasa frente a otros enfoques TTS basados en LLM

LlasaOuteTTSCosyVoice3
Arquitectura baseLLaMA (1B/3B/8B) + tokens XCodec2LLaMA/Qwen + tokens DACTokens semánticos supervisados + flow matching
Tamaños del modelo1B, 3B, 8B350M–1B0.5B
IdiomasChino, inglés23 (v1.0)9 + 18 dialectos chinos
Clonación de vozSí, prompt de voz de ~15 segundosSí, referencia de ~10 segundosSí, referencia de ~3–10 segundos
Ejecución mediante llama.cpp / GGUFNo es la vía principal de despliegueSí, de forma nativaNo
Rendimiento dialectal de fábricaRequiere ajuste fino fuera del chino y el inglésCentrado en inglésAmplio soporte nativo de dialectos chinos

El nicho específico de Llasa consiste en ofrecer una flexibilidad real de tamaños —de 1B a 8B— dentro del enfoque de «TTS como modelado puro del lenguaje», junto con una investigación centrada en escalar el cómputo durante la inferencia. Es un énfasis distinto de la estrategia de despliegue de OuteTTS, que prioriza llama.cpp, o de la amplitud dialectal de CosyVoice3, aunque los tres pertenezcan a una familia arquitectónica similar.

Preguntas frecuentes

¿Cuál es la diferencia entre Llasa 1B, 3B y 8B?

Comparten el mismo enfoque subyacente a escalas crecientes: 1B es el más ligero y el punto de partida más habitual para el ajuste fino; 3B es la versión más utilizada en demostraciones de la comunidad; y 8B es el mayor, con la comprensión de texto y la calidad de generación más sólidas a un coste computacional superior.

¿Cuánto audio de referencia necesita Llasa para clonar una voz?

Se suele citar que unos 15 segundos de audio de referencia limpio bastan para captar el timbre y el carácter emocional de la persona objetivo.

¿Funciona bien Llasa en idiomas distintos del chino y el inglés?

No de fábrica. Las pruebas independientes en cantonés, por ejemplo, mostraron que el modelo base rendía peor que sistemas específicos de cantonés o multilingües hasta que se ajustó expresamente con datos de ese idioma.

¿Qué significa «escalar el cómputo en tiempo de prueba» para Llasa?

Se refiere a mejorar la calidad de salida mediante cómputo adicional durante la inferencia, en lugar de hacerlo solo con la escala del entrenamiento. Es un concepto similar a cómo los modelos de lenguaje orientados al razonamiento usan cómputo adicional en inferencia para producir mejores respuestas, aplicado aquí a la generación de voz.

¿Por qué Llasa-3B necesita específicamente una entrada de audio a 16kHz?

Es un requisito documentado de ese checkpoint concreto: introducir audio con otras frecuencias de muestreo es una causa conocida de resultados degradados, por lo que conviene remuestrear de antemano los clips de referencia a 16kHz como práctica estándar.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →