EchoraEchora
Volver a los modelos

Sesame CSM 1B: voz basada en la conversación, no solo en el texto

6 de septiembre de 2026
•
7 min de lectura

La mayoría de los modelos TTS reciben una frase y la leen. CSM 1B de Sesame recibe toda la conversación hasta ese momento —el audio real de lo que se ha dicho, no solo su transcripción— y genera la siguiente intervención a partir de ese contexto, adaptándose al ritmo, el tono y el matiz emocional que la conversación ya ha establecido. Esa diferencia constituye toda la premisa de CSM y es lo que Sesame denomina «presencia de voz» (voice presence): el objetivo de que una interacción hablada se sienta real y transmita comprensión, en lugar de limitarse a narrar.

¿Qué es CSM 1B?

CSM (Conversational Speech Model) es un modelo de generación de voz con pesos abiertos de Sesame AI, una startup de San Francisco cofundada por Brendan Iribe, antiguo CEO de Oculus. Publicado como un checkpoint de 1.000 millones de parámetros en marzo de 2025 bajo la licencia Apache 2.0, totalmente permisiva, CSM genera voz directamente a partir de historiales intercalados de texto y audio —en lugar de hacerlo únicamente desde texto— mediante una arquitectura de dos Transformers construida sobre un backbone LLaMA.

Bajo el capó: dos Transformers y el códec Mimi

La arquitectura de CSM reparte el trabajo de generación entre dos decodificadores autorregresivos al estilo de LLaMA. Un decodificador backbone de mayor tamaño procesa el contexto intercalado de texto y audio y predice el primer token del codebook para el siguiente fragmento de voz. Después, un decodificador de profundidad más pequeño toma el estado oculto de ese backbone y genera el resto de los tokens acústicos del codebook necesarios para reconstruir un audio plenamente inteligible.

Ambos decodificadores operan con tokens de Mimi, un códec de audio de cuantización vectorial residual dividida (RVQ) desarrollado por Kyutai. Mimi comprime la voz hasta aproximadamente 1,1 kbps con una frecuencia de fotogramas de 12,5 Hz, a la vez que conserva una alta fidelidad de audio. Es una representación lo bastante eficiente como para que CSM funcione sin las elevadas exigencias computacionales que requieren pipelines acústicos más complejos.

La verdadera diferencia: basar la voz en la conversación real

Conviene detenerse en este punto, porque es fácil restarle importancia y verlo como un detalle arquitectónico menor. Al permitir que el decodificador backbone acceda simultáneamente tanto al audio como al texto anteriores, CSM puede basar su siguiente intervención en el estilo acústico real que ha tenido la conversación hasta ese momento —incluidos el contorno tonal, el ritmo y el estado emocional del hablante—, en lugar de generar una respuesta solo a partir de cómo indica el texto que debería sonar. Este es el mecanismo concreto que permite a CSM igualar la energía de una persona cuando parece cansada, sonar más animado cuando está entusiasmada y hacer pausas más naturales cuando el ritmo de la conversación disminuye. La mayoría de los sistemas de voz de producción anteriores generan a partir de una representación textual, sin esa base acústica de lo que acaba de suceder realmente en el intercambio.

Una aclaración honesta: el checkpoint abierto frente a la demo viral

Conviene precisar qué obtienes realmente. Una variante de CSM sometida a ajuste fino impulsa Maya y Miles, los acompañantes de voz alojados por Sesame cuya demo se hizo viral en febrero de 2025 por sonar más parecidos a un interlocutor real que los anteriores sistemas TTS comerciales. El checkpoint CSM 1B publicado es el modelo base de código abierto que sustenta esa experiencia, no la versión exacta con ajuste fino utilizada en la demo viral. Ajusta tus expectativas en consecuencia: el modelo base es realmente una base competente, pero el acabado específico de la demo que llegó a los titulares requirió un ajuste fino adicional que Sesame no ha publicado como pesos abiertos.

Lo que CSM no puede hacer

Antes de construir algo en torno a él, conviene conocer algunas limitaciones. CSM se ha entrenado específicamente como modelo de generación de audio, no como un LLM multimodal de propósito general: no puede generar texto, por lo que tendrás que combinarlo con otro modelo de lenguaje que produzca el contenido real de la respuesta antes de que CSM lo convierta en voz. También es, ante todo, un modelo en inglés; cuenta con cierta capacidad accidental para otros idiomas debido a la contaminación de sus datos de entrenamiento, pero no es una función en la que se pueda confiar para ningún caso de uso serio fuera del inglés.

Sesame también ha sido explícita sobre el uso aceptable: las directrices del proyecto prohíben generar voz que suplante a una persona real sin su consentimiento explícito, crear contenido engañoso o fraudulento —como noticias falsas o llamadas fraudulentas— y cualquier aplicación ilegal o perjudicial de la tecnología.

Primeros pasos con CSM 1B

  1. Clona el repositorio. Ejecuta git clone [email protected]:SesameAILabs/csm.git, configura después un entorno virtual de Python 3.10 e instala las dependencias mediante pip install -r requirements.txt.
  2. Obtén acceso a los dos modelos restringidos en Hugging Face. Necesitarás acceso aprobado tanto a sesame/CSM 1B como a meta-llama/Llama-3.2-1B, ya que el backbone de CSM depende del checkpoint de Llama. Inicia sesión mediante huggingface-cli login antes de intentar descargar cualquiera de ellos.
  3. Desactiva la compilación diferida en Mimi. Establecer la variable de entorno NO_TORCH_COMPILE=1 es un paso documentado para evitar problemas de compilación específicos del componente del códec Mimi.
  4. Usa triton-windows en lugar de triton estándar en Windows. El paquete triton estándar no se puede instalar en Windows y la documentación del proyecto indica expresamente este sustituto.
  5. Combínalo con un LLM independiente para crear pipelines conversacionales completos. Como CSM solo genera audio, planifica un modelo de generación de texto al principio del pipeline para producir el contenido real del diálogo que CSM convertirá después en voz.
  6. Considera un fork de la comunidad para disponer de una interfaz más completa desde el primer momento. Proyectos como akashjss/sesame-csm añaden una interfaz Gradio y una API compatible con OpenAI sobre el modelo base, con soporte para dispositivos CUDA, MLX y CPU. Es una vía más rápida hacia una interfaz utilizable que construirla directamente a partir del repositorio base.

Consejos para obtener mejores resultados

  • Proporciónale un historial de conversación real, no solo la frase que quieres que pronuncie. La ventaja fundamental de CSM solo aparece cuando le das contexto intercalado de texto y audio en el que apoyarse; usarlo como un modelo TTS de una sola frase sin ese historial no hace justicia a aquello para lo que realmente fue diseñado.
  • No esperes que el checkpoint base alcance exactamente la calidad de la demo viral de Maya/Miles. Esa experiencia funciona con una variante sometida a ajuste fino que Sesame no ha publicado como código abierto; considera el CSM 1B público como una base sólida sobre la que desarrollar y realizar ajustes finos, no como una réplica exacta de lo que se hizo viral.
  • Diseña tu pipeline teniendo presente que CSM solo genera audio. Reserva un modelo de generación de texto independiente para alimentar a CSM, en lugar de esperar que se encargue de generar el diálogo y ponerle voz en un único paso.
  • Limítate al inglés para cualquier aplicación crítica de producción. Dado que su capacidad para otros idiomas es accidental y poco fiable, trata el inglés como el único idioma para el que el modelo se ha creado y probado realmente.
  • Respeta las directrices explícitas de uso sobre consentimiento y suplantación. Precisamente porque la salida de CSM puede resultar tan convincentemente consciente del contexto, toma en serio las restricciones del propio proyecto contra la suplantación de voz sin consentimiento, en lugar de tratarlas como una fórmula de rigor.

CSM 1B frente a otros modelos de voz con backbone Llama

CSM 1BOrpheus TTSModelos típicos de clonación con audio de referencia
Entrada principalHistorial de conversación con texto + audio intercaladosTexto (más una referencia de voz opcional)Texto + un único clip de referencia estático
BackboneArquitectura LLaMA de dos TransformersLlama-3BVaría (difusión, flow matching, etc.)
CódecMimi (Kyutai), 12,5 Hz, 1,1 kbpsSNACVaría
Puede generar textoNo, solo audioNo, solo audioNo
Conciencia del contextoObjetivo principal del diseñoNo es un objetivo principalNo es un objetivo principal
LicenciaApache 2.0Apache 2.0Varía

El nicho específico de CSM 1B es una auténtica base conversacional: adaptarse a la realidad acústica de un intercambio en curso en lugar de tratar cada frase como una tarea de generación aislada. Se trata de un objetivo de diseño sustancialmente diferente al de los modelos centrados en la narración o la clonación de voz a partir de clips de referencia.

Preguntas frecuentes

¿Qué significan las siglas CSM?

Conversational Speech Model, lo que refleja su objetivo principal de diseño: mantener la conciencia del contexto durante un diálogo, en lugar de generar intervenciones aisladas y descontextualizadas.

¿Puede CSM 1B generar respuestas de texto por sí solo?

No. CSM se ha entrenado específicamente como modelo de generación de audio y no puede generar texto; combínalo con un modelo de lenguaje independiente que produzca el contenido del diálogo antes de que CSM lo convierta en voz.

¿Es el CSM 1B de código abierto el mismo modelo que impulsa la demo viral de voz de Sesame?

No exactamente. Una variante de CSM sometida a ajuste fino impulsa Maya y Miles, los acompañantes de voz alojados de la demo viral de Sesame. El CSM 1B publicado es el modelo base de código abierto que sustenta ese sistema, no esa versión concreta con ajuste fino.

¿Qué es el códec Mimi?

Mimi es un códec de audio de cuantización vectorial residual dividida desarrollado por Kyutai. CSM lo utiliza para codificar la voz en tokens discretos y volver a decodificarlos como audio a aproximadamente 1,1 kbps, manteniendo una alta fidelidad.

¿Se puede usar CSM 1B gratis con fines comerciales?

Sí, en lo que respecta a la licencia: se publica bajo la licencia Apache 2.0. Dicho esto, las directrices de uso de Sesame prohíben explícitamente la suplantación de voz sin consentimiento y los usos engañosos, y se aplican con independencia de que la licencia del código sea permisiva.

Convierte un guion con varios hablantes en audio

Si ya tienes un guion terminado con varios hablantes, utiliza Texto a diálogo de Echora. Añade hasta 12 bloques de diálogo y 5.000 caracteres en total, asigna una voz a cada bloque, incorpora etiquetas de interpretación compatibles y ajusta la estabilidad o el refuerzo del hablante. Después podrás escuchar y descargar la conversación completa.

Crear audio de diálogo →