Sesame CSM 1B: voz basada en la conversación, no solo en el texto
- ¿Qué es CSM 1B?
- Bajo el capó: dos Transformers y el códec Mimi
- La verdadera diferencia: basar la voz en la conversación real
- Una aclaración honesta: el checkpoint abierto frente a la demo viral
- Lo que CSM no puede hacer
- Primeros pasos con CSM 1B
- Consejos para obtener mejores resultados
- CSM 1B frente a otros modelos de voz con backbone Llama
- Preguntas frecuentes
- Convierte un guion con varios hablantes en audio
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
La mayoría de los modelos TTS reciben una frase y la leen. CSM 1B de Sesame recibe toda la conversación hasta ese momento —el audio real de lo que se ha dicho, no solo su transcripción— y genera la siguiente intervención a partir de ese contexto, adaptándose al ritmo, el tono y el matiz emocional que la conversación ya ha establecido. Esa diferencia constituye toda la premisa de CSM y es lo que Sesame denomina «presencia de voz» (voice presence): el objetivo de que una interacción hablada se sienta real y transmita comprensión, en lugar de limitarse a narrar.
¿Qué es CSM 1B?
CSM (Conversational Speech Model) es un modelo de generación de voz con pesos abiertos de Sesame AI, una startup de San Francisco cofundada por Brendan Iribe, antiguo CEO de Oculus. Publicado como un checkpoint de 1.000 millones de parámetros en marzo de 2025 bajo la licencia Apache 2.0, totalmente permisiva, CSM genera voz directamente a partir de historiales intercalados de texto y audio —en lugar de hacerlo únicamente desde texto— mediante una arquitectura de dos Transformers construida sobre un backbone LLaMA.
Bajo el capó: dos Transformers y el códec Mimi
La arquitectura de CSM reparte el trabajo de generación entre dos decodificadores autorregresivos al estilo de LLaMA. Un decodificador backbone de mayor tamaño procesa el contexto intercalado de texto y audio y predice el primer token del codebook para el siguiente fragmento de voz. Después, un decodificador de profundidad más pequeño toma el estado oculto de ese backbone y genera el resto de los tokens acústicos del codebook necesarios para reconstruir un audio plenamente inteligible.
Ambos decodificadores operan con tokens de Mimi, un códec de audio de cuantización vectorial residual dividida (RVQ) desarrollado por Kyutai. Mimi comprime la voz hasta aproximadamente 1,1 kbps con una frecuencia de fotogramas de 12,5 Hz, a la vez que conserva una alta fidelidad de audio. Es una representación lo bastante eficiente como para que CSM funcione sin las elevadas exigencias computacionales que requieren pipelines acústicos más complejos.
La verdadera diferencia: basar la voz en la conversación real
Conviene detenerse en este punto, porque es fácil restarle importancia y verlo como un detalle arquitectónico menor. Al permitir que el decodificador backbone acceda simultáneamente tanto al audio como al texto anteriores, CSM puede basar su siguiente intervención en el estilo acústico real que ha tenido la conversación hasta ese momento —incluidos el contorno tonal, el ritmo y el estado emocional del hablante—, en lugar de generar una respuesta solo a partir de cómo indica el texto que debería sonar. Este es el mecanismo concreto que permite a CSM igualar la energía de una persona cuando parece cansada, sonar más animado cuando está entusiasmada y hacer pausas más naturales cuando el ritmo de la conversación disminuye. La mayoría de los sistemas de voz de producción anteriores generan a partir de una representación textual, sin esa base acústica de lo que acaba de suceder realmente en el intercambio.
Una aclaración honesta: el checkpoint abierto frente a la demo viral
Conviene precisar qué obtienes realmente. Una variante de CSM sometida a ajuste fino impulsa Maya y Miles, los acompañantes de voz alojados por Sesame cuya demo se hizo viral en febrero de 2025 por sonar más parecidos a un interlocutor real que los anteriores sistemas TTS comerciales. El checkpoint CSM 1B publicado es el modelo base de código abierto que sustenta esa experiencia, no la versión exacta con ajuste fino utilizada en la demo viral. Ajusta tus expectativas en consecuencia: el modelo base es realmente una base competente, pero el acabado específico de la demo que llegó a los titulares requirió un ajuste fino adicional que Sesame no ha publicado como pesos abiertos.
Lo que CSM no puede hacer
Antes de construir algo en torno a él, conviene conocer algunas limitaciones. CSM se ha entrenado específicamente como modelo de generación de audio, no como un LLM multimodal de propósito general: no puede generar texto, por lo que tendrás que combinarlo con otro modelo de lenguaje que produzca el contenido real de la respuesta antes de que CSM lo convierta en voz. También es, ante todo, un modelo en inglés; cuenta con cierta capacidad accidental para otros idiomas debido a la contaminación de sus datos de entrenamiento, pero no es una función en la que se pueda confiar para ningún caso de uso serio fuera del inglés.
Sesame también ha sido explícita sobre el uso aceptable: las directrices del proyecto prohíben generar voz que suplante a una persona real sin su consentimiento explícito, crear contenido engañoso o fraudulento —como noticias falsas o llamadas fraudulentas— y cualquier aplicación ilegal o perjudicial de la tecnología.
Primeros pasos con CSM 1B
- Clona el repositorio. Ejecuta
git clone [email protected]:SesameAILabs/csm.git, configura después un entorno virtual de Python 3.10 e instala las dependencias mediantepip install -r requirements.txt. - Obtén acceso a los dos modelos restringidos en Hugging Face. Necesitarás acceso aprobado tanto a
sesame/CSM 1Bcomo ameta-llama/Llama-3.2-1B, ya que el backbone de CSM depende del checkpoint de Llama. Inicia sesión mediantehuggingface-cli loginantes de intentar descargar cualquiera de ellos. - Desactiva la compilación diferida en Mimi. Establecer la variable de entorno
NO_TORCH_COMPILE=1es un paso documentado para evitar problemas de compilación específicos del componente del códec Mimi. - Usa
triton-windowsen lugar detritonestándar en Windows. El paquetetritonestándar no se puede instalar en Windows y la documentación del proyecto indica expresamente este sustituto. - Combínalo con un LLM independiente para crear pipelines conversacionales completos. Como CSM solo genera audio, planifica un modelo de generación de texto al principio del pipeline para producir el contenido real del diálogo que CSM convertirá después en voz.
- Considera un fork de la comunidad para disponer de una interfaz más completa desde el primer momento. Proyectos como
akashjss/sesame-csmañaden una interfaz Gradio y una API compatible con OpenAI sobre el modelo base, con soporte para dispositivos CUDA, MLX y CPU. Es una vía más rápida hacia una interfaz utilizable que construirla directamente a partir del repositorio base.
Consejos para obtener mejores resultados
- Proporciónale un historial de conversación real, no solo la frase que quieres que pronuncie. La ventaja fundamental de CSM solo aparece cuando le das contexto intercalado de texto y audio en el que apoyarse; usarlo como un modelo TTS de una sola frase sin ese historial no hace justicia a aquello para lo que realmente fue diseñado.
- No esperes que el checkpoint base alcance exactamente la calidad de la demo viral de Maya/Miles. Esa experiencia funciona con una variante sometida a ajuste fino que Sesame no ha publicado como código abierto; considera el CSM 1B público como una base sólida sobre la que desarrollar y realizar ajustes finos, no como una réplica exacta de lo que se hizo viral.
- Diseña tu pipeline teniendo presente que CSM solo genera audio. Reserva un modelo de generación de texto independiente para alimentar a CSM, en lugar de esperar que se encargue de generar el diálogo y ponerle voz en un único paso.
- Limítate al inglés para cualquier aplicación crítica de producción. Dado que su capacidad para otros idiomas es accidental y poco fiable, trata el inglés como el único idioma para el que el modelo se ha creado y probado realmente.
- Respeta las directrices explícitas de uso sobre consentimiento y suplantación. Precisamente porque la salida de CSM puede resultar tan convincentemente consciente del contexto, toma en serio las restricciones del propio proyecto contra la suplantación de voz sin consentimiento, en lugar de tratarlas como una fórmula de rigor.
CSM 1B frente a otros modelos de voz con backbone Llama
| CSM 1B | Orpheus TTS | Modelos típicos de clonación con audio de referencia | |
|---|---|---|---|
| Entrada principal | Historial de conversación con texto + audio intercalados | Texto (más una referencia de voz opcional) | Texto + un único clip de referencia estático |
| Backbone | Arquitectura LLaMA de dos Transformers | Llama-3B | Varía (difusión, flow matching, etc.) |
| Códec | Mimi (Kyutai), 12,5 Hz, 1,1 kbps | SNAC | Varía |
| Puede generar texto | No, solo audio | No, solo audio | No |
| Conciencia del contexto | Objetivo principal del diseño | No es un objetivo principal | No es un objetivo principal |
| Licencia | Apache 2.0 | Apache 2.0 | Varía |
El nicho específico de CSM 1B es una auténtica base conversacional: adaptarse a la realidad acústica de un intercambio en curso en lugar de tratar cada frase como una tarea de generación aislada. Se trata de un objetivo de diseño sustancialmente diferente al de los modelos centrados en la narración o la clonación de voz a partir de clips de referencia.
Preguntas frecuentes
¿Qué significan las siglas CSM?
Conversational Speech Model, lo que refleja su objetivo principal de diseño: mantener la conciencia del contexto durante un diálogo, en lugar de generar intervenciones aisladas y descontextualizadas.
¿Puede CSM 1B generar respuestas de texto por sí solo?
No. CSM se ha entrenado específicamente como modelo de generación de audio y no puede generar texto; combínalo con un modelo de lenguaje independiente que produzca el contenido del diálogo antes de que CSM lo convierta en voz.
¿Es el CSM 1B de código abierto el mismo modelo que impulsa la demo viral de voz de Sesame?
No exactamente. Una variante de CSM sometida a ajuste fino impulsa Maya y Miles, los acompañantes de voz alojados de la demo viral de Sesame. El CSM 1B publicado es el modelo base de código abierto que sustenta ese sistema, no esa versión concreta con ajuste fino.
¿Qué es el códec Mimi?
Mimi es un códec de audio de cuantización vectorial residual dividida desarrollado por Kyutai. CSM lo utiliza para codificar la voz en tokens discretos y volver a decodificarlos como audio a aproximadamente 1,1 kbps, manteniendo una alta fidelidad.
¿Se puede usar CSM 1B gratis con fines comerciales?
Sí, en lo que respecta a la licencia: se publica bajo la licencia Apache 2.0. Dicho esto, las directrices de uso de Sesame prohíben explícitamente la suplantación de voz sin consentimiento y los usos engañosos, y se aplican con independencia de que la licencia del código sea permisiva.
Convierte un guion con varios hablantes en audio
Si ya tienes un guion terminado con varios hablantes, utiliza Texto a diálogo de Echora. Añade hasta 12 bloques de diálogo y 5.000 caracteres en total, asigna una voz a cada bloque, incorpora etiquetas de interpretación compatibles y ajusta la estabilidad o el refuerzo del hablante. Después podrás escuchar y descargar la conversación completa.