EchoraEchora
Voltar aos modelos

Sesame CSM 1B: fala baseada na conversa, não apenas no texto

6 de setembro de 2026
•
7 min de leitura

A maioria dos modelos de TTS recebe uma frase e a lê. O CSM 1B da Sesame recebe toda a conversa até aquele momento — o áudio real do que foi dito, não apenas sua transcrição — e gera a próxima fala com base nesse contexto, acompanhando o ritmo, a altura e o tom emocional que a conversa já estabeleceu. Essa distinção é toda a premissa por trás do CSM e aquilo que a Sesame chama de “presença vocal” (voice presence): o objetivo de fazer uma interação falada parecer real e transmitir compreensão, em vez de se limitar à narração.

O que é o CSM 1B?

O CSM (Conversational Speech Model) é um modelo de geração de fala com pesos abertos da Sesame AI, startup de San Francisco cofundada pelo ex-CEO da Oculus Brendan Iribe. Lançado como um checkpoint de 1 bilhão de parâmetros em março de 2025 sob a licença Apache 2.0, totalmente permissiva, o CSM gera fala diretamente a partir de um histórico intercalado de texto e áudio — em vez de usar apenas texto — com uma arquitetura de dois Transformers construída sobre um backbone LLaMA.

Por dentro: dois Transformers e o codec Mimi

A arquitetura do CSM divide o trabalho de geração entre dois decodificadores autorregressivos no estilo do LLaMA. Um decodificador backbone maior processa o contexto intercalado de texto e áudio e prevê o primeiro token do codebook para o próximo trecho de fala. Em seguida, um decodificador de profundidade menor recebe o estado oculto desse backbone e gera os tokens acústicos restantes do codebook, necessários para reconstruir um áudio completamente inteligível.

Os dois decodificadores operam com tokens do Mimi, um codec de áudio com quantização vetorial residual dividida (RVQ) desenvolvido pela Kyutai. O Mimi comprime a fala para cerca de 1,1 kbps a uma taxa de quadros de 12,5 Hz, preservando alta fidelidade de áudio. É uma representação eficiente o suficiente para que o CSM funcione sem as altas exigências computacionais de pipelines acústicos mais elaborados.

O verdadeiro diferencial: basear a fala na conversa real

Vale a pena refletir sobre isso, pois é fácil minimizar o recurso como um pequeno detalhe de arquitetura. Ao dar ao decodificador backbone acesso simultâneo ao áudio e ao texto anteriores, o CSM consegue basear sua próxima fala no estilo acústico real que a conversa apresentou até aquele momento — incluindo o contorno de altura, o ritmo e o estado emocional do falante — em vez de gerar uma resposta apenas com base em como o texto indica que ela deveria soar. Esse é o mecanismo específico por trás da capacidade do CSM de acompanhar a energia de uma pessoa quando ela parece cansada, soar mais animado quando ela está empolgada e fazer pausas mais naturais quando o ritmo da conversa diminui. A maioria dos sistemas de voz de produção anteriores gera áudio somente a partir da representação textual, sem essa base acústica no que realmente acabou de acontecer durante a interação.

Uma observação honesta: o checkpoint aberto e a demo viral

É importante ser preciso sobre aquilo que você realmente recebe. Uma variante do CSM com ajuste fino alimenta Maya e Miles, os companheiros de voz hospedados pela Sesame cuja demo viralizou em fevereiro de 2025 por soar mais próxima de um interlocutor real do que os sistemas comerciais de TTS anteriores. O checkpoint CSM 1B disponibilizado publicamente é o modelo-base de código aberto por trás dessa experiência, não a versão exata com ajuste fino usada na própria demo viral. Ajuste suas expectativas de acordo: o modelo-base é de fato uma base competente, mas o acabamento específico da demo que ganhou as manchetes envolveu um ajuste fino adicional que a Sesame não disponibilizou como pesos abertos.

O que o CSM não consegue fazer

Há algumas limitações que vale a pena conhecer antes de desenvolver algo em torno dele. O CSM é treinado especificamente como modelo de geração de áudio, não como um LLM multimodal de uso geral — ele não consegue gerar texto. Portanto, você precisará combiná-lo com outro modelo de linguagem para produzir o conteúdo real da resposta antes que o CSM o transforme em fala. Ele também é principalmente um modelo em inglês; possui alguma capacidade incidental em outros idiomas devido à contaminação dos dados de treinamento, mas não é uma função confiável para nenhum caso de uso sério em outros idiomas.

A Sesame também foi explícita sobre o uso aceitável: as diretrizes do projeto proíbem gerar fala que imite uma pessoa real sem o consentimento explícito dela, criar conteúdo enganoso ou fraudulento — como notícias falsas ou ligações fraudulentas — e qualquer aplicação ilegal ou prejudicial da tecnologia.

Como começar a usar o CSM 1B

  1. Clone o repositório. Execute git clone [email protected]:SesameAILabs/csm.git, configure um ambiente virtual do Python 3.10 e instale as dependências com pip install -r requirements.txt.
  2. Obtenha acesso aos dois modelos restritos no Hugging Face. Você precisará de acesso aprovado tanto ao sesame/CSM 1B quanto ao meta-llama/Llama-3.2-1B, pois o backbone do CSM depende do checkpoint do Llama. Entre com huggingface-cli login antes de tentar baixar qualquer um deles.
  3. Desative a compilação tardia no Mimi. Definir a variável de ambiente NO_TORCH_COMPILE=1 é uma etapa documentada para evitar problemas de compilação específicos do componente do codec Mimi.
  4. Use triton-windows em vez do triton padrão no Windows. O pacote triton padrão não pode ser instalado no Windows, e a documentação do projeto indica especificamente esse substituto.
  5. Combine-o com um LLM separado para ter pipelines conversacionais completos. Como o CSM gera apenas áudio, planeje um modelo de geração de texto no início do pipeline para produzir o conteúdo real do diálogo que o CSM transformará em voz.
  6. Considere um fork da comunidade para ter uma interface mais completa e pronta para uso. Projetos como akashjss/sesame-csm adicionam uma interface Gradio e uma API compatível com a OpenAI sobre o modelo-base, com suporte a dispositivos CUDA, MLX e CPU. Esse é um caminho mais rápido para uma interface utilizável do que criar uma diretamente a partir do repositório-base.

Dicas para obter resultados melhores

  • Forneça um histórico de conversa real, não apenas a frase que você quer que seja falada. A principal vantagem do CSM só aparece quando você fornece um contexto intercalado de texto e áudio no qual ele possa se basear. Usá-lo como um modelo TTS de frase única sem esse histórico subestima aquilo para que ele realmente foi desenvolvido.
  • Não espere do checkpoint-base exatamente a mesma qualidade da demo viral de Maya/Miles. Essa experiência usa uma variante com ajuste fino que a Sesame não disponibilizou como código aberto. Trate o CSM 1B público como uma base sólida para desenvolver e fazer ajustes finos, não como uma réplica exata da experiência que viralizou.
  • Planeje seu pipeline considerando que o CSM gera somente áudio. Reserve um modelo separado de geração de texto para alimentar o CSM, em vez de esperar que ele cuide da geração do diálogo e da voz em uma só etapa.
  • Use apenas inglês em qualquer aplicação essencial para produção. Como sua capacidade em outros idiomas é incidental e pouco confiável, trate o inglês como o único idioma para o qual o modelo realmente foi desenvolvido e testado.
  • Respeite as diretrizes explícitas de uso sobre consentimento e imitação. Justamente porque a saída sensível ao contexto do CSM pode ser tão convincente, leve a sério as restrições do próprio projeto contra a imitação de voz sem consentimento, em vez de tratá-las como um simples texto padrão.

CSM 1B em comparação com outros modelos de fala com backbone Llama

CSM 1BOrpheus TTSModelos típicos de clonagem com áudio de referência
Entrada principalHistórico de conversa com texto + áudio intercaladosTexto (mais uma referência de voz opcional)Texto + um único clipe de referência estático
BackboneArquitetura LLaMA com dois TransformersLlama-3BVaria (difusão, flow matching etc.)
CodecMimi (Kyutai), 12,5 Hz, 1,1 kbpsSNACVaria
Pode gerar textoNão, apenas áudioNão, apenas áudioNão
Sensibilidade ao contextoPrincipal objetivo de projetoNão é o foco principalNão é o foco principal
LicençaApache 2.0Apache 2.0Varia

O nicho específico do CSM 1B é a fundamentação realmente conversacional: acompanhar a realidade acústica de uma interação em andamento em vez de tratar cada fala como uma tarefa de geração isolada. Esse é um objetivo de projeto significativamente diferente tanto dos modelos voltados à narração quanto dos modelos de clonagem de voz com clipes de referência.

Perguntas frequentes

O que significa CSM?

Conversational Speech Model — nome que reflete seu principal objetivo de projeto: manter a percepção do contexto ao longo de um diálogo em vez de gerar falas isoladas e sem contexto.

O CSM 1B consegue gerar respostas em texto sozinho?

Não. O CSM é treinado especificamente como modelo de geração de áudio e não consegue gerar texto. Combine-o com outro modelo de linguagem para produzir o conteúdo do diálogo antes que o CSM o converta em fala.

O CSM 1B de código aberto é o mesmo modelo por trás da demo de voz viral da Sesame?

Não exatamente. Uma variante do CSM com ajuste fino alimenta Maya e Miles, os companheiros de voz hospedados da demo viral da Sesame. O CSM 1B disponibilizado publicamente é o modelo-base de código aberto por trás desse sistema, não a variante específica com ajuste fino.

O que é o codec Mimi?

O Mimi é um codec de áudio com quantização vetorial residual dividida desenvolvido pela Kyutai. O CSM o utiliza para codificar a fala em tokens discretos e decodificá-los novamente em áudio a cerca de 1,1 kbps, preservando alta fidelidade.

O CSM 1B é gratuito para uso comercial?

Sim, em termos de licenciamento: ele é disponibilizado sob a licença Apache 2.0. Ainda assim, as diretrizes de uso da Sesame proíbem explicitamente a imitação de voz sem consentimento e o uso enganoso, regras que se aplicam independentemente de a licença do código ser permissiva.

Transforme um roteiro com vários locutores em áudio

Se você já tem um roteiro pronto com vários locutores, use o Texto para diálogo da Echora. Adicione até 12 blocos de diálogo e 5.000 caracteres no total, atribua uma voz a cada bloco, inclua tags de interpretação compatíveis e ajuste a estabilidade ou o reforço do locutor. Depois, você pode ouvir e baixar a conversa completa.

Criar áudio de diálogo →