Sesame CSM 1B: fala baseada na conversa, não apenas no texto
- O que é o CSM 1B?
- Por dentro: dois Transformers e o codec Mimi
- O verdadeiro diferencial: basear a fala na conversa real
- Uma observação honesta: o checkpoint aberto e a demo viral
- O que o CSM não consegue fazer
- Como começar a usar o CSM 1B
- Dicas para obter resultados melhores
- CSM 1B em comparação com outros modelos de fala com backbone Llama
- Perguntas frequentes
- Transforme um roteiro com vários locutores em áudio
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
A maioria dos modelos de TTS recebe uma frase e a lê. O CSM 1B da Sesame recebe toda a conversa até aquele momento — o áudio real do que foi dito, não apenas sua transcrição — e gera a próxima fala com base nesse contexto, acompanhando o ritmo, a altura e o tom emocional que a conversa já estabeleceu. Essa distinção é toda a premissa por trás do CSM e aquilo que a Sesame chama de “presença vocal” (voice presence): o objetivo de fazer uma interação falada parecer real e transmitir compreensão, em vez de se limitar à narração.
O que é o CSM 1B?
O CSM (Conversational Speech Model) é um modelo de geração de fala com pesos abertos da Sesame AI, startup de San Francisco cofundada pelo ex-CEO da Oculus Brendan Iribe. Lançado como um checkpoint de 1 bilhão de parâmetros em março de 2025 sob a licença Apache 2.0, totalmente permissiva, o CSM gera fala diretamente a partir de um histórico intercalado de texto e áudio — em vez de usar apenas texto — com uma arquitetura de dois Transformers construída sobre um backbone LLaMA.
Por dentro: dois Transformers e o codec Mimi
A arquitetura do CSM divide o trabalho de geração entre dois decodificadores autorregressivos no estilo do LLaMA. Um decodificador backbone maior processa o contexto intercalado de texto e áudio e prevê o primeiro token do codebook para o próximo trecho de fala. Em seguida, um decodificador de profundidade menor recebe o estado oculto desse backbone e gera os tokens acústicos restantes do codebook, necessários para reconstruir um áudio completamente inteligível.
Os dois decodificadores operam com tokens do Mimi, um codec de áudio com quantização vetorial residual dividida (RVQ) desenvolvido pela Kyutai. O Mimi comprime a fala para cerca de 1,1 kbps a uma taxa de quadros de 12,5 Hz, preservando alta fidelidade de áudio. É uma representação eficiente o suficiente para que o CSM funcione sem as altas exigências computacionais de pipelines acústicos mais elaborados.
O verdadeiro diferencial: basear a fala na conversa real
Vale a pena refletir sobre isso, pois é fácil minimizar o recurso como um pequeno detalhe de arquitetura. Ao dar ao decodificador backbone acesso simultâneo ao áudio e ao texto anteriores, o CSM consegue basear sua próxima fala no estilo acústico real que a conversa apresentou até aquele momento — incluindo o contorno de altura, o ritmo e o estado emocional do falante — em vez de gerar uma resposta apenas com base em como o texto indica que ela deveria soar. Esse é o mecanismo específico por trás da capacidade do CSM de acompanhar a energia de uma pessoa quando ela parece cansada, soar mais animado quando ela está empolgada e fazer pausas mais naturais quando o ritmo da conversa diminui. A maioria dos sistemas de voz de produção anteriores gera áudio somente a partir da representação textual, sem essa base acústica no que realmente acabou de acontecer durante a interação.
Uma observação honesta: o checkpoint aberto e a demo viral
É importante ser preciso sobre aquilo que você realmente recebe. Uma variante do CSM com ajuste fino alimenta Maya e Miles, os companheiros de voz hospedados pela Sesame cuja demo viralizou em fevereiro de 2025 por soar mais próxima de um interlocutor real do que os sistemas comerciais de TTS anteriores. O checkpoint CSM 1B disponibilizado publicamente é o modelo-base de código aberto por trás dessa experiência, não a versão exata com ajuste fino usada na própria demo viral. Ajuste suas expectativas de acordo: o modelo-base é de fato uma base competente, mas o acabamento específico da demo que ganhou as manchetes envolveu um ajuste fino adicional que a Sesame não disponibilizou como pesos abertos.
O que o CSM não consegue fazer
Há algumas limitações que vale a pena conhecer antes de desenvolver algo em torno dele. O CSM é treinado especificamente como modelo de geração de áudio, não como um LLM multimodal de uso geral — ele não consegue gerar texto. Portanto, você precisará combiná-lo com outro modelo de linguagem para produzir o conteúdo real da resposta antes que o CSM o transforme em fala. Ele também é principalmente um modelo em inglês; possui alguma capacidade incidental em outros idiomas devido à contaminação dos dados de treinamento, mas não é uma função confiável para nenhum caso de uso sério em outros idiomas.
A Sesame também foi explícita sobre o uso aceitável: as diretrizes do projeto proíbem gerar fala que imite uma pessoa real sem o consentimento explícito dela, criar conteúdo enganoso ou fraudulento — como notícias falsas ou ligações fraudulentas — e qualquer aplicação ilegal ou prejudicial da tecnologia.
Como começar a usar o CSM 1B
- Clone o repositório. Execute
git clone [email protected]:SesameAILabs/csm.git, configure um ambiente virtual do Python 3.10 e instale as dependências compip install -r requirements.txt. - Obtenha acesso aos dois modelos restritos no Hugging Face. Você precisará de acesso aprovado tanto ao
sesame/CSM 1Bquanto aometa-llama/Llama-3.2-1B, pois o backbone do CSM depende do checkpoint do Llama. Entre comhuggingface-cli loginantes de tentar baixar qualquer um deles. - Desative a compilação tardia no Mimi. Definir a variável de ambiente
NO_TORCH_COMPILE=1é uma etapa documentada para evitar problemas de compilação específicos do componente do codec Mimi. - Use
triton-windowsem vez dotritonpadrão no Windows. O pacotetritonpadrão não pode ser instalado no Windows, e a documentação do projeto indica especificamente esse substituto. - Combine-o com um LLM separado para ter pipelines conversacionais completos. Como o CSM gera apenas áudio, planeje um modelo de geração de texto no início do pipeline para produzir o conteúdo real do diálogo que o CSM transformará em voz.
- Considere um fork da comunidade para ter uma interface mais completa e pronta para uso. Projetos como
akashjss/sesame-csmadicionam uma interface Gradio e uma API compatível com a OpenAI sobre o modelo-base, com suporte a dispositivos CUDA, MLX e CPU. Esse é um caminho mais rápido para uma interface utilizável do que criar uma diretamente a partir do repositório-base.
Dicas para obter resultados melhores
- Forneça um histórico de conversa real, não apenas a frase que você quer que seja falada. A principal vantagem do CSM só aparece quando você fornece um contexto intercalado de texto e áudio no qual ele possa se basear. Usá-lo como um modelo TTS de frase única sem esse histórico subestima aquilo para que ele realmente foi desenvolvido.
- Não espere do checkpoint-base exatamente a mesma qualidade da demo viral de Maya/Miles. Essa experiência usa uma variante com ajuste fino que a Sesame não disponibilizou como código aberto. Trate o CSM 1B público como uma base sólida para desenvolver e fazer ajustes finos, não como uma réplica exata da experiência que viralizou.
- Planeje seu pipeline considerando que o CSM gera somente áudio. Reserve um modelo separado de geração de texto para alimentar o CSM, em vez de esperar que ele cuide da geração do diálogo e da voz em uma só etapa.
- Use apenas inglês em qualquer aplicação essencial para produção. Como sua capacidade em outros idiomas é incidental e pouco confiável, trate o inglês como o único idioma para o qual o modelo realmente foi desenvolvido e testado.
- Respeite as diretrizes explícitas de uso sobre consentimento e imitação. Justamente porque a saída sensível ao contexto do CSM pode ser tão convincente, leve a sério as restrições do próprio projeto contra a imitação de voz sem consentimento, em vez de tratá-las como um simples texto padrão.
CSM 1B em comparação com outros modelos de fala com backbone Llama
| CSM 1B | Orpheus TTS | Modelos típicos de clonagem com áudio de referência | |
|---|---|---|---|
| Entrada principal | Histórico de conversa com texto + áudio intercalados | Texto (mais uma referência de voz opcional) | Texto + um único clipe de referência estático |
| Backbone | Arquitetura LLaMA com dois Transformers | Llama-3B | Varia (difusão, flow matching etc.) |
| Codec | Mimi (Kyutai), 12,5 Hz, 1,1 kbps | SNAC | Varia |
| Pode gerar texto | Não, apenas áudio | Não, apenas áudio | Não |
| Sensibilidade ao contexto | Principal objetivo de projeto | Não é o foco principal | Não é o foco principal |
| Licença | Apache 2.0 | Apache 2.0 | Varia |
O nicho específico do CSM 1B é a fundamentação realmente conversacional: acompanhar a realidade acústica de uma interação em andamento em vez de tratar cada fala como uma tarefa de geração isolada. Esse é um objetivo de projeto significativamente diferente tanto dos modelos voltados à narração quanto dos modelos de clonagem de voz com clipes de referência.
Perguntas frequentes
O que significa CSM?
Conversational Speech Model — nome que reflete seu principal objetivo de projeto: manter a percepção do contexto ao longo de um diálogo em vez de gerar falas isoladas e sem contexto.
O CSM 1B consegue gerar respostas em texto sozinho?
Não. O CSM é treinado especificamente como modelo de geração de áudio e não consegue gerar texto. Combine-o com outro modelo de linguagem para produzir o conteúdo do diálogo antes que o CSM o converta em fala.
O CSM 1B de código aberto é o mesmo modelo por trás da demo de voz viral da Sesame?
Não exatamente. Uma variante do CSM com ajuste fino alimenta Maya e Miles, os companheiros de voz hospedados da demo viral da Sesame. O CSM 1B disponibilizado publicamente é o modelo-base de código aberto por trás desse sistema, não a variante específica com ajuste fino.
O que é o codec Mimi?
O Mimi é um codec de áudio com quantização vetorial residual dividida desenvolvido pela Kyutai. O CSM o utiliza para codificar a fala em tokens discretos e decodificá-los novamente em áudio a cerca de 1,1 kbps, preservando alta fidelidade.
O CSM 1B é gratuito para uso comercial?
Sim, em termos de licenciamento: ele é disponibilizado sob a licença Apache 2.0. Ainda assim, as diretrizes de uso da Sesame proíbem explicitamente a imitação de voz sem consentimento e o uso enganoso, regras que se aplicam independentemente de a licença do código ser permissiva.
Transforme um roteiro com vários locutores em áudio
Se você já tem um roteiro pronto com vários locutores, use o Texto para diálogo da Echora. Adicione até 12 blocos de diálogo e 5.000 caracteres no total, atribua uma voz a cada bloco, inclua tags de interpretação compatíveis e ajuste a estabilidade ou o reforço do locutor. Depois, você pode ouvir e baixar a conversa completa.