EchoraEchora
Voltar aos modelos

Orpheus TTS: o que acontece quando um LLM aprende prosódia como aprende gramática

5 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A Canopy Labs criou o Orpheus TTS em torno de uma aposta específica: dê a um modelo de linguagem competente o tokenizador de voz certo e um corpus de voz selecionado grande o bastante, e ele aprenderá prosódia, ritmo e emoção de forma natural, assim como aprende gramática a partir do texto. O Orpheus testa essa aposta com 3 bilhões de parâmetros sobre uma arquitetura Llama — não é um pipeline de TTS com um modelo de linguagem acoplado, mas um verdadeiro LLM de voz que prevê tokens de áudio da mesma forma que um modelo de chat prevê a próxima palavra.

O que é Orpheus TTS?

Orpheus TTS é um sistema open source de texto para fala lançado pela Canopy Labs em março de 2025, construído sobre uma arquitetura Llama-3B e publicado sob a licença Apache 2.0, totalmente permissiva. Em termos de arquitetura, é um modelo autorregressivo que gera tokens de áudio, depois decodificados em uma forma de onda pelo codec neural SNAC — o mesmo paradigma generativo amplo que impulsiona os LLMs modernos baseados em texto, aplicado diretamente à fala em vez de adaptado de uma tradição separada de modelagem acústica. Ele foi treinado com mais de 100.000 horas de dados de fala em inglês, e as comparações da própria Canopy Labs o colocam diante de sistemas comerciais fechados, como ElevenLabs e PlayHT, e não apenas de outras alternativas open source.

Tags de emoção e clonagem zero-shot

O Orpheus aceita tags de emoção e interpretação inseridas diretamente no texto de entrada — <laugh>, <sigh>, <yawn>, <gasp> e palavras naturais de hesitação como “um” — permitindo que o modelo interprete essa reação no contexto em vez de tratá-la como um efeito de áudio separado, acrescentado depois. Como é a arquitetura de LLM de voz do modelo que posiciona essas reações naturalmente dentro de uma frase, elas tendem a surgir com um timing mais coerente com o contexto do que efeitos sonoros aplicados em pós-produção costumam conseguir. Além disso, o Orpheus oferece clonagem de voz zero-shot sem exigir qualquer fine-tuning prévio — ele clona uma voz diretamente a partir de uma referência, como se faria um prompt para extrair qualquer outra capacidade de um LLM competente.

Streaming de baixa latência

Esse é o outro recurso de destaque do Orpheus, e os números são específicos: cerca de 200ms de latência de streaming para aplicações em tempo real, que podem cair para aproximadamente 100ms quando o streaming de entrada é ativado. É rápido o bastante para operar por trás de um agente de voz ao vivo ou de uma aplicação interativa sem que o atraso da geração se torne o gargalo da conversa — um objetivo de projeto realmente diferente daquele de modelos otimizados apenas para a qualidade de narração offline.

O caminho prático de implantação: GGUF, llama.cpp e FastAPI

Para a maioria dos usos com hospedagem própria, a configuração que se consolidou como padrão não executa diretamente o modelo completo — ela usa um pipeline quantizado e mais eficiente em recursos. O Orpheus está disponível em pesos quantizados no formato GGUF (Q4_K_M ou Q8_0, sendo que a versão Q8_0 pesa cerca de 4GB), servidos por um backend llama.cpp e acomodados com folga em aproximadamente 8GB de VRAM. Além disso, o servidor Orpheus-FastAPI, criado pela comunidade, coloca um endpoint /v1/audio/speech compatível com a OpenAI diante do modelo GGUF carregado. Isso permite apontar o código existente, escrito para a API de TTS da OpenAI, diretamente para uma instância local do Orpheus, com oito vozes em inglês disponíveis nessa configuração, e trocar de provedor com o mínimo de alterações no código.

Para alcançar o máximo de throughput em vez de ocupar o mínimo de recursos locais, o pacote Python oficial orpheus-speech usa vLLM internamente. Ele é a melhor escolha se a prioridade for atender muitas solicitações simultâneas, e não executar o modelo confortavelmente em uma única GPU de consumo.

Primeiros passos com Orpheus TTS

  1. Escolha o caminho de implantação de acordo com sua prioridade. Use GGUF com llama.cpp para obter a menor ocupação local em hardware de consumo; escolha o pacote oficial orpheus-speech, baseado em vLLM, se a prioridade for otimizar o throughput em escala.
  2. No caminho GGUF, baixe um checkpoint quantizado. Baixe os pesos GGUF Q4_K_M ou Q8_0 e carregue-os por meio do llama.cpp ou de uma interface compatível, como o LM Studio.
  3. Adicione o servidor Orpheus-FastAPI para uma integração compatível com a OpenAI. Ele oferece um endpoint /v1/audio/speech padrão, permitindo substituir por Orpheus qualquer API TTS no estilo da OpenAI que seu código já espere, com oito vozes em inglês incluídas e prontas para uso.
  4. Para o pacote oficial, instale via pip. pip install orpheus-speech instala o caminho de inferência baseado em vLLM; clone primeiro o repositório canopyai/Orpheus-TTS se também quiser os scripts de processamento de dados e conjuntos de dados de exemplo para fine-tuning.
  5. Escolha entre os checkpoints Pretrained e Finetuned Prod. O modelo Finetuned Prod é ajustado para casos cotidianos de TTS; o modelo base Pretrained, treinado com o corpus completo de mais de 100.000 horas, é o melhor ponto de partida se você pretende fazer seu próprio fine-tuning em vez de usar o Orpheus diretamente.
  6. Ative o streaming de entrada se precisar da menor latência possível. A queda de cerca de 200ms para 100ms exige especificamente que o streaming de entrada seja configurado, em vez de ser o comportamento padrão.

Dicas para obter resultados melhores

  • Use tags de emoção onde uma pessoa realmente faria uma pausa ou reagiria. Colocar <laugh> ou <sigh> em um momento natural da conversa soa mais convincente do que espalhar tags sem considerar em que ponto da frase ocorreria uma reação real.
  • Alinhe o caminho de implantação à sua limitação real. Se a VRAM estiver apertada, o caminho de GGUF com llama.cpp é a opção mais prática; se você atende muitas solicitações simultâneas, o pacote oficial baseado em vLLM escalará melhor do que uma configuração quantizada de instância única.
  • Faça fine-tuning a partir do checkpoint Pretrained para usos fora do padrão. Se o projeto precisar de um idioma, estilo ou domínio diferente daqueles cobertos pelo modelo geral Finetuned Prod, começar pelo modelo base pré-treinado com seu próprio conjunto de dados é o caminho documentado para o qual a Canopy Labs fornece scripts.
  • Use o servidor FastAPI se estiver migrando de uma API TTS comercial. Como ele replica a estrutura de endpoints da OpenAI, geralmente exige menos alterações no código do que a adaptação a uma interface de inferência totalmente personalizada.
  • Reserve cerca de 8GB de VRAM para uma implantação GGUF local. Esse é o mínimo prático para obter um desempenho confortável com quantização Q4/Q8 — confirme se o hardware atende ao requisito antes de optar pela hospedagem própria em vez de uma API hospedada.

Orpheus TTS em comparação com outros modelos expressivos e leves

Orpheus TTSChatterboxKokoro-82M
Arquitetura principalLLM de voz Llama-3B + codec SNACBaseada em difusãoStyleTTS 2 + ISTFTNet
Parâmetros3B~0.5B82M
Tags de emoção/reaçãoSim, inline (<laugh>, <sigh> etc.)Parâmetro de exageroNão é um recurso específico
Clonagem de vozSim, zero-shotSim, zero-shotNão, catálogo fixo de vozes
Latência de streaming~200ms (~100ms com streaming de entrada)Não é um foco principalNão se aplica (foco em narração por CPU)
Uso de VRAM~8GB (GGUF quantizado)MenorMínimo, adequado para CPU
LicençaApache 2.0MITApache 2.0

O Orpheus troca uma carga consideravelmente maior do que a de modelos como Kokoro ou Chatterbox por uma saída que a Canopy Labs criou e ajustou especificamente para competir com sistemas comerciais fechados em expressividade e naturalidade. Se seu hardware puder reservar a VRAM necessária e seu caso de uso valorizar essa amplitude emocional e o streaming de baixa latência, ele realmente oferece um nível de saída diferente do das opções mais leves deste site.

Perguntas frequentes

O que significa dizer que o Orpheus é um “LLM de voz”?

Significa que, em termos de arquitetura, o Orpheus é um modelo de linguagem autorregressivo padrão, mas treinado para prever tokens de áudio, que o codec SNAC decodifica em uma forma de onda, em vez de tokens de texto — a mesma abordagem generativa subjacente que impulsiona LLMs baseados em texto, aplicada diretamente à fala.

Qual é a latência real do Orpheus?

Cerca de 200ms no streaming padrão, que podem cair para aproximadamente 100ms quando o streaming de entrada é ativado especificamente — rápido o suficiente para aplicações interativas em tempo real.

O que é Orpheus-FastAPI?

É um servidor criado pela comunidade que coloca um endpoint /v1/audio/speech compatível com a OpenAI diante de um modelo Orpheus quantizado em GGUF e executado localmente, facilitando a substituição pelo Orpheus em código escrito originalmente para a API de TTS da OpenAI.

De quanta VRAM o Orpheus precisa para ser executado localmente?

Cerca de 8GB de VRAM com quantização GGUF Q4_K_M ou Q8_0 por um backend llama.cpp — apenas os pesos Q8_0 ocupam cerca de 4GB.

Orpheus TTS é gratuito para uso comercial?

Sim. Ele é publicado sob a licença Apache 2.0, uma das opções mais permissivas entre modelos TTS open source, sem restrições que exijam um contrato comercial separado.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →