EchoraEchora
Volver a los modelos

Step-Audio: un solo modelo, en lugar de tres pasándose el trabajo

6 de septiembre de 2026
•
7 min de lectura

La mayoría de los asistentes de voz son en realidad tres sistemas separados bajo una única interfaz: un modelo de reconocimiento de voz transcribe lo que has dicho, un modelo de lenguaje decide qué responder y un modelo TTS independiente convierte esa respuesta en audio. Cada traspaso entre esos tres sistemas añade latencia y pierde información. Step-Audio, publicado por StepFun, se creó para condensar toda esa cadena en un único modelo unificado que se ocupa a la vez del reconocimiento, la comprensión y la generación. Sus creadores lo describen como el primer sistema de interacción por voz en tiempo real, de código abierto y listo para producción de la industria construido de esta forma.

¿Qué es Step-Audio?

Step-Audio es un sistema de interacción por voz de código abierto publicado por StepFun en febrero de 2025 y diseñado en torno a una idea central: la comprensión y la generación del habla no deberían ser dos problemas separados que resuelven dos modelos distintos. Un único sistema se ocupa del reconocimiento automático del habla, la comprensión semántica, la gestión del diálogo, la clonación de voz y la generación de voz, específicamente para eliminar el cuello de botella de latencia que introducen las arquitecturas tradicionales de ASR más TTS en cascada cada vez que el trabajo pasa de un componente a otro.

Bajo el capó: los cuatro componentes

Un framework de tokenización con dos codebooks. Los tokenizadores de voz convencionales suelen capturar información adecuada para tareas de comprensión o para tareas de generación, pero rara vez para ambas. Step-Audio utiliza en su lugar dos tokenizadores en paralelo: uno lingüístico (16,7Hz, codebook de 1024 entradas) y otro semántico (25Hz, codebook de 4096 entradas), combinados mediante un entrelazado temporal 2:3. Esta estructura doble es precisamente lo que permite que un único modelo posterior gestione tanto la comprensión como la generación a partir de la misma representación tokenizada, en vez de necesitar pipelines separados para cada tarea.

Una base LLM de 130.000 millones de parámetros. Construido sobre el propio modelo de lenguaje Step-1 de StepFun y reforzado mediante preentrenamiento continuo contextualizado con audio y postentrenamiento específico para cada tarea, este es el componente que proporciona a Step-Audio una auténtica comprensión intermodal: razona sobre el contenido de audio como un modelo de lenguaje potente razona sobre el texto, en vez de tratar el audio como una modalidad independiente acoplada a un modelo exclusivamente textual.

Un sintetizador de voz híbrido. Este componente combina flow matching con vocodificación neuronal y está optimizado específicamente para generar formas de onda en tiempo real: es la parte del pipeline que convierte las representaciones internas del modelo de nuevo en voz audible.

Un módulo de detección de actividad de voz. Extrae los segmentos vocales de un flujo de audio y se ocupa de la tarea práctica de entrada de saber cuándo alguien está hablando realmente, algo importante para una interacción auténticamente en tiempo real y por streaming, en lugar del procesamiento por lotes de clips de audio completos.

Por qué la unificación importa de verdad

Conviene decirlo claramente, porque es fácil interpretar «modelo unificado» como una frase de marketing y no como una diferencia arquitectónica real. Un pipeline en cascada —ASR independiente, LLM independiente y TTS independiente— tiene que pasar en serie por los límites de tres modelos, y en cada uno se pierde información: una transcripción ASR elimina el tono y el énfasis antes de que el LLM llegue a verlos, y la respuesta textual del LLM elimina cualquier indicación sobre cómo debería expresarse antes de que el modelo TTS la reciba. El enfoque con dos codebooks de Step-Audio está diseñado específicamente para transportar información más rica por todo el pipeline en una sola pasada, lo que explica en parte que pueda responder con matices dialectales y emocionales que un pipeline compuesto por tres sistemas no puede conservar con la misma limpieza por su propia estructura.

Control de voz granular

Step-Audio permite controlar mediante instrucciones y con precisión cómo suena realmente la voz generada: varias emociones (enfado, alegría y tristeza), dialectos regionales (cantonés, sichuanés y otros) y estilos vocales diferenciados, como rap y tarareo a cappella. Este control opera mediante la misma arquitectura unificada en vez de ser un parámetro de estilo añadido, y se combina con diálogo multilingüe en chino, inglés y japonés.

Mejora medida frente a los sistemas en cascada

La alineación de dos codebooks de Step-Audio produjo un resultado medible en la evaluación del propio equipo: una mejora del 12% en la similitud del hablante (SS) frente a CosyVoice, atribuida específicamente a la forma en que colaboran los tokenizadores lingüístico y semántico, y no solo a la escala bruta del modelo.

Capacidades de agente más allá del habla

Como Step-Audio se apoya en una verdadera base LLM de 130.000 millones de parámetros y no en un modelo acústico más pequeño, va más allá de la generación pura de voz y se extiende a comportamientos de agente más amplios. Admite mecanismos de llamada a herramientas para ejecutar tareas complejas y una capacidad de interpretación de roles mejorada, por lo que se acerca más a un framework completo de agente de voz que a un motor TTS independiente.

Primeros pasos con Step-Audio

  1. Clona el repositorio. Clona con git clone el proyecto stepfun-ai/Step-Audio desde GitHub para obtener el código, la documentación y las instrucciones de acceso al modelo.
  2. Prepárate para unos requisitos de hardware realmente considerables. Dada la base LLM de 130.000 millones de parámetros del sistema, cabe esperar unas necesidades de recursos muy superiores a las de modelos TTS dedicados más pequeños: es un sistema a escala de producción, no un despliegue local ligero.
  3. Decide si necesitas el sistema unificado completo o solo la generación. Si tu caso de uso es únicamente texto a voz y no requiere los componentes de comprensión y gestión del diálogo, valora si un modelo TTS dedicado puede ser una opción más sencilla que desplegar toda la arquitectura de Step-Audio para una tarea más limitada.
  4. Usa los controles mediante instrucciones para la emoción, el dialecto y el estilo. En lugar de depender únicamente de una voz de referencia, el sistema de control granular de Step-Audio está diseñado para recibir instrucciones explícitas sobre las características de la interpretación.
  5. Explora la integración ToolCall si estás creando un agente y no solo una interfaz de voz. Como la base LLM de Step-Audio admite llamadas a herramientas e interpretación de roles, merece la pena evaluarlo para aplicaciones de voz con verdadera capacidad de agente en vez de tratarlo únicamente como un sustituto directo de TTS.

Consejos para obtener mejores resultados

  • Ajusta el modelo al alcance real de tu proyecto. La arquitectura unificada de Step-Audio ofrece una ventaja real para crear un sistema completo de interacción por voz; si solo necesitas generar texto a voz, probablemente sea más práctico desplegar y ejecutar un modelo dedicado más pequeño.
  • Indica de forma explícita el dialecto y la emoción en vez de esperar que el modelo los deduzca. Como estas características se dirigen mediante el sistema de control por instrucciones, especificar el dialecto o tono emocional que deseas da resultados más fiables que una petición vaga o implícita.
  • Considera Step-Audio 2 si la latencia de extremo a extremo es tu principal preocupación. El trabajo posterior de StepFun avanza hacia un procesamiento realmente de extremo a extremo, elimina aún más elementos de la estructura tradicional del pipeline y añade capacidades de razonamiento de audio. Conviene revisarlo si las necesidades de tu proyecto han superado lo que cubre el Step-Audio original.
  • Evalúa las capacidades de agente si tu caso de uso va más allá del TTS sencillo. Dada su compatibilidad con ToolCall y la interpretación de roles, Step-Audio merece especial consideración para agentes controlados por voz que resuelven tareas complejas de varios pasos, y no solo para generar narración.

Step-Audio frente a sistemas en cascada y sistemas solo de generación

Step-AudioPipeline tradicional en cascadaCosyVoice3 (solo generación)
Alcance centralComprensión + generación unificadasModelos separados de ASR + LLM + TTSSolo generación de voz
LatenciaReducida, arquitectura de una sola pasadaMayor, serializada entre 3 sistemasOptimizado específicamente para generación
Control de dialecto/emociónSí, mediante instruccionesDepende del componente TTS utilizadoSí, centrado en dialectos
Capacidades de agente (llamada a herramientas, interpretación de roles)SíRequiere una orquestación independienteNo aplicable
Escala del modeloBase LLM de 130.000 millones de parámetrosVaría, a menudo con componentes más pequeños0,5B

La verdadera diferencia de Step-Audio es el alcance de su arquitectura, no solo la calidad de generación: resuelve un problema más amplio, la interacción por voz unificada, que la mayoría de los modelos creados específicamente solo para generar voz.

Preguntas frecuentes

¿Qué diferencia a Step-Audio de un modelo TTS típico?

La mayoría de los modelos TTS solo se ocupan de generar voz. Step-Audio unifica reconocimiento del habla, comprensión semántica, gestión del diálogo y generación en un único modelo, específicamente para eliminar la latencia y la pérdida de información que aparecen cuando sistemas separados de ASR, LLM y TTS se pasan el trabajo unos a otros.

¿Quién desarrolló Step-Audio?

Step-Audio fue desarrollado por StepFun, una empresa china de IA, y se publicó como código abierto en febrero de 2025.

¿Cómo funciona el tokenizador con dos codebooks de Step-Audio?

Combina dos tokenizadores paralelos, uno lingüístico y otro semántico, que funcionan a distintas frecuencias de fotogramas y se entrelazan en una proporción 2:3. Está diseñado específicamente para que un único modelo posterior pueda encargarse tanto de la comprensión como de la generación a partir de la misma representación tokenizada del habla.

¿Step-Audio admite dialectos y emociones?

Sí, mediante un control basado en instrucciones que abarca varias emociones (enfado, alegría y tristeza), dialectos regionales (cantonés, sichuanés y otros) y estilos vocales como el rap y el tarareo a cappella.

¿Existe una versión más reciente de Step-Audio?

Sí. StepFun ha publicado Step-Audio 2 como continuación, avanzando aún más hacia un procesamiento verdaderamente de extremo a extremo y añadiendo capacidades de razonamiento de audio, además de otras publicaciones de investigación posteriores de la misma línea.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →