Bark: el modelo que trata el habla como un sonido más
- ¿Qué es Bark?
- Etiquetas entre corchetes: cómo funcionan realmente las risas y los suspiros
- Más que habla
- Lo que Bark no hace (lee esto antes de empezar)
- Cómo empezar con Bark
- Consejos para obtener mejores resultados
- Bark frente a otros modelos TTS expresivos
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Pide una risa a la mayoría de los modelos TTS y obtendrás silencio o algo que suena como si se hubiera insertado torpemente desde una biblioteca de efectos de sonido. Bark, el modelo open source de Suno, lo aborda de otra manera porque nunca se creó como un motor limitado de texto a voz: es un modelo generativo de texto a audio, y el habla es solo una de las cosas que se le dan bien. Inserta [laughs] en una frase y Bark interpreta la risa en su contexto, del mismo modo que genera las palabras que la rodean.
¿Qué es Bark?
Bark es un modelo generativo de audio basado en Transformer, creado por Suno y publicado bajo la licencia MIT. En lugar de seguir el proceso tradicional de TTS —de texto a fonemas, de ahí a características acústicas y finalmente a una forma de onda—, Bark funciona más como un modelo de lenguaje que produce tokens de audio en vez de tokens de texto. Convierte instrucciones escritas directamente en una forma de onda de 24kHz mediante un proceso autorregresivo de tres etapas: primero genera tokens semánticos que representan el contenido previsto, luego tokens acústicos gruesos y por último tokens acústicos finos, utilizando EnCodec de Meta para la tokenización de audio subyacente. No hay ningún paso de conversión a fonemas: entra texto y salen representaciones de audio cada vez más detalladas, de extremo a extremo.
Etiquetas entre corchetes: cómo funcionan realmente las risas y los suspiros
Esta es la característica distintiva de Bark y resulta realmente sencilla de usar. Los sonidos no verbales y las indicaciones emocionales se activan insertando etiquetas directamente en el texto de entrada: [laughter], [sighs], [gasps] y marcadores similares hacen que el modelo genere ese sonido justo en ese punto de la frase, interpretado por la voz que esté hablando en ese momento en lugar de añadirse como un clip de audio independiente. Además de las etiquetas entre corchetes, Bark también interpreta el formato normal como indicaciones de interpretación: escribir una palabra EN MAYÚSCULAS impulsa al modelo a enfatizarla, y terminar una frase con "..." produce una vacilación natural en la interpretación, sin necesidad de un parámetro específico para ninguno de los dos efectos.
Más que habla
Como Bark genera audio como categoría general y no solo habla, también puede producir música sencilla, ambiente de fondo y efectos de sonido básicos directamente a partir de una instrucción de texto, capacidades que quedan completamente fuera de aquello para lo que se crea un modelo TTS especializado. Admite más de una docena de idiomas con alternancia natural entre ellos, lo que significa que un guion que cambia de idioma a mitad de frase no requiere llamadas de generación independientes. Además, incluye diversos preajustes de hablante que abarcan diferentes estilos vocales, en lugar de una única voz predeterminada.
Lo que Bark no hace (lee esto antes de empezar)
Conviene conocer de antemano algunas limitaciones reales, porque determinan para qué sirve Bark en la práctica:
No es principalmente un modelo de clonación de voz. A diferencia de la mayoría de los sistemas centrados en la clonación, el flujo de trabajo estándar de Bark gira en torno a sus preajustes de hablante integrados, no a reproducir cualquier voz de referencia a partir de un clip breve. Si tu requisito principal es clonar la voz de una persona concreta, te irá mejor con un modelo creado específicamente para esa tarea.
El resultado puede sorprenderte de verdad. Como Bark es un modelo totalmente generativo y no un sistema TTS restringido, en ocasiones puede desviarse de la instrucción de entrada de formas inesperadas: saltarse una frase, añadir un sonido no solicitado o no decir exactamente lo que has escrito. Es una propiedad estructural de la arquitectura, no un error que pueda eliminarse mediante configuración.
Es lento y la duración de cada generación está limitada. El proceso autorregresivo de Bark hace que una sola frase tarde normalmente entre 5 y 15 segundos en generarse con GPU, y cada llamada de generación está limitada a unos 13-14 segundos de audio. El contenido más largo debe dividirse en varias llamadas en lugar de generarse de una sola vez.
Cómo empezar con Bark
- Instálalo mediante pip o clona el repositorio.
pip install git+https://github.com/suno-ai/bark.gitte permite empezar rápidamente; también puedes clonar el repositorio directamente si quieres inspeccionar o modificar el código. - Comprueba las versiones de PyTorch y CUDA. Bark necesita PyTorch 2.0 o una versión posterior, con compatibilidad para CUDA 11.7 o 12.0 si vas a ejecutarlo con GPU.
- Usa la variante pequeña del modelo si tienes poca VRAM. Configurar la variable de entorno
SUNO_USE_SMALL_MODELS=Trueantes de cargar el modelo permite ejecutar Bark con unos 8GB de VRAM, a costa de cierta calidad de salida. - Escribe la instrucción con las etiquetas integradas. Una generación básica requiere unas pocas líneas: carga el modelo, pasa una cadena de texto que contenga las etiquetas entre corchetes que quieras y guarda la forma de onda resultante. Las indicaciones no verbales no necesitan ningún paso de configuración independiente.
- Divide los guiones largos en varias generaciones. Dado el límite aproximado de 13-14 segundos por llamada, separa una narración larga en fragmentos del tamaño de una frase o un párrafo y concatena el audio resultante, en lugar de esperar que una llamada procese un párrafo completo.
- Prueba la integración con Hugging Face Transformers si prefieres prescindir del repositorio independiente. Bark es compatible con Transformers desde la versión 4.31.0, lo que puede simplificar la integración si tu proyecto ya depende de esa biblioteca.
Consejos para obtener mejores resultados
- Usa las etiquetas con moderación y dentro de contexto. Una etiqueta
[laughs]encaja de forma natural justo después de algo realmente gracioso en el guion; repartir etiquetas no verbales por todas partes diluye el efecto y puede hacer que la interpretación parezca recitada en vez de reactiva. - Prueba un hablante predefinido antes de dar por hecho que necesitas una voz personalizada. Como Bark no se creó alrededor de la clonación zero-shot, revisar primero sus preajustes de hablante integrados suele ser más rápido que intentar forzar una voz de referencia cualquiera dentro del proceso.
- Vuelve a generar en lugar de pelearte con un resultado impredecible. Dada la naturaleza generativa de Bark, cuando aparece un resultado extraño suele ser más rápido volver a generar la misma instrucción que intentar evitarlo únicamente mediante ingeniería de prompts.
- Planifica desde el principio el límite de duración por llamada. Estructurar el guion en fragmentos naturales desde el inicio evita más trabajo que escribir un pasaje largo y descubrir el límite de duración a mitad del proyecto.
- Úsalo específicamente cuando la expresividad importe más que la precisión. La actuación de voces de personajes, el contenido animado y los proyectos de audio creativos son donde destaca de verdad la variedad no verbal de Bark. Para una narración precisa y predecible, quizá encaje mejor un modelo TTS más convencional.
Bark frente a otros modelos TTS expresivos
| Bark | Chatterbox | CosyVoice3 | |
|---|---|---|---|
| Objetivo principal | Texto a audio generativo | Clonación de voz con control emocional | Clonación multilingüe con dialectos |
| Sonidos no verbales | Etiquetas entre corchetes nativas, además de música/efectos | Etiquetas paralingüísticas (variante Turbo) | No es una función específica |
| Clonación de voz | No es el flujo de trabajo principal | Sí, zero-shot | Sí, zero-shot |
| Previsibilidad del resultado | Puede desviarse de la instrucción | Más consistente | Más consistente |
| Idiomas | 13+ | Inglés (Multilingual: 23) | 9 + 18 dialectos chinos |
| Licencia | MIT | MIT | Abierta, con API alojada disponible |
El nicho específico de Bark es el audio expresivo y centrado en personajes, donde las risas, los suspiros y los cambios de tono importan más que reproducir la voz exacta de una persona. Para ese trabajo concreto, pocos modelos open source generan sonidos no verbales de forma tan natural.
Preguntas frecuentes
¿Cómo hago que Bark genere risas o suspiros?
Inserta etiquetas entre corchetes como [laughter] o [sighs] directamente en el texto de entrada, justo donde quieras que aparezca el sonido. Bark lo interpreta con la voz del hablante actual, sin necesidad de un efecto de audio independiente.
¿Puede Bark clonar la voz de una persona concreta?
No como objetivo principal de su diseño. Bark se basa en un conjunto de voces predefinidas, no en la clonación zero-shot a partir de un clip de referencia. Para clonar una voz real concreta, un modelo de clonación especializado resulta más adecuado.
¿Bark es gratuito para uso comercial?
Sí. Bark se publica bajo la licencia MIT, que permite el uso comercial sin regalías ni acuerdos de licencia independientes.
¿Por qué Bark genera a veces algo distinto de lo que he escrito?
Bark es un modelo de audio totalmente generativo, no un sistema TTS restringido, por lo que en ocasiones puede desviarse de la instrucción exacta. Es una característica conocida de su arquitectura, no un problema de configuración.
¿Cuánto puede durar una sola generación de Bark?
Cada llamada de generación está limitada a unos 13-14 segundos de audio; el contenido más largo debe dividirse en varios fragmentos y generarse por separado.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.