Edge TTS: la puerta trasera gratuita a voces neuronales de nivel empresarial
- ¿Qué es Edge TTS?
- Ventajas funcionales de Edge TTS
- Una nota importante sobre lo que realmente es
- Primeros pasos con Edge TTS
- Consejos para obtener mejores resultados
- Edge TTS frente a los servicios de voz oficiales de Microsoft y las alternativas autoalojadas
- Preguntas frecuentes
- Crea voz en línea con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
El navegador Microsoft Edge tiene una función de accesibilidad llamada «Leer en voz alta» que utiliza discretamente voces neuronales de una calidad realmente alta: del mismo nivel que las que Microsoft vende mediante su servicio de pago Azure Speech. Edge TTS es una herramienta Python de código abierto que accede directamente a ese mismo servicio gratuito del navegador y te ofrece acceso programable a cientos de esas voces neuronales sin abrir un navegador, instalar Windows ni registrarte para obtener una clave de API.
¿Qué es Edge TTS?
Edge TTS es un módulo de Python y una herramienta de línea de comandos creados por el desarrollador independiente rany2. Permite utilizar el servicio en línea de texto a voz de Microsoft Edge desde tu propio código o desde la línea de comandos, sin necesitar Edge, Windows ni una clave de API. Conviene precisar qué es realmente: no se trata de un producto oficial de Microsoft ni de una API con soporte, sino de una herramienta comunitaria que se conecta al mismo servicio backend que el navegador Edge utiliza internamente para su función de accesibilidad Leer en voz alta y ofrece acceso externo y gratuito a ese mismo motor de voz.
Ventajas funcionales de Edge TTS
- Es realmente gratuito y no requiere clave de API ni registro de cuenta: una diferencia real frente a Azure Speech Services, el servicio de pago de Microsoft, que emplea esta misma tecnología de voz subyacente mediante una API con credenciales y facturación por uso.
- Cientos de voces neuronales en decenas de idiomas y configuraciones regionales, incluidas varias variantes regionales para idiomas como el árabe, en lugar de una única voz genérica por idioma.
- Funciona con independencia del navegador Edge y de Windows, como herramienta Python autónoma en cualquier plataforma con conexión a internet.
- Permite ajustar velocidad, volumen y tono directamente mediante opciones de línea de comandos, lo que ofrece un control prosódico básico sin necesitar un lenguaje de marcado completo.
- Generación de subtítulos integrada, que produce archivos SRT o VTT junto con el audio: realmente útil para narración de vídeo, contenido de aprendizaje electrónico o flujos de accesibilidad.
- Una CLI sencilla más una API asíncrona de Python, compatibles tanto con comandos rápidos de una sola ejecución como con integraciones programadas y por lotes dentro de una aplicación mayor.
Una nota importante sobre lo que realmente es
Conviene entenderlo bien antes de construir algo serio sobre esta herramienta. Edge TTS funciona conectándose al mismo endpoint en línea que impulsa la función Leer en voz alta de Microsoft Edge: una función gratuita de accesibilidad del navegador, no una API pública documentada y respaldada por contrato. Esa diferencia importa en la práctica por dos razones. En primer lugar, al no ser oficial, Microsoft podría modificar o restringir ese endpoint en cualquier momento y sin aviso, lo que rompería la herramienta hasta que la comunidad se adaptara. En segundo lugar, la compatibilidad con marcado SSML personalizado se eliminó expresamente del proyecto porque Microsoft bloquea cualquier SSML que no haya sido generado por sus propias herramientas oficiales, lo que limita el grado de control detallado disponible frente a una API de voz real y documentada. Considera Edge TTS una herramienta gratuita realmente útil para proyectos personales, prototipos y contenido no crítico. Si piensas utilizarla en un producto comercial, revisa directamente las condiciones de Microsoft, ya que no es una API comercial con licencia como Azure Speech Services.
Primeros pasos con Edge TTS
- Instala mediante pip o pipx.
pip install edge-ttssirve para el uso general. Si solo necesitas la propia herramienta de línea de comandos y no la biblioteca de Python para programar,pipx install edge-ttses la alternativa documentada y más limpia, que evita contaminar el entorno Python del sistema. - Enumera las voces disponibles antes de elegir una.
edge-tts --list-voicesmuestra el catálogo completo de voces con género, categoría de contenido y etiquetas de personalidad; resulta útil para encontrar la variante regional adecuada antes de decidirte por un nombre de voz concreto. - Genera tu primer archivo de audio.
edge-tts --voice en-US-AriaNeural --text "Hello, world!" --write-media hello.mp3 --write-subtitles hello.srtproduce en un solo comando tanto un archivo de audio como su archivo de subtítulos correspondiente. - Ajusta velocidad, volumen o tono con las opciones correspondientes.
--rate=-50%,--volume=-50%y--pitch=-50Hzson la sintaxis documentada. Ten en cuenta que los valores negativos necesitan específicamente el signo=; de lo contrario, la línea de comandos interpretará mal la opción. - Instala
mpvsi quieres reproducción directa en sistemas que no sean Windows. El comandoedge-playbackreproduce de inmediato el audio generado en lugar de guardarlo en un archivo, pero en Linux y macOS requiere instalar por separado el reproductor de línea de comandosmpv(Windows no necesita este paso adicional). - Utiliza la API asíncrona de Python para todo lo que vaya más allá de comandos puntuales en la CLI. Importar la biblioteca directamente en tu código Python te proporciona un control programático adecuado para backends web o procesos por lotes, en vez de invocar repetidamente la CLI desde el shell.
Consejos para obtener mejores resultados
- Explora la salida de
--list-voicesen busca de variantes regionales adecuadas para tu público. Como muchos idiomas tienen varias opciones dialectales, elegir la variante regional más cercana sonará notablemente más natural que usar por defecto la primera voz en orden alfabético. - Divide los textos muy largos en lugar de enviarlos como una única petición enorme. Aunque no existe un límite estricto documentado, separar el contenido extenso en fragmentos más pequeños es una estrategia más fiable para obtener resultados consistentes.
- No dependas de SSML personalizado para el control detallado. Como Microsoft bloquea el SSML que no generan sus propias herramientas, utiliza las opciones admitidas por la biblioteca para velocidad, volumen y tono en lugar de intentar añadir tu propio marcado.
- Ten un plan alternativo para el uso en producción. Dado que se trata de una integración no oficial con una función gratuita del navegador, y no de una API contratada, no construyas un proceso crítico para el negocio que dependa por completo de ella sin un respaldo para el caso de que cambie el método de acceso subyacente.
- Utiliza específicamente la salida de subtítulos para proyectos de vídeo. Generar archivos SRT/VTT sincronizados junto con el audio en el mismo comando evita un paso independiente de subtitulado que la mayoría de las demás herramientas TTS gratuitas no incluye.
Edge TTS frente a los servicios de voz oficiales de Microsoft y las alternativas autoalojadas
| Edge TTS | Azure Speech Services (oficial) | Piper (autoalojado) | |
|---|---|---|---|
| Coste | Gratuito | De pago, facturado por uso | Gratuito, autoalojado |
| Requiere clave de API/cuenta | No | Sí | No |
| API oficial y con soporte | No: herramienta comunitaria no oficial | Sí | No se aplica, proyecto de código abierto |
| Calidad de voz | Alta (las mismas voces neuronales subyacentes) | Alta (las mismas voces neuronales subyacentes) | Sólida, más ligera |
| Compatibilidad con SSML personalizado | No (Microsoft lo bloquea) | Sí | No es una función central |
| Garantía de fiabilidad | Ninguna: el endpoint podría cambiar sin aviso | Respaldada por SLA | Depende por completo de tu propia infraestructura |
El nicho específico de Edge TTS consiste en ofrecer acceso gratuito y sin registro a voces neuronales de una calidad realmente alta para proyectos personales, prototipos y contenido informal. Para cualquier uso comercial crítico o que requiera disponibilidad garantizada, Azure Speech Services, el servicio de pago de Microsoft que utiliza la misma tecnología de voz con licencia oficial, es la opción más apropiada.
Preguntas frecuentes
¿Edge TTS es un producto oficial de Microsoft?
No. Es una herramienta independiente y de código abierto que se conecta al mismo servicio backend que impulsa la función Leer en voz alta del navegador Microsoft Edge; no es una API de Microsoft documentada ni respaldada oficialmente.
¿Tengo que instalar Microsoft Edge o Windows para utilizar Edge TTS?
No. Funciona como una herramienta Python autónoma en cualquier plataforma con conexión a internet, con independencia del navegador Edge y del sistema operativo Windows.
¿Edge TTS es realmente gratuito?
Sí, sin necesidad de clave de API, cuenta ni pago: una diferencia real frente a Azure Speech Services, el servicio de pago de Microsoft, que emplea una tecnología de voz subyacente similar mediante una API con facturación por uso.
¿Puedo utilizar Edge TTS en un producto comercial?
Procede con cautela. Como es una herramienta no oficial que accede a una función gratuita de accesibilidad del navegador, y no una API comercial con licencia, revisa directamente las condiciones de Microsoft y valora Azure Speech Services para cualquier uso crítico para el negocio.
¿En qué se diferencia de descargar voces TTS en la configuración de Windows?
Son sistemas distintos. Las voces integradas del Narrador de Windows, que se descargan mediante Configuración, forman parte del propio sistema operativo. Edge TTS, en cambio, accede específicamente a las voces neuronales en la nube del navegador Edge, que requieren conexión a internet pero suelen sonar más naturales.
Crea voz en línea con Echora
Para un flujo en el navegador con un objetivo parecido, utiliza la herramienta de Echora Texto a voz. Convierte hasta 5.000 caracteres en audio de un solo hablante, previsualiza el resultado y descarga el MP3 terminado.