Suscríbete a mi canal:
Voicebox es un estudio de voz open source que corre en tu ordenador y te deja clonar tu voz sin pagar créditos por minuto.
En el vídeo de arriba te enseño el flujo en Windows: activar CUDA, grabar unos 30 segundos y generar audio con tu clon.
¿Voicebox de jamiepine o Meta Voicebox — cuál es este proyecto?
Este es jamiepine/voicebox, el de github.com/jamiepine/voicebox y voicebox.sh.
Meta publicó en 2023 un paper también llamado Voicebox. Era investigación de generación de habla.
No es esta interfaz descargable. Si buscas “Voicebox” a secas, mira el autor del repo antes de instalar otra cosa.
El nombre se presta a lío y no quiero que acabes en el paper equivocado.
La app de jamiepine es un estudio de escritorio. Mac, Windows y también vía terminal.
En el vídeo uso el ejecutable de Windows. Abres, y ya estás dentro del estudio.
¿Por qué buscar una alternativa local a ElevenLabs?
Porque las herramientas online te atrapan en una dicotomía. O tienes calidad con límites estrictos, o tienes cantidad con errores raros que no controlas.
ElevenLabs, para mí, sigue siendo el techo. Yo pago la versión de pago y estoy encantado.
No lo digo de postureo. Cuando quiero el acabado “de estudio” para algo que va a un cliente, tiro de Eleven sin drama.
El problema no es la calidad. El problema es el ritmo de trabajo cuando estás probando guiones.
Regeneras, cambias una frase, vuelves a regenerar. Cada vuelta mira el contador de caracteres o de créditos.
Y tu muestra de voz se queda en un servidor de terceros.
Lo que quería era otra vía. Ilimitada en casa.
Privada. Sin pelearme con el plan cada vez que pruebo un párrafo.
En el vídeo lo oyes al principio: el clon dice que la voz no es real, que es gratis, local e ilimitada. Ese es el punto del experimento.
No sustituir Eleven mañana. Tener un laboratorio de voz en el PC.
¿Qué es Voicebox y cómo se instala?
Es software libre. Repo abierto, sitio en voicebox.sh, y builds para Mac, Windows y terminal.
En mi caso ya lo tenía instalado. No te muestro la instalación en cámara porque en Windows es un ejecutable.
Descargas, abres, y entras al estudio. Sin pelearme con dependencias en esa toma.
Eso no quiere decir que en todos los sistemas sea “doble clic y listo”. En macOS a veces aparece el aviso de app dañada (cuarentena del binario).
En Linux conviene pillar la release correcta para tu SO. Eso lo dejo abajo en «Cuando algo falla», con fuente.
En el vídeo el camino es el simple: Windows + exe.
El beneficio que busco no es lucir open source. Es poder clonar y regenerar sin créditos.
El instalador solo es la puerta.
¿Cómo configurar GPU/CUDA si te arranca en CPU?
En Windows, a veces Voicebox arranca en CPU aunque tengas gráfica. Me pasó en la demo.
Abro lo que en el vídeo llamo la “ruleta” de estado. Tengo GPU.
Se ve. Pero de entrada no me la reconoció.
Me aparecía que estaba funcionando con CPU, y abajo me ponía activar CUDA.
Lo activé. Le di a reiniciar.
Y ya me aparece la gráfica. En pantalla se ve ocupación.
Pone del orden de 5 GB en una tarjeta de 12. Supongo que es la parte libre o el tramo que está usando en ese momento.
No lo tomes como benchmark de producto. Es lo que salió en esa toma, en esa máquina.
Si te pasa lo mismo, no tires la app. Mira el interruptor de CUDA, reinicia el estudio y comprueba otra vez.
Sin VRAM suficiente, puedes caer a CPU. Funciona.
Solo asume que el tiempo por frase sube. Para probar el clon, CPU vale.
Para regenerar en bucle, la GPU cambia el ritmo.
No hice más magia. Con CUDA activo, pasé directo a crear la voz.
¿Cómo clonar tu voz en local con ~30 segundos?
Icono del altavoz → crear una voz → grabar ~30 segundos → nombre + descripción → idioma.
Ese es el flujo de la demo, clic a clic. No hay ritual de fine-tuning el primer día.
Le doy a grabar. Hablo unos 30 segundos.
Por lo que he estado viendo en la ayuda del propio programa, puedes añadir más voces o más muestras, pero de momento no va a mejorar el resultado. Entiendo que poco a poco irá mejorando el entrenamiento.
Hoy, con una toma corta, basta para probar.
Le pongo nombre a la voz. Una descripción para encontrarla después.
Y en idioma, español. Nada más.
Sin parámetros esotéricos en pantalla.
Cuando está lista, pegas el texto que quieres generar. En el vídeo cloné de nuevo el mismo párrafo de la intro, para que oyeras el resultado con el mismo contenido.
Tenía dos perfiles. Ambos eran mi voz.
Selecciono el que quiero y le doy a generar.
Sale el audio. Se entiende.
Suena a mí lo suficiente para un borrador. No es perfecto.
No es ElevenLabs. Lo digo en el vídeo sin drama.
Puedes regenerar el mismo párrafo las veces que quieras sin mirar un plan. Para un solopreneur que prueba guiones, eso cambia el día a día.
Si lo que necesitas es TTS en la nube con API madura (otro problema, otro contrato), el contraste está en TTS en la nube con Amazon Polly.
¿Qué motores TTS incluye y cuál elegir?
Hay varios motores dentro. En el vídeo no hago un tour de todos.
Dejo seleccionado el que el propio Voicebox marca como mejor equilibrio.
Esa es la decisión práctica del primer día. No te pierdas eligiendo motor antes de tener una muestra decente.
Primero clona. Luego, si el resultado te sabe a poco, cambias de motor y regeneras el mismo texto.
En local eso no te cuesta créditos.
En voicebox.sh verás nombres tipo Qwen3-TTS, Chatterbox, Kokoro y otros. Pesos distintos, idiomas distintos, VRAM distinta.
El troubleshooting oficial avisa que la primera generación de un motor puede tardar minutos porque descarga el modelo. Las siguientes reutilizan la caché.
En mi demo no me peleo con ese catálogo. Elijo el marcado como mejor, genero, y escucho.
Si tú tienes poca VRAM, empieza por un motor ligero y sube cuando te quede holgura.
¿Cuándo sigue siendo mejor ElevenLabs?
Cuando la calidad comercial manda. Anuncios, producto de pago, tono de estudio, cliente exigente.
Voicebox me vale para borradores, pruebas de guion, contenido donde priorizo no pagar por cada regeneración y no subir la voz a un tercero. Me quita dependencia cuando quiero volumen o privacidad.
No me sustituye Eleven en el día a día premium.
La dicotomía del vídeo (calidad con límites frente a cantidad con errores) no desaparece del todo. Cambia de sitio.
Aquí ganas control y privacidad. La calidad la negocias tú con el motor, la muestra y el oído.
El mismo espíritu “que se quede en el PC” lo aplico a documentos con el OCR con IA en local.
Cuando algo falla
Sin postureo. Piedras reales, las del vídeo y las del troubleshooting oficial:
- Arranca en CPU aunque tengas GPU — es la piedra de la demo. Activa CUDA, reinicia el estudio y mira otra vez el estado. Si no hay VRAM usable, acepta CPU y asume más tiempo por frase.
- La primera generación tarda minutos — está descargando el modelo del motor (de cientos de MB a varios GB según el engine). No es que se haya colgado. Mira el progreso en Settings → Models. Las siguientes suelen ir más fluidas. Fuente: troubleshooting de jamiepine/voicebox.
- macOS: “App is damaged” — suele ser la cuarentena del binario. El repo indica
xattr -cr /Applications/Voicebox.appantes de pensar que el build está corrupto. - CUDA OOM / out of memory — cierra lo que coma VRAM, parte el texto en trozos, o pasa a CPU (más lento, usa RAM). El doc habla de ~6 GB+ como zona cómoda de GPU según el caso.
- Linux y el instalador equivocado — ha habido líos de descarga (issues del repo, p. ej. #767). Mira la release correcta para tu SO, no copies el .exe de Windows.
- Calidad rara o robótica — graba 10–30 s claros, sin ruido de fondo, tono estable, español bien etiquetado. La ayuda del programa dice que apilar más muestras no mejora de momento. No esperes magia de estudio a la primera.
- API local — Voicebox expone endpoints en localhost (puerto 17493 en la doc de voicebox.sh) si quieres generar desde script. No hace falta para el flujo del vídeo.
¿Para qué me sirve (y para qué no)?
Me sirve para clonar mi voz en local sin límites de créditos y sin subir la muestra a un SaaS. Me sirve para probar guiones en bucle.
Puedes usarlo como laboratorio de voz y reservar ElevenLabs para el corte final.
No me sirve si necesitas el techo de Eleven ya, hoy, para un cliente exigente. Ahí sigo pagando Eleven sin drama.
Y no me sirve si esperas que 30 segundos de micrófono suenen a doblaje de película. El vídeo es honesto: se oye bien para el precio (cero) y para el sitio (tu PC).
No es perfecto.
Repo otra vez en github.com/jamiepine/voicebox y en voicebox.sh. La referencia de comparación (la que yo pago) es ElevenLabs.
Si te interesa seguir quitándote suscripciones de voz y trabajo manual con herramientas que controlas tú, en la comunidad dejo más de este tipo de cosas: Skool — Mis Ingresos Pasivos. Pruébalo, dime qué te parece el clon en tu máquina, y nos vemos en el siguiente.