~/biblioteca-ia/voicebox
repoMediapendiente
Voicebox
Estudio de voz local y open source. Clona voces, dicta en cualquier app y da voz a tus agentes.

Para qué reto sirve
Cuando necesitas voz y no quieres mandar el audio a un servicio ajeno, ni pagar por minuto. Cubre las dos mitades del bucle que los productos comerciales venden por separado: entrada —dictado con atajo global y Whisper— y salida —clonación y síntesis—. Y la pieza que casi nadie tiene: una llamada MCP, voicebox.speak, para que Claude Code o Cursor te respondan hablando.
Qué es
Estudio de voz local, alternativa libre a ElevenLabs y WisprFlow en una sola aplicación. Clona una voz desde unos segundos de audio, genera habla en 23 idiomas con siete motores TTS, dicta en cualquier campo de texto con un atajo global, y expone un servidor MCP para que un agente hable con la voz que elijas. Nada sale de tu máquina. Construido con Tauri sobre Rust, no Electron.
Cuándo no usarla
Corre en tu hardware, así que la latencia y la calidad dependen de tu GPU: en un equipo sin aceleración va a arrastrarse. Linux no tiene binarios todavía, hay que compilar desde el código. Y el punto serio: clonar la voz de una persona sin su permiso puede ser ilegal según dónde estés, y el software no te protege de eso. Si es para un cliente, pide consentimiento por escrito.
Mi veredicto
Sin probar. Lo que hay que medir antes de adoptarlo es el hardware: cuánto tarda en generar en mi equipo y si el dictado aguanta la comparación con WisprFlow en uso diario. La clonación es lo llamativo, pero el dictado es lo que usaría todos los días.
Los siete motores
No es un motor con ajustes: son siete implementaciones distintas y eliges según el trabajo. Qwen3-TTS y Qwen CustomVoice, este último con control de interpretación en lenguaje natural. LuxTTS, ligero —alrededor de 1 GB de VRAM— y 150 veces tiempo real en CPU, pero solo inglés. Chatterbox Multilingual para cobertura de idiomas y Chatterbox Turbo para etiquetas paralingüísticas del tipo [laugh] o [sigh]. HumeAI TADA. Y Kokoro, que trae voces preestablecidas.
La parte de agentes
Un agente compatible con MCP —Claude Code, Cursor, Cline— llama a voicebox.speak y responde en voz. Cada perfil de voz puede llevar una persona en texto libre, y hay un LLM local integrado con modos Compose, Rewrite y Respond que el agente también puede invocar por MCP.
Lo demás
Editor de historias con línea de tiempo multipista para conversaciones y pódcast. Post-proceso con cambio de tono, reverberación, delay, coro, compresión y filtros. Troceado automático con fundido cruzado para textos largos. API REST además del servidor MCP.