VoiceStudio: S铆ntesis y clonaci贸n de voz local 100% offline
VoiceStudio es una aplicaci贸n de c贸digo abierto (licencia AGPL-3.0) que permite clonar voces, doblar videos, dictar texto y generar audios largos completamente en local, sin necesidad de cuenta, clave API ni suscripci贸n. Incluye 16 motores de s铆ntesis de voz (TTS), 11 de reconocimiento de voz (ASR) y soporte para 646 idiomas, todo ejecutable en macOS, Windows, Linux y mediante contenedores Docker. La aplicaci贸n est谩 dise帽ada para usuarios que valoran la privacidad y el control total sobre sus datos, ofreciendo una alternativa local a los servicios basados en la nube.
La suite es adecuada para creadores de contenido, desarrolladores y profesionales que necesiten generar audios o doblar videos sin depender de servicios externos. Funciona con hardware local, incluyendo GPUs NVIDIA (CUDA), Apple Silicon (MPS/MLX) y AMD (ROCm en Linux), aunque tambi茅n soporta ejecuci贸n en CPU. Requiere al menos 8 GB de RAM y 10 GB de espacio en disco, aunque se recomiendan 16 GB y 20 GB para un rendimiento 贸ptimo.
Entre sus caracter铆sticas destacan la clonaci贸n de voz sin necesidad de entrenamiento previo, la integraci贸n de modelos como CosyVoice 3, GPT-SoVITS y OmniVoice, y una interfaz de usuario intuitiva que permite cambiar entre motores f谩cilmente. Adem谩s, ofrece herramientas avanzadas como aislamiento vocal, diarizaci贸n de hablantes y un servidor MCP para integraciones personalizadas. Aunque es una versi贸n beta activa, se recomienda usar la 煤ltima versi贸n estable para trabajos productivos.