NovedadIA
V

VoiceStudio

Codigo abiertoValoracion editorial 4.1/5Voz y audio con IA

Kit de herramientas de voz con IA de código abierto y 100% local que agrupa 16 motores TTS y 11 motores ASR con soporte para 646 idiomas. Sin suscripciones ni facturación por consumo, permite clonar voces, doblar vídeos, dictar, transcribir y crear audiolibros desde el propio hardware.

Herramientas relacionadas

VoiceStudio, anteriormente conocido como OmniVoice-Studio, es un kit de herramientas de voz con IA de código abierto diseñado para ejecutarse completamente en local. Su propuesta es muy clara: ofrecer un conjunto completo de herramientas de procesamiento de voz que pueda funcionar directamente en el ordenador del usuario, sin suscripciones, sin API Key y sin facturación por consumo.

A diferencia de servicios de voz en la nube como ElevenLabs o Play.ht, VoiceStudio realiza todo el procesamiento principal en el dispositivo. El usuario descarga los pesos de los modelos y ejecuta las tareas utilizando su propio hardware, por lo que los datos no abandonan el dispositivo. En palabras del propio proyecto, VoiceStudio intercambia la potencia de cómputo gestionada en la nube por control local.

En una frase: VoiceStudio es algo parecido a un «Blender para la voz con IA»: extremadamente completo, gratuito y de código abierto, pero exige estar dispuesto a configurar hardware, modelos y herramientas técnicas.

2. Capacidades principales

1. 16 motores TTS + 11 motores ASR: un ecosistema de motores especialmente amplio

La principal diferenciación de VoiceStudio es su ecosistema de motores. No se trata de un único modelo de voz, sino de una plataforma que agrupa diferentes motores de síntesis y reconocimiento.

Motores TTS (16):

  • OmniVoice GGUF / OmniVoice (subproceso): más de 600 idiomas y clonación de voz.
  • IndexTTS 2.5: síntesis de voz de alta calidad.
  • PocketTTS: compatible con inglés, francés, alemán, portugués, italiano y español, con funcionamiento exclusivamente mediante CPU.
  • Supertonic 3, MOSS-TTS-v1.5, dots.tts, Confucius4-TTS, entre otros.

Motores ASR (11):

  • WhisperX (predeterminado): alrededor de 100 idiomas, doblaje, subtítulos y marcas de tiempo a nivel de palabra.
  • Faster-Whisper: alrededor de 100 idiomas y transcripción multiplataforma.
  • Parakeet TDT v3 (MLX): 25 idiomas de la Unión Europea y optimización para Apple Silicon.
  • Moonshine: inglés, baja latencia y bajo consumo mediante ONNX.
  • FunASR: más de 50 idiomas, VAD y diarización de hablantes integrada.
  • sherpa-onnx (dictado en tiempo real): dictado mediante streaming utilizando CPU.
  • ASR compatible con OpenAI: permite utilizar gigastt/Qwen3-ASR localmente o endpoints remotos.

Una decisión de diseño importante: el usuario puede cambiar libremente de motor desde el Model Catalogue. También puede utilizar el atajo Ctrl/Cmd+E.

Esto permite elegir el motor más adecuado para cada tarea: por ejemplo, OmniVoice para doblaje de alta calidad y PocketTTS para escenarios donde el consumo de recursos sea una prioridad.

2. Compatibilidad con 646 idiomas: una cobertura lingüística excepcional

VoiceStudio afirma ofrecer soporte para 646 idiomas TTS. Es una de las cifras de cobertura lingüística más amplias anunciadas actualmente entre las herramientas de voz con IA.

Sin embargo, hay que interpretar esta cifra con cierto contexto. La cobertura real y la calidad dependen del motor utilizado: OmniVoice cubre más de 600 idiomas, mientras que PocketTTS se limita a seis.

3. Cinco flujos de trabajo principales

VoiceStudio reúne cinco grandes flujos de trabajo:

① Clonación y diseño de voz: clonar la voz de una persona concreta o diseñar una voz completamente nueva.

② Doblaje de vídeo: generar doblaje para vídeos y trabajar con diferentes idiomas.

③ Dictado: herramienta de transcripción en tiempo real activada mediante un atajo de teclado a nivel del sistema, con posibilidad de utilizar un LLM local para limpiar el resultado.

④ Creación de audiolibros y narraciones: admite guiones con varios personajes, importación de EPUB/PDF, renderizado por capítulos y exportación .m4b.

⑤ Generación por lotes: procesamiento masivo de tareas de audio y vídeo, incluida la posibilidad de vigilar una carpeta y procesar automáticamente los nuevos vídeos.

4. Funciones adicionales

  • Aislamiento de voz: separación de voz y fondo mediante Demucs.
  • Diarización de hablantes: asignación de participantes mediante Pyannote y WhisperX.
  • Marca de agua de IA: inserción y detección mediante AudioSeal.
  • Servidor MCP: proporciona herramientas de síntesis y transcripción a clientes compatibles con MCP.

5. Arquitectura local y extensible

VoiceStudio utiliza una arquitectura de tres capas basada en Tauri v2 (Rust) + React + FastAPI:

  • Desktop shell: gestión de ventanas, bandeja del sistema, atajos y actualizador.
  • Frontend: interfaz React, gestión del estado e internacionalización.
  • Backend: servicio FastAPI encargado de ejecutar las inferencias de IA.

Los datos se almacenan por defecto en el directorio local omnivoice_data/.

Las funciones de red están diseñadas como opt-in explícito. Tanto los workers remotos como el ASR compatible con OpenAI requieren activación por parte del usuario.

Las funciones analíticas tampoco se activan antes de obtener consentimiento. Cuando se utilizan, solo se envían metadatos de uso anonimizados, sin texto, audio, nombres de archivos ni contenido de proyectos.

3. Rendimiento y requisitos de hardware

El hardware: la principal «barrera invisible» de VoiceStudio

ConfiguraciónRequisitos mínimosConfiguración recomendada
Sistema operativoWindows 10 x64 / macOS 13.3 Apple Silicon / Linux x86_64 glibc 2.39+Última versión disponible del sistema compatible
Memoria8 GB16 GB+
Almacenamiento10 GB libres20 GB+ SSD
GPUOpcional, admite CPUNVIDIA CUDA o Apple Silicon
VRAM4 GB con GPU8 GB+

Fuente: README de VoiceStudio

Aspectos importantes:

  • Apple Silicon recibe soporte de primera clase: macOS 13.3 o posterior, únicamente Apple Silicon. Los Mac con Intel no pueden ejecutar el backend Python local y necesitan utilizar un backend remoto.
  • ROCm solo está disponible en Linux y requiere activación explícita.
  • Windows con AMD/Ryzen AI solo puede utilizar CPU.
  • Cuando no hay suficiente VRAM, el sistema puede realizar automáticamente offload hacia la CPU.

Descarga y gestión de modelos

En el primer inicio, VoiceStudio crea un entorno Python gestionado y descarga los modelos predeterminados. Los siguientes inicios reutilizan ese entorno.

El problema aparece cuando se utilizan diferentes motores: cada motor puede requerir pesos de modelos distintos y cada uno puede tener condiciones de licencia diferentes.

En la práctica, el usuario debe encargarse de descargar, organizar y mantener múltiples archivos de modelos.

4. Opiniones y comentarios de los usuarios

Nota: VoiceStudio es todavía un proyecto de código abierto relativamente reciente y no dispone de una gran cantidad de evaluaciones independientes a gran escala. El siguiente análisis se basa principalmente en el README, la documentación y las conversaciones generales de la comunidad de código abierto.

Lo que gusta 👍

  • «Funciona completamente en local y los datos no salen del dispositivo»: para usuarios que trabajan con audio sensible —como contenidos médicos, legales o reuniones empresariales— supone una ventaja fundamental frente a servicios en la nube como ElevenLabs.
  • «Cero suscripción y cero facturación por uso»: no hay facturas mensuales ni preocupación por quedarse sin créditos.
  • «Una cantidad enorme de motores»: 16 motores TTS y 11 ASR permiten adaptar la herramienta a diferentes escenarios.
  • «646 idiomas»: resulta especialmente atractiva para proyectos que necesitan idiomas minoritarios.
  • «Código abierto y extensible»: el sistema basado en registros de motores y las interfaces de plugins permiten ampliar la plataforma.
  • «API compatible con OpenAI + servidor MCP»: facilita su integración con flujos de trabajo existentes.

Lo que genera críticas 👎

  • «Los requisitos de hardware son demasiado altos»: la configuración recomendada de 16 GB o más de RAM, 8 GB o más de VRAM y 20 GB o más de SSD puede dejar fuera a muchos usuarios.
  • «La gestión de modelos es complicada»: diferentes motores requieren diferentes modelos y las licencias no son uniformes.
  • «Los usuarios de Mac Intel quedan fuera»: no pueden ejecutar localmente el backend Python.
  • «AGPL-3.0 no es especialmente cómoda para determinados usos comerciales»: las obligaciones de licencia pueden complicar proyectos derivados.
  • «No es realmente plug-and-play»: hay que configurar el entorno, descargar modelos y gestionar los motores.
  • «Algunos motores tienen restricciones adicionales»: IndexTTS 2.5, por ejemplo, exige autorización escrita adicional para organizaciones con más de 100 millones de usuarios activos mensuales o más de 1.000 millones de yuanes de ingresos anuales.

5. VoiceStudio frente a la competencia

ProductoPrecioLocalCódigo abiertoMotores TTSIdiomasClonación de vozDoblaje de vídeoMás adecuado para
VoiceStudioGratis✅ AGPL-3.016646Usuarios técnicos, privacidad
ElevenLabs$5-22/mes1 propio70+Creadores que priorizan comodidad
Coqui TTSGratis✅ MIT1MultilingüeDesarrolladores TTS de código abierto
Play.ht$19-99/mesMúltiples140+Podcasts y audiolibros

Conclusiones clave:

  • VoiceStudio destaca claramente por número de motores y cobertura lingüística: 16 motores frente a 1 en ElevenLabs y 646 idiomas frente a más de 70.
  • VoiceStudio es una de las pocas opciones que combina ejecución local, código abierto, doblaje de vídeo y creación de audiolibros en un mismo flujo de trabajo.
  • ElevenLabs supera ampliamente a VoiceStudio en facilidad de uso: no requiere configurar hardware, instalar múltiples modelos ni gestionar pesos.
  • Coqui TTS utiliza una licencia MIT más sencilla para determinados usos comerciales, aunque su cobertura funcional está muy por debajo de VoiceStudio.

6. Ventajas y desventajas

✅ Ventajas

  1. Funcionamiento completamente local: los datos permanecen en el dispositivo.
  2. Cero suscripción y cero facturación por uso: sin cuotas mensuales.
  3. 16 motores TTS + 11 motores ASR: un ecosistema especialmente amplio.
  4. 646 idiomas: una de las coberturas lingüísticas más extensas.
  5. Cinco grandes flujos de trabajo: clonación de voz, doblaje, dictado, audiolibros y procesamiento por lotes.
  6. API compatible con OpenAI + servidor MCP: integración sencilla con otros flujos de trabajo.
  7. Multiplataforma: macOS, Windows, Linux y Docker.
  8. Código abierto y extensible: motores basados en registros e interfaces de plugins.

❌ Desventajas

  1. Requisitos de hardware elevados: 16 GB+ de RAM, 8 GB+ de VRAM y 20 GB+ de SSD recomendados.
  2. Gestión de modelos compleja: cada motor puede requerir modelos y licencias diferentes.
  3. Los Mac con Intel no admiten ejecución local.
  4. La licencia AGPL-3.0 puede ser problemática para determinados usos comerciales.
  5. No ofrece una experiencia completamente plug-and-play: requiere configuración y gestión de modelos.
  6. Algunos motores tienen restricciones adicionales: IndexTTS 2.5 impone requisitos adicionales a organizaciones grandes.
  7. El proyecto continúa en fase beta activa: el propio README lo identifica como «Active beta».

7. ¿Quién debería utilizar VoiceStudio?

✅ Recomendado para

  • Desarrolladores y usuarios técnicos preocupados por la privacidad: no quieren enviar audio a servicios en la nube.
  • Investigadores que trabajan con contenido sensible: grabaciones médicas, legales o reuniones empresariales.
  • Entusiastas de la IA con hardware potente: usuarios que ya disponen de una GPU potente o están dispuestos a invertir en ella.
  • Creadores que trabajan con muchos idiomas o idiomas minoritarios: la cobertura de 646 idiomas es uno de sus mayores atractivos.
  • Usuarios que prefieren una inversión inicial sin suscripción mensual: no hay cuotas recurrentes.
  • Entusiastas del software de código abierto: pueden modificar y ampliar la herramienta.

❌ No recomendado para

  • Usuarios con hardware limitado: equipos con 8 GB de RAM y gráficos integrados pueden quedarse cortos.
  • Creadores que buscan una experiencia inmediata: ElevenLabs o Play.ht resultan más adecuados.
  • Usuarios de Mac Intel: no pueden ejecutar el backend local.
  • Empresas con requisitos estrictos de licenciamiento: AGPL-3.0 puede imponer restricciones importantes.
  • Usuarios que no quieren gestionar modelos: VoiceStudio requiere mantener varios modelos y motores.

8. Puntuación final sobre 5

DimensiónPuntuaciónEvaluación
Cobertura funcional5,0/516 TTS + 11 ASR + 5 grandes flujos de trabajo
Cobertura lingüística5,0/5646 idiomas
Funcionamiento local/privacidad5,0/5Procesamiento completamente local
Relación calidad-precio5,0/5Gratuito, sin suscripción ni facturación por uso
Libertad del código abierto4,0/5AGPL-3.0 puede limitar determinados usos comerciales
Facilidad de uso2,5/5Hardware exigente y gestión de modelos compleja
Requisitos de hardware2,5/516 GB+ de RAM y 8 GB+ de VRAM recomendados

Puntuación general: 4,1/5

(Basándonos en su posicionamiento como «kit de herramientas de voz con IA local y de código abierto», VoiceStudio destaca por cobertura funcional y privacidad. La ausencia de suscripción y facturación por uso es uno de sus mayores atractivos, mientras que los requisitos de hardware y la complejidad técnica constituyen sus principales limitaciones. Para usuarios técnicos con hardware adecuado, la valoración podría subir hasta 4,5/5; para usuarios convencionales, podría quedarse alrededor de 3,0/5.)

9. Conclusión final: ¿merece la pena?

La respuesta depende de tu hardware y de cuánto estés dispuesto a configurar por tu cuenta.

VoiceStudio es uno de los kits de herramientas de voz con IA local y de código abierto más completos de 2026. Sus 16 motores TTS, 11 motores ASR, 646 idiomas y cinco grandes flujos de trabajo demuestran que el proyecto ha avanzado considerablemente hacia su objetivo de convertirse en una alternativa completamente local a ElevenLabs.

El hecho de combinar cero suscripciones, cero facturación por uso y procesamiento local resulta especialmente atractivo para usuarios técnicos y personas preocupadas por la privacidad.

Pero no es una herramienta que simplemente instalas y empiezas a utilizar.

La configuración recomendada de 16 GB+ de RAM, 8 GB+ de VRAM y 20 GB+ de SSD representa una barrera importante para muchos usuarios. Los Mac con Intel quedan directamente fuera de la ejecución local. Además, es necesario descargar y administrar los modelos de diferentes motores, cada uno con sus propias condiciones de licencia.

La licencia AGPL-3.0 también debe analizarse cuidadosamente antes de utilizar VoiceStudio en determinados proyectos comerciales.

VoiceStudio merece especialmente la pena si:

  • Tienes hardware potente: 16 GB+ de RAM y 8 GB+ de VRAM.
  • Utilizas un Mac con Apple Silicon o Linux/NVIDIA.
  • Te preocupa la privacidad de los datos y no quieres subir audio a la nube.
  • Estás dispuesto a configurar y administrar modelos.
  • Necesitas trabajar con muchos idiomas o idiomas minoritarios.
  • Tu proyecto es personal o un proyecto de código abierto compatible con AGPL-3.0.

Conviene pensárselo dos veces si:

  • Tu hardware es limitado, por ejemplo 8 GB de RAM y gráficos integrados.
  • Utilizas un Mac Intel.
  • Buscas una experiencia verdaderamente plug-and-play: ElevenLabs resulta más cómodo.
  • Tu proyecto necesita distribuir software comercial cerrado y la AGPL-3.0 supone un problema.
  • No quieres dedicar tiempo a gestionar modelos y entornos locales.

En una frase: VoiceStudio está pensado para usuarios técnicos con hardware potente, preocupación por la privacidad y disposición a configurar las cosas por sí mismos. En 2026, su cobertura funcional y su enfoque local son difíciles de igualar, pero los requisitos de hardware y la complejidad técnica hacen que sea mucho más adecuado para quienes disfrutan teniendo el control que para quienes solo quieren hacer unos clics y obtener el resultado.

Si tienes el hardware y estás dispuesto a invertir tiempo en la configuración, VoiceStudio es una de las herramientas de voz con IA local más interesantes de 2026. Si eres un usuario convencional, ElevenLabs o Play.ht probablemente sean opciones más prácticas.

10. Preguntas frecuentes (FAQ)

¿VoiceStudio es gratis?

Sí. Es completamente gratuito y de código abierto bajo AGPL-3.0. El software no tiene coste, pero debes aportar tu propio hardware y descargar los pesos de los modelos por tu cuenta.

¿Qué plataformas admite VoiceStudio?

Admite macOS 13.3+ exclusivamente con Apple Silicon, Windows 10/11 x64, Linux x86_64 con glibc 2.39+ y Docker. Los Mac con Intel no pueden ejecutar el backend local.

¿Qué hardware necesita VoiceStudio?

El mínimo indicado es de 8 GB de RAM y 10 GB de almacenamiento. La configuración recomendada es de 16 GB+ de RAM, 8 GB+ de VRAM y 20 GB+ de SSD.

¿VoiceStudio admite español?

Sí. PocketTTS incluye explícitamente soporte para español. OmniVoice admite más de 600 idiomas, por lo que también debería cubrir español.

¿Cuál es la diferencia entre VoiceStudio y ElevenLabs?

VoiceStudio funciona completamente en local, es gratuito, de código abierto y ofrece 16 motores y 646 idiomas. ElevenLabs funciona en la nube, es de pago y de código cerrado, y su enfoque se basa en sus propios modelos y servicios. VoiceStudio ofrece mayor flexibilidad y control, pero exige bastante más al hardware y al usuario.

¿Se puede utilizar VoiceStudio con fines comerciales?

Sí, pero existen restricciones importantes. La licencia AGPL-3.0 puede exigir que determinadas obras derivadas también se distribuyan bajo una licencia compatible. Además, algunos motores, como IndexTTS 2.5, tienen requisitos de autorización adicionales para organizaciones grandes.

¿VoiceStudio envía los datos a la nube?

Por defecto, no. El procesamiento principal funciona completamente en local y los datos permanecen en el dispositivo. Los workers remotos, el ASR compatible con OpenAI y las funciones analíticas requieren activación explícita por parte del usuario.

Lo que hace VoiceStudio

  • Funcionamiento completamente local sin necesidad de cuenta, API Key ni conexión a Internet
  • 16 motores TTS y 11 motores ASR intercambiables desde el catálogo de modelos
  • Compatibilidad con 646 idiomas de síntesis de voz
  • Clonación y diseño de voces
  • Doblaje de vídeo multilingüe
  • Dictado y transcripción en tiempo real mediante atajo de sistema
  • Creación de audiolibros con guiones multi personaje, importación EPUB y PDF y exportación m4b
  • Generación por lotes con vigilancia de carpetas
  • API de audio compatible con OpenAI y servidor MCP
  • API local REST, SSE y WebSocket
  • Aislamiento de voz, diarización de hablantes y marca de agua de IA
  • Multiplataforma para macOS, Windows, Linux y Docker

Comparativas con VoiceStudio