Whisper
Modelo de reconocimiento automático del habla (ASR) de OpenAI lanzado como código abierto en 2022 bajo licencia MIT. Se ejecuta completamente offline en local, soporta 99 idiomas (transcripción y traducción) y ofrece precisión líder (2,1% WER en LibriSpeech test-clean) gracias a una arquitectura Transformer de extremo a extremo. Es la opción preferida de desarrolladores y usuarios preocupados por la privacidad, aunque carece de diarización nativa y de actualizaciones oficiales recientes.
Whisper es un modelo de reconocimiento automático del habla (ASR) que OpenAI lanzó como código abierto en septiembre de 2022. Fue entrenado con 680.000 horas de datos de audio multilingües y multitarea supervisados, una cantidad de datos muy superior a la de la mayoría de los conjuntos de datos de reconocimiento de voz disponibles en aquel momento.
A diferencia de muchos sistemas de reconocimiento de voz convencionales, Whisper utiliza una arquitectura Transformer de extremo a extremo, capaz de generalizar en condiciones de zero-shot a una gran variedad de conjuntos de datos y dominios.
La idea central de Whisper es muy sencilla: no necesitas un servicio en la nube, una clave API ni una suscripción de pago. Descargas el modelo, lo ejecutas localmente y obtienes transcripciones de alta calidad.
Esto supone una diferencia fundamental frente a servicios comerciales como Otter.ai o Fireflies.ai, que procesan las grabaciones enviándolas a servidores en la nube.
Datos clave:
- Lanzamiento: septiembre de 2022
- Desarrollado por: OpenAI
- Licencia open source: MIT
- Datos de entrenamiento: 680.000 horas de audio multilingüe
- Idiomas compatibles: 99
- Tamaño del modelo: 809 millones de parámetros en Large v3 Turbo
- Modelos disponibles: varios tamaños (tiny, base, small, medium, large)
2. Capacidades principales
1. Código abierto completo + licencia MIT: una de las soluciones de ASR más libres
Esta es una de las principales ventajas de Whisper. Los pesos del modelo están disponibles públicamente y se distribuyen bajo la licencia MIT, que permite utilizarlos, modificarlos y emplearlos comercialmente.
Puedes:
- Ejecutarlo completamente offline en local, sin que los datos salgan del dispositivo.
- Desplegarlo en prácticamente cualquier hardware compatible, desde un portátil hasta una GPU individual o determinadas funciones serverless.
- Modificar y ajustar el modelo para adaptarlo a escenarios específicos.
- Evitar el vendor lock-in, sin preocuparte por cambios en los precios de una API o por la interrupción de un servicio.
2. Soporte para 99 idiomas
Whisper admite tanto transcripción como traducción y cubre 99 idiomas.
No solo puede convertir el habla en texto manteniendo el mismo idioma, sino que también puede traducir directamente voz en idiomas distintos del inglés al inglés.
La precisión, sin embargo, depende de la cantidad y calidad de los datos de entrenamiento disponibles para cada idioma. En los principales idiomas europeos, incluido el español, su rendimiento es especialmente fiable.
3. Precisión muy alta: un referente del sector
Whisper Large v3 Turbo se encuentra entre los modelos open source con mejor precisión:
- LibriSpeech test-clean: 2,1 % WER (tasa de error de palabras)
- LibriSpeech test-other: 4,2 % WER
- Common Voice English: 9,1 % WER
Estos resultados han sido reproducidos y comprobados ampliamente por la comunidad durante años. En determinadas pruebas de reconocimiento de inglés hablado por personas no nativas, Whisper también ha mostrado un rendimiento claramente superior al de otros modelos y servicios, incluido AssemblyAI.
4. Ejecución local + privacidad: su mayor ventaja diferencial
A diferencia de servicios comerciales de transcripción como Otter.ai o Fireflies.ai, Whisper no necesita enviar el audio a servidores en la nube.
Todo el proceso de transcripción puede realizarse localmente, por lo que las grabaciones no tienen por qué abandonar el dispositivo.
Para usuarios que trabajan con actas de reuniones sensibles, entrevistas médicas o grabaciones legales, esta característica puede ser difícil de sustituir.
Un usuario que pasó de Otter.ai a Whisper lo resumió así: “Otter procesa el audio en sus servidores, lo que significa que tus grabaciones salen de tu sistema. Aunque ofrezcan cifrado o garantías de cumplimiento, sigues confiando en una infraestructura que no puedes inspeccionar. Whisper se centra en transcribir: no entra en reuniones, no envía correos ni interactúa con otros participantes. Procesa el audio y devuelve texto. Eso es todo”.
5. Diferentes tamaños de modelo para distintos equipos
Whisper ofrece modelos de diferentes tamaños, desde tiny (39 millones de parámetros) hasta large (1.550 millones de parámetros), lo que permite elegir según el hardware disponible y el nivel de precisión deseado.
Large v3 Turbo es una versión destilada de Large v3. Reduce las capas del decodificador de 32 a 4, consiguiendo una mejora de velocidad de aproximadamente 4-8 veces, mientras mantiene gran parte de la precisión del modelo original.
6. Las limitaciones de Whisper: funciones que no incorpora de forma nativa
Whisper no incorpora de forma nativa la diarización de hablantes (Speaker Diarization).
Es decir, no puede identificar automáticamente quién dijo qué. Esta es precisamente una de las funciones principales de muchos servicios comerciales de transcripción, como Otter.ai.
Si necesitas diarización, tendrás que combinar Whisper con otras herramientas, como pyannote-audio, o recurrir a una API comercial que incluya esta capacidad.
3. Whisper en 2026: el cambio estratégico de OpenAI
El 7 de mayo de 2026, OpenAI presentó tres nuevos modelos de voz en tiempo real, entre ellos GPT-Realtime-Whisper.
GPT-Realtime-Whisper es un sistema de voz a texto mediante streaming diseñado específicamente para ofrecer transcripción de baja latencia. Puede generar texto mientras la persona está hablando, lo que permite utilizarlo para subtítulos en tiempo real, actas de reuniones y actualizaciones de flujos de trabajo.
Su precio es de 0,017 dólares por minuto.
Como referencia, la antigua API de Whisper (whisper-1) tiene un precio de 0,006 dólares por minuto.
¿Qué significa este cambio estratégico?
- OpenAI ha ampliado la marca Whisper desde un modelo open source hacia servicios comerciales de transcripción en tiempo real.
- El Whisper de código abierto no ha recibido ninguna actualización importante desde 2023; las versiones open source más recientes siguen siendo Large v3 / v3 Turbo.
- El foco de OpenAI se ha desplazado hacia servicios de voz comerciales ofrecidos mediante Realtime API.
- La comunidad open source continúa manteniendo activamente el ecosistema de Whisper: faster-whisper, whisper.cpp, exportaciones ONNX y otras herramientas siguen evolucionando.
4. Opiniones reales de los usuarios: una valoración abrumadoramente positiva
Nota: El siguiente resumen se basa en conversaciones públicas de usuarios en XDA Developers, MakeUseOf, Reddit y otras comunidades.
Lo que gusta 👍
- “Whisper es una herramienta fantástica para transcribir cualquier audio gratis en tu propio equipo, y además tiene una precisión muy alta” — evaluación de XDA Developers.
- “Código abierto y privacidad como prioridad”: HappyScribe considera Whisper especialmente adecuado para desarrolladores y usuarios preocupados por la privacidad.
- “MacWhisper procesó una entrevista de 46 minutos mucho más rápido de lo que esperaba” — experiencia compartida por un usuario de MakeUseOf.
- “He notado una mejora significativa en la precisión al utilizar Whisper para transcribir”.
- “Los modelos WhisperKit son una de las mejores cosas que han ocurrido en los últimos años en el ámbito de la transcripción de voz”.
- “Preciso, resistente al ruido y a los acentos, compatible con decenas de idiomas y gratuito en tu propio hardware” — AIToolsRecap le otorgó una puntuación de 5/5.
Lo que disgusta 👎
- “El Whisper que funciona en el navegador utiliza un modelo pequeño, aproximadamente de nivel base, no la versión completa” — algunos usuarios señalan que las implementaciones locales ligeras pueden ofrecer una precisión inferior.
- “No incorpora diarización de hablantes de forma nativa” — es necesario utilizar herramientas adicionales o una API.
- “La versión open source ha dejado de avanzar” — no ha habido una actualización oficial importante desde 2023.
- “El soporte de algunos idiomas no es tan fiable como el inglés” — la precisión varía según la cantidad de datos de entrenamiento disponibles para cada idioma.
En conjunto
Las opiniones sobre Whisper muestran un patrón de “valoración abrumadoramente positiva, pero con expectativas que deben gestionarse correctamente”.
Los usuarios valoran especialmente su libertad como software open source, privacidad y precisión, y lo consideran una alternativa gratuita a muchos servicios comerciales de transcripción.
La contradicción principal es clara: la versión open source de Whisper sigue siendo una de las mejores soluciones gratuitas de reconocimiento de voz, pero OpenAI ha desplazado su atención hacia los servicios comerciales, por lo que el futuro de las actualizaciones del proyecto open source es incierto.
5. Whisper frente a sus competidores
| Producto | Precio | Open source | Ejecución local | Idiomas | Diarización | Streaming en tiempo real | Ideal para |
|---|---|---|---|---|---|---|---|
| Whisper (open source) | Gratis | ✅ MIT | ✅ | 99 | ❌ | ❌ | Desarrolladores centrados en la privacidad |
| GPT-Realtime-Whisper | $0,017/min | ❌ | ❌ | Multilingüe | ❌ | ✅ | Desarrolladores que necesitan transcripción en tiempo real |
| Otter.ai | $10-20/mes | ❌ | ❌ | Limitados | ✅ | ✅ | Actas de reuniones empresariales |
| Gemini 3.5 Transcribe | Pago por uso | ❌ | ❌ | 85+ | ✅ | ✅ | Usuarios del ecosistema de Google |
| Speechmatics | Pago por uso | ❌ | ✅ (despliegue local) | Multilingüe | ✅ | ✅ | ASR empresarial |
Conclusiones clave:
- Whisper open source es uno de los pocos modelos ASR principales que combina uso gratuito y ejecución local, sin depender de un servicio cloud.
- GPT-Realtime-Whisper es la versión comercial de OpenAI orientada a la transcripción en tiempo real, principalmente para desarrolladores y productos.
- La principal ventaja de servicios comerciales como Otter y Fireflies es la diarización y la integración con flujos de trabajo de reuniones, precisamente una de las debilidades de Whisper.
- Gemini 3.5 Transcribe es un competidor reciente de 2026 que plantea la transcripción como una tarea que también puede beneficiarse del razonamiento, pero Whisper sigue destacando por sus resultados históricos en benchmarks como LibriSpeech.
6. Ventajas y desventajas
✅ Ventajas
- Completamente open source (licencia MIT): permite utilizar, modificar y emplear el modelo comercialmente.
- Ejecución local + privacidad: los datos pueden permanecer en el dispositivo sin depender de servicios cloud.
- Precisión líder: 2,1 % WER en LibriSpeech, un referente para ASR open source.
- 99 idiomas: una cobertura lingüística superior a la de muchas alternativas.
- Múltiples tamaños de modelo: desde tiny hasta large para diferentes configuraciones de hardware.
- Ecosistema enorme: faster-whisper, whisper.cpp, ONNX y otras herramientas forman una cadena tecnológica madura.
- Completamente gratuito: sin suscripción ni facturación por uso.
- Amplia validación por parte de la comunidad: ha sido reproducido y probado durante años.
❌ Desventajas
- Sin diarización nativa: no identifica automáticamente quién está hablando.
- Actualizaciones open source estancadas: no ha recibido una actualización oficial importante desde 2023.
- OpenAI ha desplazado su foco hacia la comercialización: GPT-Realtime-Whisper representa la nueva dirección estratégica.
- El streaming en tiempo real requiere herramientas adicionales o servicios comerciales: la versión open source no ofrece esta función de forma nativa.
- El rendimiento varía según el idioma: algunos idiomas ofrecen resultados menos fiables que el inglés.
- La ejecución local requiere ciertos conocimientos técnicos: los usuarios no técnicos suelen necesitar interfaces gráficas como MacWhisper.
7. ¿Quién debería utilizar Whisper?
✅ Recomendado para
- Desarrolladores preocupados por la privacidad: no quieren subir grabaciones sensibles a la nube.
- Investigadores y académicos: necesitan una herramienta de transcripción reproducible y auditable.
- Podcasters y creadores de contenido: pueden transcribir entrevistas sin pagar una suscripción.
- Usuarios con presupuesto limitado: una alternativa completamente gratuita frente a servicios comerciales que pueden costar hasta 200 dólares al año.
- Usuarios interesados en el software open source: la licencia MIT permite modificar y desplegar libremente el modelo.
- Usuarios que necesitan trabajar sin conexión: puede ejecutarse completamente offline.
❌ No recomendado para
- Usuarios que necesitan diarización: Whisper no la incorpora de forma nativa y requiere herramientas adicionales.
- Usuarios que necesitan transcripción en streaming en tiempo real: la versión open source no está diseñada para ello.
- Usuarios sin conocimientos técnicos: el despliegue local puede requerir cierta experiencia, aunque existen interfaces gráficas.
- Equipos que buscan un flujo de trabajo de reuniones listo para usar: herramientas comerciales como Otter pueden resultar más adecuadas.
- Empresas que necesitan SLA y soporte empresarial: el proyecto open source no proporciona soporte oficial de nivel empresarial.
8. Puntuación final (sobre 5)
| Dimensión | Puntuación | Evaluación |
|---|---|---|
| Precisión | 5,0/5 | 2,1 % WER, un referente del ASR open source |
| Open source / libertad | 5,0/5 | Licencia MIT y gran libertad de uso |
| Privacidad | 5,0/5 | Ejecución local, con los datos permaneciendo en el dispositivo |
| Cobertura lingüística | 4,5/5 | 99 idiomas y una cobertura muy amplia |
| Completitud de funciones | 3,5/5 | Carece de diarización nativa y streaming en tiempo real |
| Actividad de desarrollo | 2,5/5 | Sin una actualización open source importante desde 2023 |
Puntuación global: 4,5/5
(Basada en su posicionamiento como herramienta de reconocimiento de voz open source: su precisión y libertad de uso están entre las mejores del sector, y su capacidad para ejecutarse localmente ofrece una protección de privacidad difícil de igualar. Sin embargo, la ausencia de diarización nativa y de nuevas actualizaciones oficiales son sus principales debilidades. Para usuarios con conocimientos técnicos y preocupados por la privacidad, la puntuación puede llegar a 4,8/5; para empresas que necesitan diarización y transcripción en tiempo real, podría quedarse en 3,0/5.)
9. Conclusión final: ¿Merece la pena?
La respuesta es: casi con toda seguridad, sí, si eres un usuario con conocimientos técnicos y preocupado por la privacidad.
Whisper sigue siendo en 2026 uno de los referentes indiscutibles del reconocimiento de voz open source. Un WER del 2,1 %, compatibilidad con 99 idiomas, licencia MIT y ejecución local offline hacen que siga estando muy por delante de muchas alternativas gratuitas en sus capacidades fundamentales.
Un usuario sustituyó un servicio comercial de transcripción de 200 dólares al año por Whisper y descubrió que “los resultados fueron mucho más impresionantes de lo esperado”. Otro usuario lo resumió de forma sencilla: “Whisper es una herramienta fantástica para transcribir cualquier audio gratis en tu propio equipo, y además tiene una precisión muy alta”.
Sin embargo, Whisper se encuentra en 2026 en un punto de inflexión.
OpenAI ha desplazado su foco hacia el GPT-Realtime-Whisper comercial. El Whisper open source no ha recibido ninguna actualización importante desde 2023. Además, la diarización de hablantes y la transcripción en streaming en tiempo real siguen requiriendo herramientas adicionales o servicios comerciales.
Para los usuarios que necesitan estas funciones, Whisper puede quedarse corto.
Whisper merece la pena si:
- Te preocupa la privacidad y no quieres subir tus grabaciones a la nube.
- Tienes conocimientos técnicos y puedes trabajar con la línea de comandos o utilizar herramientas gráficas como MacWhisper.
- Tu prioridad es la transcripción, no la diarización de hablantes.
- Tienes un presupuesto limitado y quieres una solución completamente gratuita.
- Necesitas soporte para 99 idiomas, incluido el español.
Conviene buscar otra opción si:
- Necesitas diarización de hablantes: Otter.ai o Speechmatics pueden ser más adecuados.
- Necesitas transcripción en streaming en tiempo real: GPT-Realtime-Whisper u otras soluciones comerciales pueden encajar mejor.
- No eres un usuario técnico y quieres evitar configuraciones locales.
- Necesitas SLA y soporte empresarial: una solución open source por sí sola no ofrece ese nivel de servicio.
En una frase: Whisper está pensado para “desarrolladores y usuarios particulares preocupados por la privacidad, con conocimientos técnicos y que necesitan transcripción de alta calidad de forma gratuita”. Su precisión y libertad como software open source siguen siendo difíciles de igualar en 2026, pero la ausencia de diarización y de nuevas actualizaciones oficiales hace que resulte mucho más adecuado para usuarios técnicos que para empresas.
Si eres desarrollador o das prioridad a la privacidad, Whisper sigue siendo una de las opciones más difíciles de sustituir; si necesitas diarización o transcripción en tiempo real, conviene considerar GPT-Realtime-Whisper u otras alternativas comerciales.
10. Preguntas frecuentes (FAQ)
¿Whisper es gratis?
La versión open source es completamente gratuita bajo la licencia MIT y puede ejecutarse localmente sin pagar por cada transcripción. OpenAI también ofrece Whisper mediante API (whisper-1), con un precio de $0,006 por minuto.
¿Whisper admite español?
Sí. Whisper admite 99 idiomas, incluido el español. La precisión varía según la cantidad de datos de entrenamiento disponibles para cada idioma, pero el español, como uno de los principales idiomas europeos, ofrece un rendimiento fiable.
¿Cuál es la diferencia entre Whisper y GPT-Realtime-Whisper?
Whisper open source es un modelo de transcripción que puede ejecutarse localmente y offline de forma gratuita, pero no está diseñado para streaming en tiempo real. GPT-Realtime-Whisper es el servicio comercial de transcripción en tiempo real presentado por OpenAI en mayo de 2026, con soporte para streaming y un precio de $0,017 por minuto.
¿Whisper admite diarización de hablantes?
No de forma nativa. Para identificar quién dijo qué, necesitas combinar Whisper con herramientas adicionales como pyannote-audio o utilizar una API comercial que incluya esta función.
¿Whisper puede ejecutarse localmente?
Sí. Whisper es un modelo open source que puede ejecutarse completamente offline en un equipo local. Requiere ciertos conocimientos técnicos, como Python y línea de comandos, aunque también puedes utilizar interfaces gráficas como MacWhisper o Buzz.
¿Qué precisión tiene Whisper?
Muy alta. Whisper Large v3 Turbo alcanza una tasa de error de palabras (WER) de solo 2,1 % en LibriSpeech test-clean y 4,2 % en test-other. Sigue siendo uno de los modelos líderes dentro del ecosistema de ASR open source.
Lo que hace Whisper
- Código abierto completo con licencia MIT
- Ejecución local y offline sin depender de la nube
- Soporte para 99 idiomas, con transcripción y traducción
- Precisión líder: 2,1% WER en LibriSpeech test-clean
- Varios tamaños de modelo (tiny a large)
- Ecosistema maduro: faster-whisper, whisper.cpp, exportaciones ONNX
- Completamente gratuito, sin suscripción