Gemma 4: ¿merece la pena ejecutarlo en local?
Gemma 4 ofrece modelos abiertos con licencia Apache 2.0 y opciones para todo tipo de hardware, desde Raspberry Pi hasta GPU profesionales. Analizamos sus variantes, requisitos de memoria, rendimiento real y despliegue local, con especial atención al 26B A4B como opción ideal para GPU de 24 GB.
Herramientas relacionadas
Gemma 4 es una familia de modelos de lenguaje de código abierto desarrollada por Google DeepMind y lanzada en abril de 2026. Frente a la generación anterior, Gemma 3, supone una actualización importante en tres frentes: arquitectura, capacidades y licencia. Toda la familia utiliza la licencia Apache 2.0, sin límites de usuarios activos mensuales, restricciones de uso ni limitaciones para aplicaciones comerciales.
Gemma 4 está disponible en cuatro variantes:
| Modelo | Parámetros activos | Parámetros totales | Contexto | Modalidades |
|---|---|---|---|---|
| E2B | 2,3B | 5,1B | 128K | Texto, imagen, audio |
| E4B | 4,5B | 8B | 128K | Texto, imagen, audio |
| 26B A4B (MoE) | 3,8B | 25,2B | 256K | Texto, imagen, vídeo |
| 31B Dense | 30,7B | 30,7B | 256K | Texto, imagen, vídeo |
E2B y E4B utilizan la tecnología de embeddings por capas (PLE). Esto permite que un modelo con 2,3B de parámetros efectivos alcance una profundidad de representación equivalente a un modelo de 5,1B parámetros.
El 26B A4B utiliza una arquitectura MoE (Mixture of Experts) con 128 expertos. En cada token se activan 8 expertos enrutados más 1 experto compartido, por lo que cada pasada hacia adelante solo activa 3,8B parámetros.
El 31B es un modelo completamente denso que prioriza el máximo rendimiento bruto.
¿Para qué sirve Gemma 4? Su principal ventaja es cubrir prácticamente todo el espectro de dispositivos, desde una Raspberry Pi hasta una estación de trabajo. E2B y E4B están pensados principalmente para ejecución en el dispositivo: pueden funcionar offline en teléfonos, portátiles e incluso Raspberry Pi. Los modelos 26B y 31B están orientados a estaciones de trabajo y servidores, y son especialmente adecuados para razonamiento avanzado, flujos de trabajo con Agent, generación de código y procesamiento de documentos largos.
¿Por qué merece la pena ejecutarlo localmente?
La razón más directa: una licencia realmente abierta. Gemma 4 es la primera familia de grandes modelos de Google distribuida bajo la licencia Apache 2.0. Los desarrolladores pueden modificarla, redistribuirla y utilizarla comercialmente sin límites de usuarios activos mensuales. Para los equipos que necesitan integrar un modelo en un producto comercial, esto elimina una de las principales barreras legales.
El salto de rendimiento es considerable. Frente a Gemma 3 27B, Gemma 4 31B consigue mejoras muy importantes en varios benchmarks:
| Benchmark | Gemma 3 27B | Gemma 4 31B |
|---|---|---|
| AIME 2026 (razonamiento matemático) | 20,8 % | 89,2 % |
| LiveCodeBench v6 (programación) | 29,1 % | 80,0 % |
| GPQA Diamond (razonamiento científico) | 42,4 % | 84,3 % |
| MMLU Pro | — | 85,2 % |
El modelo 31B ocupa el tercer puesto entre los modelos de código abierto a nivel mundial en el ranking de texto de Arena AI. El 26B A4B ocupa el sexto puesto.
Con cuantización de 2 bits, E2B necesita menos de 1,5 GB de memoria, por lo que puede ejecutarse en una Raspberry Pi 5.
El 26B A4B es el punto dulce para el despliegue local. En las conversaciones de la comunidad, el 26B A4B aparece repetidamente como una de las mejores opciones para ejecutar Gemma 4 localmente. Tiene 26B de parámetros totales, pero solo activa 3,8B durante cada inferencia. En la práctica, esto permite obtener una calidad cercana a la de un modelo de 26B con un coste computacional parecido al de un modelo de 4B.
La evaluación de Hardware Corner lo resume claramente: «una GPU de 24 GB puede ejecutar el contexto completo de 256K», convirtiéndolo en uno de los lanzamientos MoE más prácticos disponibles actualmente.
Pero también existen limitaciones claras. Un desarrollador probó el 26B A4B en un M4 Max de 128 GB conectado a Claude Code y descubrió que el prompt de sistema de Claude Code ocupa más de 29.000 tokens, mientras que LM Studio utiliza por defecto un contexto de solo 4.096 tokens. Es necesario aumentar manualmente la ventana hasta 256K para que funcione correctamente, pero incluso así el rendimiento no resulta especialmente fluido en escenarios de Agent exigentes.
Otro usuario señaló que, aunque E4B es entre un 30 y un 40 % más rápido que Gemini API, Gemini Pro sigue ofreciendo mayor precisión en tareas creativas que requieren una comprensión profunda del contexto.
¿Quién debería considerar el despliegue local?
Desarrolladores que necesitan integrar el modelo en productos comerciales (Apache 2.0 reduce considerablemente las restricciones legales)
Usuarios que ya tienen una GPU con 24 GB de VRAM (26B A4B es el punto dulce)
Personas que utilizan Agent o generación de código con mucha frecuencia y quieren reducir el gasto en API
Usuarios con requisitos estrictos de privacidad
Quienes necesitan ejecutar el modelo offline en dispositivos como teléfonos, portátiles o Raspberry Pi
¿Quién probablemente no debería complicarse?
Usuarios con menos de 8 GB de VRAM: E4B en 4 bits necesita 9,6 GB
Personas que solo utilizan el modelo ocasionalmente: una API en la nube resulta más cómoda
Usuarios que necesitan un contexto completo de 256K pero solo disponen de una GPU de menos de 24 GB: el 26B A4B necesita unos 23 GB de VRAM con 256K
Resumen de las opciones de despliegue
Gemma 4 ya cuenta con un amplio soporte por parte de las principales herramientas de despliegue.
Ollama (la opción más recomendable para usuarios normales): la versión estable de Ollama admite las cuatro variantes. Basta con ejecutar un comando.
llama.cpp + Unsloth GGUF (recomendado para desarrolladores): Unsloth proporciona archivos GGUF cuantizados para los diferentes modelos.
LM Studio (recomendado para usuarios de Mac): ofrece una interfaz gráfica, aceleración Metal integrada y una API compatible con OpenAI.
Primera prueba después del despliegue: introduce «Hola, preséntate brevemente». Si el modelo responde correctamente, el despliegue se ha realizado con éxito.
Requisitos de hardware
Los requisitos de Gemma 4 varían enormemente según el modelo: desde menos de 1,5 GB de memoria en una Raspberry Pi hasta 80 GB de VRAM en una H100.
| Modelo | Cuantización | VRAM necesaria | Dispositivo recomendado |
|---|---|---|---|
| E2B | 4 bits | 7,2 GB | Teléfono, Raspberry Pi, Jetson |
| E2B | 2 bits | < 1,5 GB | Raspberry Pi 5 |
| E4B | 4 bits | 9,6 GB | Portátil, GPU de consumo |
| E4B | BF16 | 16 GB | Estación de trabajo |
| 26B A4B | 4 bits | ~18-23 GB | GPU de 24 GB |
| 26B A4B | BF16 | 52 GB | GPU profesional |
| 31B Dense | 4 bits | ~20 GB | GPU de 24 GB o más |
| 31B Dense | BF16 | 62 GB | H100 de 80 GB |
Necesidades de VRAM del 26B A4B en 4 bits según el contexto:
| Contexto | VRAM |
|---|---|
| 4K - 32K | ~18 GB |
| 128K | 20 GB |
| 256K | 23 GB |
Conclusión clave: las GPU con 24 GB de VRAM, como RTX 3090, 4090 y 5090, pueden ejecutar el 26B A4B con el contexto completo de 256K. E4B en 4 bits solo necesita 9,6 GB, por lo que puede funcionar en la mayoría de las GPU de consumo.
Rendimiento real según la configuración
RTX 5090 — gama alta de consumo
Al ejecutar 26B A4B en una RTX 5090 mediante cuantización AWQ + vLLM + DFlash, la comunidad de Reddit ha informado de velocidades de aproximadamente 600 tokens/s.
Los datos más detallados de Hardware Corner utilizando llama.cpp son:
| Contexto | Prefill (t/s) | Decode (t/s) |
|---|---|---|
| 4K | 8.799 | 180 |
| 32K | 6.292 | 159 |
| 128K | 2.839 | 130 |
| 256K | 1.707 | 106 |
Experiencia real: 106-180 tok/s significa que generar 500 caracteres requiere aproximadamente 2-3 segundos, ofreciendo una experiencia extremadamente fluida. Incluso con un contexto de 256K, la velocidad sigue siendo perfectamente utilizable.
RTX 3090 / 4090 — configuración principal
Esta es probablemente la configuración que más interesa a los usuarios. En una única RTX 3090, ejecutando 26B A4B Q4_K_XL GGUF mediante llama.cpp, las pruebas muestran:
| Escenario | Velocidad |
|---|---|
| Generación narrativa | 131 tok/s |
| Generación de código | 129 tok/s |
| Explicaciones técnicas | 129 tok/s |
El consumo de VRAM es de 22,8 GB, con 262K de contexto completo. La utilización de la GPU alcanza el 95 %.
Datos más detallados de Hardware Corner en RTX 3090:
| Contexto | Prefill (t/s) | Decode (t/s) |
|---|---|---|
| 4K | 3.625 | 119 |
| 32K | 2.453 | 107 |
| 128K | 1.147 | 82 |
| 256K | 671 | 64 |
Experiencia real: 64-119 tok/s significa que generar 500 caracteres requiere aproximadamente 4-8 segundos. La experiencia es completamente fluida.
Los 24 GB de VRAM encajan prácticamente a la perfección con las necesidades del 26B A4B, que es precisamente la razón por la que la comunidad considera este modelo uno de los lanzamientos MoE más prácticos para uso local.
En una RTX 4090, utilizando vLLM con speculative decoding mediante MTP, un prompt híbrido típico alcanza aproximadamente 50 tok/s, con picos de hasta 69,7 tok/s.
RTX 4080 Super — gama media-alta
Un usuario probó Gemma 4 12B, con un requisito de 16 GB de VRAM, en una RTX 4080 Super y lo utilizó junto con Pi Agent como asistente de programación local.
La experiencia fue fluida y adecuada para tareas de desarrollo cotidianas.
M4 Max 128 GB — Mac
Un desarrollador probó 26B A4B Q4_K_M (17,99 GB) en un Mac Studio con M4 Max y 128 GB de memoria unificada:
Framework de inferencia: LM Studio 0.4.9, aceleración Metal, descarga de las 30/30 capas a la GPU
Rendimiento: conversaciones cortas fluidas, pero retrasos evidentes con contextos largos
Limitación principal: el prompt de sistema de Claude Code ocupa más de 29.000 tokens, por lo que es necesario aumentar manualmente el contexto hasta 256K
Experiencia real: las conversaciones normales y la generación de código son perfectamente utilizables, pero el rendimiento no resulta suficientemente fluido en escenarios de Agent pesados con más de 29K tokens.
DGX Spark — estación de trabajo para desarrolladores
Un desarrollador desplegó los cuatro modelos de Gemma 4 para realizar pruebas. La versión BF16 del modelo 31B tarda aproximadamente 1,97 segundos en cargarse.
Raspberry Pi 5 — ejecución extrema en el dispositivo
Con cuantización de 2 bits, E2B utiliza menos de 1,5 GB de memoria. Google verificó oficialmente este consumo en una Raspberry Pi 5 con 8 GB de RAM.
La velocidad de prefill alcanza 133 tokens/s, mientras que la velocidad de decode es de 7,6 tokens/s.
Experiencia real: 7,6 tok/s significa que hay que esperar cada respuesta, pero el modelo realmente funciona en una Raspberry Pi. Es una demostración extrema de las capacidades de Gemma 4 para ejecutarse directamente en el dispositivo.
Resumen del rendimiento real
| Aspecto | Configuración básica (E4B / 8-12 GB VRAM) | Configuración principal (26B A4B / 24 GB VRAM) | Gama alta (31B / varias GPU o GPU profesional) |
|---|---|---|---|
| ¿Puede ejecutarlo? | ✅ 4 bits | ✅ Contexto completo de 256K | ✅ Puede ejecutar BF16 |
| Velocidad | Depende del hardware | ~64-180 tok/s | Cercana a 26B |
| VRAM necesaria | 9,6 GB (4 bits) | 18-23 GB | 20 GB+ (4 bits) |
| Tiempo para generar 500 caracteres | Depende del hardware | ~3-8 s | ~3-5 s |
| Experiencia real | Utilizable | Fluida | Fluida |
| Recomendación | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
¿Merece la pena actualizar el hardware?
Si ya tienes una RTX 3090 / 4090 / 5090 con 24 GB de VRAM: no necesitas actualizarla. El 26B A4B parece prácticamente diseñado para este segmento: necesita unos 23 GB de VRAM con un contexto de 256K, por lo que encaja justo en los 24 GB.
Es una de las experiencias de MoE más prácticas que se pueden conseguir actualmente con hardware de consumo.
Si tienes entre 8 y 12 GB de VRAM: E4B en 4 bits solo necesita 9,6 GB y puede funcionar de forma fluida. Es una de las mejores opciones para iniciarse en los modelos multimodales locales.
Si estás pensando en comprar una GPU nueva: una RTX 3090 de segunda mano, con un precio aproximado de 600-800 dólares, ofrece actualmente una de las mejores relaciones calidad-precio. Sus 24 GB de VRAM son suficientes para ejecutar el 26B A4B con el contexto completo, con velocidades de 64-131 tok/s.
No es necesario comprar una RTX 5090 específicamente para Gemma 4, salvo que también quieras ejecutar otros modelos de mayor tamaño.
Pasar de una API online al despliegue local: si tu gasto mensual en API es elevado y ya tienes una GPU de 24 GB, ejecutar localmente el 26B A4B puede amortizarse en pocos meses. E4B también puede ser entre un 30 y un 40 % más rápido que Gemini API en tareas estructuradas y, además, no tiene coste por uso local.
FAQ
¿Cuánta VRAM necesita Gemma 4 como mínimo?
E2B en 4 bits necesita 7,2 GB, mientras que E2B en 2 bits puede funcionar con menos de 1,5 GB.
¿Qué experiencia puedo esperar con 8 GB / 12 GB / 16 GB / 24 GB de VRAM?
8 GB: E2B en 4 bits (7,2 GB), adecuado para tareas ligeras en el dispositivo
12 GB: E4B en 4 bits (9,6 GB), una buena opción para portátiles
16 GB: E4B en BF16 (16 GB), con mayor calidad
24 GB: 26B A4B con contexto completo de 256K (23 GB) — la configuración ideal
¿Puede funcionar con CPU?
Sí, pero la velocidad disminuye considerablemente. E2B en 2 bits alcanza aproximadamente 7,6 tok/s de decode en una Raspberry Pi 5.
¿Qué velocidad real alcanza el 26B A4B?
En una RTX 3090, aproximadamente 64-131 tok/s. En una RTX 5090, aproximadamente 106-180 tok/s.
¿Cuánta RAM del sistema necesito?
Además de la VRAM, se recomienda disponer de al menos 32 GB de RAM del sistema, ya que los modelos 26B y 31B necesitan memoria adicional durante la ejecución.
¿Cuál es la diferencia entre 4 bits y BF16?
La cuantización de 4 bits reduce considerablemente los requisitos de VRAM: en el 26B, pasa de unos 52 GB a aproximadamente 18-23 GB. La pérdida de calidad es relativamente pequeña. BF16 ofrece la máxima calidad, pero requiere una GPU de nivel profesional.
¿Cuál es la diferencia entre el despliegue local y una API en la nube?
El despliegue local no tiene coste por uso, mantiene los datos en el dispositivo, permite trabajar offline y la licencia Apache 2.0 permite aplicaciones comerciales. Las API en la nube no requieren hardware potente, pero cobran según el consumo y pueden plantear cuestiones relacionadas con la privacidad de los datos.
¿Merece la pena comprar una GPU nueva específicamente para Gemma 4?
Si ya tienes una GPU de 24 GB, merece la pena probarlo: el 26B A4B es actualmente uno de los modelos MoE más prácticos para ejecutar localmente.
Si vas a comprar una GPU específicamente para este modelo, una RTX 3090 de segunda mano ofrece probablemente la mejor relación calidad-precio. Si solo lo utilizas ocasionalmente, es mejor empezar con una API en la nube.