NovedadIA
G

Gemma 4

Codigo abiertoValoracion editorial 3.9/5Modelos de IA

Familia de modelos abiertos de Google DeepMind lanzada en junio de 2026 con multimodalidad nativa (texto, imagen, audio y vídeo). Ofrece un precio extremadamente bajo desde $0,06-0,10 por millón de tokens, licencia Apache 2.0, ventana de contexto de 256K, soporte para más de 140 idiomas y la posibilidad de ejecutarse localmente en un portátil con 16 GB. Su mayor debilidad es la programación y las capacidades Agent.

Herramientas relacionadas

Gemma es una familia de modelos ligeros y abiertos desarrollada por Google DeepMind, diseñada para complementar los modelos propietarios Gemini. Gemma 3 se lanzó en marzo de 2025 con cuatro tamaños —1B, 4B, 12B y 27B— y soporte para más de 140 idiomas. En aquel momento se presentó como una de las familias de modelos más potentes capaces de ejecutarse en una sola GPU. Hasta agosto de 2026, la familia Gemma acumula más de 1.000 millones de descargas.

Gemma 4, lanzado en junio de 2026, representa la tercera generación de la familia Gemma. Sus principales cambios son:

CaracterísticaGemma 3Gemma 4
Arquitectura multimodalCodificador visual independiente (~550M) + codificador de audio (~300M)Diseño sin codificadores, módulo de embeddings de ~35M para procesar directamente las entradas
Modalidades de entradaTexto + imagenTexto + imagen + audio + vídeo
Ventana de contexto128K256K
LicenciaPermite uso comercialApache 2.0
Fine-tuningEstándarUn único LoRA puede ajustarse para todas las modalidades

Gemma 4 12B es el modelo que más atención está recibiendo dentro de la familia: un modelo denso de 12.000 millones de parámetros —no MoE— que, una vez cuantizado, ocupa solo 6-7 GB y puede ejecutarse en un portátil con 16 GB. Está disponible tanto en una versión con razonamiento como en una versión sin razonamiento.

Gemma 4 26B A4B es la variante MoE: cuenta con 26.000 millones de parámetros totales, pero solo activa 4.000 millones en cada paso. Su precio es de apenas $0,06 por millón de tokens de entrada y $0,33 por millón de tokens de salida, aproximadamente un 96 % menos que Gemini 3.6 Flash. Su latencia mediana es de solo 2000 ms, un 48 % inferior a la de Gemini 3.6 Flash.

Gemma 3 27B: aunque ya ha sido sustituido por Gemma 4, sigue ofreciendo acceso a su API de forma completamente gratuita en algunas plataformas. Para desarrolladores con presupuesto cero, continúa siendo una opción de entrada especialmente atractiva.

三、Capacidades principales

Capacidades multimodales: el mayor atractivo de Gemma 4

Gemma 4 12B es el primer modelo abierto de tamaño medio de Google DeepMind con multimodalidad nativa. En lugar de utilizar los codificadores visuales y de audio independientes habituales en los modelos multimodales, utiliza un módulo de embeddings de aproximadamente 35 millones de parámetros para procesar imágenes y divide el audio original de 16 kHz en fragmentos de 40 milisegundos que se introducen directamente en la red principal.

¿Qué significa esto en la práctica?

  • Un único conjunto de pesos procesa texto, imágenes, audio y vídeo a 1 fps.
  • Un único LoRA permite realizar fine-tuning en todas las modalidades.
  • Tras la cuantización, ocupa solo 6-7 GB y puede ejecutarse en un portátil.

Para desarrolladores que necesitan procesar datos multimodales con un presupuesto limitado, Gemma 4 es actualmente uno de los modelos multimodales abiertos con mejor relación calidad-precio.

Capacidades multilingües

Gemma 3 admite más de 140 idiomas, entre ellos español, inglés y chino. En los rankings de capacidad en español, Gemma 3 27B se sitúa entre los modelos destacados. Google también desarrolló la familia de modelos de traducción TranslateGemma sobre la base de Gemma 3, con cobertura de 55 idiomas.

¿Qué significa esto en la práctica? Para aplicaciones dirigidas al mercado hispanohablante —España y los distintos países de Latinoamérica—, Gemma es una opción especialmente interesante y optimizada por Google para escenarios multilingües.

Capacidad de razonamiento

Gemma 4 12B en su versión de razonamiento obtiene 22 puntos en el Artificial Analysis Intelligence Index, muy por encima de la mediana de 9 entre modelos comparables. Gemma 3 27B alcanza un 89,0 % en MATH.

Sin embargo, las capacidades de razonamiento de Gemma 3 12B son más limitadas: obtiene solo un 59,5 % en MMLU Pro y un 34,9 % en GPQA Diamond.

¿Qué significa esto en la práctica? La versión de razonamiento de Gemma 4 12B es suficientemente capaz para tareas de complejidad media, pero todavía existe una diferencia clara frente a modelos insignia como GPT-5.5 o Claude Opus 4.8.

Programación: su mayor debilidad

Este es el punto más débil de la familia Gemma.

Gemma 3 12B obtiene solo 13,7 % en LiveCodeBench y ocupa el puesto 184 entre 198 modelos en programación. Gemma 3 27B obtiene apenas 16 puntos en benchmarks de programación, frente al 66,4 % de Claude Sonnet 4.6. En SWE-bench Verified, Gemma 3 27B alcanza solo el 16 %, mientras que Claude Sonnet 4.6 llega al 79,6 %.

Gemma 4 12B obtiene 6,3 puntos en el Coding Index de Artificial Analysis, por lo que continúa en una posición relativamente baja.

¿Qué significa esto en la práctica? Si necesitas IA para ayudarte a programar, Gemma no debería ser tu primera opción. Para programación, es mejor considerar GLM 5.2, DeepSeek-V4-Pro o Claude Opus 4.8.

Capacidades Agent: también limitadas

Gemma 3 12B obtiene solo 5,8 puntos en Agentic Index y ocupa el puesto 129 entre 180 modelos. En TerminalBench Hard obtiene apenas un 0,8 %.

¿Qué significa esto en la práctica? Gemma no es una buena opción para construir agentes capaces de ejecutar tareas complejas de forma autónoma. Para desarrollo de agentes, es preferible utilizar GLM 5.2 o DeepSeek-V4-Pro.

Velocidad

ModeloVelocidad
Gemma 4 12B (razonamiento)113 tokens/s
Gemma 4 12B (sin razonamiento)116 tokens/s
Gemma 3 27B31 tokens/s
Gemma 4 26B A4B37 tokens/s

¿Qué significa esto en la práctica? La velocidad de Gemma 4 12B se encuentra en un nivel intermedio: es más rápido que Claude Opus 4.8, con 60,9 tokens/s, pero está muy por debajo de Gemini 3.6 Flash, que alcanza 1262 tokens/s.

四、¿Cómo interpretar los benchmarks?

Los benchmarks de la familia Gemma deben analizarse modelo por modelo y tarea por tarea.

Artificial Analysis Intelligence Index (22 puntos para Gemma 4 12B): procede de la evaluación de un tercero independiente, Artificial Analysis. Sus 22 puntos superan ampliamente la mediana de 9. Esto indica que Gemma 4 12B tiene una capacidad de inteligencia general competitiva dentro de los modelos abiertos de tamaño similar. Sin embargo, la prueba incluye nueve evaluaciones y las tareas de programación y Agent tienen un peso limitado, precisamente las áreas en las que Gemma es más débil.

Benchmark de programación (LiveCodeBench 13,7 %): esta es una señal de alarma para la familia Gemma. En tareas de programación, Gemma 3 12B ocupa el puesto 184 entre 198 modelos. Si la programación es tu tarea principal, puedes descartar Gemma directamente.

SWE-bench Verified (16 % para Gemma 3 27B): frente al 79,6 % de Claude Sonnet 4.6, la diferencia es enorme. Gemma tiene dificultades para resolver tareas reales de ingeniería de software.

Capacidades multilingües: este es uno de los verdaderos puntos fuertes de Gemma. Admite más de 140 idiomas y ofrece un buen rendimiento en español. Para aplicaciones multilingües, Gemma es una opción muy competitiva.

Principio clave: una puntuación alta en un benchmark ≠ el modelo adecuado para todas las tareas. Gemma 4 destaca en inteligencia general y multimodalidad, pero queda claramente por detrás en programación y Agent. Antes de elegir un modelo, determina primero cuál es tu tarea principal.

五、Valor práctico en el uso real

Escenario 1: procesamiento multimodal por lotes — máxima recomendación para Gemma 4

La capacidad multimodal nativa de Gemma 4 12B —texto + imagen + audio + vídeo— combinada con un precio extremadamente bajo, desde $0,10 por millón de tokens de entrada, lo convierte en una de las mejores opciones para procesamiento multimodal a gran escala.

Algunos usos incluyen:

  • Clasificación de imágenes
  • Análisis de fotogramas de vídeo
  • Transcripción de audio
  • Moderación de contenido multimodal

Escenario 2: aplicaciones multilingües — muy recomendable

Con soporte para más de 140 idiomas y un buen rendimiento en español, Gemma resulta especialmente interesante para chatbots de atención al cliente, generación de contenido y herramientas de traducción destinadas al mercado hispanohablante.

La familia TranslateGemma lleva esta especialización un paso más allá al optimizar específicamente la calidad de traducción.

Escenario 3: despliegue local o edge — muy recomendable

Gemma 4 12B ocupa solo 6-7 GB después de la cuantización y se distribuye bajo la licencia Apache 2.0. Puede ejecutarse en un único portátil con 16 GB.

Para empresas y desarrolladores que necesitan proteger sus datos y no quieren depender de una API en la nube, esta característica resulta especialmente atractiva.

Escenario 4: desarrollo de prototipos de bajo coste — recomendable

Gemma 3 27B está disponible completamente gratis en algunas plataformas. Para desarrolladores con presupuesto cero, estudiantes y equipos de startups, puede ser un excelente punto de partida para validar ideas y construir prototipos.

Escenario 5: programación y desarrollo de agentes — no recomendable

LiveCodeBench 13,7 %, SWE-bench 16 % y Agentic Index 5,8: Gemma presenta limitaciones importantes en programación y tareas Agent.

Si necesitas asistencia para programar o quieres construir agentes autónomos, es mejor elegir GLM 5.2, DeepSeek-V4-Pro o Claude Opus 4.8.

六、Precio y relación calidad-precio

Precios consultados en agosto de 2026.

Gemma 4 12B — versión de razonamiento

ConceptoPrecio
Entrada$0,10 / millón de tokens
Salida$0,30 / millón de tokens

Gemma 4 26B A4B — versión MoE

ConceptoPrecio
Entrada$0,06 / millón de tokens
Salida$0,33 / millón de tokens

Gemma 3 — los precios varían considerablemente según la plataforma

Modelo / PlataformaPrecio de entradaPrecio de salida
Gemma 3 27B (algunas plataformas)$0,00$0,00
Gemma 3 12B (general)$0,05$0,15
Gemma 3 27B (Nebius)$0,06$0,20

Comparación con la competencia

ModeloEntrada (/M)Salida (/M)MultimodalAbierto
------:---:------
Gemma 4 12B$0,10$0,30✅ Texto + imagen + audio + vídeo✅ Apache 2.0
Gemma 4 26B A4B$0,06$0,33
GLM 5.2$1,40$4,40❌ Solo texto✅ MIT
DeepSeek-V4-Flash~$0,21~$0,63✅ MIT
Claude Opus 4.8$5,00$25,00✅ Texto + imagen

Conclusión sobre la relación calidad-precio: Gemma 4 ofrece una relación calidad-precio excepcional dentro de los modelos multimodales abiertos. Sin embargo, en programación y Agent, pagar menos no sirve de mucho si el modelo no puede completar correctamente la tarea.

七、Modelo frente a alternativas similares

Gemma 4 12B vs GLM 5.2

DimensiónGemma 4 12BGLM 5.2
Parámetros12B (denso)744B / 40B activos (MoE)
Multimodalidad✅ Texto + imagen + audio + vídeo❌ Solo texto
Contexto256K1M
Precio de entrada$0,10$1,40
ProgramaciónDébil (LiveCodeBench 13,7 %)Fuerte (FrontierSWE 74,4)
Despliegue local✅ 6-7 GB cuantizado❌ Requiere gran capacidad de cómputo
LicenciaApache 2.0MIT

Conclusión: Gemma 4 12B es una de las mejores opciones para multimodalidad y despliegue local; GLM 5.2 es una opción mucho más potente para programación y agentes de larga duración. Los dos modelos están orientados a necesidades completamente diferentes.

Gemma 4 12B vs Gemma 3 27B

DimensiónGemma 4 12BGemma 3 27B
Arquitectura multimodalNativa, sin codificadores independientesCodificadores independientes
Entrada de audio
Contexto256K128K
Velocidad113 tok/s31 tok/s
Precio$0,10/$0,30Gratis en algunas plataformas

Conclusión: Gemma 4 12B supera a Gemma 3 27B en arquitectura, capacidades y velocidad. Sin embargo, si el presupuesto es cero, la disponibilidad gratuita de Gemma 3 27B sigue siendo un argumento importante.

八、Opiniones y comentarios de los usuarios

Las opiniones sobre la familia Gemma están muy divididas, principalmente porque la experiencia depende mucho del uso que se le dé.

Comentarios positivos:

  • Las capacidades multimodales y la facilidad de despliegue local de Gemma 4 12B reciben un amplio reconocimiento entre los desarrolladores.
  • Su precio extremadamente bajo —y el hecho de que algunas versiones sean incluso gratuitas— lo convierte en una opción atractiva para prototipos y procesamiento masivo.
  • Más de 140 idiomas, con un rendimiento especialmente bueno en español.
  • La licencia Apache 2.0 permite a las empresas utilizar y modificar el modelo con gran libertad.
  • Instituciones como NASA incluso han utilizado Gemma en satélites para analizar imágenes orbitales.

Críticas y aspectos a tener en cuenta:

  • La programación débil es la crítica más frecuente.
  • Las capacidades Agent son limitadas, por lo que no resulta adecuado para tareas de automatización complejas.
  • La velocidad de razonamiento relativamente baja puede ser problemática en aplicaciones en tiempo real.
  • Algunos usuarios señalan que Gemma 3 27B tiene una ventana de contexto de solo 32K en determinadas versiones gratuitas, lo que limita el procesamiento de documentos largos.

Importante: Gemma 4 se lanzó en junio de 2026, por lo que todavía se están acumulando evaluaciones independientes a gran escala. Los comentarios anteriores combinan datos de Gemma 3 con los primeros resultados disponibles de Gemma 4.

九、Ventajas y desventajas

Ventajas

  • Multimodalidad nativa (Gemma 4): entrada de texto, imagen, audio y vídeo, con un único conjunto de pesos para todas las modalidades.
  • Precio extremadamente bajo: desde $0,06-0,10 por millón de tokens de entrada.
  • Algunas versiones son gratuitas: Gemma 3 27B está disponible sin coste en determinadas plataformas.
  • Apache 2.0: uso, modificación y explotación comercial permitidos.
  • Despliegue local: solo 6-7 GB después de la cuantización, suficiente para ejecutarse en un portátil.
  • Más de 140 idiomas: buen rendimiento en español.
  • Un único LoRA para fine-tuning multimodal en Gemma 4.

Desventajas

  • Programación muy débil: LiveCodeBench 13,7 %, puesto 184 entre 198 modelos.
  • Capacidades Agent insuficientes: Agentic Index de solo 5,8.
  • Velocidad de inferencia relativamente baja: 113 tokens/s en 12B y solo 31 tokens/s en 27B.
  • Contexto limitado: 256K en Gemma 4 y 128K en Gemma 3, por debajo de algunos competidores con 1M.
  • Salida exclusivamente textual: aunque acepta múltiples modalidades de entrada, solo genera texto.
  • Distancia frente a los modelos insignia: no puede competir con GPT-5.5 o Claude Opus 4.8 en inteligencia general.

十、¿Quién debería elegir Gemma 4?

Muy recomendable

  • Desarrolladores de aplicaciones multimodales: equipos que necesitan procesar imágenes, audio y vídeo con un presupuesto limitado.
  • Desarrolladores de aplicaciones multilingües: chatbots, herramientas de traducción y generación de contenido para el mercado hispanohablante.
  • Empresas que necesitan despliegue local o edge: organizaciones que priorizan la privacidad de los datos y no quieren depender de APIs en la nube.
  • Desarrolladores con presupuesto cero: la versión gratuita de Gemma 3 27B es un excelente punto de partida para prototipos.
  • Procesamiento multimodal por lotes: clasificación de imágenes, análisis de vídeo, transcripción de audio y otras tareas masivas.

Elegir con cautela

  • Usuarios que necesitan asistencia de programación: el 13,7 % de LiveCodeBench no es suficiente para cubrir las necesidades habituales de desarrollo.
  • Usuarios que necesitan construir agentes: un Agentic Index de 5,8 resulta claramente insuficiente.
  • Usuarios que necesitan inferencia extremadamente rápida: 113 tokens/s puede no ser suficiente para determinadas aplicaciones en tiempo real.
  • Usuarios que necesitan contexto ultralargo: 256K está por debajo de algunos competidores con ventanas de 1M.

No recomendable

  • Ingenieros de software profesionales: mejor elegir GLM 5.2 o DeepSeek-V4-Pro.
  • Desarrolladores de agentes: mejor elegir GLM 5.2 o DeepSeek-V4-Pro.
  • Usuarios que necesitan generación de imágenes: Gemma no genera imágenes.
  • Usuarios que buscan la máxima inteligencia general: mejor elegir Claude Opus 4.8 o GPT-5.5.

十一、Puntuación final — escala de 5,0

Lógica de la puntuación: esta valoración analiza Gemma 4 desde su posicionamiento como modelo multimodal abierto y ligero, centrándose principalmente en sus tres objetivos principales: multimodalidad, bajo coste y facilidad de despliegue. Aunque la programación y las capacidades Agent son débiles, tienen un peso menor porque no forman parte de su objetivo principal.

DimensiónPuntuaciónExplicación
------:---
Capacidades multimodales4,7Texto + imagen + audio + vídeo de forma nativa, con una arquitectura innovadora
Capacidades multilingües4,6Más de 140 idiomas, con buen rendimiento en español
Razonamiento3,8Intelligence Index de 22, superior a la mediana de modelos similares, pero por debajo de los insignia
Programación2,0LiveCodeBench 13,7 %, una debilidad importante
Capacidades Agent2,5Agentic Index de 5,8, claramente insuficiente
Velocidad3,5113 tok/s, nivel intermedio
Relación calidad-precio4,8Precio extremadamente bajo + algunas versiones gratuitas + posibilidad de despliegue local
Disponibilidad open-weight5,0Apache 2.0, despliegue local y solo 6-7 GB tras la cuantización
Valoración global3,9Excelente dentro de su posicionamiento, pero con debilidades claras

十二、Conclusión final: ¿Merece la pena?

Sí, pero solo si tu tarea encaja con lo que Gemma hace bien.

El mayor valor de Gemma 4 está en que combina un precio extremadamente bajo con una licencia Apache 2.0, capacidades multimodales nativas, buen soporte del español y la posibilidad de ejecutarse localmente. Para desarrolladores de aplicaciones multimodales, equipos que ofrecen servicios multilingües y empresas que necesitan ejecutar modelos abiertos de forma local, Gemma 4 es una de las opciones con mejor relación calidad-precio de 2026.

El mayor sacrificio es evidente: la programación y las capacidades Agent son el talón de Aquiles de Gemma. Si necesitas asistencia de IA para programar o quieres construir agentes de automatización complejos, Gemma puede resultar decepcionante.

Si desarrollas aplicaciones multimodales, trabajas con contenido en español o quieres ejecutar un modelo abierto localmente, Gemma 4 merece una consideración seria.

Si eres ingeniero de software, desarrollador de agentes o necesitas capacidades de programación de primer nivel, no elijas Gemma. Considera GLM 5.2 o DeepSeek-V4-Pro.

Si tu presupuesto es cero y solo quieres validar rápidamente una idea, la versión gratuita de Gemma 3 27B es un excelente punto de partida.

Si solo puedes elegir un modelo para procesamiento multimodal por lotes y despliegue local, y además quieres mantener los costes al mínimo, Gemma 4 es una de las opciones más razonables dentro de los modelos multimodales abiertos de 2026.

十三、FAQ

¿Qué es Gemma 4?

Gemma 4 es una familia de modelos abiertos desarrollada por Google DeepMind y lanzada en junio de 2026. Admite entradas de texto, imágenes, audio y vídeo, y utiliza la licencia Apache 2.0. Está disponible en una versión densa de 12B y una versión MoE Gemma 4 26B A4B.

¿Cuánto cuesta Gemma 4?

Gemma 4 12B, en su versión de razonamiento, cuesta $0,10 por millón de tokens de entrada y $0,30 por millón de tokens de salida. Gemma 4 26B A4B cuesta $0,06 por millón de tokens de entrada y $0,33 por millón de tokens de salida. Gemma 3 27B está disponible completamente gratis en algunas plataformas. Precios consultados en agosto de 2026.

¿Gemma 4 tiene una versión gratuita?

Gemma 4 es un modelo abierto bajo Apache 2.0, por lo que sus pesos pueden descargarse gratuitamente. Además, Gemma 3 27B está disponible completamente gratis en algunas plataformas de API.

¿Qué tal es Gemma 4 para programar?

No es su punto fuerte. Gemma 3 12B obtiene solo un 13,7 % en LiveCodeBench y ocupa el puesto 184 entre 198 modelos. Aunque Gemma 4 mejora respecto a la generación anterior, la programación sigue sin ser una de sus fortalezas. Si necesitas asistencia para programar, es preferible elegir GLM 5.2 o DeepSeek-V4-Pro.

¿Gemma 4 es mejor que GLM 5.2?

Depende de lo que necesites. Gemma 4 tiene ventaja en multimodalidad, capacidades multilingües —incluido el español— y despliegue local. GLM 5.2 es muy superior en programación y tareas Agent de larga duración. Ambos modelos están diseñados para necesidades completamente diferentes.

¿Quién debería usar Gemma 4?

Gemma 4 resulta especialmente adecuado para desarrolladores de aplicaciones multimodales, equipos que trabajan con múltiples idiomas, empresas que necesitan ejecutar modelos abiertos localmente y desarrolladores con presupuestos limitados. No es la mejor opción para quienes necesitan asistencia avanzada de programación, desarrollo de agentes o la máxima inteligencia general.

Lo que hace Gemma 4

  • Multimodalidad nativa: entrada de texto, imagen, audio y vídeo con un único conjunto de pesos
  • Precio extremadamente bajo: desde $0,06-0,10 por millón de tokens de entrada
  • Licencia Apache 2.0 que permite uso, modificación y explotación comercial
  • Despliegue local o edge: solo 6-7 GB tras la cuantización, ejecutable en un portátil
  • Soporte para más de 140 idiomas con buen rendimiento en español
  • Capacidad de razonamiento competitiva: 22 puntos en el Artificial Analysis Intelligence Index