NovedadIA
G

GLM-5.2

Codigo abiertoValoracion editorial 4.4/5Modelos de IA

Modelo MoE open-weight insignia de Zhipu AI (lanzado en junio de 2026) con 744B de parámetros (~40B activos), contexto de 1M de tokens sin pérdida y licencia MIT. Ofrece capacidad de programación cercana a Claude Opus 4.8 por aproximadamente un tercio de su precio, con 74,4 puntos en FrontierSWE y la primera posición global en Code Arena.

Herramientas relacionadas

GLM-5.2 es el modelo de lenguaje de gran escala open-weight de nueva generación que Zhipu AI lanzó en junio de 2026 y representa una nueva iteración de la familia GLM-5.

Parámetros principales:

  • Arquitectura: MoE (Mixture of Experts), 744B (753B) de parámetros totales y aproximadamente 40B de parámetros activos
  • Contexto: ventana de contexto de 1M de tokens sin pérdida
  • Salida máxima: 128K tokens
  • Datos de entrenamiento: hasta noviembre de 2025
  • Modalidades: texto y código únicamente, sin capacidades multimodales
  • Licencia: MIT License
  • Formato de API: compatible con OpenAI ChatCompletions

Cronología de lanzamiento:

  • 13 de junio de 2026, 17:21: disponible para todos los usuarios de GLM Coding Plan
  • 15 de junio de 2026: Zhipu anuncia oficialmente GLM-5.2 mediante un comunicado en la Bolsa de Hong Kong
  • 17 de junio de 2026: lanzamiento oficial y apertura de los pesos del modelo

Contexto del lanzamiento: GLM-5.2 llegó en un momento en el que Anthropic había retirado globalmente Claude Fable 5 y Mythos 5 debido a las restricciones estadounidenses a la exportación. El anuncio de Zhipu del 13 de junio sobre la disponibilidad de GLM-5.2 fue ampliamente interpretado como una respuesta a este acontecimiento.

Zhipu declaró:

“La inteligencia de frontera no debería pertenecer solo a unos pocos ni poder ser retirada en cualquier momento por unas pocas reglas. Debería ser abierta, accesible, construible y estar al servicio de todos los desarrolladores.”

Su verdadera posición en el mercado no es la de “un modelo con más parámetros”, sino la de un “modelo insignia de programación diseñado para tareas de larga duración”.

Zhipu posiciona explícitamente GLM-5.2 como un modelo “diseñado específicamente para capacidades de larga duración”: la idea es que la IA deje de limitarse a responder preguntas inmediatas y pueda trabajar de forma continua durante horas, como lo haría una persona, completando por sí misma un proyecto de ingeniería completo.

Con una sola descripción de lo que necesitas, puede encargarse del desarrollo, la integración, las pruebas y el empaquetado hasta llegar a un resultado listo para desplegar. En teoría, puede entregar en unas horas una aplicación multiplataforma funcional.


3. Capacidades principales

Capacidad de programación: su mayor atractivo

La programación es el principal argumento de venta de GLM-5.2.

Resultados clave en benchmarks:

BenchmarkGLM-5.2Claude Opus 4.8GPT-5.5Qué mide
------:---:---:---
Code Arena1595 puntos (1.º entre modelos disponibles globalmente)Evaluación de desarrollo frontend mediante pruebas ciegas con millones de usuarios
FrontierSWE74,475,172,6Capacidad de desarrollo de software autónomo de larga duración
SWE-bench Pro62,169,258,6Capacidad para resolver GitHub Issues
Terminal-Bench 2.181,085,084,0Operaciones en terminal y ejecución de tareas
MCP-Atlas (uso de herramientas)76,877,875,3Capacidad de uso de herramientas

¿Qué significan estos resultados en la práctica?

  • Una puntuación de 74,4 en FrontierSWE significa que GLM-5.2 ya se acerca a Claude Opus 4.8 cuando tiene que abordar proyectos técnicos abiertos que pueden requerir horas de trabajo, y además supera a GPT-5.5.
  • Terminal-Bench 2.1 pasó de los 63,5 puntos de GLM-5.1 a 81,0, un salto de 17,5 puntos. Esto indica una mejora radical en la capacidad de dejar que la IA opere directamente sobre el sistema y ejecute tareas.
  • En pruebas prácticas, GLM-5.2 puede completar de una sola vez el desarrollo full-stack de aplicaciones web, móviles y miniapps, llegando a procesar un total de 880.000 tokens.

Un desarrollador informó que, al utilizar GLM-5.2 para revisar 1700 líneas de código Python, manteniendo el mismo nivel de precisión, el tiempo se redujo de 124,8 segundos con GLM-5.1 a 47,7 segundos, mientras que la salida pasó de 3436 tokens a 1415.

Otro desarrollador afirmó que su capacidad de programación “ya ha alcanzado un nivel en el que resulta difícil distinguirlo de Claude Opus”.

Capacidad para tareas de larga duración

Esta es la principal característica que diferencia a GLM-5.2 de la mayoría de modelos.

  • Contexto de 1M de tokens sin pérdida: puede manejar textos de millones de palabras, PDF complejos de cientos de páginas o incluso repositorios completos de software de tamaño mediano o grande.
  • Mecanismo IndexShare: reutiliza índices de atención dispersa entre capas para mejorar la eficiencia del razonamiento con contextos extremadamente largos.
  • Optimización de infraestructura: con un contexto de 1M, los FLOPs por token se reducen hasta 2,9 veces.

¿Qué significa esto en la práctica?

El objetivo de GLM-5.2 es soportar procesos de planificación y ejecución que pueden extenderse durante semanas o incluso meses, reduciendo la pérdida de información y la desviación de objetivos causada por las limitaciones del contexto.

Ya no se plantea simplemente como una “máquina de preguntas y respuestas”, sino como un “empleado digital” capaz de trabajar de forma continua durante horas.

Agent y uso de herramientas

GLM-5.2 también ofrece un rendimiento destacado en tareas Agent y llamadas a herramientas:

  • MCP-Atlas (uso de herramientas): 76,8 puntos, cerca de los 77,8 de Claude Opus 4.8
  • Admite llamadas a funciones, salidas estructuradas y respuestas en streaming
  • Incluye búsqueda web integrada

En la práctica: para aplicaciones Agent que necesitan utilizar herramientas externas, operar una terminal o ejecutar flujos de automatización, GLM-5.2 ya ofrece capacidades suficientes para cubrir la mayoría de escenarios de producción.

Capacidad de razonamiento

GLM-5.2 se sitúa en un nivel medio-alto entre los modelos insignia en tareas de razonamiento:

  • Clasificación general de Artificial Analysis: 51 puntos, primera posición entre los modelos open-weight
  • GPQA Diamond: 89 %

En la práctica: GLM-5.2 ofrece un rendimiento excelente en razonamiento cotidiano, análisis lógico complejo y planificación en múltiples pasos.

Eso sí, conviene tener en cuenta que su principal fortaleza está en la programación y las tareas de larga duración, no en el razonamiento matemático puro.

Velocidad

La velocidad de ejecución de GLM-5.2 ronda los 158 tokens por segundo.

No es especialmente rápido frente a los modelos ligeros, pero teniendo en cuenta sus 744B de parámetros totales y su capacidad de manejar un contexto de 1M, esta velocidad resulta aceptable dentro de la categoría de modelos open-weight insignia.

Pero hay una advertencia importante: algunas evaluaciones señalan que GLM-5.2 presenta una velocidad de razonamiento relativamente lenta. Si tu aplicación es extremadamente sensible a la latencia, conviene realizar pruebas antes de adoptarlo.


4. ¿Cómo interpretar sus benchmarks?

Los benchmarks de GLM-5.2 son muy buenos, pero deben analizarse con cierta perspectiva crítica.

Code Arena (1595 puntos, primero entre modelos disponibles globalmente): se trata de un sistema de evaluación de programación a gran escala basado en pruebas ciegas con millones de usuarios. Su valor está precisamente en el componente de “usuarios reales”: no se trata únicamente de un entorno de laboratorio, sino de comparaciones realizadas por desarrolladores sobre las respuestas generadas por distintos modelos.

Los 1595 puntos indican que, en escenarios reales de programación, la calidad de las respuestas de GLM-5.2 ha sido validada por un gran número de usuarios como una de las mejores entre los modelos disponibles globalmente.

FrontierSWE (74,4): mide hasta qué punto una IA puede trabajar durante horas como lo haría un ingeniero. Sus 74,4 puntos están aproximadamente un punto por debajo de Claude Opus 4.8 y por encima de GPT-5.5.

Este es probablemente el logro más importante de GLM-5.2: demuestra que un modelo open-weight puede acercarse a los modelos propietarios más caros del mundo en tareas de programación de larga duración.

SWE-bench Pro (62,1): comprueba si el modelo puede resolver GitHub Issues reales. Su puntuación de 62,1 supera los 58,6 de GPT-5.5. Esto indica que GLM-5.2 no solo puede “escribir código”, sino también comprender bases de código existentes y corregir problemas dentro de ellas.

Terminal-Bench 2.1 (81,0): evalúa si el modelo puede completar tareas dentro de una terminal real. El salto de 63,5 a 81,0 muestra una mejora considerable en la capacidad de permitir que la IA opere directamente sobre el sistema.

Principio clave: un benchmark excelente no significa que el modelo sea perfecto para todos los escenarios.

GLM-5.2 se acerca a la frontera tecnológica en programación y tareas de larga duración, pero todavía presenta limitaciones en velocidad de razonamiento y seguimiento de instrucciones. Antes de elegirlo, conviene comprobar que tus tareas coincidan realmente con sus puntos fuertes.


5. Valor práctico

Escenario 1: programación de larga duración y desarrollo de software — el más recomendado

Este es el campo de batalla principal de GLM-5.2.

Ya sea para desarrollar aplicaciones full-stack, comprender y modificar grandes bases de código o ejecutar tareas de programación automatizadas que requieren horas de trabajo continuo, GLM-5.2 es una de las mejores opciones disponibles actualmente entre los modelos open-weight.

Algunas evaluaciones indican que obtuvo 189/200 puntos en una evaluación de todo el ciclo de desarrollo de software, logrando un despliegue E2E completo sin ninguna intervención humana.

Escenario 2: desarrollo de aplicaciones Agent — muy recomendado

Con 76,8 puntos en MCP-Atlas, 81,0 en Terminal-Bench y soporte para llamadas a funciones y herramientas, GLM-5.2 cuenta con capacidades suficientes para desarrollar aplicaciones Agent de nivel productivo.

Para agentes que necesitan ejecutar tareas autónomas en múltiples pasos, su contexto de 1M representa además una ventaja importante.

Escenario 3: autoalojamiento y despliegue privado empresarial — muy recomendado

GLM-5.2 está disponible bajo la licencia MIT, sin restricciones geográficas, y puede descargarse, desplegarse y utilizarse comercialmente.

Desde el primer día de lanzamiento se completó su adaptación a ocho grandes plataformas de computación de fabricación china, entre ellas Huawei Ascend, T-Head, Moore Threads y Cambricon.

Para empresas que necesitan mantener la privacidad de los datos y no quieren depender de APIs de terceros, resulta una opción especialmente atractiva.

Escenario 4: revisión y refactorización de código — recomendado

Las pruebas prácticas muestran que, manteniendo el mismo nivel de precisión, GLM-5.2 puede realizar revisiones de código aproximadamente 2,6 veces más rápido que la generación anterior, reduciendo además el número de tokens de salida en torno a un 59 %.

Para equipos que necesitan revisar grandes cantidades de código, esto puede convertirse directamente en una ventaja de productividad y costes.

Escenario 5: conversaciones en tiempo real y tareas ligeras — no recomendado

GLM-5.2 tiene una velocidad de razonamiento relativamente lenta, alrededor de 158 tokens por segundo, y algunos desarrolladores han señalado problemas de estabilidad en el seguimiento de instrucciones.

Si tu aplicación consiste principalmente en conversaciones en tiempo real, preguntas sencillas o procesamiento ligero de texto, probablemente un modelo más ligero sea una opción más adecuada.


6. Precio y relación calidad-precio

Precios consultados en agosto de 2026.

Precio de la API — Z.ai / EmpirioLabs

ConceptoPrecio en USDPrecio aproximado en RMB
------:---:
Entrada1,40 $ / millón de tokens~10 yuanes
Salida4,40 $ / millón de tokens~32 yuanes
Entrada con caché0,26–0,28 $ / millón de tokens~2 yuanes
Búsqueda web0,033 $ / solicitud

Fuente: precios oficiales de la API de Z.ai y EmpirioLabs.

Comparación con la competencia

ModeloEntrada ($/M)Salida ($/M)Open-weight
------:---:---
GLM-5.21,40 $4,40 $✅ MIT
Claude Opus 4.8~$5,00~$15,00+
GPT-5.5~$5,00~$15,00+
DeepSeek-V4-ProPor confirmarPor confirmar✅ Apache 2.0

El precio de la API de GLM-5.2 es aproximadamente un tercio del de Claude Opus 4.8.

Teniendo en cuenta que en FrontierSWE solo está alrededor de un punto por debajo de Opus 4.8, esta relación calidad-precio resulta difícil de igualar entre los modelos de programación de gama alta.

Importante: los precios pueden variar ligeramente según la plataforma, como ocurre con Alibaba Cloud. Algunas plataformas también ofrecen una versión glm-5.2-fast-preview, cuyo precio puede ser diferente.


7. Modelo vs. alternativas

GLM-5.2 vs. DeepSeek-V4-Pro

DimensiónGLM-5.2DeepSeek-V4-Pro
Parámetros totales744B / 40B activos1,6T / 49B activos
Contexto1M1M
Salida máxima128K384K
LicenciaMITApache 2.0
Multimodal❌ Solo texto✅ Razonamiento con imágenes
ProgramaciónFrontierSWE 74,4Por confirmar
Punto fuerteProgramación de larga duración + licencia open-weight muy permisivaAgent + multimodalidad

Conclusión: GLM-5.2 alcanza un nivel de élite entre los modelos open-weight en programación de larga duración y, además, la licencia MIT es más permisiva que Apache 2.0.

DeepSeek-V4-Pro destaca por su soporte multimodal y por permitir una salida máxima mucho mayor, 384K frente a 128K.

La elección depende principalmente de si necesitas capacidades multimodales y una salida individual de mayor tamaño.

GLM-5.2 vs. Claude Opus 4.8

DimensiónGLM-5.2Claude Opus 4.8
Precio de salida4,40 $/M~$15–25/M
FrontierSWE74,475,1
Open-weight✅ MIT
Despliegue propio

Conclusión: GLM-5.2 ofrece aproximadamente un tercio del precio de Opus 4.8 con una capacidad de programación de larga duración muy cercana, además de permitir el autoalojamiento.

Si no necesitas ese punto porcentual adicional de Opus 4.8, la relación calidad-precio de GLM-5.2 resulta claramente superior.


8. Opiniones de los usuarios

GLM-5.2 se lanzó en junio de 2026 y las primeras opiniones se han concentrado principalmente en las comunidades de desarrolladores.

Comentarios positivos:

  • “Su capacidad de programación ya ha alcanzado un nivel difícil de distinguir de Claude Opus.”
  • En la revisión de 1700 líneas de código Python, consiguió una mejora de 2,6 veces en velocidad y una reducción del 59 % en la salida manteniendo la misma precisión.
  • En tareas de programación para recrear videojuegos, algunos usuarios consideran que su rendimiento es “claramente mejor que GPT-5.5”.
  • La licencia MIT y la posibilidad de autoalojamiento han sido bien recibidas por usuarios empresariales.
  • Su volumen semanal de uso alcanzó 2,58 billones de tokens, entrando en el top 5.

Comentarios negativos o de cautela:

  • “La velocidad de razonamiento es lenta y el seguimiento de instrucciones es inestable.”
  • “Se parece a Claude, pero todavía no obedece tan bien”: sus capacidades están cerca, pero existe una diferencia de controlabilidad.
  • “Autonomía insuficiente, congestión durante la ejecución y consumo rápido de la cuota.”
  • Algunas evaluaciones señalan que “GLM-5.2 ya puede competir, pero todavía no puede sustituir a GPT”.
  • Algunos desarrolladores consideran que el modelo es “demasiado hablador”: una revisión de código llegó a utilizar 1144 tokens de salida, frente a solo 357 de Claude Sonnet.

Conviene aclarar: estas opiniones proceden principalmente de evaluaciones tempranas de la comunidad y todavía faltan estudios independientes a gran escala sobre satisfacción de los usuarios.


9. Ventajas y desventajas

Ventajas

  • Programación cercana a la frontera tecnológica: FrontierSWE 74,4, aproximadamente un 1 % por debajo de Claude Opus 4.8.
  • Primero global en Code Arena entre los modelos disponibles: 1595 puntos, validados mediante pruebas ciegas con millones de usuarios.
  • Contexto de 1M sin pérdida: permite trabajar con millones de palabras o repositorios completos de código.
  • Licencia MIT: una de las licencias open-weight más permisivas, con libertad para descargar, desplegar y utilizar comercialmente el modelo.
  • API muy económica: aproximadamente un tercio del precio de Claude Opus 4.8.
  • Adaptación Day 0 a hardware chino: compatible con ocho grandes plataformas de computación nacionales, incluida Huawei Ascend.
  • 2,58 billones de tokens de uso semanal: una señal de adopción considerable.

Desventajas

  • Velocidad de razonamiento relativamente lenta: unos 158 tokens/s, poco adecuada para escenarios de latencia extremadamente baja.
  • Seguimiento de instrucciones inestable: en determinados escenarios puede resultar “menos obediente”.
  • Respuestas demasiado largas: puede ser más verboso que sus competidores, aumentando el consumo de tokens.
  • Modelo exclusivamente textual: no admite entradas de imagen, audio o vídeo.
  • Salida máxima de solo 128K: inferior a los 384K de DeepSeek-V4-Pro.
  • Autonomía mejorable: algunos escenarios Agent todavía requieren una mayor intervención humana.

10. ¿Quién debería elegir GLM-5.2?

Muy recomendado

  • Ingenieros de software profesionales: desarrolladores que trabajan con grandes bases de código y tareas de programación de larga duración.
  • Desarrolladores de aplicaciones Agent: equipos que construyen agentes de IA capaces de ejecutar tareas autónomas en múltiples pasos.
  • Empresas: organizaciones que necesitan autoalojamiento, privacidad de datos y una licencia MIT.
  • Usuarios sensibles al precio: personas que quieren capacidades avanzadas de programación por mucho menos que los modelos propietarios.
  • Usuarios de hardware chino: equipos que necesitan desplegar el modelo en plataformas como Huawei Ascend.

Elegir con cautela

  • Usuarios que necesitan inferencia extremadamente rápida: conversaciones en tiempo real, llamadas frecuentes a la API y escenarios sensibles a la latencia.
  • Usuarios que exigen un seguimiento de instrucciones extremadamente preciso: aplicaciones donde el control exacto de la salida sea fundamental.
  • Usuarios que necesitan capacidades multimodales: GLM-5.2 no admite entradas de imagen, audio o vídeo.
  • Usuarios que necesitan una salida individual gigantesca: el límite de 128K puede quedarse corto.

No recomendado

  • Usuarios que solo necesitan preguntas sencillas y tareas ligeras: un modelo ligero puede ofrecer una mejor relación calidad-precio.
  • Usuarios que necesitan generación de imágenes: GLM-5.2 no admite ningún tipo de generación de imágenes.
  • Aplicaciones extremadamente sensibles a la latencia: la velocidad de razonamiento puede convertirse en un cuello de botella.

11. Puntuación final — escala de 5,0

Criterio de evaluación: esta puntuación considera a GLM-5.2 como un modelo open-weight insignia especializado en programación, prestando especial atención a sus dos objetivos principales: las tareas de programación de larga duración y la disponibilidad abierta.

DimensiónPuntuaciónComentario
------:---
Capacidad de programación4,8FrontierSWE 74,4 y primero global en Code Arena entre modelos disponibles
Tareas de larga duración4,7Contexto de 1M y diseño específico para tareas prolongadas
Capacidades Agent4,3MCP-Atlas 76,8 y uso de herramientas cercano a los modelos punteros
Razonamiento4,0Rendimiento general excelente, aunque no es su principal fortaleza
Velocidad3,5158 tok/s, relativamente lento entre los modelos insignia
Relación calidad-precio4,8Aproximadamente un tercio del precio de Opus 4.8 y con licencia MIT
Disponibilidad open-weight5,0Licencia MIT, autoalojamiento y adaptación a hardware chino
Puntuación global4,4Rendimiento sobresaliente dentro de la categoría de modelos open-weight para programación

12. Conclusión final: ¿merece la pena?

Sí, y es una de las decisiones más fáciles de 2026 si tu trabajo implica coding.

El mayor valor de GLM-5.2 es muy claro: como modelo open-weight, ofrece una capacidad de programación cercana a la de uno de los modelos propietarios más caros, Claude Opus 4.8, pero por aproximadamente un tercio de su precio.

El principal sacrificio es igualmente claro: la velocidad de razonamiento es relativamente lenta y el seguimiento de instrucciones no siempre es estable.

Si necesitas respuestas extremadamente rápidas y un control absoluto sobre cada salida, GLM-5.2 puede decepcionarte.

Pero si buscas un “ingeniero digital” capaz de trabajar durante horas y completar de forma autónoma grandes proyectos de programación, es actualmente una de las mejores opciones open-weight del mercado.

Si eres ingeniero de software, desarrollador de Agent o una empresa que necesita autoalojar un modelo open-weight, GLM-5.2 merece la pena probarlo de inmediato.

Si necesitas una inferencia extremadamente rápida, capacidades multimodales o solo realizas preguntas sencillas, considera un modelo ligero u otras alternativas.

Si solo pudieras elegir un modelo para programación de larga duración y desarrollo de Agent, y además quieres la libertad que ofrece una licencia MIT, GLM-5.2 es una de las opciones open-weight más razonables de 2026.


13. FAQ

¿Qué es GLM-5.2?

GLM-5.2 es el modelo MoE open-weight insignia que Zhipu AI lanzó en junio de 2026. Cuenta con 744B de parámetros totales y aproximadamente 40B activos, admite un contexto de 1M de tokens sin pérdida, permite generar hasta 128K tokens y está disponible bajo la licencia MIT.

¿Cuánto cuesta GLM-5.2?

La API cuesta 1,40 $ por millón de tokens de entrada y 4,40 $ por millón de tokens de salida. La entrada con caché cuesta aproximadamente 0,26–0,28 $ por millón de tokens.

Los precios corresponden a la consulta realizada en agosto de 2026. Los pesos del modelo son gratuitos y están disponibles bajo la licencia MIT.

¿GLM-5.2 tiene una versión gratuita?

Los pesos del modelo están disponibles gratuitamente en Hugging Face y ModelScope bajo la licencia MIT, por lo que pueden descargarse, desplegarse y utilizarse comercialmente.

El uso de la API sí requiere pago.

¿Qué tan bueno es GLM-5.2 para programar?

Excelente.

Obtiene 74,4 puntos en FrontierSWE, aproximadamente un 1 % por debajo de Claude Opus 4.8; alcanza 1595 puntos en Code Arena, la primera posición entre los modelos disponibles globalmente; y obtiene 62,1 en SWE-bench Pro, superando a GPT-5.5.

¿GLM-5.2 es mejor que DeepSeek-V4-Pro?

Depende.

GLM-5.2 alcanza un nivel de élite entre los modelos open-weight en programación de larga duración y utiliza una licencia MIT más permisiva que Apache 2.0.

DeepSeek-V4-Pro destaca por sus capacidades multimodales y por permitir una salida máxima mayor, de 384K frente a los 128K de GLM-5.2.

La elección depende de si necesitas multimodalidad y una capacidad de salida individual mayor.

¿Quién debería usar GLM-5.2?

Principalmente ingenieros de software profesionales, desarrolladores de Agent y empresas que necesitan autoalojamiento.

No es la opción más adecuada para usuarios que necesitan una inferencia extremadamente rápida, capacidades multimodales o simplemente realizan preguntas y tareas sencillas.


Lo que hace GLM-5.2

  • Capacidad de programación de larga duración cercana a la frontera: 74,4 puntos en FrontierSWE y primero global en Code Arena (1595 puntos)
  • Arquitectura MoE open-weight de 744B parámetros (~40B activos) con licencia MIT y libre autoalojamiento comercial
  • Contexto nativo de 1M de tokens sin pérdida y generación de hasta 128K tokens, con mecanismo IndexShare
  • Fuertes capacidades Agent y uso de herramientas: 76,8 en MCP-Atlas y 81,0 en Terminal-Bench 2.1
  • API económica, aproximadamente un tercio del precio de Claude Opus 4.8
  • Adaptación Day 0 a ocho plataformas de computación chinas, incluida Huawei Ascend