GLM-5.2 es el modelo open-weight líder en el Artificial Analysis Intelligence Index, con una puntuación de 51, y cuesta una fracción de lo que cobran los grandes modelos cerrados. Esa diferencia es la razón por la que la pregunta de GLM vs Claude ha evolucionado hacia un debate mucho más amplio. El modelo open-weight de Zhipu AI cuesta $1.40 de entrada / $4.40 de salida por millón de tokens frente a Claude Opus 5 a $5 / $25, se distribuye bajo la permisiva licencia MIT y ya compite en benchmarks con modelos de OpenAI, Google, xAI y DeepSeek.

Así que la verdadera pregunta no es solo GLM vs Claude, sino si un modelo open-weight a una fracción del coste puede sustituir a cualquiera de los grandes modelos de pago. Esta guía compara GLM-5.2 cara a cara con Claude, GPT-5.6, Gemini, Grok y DeepSeek V4 en precio, benchmarks, contexto y programación, y luego te indica exactamente qué modelo elegir para cada tarea. Todos los datos se comprobaron de nuevo en las páginas de precios de cada proveedor y en los rankings de Artificial Analysis a 25 de julio de 2026. Cada comparativa usa GLM-5.2, que sigue siendo el GLM más reciente que puedes descargar: GLM 5.3, lanzado el 14 de agosto de 2026, lidera en programación agéntica y seguridad según las propias cifras de Z.ai, pero se publicó sin pesos abiertos y solo está disponible a través del GLM Coding Plan y ZCode.

Lo más importante

  • GLM-5.2 es el líder en relación calidad-precio, a $1.40 / $4.40 por millón de tokens frente a $5 / $25 de Claude Opus 5, lo que supone una entrada aproximadamente 3,6 veces más barata y una salida 5,7 veces más barata.
  • Claude sigue ganando en las tareas agénticas más exigentes. Opus 5 encabeza el Artificial Analysis Agentic Index con 55,3 frente a 43,1 de GLM-5.2, y Opus 4.8 ya lideraba sobre GLM en SWE-bench Pro con 69,2 frente a 62,1.
  • GLM encabeza los modelos open-weight en inteligencia, ocupando el primer puesto entre los modelos open-weight en el Artificial Analysis Intelligence Index, por delante de DeepSeek V4 Pro y MiniMax-M3 (51 frente a 44 para ambos).
  • DeepSeek V4 Pro es aún más barato, a $0.435 / $0.87 por millón de tokens, y domina los benchmarks de programación competitiva.
  • GLM y DeepSeek tienen licencia MIT y permiten el autoalojamiento; Claude, GPT, Gemini y Grok son modelos cerrados y solo accesibles mediante API.
  • GLM 5.3 no forma parte de estas comparativas. Es el modelo más reciente, pero no tiene pesos abiertos ni precio por token publicado, por lo que GLM-5.2 sigue siendo el que puedes descargar, autoalojar y presupuestar.

GLM vs Claude, GPT, Gemini, Grok y DeepSeek de un vistazo

Del editor

Todos los modelos de IA en una sola app

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 y más en una sola app nativa para Mac y iPhone.

¡Descárgala ahora!

Aquí tienes todo el campo en una sola pantalla. Los precios son las tarifas de lista de API por millón de tokens; el contexto es la ventana de entrada máxima. GLM-5.2 y DeepSeek V4 son los únicos modelos open-weight del grupo, y DeepSeek es el más barato de los seis. El más reciente Kimi K3 de Moonshot pertenece al mismo campo open-weight, aunque se espera que sus pesos se publiquen a finales de julio de 2026.

ModeloFabricanteLicenciaPrecio (entrada / salida por 1M)ContextoMejor en
GLM-5.2Zhipu / Z.aiAbierta, MIT$1.40 / $4.401MRelación calidad-precio, matemáticas, pesos abiertos
Claude Opus 5AnthropicCerrada$5 / $251MProgramación de larga duración, uso de herramientas, escritura
GPT-5.6 SolOpenAICerrada$4 / $201MEquilibrio general, ecosistema
Gemini 3.1 ProGoogleCerrada$2 / $121MMultimodal, arena de programación
Grok 4.6xAICerrada$2 / $6500kDatos en tiempo real de X, el Grok más potente
DeepSeek V4 ProDeepSeekAbierta, MIT$0.435 / $0.871MMenor coste, programación competitiva

Si quieres la definición completa y el historial de versiones detrás de estos números, nuestro artículo sobre qué es GLM y cómo ha evolucionado la familia cubre todos los lanzamientos desde el 4.5 hasta el 5.2. El resto de este artículo es el veredicto cara a cara.

GLM frente a cada rival, uno a uno

La tabla de un vistazo establece el contexto, pero la decisión real se toma comparativa a comparativa. Así es como GLM-5.2 se mide frente a cada uno de los cinco grandes modelos, con las diferencias concretas de benchmark y precio que deben guiar tu elección.

GLM vs Claude

Esta es la comparativa que todo el mundo busca, y la respuesta honesta es que Claude sigue siendo el mejor modelo donde más importa, es decir, en ingeniería de software de muchas horas, orquestación de herramientas y escritura pulida. El actual modelo insignia de Anthropic es Claude Opus 5, lanzado el 24 de julio de 2026, que encabeza el Artificial Analysis Intelligence Index con 61 y su Agentic Index con 55,3 frente a 51 y 43,1 de GLM-5.2. En la comparativa directa de llm-stats, el modelo insignia anterior, Opus 4.8, ya lideraba sobre GLM-5.2 en SWE-bench Pro (69,2 vs 62,1), Tool-Decathlon (59,9 vs 48,2) y NL2Repo por un amplio margen. Si tu trabajo depende de que un agente mantenga la coherencia a lo largo de una tarea larga y desordenada, Claude vale el precio premium.

GLM-5.2 recorta distancias en lugares sorprendentes, sin embargo. Casi satura las matemáticas de olimpiada, con una puntuación de 99,2 en AIME 2026 y 91,0 en IMO-AnswerBench, benchmarks en los que se sitúa en lo más alto o muy cerca de ello en todo el campo, y se queda a un punto de Opus en varias evaluaciones agénticas. El argumento del precio es determinante: GLM cuesta 3,6 veces menos en entrada y 5,7 veces menos en salida. Para flujos de trabajo que ejecutan miles de turnos de agente al día, esa diferencia se convierte en dinero real.

MétricaGLM-5.2Claude (Opus 4.8 / Opus 5)
SWE-bench Pro (Opus 4.8)62,169,2
GPQA Diamond (Opus 4.8)91,293,6
AA Agentic Index (Opus 5)43,155,3
AIME 2026 (matemáticas)99,2No publicado
Precio (salida por 1M)$4.40$25
PesosAbiertos, MITCerrados

Veredicto: elige Claude Opus 5 para programación premium de alta exigencia y contenido de cara al cliente; elige GLM para pipelines de gran volumen y sensibles al coste donde calidad de frontera a un sexto del precio de salida es un intercambio fácil. Para las especificaciones completas, consulta nuestro análisis de la arquitectura y capacidades de GLM-5.2.

GLM vs GPT-5.6

GPT-5.6 Sol es el modelo insignia de OpenAI, en lanzamiento amplio desde el 9 de julio de 2026. Es la opción segura por defecto para quienes quieren un modelo que haga todo bien dentro de un ecosistema maduro. Iguala a GLM en razonamiento general y se adelanta en amplitud de herramientas, plugins y soporte de terceros. Lo que no hace es competir en precio.

A $4 de entrada / $20 de salida por millón de tokens, bajado desde $5 / $30 el 21 de agosto de 2026, Sol ya no es el más caro en salida de esta tabla (ese puesto lo ocupa Claude Opus 5 con $25) y cuesta aproximadamente 4,5 veces más que GLM-5.2. OpenAI vende niveles más baratos de la misma generación, y los recortó fuertemente el 30 de julio de 2026, llevando Terra a $2 / $12 y Luna a $0.20 / $1.20, por lo que la comparativa depende enteramente de cuál uses realmente. Frente a Sol, GLM es considerablemente más barato. Frente a Luna no lo es: Luna es 7 veces más barata que GLM-5.2 en entrada y aproximadamente 3,7 veces más barata en salida. Lo que GLM sí te da, y ningún nivel de GPT ofrece, son pesos abiertos y autoalojamiento.

Veredicto: elige GPT-5.6 por la profundidad de su ecosistema, por ser un modelo todo terreno fiable y ahora también por los tokens más baratos de los dos si Luna es suficiente para el trabajo; elige GLM cuando necesites pesos abiertos, autoalojamiento o calidad de frontera muy por debajo del precio de Sol.

GLM vs Gemini

El modelo Pro de Google en producción es Gemini 3.1 Pro a $2 / $12 por millón de tokens. Vale la pena aclarar algo que circula constantemente: no existe Gemini 3.5 Pro ni Gemini 3.6 Pro. El catálogo publicado por Google lista a 3.1 Pro como su modelo Pro más reciente, todavía en versión preliminar, y a Gemini 3.6 Flash como su modelo Flash estable más reciente. La ventaja de Gemini es la comprensión multimodal y un sólido rendimiento en la arena de programación, junto con una integración estrecha con Google Workspace y Search. También está más cerca de GLM en precio que los otros modelos cerrados insignia.

GLM-5.2 contraataca con puntuaciones de inteligencia bruta más altas entre los modelos open-weight y una salida mucho más barata. Gemini es la mejor opción si tu trabajo es intensivo en imágenes, vídeo o documentos, o si vives dentro de las herramientas de Google. Para cargas de trabajo basadas en texto, de gran volumen o autoalojadas, la ventaja de coste de GLM y su licencia MIT pesan más.

Veredicto: elige Gemini para trabajo multimodal y del ecosistema de Google; elige GLM para pipelines de texto intensivo y despliegue abierto.

GLM vs Grok

xAI distribuye ahora dos modelos que merecen compararse. Grok 4.6, lanzado el 12 de agosto de 2026, es el modelo insignia, listado públicamente en el catálogo de la API de xAI a $2 / $6 por millón de tokens por debajo de 200k y $4 / $12 por encima, con una ventana de contexto de 500k. Grok 4.3 sigue disponible a $1.25 / $2.50 con una ventana de 1M, lo que lo convierte en la opción barata más que en la potente. La característica diferenciadora de Grok es el acceso en tiempo real a datos de X (Twitter), algo que ningún otro modelo de este grupo ofrece de forma nativa.

La comparativa de precios depende totalmente de qué Grok uses. Grok 4.3 supera a GLM-5.2 en salida con $2.50 frente a $4.40, pero Grok 4.6 cuesta más que GLM en ambos lados de la balanza. Grok 4.6 aporta considerablemente más capacidad que Grok 4.5, con una puntuación de 61 en el Artificial Analysis Intelligence Index frente a 51 de GLM-5.2, una brecha que se amplió de tres a diez puntos cuando Grok 4.6 llegó en agosto sin cambio de precio. Si los datos en tiempo real de X son fundamentales para tu caso de uso, Grok gana. Si los pesos abiertos, el autoalojamiento o la factura más baja importan más, GLM es la opción.

Veredicto: elige Grok 4.6 para datos en tiempo real de X y el modelo cerrado más potente de la línea de xAI; elige GLM para pesos abiertos, autoalojamiento y la factura más baja.

GLM vs DeepSeek

Esta es la verdadera batalla open-weight, porque GLM-5.2 y DeepSeek V4 tienen ambos licencia MIT, ambos son chinos, ambos tienen contexto de 1M y ambos están diseñados para desarrolladores que quieren programación de frontera sin bloqueo de proveedor. DeepSeek V4 Pro es el más barato de los dos, a $0.435 / $0.87 por millón de tokens, y domina las evaluaciones de programación competitiva como LiveCodeBench (93,5 %) y Codeforces (puntuación 3206). El Qwen 3.8 de Alibaba es el nuevo peso pesado en esa carrera open-weight china.

GLM-5.2 gana en inteligencia general y programación de largo alcance, liderando a DeepSeek en SWE-bench Pro (62,1 vs 55,4) y ocupando un puesto más alto en el Artificial Analysis Intelligence Index (51 vs 44). Así que la división es clara: DeepSeek para el menor coste posible y la programación de tipo concurso, GLM para mayor razonamiento general y trabajo de software agéntico. Ambos son verdaderos líderes open-weight, tal como cubre nuestro resumen de los mejores modelos de IA open source.

Veredicto: elige DeepSeek para el menor coste posible y la programación competitiva; elige GLM para una inteligencia general más sólida. Consulta nuestro análisis completo de DeepSeek V4 para los detalles.

Benchmarks: dónde gana y pierde realmente GLM

Los benchmarks cuentan una historia coherente cuando los divides en tres grupos. GLM-5.2 es competitivo en la frontera en razonamiento y matemáticas, competitivo pero por detrás en la programación agéntica más exigente, y claramente por delante en valor. Los nuevos benchmarks de GLM 5.3 reducen considerablemente la brecha en programación agéntica, aunque solo según las cifras propias de Z.ai. Así se desglosa cada grupo.

Razonamiento y matemáticas: GLM es de clase frontera

En razonamiento puro y matemáticas, GLM-5.2 corre a la par con la frontera. Encabeza el campo open-weight en GPQA Diamond (91,2 %) y casi satura las matemáticas de olimpiada, con una puntuación de 99,2 en AIME 2026 y 91,0 en IMO-AnswerBench, donde se sitúa en lo más alto o muy cerca de ello en todos los modelos evaluados. Esta es la categoría donde un modelo open-weight iguala de manera más convincente a los modelos de pago.

Programación y agentes: los modelos cerrados siguen liderando

En ingeniería de software de largo alcance, los modelos cerrados de frontera siguen liderando. Claude Opus 4.8 estaba por delante en SWE-bench Pro (69,2 vs 62,1) y en maratones de uso de herramientas como el Tool-Decathlon (59,9 vs 48,2). Su sucesor Opus 5 ha tomado la cima del Artificial Analysis Agentic Index con 55,3. Este es el trabajo agéntico de muchas horas donde lo que pagas es que el modelo mantenga la coherencia a lo largo de una tarea complicada. GLM se queda a unos pocos puntos de distancia, no a un abismo, que es la razón por la que el argumento de valor se sostiene. Los nuevos participantes siguen empujando en esa frontera. Muse Spark 1.1 de Meta gana varias filas de uso agéntico de herramientas en el gráfico de benchmark propio de Meta. Artificial Analysis lo puntúa muy por detrás de GLM en su Agentic Index independiente, sin embargo: 37,5 frente a 43,1.

Seguridad: GLM supera a Claude Code

El resultado más comentado procede de la empresa de investigación de seguridad Semgrep. En su prueba de detección de vulnerabilidades IDOR solo con prompt, GLM-5.2 obtuvo un F1 de 39 % sin ningún scaffolding y superó a Claude Code, un resultado que Semgrep destacó como una victoria de siete puntos. Que un modelo open-weight que ejecuta un prompt básico iguale a un agente de programación de frontera en una tarea de seguridad con gran carga de razonamiento es exactamente el tipo de resultado que lleva a los equipos a reconsiderar pagar precios premium.

La conclusión requiere matices, no es un resultado categórico. Puedes verificar los rankings en tiempo real en el Artificial Analysis Intelligence Index y leer la metodología de Semgrep en su análisis de benchmarks de ciberseguridad de GLM-5.2.

Precios: la razón por la que existe esta comparativa

Todos los veredictos anteriores giran en torno a un hecho: GLM es mucho más barato que los modelos insignia cerrados. A $1.40 / $4.40 por millón de tokens, GLM-5.2 supera a Claude Opus 5 entre 3,6 y 5,7 veces, a GPT-5.6 Sol incluso más en salida, y se sitúa por debajo de Gemini 3.1 Pro. Los niveles baratos son otra historia desde el 30 de julio de 2026. DeepSeek V4 Pro y el antiguo Grok 4.3 siguen por debajo de GLM, y GPT-5.6 Luna se une a ellos a $0.20 / $1.20. Los tres ceden terreno a GLM en algún aspecto, ya sea en inteligencia general o en pesos abiertos, por lo que el más barato por token y el mejor por precio ya no son la misma pregunta.

Zhipu también ofrece planes de suscripción para programación y límites de frecuencia más altos que la mayoría de sus competidores, lo que importa para equipos que ejecutan agentes continuos. Para el desglose completo plan a plan, incluidos los niveles de programación y los modelos gratuitos, consulta nuestra guía de precios de GLM, y compáralo con el mercado más amplio en nuestra comparativa de precios de IA.

¿Qué modelo deberías elegir realmente?

La respuesta entre los cinco modelos depende de lo que optimices. Para programación premium y tareas agénticas largas, Claude Opus 5 es la elección, con GLM-5.2 como alternativa económica de primera. Para el mejor valor a escala, opta por GLM-5.2, o baja a DeepSeek V4 Pro si quieres la opción absolutamente más barata.

Los trabajos especializados también se reparten con claridad. El trabajo multimodal y del ecosistema de Google corresponde a Gemini 3.1 Pro, la información en tiempo real y los datos de X van a Grok 4.6, y cualquier cosa que necesite pesos abiertos o autoalojamiento significa GLM-5.2 o DeepSeek V4, las únicas opciones con licencia MIT de este grupo.

Observa que ningún modelo gana en todos los trabajos. Esa es la lección real de cualquier comparativa GLM vs Claude vs todos: el «mejor» modelo depende enteramente de la tarea que tengas delante, y los equipos más inteligentes derivan distintos trabajos a distintos modelos.

Conclusión: no tienes que elegir solo uno

GLM-5.2 ha convertido la pregunta de GLM vs Claude en una competición genuina. Ofrece razonamiento de clase frontera a precios open-weight, lidera el campo en matemáticas y supera a Claude Code en un benchmark de seguridad, y solo se queda atrás en la programación de largo alcance más exigente. Frente a GPT, Gemini y Grok gana en apertura, y en coste frente a todo excepto DeepSeek y el antiguo Grok 4.3, mientras se bate en capacidad.

Como el ganador cambia con cada tarea, la decisión práctica es tener varios modelos a mano. Fello AI te da Claude, ChatGPT, Gemini, Grok, DeepSeek y modelos abiertos como GLM en una sola aplicación con una única suscripción plana, para que puedas enviar cada trabajo al modelo que lo gana sin gestionar cinco facturas separadas. Así es como sacas el mejor partido de toda esta comparativa en lugar de comprometerte con uno solo de sus lados. En un Mac, todo funciona a través de un cliente de escritorio nativo de GLM, junto a todos los demás modelos de esta comparativa.

Preguntas frecuentes

¿Es GLM mejor que Claude?

No en general, aunque depende de la tarea. Claude Opus 5 lidera sobre GLM-5.2 en ingeniería de software de largo alcance y uso de herramientas, encabezando el Artificial Analysis Agentic Index con 55,3 frente a 43,1, mientras que GLM gana en benchmarks matemáticos y cuesta aproximadamente entre 3,6 y 5,7 veces menos. Para trabajo de gran volumen o sensible al coste, GLM suele ser la elección más inteligente.

¿Es GLM más barato que Claude y GPT?

Sí, considerablemente. GLM-5.2 cuesta $1.40 de entrada / $4.40 de salida por millón de tokens, frente a $5 / $25 de Claude Opus 5 y $4 / $20 de GPT-5.6 Sol. Eso es aproximadamente un quinto de la tasa de salida de Sol y un sexto de la de Claude Opus 5.

¿Es GLM open source?

GLM-5.2 se publica con pesos abiertos bajo la permisiva licencia MIT, por lo que puedes autoalojarlo y ajustarlo. Junto con DeepSeek V4, es uno de los únicos modelos open-weight de esta comparativa; Claude, GPT, Gemini y Grok son todos cerrados y solo accesibles mediante API.

GLM vs DeepSeek, ¿cuál es mejor?

GLM-5.2 lidera en inteligencia general y programación de largo alcance, mientras que DeepSeek V4 Pro es más barato ($0.435 / $0.87) y domina los benchmarks de programación competitiva como LiveCodeBench. Ambos son modelos open-weight con licencia MIT y contexto de 1M, por lo que la elección se reduce a coste frente a capacidad general.

¿Puede GLM sustituir a Claude para programar?

Para muchas tareas de programación, sí, especialmente a escala donde el coste importa. GLM-5.2 se mantiene a pocos puntos de Claude en la mayoría de evaluaciones de programación e incluso superó a Claude Code en un benchmark de seguridad. Para el trabajo agéntico de muchas horas más exigente, Claude Opus 5 sigue teniendo ventaja.