El 8 de julio de 2026, xAI lanzó Grok 4.5, su primer modelo diseñado específicamente para programación y trabajo agéntico. No es una mejora de capacidades generales, sino un giro deliberado hacia los desarrolladores, con entrenamiento basado en datos reales de sesiones de Cursor y benchmarks creados para medir lo que una IA puede hacer dentro de una base de código real durante una sesión larga. El 12 de agosto de 2026 fue superado por Grok 4.6, una mejora de post-entrenamiento sobre la misma base.

El resultado es un modelo que obtiene 56 en el Artificial Analysis Intelligence Index, por delante de todos los modelos de Gemini, a una fracción del coste que tiene hoy la frontera. Artificial Analysis gastó $0.36 para ejecutar Grok 4.5 en el índice, frente a $1.23 para GPT-5.6 Sol y $2.34 para Claude Opus 5 con razonamiento máximo.

Elon Musk lo posicionó directamente: «Es un modelo de clase Opus, pero más rápido, más eficiente en tokens y de menor coste.» En un mensaje posterior fue más preciso: «Grok 4.5 es aproximadamente comparable a Opus 4.7, pero mucho más rápido.»

Musk también indicó que las velocidades actuales no son el techo. xAI aún no ha desplegado su stack de inferencia interno en C/C++ que se mapea directamente al hardware GB300, y cuando lo haga espera que la velocidad se duplique o supere eso. Señaló una mejora importante para el mes siguiente; a 10 de agosto de 2026 no había salido nada, y grok-4.5-latest sigue siendo el alias actual en la lista de modelos de xAI.

Lo más importante

  • Grok 4.5 se lanzó el 8 de julio de 2026 y obtiene 56 en el Artificial Analysis Intelligence Index v4.1.1, por delante de todos los modelos de Gemini. En el lanzamiento quedó 4.º y ahora está en el puesto 15 de 185 entradas.
  • Construido sobre el modelo base V9 de 1,5 billones de parámetros y entrenado con datos reales de sesiones de Cursor para tareas de programación y trabajo agéntico.
  • Con un precio de $2 / $6 por millón de tokens y entradas en caché a $0.30, frente a $5 / $25 del actual Claude Opus 5. En Artificial Analysis es el modelo más barato del top 15 para ejecutar en el Intelligence Index.
  • Muy eficiente en tokens: usa unos 14 000 tokens de salida por tarea del Intelligence Index frente a los 67 020 de Opus 4.8 según la comparación de xAI el día del lanzamiento.
  • Musk lo llama «de clase Opus, pero más rápido», con un stack de inferencia personalizado que se espera duplique los actuales ~80 tokens/seg.

Qué es realmente Grok 4.5

Del editor

Todos los modelos de IA en una sola app

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 y más en una sola app nativa para Mac y iPhone.

¡Descárgala ahora!

Grok 4.5 es el primer modelo de xAI entrenado desde cero para tareas de programación y trabajo agéntico, no para inteligencia general. Construido sobre el modelo base V9 de 1,5 billones de parámetros, se entrenó en colaboración con Cursor para gestionar trabajos de larga duración en múltiples repositorios y operar con mínima intervención humana a lo largo de cientos de llamadas a herramientas. Esa colaboración produjo después el producto de agente de SpaceXAI, que aplica el mismo enfoque en una aplicación de escritorio.

Las especificaciones principales son directas.

EspecificaciónDetalle
Nombre del modelo en APIgrok-4.5
ArquitecturaModelo base V9, 1,5 billones de parámetros (3 veces mayor que el V8 de Grok 4.3)
Ventana de contexto500 000 tokens
Velocidadaproximadamente 80 tokens por segundo
Modalidades de entradatexto e imágenes (visión)
Razonamientoconfigurable en esfuerzo bajo, medio, alto o xhigh (por defecto alto)
APIs compatiblesResponses API y Chat Completions
Capacidades integradasllamada a funciones, búsqueda web, búsqueda en X, ejecución de código

El nombre V9 marca un cambio generacional completo respecto a la serie V8 que impulsaba Grok 4.3, triplicando la escala y desplazando el foco de entrenamiento por completo hacia la programación y las tareas agénticas. La ventana de contexto se redujo del millón de tokens de Grok 4.3 a 500 000, lo que es un compromiso real para quienes necesitaban el millón completo.

La conexión con Cursor

El «entrenado con Cursor» del anuncio no es solo una colaboración de marketing. A mediados de junio de 2026, SpaceX adquirió Cursor por aproximadamente $60 000 millones, incorporando uno de los editores de IA para programación más utilizados directamente al ecosistema de xAI. Esa adquisición explica por qué el entrenamiento de Grok 4.5 incorporó datos reales de sesiones de desarrolladores de Cursor, dando a xAI acceso directo a los flujos de trabajo reales, los patrones de contexto y las estructuras de tareas de largo alcance que los desarrolladores usan en producción.

A diferencia del entrenamiento con repositorios de código público, los datos de sesiones reales capturan cómo los desarrolladores iteran sobre un problema, cambian de contexto entre archivos y toman decisiones de varios pasos dentro de proyectos reales. Grok 4.5 es el primer modelo que refleja eso.

xAI también introdujo junto a este modelo una nueva metodología de entrenamiento, el aprendizaje asíncrono, que permite que las ejecuciones de entrenamiento agéntico de varias horas avancen en paralelo con el entrenamiento del modelo en curso, en lugar de hacerlo de forma secuencial. El efecto práctico es que los bucles de retroalimentación entre el comportamiento del modelo y sus actualizaciones de entrenamiento son mucho más ajustados, lo que permite al modelo manejar el tipo de sesiones autónomas de larga duración en las que la mayoría de los agentes se atascan.

Resultados en benchmarks

Benchmarks publicados por xAI en el lanzamiento

BenchmarkFable 5GPT-5.5Grok 4.5Opus 4.8GLM-5.2
DeepSWE 1.066,1%64,3%62,0%55,8%n/a
DeepSWE 1.170,0%67,0%53,0%59,0%44,0%
Terminal-Bench 2.184,3%83,4%83,3%78,9%n/a
SWE-Bench Pro80,4%n/a64,7%69,2%62,1%

Estas son las cifras que xAI publicó el 8 de julio de 2026, medidas frente a los modelos vigentes ese día. Leídas directamente: Grok 4.5 supera a Opus 4.8 en dos de los cuatro benchmarks (DeepSWE 1.0 y Terminal-Bench 2.1) y queda por detrás en los otros dos (DeepSWE 1.1 y SWE-Bench Pro). Claude Fable 5 lidera los cuatro y, en Terminal-Bench 2.1, el margen entre Grok 4.5 (83,3%) y GPT-5.5 (83,4%) es de una décima. Opus 4.8 y GPT-5.5 han sido superados desde entonces por Claude Opus 5 y GPT-5.6 Sol, frente a los cuales xAI no ha publicado datos, por lo que la sección de clasificaciones actuales es la que debes consultar para tomar decisiones de compra.

Benchmarks independientes de Artificial Analysis

En el Artificial Analysis Intelligence Index, ahora en la versión v4.1.1, Grok 4.5 con razonamiento alto obtiene 56. Grok 4.3 obtiene 37 con razonamiento medio en el mismo tablero, lo que convierte este en el mayor salto generacional que xAI ha registrado en este índice; y Grok 4.5 sigue superando a todos los modelos de Gemini listados, siendo el mejor de ellos, Gemini 3.6 Flash, con 52. La puntuación pasó de 54 a 56 en agosto porque Artificial Analysis recalculó todo el tablero al alza en la versión v4.1.1, no porque el modelo cambiara.

Su posición sí ha cambiado, y vale la pena decirlo con claridad. Grok 4.5 fue cuarto de 168 entradas en el lanzamiento del 8 de julio. En el tablero actual ocupa el puesto 15 de 185, con Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Kimi K3, Qwen3.8 Max, Muse Spark 1.2 y GPT-5.6 Terra por encima. Claude Opus 4.8, contra el que se midió Grok 4.5 en el lanzamiento, ya no aparece en el tablero. La puntuación no cayó, el campo avanzó.

Una afirmación del lanzamiento ha quedado superada por completo. Grok 4.5 ya no supera a todos los modelos de pesos abiertos, porque Kimi K3 publicó sus pesos abiertos el 27 de julio de 2026 y obtiene 60 en el mismo índice.

En GDPval-AA v2, el benchmark que mide el trabajo agéntico de conocimiento sostenido, Grok 4.5 obtiene un Elo de 1 543, por delante de GLM-5.2 con 1 513 y por detrás de Claude Opus 4.8 con 1 600. En el lanzamiento quedó cuarto, pero Claude Opus 5 ha publicado desde entonces 1 861 en el mismo benchmark, por lo que esa posición también ha cambiado. En la subtarea de razonamiento financiero más difícil, tau3-Banking, Grok 4.5 alcanza el 33%, la puntuación más alta entre todos los modelos evaluados, superando a GPT-5.5 (xhigh) con el 31%.

En el Artificial Analysis Coding Agent Index (DeepSWE, Terminal-Bench v2 y SWE-Atlas QnA combinados), Grok 4.5 en el harness Grok Build obtiene 76, quedando tercero. Está al nivel de GPT-5.5 (xhigh) en Codex y justo por debajo de Fable 5 (max) en Claude Code.

xAI también reporta el Harvey Legal Agent Benchmark, en el que Grok 4.5 queda primero. Combinado con la primera posición en tau3-Banking, esto apunta al trabajo jurídico y financiero como fortalezas específicas más allá de lo que capturan los benchmarks de programación solos.

Resultados de benchmarks de Artificial Analysis [fuente]

Eficiencia en tokens

El precio por token es el titular, pero la eficiencia en tokens es el dato más relevante. En SWE-Bench Pro, Grok 4.5 usó aproximadamente 15 954 tokens de salida por tarea frente a los 67 020 de Opus 4.8, una diferencia de 4,2x. En el Artificial Analysis Intelligence Index usa aproximadamente 14 000 tokens de salida por tarea, más del 60% menos que Opus 4.8. En el Coding Agent Index promedia 1,9 millones de tokens totales por tarea, frente a 7,2 millones de Fable 5 en Claude Code y 6,2 millones de GPT-5.5 en Codex.

Un modelo que usa 4 veces menos tokens no es solo más barato por tarea. También es más rápido y genera menos ruido en los pipelines agénticos, algo que importa en el trabajo autónomo de múltiples pasos.

Precios y coste por tarea

Grok 4.5 tiene un precio de $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. Los aciertos de caché tienen un descuento del 85%, lo que deja los tokens de entrada en caché en $0.30 por millón. Un aviso importante: el precio se duplica para entradas superiores a 200 000 tokens. Para un desglose completo de los precios de suscripción y API de Grok, incluyendo los niveles de consumidor, esa guía cubre todas las opciones.

Frente a la frontera actual, eso supone bastante menos de la mitad de lo que cobra Claude Opus 5 a $5 / $25. Pero el coste por tarea es el dato más relevante, ya que tiene en cuenta cuántos tokens gasta realmente cada modelo. La tabla siguiente recoge las cifras de xAI y Artificial Analysis publicadas en el lanzamiento en julio de 2026.

ModeloEntrada (por 1M)Salida (por 1M)Coste por tarea del Intelligence IndexCoste por tarea del Coding Agent
Grok 4.5$2.00$6.00$0.31$2.49
GPT-5.5 (Codex)$5.00$30.00superior$5.07
Fable 5 (Claude Code)$10.00$50.00superior$11.80
Opus 4.8$5.00$25.00superiorn/a

Las cifras por tarea son las que realmente importan a escala de producción. Grok 4.5 logró un rendimiento casi equivalente como agente de programación a aproximadamente la mitad del coste de GPT-5.5 y menos de una cuarta parte del coste de Fable 5 por trabajo completado. Esa ventaja se ha mantenido a medida que el campo avanza. En el Intelligence Index actual, Artificial Analysis sitúa el coste de ejecutar Grok 4.5 en $0.36 frente a $1.23 de GPT-5.6 Sol y $2.34 de Claude Opus 5, ambos con razonamiento máximo.

Dónde está disponible Grok 4.5

Grok 4.5 se activó en un amplio conjunto de plataformas el día del lanzamiento. Está disponible en la API de xAI bajo el nombre de modelo grok-4.5, en Grok Build (el harness propio de xAI para agentes de programación) y en Cursor en todos los planes. El acceso de terceros incluye OpenRouter, Vercel, Cloudflare, Snowflake y Databricks Mosaic. También está disponible en Fello AI para Mac, iPhone y iPad.

El lanzamiento del plugin para Office es destacable. xAI posiciona Grok 4.5 no solo como modelo de programación, sino como modelo para trabajo de conocimiento capaz de construir modelos complejos de Excel con investigación web integrada y generar contenido sofisticado de PowerPoint. Eso amplía el caso de uso potencial mucho más allá del desarrollo de software.

La brecha con la UE se ha cerrado. Grok 4.5 se lanzó en 47 países, pero estaba bloqueado en los 27 estados miembros de la UE, un retraso atribuido al trabajo de cumplimiento bajo la Ley de IA de la UE, que trata a los modelos entrenados por encima de 1025 FLOPs como portadores de riesgo sistémico. xAI abrió el acceso a la UE a finales de julio de 2026 y su documentación para desarrolladores ya no incluye la restricción regional que mostraba en el lanzamiento.

El modelo es compatible tanto con la Responses API como con el formato Chat Completions, lo que significa que encaja en bases de código ya construidas sobre APIs compatibles con OpenAI sin necesidad de modificación.

Qué dijo Elon Musk

Musk hizo varias declaraciones alrededor del día del lanzamiento que indican dónde encaja este modelo y hacia dónde va.

Sobre el posicionamiento de capacidades: «Es un modelo de clase Opus, pero más rápido, más eficiente en tokens y de menor coste», con una aclaración posterior de que es «aproximadamente comparable a Opus 4.7, pero mucho más rápido.» Ese último detalle importa: Musk compara con Opus 4.7, no con 4.8, algo que los datos independientes respaldan en términos generales.

Sobre el techo de velocidad: «Grok 4.5 aún no usa nuestro software de inferencia interno en C/C++ que se mapea exactamente al hardware GB300. Probablemente se pueda duplicar o superar la velocidad actual.» El rendimiento actual de unos 80 tokens por segundo no es la cifra definitiva. El stack de inferencia personalizado está en desarrollo y añadirá más velocidad sin cambiar los pesos del modelo.

Sobre lo que viene: «La versión del próximo mes supondrá otra mejora significativa, a medida que cerremos el bucle resolviendo problemas de ingeniería reales en Tesla, SpaceX, Neuralink y Boring Company.» Ese bucle de retroalimentación del trabajo de ingeniería real en las empresas hermanas de xAI es una fuente de datos de entrenamiento que ningún otro laboratorio tiene a la misma escala.

Sobre las futuras capacidades multimodales: Grok ganará la capacidad de llamar a Grok Imagine como herramienta en modo agéntico, invocando la generación de imágenes y vídeo como parte de un flujo de trabajo autónomo más largo en lugar de como una función separada. Musk señaló que esto es especialmente valioso para los desarrolladores de videojuegos.

Primeras reacciones de los usuarios

Las opiniones de los desarrolladores con acceso anticipado a través de Cursor fueron positivas. Danny Limanseta lo describió como «Opus 4.8 al doble de velocidad y a un precio mucho menor» tras usarlo para hacer brainstorming, planificar e implementar una función compleja de un juego a lo largo de una sesión completa sin necesidad de corregirlo manualmente en cada paso.

Artificial Analysis resumió el cambio competitivo de forma directa el día del lanzamiento, escribiendo que Grok 4.5 «lleva a SpaceXAI a la frontera de la inteligencia por detrás solo de OpenAI y Anthropic, superando a todos los modelos de pesos abiertos y notablemente a los modelos Gemini de Google». La parte de los pesos abiertos de esa frase ha quedado superada desde entonces, como se indica arriba.

Cómo se compara Grok 4.5 con la competencia

Frente a la frontera actual, Grok 4.5 rara vez ocupa el primer puesto en capacidad bruta, pero gana de forma consistente en coste y eficiencia de tokens. A continuación se compara modelo por modelo, usando el tablero Artificial Analysis v4.1.1 para lo actual y las cifras del lanzamiento de xAI donde son los únicos datos publicados.

Frente a Grok 4.3

56 frente a los 37 de Grok 4.3 es el mayor salto generacional en el linaje de Grok. La ventana de contexto se redujo a la mitad, de 1M a 500 000 tokens, y las modalidades de entrada se limitaron a texto e imágenes, que son los dos compromisos reales. Si has estado usando Grok 4.3 para programación, Grok 4.5 es una mejora significativa en todas las demás dimensiones.

Frente a Claude Opus 5

Claude Opus 5 es el modelo estrella actual de Anthropic y encabeza el Intelligence Index con 63, siete puntos por encima de Grok 4.5. También tiene una ventana de contexto de 1M de tokens frente a los 500 000 de Grok 4.5. La comparación de costes va en sentido contrario, y no de forma estrecha. Opus 5 tiene un precio de $5 / $25 por millón de tokens frente a $2 / $6, y Artificial Analysis gastó $2.34 ejecutando Opus 5 en el índice frente a $0.36 para Grok 4.5. Para el trabajo de programación más difícil y abierto, Opus 5 tiene ventaja; para pipelines agénticos donde el coste por tarea se acumula a lo largo de cientos de llamadas a herramientas, Grok 4.5 ofrece mejor economía.

Frente a Claude Fable 5

Fable 5 lidera en los cuatro benchmarks de xAI y en el Intelligence Index. La brecha de costes es la mayor de cualquier comparación: $2.49 frente a $11.80 por tarea del Coding Agent, casi 5x. Para cargas de trabajo donde el rendimiento absoluto de programación es obligatorio, Fable 5 sigue siendo superior. Para un rendimiento cercano a la frontera a una fracción del coste, gana Grok 4.5.

Frente a GPT-5.6 Sol

Sol es el modelo estrella actual de OpenAI y la comparación más cercana en el tablero. Obtiene 61 con razonamiento máximo y 57 con razonamiento alto, lo que pone el 56 de Grok 4.5 a solo un punto de Sol en la configuración alta. El coste los separa: Artificial Analysis ejecutó Sol al máximo en el índice por $1.23 frente a los $0.36 de Grok 4.5. Si eliges por capacidad bruta, gana Sol; si eliges por capacidad por dólar a escala, gana Grok 4.5.

Frente al par del día del lanzamiento, Opus 4.8 y GPT-5.5

Ambos modelos contra los que se midió Grok 4.5 en julio han pasado a ser legado, pero los datos merecen conservarse porque son los únicos head-to-head que xAI publicó. Frente a Opus 4.8, Grok 4.5 ganó en DeepSWE 1.0 y Terminal-Bench 2.1 y perdió en DeepSWE 1.1 y SWE-Bench Pro. Frente a GPT-5.5, el margen en Terminal-Bench 2.1 fue de una décima (83,3% frente a 83,4%), el Coding Agent Index quedó en empate y Grok 4.5 lideró tau3-Banking por 2 puntos a aproximadamente la mitad del coste por tarea ($2.49 frente a $5.07).

Frente a GLM-5.2

Grok 4.5 se sitúa ligeramente por delante de GLM-5.2 en GDPval-AA v2 (Elo 1 543 frente a 1 513). Grok 4.5 lidera en el Intelligence Index general y en tau3-Banking.

Comparación de benchmarks con otros modelos líderes [fuente]

Por qué importa este lanzamiento

Hay tres aspectos del lanzamiento de Grok 4.5 que vale la pena seguir más allá de los números de los benchmarks.

xAI ha alcanzado la frontera de la inteligencia. Grok 4.3 no competía con Anthropic y OpenAI en lo alto de los rankings de capacidades, con un 37 en el Intelligence Index. Grok 4.5 sí lo hace, con 56. Eso cambia la estructura competitiva del mercado de una carrera entre dos a una entre tres.

La eficiencia en costes es real, no solo un descuento de precio. Grok 4.5 es más barato por token, pero también es drásticamente más eficiente en tokens por tarea. Un modelo que produce el mismo resultado en 14 000 tokens cuando un competidor necesita 67 000 no solo es más barato de ejecutar, también es más rápido y genera menos ruido en los flujos de trabajo agénticos. Ambas cosas importan a escala de producción.

El techo de velocidad todavía no se ha alcanzado. 80 tokens por segundo es la cifra actual. Cuando xAI despliegue su stack de inferencia personalizado en C/C++ mapeado al hardware GB300, Musk espera que se duplique o supere. Un modelo ya competitivo en coste y calidad se vuelve significativamente más rápido sin necesidad de ninguna actualización del modelo.

Grok 4.5 está disponible en Fello AI, donde puedes usarlo junto a Claude, ChatGPT, Gemini, DeepSeek y Perplexity en una sola aplicación nativa para Mac, iPhone y iPad, comparando la misma tarea en todos los modelos de frontera con una sola suscripción en lugar de gestionar cuentas separadas. Para contexto sobre lo que viene después de Grok 4.5, el artículo sobre Grok 5 cubre lo que xAI ha señalado sobre la próxima versión principal.

FAQ

¿Cuándo se lanzó Grok 4.5?

xAI lanzó Grok 4.5 el 8 de julio de 2026. Es el primer modelo de xAI diseñado específicamente para programación y trabajo agéntico, entrenado con datos reales de sesiones de desarrolladores de Cursor.

¿Cuánto cuesta Grok 4.5?

El precio de la API es $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. Los aciertos de caché tienen un descuento del 85%, reduciendo la entrada en caché a $0.30 por millón. El precio se duplica para entradas superiores a 200 000 tokens.

¿Es Grok 4.5 mejor que Claude Opus 5?

No en capacidad bruta. Claude Opus 5 obtiene 63 en el Artificial Analysis Intelligence Index frente a los 56 de Grok 4.5, y tiene una ventana de contexto de 1M tokens frente a 500 000. Grok 4.5 gana de forma clara en coste, a $2 / $6 por millón de tokens frente a $5 / $25, y en eficiencia de tokens por tarea completada.

¿Cuál es la ventana de contexto de Grok 4.5?

Grok 4.5 tiene una ventana de contexto de 500 000 tokens, frente al millón de tokens de Grok 4.3. Es el único compromiso claro en una actualización que mejora en todas las demás dimensiones.

¿Puedo usar Grok 4.5 en Fello AI?

Sí. Grok 4.5 está disponible en Fello AI, así que puedes usarlo junto a Claude, ChatGPT, Gemini, DeepSeek y Perplexity en una sola aplicación nativa para Mac, iPhone y iPad, y comparar la misma tarea en todos los modelos de frontera con una sola suscripción.