Mejores modelos de IA en 2026
Clasificaciones, comparativas y análisis a fondo, actualizados cada mes a medida que llegan nuevos modelos.
Anthropic lanzó Claude Opus 5.5 el 22 de septiembre y se lleva la corona de programación. Artificial Analysis lo sitúa en 57,6 en el Intelligence Index v4.3.2, la puntuación más alta que ha publicado nunca y 4,3 puntos por delante de Claude Fable 5.1, y de paso lidera GDPval-AA v2.1, AA-Briefcase v1.1 y Humanity's Last Exam. Lo hace a $4 / $20 por 1M de tokens, por debajo de Claude Opus 5 a $5 / $25, así que el mejor modelo es ahora también el más barato.
OpenAI respondió unos noventa minutos después con GPT-6 Sol y GPT-6 Luna y con ellos partió por la mitad sus precios de API: Sol cuesta $2 / $10 por 1M de tokens y Luna $0,10 / $0,50, y ninguno de los dos está todavía en la ventana de chat de ChatGPT. GPT-6 Astra conserva los dos tableros de programación de Arena, porque Opus 5.5 aún no tiene votos allí, y Claude Fable 5.1 conserva escritura y precisión en los tableros con los que se deciden esas categorías. Esta página clasifica por puntuaciones medidas, así que una corona cambia en cuanto un modelo supera al titular, sin esperar a los tableros basados en votos. Nuestra guía de benchmarks de IA explica cómo se construye ese índice y por qué importa su número de versión.
SpaceXAI lanzó Grok 4.7 el 21 de septiembre sobre un modelo base nuevo y mayor, y queda por encima de Astra en los dos tableros agénticos que publica Artificial Analysis. El Intelligence Index marca 46,3 frente al 44,3 de Grok 4.6 y el precio por tokens no se mueve, $2 / $6, pero una tarea del índice cuesta $2,73 frente a $1,86, porque 4.7 emite alrededor del doble de salida. Salió en la API, en Cursor y en Grok Build; la app de Grok sigue sirviendo 4.6.
El campo abierto también tiene nuevo líder: el MiMo-V2.6-Pro de Xiaomi, publicado el 21 de septiembre bajo MIT puro, puntúa 46,3 y resuelve una tarea del índice por $0,13, lo más barato entre los modelos abiertos de esta página. Abajo están los ganadores por categoría de septiembre de 2026. Haz clic en cualquier tarjeta para ir directo al análisis completo, o usa la navegación fija para saltar entre categorías. Clasificaciones, benchmarks y precios se actualizan en un plazo de 48 horas tras cualquier lanzamiento importante.
¿Quieres los mejores modelos de IA sin hacer malabares con suscripciones separadas? Fello AI reúne los modelos líderes en una sola app nativa para Mac, iPhone y iPad.
Descargar Fello AI22 sep OpenAI GPT-6 Sol y GPT-6 Luna parten por la mitad los precios de API de OpenAI y llegan a todas partes menos al chat de ChatGPT Nuevo
22 sep Anthropic Claude Opus 5.5 se lleva el Intelligence Index con 57,6 y baja el precio de Opus 5 Nuevo
21 sep SpaceXAI Grok 4.7 llega sobre un modelo base mayor a los mismos $2 / $6 y cuesta un 47 % más por tarea Nuevo
21 sep Xiaomi El MiMo-V2.6-Pro de Xiaomi es el modelo abierto con la mayor puntuación jamás medida, a $0,13 por tarea del índice bajo MIT Nuevo
15 sep TypeSafe TypeSafe sale del sigilo con Jev, un modelo que devuelve decisiones tipadas en lugar de texto, a $0.042 por 1M de tokens Nuevo
10 sep DeepSeek DeepSeek retira V4-Flash, lo sustituye por V4.1-Flash y baja la tarifa Flash alrededor de un tercio Nuevo
3 sep OpenAI GPT-6 Astra sale a $10 / $50 y en un día está en Plus y Pro y lidera los tableros de programación Nuevo
2 sep Alibaba Qwen3.8-Max-0902 le quita a Claude Opus 5 el tablero WebDev de Arena por tres puntos, a $2 / $6 Nuevo
2 sep Muse Spark 1.3, Intelligence Index de 57 a 61 con un $1.25 / $4.25 sin cambios, gana en programación y pierde todas las filas de agente Nuevo
2 sep Google Gemini 3.8 Flash, tres puntos más en el Intelligence Index al mismo $0.75 / $3.75 Nuevo
1 sep Anthropic Claude Fable 5.1 y Mythos 5.1, un nuevo #1 en Artificial Analysis con 66 y un recorte del 75 % en las lecturas de caché Nuevo
28 ago Z.ai Los pesos de GLM 5.3 ya están fuera tras la pausa de seguridad, pero la licencia no es MIT Nuevo
28 ago Tencent Tencent Hy4 Preview, 770B de pesos abiertos bajo Apache 2.0 y el mayor modelo permisivo hasta la fecha Nuevo
26 ago Z.ai GLM 5.3 Flash, Ox Alpha desvelado, y los primeros pesos MIT que Z.ai publica desde GLM-5.2 Nuevo
26 ago Alibaba Qwen3.8-Flash-Next, pesos abiertos y el primer vistazo público a la arquitectura Qwen4 Nuevo
21 ago OpenAI GPT-5.6 Sol baja más de un 20 % y queda por debajo de Claude Opus 5 en ambos lados Nuevo
16 ago DeepSeek DeepSeek sube los precios de la API unas cuatro veces y divide la tarifa en horas punta y valle Nuevo
14 ago Z.ai GLM 5.3, un gran salto agéntico solo con post-entrenamiento, lanzado sin los open weights Nuevo
13 ago Google Gemini 3.7 Flash, las puntuaciones de programación suben y el precio se reduce a la mitad hasta $0.75 / $3.75, hasta enero Nuevo
12 ago SpaceXAI Grok 4.6, el post-entrenamiento sube el Intelligence Index de 56 a 61 con $2 / $6 sin cambios Nuevo
5 ago Muse Spark 1.2 y Muse Code, Intelligence Index de 51 a 57 con un $1.25 / $4.25 sin cambios, además de un agente de programación de terminal Nuevo
3 ago Alibaba Qwen 3.8 (Qwen3.8-Max), buque insignia multimodal de 2,4 billones de parámetros ya disponible en general a $2 / $6 Nuevo
Pendiente Google Gemini 3.5 Pro, aún sin lanzar, meses de retraso según Bloomberg Retrasado
Mejor IA para escritura
La mejor IA para escribir es Claude Fable 5.1, y el argumento a su favor es la constancia, no un primer puesto aislado. Es el único modelo entre los seis primeros de los tres tableros de prosa: segundo en EQ-Bench Creative Writing v3 con 2152,7, segundo en LiveBench Language con 89,5 y sexto en el tablero de escritura creativa de Arena. Ningún otro lo consigue. GPT-6 Astra lidera EQ-Bench con 2163,9 pero ocupa el puesto 25 en escritura creativa de Arena; Claude Fable 5 lidera los tableros de texto y de escritura creativa de Arena y encabeza LiveBench Language con 90,7, pero ha caído al octavo puesto en EQ-Bench. Claude Opus 5.5, que el 22 de septiembre le quitó a Fable 5.1 el Intelligence Index y Humanity's Last Exam, está sin valorar en EQ-Bench y en Arena y es octavo en LiveBench Language, así que todavía no tiene ningún argumento en los tableros de escritura y la corona no pasa a él. Si tu escritura es un entregable de trabajo y no prosa, esa es otra pregunta, y el tablero de entregables profesionales GDPval-AA v2.1 lo lidera Claude Opus 5.5 con 1846 por delante de Claude Fable 5.1 con 1735 y de Claude Opus 5 con 1708. Claude Sonnet 5 sigue siendo la mejor relación en el nivel gratuito y Claude Fable 5 la elección si pesas más los votos humanos de Arena que las puntuaciones de harness; Fable 5 cuesta $10 / $50 por 1M de tokens y está incluido de forma permanente en Claude Max y Team Premium con en torno al 50 % de los límites de uso habituales. La traducción es una cuestión aparte con un ganador aparte, que trabajamos en nuestra guía de la mejor IA para traducir.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5.1 | Mejor escritura en general | #2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) y #6 escritura creativa de Arena, la mejor colocación combinada de todos | No lidera ninguno de los tres en solitario; Claude Opus 5.5 se llevó el Intelligence Index y Humanity's Last Exam el 22 de septiembre | $10 / $50 |
| Claude Fable 5 | Encabeza los tableros de votos humanos de Arena | #1 Arena texto en general (1505,7), #1 LiveBench Language (90.7), #8 EQ-Bench | La opción más cara aquí | $10 / $50 |
| Kimi K3 | Ficción creativa y voz | #4 EQ-Bench Creative Writing (2070.6) | Solo #27 en Arena escritura creativa | $3 / $15 |
| Claude Sonnet 5 | Escritura gratuita para el día a día | Gratis y por defecto en claude.ai, contexto 1M | #53 Arena escritura creativa; 75,0 LiveBench Language | $2 / $10, ahora permanente |
| Claude Opus 5 | Entregables profesionales ajustados de precio | #2 GDPval-AA v2.1 con 1708, por delante de Fable 5 (1632) | Por detrás de Fable 5 en Arena texto, por detrás de Fable 5.1 en GDPval-AA v2.1 | $5 / $25 |
| GPT-5.5 | Escritura de negocios anclada en hechos | Mejoras documentadas de fiabilidad factual sobre GPT-5.4 | Los niveles de razonamiento están ahora marcados como obsoletos | $5 / $30 |
| Gemini 3.8 Flash | Borradores en volumen a escala | Intelligence Index 40,9, 308,4 tok/s de salida, contexto 1M | Ajustado a agentes más que a prosa; el precio introductorio se duplica el 1 de enero de 2027 | $0.75 / $3.75 |
La corona de escritura se queda con Claude Fable 5.1, pero su fundamento ha cambiado. Claude Opus 5.5 le quitó el Intelligence Index y Humanity's Last Exam el 22 de septiembre, que era justo lo que citaba esta tarjeta, así que hemos vuelto a fundamentar la elección en los tableros que miden prosa de verdad. En ellos, Fable 5.1 es el único modelo entre los seis primeros de los tres: segundo en EQ-Bench Creative Writing, segundo en LiveBench Language y sexto en el tablero de escritura creativa de Arena. Opus 5.5 está sin valorar en dos de los tres y es octavo en el otro, así que todavía no tiene argumento en escritura. Arena ya ha valorado a Fable 5.1, lo que elimina la salvedad que arrastrábamos el mes pasado de que los tableros de preferencia humana no se habían pronunciado: es quinto en el tablero de texto con 1498,5, donde Claude Fable 5 sigue liderando con 1505,7. GDPval-AA v2.1 se volvió a reanclar y ahora marca 1846 para Opus 5.5, 1735 para Fable 5.1 y 1708 para Opus 5, así que las cifras de este bloque quedan muy por debajo de las que citábamos en agosto.
Mejor IA para chat & asistente diario
La mejor IA para el chat del día a día es GPT-5.6, y la razón honesta es el alcance en lugar de la posición en los tableros. Es el modelo que ChatGPT sirve por defecto a la mayor base de usuarios de la categoría, lo que lo convierte en el mejor asistente que la mayoría de la gente puede abrir de verdad. En preferencia humana pura no es el líder: GPT-5.6 Sol se sitúa #18 en la tabla de texto de Arena con 1483,5, donde Claude Fable 5 lidera con 1505,7. La mayoría de los usuarios de ChatGPT reciben el nivel equilibrado Terra, que OpenAI dice que iguala a GPT-5.5 y, desde el recorte de precios del 30 de julio de 2026, cuesta un 60 % menos. Está disponible dentro de ChatGPT (gratis con límites, Plus a $20/mes, Pro a $100/mes), a través de la API (los niveles de la 5.6: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), y empaquetado dentro de Fello AI junto a Claude, Gemini, Grok y DeepSeek. Una advertencia: la system card de OpenAI y el evaluador METR señalaron un comportamiento de «scheming» elevado en Sol, así que GPT-5.5 Instant sigue siendo la elección más segura para trabajo sensible a las alucinaciones.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| GPT-5.6 | Chat diario, por defecto de ChatGPT | El asistente que la mayoría puede abrir; Terra iguala a GPT-5.5 a ~mitad de coste | #14 en Arena texto; scheming señalado por METR | Gratis / $20/mes Plus; API $0.20 / $1.20 a $4 / $20 |
| Claude Fable 5 | La conversación mejor valorada | #1 en Arena texto general (1505,7) y en cuatro de sus ocho subcategorías | Sin plan gratuito; acceso por créditos de uso en Pro | $10 / $50 API |
| Claude Opus 5 | Respuestas reflexivas y matizadas | Tercero en el Intelligence Index de Artificial Analysis (50,8), por detrás de Claude Fable 5.1 y GPT-6 Astra | #10 en Arena texto, por detrás de Claude Fable 5 | $20/mes Pro, $5 / $25 API |
| GPT-5.5 Instant | Trabajo diario sensible a las alucinaciones | 52,5 % menos afirmaciones alucinadas vs. 5.3 Instant | Los niveles de razonamiento están ahora marcados como obsoletos | $20/mes Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rápido, gratis, multimodal | Sigue siendo el modelo que sirve el nivel gratuito de Gemini, contexto 1M, #12 en Arena texto | Más flojo en el razonamiento más difícil; 3.8 Flash lo supera al mismo precio | Gratis / $0.75 / $3.75 API |
| Fello AI | Todos los mejores modelos, una app | ChatGPT + Claude + Gemini + Grok + DeepSeek y más en Mac, iPhone y iPad | Enrutado por la app, no directo | $9.99/mes |
GPT-5.6 conserva la elección de chat por alcance, y la distancia con el líder de preferencia ha vuelto a ampliarse. Sol está ahora en el puesto 18 del tablero de texto de Arena con 1483,5, desde el 14, mientras que Claude Fable 5 lidera con 1505,7. Nada ha cambiado en el producto, así que la corona no se mueve: sigue tratándose de qué asistente puede abrir de verdad más gente. Dos lanzamientos que de otro modo serían candidatos no lo son: GPT-6 Astra llegó a ChatGPT Business, Pro y Plus a principios de septiembre pero OpenAI no ha anunciado nada para el nivel gratuito, y Claude Opus 5.5, que se llevó el Intelligence Index el 22 de septiembre, es un modelo para la API y para los planes de Claude, no un asistente por defecto para mil millones de personas. OpenAI lanzó GPT-6 Sol y GPT-6 Luna el 22 de septiembre y los puso en ChatGPT Work y Codex, diciendo sin rodeos que todavía no están en Chat, así que la ventana en la que escribe la mayoría sigue con GPT-5.6.
Mejor IA para imágenes
La mejor IA para generar imágenes es ChatGPT Images 2.5, que OpenAI convirtió en predeterminada en todos los planes de ChatGPT el 8 de septiembre y que ahora lidera los cuatro tableros de imagen que seguimos. Sus dos modelos quedan primero y segundo en cada uno: GPT-Image-2.5 Sunburst, construido para la precisión, lidera Arena texto a imagen con 1423,2 y Arena edición de imágenes con 1526,0, y también el Elo de calidad de Artificial Analysis con 1196,8 y su tablero de edición con 1221,3, con el más rápido GPT-Image-2.5 Flare segundo en los cuatro. Es un cambio respecto al mes pasado, cuando Artificial Analysis no había valorado ninguno de los dos y sus tableros contradecían a los de Arena. Aun así, lee la distancia entre Sunburst y Flare como provisional, porque esas posiciones en Arena se apoyan en unos pocos miles de votos cada una frente a los 83.000 y 259.000 de GPT Image 2, y en texto a imagen ambos comparten banda de posición. El segundo es MAI-Image-2.6, tercero en el tablero de edición de Artificial Analysis con 1191,6 y cuarto en el de texto a imagen de Arena con 1334,0, con Muse Image de Meta en tercer lugar. Reve 2.1 mantiene su argumento de maquetación, tipografía y 4K nativo pero ha dejado el podio: es sexto en Arena texto a imagen y decimocuarto en Arena edición de imágenes. Nuestro análisis completo de lo que salió está en ChatGPT Images 2.5.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| ChatGPT Images 2.5 | Imágenes con texto legible | #1 y #2 en los cuatro tableros: Arena texto a imagen (1423,2 / 1401,3), Arena edición (1526,0 / 1481,8), calidad de Artificial Analysis (1196,8 / 1190,4) y edición (1221,3 / 1207,0) | Las posiciones en Arena se apoyan en unos pocos miles de votos | Predeterminado en todos los planes de ChatGPT |
| MAI-Image-2.6 | Editar una imagen que ya tienes | #3 en edición de imágenes de Artificial Analysis (1191,6) y #4 en Arena texto a imagen (1334,0) | Vista previa pública, aún no en Copilot ni en Bing; perdió el liderato de edición de Artificial Analysis ante ChatGPT Images 2.5 | MAI Playground / Microsoft Foundry |
| Muse Image | Edición de imágenes, ecosistema Meta | #5 en edición de imágenes de Artificial Analysis (1171,3) y #7 en su Elo de calidad | Nuevo, con poco utillaje alrededor | App de Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Retratos y productos fotorrealistas | #4 en texto a imagen de Artificial Analysis, por delante de Nano Banana Pro en el de Arena | En la edición de imágenes de Arena, Nano Banana Pro va por delante | Aplicación Gemini / AI Studio |
| Seedream 5.0 Pro | Texto multilingüe + edición por regiones | 10+ idiomas incl. árabe RTL, edición con lazo y capas | En torno al décimo puesto en los tableros independientes; incertidumbre de derechos de autor | BytePlus / Magnific |
| Midjourney v8 | Arte estilizado, ilustración | Base estética que la mayoría de los artistas prefieren | Más flojo en texto dentro de la imagen | $10-$120/mes |
| Grok Imagine | NSFW / modo Spicy | Los límites más permisivos; Arena sitúa su modelo Image 2.0 en el #5 de texto a imagen y en el #4 de edición, y Artificial Analysis lo tiene ahora en el #4 del Elo de calidad | Nada en el registro de lanzamientos muestra que Image 2.0 saliera como producto | $30 al mes SuperGrok |
ChatGPT Images 2.5 conserva la corona de imagen y su argumento se ha reforzado. El mes pasado Artificial Analysis no había valorado ninguno de sus dos modelos de API, así que los tableros que seguimos se contradecían: Arena tenía a Sunburst y Flare primero y segundo mientras Artificial Analysis seguía con GPT Image 2 en cabeza de texto a imagen y con MAI-Image-2.6 de Microsoft en cabeza de edición. Artificial Analysis ya ha valorado a los dos, y allí también quedan primero y segundo, 1196,8 y 1190,4 en el Elo de calidad y 1221,3 y 1207,0 en edición de imágenes. Con eso es #1 y #2 en los cuatro tableros. MAI-Image-2.6 sigue siendo el segundo pero baja al tercer puesto del tablero de edición que antes lideraba, y Grok Imagine Image 2.0 es ahora cuarto en el Elo de calidad de Artificial Analysis y cuarto en el tablero de edición de Arena, mejor posición que el tercer puesto del podio; lo seguimos reportando en vez de coronarlo, porque nada en el registro de lanzamientos muestra que haya salido como producto.
Mejor IA para vídeo
La mejor IA para generar vídeo es Gemini Omni 1.1 Flash, que Google lanzó el 27 de agosto y que lidera el tablero de texto a vídeo de Arena con 1516, justo por delante de su propio predecesor Gemini Omni Flash con 1513. Léelo como un empate: los dos caen dentro de los intervalos de confianza del otro y la propia Arena le da a 1.1 Flash una banda de posición de uno a cuatro. Lo que lo rompe es la especificación, donde 1.1 Flash es claramente el modelo más capaz: extensión de escena en tramos de 10 segundos hasta 40 segundos acumulados, control del primer y último fotograma, referencias de vídeo, borradores a 360p y salida a 1080p o 4K, a unos $0,03 por segundo en 360p, $0,10 en 720p, $0,15 en 1080p y $0,30 en 4K. Gemini Omni Flash sigue siendo la opción más barata, en torno a $0,10 por segundo, pero se queda en clips de 10 segundos. Dos límites que conviene saber. Artificial Analysis no ha valorado 1.1 Flash en absoluto; en su tablero de texto a vídeo lidera el más antiguo Omni Flash con 1512,8 por delante del Wan 3.0 de Alibaba con 1431,4 y de MiniMax H3 con 1407,7. Y en el tablero de imagen a vídeo de Arena 1.1 Flash es segundo con 1488,5 por detrás de MiniMax H3 con 1495,4, así que la corona se apoya en texto a vídeo y en la especificación, no en un barrido. Si necesitas tomas más largas dentro de las herramientas de Google, Veo 3.1 sigue funcionando en la app de Gemini, en AI Studio y en Vertex AI con audio nativo y salida a 1080p. MiniMax H3 (31 de julio) sigue siendo el rival en especificación, con clips en 2K de 4 a 15 segundos y audio estéreo nativo desde $0,13 por segundo.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash | Mejor vídeo con IA en general | #1 Arena texto a vídeo (1516); extensión de escena a 40 segundos, salida en 4K | Sin valorar por Artificial Analysis; segundo tras MiniMax H3 en Arena imagen a vídeo | $0,03-$0,30/s; Gemini API / AI Studio / Flow |
| Gemini Omni Flash | Clips de diez segundos más baratos | #2 Arena texto a vídeo (1511), #2 vídeo de AA (1238); edición conversacional | Se queda en generaciones de diez segundos | ~$0.10/s; app Gemini / AI Studio |
| Wan 3.0 | Vídeo a partir de documentos y diapositivas | #1 en el tablero de vídeo de Artificial Analysis (1239); 2-30 s, hasta 1080p, entrada Omni-Reference | Solo API, sin pesos publicados; #3 en Arena | $0.05-$0.20/s |
| MiniMax H3 | Clips 2K con audio nativo | 4-15 s en 2K, audio estéreo nativo; #8 Arena texto a vídeo (1462) | #4 en vídeo de AA (1227); los pesos abiertos excluyen el escalador 2K y exigen solicitud en EE. UU., la UE, el Reino Unido y Corea del Sur | $0.13/s en 2K |
| Dreamina Seedance 2.5 | Aspirante de ByteDance | #6 Arena texto a vídeo (1482); lidera imagen a vídeo con audio | Ecosistema ByteDance, acceso occidental limitado | Dreamina / BytePlus |
| Muse Video | Vídeo en el ecosistema Meta | #3 texto a vídeo con 1459 | El más nuevo del grupo, herramientas escasas | Aplicación Meta AI |
| Veo 3.1 | Clips de producción más largos | Audio nativo, 1080p, fuerte consistencia física | #6 en Arena vídeo, no el líder de calidad | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Iteración rápida a menor coste | 4K nativo, 60fps, clips de 15 segundos; Turbo salió el 17 de junio | Fuera del top 16 en Arena texto a vídeo | Desde $10/mes |
| Luma Ray 3 | Escenas fotorrealistas | Fuerte realismo para paisajes | Comunidad más pequeña | Gratis / desde $9.99/mes |
Gemini Omni 1.1 Flash conserva la corona de vídeo, pero el panorama a su alrededor es más enredado de lo que daba a entender la entrada del mes pasado. Sigue liderando el tablero de texto a vídeo de Arena, 1516 frente a los 1513 de Gemini Omni Flash, y Arena le da una banda de posición de uno a cuatro, así que sigue siendo un empate resuelto por capacidad. Dos cosas que contamos en agosto han cambiado. Artificial Analysis reancló su Elo de vídeo y el viejo trío 1239 / 1238 / 1235 ya no existe: Gemini Omni Flash lidera ahora ese tablero con 1512,8 por delante de Wan 3.0 con 1431,4 y de MiniMax H3 con 1407,7, y Artificial Analysis sigue sin valorar 1.1 Flash en absoluto. Y MiniMax H3 se ha puesto en cabeza del tablero de imagen a vídeo de Arena con 1495,4, empujando a 1.1 Flash al segundo puesto con 1488,5, el primer tablero que pierde esta corona.
Mejor IA para programación
La mejor IA para programar es Claude Opus 5.5, que Anthropic lanzó el 22 de septiembre y que lidera todos los harnesses de programación que seguimos: la propia ejecución de Terminal-Bench 4.0 de Artificial Analysis con 59,6 % frente al 59,1 % de GPT-6 Astra, LiveBench Coding con 89,3 frente a 80,4 y LiveBench Agentic Coding con 71,7 frente a 57,3. Lo hace a $4 / $20 por 1M de tokens, menos de la mitad del precio de lista de los dos modelos que encabezaban esta tabla el mes pasado, con lecturas de caché a $0,20, y según las pruebas de la propia Anthropic una carga de trabajo típica cuesta un 40 % menos que en Claude Opus 5. La ejecución interna de Terminal-Bench 4.0 de Anthropic amplía aún más la distancia, 66,4 % frente al 57,9 % que OpenAI reporta para Astra, junto a un 54,4 % en FrontierCode v1.1 y un 57,8 % en CursorBench 4.0. GPT-6 Astra conserva los dos tableros de programación de Arena, WebDev con 1793 e imagen a WebDev con 1733, porque Opus 5.5 todavía no tiene ni un voto en Arena, y ese es el reparto honesto aquí: OpenAI lidera en preferencia humana, Anthropic en todos los harnesses medidos. Lea con cuidado el margen de medio punto en Terminal-Bench, porque la propia Anthropic reporta un error estándar de unos 2,6 puntos en ese benchmark, así que trátelos como iguales ahí y deje que decidan los tableros de LiveBench y el precio. Claude Fable 5.1 es segundo en los dos tableros de Arena y tercero en los harnesses. El Qwen3.8-Max-0902 de Alibaba mantuvo el tablero WebDev de Arena unos tres días a principios de septiembre y ahora es quinto con 1662. Entre los pesos abiertos el panorama cambió el 21 de septiembre: el MiMo-V2.6-Pro de Xiaomi logra un 34,8 % en Terminal-Bench 4.0 bajo MIT puro a $0,13 por tarea del índice, mientras que GLM-5.3 sigue siendo el modelo abierto más fuerte en ese harness con un 41,9 % y Kimi K3 es el modelo abierto mejor situado en Arena WebDev, séptimo con 1658, con solo un 12,6 % en el harness. Artificial Analysis ha retirado tanto su Coding Index como su Coding Agent Index, así que las dos clasificaciones compuestas de programación que esta página citaba ya no existen.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5.5 | Mejor programación en general | #1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) y #1 LiveBench Coding (89,3) | Aún sin votos en Arena, así que Astra conserva sus dos tableros de programación | $4 / $20 |
| GPT-6 Astra | Cima de los dos tableros de programación de Arena | #1 Arena WebDev (1793) y #1 imagen a WebDev (1733); 59,1 % Terminal-Bench 4.0 | 2,5 veces el precio de Opus 5.5 y por detrás de él en todos los harnesses | $10 / $50 |
| Claude Fable 5.1 | Mayor puntuación compuesta antes de Opus 5.5 | #2 en los dos tableros de programación de Arena; Intelligence Index 53,4; AA-Briefcase 1678 | 52,0 % Terminal-Bench 4.0; 2,5 veces el precio de Opus 5.5 | $10 / $50 |
| Claude Opus 5 | Sustituido por Opus 5.5 | 49,0 % Terminal-Bench 4.0 y #3 en los dos tableros de programación de Arena | Cuesta más por token que Opus 5.5 y puntúa siete puntos menos | $5 / $25 |
| Claude Fable 5 | Trabajo agéntico más duro y de horizonte largo | Intelligence Index 49,6; 42,4 % Terminal-Bench 4.0; contexto de 1M | El más caro por tarea del índice en esta tabla, $8,75; #6 en Arena imagen a WebDev | $10 / $50 |
| Qwen3.8-Max-0902 | Breve dueño del tablero WebDev de Arena | #5 Code Arena: WebDev (1662); Intelligence Index 45,4; 2,4 billones de parámetros, contexto de 1M | Solo API de QwenCloud, sin interfaz de consumo; perdió el liderato de WebDev en días | $2 / $6 |
| Kimi K3 | Modelo abierto mejor situado en Arena | #7 Arena WebDev (1658), la mejor posición abierta en ese tablero; 2,8 billones/104.000 millones activos | Solo 12,6 % en Terminal-Bench 4.0; 1,56 TB para alojarlo | $3 / $15 |
| GPT-5.6 Sol | El buque insignia barato de OpenAI | Intelligence Index 47,0; 39,9 % Terminal-Bench 4.0 | Sustituido por GPT-6 Sol, que puntúa más alto a mitad de precio; METR le señaló manipulación de evaluaciones | $4 / $20 |
| GPT-6 Sol | Programación con GPT-6 barata en Codex | Intelligence Index 47,5 (v4.3.2) y 43,9 % en Terminal-Bench 4.0, ambos por encima de GPT-5.6 Sol y a mitad de precio | Sin votos en Arena; solo en Codex y ChatGPT Work, no en Chat | $2 / $10 |
| Muse Spark 1.3 | Programación agéntica barata | Intelligence Index 48,1 a $1,25 / $4,25 y $1,60 por tarea del índice | 33,3 % en Terminal-Bench 4.0; las victorias en programación salen del gráfico de la propia Meta, medido en una variante max solo para socios | $1,25 / $4,25 |
| Grok 4.7 | Programador barato con buena relación | 46,3 % CursorBench 4.0 y 71,0 % DeepSWE v1.1 según las cifras de la propia SpaceXAI; Intelligence Index 46,3 | 24,7 % en Terminal-Bench 4.0; los prompts de 200K tokens o más refacturan la petición entera al doble | $2 / $6 |
| Gemini 3.8 Flash | Programación agéntica a escala | Intelligence Index 40,9; 308,4 tokens de salida por segundo | 19,7 % en Terminal-Bench 4.0; el precio de lanzamiento se duplica el 1 de enero de 2027 | $0,75 / $3,75 |
| GLM 5.3 Flash | El programador serio más barato que puedes alojar | 32,8 % Terminal-Bench 4.0 a $0,25 por tarea del índice; MIT, 320.000 millones/18.000 millones activos | GLM-5.3 llega al 41,9 % en el mismo harness; sin producto de consumo | Pesos abiertos (MIT) |
| MiMo-V2.6-Pro | El mayor Intelligence Index abierto | 46,3 en v4.3.2 y 34,8 % Terminal-Bench 4.0 a $0,13 por tarea del índice; MIT, 1,02 billones/42.000 millones activos | Publicado el 21 de septiembre, así que aún no tiene votos en Arena ni historial independiente | $0,435 / $0,87 |
La corona de programación pasó a Claude Opus 5.5, cuatro días después de pasar a GPT-6 Astra. Anthropic lo lanzó el 22 de septiembre y lidera todos los harnesses de programación que seguimos: 59,6 % frente al 59,1 % de Astra en la propia ejecución de Terminal-Bench 4.0 de Artificial Analysis, 89,3 frente a 80,4 en LiveBench Coding y 71,7 frente a 57,3 en LiveBench Agentic Coding, a $4 / $20 frente a $10 / $50. Astra conserva los dos tableros de programación de Arena porque Opus 5.5 todavía no tiene votos allí, así que esto es un reparto y no un barrido. El margen en Terminal-Bench es de medio punto frente a un error estándar que Anthropic sitúa en torno a 2,6, de modo que lo que decide de verdad son los tableros de LiveBench y el precio. Claude Opus 5 abandona el podio: Opus 5.5 cuesta menos por token, gasta menos tokens y puntúa siete puntos más en el Intelligence Index, lo que deja el viejo argumento de valor de Opus 5 no ya debilitado sino obsoleto. El MiMo-V2.6-Pro de Xiaomi y el Grok 4.7 de SpaceXAI entran en la tabla, y todas las cifras del índice en esta página se han movido a v4.3.2, por lo que quedan ligeramente por debajo de las del mes pasado. GPT-6 Sol entra en la tabla el mismo día a $2 / $10: Artificial Analysis lo mide en 47,5 en el índice y en un 43,9 % en Terminal-Bench 4.0, por encima de GPT-5.6 Sol en ambos y a mitad de precio, pero muy por detrás de Opus 5.5, y llega a los desarrolladores por Codex y no por la ventana de chat.
Mejor IA para creatividad
La mejor IA para trabajo creativo sin filtros y a la última es Grok 4.7, y queremos ser exactos sobre por qué. Esta elección va de la línea de producto, no de la calidad de la prosa. Grok lleva las menores restricciones de contenido de cualquier modelo de frontera y la única integración nativa con X en tiempo real, lo que lo convierte en el único modelo que entra en encargos atrevidos, de actualidad o deliberadamente provocadores que los demás rechazan. Lea la disponibilidad con cuidado: SpaceXAI lanzó Grok 4.7 el 21 de septiembre en la API de Grok, Cursor, Grok Build, harnesses de terceros y routers en la nube, y su anuncio no dice nada de la app de consumo, que sigue sirviendo Grok 4.6 a los suscriptores de SuperGrok y X Premium+ por $30 al mes. No es el mejor escritor. Arena ya ha valorado a Grok 4.6 y ocupa el puesto 32 del tablero de escritura creativa, por delante de Grok 4.5 en el 36 pero por detrás del más antiguo Grok 4.20-beta1 en el 23. EQ-Bench no ha valorado ni 4.6 ni 4.7, y en ese tablero Grok 4.5 está en el puesto 46 con 1576,0, ahora justo por delante de Grok 4.20-beta en lugar de por detrás. Como SpaceXAI orientó ambos lanzamientos a programación y trabajo agéntico y no a la prosa, no damos por hecho que 4.7 haya movido nada aquí. Si eliges solo por calidad de salida, Claude Fable 5 sigue liderando el tablero de escritura creativa de Arena, mientras que EQ-Bench pone primero a GPT-6 Astra con 2163,9, segundo a Claude Fable 5.1 y cuarto a Kimi K3. Elige Grok por lo que te dejará hacer, no por lo bien que escribe.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Grok 4.7 | Sin filtros, con opinión, a la última | Menos restricciones de contenido, anclaje nativo en X en tiempo real | Ningún tablero de escritura creativa lo ha valorado; Grok 4.6 está en el #32 de escritura creativa de Arena | $2 / $6 API; app SuperGrok de $30 al mes, aún en 4.6 |
| Claude Fable 5 | Prosa creativa de máxima calidad | #1 Arena escritura creativa, #1 LiveBench Language | Límites cautelosos ante encargos atrevidos | $10 / $50 API |
| Kimi K3 | Ficción y voz propia | #4 EQ-Bench Creative Writing con 2070,6 | Solo #27 en escritura creativa de Arena | $3 / $15 |
| Claude Opus 5 | Creatividad estructurada de formato largo | Mantiene hilos largos y se autoedita; Intelligence Index 50,8, por detrás de Claude Fable 5.1 y GPT-6 Astra | El más cauteloso del grupo | $20/mes Pro; $5 / $25 API |
| Gemini 3.1 Pro | Creatividad multimodal | Fuerte cadena de texto, imagen y vídeo | Cuotas dentro de la aplicación de Gemini | Gratis / $2.00-$4.00 API entrada |
| Grok Imagine (Spicy Mode) | NSFW / creatividad para adultos | La generación de imágenes más permisiva | Caso de uso de nicho | $30/mes SuperGrok |
Grok conserva esta elección, ahora con Grok 4.7, que SpaceXAI lanzó el 21 de septiembre sobre un modelo base nuevo y más grande. Nada ha cambiado en la permisividad del producto ni en su acceso en vivo a X, que es en lo que se apoya la elección. El modelo de debajo vuelve a ser más fuerte, 46,3 en el Intelligence Index frente al 44,3 de Grok 4.6, pero esa mejora cayó en programación y trabajo agéntico, no en prosa, y ningún tablero de escritura creativa ha valorado el 4.7. Una corrección respecto a la entrada del mes pasado: Arena ya ha valorado a Grok 4.6, que ocupa el puesto 32 de su tablero de escritura creativa, así que la frase de que ninguno de los dos tableros lo había valorado ya no se sostiene. Fíjate también en la disponibilidad partida, porque para esta categoría importa: el 4.7 está en la API, en Cursor y en Grok Build, mientras que la app de Grok de $30 al mes, que es de lo que va realmente el argumento de la permisividad, sigue sirviendo 4.6. Claude Fable 5 sigue siendo el modelo al que acudir cuando quieres la mejor escritura.
Mejor IA para precisión & investigación
La mejor IA para precisión e investigación es Claude Fable 5.1, que tiene la mayor precisión factual que ha medido Artificial Analysis, un 67 % en AA-Omniscience. Esa es exactamente la columna con la que se decide esta categoría, y superó una prueba dura el 22 de septiembre: Claude Opus 5.5 batió a Fable 5.1 en casi todo lo demás, incluidos Humanity's Last Exam con 61,4 % frente a 59,1 % y el índice AA-Omniscience penalizado por alucinaciones con 46,4 frente a 43,5, pero en precisión factual bruta marca 66 % frente al 67 % de Fable 5.1. Trata ese punto de diferencia por sí solo como un empate y lee los dos juntos: Opus 5.5 es la mejor apuesta cuando una respuesta equivocada es peor que ninguna, y Fable 5.1 cuando quieres acertar el mayor número de hechos. La elección por valor es Gemini 3.1 Pro, y sigue siendo a lo que acudiríamos cuando importa el coste. Su mejor resultado está en ARC-AGI-1 de ARC Prize, donde saca un 98 % e iguala al panel humano, y lo hace a $0,52 por tarea, aunque Claude Fable 5 y GPT-6 Astra ya han superado al panel con un 98,5 %. Lo combina con anclaje nativo en Google Search, que es lo que quieres cuando la respuesta tiene que ser actual y no solo plausible. También saca un 94,1 % en GPQA Diamond, donde GPT-5.6 Sol ahora lo iguala en lugar de quedarse atrás, y un 44,4 % en Humanity's Last Exam, y un 46,44 en el tablero HLE de Scale SEAL, que ahora lidera Claude Fable 5 con un 55,5 %. Dos salvedades honestas. En búsqueda anclada concretamente, el tablero de búsqueda de Arena lo lidera OpenAI y no Google ni Anthropic: GPT-5.6 Sol encabeza con 1257, con Claude Fable 5 quinto y Gemini 3.1 Pro con anclaje noveno. Y en razonamiento novedoso la corona está en otra parte por completo, porque GPT-6 Astra lidera tanto ARC-AGI-2 como ARC-AGI-3. No movimos esta corona a Claude Opus 5 porque Artificial Analysis mide su tasa de alucinación en el 50 % y lo sitúa muy por debajo de los dos modelos Fable en AA-Omniscience.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| Claude Fable 5.1 | La mayor precisión factual medida | 67 % de precisión factual en AA-Omniscience, la mayor que ha medido Artificial Analysis, un punto por encima de Claude Opus 5.5 | Sin nivel barato; sin valorar en el tablero de búsqueda de Arena; Opus 5.5 lidera Humanity's Last Exam y el índice AA-Omniscience | $10 / $50 |
| Gemini 3.1 Pro | Mejor valor, trabajo factual barato | 98 % ARC-AGI-1 (iguala al panel humano) a $0.52/tarea, 94,1 % GPQA (igualado por Sol) | ARC-AGI-2 77,1 % ahora ~14º; #9 en Arena búsqueda | $2.00-$4.00 / $12.00-$18.00 (escalonado) |
| Claude Fable 5 | Búsqueda anclada | #5 en la tabla de búsqueda de Arena, por detrás de GPT-5.6 Sol | Ningún nivel barato único | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Razonamiento novedoso | #3 ARC-AGI-2 con 92,5 %, por detrás de GPT-6 Astra (95 %) y Claude Opus 5.5 (93,3 %) | Scheming señalado por METR | $4 / $20 |
| Claude Opus 5 | Los problemas inéditos más difíciles | #1 ARC-AGI-3 con 30 %, ~3,75 veces el siguiente modelo (ARC Prize) | Artificial Analysis mide una tasa de alucinación del 50 % | $5 / $25 |
| Qwen 3.7 Max | Precisión frontier a precio de valor | 92,4 GPQA Diamond, 200 solicitudes gratis/día | Solo API, sin front-end de chat | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Opus 4.6 | Honestidad bajo presión | #1 en el tablero MASK de Scale SEAL con 96,28; Anthropic ocupa el top 5 | Reemplazado como buque insignia | Modelo legacy de Anthropic |
La corona de precisión se queda con Claude Fable 5.1, y se puso a prueba de verdad. Claude Opus 5.5 llegó el 22 de septiembre y se llevó Humanity's Last Exam con 61,4 % frente a 59,1 % y el índice AA-Omniscience penalizado por alucinaciones con 46,4 frente a 43,5, pero esta categoría se decide por la columna de precisión factual bruta y ahí Fable 5.1 sigue marcando 67 % frente al 66 % de Opus 5.5. Es un punto de diferencia, así que el bloque dice ya sin rodeos que los dos se reparten el asunto en lugar de fingir que Fable 5.1 barre: usa Opus 5.5 cuando una respuesta equivocada es peor que ninguna, y Fable 5.1 cuando quieres acertar el mayor número de hechos. Además, dos correcciones respecto a la entrada del mes pasado. Decía que GPT-5.6 Sol lideraba ARC-AGI-2 y que Claude Opus 5 lideraba ARC-AGI-3; GPT-6 Astra lidera los dos desde su lanzamiento del 3 de septiembre, como ya decía el bloque de resolución de problemas, y esa contradicción ha desaparecido. Y ARC-AGI-1 ha pasado por encima del panel humano: Claude Fable 5 y GPT-6 Astra sacan ambos un 98,5 % donde el panel de 2025 saca un 98 %, así que el 98 % de Gemini 3.1 Pro a $0,52 por tarea sigue siendo cierto y sigue siendo el argumento de valor, pero ya no es la cima de ese tablero. El otro movimiento del mes en precisión es GPT-6 Sol, y ocurre por debajo de la corona: Artificial Analysis mide su tasa de alucinación en el 60 % frente al 92 % de GPT-5.6 Sol, mientras la precisión factual pura baja del 59 % al 55 %, lo que eleva su índice AA-Omniscience de 22,0 a 27,1.
Mejor IA para resolución de problemas
La mejor IA para resolver problemas difíciles es GPT-6 Astra, que le quitó a GPT-5.6 Sol los tableros de razonamiento a los pocos días de lanzarse. Lidera LiveBench Reasoning con 92,65 y ARC-AGI-2 con un 95 %, la puntuación más alta que nadie ha logrado frente al panel humano del 100 % de ese tablero, y es tercera en LiveBench Mathematics con 96,81 por detrás del 97,08 de Claude Opus 5.5 y del 97,01 de Claude Fable 5.1. También declara un 97,6 % en FrontierMath Tier 4 v2, una cifra que conviene leer junto a la revelación de Epoch AI de que OpenAI financió el benchmark y tiene acceso exclusivo a parte de él. El inconveniente es el precio y el alcance: $10 / $50 por 1M de tokens frente a los $4 / $20 de Sol, y requiere un plan de pago de ChatGPT. GPT-5.6 Sol es la alternativa de valor, tercero en ambos tableros de LiveBench con 96,20 y 91,65 y tercero en ARC-AGI-2 desde que Claude Opus 5.5 marcó 93,3 %. GPT-6 Sol cuesta la mitad, $2 / $10, y lo supera en el índice de Artificial Analysis, pero ningún tablero de razonamiento lo ha valorado todavía. Qwen 3.7 Max es la opción económica para problemas de competición con 97,1 en el índice HMMT de febrero de 2026 y 44,5 en Apex, con 200 consultas gratuitas al día. Claude Opus 5 sigue siendo la alternativa para cadenas largas de razonamiento agéntico, aunque Astra también le ha quitado ARC-AGI-3.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| GPT-6 Astra | Matemáticas, ciencia y razonamiento más duros | #1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3 | Requiere un plan de pago de ChatGPT; 2,5 veces el precio de Sol | $10 / $50 |
| Claude Opus 5 | Cadenas largas de razonamiento agéntico | #2 AA-Briefcase (1673) y #2 GDPval-AA v2.1 (1708); 30,2 % ARC-AGI-3 | Astra lidera ahora ARC-AGI-3; 50 % de tasa de alucinación | $5 / $25 |
| GPT-5.6 Sol | Buque insignia STEM asequible | #3 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) y Reasoning (91,65) | FrontierMath aún sin publicar; METR señaló comportamiento tramposo | $100/mes ChatGPT Pro; API $4 / $20 |
| GPT-6 Sol | El mismo nivel a mitad de precio | Intelligence Index 47,5 (v4.3.2) frente al 47,0 de GPT-5.6 Sol, a $1,06 por tarea del índice frente a $1,99 | Ni LiveBench ni ARC Prize lo han valorado, así que aquí no tiene ningún tablero | $2 / $10 |
| Qwen 3.7 Max | Matemáticas de competición con presupuesto ajustado | 97,1 HMMT 2026 feb, 44,5 Apex, 200 solicitudes gratis/día | Solo API | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Fable 5 | Matemáticas dentro de un flujo de programación | #1 en la subcategoría de matemáticas de Arena (1543), 96,0 LiveBench Mathematics | La opción más cara aquí | $10 / $50 |
| GLM 5.3 Flash | Resolución de problemas open-weight | Intelligence Index 41,8 bajo MIT, casi ocho puntos por encima de GLM-5.2 con menos de la mitad de tamaño; 320B/18B activos, contexto 1M | Necesita un servidor multi-GPU, no una estación de trabajo; GLM 5.3 puntúa más alto según las propias cifras de Z.ai y se puede descargar desde el 28 de agosto, pero con más del doble de tamaño y bajo una licencia propia | Open weights (MIT) |
La corona de resolución de problemas pasó a GPT-6 Astra, que se llevó los tableros con los que se decide esta categoría a los pocos días de su lanzamiento del 3 de septiembre. Lidera LiveBench Reasoning con 92,65 frente al 91,65 de GPT-5.6 Sol, se lleva ARC-AGI-2 con un 95 % frente al 92,5 % de Sol y desplazó a Claude Opus 5 en ARC-AGI-3, donde su 62,7 % en el harness estándar supera el 30,2 % de Opus 5. Lee las cifras de ARC-AGI-3 con cuidado: ese tablero mide eficiencia de acción a nivel humano en entornos no vistos, no problemas resueltos, y el 98,6 % tan citado viene de un harness con adaptador de proveedor, no del estándar. Sol baja al tercer puesto en ambos tableros de LiveBench pero sigue siendo la alternativa de valor a $4 / $20 frente a los $10 / $50 de Astra, y LiveBench Mathematics ha cambiado de manos dos veces desde entonces, a Claude Fable 5.1 con 97,01 y el 22 de septiembre a Claude Opus 5.5 con 97,08. Después se movieron dos cosas. ARC Prize puntuó a Claude Opus 5.5 con un 93,3 % en ARC-AGI-2, lo que baja a GPT-5.6 Sol al tercer puesto de ese tablero, y el 22 de septiembre llegó GPT-6 Sol a $2 / $10, la mitad de lo que cuesta el nivel 5.6, con un Intelligence Index más alto pero todavía sin nota propia en LiveBench ni en ARC Prize.
Mejor agente de IA
El mejor agente de IA es Gemini Spark si lo quieres en la nube y Claude Cowork si lo quieres en tu escritorio. Son elecciones conjuntas, no un primero y un segundo: Spark corre en una VM de Google Cloud, así que sigue trabajando con el portátil cerrado, integrado con Gmail, Docs y, desde principios de septiembre, Google Fotos; Cowork corre en tu Mac o tu PC con Windows y maneja tus aplicaciones locales y tu pantalla. Ningún tablero independiente enfrenta a los dos productos, así que la elección va de dónde tiene que ocurrir el trabajo y no de quién puntúa más. El precio tampoco desempata ya: Spark llega ahora al nivel Google AI Pro de $19.99/mes en EE. UU. y en más de 160 países más, y Cowork se incluye sin coste adicional en todos los planes de pago de Claude desde $20/mes. ChatGPT Codex Mobile (14 de mayo) es la alternativa para el trabajo de agente de programación, y los agentes de navegador tipo OpenAI Operator para tareas web. Lee la comparativa completa de Gemini Spark y Claude Cowork.
| Agente | Mejor para | Dónde se ejecuta | Fortaleza | Precio |
|---|---|---|---|---|
| Gemini Spark | Tareas en la nube 24/7, flujos de Workspace | VM de Google Cloud (siempre activa) | Primer agente 24/7 real, integración profunda con Workspace | Desde $19.99/mes Google AI Pro |
| Claude Cowork | Escritorio, manejo de apps, diseño + código | Tu escritorio Mac/Windows | Maneja apps locales, ve tu pantalla | $20/mes Claude Pro |
| ChatGPT Codex Mobile | Agente de programación en el móvil | Nube de OpenAI + iOS/Android | Aprobar diffs y redirigir el trabajo desde el móvil | Incluido en los planes de ChatGPT |
| Grok Agentic (Grok 4.7) | Investigación en tiempo real, scraping de X | Nube de SpaceXAI | Integración nativa con X; Elo 1695 en GDPval-AA v2.1, cuarto entre modelos distintos | $30 al mes SuperGrok, aún en 4.6 |
| OpenAI de clase Operator | Tareas de navegador, formularios web | Nube de OpenAI + tu navegador | Automatización web | ChatGPT Pro |
No ha salido ningún producto de agente de consumo nuevo, así que las coronas no se mueven: Gemini Spark (nube) y Claude Cowork (escritorio) siguen siendo elecciones conjuntas separadas por dónde corre el agente. Spark sí se amplió: llegó al plan Google AI Pro de $19,99 al mes y ganó Google Fotos, donde puede buscar, editar, curar y ejecutar flujos programados. La capa de modelos de debajo se movió mucho, y casi todo fue el 22 de septiembre. Claude Opus 5.5 lidera ahora los dos tableros agénticos que publica Artificial Analysis: AA-Briefcase v1.1 con 1822 frente a los 1678 de Claude Fable 5.1 y los 1673 de Claude Opus 5, y GDPval-AA v2.1 con 1846 frente a 1735 y 1708. Además iguala a GPT-6 Astra en Terminal-Bench 4.0 a $4 / $20 frente a $10 / $50, lo que lo convierte en el modelo sobre el que la mayoría de los equipos debería construir ahora, en lugar de la recomendación de Opus 5 que llevaba este bloque. La Agent Arena de Arena no lo ha valorado, y allí sigue liderando Claude Fable 5.1 la finalización de tareas con un 19,8 %, con GPT-6 Astra segundo con un 17,7 %, DeepSeek V4.1-Flash tercero y Claude Opus 5 cuarto. El otro movimiento es el Grok 4.7 de SpaceXAI (21 de septiembre): 1695 en GDPval-AA v2.1 y 1657 en AA-Briefcase lo colocan cuarto y séptimo, por encima de GPT-6 Astra en ambos, aunque llega a la API, a Cursor y a Grok Build y no a un producto de agente de consumo. El Muse Spark 1.3 de Meta queda quinto entre modelos distintos en GDPval-AA v2.1 con 1674, por debajo de Grok 4.7 y no por encima como informamos el mes pasado, y Scale SEAL sigue habiendo valorado solo el más antiguo 1.1, que lidera su tablero de uso de herramientas MCP Atlas con 88,1. GLM 5.3 Flash (26 de agosto, MIT) sigue siendo el modelo agéntico abierto que alojaríamos, con AutomationBench 48,8 en el gráfico de la propia Z.ai donde Claude Opus 4.8 saca 41,0; en la señal de finalización de tareas de la Agent Arena GLM-5.2 está decimoséptimo y Kimi K3 quinto, y el modelo abierto mejor situado es DeepSeek V4.1-Flash en tercer lugar.
Los modelos líderes como ChatGPT, Claude y Gemini, juntos en Mac, iPhone y iPad.
Gratis para empezar, 4,7★ en más de 27 000 reseñas.
Descargar Fello AIMejor IA para estudiantes
La mejor IA para estudiantes es GPT-5.6 Luna dentro de ChatGPT para trabajo de curso general y Gemini 3.6 Flash dentro de la aplicación de Gemini para STEM y estudio multimodal, con Qwen 3.7 Max como alternativa por API para conjuntos de problemas más difíciles (200 solicitudes gratis al día) y Claude Opus 5 como alternativa para editar ensayos. La mayoría de los estudiantes no necesita pagar, y el nivel gratuito mejoró el 6 de agosto: GPT-5.6 Luna pasó a ser el modelo por defecto de ChatGPT Free y Go, con chats de texto ilimitados y un botón Think para preguntas más difíciles, aunque las subidas de archivos y las herramientas de imagen siguen limitadas. El 22 de septiembre OpenAI añadió GPT-6 Luna para los usuarios de Free y Go en la app de escritorio de ChatGPT, un modelo de la generación actual en el nivel gratuito desde el primer día, aunque en el índice de Artificial Analysis saca los mismos 37,3 que GPT-5.6 Luna. Gemini 3.6 Flash sigue siendo lo que sirve la aplicación gratuita de Gemini, Claude Sonnet 5 es el Claude gratuito por defecto, y DeepSeek V4 es gratis en el sitio de chat de DeepSeek. Luna es el miembro más barato de la familia GPT-5.6, no el más fuerte, así que recurre al botón Think o cambia a GPT-5.5 cuando un ensayo necesite más cuidado. Para trabajar paso a paso las matemáticas más duras, GPT-5.6 Sol es el buque insignia de pago de OpenAI y GPT-6 Astra ahora declara un 97,6 % en FrontierMath Tier 4 v2 frente al 39,6 % verificado de GPT-5.5 Pro, aunque Astra todavía no está en el nivel gratuito de ChatGPT; Qwen 3.7 Max es la alternativa de valor con 97,1 en el índice HMMT de febrero de 2026 y precios de API de $1,25 / $3,75 en su promoción actual del 50 % ($2,50 / $7,50 de lista).
| Tarea | Mejor modelo | Por qué | ¿Gratis? | Alternativa |
|---|---|---|---|---|
| Ensayos & trabajo de curso | GPT-5.6 Luna | Por defecto y gratis en ChatGPT desde el 6 de agosto; chats de texto ilimitados, y GPT-6 Luna en la app de escritorio desde el 22 de septiembre | Sí | Claude Sonnet 5 (Claude gratis) |
| Resolución de problemas STEM | GPT-5.6 Sol / Qwen 3.7 Max | Buque insignia STEM de pago; Astra declara 97,6 % en FrontierMath Tier 4 v2 / 97,1 HMMT feb 2026 | Pro de pago / Qwen API de pago | Gemini 3.6 Flash (gratis) |
| Investigación & precisión | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje nativo en Google Search | Sí (aplicación Gemini) | Claude Opus 5 |
| Edición de escritura | Claude Sonnet 5 | Gratis y por defecto en claude.ai; Claude Fable 5 es el líder de calidad | Sí (Claude gratis) | Claude Fable 5 |
| Estudio multimodal (PDF, diapositivas, imágenes) | Gemini 3.6 Flash | Contexto 1M, gratis en la aplicación de Gemini | Sí | NotebookLM (Google) |
El nivel gratuito es lo que se movió en esta guía. El 6 de agosto OpenAI convirtió GPT-5.6 Luna en el modelo por defecto de ChatGPT Free y Go y dio a ambos chats de texto ilimitados más un botón Think para preguntas más difíciles, así que la elección gratuita ahora es Luna en lugar de GPT-5.5, que sigue siendo seleccionable cuando un ensayo necesita más cuidado. Las subidas de archivos, las imágenes y otras herramientas siguen limitadas. En el lado de Google no se movió nada: Gemini 3.8 Flash salió el 2 de septiembre pero llega a los usuarios gratuitos solo a través de AI Studio y la API, así que la aplicación gratuita de Gemini sigue sirviendo 3.6 Flash y este conserva la fila multimodal. GPT-6 Astra (3 de septiembre) es el modelo a vigilar para conjuntos de problemas duros, con un 97,6 % declarado en FrontierMath Tier 4 v2 frente al 39,6 % verificado de GPT-5.5 Pro, pero requiere un plan de pago de ChatGPT y ningún nivel gratuito lo incluye. El nivel gratuito se movió otra vez el 22 de septiembre: los usuarios de Free y Go ya llegan a GPT-6 Luna en la app de escritorio de ChatGPT. Léelo como más barato y no como más listo, porque Artificial Analysis le da 37,3, a la par de la versión 5.6, y ARC Prize los separa por dos décimas de punto en ARC-AGI-2.
Mejor IA para el trabajo & profesionales
La mejor IA para el trabajo profesional es GPT-5.6 (por defecto de ChatGPT desde el 9 de julio) para el trabajo de conocimiento diario, Claude Opus 5 para programación y escritura de alto riesgo, y Gemini Spark para flujos agénticos 24/7. La mayoría de los profesionales sacan el máximo partido ejecutando dos suscripciones de pago (ChatGPT Plus a $20/mes más Claude Pro a $20/mes, un total de $40/mes), o consolidando con Fello AI a $9.99/mes para los cinco mejores modelos en una app de Mac/iOS. Para el trabajo agéntico que corre mientras duermes, Gemini Spark es el único agente en la nube 24/7 real, y desde el 30 de julio llega al nivel Google AI Pro de $19.99/mes además de a Google AI Ultra.
| Caso de uso | Mejor modelo | Dato clave | Precio | Alternativa |
|---|---|---|---|---|
| Trabajo de conocimiento diario | GPT-5.6 | Por defecto de ChatGPT desde el 9 de julio; el asistente que la mayoría puede abrir | $20/mes ChatGPT Plus | Claude Opus 5 |
| ChatGPT Work y Codex | GPT-6 Sol | En ChatGPT Work y Codex para Plus, Pro, Business, Enterprise y Edu desde el 22 de septiembre, a $2 / $10 en la API | $20/mes ChatGPT Plus | GPT-6 Luna para trabajo de volumen |
| Programación (propietaria) | Claude Opus 5.5 | #1 Terminal-Bench 4.0 (59,6 %) y #1 en los dos tableros de programación de LiveBench, a $4 / $20 | $20 al mes Claude Pro | GPT-6 Astra, que conserva los dos tableros de programación de Arena |
| Programación (rentable) | Qwen3.8-Max-0902 | #5 en Code Arena: WebDev (1662), por detrás de GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 y el anterior Qwen3.8-Max; solo API en QwenCloud | $2 / $6 | Qwen 3.7 Max; DeepSeek V4.1-Flash |
| Investigación & informes | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje de Google | Google AI Pro / Ultra | Claude Opus 5 |
| Matemáticas duras, física, modelado financiero | GPT-6 Astra | #1 LiveBench Reasoning y ARC-AGI-2 (95 %); declara 97,6 % en FrontierMath Tier 4 v2 | $100/mes ChatGPT Pro | GPT-5.6 Sol; Qwen 3.7 Max |
| Flujos de agente siempre activos | Gemini Spark | Primer agente en la nube 24/7 | Desde $19.99/mes Google AI Pro | Claude Cowork |
| Noticias en vivo, creatividad con contexto de X | Grok 4.7 | Intelligence Index 46,3 + anclaje nativo en X; la app de Grok sigue sirviendo 4.6 | $30 al mes SuperGrok | Gemini 3.1 Pro |
| Consolidación todo en uno | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/mes | Pagar a cada proveedor por separado |
Tres lanzamientos cayeron en los tres primeros días de septiembre y un cuarto el 22 de septiembre, y este último sí cambia el argumento de precio sobre el que se apoya este bloque. Claude Opus 5.5 encabeza el Intelligence Index de Artificial Analysis con 57,6 en v4.3.2 y sus dos tableros agénticos, y lo hace a $4 / $20 frente a los $5 / $25 de Claude Opus 5. El razonamiento que llevaba este bloque, que los equipos deberían empezar por Opus 5 porque cuesta la mitad que los modelos mejores, ya no se sostiene: Opus 5.5 es a la vez mejor y más barato, así que se lleva la fila de programación propietaria y es el modelo sobre el que construiríamos el trabajo diario. GPT-5.6 conserva igualmente la fila de asistente diario, porque esa fila va de alcance y no de puntuación, y ni Opus 5.5 ni GPT-6 Astra son la opción por defecto de cientos de millones de personas. El Qwen3.8-Max-0902 de Alibaba (2 de septiembre) mantiene la fila de programación rentable a $2 / $6, aunque solo está en la API de QwenCloud sin interfaz de consumo. GPT-6 Sol y GPT-6 Luna aterrizaron el 22 de septiembre justo en la superficie de la que trata este bloque: ChatGPT Work y Codex, para Plus, Pro, Business, Enterprise y Edu, a $2 / $10 y $0,10 / $0,50 en la API, y no en la ventana de chat corriente.
Precios de los modelos de IA en septiembre de 2026
Desde niveles gratuitos de $0 hasta Google AI Ultra a $199,99 al mes. El precio más consecuente de esta tabla es Claude Opus 5.5 a $4 / $20, porque el 22 de septiembre Anthropic lanzó el modelo con la puntuación más alta que ha medido cualquier evaluador independiente a un precio de lista menor que el modelo al que sustituye: Claude Opus 5 cuesta $5 / $25, y las lecturas de caché bajan un 60 % hasta $0,20, con la cifra de la propia Anthropic situando una carga de trabajo típica un 40 % más barata que en Opus 5. Eso invierte la forma que ha tenido esta sección todo el año, en la que el mejor modelo era también el más caro. Claude Fable 5.1 y GPT-6 Astra están los dos a $10 / $50 y los dos puntúan ahora por debajo. El Muse Spark 1.3 de Meta cuesta $1,25 / $4,25, sin cambios a lo largo de tres saltos de capacidad desde julio, con un nivel Contributor a $0,10 / $0,20 para quien acepte que Meta entrene con sus prompts, y tanto Grok 4.6 como Grok 4.7 están a $2 / $6, con la salvedad de que un prompt de 200.000 tokens o más refactura la petición entera a $4 / $12. Grok 4.7 es el caso más claro de esta página de un precio que no se movió mientras el coste sí: los tokens cuestan lo mismo y una tarea del Intelligence Index cuesta $2,73 frente a los $1,86 de Grok 4.6, porque 4.7 emite alrededor del doble de salida para llegar ahí. El extremo barato se ha movido dos veces. DeepSeek subió los dos modelos V4 unas cuatro veces el 16 de agosto, lo que le costó a V4-Flash la elección por relación calidad-precio, y luego lo revirtió en buena parte el 10 de septiembre: V4-Flash se retiró y V4.1-Flash ocupó su lugar a $0,15 / $0,60 fuera de pico y $0,30 / $1,20 en pico. Entre los modelos que se compran por tokens la elección sigue siendo GLM 5.3 Flash, ahora a su precio de lista simple de $0,15 / $0,50 desde que la promoción de lanzamiento caducó el 9 de septiembre, porque Artificial Analysis lo mide en $0,25 por tarea del Intelligence Index con una puntuación de 41,8 frente a los $0,27 de DeepSeek con 39,5. Fuera de pico los dos están igualados en entrada y GLM es más barato en salida; en pico GLM gana en ambas. Un modelo abierto los bate a los dos en coste por tarea y tiene cuatro días: el MiMo-V2.6-Pro de Xiaomi resuelve una tarea del índice por $0,13 con una puntuación de 46,3 bajo MIT puro, pero hay que alojar 1,02 billones de parámetros para conseguirlo. En la frontera la elección por valor es el Muse Spark 1.3 de Meta, a $1,60 por tarea del índice con 48,1. Entre los modelos cerrados GPT-6 Luna se llevó ese título el 22 de septiembre, a $0,10 / $0,50 por token y $0,07 por tarea del índice, lo más barato por tarea de toda esta página; GPT-6 Sol cayó igual, de $4 / $20 a $2 / $10, justo sobre la tarifa de Claude Sonnet 5, y OpenAI dice que ambos recortes son permanentes y no promocionales. Para un desglose más profundo, consulta nuestra guía completa de comparación de precios de IA.
| Modelo | Entrada (por 1M) | Salida (por 1M) | Contexto | ¿Acceso gratis? |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 | 1 050 000 (entrada máx. 922 000) | En Chat en Pro, Business y Enterprise desde el 4 de septiembre; Plus lo tiene en ChatGPT Work y Codex, no en Chat; sin plan gratuito; activo en la API |
| GPT-6 Sol | $2.00 | $10.00 | 1 050 000 (entrada máx. 922 000) | ChatGPT Work y Codex en Plus, Pro, Business, Enterprise y Edu desde el 22 de septiembre; API; no en Chat |
| GPT-6 Luna | $0.10 | $0.50 | 1 050 000 (entrada máx. 922 000) | Free y Go en la app de escritorio de ChatGPT; ChatGPT Work y Codex en planes de pago; API; no en Chat |
| GPT-5.5 | $5.00 | $30.00 | 1M (400K en Codex) | ChatGPT Free; API de pago |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro desde $100/mes (nivel de mayor uso a $200) |
| GPT-5.6 Sol | $4.00 | $20.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio); tarifa promocional al menos hasta el 21 de noviembre de 2026 |
| GPT-5.6 Terra | $2.00 | $12.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| GPT-5.6 Luna | $0.20 | $1.20 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| Claude Opus 5.5 | $4.00 | $20.00 | 1M | Claude Pro/Max/Team; API de pago; lecturas de caché $0,20 |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Por defecto en Claude Pro/Max; API de pago |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modelo legacy en Anthropic; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Lecturas de caché $0.25; en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos. Mythos 5.1 factura igual, solo por invitación |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanente en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Por defecto en Claude Free & Pro; API de pago |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API de pago (reemplazado por Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Aplicación Gemini limitada; API de pago |
| Gemini 3.8 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | AI Studio, Antigravity, Gemini Enterprise + API de pago; en la aplicación de Gemini reportado para AI Pro/Ultra |
| Gemini 3.7 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | AI Studio, Android Studio, Antigravity + API de pago; en la aplicación de Gemini solo vía Spark (AI Pro/Ultra, excluye EEE/RU/CH/Nigeria) |
| Gemini 3.6 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | Modelo por defecto de la app gratuita de Gemini; AI Studio; nivel gratuito de API + API de pago |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; nivel gratuito de API + API de pago |
| Qwen3.8-Max-0902 | $2.00 ($0.17 cache hit explícito, $0.25 implícito) | $6.00 | 1M (salida de 128K) | Solo API de QwenCloud; sin chat de consumo, sin pesos abiertos |
| Qwen 3.7 Max | $1.25 promo / $2.50 lista | $3.75 promo / $7.50 lista | 1M | 200 solicitudes gratis/día; API de pago más allá |
| MiniMax M3 | $0.30 (50 % de descuento sobre $0.60) | $1.20 (≤512K) | 1M | Open weights; se aplican costes de alojamiento |
| LongCat-2.0 | Depende del proveedor | Depende del proveedor | 1M | Open weights (MIT); se aplican costes de alojamiento |
| NVIDIA Nemotron 3 Ultra | Depende del proveedor | Depende del proveedor | 1M | Open weights (OpenMDW); se aplican costes de alojamiento |
| Qwen 3.5 (open-weight) | Autoalojado / Together | Autoalojado / Together | 1M | Open weights; se aplican costes de alojamiento |
| Nex-N2-Pro | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (Apache 2.0); se aplican costes de alojamiento |
| Rio 3.5 Open 397B | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (MIT); se aplican costes de alojamiento |
| Grok 4.3 | $1.25 | $2.50 | 1M | Plan de consumo gratuito; API de pago |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API de SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Grok 4.7 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API de SpaceXAI, Cursor, Grok Build, harnesses y routers en la nube; no en la app de Grok |
| Muse Spark 1.3 | $1.25 ($0.10 nivel Contributor) | $4.25 ($0.20 nivel Contributor) | 1M | API de pago; Muse Code, Meta Model API y OpenRouter; el nivel Contributor cambia derechos de entrenamiento por un ~92 % de descuento |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Nivel básico gratuito en la aplicación de Kimi; open weights en Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vídeo) | $1.50 | $17.50 (salida de vídeo) | Clips de 10 segundos | Aplicación Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.66 en valle / $1.32 en punta ($0.022 cache-hit en valle) | $1.98 en valle / $3.96 en punta | 1M | DeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto |
| DeepSeek V4.1-Flash | $0.15 en valle / $0.30 en punta ($0.003 acierto de caché en valle) | $0.60 en valle / $1.20 en punta | 1M | DeepSeek Chat gratis; API de pago, tarifas de valle y punta; sustituyó a V4-Flash el 10 de septiembre |
| Kimi K2.7 Code | Depende del proveedor | Depende del proveedor | 256K | Open weights; se aplican costes de alojamiento |
| GLM-5.2 | Depende del proveedor | Depende del proveedor | 1M | Open weights; se aplican costes de alojamiento |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | API de Z.ai, GLM Coding Plan y ZCode; pesos en Hugging Face desde el 28 de agosto bajo la GLM 5.3 License propia |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit); $0.075 en promoción | $0.50; $0.25 en promoción | 1M | API de Z.ai, GLM Coding Plan, OpenRouter; pesos MIT en Hugging Face; la promoción acaba el 9 de septiembre |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Pesos abiertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Depende del proveedor | Depende del proveedor | 262K (hasta 1M) | Pesos abiertos (Qwen Community License 1.0); se suman los costes de alojamiento |
| MiMo-V2.6-Pro | $0.435 | $0.87 | 1M | Pesos abiertos (MIT); el alojamiento se paga aparte |
| ERNIE 5.1 | Precio para la región de China | Precio para la región de China | 256K | Nivel gratuito de Baidu |
| Gemini Spark (agente) | Sin precio de API | Sin precio de API | 1M (base Gemini) | Google AI Pro $19.99, AI Ultra $99.99 o $199.99/mes |
| Fello AI (agregador) | Enrutado por la app | Enrutado por la app | Depende del modelo | $9.99/mes, plan gratuito disponible |
Las tarifas de GPT-5.5 y GPT-5.5 Pro de arriba son precios de contexto corto; OpenAI ya no publica las cifras específicas de contexto largo. Los niveles GPT-5.6 se facturan a 2x entrada y 1,5x salida una vez que un prompt supera los 272K tokens de entrada, lo que sitúa a Terra de contexto largo en $4 / $18 y a Luna en $0.40 / $1.80. Para los niveles GPT-6 OpenAI no publica recargo por contexto largo, y sus lecturas de caché salen un 90 % más baratas: $1.00 en Astra, $0.20 en Sol y $0.01 en Luna. Grok 4.6 funciona igual, pero muerde más fuerte: a partir de 200.000 tokens de prompt, SpaceXAI refactura la petición entera a la tarifa más alta en lugar de solo el exceso, así que pasarse por mil tokens duplica el coste de toda la llamada. La otra tarifa que conviene leer dos veces es la de DeepSeek: desde el 16 de agosto sus dos modelos V4 se facturan a precio de punta de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y a exactamente la mitad en cualquier otra hora, así que la misma tarea puede costar el doble según cuándo la ejecutes. Si quieres acceso a varios modelos de IA sin gestionar suscripciones separadas, Fello AI ofrece GPT, Claude, Gemini, Grok, Perplexity y más en una sola app para Mac, iPhone y iPad desde $9.99/mes.
Mejores modelos open-weight en septiembre de 2026
El mejor modelo de pesos abiertos en septiembre de 2026 es MiMo-V2.6-Pro, que Xiaomi publicó el 21 de septiembre bajo MIT puro: 1,02 billones de parámetros con 42.000 millones activos, contexto de 1M de tokens y los pesos en Hugging Face el mismo día. Artificial Analysis lo mide en 46,3 en el Intelligence Index v4.3.2, la mayor puntuación abierta que ha publicado nunca, por encima de GLM-5.3 con 44,8 y de Kimi K3 con 43,6, y lo hace a $0,13 por tarea del Intelligence Index, más barato que cualquier otro modelo abierto de esta página. También logra un 34,8 % en Terminal-Bench 4.0 y 1673 en GDPval-AA v2.1, lo que lo coloca por encima de Kimi K3 en ambos. Dos límites honestos: ningún tablero de Arena lo ha valorado, así que no hay ninguna evidencia de preferencia humana sobre él, y se publicó hace cuatro días, así que no tiene historial independiente. Kimi K3 sigue siendo el modelo abierto mejor situado en Arena, séptimo en WebDev con 1658 y quinto en la señal de finalización de tareas de la Agent Arena, y GLM-5.3 sigue siendo el modelo abierto más fuerte en el Terminal-Bench 4.0 de Artificial Analysis con un 41,9 % frente al 34,8 % de MiMo, bajo una licencia propia de Z.ai y no MIT. La recomendación práctica para equipos que ejecutan sus propios pesos sigue siendo GLM 5.3 Flash (Z.ai, MIT), lanzado el 26 de agosto y con 41,8 en v4.3.2, 320.000 millones en total con 18.000 millones activos, porque un modelo de 1,02 billones de parámetros no es algo para una estación de trabajo y la descarga de K3 son 96 fragmentos safetensors y unos 1,56 TB. El escalón abierto barato volvió a cambiar el 10 de septiembre: DeepSeek retiró V4-Flash 0731 y lo sustituyó por DeepSeek-V4.1-Flash, 552.000 millones con 8.000 millones activos en prefill y 16.000 millones en decodificación, multimodal de forma nativa, MIT desde el primer día, con 39,5 en v4.3.2 frente a 34,3 de la versión a la que sustituye, y con el precio de vuelta a $0,15 / $0,60 fuera de pico. Además es tercero en la señal de finalización de tareas de la Agent Arena, el modelo abierto mejor situado allí. De los tres lanzamientos que cerraron agosto, GLM 5.3 publicó sus pesos el 28 de agosto bajo una licencia propia con una cláusula que obliga a todo operador de model-as-a-service con más de 10.000 millones de dólares de ingresos a pasar antes una revisión de seguridad de Z.ai; el Qwen3.8-Flash-Next de Alibaba, una mezcla de expertos de 125.000 millones con solo 6.000 millones activos que adelanta la arquitectura Qwen4, puntúa 39,8 y es noveno en el tablero WebDev de Arena; y el Hy4 Preview de Tencent, 770.000 millones en total y 49.000 millones activos bajo Apache 2.0, no tiene valoración de Artificial Analysis pero es undécimo en Arena WebDev con 1624. Ten en cuenta también que GLM 5.3 Flash no es un GLM 5.3 recortado sino un modelo aparte sobre una base entrenada de nuevo, y por eso pudo salir bajo MIT puro mientras que el buque insignia no.
| Modelo | Mejor para | Benchmark clave | Contexto / Licencia | Dónde ejecutar |
|---|---|---|---|---|
| MiMo-V2.6-Pro | El mayor Intelligence Index abierto jamás medido | II 46,3 (v4.3.2), por encima de GLM-5.3 y Kimi K3, a $0,13 por tarea del índice; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1673; 1,02 billones/42.000 millones activos | 1M / MIT | Hugging Face (XiaomiMiMo), proveedores, autoalojado |
| Kimi K3 | Modelo abierto mejor situado en Arena | II 43,6 (v4.3.2); #5 Arena WebDev, la mejor posición abierta; #5 Agent Arena; 2.8T/104B activos | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 TB), Moonshot API, proveedores |
| GLM 5.3 Flash | Mejor modelo abierto que la mayoría de equipos puede ejecutar de verdad | II 41,8 (v4.3.2), en la frontera de Pareto entre inteligencia y coste, a unos $0.25 por tarea del índice; 320B/18B activos, nativamente multimodal | 1M / MIT | Hugging Face, API de Z.ai ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Respaldo con historial independiente | II 33,7 (v4.3.2); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B activos | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Abierto desde el 28 de agosto, pero con licencia propia | II 44,8 (v4.3.2), la puntuación abierta más alta que hemos encontrado; misma base de 744B que GLM-5.2, solo post-entrenada, checkpoint publicado contado en 753B; CyberGym 84,5 % y Terminal-Bench 3.0 28,3 (cifras del fabricante) | 1M / GLM 5.3 License (model-as-a-service por encima de 10 000 M USD de ingresos necesita revisión de seguridad de Z.ai) | Hugging Face, API de Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4.1-Flash | Mejor valor abierto si lo alojas tú mismo | II 39,5 (v4.3.2) frente a 34,3 de la versión V4-Flash 0731 que sustituye; 552B, 8B activos en prefill y 16B en decodificación | 1M / MIT | DeepSeek API ($0.15/$0.60 en valle, $0.30/$1.20 en punta desde el 10 de septiembre), local |
| Tencent Hy4 Preview | Mayor modelo con licencia permisiva hasta la fecha | 770B/49B activos; 2,99/4,00 en el panel propio de Tencent de 203 tareas frente a 2,94 de Kimi K3 y 2,92 de GLM 5.3 (fabricante); sin valoración de Artificial Analysis; #11 Arena WebDev (1624) | 1M+ / Apache 2.0 | Hugging Face (BF16 y FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Anticipo de la arquitectura Qwen4 | 125B totales más un embedding de N-gramas de 51B, 6B activos; 91,7 GPQA Diamond y 62,5 SWE-Bench Pro (fabricante); II 39,8 (v4.3.2); #9 Arena WebDev (1635) | 262K a 1M / Qwen Community License 1.0 | Hugging Face, proveedores, autoalojamiento |
| LongCat-2.0 | Programador abierto frontier entrenado en chips chinos | II 33 (v4.1); 59,5 % SWE-Bench Pro (proveedor), 1.6T/~48B activos | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de clase frontier barato | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licencia por definir | Hugging Face, API $0.30/1M (50 % de descuento) |
| Nex-N2-Pro | Puntuación de programación abierta más fuerte | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B activos | Basado en Qwen / Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Kimi K2.7 Code | Programador abierto con licencia comercial más fuerte | +21,8 % en Kimi Code Bench v2 vs. K2.6 (proveedor); 1T/32B activos | 256K / Modified MIT | Hugging Face, DeepInfra, proveedores |
| DeepSeek V4-Pro | Trabajo agéntico del mundo real | II 44 (v4.1), 1.6T/49B activos | 1M / MIT | DeepSeek API ($0.66/$1.98 fuera de pico, $1.32/$3.96 en pico desde el 16 de agosto), local |
| Hy3 | El participante más nuevo con licencia permisiva | II 41 (v4.1); #22 en Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Inkling | Primer modelo open-weight de Thinking Machines | II 41 (v4.1), agéntico 32,3, lanzado el 15 de julio | Open weights | Hugging Face, proveedores, autoalojado |
| Inkling Small | Misma familia a una cuarta parte del tamaño | II 40 (v4.1), agéntico 30,8; 276B/12B activos, entrada de texto, imagen y audio | Apache 2.0 | Hugging Face (BF16 y NVFP4), proveedores, autoalojado |
| NVIDIA Nemotron 3 Ultra | Afinado por NVIDIA, licencia totalmente permisiva | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B activos | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 autoalojado) |
| Qwen 3.5 (397B / 17B activos) | Multimodal, decodificación rápida | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / abierto | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programador agéntico abierto eficiente (3B activos) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B activos | 262K (a 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programador denso ejecutable en portátil | 87,8 GPQA Diamond, denso 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, razonamiento multilingüe | 70,8 Terminal-Bench 2.1 (first-party), supera a Qwen 3.7 Plus en 4/5 | 397B/17B activos / MIT | Hugging Face, proveedores, autoalojado |
| Llama 4 Maverick | Buque insignia de la línea Meta | 17B activos / 400B de parámetros totales | Llama 4 license | Nube de Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / bajo consumo | Multimodal, huella muy pequeña | Compacto / abierto | Local, herramienta NVIDIA |
Aquí la licencia importa tanto como la puntuación bruta, y agosto ha ensanchado la distancia entre los dos grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) y Nemotron 3 Ultra (OpenMDW) todos permiten claramente el uso comercial sin prueba de ingresos. El resto lleva condiciones que conviene leer antes de construir sobre ellas: MiniMax M3 y MiniMax H3 vienen bajo sus propias licencias comunitarias, y H3 exige además una solicitud desde EE. UU., la UE, el Reino Unido y Corea del Sur; Kimi K3 se sitúa en una licencia propia con un umbral de ingresos para quien lo revenda como servicio; GLM 5.3 exige una revisión de seguridad de Z.ai a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos; y la Qwen Community License 1.0 de Qwen3.8-Flash-Next exige una licencia aparte de Qwen para explotar un negocio de model-as-a-service o de asistente de trabajo con IA, aunque el uso interno queda exento. Ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos: Claude Opus 5 se llevó el tablero Agent en julio, el último que lideró un modelo open-weight.
Benchmarks, precios y uso práctico
Cada clasificación de esta página combina tres entradas: benchmarks públicos de siete casas independientes (Artificial Analysis, Arena antes LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize y el tablero oficial de Terminal-Bench 4.0, cubriendo el Intelligence Index, GPQA Diamond, ARC-AGI-1 al 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas y el Remote Labor Index), precios de API y suscripción publicados en la página de precios oficial de cada proveedor, y uso práctico por parte del equipo editorial de FelloAI que ejecuta prompts reales sobre la misma tarea en cada modelo. Volvemos a obtener las fuentes oficiales de precios y benchmarks antes de cada actualización mensual.
Los benchmarks se ponderan según el caso de uso: SWE-bench y Terminal-Bench impulsan la programación, GPQA Diamond y ARC-AGI-2 impulsan la precisión, GDPval-AA (el benchmark de entregables profesionales de Artificial Analysis) informa la calidad de las tareas profesionales mientras que el estilo de escritura se juzga principalmente por pruebas prácticas, FrontierMath y HMMT impulsan la resolución de problemas. Revelamos cuándo un benchmark es reportado por el proveedor pero no verificado de forma independiente, y descartamos cualquier afirmación que no podamos reproducir contra una fuente en vivo. Clasificamos por puntuaciones medidas: la corona de una categoría se mueve en cuanto un modelo supera al titular en los tableros que definen esa categoría, sin esperar a los tableros basados en votos, y un modelo que todavía no está ampliamente disponible se señala en su tarjeta en lugar de quedarse sin ella. Revisamos los puestos además de las cifras, porque una puntuación puede seguir siendo correcta mientras el tablero que la rodea se mueve. Cuando un modelo pasa por una actualización importante entre actualizaciones, volvemos a clasificar la categoría y añadimos una línea «Qué cambió este mes» al pie del análisis a fondo.
Fello AI reúne los mejores modelos de IA en una sola app nativa y ligera.
Cambia entre ellos cuando quieras, sin suscripciones separadas.
Descargar Fello AI




