Mejores modelos de IA en 2026
Clasificaciones, comparativas y análisis a fondo, actualizados cada mes a medida que llegan nuevos modelos.
Claude Fable 5.1 llegó el 1 de septiembre y se puso directamente en lo más alto del Intelligence Index de Artificial Analysis con 66, la puntuación más alta que la casa ha medido, llevándose con él su Agentic Index con 61. Claude Opus 5 conserva las dos cosas por las que la mayoría de lectores decide de verdad: la corona de programación, ganada en los dos tableros por votos de Arena, y el precio, $5 / $25 por 1M de tokens frente a los $10 / $50 de Fable 5.1. Ningún tablero de Arena tiene todavía votos para 5.1, así que no se ha movido nada de lo que en esta página decide la preferencia humana. Grok 4.6 es la verdadera sorpresa del mes: una actualización de post-entrenamiento de Grok 4.5 que sube cinco puntos hasta 61, empatando con GPT-5.6 Sol mientras cobra $2 / $6, y que termina los trabajos agénticos largos en aproximadamente la mitad de turnos que necesita Opus 5.
El otro movimiento está en el extremo económico, y por primera vez este año fue en la dirección contraria. DeepSeek subió los precios de sus dos modelos V4 unas cuatro veces el 16 de agosto y dividió la tarifa en horas punta y valle, así que DeepSeek V4-Flash 0731 cuesta ahora $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, en lugar de los $0.14 / $0.28 planos con los que salió, lo que le cuesta la elección relación precio-rendimiento. Esa elección pasa a GLM 5.3 Flash, que aterrizó el 26 de agosto con pesos MIT el primer día, un Intelligence Index de 57 y un precio de lista de $0.15 / $0.50, reducido a la mitad hasta el 9 de septiembre a $0.075 / $0.25, y que ahora deja a DeepSeek por debajo a cualquier hora del día. Google ya había reducido a la mitad su propia tarifa Flash: Gemini 3.7 Flash salió el 13 de agosto a un introductorio $0.75 / $3.75, con 56 puntos y el primer puesto de 182 modelos en velocidad de salida, y Gemini 3.6 Flash pasó a la misma tarifa. Ambos precios se duplican el 1 de enero de 2027. El campo abierto cerró después el mes con tres lanzamientos en tres días: GLM 5.3 publicó por fin sus pesos el 28 de agosto, aunque bajo una licencia propia de Z.ai en lugar del MIT puro que recibió su hermano menor, Alibaba abrió Qwen3.8-Flash-Next el 26 de agosto como el primer vistazo público a la arquitectura Qwen4, y Tencent liberó Hy4 Preview el 28 de agosto, 770 000 millones de parámetros bajo Apache 2.0. Abajo están los ganadores por categoría de septiembre de 2026. Haz clic en cualquier tarjeta para saltar directamente al desglose completo, o usa la navegación fija para moverte entre categorías. Las clasificaciones, benchmarks y precios se actualizan dentro de las 48 horas siguientes al lanzamiento de cualquier modelo importante.
¿Quieres los mejores modelos de IA sin hacer malabares con suscripciones separadas? Fello AI reúne los modelos líderes en una sola app nativa para Mac, iPhone y iPad.
Descargar Fello AI1 sep Anthropic Claude Fable 5.1 y Mythos 5.1, un nuevo #1 en Artificial Analysis con 66 y un recorte del 75 % en las lecturas de caché Nuevo
28 ago Z.ai Los pesos de GLM 5.3 ya están fuera tras la pausa de seguridad, pero la licencia no es MIT Nuevo
28 ago Tencent Tencent Hy4 Preview, 770B de pesos abiertos bajo Apache 2.0 y el mayor modelo permisivo hasta la fecha Nuevo
26 ago Z.ai GLM 5.3 Flash, Ox Alpha desvelado, y los primeros pesos MIT que Z.ai publica desde GLM-5.2 Nuevo
26 ago Alibaba Qwen3.8-Flash-Next, pesos abiertos y el primer vistazo público a la arquitectura Qwen4 Nuevo
21 ago OpenAI GPT-5.6 Sol baja más de un 20 % y queda por debajo de Claude Opus 5 en ambos lados Nuevo
16 ago DeepSeek DeepSeek sube los precios de la API unas cuatro veces y divide la tarifa en horas punta y valle Nuevo
14 ago Z.ai GLM 5.3, un gran salto agéntico solo con post-entrenamiento, lanzado sin los open weights Nuevo
13 ago Google Gemini 3.7 Flash, las puntuaciones de programación suben y el precio se reduce a la mitad hasta $0.75 / $3.75, hasta enero Nuevo
12 ago SpaceXAI Grok 4.6, el post-entrenamiento sube el Intelligence Index de 56 a 61 con $2 / $6 sin cambios Nuevo
5 ago Muse Spark 1.2 y Muse Code, Intelligence Index de 51 a 57 con un $1.25 / $4.25 sin cambios, además de un agente de programación de terminal Nuevo
3 ago Alibaba Qwen 3.8 (Qwen3.8-Max), buque insignia multimodal de 2,4 billones de parámetros ya disponible en general a $2 / $6 Nuevo
31 jul DeepSeek DeepSeek V4-Flash 0731, mismo precio, mismo tamaño, Intelligence Index de 40 a 52
31 jul MiniMax MiniMax H3, vídeo 2K con audio estéreo nativo desde $0.13 por segundo
Finales de jul Thinking Machines Inkling Small, una cuarta parte del tamaño de Inkling con casi la misma puntuación
30 jul OpenAI Recorte de precios de GPT-5.6, Luna un 80 % más barato, Terra un 20 % más barato, Sol sin cambios
24 jul Anthropic Claude Opus 5, nuevo #1 en Artificial Analysis, lidera tanto el Intelligence Index (63) como el Agentic Index (55.3)
24 jul Sakana AI Fugu-Ultra v1.1, renovación del motor de orquestación con mejoras reportadas por el proveedor de hasta 7,9 puntos sobre v1.0 al mismo precio
21 jul Google Gemini 3.6 Flash, salida más barata, más rápido, mismo Intelligence Index
16 jul Moonshot AI Kimi K3, 2,8B de parámetros, el mayor modelo open-weight jamás publicado (pesos lanzados el 27 de julio)
9 jul OpenAI GPT-5.6 Sol, Terra y Luna, familia de nueva generación en vivo en ChatGPT, Codex y la API
Pendiente Google Gemini 3.5 Pro, aún sin lanzar, meses de retraso según Bloomberg Retrasado
Mejor IA para escritura
La mejor IA para escritura es Claude Fable 5, el único modelo entre los tres primeros de los tres tableros independientes de escritura, con Claude Sonnet 5 como la elección de valor del plan gratuito y GPT-5.5 como alternativa para la escritura de negocios anclada en hechos. Fable 5 lidera la tabla de escritura creativa de Arena, encabeza LiveBench Language con 90,7 y queda tercero en EQ-Bench Creative Writing v3 por detrás de Kimi K3 y GPT-5.6 Sol. Ningún otro modelo está entre los tres primeros en más de uno de ellos. Es un cambio respecto al mes pasado, cuando Claude Sonnet 5 ocupaba este puesto por GDPval-AA; los tableros de preferencia no respaldan esa colocación, así que Sonnet 5 es ahora la elección de valor en lugar del líder de calidad. Fable 5 cuesta $10 / $50 por 1M de tokens y está incluido de forma permanente en Claude Max y Team Premium con cerca del 50 % de los límites de uso habituales. Si tu escritura es un entregable de trabajo en lugar de prosa, el tablero GDPval-AA v2 de entregables profesionales lo lidera ahora Claude Fable 5.1 con 1853, por delante de Claude Opus 5 con 1824 y de Fable 5 con 1723. Fable 5.1 llegó el 1 de septiembre como el modelo más capaz al mismo precio de $10 / $50, y gana a Fable 5 en todos los tableros que han medido a ambos, incluido Humanity's Last Exam con un 59,1 % frente al 55,5 %. No le hemos movido la corona porque esta elección descansa sobre la preferencia humana y ningún tablero de Arena lo ha valorado todavía. La traducción es una cuestión aparte con un ganador aparte, que analizamos en nuestra guía sobre la mejor IA para traducir.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5 | Mejor escritura en general | #1 Arena texto en general (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | La opción más cara aquí | $10 / $50 |
| Claude Fable 5.1 | Máxima capacidad al mismo precio | #1 Humanity's Last Exam (59,1 %), #1 GDPval-AA v2 (1853), #1 Intelligence Index (66) | Sin votos en Arena todavía, así que sin valorar en los tableros de preferencia | $10 / $50 |
| Kimi K3 | Ficción creativa y voz | #1 EQ-Bench Creative Writing (2377), 234 Elo por delante del segundo | Solo #10 en Arena escritura creativa | $3 / $15 |
| Claude Sonnet 5 | Escritura gratuita para el día a día | Gratis y por defecto en claude.ai, contexto 1M | #53 Arena escritura creativa; 75,0 LiveBench Language | $2 / $10, ahora permanente |
| Claude Opus 5 | Entregables profesionales ajustados de precio | #2 GDPval-AA v2 con 1824, por delante de Fable 5 (1723) | Por detrás de Fable 5 en Arena texto, por detrás de Fable 5.1 en GDPval-AA v2 | $5 / $25 |
| GPT-5.5 | Escritura de negocios anclada en hechos | Mejoras documentadas de fiabilidad factual sobre GPT-5.4 | Los niveles de razonamiento están ahora marcados como obsoletos | $5 / $30 |
| Gemini 3.7 Flash | Borradores en volumen a escala | La salida más rápida de cualquier modelo medido (385,1 tok/s), Intelligence Index 56 | Ajustado a código más que a prosa; el precio introductorio se duplica el 1 de enero de 2027 | $0.75 / $3.75 |
La corona de escritura se queda con Claude Fable 5, pero el argumento a su favor se estrechó el 1 de septiembre. Anthropic lanzó Claude Fable 5.1, y se lleva Humanity's Last Exam con un 59,1 % frente al 55,5 % de Fable 5, el tablero GDPval-AA v2 con 1853 y el Intelligence Index con 66. Lo que no tiene es un solo voto en Arena, y esta corona descansa sobre los tableros de texto y de escritura creativa de Arena, donde Fable 5 sigue siendo #1 con 1508.6 en el corte del 1 de agosto. Fable 5.1 entra por tanto en la tabla como la opción más capaz al mismo precio de $10 / $50, y volvemos a probar la corona en cuanto Arena lo valore. Dos cifras que dimos el mes pasado también se han recalibrado: AA-Omniscience marca ahora 43 para ambos modelos Fable en lugar de 40, y Artificial Analysis mide a Fable 5 en Humanity's Last Exam con un 55,5 % en lugar de un 53,3 %.
Mejor IA para chat & asistente diario
La mejor IA para el chat del día a día es GPT-5.6, y la razón honesta es el alcance en lugar de la posición en los tableros. Es el modelo que ChatGPT sirve por defecto a la mayor base de usuarios de la categoría, lo que lo convierte en el mejor asistente que la mayoría de la gente puede abrir de verdad. En preferencia humana pura no es el líder: GPT-5.6 Sol se sitúa #14 en la tabla de texto de Arena con 1482,8, donde Claude Fable 5 lidera con 1508.6. La mayoría de los usuarios de ChatGPT reciben el nivel equilibrado Terra, que OpenAI dice que iguala a GPT-5.5 y, desde el recorte de precios del 30 de julio de 2026, cuesta un 60 % menos. Está disponible dentro de ChatGPT (gratis con límites, Plus a $20/mes, Pro a $100/mes), a través de la API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), y empaquetado dentro de Fello AI junto a Claude, Gemini, Grok y DeepSeek. Una advertencia: la system card de OpenAI y el evaluador METR señalaron un comportamiento de «scheming» elevado en Sol, así que GPT-5.5 Instant sigue siendo la elección más segura para trabajo sensible a las alucinaciones.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| GPT-5.6 | Chat diario, por defecto de ChatGPT | El asistente que la mayoría puede abrir; Terra iguala a GPT-5.5 a ~mitad de coste | #14 en Arena texto; scheming señalado por METR | Gratis / $20/mes Plus; API $0.20 / $1.20 a $4 / $20 |
| Claude Fable 5 | La conversación mejor valorada | #1 en Arena texto en general (1508.6) y en 6 de 7 subcategorías | Sin plan gratuito; acceso por créditos de uso en Pro | $10 / $50 API |
| Claude Opus 5 | Respuestas reflexivas y matizadas | #1 Artificial Analysis Intelligence Index (63) y Agentic Index (55.3) | #6 en Arena texto, por detrás de Claude Fable 5 | $20/mes Pro, $5 / $25 API |
| GPT-5.5 Instant | Trabajo diario sensible a las alucinaciones | 52,5 % menos afirmaciones alucinadas vs. 5.3 Instant | Los niveles de razonamiento están ahora marcados como obsoletos | $20/mes Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rápido, gratis, multimodal | Sigue siendo el modelo que sirve el nivel gratuito de Gemini, contexto 1M, #12 en Arena texto | Más flojo en el razonamiento más difícil; 3.7 Flash lo supera al mismo precio | Gratis / $0.75 / $3.75 API |
| Fello AI | Todos los mejores modelos, una app | ChatGPT + Claude + Gemini + Grok + DeepSeek y más en Mac, iPhone y iPad | Enrutado por la app, no directo | $9.99/mes |
GPT-5.6 mantiene la elección de chat por alcance, y la distancia con el líder de preferencia se amplió en lugar de cerrarse. En el corte del 1 de agosto Sol se sitúa #14 en Arena texto con 1482,8, bajando desde #11, mientras Claude Fable 5 lidera con 1508.6. Nada del producto cambió, así que la corona no se mueve: sigue tratándose de qué asistente puede abrir de verdad la mayoría de la gente.
Mejor IA para imágenes
La mejor IA para la generación de imágenes es ChatGPT Images 2.0, y es la corona menos discutida de esta página. GPT Image 2 lidera el tablero de texto a imagen de Arena con 1385 Elo y su tablero de edición de imágenes con 1463, y Artificial Analysis lo pone primero en su propia arena de imagen con 1339,4. Es la elección natural siempre que tu imagen tenga que contener palabras legibles, en español o en otra escritura, y está incluido en ChatGPT Plus y Pro. Los segundos puestos han cambiado. Reve 2.1 (9 de julio) es el verdadero #2 en texto a imagen con 1302, y Reve 2.0 ahora se sitúa por detrás de él en los dos tableros. Muse Image de Meta es #3 en el tablero de texto a imagen de Arena y #2 en edición de imágenes, la mejor actuación que ha logrado ningún modelo de imagen de Meta. Nano Banana Pro de Google ya no es el segundo en general: en texto a imagen se clasifica entre #8 y #11, por debajo de su propio hermano más barato Nano Banana 2, aunque queda más arriba en edición de imágenes.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Imágenes con texto legible | #1 texto a imagen (1385) y #1 edición de imágenes (1463) | Menos fotorrealista que la línea de imagen de Gemini | Incluido en ChatGPT Plus |
| Reve 2.1 | Diseño, tipografía, 4K nativo | #2 texto a imagen con 1302, edición que preserva el diseño | Ecosistema más pequeño | Gratis / desde $7.99/mes |
| Muse Image | Edición de imágenes, ecosistema Meta | #3 texto a imagen, #2 edición de imágenes (1407) | Nuevo, herramientas escasas a su alrededor | Aplicación Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Retratos y productos fotorrealistas | Supera a Nano Banana Pro en los dos tableros | Más flojo en texto dentro de la imagen | Aplicación Gemini / AI Studio |
| Seedream 5.0 Pro | Texto multilingüe + edición por regiones | 10+ idiomas incl. árabe RTL, edición con lazo y capas | Sin benchmarks independientes; incertidumbre de derechos de autor | BytePlus / Magnific |
| Midjourney v8 | Arte estilizado, ilustración | Base estética que la mayoría de los artistas prefieren | Más flojo en texto dentro de la imagen | $10-$120/mes |
| Grok Imagine | NSFW / Spicy Mode | Los límites más permisivos | Un modelo más pequeño por detrás | $30/mes SuperGrok |
La corona de imagen no cambia y GPT Image 2 sigue liderando los tres tableros que seguimos, en Arena texto a imagen (1385), Arena edición de imágenes (1463) y la arena de imagen de Artificial Analysis (1339,4). La única incorporación es MAI-Image-2.5 de Microsoft, que se sitúa tercero en el tablero de imagen de Artificial Analysis con 1269,7 y tercero en el tablero de edición de imágenes de Arena, así que el tercer puesto ahora depende de qué casa leas.
Mejor IA para vídeo
La mejor IA para la generación de vídeo es Gemini Omni Flash, que lidera el tablero de texto a vídeo de Arena con 1527 Elo, 45 puntos completos por delante del segundo, y también encabeza la arena de vídeo de Artificial Analysis. Es #1 en las dos casas, algo que ningún otro modelo de vídeo logra. El precio va de $1.50 de entrada y $17.50 por 1M de tokens de salida de vídeo, lo que sale a unos $0.10 por segundo de vídeo terminado, y admite edición conversacional. El único límite real es la duración: Omni Flash genera clips de 10 segundos. Si necesitas tomas más largas, Veo 3.1 sigue siendo la herramienta adecuada dentro de la aplicación de Gemini, AI Studio y Vertex AI, con audio nativo y salida 1080p. Esto reemplaza a Veo 3.1 en lo alto de la categoría; Veo 3.1 es un buen modelo pero no el líder, con su mejor variante en #6 del tablero de texto a vídeo de Arena. El aspirante a vigilar es MiniMax H3 (31 de julio), que genera clips 2K de 4 a 15 segundos con audio estéreo nativo y se factura por segundo desde $0.13 a 2K, ya #2 en el tablero de vídeo de Artificial Analysis con 1241,5. No movemos la corona por eso: el margen es de 3,3 Elo en el único tablero que no se ha reproducido entre análisis, y H3 sigue sin votos en el tablero de texto a vídeo de Arena.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Gemini Omni Flash | Mejor vídeo de IA en general | #1 en los dos tableros de vídeo (1527 Arena), edición conversacional | Limitado a generaciones de 10 segundos | ~$0.10/s; aplicación Gemini / AI Studio |
| MiniMax H3 | Clips 2K con audio nativo | 4-15 s a 2K, audio estéreo nativo; #2 en AA vídeo (1241.5) | Aún sin votos en Arena; los pesos abiertos excluyen el escalador 2K y exigen solicitud en EE. UU., la UE, el Reino Unido y Corea del Sur | $0.13/s a 2K |
| Dreamina Seedance 2.0 | El rival más cercano | #2 texto a vídeo (1482) y #1 en imagen a vídeo con audio (1198) | Ecosistema ByteDance, acceso occidental limitado | Dreamina / BytePlus |
| Muse Video | Vídeo en el ecosistema Meta | #3 texto a vídeo con 1459 | El más nuevo del grupo, herramientas escasas | Aplicación Meta AI |
| Veo 3.1 | Clips de producción más largos | Audio nativo, 1080p, fuerte consistencia física | #6 en Arena vídeo, no el líder de calidad | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Iteración rápida a menor coste | 4K nativo, 60fps, clips de 15 segundos; Turbo salió el 17 de junio | Fuera del top 16 en Arena texto a vídeo | Desde $10/mes |
| Luma Ray 3 | Escenas fotorrealistas | Fuerte realismo para paisajes | Comunidad más pequeña | Gratis / desde $9.99/mes |
Gemini Omni Flash mantiene la corona de vídeo, y sigue siendo #1 en los dos tableros, con 1527,5 en Arena y 1244,8 en Artificial Analysis. MiniMax H3 (31 de julio) entra como aspirante en #2 del tablero de vídeo de Artificial Analysis (1241,5), a 3,3 Elo, y supera a Omni Flash en especificaciones con salida 2K, clips de hasta 15 segundos y audio estéreo nativo. Mantenemos la corona porque ese margen es de 3,3 Elo en un solo tablero y H3 sigue sin votos en el tablero de texto a vídeo de Arena. MiniMax sí abrió los pesos el 3 de agosto, pero solo H3-Base junto con los VAE y el codificador; el escalador 2K sobre el que descansa su ventaja de especificaciones se quedó solo en la API.
Mejor IA para programación
La mejor IA para programación es Claude Opus 5, y gana en los dos tableros donde los desarrolladores votan sobre el resultado terminado en lugar de un script midiendo un harness. Es #1 en el tablero WebDev de Arena con 1,702.9 y #1 en image-to-WebDev con 1,668.6, en cortes de votos del 1 de agosto y el 31 de julio. El precio es la segunda mitad del argumento: Opus 5 corre a $5 / $25 por 1M de tokens frente a los $10 / $50 de Claude Fable 5, y Artificial Analysis lo mide en $2.34 por tarea de índice frente a los $3.14 de Fable 5. La propia documentación de Anthropic dice a los desarrolladores que empiecen con Opus 5 para programación agéntica compleja y reserven Fable 5 para cargas que necesiten la máxima capacidad disponible. Claude Fable 5 es el segundo y sigue siendo la elección para el trabajo de largo horizonte más difícil, en #4 en WebDev (1,630.7) y #2 en image-to-WebDev (1,625.7); su sucesor del 1 de septiembre, Claude Fable 5.1, es el modelo más fuerte en los benchmarks de harness al mismo precio, y alcanza un 55,8 % en Terminal-Bench 4.0 frente al 52,3 % de Opus 5 y al 42,0 % de Fable 5 según las cifras del propio Anthropic, pero Arena todavía no tiene votos para él. El aspirante es Kimi K3, que se lleva el #2 en WebDev con 1,675.5 y el #3 en el tablero Agent de Arena, el programador open-weight más fuerte en los tableros, aunque autoalojarlo significa 1,56 TB de pesos. En el Coding Index de Artificial Analysis no es un barrido de Claude: GPT-5.6 Sol (xhigh) lidera con 78,3 con Opus 5 (max) en 78,0, lo bastante cerca para llamarlo empate. El aspirante serio más barato es ahora GLM 5.3 Flash a $0.15 / $0.50 bajo MIT, después de que la subida de DeepSeek del 16 de agosto llevara a V4-Flash 0731 a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, y la mejor relación calidad-precio en la propia frontier es Grok 4.6, que marca un 88,4 % en Terminal-Bench v2.1 y $0.84 por tarea de índice a $2 / $6.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5 | Mejor programación en general | #1 Arena WebDev (1,702.9) y #1 image-to-WebDev (1,668.6); $2.34 por tarea de índice | El Coding Index de Artificial Analysis tiene a GPT-5.6 Sol un pelín por delante | $5 / $25 |
| Claude Fable 5 | El trabajo agéntico de largo horizonte más difícil | #2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1M | El más caro; el Coding Index de Artificial Analysis lo pone 7º | $10 / $50 |
| Claude Fable 5.1 | Programación agéntica de máxima capacidad | #1 Intelligence Index (66) y #1 Agentic Index (61); 55,8 % en Terminal-Bench 4.0 (Anthropic) | Sin votos en Arena todavía; el doble de caro que Opus 5 | $10 / $50 |
| Kimi K3 | Construcción de apps web y agentes | #2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index abierto más alto (60) | 1,56 TB para autoalojar | $3 / $15 |
| GPT-5.6 Sol | Buque insignia de OpenAI, programación agéntica | #1 Artificial Analysis Coding Index con 78,3 (xhigh) | Ausente del tablero oficial de Terminal-Bench; manipulación de evals señalada por METR | $4 / $20 |
| Muse Spark 1.2 | Programación agéntica barata | Intelligence Index 57 a $1.25 / $4.25; 80 % en Terminal-Bench 2.1 (Artificial Analysis) | Segundo tras Opus 5 en los tres gráficos de programación propios de Meta (82,9 % vs. 86,7 %); Scale SEAL solo ha valorado la 1.1 | $1.25 / $4.25 |
| Grok 4.6 | Programador barato de buen valor | 88,4 % en Terminal-Bench v2.1 e Intelligence Index 61, a $0.84 por tarea de índice | Los prompts desde 200K tokens refacturan la petición entera al doble; mayor tasa de alucinación | $2 / $6 |
| Gemini 3.7 Flash | Programación de agentes a escala | Intelligence Index 56, 65,3 % DeepSWE v1.1, 85,8 % Terminal-Bench 2.1, 385,1 tok/s | 14,9 % en el más difícil Terminal-Bench 3.0; el precio introductorio se duplica el 1 de enero de 2027 | $0.75 / $3.75 |
| GLM 5.3 Flash | Mejor programador open-weight que puedes alojar | Intelligence Index 57; DeepSWE v1.1 63,4 y Terminal Bench 2.1 84,3 (cifras del fabricante); MIT, 320B/18B activos | Kimi K3 lo supera; las cifras de programación son del fabricante y todavía no tiene votos en Arena | Open weights (MIT) |
La corona de programación se movió a Claude Opus 5. Arena terminó de valorarlo, y quedó primero en los dos tableros de programación, WebDev con 1,702.9 e image-to-WebDev con 1,668.6, con Claude Fable 5 cuarto y segundo. Son tableros por votos con cortes publicados, así que la corona ahora descansa sobre comparaciones humanas en lugar de sobre un solo harness, y Opus 5 lo hace a la mitad del precio de Fable 5. Fable 5 pasa a ser el segundo para el trabajo de largo horizonte más difícil, y Kimi K3 sigue siendo el aspirante en #2 en WebDev. Muse Spark 1.2 de Meta llegó el 5 de agosto y no cambia eso, porque en los propios gráficos de Meta queda segundo tras Opus 5 en cada benchmark de programación que publicó. Grok 4.6 (12 de agosto) tampoco se lleva la corona, pero es el modelo a vigilar por coste: alcanza un 88,4 % en Terminal-Bench v2.1 y termina los trabajos agénticos largos en aproximadamente la mitad de turnos que Opus 5, a $2 / $6 frente a $5 / $25. Justo después llegaron otros dos lanzamientos centrados en programación. Gemini 3.7 Flash (13 de agosto) sustituye a 3.6 Flash en esta tabla por su salto del 49,0 % al 65,3 % en DeepSWE v1.1 a la mitad del precio anterior, y GLM 5.3 (14 de agosto) firma la mayor mejora agéntica del mes, Terminal-Bench 3.0 de 4,6 a 28,3, pero salió sin pesos descargables. Z.ai cerró el mes abriendo otro modelo en su lugar: GLM 5.3 Flash (26 de agosto) llegó bajo MIT el primer día con un Intelligence Index de 57, y le quita a GLM-5.2 el puesto open-weight de programación. Los últimos días del mes trajeron después otros tres lanzamientos abiertos: los pesos del propio GLM 5.3 el 28 de agosto bajo una licencia propia en lugar de MIT, Qwen3.8-Flash-Next de Alibaba el 26 de agosto como anticipo de la arquitectura Qwen4, y Hy4 Preview de Tencent, de 770B, el 28 de agosto bajo Apache 2.0. Ninguno tiene todavía una valoración independiente de programación, así que ninguno mueve esta tabla. Anthropic abrió después septiembre el día 1 con Claude Fable 5.1, que lidera el Intelligence Index y el Agentic Index de Artificial Analysis y marca un 55,8 % en Terminal-Bench 4.0 frente al 52,3 % de Opus 5, pero Arena no lo ha valorado, así que la corona se queda donde están los votos.
Mejor IA para creatividad
La mejor IA para el trabajo creativo sin filtros y a la última es Grok 4.6, y queremos ser exactos sobre por qué. Esta elección es sobre el producto, no sobre la calidad de la prosa. Grok lleva las menos restricciones de contenido de cualquier modelo frontier y la única integración nativa con X en tiempo real, lo que lo convierte en el único modelo que se involucrará con encargos atrevidos, de actualidad o deliberadamente provocadores que los demás rechazan. Es el modelo por defecto en la aplicación de Grok para suscriptores de SuperGrok y X Premium+ a $30/mes. No es el mejor escritor, y los tableros fueron contundentes con su predecesor: Grok 4.5 se situaba #33 en EQ-Bench Creative Writing y #41 en la tabla de escritura creativa de Arena, perdiendo en ambas ante el más antiguo Grok 4.20-beta1. Ninguna de las dos tablas de escritura creativa ha valorado aún a Grok 4.6 y, dado que SpaceXAI orientó este lanzamiento a la programación y al trabajo agéntico más que a la prosa, no damos por hecho que se haya movido. Si eliges solo por calidad de salida, Claude Fable 5 gana de forma clara en #1 en Arena escritura creativa, y Kimi K3 gana EQ-Bench. Elige Grok 4.6 por lo que te deja crear, no por lo bien que escribe.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Grok 4.6 | Sin filtros, con opinión, a la última | Menos restricciones de contenido, anclaje nativo en X en tiempo real | Las tablas de escritura creativa aún no lo han valorado; Grok 4.5 estaba #33 EQ-Bench, #41 Arena | $30/mes SuperGrok |
| Claude Fable 5 | Prosa creativa de máxima calidad | #1 Arena escritura creativa, #1 LiveBench Language | Límites cautelosos ante encargos atrevidos | $10 / $50 API |
| Kimi K3 | Ficción y voz distintiva | #1 EQ-Bench Creative Writing con 2377 | Solo #10 en Arena escritura creativa | $3 / $15 |
| Claude Opus 5 | Creatividad estructurada de formato largo | Mantiene hilos largos y se autoedita; Intelligence Index 63, solo por detrás de Claude Fable 5.1 | El más cauteloso del grupo | $20/mes Pro; $5 / $25 API |
| Gemini 3.1 Pro | Creatividad multimodal | Fuerte cadena de texto, imagen y vídeo | Cuotas dentro de la aplicación de Gemini | Gratis / $2.00-$4.00 API entrada |
| Grok Imagine (Spicy Mode) | NSFW / creatividad para adultos | La generación de imágenes más permisiva | Caso de uso de nicho | $30/mes SuperGrok |
Grok mantiene esta elección, ahora con Grok 4.6, que el 12 de agosto sustituyó a Grok 4.5 como buque insignia de SpaceXAI. Nada ha cambiado en su permisividad ni en su acceso en vivo a X, que es en lo que se apoya esta elección. El modelo de debajo es bastante más fuerte, cinco puntos arriba hasta un Intelligence Index de 61, pero esa ganancia aterrizó en programación y trabajo agéntico, no en la prosa, y ninguna tabla de escritura creativa ha valorado aún a Grok 4.6. Claude Fable 5 sigue siendo el modelo que usar cuando quieres la mejor escritura.
Mejor IA para precisión & investigación
La mejor IA para precisión e investigación es Gemini 3.1 Pro. Su resultado más fuerte es en ARC-AGI-1 de ARC Prize, donde puntúa un 98 % e iguala al panel humano, y lo hace a $0.52 por tarea. Esa combinación es el argumento: varios modelos están cerca en capacidad, ninguno lo iguala en coste para trabajo factual fiable. Lo empareja con anclaje nativo en Google Search, que es lo que quieres cuando la respuesta tiene que ser actual en lugar de simplemente plausible. También puntúa un 94,1 % en GPQA Diamond, donde GPT-5.6 Sol ahora lo iguala en lugar de quedar por detrás, y un 44,4 % en Humanity's Last Exam, y encabeza el tablero HLE de Scale SEAL con 46,44. Hemos descartado el marco anterior de ARC-AGI-2: su 77,1 % sigue siendo correcto, pero el tablero se ha movido y esa puntuación ahora lo sitúa alrededor del puesto 14. Dos advertencias honestas. En búsqueda anclada en concreto, la tabla de búsqueda de Arena la lidera Anthropic, no Google, con Gemini 3.1 Pro con anclaje en #7. Y en razonamiento novedoso, GPT-5.6 Sol lidera ARC-AGI-2 y Claude Opus 5 lidera ARC-AGI-3 con un 30 %, cerca de 3,75 veces el siguiente mejor modelo. No movimos la corona a Opus 5 porque Artificial Analysis mide su tasa de alucinación en un 50 % y lo sitúa por debajo de Fable 5 en AA-Omniscience, un tablero cuya cima comparte ahora Claude Fable 5.1.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| Gemini 3.1 Pro | Trabajo factual barato y fiable | 98 % ARC-AGI-1 (iguala al panel humano) a $0.52/tarea, 94,1 % GPQA (igualado por Sol) | ARC-AGI-2 77,1 % ahora ~14º; #7 en Arena búsqueda | $2.00-$4.00 / $12.00-$18.00 (escalonado) |
| Claude Fable 5 | Búsqueda anclada | #1 y #3 en la tabla de búsqueda de Arena, por delante de Google | Ningún nivel barato único | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Razonamiento novedoso | #1 ARC-AGI-2 con 92,5 %, contra un panel humano del 100 % | Scheming señalado por METR | $4 / $20 |
| Claude Opus 5 | Los problemas inéditos más difíciles | #1 ARC-AGI-3 con 30 %, ~3,75 veces el siguiente modelo (ARC Prize) | Artificial Analysis mide una tasa de alucinación del 50 % | $5 / $25 |
| Qwen 3.7 Max | Precisión frontier a precio de valor | 92,4 GPQA Diamond, 200 solicitudes gratis/día | Solo API, sin front-end de chat | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Opus 4.6 | Honestidad bajo presión | #1 en el tablero MASK de Scale SEAL con 96,28; Anthropic ocupa el top 5 | Reemplazado como buque insignia | Modelo legacy de Anthropic |
Gemini 3.1 Pro mantiene la corona de precisión, pero su cifra estrella ya no es una ventaja. Su puntuación de GPQA Diamond se recalibró a 94,1 % y GPT-5.6 Sol ahora lo iguala exactamente, así que la corona descansa sobre el resultado de ARC-AGI-1 a $0.52 por tarea más el anclaje de Search en lugar de sobre GPQA. Esta es la siguiente corona que volvemos a probar, y los tableros que miden con qué frecuencia un modelo simplemente se equivoca se movieron el 1 de septiembre. Claude Fable 5.1 tiene ahora la mayor precisión factual que Artificial Analysis ha medido, un 67 % frente al 65 % de Claude Fable 5, y encabeza Humanity's Last Exam con un 59,1 % frente al 55,5 %. El propio índice AA-Omniscience marca 43 para ambos modelos, por encima del 40 que dimos para Fable 5 el mes pasado, porque 5.1 compra su precisión extra con una tasa de intento más alta en las preguntas que no sabe responder.
Mejor IA para resolución de problemas
La mejor IA para la resolución de problemas difíciles es GPT-5.6 Sol, y es la corona mejor respaldada de esta página. Se lleva el #1 en LiveBench Mathematics con 96,2, el #1 en LiveBench Reasoning con 91,7 y el #1 en ARC-AGI-2 con un 92,5 %, lo más cerca que ningún modelo ha llegado del panel humano del 100 %. Tres casas distintas lo ponen primero en las tareas de razonamiento que importan, que es más acuerdo del que produce cualquier otra categoría de esta página. OpenAI aún no ha publicado la puntuación de FrontierMath de Sol, así que la marca verificada de OpenAI sigue siendo el 39,6 % de GPT-5.5 Pro en FrontierMath Tier 4, y encajaremos el número de Sol en el momento en que se haga público. Qwen 3.7 Max es la alternativa de valor para problemas de estilo competición con 97,1 en el índice HMMT de febrero de 2026 y 44,5 en Apex, a una fracción del coste de ChatGPT Pro, y ahora incluye 200 solicitudes de modelo gratis al día. Claude Opus 5 es la alternativa para cadenas largas de razonamiento agéntico, con 59 en el Agentic Index de Artificial Analysis, segundo tras el 61 de Claude Fable 5.1, y #1 en ARC-AGI-3 de ARC Prize con un 30 %, cerca de 3,75 veces el siguiente mejor modelo.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| GPT-5.6 Sol | Las matemáticas, la ciencia y el razonamiento más difíciles | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (92,5 %) | FrontierMath aún sin publicar; scheming señalado por METR | $100/mes ChatGPT Pro; API $4 / $20 |
| Claude Opus 5 | Cadenas largas de razonamiento agéntico | #2 Agentic Index (59), #1 ARC-AGI-3 (30 %) | Segundo en LiveBench Reasoning; tasa de alucinación del 50 % | $5 / $25 |
| GPT-5.5 Pro | Líder verificado de FrontierMath | 39,6 % FrontierMath Tier 4 | Reemplazado por Sol como buque insignia | $100/mes ChatGPT Pro |
| Qwen 3.7 Max | Matemáticas de competición con presupuesto ajustado | 97,1 HMMT 2026 feb, 44,5 Apex, 200 solicitudes gratis/día | Solo API | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Fable 5 | Matemáticas dentro de un flujo de programación | #1 en la subcategoría de matemáticas de Arena (1543), 96,0 LiveBench Mathematics | La opción más cara aquí | $10 / $50 |
| GLM 5.3 Flash | Resolución de problemas open-weight | Intelligence Index 57 bajo MIT, cuatro puntos por encima de GLM-5.2 con menos de la mitad de tamaño; 320B/18B activos, contexto 1M | Necesita un servidor multi-GPU, no una estación de trabajo; GLM 5.3 puntúa más alto según las propias cifras de Z.ai y se puede descargar desde el 28 de agosto, pero con más del doble de tamaño y bajo una licencia propia | Open weights (MIT) |
GPT-5.6 Sol mantiene esta corona, y sumó un segundo argumento. Sol ahora también lidera el Terminal-Bench v2.1 de Artificial Analysis con un 89,5 % y su Coding Index con 78,3, e iguala a Gemini 3.1 Pro en GPQA Diamond con un 94,1 %. Claude Opus 5 sigue siendo la alternativa de razonamiento agéntico por la fuerza de ARC-AGI-3. El 1 de agosto OpenAI llamó a su próxima familia de modelos Astra y publicó diez nuevos resultados matemáticos de una versión interna, aunque Astra está sin lanzar y no tiene fecha, precio ni disponibilidad. Claude Fable 5.1 de Anthropic llegó el 1 de septiembre y le quitó a Opus 5 el Agentic Index, 61 frente a 59, lo que cambia la cifra de apoyo de la alternativa, no la corona.
Mejor agente de IA
El mejor agente de IA ahora mismo es Gemini Spark para trabajo residente en la nube 24/7 y Claude Cowork para trabajo residente en el escritorio, con ChatGPT Codex como alternativa para agentes de programación y los agentes de navegador de clase OpenAI Operator como alternativa para tareas web. Los agentes de IA son la categoría que más rápido se mueve de 2026: cada proveedor de primer nivel lanza ahora un producto de agente, y la elección práctica es entre agentes que viven en la nube (se ejecutan mientras tu portátil está cerrado) y agentes que viven en tu escritorio (manejan tus apps directamente). Gemini Spark se lanzó en el Google I/O el 19 de mayo de 2026 y es el primer agente en la nube 24/7. Claude Cowork alcanzó la disponibilidad general el 9 de abril de 2026 y funciona como un agente de escritorio que maneja tus apps locales. ChatGPT Codex Mobile (14 de mayo) es la elección para trabajo de agente de programación. Lee la comparativa completa Gemini Spark vs. Claude Cowork.
| Agente | Mejor para | Dónde se ejecuta | Fortaleza | Precio |
|---|---|---|---|---|
| Gemini Spark | Tareas en la nube 24/7, flujos de Workspace | VM de Google Cloud (siempre activa) | Primer agente 24/7 real, integración profunda con Workspace | $99.99/mes Google AI Ultra |
| Claude Cowork | Escritorio, manejo de apps, diseño + código | Tu escritorio Mac/Windows | Maneja apps locales, ve tu pantalla | $20/mes Claude Pro |
| ChatGPT Codex Mobile | Agente de programación en el móvil | Nube de OpenAI + iOS/Android | Aprobar diffs y redirigir el trabajo desde el móvil | Incluido en los planes de ChatGPT |
| Grok Agentic (Grok 4.6) | Investigación en tiempo real, scraping de X | Nube de SpaceXAI | Integración nativa con X; Elo de 1755 en GDPval-AA v2 | $30/mes SuperGrok |
| OpenAI de clase Operator | Tareas de navegador, formularios web | Nube de OpenAI + tu navegador | Automatización web | ChatGPT Pro |
No se lanzaron nuevos agentes de consumo, y Muse Code de Meta (5 de agosto) es una herramienta de terminal para desarrolladores en lugar de una de consumo, así que la elección entre Gemini Spark (nube) y Claude Cowork (escritorio) sigue guiando la mayoría de las decisiones sobre agentes para usuarios individuales. La capa de modelo por debajo se movió de nuevo: Claude Fable 5.1 (1 de septiembre) lidera ahora el Agentic Index de Artificial Analysis con 61, por delante de Claude Opus 5 con 59, y encabeza el tablero GDPval-AA v2 con 1853 frente al 1824 de Opus 5. Opus 5 sigue siendo el modelo sobre el que la mayoría de equipos debería construir, a $5 / $25, la mitad del precio de Fable 5.1, y encabeza el tablero Agent de Arena, con Kimi K3 en tercer lugar. Para equipos que construyen sus propios agentes, Muse Spark 1.2 de Meta (5 de agosto) es una opción agent-native barata a $1.25 / $4.25 cuyo Elo agéntico GDPval-AA v2 saltó de 1371 a 1631, aunque Scale SEAL solo ha valorado la 1.1 más antigua, que lidera su tablero de uso de herramientas MCP Atlas con 88,1. GLM 5.3 Flash (26 de agosto, MIT) es ahora el modelo de agente open-weight que alojaríamos, con un Intelligence Index de 57 y AutomationBench 48,8 en el propio gráfico de Z.ai, donde Claude Opus 4.8 marca 41,0, aunque todavía no tiene votos en Arena; el registro independiente lo conserva GLM-5.2, en #5 del tablero Agent de Arena. Grok 4.6 (12 de agosto) es aquí la nueva historia de coste más que un producto de agente nuevo: marca un Elo de 1755 en GDPval-AA v2, que las entradas de septiembre han empujado al quinto puesto entre modelos distintos, y Artificial Analysis mide que termina los trabajos de largo horizonte en unos 53 turnos y 0,5 mil millones de tokens de entrada frente a unos 103 turnos y 2,0 mil millones de Opus 5, a $0.84 por tarea de índice.
Los modelos líderes como ChatGPT, Claude y Gemini, juntos en Mac, iPhone y iPad.
Gratis para empezar, 4,7★ en más de 27 000 reseñas.
Descargar Fello AIMejor IA para estudiantes
La mejor IA para estudiantes es GPT-5.5 Free dentro de ChatGPT para trabajo de curso general y Gemini 3.6 Flash Free dentro de la aplicación de Gemini para STEM y estudio multimodal, con Qwen 3.7 Max como alternativa por API para conjuntos de problemas más difíciles (200 solicitudes gratis al día) y Claude Opus 5 como alternativa para editar ensayos. La mayoría de los estudiantes no necesitan pagar: el nivel gratuito de ChatGPT ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible), Gemini 3.6 Flash está en la aplicación gratuita de Gemini y en AI Studio, Claude Sonnet 5 es el nuevo Claude gratuito por defecto, y DeepSeek V4 es gratis en el sitio de chat de DeepSeek. Para el desarrollo paso a paso en las matemáticas más difíciles, GPT-5.6 Sol es el nuevo buque insignia de OpenAI (su puntuación de FrontierMath aún no se ha publicado, con el 39,6 % verificado de GPT-5.5 Pro en FrontierMath Tier 4 como marca actual), aunque ambos son solo de pago; Qwen 3.7 Max es la alternativa de valor con 97,1 en HMMT 2026 febrero con precio de API de $1.25 / $3.75 en su promo del 50 % actual ($2.50 / $7.50 lista).
| Tarea | Mejor modelo | Por qué | ¿Gratis? | Alternativa |
|---|---|---|---|---|
| Ensayos & trabajo de curso | GPT-5.5 | Gratis en ChatGPT, fiabilidad factual mejorada vs. 5.4 | Sí | Claude Sonnet 5 (Claude gratis) |
| Resolución de problemas STEM | GPT-5.6 Sol / Qwen 3.7 Max | Nuevo buque insignia STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 feb | Pro de pago / Qwen API de pago | Gemini 3.6 Flash (gratis) |
| Investigación & precisión | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje nativo en Google Search | Sí (aplicación Gemini) | Claude Opus 5 |
| Edición de escritura | Claude Sonnet 5 | Gratis y por defecto en claude.ai; Claude Fable 5 es el líder de calidad | Sí (Claude gratis) | Claude Fable 5 |
| Estudio multimodal (PDF, diapositivas, imágenes) | Gemini 3.6 Flash | Contexto 1M, gratis en la aplicación de Gemini | Sí | NotebookLM (Google) |
Mejor IA para el trabajo & profesionales
La mejor IA para el trabajo profesional es GPT-5.6 (por defecto de ChatGPT desde el 9 de julio) para el trabajo de conocimiento diario, Claude Opus 5 para programación y escritura de alto riesgo, y Gemini Spark para flujos agénticos 24/7. La mayoría de los profesionales sacan el máximo partido ejecutando dos suscripciones de pago (ChatGPT Plus a $20/mes más Claude Pro a $20/mes, un total de $40/mes), o consolidando con Fello AI a $9.99/mes para los cinco mejores modelos en una app de Mac/iOS. Para el trabajo agéntico que corre mientras duermes, Gemini Spark en Google AI Ultra a $99.99/mes es el único agente en la nube 24/7 real.
| Caso de uso | Mejor modelo | Dato clave | Precio | Alternativa |
|---|---|---|---|---|
| Trabajo de conocimiento diario | GPT-5.6 | Por defecto de ChatGPT desde el 9 de julio; el asistente que la mayoría puede abrir | $20/mes ChatGPT Plus | Claude Opus 5 |
| Programación (propietaria) | Claude Opus 5 | #1 en Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); el por defecto recomendado de Anthropic | $20/mes Claude Pro | Claude Fable 5 |
| Programación (rentable) | Qwen 3.7 Max | 80,4 SWE-Verified, contexto 1M | $1.25 / $3.75 promo; $2.50 / $7.50 lista | DeepSeek V4-Flash 0731 |
| Investigación & informes | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje de Google | Google AI Pro / Ultra | Claude Opus 5 |
| Matemáticas, física, modelado financiero difíciles | GPT-5.6 Sol | Nuevo buque insignia STEM de OpenAI (5.5 Pro verificado en 39,6 % FrontierMath) | $100/mes ChatGPT Pro | Qwen 3.7 Max |
| Flujos de agente siempre activos | Gemini Spark | Primer agente en la nube 24/7 | $99.99/mes Google AI Ultra | Claude Cowork |
| Noticias en vivo, creatividad con contexto de X | Grok 4.6 | Intelligence Index 61 + anclaje nativo en X | $30/mes SuperGrok | Gemini 3.1 Pro |
| Consolidación todo en uno | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/mes | Pagar a cada proveedor por separado |
Precios de los modelos de IA en septiembre de 2026
Desde planes gratuitos de $0 hasta $199.99/mes de Google AI Ultra. El precio más determinante de esta tabla es Claude Opus 5 a $5 / $25, porque es el segundo mejor puntuado en el Intelligence Index de Artificial Analysis a la mitad del coste de los dos modelos Fable que lo rodean. Claude Fable 5.1, que se llevó la cima de ese índice el 1 de septiembre, mantiene el mismo precio de lista de $10 / $50 que Fable 5, pero recorta las lecturas de caché un 75 % hasta $0.25, y ahí está el ahorro en ejecuciones agénticas largas, no en el precio de lista. Muse Spark 1.2 de Meta se lista a $1.25 / $4.25, con un nivel Contributor a $0.10 / $0.20 para quien esté dispuesto a dejar que Meta entrene con sus prompts, y Grok 4.6 se lista a $2 / $6, con la salvedad de que un prompt de 200.000 tokens o más refactura la petición entera a $4 / $12. La elección relación precio-rendimiento se movió en agosto, y no porque nada se abaratara: DeepSeek subió sus dos modelos V4 unas cuatro veces el 16 de agosto, llevando V4-Flash 0731 de unos $0.14 / $0.28 planos a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta. La elección es ahora GLM 5.3 Flash a $0.15 / $0.50 de lista, a mitad de precio hasta el 9 de septiembre, que puntúa 57 en el Intelligence Index y deja por debajo incluso la tarifa en valle de DeepSeek por ambos lados a cualquier hora del día. En la propia frontier, la elección de valor es Grok 4.6, con 61 por $0.84 por tarea de índice, donde Opus 5 cuesta $2.34 y GPT-5.6 Sol cobra $4 / $20 por la misma puntuación tras su recorte del 21 de agosto. Entre los modelos cerrados, GPT-5.6 Luna es el más barato a $0.20 / $1.20 tras el recorte de OpenAI del 30 de julio. Para un desglose más a fondo consulta nuestra Guía completa de comparativa de precios de IA.
| Modelo | Entrada (por 1M) | Salida (por 1M) | Contexto | ¿Acceso gratis? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K en Codex) | ChatGPT Free; API de pago |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro desde $100/mes (nivel de mayor uso a $200) |
| GPT-5.6 Sol | $4.00 | $20.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| GPT-5.6 Terra | $2.00 | $12.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| GPT-5.6 Luna | $0.20 | $1.20 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Por defecto en Claude Pro/Max; API de pago |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modelo legacy en Anthropic; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Lecturas de caché $0.25; en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos. Mythos 5.1 factura igual, solo por invitación |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanente en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Por defecto en Claude Free & Pro; API de pago |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API de pago (reemplazado por Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Aplicación Gemini limitada; API de pago |
| Gemini 3.7 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | AI Studio, Android Studio, Antigravity + API de pago; en la aplicación de Gemini solo vía Spark (AI Pro/Ultra, excluye EEE/RU/CH/Nigeria) |
| Gemini 3.6 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | Modelo por defecto de la app gratuita de Gemini; AI Studio; nivel gratuito de API + API de pago |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; nivel gratuito de API + API de pago |
| Qwen 3.7 Max | $1.25 promo / $2.50 lista | $3.75 promo / $7.50 lista | 1M | 200 solicitudes gratis/día; API de pago más allá |
| MiniMax M3 | $0.30 (50 % de descuento sobre $0.60) | $1.20 (≤512K) | 1M | Open weights; se aplican costes de alojamiento |
| LongCat-2.0 | Depende del proveedor | Depende del proveedor | 1M | Open weights (MIT); se aplican costes de alojamiento |
| NVIDIA Nemotron 3 Ultra | Depende del proveedor | Depende del proveedor | 1M | Open weights (OpenMDW); se aplican costes de alojamiento |
| Qwen 3.5 (open-weight) | Autoalojado / Together | Autoalojado / Together | 1M | Open weights; se aplican costes de alojamiento |
| Nex-N2-Pro | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (Apache 2.0); se aplican costes de alojamiento |
| Rio 3.5 Open 397B | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (MIT); se aplican costes de alojamiento |
| Grok 4.3 | $1.25 | $2.50 | 1M | Plan de consumo gratuito; API de pago |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API de SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Muse Spark 1.2 | $1.25 ($0.10 nivel Contributor) | $4.25 ($0.20 nivel Contributor) | 1M | API de pago; Muse Code, Meta Model API y OpenRouter; el nivel Contributor cambia derechos de entrenamiento por un ~92 % de descuento |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Nivel básico gratuito en la aplicación de Kimi; open weights en Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vídeo) | $1.50 | $17.50 (salida de vídeo) | Clips de 10 segundos | Aplicación Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.66 en valle / $1.32 en punta ($0.022 cache-hit en valle) | $1.98 en valle / $3.96 en punta | 1M | DeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto |
| DeepSeek V4-Flash 0731 | $0.22 en valle / $0.44 en punta ($0.007 cache-hit en valle) | $0.66 en valle / $1.32 en punta | 1M | DeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto |
| Kimi K2.7 Code | Depende del proveedor | Depende del proveedor | 256K | Open weights; se aplican costes de alojamiento |
| GLM-5.2 | Depende del proveedor | Depende del proveedor | 1M | Open weights; se aplican costes de alojamiento |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | API de Z.ai, GLM Coding Plan y ZCode; pesos en Hugging Face desde el 28 de agosto bajo la GLM 5.3 License propia |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit); $0.075 en promoción | $0.50; $0.25 en promoción | 1M | API de Z.ai, GLM Coding Plan, OpenRouter; pesos MIT en Hugging Face; la promoción acaba el 9 de septiembre |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Pesos abiertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Depende del proveedor | Depende del proveedor | 262K (hasta 1M) | Pesos abiertos (Qwen Community License 1.0); se suman los costes de alojamiento |
| ERNIE 5.1 | Precio para la región de China | Precio para la región de China | 256K | Nivel gratuito de Baidu |
| Gemini Spark (agente) | Sin precio de API | Sin precio de API | 1M (base Gemini) | Google AI Ultra $99.99 o $199.99/mes |
| Fello AI (agregador) | Enrutado por la app | Enrutado por la app | Depende del modelo | $9.99/mes, plan gratuito disponible |
Las tarifas de GPT-5.5 y GPT-5.5 Pro de arriba son precios de contexto corto; OpenAI ya no publica las cifras específicas de contexto largo. Los niveles GPT-5.6 se facturan a 2x entrada y 1,5x salida una vez que un prompt supera los 272K tokens de entrada, lo que sitúa a Terra de contexto largo en $4 / $18 y a Luna en $0.40 / $1.80. Grok 4.6 funciona igual, pero muerde más fuerte: a partir de 200.000 tokens de prompt, SpaceXAI refactura la petición entera a la tarifa más alta en lugar de solo el exceso, así que pasarse por mil tokens duplica el coste de toda la llamada. La otra tarifa que conviene leer dos veces es la de DeepSeek: desde el 16 de agosto sus dos modelos V4 se facturan a precio de punta de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y a exactamente la mitad en cualquier otra hora, así que la misma tarea puede costar el doble según cuándo la ejecutes. Si quieres acceso a varios modelos de IA sin gestionar suscripciones separadas, Fello AI ofrece GPT, Claude, Gemini, Grok, Perplexity y más en una sola app para Mac, iPhone y iPad desde $9.99/mes.
Mejores modelos open-weight en septiembre de 2026
El mejor modelo open-weight en septiembre de 2026 es Kimi K3, y se llevó la delantera en el momento en que Moonshot publicó los pesos el 27 de julio de 2026. Tiene el Intelligence Index más alto de cualquier modelo open-weight con 60 en Artificial Analysis, siete puntos por delante de GLM-5.2, y en Arena sigue siendo la entrada abierta mejor situada, en #2 en WebDev (1,675.5) por detrás solo de Claude Opus 5 y #3 en el tablero Agent. Una pega decide cuál de los dos deberías usar de verdad. La descarga de K3 son 96 shards de safetensors y unos 1,56 TB, lo que necesita un clúster de GPU multinodo en lugar de una estación de trabajo, y viene bajo una licencia propia Kimi K3 License en lugar de MIT. Así que la recomendación práctica para equipos que ejecutan sus propios pesos es ahora GLM 5.3 Flash (Z.ai, MIT), publicado el 26 de agosto con un Intelligence Index de 57, cuatro puntos por encima de GLM-5.2 y con menos de la mitad de tamaño, 320B totales con 18B activos. Es el primer modelo nativamente multimodal de la línea GLM-5, admite un contexto de 1M de tokens, y los pesos estaban en Hugging Face bajo MIT el mismo día del lanzamiento. GLM-5.2 (MIT) es la alternativa de respaldo, con un Intelligence Index de 53, y conserva el registro independiente que el modelo más nuevo aún no ha tenido tiempo de ganarse, #6 en Arena WebDev (1,587.1) y #5 en el tablero Agent. El tercer puesto cambió de manos el último día de julio: DeepSeek V4-Flash 0731 recibió nuevo post-training y saltó de un Intelligence Index de 40 a 52 en el índice actual v4.1.1 bajo MIT, aunque su precio de API ha subido desde entonces unas cuatro veces, a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta. Tres lanzamientos cerraron después el mes, y ninguno tiene todavía una valoración independiente. GLM 5.3 publicó por fin sus pesos el 28 de agosto, exactamente en la fecha que llevaba su marcador de posición, pero bajo una GLM 5.3 License propia en lugar de MIT, con una cláusula que obliga a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos a pasar antes una revisión de seguridad de Z.ai; ten en cuenta además que GLM 5.3 Flash no es un GLM 5.3 recortado, sino un modelo aparte sobre una base recién entrenada, y por eso pudo salir bajo MIT puro cuando el buque insignia no pudo. Tencent liberó Hy4 Preview el 28 de agosto con 770B totales y 49B activos bajo Apache 2.0, el mayor modelo con licencia permisiva publicado hasta la fecha, apoyado en una evaluación ciega interna y no en ningún tablero independiente. Y Alibaba publicó Qwen3.8-Flash-Next el 26 de agosto, un mixture-of-experts de 125B con solo 6B activos que anticipa la arquitectura Qwen4, bajo la Qwen Community License 1.0 en lugar de Apache. Los tres se listan abajo en lugar de clasificarse.
| Modelo | Mejor para | Benchmark clave | Contexto / Licencia | Dónde ejecutar |
|---|---|---|---|---|
| Kimi K3 | Modelo open-weight mejor puntuado, trabajo agéntico y web | II 60, el más alto de cualquier modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B activos | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 TB), Moonshot API, proveedores |
| GLM 5.3 Flash | Mejor modelo abierto que la mayoría de equipos puede ejecutar de verdad | II 57 (v4.1.1), en la frontera de Pareto entre inteligencia y coste, a unos $0.09 por tarea del índice; 320B/18B activos, nativamente multimodal | 1M / MIT | Hugging Face, API de Z.ai ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Respaldo con historial independiente | II 53; #6 Arena WebDev (1,587.1), #5 Arena Agent; 744B/40B activos | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Abierto desde el 28 de agosto, pero con licencia propia | Misma base de 744B que GLM-5.2, solo post-entrenada, checkpoint publicado contado en 753B; CyberGym 84,5 % y Terminal-Bench 3.0 28,3 (cifras del fabricante) | 1M / GLM 5.3 License (model-as-a-service por encima de 10 000 M USD de ingresos necesita revisión de seguridad de Z.ai) | Hugging Face, API de Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4-Flash 0731 | Mejor valor abierto si lo alojas tú mismo | II 52 (v4.1.1), desde 40 el 31 de julio; 284B/13B activos | 1M / MIT | DeepSeek API ($0.22/$0.66 en valle, $0.44/$1.32 en punta desde el 16 de agosto), local |
| Tencent Hy4 Preview | Mayor modelo con licencia permisiva hasta la fecha | 770B/49B activos; 2,99/4,00 en el panel propio de Tencent de 203 tareas frente a 2,94 de Kimi K3 y 2,92 de GLM 5.3 (fabricante); todavía sin valoración independiente | 1M+ / Apache 2.0 | Hugging Face (BF16 y FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Anticipo de la arquitectura Qwen4 | 125B totales más un embedding de N-gramas de 51B, 6B activos; 91,7 GPQA Diamond y 62,5 SWE-Bench Pro (fabricante); todavía sin valoración independiente | 262K a 1M / Qwen Community License 1.0 | Hugging Face, proveedores, autoalojamiento |
| LongCat-2.0 | Programador abierto frontier entrenado en chips chinos | II 33 (v4.1); 59,5 % SWE-Bench Pro (proveedor), 1.6T/~48B activos | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de clase frontier barato | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licencia por definir | Hugging Face, API $0.30/1M (50 % de descuento) |
| Nex-N2-Pro | Puntuación de programación abierta más fuerte | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B activos | Basado en Qwen / Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Kimi K2.7 Code | Programador abierto con licencia comercial más fuerte | +21,8 % en Kimi Code Bench v2 vs. K2.6 (proveedor); 1T/32B activos | 256K / Modified MIT | Hugging Face, DeepInfra, proveedores |
| DeepSeek V4-Pro | Trabajo agéntico del mundo real | II 44 (v4.1), 1.6T/49B activos | 1M / MIT | DeepSeek API ($0.435/$0.87), local |
| Hy3 | El participante más nuevo con licencia permisiva | II 41 (v4.1); #22 en Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Inkling | Primer modelo open-weight de Thinking Machines | II 41 (v4.1), agéntico 32,3, lanzado el 15 de julio | Open weights | Hugging Face, proveedores, autoalojado |
| Inkling Small | Misma familia a una cuarta parte del tamaño | II 40 (v4.1), agéntico 30,8; 276B/12B activos, entrada de texto, imagen y audio | Apache 2.0 | Hugging Face (BF16 y NVFP4), proveedores, autoalojado |
| NVIDIA Nemotron 3 Ultra | Afinado por NVIDIA, licencia totalmente permisiva | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B activos | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 autoalojado) |
| Qwen 3.5 (397B / 17B activos) | Multimodal, decodificación rápida | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / abierto | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programador agéntico abierto eficiente (3B activos) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B activos | 262K (a 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programador denso ejecutable en portátil | 87,8 GPQA Diamond, denso 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, razonamiento multilingüe | 70,8 Terminal-Bench 2.1 (first-party), supera a Qwen 3.7 Plus en 4/5 | 397B/17B activos / MIT | Hugging Face, proveedores, autoalojado |
| Llama 4 Maverick | Buque insignia de la línea Meta | 17B activos / 400B de parámetros totales | Llama 4 license | Nube de Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / bajo consumo | Multimodal, huella muy pequeña | Compacto / abierto | Local, herramienta NVIDIA |
Aquí la licencia importa tanto como la puntuación bruta, y agosto ha ensanchado la distancia entre los dos grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) y Nemotron 3 Ultra (OpenMDW) todos permiten claramente el uso comercial sin prueba de ingresos. El resto lleva condiciones que conviene leer antes de construir sobre ellas: MiniMax M3 y MiniMax H3 vienen bajo sus propias licencias comunitarias, y H3 exige además una solicitud desde EE. UU., la UE, el Reino Unido y Corea del Sur; Kimi K3 se sitúa en una licencia propia con un umbral de ingresos para quien lo revenda como servicio; GLM 5.3 exige una revisión de seguridad de Z.ai a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos; y la Qwen Community License 1.0 de Qwen3.8-Flash-Next exige una licencia aparte de Qwen para explotar un negocio de model-as-a-service o de asistente de trabajo con IA, aunque el uso interno queda exento. Ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos: Claude Opus 5 se llevó el tablero Agent en julio, el último que lideró un modelo open-weight.
Benchmarks, precios y uso práctico
Cada clasificación de esta página combina tres entradas: benchmarks públicos de siete casas independientes (Artificial Analysis, Arena antes LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize y el tablero oficial de Terminal-Bench 2.1, cubriendo los índices Intelligence y Agentic, GPQA Diamond, ARC-AGI-1 al 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas y el Remote Labor Index), precios de API y suscripción publicados en la página de precios oficial de cada proveedor, y uso práctico por parte del equipo editorial de FelloAI que ejecuta prompts reales sobre la misma tarea en cada modelo. Volvemos a obtener las fuentes oficiales de precios y benchmarks antes de cada actualización mensual.
Los benchmarks se ponderan según el caso de uso: SWE-bench y Terminal-Bench impulsan la programación, GPQA Diamond y ARC-AGI-2 impulsan la precisión, GDPval-AA (el benchmark de entregables profesionales de Artificial Analysis) informa la calidad de las tareas profesionales mientras que el estilo de escritura se juzga principalmente por pruebas prácticas, FrontierMath y HMMT impulsan la resolución de problemas. Revelamos cuándo un benchmark es reportado por el proveedor pero no verificado de forma independiente, y descartamos cualquier afirmación que no podamos reproducir contra una fuente en vivo. No movemos la corona de una categoría por la fuerza de una sola tabla, y cuando un modelo nuevo es demasiado reciente para que los tableros de preferencia humana lo hayan valorado, lo decimos en lugar de coronarlo solo por puntuaciones de benchmark. Cuando un modelo pasa por una actualización importante entre actualizaciones, volvemos a clasificar la categoría y añadimos una línea «Qué cambió este mes» al pie del análisis a fondo.
Fello AI reúne los mejores modelos de IA en una sola app nativa y ligera.
Cambia entre ellos cuando quieras, sin suscripciones separadas.
Descargar Fello AI




