Mejores modelos de IA en 2026
Clasificaciones, comparativas y análisis a fondo, actualizados cada mes a medida que llegan nuevos modelos.
Claude Fable 5.1 llegó el 1 de septiembre y se puso directamente en lo más alto del Intelligence Index de Artificial Analysis con 66, la puntuación más alta que la casa ha medido, llevándose con él su Agentic Index con 61. Claude Opus 5 conserva las dos cosas por las que la mayoría de lectores decide de verdad: la corona de programación y el precio, $5 / $25 por 1M de tokens frente a los $10 / $50 de Fable 5.1. Esa corona es más estrecha que antes: el Qwen3.8-Max-0902 de Alibaba debutó el 2 de septiembre como #1 en el tablero Code Arena: WebDev de Arena con 1691 puntos frente a los 1688 de Opus 5, así que Opus 5 ahora lidera image-to-WebDev y es segundo en WebDev. Ningún tablero de Arena tiene todavía votos para 5.1, así que no se ha movido nada de lo que en esta página decide la preferencia humana. Grok 4.6 es la verdadera sorpresa del mes: una actualización de post-entrenamiento de Grok 4.5 que sube cinco puntos hasta 61, empatando con GPT-5.6 Sol mientras cobra $2 / $6, y que termina los trabajos agénticos largos en aproximadamente la mitad de turnos que necesita Opus 5. Meta sube más rápido que nadie: Muse Spark 1.3 aterrizó el 2 de septiembre con 61 en ese mismo índice, ocho puntos más que en julio, aunque es un lanzamiento para desarrolladores sin producto de consumo que pierde todas las filas de agente en el propio gráfico de Meta.
El otro movimiento está en el extremo económico, y por primera vez este año fue en la dirección contraria. DeepSeek subió los precios de sus dos modelos V4 unas cuatro veces el 16 de agosto y dividió la tarifa en horas punta y valle, así que DeepSeek V4-Flash 0731 cuesta ahora $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, en lugar de los $0.14 / $0.28 planos con los que salió, lo que le cuesta la elección relación precio-rendimiento. Esa elección pasa a GLM 5.3 Flash, que aterrizó el 26 de agosto con pesos MIT el primer día, un Intelligence Index de 57 y un precio de lista de $0.15 / $0.50, reducido a la mitad hasta el 9 de septiembre a $0.075 / $0.25, y que ahora deja a DeepSeek por debajo a cualquier hora del día. Google ya había reducido a la mitad su propia tarifa Flash: Gemini 3.7 Flash salió el 13 de agosto a un introductorio $0.75 / $3.75, con Gemini 3.6 Flash pasando a la misma tarifa, y Gemini 3.8 Flash lo siguió el 2 de septiembre a ese mismo precio, con 59 puntos en el Intelligence Index de Artificial Analysis frente a los 56 de 3.7 Flash. Los tres precios se duplican el 1 de enero de 2027. El campo abierto cerró después el mes con tres lanzamientos en tres días: GLM 5.3 publicó por fin sus pesos el 28 de agosto, aunque bajo una licencia propia de Z.ai en lugar del MIT puro que recibió su hermano menor, Alibaba abrió Qwen3.8-Flash-Next el 26 de agosto como el primer vistazo público a la arquitectura Qwen4, y Tencent liberó Hy4 Preview el 28 de agosto, 770 000 millones de parámetros bajo Apache 2.0. Abajo están los ganadores por categoría de septiembre de 2026. Haz clic en cualquier tarjeta para saltar directamente al desglose completo, o usa la navegación fija para moverte entre categorías. Las clasificaciones, benchmarks y precios se actualizan dentro de las 48 horas siguientes al lanzamiento de cualquier modelo importante.
¿Quieres los mejores modelos de IA sin hacer malabares con suscripciones separadas? Fello AI reúne los modelos líderes en una sola app nativa para Mac, iPhone y iPad.
Descargar Fello AI2 sep Alibaba Qwen3.8-Max-0902 le quita a Claude Opus 5 el tablero WebDev de Arena por tres puntos, a $2 / $6 Nuevo
2 sep Muse Spark 1.3, Intelligence Index de 57 a 61 con un $1.25 / $4.25 sin cambios, gana en programación y pierde todas las filas de agente Nuevo
2 sep Google Gemini 3.8 Flash, tres puntos más en el Intelligence Index al mismo $0.75 / $3.75 Nuevo
1 sep Anthropic Claude Fable 5.1 y Mythos 5.1, un nuevo #1 en Artificial Analysis con 66 y un recorte del 75 % en las lecturas de caché Nuevo
28 ago Z.ai Los pesos de GLM 5.3 ya están fuera tras la pausa de seguridad, pero la licencia no es MIT Nuevo
28 ago Tencent Tencent Hy4 Preview, 770B de pesos abiertos bajo Apache 2.0 y el mayor modelo permisivo hasta la fecha Nuevo
26 ago Z.ai GLM 5.3 Flash, Ox Alpha desvelado, y los primeros pesos MIT que Z.ai publica desde GLM-5.2 Nuevo
26 ago Alibaba Qwen3.8-Flash-Next, pesos abiertos y el primer vistazo público a la arquitectura Qwen4 Nuevo
21 ago OpenAI GPT-5.6 Sol baja más de un 20 % y queda por debajo de Claude Opus 5 en ambos lados Nuevo
16 ago DeepSeek DeepSeek sube los precios de la API unas cuatro veces y divide la tarifa en horas punta y valle Nuevo
14 ago Z.ai GLM 5.3, un gran salto agéntico solo con post-entrenamiento, lanzado sin los open weights Nuevo
13 ago Google Gemini 3.7 Flash, las puntuaciones de programación suben y el precio se reduce a la mitad hasta $0.75 / $3.75, hasta enero Nuevo
12 ago SpaceXAI Grok 4.6, el post-entrenamiento sube el Intelligence Index de 56 a 61 con $2 / $6 sin cambios Nuevo
5 ago Muse Spark 1.2 y Muse Code, Intelligence Index de 51 a 57 con un $1.25 / $4.25 sin cambios, además de un agente de programación de terminal Nuevo
3 ago Alibaba Qwen 3.8 (Qwen3.8-Max), buque insignia multimodal de 2,4 billones de parámetros ya disponible en general a $2 / $6 Nuevo
31 jul DeepSeek DeepSeek V4-Flash 0731, mismo precio, mismo tamaño, Intelligence Index de 40 a 52
31 jul MiniMax MiniMax H3, vídeo 2K con audio estéreo nativo desde $0.13 por segundo
Finales de jul Thinking Machines Inkling Small, una cuarta parte del tamaño de Inkling con casi la misma puntuación
30 jul OpenAI Recorte de precios de GPT-5.6, Luna un 80 % más barato, Terra un 20 % más barato, Sol sin cambios
24 jul Anthropic Claude Opus 5, nuevo #1 en Artificial Analysis, lidera tanto el Intelligence Index (63) como el Agentic Index (55.3)
24 jul Sakana AI Fugu-Ultra v1.1, renovación del motor de orquestación con mejoras reportadas por el proveedor de hasta 7,9 puntos sobre v1.0 al mismo precio
21 jul Google Gemini 3.6 Flash, salida más barata, más rápido, mismo Intelligence Index
16 jul Moonshot AI Kimi K3, 2,8B de parámetros, el mayor modelo open-weight jamás publicado (pesos lanzados el 27 de julio)
9 jul OpenAI GPT-5.6 Sol, Terra y Luna, familia de nueva generación en vivo en ChatGPT, Codex y la API
Pendiente Google Gemini 3.5 Pro, aún sin lanzar, meses de retraso según Bloomberg Retrasado
Mejor IA para escritura
La mejor IA para escritura es Claude Fable 5, el único modelo entre los tres primeros de los tres tableros independientes de escritura, con Claude Sonnet 5 como la elección de valor del plan gratuito y GPT-5.5 como alternativa para la escritura de negocios anclada en hechos. Fable 5 lidera la tabla de escritura creativa de Arena, encabeza LiveBench Language con 90,7 y queda tercero en EQ-Bench Creative Writing v3 por detrás de Kimi K3 y GPT-5.6 Sol. Ningún otro modelo está entre los tres primeros en más de uno de ellos. Es un cambio respecto al mes pasado, cuando Claude Sonnet 5 ocupaba este puesto por GDPval-AA; los tableros de preferencia no respaldan esa colocación, así que Sonnet 5 es ahora la elección de valor en lugar del líder de calidad. Fable 5 cuesta $10 / $50 por 1M de tokens y está incluido de forma permanente en Claude Max y Team Premium con cerca del 50 % de los límites de uso habituales. Si tu escritura es un entregable de trabajo en lugar de prosa, el tablero GDPval-AA v2 de entregables profesionales lo lidera ahora Claude Fable 5.1 con 1853, por delante de Claude Opus 5 con 1824 y de Fable 5 con 1723. Fable 5.1 llegó el 1 de septiembre como el modelo más capaz al mismo precio de $10 / $50, y gana a Fable 5 en todos los tableros que han medido a ambos, incluido Humanity's Last Exam con un 59,1 % frente al 55,5 %. No le hemos movido la corona porque esta elección descansa sobre la preferencia humana y ningún tablero de Arena lo ha valorado todavía. La traducción es una cuestión aparte con un ganador aparte, que analizamos en nuestra guía sobre la mejor IA para traducir.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5 | Mejor escritura en general | #1 Arena texto en general (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | La opción más cara aquí | $10 / $50 |
| Claude Fable 5.1 | Máxima capacidad al mismo precio | #1 Humanity's Last Exam (59,1 %), #1 GDPval-AA v2 (1853), #1 Intelligence Index (66) | Sin votos en Arena todavía, así que sin valorar en los tableros de preferencia | $10 / $50 |
| Kimi K3 | Ficción creativa y voz | #1 EQ-Bench Creative Writing (2377), 234 Elo por delante del segundo | Solo #10 en Arena escritura creativa | $3 / $15 |
| Claude Sonnet 5 | Escritura gratuita para el día a día | Gratis y por defecto en claude.ai, contexto 1M | #53 Arena escritura creativa; 75,0 LiveBench Language | $2 / $10, ahora permanente |
| Claude Opus 5 | Entregables profesionales ajustados de precio | #2 GDPval-AA v2 con 1824, por delante de Fable 5 (1723) | Por detrás de Fable 5 en Arena texto, por detrás de Fable 5.1 en GDPval-AA v2 | $5 / $25 |
| GPT-5.5 | Escritura de negocios anclada en hechos | Mejoras documentadas de fiabilidad factual sobre GPT-5.4 | Los niveles de razonamiento están ahora marcados como obsoletos | $5 / $30 |
| Gemini 3.8 Flash | Borradores en volumen a escala | Intelligence Index 59, 304,6 tok/s de salida, contexto 1M | Ajustado a agentes más que a prosa; el precio introductorio se duplica el 1 de enero de 2027 | $0.75 / $3.75 |
La corona de escritura se queda con Claude Fable 5, pero el argumento a su favor se estrechó el 1 de septiembre. Anthropic lanzó Claude Fable 5.1, y se lleva Humanity's Last Exam con un 59,1 % frente al 55,5 % de Fable 5, el tablero GDPval-AA v2 con 1853 y el Intelligence Index con 66. Lo que no tiene es un solo voto en Arena, y esta corona descansa sobre los tableros de texto y de escritura creativa de Arena, donde Fable 5 sigue siendo #1 con 1508.6 en el corte del 1 de agosto. Fable 5.1 entra por tanto en la tabla como la opción más capaz al mismo precio de $10 / $50, y volvemos a probar la corona en cuanto Arena lo valore. Dos cifras que dimos el mes pasado también se han recalibrado: AA-Omniscience marca ahora 43 para ambos modelos Fable en lugar de 40, y Artificial Analysis mide a Fable 5 en Humanity's Last Exam con un 55,5 % en lugar de un 53,3 %.
Mejor IA para chat & asistente diario
La mejor IA para el chat del día a día es GPT-5.6, y la razón honesta es el alcance en lugar de la posición en los tableros. Es el modelo que ChatGPT sirve por defecto a la mayor base de usuarios de la categoría, lo que lo convierte en el mejor asistente que la mayoría de la gente puede abrir de verdad. En preferencia humana pura no es el líder: GPT-5.6 Sol se sitúa #14 en la tabla de texto de Arena con 1482,8, donde Claude Fable 5 lidera con 1508.6. La mayoría de los usuarios de ChatGPT reciben el nivel equilibrado Terra, que OpenAI dice que iguala a GPT-5.5 y, desde el recorte de precios del 30 de julio de 2026, cuesta un 60 % menos. Está disponible dentro de ChatGPT (gratis con límites, Plus a $20/mes, Pro a $100/mes), a través de la API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), y empaquetado dentro de Fello AI junto a Claude, Gemini, Grok y DeepSeek. Una advertencia: la system card de OpenAI y el evaluador METR señalaron un comportamiento de «scheming» elevado en Sol, así que GPT-5.5 Instant sigue siendo la elección más segura para trabajo sensible a las alucinaciones.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| GPT-5.6 | Chat diario, por defecto de ChatGPT | El asistente que la mayoría puede abrir; Terra iguala a GPT-5.5 a ~mitad de coste | #14 en Arena texto; scheming señalado por METR | Gratis / $20/mes Plus; API $0.20 / $1.20 a $4 / $20 |
| Claude Fable 5 | La conversación mejor valorada | #1 en Arena texto en general (1508.6) y en 6 de 7 subcategorías | Sin plan gratuito; acceso por créditos de uso en Pro | $10 / $50 API |
| Claude Opus 5 | Respuestas reflexivas y matizadas | #1 Artificial Analysis Intelligence Index (63) y Agentic Index (55.3) | #6 en Arena texto, por detrás de Claude Fable 5 | $20/mes Pro, $5 / $25 API |
| GPT-5.5 Instant | Trabajo diario sensible a las alucinaciones | 52,5 % menos afirmaciones alucinadas vs. 5.3 Instant | Los niveles de razonamiento están ahora marcados como obsoletos | $20/mes Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rápido, gratis, multimodal | Sigue siendo el modelo que sirve el nivel gratuito de Gemini, contexto 1M, #12 en Arena texto | Más flojo en el razonamiento más difícil; 3.8 Flash lo supera al mismo precio | Gratis / $0.75 / $3.75 API |
| Fello AI | Todos los mejores modelos, una app | ChatGPT + Claude + Gemini + Grok + DeepSeek y más en Mac, iPhone y iPad | Enrutado por la app, no directo | $9.99/mes |
GPT-5.6 mantiene la elección de chat por alcance, y la distancia con el líder de preferencia se amplió en lugar de cerrarse. En el corte del 1 de agosto Sol se sitúa #14 en Arena texto con 1482,8, bajando desde #11, mientras Claude Fable 5 lidera con 1508.6. Nada del producto cambió, así que la corona no se mueve: sigue tratándose de qué asistente puede abrir de verdad la mayoría de la gente.
Mejor IA para imágenes
La mejor IA para la generación de imágenes es ChatGPT Images 2.0, y es la corona menos discutida de esta página. GPT Image 2 lidera el tablero de texto a imagen de Arena con 1385 Elo y su tablero de edición de imágenes con 1463, y Artificial Analysis lo pone primero en su propia arena de imagen con 1339,4. Es la elección natural siempre que tu imagen tenga que contener palabras legibles, en español o en otra escritura, y está incluido en ChatGPT Plus y Pro. Los segundos puestos han cambiado. Reve 2.1 (9 de julio) es el verdadero #2 en texto a imagen con 1302, y Reve 2.0 ahora se sitúa por detrás de él en los dos tableros. Muse Image de Meta es #3 en el tablero de texto a imagen de Arena y #2 en edición de imágenes, la mejor actuación que ha logrado ningún modelo de imagen de Meta. Nano Banana Pro de Google ya no es el segundo en general: en texto a imagen se clasifica entre #8 y #11, por debajo de su propio hermano más barato Nano Banana 2, aunque queda más arriba en edición de imágenes.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Imágenes con texto legible | #1 texto a imagen (1385) y #1 edición de imágenes (1463) | Menos fotorrealista que la línea de imagen de Gemini | Incluido en ChatGPT Plus |
| Reve 2.1 | Diseño, tipografía, 4K nativo | #2 texto a imagen con 1302, edición que preserva el diseño | Ecosistema más pequeño | Gratis / desde $7.99/mes |
| Muse Image | Edición de imágenes, ecosistema Meta | #3 texto a imagen, #2 edición de imágenes (1407) | Nuevo, herramientas escasas a su alrededor | Aplicación Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Retratos y productos fotorrealistas | Supera a Nano Banana Pro en los dos tableros | Más flojo en texto dentro de la imagen | Aplicación Gemini / AI Studio |
| Seedream 5.0 Pro | Texto multilingüe + edición por regiones | 10+ idiomas incl. árabe RTL, edición con lazo y capas | Sin benchmarks independientes; incertidumbre de derechos de autor | BytePlus / Magnific |
| Midjourney v8 | Arte estilizado, ilustración | Base estética que la mayoría de los artistas prefieren | Más flojo en texto dentro de la imagen | $10-$120/mes |
| Grok Imagine | NSFW / Spicy Mode | Los límites más permisivos | Un modelo más pequeño por detrás | $30/mes SuperGrok |
La corona de imagen no cambia y GPT Image 2 sigue liderando los tres tableros que seguimos, en Arena texto a imagen (1385), Arena edición de imágenes (1463) y la arena de imagen de Artificial Analysis (1339,4). La única incorporación es MAI-Image-2.5 de Microsoft, que se sitúa tercero en el tablero de imagen de Artificial Analysis con 1269,7 y tercero en el tablero de edición de imágenes de Arena, así que el tercer puesto ahora depende de qué casa leas.
Mejor IA para vídeo
La mejor IA para la generación de vídeo es Gemini Omni Flash, que lidera el tablero de texto a vídeo de Arena con 1527 Elo, 45 puntos completos por delante del segundo, y también encabeza la arena de vídeo de Artificial Analysis. Es #1 en las dos casas, algo que ningún otro modelo de vídeo logra. El precio va de $1.50 de entrada y $17.50 por 1M de tokens de salida de vídeo, lo que sale a unos $0.10 por segundo de vídeo terminado, y admite edición conversacional. El único límite real es la duración: Omni Flash genera clips de 10 segundos. Si necesitas tomas más largas, Veo 3.1 sigue siendo la herramienta adecuada dentro de la aplicación de Gemini, AI Studio y Vertex AI, con audio nativo y salida 1080p. Esto reemplaza a Veo 3.1 en lo alto de la categoría; Veo 3.1 es un buen modelo pero no el líder, con su mejor variante en #6 del tablero de texto a vídeo de Arena. El aspirante a vigilar es MiniMax H3 (31 de julio), que genera clips 2K de 4 a 15 segundos con audio estéreo nativo y se factura por segundo desde $0.13 a 2K, ya #2 en el tablero de vídeo de Artificial Analysis con 1241,5. No movemos la corona por eso: el margen es de 3,3 Elo en el único tablero que no se ha reproducido entre análisis, y H3 sigue sin votos en el tablero de texto a vídeo de Arena.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Gemini Omni Flash | Mejor vídeo de IA en general | #1 en los dos tableros de vídeo (1527 Arena), edición conversacional | Limitado a generaciones de 10 segundos | ~$0.10/s; aplicación Gemini / AI Studio |
| MiniMax H3 | Clips 2K con audio nativo | 4-15 s a 2K, audio estéreo nativo; #2 en AA vídeo (1241.5) | Aún sin votos en Arena; los pesos abiertos excluyen el escalador 2K y exigen solicitud en EE. UU., la UE, el Reino Unido y Corea del Sur | $0.13/s a 2K |
| Dreamina Seedance 2.0 | El rival más cercano | #2 texto a vídeo (1482) y #1 en imagen a vídeo con audio (1198) | Ecosistema ByteDance, acceso occidental limitado | Dreamina / BytePlus |
| Muse Video | Vídeo en el ecosistema Meta | #3 texto a vídeo con 1459 | El más nuevo del grupo, herramientas escasas | Aplicación Meta AI |
| Veo 3.1 | Clips de producción más largos | Audio nativo, 1080p, fuerte consistencia física | #6 en Arena vídeo, no el líder de calidad | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Iteración rápida a menor coste | 4K nativo, 60fps, clips de 15 segundos; Turbo salió el 17 de junio | Fuera del top 16 en Arena texto a vídeo | Desde $10/mes |
| Luma Ray 3 | Escenas fotorrealistas | Fuerte realismo para paisajes | Comunidad más pequeña | Gratis / desde $9.99/mes |
Gemini Omni Flash mantiene la corona de vídeo, y sigue siendo #1 en los dos tableros, con 1527,5 en Arena y 1244,8 en Artificial Analysis. MiniMax H3 (31 de julio) entra como aspirante en #2 del tablero de vídeo de Artificial Analysis (1241,5), a 3,3 Elo, y supera a Omni Flash en especificaciones con salida 2K, clips de hasta 15 segundos y audio estéreo nativo. Mantenemos la corona porque ese margen es de 3,3 Elo en un solo tablero y H3 sigue sin votos en el tablero de texto a vídeo de Arena. MiniMax sí abrió los pesos el 3 de agosto, pero solo H3-Base junto con los VAE y el codificador; el escalador 2K sobre el que descansa su ventaja de especificaciones se quedó solo en la API.
Mejor IA para programación
La mejor IA para programación es Claude Opus 5, aunque ya no arrasa en los dos tableros donde los desarrolladores votan sobre el resultado terminado en lugar de un script midiendo un harness. El Qwen3.8-Max-0902 de Alibaba debutó el 2 de septiembre como #1 en el tablero WebDev de Arena con 1691 puntos frente a los 1688 de Opus 5, un margen de tres puntos, y Opus 5 conserva image-to-WebDev con 1,668.6. El precio es la segunda mitad del argumento: Opus 5 corre a $5 / $25 por 1M de tokens frente a los $10 / $50 de Claude Fable 5, y Artificial Analysis lo mide en $2.34 por tarea de índice frente a los $3.14 de Fable 5. La propia documentación de Anthropic dice a los desarrolladores que empiecen con Opus 5 para programación agéntica compleja y reserven Fable 5 para cargas que necesiten la máxima capacidad disponible. Claude Fable 5 es el segundo y sigue siendo la elección para el trabajo de largo horizonte más difícil, en en WebDev con 1,630.7 y #2 en image-to-WebDev (1,625.7); su sucesor del 1 de septiembre, Claude Fable 5.1, es el modelo más fuerte en los benchmarks de harness al mismo precio, y alcanza un 55,8 % en Terminal-Bench 4.0 frente al 52,3 % de Opus 5 y al 42,0 % de Fable 5 según las cifras del propio Anthropic, pero Arena todavía no tiene votos para él. El aspirante es Kimi K3, ahora #3 en WebDev a 17 puntos del líder y #3 en el tablero Agent de Arena, el programador open-weight más fuerte en los tableros, aunque autoalojarlo significa 1,56 TB de pesos. En el Coding Index de Artificial Analysis no es un barrido de Claude: GPT-5.6 Sol (xhigh) lidera con 78,3 con Opus 5 (max) en 78,0, lo bastante cerca para llamarlo empate. El aspirante serio más barato es ahora GLM 5.3 Flash a $0.15 / $0.50 bajo MIT, después de que la subida de DeepSeek del 16 de agosto llevara a V4-Flash 0731 a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, y la mejor relación calidad-precio en la propia frontier es Grok 4.6, que marca un 88,4 % en Terminal-Bench v2.1 y $0.84 por tarea de índice a $2 / $6.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio (por 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5 | Mejor programación en general | #1 Arena image-to-WebDev (1,668.6) y #2 en WebDev (1688); $2.34 por tarea de índice | Perdió el tablero WebDev de Arena ante Qwen3.8-Max-0902 el 2 de septiembre; el Coding Index de Artificial Analysis tiene a GPT-5.6 Sol un pelín por delante | $5 / $25 |
| Qwen3.8-Max-0902 | Cima del tablero WebDev de Arena | #1 en Code Arena: WebDev (1691), tres puntos por encima de Opus 5; 2,4T de parámetros, contexto de 1M | Solo API en QwenCloud, sin front-end de consumo; todavía sin puntuación compuesta independiente, y tres puntos caben en el ruido | $2 / $6 |
| Claude Fable 5 | El trabajo agéntico de largo horizonte más difícil | #2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1M | El más caro; el Coding Index de Artificial Analysis lo pone 7º | $10 / $50 |
| Claude Fable 5.1 | Programación agéntica de máxima capacidad | #1 Intelligence Index (66) y #1 Agentic Index (61); 55,8 % en Terminal-Bench 4.0 (Anthropic) | Sin votos en Arena todavía; el doble de caro que Opus 5 | $10 / $50 |
| Kimi K3 | Construcción de apps web y agentes | #3 Arena WebDev, #3 Arena Agent, Intelligence Index abierto más alto (60) | 1,56 TB para autoalojar | $3 / $15 |
| GPT-5.6 Sol | Buque insignia de OpenAI, programación agéntica | #1 Artificial Analysis Coding Index con 78,3 (xhigh) | Ausente del tablero oficial de Terminal-Bench; manipulación de evals señalada por METR | $4 / $20 |
| Muse Spark 1.3 | Programación agéntica barata | Intelligence Index 61 a $1.25 / $4.25; gana las tres filas de programación en el propio gráfico de Meta, 88,8 % en Terminal-Bench 2.1 | Son cifras de la propia Meta, medidas sobre la variante max, que es una vista previa solo para socios; en ese mismo gráfico pierde las seis filas de agente, y Scale SEAL solo ha valorado la 1.1 | $1.25 / $4.25 |
| Grok 4.6 | Programador barato de buen valor | 88,4 % en Terminal-Bench v2.1 e Intelligence Index 61, a $0.84 por tarea de índice | Los prompts desde 200K tokens refacturan la petición entera al doble; mayor tasa de alucinación | $2 / $6 |
| Gemini 3.8 Flash | Programación de agentes a escala | Intelligence Index 59, 73,7 % DeepSWE v1.1, 89,4 % Terminal-bench 2.1, 304,6 tok/s | 19,1 % en Terminal-bench 4.0 frente al 51,8 % de Opus 5; el precio introductorio se duplica el 1 de enero de 2027 | $0.75 / $3.75 |
| GLM 5.3 Flash | Mejor programador open-weight que puedes alojar | Intelligence Index 57; DeepSWE v1.1 63,4 y Terminal Bench 2.1 84,3 (cifras del fabricante); MIT, 320B/18B activos | Kimi K3 lo supera; las cifras de programación son del fabricante y todavía no tiene votos en Arena | Open weights (MIT) |
La corona de programación se queda con Claude Opus 5, pero dejó de ser un barrido limpio. Arena lo valoró primero en los dos tableros de programación en agosto, WebDev con 1,702.9 e image-to-WebDev con 1,668.6; el 2 de septiembre el Qwen3.8-Max-0902 de Alibaba debutó en lo más alto de WebDev con 1691 puntos frente a los 1688 de Opus 5, así que los dos tableros por votos ahora se reparten entre ellos. Son tableros por votos con cortes publicados, así que la corona ahora descansa sobre comparaciones humanas en lugar de sobre un solo harness, y Opus 5 lo hace a la mitad del precio de Fable 5. Fable 5 pasa a ser el segundo para el trabajo de largo horizonte más difícil, y Kimi K3 sigue siendo el aspirante, ahora tercero en WebDev. La línea Muse Spark de Meta cerró casi toda esa distancia durante el mes: la 1.2 llegó el 5 de agosto por detrás de Opus 5 en cada benchmark de programación que Meta publicó, y el 2 de septiembre llegó Muse Spark 1.3, que gana los tres, DeepSWE v1.1 con 75,4 frente a 74,0 y SWEAtlas CodeBase QnA con 59,4, con empate en Terminal-Bench 2.1 en 88,8, y todo a $1.25 / $4.25. Aun así no se lleva la corona, porque son cifras de la propia Meta para una variante de razonamiento max que solo pueden llamar sus socios, la versión disponible para todos puntúa 61 en el Intelligence Index frente al 63 de Opus 5, y Arena no la ha valorado. Grok 4.6 (12 de agosto) tampoco se lleva la corona, pero es el modelo a vigilar por coste: alcanza un 88,4 % en Terminal-Bench v2.1 y termina los trabajos agénticos largos en aproximadamente la mitad de turnos que Opus 5, a $2 / $6 frente a $5 / $25. Justo después llegaron otros dos lanzamientos centrados en programación. Gemini 3.7 Flash (13 de agosto) sustituye a 3.6 Flash en esta tabla por su salto del 49,0 % al 65,3 % en DeepSWE v1.1 a la mitad del precio anterior, y GLM 5.3 (14 de agosto) firma la mayor mejora agéntica del mes, Terminal-Bench 3.0 de 4,6 a 28,3, pero salió sin pesos descargables. Z.ai cerró el mes abriendo otro modelo en su lugar: GLM 5.3 Flash (26 de agosto) llegó bajo MIT el primer día con un Intelligence Index de 57, y le quita a GLM-5.2 el puesto open-weight de programación. Los últimos días del mes trajeron después otros tres lanzamientos abiertos: los pesos del propio GLM 5.3 el 28 de agosto bajo una licencia propia en lugar de MIT, Qwen3.8-Flash-Next de Alibaba el 26 de agosto como anticipo de la arquitectura Qwen4, y Hy4 Preview de Tencent, de 770B, el 28 de agosto bajo Apache 2.0. Ninguno tiene todavía una valoración independiente de programación, así que ninguno mueve esta tabla. Anthropic abrió después septiembre el día 1 con Claude Fable 5.1, que lidera el Intelligence Index y el Agentic Index de Artificial Analysis y marca un 55,8 % en Terminal-Bench 4.0 frente al 52,3 % de Opus 5, pero Arena no lo ha valorado, así que la corona se queda donde están los votos. Google cerró el hueco en el extremo barato el 2 de septiembre con Gemini 3.8 Flash, que le quita a 3.7 Flash la fila de trabajo a escala al mismo precio: DeepSWE v1.1 pasa del 65,3 % al 73,7 % y Terminal-bench 2.1 del 85,8 % al 89,4 %. No toca la corona, porque Opus 5 sigue ganando Terminal-bench 4.0 por 51,8 % frente a 19,1 %. El único lanzamiento que sí movió un tablero llegó el mismo día desde Alibaba: Qwen3.8-Max-0902 es un refresco de post-entrenamiento de Qwen3.8-Max en lugar de una versión nueva, y se llevó el tablero WebDev de Arena por tres puntos a $2 / $6. No movemos la elección de la categoría por ello. El margen cabe en el ruido, Artificial Analysis no ha puntuado la instantánea, y es un modelo solo de API en QwenCloud sin superficie de consumo, así que Opus 5 conserva la tarjeta por image-to-WebDev y por precio.
Mejor IA para creatividad
La mejor IA para el trabajo creativo sin filtros y a la última es Grok 4.6, y queremos ser exactos sobre por qué. Esta elección es sobre el producto, no sobre la calidad de la prosa. Grok lleva las menos restricciones de contenido de cualquier modelo frontier y la única integración nativa con X en tiempo real, lo que lo convierte en el único modelo que se involucrará con encargos atrevidos, de actualidad o deliberadamente provocadores que los demás rechazan. Es el modelo por defecto en la aplicación de Grok para suscriptores de SuperGrok y X Premium+ a $30/mes. No es el mejor escritor, y los tableros fueron contundentes con su predecesor: Grok 4.5 se situaba #33 en EQ-Bench Creative Writing y #41 en la tabla de escritura creativa de Arena, perdiendo en ambas ante el más antiguo Grok 4.20-beta1. Ninguna de las dos tablas de escritura creativa ha valorado aún a Grok 4.6 y, dado que SpaceXAI orientó este lanzamiento a la programación y al trabajo agéntico más que a la prosa, no damos por hecho que se haya movido. Si eliges solo por calidad de salida, Claude Fable 5 gana de forma clara en #1 en Arena escritura creativa, y Kimi K3 gana EQ-Bench. Elige Grok 4.6 por lo que te deja crear, no por lo bien que escribe.
| Modelo | Mejor para | Fortaleza | Debilidad | Precio |
|---|---|---|---|---|
| Grok 4.6 | Sin filtros, con opinión, a la última | Menos restricciones de contenido, anclaje nativo en X en tiempo real | Las tablas de escritura creativa aún no lo han valorado; Grok 4.5 estaba #33 EQ-Bench, #41 Arena | $30/mes SuperGrok |
| Claude Fable 5 | Prosa creativa de máxima calidad | #1 Arena escritura creativa, #1 LiveBench Language | Límites cautelosos ante encargos atrevidos | $10 / $50 API |
| Kimi K3 | Ficción y voz distintiva | #1 EQ-Bench Creative Writing con 2377 | Solo #10 en Arena escritura creativa | $3 / $15 |
| Claude Opus 5 | Creatividad estructurada de formato largo | Mantiene hilos largos y se autoedita; Intelligence Index 63, solo por detrás de Claude Fable 5.1 | El más cauteloso del grupo | $20/mes Pro; $5 / $25 API |
| Gemini 3.1 Pro | Creatividad multimodal | Fuerte cadena de texto, imagen y vídeo | Cuotas dentro de la aplicación de Gemini | Gratis / $2.00-$4.00 API entrada |
| Grok Imagine (Spicy Mode) | NSFW / creatividad para adultos | La generación de imágenes más permisiva | Caso de uso de nicho | $30/mes SuperGrok |
Grok mantiene esta elección, ahora con Grok 4.6, que el 12 de agosto sustituyó a Grok 4.5 como buque insignia de SpaceXAI. Nada ha cambiado en su permisividad ni en su acceso en vivo a X, que es en lo que se apoya esta elección. El modelo de debajo es bastante más fuerte, cinco puntos arriba hasta un Intelligence Index de 61, pero esa ganancia aterrizó en programación y trabajo agéntico, no en la prosa, y ninguna tabla de escritura creativa ha valorado aún a Grok 4.6. Claude Fable 5 sigue siendo el modelo que usar cuando quieres la mejor escritura.
Mejor IA para precisión & investigación
La mejor IA para precisión e investigación es Gemini 3.1 Pro. Su resultado más fuerte es en ARC-AGI-1 de ARC Prize, donde puntúa un 98 % e iguala al panel humano, y lo hace a $0.52 por tarea. Esa combinación es el argumento: varios modelos están cerca en capacidad, ninguno lo iguala en coste para trabajo factual fiable. Lo empareja con anclaje nativo en Google Search, que es lo que quieres cuando la respuesta tiene que ser actual en lugar de simplemente plausible. También puntúa un 94,1 % en GPQA Diamond, donde GPT-5.6 Sol ahora lo iguala en lugar de quedar por detrás, y un 44,4 % en Humanity's Last Exam, y encabeza el tablero HLE de Scale SEAL con 46,44. Hemos descartado el marco anterior de ARC-AGI-2: su 77,1 % sigue siendo correcto, pero el tablero se ha movido y esa puntuación ahora lo sitúa alrededor del puesto 14. Dos advertencias honestas. En búsqueda anclada en concreto, la tabla de búsqueda de Arena la lidera Anthropic, no Google, con Gemini 3.1 Pro con anclaje en #7. Y en razonamiento novedoso, GPT-5.6 Sol lidera ARC-AGI-2 y Claude Opus 5 lidera ARC-AGI-3 con un 30 %, cerca de 3,75 veces el siguiente mejor modelo. No movimos la corona a Opus 5 porque Artificial Analysis mide su tasa de alucinación en un 50 % y lo sitúa por debajo de Fable 5 en AA-Omniscience, un tablero cuya cima comparte ahora Claude Fable 5.1.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| Gemini 3.1 Pro | Trabajo factual barato y fiable | 98 % ARC-AGI-1 (iguala al panel humano) a $0.52/tarea, 94,1 % GPQA (igualado por Sol) | ARC-AGI-2 77,1 % ahora ~14º; #7 en Arena búsqueda | $2.00-$4.00 / $12.00-$18.00 (escalonado) |
| Claude Fable 5 | Búsqueda anclada | #1 y #3 en la tabla de búsqueda de Arena, por delante de Google | Ningún nivel barato único | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Razonamiento novedoso | #1 ARC-AGI-2 con 92,5 %, contra un panel humano del 100 % | Scheming señalado por METR | $4 / $20 |
| Claude Opus 5 | Los problemas inéditos más difíciles | #1 ARC-AGI-3 con 30 %, ~3,75 veces el siguiente modelo (ARC Prize) | Artificial Analysis mide una tasa de alucinación del 50 % | $5 / $25 |
| Qwen 3.7 Max | Precisión frontier a precio de valor | 92,4 GPQA Diamond, 200 solicitudes gratis/día | Solo API, sin front-end de chat | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Opus 4.6 | Honestidad bajo presión | #1 en el tablero MASK de Scale SEAL con 96,28; Anthropic ocupa el top 5 | Reemplazado como buque insignia | Modelo legacy de Anthropic |
Gemini 3.1 Pro mantiene la corona de precisión, pero su cifra estrella ya no es una ventaja. Su puntuación de GPQA Diamond se recalibró a 94,1 % y GPT-5.6 Sol ahora lo iguala exactamente, así que la corona descansa sobre el resultado de ARC-AGI-1 a $0.52 por tarea más el anclaje de Search en lugar de sobre GPQA. Esta es la siguiente corona que volvemos a probar, y los tableros que miden con qué frecuencia un modelo simplemente se equivoca se movieron el 1 de septiembre. Claude Fable 5.1 tiene ahora la mayor precisión factual que Artificial Analysis ha medido, un 67 % frente al 65 % de Claude Fable 5, y encabeza Humanity's Last Exam con un 59,1 % frente al 55,5 %. El propio índice AA-Omniscience marca 43 para ambos modelos, por encima del 40 que dimos para Fable 5 el mes pasado, porque 5.1 compra su precisión extra con una tasa de intento más alta en las preguntas que no sabe responder.
Mejor IA para resolución de problemas
La mejor IA para la resolución de problemas difíciles es GPT-5.6 Sol, y es la corona mejor respaldada de esta página. Se lleva el #1 en LiveBench Mathematics con 96,2, el #1 en LiveBench Reasoning con 91,7 y el #1 en ARC-AGI-2 con un 92,5 %, lo más cerca que ningún modelo ha llegado del panel humano del 100 %. Tres casas distintas lo ponen primero en las tareas de razonamiento que importan, que es más acuerdo del que produce cualquier otra categoría de esta página. OpenAI aún no ha publicado la puntuación de FrontierMath de Sol, así que la marca verificada de OpenAI sigue siendo el 39,6 % de GPT-5.5 Pro en FrontierMath Tier 4, y encajaremos el número de Sol en el momento en que se haga público. Qwen 3.7 Max es la alternativa de valor para problemas de estilo competición con 97,1 en el índice HMMT de febrero de 2026 y 44,5 en Apex, a una fracción del coste de ChatGPT Pro, y ahora incluye 200 solicitudes de modelo gratis al día. Claude Opus 5 es la alternativa para cadenas largas de razonamiento agéntico, con 59 en el Agentic Index de Artificial Analysis, segundo tras el 61 de Claude Fable 5.1, y #1 en ARC-AGI-3 de ARC Prize con un 30 %, cerca de 3,75 veces el siguiente mejor modelo.
| Modelo | Mejor para | Benchmark clave | Debilidad | Precio |
|---|---|---|---|---|
| GPT-5.6 Sol | Las matemáticas, la ciencia y el razonamiento más difíciles | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (92,5 %) | FrontierMath aún sin publicar; scheming señalado por METR | $100/mes ChatGPT Pro; API $4 / $20 |
| Claude Opus 5 | Cadenas largas de razonamiento agéntico | #2 Agentic Index (59), #1 ARC-AGI-3 (30 %) | Segundo en LiveBench Reasoning; tasa de alucinación del 50 % | $5 / $25 |
| GPT-5.5 Pro | Líder verificado de FrontierMath | 39,6 % FrontierMath Tier 4 | Reemplazado por Sol como buque insignia | $100/mes ChatGPT Pro |
| Qwen 3.7 Max | Matemáticas de competición con presupuesto ajustado | 97,1 HMMT 2026 feb, 44,5 Apex, 200 solicitudes gratis/día | Solo API | $1.25 / $3.75 promo; $2.50 / $7.50 lista |
| Claude Fable 5 | Matemáticas dentro de un flujo de programación | #1 en la subcategoría de matemáticas de Arena (1543), 96,0 LiveBench Mathematics | La opción más cara aquí | $10 / $50 |
| GLM 5.3 Flash | Resolución de problemas open-weight | Intelligence Index 57 bajo MIT, cuatro puntos por encima de GLM-5.2 con menos de la mitad de tamaño; 320B/18B activos, contexto 1M | Necesita un servidor multi-GPU, no una estación de trabajo; GLM 5.3 puntúa más alto según las propias cifras de Z.ai y se puede descargar desde el 28 de agosto, pero con más del doble de tamaño y bajo una licencia propia | Open weights (MIT) |
GPT-5.6 Sol mantiene esta corona, y sumó un segundo argumento. Sol ahora también lidera el Terminal-Bench v2.1 de Artificial Analysis con un 89,5 % y su Coding Index con 78,3, e iguala a Gemini 3.1 Pro en GPQA Diamond con un 94,1 %. Claude Opus 5 sigue siendo la alternativa de razonamiento agéntico por la fuerza de ARC-AGI-3. El 1 de agosto OpenAI llamó a su próxima familia de modelos Astra y publicó diez nuevos resultados matemáticos de una versión interna, aunque Astra está sin lanzar y no tiene fecha, precio ni disponibilidad. Claude Fable 5.1 de Anthropic llegó el 1 de septiembre y le quitó a Opus 5 el Agentic Index, 61 frente a 59, lo que cambia la cifra de apoyo de la alternativa, no la corona.
Mejor agente de IA
El mejor agente de IA ahora mismo es Gemini Spark para trabajo residente en la nube 24/7 y Claude Cowork para trabajo residente en el escritorio, con ChatGPT Codex como alternativa para agentes de programación y los agentes de navegador de clase OpenAI Operator como alternativa para tareas web. Los agentes de IA son la categoría que más rápido se mueve de 2026: cada proveedor de primer nivel lanza ahora un producto de agente, y la elección práctica es entre agentes que viven en la nube (se ejecutan mientras tu portátil está cerrado) y agentes que viven en tu escritorio (manejan tus apps directamente). Gemini Spark se lanzó en el Google I/O el 19 de mayo de 2026 y es el primer agente en la nube 24/7. Claude Cowork alcanzó la disponibilidad general el 9 de abril de 2026 y funciona como un agente de escritorio que maneja tus apps locales. ChatGPT Codex Mobile (14 de mayo) es la elección para trabajo de agente de programación. Lee la comparativa completa Gemini Spark vs. Claude Cowork.
| Agente | Mejor para | Dónde se ejecuta | Fortaleza | Precio |
|---|---|---|---|---|
| Gemini Spark | Tareas en la nube 24/7, flujos de Workspace | VM de Google Cloud (siempre activa) | Primer agente 24/7 real, integración profunda con Workspace | $99.99/mes Google AI Ultra |
| Claude Cowork | Escritorio, manejo de apps, diseño + código | Tu escritorio Mac/Windows | Maneja apps locales, ve tu pantalla | $20/mes Claude Pro |
| ChatGPT Codex Mobile | Agente de programación en el móvil | Nube de OpenAI + iOS/Android | Aprobar diffs y redirigir el trabajo desde el móvil | Incluido en los planes de ChatGPT |
| Grok Agentic (Grok 4.6) | Investigación en tiempo real, scraping de X | Nube de SpaceXAI | Integración nativa con X; Elo de 1755 en GDPval-AA v2 | $30/mes SuperGrok |
| OpenAI de clase Operator | Tareas de navegador, formularios web | Nube de OpenAI + tu navegador | Automatización web | ChatGPT Pro |
No se lanzaron nuevos agentes de consumo, y Muse Code de Meta (5 de agosto) es una herramienta de terminal para desarrolladores en lugar de una de consumo, así que la elección entre Gemini Spark (nube) y Claude Cowork (escritorio) sigue guiando la mayoría de las decisiones sobre agentes para usuarios individuales. La capa de modelo por debajo se movió de nuevo: Claude Fable 5.1 (1 de septiembre) lidera ahora el Agentic Index de Artificial Analysis con 61, por delante de Claude Opus 5 con 59, y encabeza el tablero GDPval-AA v2 con 1853 frente al 1824 de Opus 5. Opus 5 sigue siendo el modelo sobre el que la mayoría de equipos debería construir, a $5 / $25, la mitad del precio de Fable 5.1, y encabeza el tablero Agent de Arena, con Kimi K3 en tercer lugar. Para equipos que construyen sus propios agentes, Muse Spark 1.3 de Meta (2 de septiembre) es la opción barata a $1.25 / $4.25, pero aquí su gráfico de lanzamiento juega en su contra más que a favor: Meta agrupa seis benchmarks bajo Agent y la 1.3 pierde los seis, GDPVal-AA v2, JobBench, OSWorld 2.0 y AutomationBench ante Claude Opus 5, y DeepSearchQA y el Agentic IF Index ante GPT-5.6 Sol. Lo que sí gana es el contexto largo, 98,1 en la banda de 512K a 1M de MRCR frente al 55,5 de la 1.2, algo que cuenta si tu agente tiene que sostener una base de código grande en la ventana. Scale SEAL sigue sin valorar más que la 1.1 más antigua, que lidera su tablero de uso de herramientas MCP Atlas con 88,1. GLM 5.3 Flash (26 de agosto, MIT) es ahora el modelo de agente open-weight que alojaríamos, con un Intelligence Index de 57 y AutomationBench 48,8 en el propio gráfico de Z.ai, donde Claude Opus 4.8 marca 41,0, aunque todavía no tiene votos en Arena; el registro independiente lo conserva GLM-5.2, en #5 del tablero Agent de Arena. Grok 4.6 (12 de agosto) es aquí la nueva historia de coste más que un producto de agente nuevo: marca un Elo de 1755 en GDPval-AA v2, que las entradas de septiembre han empujado al quinto puesto entre modelos distintos, y Artificial Analysis mide que termina los trabajos de largo horizonte en unos 53 turnos y 0,5 mil millones de tokens de entrada frente a unos 103 turnos y 2,0 mil millones de Opus 5, a $0.84 por tarea de índice.
Los modelos líderes como ChatGPT, Claude y Gemini, juntos en Mac, iPhone y iPad.
Gratis para empezar, 4,7★ en más de 27 000 reseñas.
Descargar Fello AIMejor IA para estudiantes
La mejor IA para estudiantes es GPT-5.5 Free dentro de ChatGPT para trabajo de curso general y Gemini 3.6 Flash Free dentro de la aplicación de Gemini para STEM y estudio multimodal, con Qwen 3.7 Max como alternativa por API para conjuntos de problemas más difíciles (200 solicitudes gratis al día) y Claude Opus 5 como alternativa para editar ensayos. La mayoría de los estudiantes no necesitan pagar: el nivel gratuito de ChatGPT ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible), Gemini 3.6 Flash está en la aplicación gratuita de Gemini y en AI Studio, Claude Sonnet 5 es el nuevo Claude gratuito por defecto, y DeepSeek V4 es gratis en el sitio de chat de DeepSeek. Para el desarrollo paso a paso en las matemáticas más difíciles, GPT-5.6 Sol es el nuevo buque insignia de OpenAI (su puntuación de FrontierMath aún no se ha publicado, con el 39,6 % verificado de GPT-5.5 Pro en FrontierMath Tier 4 como marca actual), aunque ambos son solo de pago; Qwen 3.7 Max es la alternativa de valor con 97,1 en HMMT 2026 febrero con precio de API de $1.25 / $3.75 en su promo del 50 % actual ($2.50 / $7.50 lista).
| Tarea | Mejor modelo | Por qué | ¿Gratis? | Alternativa |
|---|---|---|---|---|
| Ensayos & trabajo de curso | GPT-5.5 | Gratis en ChatGPT, fiabilidad factual mejorada vs. 5.4 | Sí | Claude Sonnet 5 (Claude gratis) |
| Resolución de problemas STEM | GPT-5.6 Sol / Qwen 3.7 Max | Nuevo buque insignia STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 feb | Pro de pago / Qwen API de pago | Gemini 3.6 Flash (gratis) |
| Investigación & precisión | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje nativo en Google Search | Sí (aplicación Gemini) | Claude Opus 5 |
| Edición de escritura | Claude Sonnet 5 | Gratis y por defecto en claude.ai; Claude Fable 5 es el líder de calidad | Sí (Claude gratis) | Claude Fable 5 |
| Estudio multimodal (PDF, diapositivas, imágenes) | Gemini 3.6 Flash | Contexto 1M, gratis en la aplicación de Gemini | Sí | NotebookLM (Google) |
Mejor IA para el trabajo & profesionales
La mejor IA para el trabajo profesional es GPT-5.6 (por defecto de ChatGPT desde el 9 de julio) para el trabajo de conocimiento diario, Claude Opus 5 para programación y escritura de alto riesgo, y Gemini Spark para flujos agénticos 24/7. La mayoría de los profesionales sacan el máximo partido ejecutando dos suscripciones de pago (ChatGPT Plus a $20/mes más Claude Pro a $20/mes, un total de $40/mes), o consolidando con Fello AI a $9.99/mes para los cinco mejores modelos en una app de Mac/iOS. Para el trabajo agéntico que corre mientras duermes, Gemini Spark en Google AI Ultra a $99.99/mes es el único agente en la nube 24/7 real.
| Caso de uso | Mejor modelo | Dato clave | Precio | Alternativa |
|---|---|---|---|---|
| Trabajo de conocimiento diario | GPT-5.6 | Por defecto de ChatGPT desde el 9 de julio; el asistente que la mayoría puede abrir | $20/mes ChatGPT Plus | Claude Opus 5 |
| Programación (propietaria) | Claude Opus 5 | #1 en Arena image-to-WebDev (1,668.6) y #2 en WebDev (1688); el por defecto recomendado de Anthropic | $20/mes Claude Pro | Claude Fable 5 |
| Programación (rentable) | Qwen 3.7 Max | 80,4 SWE-Verified, contexto 1M | $1.25 / $3.75 promo; $2.50 / $7.50 lista | DeepSeek V4-Flash 0731 |
| Investigación & informes | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarea, anclaje de Google | Google AI Pro / Ultra | Claude Opus 5 |
| Matemáticas, física, modelado financiero difíciles | GPT-5.6 Sol | Nuevo buque insignia STEM de OpenAI (5.5 Pro verificado en 39,6 % FrontierMath) | $100/mes ChatGPT Pro | Qwen 3.7 Max |
| Flujos de agente siempre activos | Gemini Spark | Primer agente en la nube 24/7 | $99.99/mes Google AI Ultra | Claude Cowork |
| Noticias en vivo, creatividad con contexto de X | Grok 4.6 | Intelligence Index 61 + anclaje nativo en X | $30/mes SuperGrok | Gemini 3.1 Pro |
| Consolidación todo en uno | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/mes | Pagar a cada proveedor por separado |
Precios de los modelos de IA en septiembre de 2026
Desde planes gratuitos de $0 hasta $199.99/mes de Google AI Ultra. El precio más determinante de esta tabla es Claude Opus 5 a $5 / $25, porque es el segundo mejor puntuado en el Intelligence Index de Artificial Analysis a la mitad del coste de los dos modelos Fable que lo rodean. Claude Fable 5.1, que se llevó la cima de ese índice el 1 de septiembre, mantiene el mismo precio de lista de $10 / $50 que Fable 5, pero recorta las lecturas de caché un 75 % hasta $0.25, y ahí está el ahorro en ejecuciones agénticas largas, no en el precio de lista. Muse Spark 1.3 de Meta se lista a $1.25 / $4.25, sin cambios a lo largo de tres saltos de capacidad desde julio, con un nivel Contributor a $0.10 / $0.20 para quien esté dispuesto a dejar que Meta entrene con sus prompts, y Grok 4.6 se lista a $2 / $6, con la salvedad de que un prompt de 200.000 tokens o más refactura la petición entera a $4 / $12. La elección relación precio-rendimiento se movió en agosto, y no porque nada se abaratara: DeepSeek subió sus dos modelos V4 unas cuatro veces el 16 de agosto, llevando V4-Flash 0731 de unos $0.14 / $0.28 planos a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta. La elección es ahora GLM 5.3 Flash a $0.15 / $0.50 de lista, a mitad de precio hasta el 9 de septiembre, que puntúa 57 en el Intelligence Index y deja por debajo incluso la tarifa en valle de DeepSeek por ambos lados a cualquier hora del día. En la propia frontier, la elección de valor es Grok 4.6, con 61 por $0.84 por tarea de índice, donde Opus 5 cuesta $2.34 y GPT-5.6 Sol cobra $4 / $20 por la misma puntuación tras su recorte del 21 de agosto. Entre los modelos cerrados, GPT-5.6 Luna es el más barato a $0.20 / $1.20 tras el recorte de OpenAI del 30 de julio. Para un desglose más a fondo consulta nuestra Guía completa de comparativa de precios de IA.
| Modelo | Entrada (por 1M) | Salida (por 1M) | Contexto | ¿Acceso gratis? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K en Codex) | ChatGPT Free; API de pago |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro desde $100/mes (nivel de mayor uso a $200) |
| GPT-5.6 Sol | $4.00 | $20.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| GPT-5.6 Terra | $2.00 | $12.00 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| GPT-5.6 Luna | $0.20 | $1.20 | No publicado | En vivo en ChatGPT, Codex & API (9 de julio) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Por defecto en Claude Pro/Max; API de pago |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modelo legacy en Anthropic; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Lecturas de caché $0.25; en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos. Mythos 5.1 factura igual, solo por invitación |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanente en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Por defecto en Claude Free & Pro; API de pago |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API de pago (reemplazado por Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Aplicación Gemini limitada; API de pago |
| Gemini 3.8 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | AI Studio, Antigravity, Gemini Enterprise + API de pago; en la aplicación de Gemini reportado para AI Pro/Ultra |
| Gemini 3.7 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | AI Studio, Android Studio, Antigravity + API de pago; en la aplicación de Gemini solo vía Spark (AI Pro/Ultra, excluye EEE/RU/CH/Nigeria) |
| Gemini 3.6 Flash | $0.75 introductorio / $1.50 desde el 1/1/2027 | $3.75 introductorio / $7.50 desde el 1/1/2027 | 1M | Modelo por defecto de la app gratuita de Gemini; AI Studio; nivel gratuito de API + API de pago |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; nivel gratuito de API + API de pago |
| Qwen3.8-Max-0902 | $2.00 ($0.17 cache hit explícito, $0.25 implícito) | $6.00 | 1M (salida de 128K) | Solo API de QwenCloud; sin chat de consumo, sin pesos abiertos |
| Qwen 3.7 Max | $1.25 promo / $2.50 lista | $3.75 promo / $7.50 lista | 1M | 200 solicitudes gratis/día; API de pago más allá |
| MiniMax M3 | $0.30 (50 % de descuento sobre $0.60) | $1.20 (≤512K) | 1M | Open weights; se aplican costes de alojamiento |
| LongCat-2.0 | Depende del proveedor | Depende del proveedor | 1M | Open weights (MIT); se aplican costes de alojamiento |
| NVIDIA Nemotron 3 Ultra | Depende del proveedor | Depende del proveedor | 1M | Open weights (OpenMDW); se aplican costes de alojamiento |
| Qwen 3.5 (open-weight) | Autoalojado / Together | Autoalojado / Together | 1M | Open weights; se aplican costes de alojamiento |
| Nex-N2-Pro | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (Apache 2.0); se aplican costes de alojamiento |
| Rio 3.5 Open 397B | Autoalojado / proveedores | Autoalojado / proveedores | 1M | Open weights (MIT); se aplican costes de alojamiento |
| Grok 4.3 | $1.25 | $2.50 | 1M | Plan de consumo gratuito; API de pago |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API de SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Muse Spark 1.3 | $1.25 ($0.10 nivel Contributor) | $4.25 ($0.20 nivel Contributor) | 1M | API de pago; Muse Code, Meta Model API y OpenRouter; el nivel Contributor cambia derechos de entrenamiento por un ~92 % de descuento |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Nivel básico gratuito en la aplicación de Kimi; open weights en Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vídeo) | $1.50 | $17.50 (salida de vídeo) | Clips de 10 segundos | Aplicación Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.66 en valle / $1.32 en punta ($0.022 cache-hit en valle) | $1.98 en valle / $3.96 en punta | 1M | DeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto |
| DeepSeek V4-Flash 0731 | $0.22 en valle / $0.44 en punta ($0.007 cache-hit en valle) | $0.66 en valle / $1.32 en punta | 1M | DeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto |
| Kimi K2.7 Code | Depende del proveedor | Depende del proveedor | 256K | Open weights; se aplican costes de alojamiento |
| GLM-5.2 | Depende del proveedor | Depende del proveedor | 1M | Open weights; se aplican costes de alojamiento |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | API de Z.ai, GLM Coding Plan y ZCode; pesos en Hugging Face desde el 28 de agosto bajo la GLM 5.3 License propia |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit); $0.075 en promoción | $0.50; $0.25 en promoción | 1M | API de Z.ai, GLM Coding Plan, OpenRouter; pesos MIT en Hugging Face; la promoción acaba el 9 de septiembre |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Pesos abiertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Depende del proveedor | Depende del proveedor | 262K (hasta 1M) | Pesos abiertos (Qwen Community License 1.0); se suman los costes de alojamiento |
| ERNIE 5.1 | Precio para la región de China | Precio para la región de China | 256K | Nivel gratuito de Baidu |
| Gemini Spark (agente) | Sin precio de API | Sin precio de API | 1M (base Gemini) | Google AI Ultra $99.99 o $199.99/mes |
| Fello AI (agregador) | Enrutado por la app | Enrutado por la app | Depende del modelo | $9.99/mes, plan gratuito disponible |
Las tarifas de GPT-5.5 y GPT-5.5 Pro de arriba son precios de contexto corto; OpenAI ya no publica las cifras específicas de contexto largo. Los niveles GPT-5.6 se facturan a 2x entrada y 1,5x salida una vez que un prompt supera los 272K tokens de entrada, lo que sitúa a Terra de contexto largo en $4 / $18 y a Luna en $0.40 / $1.80. Grok 4.6 funciona igual, pero muerde más fuerte: a partir de 200.000 tokens de prompt, SpaceXAI refactura la petición entera a la tarifa más alta en lugar de solo el exceso, así que pasarse por mil tokens duplica el coste de toda la llamada. La otra tarifa que conviene leer dos veces es la de DeepSeek: desde el 16 de agosto sus dos modelos V4 se facturan a precio de punta de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y a exactamente la mitad en cualquier otra hora, así que la misma tarea puede costar el doble según cuándo la ejecutes. Si quieres acceso a varios modelos de IA sin gestionar suscripciones separadas, Fello AI ofrece GPT, Claude, Gemini, Grok, Perplexity y más en una sola app para Mac, iPhone y iPad desde $9.99/mes.
Mejores modelos open-weight en septiembre de 2026
El mejor modelo open-weight en septiembre de 2026 es Kimi K3, y se llevó la delantera en el momento en que Moonshot publicó los pesos el 27 de julio de 2026. Tiene el Intelligence Index más alto de cualquier modelo open-weight con 60 en Artificial Analysis, siete puntos por delante de GLM-5.2, y en Arena sigue siendo la entrada abierta mejor situada, en #3 en WebDev por detrás de Qwen3.8-Max-0902 y Claude Opus 5 y #3 en el tablero Agent. Una pega decide cuál de los dos deberías usar de verdad. La descarga de K3 son 96 shards de safetensors y unos 1,56 TB, lo que necesita un clúster de GPU multinodo en lugar de una estación de trabajo, y viene bajo una licencia propia Kimi K3 License en lugar de MIT. Así que la recomendación práctica para equipos que ejecutan sus propios pesos es ahora GLM 5.3 Flash (Z.ai, MIT), publicado el 26 de agosto con un Intelligence Index de 57, cuatro puntos por encima de GLM-5.2 y con menos de la mitad de tamaño, 320B totales con 18B activos. Es el primer modelo nativamente multimodal de la línea GLM-5, admite un contexto de 1M de tokens, y los pesos estaban en Hugging Face bajo MIT el mismo día del lanzamiento. GLM-5.2 (MIT) es la alternativa de respaldo, con un Intelligence Index de 53, y conserva el registro independiente que el modelo más nuevo aún no ha tenido tiempo de ganarse, #6 en Arena WebDev (1,587.1) y #5 en el tablero Agent. El tercer puesto cambió de manos el último día de julio: DeepSeek V4-Flash 0731 recibió nuevo post-training y saltó de un Intelligence Index de 40 a 52 en el índice actual v4.1.1 bajo MIT, aunque su precio de API ha subido desde entonces unas cuatro veces, a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta. Tres lanzamientos cerraron después el mes, y ninguno tiene todavía una valoración independiente. GLM 5.3 publicó por fin sus pesos el 28 de agosto, exactamente en la fecha que llevaba su marcador de posición, pero bajo una GLM 5.3 License propia en lugar de MIT, con una cláusula que obliga a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos a pasar antes una revisión de seguridad de Z.ai; ten en cuenta además que GLM 5.3 Flash no es un GLM 5.3 recortado, sino un modelo aparte sobre una base recién entrenada, y por eso pudo salir bajo MIT puro cuando el buque insignia no pudo. Tencent liberó Hy4 Preview el 28 de agosto con 770B totales y 49B activos bajo Apache 2.0, el mayor modelo con licencia permisiva publicado hasta la fecha, apoyado en una evaluación ciega interna y no en ningún tablero independiente. Y Alibaba publicó Qwen3.8-Flash-Next el 26 de agosto, un mixture-of-experts de 125B con solo 6B activos que anticipa la arquitectura Qwen4, bajo la Qwen Community License 1.0 en lugar de Apache. Los tres se listan abajo en lugar de clasificarse.
| Modelo | Mejor para | Benchmark clave | Contexto / Licencia | Dónde ejecutar |
|---|---|---|---|---|
| Kimi K3 | Modelo open-weight mejor puntuado, trabajo agéntico y web | II 60, el más alto de cualquier modelo open-weight; #3 Arena WebDev, #3 Arena Agent; 2.8T/104B activos | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 TB), Moonshot API, proveedores |
| GLM 5.3 Flash | Mejor modelo abierto que la mayoría de equipos puede ejecutar de verdad | II 57 (v4.1.1), en la frontera de Pareto entre inteligencia y coste, a unos $0.09 por tarea del índice; 320B/18B activos, nativamente multimodal | 1M / MIT | Hugging Face, API de Z.ai ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Respaldo con historial independiente | II 53; #6 Arena WebDev (1,587.1), #5 Arena Agent; 744B/40B activos | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Abierto desde el 28 de agosto, pero con licencia propia | Misma base de 744B que GLM-5.2, solo post-entrenada, checkpoint publicado contado en 753B; CyberGym 84,5 % y Terminal-Bench 3.0 28,3 (cifras del fabricante) | 1M / GLM 5.3 License (model-as-a-service por encima de 10 000 M USD de ingresos necesita revisión de seguridad de Z.ai) | Hugging Face, API de Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4-Flash 0731 | Mejor valor abierto si lo alojas tú mismo | II 52 (v4.1.1), desde 40 el 31 de julio; 284B/13B activos | 1M / MIT | DeepSeek API ($0.22/$0.66 en valle, $0.44/$1.32 en punta desde el 16 de agosto), local |
| Tencent Hy4 Preview | Mayor modelo con licencia permisiva hasta la fecha | 770B/49B activos; 2,99/4,00 en el panel propio de Tencent de 203 tareas frente a 2,94 de Kimi K3 y 2,92 de GLM 5.3 (fabricante); todavía sin valoración independiente | 1M+ / Apache 2.0 | Hugging Face (BF16 y FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Anticipo de la arquitectura Qwen4 | 125B totales más un embedding de N-gramas de 51B, 6B activos; 91,7 GPQA Diamond y 62,5 SWE-Bench Pro (fabricante); todavía sin valoración independiente | 262K a 1M / Qwen Community License 1.0 | Hugging Face, proveedores, autoalojamiento |
| LongCat-2.0 | Programador abierto frontier entrenado en chips chinos | II 33 (v4.1); 59,5 % SWE-Bench Pro (proveedor), 1.6T/~48B activos | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de clase frontier barato | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licencia por definir | Hugging Face, API $0.30/1M (50 % de descuento) |
| Nex-N2-Pro | Puntuación de programación abierta más fuerte | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B activos | Basado en Qwen / Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Kimi K2.7 Code | Programador abierto con licencia comercial más fuerte | +21,8 % en Kimi Code Bench v2 vs. K2.6 (proveedor); 1T/32B activos | 256K / Modified MIT | Hugging Face, DeepInfra, proveedores |
| DeepSeek V4-Pro | Trabajo agéntico del mundo real | II 44 (v4.1), 1.6T/49B activos | 1M / MIT | DeepSeek API ($0.66/$1.98 fuera de pico, $1.32/$3.96 en pico desde el 16 de agosto), local |
| Hy3 | El participante más nuevo con licencia permisiva | II 41 (v4.1); #22 en Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, proveedores, autoalojado |
| Inkling | Primer modelo open-weight de Thinking Machines | II 41 (v4.1), agéntico 32,3, lanzado el 15 de julio | Open weights | Hugging Face, proveedores, autoalojado |
| Inkling Small | Misma familia a una cuarta parte del tamaño | II 40 (v4.1), agéntico 30,8; 276B/12B activos, entrada de texto, imagen y audio | Apache 2.0 | Hugging Face (BF16 y NVFP4), proveedores, autoalojado |
| NVIDIA Nemotron 3 Ultra | Afinado por NVIDIA, licencia totalmente permisiva | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B activos | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 autoalojado) |
| Qwen 3.5 (397B / 17B activos) | Multimodal, decodificación rápida | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / abierto | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programador agéntico abierto eficiente (3B activos) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B activos | 262K (a 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programador denso ejecutable en portátil | 87,8 GPQA Diamond, denso 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, razonamiento multilingüe | 70,8 Terminal-Bench 2.1 (first-party), supera a Qwen 3.7 Plus en 4/5 | 397B/17B activos / MIT | Hugging Face, proveedores, autoalojado |
| Llama 4 Maverick | Buque insignia de la línea Meta | 17B activos / 400B de parámetros totales | Llama 4 license | Nube de Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / bajo consumo | Multimodal, huella muy pequeña | Compacto / abierto | Local, herramienta NVIDIA |
Aquí la licencia importa tanto como la puntuación bruta, y agosto ha ensanchado la distancia entre los dos grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) y Nemotron 3 Ultra (OpenMDW) todos permiten claramente el uso comercial sin prueba de ingresos. El resto lleva condiciones que conviene leer antes de construir sobre ellas: MiniMax M3 y MiniMax H3 vienen bajo sus propias licencias comunitarias, y H3 exige además una solicitud desde EE. UU., la UE, el Reino Unido y Corea del Sur; Kimi K3 se sitúa en una licencia propia con un umbral de ingresos para quien lo revenda como servicio; GLM 5.3 exige una revisión de seguridad de Z.ai a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos; y la Qwen Community License 1.0 de Qwen3.8-Flash-Next exige una licencia aparte de Qwen para explotar un negocio de model-as-a-service o de asistente de trabajo con IA, aunque el uso interno queda exento. Ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos: Claude Opus 5 se llevó el tablero Agent en julio, el último que lideró un modelo open-weight.
Benchmarks, precios y uso práctico
Cada clasificación de esta página combina tres entradas: benchmarks públicos de siete casas independientes (Artificial Analysis, Arena antes LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize y el tablero oficial de Terminal-Bench 2.1, cubriendo los índices Intelligence y Agentic, GPQA Diamond, ARC-AGI-1 al 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas y el Remote Labor Index), precios de API y suscripción publicados en la página de precios oficial de cada proveedor, y uso práctico por parte del equipo editorial de FelloAI que ejecuta prompts reales sobre la misma tarea en cada modelo. Volvemos a obtener las fuentes oficiales de precios y benchmarks antes de cada actualización mensual.
Los benchmarks se ponderan según el caso de uso: SWE-bench y Terminal-Bench impulsan la programación, GPQA Diamond y ARC-AGI-2 impulsan la precisión, GDPval-AA (el benchmark de entregables profesionales de Artificial Analysis) informa la calidad de las tareas profesionales mientras que el estilo de escritura se juzga principalmente por pruebas prácticas, FrontierMath y HMMT impulsan la resolución de problemas. Revelamos cuándo un benchmark es reportado por el proveedor pero no verificado de forma independiente, y descartamos cualquier afirmación que no podamos reproducir contra una fuente en vivo. No movemos la corona de una categoría por la fuerza de una sola tabla, y cuando un modelo nuevo es demasiado reciente para que los tableros de preferencia humana lo hayan valorado, lo decimos en lugar de coronarlo solo por puntuaciones de benchmark. Cuando un modelo pasa por una actualización importante entre actualizaciones, volvemos a clasificar la categoría y añadimos una línea «Qué cambió este mes» al pie del análisis a fondo.
Fello AI reúne los mejores modelos de IA en una sola app nativa y ligera.
Cambia entre ellos cuando quieras, sin suscripciones separadas.
Descargar Fello AI




