Actualizado 23 de septiembre de 2026

Mejores modelos de IA en 2026

Clasificaciones, comparativas y análisis a fondo, actualizados cada mes a medida que llegan nuevos modelos.

Anthropic lanzó Claude Opus 5.5 el 22 de septiembre y se lleva la corona de programación. Artificial Analysis lo sitúa en 57,6 en el Intelligence Index v4.3.2, la puntuación más alta que ha publicado nunca y 4,3 puntos por delante de Claude Fable 5.1, y de paso lidera GDPval-AA v2.1, AA-Briefcase v1.1 y Humanity's Last Exam. Lo hace a $4 / $20 por 1M de tokens, por debajo de Claude Opus 5 a $5 / $25, así que el mejor modelo es ahora también el más barato.

OpenAI respondió unos noventa minutos después con GPT-6 Sol y GPT-6 Luna y con ellos partió por la mitad sus precios de API: Sol cuesta $2 / $10 por 1M de tokens y Luna $0,10 / $0,50, y ninguno de los dos está todavía en la ventana de chat de ChatGPT. GPT-6 Astra conserva los dos tableros de programación de Arena, porque Opus 5.5 aún no tiene votos allí, y Claude Fable 5.1 conserva escritura y precisión en los tableros con los que se deciden esas categorías. Esta página clasifica por puntuaciones medidas, así que una corona cambia en cuanto un modelo supera al titular, sin esperar a los tableros basados en votos. Nuestra guía de benchmarks de IA explica cómo se construye ese índice y por qué importa su número de versión.

SpaceXAI lanzó Grok 4.7 el 21 de septiembre sobre un modelo base nuevo y mayor, y queda por encima de Astra en los dos tableros agénticos que publica Artificial Analysis. El Intelligence Index marca 46,3 frente al 44,3 de Grok 4.6 y el precio por tokens no se mueve, $2 / $6, pero una tarea del índice cuesta $2,73 frente a $1,86, porque 4.7 emite alrededor del doble de salida. Salió en la API, en Cursor y en Grok Build; la app de Grok sigue sirviendo 4.6.

El campo abierto también tiene nuevo líder: el MiMo-V2.6-Pro de Xiaomi, publicado el 21 de septiembre bajo MIT puro, puntúa 46,3 y resuelve una tarea del índice por $0,13, lo más barato entre los modelos abiertos de esta página. Abajo están los ganadores por categoría de septiembre de 2026. Haz clic en cualquier tarjeta para ir directo al análisis completo, o usa la navegación fija para saltar entre categorías. Clasificaciones, benchmarks y precios se actualizan en un plazo de 48 horas tras cualquier lanzamiento importante.

Ganadores por categoría de septiembre de 2026
Escritura
Claude Fable 5.1
#2 EQ-Bench Creative Writing y #2 LiveBench Language
El único modelo que está entre los seis primeros en los tres tableros de prosa. Mejor valor: Claude Sonnet 5, gratis en claude.ai.
Análisis a fondo →
Chat & asistente diario
GPT-5.6
Modelo por defecto de ChatGPT desde el 9 de julio
El mejor asistente que la mayoría de la gente puede abrir de verdad, equilibrando capacidad, velocidad y alcance.
Análisis a fondo →
Imágenes
ChatGPT Images 2.5
#1 y #2 en los cuatro tableros de imagen que seguimos
Sus dos modelos ocupan los dos primeros puestos en todos los tableros de imagen que seguimos, tanto de Arena como de Artificial Analysis, y es el predeterminado en todos los planes de ChatGPT, incluido el gratuito. Mejor valor: Flare, el más rápido de los dos, al mismo precio por tokens que GPT Image 2.
Análisis a fondo →
Vídeo
Gemini Omni 1.1 Flash
#1 Arena texto a vídeo (1516), escenas de 40 segundos
El vídeo más reciente de Google: extensión de escena hasta 40 segundos, salida en 4K, desde $0.03 por segundo.
Análisis a fondo →
Programación
Claude Opus 5.5
#1 Terminal-Bench 4.0 (59,6 %) y #1 Intelligence Index (57,6)
El buque insignia de Anthropic del 22 de septiembre lidera el Terminal-Bench 4.0 de Artificial Analysis y los dos tableros de programación de LiveBench, a $4 / $20 frente a los $10 / $50 de GPT-6 Astra. Astra conserva los dos tableros de programación de Arena, que aún no tienen votos para Opus 5.5.
Análisis a fondo →
Creatividad
Grok 4.7
Menos restricciones de contenido + X nativo en tiempo real
La elección para trabajo atrevido y a la última: menos límites y integración nativa con X. Grok 4.7 está en la API, en Cursor y en Grok Build; la app de Grok de $30 al mes sigue sirviendo 4.6.
Análisis a fondo →
Precisión & investigación
Claude Fable 5.1
La mayor precisión factual que ha medido Artificial Analysis (67 %)
Encabeza los tableros que miden con qué frecuencia un modelo simplemente se equivoca. Mejor valor: Gemini 3.1 Pro a $0,52 por tarea con anclaje en Google Search.
Análisis a fondo →
Resolución de problemas
GPT-6 Astra
#1 LiveBench Reasoning (92,65) y #1 ARC-AGI-2 (95 %)
Le quitó a GPT-5.6 Sol los tableros de razonamiento más duros días después de su lanzamiento. Mejor valor: GPT-6 Sol a $2 / $10, que supera a GPT-5.6 Sol en el Intelligence Index por la mitad de precio.
Análisis a fondo →
Agentes de IA
Gemini Spark
Primer agente de IA residente en la nube 24/7
Se ejecuta de forma continua en una VM de Google Cloud, muy integrado con Gmail, Docs y Chrome.
Análisis a fondo →

¿Quieres los mejores modelos de IA sin hacer malabares con suscripciones separadas? Fello AI reúne los modelos líderes en una sola app nativa para Mac, iPhone y iPad.

Descargar Fello AI
Novedades de septiembre de 2026
22 sep OpenAI GPT-6 Sol y GPT-6 Luna parten por la mitad los precios de API de OpenAI y llegan a todas partes menos al chat de ChatGPT Nuevo
OpenAI lanzó GPT-6 Sol y GPT-6 Luna el 22 de septiembre de 2026, unos noventa minutos después de que Anthropic sacara Claude Opus 5.5, y el lanzamiento es un argumento sobre el coste por tarea, no sobre la cima del tablero. Sol baja de $4 / $20 a $2 / $10 por 1M de tokens y Luna de $0,20 / $1,20 a $0,10 / $0,50, con las lecturas de caché con un 90 % de descuento, a $0,20 y $0,01. OpenAI etiqueta ambos recortes como del 50 %, pero la salida de Luna cae un 58,3 %, y la comparación es contra los precios promocionales de GPT-5.6, no contra la tarifa de lista. Dos portavoces y Tibo Sottiaux, de OpenAI, coinciden en que las nuevas tarifas son permanentes. Dónde se pueden usar es la parte que todos los resúmenes aplanaron: los modelos están en ChatGPT Work y en Codex para Plus, Pro, Business, Enterprise y Edu, los usuarios de Free y Go llegan a Luna en la app de escritorio, y OpenAI dice sin rodeos que «todavía no están disponibles en Chat». De forma independiente, Artificial Analysis puntúa a Sol con 47,5 en el Intelligence Index v4.3.2 a esfuerzo máximo frente al 47,0 de GPT-5.6 Sol, a $1,06 por tarea del índice frente a $1,99, con un 43,9 % en Terminal-Bench 4.0 frente al 39,9 % y la tasa de alucinación bajando del 92 % al 60 %. Luna queda a la par de GPT-5.6 Luna con 37,3, pero resuelve una tarea del índice por $0,07 frente a $0,18, lo que la convierte en el modelo más barato por tarea del índice de esta página. ARC Prize ha puntuado a Luna, 59,3 % en ARC-AGI-2 frente al 59,5 % de la versión 5.6, y no ha publicado nada sobre Sol. Las evaluaciones de la propia OpenAI son todas argumentos de coste: en AutomationBench 1.0.6, Sol a esfuerzo xhigh saca un 33,2 % por $0,27 la tarea, y la fila rival más cercana es Claude Fable 5.1 con Opus 5 de respaldo en 31,4 %, así que la ventaja real es de 1,8 puntos y no de los 6,3 que sugiere la fila de Claude Opus 5. OpenAI afirma que Sol comete alrededor de la mitad de errores que GPT-5.6 Sol, «acercándose a la fiabilidad de Astra a un coste mucho menor», y repite que Astra sigue siendo su mejor modelo en conjunto. Nada de esto mueve una corona: Sol y Luna son más baratos, no mejores. No hay GPT-6 Terra, y OpenAI no ha dicho si habrá uno. Todo el detalle en nuestro análisis de GPT-6 Sol y Luna.
22 sep Anthropic Claude Opus 5.5 se lleva el Intelligence Index con 57,6 y baja el precio de Opus 5 Nuevo
Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026, el primer modelo de una nueva familia Claude 5.5, y es el mayor movimiento en un solo día que ha registrado esta página. Artificial Analysis lo mide en 57,6 en el Intelligence Index v4.3.2, 4,3 puntos por encima de Claude Fable 5.1 y la puntuación más alta que ha publicado para cualquier modelo, y de paso se lleva GDPval-AA v2.1 con 1846 frente a los 1735 de Fable 5.1, AA-Briefcase v1.1 con 1822 frente a 1678, Humanity's Last Exam con 61,4 % frente a 59,1 % y la propia ejecución de Terminal-Bench 4.0 de Artificial Analysis con 59,6 % frente al 59,1 % de GPT-6 Astra. El precio baja en lugar de subir: $4 / $20 por 1M de tokens frente a los $5 / $25 de Opus 5, lecturas de caché un 60 % más baratas a $0,20 y escrituras a $5, con las pruebas de la propia Anthropic situando una carga de trabajo típica un 40 % más barata que en Opus 5 y la salida más de un 30 % más rápida. Un modo rápido en Claude Code y en la Claude Platform duplica el precio por hasta 2,5 veces la velocidad. En el harness propio de Anthropic la distancia en programación es aún mayor, 66,4 % en Terminal-Bench 4.0 frente al 57,9 % que OpenAI reporta para Astra, más un 54,4 % en FrontierCode v1.1 y un 57,8 % en CursorBench 4.0. Dos cosas que no gana: el AutomationBench de Zapier, donde Astra saca 41,4 % frente a su 40,0 %, y Terminal-Bench-Science 0.1, donde Astra saca 64,6 % frente a su 58,7 %. Lee los márgenes con la salvedad que la propia Anthropic imprime, que el modelo "performs at the level of Claude Fable 5.1 on most work" y que "benchmark margins have become a less reliable guide to real-world differences". Está disponible de forma general en la Claude Platform como claude-opus-5-5 y en AWS, Google Cloud y Microsoft Azure, los límites de cinco horas suben en Pro, Max y Team, y Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán en las próximas semanas. Como iguala a Claude Mythos 5.1 en biología y ciberseguridad, sale con las salvaguardas de Fable 5.1 y con un nuevo Life Sciences Verification Program para laboratorios verificados. Ningún tablero de Arena lo ha valorado todavía. Todo el detalle en nuestro análisis de Claude Opus 5.5.
21 sep SpaceXAI Grok 4.7 llega sobre un modelo base mayor a los mismos $2 / $6 y cuesta un 47 % más por tarea Nuevo
SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026 como su modelo más capaz para programación y trabajo de conocimiento. Usa un modelo base nuevo y mayor que Grok 4.6, con una tanda más larga de aprendizaje por refuerzo orientada a tareas que llevan muchas horas, y se entrenó para entender de forma nativa el harness de Grok Bot. La empresa no publica un recuento de parámetros. Según sus propias cifras logra un 46,3 % en CursorBench 4.0 frente al 40,4 % de Grok 4.6 y al 41,7 % de GPT-5.6 Sol, un 71,0 % en DeepSWE v1.1 con esfuerzo alto, un 64,0 % en EEBench, un 38,0 % en Terminal-Bench 4.0, un 19,6 % en el benchmark de agente legal de Harvey y un 56,7 % en HealthBench Professional. De forma independiente, Artificial Analysis lo sitúa en 46,3 en el Intelligence Index v4.3.2 con esfuerzo alto frente al 44,3 de Grok 4.6, y en 1695 en GDPval-AA v2.1 y 1657 en AA-Briefcase v1.1, ambos por encima de los 1542 y 1569 de GPT-6 Astra. El precio no se mueve, $2 / $6 por 1M de tokens con la petición entera refacturada a $4 / $12 por encima de 200.000 tokens de prompt, y una variante rápida funciona al doble de velocidad de salida por el doble de precio. Lo que sí se mueve es el coste por tarea: $2,73 frente a los $1,86 de Grok 4.6, porque 4.7 emite alrededor del doble de tokens de salida para llegar al mismo sitio, y el esfuerzo xhigh no aporta puntos de índice extra en ninguna de las dos generaciones. En seguridad SpaceXAI reporta la mayor resistencia a rechazos y jailbreaks que ha probado, un 62,4 % en el benchmark de bioseguridad de LatchBio y un 3,3 % de prompts de doble uso arriesgados admitidos en su propio HackerBench v0.3. La disponibilidad es del lado de desarrolladores: la API de Grok, Cursor, Grok Build, harnesses de programación de terceros y routers en la nube. El anuncio no dice nada de la app de consumo de Grok, que sigue sirviendo Grok 4.6. Todo el detalle en nuestro análisis de Grok 4.7.
21 sep Xiaomi El MiMo-V2.6-Pro de Xiaomi es el modelo abierto con la mayor puntuación jamás medida, a $0,13 por tarea del índice bajo MIT Nuevo
Xiaomi publicó MiMo-V2.6-Pro el 21 de septiembre de 2026 bajo MIT puro, con los pesos en Hugging Face en XiaomiMiMo/MiMo-V2.6-Pro-RL el mismo día. Es una mezcla de expertos de 1,02 billones de parámetros con 42.000 millones activos y contexto de 1M de tokens. Artificial Analysis lo mide, no lo estima, en 46,3 en el Intelligence Index v4.3.2, la mayor puntuación abierta que ha publicado nunca: por encima de GLM-5.3 con 44,8, por encima de Kimi K3 con 43,6 y a la par del recién salido Grok 4.7 de SpaceXAI. La otra mitad de la historia es el coste. Resuelve una tarea del Intelligence Index por $0,13 a $0,435 / $0,87 por 1M de tokens, más barato por tarea que cualquier otro modelo abierto de esta página, en torno a la mitad de lo que cuesta GLM 5.3 Flash por cuatro puntos y medio más. También logra un 34,8 % en Terminal-Bench 4.0, 1673 en GDPval-AA v2.1, un 49,4 % en Humanity's Last Exam y un 86,3 % en AA-LCR, lo que lo pone por encima de Kimi K3 en tres de esos cuatro. Dos límites conviene decirlos sin rodeos. Ningún tablero de Arena lo ha valorado, así que no hay evidencia alguna de preferencia humana sobre él, y se publicó hace cuatro días, así que no tiene historial independiente más allá de Artificial Analysis. Y 1,02 billones de parámetros son un clúster, no una estación de trabajo, y por eso GLM 5.3 Flash sigue siendo nuestra recomendación para equipos que de verdad quieren alojar lo suyo. Se lleva la corona de pesos abiertos de esta página por puntuación medida y por coste.
15 sep TypeSafe TypeSafe sale del sigilo con Jev, un modelo que devuelve decisiones tipadas en lugar de texto, a $0.042 por 1M de tokens Nuevo
TypeSafe AI salió de dos años de sigilo el 15 de septiembre de 2026 con 40 millones de dólares de financiación semilla liderada por DCVC y un modelo que no genera texto en absoluto. Jev es el primero de lo que la empresa llama modelos System One: le envías un bloque de estado y un conjunto fijo de preguntas tipadas, y responde a todas en una sola pasada paralela, devolviendo una opción, una puntuación o una probabilidad de sí o no en lugar de una frase. Como el espacio de respuestas se define antes de la llamada, no puede devolver un resultado mal formado, y de ahí viene la frase del anuncio de que Jev no puede alucinar. Aun así puede elegir la opción equivocada, y la propia documentación de TypeSafe dice que la calibración no garantiza que una respuesta concreta sea correcta. El precio es de $42 por cada mil millones de tokens de entrada, es decir $0.042 por 1M, con la salida gratis, contexto de 64k y solo entrada de texto. Las cifras de rendimiento exigen cuidado, porque la empresa publicó cuatro distintas en tres días: desde menos de 100 milisegundos y hasta 100x más rápido en la nota de prensa hasta 193.6x más rápido y 444.6x más barato en la portada, cada una medida frente a un rival diferente, y su propia nota al pie llama a los números grandes el extremo alto de las ganancias reales. Su evaluación de flujos de trabajo se mide contra el promedio de GPT-6 Astra y Fable 5.1 en vez de contra una verdad de referencia, y la empresa no publica ninguna puntuación pública de benchmark por decisión propia. Dos pruebas independientes del 18 de septiembre midieron alrededor de 6x menos coste y 8x más velocidad frente a un modelo barato con el razonamiento desactivado, y la calibración aguantó. Nada de esto cambia una elección de esta página: Jev no tiene interfaz de consumidor y está en acceso anticipado con lista de espera. Todo el detalle en nuestra explicación de los modelos System One.
10 sep DeepSeek DeepSeek retira V4-Flash, lo sustituye por V4.1-Flash y baja la tarifa Flash alrededor de un tercio Nuevo
DeepSeek retiró DeepSeek-V4-Flash el 10 de septiembre de 2026 y puso DeepSeek-V4.1-Flash en su lugar. El nombre del modelo es ahora deepseek-flash; los nombres antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp siguen resolviendo, pero los modelos que había detrás están retirados y las peticiones las atiende V4.1-Flash al precio de Flash. Ese precio baja alrededor de un tercio: $0.15 / $0.60 por 1M de tokens en valle y $0.30 / $1.20 en punta, frente a $0.22 / $0.66 y $0.44 / $1.32 de la versión que sustituye, con aciertos de caché a $0.003 en valle. Las ventanas de punta no cambian, de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y el resto de horas van a mitad de precio. V4-Pro queda intacto a $0.66 / $1.98 en valle, y DeepSeek ha dicho que seguirá sirviéndolo más allá de su fecha de retirada del 14 de septiembre. El modelo nuevo es un mixture-of-experts de 552 000 millones de parámetros sobre un diseño causal encoder-decoder que activa 8000 millones en prefill y 16 000 millones en decodificación, admite 1M de tokens de contexto, lee imágenes de forma nativa y apareció en Hugging Face bajo MIT ese mismo día. Artificial Analysis lo puntúa con 39,5 en el Intelligence Index v4.3 frente al 34,5 de la versión V4-Flash 0731 que sustituye, a $0.27 por tarea del índice. No recupera la elección relación precio-rendimiento: GLM 5.3 Flash marca 41,9 a $0.25 por tarea. Todo el detalle en nuestra guía de precios de DeepSeek.
3 sep OpenAI GPT-6 Astra sale a $10 / $50 y en un día está en Plus y Pro y lidera los tableros de programación Nuevo
OpenAI lanzó GPT-6 Astra el 3 de septiembre de 2026 y zanjó la discusión que duró todo el año: esto es GPT-6, no otra versión intermedia dentro de la línea GPT-5. El presidente de la compañía, Greg Brockman, dijo en una rueda de prensa «Bienvenidos a la era de la AGI.» Las cifras independientes son más sobrias que el encuadre. Artificial Analysis puntúa a Astra con 61 en el Intelligence Index v4.1.1 en modo max, exactamente al nivel de GPT-5.6 Sol, cinco puntos por detrás de Claude Fable 5.1 con 66 y dos por detrás de Claude Opus 5 con 63, y cobra $10 / $50 por 1M de tokens frente a los $4 / $20 de Sol, lo que sale un 75 % más caro por tarea del índice que el modelo al que sustituye. El resultado más fuerte está en el Coding Agent Index, donde Astra en Codex saca 67, al nivel de Claude Opus 5 y Claude Fable 5 en Claude Code y por detrás de los 70 de Claude Fable 5.1, y llega ahí con un tercio de los tokens de Sol y un quinto de los de Opus 5, lo que lo sitúa en la frontera de eficiencia de coste. También reduce a la mitad las alucinaciones en AA-Omniscience, del 92 % al 51 % en modo max, mientras gana cuatro puntos de precisión, y suma unos 80 Elo en AA-Briefcase y seis puntos en Humanity's Last Exam. En contra, pierde unos 80 Elo en GDPval-AA v2 y retrocede entre dos y tres puntos en atención al cliente, SciCode y razonamiento de contexto largo. Dos advertencias acompañan a las cifras del lanzamiento: el 98,6 % en ARC-AGI-3 no es un porcentaje de problemas resueltos sino una puntuación de eficiencia de acciones frente a una referencia humana, medida en un arnés que la propia OpenAI ha demostrado que puede triplicar el resultado, y Epoch AI revela que OpenAI financió FrontierMath y tiene acceso exclusivo a una parte. La verdadera limitación es la disponibilidad. Astra es el primer modelo que OpenAI ha designado como crítico en ciberseguridad dentro de su Preparedness Framework, así que lo recibieron primero los defensores aprobados del programa Daybreak. ChatGPT Business y Pro llegaron el 4 de septiembre y Plus unas horas después, mientras que la API, AWS, Azure y el plan gratuito siguen pendientes. Artificial Analysis ha retirado desde entonces el Coding Agent Index y, en su propia ejecución de Terminal-Bench 4.0, Astra lidera ahora con claridad, 60 % frente al 55 % de Claude Fable 5.1, que es lo que ha movido la corona de programación de esta página a Astra. Todo el detalle en nuestro análisis de GPT-6 Astra.
2 sep Alibaba Qwen3.8-Max-0902 le quita a Claude Opus 5 el tablero WebDev de Arena por tres puntos, a $2 / $6 Nuevo
Alibaba lanzó Qwen3.8-Max-0902 el 2 de septiembre de 2026, y lo primero que hay que entender bien es el nombre: se trata de un refresco de post-entrenamiento del Qwen3.8-Max que salió el 3 de agosto, no de una versión nueva, con los mismos 2,4 billones de parámetros y la misma ventana de contexto de 1M de tokens. Qwen dice que fue post-entrenado además en programación y trabajo de tipo Cowork. Lo que importa es el tablero que movió. Arena anunció ese mismo día que Qwen3.8-Max-0902 debutó como #1 general en Code Arena: WebDev con 1691 puntos, tres por encima de Claude Opus 5 (Max), diecisiete por encima de Kimi K3 (Max) y veintidós por encima del anterior Qwen3.8-Max, llevándose además el #1 en las categorías Data & Analytics y Consumer Product. Es la primera vez este año que un modelo de Anthropic es desplazado de lo más alto de un tablero de programación por votos. El precio es de $2 / $6 por 1M de tokens con cache hits a $0.17 explícito y $0.25 implícito, que Arena contabiliza como $5 mezclados por millón y la mejor posición de su frontera de Pareto. Léelo con tres salvedades. Tres puntos caben en el ruido de un tablero por votos, Artificial Analysis no había publicado entonces ningún Intelligence Index para la instantánea 0902 y desde entonces le ha dado 45,4 en la v4.3, y este es un modelo alojado en QwenCloud sin front-end de chat de consumo: los pesos abiertos que Alibaba prometió para Qwen3.8-Max en agosto siguen sin llegar, así que nada de esto cambia nuestra elección open-weight. Arena dice que las puntuaciones de Agent Arena están aún por llegar. Qwen3.8-Max-0902 ha caído desde entonces al cuarto puesto en WebDev, por detrás de GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5, y la categoría de programación ha pasado a Astra. Todo el detalle en nuestro análisis de Qwen 3.8.
2 sep Meta Muse Spark 1.3, Intelligence Index de 57 a 61 con un $1.25 / $4.25 sin cambios, gana en programación y pierde todas las filas de agente Nuevo
Meta lanzó Muse Spark 1.3 el 2 de septiembre de 2026, su cuarto modelo Muse Spark en cinco meses, en Muse Code y la Meta Model API. Artificial Analysis lo puntúa con 61 en el Intelligence Index v4.1.1, frente a 57 de la 1.2 y 53 de la 1.1, ocho puntos en dos meses y la subida más rápida que consigue nadie en esta página. El precio no se movió en absoluto: $1.25 / $4.25 por 1M de tokens sobre una ventana de contexto de 1M de tokens, y el nivel Contributor sigue en $0.10 / $0.20 a cambio de dejar que Meta entrene con tus prompts y completions. Hay dos cosas del lanzamiento que conviene leer con calma. En la propia tabla de Meta el modelo gana todas las filas de programación, DeepSWE v1.1 con 75,4 frente al 74,0 de Claude Opus 5 y SWEAtlas CodeBase QnA con 59,4, empata con GPT-5.6 Sol en Terminal-Bench 2.1 en 88,8 y se lleva las dos bandas de contexto largo de MRCR por mucho, 98,1 en la banda de 512K a 1M frente al 55,5 de la 1.2. También pierde las seis filas que Meta agrupa bajo Agent, cuatro ante Opus 5 y dos ante GPT-5.6 Sol, y esa mitad del gráfico apenas se contó. El otro matiz es qué modelo se midió: la columna evaluada es Muse Spark 1.3 (max), una vista previa limitada para socios de Meta que puntúa 62, mientras que la versión que cualquiera puede llamar hoy es xhigh con 61, y Meta ejecutó la columna de comparación de la 1.2 en xhigh y no en max. Meta lo lanzó primero para desarrolladores, en Muse Code y la Meta Model API, y dijo que un despliegue en Facebook, Instagram y la app de Meta AI llegaría en los próximos días, y la promesa de pesos abiertos volvió a retrasarse: el compromiso de agosto de publicar los pesos de Muse Spark 1.2 se convirtió en una frase sin fecha sobre pesos abiertos que llegarán pronto. Todo el detalle en nuestro análisis de Muse Spark 1.3.
2 sep Google Gemini 3.8 Flash, tres puntos más en el Intelligence Index al mismo $0.75 / $3.75 Nuevo
Google puso Gemini 3.8 Flash en disponibilidad general el 2 de septiembre de 2026, tres semanas después de 3.7 Flash y como su tercer lanzamiento Flash en 43 días. Todas las especificaciones se mantienen sin cambios: 1M de contexto de entrada, un límite de salida de 64K, corte de conocimiento en marzo de 2026, la misma lista de modalidades y los mismos $0.75 / $3.75 introductorios por 1M de tokens, que se duplican a $1.50 / $7.50 el 1 de enero de 2027. Solo se movieron las puntuaciones, y lo hicieron en todas las filas publicadas. DeepSWE v1.1 pasa del 65,3 % al 73,7 %, Terminal-bench 2.1 del 85,8 % al 89,4 %, Terminal-bench 4.0 del 11,2 % al 19,1 % y BioMysteryBench Human Difficult del 43,5 % al 56,5 %. Artificial Analysis le da 59 en el Intelligence Index v4.1.1 frente a los 56 de 3.7 Flash, y mide 304,6 tokens de salida por segundo frente a 279,4, con un lento tiempo hasta el primer token de 13,39 segundos que lo convierte en un modelo de lotes y agentes más que de chat interactivo. Lee las victorias junto a las derrotas: la propia tabla comparativa de Google da a 3.8 Flash 8 de 14 filas, y Claude Opus 5 sigue llevándose Terminal-bench 4.0 por 51,8 % frente a 19,1 %, OSWorld-2.0 por 75,4 % frente a 59,0 % y GDPVal-AA v2 por 1824 frente a 1545 de Elo. La cifra de DeepSWE que republicó buena parte de la cobertura del lanzamiento, 71,0 %, no es la del PDF de Google, que dice 73,7 % frente al 74,0 % de Opus 5. El acceso para desarrolladores estaba activo desde el anuncio, a través de la API de Gemini, AI Studio, Antigravity y la Gemini Enterprise Agent Platform. El acceso de consumo se reporta para suscriptores de Google AI Pro y Ultra, pero las notas de versión de las aplicaciones Gemini todavía no tienen ninguna entrada al respecto, y el nivel gratuito de Gemini sigue ejecutando 3.6 Flash. Todo el detalle en nuestro análisis de Gemini 3.8 Flash.
1 sep Anthropic Claude Fable 5.1 y Mythos 5.1, un nuevo #1 en Artificial Analysis con 66 y un recorte del 75 % en las lecturas de caché Nuevo
Anthropic lanzó Claude Fable 5.1 y Claude Mythos 5.1 el 1 de septiembre de 2026, y son un modelo en dos configuraciones de salvaguardas, no dos modelos. Fable 5.1 está disponible de forma general; Mythos 5.1 relaja las restricciones de biología y ciberseguridad y se reparte por invitación, sin criterios de elegibilidad publicados. Artificial Analysis puntúa a Fable 5.1 con 66 en su Intelligence Index v4.1.1 con effort max, la puntuación más alta que ha medido nunca, por delante de Claude Opus 5 con 63, Claude Fable 5 con 62 y GPT-5.6 Sol y Grok 4.6 con 61. También se llevó entonces el Agentic Index con 61 frente al 59 de Opus 5, el tablero GDPval-AA v2 de entregables profesionales con 1853 frente a 1824, y Humanity's Last Exam con un 59,1 % frente al 55,5 % de Fable 5. El ajuste de effort pesa aquí más de lo habitual: el mismo modelo marca 58 en low, 60 en medium, 62 en high y 65 en xhigh, y esos ajustes abarcan una diferencia de once veces en tokens de salida, de 13,1 millones a 143,7 millones en toda la batería. El precio no cambia, a $10 / $50 por 1M de tokens, pero las lecturas de caché bajan un 75 % hasta $0.25 desde el $1.00 de Fable 5, y ahí es donde está el ahorro real en las ejecuciones agénticas largas. Con las cifras del propio Anthropic alcanza un 52,6 % en Terminal-Bench-Science 0.1 frente al 29,0 % de Opus 5, y la tarjeta de sistema de 212 páginas subió la propia evaluación de riesgo de alineación de la empresa de muy baja a baja. Dos cosas antes de cambiar: Anthropic sigue recomendando empezar con Opus 5 para la mayoría de las cargas a mitad de precio, y en el lanzamiento ningún tablero de Arena tenía votos para ninguno de los dos modelos. Fable 5.1 ya está valorado: es segundo en los dos tableros de programación de Arena y quinto en el de texto. Todo el detalle en nuestro desglose de Claude Fable 5.1 y Mythos 5.1.
28 ago Z.ai Los pesos de GLM 5.3 ya están fuera tras la pausa de seguridad, pero la licencia no es MIT Nuevo
Z.ai publicó los pesos de GLM 5.3 en Hugging Face el 28 de agosto de 2026, dos semanas después del lanzamiento de la API y exactamente en la fecha que llevaba su marcador de posición, así que la evaluación de seguridad prometida sí se hizo y la pausa queda cerrada en lugar de abierta. Lo que cambió es la licencia. GLM 5.3 Flash había salido bajo MIT puro dos días antes; el buque insignia lleva un documento propio titulado GLM 5.3 License, y el campo de licencia de la ficha del modelo dice glm-5.3, no mit. La concesión de derechos sigue de cerca a MIT, con derecho a ejecutar, desplegar, ajustar, modificar, distribuir y vender, y con los pesos explícitamente incluidos en la definición del software, de modo que el uso comercial queda abierto a casi todo el mundo. Una cláusula sí es nueva: un operador de model-as-a-service cuyos ingresos superen los 10 000 millones de dólares en doce meses consecutivos debe pasar una revisión de seguridad de Z.ai antes de desplegar comercialmente, y Z.ai se reserva determinar por su cuenta el alcance y el método de esa revisión. Ten en cuenta además que Hugging Face cuenta el checkpoint publicado en 753B parámetros frente a la base de 744B que Z.ai dice compartir con GLM-5.2; es el tipo de diferencia que produce un recuento mecánico de parámetros, no la prueba de un modelo distinto. Esto no mueve nuestra elección open-weight. GLM 5.3 Flash sigue siendo el modelo que alojaríamos, porque 320B bajo MIT puro es mucho más fácil de operar y de resolver legalmente que 753B bajo una licencia propia. Todo el detalle en nuestro desglose de GLM 5.3.
28 ago Tencent Tencent Hy4 Preview, 770B de pesos abiertos bajo Apache 2.0 y el mayor modelo permisivo hasta la fecha Nuevo
Tencent publicó y liberó Hy4 preview el 28 de agosto de 2026, el nuevo buque insignia de su línea Hunyuan y el mayor modelo que nadie haya publicado bajo Apache 2.0. Funciona con 770 000 millones de parámetros totales y 49 000 millones activos por token en un diseño mixture-of-experts, admite una ventana de contexto que Tencent describe como superior a 1M de tokens, y se distribuye con una compilación FP8 junto a los pesos en precisión completa. El precio de la API es $0.834 por 1M de tokens de entrada, $2.501 de salida y $0.042 de entrada en caché, barato para este tamaño. La licencia es la verdadera noticia: Apache 2.0 es más permisiva que el documento propio de Kimi K3 y que la licencia que Z.ai adjuntó a GLM 5.3 ese mismo día. Trata con cuidado la afirmación de calidad, porque la única prueba hasta ahora es la del fabricante. Tencent hizo una evaluación ciega interna de 203 tareas de ingeniería puntuadas por 163 expertos, y Hy4 preview obtiene ahí 2,99 sobre 4,00 frente al 2,94 de Kimi K3 y el 2,92 de GLM 5.3. Es el propio panel de Tencent, los márgenes caben en una décima de punto y ninguna casa independiente había publicado entonces un Intelligence Index ni una valoración de Arena. Arena lo sitúa desde entonces undécimo en WebDev con 1624, mientras que Artificial Analysis sigue sin darle un Intelligence Index, así que lo listamos en lugar de clasificarlo. Tencent afirma además que el modelo ayudó a automatizar la optimización de su propio proceso de entrenamiento y elevó su propio rendimiento de inferencia un 31,8 % medido. Está disponible como pesos abiertos y a través de WorkBuddy, CodeBuddy, Yuanbao e ima, además de Tencent Cloud TokenHub y OpenRouter, con acceso gratuito en WorkBuddy y CodeBuddy durante dos semanas desde el lanzamiento. Todo el detalle en nuestro análisis de Tencent Hy4 Preview.
26 ago Z.ai GLM 5.3 Flash, Ox Alpha desvelado, y los primeros pesos MIT que Z.ai publica desde GLM-5.2 Nuevo
Z.ai lanzó GLM 5.3 Flash el 26 de agosto de 2026, y no es el modelo que el sector esperaba. Los pesos retenidos el 14 de agosto pertenecen a GLM 5.3; este es un modelo aparte sobre una base recién entrenada, 320 000 millones de parámetros con 18 000 millones activos, el primer modelo nativamente multimodal de la línea GLM-5, y llegó a Hugging Face bajo licencia MIT el mismo día. Es además el modelo sigiloso que venía sirviendo tráfico en OpenRouter como Ox Alpha, ejecutado durante esa vista previa íntegramente en chips de IA chinos, lo que describe cómo se sirvió, no cómo se entrenó. Artificial Analysis lo puntúa con 57 en el Intelligence Index v4.1.1, cuatro puntos por encima de GLM-5.2 con menos de la mitad de tamaño, y lo sitúa en la frontera de Pareto entre inteligencia y coste. En el índice v4.3 de hoy marca 41,9 frente al 34,0 de GLM-5.2, a $0.25 por tarea del índice. El precio de lista es $0.15 / $0.50 por 1M de tokens; la promoción de lanzamiento del 50 % estuvo vigente hasta las 24:00 del 9 de septiembre y ya ha terminado. El relevo de DeepSeek por V4.1-Flash el 10 de septiembre cerró casi toda la distancia: en valle los dos empatan ahora en $0.15 de entrada, con GLM más barato en salida, $0.50 frente a $0.60, y en punta GLM queda por debajo en ambos lados. Trata las cifras de programación y agénticas con cuidado: salen del propio gráfico de Z.ai, que elige como comparación a Claude Opus 4.8 y GPT-5.6 Terra en lugar de a los líderes actuales, y ahí figuran Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 frente al 46,2 de GLM-5.2 y AutomationBench 48,8. La única cifra de ese gráfico medida por Artificial Analysis es GDPval-AA v2, donde GLM 5.3 Flash alcanza 1773 Elo, la más alta representada. Arena ya lo ha valorado, decimoséptimo en WebDev y décimo en image-to-WebDev. Esto sí mueve nuestra elección open-weight: GLM 5.3 Flash sustituye a GLM-5.2 como el modelo MIT que alojaríamos. Una advertencia sobre hardware: 18B activos no significa 18B para alojar, porque el enrutado mixture-of-experts necesita los 320B de pesos residentes, así que hablamos de un servidor multi-GPU, no de una estación de trabajo. Todo el detalle en nuestro desglose de GLM 5.3 Flash.
26 ago Alibaba Qwen3.8-Flash-Next, pesos abiertos y el primer vistazo público a la arquitectura Qwen4 Nuevo
Alibaba publicó Qwen3.8-Flash-Next en Hugging Face el 26 de agosto de 2026, y aquí importa más la arquitectura que la tabla de puntuaciones: Qwen lo presenta como un vistazo temprano al diseño que usará la familia Qwen4, publicado para que la comunidad pueda prepararse. Es un mixture-of-experts de 125 000 millones de parámetros con solo 6000 millones activos por token, más un embedding de N-gramas aparte de 51 000 millones de parámetros, y admite texto, imagen y vídeo. El contexto es de 262 144 tokens de forma nativa, ampliable a 1M. Entre las cifras publicadas por Qwen están 91,7 en GPQA Diamond, 62,5 en SWE-Bench Pro, 58,7 en DeepSWE 1.1, 81,0 en SWE-Bench Multilingual y 84,5 en AndroidWorld vision, todas del fabricante y, entonces, sin ninguna valoración independiente. Artificial Analysis le ha dado desde entonces 39,9 en el Intelligence Index v4.3 y Arena lo sitúa noveno en WebDev con 1635. Conviene leer la licencia antes de construir sobre ella, porque no es Apache. La Qwen Community License 1.0 permite uso comercial, modificación y alojamiento, pero exige mostrar de forma visible el nombre del modelo en cuanto un producto supere los 100 millones de usuarios activos mensuales o los 20 millones de dólares de ingresos mensuales, y exige una licencia aparte de Qwen para explotar un negocio de model-as-a-service o de asistente de trabajo con IA. El uso interno queda exento de esa segunda condición.
21 ago OpenAI GPT-5.6 Sol baja más de un 20 % y queda por debajo de Claude Opus 5 en ambos lados Nuevo
OpenAI recortó GPT-5.6 Sol de $5 / $30 a $4 / $20 por 1M de tokens el 21 de agosto de 2026, el primer recorte al buque insignia desde el lanzamiento de la familia GPT-5.6 en julio. La tarifa es promocional y OpenAI dice que dura unos tres meses. Cubre la API y los créditos de Codex y ChatGPT Work; los precios de suscripción de Plus, Pro y Business no cambian. A $4 / $20, Sol queda ahora por debajo de Claude Opus 5 a $5 / $25 tanto en entrada como en salida, la primera vez que el buque insignia de OpenAI es el más barato de los dos.
16 ago DeepSeek DeepSeek sube los precios de la API unas cuatro veces y divide la tarifa en horas punta y valle Nuevo
DeepSeek pasó sus dos modelos V4 a una nueva tarifa a las 16:00 UTC del 16 de agosto de 2026, y la dirección es poco habitual en este sector: los precios subieron, unas cuatro veces en hora punta. V4-Flash 0731 pasó de unos $0.14 / $0.28 planos por 1M de tokens a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, y V4-Pro 0813 de $0.435 / $0.87 a $0.66 / $1.98 en valle y $1.32 / $3.96 en punta, con la entrada en caché a $0.007 y $0.022 en valle respectivamente. La hora punta va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, y cualquier otra hora es valle a exactamente la mitad de la tarifa punta. DeepSeek lo presentó como un reparto más razonable de la capacidad. Nada cambió en los modelos, así que es puramente un hecho económico, pero de consecuencia para esta página: le costó a DeepSeek V4-Flash la elección relación precio-rendimiento, que pasó a GLM 5.3 Flash con $0.15 / $0.50 de lista. DeepSeek revirtió casi toda la subida el 10 de septiembre, retiró V4-Flash y lo sustituyó por V4.1-Flash a $0.15 / $0.60 en valle, así que en entrada y en valle los dos vuelven a estar igualados. Los pesos siguen bajo MIT, así que quien se lo aloje por su cuenta no se ve afectado. Todo el detalle en nuestro desglose de DeepSeek V4.
14 ago Z.ai GLM 5.3, un gran salto agéntico solo con post-entrenamiento, lanzado sin los open weights Nuevo
Z.ai lanzó GLM 5.3 el 14 de agosto de 2026, y lo notable es lo que no cambió: funciona sobre la misma base de 744 000 millones de parámetros que GLM-5.2, sin nuevo preentrenamiento. Toda la mejora viene de post-entrenamiento escalado, y la agéntica es grande. En el propio gráfico de Z.ai, Terminal-Bench 3.0 pasa de 4,6 a 28,3, DeepSWE v1.1 de 46,2 a 66,9 y CyberGym del 77,2 % al 84,5 %, lo que según la compañía supera por poco a Claude Mythos 5 con 83,8 y a GPT-5.6 Sol con 83,6. Todas esas cifras son del fabricante, todavía sin auditoría independiente, y el gráfico es menos halagador en otros puntos: en el Code Bench interno de Z.ai, Claude Fable 5 sigue liderando con un 39,5 % frente al 31,4 % de GLM 5.3, y en ExploitBench los líderes frontier están en el 78,0 % frente al 54,4 %. La pega es la licencia, no la puntuación. GLM-5.2 publicó pesos con licencia MIT en cuestión de días; GLM 5.3 llegó sin ninguno, y Z.ai dijo que llegarían tras una evaluación de seguridad de la capacidad del modelo para descubrir vulnerabilidades, en unas dos semanas. Eso se resolvió el 28 de agosto de 2026, cuando Z.ai publicó los pesos exactamente en la fecha que llevaba el marcador de posición, aunque bajo una GLM 5.3 License propia en lugar del MIT puro que recibieron tanto GLM-5.2 como GLM 5.3 Flash. La tarifa por token ya está publicada, $1.40 / $4.40 por 1M de tokens, junto al GLM Coding Plan y ZCode. Lo que llegó el 26 de agosto fue, en su lugar, GLM 5.3 Flash, un modelo distinto y más pequeño que sí publicó pesos MIT, y es ese lanzamiento el que movió nuestra elección open-weight. Todo el detalle en nuestro desglose de GLM 5.3.
13 ago Google Gemini 3.7 Flash, las puntuaciones de programación suben y el precio se reduce a la mitad hasta $0.75 / $3.75, hasta enero Nuevo
Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026, 23 días después de 3.6 Flash y como su tercera versión Flash en menos de dos meses, mientras Gemini 3.5 Pro sigue sin salir. Las mejoras de programación son el punto: DeepSWE v1.1 sube del 49,0 % al 65,3 %, FrontierCode 1.1 Main del 34,4 % al 43,6 %, y AutomationBench casi se duplica, del 17,0 % al 30,4 %. Artificial Analysis lo puntúa con 56 en su índice v4.1.1 frente a 52 para 3.6 Flash, y lo sitúa primero de 182 modelos en velocidad de salida con 385,1 tokens por segundo, lo que lo coloca en la frontera de Pareto de inteligencia frente a tiempo. La ventana de contexto y el límite de salida de 64K no cambian respecto a 3.6 Flash, así que no se sacrificó nada. Dos advertencias pesan más que los benchmarks. La tarifa de $0.75 / $3.75 es introductoria y expira el 31 de diciembre de 2026, tras lo cual se duplica a $1.50 / $7.50, exactamente lo que costaba 3.6 Flash en su lanzamiento; Google también pasó 3.6 Flash a la misma tarifa, así que ahora cuestan lo mismo y la actualización es una decisión puramente de capacidad. Y el acceso de consumo va solo a través de Spark, que requiere Google AI Pro o Ultra y excluye el Espacio Económico Europeo, el Reino Unido, Suiza y Nigeria, así que la mayoría de los lectores europeos no pueden alcanzarlo en la aplicación de Gemini. El nivel gratuito de Gemini sigue recibiendo 3.6 Flash. El acceso por API no se ve afectado en ningún sitio. Todo el detalle en nuestro desglose de Gemini 3.7 Flash.
12 ago SpaceXAI Grok 4.6, el post-entrenamiento sube el Intelligence Index de 56 a 61 con $2 / $6 sin cambios Nuevo
SpaceXAI lanzó Grok 4.6 el 12 de agosto de 2026, y explícitamente no es un modelo base nuevo: la empresa mantuvo la base de Grok 4.5 y compró las mejoras con una tanda de entrenamiento suplementario más larga, trayectorias de ajuste fino regeneradas y aprendizaje por refuerzo en entornos agénticos. No se publicó ninguna arquitectura ni recuento de parámetros nuevos. Artificial Analysis lo puntúa con un Intelligence Index de 61, cinco puntos por encima de Grok 4.5, lo que lo empata con GPT-5.6 Sol en el tercer puesto, por detrás de Claude Opus 5 con 63 y Claude Fable 5 con 62, tal como estaba el índice ese mes; Claude Fable 5.1 se ha puesto desde entonces por encima de los tres con 66. Las cifras agénticas son más fuertes que el índice compuesto: un Elo de 1753 en GDPval-AA v2 solo por detrás de Opus 5, un 88,4 % en Terminal-Bench v2.1 y un 50,7 % en tau3-Banking. El argumento entonces era la eficiencia, a $0.84 por tarea de índice y unos 53 turnos y 0,5 mil millones de tokens de entrada en trabajos largos frente a unos 103 turnos y 2,0 mil millones de Opus 5. Con las cifras v4.3 actuales de Artificial Analysis ese argumento se debilita: Grok 4.6 cuesta $1.86 por tarea de índice, más que los $1.61 de Muse Spark 1.3 con mejor puntuación. El precio no cambia, a $2 / $6 por 1M de tokens con entrada cacheada a $0.50, sobre la misma ventana de contexto de 500K tokens, pero hay una trampa que conviene conocer: si un prompt alcanza los 200.000 tokens, SpaceXAI vuelve a facturar la petición entera a $4 / $12, no solo el exceso. Un aviso sobre la cobertura de benchmarks, porque mucha cobertura ya lo ha enredado: Terminal-Bench v3.0 es una prueba distinta y mucho más dura que la v2.1, así que un 26 % en v3.0 y un 88,4 % en v2.1 son ambas afirmaciones ciertas sobre el mismo modelo. Está disponible desde el primer día en la API de SpaceXAI, en Cursor y Grok Build, y en socios como OpenRouter, Vercel y Cloudflare. Todo el detalle en nuestro desglose de benchmarks y precios de Grok 4.6.
5 ago Meta Muse Spark 1.2 y Muse Code, Intelligence Index de 51 a 57 con un $1.25 / $4.25 sin cambios, además de un agente de programación de terminal Nuevo
Meta lanzó Muse Spark 1.2 el 5 de agosto de 2026 junto a Muse Code, su primer agente de programación de terminal, que se ejecuta en macOS y Linux sin aplicación de escritorio y sin suscripción. Artificial Analysis puntúa el modelo con un Intelligence Index de 57 en su ajuste de razonamiento más alto en su índice actual v4.1.1, frente a 51 para la 1.1 y 43 para la versión de abril, y casi toda esa mejora es agéntica en lugar de conocimiento general; su Elo GDPval-AA v2 saltó de 1371 a 1631 mientras que Terminal-Bench v2.1 solo pasó del 78 % al 80 %. El precio no cambia a $1.25 / $4.25 por 1M de tokens sobre una ventana de contexto de 1M de tokens, y Meta añadió un nivel Contributor a $0.10 / $0.20, cerca de un 92 % más barato, a cambio de dejar que Meta entrene con tus prompts y completions. La disponibilidad se amplió del acceso previo solo para EE. UU. con el que se lanzó la 1.1 a un acceso global ampliado a través de Muse Code, la Meta Model API y OpenRouter. En los propios gráficos de lanzamiento de Meta, el modelo queda segundo tras Claude Opus 5 en los tres benchmarks de programación que publicó, con un 82,9 % frente al 86,7 % en Terminal-Bench 2.1.
3 ago Alibaba Qwen 3.8 (Qwen3.8-Max), buque insignia multimodal de 2,4 billones de parámetros ya disponible en general a $2 / $6 Nuevo
Alibaba puso Qwen3.8-Max en disponibilidad general el 3 de agosto de 2026, dos semanas después de presentarlo en el WAIC Shanghai, y cada cifra que faltaba en la vista previa ya tiene un número detrás. Corre 2,4 billones de parámetros totales con unos 95 000 millones activos por token en un diseño disperso de Mixture-of-Experts, admite texto, imágenes y vídeo, y confirma una ventana de contexto de 1M de tokens con hasta 128K tokens de salida. El precio de la API es de $2 / $6 por 1M de tokens, plano en todo el contexto en lugar de escalonado por longitud del prompt, con lecturas en caché a $0.25. La afirmación de «solo por detrás de Fable 5» ahora se divide limpiamente en dos: en el tablero de visión de Arena es #2 con 1305, solo detrás de Fable 5, pero en el tablero de texto es #5 con 1496, detrás de cuatro entradas de Anthropic. Ambas puntuaciones de Arena siguen marcadas como preliminares, y los open weights prometidos no han llegado. Mantenemos a Qwen 3.8 fuera de las elecciones clasificadas hasta que los pesos y la licencia lleguen de verdad.
Pendiente Google Gemini 3.5 Pro, aún sin lanzar, meses de retraso según Bloomberg Retrasado
Gemini 3.5 Pro sigue siendo el mayor lanzamiento pendiente. Google lo anunció en el I/O el 19 de mayo junto a Gemini 3.5 Flash, pero solo Flash se lanzó, y el objetivo de junio se retrasó. Bloomberg informó el 16 de julio de 2026 de que el modelo lleva meses de retraso y se ha quedado corto respecto a los objetivos internos de Google, con la empresa aún trabajando para mejorar sus capacidades, en particular en programación. Ese es todo el panorama con fuentes. Google nunca ha confirmado públicamente una fecha de lanzamiento, y Google no ha publicado especificaciones finales como la ventana de contexto o los modos de razonamiento, así que trata las cifras que circulan como no confirmadas. Usa Gemini 3.8 Flash mientras tanto si trabajas por API, o Gemini 3.6 Flash si estás en la aplicación gratuita de Gemini, que sigue ejecutándolo; moveremos 3.5 Pro a la clasificación principal en cuanto se lance.
Elección de categoría, septiembre de 2026

Mejor IA para escritura

1
Claude Fable 5.1
Mejor escritura en general
2
Kimi K3
Ficción creativa
3
Claude Sonnet 5
Gratis para el día a día

La mejor IA para escribir es Claude Fable 5.1, y el argumento a su favor es la constancia, no un primer puesto aislado. Es el único modelo entre los seis primeros de los tres tableros de prosa: segundo en EQ-Bench Creative Writing v3 con 2152,7, segundo en LiveBench Language con 89,5 y sexto en el tablero de escritura creativa de Arena. Ningún otro lo consigue. GPT-6 Astra lidera EQ-Bench con 2163,9 pero ocupa el puesto 25 en escritura creativa de Arena; Claude Fable 5 lidera los tableros de texto y de escritura creativa de Arena y encabeza LiveBench Language con 90,7, pero ha caído al octavo puesto en EQ-Bench. Claude Opus 5.5, que el 22 de septiembre le quitó a Fable 5.1 el Intelligence Index y Humanity's Last Exam, está sin valorar en EQ-Bench y en Arena y es octavo en LiveBench Language, así que todavía no tiene ningún argumento en los tableros de escritura y la corona no pasa a él. Si tu escritura es un entregable de trabajo y no prosa, esa es otra pregunta, y el tablero de entregables profesionales GDPval-AA v2.1 lo lidera Claude Opus 5.5 con 1846 por delante de Claude Fable 5.1 con 1735 y de Claude Opus 5 con 1708. Claude Sonnet 5 sigue siendo la mejor relación en el nivel gratuito y Claude Fable 5 la elección si pesas más los votos humanos de Arena que las puntuaciones de harness; Fable 5 cuesta $10 / $50 por 1M de tokens y está incluido de forma permanente en Claude Max y Team Premium con en torno al 50 % de los límites de uso habituales. La traducción es una cuestión aparte con un ganador aparte, que trabajamos en nuestra guía de la mejor IA para traducir.

ModeloMejor paraFortalezaDebilidadPrecio (por 1M de tokens)
Claude Fable 5.1Mejor escritura en general#2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) y #6 escritura creativa de Arena, la mejor colocación combinada de todosNo lidera ninguno de los tres en solitario; Claude Opus 5.5 se llevó el Intelligence Index y Humanity's Last Exam el 22 de septiembre$10 / $50
Claude Fable 5Encabeza los tableros de votos humanos de Arena#1 Arena texto en general (1505,7), #1 LiveBench Language (90.7), #8 EQ-BenchLa opción más cara aquí$10 / $50
Kimi K3Ficción creativa y voz#4 EQ-Bench Creative Writing (2070.6)Solo #27 en Arena escritura creativa$3 / $15
Claude Sonnet 5Escritura gratuita para el día a díaGratis y por defecto en claude.ai, contexto 1M#53 Arena escritura creativa; 75,0 LiveBench Language$2 / $10, ahora permanente
Claude Opus 5Entregables profesionales ajustados de precio#2 GDPval-AA v2.1 con 1708, por delante de Fable 5 (1632)Por detrás de Fable 5 en Arena texto, por detrás de Fable 5.1 en GDPval-AA v2.1$5 / $25
GPT-5.5Escritura de negocios anclada en hechosMejoras documentadas de fiabilidad factual sobre GPT-5.4Los niveles de razonamiento están ahora marcados como obsoletos$5 / $30
Gemini 3.8 FlashBorradores en volumen a escalaIntelligence Index 40,9, 308,4 tok/s de salida, contexto 1MAjustado a agentes más que a prosa; el precio introductorio se duplica el 1 de enero de 2027$0.75 / $3.75
Segundo puesto y alternativas: Claude Fable 5 es el segundo y la elección si ponderas los votos humanos de Arena, Kimi K3 es la elección para la ficción con voz propia, aunque ahora es cuarto en EQ-Bench, Claude Sonnet 5 es la elección de valor y la que usar si no pagas, Claude Opus 5 es la opción más barata para entregables profesionales, y Gemini 3.8 Flash es la elección para redactar en volumen.
Qué cambió este mes

La corona de escritura se queda con Claude Fable 5.1, pero su fundamento ha cambiado. Claude Opus 5.5 le quitó el Intelligence Index y Humanity's Last Exam el 22 de septiembre, que era justo lo que citaba esta tarjeta, así que hemos vuelto a fundamentar la elección en los tableros que miden prosa de verdad. En ellos, Fable 5.1 es el único modelo entre los seis primeros de los tres: segundo en EQ-Bench Creative Writing, segundo en LiveBench Language y sexto en el tablero de escritura creativa de Arena. Opus 5.5 está sin valorar en dos de los tres y es octavo en el otro, así que todavía no tiene argumento en escritura. Arena ya ha valorado a Fable 5.1, lo que elimina la salvedad que arrastrábamos el mes pasado de que los tableros de preferencia humana no se habían pronunciado: es quinto en el tablero de texto con 1498,5, donde Claude Fable 5 sigue liderando con 1505,7. GDPval-AA v2.1 se volvió a reanclar y ahora marca 1846 para Opus 5.5, 1735 para Fable 5.1 y 1708 para Opus 5, así que las cifras de este bloque quedan muy por debajo de las que citábamos en agosto.

Elección de categoría, septiembre de 2026

Mejor IA para chat & asistente diario

1
GPT-5.6
Por defecto de ChatGPT
2
Claude Fable 5
El mejor valorado
3
Claude Opus 5
Profundidad reflexiva

La mejor IA para el chat del día a día es GPT-5.6, y la razón honesta es el alcance en lugar de la posición en los tableros. Es el modelo que ChatGPT sirve por defecto a la mayor base de usuarios de la categoría, lo que lo convierte en el mejor asistente que la mayoría de la gente puede abrir de verdad. En preferencia humana pura no es el líder: GPT-5.6 Sol se sitúa #18 en la tabla de texto de Arena con 1483,5, donde Claude Fable 5 lidera con 1505,7. La mayoría de los usuarios de ChatGPT reciben el nivel equilibrado Terra, que OpenAI dice que iguala a GPT-5.5 y, desde el recorte de precios del 30 de julio de 2026, cuesta un 60 % menos. Está disponible dentro de ChatGPT (gratis con límites, Plus a $20/mes, Pro a $100/mes), a través de la API (los niveles de la 5.6: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), y empaquetado dentro de Fello AI junto a Claude, Gemini, Grok y DeepSeek. Una advertencia: la system card de OpenAI y el evaluador METR señalaron un comportamiento de «scheming» elevado en Sol, así que GPT-5.5 Instant sigue siendo la elección más segura para trabajo sensible a las alucinaciones.

ModeloMejor paraFortalezaDebilidadPrecio
GPT-5.6Chat diario, por defecto de ChatGPTEl asistente que la mayoría puede abrir; Terra iguala a GPT-5.5 a ~mitad de coste#14 en Arena texto; scheming señalado por METRGratis / $20/mes Plus; API $0.20 / $1.20 a $4 / $20
Claude Fable 5La conversación mejor valorada#1 en Arena texto general (1505,7) y en cuatro de sus ocho subcategoríasSin plan gratuito; acceso por créditos de uso en Pro$10 / $50 API
Claude Opus 5Respuestas reflexivas y matizadasTercero en el Intelligence Index de Artificial Analysis (50,8), por detrás de Claude Fable 5.1 y GPT-6 Astra#10 en Arena texto, por detrás de Claude Fable 5$20/mes Pro, $5 / $25 API
GPT-5.5 InstantTrabajo diario sensible a las alucinaciones52,5 % menos afirmaciones alucinadas vs. 5.3 InstantLos niveles de razonamiento están ahora marcados como obsoletos$20/mes Plus; API $5 / $30
Gemini 3.6 FlashRápido, gratis, multimodalSigue siendo el modelo que sirve el nivel gratuito de Gemini, contexto 1M, #12 en Arena textoMás flojo en el razonamiento más difícil; 3.8 Flash lo supera al mismo precioGratis / $0.75 / $3.75 API
Fello AITodos los mejores modelos, una appChatGPT + Claude + Gemini + Grok + DeepSeek y más en Mac, iPhone y iPadEnrutado por la app, no directo$9.99/mes
Segundo puesto y alternativas: Claude Fable 5 es el segundo y el verdadero líder de preferencia, Claude Opus 5 es el segundo para uso diario reflexivo, Gemini 3.6 Flash es el segundo para rápido y gratis, y Grok 4.6 es la elección de nicho para días de noticias en vivo. Fello AI es la elección natural si quieres los mejores modelos en una app de Mac e iOS por $9.99/mes en lugar de hacer malabares con suscripciones.
Qué cambió este mes

GPT-5.6 conserva la elección de chat por alcance, y la distancia con el líder de preferencia ha vuelto a ampliarse. Sol está ahora en el puesto 18 del tablero de texto de Arena con 1483,5, desde el 14, mientras que Claude Fable 5 lidera con 1505,7. Nada ha cambiado en el producto, así que la corona no se mueve: sigue tratándose de qué asistente puede abrir de verdad más gente. Dos lanzamientos que de otro modo serían candidatos no lo son: GPT-6 Astra llegó a ChatGPT Business, Pro y Plus a principios de septiembre pero OpenAI no ha anunciado nada para el nivel gratuito, y Claude Opus 5.5, que se llevó el Intelligence Index el 22 de septiembre, es un modelo para la API y para los planes de Claude, no un asistente por defecto para mil millones de personas. OpenAI lanzó GPT-6 Sol y GPT-6 Luna el 22 de septiembre y los puso en ChatGPT Work y Codex, diciendo sin rodeos que todavía no están en Chat, así que la ventana en la que escribe la mayoría sigue con GPT-5.6.

Elección de categoría, septiembre de 2026

Mejor IA para imágenes

1
ChatGPT Images 2.5
Texto en imágenes
2
MAI-Image-2.6
#1 edición AA
3
Muse Image
Ecosistema Meta AI

La mejor IA para generar imágenes es ChatGPT Images 2.5, que OpenAI convirtió en predeterminada en todos los planes de ChatGPT el 8 de septiembre y que ahora lidera los cuatro tableros de imagen que seguimos. Sus dos modelos quedan primero y segundo en cada uno: GPT-Image-2.5 Sunburst, construido para la precisión, lidera Arena texto a imagen con 1423,2 y Arena edición de imágenes con 1526,0, y también el Elo de calidad de Artificial Analysis con 1196,8 y su tablero de edición con 1221,3, con el más rápido GPT-Image-2.5 Flare segundo en los cuatro. Es un cambio respecto al mes pasado, cuando Artificial Analysis no había valorado ninguno de los dos y sus tableros contradecían a los de Arena. Aun así, lee la distancia entre Sunburst y Flare como provisional, porque esas posiciones en Arena se apoyan en unos pocos miles de votos cada una frente a los 83.000 y 259.000 de GPT Image 2, y en texto a imagen ambos comparten banda de posición. El segundo es MAI-Image-2.6, tercero en el tablero de edición de Artificial Analysis con 1191,6 y cuarto en el de texto a imagen de Arena con 1334,0, con Muse Image de Meta en tercer lugar. Reve 2.1 mantiene su argumento de maquetación, tipografía y 4K nativo pero ha dejado el podio: es sexto en Arena texto a imagen y decimocuarto en Arena edición de imágenes. Nuestro análisis completo de lo que salió está en ChatGPT Images 2.5.

ModeloMejor paraFortalezaDebilidadPrecio
ChatGPT Images 2.5Imágenes con texto legible#1 y #2 en los cuatro tableros: Arena texto a imagen (1423,2 / 1401,3), Arena edición (1526,0 / 1481,8), calidad de Artificial Analysis (1196,8 / 1190,4) y edición (1221,3 / 1207,0)Las posiciones en Arena se apoyan en unos pocos miles de votosPredeterminado en todos los planes de ChatGPT
MAI-Image-2.6Editar una imagen que ya tienes#3 en edición de imágenes de Artificial Analysis (1191,6) y #4 en Arena texto a imagen (1334,0)Vista previa pública, aún no en Copilot ni en Bing; perdió el liderato de edición de Artificial Analysis ante ChatGPT Images 2.5MAI Playground / Microsoft Foundry
Muse ImageEdición de imágenes, ecosistema Meta#5 en edición de imágenes de Artificial Analysis (1171,3) y #7 en su Elo de calidadNuevo, con poco utillaje alrededorApp de Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Retratos y productos fotorrealistas#4 en texto a imagen de Artificial Analysis, por delante de Nano Banana Pro en el de ArenaEn la edición de imágenes de Arena, Nano Banana Pro va por delanteAplicación Gemini / AI Studio
Seedream 5.0 ProTexto multilingüe + edición por regiones10+ idiomas incl. árabe RTL, edición con lazo y capasEn torno al décimo puesto en los tableros independientes; incertidumbre de derechos de autorBytePlus / Magnific
Midjourney v8Arte estilizado, ilustraciónBase estética que la mayoría de los artistas prefierenMás flojo en texto dentro de la imagen$10-$120/mes
Grok ImagineNSFW / modo SpicyLos límites más permisivos; Arena sitúa su modelo Image 2.0 en el #5 de texto a imagen y en el #4 de edición, y Artificial Analysis lo tiene ahora en el #4 del Elo de calidadNada en el registro de lanzamientos muestra que Image 2.0 saliera como producto$30 al mes SuperGrok
Segundo puesto y alternativas: MAI-Image-2.6 es el segundo en general y la elección para editar una imagen que ya tienes, Muse Image es el tercero y la elección dentro de las aplicaciones de Meta, y Nano Banana 2 sigue siendo la elección fotorrealista. Reve 2.1 sigue siendo la elección para diseño, tipografía y 4K nativo aunque haya abandonado el podio. Grok Imagine sigue siendo el único modelo frontier que permite contenido para adultos en Spicy Mode, y Arena sitúa ahora su modelo Image 2.0 quinto en texto a imagen y cuarto en edición de imágenes.
Qué cambió este mes

ChatGPT Images 2.5 conserva la corona de imagen y su argumento se ha reforzado. El mes pasado Artificial Analysis no había valorado ninguno de sus dos modelos de API, así que los tableros que seguimos se contradecían: Arena tenía a Sunburst y Flare primero y segundo mientras Artificial Analysis seguía con GPT Image 2 en cabeza de texto a imagen y con MAI-Image-2.6 de Microsoft en cabeza de edición. Artificial Analysis ya ha valorado a los dos, y allí también quedan primero y segundo, 1196,8 y 1190,4 en el Elo de calidad y 1221,3 y 1207,0 en edición de imágenes. Con eso es #1 y #2 en los cuatro tableros. MAI-Image-2.6 sigue siendo el segundo pero baja al tercer puesto del tablero de edición que antes lideraba, y Grok Imagine Image 2.0 es ahora cuarto en el Elo de calidad de Artificial Analysis y cuarto en el tablero de edición de Arena, mejor posición que el tercer puesto del podio; lo seguimos reportando en vez de coronarlo, porque nada en el registro de lanzamientos muestra que haya salido como producto.

Elección de categoría, septiembre de 2026

Mejor IA para vídeo

1
Gemini Omni 1.1 Flash
#1 Arena texto a vídeo
2
MiniMax H3
2K + audio nativo
3
Dreamina Seedance 2.0
El rival más cercano

La mejor IA para generar vídeo es Gemini Omni 1.1 Flash, que Google lanzó el 27 de agosto y que lidera el tablero de texto a vídeo de Arena con 1516, justo por delante de su propio predecesor Gemini Omni Flash con 1513. Léelo como un empate: los dos caen dentro de los intervalos de confianza del otro y la propia Arena le da a 1.1 Flash una banda de posición de uno a cuatro. Lo que lo rompe es la especificación, donde 1.1 Flash es claramente el modelo más capaz: extensión de escena en tramos de 10 segundos hasta 40 segundos acumulados, control del primer y último fotograma, referencias de vídeo, borradores a 360p y salida a 1080p o 4K, a unos $0,03 por segundo en 360p, $0,10 en 720p, $0,15 en 1080p y $0,30 en 4K. Gemini Omni Flash sigue siendo la opción más barata, en torno a $0,10 por segundo, pero se queda en clips de 10 segundos. Dos límites que conviene saber. Artificial Analysis no ha valorado 1.1 Flash en absoluto; en su tablero de texto a vídeo lidera el más antiguo Omni Flash con 1512,8 por delante del Wan 3.0 de Alibaba con 1431,4 y de MiniMax H3 con 1407,7. Y en el tablero de imagen a vídeo de Arena 1.1 Flash es segundo con 1488,5 por detrás de MiniMax H3 con 1495,4, así que la corona se apoya en texto a vídeo y en la especificación, no en un barrido. Si necesitas tomas más largas dentro de las herramientas de Google, Veo 3.1 sigue funcionando en la app de Gemini, en AI Studio y en Vertex AI con audio nativo y salida a 1080p. MiniMax H3 (31 de julio) sigue siendo el rival en especificación, con clips en 2K de 4 a 15 segundos y audio estéreo nativo desde $0,13 por segundo.

ModeloMejor paraFortalezaDebilidadPrecio
Gemini Omni 1.1 FlashMejor vídeo con IA en general#1 Arena texto a vídeo (1516); extensión de escena a 40 segundos, salida en 4KSin valorar por Artificial Analysis; segundo tras MiniMax H3 en Arena imagen a vídeo$0,03-$0,30/s; Gemini API / AI Studio / Flow
Gemini Omni FlashClips de diez segundos más baratos#2 Arena texto a vídeo (1511), #2 vídeo de AA (1238); edición conversacionalSe queda en generaciones de diez segundos~$0.10/s; app Gemini / AI Studio
Wan 3.0Vídeo a partir de documentos y diapositivas#1 en el tablero de vídeo de Artificial Analysis (1239); 2-30 s, hasta 1080p, entrada Omni-ReferenceSolo API, sin pesos publicados; #3 en Arena$0.05-$0.20/s
MiniMax H3Clips 2K con audio nativo4-15 s en 2K, audio estéreo nativo; #8 Arena texto a vídeo (1462)#4 en vídeo de AA (1227); los pesos abiertos excluyen el escalador 2K y exigen solicitud en EE. UU., la UE, el Reino Unido y Corea del Sur$0.13/s en 2K
Dreamina Seedance 2.5Aspirante de ByteDance#6 Arena texto a vídeo (1482); lidera imagen a vídeo con audioEcosistema ByteDance, acceso occidental limitadoDreamina / BytePlus
Muse VideoVídeo en el ecosistema Meta#3 texto a vídeo con 1459El más nuevo del grupo, herramientas escasasAplicación Meta AI
Veo 3.1Clips de producción más largosAudio nativo, 1080p, fuerte consistencia física#6 en Arena vídeo, no el líder de calidadGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboIteración rápida a menor coste4K nativo, 60fps, clips de 15 segundos; Turbo salió el 17 de junioFuera del top 16 en Arena texto a vídeoDesde $10/mes
Luma Ray 3Escenas fotorrealistasFuerte realismo para paisajesComunidad más pequeñaGratis / desde $9.99/mes
Segundo puesto y alternativas: MiniMax H3 es el segundo y ahora lidera el tablero de imagen a vídeo de Arena con 1495,4, por delante de Gemini Omni 1.1 Flash con 1488,5. Dreamina Seedance 2.0 es tercero y sigue siendo la elección para imagen a vídeo con audio. Veo 3.1 es la elección cuando 10 segundos no bastan, y el Wan 3.0 de Alibaba el que usar cuando el material de partida es un documento, una hoja de cálculo o una presentación. OpenAI retiró la app de consumo de Sora 2 el 26 de abril de 2026 y solo queda la API para desarrolladores, hasta el 24 de septiembre de 2026. Seguimos las fechas de retirada de los modelos antiguos de todos los proveedores en una lista aparte en curso.
Qué cambió este mes

Gemini Omni 1.1 Flash conserva la corona de vídeo, pero el panorama a su alrededor es más enredado de lo que daba a entender la entrada del mes pasado. Sigue liderando el tablero de texto a vídeo de Arena, 1516 frente a los 1513 de Gemini Omni Flash, y Arena le da una banda de posición de uno a cuatro, así que sigue siendo un empate resuelto por capacidad. Dos cosas que contamos en agosto han cambiado. Artificial Analysis reancló su Elo de vídeo y el viejo trío 1239 / 1238 / 1235 ya no existe: Gemini Omni Flash lidera ahora ese tablero con 1512,8 por delante de Wan 3.0 con 1431,4 y de MiniMax H3 con 1407,7, y Artificial Analysis sigue sin valorar 1.1 Flash en absoluto. Y MiniMax H3 se ha puesto en cabeza del tablero de imagen a vídeo de Arena con 1495,4, empujando a 1.1 Flash al segundo puesto con 1488,5, el primer tablero que pierde esta corona.

Elección de categoría, septiembre de 2026

Mejor IA para programación

1
Claude Opus 5.5
Lidera todos los harnesses
2
GPT-6 Astra
Los dos tableros de programación de Arena
3
Claude Fable 5.1
Segundo en los harnesses

La mejor IA para programar es Claude Opus 5.5, que Anthropic lanzó el 22 de septiembre y que lidera todos los harnesses de programación que seguimos: la propia ejecución de Terminal-Bench 4.0 de Artificial Analysis con 59,6 % frente al 59,1 % de GPT-6 Astra, LiveBench Coding con 89,3 frente a 80,4 y LiveBench Agentic Coding con 71,7 frente a 57,3. Lo hace a $4 / $20 por 1M de tokens, menos de la mitad del precio de lista de los dos modelos que encabezaban esta tabla el mes pasado, con lecturas de caché a $0,20, y según las pruebas de la propia Anthropic una carga de trabajo típica cuesta un 40 % menos que en Claude Opus 5. La ejecución interna de Terminal-Bench 4.0 de Anthropic amplía aún más la distancia, 66,4 % frente al 57,9 % que OpenAI reporta para Astra, junto a un 54,4 % en FrontierCode v1.1 y un 57,8 % en CursorBench 4.0. GPT-6 Astra conserva los dos tableros de programación de Arena, WebDev con 1793 e imagen a WebDev con 1733, porque Opus 5.5 todavía no tiene ni un voto en Arena, y ese es el reparto honesto aquí: OpenAI lidera en preferencia humana, Anthropic en todos los harnesses medidos. Lea con cuidado el margen de medio punto en Terminal-Bench, porque la propia Anthropic reporta un error estándar de unos 2,6 puntos en ese benchmark, así que trátelos como iguales ahí y deje que decidan los tableros de LiveBench y el precio. Claude Fable 5.1 es segundo en los dos tableros de Arena y tercero en los harnesses. El Qwen3.8-Max-0902 de Alibaba mantuvo el tablero WebDev de Arena unos tres días a principios de septiembre y ahora es quinto con 1662. Entre los pesos abiertos el panorama cambió el 21 de septiembre: el MiMo-V2.6-Pro de Xiaomi logra un 34,8 % en Terminal-Bench 4.0 bajo MIT puro a $0,13 por tarea del índice, mientras que GLM-5.3 sigue siendo el modelo abierto más fuerte en ese harness con un 41,9 % y Kimi K3 es el modelo abierto mejor situado en Arena WebDev, séptimo con 1658, con solo un 12,6 % en el harness. Artificial Analysis ha retirado tanto su Coding Index como su Coding Agent Index, así que las dos clasificaciones compuestas de programación que esta página citaba ya no existen.

ModeloMejor paraFortalezaDebilidadPrecio (por 1M de tokens)
Claude Opus 5.5Mejor programación en general#1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) y #1 LiveBench Coding (89,3)Aún sin votos en Arena, así que Astra conserva sus dos tableros de programación$4 / $20
GPT-6 AstraCima de los dos tableros de programación de Arena#1 Arena WebDev (1793) y #1 imagen a WebDev (1733); 59,1 % Terminal-Bench 4.02,5 veces el precio de Opus 5.5 y por detrás de él en todos los harnesses$10 / $50
Claude Fable 5.1Mayor puntuación compuesta antes de Opus 5.5#2 en los dos tableros de programación de Arena; Intelligence Index 53,4; AA-Briefcase 167852,0 % Terminal-Bench 4.0; 2,5 veces el precio de Opus 5.5$10 / $50
Claude Opus 5Sustituido por Opus 5.549,0 % Terminal-Bench 4.0 y #3 en los dos tableros de programación de ArenaCuesta más por token que Opus 5.5 y puntúa siete puntos menos$5 / $25
Claude Fable 5Trabajo agéntico más duro y de horizonte largoIntelligence Index 49,6; 42,4 % Terminal-Bench 4.0; contexto de 1MEl más caro por tarea del índice en esta tabla, $8,75; #6 en Arena imagen a WebDev$10 / $50
Qwen3.8-Max-0902Breve dueño del tablero WebDev de Arena#5 Code Arena: WebDev (1662); Intelligence Index 45,4; 2,4 billones de parámetros, contexto de 1MSolo API de QwenCloud, sin interfaz de consumo; perdió el liderato de WebDev en días$2 / $6
Kimi K3Modelo abierto mejor situado en Arena#7 Arena WebDev (1658), la mejor posición abierta en ese tablero; 2,8 billones/104.000 millones activosSolo 12,6 % en Terminal-Bench 4.0; 1,56 TB para alojarlo$3 / $15
GPT-5.6 SolEl buque insignia barato de OpenAIIntelligence Index 47,0; 39,9 % Terminal-Bench 4.0Sustituido por GPT-6 Sol, que puntúa más alto a mitad de precio; METR le señaló manipulación de evaluaciones$4 / $20
GPT-6 SolProgramación con GPT-6 barata en CodexIntelligence Index 47,5 (v4.3.2) y 43,9 % en Terminal-Bench 4.0, ambos por encima de GPT-5.6 Sol y a mitad de precioSin votos en Arena; solo en Codex y ChatGPT Work, no en Chat$2 / $10
Muse Spark 1.3Programación agéntica barataIntelligence Index 48,1 a $1,25 / $4,25 y $1,60 por tarea del índice33,3 % en Terminal-Bench 4.0; las victorias en programación salen del gráfico de la propia Meta, medido en una variante max solo para socios$1,25 / $4,25
Grok 4.7Programador barato con buena relación46,3 % CursorBench 4.0 y 71,0 % DeepSWE v1.1 según las cifras de la propia SpaceXAI; Intelligence Index 46,324,7 % en Terminal-Bench 4.0; los prompts de 200K tokens o más refacturan la petición entera al doble$2 / $6
Gemini 3.8 FlashProgramación agéntica a escalaIntelligence Index 40,9; 308,4 tokens de salida por segundo19,7 % en Terminal-Bench 4.0; el precio de lanzamiento se duplica el 1 de enero de 2027$0,75 / $3,75
GLM 5.3 FlashEl programador serio más barato que puedes alojar32,8 % Terminal-Bench 4.0 a $0,25 por tarea del índice; MIT, 320.000 millones/18.000 millones activosGLM-5.3 llega al 41,9 % en el mismo harness; sin producto de consumoPesos abiertos (MIT)
MiMo-V2.6-ProEl mayor Intelligence Index abierto46,3 en v4.3.2 y 34,8 % Terminal-Bench 4.0 a $0,13 por tarea del índice; MIT, 1,02 billones/42.000 millones activosPublicado el 21 de septiembre, así que aún no tiene votos en Arena ni historial independiente$0,435 / $0,87
Segundo puesto y alternativas: GPT-6 Astra es el segundo y sigue encabezando los dos tableros de programación de Arena, Claude Fable 5.1 es segundo en esos tableros y tercero en los harnesses, y a Claude Opus 5 lo sustituye ahora un modelo a la vez más barato y mejor. Entre los pesos abiertos, el MiMo-V2.6-Pro de Xiaomi es el nuevo líder en puntuación y en coste, GLM-5.3 es el más fuerte en el Terminal-Bench 4.0 de Artificial Analysis, Kimi K3 es el modelo abierto mejor situado en el tablero WebDev de Arena, y GLM 5.3 Flash es la elección para equipos que alojan el suyo, a $0,25 por tarea del índice bajo MIT puro. Dentro de los IDE, Cursor con Claude sigue siendo la pareja más popular y Claude Code es la elección natural si vives en la terminal.
Qué cambió este mes

La corona de programación pasó a Claude Opus 5.5, cuatro días después de pasar a GPT-6 Astra. Anthropic lo lanzó el 22 de septiembre y lidera todos los harnesses de programación que seguimos: 59,6 % frente al 59,1 % de Astra en la propia ejecución de Terminal-Bench 4.0 de Artificial Analysis, 89,3 frente a 80,4 en LiveBench Coding y 71,7 frente a 57,3 en LiveBench Agentic Coding, a $4 / $20 frente a $10 / $50. Astra conserva los dos tableros de programación de Arena porque Opus 5.5 todavía no tiene votos allí, así que esto es un reparto y no un barrido. El margen en Terminal-Bench es de medio punto frente a un error estándar que Anthropic sitúa en torno a 2,6, de modo que lo que decide de verdad son los tableros de LiveBench y el precio. Claude Opus 5 abandona el podio: Opus 5.5 cuesta menos por token, gasta menos tokens y puntúa siete puntos más en el Intelligence Index, lo que deja el viejo argumento de valor de Opus 5 no ya debilitado sino obsoleto. El MiMo-V2.6-Pro de Xiaomi y el Grok 4.7 de SpaceXAI entran en la tabla, y todas las cifras del índice en esta página se han movido a v4.3.2, por lo que quedan ligeramente por debajo de las del mes pasado. GPT-6 Sol entra en la tabla el mismo día a $2 / $10: Artificial Analysis lo mide en 47,5 en el índice y en un 43,9 % en Terminal-Bench 4.0, por encima de GPT-5.6 Sol en ambos y a mitad de precio, pero muy por detrás de Opus 5.5, y llega a los desarrolladores por Codex y no por la ventana de chat.

Elección de categoría, septiembre de 2026

Mejor IA para creatividad

1
Grok 4.7
Menos límites
2
Claude Fable 5
Prosa de máxima calidad
3
Kimi K3
Ficción y voz

La mejor IA para trabajo creativo sin filtros y a la última es Grok 4.7, y queremos ser exactos sobre por qué. Esta elección va de la línea de producto, no de la calidad de la prosa. Grok lleva las menores restricciones de contenido de cualquier modelo de frontera y la única integración nativa con X en tiempo real, lo que lo convierte en el único modelo que entra en encargos atrevidos, de actualidad o deliberadamente provocadores que los demás rechazan. Lea la disponibilidad con cuidado: SpaceXAI lanzó Grok 4.7 el 21 de septiembre en la API de Grok, Cursor, Grok Build, harnesses de terceros y routers en la nube, y su anuncio no dice nada de la app de consumo, que sigue sirviendo Grok 4.6 a los suscriptores de SuperGrok y X Premium+ por $30 al mes. No es el mejor escritor. Arena ya ha valorado a Grok 4.6 y ocupa el puesto 32 del tablero de escritura creativa, por delante de Grok 4.5 en el 36 pero por detrás del más antiguo Grok 4.20-beta1 en el 23. EQ-Bench no ha valorado ni 4.6 ni 4.7, y en ese tablero Grok 4.5 está en el puesto 46 con 1576,0, ahora justo por delante de Grok 4.20-beta en lugar de por detrás. Como SpaceXAI orientó ambos lanzamientos a programación y trabajo agéntico y no a la prosa, no damos por hecho que 4.7 haya movido nada aquí. Si eliges solo por calidad de salida, Claude Fable 5 sigue liderando el tablero de escritura creativa de Arena, mientras que EQ-Bench pone primero a GPT-6 Astra con 2163,9, segundo a Claude Fable 5.1 y cuarto a Kimi K3. Elige Grok por lo que te dejará hacer, no por lo bien que escribe.

ModeloMejor paraFortalezaDebilidadPrecio
Grok 4.7Sin filtros, con opinión, a la últimaMenos restricciones de contenido, anclaje nativo en X en tiempo realNingún tablero de escritura creativa lo ha valorado; Grok 4.6 está en el #32 de escritura creativa de Arena$2 / $6 API; app SuperGrok de $30 al mes, aún en 4.6
Claude Fable 5Prosa creativa de máxima calidad#1 Arena escritura creativa, #1 LiveBench LanguageLímites cautelosos ante encargos atrevidos$10 / $50 API
Kimi K3Ficción y voz propia#4 EQ-Bench Creative Writing con 2070,6Solo #27 en escritura creativa de Arena$3 / $15
Claude Opus 5Creatividad estructurada de formato largoMantiene hilos largos y se autoedita; Intelligence Index 50,8, por detrás de Claude Fable 5.1 y GPT-6 AstraEl más cauteloso del grupo$20/mes Pro; $5 / $25 API
Gemini 3.1 ProCreatividad multimodalFuerte cadena de texto, imagen y vídeoCuotas dentro de la aplicación de GeminiGratis / $2.00-$4.00 API entrada
Grok Imagine (Spicy Mode)NSFW / creatividad para adultosLa generación de imágenes más permisivaCaso de uso de nicho$30/mes SuperGrok
Segundo puesto y alternativas: Claude Fable 5 es el segundo y la elección correcta si la calidad importa más que la libertad, Kimi K3 es la elección para ficción, y Claude Opus 5 es la elección para proyectos creativos que se extienden a lo largo de muchos turnos. Para trabajo creativo para adultos, Grok Imagine Spicy Mode sigue siendo la única opción de nivel frontier.
Qué cambió este mes

Grok conserva esta elección, ahora con Grok 4.7, que SpaceXAI lanzó el 21 de septiembre sobre un modelo base nuevo y más grande. Nada ha cambiado en la permisividad del producto ni en su acceso en vivo a X, que es en lo que se apoya la elección. El modelo de debajo vuelve a ser más fuerte, 46,3 en el Intelligence Index frente al 44,3 de Grok 4.6, pero esa mejora cayó en programación y trabajo agéntico, no en prosa, y ningún tablero de escritura creativa ha valorado el 4.7. Una corrección respecto a la entrada del mes pasado: Arena ya ha valorado a Grok 4.6, que ocupa el puesto 32 de su tablero de escritura creativa, así que la frase de que ninguno de los dos tableros lo había valorado ya no se sostiene. Fíjate también en la disponibilidad partida, porque para esta categoría importa: el 4.7 está en la API, en Cursor y en Grok Build, mientras que la app de Grok de $30 al mes, que es de lo que va realmente el argumento de la permisividad, sigue sirviendo 4.6. Claude Fable 5 sigue siendo el modelo al que acudir cuando quieres la mejor escritura.

Elección de categoría, septiembre de 2026

Mejor IA para precisión & investigación

1
Claude Fable 5.1
Mayor precisión factual
2
Gemini 3.1 Pro
Mejor valor, $0,52/tarea
3
GPT-5.6 Sol
Razonamiento novedoso

La mejor IA para precisión e investigación es Claude Fable 5.1, que tiene la mayor precisión factual que ha medido Artificial Analysis, un 67 % en AA-Omniscience. Esa es exactamente la columna con la que se decide esta categoría, y superó una prueba dura el 22 de septiembre: Claude Opus 5.5 batió a Fable 5.1 en casi todo lo demás, incluidos Humanity's Last Exam con 61,4 % frente a 59,1 % y el índice AA-Omniscience penalizado por alucinaciones con 46,4 frente a 43,5, pero en precisión factual bruta marca 66 % frente al 67 % de Fable 5.1. Trata ese punto de diferencia por sí solo como un empate y lee los dos juntos: Opus 5.5 es la mejor apuesta cuando una respuesta equivocada es peor que ninguna, y Fable 5.1 cuando quieres acertar el mayor número de hechos. La elección por valor es Gemini 3.1 Pro, y sigue siendo a lo que acudiríamos cuando importa el coste. Su mejor resultado está en ARC-AGI-1 de ARC Prize, donde saca un 98 % e iguala al panel humano, y lo hace a $0,52 por tarea, aunque Claude Fable 5 y GPT-6 Astra ya han superado al panel con un 98,5 %. Lo combina con anclaje nativo en Google Search, que es lo que quieres cuando la respuesta tiene que ser actual y no solo plausible. También saca un 94,1 % en GPQA Diamond, donde GPT-5.6 Sol ahora lo iguala en lugar de quedarse atrás, y un 44,4 % en Humanity's Last Exam, y un 46,44 en el tablero HLE de Scale SEAL, que ahora lidera Claude Fable 5 con un 55,5 %. Dos salvedades honestas. En búsqueda anclada concretamente, el tablero de búsqueda de Arena lo lidera OpenAI y no Google ni Anthropic: GPT-5.6 Sol encabeza con 1257, con Claude Fable 5 quinto y Gemini 3.1 Pro con anclaje noveno. Y en razonamiento novedoso la corona está en otra parte por completo, porque GPT-6 Astra lidera tanto ARC-AGI-2 como ARC-AGI-3. No movimos esta corona a Claude Opus 5 porque Artificial Analysis mide su tasa de alucinación en el 50 % y lo sitúa muy por debajo de los dos modelos Fable en AA-Omniscience.

ModeloMejor paraBenchmark claveDebilidadPrecio
Claude Fable 5.1La mayor precisión factual medida67 % de precisión factual en AA-Omniscience, la mayor que ha medido Artificial Analysis, un punto por encima de Claude Opus 5.5Sin nivel barato; sin valorar en el tablero de búsqueda de Arena; Opus 5.5 lidera Humanity's Last Exam y el índice AA-Omniscience$10 / $50
Gemini 3.1 ProMejor valor, trabajo factual barato98 % ARC-AGI-1 (iguala al panel humano) a $0.52/tarea, 94,1 % GPQA (igualado por Sol)ARC-AGI-2 77,1 % ahora ~14º; #9 en Arena búsqueda$2.00-$4.00 / $12.00-$18.00 (escalonado)
Claude Fable 5Búsqueda anclada#5 en la tabla de búsqueda de Arena, por detrás de GPT-5.6 SolNingún nivel barato único$10 / $50 (Fable 5)
GPT-5.6 SolRazonamiento novedoso#3 ARC-AGI-2 con 92,5 %, por detrás de GPT-6 Astra (95 %) y Claude Opus 5.5 (93,3 %)Scheming señalado por METR$4 / $20
Claude Opus 5Los problemas inéditos más difíciles#1 ARC-AGI-3 con 30 %, ~3,75 veces el siguiente modelo (ARC Prize)Artificial Analysis mide una tasa de alucinación del 50 %$5 / $25
Qwen 3.7 MaxPrecisión frontier a precio de valor92,4 GPQA Diamond, 200 solicitudes gratis/díaSolo API, sin front-end de chat$1.25 / $3.75 promo; $2.50 / $7.50 lista
Claude Opus 4.6Honestidad bajo presión#1 en el tablero MASK de Scale SEAL con 96,28; Anthropic ocupa el top 5Reemplazado como buque insigniaModelo legacy de Anthropic
Segundo puesto y alternativas: Gemini 3.1 Pro es el segundo y la elección de valor a $0,52 por tarea con anclaje en Google Search, GPT-5.6 Sol es el segundo para razonamiento novedoso, Claude Opus 4.6 arrasa en el tablero de honestidad bajo presión, y Qwen 3.7 Max es la elección de valor en la frontera.
Qué cambió este mes

La corona de precisión se queda con Claude Fable 5.1, y se puso a prueba de verdad. Claude Opus 5.5 llegó el 22 de septiembre y se llevó Humanity's Last Exam con 61,4 % frente a 59,1 % y el índice AA-Omniscience penalizado por alucinaciones con 46,4 frente a 43,5, pero esta categoría se decide por la columna de precisión factual bruta y ahí Fable 5.1 sigue marcando 67 % frente al 66 % de Opus 5.5. Es un punto de diferencia, así que el bloque dice ya sin rodeos que los dos se reparten el asunto en lugar de fingir que Fable 5.1 barre: usa Opus 5.5 cuando una respuesta equivocada es peor que ninguna, y Fable 5.1 cuando quieres acertar el mayor número de hechos. Además, dos correcciones respecto a la entrada del mes pasado. Decía que GPT-5.6 Sol lideraba ARC-AGI-2 y que Claude Opus 5 lideraba ARC-AGI-3; GPT-6 Astra lidera los dos desde su lanzamiento del 3 de septiembre, como ya decía el bloque de resolución de problemas, y esa contradicción ha desaparecido. Y ARC-AGI-1 ha pasado por encima del panel humano: Claude Fable 5 y GPT-6 Astra sacan ambos un 98,5 % donde el panel de 2025 saca un 98 %, así que el 98 % de Gemini 3.1 Pro a $0,52 por tarea sigue siendo cierto y sigue siendo el argumento de valor, pero ya no es la cima de ese tablero. El otro movimiento del mes en precisión es GPT-6 Sol, y ocurre por debajo de la corona: Artificial Analysis mide su tasa de alucinación en el 60 % frente al 92 % de GPT-5.6 Sol, mientras la precisión factual pura baja del 59 % al 55 %, lo que eleva su índice AA-Omniscience de 22,0 a 27,1.

Elección de categoría, septiembre de 2026

Mejor IA para resolución de problemas

1
GPT-6 Astra
Líder en razonamiento
2
Claude Opus 5
Cadenas agénticas
3
GPT-5.6 Sol
Buque insignia STEM asequible

La mejor IA para resolver problemas difíciles es GPT-6 Astra, que le quitó a GPT-5.6 Sol los tableros de razonamiento a los pocos días de lanzarse. Lidera LiveBench Reasoning con 92,65 y ARC-AGI-2 con un 95 %, la puntuación más alta que nadie ha logrado frente al panel humano del 100 % de ese tablero, y es tercera en LiveBench Mathematics con 96,81 por detrás del 97,08 de Claude Opus 5.5 y del 97,01 de Claude Fable 5.1. También declara un 97,6 % en FrontierMath Tier 4 v2, una cifra que conviene leer junto a la revelación de Epoch AI de que OpenAI financió el benchmark y tiene acceso exclusivo a parte de él. El inconveniente es el precio y el alcance: $10 / $50 por 1M de tokens frente a los $4 / $20 de Sol, y requiere un plan de pago de ChatGPT. GPT-5.6 Sol es la alternativa de valor, tercero en ambos tableros de LiveBench con 96,20 y 91,65 y tercero en ARC-AGI-2 desde que Claude Opus 5.5 marcó 93,3 %. GPT-6 Sol cuesta la mitad, $2 / $10, y lo supera en el índice de Artificial Analysis, pero ningún tablero de razonamiento lo ha valorado todavía. Qwen 3.7 Max es la opción económica para problemas de competición con 97,1 en el índice HMMT de febrero de 2026 y 44,5 en Apex, con 200 consultas gratuitas al día. Claude Opus 5 sigue siendo la alternativa para cadenas largas de razonamiento agéntico, aunque Astra también le ha quitado ARC-AGI-3.

ModeloMejor paraBenchmark claveDebilidadPrecio
GPT-6 AstraMatemáticas, ciencia y razonamiento más duros#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Requiere un plan de pago de ChatGPT; 2,5 veces el precio de Sol$10 / $50
Claude Opus 5Cadenas largas de razonamiento agéntico#2 AA-Briefcase (1673) y #2 GDPval-AA v2.1 (1708); 30,2 % ARC-AGI-3Astra lidera ahora ARC-AGI-3; 50 % de tasa de alucinación$5 / $25
GPT-5.6 SolBuque insignia STEM asequible#3 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) y Reasoning (91,65)FrontierMath aún sin publicar; METR señaló comportamiento tramposo$100/mes ChatGPT Pro; API $4 / $20
GPT-6 SolEl mismo nivel a mitad de precioIntelligence Index 47,5 (v4.3.2) frente al 47,0 de GPT-5.6 Sol, a $1,06 por tarea del índice frente a $1,99Ni LiveBench ni ARC Prize lo han valorado, así que aquí no tiene ningún tablero$2 / $10
Qwen 3.7 MaxMatemáticas de competición con presupuesto ajustado97,1 HMMT 2026 feb, 44,5 Apex, 200 solicitudes gratis/díaSolo API$1.25 / $3.75 promo; $2.50 / $7.50 lista
Claude Fable 5Matemáticas dentro de un flujo de programación#1 en la subcategoría de matemáticas de Arena (1543), 96,0 LiveBench MathematicsLa opción más cara aquí$10 / $50
GLM 5.3 FlashResolución de problemas open-weightIntelligence Index 41,8 bajo MIT, casi ocho puntos por encima de GLM-5.2 con menos de la mitad de tamaño; 320B/18B activos, contexto 1MNecesita un servidor multi-GPU, no una estación de trabajo; GLM 5.3 puntúa más alto según las propias cifras de Z.ai y se puede descargar desde el 28 de agosto, pero con más del doble de tamaño y bajo una licencia propiaOpen weights (MIT)
Segundo puesto y alternativas: GPT-5.6 Sol es el segundo y la elección de valor a $4 / $20, Claude Opus 5 es la elección natural para razonamiento agéntico de cadena larga, Qwen 3.7 Max es la elección económica, y GLM 5.3 Flash es la elección open-weight. Nuestra guía específica sobre la mejor IA para matemáticas repasa el reparto tarea por tarea y las opciones gratuitas.
Qué cambió este mes

La corona de resolución de problemas pasó a GPT-6 Astra, que se llevó los tableros con los que se decide esta categoría a los pocos días de su lanzamiento del 3 de septiembre. Lidera LiveBench Reasoning con 92,65 frente al 91,65 de GPT-5.6 Sol, se lleva ARC-AGI-2 con un 95 % frente al 92,5 % de Sol y desplazó a Claude Opus 5 en ARC-AGI-3, donde su 62,7 % en el harness estándar supera el 30,2 % de Opus 5. Lee las cifras de ARC-AGI-3 con cuidado: ese tablero mide eficiencia de acción a nivel humano en entornos no vistos, no problemas resueltos, y el 98,6 % tan citado viene de un harness con adaptador de proveedor, no del estándar. Sol baja al tercer puesto en ambos tableros de LiveBench pero sigue siendo la alternativa de valor a $4 / $20 frente a los $10 / $50 de Astra, y LiveBench Mathematics ha cambiado de manos dos veces desde entonces, a Claude Fable 5.1 con 97,01 y el 22 de septiembre a Claude Opus 5.5 con 97,08. Después se movieron dos cosas. ARC Prize puntuó a Claude Opus 5.5 con un 93,3 % en ARC-AGI-2, lo que baja a GPT-5.6 Sol al tercer puesto de ese tablero, y el 22 de septiembre llegó GPT-6 Sol a $2 / $10, la mitad de lo que cuesta el nivel 5.6, con un Intelligence Index más alto pero todavía sin nota propia en LiveBench ni en ARC Prize.

Elección de categoría, septiembre de 2026

Mejor agente de IA

1
Gemini Spark
Reside en la nube
2
Claude Cowork
Reside en el escritorio
3
ChatGPT Codex
Agente de programación

El mejor agente de IA es Gemini Spark si lo quieres en la nube y Claude Cowork si lo quieres en tu escritorio. Son elecciones conjuntas, no un primero y un segundo: Spark corre en una VM de Google Cloud, así que sigue trabajando con el portátil cerrado, integrado con Gmail, Docs y, desde principios de septiembre, Google Fotos; Cowork corre en tu Mac o tu PC con Windows y maneja tus aplicaciones locales y tu pantalla. Ningún tablero independiente enfrenta a los dos productos, así que la elección va de dónde tiene que ocurrir el trabajo y no de quién puntúa más. El precio tampoco desempata ya: Spark llega ahora al nivel Google AI Pro de $19.99/mes en EE. UU. y en más de 160 países más, y Cowork se incluye sin coste adicional en todos los planes de pago de Claude desde $20/mes. ChatGPT Codex Mobile (14 de mayo) es la alternativa para el trabajo de agente de programación, y los agentes de navegador tipo OpenAI Operator para tareas web. Lee la comparativa completa de Gemini Spark y Claude Cowork.

AgenteMejor paraDónde se ejecutaFortalezaPrecio
Gemini SparkTareas en la nube 24/7, flujos de WorkspaceVM de Google Cloud (siempre activa)Primer agente 24/7 real, integración profunda con WorkspaceDesde $19.99/mes Google AI Pro
Claude CoworkEscritorio, manejo de apps, diseño + códigoTu escritorio Mac/WindowsManeja apps locales, ve tu pantalla$20/mes Claude Pro
ChatGPT Codex MobileAgente de programación en el móvilNube de OpenAI + iOS/AndroidAprobar diffs y redirigir el trabajo desde el móvilIncluido en los planes de ChatGPT
Grok Agentic (Grok 4.7)Investigación en tiempo real, scraping de XNube de SpaceXAIIntegración nativa con X; Elo 1695 en GDPval-AA v2.1, cuarto entre modelos distintos$30 al mes SuperGrok, aún en 4.6
OpenAI de clase OperatorTareas de navegador, formularios webNube de OpenAI + tu navegadorAutomatización webChatGPT Pro
Segundo puesto y alternativas: Gemini Spark y Claude Cowork son elecciones conjuntas separadas por dónde corre el agente, no un primero y un segundo. ChatGPT Codex Mobile es la elección para agentes de programación, y Grok Agentic es la elección de nicho para investigación en tiempo real. Google AI Ultra a $99.99 o $199.99 al mes compra ahora en Spark límites de uso más altos y no el acceso, que empieza en el nivel Pro de $19.99.
Qué cambió este mes

No ha salido ningún producto de agente de consumo nuevo, así que las coronas no se mueven: Gemini Spark (nube) y Claude Cowork (escritorio) siguen siendo elecciones conjuntas separadas por dónde corre el agente. Spark sí se amplió: llegó al plan Google AI Pro de $19,99 al mes y ganó Google Fotos, donde puede buscar, editar, curar y ejecutar flujos programados. La capa de modelos de debajo se movió mucho, y casi todo fue el 22 de septiembre. Claude Opus 5.5 lidera ahora los dos tableros agénticos que publica Artificial Analysis: AA-Briefcase v1.1 con 1822 frente a los 1678 de Claude Fable 5.1 y los 1673 de Claude Opus 5, y GDPval-AA v2.1 con 1846 frente a 1735 y 1708. Además iguala a GPT-6 Astra en Terminal-Bench 4.0 a $4 / $20 frente a $10 / $50, lo que lo convierte en el modelo sobre el que la mayoría de los equipos debería construir ahora, en lugar de la recomendación de Opus 5 que llevaba este bloque. La Agent Arena de Arena no lo ha valorado, y allí sigue liderando Claude Fable 5.1 la finalización de tareas con un 19,8 %, con GPT-6 Astra segundo con un 17,7 %, DeepSeek V4.1-Flash tercero y Claude Opus 5 cuarto. El otro movimiento es el Grok 4.7 de SpaceXAI (21 de septiembre): 1695 en GDPval-AA v2.1 y 1657 en AA-Briefcase lo colocan cuarto y séptimo, por encima de GPT-6 Astra en ambos, aunque llega a la API, a Cursor y a Grok Build y no a un producto de agente de consumo. El Muse Spark 1.3 de Meta queda quinto entre modelos distintos en GDPval-AA v2.1 con 1674, por debajo de Grok 4.7 y no por encima como informamos el mes pasado, y Scale SEAL sigue habiendo valorado solo el más antiguo 1.1, que lidera su tablero de uso de herramientas MCP Atlas con 88,1. GLM 5.3 Flash (26 de agosto, MIT) sigue siendo el modelo agéntico abierto que alojaríamos, con AutomationBench 48,8 en el gráfico de la propia Z.ai donde Claude Opus 4.8 saca 41,0; en la señal de finalización de tareas de la Agent Arena GLM-5.2 está decimoséptimo y Kimi K3 quinto, y el modelo abierto mejor situado es DeepSeek V4.1-Flash en tercer lugar.

Fello AI funcionando en Mac, iPhone y iPad
Todos los mejores modelos de IA, una app

Los modelos líderes como ChatGPT, Claude y Gemini, juntos en Mac, iPhone y iPad.

Gratis para empezar, 4,7★ en más de 27 000 reseñas.

Descargar Fello AI

Guía de uso, septiembre de 2026

Mejor IA para estudiantes

1
GPT-5.6 Luna
Ensayos & investigación
2
Gemini 3.6 Flash
STEM + PDF
3
Claude Sonnet 5
Escritura & edición

La mejor IA para estudiantes es GPT-5.6 Luna dentro de ChatGPT para trabajo de curso general y Gemini 3.6 Flash dentro de la aplicación de Gemini para STEM y estudio multimodal, con Qwen 3.7 Max como alternativa por API para conjuntos de problemas más difíciles (200 solicitudes gratis al día) y Claude Opus 5 como alternativa para editar ensayos. La mayoría de los estudiantes no necesita pagar, y el nivel gratuito mejoró el 6 de agosto: GPT-5.6 Luna pasó a ser el modelo por defecto de ChatGPT Free y Go, con chats de texto ilimitados y un botón Think para preguntas más difíciles, aunque las subidas de archivos y las herramientas de imagen siguen limitadas. El 22 de septiembre OpenAI añadió GPT-6 Luna para los usuarios de Free y Go en la app de escritorio de ChatGPT, un modelo de la generación actual en el nivel gratuito desde el primer día, aunque en el índice de Artificial Analysis saca los mismos 37,3 que GPT-5.6 Luna. Gemini 3.6 Flash sigue siendo lo que sirve la aplicación gratuita de Gemini, Claude Sonnet 5 es el Claude gratuito por defecto, y DeepSeek V4 es gratis en el sitio de chat de DeepSeek. Luna es el miembro más barato de la familia GPT-5.6, no el más fuerte, así que recurre al botón Think o cambia a GPT-5.5 cuando un ensayo necesite más cuidado. Para trabajar paso a paso las matemáticas más duras, GPT-5.6 Sol es el buque insignia de pago de OpenAI y GPT-6 Astra ahora declara un 97,6 % en FrontierMath Tier 4 v2 frente al 39,6 % verificado de GPT-5.5 Pro, aunque Astra todavía no está en el nivel gratuito de ChatGPT; Qwen 3.7 Max es la alternativa de valor con 97,1 en el índice HMMT de febrero de 2026 y precios de API de $1,25 / $3,75 en su promoción actual del 50 % ($2,50 / $7,50 de lista).

TareaMejor modeloPor qué¿Gratis?Alternativa
Ensayos & trabajo de cursoGPT-5.6 LunaPor defecto y gratis en ChatGPT desde el 6 de agosto; chats de texto ilimitados, y GPT-6 Luna en la app de escritorio desde el 22 de septiembreClaude Sonnet 5 (Claude gratis)
Resolución de problemas STEMGPT-5.6 Sol / Qwen 3.7 MaxBuque insignia STEM de pago; Astra declara 97,6 % en FrontierMath Tier 4 v2 / 97,1 HMMT feb 2026Pro de pago / Qwen API de pagoGemini 3.6 Flash (gratis)
Investigación & precisiónGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarea, anclaje nativo en Google SearchSí (aplicación Gemini)Claude Opus 5
Edición de escrituraClaude Sonnet 5Gratis y por defecto en claude.ai; Claude Fable 5 es el líder de calidadSí (Claude gratis)Claude Fable 5
Estudio multimodal (PDF, diapositivas, imágenes)Gemini 3.6 FlashContexto 1M, gratis en la aplicación de GeminiNotebookLM (Google)
Segundo puesto y alternativas: Claude Sonnet 5 (gratis) es el segundo para la escritura y edición de ensayos. Gemini 3.6 Flash (gratis) es el segundo para el estudio multimodal y la ingesta de PDF. DeepSeek V4 es el segundo para la resolución de problemas con un presupuesto estrictamente de coste cero.
Qué cambió este mes

El nivel gratuito es lo que se movió en esta guía. El 6 de agosto OpenAI convirtió GPT-5.6 Luna en el modelo por defecto de ChatGPT Free y Go y dio a ambos chats de texto ilimitados más un botón Think para preguntas más difíciles, así que la elección gratuita ahora es Luna en lugar de GPT-5.5, que sigue siendo seleccionable cuando un ensayo necesita más cuidado. Las subidas de archivos, las imágenes y otras herramientas siguen limitadas. En el lado de Google no se movió nada: Gemini 3.8 Flash salió el 2 de septiembre pero llega a los usuarios gratuitos solo a través de AI Studio y la API, así que la aplicación gratuita de Gemini sigue sirviendo 3.6 Flash y este conserva la fila multimodal. GPT-6 Astra (3 de septiembre) es el modelo a vigilar para conjuntos de problemas duros, con un 97,6 % declarado en FrontierMath Tier 4 v2 frente al 39,6 % verificado de GPT-5.5 Pro, pero requiere un plan de pago de ChatGPT y ningún nivel gratuito lo incluye. El nivel gratuito se movió otra vez el 22 de septiembre: los usuarios de Free y Go ya llegan a GPT-6 Luna en la app de escritorio de ChatGPT. Léelo como más barato y no como más listo, porque Artificial Analysis le da 37,3, a la par de la versión 5.6, y ARC Prize los separa por dos décimas de punto en ARC-AGI-2.

Guía de uso, septiembre de 2026

Mejor IA para el trabajo & profesionales

1
GPT-5.6
Trabajo de conocimiento diario
2
Claude Opus 5
Programación & escritura
3
Gemini 3.1 Pro
Investigación & informes

La mejor IA para el trabajo profesional es GPT-5.6 (por defecto de ChatGPT desde el 9 de julio) para el trabajo de conocimiento diario, Claude Opus 5 para programación y escritura de alto riesgo, y Gemini Spark para flujos agénticos 24/7. La mayoría de los profesionales sacan el máximo partido ejecutando dos suscripciones de pago (ChatGPT Plus a $20/mes más Claude Pro a $20/mes, un total de $40/mes), o consolidando con Fello AI a $9.99/mes para los cinco mejores modelos en una app de Mac/iOS. Para el trabajo agéntico que corre mientras duermes, Gemini Spark es el único agente en la nube 24/7 real, y desde el 30 de julio llega al nivel Google AI Pro de $19.99/mes además de a Google AI Ultra.

Caso de usoMejor modeloDato clavePrecioAlternativa
Trabajo de conocimiento diarioGPT-5.6Por defecto de ChatGPT desde el 9 de julio; el asistente que la mayoría puede abrir$20/mes ChatGPT PlusClaude Opus 5
ChatGPT Work y CodexGPT-6 SolEn ChatGPT Work y Codex para Plus, Pro, Business, Enterprise y Edu desde el 22 de septiembre, a $2 / $10 en la API$20/mes ChatGPT PlusGPT-6 Luna para trabajo de volumen
Programación (propietaria)Claude Opus 5.5#1 Terminal-Bench 4.0 (59,6 %) y #1 en los dos tableros de programación de LiveBench, a $4 / $20$20 al mes Claude ProGPT-6 Astra, que conserva los dos tableros de programación de Arena
Programación (rentable)Qwen3.8-Max-0902#5 en Code Arena: WebDev (1662), por detrás de GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 y el anterior Qwen3.8-Max; solo API en QwenCloud$2 / $6Qwen 3.7 Max; DeepSeek V4.1-Flash
Investigación & informesGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarea, anclaje de GoogleGoogle AI Pro / UltraClaude Opus 5
Matemáticas duras, física, modelado financieroGPT-6 Astra#1 LiveBench Reasoning y ARC-AGI-2 (95 %); declara 97,6 % en FrontierMath Tier 4 v2$100/mes ChatGPT ProGPT-5.6 Sol; Qwen 3.7 Max
Flujos de agente siempre activosGemini SparkPrimer agente en la nube 24/7Desde $19.99/mes Google AI ProClaude Cowork
Noticias en vivo, creatividad con contexto de XGrok 4.7Intelligence Index 46,3 + anclaje nativo en X; la app de Grok sigue sirviendo 4.6$30 al mes SuperGrokGemini 3.1 Pro
Consolidación todo en unoFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/mesPagar a cada proveedor por separado
Segundo puesto y alternativas: para la mayoría de los equipos profesionales, Claude Opus 5.5 es el segundo tras GPT-5.6 para el trabajo diario y a la vez el líder de programación en todos los harnesses a $4 / $20, con GPT-6 Astra como segundo en los tableros de programación que funcionan con votos humanos. Gemini 3.1 Pro es el segundo para puestos con mucha investigación, y Gemini Spark es la elección única si puedes poner un agente en la nube a trabajar en tareas largas.
Qué cambió este mes

Tres lanzamientos cayeron en los tres primeros días de septiembre y un cuarto el 22 de septiembre, y este último sí cambia el argumento de precio sobre el que se apoya este bloque. Claude Opus 5.5 encabeza el Intelligence Index de Artificial Analysis con 57,6 en v4.3.2 y sus dos tableros agénticos, y lo hace a $4 / $20 frente a los $5 / $25 de Claude Opus 5. El razonamiento que llevaba este bloque, que los equipos deberían empezar por Opus 5 porque cuesta la mitad que los modelos mejores, ya no se sostiene: Opus 5.5 es a la vez mejor y más barato, así que se lleva la fila de programación propietaria y es el modelo sobre el que construiríamos el trabajo diario. GPT-5.6 conserva igualmente la fila de asistente diario, porque esa fila va de alcance y no de puntuación, y ni Opus 5.5 ni GPT-6 Astra son la opción por defecto de cientos de millones de personas. El Qwen3.8-Max-0902 de Alibaba (2 de septiembre) mantiene la fila de programación rentable a $2 / $6, aunque solo está en la API de QwenCloud sin interfaz de consumo. GPT-6 Sol y GPT-6 Luna aterrizaron el 22 de septiembre justo en la superficie de la que trata este bloque: ChatGPT Work y Codex, para Plus, Pro, Business, Enterprise y Edu, a $2 / $10 y $0,10 / $0,50 en la API, y no en la ventana de chat corriente.

Comparativa de precios

Precios de los modelos de IA en septiembre de 2026

Desde niveles gratuitos de $0 hasta Google AI Ultra a $199,99 al mes. El precio más consecuente de esta tabla es Claude Opus 5.5 a $4 / $20, porque el 22 de septiembre Anthropic lanzó el modelo con la puntuación más alta que ha medido cualquier evaluador independiente a un precio de lista menor que el modelo al que sustituye: Claude Opus 5 cuesta $5 / $25, y las lecturas de caché bajan un 60 % hasta $0,20, con la cifra de la propia Anthropic situando una carga de trabajo típica un 40 % más barata que en Opus 5. Eso invierte la forma que ha tenido esta sección todo el año, en la que el mejor modelo era también el más caro. Claude Fable 5.1 y GPT-6 Astra están los dos a $10 / $50 y los dos puntúan ahora por debajo. El Muse Spark 1.3 de Meta cuesta $1,25 / $4,25, sin cambios a lo largo de tres saltos de capacidad desde julio, con un nivel Contributor a $0,10 / $0,20 para quien acepte que Meta entrene con sus prompts, y tanto Grok 4.6 como Grok 4.7 están a $2 / $6, con la salvedad de que un prompt de 200.000 tokens o más refactura la petición entera a $4 / $12. Grok 4.7 es el caso más claro de esta página de un precio que no se movió mientras el coste sí: los tokens cuestan lo mismo y una tarea del Intelligence Index cuesta $2,73 frente a los $1,86 de Grok 4.6, porque 4.7 emite alrededor del doble de salida para llegar ahí. El extremo barato se ha movido dos veces. DeepSeek subió los dos modelos V4 unas cuatro veces el 16 de agosto, lo que le costó a V4-Flash la elección por relación calidad-precio, y luego lo revirtió en buena parte el 10 de septiembre: V4-Flash se retiró y V4.1-Flash ocupó su lugar a $0,15 / $0,60 fuera de pico y $0,30 / $1,20 en pico. Entre los modelos que se compran por tokens la elección sigue siendo GLM 5.3 Flash, ahora a su precio de lista simple de $0,15 / $0,50 desde que la promoción de lanzamiento caducó el 9 de septiembre, porque Artificial Analysis lo mide en $0,25 por tarea del Intelligence Index con una puntuación de 41,8 frente a los $0,27 de DeepSeek con 39,5. Fuera de pico los dos están igualados en entrada y GLM es más barato en salida; en pico GLM gana en ambas. Un modelo abierto los bate a los dos en coste por tarea y tiene cuatro días: el MiMo-V2.6-Pro de Xiaomi resuelve una tarea del índice por $0,13 con una puntuación de 46,3 bajo MIT puro, pero hay que alojar 1,02 billones de parámetros para conseguirlo. En la frontera la elección por valor es el Muse Spark 1.3 de Meta, a $1,60 por tarea del índice con 48,1. Entre los modelos cerrados GPT-6 Luna se llevó ese título el 22 de septiembre, a $0,10 / $0,50 por token y $0,07 por tarea del índice, lo más barato por tarea de toda esta página; GPT-6 Sol cayó igual, de $4 / $20 a $2 / $10, justo sobre la tarifa de Claude Sonnet 5, y OpenAI dice que ambos recortes son permanentes y no promocionales. Para un desglose más profundo, consulta nuestra guía completa de comparación de precios de IA.

ModeloEntrada (por 1M)Salida (por 1M)Contexto¿Acceso gratis?
GPT-6 Astra$10.00$50.001 050 000 (entrada máx. 922 000)En Chat en Pro, Business y Enterprise desde el 4 de septiembre; Plus lo tiene en ChatGPT Work y Codex, no en Chat; sin plan gratuito; activo en la API
GPT-6 Sol$2.00$10.001 050 000 (entrada máx. 922 000)ChatGPT Work y Codex en Plus, Pro, Business, Enterprise y Edu desde el 22 de septiembre; API; no en Chat
GPT-6 Luna$0.10$0.501 050 000 (entrada máx. 922 000)Free y Go en la app de escritorio de ChatGPT; ChatGPT Work y Codex en planes de pago; API; no en Chat
GPT-5.5$5.00$30.001M (400K en Codex)ChatGPT Free; API de pago
GPT-5.5 Pro$30.00$180.001MChatGPT Pro desde $100/mes (nivel de mayor uso a $200)
GPT-5.6 Sol$4.00$20.00No publicadoEn vivo en ChatGPT, Codex & API (9 de julio); tarifa promocional al menos hasta el 21 de noviembre de 2026
GPT-5.6 Terra$2.00$12.00No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
GPT-5.6 Luna$0.20$1.20No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
Claude Opus 5.5$4.00$20.001MClaude Pro/Max/Team; API de pago; lecturas de caché $0,20
Claude Opus 5$5.00$25.001MPor defecto en Claude Pro/Max; API de pago
Claude Opus 4.8$5.00$25.001MModelo legacy en Anthropic; Pro/Max/API
Claude Fable 5.1$10.00$50.001MLecturas de caché $0.25; en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos. Mythos 5.1 factura igual, solo por invitación
Claude Fable 5$10.00$50.001MPermanente en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos
Claude Sonnet 5$2.00$10.001MPor defecto en Claude Free & Pro; API de pago
Claude Sonnet 4.6$3.00$15.001MAPI de pago (reemplazado por Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MAplicación Gemini limitada; API de pago
Gemini 3.8 Flash$0.75 introductorio / $1.50 desde el 1/1/2027$3.75 introductorio / $7.50 desde el 1/1/20271MAI Studio, Antigravity, Gemini Enterprise + API de pago; en la aplicación de Gemini reportado para AI Pro/Ultra
Gemini 3.7 Flash$0.75 introductorio / $1.50 desde el 1/1/2027$3.75 introductorio / $7.50 desde el 1/1/20271MAI Studio, Android Studio, Antigravity + API de pago; en la aplicación de Gemini solo vía Spark (AI Pro/Ultra, excluye EEE/RU/CH/Nigeria)
Gemini 3.6 Flash$0.75 introductorio / $1.50 desde el 1/1/2027$3.75 introductorio / $7.50 desde el 1/1/20271MModelo por defecto de la app gratuita de Gemini; AI Studio; nivel gratuito de API + API de pago
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; nivel gratuito de API + API de pago
Qwen3.8-Max-0902$2.00 ($0.17 cache hit explícito, $0.25 implícito)$6.001M (salida de 128K)Solo API de QwenCloud; sin chat de consumo, sin pesos abiertos
Qwen 3.7 Max$1.25 promo / $2.50 lista$3.75 promo / $7.50 lista1M200 solicitudes gratis/día; API de pago más allá
MiniMax M3$0.30 (50 % de descuento sobre $0.60)$1.20 (≤512K)1MOpen weights; se aplican costes de alojamiento
LongCat-2.0Depende del proveedorDepende del proveedor1MOpen weights (MIT); se aplican costes de alojamiento
NVIDIA Nemotron 3 UltraDepende del proveedorDepende del proveedor1MOpen weights (OpenMDW); se aplican costes de alojamiento
Qwen 3.5 (open-weight)Autoalojado / TogetherAutoalojado / Together1MOpen weights; se aplican costes de alojamiento
Nex-N2-ProAutoalojado / proveedoresAutoalojado / proveedores1MOpen weights (Apache 2.0); se aplican costes de alojamiento
Rio 3.5 Open 397BAutoalojado / proveedoresAutoalojado / proveedores1MOpen weights (MIT); se aplican costes de alojamiento
Grok 4.3$1.25$2.501MPlan de consumo gratuito; API de pago
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI de SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Grok 4.7$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI de SpaceXAI, Cursor, Grok Build, harnesses y routers en la nube; no en la app de Grok
Muse Spark 1.3$1.25 ($0.10 nivel Contributor)$4.25 ($0.20 nivel Contributor)1MAPI de pago; Muse Code, Meta Model API y OpenRouter; el nivel Contributor cambia derechos de entrenamiento por un ~92 % de descuento
Kimi K3$3.00 ($0.30 cache-hit)$15.001MNivel básico gratuito en la aplicación de Kimi; open weights en Hugging Face (Kimi K3 License)
Gemini Omni Flash (vídeo)$1.50$17.50 (salida de vídeo)Clips de 10 segundosAplicación Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 en valle / $1.32 en punta ($0.022 cache-hit en valle)$1.98 en valle / $3.96 en punta1MDeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto
DeepSeek V4.1-Flash$0.15 en valle / $0.30 en punta ($0.003 acierto de caché en valle)$0.60 en valle / $1.20 en punta1MDeepSeek Chat gratis; API de pago, tarifas de valle y punta; sustituyó a V4-Flash el 10 de septiembre
Kimi K2.7 CodeDepende del proveedorDepende del proveedor256KOpen weights; se aplican costes de alojamiento
GLM-5.2Depende del proveedorDepende del proveedor1MOpen weights; se aplican costes de alojamiento
GLM 5.3$1.40 ($0.26 cache-hit)$4.401MAPI de Z.ai, GLM Coding Plan y ZCode; pesos en Hugging Face desde el 28 de agosto bajo la GLM 5.3 License propia
GLM 5.3 Flash$0.15 ($0.03 cache-hit); $0.075 en promoción$0.50; $0.25 en promoción1MAPI de Z.ai, GLM Coding Plan, OpenRouter; pesos MIT en Hugging Face; la promoción acaba el 9 de septiembre
Tencent Hy4 Preview$0.834 ($0.042 cache-hit)$2.5011M+Pesos abiertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextDepende del proveedorDepende del proveedor262K (hasta 1M)Pesos abiertos (Qwen Community License 1.0); se suman los costes de alojamiento
MiMo-V2.6-Pro$0.435$0.871MPesos abiertos (MIT); el alojamiento se paga aparte
ERNIE 5.1Precio para la región de ChinaPrecio para la región de China256KNivel gratuito de Baidu
Gemini Spark (agente)Sin precio de APISin precio de API1M (base Gemini)Google AI Pro $19.99, AI Ultra $99.99 o $199.99/mes
Fello AI (agregador)Enrutado por la appEnrutado por la appDepende del modelo$9.99/mes, plan gratuito disponible

Las tarifas de GPT-5.5 y GPT-5.5 Pro de arriba son precios de contexto corto; OpenAI ya no publica las cifras específicas de contexto largo. Los niveles GPT-5.6 se facturan a 2x entrada y 1,5x salida una vez que un prompt supera los 272K tokens de entrada, lo que sitúa a Terra de contexto largo en $4 / $18 y a Luna en $0.40 / $1.80. Para los niveles GPT-6 OpenAI no publica recargo por contexto largo, y sus lecturas de caché salen un 90 % más baratas: $1.00 en Astra, $0.20 en Sol y $0.01 en Luna. Grok 4.6 funciona igual, pero muerde más fuerte: a partir de 200.000 tokens de prompt, SpaceXAI refactura la petición entera a la tarifa más alta en lugar de solo el exceso, así que pasarse por mil tokens duplica el coste de toda la llamada. La otra tarifa que conviene leer dos veces es la de DeepSeek: desde el 16 de agosto sus dos modelos V4 se facturan a precio de punta de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y a exactamente la mitad en cualquier otra hora, así que la misma tarea puede costar el doble según cuándo la ejecutes. Si quieres acceso a varios modelos de IA sin gestionar suscripciones separadas, Fello AI ofrece GPT, Claude, Gemini, Grok, Perplexity y más en una sola app para Mac, iPhone y iPad desde $9.99/mes.

Modelos open-weight

Mejores modelos open-weight en septiembre de 2026

El mejor modelo de pesos abiertos en septiembre de 2026 es MiMo-V2.6-Pro, que Xiaomi publicó el 21 de septiembre bajo MIT puro: 1,02 billones de parámetros con 42.000 millones activos, contexto de 1M de tokens y los pesos en Hugging Face el mismo día. Artificial Analysis lo mide en 46,3 en el Intelligence Index v4.3.2, la mayor puntuación abierta que ha publicado nunca, por encima de GLM-5.3 con 44,8 y de Kimi K3 con 43,6, y lo hace a $0,13 por tarea del Intelligence Index, más barato que cualquier otro modelo abierto de esta página. También logra un 34,8 % en Terminal-Bench 4.0 y 1673 en GDPval-AA v2.1, lo que lo coloca por encima de Kimi K3 en ambos. Dos límites honestos: ningún tablero de Arena lo ha valorado, así que no hay ninguna evidencia de preferencia humana sobre él, y se publicó hace cuatro días, así que no tiene historial independiente. Kimi K3 sigue siendo el modelo abierto mejor situado en Arena, séptimo en WebDev con 1658 y quinto en la señal de finalización de tareas de la Agent Arena, y GLM-5.3 sigue siendo el modelo abierto más fuerte en el Terminal-Bench 4.0 de Artificial Analysis con un 41,9 % frente al 34,8 % de MiMo, bajo una licencia propia de Z.ai y no MIT. La recomendación práctica para equipos que ejecutan sus propios pesos sigue siendo GLM 5.3 Flash (Z.ai, MIT), lanzado el 26 de agosto y con 41,8 en v4.3.2, 320.000 millones en total con 18.000 millones activos, porque un modelo de 1,02 billones de parámetros no es algo para una estación de trabajo y la descarga de K3 son 96 fragmentos safetensors y unos 1,56 TB. El escalón abierto barato volvió a cambiar el 10 de septiembre: DeepSeek retiró V4-Flash 0731 y lo sustituyó por DeepSeek-V4.1-Flash, 552.000 millones con 8.000 millones activos en prefill y 16.000 millones en decodificación, multimodal de forma nativa, MIT desde el primer día, con 39,5 en v4.3.2 frente a 34,3 de la versión a la que sustituye, y con el precio de vuelta a $0,15 / $0,60 fuera de pico. Además es tercero en la señal de finalización de tareas de la Agent Arena, el modelo abierto mejor situado allí. De los tres lanzamientos que cerraron agosto, GLM 5.3 publicó sus pesos el 28 de agosto bajo una licencia propia con una cláusula que obliga a todo operador de model-as-a-service con más de 10.000 millones de dólares de ingresos a pasar antes una revisión de seguridad de Z.ai; el Qwen3.8-Flash-Next de Alibaba, una mezcla de expertos de 125.000 millones con solo 6.000 millones activos que adelanta la arquitectura Qwen4, puntúa 39,8 y es noveno en el tablero WebDev de Arena; y el Hy4 Preview de Tencent, 770.000 millones en total y 49.000 millones activos bajo Apache 2.0, no tiene valoración de Artificial Analysis pero es undécimo en Arena WebDev con 1624. Ten en cuenta también que GLM 5.3 Flash no es un GLM 5.3 recortado sino un modelo aparte sobre una base entrenada de nuevo, y por eso pudo salir bajo MIT puro mientras que el buque insignia no.

ModeloMejor paraBenchmark claveContexto / LicenciaDónde ejecutar
MiMo-V2.6-ProEl mayor Intelligence Index abierto jamás medidoII 46,3 (v4.3.2), por encima de GLM-5.3 y Kimi K3, a $0,13 por tarea del índice; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1673; 1,02 billones/42.000 millones activos1M / MITHugging Face (XiaomiMiMo), proveedores, autoalojado
Kimi K3Modelo abierto mejor situado en ArenaII 43,6 (v4.3.2); #5 Arena WebDev, la mejor posición abierta; #5 Agent Arena; 2.8T/104B activos1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 TB), Moonshot API, proveedores
GLM 5.3 FlashMejor modelo abierto que la mayoría de equipos puede ejecutar de verdadII 41,8 (v4.3.2), en la frontera de Pareto entre inteligencia y coste, a unos $0.25 por tarea del índice; 320B/18B activos, nativamente multimodal1M / MITHugging Face, API de Z.ai ($0.15/$0.50), OpenRouter
GLM-5.2Respaldo con historial independienteII 33,7 (v4.3.2); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B activos1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Abierto desde el 28 de agosto, pero con licencia propiaII 44,8 (v4.3.2), la puntuación abierta más alta que hemos encontrado; misma base de 744B que GLM-5.2, solo post-entrenada, checkpoint publicado contado en 753B; CyberGym 84,5 % y Terminal-Bench 3.0 28,3 (cifras del fabricante)1M / GLM 5.3 License (model-as-a-service por encima de 10 000 M USD de ingresos necesita revisión de seguridad de Z.ai)Hugging Face, API de Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4.1-FlashMejor valor abierto si lo alojas tú mismoII 39,5 (v4.3.2) frente a 34,3 de la versión V4-Flash 0731 que sustituye; 552B, 8B activos en prefill y 16B en decodificación1M / MITDeepSeek API ($0.15/$0.60 en valle, $0.30/$1.20 en punta desde el 10 de septiembre), local
Tencent Hy4 PreviewMayor modelo con licencia permisiva hasta la fecha770B/49B activos; 2,99/4,00 en el panel propio de Tencent de 203 tareas frente a 2,94 de Kimi K3 y 2,92 de GLM 5.3 (fabricante); sin valoración de Artificial Analysis; #11 Arena WebDev (1624)1M+ / Apache 2.0Hugging Face (BF16 y FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextAnticipo de la arquitectura Qwen4125B totales más un embedding de N-gramas de 51B, 6B activos; 91,7 GPQA Diamond y 62,5 SWE-Bench Pro (fabricante); II 39,8 (v4.3.2); #9 Arena WebDev (1635)262K a 1M / Qwen Community License 1.0Hugging Face, proveedores, autoalojamiento
LongCat-2.0Programador abierto frontier entrenado en chips chinosII 33 (v4.1); 59,5 % SWE-Bench Pro (proveedor), 1.6T/~48B activos1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de clase frontier baratoII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licencia por definirHugging Face, API $0.30/1M (50 % de descuento)
Nex-N2-ProPuntuación de programación abierta más fuerteII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B activosBasado en Qwen / Apache 2.0Hugging Face, proveedores, autoalojado
Kimi K2.7 CodeProgramador abierto con licencia comercial más fuerte+21,8 % en Kimi Code Bench v2 vs. K2.6 (proveedor); 1T/32B activos256K / Modified MITHugging Face, DeepInfra, proveedores
DeepSeek V4-ProTrabajo agéntico del mundo realII 44 (v4.1), 1.6T/49B activos1M / MITDeepSeek API ($0.66/$1.98 fuera de pico, $1.32/$3.96 en pico desde el 16 de agosto), local
Hy3El participante más nuevo con licencia permisivaII 41 (v4.1); #22 en Arena WebDev (1,516.4)Apache 2.0Hugging Face, proveedores, autoalojado
InklingPrimer modelo open-weight de Thinking MachinesII 41 (v4.1), agéntico 32,3, lanzado el 15 de julioOpen weightsHugging Face, proveedores, autoalojado
Inkling SmallMisma familia a una cuarta parte del tamañoII 40 (v4.1), agéntico 30,8; 276B/12B activos, entrada de texto, imagen y audioApache 2.0Hugging Face (BF16 y NVFP4), proveedores, autoalojado
NVIDIA Nemotron 3 UltraAfinado por NVIDIA, licencia totalmente permisivaII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B activos1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 autoalojado)
Qwen 3.5 (397B / 17B activos)Multimodal, decodificación rápida88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / abiertoTogether, OpenRouter, local
Qwen3.6-35B-A3BProgramador agéntico abierto eficiente (3B activos)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B activos262K (a 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgramador denso ejecutable en portátil87,8 GPQA Diamond, denso 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, razonamiento multilingüe70,8 Terminal-Bench 2.1 (first-party), supera a Qwen 3.7 Plus en 4/5397B/17B activos / MITHugging Face, proveedores, autoalojado
Llama 4 MaverickBuque insignia de la línea Meta17B activos / 400B de parámetros totalesLlama 4 licenseNube de Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / bajo consumoMultimodal, huella muy pequeñaCompacto / abiertoLocal, herramienta NVIDIA

Aquí la licencia importa tanto como la puntuación bruta, y agosto ha ensanchado la distancia entre los dos grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) y Nemotron 3 Ultra (OpenMDW) todos permiten claramente el uso comercial sin prueba de ingresos. El resto lleva condiciones que conviene leer antes de construir sobre ellas: MiniMax M3 y MiniMax H3 vienen bajo sus propias licencias comunitarias, y H3 exige además una solicitud desde EE. UU., la UE, el Reino Unido y Corea del Sur; Kimi K3 se sitúa en una licencia propia con un umbral de ingresos para quien lo revenda como servicio; GLM 5.3 exige una revisión de seguridad de Z.ai a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos; y la Qwen Community License 1.0 de Qwen3.8-Flash-Next exige una licencia aparte de Qwen para explotar un negocio de model-as-a-service o de asistente de trabajo con IA, aunque el uso interno queda exento. Ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos: Claude Opus 5 se llevó el tablero Agent en julio, el último que lideró un modelo open-weight.

Cómo evaluamos

Benchmarks, precios y uso práctico

Cada clasificación de esta página combina tres entradas: benchmarks públicos de siete casas independientes (Artificial Analysis, Arena antes LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize y el tablero oficial de Terminal-Bench 4.0, cubriendo el Intelligence Index, GPQA Diamond, ARC-AGI-1 al 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas y el Remote Labor Index), precios de API y suscripción publicados en la página de precios oficial de cada proveedor, y uso práctico por parte del equipo editorial de FelloAI que ejecuta prompts reales sobre la misma tarea en cada modelo. Volvemos a obtener las fuentes oficiales de precios y benchmarks antes de cada actualización mensual.

Los benchmarks se ponderan según el caso de uso: SWE-bench y Terminal-Bench impulsan la programación, GPQA Diamond y ARC-AGI-2 impulsan la precisión, GDPval-AA (el benchmark de entregables profesionales de Artificial Analysis) informa la calidad de las tareas profesionales mientras que el estilo de escritura se juzga principalmente por pruebas prácticas, FrontierMath y HMMT impulsan la resolución de problemas. Revelamos cuándo un benchmark es reportado por el proveedor pero no verificado de forma independiente, y descartamos cualquier afirmación que no podamos reproducir contra una fuente en vivo. Clasificamos por puntuaciones medidas: la corona de una categoría se mueve en cuanto un modelo supera al titular en los tableros que definen esa categoría, sin esperar a los tableros basados en votos, y un modelo que todavía no está ampliamente disponible se señala en su tarjeta en lugar de quedarse sin ella. Revisamos los puestos además de las cifras, porque una puntuación puede seguir siendo correcta mientras el tablero que la rodea se mueve. Cuando un modelo pasa por una actualización importante entre actualizaciones, volvemos a clasificar la categoría y añadimos una línea «Qué cambió este mes» al pie del análisis a fondo.

Fello AI funcionando en Mac, iPhone y iPad
¿No sabes qué modelo elegir?

Fello AI reúne los mejores modelos de IA en una sola app nativa y ligera.

Cambia entre ellos cuando quieras, sin suscripciones separadas.

Descargar Fello AI
Preguntas frecuentes

Preguntas comunes

¿Cuál es el mejor modelo de IA ahora mismo en septiembre de 2026?
Depende de la tarea, pero ahora un modelo lidera más tableros que ningún otro. En puntuación general de benchmarks, Claude Opus 5.5 (22 de septiembre) es el #1 del Intelligence Index de Artificial Analysis con 57,6 en v4.3.2, 4,3 puntos por delante de Claude Fable 5.1, y también lidera GDPval-AA v2.1 con 1846, AA-Briefcase v1.1 con 1822 y Humanity's Last Exam con 61,4 %, a $4 / $20 por 1M de tokens. Para programación, Opus 5.5 lidera el Terminal-Bench 4.0 de Artificial Analysis con 59,6 % y los dos tableros de programación de LiveBench, mientras GPT-6 Astra conserva los dos tableros de programación de Arena porque Opus 5.5 aún no tiene votos allí. Para chat diario, GPT-5.6 es el predeterminado de ChatGPT desde el 9 de julio y es el asistente que más gente puede abrir de verdad, aunque Claude Fable 5 lidera el tablero de texto de Arena. Para escribir, Claude Fable 5.1 es el único modelo entre los seis primeros de los tres tableros de prosa. Para precisión, Claude Fable 5.1 conserva la mayor precisión factual medida por Artificial Analysis, un 67 % en AA-Omniscience, un punto por encima de Opus 5.5. Para matemáticas duras y razonamiento, GPT-6 Astra lidera LiveBench Reasoning y ARC-AGI-2. Para imágenes, ChatGPT Images 2.5 lidera los cuatro tableros que seguimos, y para vídeo Gemini Omni 1.1 Flash lidera el de texto a vídeo de Arena. Para agentes, Gemini Spark es el agente en la nube 24/7 y Claude Cowork el de escritorio. Entre los pesos abiertos, el MiMo-V2.6-Pro de Xiaomi puntúa 46,3 bajo MIT puro a $0,13 por tarea del índice. OpenAI partió por la mitad los precios de API de sus niveles medios el 22 de septiembre, lo que convierte a GPT-6 Luna, con $0.07, en el modelo más barato por tarea del Intelligence Index de esta página.
¿Ha salido GPT-6 y es ahora el mejor modelo?
GPT-6 ya salió. OpenAI lo lanzó como GPT-6 Astra el 3 de septiembre de 2026, lo que zanja la pregunta de todo un año sobre si Astra saldría como GPT-6 o como otra versión intermedia de GPT-5. No es el mejor modelo en los tableros independientes, y el 22 de septiembre cayó más. Artificial Analysis le da 52,7 en el Intelligence Index v4.3.2, 5,7 puntos por delante de GPT-5.6 Sol pero 0,7 por detrás de Claude Fable 5.1 con 53,4 y 4,9 por detrás de Claude Opus 5.5 con 57,6, cobrando $10 / $50 por 1M de tokens frente a los $4 / $20 de Sol y de Opus 5.5. La programación era su mayor argumento y ahora está repartida: Astra se llevó el Terminal-Bench 4.0 de Artificial Analysis con un 59,1 % y lo mantuvo hasta que Opus 5.5 lo pasó con un 59,6 %, un margen dentro de las barras de error del propio benchmark, mientras que Astra conserva los dos tableros de programación de Arena porque Opus 5.5 aún no tiene votos allí. También reduce a grandes rasgos a la mitad la alucinación en AA-Omniscience, del 92 % de Sol al 51 % con esfuerzo máximo, y frente a Opus 5.5 sigue ganando el AutomationBench de Zapier y el Terminal-Bench-Science 0.1. Necesitas un plan de pago: Astra es el primer modelo que OpenAI ha clasificado como Critical en ciberseguridad, así que lo recibieron primero los defensores aprobados de su programa Daybreak, con ChatGPT Business y Pro el 4 de septiembre y Plus unas horas después, y no se ha anunciado nada para el nivel gratuito. Nuestro análisis completo de GPT-6 Astra cubre los benchmarks y las salvedades. La familia creció el 22 de septiembre con GPT-6 Sol a $2 / $10 y GPT-6 Luna a $0,10 / $0,50, a los que Artificial Analysis puntúa con 47,5 y 37,3 frente al 52,7 de Astra. Ambos están en ChatGPT Work, Codex y la API, y OpenAI dice que ninguno está todavía en Chat; el resto está en nuestro análisis de GPT-6 Sol y Luna.
¿Qué es Claude Opus 5?
Claude Opus 5 es el buque insignia de Anthropic del 24 de julio de 2026, y fue el modelo #1 en Artificial Analysis hasta que Claude Fable 5.1 llegó el 1 de septiembre. Ahora es tercero en el Intelligence Index con 50,8, frente al 53,4 de Claude Fable 5.1 y el 52,7 de GPT-6 Astra, segundo en AA-Briefcase con 1673 frente a 1678, y con esfuerzo max incluso lidera el tablero GDPval-AA v2.1 de entregables profesionales con 1708 frente a los 1735 de Fable 5.1, con intervalos de confianza solapados, todavía muy por delante del 1695 de Grok 4.7 y del 1632 de Claude Fable 5. El precio de la API es de $5 / $25 por 1M de tokens, el mismo que Opus 4.8 y la mitad del coste de Fable 5, con una ventana de contexto de 1M de tokens y una fecha de corte de conocimientos de mayo de 2026. ARC Prize confirma de forma independiente la afirmación de lanzamiento de Anthropic sobre ARC-AGI-3, donde Opus 5 puntúa un 30 % frente al 8 % del siguiente mejor modelo, cerca de 3,75 veces. Arena lo sitúa ahora tercero en los dos tableros de programación, por detrás de GPT-6 Astra y Claude Fable 5.1, primero en Document, cuarto en la señal de cumplimiento de tareas de la Agent Arena y décimo en texto. Una cosa a tener en cuenta: Artificial Analysis mide su tasa de alucinación en un 50 %, que es por lo que no ostenta ninguna corona de precisión en esta página.
¿Qué es Claude Fable 5.1?
Claude Fable 5.1 es el lanzamiento de Anthropic del 1 de septiembre de 2026 y el modelo mejor puntuado que Artificial Analysis ha medido, con 53,4 en su Intelligence Index v4.3.2 con effort max y primero en AA-Briefcase con 1678. Salió junto a Claude Mythos 5.1, que es el mismo modelo con las salvaguardas de biología y ciberseguridad relajadas, disponible solo por invitación y sin criterios de elegibilidad publicados. El precio es de $10 / $50 por 1M de tokens, igual que Fable 5, pero las lecturas de caché bajan un 75 % hasta $0.25, sobre una ventana de contexto de 1M de tokens y con corte de conocimientos de junio de 2026. Está incluido en Claude Max y Team Premium con cerca del 50 % de los límites semanales y es alcanzable desde Pro mediante créditos. Anthropic sigue recomendando empezar con Claude Opus 5 para la mayoría de las cargas, ya que cuesta la mitad y va más rápido. Nuestro desglose completo de Claude Fable 5.1 y Mythos 5.1 cubre la tarjeta de sistema y el reparto de salvaguardas.
¿Ha vuelto Claude Fable 5?
Sí. Anthropic volvió a desplegar Claude Fable 5 el 1 de julio de 2026 después de que el gobierno de EE. UU. levantara la restricción de control de exportaciones que había impuesto el 12 de junio. Está disponible de nuevo en la Claude API, Claude.ai, Claude Code y Claude Cowork. Anthropic hizo permanente a Fable 5 en los planes de pago el 20 de julio de 2026. Max y Team Premium lo incluyen con cerca del 50 % de los límites de uso habituales; Pro y Team Standard lo alcanzan a través de créditos de uso con un crédito inicial único de $100. El precio de la API es de $10 / $50 por millón de tokens. Fable 5 es un modelo de clase Mythos construido para trabajo agéntico de largo horizonte con un contexto de 1M de tokens, y es el segundo para programación por detrás de Claude Opus 5, en #2 en el tablero image-to-WebDev de Arena (1,625.7) y #4 en WebDev.
¿Qué es GPT-5.6 y puedo usarlo?
Sí, desde el 9 de julio de 2026. GPT-5.6 es la familia de modelos de nueva generación de OpenAI, y tras una vista previa cerrada de dos semanas que comenzó el 26 de junio tras una revisión de seguridad del gobierno de EE. UU., alcanzó la disponibilidad general el 9 de julio. Hay tres niveles, del menos al más capaz: Luna, el nivel rápido y más barato ($0.20 / $1.20 por 1M de tokens); Terra, un modelo equilibrado para el día a día que OpenAI dice que iguala a GPT-5.5 ($2 / $12); y Sol, el buque insignia afinado para biología, química y ciberseguridad ($4 / $20). OpenAI recortó Luna un 80 % y Terra un 20 % el 30 de julio de 2026 y dejó a Sol intacto, y luego recortó Sol más de un 20 % el 21 de agosto de 2026 como tarifa promocional de unos tres meses. Ningún precio de suscripción de ChatGPT ha cambiado. Ahora está en vivo en ChatGPT, Codex y la API como modelo por defecto de OpenAI. Una advertencia: la system card de OpenAI y el evaluador externo METR señalaron un comportamiento de «scheming» elevado en Sol, así que trátalo con cuidado para trabajo factual de alto riesgo hasta que se asienten los resultados independientes. Un apunte de nombres desde el 22 de septiembre: OpenAI reutilizó Sol y Luna para la generación GPT-6, así que un «Sol» o «Luna» a secas es ahora ambiguo. GPT-6 Sol cuesta $2 / $10 y GPT-6 Luna $0,10 / $0,50, frente a $4 / $20 y $0,20 / $1,20 de los niveles 5.6, que OpenAI sigue vendiendo.
¿Ya salió Grok 4.7?
Sí. SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026, sustituyendo a Grok 4.6 como buque insignia. A diferencia de 4.6, que era un reentrenamiento posterior sobre la misma base, 4.7 usa un modelo base nuevo y mayor, entrenado con una tanda más larga de aprendizaje por refuerzo orientada a trabajos de muchas horas; SpaceXAI no publica recuento de parámetros. Artificial Analysis le da 46,3 en el Intelligence Index v4.3.2 con esfuerzo alto frente al 44,3 de Grok 4.6, y en los dos tableros agénticos queda por encima de GPT-6 Astra, 1695 contra 1542 en GDPval-AA v2.1 y 1657 contra 1569 en AA-Briefcase v1.1. El precio no cambia, $2 / $6 por 1M de tokens con ventana de 500K, aunque los prompts de 200.000 tokens o más refacturan la petición entera a $4 / $12, y una variante rápida funciona al doble de velocidad de salida por el doble de precio. El coste por tarea del Intelligence Index sí se movió, de $1,86 a $2,73, porque 4.7 emite alrededor del doble de tokens de salida. Está activo en la API de Grok, en Cursor, en Grok Build, en harnesses de programación de terceros y en routers en la nube. El anuncio de SpaceXAI no dice nada de la app de consumo de Grok, que a $30 al mes sigue sirviendo Grok 4.6. Grok es además nuestra elección para creatividad, por motivos de producto y no por la calidad de la prosa; para el mejor texto escrito gana Claude Fable 5 de forma clara. Todas las cifras están en nuestro análisis de Grok 4.7.
¿Qué IA es la mejor para programar?
Claude Opus 5.5 es el mejor para programar desde que Anthropic lo lanzó el 22 de septiembre. Lidera la propia ejecución de Terminal-Bench 4.0 de Artificial Analysis con 59,6 % frente al 59,1 % de GPT-6 Astra, LiveBench Coding con 89,3 frente a 80,4 y LiveBench Agentic Coding con 71,7 frente a 57,3, y lo hace a $4 / $20 por 1M de tokens frente a los $10 / $50 de Astra. En el harness propio de Anthropic la distancia es mayor, 66,4 % en Terminal-Bench 4.0 frente al 57,9 % que OpenAI reporta para Astra, junto a un 54,4 % en FrontierCode v1.1 y un 57,8 % en CursorBench 4.0. GPT-6 Astra es el segundo y conserva los dos tableros de programación de Arena, WebDev con 1793 e imagen a WebDev con 1733, porque Opus 5.5 aún no tiene votos allí, así que la lectura honesta es que OpenAI lidera en preferencia humana y Anthropic en todos los harnesses medidos. Trata el margen de medio punto en Terminal-Bench como un empate, porque Anthropic reporta en él un error estándar de unos 2,6 puntos. Claude Fable 5.1 es tercero. Entre los pesos abiertos, GLM-5.3 es el más fuerte en Terminal-Bench 4.0 con un 41,9 % y Kimi K3 es el modelo abierto mejor situado en Arena WebDev, en séptimo lugar, mientras que GLM 5.3 Flash es el que la mayoría de los equipos puede alojar, a $0,25 por tarea del índice bajo MIT puro. Artificial Analysis ha retirado tanto su Coding Index como su Coding Agent Index.
¿Qué IA es la mejor para escribir?
Claude Fable 5.1 es la mejor para escribir, encabeza Humanity's Last Exam con un 59,1 % y el tablero de entregables profesionales GDPval-AA v2.1. Claude Fable 5 es la elección si ponderas los votos humanos: sigue liderando Arena escritura creativa y LiveBench Language (90.7), aunque ahora es #8 en EQ-Bench Creative Writing v3. Cuesta $10 / $50 por 1M de tokens. Claude Sonnet 5 es la elección de valor y lo que la mayoría de la gente debería usar de verdad, ya que es gratis y por defecto en claude.ai a $2 / $10, un precio de lanzamiento que Anthropic hizo permanente en agosto de 2026, aunque se clasifica #53 en Arena escritura creativa. Kimi K3 es cuarto en EQ-Bench con 2070.6 si quieres ficción distintiva, Claude Fable 5.1 encabeza el tablero GDPval-AA v2.1 de entregables profesionales con 1846, con Claude Opus 5 segundo con 1735, GPT-5.5 es la alternativa para escritura de negocios anclada en hechos, y Gemini 3.8 Flash es la elección relación precio-rendimiento para contenido en volumen.
¿Cuál es el mejor modelo de IA open-weight en 2026?
El MiMo-V2.6-Pro de Xiaomi, publicado el 21 de septiembre de 2026 bajo MIT puro. Artificial Analysis lo mide en 46,3 en el Intelligence Index v4.3.2, la mayor puntuación abierta que ha publicado nunca, por encima de GLM-5.3 con 44,8 y de Kimi K3 con 43,6, y resuelve una tarea del índice por $0,13, más barato que cualquier otro modelo abierto de esta página. Es una mezcla de expertos de 1,02 billones de parámetros con 42.000 millones activos, contexto de 1M de tokens y los pesos en Hugging Face desde el primer día. Dos salvedades: ningún tablero de Arena lo ha valorado, así que no hay evidencia alguna de preferencia humana, y tiene cuatro días. Kimi K3 sigue siendo el modelo abierto mejor situado en Arena, séptimo en WebDev y quinto en la señal de finalización de tareas de la Agent Arena, y GLM-5.3 sigue siendo el modelo abierto más fuerte en el Terminal-Bench 4.0 de Artificial Analysis con un 41,9 %, bajo una licencia propia de Z.ai y no MIT. Para equipos que de verdad quieren alojar el suyo, GLM 5.3 Flash (Z.ai, MIT) sigue siendo la recomendación práctica, con 41,8 en el índice y 320.000 millones en total con 18.000 millones activos, porque un modelo de 1,02 billones de parámetros necesita un clúster y la descarga de Kimi K3 son 96 fragmentos y unos 1,56 TB.
¿Cuál es el modelo de IA de clase frontier más barato?
En precio de API por millón de tokens, GPT-6 Luna es el modelo cerrado de clase frontera más barato a $0.10 / $0.50, tras el recorte a la mitad de OpenAI del 22 de septiembre de 2026, y Artificial Analysis lo puntúa con 37,3 en su índice v4.3.2 frente al 34,0 de Gemini 3.6 Flash. Entre los pesos abiertos sigue mandando GLM 5.3 Flash, nuestra elección relación precio-rendimiento desde agosto, ahora a su precio de lista simple de $0.15 / $0.50 desde que la promoción de lanzamiento terminó el 9 de septiembre, con 41,8 bajo una licencia MIT sin más que puedes alojar tú mismo. DeepSeek tuvo esa elección hasta que subió las tarifas unas cuatro veces el 16 de agosto, y estuvo cerca de recuperarla el 10 de septiembre, cuando V4.1-Flash sustituyó a V4-Flash a $0.15 / $0.60 en valle y $0.30 / $1.20 en punta: en valle los dos empatan ahora en entrada, con GLM más barato en salida. Artificial Analysis todavía los separa en coste por tarea del índice, $0.25 para GLM frente a $0.27 para DeepSeek. El tramo barato de Google mejoró otra vez el 2 de septiembre, con Gemini 3.8 Flash marcando 40,9 al mismo precio introductorio de $0.75 / $3.75, aunque esa tarifa se duplica el 1 de enero de 2027. MiniMax M3 está a $0.30 por millón de tokens de entrada con un descuento permanente del 50 %, con LongCat-2.0 como alternativa MIT sólida. Medido por tarea del Intelligence Index en lugar de por token, el modelo más barato de esta página es GPT-6 Luna con $0.07, por delante de GPT-5.6 Luna con $0.18 y del MiMo-V2.6-Pro abierto con $0.13.
¿Qué modelos de IA son gratis?
ChatGPT Free ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible) bajo límites de uso. Los usuarios de Free y Go también llegan a GPT-6 Luna en la app de escritorio de ChatGPT desde el 22 de septiembre. Gemini Free ejecuta Gemini 3.6 Flash en la aplicación de Gemini y Google AI Studio. Claude Free ejecuta Claude Sonnet 5 (el nuevo por defecto) con límites diarios. DeepSeek Chat ejecuta DeepSeek V4 gratis en el sitio web de DeepSeek. Grok tiene un plan de consumo gratuito limitado (X Premium es un complemento de pago). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash, MiMo-V2.6-Pro y Hy4 Preview de Tencent son open-weight y gratis para autoalojar, aunque las licencias difieren y solo algunos son MIT o Apache puros. Qwen 3.7 Max es solo API sin front-end de chat de consumo, pero Alibaba ahora incluye 200 solicitudes de modelo gratis al día. Kimi tiene un nivel básico gratuito en su app, con el uso agéntico más intenso medido.
¿Qué es Gemini Spark y qué plan necesitas?
Gemini Spark es el primer agente de IA de Google residente en la nube 24/7, lanzado en el Google I/O el 19 de mayo de 2026 y ya no exclusivo de Ultra: desde el 30 de julio de 2026 también llega al nivel Google AI Pro de $19.99/mes, en EE. UU. y en más de 160 países más, mientras que Google AI Ultra a $99.99 o $199.99/mes lleva el despliegue global más amplio. Google AI Plus, el nivel gratuito y las cuentas de trabajo o de centro educativo no lo incluyen. Spark está construido sobre los modelos base de Gemini con el harness Antigravity de Google en una VM de Google Cloud, se integra con Gmail, Google Docs y otras apps de Google Workspace, y puede interactuar con Chrome y el sistema Halo de Android en el lado del dispositivo. Vale el gasto para usuarios que tienen flujos repetibles de larga duración (triaje de bandeja de entrada, resúmenes de investigación, tareas programadas). Para tareas puntuales, Claude Cowork a $20/mes cubre la mayoría de las necesidades de agente de escritorio.
¿Qué es Fello AI?
Fello AI es un chatbot de IA para Mac, iPhone y iPad que te permite usar todos los mejores modelos de IA como ChatGPT, Claude, Gemini, Grok y DeepSeek en una sola app, con modelos actualizados con regularidad para que siempre tengas los más recientes. Cuesta $9.99/mes con una valoración de 4,7 estrellas a través de más de 27 000 reseñas.
¿Con qué frecuencia actualizáis esta página?
Actualizamos esta página al menos cada mes y dentro de las 24-48 horas siguientes al lanzamiento de cualquier modelo importante.
Artículos relacionados
Claude vs. ChatGPT: ¿qué IA es realmente mejor en 2026?

Claude alcanzó el #1 en la App Store a principios de 2026, sacando a ChatGPT del primer puesto por primera vez. El detonante fue la negativa pública de Anthropic a la exigencia del Pentágono de desplegar sus modelos para armas autónomas.

Leer más →
Grok vs. ChatGPT: ¿qué chatbot de IA es realmente mejor en 2026?

Los dos chatbots siguen moviéndose. ChatGPT corre GPT-5.6 (niveles Sol, Terra, Luna) y el buque insignia de SpaceXAI es ahora Grok 4.7, la versión del 21 de septiembre que puntúa 46,3 en el Intelligence Index a $2 / $6, aunque la app de Grok sigue sirviendo 4.6.

Leer más →
ChatGPT vs. Gemini en 2026: ¿qué IA deberías usar de verdad?

ChatGPT pasó a GPT-5.6 como su modelo insignia, mientras que Gemini 3.1 Pro sigue siendo el buque insignia de pago de Google. Cara a cara en escritura, programación, imágenes y precio.

Leer más →
Cuándo usar cada IA: elige el modelo correcto

No hay una única IA mejor. Asigna cada tarea al modelo que la lidera, con una tabla para programar, escribir, investigar y el chat diario.

Leer más →
Los mejores agentes de IA en 2026: 30 herramientas

Treinta agentes de IA comparados por lo que quieres hacer: programar, investigar, trabajo de oficina y automatización, con precios y opciones gratuitas.

Leer más →
Gemini Nano Banana Pro vs. GPT-Image-1.5: comparativa definitiva

Nuestra comparativa práctica original de diciembre de 2025 de los dos modelos líderes de generación de imágenes, con muestras de salida reales lado a lado.

Leer más →

Prueba todos los modelos.
Una app preciosa.

Todos los modelos de esta guía en una app nativa: ChatGPT, Claude, Gemini, Grok y DeepSeek. Gratis para empezar.

Fello AI funcionando en Mac, iPad y iPhone

Valoración de 4,7·más de 27 000 reseñas·Gratis para empezar