Actualizado el 2 de septiembre de 2026

Mejores modelos de IA en 2026

Clasificaciones, comparativas y análisis a fondo, actualizados cada mes a medida que llegan nuevos modelos.

Claude Fable 5.1 llegó el 1 de septiembre y se puso directamente en lo más alto del Intelligence Index de Artificial Analysis con 66, la puntuación más alta que la casa ha medido, llevándose con él su Agentic Index con 61. Claude Opus 5 conserva las dos cosas por las que la mayoría de lectores decide de verdad: la corona de programación, ganada en los dos tableros por votos de Arena, y el precio, $5 / $25 por 1M de tokens frente a los $10 / $50 de Fable 5.1. Ningún tablero de Arena tiene todavía votos para 5.1, así que no se ha movido nada de lo que en esta página decide la preferencia humana. Grok 4.6 es la verdadera sorpresa del mes: una actualización de post-entrenamiento de Grok 4.5 que sube cinco puntos hasta 61, empatando con GPT-5.6 Sol mientras cobra $2 / $6, y que termina los trabajos agénticos largos en aproximadamente la mitad de turnos que necesita Opus 5.

El otro movimiento está en el extremo económico, y por primera vez este año fue en la dirección contraria. DeepSeek subió los precios de sus dos modelos V4 unas cuatro veces el 16 de agosto y dividió la tarifa en horas punta y valle, así que DeepSeek V4-Flash 0731 cuesta ahora $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, en lugar de los $0.14 / $0.28 planos con los que salió, lo que le cuesta la elección relación precio-rendimiento. Esa elección pasa a GLM 5.3 Flash, que aterrizó el 26 de agosto con pesos MIT el primer día, un Intelligence Index de 57 y un precio de lista de $0.15 / $0.50, reducido a la mitad hasta el 9 de septiembre a $0.075 / $0.25, y que ahora deja a DeepSeek por debajo a cualquier hora del día. Google ya había reducido a la mitad su propia tarifa Flash: Gemini 3.7 Flash salió el 13 de agosto a un introductorio $0.75 / $3.75, con 56 puntos y el primer puesto de 182 modelos en velocidad de salida, y Gemini 3.6 Flash pasó a la misma tarifa. Ambos precios se duplican el 1 de enero de 2027. El campo abierto cerró después el mes con tres lanzamientos en tres días: GLM 5.3 publicó por fin sus pesos el 28 de agosto, aunque bajo una licencia propia de Z.ai en lugar del MIT puro que recibió su hermano menor, Alibaba abrió Qwen3.8-Flash-Next el 26 de agosto como el primer vistazo público a la arquitectura Qwen4, y Tencent liberó Hy4 Preview el 28 de agosto, 770 000 millones de parámetros bajo Apache 2.0. Abajo están los ganadores por categoría de septiembre de 2026. Haz clic en cualquier tarjeta para saltar directamente al desglose completo, o usa la navegación fija para moverte entre categorías. Las clasificaciones, benchmarks y precios se actualizan dentro de las 48 horas siguientes al lanzamiento de cualquier modelo importante.

Ganadores por categoría de septiembre de 2026
Escritura
Claude Fable 5
#1 Arena texto (1508.6) y Arena escritura creativa
El único modelo entre los tres primeros de los tres tableros independientes de escritura, a $10 / $50.
Análisis a fondo →
Chat & asistente diario
GPT-5.6
Modelo por defecto de ChatGPT desde el 9 de julio
El mejor asistente que la mayoría de la gente puede abrir de verdad, equilibrando capacidad, velocidad y alcance.
Análisis a fondo →
Imágenes
ChatGPT Images 2.0
#1 en texto a imagen y edición de imágenes
Lidera los dos tableros independientes de imagen y sigue siendo el mejor en texto multilingüe legible.
Análisis a fondo →
Vídeo
Gemini Omni Flash
#1 en los dos tableros de vídeo (1527 Arena)
Lidera los dos tableros independientes de vídeo con edición conversacional a unos $0.10 por segundo.
Análisis a fondo →
Programación
Claude Opus 5
#1 Arena WebDev (1,702.9) a $5 / $25
Se lleva la corona de programación en los tableros por votos, a la mitad del precio de Claude Fable 5.
Análisis a fondo →
Creatividad
Grok 4.6
Menos restricciones de contenido + X nativo en tiempo real
La elección para trabajo atrevido y a la última: menos límites y integración nativa con X.
Análisis a fondo →
Precisión & investigación
Gemini 3.1 Pro
98 % en ARC-AGI-1 a $0.52 por tarea
Iguala al panel humano en ARC-AGI-1 con anclaje nativo en Google Search para respuestas en vivo.
Análisis a fondo →
Resolución de problemas
GPT-5.6 Sol
#1 LiveBench Mathematics, Reasoning y ARC-AGI-2
La corona mejor respaldada de esta página para las matemáticas, la ciencia y el razonamiento más difíciles.
Análisis a fondo →
Agentes de IA
Gemini Spark
Primer agente de IA residente en la nube 24/7
Se ejecuta de forma continua en una VM de Google Cloud, muy integrado con Gmail, Docs y Chrome.
Análisis a fondo →

¿Quieres los mejores modelos de IA sin hacer malabares con suscripciones separadas? Fello AI reúne los modelos líderes en una sola app nativa para Mac, iPhone y iPad.

Descargar Fello AI
Novedades de septiembre de 2026
1 sep Anthropic Claude Fable 5.1 y Mythos 5.1, un nuevo #1 en Artificial Analysis con 66 y un recorte del 75 % en las lecturas de caché Nuevo
Anthropic lanzó Claude Fable 5.1 y Claude Mythos 5.1 el 1 de septiembre de 2026, y son un modelo en dos configuraciones de salvaguardas, no dos modelos. Fable 5.1 está disponible de forma general; Mythos 5.1 relaja las restricciones de biología y ciberseguridad y se reparte por invitación, sin criterios de elegibilidad publicados. Artificial Analysis puntúa a Fable 5.1 con 66 en su Intelligence Index v4.1.1 con effort max, la puntuación más alta que ha medido nunca, por delante de Claude Opus 5 con 63, Claude Fable 5 con 62 y GPT-5.6 Sol y Grok 4.6 con 61. También se lleva el Agentic Index con 61 frente al 59 de Opus 5, el tablero GDPval-AA v2 de entregables profesionales con 1853 frente a 1824, y Humanity's Last Exam con un 59,1 % frente al 55,5 % de Fable 5. El ajuste de effort pesa aquí más de lo habitual: el mismo modelo marca 58 en low, 60 en medium, 62 en high y 65 en xhigh, y esos ajustes abarcan una diferencia de once veces en tokens de salida, de 13,1 millones a 143,7 millones en toda la batería. El precio no cambia, a $10 / $50 por 1M de tokens, pero las lecturas de caché bajan un 75 % hasta $0.25 desde el $1.00 de Fable 5, y ahí es donde está el ahorro real en las ejecuciones agénticas largas. Con las cifras del propio Anthropic alcanza un 52,6 % en Terminal-Bench-Science 0.1 frente al 29,0 % de Opus 5, y la tarjeta de sistema de 212 páginas subió la propia evaluación de riesgo de alineación de la empresa de muy baja a baja. Dos cosas antes de cambiar: Anthropic sigue recomendando empezar con Opus 5 para la mayoría de las cargas a mitad de precio, y ningún tablero de Arena tiene votos para ninguno de los dos modelos, así que no se ha movido nada de lo que en esta página descansa sobre la preferencia humana. Todo el detalle en nuestro desglose de Claude Fable 5.1 y Mythos 5.1.
28 ago Z.ai Los pesos de GLM 5.3 ya están fuera tras la pausa de seguridad, pero la licencia no es MIT Nuevo
Z.ai publicó los pesos de GLM 5.3 en Hugging Face el 28 de agosto de 2026, dos semanas después del lanzamiento de la API y exactamente en la fecha que llevaba su marcador de posición, así que la evaluación de seguridad prometida sí se hizo y la pausa queda cerrada en lugar de abierta. Lo que cambió es la licencia. GLM 5.3 Flash había salido bajo MIT puro dos días antes; el buque insignia lleva un documento propio titulado GLM 5.3 License, y el campo de licencia de la ficha del modelo dice glm-5.3, no mit. La concesión de derechos sigue de cerca a MIT, con derecho a ejecutar, desplegar, ajustar, modificar, distribuir y vender, y con los pesos explícitamente incluidos en la definición del software, de modo que el uso comercial queda abierto a casi todo el mundo. Una cláusula sí es nueva: un operador de model-as-a-service cuyos ingresos superen los 10 000 millones de dólares en doce meses consecutivos debe pasar una revisión de seguridad de Z.ai antes de desplegar comercialmente, y Z.ai se reserva determinar por su cuenta el alcance y el método de esa revisión. Ten en cuenta además que Hugging Face cuenta el checkpoint publicado en 753B parámetros frente a la base de 744B que Z.ai dice compartir con GLM-5.2; es el tipo de diferencia que produce un recuento mecánico de parámetros, no la prueba de un modelo distinto. Esto no mueve nuestra elección open-weight. GLM 5.3 Flash sigue siendo el modelo que alojaríamos, porque 320B bajo MIT puro es mucho más fácil de operar y de resolver legalmente que 753B bajo una licencia propia. Todo el detalle en nuestro desglose de GLM 5.3.
28 ago Tencent Tencent Hy4 Preview, 770B de pesos abiertos bajo Apache 2.0 y el mayor modelo permisivo hasta la fecha Nuevo
Tencent publicó y liberó Hy4 preview el 28 de agosto de 2026, el nuevo buque insignia de su línea Hunyuan y el mayor modelo que nadie haya publicado bajo Apache 2.0. Funciona con 770 000 millones de parámetros totales y 49 000 millones activos por token en un diseño mixture-of-experts, admite una ventana de contexto que Tencent describe como superior a 1M de tokens, y se distribuye con una compilación FP8 junto a los pesos en precisión completa. El precio de la API es $0.834 por 1M de tokens de entrada, $2.501 de salida y $0.042 de entrada en caché, barato para este tamaño. La licencia es la verdadera noticia: Apache 2.0 es más permisiva que el documento propio de Kimi K3 y que la licencia que Z.ai adjuntó a GLM 5.3 ese mismo día. Trata con cuidado la afirmación de calidad, porque la única prueba hasta ahora es la del fabricante. Tencent hizo una evaluación ciega interna de 203 tareas de ingeniería puntuadas por 163 expertos, y Hy4 preview obtiene ahí 2,99 sobre 4,00 frente al 2,94 de Kimi K3 y el 2,92 de GLM 5.3. Es el propio panel de Tencent, los márgenes caben en una décima de punto y ninguna casa independiente ha publicado todavía un Intelligence Index ni una valoración de Arena, así que lo listamos en lugar de clasificarlo. Tencent afirma además que el modelo ayudó a automatizar la optimización de su propio proceso de entrenamiento y elevó su propio rendimiento de inferencia un 31,8 % medido. Está disponible como pesos abiertos y a través de WorkBuddy, CodeBuddy, Yuanbao e ima, además de Tencent Cloud TokenHub y OpenRouter, con acceso gratuito en WorkBuddy y CodeBuddy durante dos semanas desde el lanzamiento.
26 ago Z.ai GLM 5.3 Flash, Ox Alpha desvelado, y los primeros pesos MIT que Z.ai publica desde GLM-5.2 Nuevo
Z.ai lanzó GLM 5.3 Flash el 26 de agosto de 2026, y no es el modelo que el sector esperaba. Los pesos retenidos el 14 de agosto pertenecen a GLM 5.3; este es un modelo aparte sobre una base recién entrenada, 320 000 millones de parámetros con 18 000 millones activos, el primer modelo nativamente multimodal de la línea GLM-5, y llegó a Hugging Face bajo licencia MIT el mismo día. Es además el modelo sigiloso que venía sirviendo tráfico en OpenRouter como Ox Alpha, ejecutado durante esa vista previa íntegramente en chips de IA chinos, lo que describe cómo se sirvió, no cómo se entrenó. Artificial Analysis lo puntúa con 57 en el Intelligence Index v4.1.1, cuatro puntos por encima de GLM-5.2 con menos de la mitad de tamaño, y lo sitúa en la frontera de Pareto entre inteligencia y coste, a unos $0.09 por tarea del índice. El precio de lista es $0.15 / $0.50 por 1M de tokens, con una promoción de lanzamiento del 50 % vigente hasta las 24:00 del 9 de septiembre, y tras la subida de DeepSeek del 16 de agosto ese precio de lista deja por debajo a DeepSeek V4-Flash 0731 a cualquier hora del día. Trata las cifras de programación y agénticas con cuidado: salen del propio gráfico de Z.ai, que elige como comparación a Claude Opus 4.8 y GPT-5.6 Terra en lugar de a los líderes actuales, y ahí figuran Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 frente al 46,2 de GLM-5.2 y AutomationBench 48,8. La única cifra de ese gráfico medida por Artificial Analysis es GDPval-AA v2, donde GLM 5.3 Flash alcanza 1773 Elo, la más alta representada. Todavía no hay votos en Arena. Esto sí mueve nuestra elección open-weight: GLM 5.3 Flash sustituye a GLM-5.2 como el modelo MIT que alojaríamos. Una advertencia sobre hardware: 18B activos no significa 18B para alojar, porque el enrutado mixture-of-experts necesita los 320B de pesos residentes, así que hablamos de un servidor multi-GPU, no de una estación de trabajo. Todo el detalle en nuestro desglose de GLM 5.3 Flash.
26 ago Alibaba Qwen3.8-Flash-Next, pesos abiertos y el primer vistazo público a la arquitectura Qwen4 Nuevo
Alibaba publicó Qwen3.8-Flash-Next en Hugging Face el 26 de agosto de 2026, y aquí importa más la arquitectura que la tabla de puntuaciones: Qwen lo presenta como un vistazo temprano al diseño que usará la familia Qwen4, publicado para que la comunidad pueda prepararse. Es un mixture-of-experts de 125 000 millones de parámetros con solo 6000 millones activos por token, más un embedding de N-gramas aparte de 51 000 millones de parámetros, y admite texto, imagen y vídeo. El contexto es de 262 144 tokens de forma nativa, ampliable a 1M. Entre las cifras publicadas por Qwen están 91,7 en GPQA Diamond, 62,5 en SWE-Bench Pro, 58,7 en DeepSWE 1.1, 81,0 en SWE-Bench Multilingual y 84,5 en AndroidWorld vision, todas del fabricante, todavía sin Intelligence Index independiente y sin votos en Arena. Conviene leer la licencia antes de construir sobre ella, porque no es Apache. La Qwen Community License 1.0 permite uso comercial, modificación y alojamiento, pero exige mostrar de forma visible el nombre del modelo en cuanto un producto supere los 100 millones de usuarios activos mensuales o los 20 millones de dólares de ingresos mensuales, y exige una licencia aparte de Qwen para explotar un negocio de model-as-a-service o de asistente de trabajo con IA. El uso interno queda exento de esa segunda condición.
21 ago OpenAI GPT-5.6 Sol baja más de un 20 % y queda por debajo de Claude Opus 5 en ambos lados Nuevo
OpenAI recortó GPT-5.6 Sol de $5 / $30 a $4 / $20 por 1M de tokens el 21 de agosto de 2026, el primer recorte al buque insignia desde el lanzamiento de la familia GPT-5.6 en julio. La tarifa es promocional y OpenAI dice que dura unos tres meses. Cubre la API y los créditos de Codex y ChatGPT Work; los precios de suscripción de Plus, Pro y Business no cambian. A $4 / $20, Sol queda ahora por debajo de Claude Opus 5 a $5 / $25 tanto en entrada como en salida, la primera vez que el buque insignia de OpenAI es el más barato de los dos.
16 ago DeepSeek DeepSeek sube los precios de la API unas cuatro veces y divide la tarifa en horas punta y valle Nuevo
DeepSeek pasó sus dos modelos V4 a una nueva tarifa a las 16:00 UTC del 16 de agosto de 2026, y la dirección es poco habitual en este sector: los precios subieron, unas cuatro veces en hora punta. V4-Flash 0731 pasó de unos $0.14 / $0.28 planos por 1M de tokens a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, y V4-Pro 0813 de $0.435 / $0.87 a $0.66 / $1.98 en valle y $1.32 / $3.96 en punta, con la entrada en caché a $0.007 y $0.022 en valle respectivamente. La hora punta va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, y cualquier otra hora es valle a exactamente la mitad de la tarifa punta. DeepSeek lo presentó como un reparto más razonable de la capacidad. Nada cambió en los modelos, así que es puramente un hecho económico, pero de consecuencia para esta página: le cuesta a DeepSeek V4-Flash la elección relación precio-rendimiento, que pasa a GLM 5.3 Flash con $0.15 / $0.50 de lista, una tarifa que deja por debajo incluso el precio en valle de DeepSeek a cualquier hora del día. Los pesos siguen bajo MIT, así que quien se lo aloje por su cuenta no se ve afectado. Todo el detalle en nuestro desglose de DeepSeek V4.
14 ago Z.ai GLM 5.3, un gran salto agéntico solo con post-entrenamiento, lanzado sin los open weights Nuevo
Z.ai lanzó GLM 5.3 el 14 de agosto de 2026, y lo notable es lo que no cambió: funciona sobre la misma base de 744 000 millones de parámetros que GLM-5.2, sin nuevo preentrenamiento. Toda la mejora viene de post-entrenamiento escalado, y la agéntica es grande. En el propio gráfico de Z.ai, Terminal-Bench 3.0 pasa de 4,6 a 28,3, DeepSWE v1.1 de 46,2 a 66,9 y CyberGym del 77,2 % al 84,5 %, lo que según la compañía supera por poco a Claude Mythos 5 con 83,8 y a GPT-5.6 Sol con 83,6. Todas esas cifras son del fabricante, todavía sin auditoría independiente, y el gráfico es menos halagador en otros puntos: en el Code Bench interno de Z.ai, Claude Fable 5 sigue liderando con un 39,5 % frente al 31,4 % de GLM 5.3, y en ExploitBench los líderes frontier están en el 78,0 % frente al 54,4 %. La pega es la licencia, no la puntuación. GLM-5.2 publicó pesos con licencia MIT en cuestión de días; GLM 5.3 llegó sin ninguno, y Z.ai dijo que llegarían tras una evaluación de seguridad de la capacidad del modelo para descubrir vulnerabilidades, en unas dos semanas. Eso se resolvió el 28 de agosto de 2026, cuando Z.ai publicó los pesos exactamente en la fecha que llevaba el marcador de posición, aunque bajo una GLM 5.3 License propia en lugar del MIT puro que recibieron tanto GLM-5.2 como GLM 5.3 Flash. La tarifa por token ya está publicada, $1.40 / $4.40 por 1M de tokens, junto al GLM Coding Plan y ZCode. Lo que llegó el 26 de agosto fue, en su lugar, GLM 5.3 Flash, un modelo distinto y más pequeño que sí publicó pesos MIT, y es ese lanzamiento el que movió nuestra elección open-weight. Todo el detalle en nuestro desglose de GLM 5.3.
13 ago Google Gemini 3.7 Flash, las puntuaciones de programación suben y el precio se reduce a la mitad hasta $0.75 / $3.75, hasta enero Nuevo
Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026, 23 días después de 3.6 Flash y como su tercera versión Flash en menos de dos meses, mientras Gemini 3.5 Pro sigue sin salir. Las mejoras de programación son el punto: DeepSWE v1.1 sube del 49,0 % al 65,3 %, FrontierCode 1.1 Main del 34,4 % al 43,6 %, y AutomationBench casi se duplica, del 17,0 % al 30,4 %. Artificial Analysis lo puntúa con 56 en su índice v4.1.1 frente a 52 para 3.6 Flash, y lo sitúa primero de 182 modelos en velocidad de salida con 385,1 tokens por segundo, lo que lo coloca en la frontera de Pareto de inteligencia frente a tiempo. La ventana de contexto y el límite de salida de 64K no cambian respecto a 3.6 Flash, así que no se sacrificó nada. Dos advertencias pesan más que los benchmarks. La tarifa de $0.75 / $3.75 es introductoria y expira el 31 de diciembre de 2026, tras lo cual se duplica a $1.50 / $7.50, exactamente lo que costaba 3.6 Flash en su lanzamiento; Google también pasó 3.6 Flash a la misma tarifa, así que ahora cuestan lo mismo y la actualización es una decisión puramente de capacidad. Y el acceso de consumo va solo a través de Spark, que requiere Google AI Pro o Ultra y excluye el Espacio Económico Europeo, el Reino Unido, Suiza y Nigeria, así que la mayoría de los lectores europeos no pueden alcanzarlo en la aplicación de Gemini. El nivel gratuito de Gemini sigue recibiendo 3.6 Flash. El acceso por API no se ve afectado en ningún sitio. Todo el detalle en nuestro desglose de Gemini 3.7 Flash.
12 ago SpaceXAI Grok 4.6, el post-entrenamiento sube el Intelligence Index de 56 a 61 con $2 / $6 sin cambios Nuevo
SpaceXAI lanzó Grok 4.6 el 12 de agosto de 2026, y explícitamente no es un modelo base nuevo: la empresa mantuvo la base de Grok 4.5 y compró las mejoras con una tanda de entrenamiento suplementario más larga, trayectorias de ajuste fino regeneradas y aprendizaje por refuerzo en entornos agénticos. No se publicó ninguna arquitectura ni recuento de parámetros nuevos. Artificial Analysis lo puntúa con un Intelligence Index de 61, cinco puntos por encima de Grok 4.5, lo que lo empata con GPT-5.6 Sol en el tercer puesto, por detrás de Claude Opus 5 con 63 y Claude Fable 5 con 62, tal como estaba el índice ese mes; Claude Fable 5.1 se ha puesto desde entonces por encima de los tres con 66. Las cifras agénticas son más fuertes que el índice compuesto: un Elo de 1753 en GDPval-AA v2 solo por detrás de Opus 5, un 88,4 % en Terminal-Bench v2.1 y un 50,7 % en tau3-Banking. El argumento real es la eficiencia, a $0.84 por tarea de índice y unos 53 turnos y 0,5 mil millones de tokens de entrada en trabajos largos frente a unos 103 turnos y 2,0 mil millones de Opus 5. El precio no cambia, a $2 / $6 por 1M de tokens con entrada cacheada a $0.50, sobre la misma ventana de contexto de 500K tokens, pero hay una trampa que conviene conocer: si un prompt alcanza los 200.000 tokens, SpaceXAI vuelve a facturar la petición entera a $4 / $12, no solo el exceso. Un aviso sobre la cobertura de benchmarks, porque mucha cobertura ya lo ha enredado: Terminal-Bench v3.0 es una prueba distinta y mucho más dura que la v2.1, así que un 26 % en v3.0 y un 88,4 % en v2.1 son ambas afirmaciones ciertas sobre el mismo modelo. Está disponible desde el primer día en la API de SpaceXAI, en Cursor y Grok Build, y en socios como OpenRouter, Vercel y Cloudflare. Todo el detalle en nuestro desglose de benchmarks y precios de Grok 4.6.
5 ago Meta Muse Spark 1.2 y Muse Code, Intelligence Index de 51 a 57 con un $1.25 / $4.25 sin cambios, además de un agente de programación de terminal Nuevo
Meta lanzó Muse Spark 1.2 el 5 de agosto de 2026 junto a Muse Code, su primer agente de programación de terminal, que se ejecuta en macOS y Linux sin aplicación de escritorio y sin suscripción. Artificial Analysis puntúa el modelo con un Intelligence Index de 57 en su ajuste de razonamiento más alto en su índice actual v4.1.1, frente a 51 para la 1.1 y 43 para la versión de abril, y casi toda esa mejora es agéntica en lugar de conocimiento general; su Elo GDPval-AA v2 saltó de 1371 a 1631 mientras que Terminal-Bench v2.1 solo pasó del 78 % al 80 %. El precio no cambia a $1.25 / $4.25 por 1M de tokens sobre una ventana de contexto de 1M de tokens, y Meta añadió un nivel Contributor a $0.10 / $0.20, cerca de un 92 % más barato, a cambio de dejar que Meta entrene con tus prompts y completions. La disponibilidad se amplió del acceso previo solo para EE. UU. con el que se lanzó la 1.1 a un acceso global ampliado a través de Muse Code, la Meta Model API y OpenRouter. En los propios gráficos de lanzamiento de Meta, el modelo queda segundo tras Claude Opus 5 en los tres benchmarks de programación que publicó, con un 82,9 % frente al 86,7 % en Terminal-Bench 2.1.
3 ago Alibaba Qwen 3.8 (Qwen3.8-Max), buque insignia multimodal de 2,4 billones de parámetros ya disponible en general a $2 / $6 Nuevo
Alibaba puso Qwen3.8-Max en disponibilidad general el 3 de agosto de 2026, dos semanas después de presentarlo en el WAIC Shanghai, y cada cifra que faltaba en la vista previa ya tiene un número detrás. Corre 2,4 billones de parámetros totales con unos 95 000 millones activos por token en un diseño disperso de Mixture-of-Experts, admite texto, imágenes y vídeo, y confirma una ventana de contexto de 1M de tokens con hasta 128K tokens de salida. El precio de la API es de $2 / $6 por 1M de tokens, plano en todo el contexto en lugar de escalonado por longitud del prompt, con lecturas en caché a $0.25. La afirmación de «solo por detrás de Fable 5» ahora se divide limpiamente en dos: en el tablero de visión de Arena es #2 con 1305, solo detrás de Fable 5, pero en el tablero de texto es #5 con 1496, detrás de cuatro entradas de Anthropic. Ambas puntuaciones de Arena siguen marcadas como preliminares, y los open weights prometidos no han llegado. Mantenemos a Qwen 3.8 fuera de las elecciones clasificadas hasta que los pesos y la licencia lleguen de verdad.
31 jul DeepSeek DeepSeek V4-Flash 0731, mismo precio, mismo tamaño, Intelligence Index de 40 a 52
DeepSeek volvió a hacer post-training de V4-Flash y publicó el resultado el 31 de julio de 2026 como DeepSeek-V4-Flash-0731. Nada en la forma del modelo cambió: es el mismo Mixture-of-Experts de 284B total / 13B activos, el mismo contexto de 1M de tokens, la misma licencia MIT y, en aquel momento, los mismos $0.14 / $0.28 por 1M de tokens en la propia tarifa de DeepSeek. Eso último no sobrevivió al mes: DeepSeek subió sus dos modelos V4 unas cuatro veces el 16 de agosto y los dividió en horas punta y valle. Lo que se movió es la capacidad. Artificial Analysis ahora lo puntúa con un Intelligence Index de 52 en su índice v4.1.1, frente a 40 antes del nuevo post-training, con Agentic 45,7 y un 78,7 % en Terminal-Bench v2.1, lo que lo eleva de aproximadamente el decimotercero al tercer puesto en el campo abierto por detrás de Kimi K3 y GLM-5.2. Artificial Analysis lo midió en $0.11 por tarea de índice frente a $2.34 de Claude Opus 5, que es lo que le valió entonces la elección relación precio-rendimiento; la subida del 16 de agosto se la ha quitado desde entonces. Esa cifra se mide contra el endpoint que prueba Artificial Analysis, más caro que la propia tarifa de DeepSeek. Un límite honesto: la puntuación viene de una sola casa, y el modelo aún no tiene votos en ningún tablero de Arena.
31 jul MiniMax MiniMax H3, vídeo 2K con audio estéreo nativo desde $0.13 por segundo
MiniMax lanzó H3 (Hailuo 3.0) el 31 de julio de 2026 como un modelo de vídeo multimodal de propósito general que admite texto, imagen, vídeo y audio como entrada. Genera clips 2K de 4 a 15 segundos con audio estéreo nativo, admite transferencia de movimiento, generación guiada por referencia y edición generativa de vídeo, y se factura por segundo a $0.13 para 2K y $0.09 para 768p. Artificial Analysis lo sitúa #2 en su tablero de vídeo con 1241,5, a 3,3 Elo de Gemini Omni Flash. Hemos mantenido la corona de vídeo donde está: esa diferencia tiene un día y viene del único tablero que no se ha reproducido entre análisis, y el corte de texto a vídeo de Arena es anterior a H3 por completo, así que no ha ganado nada por votos. MiniMax publicó los pesos el 3 de agosto de 2026, pero solo en parte: H3-Base junto con los VAE y el codificador salieron en Hugging Face bajo la MiniMax H3 Community License, que exige una solicitud a los usuarios de EE. UU., la UE, el Reino Unido y Corea del Sur, mientras que H3-Context-IR y el escalador H3-Regenerate-2K se quedaron solo en la API. La salida 2K sobre la que se vende el modelo no está, por tanto, en la publicación abierta.
Finales de jul Thinking Machines Inkling Small, una cuarta parte del tamaño de Inkling con casi la misma puntuación
Thinking Machines siguió a su primer modelo open-weight con Inkling Small, un Mixture-of-Experts de 276B total / 12B activos bajo Apache 2.0 que enruta cada token a 6 de 256 expertos más 2 compartidos. Acepta entrada de texto, imagen y audio y devuelve texto, y Artificial Analysis lo puntúa con un Intelligence Index de 40 frente a 41 para el Inkling de tamaño completo, con cerca de una cuarta parte de los parámetros. Las fuentes no coinciden en la fecha exacta de publicación, así que no imprimimos ninguna. Los pesos, una compilación NVFP4 y las recetas de despliegue están todos en Hugging Face.
30 jul OpenAI Recorte de precios de GPT-5.6, Luna un 80 % más barato, Terra un 20 % más barato, Sol sin cambios
OpenAI recortó el precio de la API de sus dos niveles GPT-5.6 más baratos el 30 de julio de 2026, tres semanas después de que la familia alcanzara la disponibilidad general. Luna cayó un 80 % a $0.20 / $1.20 por 1M de tokens y Terra cayó un 20 % a $2 / $12, con las lecturas de entrada en caché bajando a $0.02 en Luna y $0.20 en Terra. El buque insignia Sol se quedó en $5 / $30, los prompts por encima de 272K tokens de entrada aún se facturan a 2x entrada y 1,5x salida, y ningún precio de suscripción de ChatGPT cambió, así que Free, Go a $8, Plus a $20, Pro a $100 y $200 y Business a $25-30 por asiento se quedan todos igual. El recorte deja a Luna en un Intelligence Index de 52 en el índice v4.1.1 de Artificial Analysis por unos $0.05 por tarea de índice, al mismo nivel que Gemini 3.6 Flash en puntuación y muy por debajo en coste.
24 jul Anthropic Claude Opus 5, nuevo #1 en Artificial Analysis, lidera tanto el Intelligence Index (63) como el Agentic Index (55.3)
Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, su cuarto modelo en menos de dos meses tras Mythos 5, Fable 5 y Sonnet 5. En la tabla de clasificación de Artificial Analysis es el modelo mejor clasificado en general, liderando tanto el Intelligence Index con 63 como el Agentic Index con 55,3, por delante de Fable 5 (62 / 52,8) y GPT-5.6 Sol (61 / 54,0). El precio de la API es de $5 / $25 por 1M de tokens, idéntico a Opus 4.8 y la mitad del coste de Fable 5, bajo el API id claude-opus-5. Añade un modo Fast que corre unas 2,5 veces más rápido al doble del precio base, más un ajuste de effort de low a high y un nuevo nivel max. También se lleva de forma clara el tablero GDPval-AA v2 de entregables profesionales de Artificial Analysis con 1858, por delante del 1746 de Fable 5. Arena lo ha valorado desde entonces en sus tableros, situándolo #1 en WebDev, image-to-WebDev, Document y el tablero Agent y #6 en texto, que es lo que le movió la corona de programación este mes. Es el modelo por defecto en Claude Max y el más fuerte en Claude Pro. Ten en cuenta que la afirmación de liderazgo de arriba ha quedado superada: Claude Fable 5.1 llegó el 1 de septiembre de 2026 y se llevó el Intelligence Index con 66 y el Agentic Index con 61, frente a 63 y 59 de Opus 5 en la lectura actual, y con ellos el tablero GDPval-AA v2, donde el Elo recalibrado sitúa a Fable 5.1 en 1853 frente al 1824 de Opus 5. Opus 5 conserva los dos tableros de programación de Arena y cuesta la mitad.
24 jul Sakana AI Fugu-Ultra v1.1, renovación del motor de orquestación con mejoras reportadas por el proveedor de hasta 7,9 puntos sobre v1.0 al mismo precio
Sakana AI lanzó Fugu-Ultra v1.1 el 24 de julio de 2026, una renovación de los modelos frontier dentro de su motor de orquestación TRINITY en lugar de un nuevo modelo base. El propio anuncio de Sakana afirma mejoras de hasta 7,9 puntos sobre v1.0 con el precio sin cambios, aunque no publica las puntuaciones de v1.0 lado a lado, así que trátalo como la cifra del proveedor. Todos los números de benchmark vienen del scaffolding propio de Sakana en lugar de pruebas independientes: en sus propios gráficos lidera sobre Opus 4.8, GPT-5.5 y Gemini 3.1 Pro, con un 73,7 % en SWE-Bench Pro, un 82,1 % en Terminal-Bench 2.1, un 93,2 % en LiveCodeBench y 95,5 en GPQA-Diamond. Aun así no arrasa en el campo: su 50,0 en Humanity's Last Exam es un empate por redondeo con el 49,8 de Opus 4.8. El precio no cambia respecto a v1.0 a $5 / $30 por 1M de tokens de entrada/salida (más $0.50 en caché), subiendo a $10 / $45 por encima de la marca de contexto de 272K tokens; la API es compatible con OpenAI con una ventana de contexto de 1M de tokens.
21 jul Google Gemini 3.6 Flash, salida más barata, más rápido, mismo Intelligence Index
Gemini 3.6 Flash era el modelo Flash más nuevo de Google cuando salió, y sigue siendo el que alcanza la aplicación gratuita de Gemini. La salida cae a $7.50 por 1M de tokens desde $9.00 mientras la entrada se mantiene en $1.50, así que el recorte es solo de salida. Google dice que «reduce el uso de tokens de salida en un 17 % respecto a 3.5 Flash», y hasta un 65 % en trabajo agéntico de largo horizonte como DeepSWE, así que el ahorro real por tarea es mayor que el precio de etiqueta. Artificial Analysis puntuó a 3.6 Flash y 3.5 Flash igual en v4.1, así que en su lanzamiento era más barato y rápido en lugar de más listo; en el índice actual v4.1.1, 3.6 Flash marca 52. Llegó junto a Gemini 3.5 Flash-Lite a $0.30 / $2.50, y está en vivo a través de la Gemini API en Google AI Studio y Android Studio, la Gemini Enterprise Agent Platform y la aplicación de Gemini para todos. Ojo: los precios de lanzamiento de arriba ya no son válidos. Cuando llegó Gemini 3.7 Flash el 13 de agosto, Google pasó 3.6 Flash a la misma tarifa introductoria de $0.75 / $3.75, y sigue siendo el modelo que sirve el nivel gratuito de Gemini. Google también anunció Gemini 3.5 Flash Cyber, pero ese no se ha lanzado: va a gobiernos y socios de confianza a través de CodeMender como piloto de acceso limitado.
16 jul Moonshot AI Kimi K3, 2,8B de parámetros, el mayor modelo open-weight jamás publicado (pesos lanzados el 27 de julio)
Moonshot AI lanzó Kimi K3 en la víspera del 16 de julio de 2026, su nuevo buque insignia y el sucesor de la línea K2, y luego publicó los open weights completos el 27 de julio de 2026. La tarjeta de modelo en Hugging Face confirma un diseño Mixture-of-Experts de 2,8 billones de parámetros con 104 000 millones de parámetros activos por token, una ventana de contexto de 1 048 576 tokens y entrada de texto, imagen y vídeo (sin audio). El razonamiento está siempre activo, y reasoning_effort ahora admite low, high o max, con max como predeterminado. Artificial Analysis sitúa a K3 en un Intelligence Index de 60, el más alto de cualquier modelo open-weight, y en Arena es #3 en el tablero Agent y #2 en WebDev por detrás de Claude Opus 5. El precio oficial de la API es de $3 / $15 por 1M de tokens con entrada en caché a $0.30, más $0.005 por cada llamada de búsqueda web exitosa. La descarga son 96 shards de safetensors y unos 1,56 TB bajo una licencia propia Kimi K3 License en lugar de MIT, así que el autoalojamiento es un trabajo multinodo; existe un nivel de chat básico gratuito en la aplicación de Kimi, con el uso agéntico más intenso medido en los planes de pago.
9 jul OpenAI GPT-5.6 Sol, Terra y Luna, familia de nueva generación en vivo en ChatGPT, Codex y la API
OpenAI abrió su familia GPT-5.6 a la disponibilidad general el 9 de julio de 2026, poniendo fin a la vista previa cerrada de dos semanas que empezó el 26 de junio tras una revisión de seguridad del gobierno de EE. UU. La gama va del menos al más capaz: Luna, un nivel rápido y de bajo coste; Terra, un modelo equilibrado para el día a día que OpenAI dice que iguala a GPT-5.5 a cerca de la mitad de coste; y Sol, el buque insignia, afinado para biología, química y ciberseguridad. GPT-5.6 se está desplegando ahora en ChatGPT, Codex y la API como modelo por defecto de OpenAI, con precios de API de lanzamiento de Sol $5 / $30, Terra $2.50 / $15 y Luna $1 / $6 por 1M de tokens; Terra y Luna se recortaron el 30 de julio de 2026 a $2 / $12 y $0.20 / $1.20, y el propio Sol se recortó a $4 / $20 el 21 de agosto de 2026. En los pocos benchmarks que OpenAI publicó, Sol logra un 88,8 % en Terminal-Bench 2.1 (91,9 % en su modo «ultra» de más cómputo) frente al 88,0 % de GPT-5.5, y 60,5 en HealthBench Professional; OpenAI notablemente retuvo las cifras habituales de SWE-bench Verified, GPQA y FrontierMath, y su ventana de contexto aún no se ha publicado oficialmente. Una advertencia: la propia system card de OpenAI y el evaluador externo METR señalaron un comportamiento de «scheming» elevado en Sol, incluido manipular una prueba de ingeniería de software a la tasa más alta que METR ha registrado jamás.
Pendiente Google Gemini 3.5 Pro, aún sin lanzar, meses de retraso según Bloomberg Retrasado
Gemini 3.5 Pro sigue siendo el mayor lanzamiento pendiente. Google lo anunció en el I/O el 19 de mayo junto a Gemini 3.5 Flash, pero solo Flash se lanzó, y el objetivo de junio se retrasó. Bloomberg informó el 16 de julio de 2026 de que el modelo lleva meses de retraso y se ha quedado corto respecto a los objetivos internos de Google, con la empresa aún trabajando para mejorar sus capacidades, en particular en programación. Ese es todo el panorama con fuentes. Google nunca ha confirmado públicamente una fecha de lanzamiento, y Google no ha publicado especificaciones finales como la ventana de contexto o los modos de razonamiento, así que trata las cifras que circulan como no confirmadas. Usa Gemini 3.7 Flash mientras tanto si trabajas por API, o Gemini 3.6 Flash si estás en la aplicación gratuita de Gemini, que sigue ejecutándolo; moveremos 3.5 Pro a la clasificación principal en cuanto se lance.
Elección de categoría, septiembre de 2026

Mejor IA para escritura

1
Claude Fable 5
Mejor escritura en general
2
Kimi K3
Ficción creativa
3
Claude Sonnet 5
Gratis para el día a día

La mejor IA para escritura es Claude Fable 5, el único modelo entre los tres primeros de los tres tableros independientes de escritura, con Claude Sonnet 5 como la elección de valor del plan gratuito y GPT-5.5 como alternativa para la escritura de negocios anclada en hechos. Fable 5 lidera la tabla de escritura creativa de Arena, encabeza LiveBench Language con 90,7 y queda tercero en EQ-Bench Creative Writing v3 por detrás de Kimi K3 y GPT-5.6 Sol. Ningún otro modelo está entre los tres primeros en más de uno de ellos. Es un cambio respecto al mes pasado, cuando Claude Sonnet 5 ocupaba este puesto por GDPval-AA; los tableros de preferencia no respaldan esa colocación, así que Sonnet 5 es ahora la elección de valor en lugar del líder de calidad. Fable 5 cuesta $10 / $50 por 1M de tokens y está incluido de forma permanente en Claude Max y Team Premium con cerca del 50 % de los límites de uso habituales. Si tu escritura es un entregable de trabajo en lugar de prosa, el tablero GDPval-AA v2 de entregables profesionales lo lidera ahora Claude Fable 5.1 con 1853, por delante de Claude Opus 5 con 1824 y de Fable 5 con 1723. Fable 5.1 llegó el 1 de septiembre como el modelo más capaz al mismo precio de $10 / $50, y gana a Fable 5 en todos los tableros que han medido a ambos, incluido Humanity's Last Exam con un 59,1 % frente al 55,5 %. No le hemos movido la corona porque esta elección descansa sobre la preferencia humana y ningún tablero de Arena lo ha valorado todavía. La traducción es una cuestión aparte con un ganador aparte, que analizamos en nuestra guía sobre la mejor IA para traducir.

ModeloMejor paraFortalezaDebilidadPrecio (por 1M de tokens)
Claude Fable 5Mejor escritura en general#1 Arena texto en general (1508.6), #1 LiveBench Language (90.7), #3 EQ-BenchLa opción más cara aquí$10 / $50
Claude Fable 5.1Máxima capacidad al mismo precio#1 Humanity's Last Exam (59,1 %), #1 GDPval-AA v2 (1853), #1 Intelligence Index (66)Sin votos en Arena todavía, así que sin valorar en los tableros de preferencia$10 / $50
Kimi K3Ficción creativa y voz#1 EQ-Bench Creative Writing (2377), 234 Elo por delante del segundoSolo #10 en Arena escritura creativa$3 / $15
Claude Sonnet 5Escritura gratuita para el día a díaGratis y por defecto en claude.ai, contexto 1M#53 Arena escritura creativa; 75,0 LiveBench Language$2 / $10, ahora permanente
Claude Opus 5Entregables profesionales ajustados de precio#2 GDPval-AA v2 con 1824, por delante de Fable 5 (1723)Por detrás de Fable 5 en Arena texto, por detrás de Fable 5.1 en GDPval-AA v2$5 / $25
GPT-5.5Escritura de negocios anclada en hechosMejoras documentadas de fiabilidad factual sobre GPT-5.4Los niveles de razonamiento están ahora marcados como obsoletos$5 / $30
Gemini 3.7 FlashBorradores en volumen a escalaLa salida más rápida de cualquier modelo medido (385,1 tok/s), Intelligence Index 56Ajustado a código más que a prosa; el precio introductorio se duplica el 1 de enero de 2027$0.75 / $3.75
Segundo puesto y alternativas: Kimi K3 es el segundo para ficción creativa y gana EQ-Bench de forma clara, Claude Sonnet 5 es el segundo en valor y el que usar si no pagas, Claude Fable 5.1 es la elección si quieres la máxima capacidad medida al mismo precio que Fable 5, Claude Opus 5 es la elección más barata para entregables profesionales, y Gemini 3.7 Flash es la elección para borradores en volumen, ahora el modelo más rápido medido y al mismo precio que 3.6 Flash.
Qué cambió este mes

La corona de escritura se queda con Claude Fable 5, pero el argumento a su favor se estrechó el 1 de septiembre. Anthropic lanzó Claude Fable 5.1, y se lleva Humanity's Last Exam con un 59,1 % frente al 55,5 % de Fable 5, el tablero GDPval-AA v2 con 1853 y el Intelligence Index con 66. Lo que no tiene es un solo voto en Arena, y esta corona descansa sobre los tableros de texto y de escritura creativa de Arena, donde Fable 5 sigue siendo #1 con 1508.6 en el corte del 1 de agosto. Fable 5.1 entra por tanto en la tabla como la opción más capaz al mismo precio de $10 / $50, y volvemos a probar la corona en cuanto Arena lo valore. Dos cifras que dimos el mes pasado también se han recalibrado: AA-Omniscience marca ahora 43 para ambos modelos Fable en lugar de 40, y Artificial Analysis mide a Fable 5 en Humanity's Last Exam con un 55,5 % en lugar de un 53,3 %.

Elección de categoría, septiembre de 2026

Mejor IA para chat & asistente diario

1
GPT-5.6
Por defecto de ChatGPT
2
Claude Fable 5
El mejor valorado
3
Claude Opus 5
Profundidad reflexiva

La mejor IA para el chat del día a día es GPT-5.6, y la razón honesta es el alcance en lugar de la posición en los tableros. Es el modelo que ChatGPT sirve por defecto a la mayor base de usuarios de la categoría, lo que lo convierte en el mejor asistente que la mayoría de la gente puede abrir de verdad. En preferencia humana pura no es el líder: GPT-5.6 Sol se sitúa #14 en la tabla de texto de Arena con 1482,8, donde Claude Fable 5 lidera con 1508.6. La mayoría de los usuarios de ChatGPT reciben el nivel equilibrado Terra, que OpenAI dice que iguala a GPT-5.5 y, desde el recorte de precios del 30 de julio de 2026, cuesta un 60 % menos. Está disponible dentro de ChatGPT (gratis con límites, Plus a $20/mes, Pro a $100/mes), a través de la API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), y empaquetado dentro de Fello AI junto a Claude, Gemini, Grok y DeepSeek. Una advertencia: la system card de OpenAI y el evaluador METR señalaron un comportamiento de «scheming» elevado en Sol, así que GPT-5.5 Instant sigue siendo la elección más segura para trabajo sensible a las alucinaciones.

ModeloMejor paraFortalezaDebilidadPrecio
GPT-5.6Chat diario, por defecto de ChatGPTEl asistente que la mayoría puede abrir; Terra iguala a GPT-5.5 a ~mitad de coste#14 en Arena texto; scheming señalado por METRGratis / $20/mes Plus; API $0.20 / $1.20 a $4 / $20
Claude Fable 5La conversación mejor valorada#1 en Arena texto en general (1508.6) y en 6 de 7 subcategoríasSin plan gratuito; acceso por créditos de uso en Pro$10 / $50 API
Claude Opus 5Respuestas reflexivas y matizadas#1 Artificial Analysis Intelligence Index (63) y Agentic Index (55.3)#6 en Arena texto, por detrás de Claude Fable 5$20/mes Pro, $5 / $25 API
GPT-5.5 InstantTrabajo diario sensible a las alucinaciones52,5 % menos afirmaciones alucinadas vs. 5.3 InstantLos niveles de razonamiento están ahora marcados como obsoletos$20/mes Plus; API $5 / $30
Gemini 3.6 FlashRápido, gratis, multimodalSigue siendo el modelo que sirve el nivel gratuito de Gemini, contexto 1M, #12 en Arena textoMás flojo en el razonamiento más difícil; 3.7 Flash lo supera al mismo precioGratis / $0.75 / $3.75 API
Fello AITodos los mejores modelos, una appChatGPT + Claude + Gemini + Grok + DeepSeek y más en Mac, iPhone y iPadEnrutado por la app, no directo$9.99/mes
Segundo puesto y alternativas: Claude Fable 5 es el segundo y el verdadero líder de preferencia, Claude Opus 5 es el segundo para uso diario reflexivo, Gemini 3.6 Flash es el segundo para rápido y gratis, y Grok 4.6 es la elección de nicho para días de noticias en vivo. Fello AI es la elección natural si quieres los mejores modelos en una app de Mac e iOS por $9.99/mes en lugar de hacer malabares con suscripciones.
Qué cambió este mes

GPT-5.6 mantiene la elección de chat por alcance, y la distancia con el líder de preferencia se amplió en lugar de cerrarse. En el corte del 1 de agosto Sol se sitúa #14 en Arena texto con 1482,8, bajando desde #11, mientras Claude Fable 5 lidera con 1508.6. Nada del producto cambió, así que la corona no se mueve: sigue tratándose de qué asistente puede abrir de verdad la mayoría de la gente.

Elección de categoría, septiembre de 2026

Mejor IA para imágenes

1
ChatGPT Images 2.0
Texto en imágenes
2
Reve 2.1
Diseño & 4K
3
Muse Image
Edición de imágenes

La mejor IA para la generación de imágenes es ChatGPT Images 2.0, y es la corona menos discutida de esta página. GPT Image 2 lidera el tablero de texto a imagen de Arena con 1385 Elo y su tablero de edición de imágenes con 1463, y Artificial Analysis lo pone primero en su propia arena de imagen con 1339,4. Es la elección natural siempre que tu imagen tenga que contener palabras legibles, en español o en otra escritura, y está incluido en ChatGPT Plus y Pro. Los segundos puestos han cambiado. Reve 2.1 (9 de julio) es el verdadero #2 en texto a imagen con 1302, y Reve 2.0 ahora se sitúa por detrás de él en los dos tableros. Muse Image de Meta es #3 en el tablero de texto a imagen de Arena y #2 en edición de imágenes, la mejor actuación que ha logrado ningún modelo de imagen de Meta. Nano Banana Pro de Google ya no es el segundo en general: en texto a imagen se clasifica entre #8 y #11, por debajo de su propio hermano más barato Nano Banana 2, aunque queda más arriba en edición de imágenes.

ModeloMejor paraFortalezaDebilidadPrecio
ChatGPT Images 2.0Imágenes con texto legible#1 texto a imagen (1385) y #1 edición de imágenes (1463)Menos fotorrealista que la línea de imagen de GeminiIncluido en ChatGPT Plus
Reve 2.1Diseño, tipografía, 4K nativo#2 texto a imagen con 1302, edición que preserva el diseñoEcosistema más pequeñoGratis / desde $7.99/mes
Muse ImageEdición de imágenes, ecosistema Meta#3 texto a imagen, #2 edición de imágenes (1407)Nuevo, herramientas escasas a su alrededorAplicación Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Retratos y productos fotorrealistasSupera a Nano Banana Pro en los dos tablerosMás flojo en texto dentro de la imagenAplicación Gemini / AI Studio
Seedream 5.0 ProTexto multilingüe + edición por regiones10+ idiomas incl. árabe RTL, edición con lazo y capasSin benchmarks independientes; incertidumbre de derechos de autorBytePlus / Magnific
Midjourney v8Arte estilizado, ilustraciónBase estética que la mayoría de los artistas prefierenMás flojo en texto dentro de la imagen$10-$120/mes
Grok ImagineNSFW / Spicy ModeLos límites más permisivosUn modelo más pequeño por detrás$30/mes SuperGrok
Segundo puesto y alternativas: Reve 2.1 es el segundo en general y la elección para diseño y tipografía, Muse Image es el segundo para editar una imagen que ya tienes, y Nano Banana 2 es la elección fotorrealista. Grok Imagine sigue siendo el único modelo frontier que permite contenido para adultos en Spicy Mode.
Qué cambió este mes

La corona de imagen no cambia y GPT Image 2 sigue liderando los tres tableros que seguimos, en Arena texto a imagen (1385), Arena edición de imágenes (1463) y la arena de imagen de Artificial Analysis (1339,4). La única incorporación es MAI-Image-2.5 de Microsoft, que se sitúa tercero en el tablero de imagen de Artificial Analysis con 1269,7 y tercero en el tablero de edición de imágenes de Arena, así que el tercer puesto ahora depende de qué casa leas.

Elección de categoría, septiembre de 2026

Mejor IA para vídeo

1
Gemini Omni Flash
#1 en los dos tableros de vídeo
2
MiniMax H3
2K + audio nativo
3
Dreamina Seedance 2.0
El rival más cercano

La mejor IA para la generación de vídeo es Gemini Omni Flash, que lidera el tablero de texto a vídeo de Arena con 1527 Elo, 45 puntos completos por delante del segundo, y también encabeza la arena de vídeo de Artificial Analysis. Es #1 en las dos casas, algo que ningún otro modelo de vídeo logra. El precio va de $1.50 de entrada y $17.50 por 1M de tokens de salida de vídeo, lo que sale a unos $0.10 por segundo de vídeo terminado, y admite edición conversacional. El único límite real es la duración: Omni Flash genera clips de 10 segundos. Si necesitas tomas más largas, Veo 3.1 sigue siendo la herramienta adecuada dentro de la aplicación de Gemini, AI Studio y Vertex AI, con audio nativo y salida 1080p. Esto reemplaza a Veo 3.1 en lo alto de la categoría; Veo 3.1 es un buen modelo pero no el líder, con su mejor variante en #6 del tablero de texto a vídeo de Arena. El aspirante a vigilar es MiniMax H3 (31 de julio), que genera clips 2K de 4 a 15 segundos con audio estéreo nativo y se factura por segundo desde $0.13 a 2K, ya #2 en el tablero de vídeo de Artificial Analysis con 1241,5. No movemos la corona por eso: el margen es de 3,3 Elo en el único tablero que no se ha reproducido entre análisis, y H3 sigue sin votos en el tablero de texto a vídeo de Arena.

ModeloMejor paraFortalezaDebilidadPrecio
Gemini Omni FlashMejor vídeo de IA en general#1 en los dos tableros de vídeo (1527 Arena), edición conversacionalLimitado a generaciones de 10 segundos~$0.10/s; aplicación Gemini / AI Studio
MiniMax H3Clips 2K con audio nativo4-15 s a 2K, audio estéreo nativo; #2 en AA vídeo (1241.5)Aún sin votos en Arena; los pesos abiertos excluyen el escalador 2K y exigen solicitud en EE. UU., la UE, el Reino Unido y Corea del Sur$0.13/s a 2K
Dreamina Seedance 2.0El rival más cercano#2 texto a vídeo (1482) y #1 en imagen a vídeo con audio (1198)Ecosistema ByteDance, acceso occidental limitadoDreamina / BytePlus
Muse VideoVídeo en el ecosistema Meta#3 texto a vídeo con 1459El más nuevo del grupo, herramientas escasasAplicación Meta AI
Veo 3.1Clips de producción más largosAudio nativo, 1080p, fuerte consistencia física#6 en Arena vídeo, no el líder de calidadGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboIteración rápida a menor coste4K nativo, 60fps, clips de 15 segundos; Turbo salió el 17 de junioFuera del top 16 en Arena texto a vídeoDesde $10/mes
Luma Ray 3Escenas fotorrealistasFuerte realismo para paisajesComunidad más pequeñaGratis / desde $9.99/mes
Segundo puesto y alternativas: Dreamina Seedance 2.0 es el segundo en general y supera a Omni Flash en imagen a vídeo con audio, donde lidera 1198 frente a 1191, aunque Omni Flash sigue liderando la variante sin audio. Muse Video es tercero, y Veo 3.1 es la elección cuando 10 segundos no bastan. OpenAI retiró la aplicación de consumo Sora 2 el 26 de abril de 2026 y solo queda la API para desarrolladores, hasta el 24 de septiembre de 2026.
Qué cambió este mes

Gemini Omni Flash mantiene la corona de vídeo, y sigue siendo #1 en los dos tableros, con 1527,5 en Arena y 1244,8 en Artificial Analysis. MiniMax H3 (31 de julio) entra como aspirante en #2 del tablero de vídeo de Artificial Analysis (1241,5), a 3,3 Elo, y supera a Omni Flash en especificaciones con salida 2K, clips de hasta 15 segundos y audio estéreo nativo. Mantenemos la corona porque ese margen es de 3,3 Elo en un solo tablero y H3 sigue sin votos en el tablero de texto a vídeo de Arena. MiniMax sí abrió los pesos el 3 de agosto, pero solo H3-Base junto con los VAE y el codificador; el escalador 2K sobre el que descansa su ventaja de especificaciones se quedó solo en la API.

Elección de categoría, septiembre de 2026

Mejor IA para programación

1
Claude Opus 5
#1 Arena WebDev
2
Claude Fable 5
Largo horizonte más difícil
3
Kimi K3
Apps web y agentes

La mejor IA para programación es Claude Opus 5, y gana en los dos tableros donde los desarrolladores votan sobre el resultado terminado en lugar de un script midiendo un harness. Es #1 en el tablero WebDev de Arena con 1,702.9 y #1 en image-to-WebDev con 1,668.6, en cortes de votos del 1 de agosto y el 31 de julio. El precio es la segunda mitad del argumento: Opus 5 corre a $5 / $25 por 1M de tokens frente a los $10 / $50 de Claude Fable 5, y Artificial Analysis lo mide en $2.34 por tarea de índice frente a los $3.14 de Fable 5. La propia documentación de Anthropic dice a los desarrolladores que empiecen con Opus 5 para programación agéntica compleja y reserven Fable 5 para cargas que necesiten la máxima capacidad disponible. Claude Fable 5 es el segundo y sigue siendo la elección para el trabajo de largo horizonte más difícil, en #4 en WebDev (1,630.7) y #2 en image-to-WebDev (1,625.7); su sucesor del 1 de septiembre, Claude Fable 5.1, es el modelo más fuerte en los benchmarks de harness al mismo precio, y alcanza un 55,8 % en Terminal-Bench 4.0 frente al 52,3 % de Opus 5 y al 42,0 % de Fable 5 según las cifras del propio Anthropic, pero Arena todavía no tiene votos para él. El aspirante es Kimi K3, que se lleva el #2 en WebDev con 1,675.5 y el #3 en el tablero Agent de Arena, el programador open-weight más fuerte en los tableros, aunque autoalojarlo significa 1,56 TB de pesos. En el Coding Index de Artificial Analysis no es un barrido de Claude: GPT-5.6 Sol (xhigh) lidera con 78,3 con Opus 5 (max) en 78,0, lo bastante cerca para llamarlo empate. El aspirante serio más barato es ahora GLM 5.3 Flash a $0.15 / $0.50 bajo MIT, después de que la subida de DeepSeek del 16 de agosto llevara a V4-Flash 0731 a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, y la mejor relación calidad-precio en la propia frontier es Grok 4.6, que marca un 88,4 % en Terminal-Bench v2.1 y $0.84 por tarea de índice a $2 / $6.

ModeloMejor paraFortalezaDebilidadPrecio (por 1M de tokens)
Claude Opus 5Mejor programación en general#1 Arena WebDev (1,702.9) y #1 image-to-WebDev (1,668.6); $2.34 por tarea de índiceEl Coding Index de Artificial Analysis tiene a GPT-5.6 Sol un pelín por delante$5 / $25
Claude Fable 5El trabajo agéntico de largo horizonte más difícil#2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1MEl más caro; el Coding Index de Artificial Analysis lo pone 7º$10 / $50
Claude Fable 5.1Programación agéntica de máxima capacidad#1 Intelligence Index (66) y #1 Agentic Index (61); 55,8 % en Terminal-Bench 4.0 (Anthropic)Sin votos en Arena todavía; el doble de caro que Opus 5$10 / $50
Kimi K3Construcción de apps web y agentes#2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index abierto más alto (60)1,56 TB para autoalojar$3 / $15
GPT-5.6 SolBuque insignia de OpenAI, programación agéntica#1 Artificial Analysis Coding Index con 78,3 (xhigh)Ausente del tablero oficial de Terminal-Bench; manipulación de evals señalada por METR$4 / $20
Muse Spark 1.2Programación agéntica barataIntelligence Index 57 a $1.25 / $4.25; 80 % en Terminal-Bench 2.1 (Artificial Analysis)Segundo tras Opus 5 en los tres gráficos de programación propios de Meta (82,9 % vs. 86,7 %); Scale SEAL solo ha valorado la 1.1$1.25 / $4.25
Grok 4.6Programador barato de buen valor88,4 % en Terminal-Bench v2.1 e Intelligence Index 61, a $0.84 por tarea de índiceLos prompts desde 200K tokens refacturan la petición entera al doble; mayor tasa de alucinación$2 / $6
Gemini 3.7 FlashProgramación de agentes a escalaIntelligence Index 56, 65,3 % DeepSWE v1.1, 85,8 % Terminal-Bench 2.1, 385,1 tok/s14,9 % en el más difícil Terminal-Bench 3.0; el precio introductorio se duplica el 1 de enero de 2027$0.75 / $3.75
GLM 5.3 FlashMejor programador open-weight que puedes alojarIntelligence Index 57; DeepSWE v1.1 63,4 y Terminal Bench 2.1 84,3 (cifras del fabricante); MIT, 320B/18B activosKimi K3 lo supera; las cifras de programación son del fabricante y todavía no tiene votos en ArenaOpen weights (MIT)
Segundo puesto y alternativas: Kimi K3 es el segundo en el tablero WebDev de Arena y la elección si quieres los open weights más fuertes, Claude Fable 5 es el segundo para el trabajo de largo horizonte más difícil, con Claude Fable 5.1 como la versión más capaz de esa misma elección al mismo precio, GPT-5.6 Sol es el segundo en el compuesto de Artificial Analysis, y GLM 5.3 Flash es la elección open-weight para equipos que lo alojan ellos mismos, con un Intelligence Index de 57 bajo MIT puro, y conserva ese puesto ahora que los pesos del propio GLM 5.3 han llegado bajo una licencia propia de Z.ai y con más del doble de tamaño. Dentro de los IDE, Cursor con Claude sigue siendo la combinación más popular y Claude Code es la elección natural si vives en la terminal.
Qué cambió este mes

La corona de programación se movió a Claude Opus 5. Arena terminó de valorarlo, y quedó primero en los dos tableros de programación, WebDev con 1,702.9 e image-to-WebDev con 1,668.6, con Claude Fable 5 cuarto y segundo. Son tableros por votos con cortes publicados, así que la corona ahora descansa sobre comparaciones humanas en lugar de sobre un solo harness, y Opus 5 lo hace a la mitad del precio de Fable 5. Fable 5 pasa a ser el segundo para el trabajo de largo horizonte más difícil, y Kimi K3 sigue siendo el aspirante en #2 en WebDev. Muse Spark 1.2 de Meta llegó el 5 de agosto y no cambia eso, porque en los propios gráficos de Meta queda segundo tras Opus 5 en cada benchmark de programación que publicó. Grok 4.6 (12 de agosto) tampoco se lleva la corona, pero es el modelo a vigilar por coste: alcanza un 88,4 % en Terminal-Bench v2.1 y termina los trabajos agénticos largos en aproximadamente la mitad de turnos que Opus 5, a $2 / $6 frente a $5 / $25. Justo después llegaron otros dos lanzamientos centrados en programación. Gemini 3.7 Flash (13 de agosto) sustituye a 3.6 Flash en esta tabla por su salto del 49,0 % al 65,3 % en DeepSWE v1.1 a la mitad del precio anterior, y GLM 5.3 (14 de agosto) firma la mayor mejora agéntica del mes, Terminal-Bench 3.0 de 4,6 a 28,3, pero salió sin pesos descargables. Z.ai cerró el mes abriendo otro modelo en su lugar: GLM 5.3 Flash (26 de agosto) llegó bajo MIT el primer día con un Intelligence Index de 57, y le quita a GLM-5.2 el puesto open-weight de programación. Los últimos días del mes trajeron después otros tres lanzamientos abiertos: los pesos del propio GLM 5.3 el 28 de agosto bajo una licencia propia en lugar de MIT, Qwen3.8-Flash-Next de Alibaba el 26 de agosto como anticipo de la arquitectura Qwen4, y Hy4 Preview de Tencent, de 770B, el 28 de agosto bajo Apache 2.0. Ninguno tiene todavía una valoración independiente de programación, así que ninguno mueve esta tabla. Anthropic abrió después septiembre el día 1 con Claude Fable 5.1, que lidera el Intelligence Index y el Agentic Index de Artificial Analysis y marca un 55,8 % en Terminal-Bench 4.0 frente al 52,3 % de Opus 5, pero Arena no lo ha valorado, así que la corona se queda donde están los votos.

Elección de categoría, septiembre de 2026

Mejor IA para creatividad

1
Grok 4.6
Menos límites
2
Claude Fable 5
Prosa de máxima calidad
3
Kimi K3
Ficción y voz

La mejor IA para el trabajo creativo sin filtros y a la última es Grok 4.6, y queremos ser exactos sobre por qué. Esta elección es sobre el producto, no sobre la calidad de la prosa. Grok lleva las menos restricciones de contenido de cualquier modelo frontier y la única integración nativa con X en tiempo real, lo que lo convierte en el único modelo que se involucrará con encargos atrevidos, de actualidad o deliberadamente provocadores que los demás rechazan. Es el modelo por defecto en la aplicación de Grok para suscriptores de SuperGrok y X Premium+ a $30/mes. No es el mejor escritor, y los tableros fueron contundentes con su predecesor: Grok 4.5 se situaba #33 en EQ-Bench Creative Writing y #41 en la tabla de escritura creativa de Arena, perdiendo en ambas ante el más antiguo Grok 4.20-beta1. Ninguna de las dos tablas de escritura creativa ha valorado aún a Grok 4.6 y, dado que SpaceXAI orientó este lanzamiento a la programación y al trabajo agéntico más que a la prosa, no damos por hecho que se haya movido. Si eliges solo por calidad de salida, Claude Fable 5 gana de forma clara en #1 en Arena escritura creativa, y Kimi K3 gana EQ-Bench. Elige Grok 4.6 por lo que te deja crear, no por lo bien que escribe.

ModeloMejor paraFortalezaDebilidadPrecio
Grok 4.6Sin filtros, con opinión, a la últimaMenos restricciones de contenido, anclaje nativo en X en tiempo realLas tablas de escritura creativa aún no lo han valorado; Grok 4.5 estaba #33 EQ-Bench, #41 Arena$30/mes SuperGrok
Claude Fable 5Prosa creativa de máxima calidad#1 Arena escritura creativa, #1 LiveBench LanguageLímites cautelosos ante encargos atrevidos$10 / $50 API
Kimi K3Ficción y voz distintiva#1 EQ-Bench Creative Writing con 2377Solo #10 en Arena escritura creativa$3 / $15
Claude Opus 5Creatividad estructurada de formato largoMantiene hilos largos y se autoedita; Intelligence Index 63, solo por detrás de Claude Fable 5.1El más cauteloso del grupo$20/mes Pro; $5 / $25 API
Gemini 3.1 ProCreatividad multimodalFuerte cadena de texto, imagen y vídeoCuotas dentro de la aplicación de GeminiGratis / $2.00-$4.00 API entrada
Grok Imagine (Spicy Mode)NSFW / creatividad para adultosLa generación de imágenes más permisivaCaso de uso de nicho$30/mes SuperGrok
Segundo puesto y alternativas: Claude Fable 5 es el segundo y la elección correcta si la calidad importa más que la libertad, Kimi K3 es la elección para ficción, y Claude Opus 5 es la elección para proyectos creativos que se extienden a lo largo de muchos turnos. Para trabajo creativo para adultos, Grok Imagine Spicy Mode sigue siendo la única opción de nivel frontier.
Qué cambió este mes

Grok mantiene esta elección, ahora con Grok 4.6, que el 12 de agosto sustituyó a Grok 4.5 como buque insignia de SpaceXAI. Nada ha cambiado en su permisividad ni en su acceso en vivo a X, que es en lo que se apoya esta elección. El modelo de debajo es bastante más fuerte, cinco puntos arriba hasta un Intelligence Index de 61, pero esa ganancia aterrizó en programación y trabajo agéntico, no en la prosa, y ninguna tabla de escritura creativa ha valorado aún a Grok 4.6. Claude Fable 5 sigue siendo el modelo que usar cuando quieres la mejor escritura.

Elección de categoría, septiembre de 2026

Mejor IA para precisión & investigación

1
Gemini 3.1 Pro
98 % ARC-AGI-1
2
Claude Fable 5
Búsqueda anclada
3
GPT-5.6 Sol
Razonamiento novedoso

La mejor IA para precisión e investigación es Gemini 3.1 Pro. Su resultado más fuerte es en ARC-AGI-1 de ARC Prize, donde puntúa un 98 % e iguala al panel humano, y lo hace a $0.52 por tarea. Esa combinación es el argumento: varios modelos están cerca en capacidad, ninguno lo iguala en coste para trabajo factual fiable. Lo empareja con anclaje nativo en Google Search, que es lo que quieres cuando la respuesta tiene que ser actual en lugar de simplemente plausible. También puntúa un 94,1 % en GPQA Diamond, donde GPT-5.6 Sol ahora lo iguala en lugar de quedar por detrás, y un 44,4 % en Humanity's Last Exam, y encabeza el tablero HLE de Scale SEAL con 46,44. Hemos descartado el marco anterior de ARC-AGI-2: su 77,1 % sigue siendo correcto, pero el tablero se ha movido y esa puntuación ahora lo sitúa alrededor del puesto 14. Dos advertencias honestas. En búsqueda anclada en concreto, la tabla de búsqueda de Arena la lidera Anthropic, no Google, con Gemini 3.1 Pro con anclaje en #7. Y en razonamiento novedoso, GPT-5.6 Sol lidera ARC-AGI-2 y Claude Opus 5 lidera ARC-AGI-3 con un 30 %, cerca de 3,75 veces el siguiente mejor modelo. No movimos la corona a Opus 5 porque Artificial Analysis mide su tasa de alucinación en un 50 % y lo sitúa por debajo de Fable 5 en AA-Omniscience, un tablero cuya cima comparte ahora Claude Fable 5.1.

ModeloMejor paraBenchmark claveDebilidadPrecio
Gemini 3.1 ProTrabajo factual barato y fiable98 % ARC-AGI-1 (iguala al panel humano) a $0.52/tarea, 94,1 % GPQA (igualado por Sol)ARC-AGI-2 77,1 % ahora ~14º; #7 en Arena búsqueda$2.00-$4.00 / $12.00-$18.00 (escalonado)
Claude Fable 5Búsqueda anclada#1 y #3 en la tabla de búsqueda de Arena, por delante de GoogleNingún nivel barato único$10 / $50 (Fable 5)
GPT-5.6 SolRazonamiento novedoso#1 ARC-AGI-2 con 92,5 %, contra un panel humano del 100 %Scheming señalado por METR$4 / $20
Claude Opus 5Los problemas inéditos más difíciles#1 ARC-AGI-3 con 30 %, ~3,75 veces el siguiente modelo (ARC Prize)Artificial Analysis mide una tasa de alucinación del 50 %$5 / $25
Qwen 3.7 MaxPrecisión frontier a precio de valor92,4 GPQA Diamond, 200 solicitudes gratis/díaSolo API, sin front-end de chat$1.25 / $3.75 promo; $2.50 / $7.50 lista
Claude Opus 4.6Honestidad bajo presión#1 en el tablero MASK de Scale SEAL con 96,28; Anthropic ocupa el top 5Reemplazado como buque insigniaModelo legacy de Anthropic
Segundo puesto y alternativas: los modelos de Anthropic son el segundo para búsqueda anclada y arrasan en el tablero de honestidad bajo presión, GPT-5.6 Sol es el segundo para razonamiento novedoso, y Qwen 3.7 Max es la elección de valor en el frontier.
Qué cambió este mes

Gemini 3.1 Pro mantiene la corona de precisión, pero su cifra estrella ya no es una ventaja. Su puntuación de GPQA Diamond se recalibró a 94,1 % y GPT-5.6 Sol ahora lo iguala exactamente, así que la corona descansa sobre el resultado de ARC-AGI-1 a $0.52 por tarea más el anclaje de Search en lugar de sobre GPQA. Esta es la siguiente corona que volvemos a probar, y los tableros que miden con qué frecuencia un modelo simplemente se equivoca se movieron el 1 de septiembre. Claude Fable 5.1 tiene ahora la mayor precisión factual que Artificial Analysis ha medido, un 67 % frente al 65 % de Claude Fable 5, y encabeza Humanity's Last Exam con un 59,1 % frente al 55,5 %. El propio índice AA-Omniscience marca 43 para ambos modelos, por encima del 40 que dimos para Fable 5 el mes pasado, porque 5.1 compra su precisión extra con una tasa de intento más alta en las preguntas que no sabe responder.

Elección de categoría, septiembre de 2026

Mejor IA para resolución de problemas

1
GPT-5.6 Sol
Buque insignia STEM
2
Claude Opus 5
Cadenas agénticas
3
GPT-5.5 Pro
FrontierMath verificado

La mejor IA para la resolución de problemas difíciles es GPT-5.6 Sol, y es la corona mejor respaldada de esta página. Se lleva el #1 en LiveBench Mathematics con 96,2, el #1 en LiveBench Reasoning con 91,7 y el #1 en ARC-AGI-2 con un 92,5 %, lo más cerca que ningún modelo ha llegado del panel humano del 100 %. Tres casas distintas lo ponen primero en las tareas de razonamiento que importan, que es más acuerdo del que produce cualquier otra categoría de esta página. OpenAI aún no ha publicado la puntuación de FrontierMath de Sol, así que la marca verificada de OpenAI sigue siendo el 39,6 % de GPT-5.5 Pro en FrontierMath Tier 4, y encajaremos el número de Sol en el momento en que se haga público. Qwen 3.7 Max es la alternativa de valor para problemas de estilo competición con 97,1 en el índice HMMT de febrero de 2026 y 44,5 en Apex, a una fracción del coste de ChatGPT Pro, y ahora incluye 200 solicitudes de modelo gratis al día. Claude Opus 5 es la alternativa para cadenas largas de razonamiento agéntico, con 59 en el Agentic Index de Artificial Analysis, segundo tras el 61 de Claude Fable 5.1, y #1 en ARC-AGI-3 de ARC Prize con un 30 %, cerca de 3,75 veces el siguiente mejor modelo.

ModeloMejor paraBenchmark claveDebilidadPrecio
GPT-5.6 SolLas matemáticas, la ciencia y el razonamiento más difíciles#1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (92,5 %)FrontierMath aún sin publicar; scheming señalado por METR$100/mes ChatGPT Pro; API $4 / $20
Claude Opus 5Cadenas largas de razonamiento agéntico#2 Agentic Index (59), #1 ARC-AGI-3 (30 %)Segundo en LiveBench Reasoning; tasa de alucinación del 50 %$5 / $25
GPT-5.5 ProLíder verificado de FrontierMath39,6 % FrontierMath Tier 4Reemplazado por Sol como buque insignia$100/mes ChatGPT Pro
Qwen 3.7 MaxMatemáticas de competición con presupuesto ajustado97,1 HMMT 2026 feb, 44,5 Apex, 200 solicitudes gratis/díaSolo API$1.25 / $3.75 promo; $2.50 / $7.50 lista
Claude Fable 5Matemáticas dentro de un flujo de programación#1 en la subcategoría de matemáticas de Arena (1543), 96,0 LiveBench MathematicsLa opción más cara aquí$10 / $50
GLM 5.3 FlashResolución de problemas open-weightIntelligence Index 57 bajo MIT, cuatro puntos por encima de GLM-5.2 con menos de la mitad de tamaño; 320B/18B activos, contexto 1MNecesita un servidor multi-GPU, no una estación de trabajo; GLM 5.3 puntúa más alto según las propias cifras de Z.ai y se puede descargar desde el 28 de agosto, pero con más del doble de tamaño y bajo una licencia propiaOpen weights (MIT)
Segundo puesto y alternativas: Claude Opus 5 es el segundo y la elección natural para razonamiento agéntico de cadena larga, Claude Fable 5 es el segundo en el tablero de matemáticas de Arena, Qwen 3.7 Max es la elección de valor, y GLM 5.3 Flash es la elección open-weight.
Qué cambió este mes

GPT-5.6 Sol mantiene esta corona, y sumó un segundo argumento. Sol ahora también lidera el Terminal-Bench v2.1 de Artificial Analysis con un 89,5 % y su Coding Index con 78,3, e iguala a Gemini 3.1 Pro en GPQA Diamond con un 94,1 %. Claude Opus 5 sigue siendo la alternativa de razonamiento agéntico por la fuerza de ARC-AGI-3. El 1 de agosto OpenAI llamó a su próxima familia de modelos Astra y publicó diez nuevos resultados matemáticos de una versión interna, aunque Astra está sin lanzar y no tiene fecha, precio ni disponibilidad. Claude Fable 5.1 de Anthropic llegó el 1 de septiembre y le quitó a Opus 5 el Agentic Index, 61 frente a 59, lo que cambia la cifra de apoyo de la alternativa, no la corona.

Elección de categoría, septiembre de 2026

Mejor agente de IA

1
Gemini Spark
Nube 24/7
2
Claude Cowork
IA de escritorio
3
ChatGPT Codex
Agente de programación

El mejor agente de IA ahora mismo es Gemini Spark para trabajo residente en la nube 24/7 y Claude Cowork para trabajo residente en el escritorio, con ChatGPT Codex como alternativa para agentes de programación y los agentes de navegador de clase OpenAI Operator como alternativa para tareas web. Los agentes de IA son la categoría que más rápido se mueve de 2026: cada proveedor de primer nivel lanza ahora un producto de agente, y la elección práctica es entre agentes que viven en la nube (se ejecutan mientras tu portátil está cerrado) y agentes que viven en tu escritorio (manejan tus apps directamente). Gemini Spark se lanzó en el Google I/O el 19 de mayo de 2026 y es el primer agente en la nube 24/7. Claude Cowork alcanzó la disponibilidad general el 9 de abril de 2026 y funciona como un agente de escritorio que maneja tus apps locales. ChatGPT Codex Mobile (14 de mayo) es la elección para trabajo de agente de programación. Lee la comparativa completa Gemini Spark vs. Claude Cowork.

AgenteMejor paraDónde se ejecutaFortalezaPrecio
Gemini SparkTareas en la nube 24/7, flujos de WorkspaceVM de Google Cloud (siempre activa)Primer agente 24/7 real, integración profunda con Workspace$99.99/mes Google AI Ultra
Claude CoworkEscritorio, manejo de apps, diseño + códigoTu escritorio Mac/WindowsManeja apps locales, ve tu pantalla$20/mes Claude Pro
ChatGPT Codex MobileAgente de programación en el móvilNube de OpenAI + iOS/AndroidAprobar diffs y redirigir el trabajo desde el móvilIncluido en los planes de ChatGPT
Grok Agentic (Grok 4.6)Investigación en tiempo real, scraping de XNube de SpaceXAIIntegración nativa con X; Elo de 1755 en GDPval-AA v2$30/mes SuperGrok
OpenAI de clase OperatorTareas de navegador, formularios webNube de OpenAI + tu navegadorAutomatización webChatGPT Pro
Segundo puesto y alternativas: Claude Cowork es el segundo en general y la elección natural cuando quieres el agente en tu máquina manejando tus apps. ChatGPT Codex Mobile es el segundo para agentes de programación. Grok Agentic es la elección de nicho para investigación en tiempo real.
Qué cambió este mes

No se lanzaron nuevos agentes de consumo, y Muse Code de Meta (5 de agosto) es una herramienta de terminal para desarrolladores en lugar de una de consumo, así que la elección entre Gemini Spark (nube) y Claude Cowork (escritorio) sigue guiando la mayoría de las decisiones sobre agentes para usuarios individuales. La capa de modelo por debajo se movió de nuevo: Claude Fable 5.1 (1 de septiembre) lidera ahora el Agentic Index de Artificial Analysis con 61, por delante de Claude Opus 5 con 59, y encabeza el tablero GDPval-AA v2 con 1853 frente al 1824 de Opus 5. Opus 5 sigue siendo el modelo sobre el que la mayoría de equipos debería construir, a $5 / $25, la mitad del precio de Fable 5.1, y encabeza el tablero Agent de Arena, con Kimi K3 en tercer lugar. Para equipos que construyen sus propios agentes, Muse Spark 1.2 de Meta (5 de agosto) es una opción agent-native barata a $1.25 / $4.25 cuyo Elo agéntico GDPval-AA v2 saltó de 1371 a 1631, aunque Scale SEAL solo ha valorado la 1.1 más antigua, que lidera su tablero de uso de herramientas MCP Atlas con 88,1. GLM 5.3 Flash (26 de agosto, MIT) es ahora el modelo de agente open-weight que alojaríamos, con un Intelligence Index de 57 y AutomationBench 48,8 en el propio gráfico de Z.ai, donde Claude Opus 4.8 marca 41,0, aunque todavía no tiene votos en Arena; el registro independiente lo conserva GLM-5.2, en #5 del tablero Agent de Arena. Grok 4.6 (12 de agosto) es aquí la nueva historia de coste más que un producto de agente nuevo: marca un Elo de 1755 en GDPval-AA v2, que las entradas de septiembre han empujado al quinto puesto entre modelos distintos, y Artificial Analysis mide que termina los trabajos de largo horizonte en unos 53 turnos y 0,5 mil millones de tokens de entrada frente a unos 103 turnos y 2,0 mil millones de Opus 5, a $0.84 por tarea de índice.

Fello AI funcionando en Mac, iPhone y iPad
Todos los mejores modelos de IA, una app

Los modelos líderes como ChatGPT, Claude y Gemini, juntos en Mac, iPhone y iPad.

Gratis para empezar, 4,7★ en más de 27 000 reseñas.

Descargar Fello AI

Guía de uso, septiembre de 2026

Mejor IA para estudiantes

1
GPT-5.5 Free
Ensayos & investigación
2
Gemini 3.6 Flash
STEM + PDF
3
Claude Sonnet 5
Escritura & edición

La mejor IA para estudiantes es GPT-5.5 Free dentro de ChatGPT para trabajo de curso general y Gemini 3.6 Flash Free dentro de la aplicación de Gemini para STEM y estudio multimodal, con Qwen 3.7 Max como alternativa por API para conjuntos de problemas más difíciles (200 solicitudes gratis al día) y Claude Opus 5 como alternativa para editar ensayos. La mayoría de los estudiantes no necesitan pagar: el nivel gratuito de ChatGPT ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible), Gemini 3.6 Flash está en la aplicación gratuita de Gemini y en AI Studio, Claude Sonnet 5 es el nuevo Claude gratuito por defecto, y DeepSeek V4 es gratis en el sitio de chat de DeepSeek. Para el desarrollo paso a paso en las matemáticas más difíciles, GPT-5.6 Sol es el nuevo buque insignia de OpenAI (su puntuación de FrontierMath aún no se ha publicado, con el 39,6 % verificado de GPT-5.5 Pro en FrontierMath Tier 4 como marca actual), aunque ambos son solo de pago; Qwen 3.7 Max es la alternativa de valor con 97,1 en HMMT 2026 febrero con precio de API de $1.25 / $3.75 en su promo del 50 % actual ($2.50 / $7.50 lista).

TareaMejor modeloPor qué¿Gratis?Alternativa
Ensayos & trabajo de cursoGPT-5.5Gratis en ChatGPT, fiabilidad factual mejorada vs. 5.4Claude Sonnet 5 (Claude gratis)
Resolución de problemas STEMGPT-5.6 Sol / Qwen 3.7 MaxNuevo buque insignia STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 febPro de pago / Qwen API de pagoGemini 3.6 Flash (gratis)
Investigación & precisiónGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarea, anclaje nativo en Google SearchSí (aplicación Gemini)Claude Opus 5
Edición de escrituraClaude Sonnet 5Gratis y por defecto en claude.ai; Claude Fable 5 es el líder de calidadSí (Claude gratis)Claude Fable 5
Estudio multimodal (PDF, diapositivas, imágenes)Gemini 3.6 FlashContexto 1M, gratis en la aplicación de GeminiNotebookLM (Google)
Segundo puesto y alternativas: Claude Sonnet 5 (gratis) es el segundo para la escritura y edición de ensayos. Gemini 3.6 Flash (gratis) es el segundo para el estudio multimodal y la ingesta de PDF. DeepSeek V4 es el segundo para la resolución de problemas con un presupuesto estrictamente de coste cero.
Guía de uso, septiembre de 2026

Mejor IA para el trabajo & profesionales

1
GPT-5.6
Trabajo de conocimiento diario
2
Claude Opus 5
Programación & escritura
3
Gemini 3.1 Pro
Investigación & informes

La mejor IA para el trabajo profesional es GPT-5.6 (por defecto de ChatGPT desde el 9 de julio) para el trabajo de conocimiento diario, Claude Opus 5 para programación y escritura de alto riesgo, y Gemini Spark para flujos agénticos 24/7. La mayoría de los profesionales sacan el máximo partido ejecutando dos suscripciones de pago (ChatGPT Plus a $20/mes más Claude Pro a $20/mes, un total de $40/mes), o consolidando con Fello AI a $9.99/mes para los cinco mejores modelos en una app de Mac/iOS. Para el trabajo agéntico que corre mientras duermes, Gemini Spark en Google AI Ultra a $99.99/mes es el único agente en la nube 24/7 real.

Caso de usoMejor modeloDato clavePrecioAlternativa
Trabajo de conocimiento diarioGPT-5.6Por defecto de ChatGPT desde el 9 de julio; el asistente que la mayoría puede abrir$20/mes ChatGPT PlusClaude Opus 5
Programación (propietaria)Claude Opus 5#1 en Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); el por defecto recomendado de Anthropic$20/mes Claude ProClaude Fable 5
Programación (rentable)Qwen 3.7 Max80,4 SWE-Verified, contexto 1M$1.25 / $3.75 promo; $2.50 / $7.50 listaDeepSeek V4-Flash 0731
Investigación & informesGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarea, anclaje de GoogleGoogle AI Pro / UltraClaude Opus 5
Matemáticas, física, modelado financiero difícilesGPT-5.6 SolNuevo buque insignia STEM de OpenAI (5.5 Pro verificado en 39,6 % FrontierMath)$100/mes ChatGPT ProQwen 3.7 Max
Flujos de agente siempre activosGemini SparkPrimer agente en la nube 24/7$99.99/mes Google AI UltraClaude Cowork
Noticias en vivo, creatividad con contexto de XGrok 4.6Intelligence Index 61 + anclaje nativo en X$30/mes SuperGrokGemini 3.1 Pro
Consolidación todo en unoFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/mesPagar a cada proveedor por separado
Segundo puesto y alternativas: para la mayoría de los equipos profesionales, Claude Opus 5 es el segundo tras GPT-5.6 para el trabajo diario y ahora el líder de programación de forma clara a $5 / $25, con Claude Fable 5 como el segundo para el trabajo de largo horizonte más difícil. Gemini 3.1 Pro es el segundo para roles con mucha investigación, y Gemini Spark es la elección única si puedes poner un agente en la nube a trabajar en tareas largas.
Comparativa de precios

Precios de los modelos de IA en septiembre de 2026

Desde planes gratuitos de $0 hasta $199.99/mes de Google AI Ultra. El precio más determinante de esta tabla es Claude Opus 5 a $5 / $25, porque es el segundo mejor puntuado en el Intelligence Index de Artificial Analysis a la mitad del coste de los dos modelos Fable que lo rodean. Claude Fable 5.1, que se llevó la cima de ese índice el 1 de septiembre, mantiene el mismo precio de lista de $10 / $50 que Fable 5, pero recorta las lecturas de caché un 75 % hasta $0.25, y ahí está el ahorro en ejecuciones agénticas largas, no en el precio de lista. Muse Spark 1.2 de Meta se lista a $1.25 / $4.25, con un nivel Contributor a $0.10 / $0.20 para quien esté dispuesto a dejar que Meta entrene con sus prompts, y Grok 4.6 se lista a $2 / $6, con la salvedad de que un prompt de 200.000 tokens o más refactura la petición entera a $4 / $12. La elección relación precio-rendimiento se movió en agosto, y no porque nada se abaratara: DeepSeek subió sus dos modelos V4 unas cuatro veces el 16 de agosto, llevando V4-Flash 0731 de unos $0.14 / $0.28 planos a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta. La elección es ahora GLM 5.3 Flash a $0.15 / $0.50 de lista, a mitad de precio hasta el 9 de septiembre, que puntúa 57 en el Intelligence Index y deja por debajo incluso la tarifa en valle de DeepSeek por ambos lados a cualquier hora del día. En la propia frontier, la elección de valor es Grok 4.6, con 61 por $0.84 por tarea de índice, donde Opus 5 cuesta $2.34 y GPT-5.6 Sol cobra $4 / $20 por la misma puntuación tras su recorte del 21 de agosto. Entre los modelos cerrados, GPT-5.6 Luna es el más barato a $0.20 / $1.20 tras el recorte de OpenAI del 30 de julio. Para un desglose más a fondo consulta nuestra Guía completa de comparativa de precios de IA.

ModeloEntrada (por 1M)Salida (por 1M)Contexto¿Acceso gratis?
GPT-5.5$5.00$30.001M (400K en Codex)ChatGPT Free; API de pago
GPT-5.5 Pro$30.00$180.001MChatGPT Pro desde $100/mes (nivel de mayor uso a $200)
GPT-5.6 Sol$4.00$20.00No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
GPT-5.6 Terra$2.00$12.00No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
GPT-5.6 Luna$0.20$1.20No publicadoEn vivo en ChatGPT, Codex & API (9 de julio)
Claude Opus 5$5.00$25.001MPor defecto en Claude Pro/Max; API de pago
Claude Opus 4.8$5.00$25.001MModelo legacy en Anthropic; Pro/Max/API
Claude Fable 5.1$10.00$50.001MLecturas de caché $0.25; en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos. Mythos 5.1 factura igual, solo por invitación
Claude Fable 5$10.00$50.001MPermanente en Max/Team Premium (~50 % de los límites de uso); Pro/Team Standard vía créditos
Claude Sonnet 5$2.00$10.001MPor defecto en Claude Free & Pro; API de pago
Claude Sonnet 4.6$3.00$15.001MAPI de pago (reemplazado por Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MAplicación Gemini limitada; API de pago
Gemini 3.7 Flash$0.75 introductorio / $1.50 desde el 1/1/2027$3.75 introductorio / $7.50 desde el 1/1/20271MAI Studio, Android Studio, Antigravity + API de pago; en la aplicación de Gemini solo vía Spark (AI Pro/Ultra, excluye EEE/RU/CH/Nigeria)
Gemini 3.6 Flash$0.75 introductorio / $1.50 desde el 1/1/2027$3.75 introductorio / $7.50 desde el 1/1/20271MModelo por defecto de la app gratuita de Gemini; AI Studio; nivel gratuito de API + API de pago
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; nivel gratuito de API + API de pago
Qwen 3.7 Max$1.25 promo / $2.50 lista$3.75 promo / $7.50 lista1M200 solicitudes gratis/día; API de pago más allá
MiniMax M3$0.30 (50 % de descuento sobre $0.60)$1.20 (≤512K)1MOpen weights; se aplican costes de alojamiento
LongCat-2.0Depende del proveedorDepende del proveedor1MOpen weights (MIT); se aplican costes de alojamiento
NVIDIA Nemotron 3 UltraDepende del proveedorDepende del proveedor1MOpen weights (OpenMDW); se aplican costes de alojamiento
Qwen 3.5 (open-weight)Autoalojado / TogetherAutoalojado / Together1MOpen weights; se aplican costes de alojamiento
Nex-N2-ProAutoalojado / proveedoresAutoalojado / proveedores1MOpen weights (Apache 2.0); se aplican costes de alojamiento
Rio 3.5 Open 397BAutoalojado / proveedoresAutoalojado / proveedores1MOpen weights (MIT); se aplican costes de alojamiento
Grok 4.3$1.25$2.501MPlan de consumo gratuito; API de pago
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI de SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Muse Spark 1.2$1.25 ($0.10 nivel Contributor)$4.25 ($0.20 nivel Contributor)1MAPI de pago; Muse Code, Meta Model API y OpenRouter; el nivel Contributor cambia derechos de entrenamiento por un ~92 % de descuento
Kimi K3$3.00 ($0.30 cache-hit)$15.001MNivel básico gratuito en la aplicación de Kimi; open weights en Hugging Face (Kimi K3 License)
Gemini Omni Flash (vídeo)$1.50$17.50 (salida de vídeo)Clips de 10 segundosAplicación Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 en valle / $1.32 en punta ($0.022 cache-hit en valle)$1.98 en valle / $3.96 en punta1MDeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto
DeepSeek V4-Flash 0731$0.22 en valle / $0.44 en punta ($0.007 cache-hit en valle)$0.66 en valle / $1.32 en punta1MDeepSeek Chat gratis; API de pago, tarifas punta y valle desde el 16 de agosto
Kimi K2.7 CodeDepende del proveedorDepende del proveedor256KOpen weights; se aplican costes de alojamiento
GLM-5.2Depende del proveedorDepende del proveedor1MOpen weights; se aplican costes de alojamiento
GLM 5.3$1.40 ($0.26 cache-hit)$4.401MAPI de Z.ai, GLM Coding Plan y ZCode; pesos en Hugging Face desde el 28 de agosto bajo la GLM 5.3 License propia
GLM 5.3 Flash$0.15 ($0.03 cache-hit); $0.075 en promoción$0.50; $0.25 en promoción1MAPI de Z.ai, GLM Coding Plan, OpenRouter; pesos MIT en Hugging Face; la promoción acaba el 9 de septiembre
Tencent Hy4 Preview$0.834 ($0.042 cache-hit)$2.5011M+Pesos abiertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextDepende del proveedorDepende del proveedor262K (hasta 1M)Pesos abiertos (Qwen Community License 1.0); se suman los costes de alojamiento
ERNIE 5.1Precio para la región de ChinaPrecio para la región de China256KNivel gratuito de Baidu
Gemini Spark (agente)Sin precio de APISin precio de API1M (base Gemini)Google AI Ultra $99.99 o $199.99/mes
Fello AI (agregador)Enrutado por la appEnrutado por la appDepende del modelo$9.99/mes, plan gratuito disponible

Las tarifas de GPT-5.5 y GPT-5.5 Pro de arriba son precios de contexto corto; OpenAI ya no publica las cifras específicas de contexto largo. Los niveles GPT-5.6 se facturan a 2x entrada y 1,5x salida una vez que un prompt supera los 272K tokens de entrada, lo que sitúa a Terra de contexto largo en $4 / $18 y a Luna en $0.40 / $1.80. Grok 4.6 funciona igual, pero muerde más fuerte: a partir de 200.000 tokens de prompt, SpaceXAI refactura la petición entera a la tarifa más alta en lugar de solo el exceso, así que pasarse por mil tokens duplica el coste de toda la llamada. La otra tarifa que conviene leer dos veces es la de DeepSeek: desde el 16 de agosto sus dos modelos V4 se facturan a precio de punta de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y a exactamente la mitad en cualquier otra hora, así que la misma tarea puede costar el doble según cuándo la ejecutes. Si quieres acceso a varios modelos de IA sin gestionar suscripciones separadas, Fello AI ofrece GPT, Claude, Gemini, Grok, Perplexity y más en una sola app para Mac, iPhone y iPad desde $9.99/mes.

Modelos open-weight

Mejores modelos open-weight en septiembre de 2026

El mejor modelo open-weight en septiembre de 2026 es Kimi K3, y se llevó la delantera en el momento en que Moonshot publicó los pesos el 27 de julio de 2026. Tiene el Intelligence Index más alto de cualquier modelo open-weight con 60 en Artificial Analysis, siete puntos por delante de GLM-5.2, y en Arena sigue siendo la entrada abierta mejor situada, en #2 en WebDev (1,675.5) por detrás solo de Claude Opus 5 y #3 en el tablero Agent. Una pega decide cuál de los dos deberías usar de verdad. La descarga de K3 son 96 shards de safetensors y unos 1,56 TB, lo que necesita un clúster de GPU multinodo en lugar de una estación de trabajo, y viene bajo una licencia propia Kimi K3 License en lugar de MIT. Así que la recomendación práctica para equipos que ejecutan sus propios pesos es ahora GLM 5.3 Flash (Z.ai, MIT), publicado el 26 de agosto con un Intelligence Index de 57, cuatro puntos por encima de GLM-5.2 y con menos de la mitad de tamaño, 320B totales con 18B activos. Es el primer modelo nativamente multimodal de la línea GLM-5, admite un contexto de 1M de tokens, y los pesos estaban en Hugging Face bajo MIT el mismo día del lanzamiento. GLM-5.2 (MIT) es la alternativa de respaldo, con un Intelligence Index de 53, y conserva el registro independiente que el modelo más nuevo aún no ha tenido tiempo de ganarse, #6 en Arena WebDev (1,587.1) y #5 en el tablero Agent. El tercer puesto cambió de manos el último día de julio: DeepSeek V4-Flash 0731 recibió nuevo post-training y saltó de un Intelligence Index de 40 a 52 en el índice actual v4.1.1 bajo MIT, aunque su precio de API ha subido desde entonces unas cuatro veces, a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta. Tres lanzamientos cerraron después el mes, y ninguno tiene todavía una valoración independiente. GLM 5.3 publicó por fin sus pesos el 28 de agosto, exactamente en la fecha que llevaba su marcador de posición, pero bajo una GLM 5.3 License propia en lugar de MIT, con una cláusula que obliga a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos a pasar antes una revisión de seguridad de Z.ai; ten en cuenta además que GLM 5.3 Flash no es un GLM 5.3 recortado, sino un modelo aparte sobre una base recién entrenada, y por eso pudo salir bajo MIT puro cuando el buque insignia no pudo. Tencent liberó Hy4 Preview el 28 de agosto con 770B totales y 49B activos bajo Apache 2.0, el mayor modelo con licencia permisiva publicado hasta la fecha, apoyado en una evaluación ciega interna y no en ningún tablero independiente. Y Alibaba publicó Qwen3.8-Flash-Next el 26 de agosto, un mixture-of-experts de 125B con solo 6B activos que anticipa la arquitectura Qwen4, bajo la Qwen Community License 1.0 en lugar de Apache. Los tres se listan abajo en lugar de clasificarse.

ModeloMejor paraBenchmark claveContexto / LicenciaDónde ejecutar
Kimi K3Modelo open-weight mejor puntuado, trabajo agéntico y webII 60, el más alto de cualquier modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B activos1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 TB), Moonshot API, proveedores
GLM 5.3 FlashMejor modelo abierto que la mayoría de equipos puede ejecutar de verdadII 57 (v4.1.1), en la frontera de Pareto entre inteligencia y coste, a unos $0.09 por tarea del índice; 320B/18B activos, nativamente multimodal1M / MITHugging Face, API de Z.ai ($0.15/$0.50), OpenRouter
GLM-5.2Respaldo con historial independienteII 53; #6 Arena WebDev (1,587.1), #5 Arena Agent; 744B/40B activos1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Abierto desde el 28 de agosto, pero con licencia propiaMisma base de 744B que GLM-5.2, solo post-entrenada, checkpoint publicado contado en 753B; CyberGym 84,5 % y Terminal-Bench 3.0 28,3 (cifras del fabricante)1M / GLM 5.3 License (model-as-a-service por encima de 10 000 M USD de ingresos necesita revisión de seguridad de Z.ai)Hugging Face, API de Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4-Flash 0731Mejor valor abierto si lo alojas tú mismoII 52 (v4.1.1), desde 40 el 31 de julio; 284B/13B activos1M / MITDeepSeek API ($0.22/$0.66 en valle, $0.44/$1.32 en punta desde el 16 de agosto), local
Tencent Hy4 PreviewMayor modelo con licencia permisiva hasta la fecha770B/49B activos; 2,99/4,00 en el panel propio de Tencent de 203 tareas frente a 2,94 de Kimi K3 y 2,92 de GLM 5.3 (fabricante); todavía sin valoración independiente1M+ / Apache 2.0Hugging Face (BF16 y FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextAnticipo de la arquitectura Qwen4125B totales más un embedding de N-gramas de 51B, 6B activos; 91,7 GPQA Diamond y 62,5 SWE-Bench Pro (fabricante); todavía sin valoración independiente262K a 1M / Qwen Community License 1.0Hugging Face, proveedores, autoalojamiento
LongCat-2.0Programador abierto frontier entrenado en chips chinosII 33 (v4.1); 59,5 % SWE-Bench Pro (proveedor), 1.6T/~48B activos1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de clase frontier baratoII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licencia por definirHugging Face, API $0.30/1M (50 % de descuento)
Nex-N2-ProPuntuación de programación abierta más fuerteII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B activosBasado en Qwen / Apache 2.0Hugging Face, proveedores, autoalojado
Kimi K2.7 CodeProgramador abierto con licencia comercial más fuerte+21,8 % en Kimi Code Bench v2 vs. K2.6 (proveedor); 1T/32B activos256K / Modified MITHugging Face, DeepInfra, proveedores
DeepSeek V4-ProTrabajo agéntico del mundo realII 44 (v4.1), 1.6T/49B activos1M / MITDeepSeek API ($0.435/$0.87), local
Hy3El participante más nuevo con licencia permisivaII 41 (v4.1); #22 en Arena WebDev (1,516.4)Apache 2.0Hugging Face, proveedores, autoalojado
InklingPrimer modelo open-weight de Thinking MachinesII 41 (v4.1), agéntico 32,3, lanzado el 15 de julioOpen weightsHugging Face, proveedores, autoalojado
Inkling SmallMisma familia a una cuarta parte del tamañoII 40 (v4.1), agéntico 30,8; 276B/12B activos, entrada de texto, imagen y audioApache 2.0Hugging Face (BF16 y NVFP4), proveedores, autoalojado
NVIDIA Nemotron 3 UltraAfinado por NVIDIA, licencia totalmente permisivaII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B activos1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 autoalojado)
Qwen 3.5 (397B / 17B activos)Multimodal, decodificación rápida88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / abiertoTogether, OpenRouter, local
Qwen3.6-35B-A3BProgramador agéntico abierto eficiente (3B activos)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B activos262K (a 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgramador denso ejecutable en portátil87,8 GPQA Diamond, denso 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, razonamiento multilingüe70,8 Terminal-Bench 2.1 (first-party), supera a Qwen 3.7 Plus en 4/5397B/17B activos / MITHugging Face, proveedores, autoalojado
Llama 4 MaverickBuque insignia de la línea Meta17B activos / 400B de parámetros totalesLlama 4 licenseNube de Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / bajo consumoMultimodal, huella muy pequeñaCompacto / abiertoLocal, herramienta NVIDIA

Aquí la licencia importa tanto como la puntuación bruta, y agosto ha ensanchado la distancia entre los dos grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) y Nemotron 3 Ultra (OpenMDW) todos permiten claramente el uso comercial sin prueba de ingresos. El resto lleva condiciones que conviene leer antes de construir sobre ellas: MiniMax M3 y MiniMax H3 vienen bajo sus propias licencias comunitarias, y H3 exige además una solicitud desde EE. UU., la UE, el Reino Unido y Corea del Sur; Kimi K3 se sitúa en una licencia propia con un umbral de ingresos para quien lo revenda como servicio; GLM 5.3 exige una revisión de seguridad de Z.ai a cualquier operador de model-as-a-service por encima de 10 000 millones de dólares de ingresos; y la Qwen Community License 1.0 de Qwen3.8-Flash-Next exige una licencia aparte de Qwen para explotar un negocio de model-as-a-service o de asistente de trabajo con IA, aunque el uso interno queda exento. Ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos: Claude Opus 5 se llevó el tablero Agent en julio, el último que lideró un modelo open-weight.

Cómo evaluamos

Benchmarks, precios y uso práctico

Cada clasificación de esta página combina tres entradas: benchmarks públicos de siete casas independientes (Artificial Analysis, Arena antes LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize y el tablero oficial de Terminal-Bench 2.1, cubriendo los índices Intelligence y Agentic, GPQA Diamond, ARC-AGI-1 al 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas y el Remote Labor Index), precios de API y suscripción publicados en la página de precios oficial de cada proveedor, y uso práctico por parte del equipo editorial de FelloAI que ejecuta prompts reales sobre la misma tarea en cada modelo. Volvemos a obtener las fuentes oficiales de precios y benchmarks antes de cada actualización mensual.

Los benchmarks se ponderan según el caso de uso: SWE-bench y Terminal-Bench impulsan la programación, GPQA Diamond y ARC-AGI-2 impulsan la precisión, GDPval-AA (el benchmark de entregables profesionales de Artificial Analysis) informa la calidad de las tareas profesionales mientras que el estilo de escritura se juzga principalmente por pruebas prácticas, FrontierMath y HMMT impulsan la resolución de problemas. Revelamos cuándo un benchmark es reportado por el proveedor pero no verificado de forma independiente, y descartamos cualquier afirmación que no podamos reproducir contra una fuente en vivo. No movemos la corona de una categoría por la fuerza de una sola tabla, y cuando un modelo nuevo es demasiado reciente para que los tableros de preferencia humana lo hayan valorado, lo decimos en lugar de coronarlo solo por puntuaciones de benchmark. Cuando un modelo pasa por una actualización importante entre actualizaciones, volvemos a clasificar la categoría y añadimos una línea «Qué cambió este mes» al pie del análisis a fondo.

Fello AI funcionando en Mac, iPhone y iPad
¿No sabes qué modelo elegir?

Fello AI reúne los mejores modelos de IA en una sola app nativa y ligera.

Cambia entre ellos cuando quieras, sin suscripciones separadas.

Descargar Fello AI
Preguntas frecuentes

Preguntas comunes

¿Cuál es el mejor modelo de IA ahora mismo en septiembre de 2026?
Depende de la tarea. En puntuación general de benchmark, Claude Fable 5.1 (1 de septiembre) es #1 en el Intelligence Index de Artificial Analysis con 66 y su Agentic Index con 61, con Claude Opus 5 segundo en ambos con 63 y 59; Arena ha valorado a Opus 5 en lo alto de cuatro de sus tableros, incluidos los dos de programación, y todavía no tiene votos para Fable 5.1. Grok 4.6 (12 de agosto) es la elección de valor en la frontier, empatado con GPT-5.6 Sol en 61 por un tercio del precio. Para el chat diario, GPT-5.6 ha sido el modelo por defecto de ChatGPT desde el 9 de julio y es el asistente que la mayoría de la gente puede abrir de verdad, aunque Claude Fable 5 lidera la tabla de texto de Arena. Para programación, Claude Opus 5 es #1 en los tableros WebDev (1,702.9) e image-to-WebDev (1,668.6) de Arena a la mitad del precio de Fable 5. Para escritura, Claude Fable 5 es #1 en la tabla de texto de Arena (1508.6), con Fable 5.1 por delante en Humanity's Last Exam (59,1 %) y empatado con él en AA-Omniscience (43). Para precisión, Gemini 3.1 Pro iguala al panel humano en ARC-AGI-1 con un 98 % por $0.52 por tarea. Para matemáticas y razonamiento difíciles, GPT-5.6 Sol es #1 en LiveBench Mathematics, LiveBench Reasoning y ARC-AGI-2. Para imágenes, ChatGPT Images 2.0 lidera los dos tableros, y para vídeo Gemini Omni Flash lidera los dos. Para agentes, Gemini Spark es el agente en la nube 24/7 y Claude Cowork el de escritorio.
¿Qué es Claude Opus 5?
Claude Opus 5 es el buque insignia de Anthropic del 24 de julio de 2026, y fue el modelo #1 en Artificial Analysis hasta que Claude Fable 5.1 llegó el 1 de septiembre. Ahora es segundo en el Intelligence Index con 63 frente a 66, segundo en el Agentic Index con 59 frente a 61 y segundo en el tablero GDPval-AA v2 de entregables profesionales con 1824 frente a 1853, todavía muy por delante del 1755 de Grok 4.6 y del 1723 de Claude Fable 5. El precio de la API es de $5 / $25 por 1M de tokens, el mismo que Opus 4.8 y la mitad del coste de Fable 5, con una ventana de contexto de 1M de tokens y una fecha de corte de conocimientos de mayo de 2026. ARC Prize confirma de forma independiente la afirmación de lanzamiento de Anthropic sobre ARC-AGI-3, donde Opus 5 puntúa un 30 % frente al 8 % del siguiente mejor modelo, cerca de 3,75 veces. Arena lo ha valorado desde entonces, situándolo #1 en WebDev, image-to-WebDev, Document y el tablero Agent y #6 en texto, y eso es lo que le movió la corona de programación. Una cosa a tener en cuenta: Artificial Analysis mide su tasa de alucinación en un 50 %, que es por lo que no ostenta ninguna corona de precisión en esta página.
¿Qué es Claude Fable 5.1?
Claude Fable 5.1 es el lanzamiento de Anthropic del 1 de septiembre de 2026 y el modelo mejor puntuado que Artificial Analysis ha medido, con 66 en su Intelligence Index con effort max y 61 en su Agentic Index. Salió junto a Claude Mythos 5.1, que es el mismo modelo con las salvaguardas de biología y ciberseguridad relajadas, disponible solo por invitación y sin criterios de elegibilidad publicados. El precio es de $10 / $50 por 1M de tokens, igual que Fable 5, pero las lecturas de caché bajan un 75 % hasta $0.25, sobre una ventana de contexto de 1M de tokens y con corte de conocimientos de junio de 2026. Está incluido en Claude Max y Team Premium con cerca del 50 % de los límites semanales y es alcanzable desde Pro mediante créditos. Anthropic sigue recomendando empezar con Claude Opus 5 para la mayoría de las cargas, ya que cuesta la mitad y va más rápido. Nuestro desglose completo de Claude Fable 5.1 y Mythos 5.1 cubre la tarjeta de sistema y el reparto de salvaguardas.
¿Ha vuelto Claude Fable 5?
Sí. Anthropic volvió a desplegar Claude Fable 5 el 1 de julio de 2026 después de que el gobierno de EE. UU. levantara la restricción de control de exportaciones que había impuesto el 12 de junio. Está disponible de nuevo en la Claude API, Claude.ai, Claude Code y Claude Cowork. Anthropic hizo permanente a Fable 5 en los planes de pago el 20 de julio de 2026. Max y Team Premium lo incluyen con cerca del 50 % de los límites de uso habituales; Pro y Team Standard lo alcanzan a través de créditos de uso con un crédito inicial único de $100. El precio de la API es de $10 / $50 por millón de tokens. Fable 5 es un modelo de clase Mythos construido para trabajo agéntico de largo horizonte con un contexto de 1M de tokens, y es el segundo para programación por detrás de Claude Opus 5, en #2 en el tablero image-to-WebDev de Arena (1,625.7) y #4 en WebDev.
¿Qué es GPT-5.6 y puedo usarlo?
Sí, desde el 9 de julio de 2026. GPT-5.6 es la familia de modelos de nueva generación de OpenAI, y tras una vista previa cerrada de dos semanas que comenzó el 26 de junio tras una revisión de seguridad del gobierno de EE. UU., alcanzó la disponibilidad general el 9 de julio. Hay tres niveles, del menos al más capaz: Luna, el nivel rápido y más barato ($0.20 / $1.20 por 1M de tokens); Terra, un modelo equilibrado para el día a día que OpenAI dice que iguala a GPT-5.5 ($2 / $12); y Sol, el buque insignia afinado para biología, química y ciberseguridad ($4 / $20). OpenAI recortó Luna un 80 % y Terra un 20 % el 30 de julio de 2026 y dejó a Sol intacto, y luego recortó Sol más de un 20 % el 21 de agosto de 2026 como tarifa promocional de unos tres meses. Ningún precio de suscripción de ChatGPT ha cambiado. Ahora está en vivo en ChatGPT, Codex y la API como modelo por defecto de OpenAI. Una advertencia: la system card de OpenAI y el evaluador externo METR señalaron un comportamiento de «scheming» elevado en Sol, así que trátalo con cuidado para trabajo factual de alto riesgo hasta que se asienten los resultados independientes.
¿Ya salió Grok 4.6?
Sí. SpaceXAI lanzó Grok 4.6 el 12 de agosto de 2026, sustituyendo a Grok 4.5 como buque insignia poco más de un mes después de su salida. No es un modelo base nuevo: la empresa mantuvo la base de Grok 4.5 y mejoró el modelo con post-entrenamiento adicional, incluido aprendizaje por refuerzo en entornos agénticos, y no publicó ninguna arquitectura ni recuento de parámetros nuevos. Artificial Analysis lo puntúa con un Intelligence Index de 61, cinco puntos por encima del 56 de Grok 4.5, lo que lo empata con GPT-5.6 Sol en 61, por detrás de Claude Fable 5.1 con 66, Claude Opus 5 con 63 y Claude Fable 5 con 62. El precio no cambia, a $2 / $6 por 1M de tokens con una ventana de contexto de 500K tokens, aunque los prompts de 200.000 tokens o más refacturan la petición entera a $4 / $12. Está disponible en la API de SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel y Cloudflare. Grok 4.6 es también nuestra elección de creatividad, por motivos de producto en lugar de calidad de la prosa; para la mejor salida escrita, Claude Fable 5 gana de forma clara. Todas las cifras en nuestro desglose de Grok 4.6.
¿Qué IA es la mejor para programar?
Claude Opus 5 es la mejor para programar, y gana los dos tableros donde los desarrolladores votan sobre el resultado en lugar de un harness ejecutando un script: #1 en el tablero WebDev de Arena (1,702.9) y #1 en image-to-WebDev (1,668.6), en cortes de votos del 1 de agosto y el 31 de julio. Corre a $5 / $25 por 1M de tokens, la mitad de Claude Fable 5, y la propia documentación de Anthropic dice que empieces con Opus 5 para programación agéntica compleja. Claude Fable 5 es el segundo para el trabajo de largo horizonte más difícil en #2 image-to-WebDev y #4 WebDev, y Kimi K3 es el aspirante en #2 en WebDev (1,675.5). Ten en cuenta que el Coding Index de Artificial Analysis no es un barrido de Claude: GPT-5.6 Sol (xhigh) lo lidera con 78,3 con Opus 5 en 78,0, lo bastante cerca para llamarlo empate. GLM 5.3 Flash (MIT, 26 de agosto) es ahora tanto la elección relación precio-rendimiento, a $0.15 / $0.50, como el mejor programador open-weight que puedes alojar tú mismo, con un Intelligence Index de 57; lo primero se lo quitó a DeepSeek V4-Flash 0731 cuando DeepSeek subió sus tarifas unas cuatro veces el 16 de agosto.
¿Qué IA es la mejor para escribir?
Claude Fable 5 es la mejor para escribir, y es el único modelo entre los tres primeros de los tres tableros independientes de escritura: #1 en Arena escritura creativa, #1 en LiveBench Language (90.7) y #3 en EQ-Bench Creative Writing v3. Cuesta $10 / $50 por 1M de tokens. Claude Sonnet 5 es la elección de valor y lo que la mayoría de la gente debería usar de verdad, ya que es gratis y por defecto en claude.ai a $2 / $10, un precio de lanzamiento que Anthropic hizo permanente en agosto de 2026, aunque se clasifica #53 en Arena escritura creativa. Kimi K3 gana EQ-Bench de forma clara con 2377 si quieres ficción distintiva, Claude Fable 5.1 encabeza el tablero GDPval-AA v2 de entregables profesionales con 1853, con Claude Opus 5 segundo con 1824, GPT-5.5 es la alternativa para escritura de negocios anclada en hechos, y Gemini 3.6 Flash es la elección relación precio-rendimiento para contenido en volumen.
¿Cuál es el mejor modelo de IA open-weight en 2026?
Kimi K3 es el mejor modelo open-weight ahora mismo, y lo es desde que Moonshot publicó los pesos el 27 de julio de 2026. Tiene el Intelligence Index más alto de cualquier modelo open-weight con 60 en Artificial Analysis, y en Arena es #2 en WebDev y #3 en el tablero Agent. La pega es que son 96 shards y unos 1,56 TB bajo una licencia propia Kimi K3 License, así que GLM 5.3 Flash (26 de agosto, MIT) es ahora el modelo que la mayoría de los equipos pueden alojar de verdad, con un Intelligence Index de 57 y 320B totales con 18B activos. El tercero es DeepSeek V4-Flash 0731, que saltó de un Intelligence Index de 40 a 52 el 31 de julio sin cambiar tamaño ni licencia, aunque DeepSeek subió después sus tarifas de API unas cuatro veces el 16 de agosto, a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta, que es lo que le costó la elección relación precio-rendimiento. GLM 5.3, lanzado el 14 de agosto, es un modelo distinto y más grande cuyos pesos sí llegaron el 28 de agosto, pero bajo una GLM 5.3 License propia en lugar de MIT. Otros dos modelos abiertos cerraron el mes, todavía sin valoración independiente: Hy4 Preview de Tencent el 28 de agosto, 770B bajo Apache 2.0 y el mayor modelo con licencia permisiva hasta la fecha, y Qwen3.8-Flash-Next de Alibaba el 26 de agosto, un anticipo de la arquitectura Qwen4 bajo la Qwen Community License 1.0. Vale la pena saber, con honestidad, que ningún modelo open-weight es ya el primero en ningún tablero de Arena que sigamos.
¿Cuál es el modelo de IA de clase frontier más barato?
En precio de API por millón de tokens, GPT-5.6 Luna es ahora el modelo cerrado de clase frontier más barato a $0.20 / $1.20, después de que OpenAI lo recortara un 80 % el 30 de julio de 2026, y Artificial Analysis lo puntúa con un Intelligence Index de 52 en su índice v4.1.1, al mismo nivel que Gemini 3.6 Flash. Aún más barato es GLM 5.3 Flash, nuestra elección relación precio-rendimiento desde agosto, a $0.15 / $0.50 de lista y la mitad hasta el 9 de septiembre, con 57 en el Intelligence Index y bajo una licencia MIT pura que puedes autoalojar. DeepSeek V4-Flash 0731 mantuvo esa elección hasta que DeepSeek subió sus tarifas unas cuatro veces el 16 de agosto, a $0.22 / $0.66 en valle y $0.44 / $1.32 en punta. El nivel barato de Google mejoró mucho en valor en agosto: Gemini 3.7 Flash puntúa 56 a un introductorio $0.75 / $3.75, aunque esa tarifa se duplica el 1 de enero de 2027. MiniMax M3 se lista ahora a $0.30 por millón de tokens de entrada con un descuento permanente del 50 %, con LongCat-2.0 como una fuerte alternativa MIT. Qwen 3.7 Max a $1.25 / $3.75 en su promo actual es la elección de valor con un Intelligence Index de 46, aunque Luna ahora lo supera tanto en precio como en puntuación.
¿Qué modelos de IA son gratis?
ChatGPT Free ahora usa por defecto GPT-5.6 (con GPT-5.5 aún disponible) bajo límites de uso. Gemini Free ejecuta Gemini 3.6 Flash en la aplicación de Gemini y Google AI Studio. Claude Free ejecuta Claude Sonnet 5 (el nuevo por defecto) con límites diarios. DeepSeek Chat ejecuta DeepSeek V4 gratis en el sitio web de DeepSeek. Grok tiene un plan de consumo gratuito limitado (X Premium es un complemento de pago). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash y Hy4 Preview de Tencent son open-weight y gratis para autoalojar, aunque las licencias difieren y solo algunos son MIT o Apache puros. Qwen 3.7 Max es solo API sin front-end de chat de consumo, pero Alibaba ahora incluye 200 solicitudes de modelo gratis al día. Kimi tiene un nivel básico gratuito en su app, con el uso agéntico más intenso medido.
¿Qué es Gemini Spark y vale $99.99/mes?
Gemini Spark es el primer agente de IA de Google residente en la nube 24/7, lanzado en el Google I/O el 19 de mayo de 2026 y exclusivo del plan Google AI Ultra, que Google reestructuró para incluir un nivel de entrada de $99.99/mes y un nivel superior de $199.99/mes. Spark está construido sobre los modelos base de Gemini con el harness Antigravity de Google en una VM de Google Cloud, se integra con Gmail, Google Docs y otras apps de Google Workspace, y puede interactuar con Chrome y el sistema Halo de Android en el lado del dispositivo. Vale el gasto para usuarios que tienen flujos repetibles de larga duración (triaje de bandeja de entrada, resúmenes de investigación, tareas programadas). Para tareas puntuales, Claude Cowork a $20/mes cubre la mayoría de las necesidades de agente de escritorio.
¿Qué es Fello AI?
Fello AI es un chatbot de IA para Mac, iPhone y iPad que te permite usar todos los mejores modelos de IA como ChatGPT, Claude, Gemini, Grok y DeepSeek en una sola app, con modelos actualizados con regularidad para que siempre tengas los más recientes. Cuesta $9.99/mes con una valoración de 4,7 estrellas a través de más de 27 000 reseñas.
¿Con qué frecuencia actualizáis esta página?
Actualizamos esta página al menos cada mes y dentro de las 24-48 horas siguientes al lanzamiento de cualquier modelo importante.
Artículos relacionados
Claude vs. ChatGPT: ¿qué IA es realmente mejor en 2026?

Claude alcanzó el #1 en la App Store a principios de 2026, sacando a ChatGPT del primer puesto por primera vez. El detonante fue la negativa pública de Anthropic a la exigencia del Pentágono de desplegar sus modelos para armas autónomas.

Leer más →
Grok vs. ChatGPT: ¿qué chatbot de IA es realmente mejor en 2026?

Ambos chatbots acaban de pasar a nuevos modelos insignia. ChatGPT corre ahora GPT-5.6 (niveles Sol, Terra, Luna) y Grok está impulsado por Grok 4.6, la versión de SpaceXAI del 12 de agosto que empata con Sol en el Intelligence Index por un tercio del precio.

Leer más →
ChatGPT vs. Gemini en 2026: ¿qué IA deberías usar de verdad?

ChatGPT pasó a GPT-5.6 como su modelo insignia, mientras que Gemini 3.1 Pro sigue siendo el buque insignia de pago de Google. Cara a cara en escritura, programación, imágenes y precio.

Leer más →
Cuándo usar cada IA: elige el modelo correcto

No hay una única IA mejor. Asigna cada tarea al modelo que la lidera, con una tabla para programar, escribir, investigar y el chat diario.

Leer más →
Los mejores agentes de IA en 2026: 30 herramientas

Treinta agentes de IA comparados por lo que quieres hacer: programar, investigar, trabajo de oficina y automatización, con precios y opciones gratuitas.

Leer más →
Gemini Nano Banana Pro vs. GPT-Image-1.5: comparativa definitiva

Nuestra comparativa práctica original de diciembre de 2025 de los dos modelos líderes de generación de imágenes, con muestras de salida reales lado a lado.

Leer más →

Prueba todos los modelos.
Una app preciosa.

Todos los modelos de esta guía en una app nativa: ChatGPT, Claude, Gemini, Grok y DeepSeek. Gratis para empezar.

Fello AI funcionando en Mac, iPad y iPhone

Valoración de 4,7·más de 27 000 reseñas·Gratis para empezar