Mis à jour 22 septembre 2026

Meilleurs modèles d'IA en 2026

Classements, comparatifs et analyses approfondies, mis à jour chaque mois à mesure que de nouveaux modèles arrivent.

Anthropic a publié Claude Opus 5.5 le 22 septembre, et il prend la couronne de la programmation. Artificial Analysis le mesure à 57,6 sur l'Intelligence Index v4.3.2, le meilleur score qu'elle ait jamais publié et 4,3 points devant Claude Fable 5.1, et il emporte au passage GDPval-AA v2.1, AA-Briefcase v1.1 et Humanity's Last Exam. Il le fait à 4 $ / 20 $ par million de tokens, sous Claude Opus 5 à 5 $ / 25 $ : le meilleur modèle est désormais aussi le moins cher.

GPT-6 Astra conserve les deux classements de programmation d'Arena, faute de votes pour Opus 5.5, et Claude Fable 5.1 conserve l'écriture et la précision sur les classements qui décident ces catégories. Cette page classe selon les scores mesurés : une couronne change donc de mains dès qu'un modèle dépasse le tenant, sans attendre les classements fondés sur les votes. Notre guide des benchmarks d'IA explique comment cet indice est construit et pourquoi son numéro de version compte.

SpaceXAI a publié Grok 4.7 le 21 septembre sur un modèle de base nouveau et plus grand, et il passe devant Astra sur les deux classements agentiques publiés par Artificial Analysis. L'Intelligence Index affiche 46,3 contre 44,3 pour Grok 4.6 et le prix par token ne bouge pas, 2 $ / 6 $, mais une tâche de l'indice coûte 2,73 $ contre 1,86 $, parce que la 4.7 émet environ deux fois plus de sortie. Il est lancé dans l'API, dans Cursor et dans Grok Build ; l'application Grok sert toujours la 4.6.

Le champ ouvert a lui aussi un nouveau leader : le MiMo-V2.6-Pro de Xiaomi, publié le 21 septembre sous licence MIT simple, obtient 46,3 et traite une tâche de l'indice pour 0,13 $, le moins cher de cette page. Vous trouverez ci-dessous les gagnants par catégorie pour septembre 2026. Cliquez sur une carte pour aller directement à l'analyse complète, ou utilisez la navigation fixe pour passer d'une catégorie à l'autre. Classements, benchmarks et tarifs sont mis à jour dans les 48 heures suivant tout lancement majeur.

Vainqueurs par catégorie de septembre 2026
Écriture
Claude Fable 5.1
#2 EQ-Bench Creative Writing et #2 LiveBench Language
Le seul modèle présent dans les six premiers des trois classements de prose. Meilleur rapport : Claude Sonnet 5, gratuit sur claude.ai.
Analyse approfondie →
Chat & assistant du quotidien
GPT-5.6
Modèle par défaut de ChatGPT depuis le 9 juillet
Le meilleur assistant que la plupart des gens peuvent réellement ouvrir, équilibrant capacité, rapidité et portée.
Analyse approfondie →
Images
ChatGPT Images 2.5
#1 et #2 sur les quatre classements d'image que nous suivons
Ses deux modèles occupent les deux premières places sur chaque classement d'image que nous suivons, chez Arena comme chez Artificial Analysis, et il est activé par défaut sur toutes les formules ChatGPT, y compris la gratuite. Meilleur rapport qualité-prix : Flare, le plus rapide des deux, au même prix par token que GPT Image 2.
Analyse approfondie →
Vidéo
Gemini Omni 1.1 Flash
#1 Arena texte-vers-vidéo (1516), scènes de 40 secondes
Le plus récent modèle vidéo de Google : extension de scène jusqu'à 40 secondes, sortie 4K, à partir de 0,03 $ la seconde.
Analyse approfondie →
Programmation
Claude Opus 5.5
#1 Terminal-Bench 4.0 (59,6 %) et #1 Intelligence Index (57,6)
Le modèle phare d'Anthropic du 22 septembre domine le Terminal-Bench 4.0 d'Artificial Analysis et les deux classements de programmation de LiveBench, à 4 $ / 20 $ contre 10 $ / 50 $ pour GPT-6 Astra. Astra conserve les deux classements de programmation d'Arena, qui n'ont encore aucun vote pour Opus 5.5.
Analyse approfondie →
Créativité
Grok 4.7
Le moins de restrictions de contenu + X natif en temps réel
Le choix pour un travail audacieux et dans l'air du temps : le moins de garde-fous et une intégration native de X. Grok 4.7 est disponible dans l'API, dans Cursor et dans Grok Build ; l'application Grok à 30 $ par mois sert toujours la 4.6.
Analyse approfondie →
Précision & recherche
Claude Fable 5.1
La meilleure précision factuelle mesurée par Artificial Analysis (67 %)
En tête des classements qui mesurent la fréquence à laquelle un modèle se trompe purement et simplement. Meilleur rapport : Gemini 3.1 Pro à 0,52 $ par tâche avec ancrage Google Search.
Analyse approfondie →
Résolution de problèmes
GPT-6 Astra
#1 LiveBench Reasoning (92,65) et #1 ARC-AGI-2 (95 %)
A pris à GPT-5.6 Sol les classements de raisonnement les plus durs quelques jours après son lancement. Meilleur rapport : GPT-5.6 Sol à 4 $ / 20 $, toujours deuxième sur ARC-AGI-2.
Analyse approfondie →
Agents d'IA
Gemini Spark
Premier agent d'IA résident dans le cloud 24/7
Fonctionne en continu dans une VM Google Cloud, profondément intégré à Gmail, Docs et Chrome.
Analyse approfondie →

Vous voulez les meilleurs modèles d'IA sans jongler avec des abonnements séparés ? Fello AI réunit les modèles de pointe dans une seule app native pour Mac, iPhone et iPad.

Télécharger Fello AI
Les nouveautés de septembre 2026
22 sept. Anthropic Claude Opus 5.5 prend l'Intelligence Index à 57,6 et passe sous le prix d'Opus 5 Nouveau
Anthropic a publié Claude Opus 5.5 le 22 septembre 2026, premier modèle d'une nouvelle famille Claude 5.5, et c'est le plus grand mouvement en une seule journée que cette page ait enregistré. Artificial Analysis le mesure à 57,6 sur l'Intelligence Index v4.3.2, 4,3 points au-dessus de Claude Fable 5.1 et le score le plus élevé qu'elle ait publié pour un modèle, et il emporte au passage GDPval-AA v2.1 à 1846 contre 1735 pour Fable 5.1, AA-Briefcase v1.1 à 1822 contre 1678, Humanity's Last Exam à 61,4 % contre 59,1 % et la campagne Terminal-Bench 4.0 d'Artificial Analysis à 59,6 % contre 59,1 % pour GPT-6 Astra. Le prix baisse au lieu de monter : 4 $ / 20 $ par million de tokens contre 5 $ / 25 $ pour Opus 5, lectures de cache 60 % moins chères à 0,20 $ et écritures à 5 $, les tests d'Anthropic elle-même situant une charge de travail typique 40 % moins chère que sur Opus 5 et la sortie plus de 30 % plus rapide. Un mode rapide dans Claude Code et sur la Claude Platform double le prix pour jusqu'à 2,5 fois la vitesse. Sur le harness maison d'Anthropic l'écart en programmation est encore plus large, 66,4 % sur Terminal-Bench 4.0 contre les 57,9 % qu'OpenAI rapporte pour Astra, plus 54,4 % sur FrontierCode v1.1 et 57,8 % sur CursorBench 4.0. Deux choses qu'il ne gagne pas : l'AutomationBench de Zapier, où Astra fait 41,4 % contre ses 40,0 %, et Terminal-Bench-Science 0.1, où Astra fait 64,6 % contre ses 58,7 %. Lisez ces écarts avec la réserve qu'Anthropic imprime elle-même, à savoir que le modèle "performs at the level of Claude Fable 5.1 on most work" et que "benchmark margins have become a less reliable guide to real-world differences". Il est disponible sur la Claude Platform sous claude-opus-5-5 ainsi que sur AWS, Google Cloud et Microsoft Azure, les limites sur cinq heures augmentent sur Pro, Max et Team, et Claude Sonnet 5.5 et Claude Haiku 5.5 suivront dans les prochaines semaines. Comme il égale Claude Mythos 5.1 en biologie et en cybersécurité, il sort avec les protections de Fable 5.1 et un nouveau Life Sciences Verification Program pour les laboratoires vérifiés. Aucun classement d'Arena ne l'a encore évalué. Tout le détail dans notre analyse de Claude Opus 5.5.
21 sept. SpaceXAI Grok 4.7 arrive sur un modèle de base plus grand à 2 $ / 6 $ inchangés et coûte 47 % de plus par tâche Nouveau
SpaceXAI a publié Grok 4.7 le 21 septembre 2026 comme son modèle le plus performant pour la programmation et le travail de connaissance. Il repose sur un modèle de base nouveau et plus grand que Grok 4.6, avec une campagne d'apprentissage par renforcement plus longue pondérée vers des tâches de plusieurs heures, et il a été entraîné à comprendre nativement le harness Grok Bot. L'entreprise ne publie aucun nombre de paramètres. Selon ses propres chiffres il obtient 46,3 % sur CursorBench 4.0 contre 40,4 % pour Grok 4.6 et 41,7 % pour GPT-5.6 Sol, 71,0 % sur DeepSWE v1.1 en effort élevé, 64,0 % sur EEBench, 38,0 % sur Terminal-Bench 4.0, 19,6 % sur le benchmark d'agent juridique Harvey et 56,7 % sur HealthBench Professional. De façon indépendante, Artificial Analysis le place à 46,3 sur l'Intelligence Index v4.3.2 en effort élevé contre 44,3 pour Grok 4.6, et à 1695 sur GDPval-AA v2.1 et 1657 sur AA-Briefcase v1.1, tous deux au-dessus des 1542 et 1569 de GPT-6 Astra. Le prix ne bouge pas, 2 $ / 6 $ par million de tokens avec la requête entière refacturée à 4 $ / 12 $ au-delà de 200 000 tokens de prompt, et une variante rapide tourne à deux fois la vitesse de sortie pour deux fois le prix. Ce qui bouge, c'est le coût par tâche : 2,73 $ contre 1,86 $ pour Grok 4.6, parce que la 4.7 émet environ deux fois plus de tokens de sortie pour arriver au même point, et l'effort xhigh n'apporte aucun point d'indice supplémentaire sur l'une ou l'autre génération. Côté sûreté, SpaceXAI annonce la meilleure résistance aux refus et aux jailbreaks qu'elle ait testée, 62,4 % sur le benchmark de biosécurité de LatchBio et 3,3 % de prompts à double usage risqués laissés passer sur son propre HackerBench v0.3. La disponibilité est côté développeurs : l'API Grok, Cursor, Grok Build, des harnesses de programmation tiers et des routeurs cloud. L'annonce ne dit rien de l'application grand public Grok, qui sert toujours Grok 4.6. Tout le détail dans notre analyse de Grok 4.7.
21 sept. Xiaomi Le MiMo-V2.6-Pro de Xiaomi est le modèle ouvert le mieux noté jamais mesuré, à 0,13 $ par tâche sous licence MIT Nouveau
Xiaomi a publié MiMo-V2.6-Pro le 21 septembre 2026 sous licence MIT simple, les poids étant sur Hugging Face à XiaomiMiMo/MiMo-V2.6-Pro-RL le jour même. C'est un mélange d'experts de 1,02 billion de paramètres dont 42 milliards actifs, avec un contexte de 1M de tokens. Artificial Analysis le mesure, et ne l'estime pas, à 46,3 sur l'Intelligence Index v4.3.2, le meilleur score ouvert qu'elle ait jamais publié : au-dessus de GLM-5.3 à 44,8, au-dessus de Kimi K3 à 43,6 et à égalité avec le tout nouveau Grok 4.7 de SpaceXAI. L'autre moitié de l'histoire, c'est le coût. Il traite une tâche de l'Intelligence Index pour 0,13 $ à 0,435 $ / 0,87 $ par million de tokens, moins cher par tâche que tout autre modèle de cette page, environ la moitié de GLM 5.3 Flash pour quatre points et demi de plus. Il prend aussi 34,8 % sur Terminal-Bench 4.0, 1673 sur GDPval-AA v2.1, 49,4 % sur Humanity's Last Exam et 86,3 % sur AA-LCR, ce qui le place au-dessus de Kimi K3 sur trois de ces quatre. Deux limites méritent d'être dites franchement. Aucun classement d'Arena ne l'a évalué, il n'existe donc aucune donnée de préférence humaine à son sujet, et il a été publié il y a quatre jours, sans historique indépendant au-delà d'Artificial Analysis. Et 1,02 billion de paramètres, c'est un cluster, pas une station de travail, raison pour laquelle GLM 5.3 Flash reste notre recommandation pour les équipes qui veulent vraiment héberger le leur. Il prend la couronne des poids ouverts de cette page sur le score mesuré et sur le coût.
15 sept. TypeSafe TypeSafe sort de la furtivité avec Jev, un modèle qui renvoie des décisions typées au lieu de texte, à 0,042 $ par 1M de tokens Nouveau
TypeSafe AI est sorti de deux ans de furtivité le 15 septembre 2026 avec 40 millions de dollars en amorçage menés par DCVC et un modèle qui ne génère aucun texte. Jev est le premier de ce que l'entreprise appelle les modèles System One : vous envoyez un bloc d'état et un ensemble fixe de questions typées, et il répond à toutes en une seule passe parallèle, en renvoyant un choix, un score ou une probabilité oui-non au lieu d'une phrase. Comme l'espace des réponses est défini avant l'appel, il ne peut pas renvoyer un résultat mal formé, d'où la phrase de l'annonce selon laquelle Jev ne peut pas halluciner. Il peut malgré tout choisir la mauvaise option, et la documentation de TypeSafe précise que la calibration ne garantit pas qu'une réponse individuelle soit correcte. Le tarif est de 42 $ par milliard de tokens d'entrée, soit 0,042 $ par 1M, sortie gratuite, contexte de 64k et entrée texte uniquement. Les chiffres de performance demandent de la prudence, car l'entreprise en a publié quatre différents en trois jours : de moins de 100 millisecondes et jusqu'à 100x plus rapide dans le communiqué à 193,6x plus rapide et 444,6x moins cher sur la page d'accueil, chaque fois face à un rival différent, sa propre note de bas de page qualifiant les grands chiffres de haut de la fourchette des gains réels. Son évaluation de workflows se mesure à la moyenne de GPT-6 Astra et Fable 5.1 plutôt qu'à une vérité de référence, et l'entreprise ne publie volontairement aucun score de benchmark public. Deux tests indépendants du 18 septembre ont mesuré environ 6x moins cher et 8x plus rapide face à un modèle bon marché avec le raisonnement désactivé, et la calibration a tenu. Rien de tout cela ne déplace un choix sur cette page : Jev n'a pas d'interface grand public et son accès anticipé se fait sur liste d'attente. Tous les détails dans notre explication des modèles System One.
10 sept. DeepSeek DeepSeek retire V4-Flash, le remplace par V4.1-Flash et baisse le tarif Flash d'environ un tiers Nouveau
DeepSeek a retiré DeepSeek-V4-Flash le 10 septembre 2026 et mis DeepSeek-V4.1-Flash à sa place. Le nom du modèle est désormais deepseek-flash ; les anciens noms deepseek-v4-flash et deepseek-v4-flash-vision-exp répondent toujours, mais les modèles derrière eux sont retirés et les requêtes sont servies par V4.1-Flash, facturées au tarif Flash. Ce tarif baisse d'environ un tiers : 0,15 $ / 0,60 $ par 1M de tokens hors pointe et 0,30 $ / 1,20 $ en pointe, contre 0,22 $ / 0,66 $ et 0,44 $ / 1,32 $ pour la version remplacée, avec les succès de cache à 0,003 $ hors pointe. Les fenêtres de pointe ne changent pas, de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine, toute autre heure étant à moitié prix. V4-Pro reste inchangé à 0,66 $ / 1,98 $ hors pointe, et DeepSeek a annoncé qu'il continuerait à le servir au-delà de sa date d'arrêt du 14 septembre. Le nouveau modèle est un mixture-of-experts de 552 milliards de paramètres sur une architecture causal encoder-decoder qui active 8 milliards de paramètres au prefill et 16 milliards au décodage, accepte un contexte de 1M de tokens, lit nativement les images et est paru sur Hugging Face sous licence MIT le jour même. Artificial Analysis lui attribue 39,5 sur l'Intelligence Index v4.3 contre 34,5 pour la version V4-Flash 0731 qu'il remplace, à 0,27 $ par tâche de l'index. Il ne reprend pas pour autant le choix rapport prix-performance : GLM 5.3 Flash affiche 41,9 pour 0,25 $ par tâche. Tous les détails dans notre guide des tarifs DeepSeek.
3 sept. OpenAI GPT-6 Astra sort à 10 $ / 50 $ et, en un jour, il est sur Plus et Pro et domine les classements de programmation Nouveau
OpenAI a lancé GPT-6 Astra le 3 septembre 2026, ce qui tranche le débat qui a duré toute l'année : c'est bien GPT-6, et non une nouvelle version intermédiaire de la lignée GPT-5. Le président de l'entreprise, Greg Brockman, a déclaré lors d'un point presse « Bienvenue dans l'ère de l'AGI. » Les chiffres indépendants sont plus mesurés que le discours. Artificial Analysis attribue 61 à Astra sur l'Intelligence Index v4.1.1 en effort max, exactement à égalité avec GPT-5.6 Sol, cinq points derrière Claude Fable 5.1 à 66 et deux derrière Claude Opus 5 à 63, et il facture 10 $ / 50 $ par 1M de tokens contre les 4 $ / 20 $ de Sol, soit 75 % de plus par tâche d'index que le modèle qu'il remplace. Le meilleur résultat se trouve sur le Coding Agent Index, où Astra dans Codex obtient 67, à égalité avec Claude Opus 5 et Claude Fable 5 dans Claude Code et derrière les 70 de Claude Fable 5.1, et il y parvient avec un tiers des tokens de Sol et un cinquième de ceux d'Opus 5, ce qui le place sur la frontière d'efficacité des coûts. Il divise aussi par deux les hallucinations sur AA-Omniscience, de 92 % à 51 % en effort max, tout en gagnant quatre points de précision, et ajoute environ 80 Elo sur AA-Briefcase et six points sur Humanity's Last Exam. En face, il perd environ 80 Elo sur GDPval-AA v2 et recule de deux à trois points sur le support client, SciCode et le raisonnement en contexte long. Deux réserves accompagnent les chiffres du lancement : les 98,6 % sur ARC-AGI-3 ne sont pas un taux de résolution mais un score d'efficacité des actions face à une référence humaine, mesuré sur un harnais dont OpenAI a elle-même montré qu'il pouvait tripler le résultat, et Epoch AI indique qu'OpenAI a financé FrontierMath et dispose d'un accès exclusif à une partie du jeu. La vraie contrainte, c'est la disponibilité. Astra est le premier modèle qu'OpenAI a classé critique en cybersécurité dans son Preparedness Framework, si bien que les défenseurs agréés du programme Daybreak l'ont obtenu en premier. ChatGPT Business et Pro ont suivi le 4 septembre et Plus quelques heures plus tard, tandis que l'API, AWS, Azure et l'offre gratuite restent en attente. Artificial Analysis a depuis retiré le Coding Agent Index et, dans sa propre campagne Terminal-Bench 4.0, Astra domine désormais nettement, 60 % contre les 55 % de Claude Fable 5.1, ce qui a fait passer la couronne de la programmation à Astra sur cette page. Tous les détails dans notre analyse de GPT-6 Astra.
2 sept. Alibaba Qwen3.8-Max-0902 prend à Claude Opus 5 le classement WebDev d'Arena de trois points, à 2 $ / 6 $ Nouveau
Alibaba a livré Qwen3.8-Max-0902 le 2 septembre 2026, et la première chose à bien comprendre est le nom : il s'agit d'un rafraîchissement de post-entraînement du Qwen3.8-Max sorti le 3 août, et non d'une nouvelle version, avec les mêmes 2 400 milliards de paramètres et la même fenêtre de contexte de 1M de tokens. Qwen indique qu'il a été post-entraîné en plus sur la programmation et le travail de type Cowork. Ce qui compte, c'est le classement qu'il a déplacé. Arena a annoncé le même jour que Qwen3.8-Max-0902 débutait en #1 au général de Code Arena: WebDev avec 1691 points, trois points devant Claude Opus 5 (Max), dix-sept devant Kimi K3 (Max) et vingt-deux devant le précédent Qwen3.8-Max, en prenant aussi le #1 dans les catégories Data & Analytics et Consumer Product. C'est la première fois cette année qu'un modèle d'Anthropic est délogé du sommet d'un classement de programmation par votes. Le tarif est de 2 $ / 6 $ par 1M de tokens avec des cache hits à 0,17 $ explicite et 0,25 $ implicite, ce qu'Arena comptabilise comme 5 $ mélangés par million et la meilleure position sur sa frontière de Pareto. À lire avec trois réserves. Trois points tiennent dans le bruit d'un classement par votes, Artificial Analysis n'avait alors publié aucun Intelligence Index pour l'instantané 0902 et lui attribue depuis 45,4 sur la v4.3, et c'est un modèle hébergé sur QwenCloud sans interface de chat grand public : les poids ouverts qu'Alibaba avait promis pour Qwen3.8-Max en août ne sont toujours pas arrivés, donc rien de tout cela ne change notre choix open-weight. Arena précise que les scores d'Agent Arena sont encore à venir. Qwen3.8-Max-0902 est depuis retombé à la quatrième place sur WebDev, derrière GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5, et la catégorie programmation est passée à Astra. Tout le détail dans notre analyse de Qwen 3.8.
2 sept. Meta Muse Spark 1.3, Intelligence Index de 57 à 61 à un tarif inchangé de 1,25 $ / 4,25 $, gagne en programmation et perd toutes les lignes agent Nouveau
Meta a lancé Muse Spark 1.3 le 2 septembre 2026, son quatrième modèle Muse Spark en cinq mois, dans Muse Code et la Meta Model API. Artificial Analysis note le modèle à 61 sur l'Intelligence Index v4.1.1, contre 57 pour la 1.2 et 53 pour la 1.1, soit huit points en deux mois et la progression la plus rapide que quiconque réalise sur cette page. Le prix n'a pas bougé du tout : 1,25 $ / 4,25 $ par 1M de tokens sur une fenêtre de contexte de 1M de tokens, avec le palier Contributor toujours à 0,10 $ / 0,20 $ en échange du fait de laisser Meta s'entraîner sur vos prompts et vos completions. Deux choses dans ce lancement méritent une lecture attentive. Sur le propre tableau de Meta, le modèle gagne toutes les lignes de programmation, DeepSWE v1.1 à 75,4 contre les 74,0 de Claude Opus 5 et SWEAtlas CodeBase QnA à 59,4, il fait jeu égal avec GPT-5.6 Sol sur Terminal-Bench 2.1 à 88,8, et il prend les deux bandes de long contexte MRCR avec une large avance, 98,1 sur la bande 512K à 1M contre 55,5 pour la 1.2. Mais il perd aussi les six lignes que Meta regroupe sous Agent, quatre face à Opus 5 et deux face à GPT-5.6 Sol, et cette moitié du graphique n'a presque pas été reprise. L'autre piège tient au modèle réellement mesuré : la colonne évaluée est Muse Spark 1.3 (max), un aperçu limité réservé aux partenaires de Meta qui obtient 62, alors que la version que tout le monde peut appeler aujourd'hui est xhigh à 61, et Meta a fait tourner la colonne de comparaison 1.2 en xhigh et non en max. Meta l'a d'abord sorti pour les développeurs, sur Muse Code et la Meta Model API, en annonçant qu'un déploiement sur Facebook, Instagram et l'app Meta AI suivrait dans les jours à venir, et la promesse de poids ouverts a de nouveau glissé : l'engagement d'août de publier les poids de Muse Spark 1.2 est devenu une phrase sans date sur des poids ouverts à venir. Tous les détails dans notre analyse de Muse Spark 1.3.
2 sept. Google Gemini 3.8 Flash, trois points de plus sur l'Intelligence Index au même tarif de 0,75 $ / 3,75 $ Nouveau
Google a rendu Gemini 3.8 Flash généralement disponible le 2 septembre 2026, trois semaines après 3.7 Flash et comme sa troisième sortie Flash en 43 jours. Toutes les spécifications sont reconduites à l'identique : 1M de contexte d'entrée, une limite de sortie de 64K, une date de connaissance en mars 2026, la même liste de modalités et le même tarif introductif de 0,75 $ / 3,75 $ par 1M de tokens, qui double à 1,50 $ / 7,50 $ le 1er janvier 2027. Seuls les scores ont bougé, et ils ont bougé sur chaque ligne publiée. DeepSWE v1.1 passe de 65,3 % à 73,7 %, Terminal-bench 2.1 de 85,8 % à 89,4 %, Terminal-bench 4.0 de 11,2 % à 19,1 % et BioMysteryBench Human Difficult de 43,5 % à 56,5 %. Artificial Analysis lui donne 59 sur l'Intelligence Index v4.1.1 contre 56 pour 3.7 Flash, et mesure 304,6 tokens de sortie par seconde contre 279,4, avec un temps jusqu'au premier token lent de 13,39 secondes qui en fait un modèle de traitement par lots et d'agents plutôt qu'un modèle de chat interactif. Lisez les victoires avec les défaites : le propre tableau comparatif de Google donne 8 lignes sur 14 à 3.8 Flash, et Claude Opus 5 remporte toujours Terminal-bench 4.0 par 51,8 % contre 19,1 %, OSWorld-2.0 par 75,4 % contre 59,0 % et GDPVal-AA v2 par 1824 contre 1545 d'Elo. Le chiffre DeepSWE repris par une grande partie de la couverture du lancement, 71,0 %, n'est pas celui du PDF de Google, qui indique 73,7 % contre 74,0 % pour Opus 5. L'accès développeur était actif dès l'annonce, via l'API Gemini, AI Studio, Antigravity et la Gemini Enterprise Agent Platform. L'accès grand public est rapporté pour les abonnés Google AI Pro et Ultra, mais les notes de version des applications Gemini n'en portent encore aucune mention, et le palier gratuit de Gemini fonctionne toujours avec 3.6 Flash. Tous les détails dans notre analyse de Gemini 3.8 Flash.
1er sept. Anthropic Claude Fable 5.1 et Mythos 5.1, un nouveau #1 sur Artificial Analysis à 66 et une baisse de 75 % sur les lectures de cache Nouveau
Anthropic a publié Claude Fable 5.1 et Claude Mythos 5.1 le 1er septembre 2026, et il s'agit d'un seul modèle en deux configurations de garde-fous, pas de deux modèles. Fable 5.1 est disponible pour tous ; Mythos 5.1 relâche les restrictions en biologie et en cybersécurité et se distribue sur invitation, sans critères d'éligibilité publiés. Artificial Analysis note Fable 5.1 à 66 sur son Intelligence Index v4.1.1 en effort max, le score le plus élevé qu'elle ait jamais mesuré, devant Claude Opus 5 à 63, Claude Fable 5 à 62 et GPT-5.6 Sol et Grok 4.6 à 61. Il remportait alors aussi l'Agentic Index à 61 contre les 59 d'Opus 5, le classement GDPval-AA v2 de livrables professionnels à 1853 contre 1824, et Humanity's Last Exam à 59,1 % contre les 55,5 % de Fable 5. Le réglage effort compte ici plus que d'habitude : le même modèle affiche 58 en low, 60 en medium, 62 en high et 65 en xhigh, et ces réglages couvrent un écart de un à onze sur les tokens de sortie, de 13,1 millions à 143,7 millions sur l'ensemble de la suite. Les tarifs restent inchangés à 10 $ / 50 $ par 1M de tokens, mais les lectures de cache baissent de 75 % à 0,25 $ contre 1,00 $ pour Fable 5, et c'est là que se trouve la vraie économie sur les longues exécutions agentiques. Sur les propres chiffres d'Anthropic, il atteint 52,6 % sur Terminal-Bench-Science 0.1 contre les 29,0 % d'Opus 5, et la system card de 212 pages a relevé l'évaluation du risque d'alignement de l'entreprise elle-même de très faible à faible. Deux points à peser avant de basculer : Anthropic recommande toujours de commencer par Opus 5 pour la plupart des charges, à moitié prix, et au lancement aucun classement d'Arena n'avait de votes pour l'un ou l'autre modèle. Fable 5.1 est depuis noté : il est deuxième sur les deux classements de programmation d'Arena et cinquième sur celui du texte. Tous les détails dans notre décryptage de Claude Fable 5.1 et Mythos 5.1.
28 août Z.ai Les poids de GLM 5.3 sont sortis après la pause de sécurité, mais la licence n'est pas MIT Nouveau
Z.ai a publié les poids de GLM 5.3 sur Hugging Face le 28 août 2026, deux semaines après le lancement de l'API et exactement à la date que portait son espace réservé, si bien que l'évaluation de sécurité promise a bel et bien eu lieu et que la pause est close plutôt qu'ouverte. Ce qui a changé, c'est la licence. GLM 5.3 Flash était sorti sous MIT pur deux jours plus tôt ; le vaisseau amiral porte un document maison intitulé GLM 5.3 License, et le champ licence de la fiche du modèle indique glm-5.3 et non mit. La concession de droits suit MIT de près, avec le droit d'exécuter, de déployer, d'affiner, de modifier, de distribuer et de vendre, et avec les poids explicitement inclus dans la définition du logiciel, de sorte que l'usage commercial reste ouvert à presque tout le monde. Une clause est réellement nouvelle : un opérateur de model-as-a-service dont le chiffre d'affaires dépasse 10 milliards de dollars sur douze mois consécutifs doit passer une revue de sécurité de Z.ai avant tout déploiement commercial, Z.ai se réservant d'en déterminer seule la portée et la méthode. Notez aussi que Hugging Face compte le checkpoint publié à 753B paramètres, contre la base de 744B que Z.ai dit partager avec GLM-5.2 ; c'est le genre d'écart que produit un comptage mécanique de paramètres, et non la preuve d'un modèle différent. Cela ne déplace pas notre choix open-weight. GLM 5.3 Flash reste le modèle que nous hébergerions, car 320B sous MIT pur s'exploite et se sécurise juridiquement bien plus facilement que 753B sous une licence maison. Tous les détails dans notre décryptage de GLM 5.3.
28 août Tencent Tencent Hy4 Preview, 770B de poids ouverts sous Apache 2.0 et le plus grand modèle permissif à ce jour Nouveau
Tencent a publié et ouvert Hy4 preview le 28 août 2026, nouveau vaisseau amiral de sa lignée Hunyuan et plus grand modèle jamais publié sous Apache 2.0. Il tourne sur 770 milliards de paramètres au total dont 49 milliards actifs par token dans une architecture mixture-of-experts, accepte une fenêtre de contexte que Tencent décrit comme dépassant 1M de tokens, et est livré avec une version FP8 à côté des poids en pleine précision. Le tarif de l'API est de 0,834 $ par 1M de tokens en entrée, 2,501 $ en sortie et 0,042 $ pour l'entrée en cache, ce qui est peu cher pour cette taille. La vraie nouvelle est la licence : Apache 2.0 est plus permissive que le document maison de Kimi K3 et que la licence attachée par Z.ai à GLM 5.3 le même jour. Traitez l'affirmation de qualité avec prudence, car la seule preuve à ce jour vient de l'éditeur. Tencent a mené une évaluation à l'aveugle interne de 203 tâches d'ingénierie notées par 163 experts, où Hy4 preview obtient 2,99 sur 4,00 contre 2,94 pour Kimi K3 et 2,92 pour GLM 5.3. C'est le propre panel de Tencent, les écarts tiennent dans un dixième de point, et aucune maison indépendante n'avait alors publié d'Intelligence Index ni de note Arena. Arena le place depuis onzième sur WebDev à 1624, tandis qu'Artificial Analysis n'a toujours pas d'Intelligence Index pour lui, nous le listons donc plutôt que de le classer. Tencent affirme aussi que le modèle a contribué à automatiser l'optimisation de son propre pipeline d'entraînement et a relevé son propre débit d'inférence de 31,8 % mesurés. Il est disponible en poids ouverts et via WorkBuddy, CodeBuddy, Yuanbao et ima, ainsi que Tencent Cloud TokenHub et OpenRouter, avec un accès gratuit sur WorkBuddy et CodeBuddy pendant deux semaines à compter du lancement. Tout le détail dans notre analyse de Tencent Hy4 Preview.
26 août Z.ai GLM 5.3 Flash, Ox Alpha démasqué, et les premiers poids MIT publiés par Z.ai depuis GLM-5.2 Nouveau
Z.ai a publié GLM 5.3 Flash le 26 août 2026, et ce n'est pas le modèle que le secteur attendait. Les poids retenus le 14 août appartiennent à GLM 5.3 ; celui-ci est un modèle distinct sur une base fraîchement entraînée, 320 milliards de paramètres dont 18 milliards actifs, le premier modèle nativement multimodal de la lignée GLM-5, et il est arrivé sur Hugging Face sous licence MIT le jour même. C'est aussi le modèle furtif qui servait du trafic sur OpenRouter sous le nom d'Ox Alpha, exécuté pendant cet aperçu entièrement sur des puces d'IA chinoises, ce qui décrit la façon dont il a été servi, pas la façon dont il a été entraîné. Artificial Analysis lui attribue 57 sur l'Intelligence Index v4.1.1, quatre points au-dessus de GLM-5.2 pour moins de la moitié de la taille, et le place sur la frontière de Pareto entre intelligence et coût. Sur l'index v4.3 actuel, il affiche 41,9 contre 34,0 pour GLM-5.2, à 0,25 $ par tâche de l'index. Le tarif catalogue est de 0,15 $ / 0,50 $ par 1M de tokens ; la promotion de lancement de 50 % a couru jusqu'à 24h00 le 9 septembre et a pris fin. Le remplacement par V4.1-Flash chez DeepSeek le 10 septembre a comblé l'essentiel de l'écart : hors pointe, les deux sont désormais à égalité à 0,15 $ en entrée, GLM restant moins cher en sortie, 0,50 $ contre 0,60 $, et en pointe GLM passe sous les deux. Traitez les chiffres de programmation et d'agentique avec prudence : ils viennent du graphique de Z.ai lui-même, qui choisit Claude Opus 4.8 et GPT-5.6 Terra comme comparaison plutôt que les leaders actuels, et on y lit Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 contre 46,2 pour GLM-5.2 et AutomationBench 48,8. Le seul chiffre de ce graphique mesuré par Artificial Analysis est GDPval-AA v2, où GLM 5.3 Flash atteint 1773 Elo, le plus élevé qui y figure. Arena l'a depuis noté, dix-septième sur WebDev et dixième sur image-to-WebDev. Cela déplace bel et bien notre choix open-weight : GLM 5.3 Flash remplace GLM-5.2 comme le modèle MIT que nous hébergerions. Un avertissement côté matériel : 18B actifs ne veut pas dire 18B à héberger, car le routage mixture-of-experts a besoin des 320B de poids résidents, il s'agit donc d'un serveur multi-GPU et non d'une station de travail. Tous les détails dans notre décryptage de GLM 5.3 Flash.
26 août Alibaba Qwen3.8-Flash-Next, poids ouverts et premier aperçu public de l'architecture Qwen4 Nouveau
Alibaba a publié Qwen3.8-Flash-Next sur Hugging Face le 26 août 2026, et l'enjeu tient davantage à l'architecture qu'au tableau des scores : Qwen le présente comme un aperçu précoce de la conception qu'utilisera la famille Qwen4, publié pour que la communauté puisse s'y préparer. C'est un mixture-of-experts de 125 milliards de paramètres dont 6 milliards seulement actifs par token, plus un embedding N-gramme distinct de 51 milliards de paramètres, et il accepte texte, image et vidéo. Le contexte est de 262 144 tokens en natif, extensible à 1M. Parmi les chiffres publiés par Qwen figurent 91,7 sur GPQA Diamond, 62,5 sur SWE-Bench Pro, 58,7 sur DeepSWE 1.1, 81,0 sur SWE-Bench Multilingual et 84,5 sur AndroidWorld vision, tous fournis par l'éditeur et, à l'époque, sans aucune note indépendante. Artificial Analysis lui attribue depuis 39,9 sur l'Intelligence Index v4.3 et Arena le place neuvième sur WebDev à 1635. Mieux vaut lire la licence avant de construire dessus, car ce n'est pas Apache. La Qwen Community License 1.0 autorise l'usage commercial, la modification et l'hébergement, mais impose d'afficher visiblement le nom du modèle dès qu'un produit dépasse 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, et impose une licence distincte de Qwen pour exploiter une activité de model-as-a-service ou d'assistant de travail IA. L'usage interne est exempté de cette seconde condition.
21 août OpenAI GPT-5.6 Sol baisse de plus de 20 % et passe sous Claude Opus 5 des deux côtés Nouveau
OpenAI a ramené GPT-5.6 Sol de 5 $ / 30 $ à 4 $ / 20 $ par 1M de tokens le 21 août 2026, la première baisse du modèle phare depuis le lancement de la famille GPT-5.6 en juillet. Le tarif est promotionnel et doit durer environ trois mois selon OpenAI. Il couvre l'API ainsi que les crédits Codex et ChatGPT Work ; les prix des abonnements Plus, Pro et Business ne changent pas. À 4 $ / 20 $, Sol passe désormais sous Claude Opus 5 à 5 $ / 25 $ en entrée comme en sortie, la première fois que le modèle phare d'OpenAI est le moins cher des deux.
16 août DeepSeek DeepSeek multiplie ses tarifs d'API par environ quatre et scinde sa grille en heures de pointe et heures creuses Nouveau
DeepSeek a basculé ses deux modèles V4 sur une nouvelle grille tarifaire à 16h00 UTC le 16 août 2026, et la direction est inhabituelle dans ce secteur : les prix ont augmenté, d'environ quatre fois en heures de pointe. V4-Flash 0731 est passé de 0,14 $ / 0,28 $ fixes par 1M de tokens à 0,22 $ / 0,66 $ hors pointe et 0,44 $ / 1,32 $ en pointe, et V4-Pro 0813 de 0,435 $ / 0,87 $ à 0,66 $ / 1,98 $ hors pointe et 1,32 $ / 3,96 $ en pointe, avec l'entrée en cache à 0,007 $ et 0,022 $ hors pointe respectivement. Les heures de pointe vont de 01h00 à 04h00 et de 06h00 à 10h00 UTC, du lundi au vendredi, et toute autre heure est hors pointe, à exactement la moitié du tarif de pointe. DeepSeek a présenté le changement comme une répartition plus raisonnable de la capacité. Rien n'a changé dans les modèles eux-mêmes, c'est donc purement un événement économique, mais lourd de conséquences pour cette page : il a coûté à DeepSeek V4-Flash le choix rapport prix-performance, passé à GLM 5.3 Flash à 0,15 $ / 0,50 $ catalogue. DeepSeek a annulé l'essentiel de la hausse le 10 septembre, retirant V4-Flash et le remplaçant par V4.1-Flash à 0,15 $ / 0,60 $ hors pointe, si bien que les deux sont de nouveau à égalité en entrée hors pointe. Les poids restent sous MIT, ceux qui l'auto-hébergent ne sont donc pas concernés. Tous les détails dans notre décryptage de DeepSeek V4.
14 août Z.ai GLM 5.3, un grand bond agentique par le seul post-entraînement, sorti sans les open weights Nouveau
Z.ai a publié GLM 5.3 le 14 août 2026, et le fait notable est ce qui n'a pas changé : il tourne sur la même base de 744 milliards de paramètres que GLM-5.2, sans nouveau pré-entraînement. Tout le gain vient d'un post-entraînement mis à l'échelle, et le gain agentique est important. Sur le propre graphique de Z.ai, Terminal-Bench 3.0 passe de 4,6 à 28,3, DeepSWE v1.1 de 46,2 à 66,9 et CyberGym de 77,2 % à 84,5 %, ce qui devance de peu, selon l'entreprise, Claude Mythos 5 à 83,8 et GPT-5.6 Sol à 83,6. Tous ces chiffres sont ceux de l'éditeur, sans audit indépendant à ce jour, et le graphique est moins flatteur ailleurs : sur le Code Bench interne de Z.ai, Claude Fable 5 mène toujours à 39,5 % contre 31,4 % pour GLM 5.3, et sur ExploitBench les leaders frontier sont à 78,0 % contre 54,4 %. Le hic tient à la licence, pas au score. GLM-5.2 a publié des poids sous licence MIT en quelques jours ; GLM 5.3 est sorti sans aucun, et Z.ai a indiqué qu'ils suivraient après une évaluation de sécurité de la capacité du modèle à découvrir des vulnérabilités, dans environ deux semaines. Cela s'est réglé le 28 août 2026 : Z.ai a publié les poids exactement à la date que portait l'espace réservé, mais sous une licence maison intitulée GLM 5.3 License plutôt que le MIT pur qu'ont reçu GLM-5.2 et GLM 5.3 Flash. Le tarif au token est désormais publié, 1,40 $ / 4,40 $ par 1M de tokens, aux côtés du GLM Coding Plan et de ZCode. Ce qui est arrivé le 26 août, c'est GLM 5.3 Flash, un modèle différent et plus petit qui, lui, a livré des poids MIT, et c'est cette sortie qui a déplacé notre choix open-weight. Tous les détails dans notre décryptage de GLM 5.3.
13 août Google Gemini 3.7 Flash, les scores de programmation bondissent et le prix est divisé par deux à 0,75 $ / 3,75 $, jusqu'en janvier Nouveau
Google a sorti Gemini 3.7 Flash le 13 août 2026, 23 jours après 3.6 Flash et comme sa troisième version Flash en moins de deux mois, alors que Gemini 3.5 Pro n'est toujours pas sorti. Les gains en programmation sont l'essentiel : DeepSWE v1.1 grimpe de 49,0 % à 65,3 %, FrontierCode 1.1 Main de 34,4 % à 43,6 %, et AutomationBench double presque, de 17,0 % à 30,4 %. Artificial Analysis le note à 56 sur son index v4.1.1 contre 52 pour 3.6 Flash, et le classe premier sur 182 modèles en vitesse de sortie à 385,1 tokens par seconde, ce qui le place sur la frontière de Pareto intelligence contre temps. La fenêtre de contexte et la limite de sortie de 64K sont inchangées par rapport à 3.6 Flash, rien n'a donc été sacrifié. Deux réserves pèsent plus lourd que les benchmarks. Le tarif de 0,75 $ / 3,75 $ est introductif et expire le 31 décembre 2026, après quoi il double à 1,50 $ / 7,50 $, exactement ce que coûtait 3.6 Flash à son lancement ; Google a aussi basculé 3.6 Flash sur le même tarif, les deux coûtent donc désormais la même chose et la mise à niveau est une pure décision de capacité. Et l'accès grand public passe uniquement par Spark, qui exige Google AI Pro ou Ultra et exclut l'Espace économique européen, le Royaume-Uni, la Suisse et le Nigeria, si bien que la plupart des lecteurs européens ne peuvent pas l'atteindre dans l'application Gemini. Le palier gratuit de Gemini reçoit toujours 3.6 Flash. L'accès API n'est affecté nulle part. Tous les détails dans notre décryptage de Gemini 3.7 Flash.
12 août SpaceXAI Grok 4.6, le post-entraînement fait passer l'Intelligence Index de 56 à 61 à 2 $ / 6 $ inchangés Nouveau
SpaceXAI a publié Grok 4.6 le 12 août 2026, et ce n'est explicitement pas un nouveau modèle de base : l'entreprise a conservé la fondation de Grok 4.5 et a acheté les gains avec une phase d'entraînement supplémentaire plus longue, des trajectoires de fine-tuning régénérées et de l'apprentissage par renforcement dans des environnements agentiques. Aucune nouvelle architecture ni aucun nombre de paramètres n'a été publié. Artificial Analysis le note à un Intelligence Index de 61, cinq points au-dessus de Grok 4.5, ce qui le place à égalité avec GPT-5.6 Sol à la troisième place, derrière Claude Opus 5 à 63 et Claude Fable 5 à 62, tel que l'index se présentait ce mois-là ; Claude Fable 5.1 est depuis passé au-dessus des trois à 66. Les chiffres agentiques sont plus solides que l'indice composite : un Elo de 1753 sur GDPval-AA v2 derrière le seul Opus 5, 88,4 % sur Terminal-Bench v2.1 et 50,7 % sur tau3-Banking. L'argument était alors l'efficience, à 0,84 $ par tâche d'index et environ 53 tours et 0,5 milliard de tokens d'entrée sur les tâches longues, contre environ 103 tours et 2,0 milliards pour Opus 5. Sur les chiffres v4.3 actuels d'Artificial Analysis, cet argument s'affaiblit : Grok 4.6 coûte 1,86 $ par tâche d'index, plus que les 1,61 $ de Muse Spark 1.3 pour un meilleur score. Les tarifs restent inchangés à 2 $ / 6 $ par 1M de tokens avec l'entrée en cache à 0,50 $, sur la même fenêtre de contexte de 500K tokens, mais il y a un piège à connaître : dès qu'un prompt atteint 200 000 tokens, SpaceXAI refacture la requête entière à 4 $ / 12 $, et non le seul dépassement. Un avertissement sur la couverture des benchmarks, car beaucoup d'articles l'ont déjà embrouillée : Terminal-Bench v3.0 est un test différent et bien plus difficile que la v2.1, donc 26 % sur v3.0 et 88,4 % sur v2.1 sont deux affirmations vraies sur le même modèle. Il est disponible dès le premier jour dans l'API SpaceXAI, dans Cursor et Grok Build, ainsi que chez les partenaires OpenRouter, Vercel et Cloudflare. Tous les détails dans notre décryptage des benchmarks et des prix de Grok 4.6.
5 août Meta Muse Spark 1.2 et Muse Code, Intelligence Index de 51 à 57 à un tarif inchangé de 1,25 $ / 4,25 $, plus un agent de programmation en terminal Nouveau
Meta a lancé Muse Spark 1.2 le 5 août 2026 aux côtés de Muse Code, son premier agent de programmation en terminal, qui fonctionne sur macOS et Linux sans application de bureau et sans abonnement. Artificial Analysis note le modèle à un Intelligence Index de 57 à son réglage de raisonnement le plus élevé sur son index actuel v4.1.1, contre 51 pour la 1.1 et 43 pour la version d'avril, et la quasi-totalité de ce gain est agentique plutôt que de la connaissance générale ; son Elo GDPval-AA v2 a bondi de 1371 à 1631 tandis que Terminal-Bench v2.1 n'est passé que de 78 % à 80 %. Le prix reste inchangé à 1,25 $ / 4,25 $ par 1M de tokens sur une fenêtre de contexte de 1M de tokens, et Meta a ajouté un palier Contributor à 0,10 $ / 0,20 $, environ 92 % moins cher, en échange du fait de laisser Meta s'entraîner sur vos prompts et vos completions. La disponibilité s'est élargie de l'aperçu réservé aux États-Unis sous lequel la 1.1 a été lancée à un accès mondial étendu via Muse Code, la Meta Model API et OpenRouter. Sur les propres graphiques de lancement de Meta, le modèle termine deuxième derrière Claude Opus 5 sur les trois benchmarks de programmation qu'il a publiés, avec 82,9 % contre 86,7 % sur Terminal-Bench 2.1.
3 août Alibaba Qwen 3.8 (Qwen3.8-Max), modèle phare multimodal de 2,4 billions de paramètres désormais disponible pour tous à 2 $ / 6 $ Nouveau
Alibaba a rendu Qwen3.8-Max disponible pour tous le 3 août 2026, deux semaines après l'avoir présenté en avant-première au WAIC Shanghai, et chaque chiffre qui manquait à l'avant-première a désormais une valeur derrière lui. Il fonctionne avec 2,4 billions de paramètres au total et environ 95 milliards actifs par token sur une conception Mixture-of-Experts clairsemée, prend en charge le texte, les images et la vidéo, et confirme une fenêtre de contexte de 1M de tokens avec jusqu'à 128K tokens de sortie. Le tarif de l'API est de 2 $ / 6 $ par 1M de tokens, uniforme sur tout le contexte plutôt qu'échelonné selon la longueur du prompt, avec des lectures en cache à 0,25 $. L'affirmation « juste derrière Fable 5 » se scinde désormais nettement en deux : sur le classement vision d'Arena, il est #2 à 1305, juste derrière Fable 5, mais sur le classement texte, il est #5 à 1496, derrière quatre entrées d'Anthropic. Les deux scores Arena sont encore signalés comme préliminaires, et les open weights promis ne sont pas arrivés. Nous maintenons Qwen 3.8 hors des choix classés jusqu'à ce que les poids et la licence arrivent réellement.
En attente Google Gemini 3.5 Pro, toujours pas sorti, des mois de retard selon Bloomberg Retardé
Gemini 3.5 Pro reste le plus gros lancement en attente. Google l'a annoncé à l'I/O le 19 mai aux côtés de Gemini 3.5 Flash, mais seul Flash est sorti, et l'objectif de juin a glissé. Bloomberg a rapporté le 16 juillet 2026 que le modèle a des mois de retard et n'a pas atteint les objectifs internes de Google, l'entreprise travaillant encore à améliorer ses capacités, en particulier en programmation. C'est tout le tableau sourcé. Google n'a jamais confirmé publiquement de date de lancement, et Google n'a pas publié de spécifications finales telles que la fenêtre de contexte ou les modes de raisonnement, alors traitez les chiffres qui circulent comme non confirmés. Utilisez Gemini 3.8 Flash entre-temps si vous passez par l'API, ou Gemini 3.6 Flash si vous êtes sur l'application gratuite Gemini, qui l'exécute toujours ; nous ferons passer 3.5 Pro dans le classement principal dès qu'il sera en ligne.
Choix de catégorie, septembre 2026

Meilleure IA pour l'écriture

1
Claude Fable 5.1
Meilleure écriture globale
2
Kimi K3
Fiction créative
3
Claude Sonnet 5
Gratuit au quotidien

La meilleure IA pour écrire est Claude Fable 5.1, et l'argument en sa faveur est la régularité, pas une première place isolée. C'est le seul modèle présent dans les six premiers des trois classements de prose : deuxième sur EQ-Bench Creative Writing v3 à 2152,7, deuxième sur LiveBench Language à 89,5 et sixième sur le classement d'écriture créative d'Arena. Aucun autre n'y parvient. GPT-6 Astra domine EQ-Bench à 2163,9 mais occupe la 25e place en écriture créative sur Arena ; Claude Fable 5 domine les classements texte et écriture créative d'Arena et arrive en tête de LiveBench Language à 90,7, mais est retombé huitième sur EQ-Bench. Claude Opus 5.5, qui a pris à Fable 5.1 l'Intelligence Index et Humanity's Last Exam le 22 septembre, n'est évalué ni sur EQ-Bench ni sur Arena et se classe huitième sur LiveBench Language : il n'a donc encore aucun argument sur les classements d'écriture, et la couronne ne lui revient pas. Si votre écriture est un livrable professionnel plutôt que de la prose, c'est une autre question, et le classement des livrables professionnels GDPval-AA v2.1 est mené par Claude Opus 5.5 à 1846 devant Claude Fable 5.1 à 1735 et Claude Opus 5 à 1708. Claude Sonnet 5 reste le meilleur rapport dans l'offre gratuite et Claude Fable 5 le choix si vous pesez les votes humains d'Arena plus que les scores de harness ; Fable 5 coûte 10 $ / 50 $ par million de tokens et est inclus en permanence dans Claude Max et Team Premium, à environ 50 % des limites d'usage habituelles. La traduction est une question distincte avec un gagnant distinct, que nous traitons dans notre guide de la meilleure IA pour traduire.

ModèleIdéal pourForceFaiblessePrix (par 1M de tokens)
Claude Fable 5.1Meilleure écriture globale#2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) et #6 écriture créative Arena, le meilleur classement combiné de tousN'en domine aucun des trois ; Claude Opus 5.5 a pris l'Intelligence Index et Humanity's Last Exam le 22 septembre10 $ / 50 $
Claude Fable 5En tête des classements de votes humains d'Arena#1 Arena texte global (1505,7), #1 LiveBench Language (90.7), #8 EQ-BenchL'option la plus chère ici10 $ / 50 $
Kimi K3Fiction créative et voix#4 EQ-Bench Creative Writing (2070.6)Seulement #27 sur Arena écriture créative3 $ / 15 $
Claude Sonnet 5Écriture gratuite au quotidienGratuit et par défaut sur claude.ai, contexte 1M#53 Arena écriture créative ; 75,0 LiveBench Language2 $ / 10 $, désormais permanent
Claude Opus 5Livrables professionnels au meilleur prix#2 GDPval-AA v2.1 à 1708, devant Fable 5 (1632)Derrière Fable 5 sur Arena texte, derrière Fable 5.1 sur GDPval-AA v2.15 $ / 25 $
GPT-5.5Écriture professionnelle ancrée dans les faitsGains documentés de fiabilité factuelle sur GPT-5.4Les paliers de raisonnement sont désormais marqués obsolètes5 $ / 30 $
Gemini 3.8 FlashBrouillons en masse à grande échelleIntelligence Index 40,9, 308,4 tok/s en sortie, contexte 1MRéglé pour les agents plutôt que la prose ; le tarif introductif double le 1er janvier 20270,75 $ / 3,75 $
Deuxième place et alternatives : Claude Fable 5 est le deuxième et le choix si vous accordez plus de poids aux votes humains d'Arena, Kimi K3 est le choix pour la fiction à la voix marquée, même s'il n'est plus que quatrième sur EQ-Bench, Claude Sonnet 5 est le choix rapport qualité-prix et celui à utiliser si vous ne payez pas, Claude Opus 5 est le choix moins cher pour les livrables professionnels, et Gemini 3.8 Flash est le choix pour rédiger en volume.
Ce qui a changé ce mois-ci

La couronne de l'écriture reste à Claude Fable 5.1, mais son fondement a changé. Claude Opus 5.5 lui a pris l'Intelligence Index et Humanity's Last Exam le 22 septembre, c'est-à-dire exactement ce que citait cette carte, nous avons donc réancré ce choix sur les classements qui mesurent vraiment la prose. Sur ceux-là, Fable 5.1 est le seul modèle dans les six premiers des trois : deuxième sur EQ-Bench Creative Writing, deuxième sur LiveBench Language et sixième sur le classement d'écriture créative d'Arena. Opus 5.5 n'est évalué sur aucun des deux premiers et se classe huitième sur le troisième, il n'a donc encore aucun argument en écriture. Arena a désormais évalué Fable 5.1, ce qui lève la réserve que nous portions le mois dernier selon laquelle les classements de préférence humaine ne s'étaient pas prononcés : il est cinquième au classement texte à 1498,5, où Claude Fable 5 mène toujours à 1505,7. GDPval-AA v2.1 a de nouveau été réancré et affiche maintenant 1846 pour Opus 5.5, 1735 pour Fable 5.1 et 1708 pour Opus 5, les chiffres de ce bloc sont donc nettement inférieurs à ceux d'août.

Choix de catégorie, septembre 2026

Meilleure IA pour le chat & l'assistant du quotidien

1
GPT-5.6
Par défaut de ChatGPT
2
Claude Fable 5
Le mieux noté
3
Claude Opus 5
Profondeur réfléchie

La meilleure IA pour le chat du quotidien est GPT-5.6, et la raison honnête tient à la portée plutôt qu'à la position dans les classements. C'est le modèle que ChatGPT sert par défaut à la plus grande base d'utilisateurs de la catégorie, ce qui en fait le meilleur assistant que la plupart des gens peuvent réellement ouvrir. En préférence humaine pure, ce n'est pas le leader : GPT-5.6 Sol se situe #18 sur le classement texte d'Arena à 1483,5, où Claude Fable 5 domine à 1505,7. La plupart des utilisateurs de ChatGPT reçoivent le palier équilibré Terra, qu'OpenAI dit égaler GPT-5.5 et qui, depuis la baisse de prix du 30 juillet 2026, coûte 60 % de moins. Il est disponible dans ChatGPT (gratuit avec limites, Plus à 20 $/mois, Pro à 100 $/mois), via l'API (Luna 0,20 $ / 1,20 $, Terra 2 $ / 12 $, Sol 4 $ / 20 $ par 1M de tokens), et intégré dans Fello AI aux côtés de Claude, Gemini, Grok et DeepSeek. Une réserve : la system card d'OpenAI et l'évaluateur METR ont signalé un comportement de « scheming » élevé chez Sol, donc GPT-5.5 Instant reste le choix le plus sûr pour un travail sensible aux hallucinations.

ModèleIdéal pourForceFaiblessePrix
GPT-5.6Chat du quotidien, par défaut de ChatGPTL'assistant que la plupart peuvent ouvrir ; Terra égale GPT-5.5 à ~moitié coût#14 sur Arena texte ; scheming signalé par METRGratuit / 20 $/mois Plus ; API 0,20 $ / 1,20 $ à 4 $ / 20 $
Claude Fable 5La conversation la mieux notée#1 sur Arena texte global (1505,7) et sur quatre de ses huit sous-catégoriesPas de version gratuite ; accès par crédits d'usage sur Pro10 $ / 50 $ API
Claude Opus 5Réponses réfléchies et nuancéesTroisième sur l'Intelligence Index d'Artificial Analysis (50,8), derrière Claude Fable 5.1 et GPT-6 Astra#10 sur Arena texte, derrière Claude Fable 520 $/mois Pro, 5 $ / 25 $ API
GPT-5.5 InstantTravail quotidien sensible aux hallucinations52,5 % d'affirmations hallucinées en moins vs 5.3 InstantLes paliers de raisonnement sont désormais marqués obsolètes20 $/mois Plus ; API 5 $ / 30 $
Gemini 3.6 FlashRapide, gratuit, multimodalToujours le modèle servi par le palier gratuit de Gemini, contexte 1M, #12 sur Arena textePlus faible sur le raisonnement le plus ardu ; 3.8 Flash le surclasse au même prixGratuit / 0,75 $ / 3,75 $ API
Fello AITous les meilleurs modèles, une seule appChatGPT + Claude + Gemini + Grok + DeepSeek et plus sur Mac, iPhone et iPadAcheminé via l'app, pas en direct9,99 $/mois
Deuxième place et alternatives : Claude Fable 5 est le deuxième et le véritable leader de préférence, Claude Opus 5 est le deuxième pour un usage quotidien réfléchi, Gemini 3.6 Flash est le deuxième pour rapide et gratuit, et Grok 4.6 est le choix de niche pour les jours d'actualité en direct. Fello AI est le choix naturel si vous voulez les meilleurs modèles dans une seule app Mac et iOS à 9,99 $/mois plutôt que de jongler avec les abonnements.
Ce qui a changé ce mois-ci

GPT-5.6 conserve le choix du chat grâce à sa portée, et l'écart avec le leader des préférences s'est de nouveau creusé. Sol occupe désormais la 18e place du classement texte d'Arena à 1483,5, contre la 14e auparavant, tandis que Claude Fable 5 mène à 1505,7. Rien n'a changé dans le produit, la couronne ne bouge donc pas : il s'agit toujours de savoir quel assistant le plus de gens peuvent réellement ouvrir. Deux lancements qui seraient sinon des candidats ne le sont pas : GPT-6 Astra a atteint ChatGPT Business, Pro et Plus début septembre mais OpenAI n'a rien annoncé pour l'offre gratuite, et Claude Opus 5.5, qui a pris l'Intelligence Index le 22 septembre, est un modèle pour l'API et les formules Claude, pas un assistant par défaut pour un milliard de personnes.

Choix de catégorie, septembre 2026

Meilleure IA pour les images

1
ChatGPT Images 2.5
Texte dans les images
2
MAI-Image-2.6
#1 édition AA
3
Muse Image
Écosystème Meta AI

La meilleure IA pour générer des images est ChatGPT Images 2.5, qu'OpenAI a mis par défaut sur toutes les formules ChatGPT le 8 septembre et qui domine désormais les quatre classements d'image que nous suivons. Ses deux modèles occupent les deux premières places sur chacun : GPT-Image-2.5 Sunburst, conçu pour la précision, mène Arena texte-vers-image à 1423,2 et Arena édition d'images à 1526,0, et mène aussi l'Elo de qualité d'Artificial Analysis à 1196,8 et son classement d'édition à 1221,3, le plus rapide GPT-Image-2.5 Flare étant deuxième sur les quatre. C'est un changement par rapport au mois dernier, quand Artificial Analysis n'avait évalué ni l'un ni l'autre et que ses classements contredisaient ceux d'Arena. Lisez tout de même l'écart entre Sunburst et Flare comme provisoire, car ces places sur Arena reposent sur quelques milliers de votes chacune contre 83 000 et 259 000 pour GPT Image 2, et sur le texte-vers-image les deux partagent une même bande de rang. Le deuxième est MAI-Image-2.6, troisième au classement d'édition d'Artificial Analysis à 1191,6 et quatrième au texte-vers-image d'Arena à 1334,0, avec Muse Image de Meta en troisième. Reve 2.1 garde son argument de mise en page, de typographie et de 4K natif mais a quitté le podium : il est sixième sur Arena texte-vers-image et quatorzième sur Arena édition d'images. Notre analyse complète de ce qui est sorti se trouve dans ChatGPT Images 2.5.

ModèleIdéal pourForceFaiblessePrix
ChatGPT Images 2.5Images avec texte lisible#1 et #2 sur les quatre classements : Arena texte-vers-image (1423,2 / 1401,3), Arena édition (1526,0 / 1481,8), qualité Artificial Analysis (1196,8 / 1190,4) et édition (1221,3 / 1207,0)Les places sur Arena reposent sur quelques milliers de votesPar défaut sur toutes les formules ChatGPT
MAI-Image-2.6Retoucher une image existante#3 en édition d'images chez Artificial Analysis (1191,6) et #4 sur Arena texte-vers-image (1334,0)Aperçu public, pas encore dans Copilot ni Bing ; a cédé la tête de l'édition chez Artificial Analysis à ChatGPT Images 2.5MAI Playground / Microsoft Foundry
Muse ImageÉdition d'images, écosystème Meta#5 en édition d'images chez Artificial Analysis (1171,3) et #7 à son Elo de qualitéNouveau, outillage encore mince autourApplication Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Portraits et produits photoréalistes#4 en texte vers image Artificial Analysis, devant Nano Banana Pro sur celui d'ArenaEn édition d'images Arena, Nano Banana Pro passe devantApplication Gemini / AI Studio
Seedream 5.0 ProTexte multilingue + édition par régions10+ langues dont l'arabe RTL, édition au lasso et par calquesAutour de la dixième place sur les classements indépendants ; incertitude sur les droits d'auteurBytePlus / Magnific
Midjourney v8Art stylisé, illustrationBase esthétique que la plupart des artistes préfèrentPlus faible sur le texte dans l'image10-120 $/mois
Grok ImagineNSFW / mode SpicyLes garde-fous les plus permissifs ; Arena classe son modèle Image 2.0 #5 en texte-vers-image et #4 en édition d'images, et Artificial Analysis le place désormais #4 à l'Elo de qualitéRien dans l'historique des sorties ne montre qu'Image 2.0 soit sorti comme produit30 $ par mois SuperGrok
Deuxième place et alternatives : MAI-Image-2.6 est le deuxième dans l'ensemble et le choix pour éditer une image que vous avez déjà, Muse Image est le troisième et le choix au sein des applications de Meta, et Nano Banana 2 reste le choix photoréaliste. Reve 2.1 reste le choix pour la mise en page, la typographie et le 4K natif même après avoir quitté le podium. Grok Imagine reste le seul modèle frontier qui autorise le contenu pour adultes en Spicy Mode, et Arena classe désormais son modèle Image 2.0 cinquième en texte vers image et quatrième en édition d'images.
Ce qui a changé ce mois-ci

ChatGPT Images 2.5 conserve la couronne de l'image et son argument s'est renforcé. Le mois dernier, Artificial Analysis n'avait évalué aucun de ses deux modèles d'API, si bien que les classements que nous suivons se contredisaient : Arena plaçait Sunburst et Flare aux deux premières places tandis qu'Artificial Analysis gardait GPT Image 2 en tête du texte-vers-image et MAI-Image-2.6 de Microsoft en tête de l'édition. Artificial Analysis a désormais évalué les deux, et ils y prennent aussi les deux premières places, 1196,8 et 1190,4 à l'Elo de qualité et 1221,3 et 1207,0 en édition d'images. Cela en fait #1 et #2 sur les quatre classements. MAI-Image-2.6 reste deuxième mais recule à la troisième place du classement d'édition qu'il menait, et Grok Imagine Image 2.0 est maintenant quatrième à l'Elo de qualité d'Artificial Analysis et quatrième au classement d'édition d'Arena, une meilleure place que la troisième marche du podium ; nous continuons de le rapporter plutôt que de le couronner, car rien dans l'historique des sorties ne montre qu'il soit sorti comme produit.

Choix de catégorie, septembre 2026

Meilleure IA pour la vidéo

1
Gemini Omni 1.1 Flash
#1 Arena texte-vers-vidéo
2
MiniMax H3
2K + audio natif
3
Dreamina Seedance 2.0
Le concurrent le plus proche

La meilleure IA pour générer de la vidéo est Gemini Omni 1.1 Flash, que Google a publié le 27 août et qui domine le classement texte-vers-vidéo d'Arena à 1516, juste devant son propre prédécesseur Gemini Omni Flash à 1513. Lisez cela comme une égalité : les deux se situent dans les intervalles de confiance l'un de l'autre et Arena elle-même attribue à 1.1 Flash une bande de rang de un à quatre. Ce qui tranche, c'est la fiche technique, où 1.1 Flash est nettement le modèle le plus capable : extension de scène par tranches de 10 secondes jusqu'à 40 secondes cumulées, contrôle de la première et de la dernière image, références vidéo, brouillons en 360p et sortie en 1080p ou 4K, à environ 0,03 $ la seconde en 360p, 0,10 $ en 720p, 0,15 $ en 1080p et 0,30 $ en 4K. Gemini Omni Flash reste l'option la moins chère, autour de 0,10 $ la seconde, mais plafonne à des clips de 10 secondes. Deux limites à connaître. Artificial Analysis n'a pas du tout évalué 1.1 Flash ; sur son classement texte-vers-vidéo, c'est l'ancien Omni Flash qui mène à 1512,8 devant le Wan 3.0 d'Alibaba à 1431,4 et MiniMax H3 à 1407,7. Et sur le classement image-vers-vidéo d'Arena, 1.1 Flash est deuxième à 1488,5 derrière MiniMax H3 à 1495,4 : la couronne repose donc sur le texte-vers-vidéo et sur la fiche technique, pas sur une razzia. S'il vous faut des plans plus longs dans l'outillage de Google, Veo 3.1 tourne toujours dans l'application Gemini, dans AI Studio et dans Vertex AI avec audio natif et sortie 1080p. MiniMax H3 (31 juillet) reste le concurrent sur la fiche technique, avec des clips 2K de 4 à 15 secondes et un son stéréo natif à partir de 0,13 $ la seconde.

ModèleIdéal pourForceFaiblessePrix
Gemini Omni 1.1 FlashMeilleure vidéo IA globale#1 Arena texte-vers-vidéo (1516) ; extension de scène à 40 secondes, sortie 4KNon évalué par Artificial Analysis ; deuxième derrière MiniMax H3 sur Arena image-vers-vidéo0,03-0,30 $/s ; Gemini API / AI Studio / Flow
Gemini Omni FlashClips de dix secondes moins chers#2 Arena texte-vers-vidéo (1511), #2 vidéo AA (1238) ; édition conversationnellePlafonne à des générations de dix secondes~0,10 $/s ; app Gemini / AI Studio
Wan 3.0Vidéo à partir de documents et de diapositives#1 sur le classement vidéo d'Artificial Analysis (1239) ; 2-30 s, jusqu'à 1080p, entrée Omni-ReferenceAPI uniquement, aucun poids publié ; #3 sur Arena0,05-0,20 $/s
MiniMax H3Clips 2K avec audio natif4-15 s en 2K, son stéréo natif ; #8 Arena texte-vers-vidéo (1462)#4 sur la vidéo AA (1227) ; les poids ouverts excluent l'upscaler 2K et exigent une demande aux États-Unis, dans l'UE, au Royaume-Uni et en Corée du Sud0,13 $/s en 2K
Dreamina Seedance 2.5Concurrent de ByteDance#6 Arena texte-vers-vidéo (1482) ; mène l'image-vers-vidéo avec audioÉcosystème ByteDance, accès occidental limitéDreamina / BytePlus
Muse VideoVidéo dans l'écosystème Meta#3 texte vers vidéo à 1459Le plus récent du groupe, outillage limitéApplication Meta AI
Veo 3.1Clips de production plus longsAudio natif, 1080p, forte cohérence physique#6 sur Arena vidéo, pas le leader en qualitéGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboItération rapide à moindre coût4K natif, 60fps, clips de 15 secondes ; Turbo sorti le 17 juinHors du top 16 sur Arena texte vers vidéoÀ partir de 10 $/mois
Luma Ray 3Scènes photoréalistesFort réalisme pour les paysagesCommunauté plus petiteGratuit / à partir de 9,99 $/mois
Deuxième et alternatives : MiniMax H3 est le deuxième et mène désormais le classement image-vers-vidéo d'Arena à 1495,4, devant Gemini Omni 1.1 Flash à 1488,5. Dreamina Seedance 2.0 est troisième et reste le choix pour l'image-vers-vidéo avec audio. Veo 3.1 est le choix quand 10 secondes ne suffisent pas, et le Wan 3.0 d'Alibaba celui à utiliser quand la source est un document, un tableur ou une présentation. OpenAI a retiré l'application grand public Sora 2 le 26 avril 2026 et il ne reste que l'API développeur, jusqu'au 24 septembre 2026. Nous suivons les dates de retrait des anciens modèles de chaque fournisseur dans une liste distincte tenue à jour.
Ce qui a changé ce mois-ci

Gemini Omni 1.1 Flash conserve la couronne de la vidéo, mais le tableau autour est plus embrouillé que ne le laissait entendre l'entrée du mois dernier. Il domine toujours le classement texte-vers-vidéo d'Arena, 1516 contre 1513 pour Gemini Omni Flash, et Arena lui donne une bande de rang de un à quatre : cela reste une égalité tranchée par la fiche technique. Deux choses rapportées en août ont changé. Artificial Analysis a réancré son Elo vidéo et l'ancien trio 1239 / 1238 / 1235 n'existe plus : Gemini Omni Flash mène désormais ce classement à 1512,8 devant Wan 3.0 à 1431,4 et MiniMax H3 à 1407,7, et 1.1 Flash n'y est toujours pas évalué du tout. Et MiniMax H3 a pris la tête du classement image-vers-vidéo d'Arena à 1495,4, repoussant 1.1 Flash au deuxième rang à 1488,5, le premier classement que cette couronne ait perdu.

Choix de catégorie, septembre 2026

Meilleure IA pour la programmation

1
Claude Opus 5.5
En tête de tous les harnesses
2
GPT-6 Astra
Les deux classements de programmation d'Arena
3
Claude Fable 5.1
Deuxième sur les harnesses

La meilleure IA pour programmer est Claude Opus 5.5, qu'Anthropic a publié le 22 septembre et qui domine tous les harnesses de programmation que nous suivons : la campagne Terminal-Bench 4.0 d'Artificial Analysis à 59,6 % contre 59,1 % pour GPT-6 Astra, LiveBench Coding à 89,3 contre 80,4 et LiveBench Agentic Coding à 71,7 contre 57,3. Il le fait à 4 $ / 20 $ par million de tokens, moins de la moitié du tarif public des deux modèles qui dominaient ce tableau le mois dernier, avec des lectures de cache à 0,20 $, et selon les tests d'Anthropic elle-même une charge de travail typique coûte 40 % de moins que sur Claude Opus 5. La campagne interne de Terminal-Bench 4.0 d'Anthropic creuse encore l'écart, 66,4 % contre les 57,9 % qu'OpenAI rapporte pour Astra, avec 54,4 % sur FrontierCode v1.1 et 57,8 % sur CursorBench 4.0. GPT-6 Astra conserve les deux classements de programmation d'Arena, WebDev à 1800 et image-vers-WebDev à 1733, car Opus 5.5 n'a encore aucun vote sur Arena, et c'est le partage honnête ici : OpenAI domine la préférence humaine, Anthropic chaque harness mesuré. Lisez avec prudence ce demi-point d'avance sur Terminal-Bench, car Anthropic annonce elle-même une erreur type d'environ 2,6 points sur ce benchmark : traitez-les donc comme à égalité et laissez les classements LiveBench et le prix trancher. Claude Fable 5.1 est deuxième sur les deux classements d'Arena et troisième sur les harnesses. Le Qwen3.8-Max-0902 d'Alibaba a tenu le classement WebDev d'Arena environ trois jours début septembre et se retrouve quatrième à 1681. Du côté des poids ouverts, le tableau a changé le 21 septembre : le MiMo-V2.6-Pro de Xiaomi prend 34,8 % sur Terminal-Bench 4.0 sous licence MIT simple à 0,13 $ par tâche de l'indice, tandis que GLM-5.3 reste le modèle ouvert le plus fort sur ce harness à 41,9 % et que Kimi K3 demeure le modèle ouvert le mieux classé sur Arena WebDev, cinquième à 1674, avec seulement 12,6 % sur le harness. Artificial Analysis a retiré son Coding Index et son Coding Agent Index, les deux classements composites de programmation que cette page citait n'existent donc plus.

ModèleIdéal pourForceFaiblessePrix (par 1M de tokens)
Claude Opus 5.5Meilleure programmation globale#1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) et #1 LiveBench Coding (89,3)Aucun vote sur Arena pour le moment, Astra garde donc ses deux classements de programmation4 $ / 20 $
GPT-6 AstraSommet des deux classements de programmation d'Arena#1 Arena WebDev (1800) et #1 image-vers-WebDev (1733) ; 59,1 % Terminal-Bench 4.02,5 fois le prix d'Opus 5.5 et derrière lui sur chaque harness10 $ / 50 $
Claude Fable 5.1Meilleur score composite avant Opus 5.5#2 sur les deux classements de programmation d'Arena ; Intelligence Index 53,4 ; AA-Briefcase 167852,0 % Terminal-Bench 4.0 ; 2,5 fois le prix d'Opus 5.510 $ / 50 $
Claude Opus 5Remplacé par Opus 5.549,0 % Terminal-Bench 4.0 et #3 sur les deux classements de programmation d'ArenaCoûte plus cher par token qu'Opus 5.5 et marque sept points de moins5 $ / 25 $
Claude Fable 5Travail agentique le plus long et le plus durIntelligence Index 49,6 ; 42,4 % Terminal-Bench 4.0 ; contexte 1MLe plus cher par tâche de ce tableau à 8,75 $ ; #6 sur Arena image-vers-WebDev10 $ / 50 $
Qwen3.8-Max-0902Détenteur éphémère du classement WebDev#4 Code Arena : WebDev (1681) ; Intelligence Index 45,4 ; 2,4 billions de paramètres, contexte 1MAPI QwenCloud uniquement, sans interface grand public ; a perdu la tête de WebDev en quelques jours2 $ / 6 $
Kimi K3Modèle ouvert le mieux classé sur Arena#5 Arena WebDev (1674), la meilleure place ouverte sur ce classement ; 2,8 billions/104 Md actifsSeulement 12,6 % sur Terminal-Bench 4.0 ; 1,56 To à héberger3 $ / 15 $
GPT-5.6 SolLe vaisseau amiral bon marché d'OpenAIIntelligence Index 47,0 ; 39,9 % Terminal-Bench 4.0Loin derrière Astra sur chaque classement de programmation ; manipulation des évaluations signalée par METR4 $ / 20 $
Muse Spark 1.3Programmation agentique bon marchéIntelligence Index 48,1 à 1,25 $ / 4,25 $ et 1,60 $ par tâche33,3 % sur Terminal-Bench 4.0 ; les victoires en programmation viennent du graphique de Meta, mesuré sur une variante max réservée aux partenaires1,25 $ / 4,25 $
Grok 4.7Codeur économique46,3 % CursorBench 4.0 et 71,0 % DeepSWE v1.1 selon les chiffres de SpaceXAI ; Intelligence Index 46,324,7 % sur Terminal-Bench 4.0 ; les prompts de 200K tokens et plus refacturent toute la requête au double2 $ / 6 $
Gemini 3.8 FlashProgrammation agentique à grande échelleIntelligence Index 40,9 ; 308,4 tokens de sortie par seconde19,7 % sur Terminal-Bench 4.0 ; le tarif de lancement double le 1er janvier 20270,75 $ / 3,75 $
GLM 5.3 FlashLe codeur sérieux le moins cher à héberger32,8 % Terminal-Bench 4.0 à 0,25 $ par tâche ; MIT, 320 Md/18 Md actifsGLM-5.3 atteint 41,9 % sur le même harness ; aucun produit grand publicPoids ouverts (MIT)
MiMo-V2.6-ProLe plus haut Intelligence Index ouvert46,3 sur v4.3.2 et 34,8 % Terminal-Bench 4.0 à 0,13 $ par tâche ; MIT, 1,02 billion/42 Md actifsPublié le 21 septembre, donc aucun vote sur Arena ni historique indépendant0,435 $ / 0,87 $
Deuxième et alternatives : GPT-6 Astra est le deuxième et domine toujours les deux classements de programmation d'Arena, Claude Fable 5.1 y est deuxième et troisième sur les harnesses, et Claude Opus 5 est désormais remplacé par un modèle à la fois moins cher et meilleur. Du côté des poids ouverts, le MiMo-V2.6-Pro de Xiaomi est le nouveau leader au score comme au coût, GLM-5.3 est le plus fort sur le Terminal-Bench 4.0 d'Artificial Analysis, Kimi K3 reste le modèle ouvert le mieux classé sur le classement WebDev d'Arena, et GLM 5.3 Flash est le choix des équipes qui hébergent le leur, à 0,25 $ par tâche sous licence MIT simple. Dans les IDE, Cursor avec Claude reste le duo le plus populaire et Claude Code est le choix naturel si vous vivez dans le terminal.
Ce qui a changé ce mois-ci

La couronne de la programmation est passée à Claude Opus 5.5, quatre jours après être passée à GPT-6 Astra. Anthropic l'a publié le 22 septembre et il domine chaque harness de programmation que nous suivons : 59,6 % contre 59,1 % pour Astra sur la campagne Terminal-Bench 4.0 d'Artificial Analysis, 89,3 contre 80,4 sur LiveBench Coding et 71,7 contre 57,3 sur LiveBench Agentic Coding, à 4 $ / 20 $ contre 10 $ / 50 $. Astra conserve les deux classements de programmation d'Arena parce qu'Opus 5.5 n'y a pas encore de votes, c'est donc un partage et non une razzia. L'écart sur Terminal-Bench est d'un demi-point face à une erreur type qu'Anthropic situe autour de 2,6 : ce sont donc les classements LiveBench et le prix qui tranchent réellement. Claude Opus 5 quitte le podium : Opus 5.5 coûte moins par token, en consomme moins et marque sept points de plus sur l'Intelligence Index, ce qui rend l'ancien argument tarifaire d'Opus 5 non pas plus faible mais caduc. Le MiMo-V2.6-Pro de Xiaomi et le Grok 4.7 de SpaceXAI entrent tous deux au tableau, et tous les chiffres d'indice de cette page sont passés en v4.3.2, d'où des valeurs légèrement inférieures à celles du mois dernier.

Choix de catégorie, septembre 2026

Meilleure IA pour la créativité

1
Grok 4.7
Le moins de garde-fous
2
Claude Fable 5
Prose de la plus haute qualité
3
Kimi K3
Fiction et voix

La meilleure IA pour un travail créatif non filtré et dans l'air du temps est Grok 4.7, et nous voulons être précis sur les raisons. Ce choix porte sur la gamme de produits, pas sur la qualité de la prose. Grok porte le moins de restrictions de contenu de tous les modèles de pointe et la seule intégration native de X en temps réel, ce qui en fait le seul modèle à accepter les briefs audacieux, d'actualité ou délibérément provocateurs que les autres refusent. Lisez la disponibilité avec attention : SpaceXAI a publié Grok 4.7 le 21 septembre pour l'API Grok, Cursor, Grok Build, des harnesses tiers et des routeurs cloud, et son annonce ne dit rien de l'application grand public, qui sert toujours Grok 4.6 aux abonnés SuperGrok et X Premium+ à 30 $ par mois. Ce n'est pas le meilleur rédacteur. Arena a désormais évalué Grok 4.6, qui occupe la 32e place du classement d'écriture créative, devant Grok 4.5 en 36e mais derrière l'ancien Grok 4.20-beta1 en 23e. EQ-Bench n'a évalué ni 4.6 ni 4.7, et sur ce classement Grok 4.5 est 46e à 1576,0, soit désormais juste devant Grok 4.20-beta plutôt que derrière. Comme SpaceXAI a orienté ces deux versions vers la programmation et le travail agentique plutôt que vers la prose, nous ne supposons pas que 4.7 ait changé quoi que ce soit ici. Si vous choisissez sur la seule qualité de sortie, Claude Fable 5 domine toujours le classement d'écriture créative d'Arena, tandis qu'EQ-Bench place GPT-6 Astra premier à 2163,9, Claude Fable 5.1 deuxième et Kimi K3 quatrième. Choisissez Grok pour ce qu'il vous laissera faire, pas pour la qualité de son écriture.

ModèleIdéal pourForceFaiblessePrix
Grok 4.7Non filtré, tranché, dans l'air du tempsLe moins de restrictions de contenu, ancrage natif sur X en temps réelAucun classement d'écriture créative ne l'a évalué ; Grok 4.6 est #32 en écriture créative sur Arena2 $ / 6 $ API ; application SuperGrok à 30 $ par mois, toujours en 4.6
Claude Fable 5Prose créative de la plus haute qualité#1 Arena écriture créative, #1 LiveBench LanguageGarde-fous prudents sur les briefs audacieux10 $ / 50 $ API
Kimi K3Fiction et voix singulière#4 EQ-Bench Creative Writing à 2070,6Seulement #27 en écriture créative sur Arena3 $ / 15 $
Claude Opus 5Créativité structurée de format longTient de longs fils et s'auto-édite ; Intelligence Index 50,8, derrière Claude Fable 5.1 et GPT-6 AstraLe plus prudent du groupe20 $/mois Pro ; 5 $ / 25 $ API
Gemini 3.1 ProCréatif multimodalChaîne texte, image et vidéo solideQuotas dans l'application GeminiGratuit / 2,00-4,00 $ API entrée
Grok Imagine (Spicy Mode)NSFW / créatif pour adultesLa génération d'images la plus permissiveCas d'usage de niche30 $/mois SuperGrok
Deuxième place et alternatives : Claude Fable 5 est le deuxième et le bon choix si la qualité compte plus que la liberté, Kimi K3 est le choix pour la fiction, et Claude Opus 5 est le choix pour les projets créatifs qui s'étalent sur de nombreux tours. Pour le travail créatif pour adultes, Grok Imagine Spicy Mode reste la seule option de niveau frontier.
Ce qui a changé ce mois-ci

Grok conserve ce choix, désormais avec Grok 4.7, que SpaceXAI a publié le 21 septembre sur un modèle de base nouveau et plus grand. Rien n'a changé dans la permissivité du produit ni dans son accès en direct à X, et c'est là-dessus que repose le choix. Le modèle sous-jacent est de nouveau plus fort, 46,3 sur l'Intelligence Index contre 44,3 pour Grok 4.6, mais ce gain a atterri dans la programmation et le travail agentique plutôt que dans la prose, et aucun classement d'écriture créative n'a évalué la 4.7. Une correction par rapport à l'entrée du mois dernier : Arena a depuis évalué Grok 4.6, qui occupe la 32e place de son classement d'écriture créative, la phrase selon laquelle aucun des deux classements ne l'avait évalué ne tient donc plus. Notez aussi la disponibilité partagée, car elle compte pour cette catégorie : la 4.7 est dans l'API, dans Cursor et dans Grok Build, tandis que l'application Grok à 30 $ par mois, dont relève réellement l'argument de permissivité, sert toujours la 4.6. Claude Fable 5 reste le modèle à utiliser quand on veut la meilleure écriture.

Choix de catégorie, septembre 2026

Meilleure IA pour la précision & la recherche

1
Claude Fable 5.1
Meilleure précision factuelle
2
Gemini 3.1 Pro
Meilleur rapport, 0,52 $/tâche
3
GPT-5.6 Sol
Raisonnement inédit

La meilleure IA pour la précision et la recherche est Claude Fable 5.1, qui détient la meilleure précision factuelle mesurée par Artificial Analysis, 67 % sur AA-Omniscience. C'est exactement la colonne qui décide cette catégorie, et elle a survécu à un test sévère le 22 septembre : Claude Opus 5.5 a battu Fable 5.1 sur presque tout le reste, y compris Humanity's Last Exam à 61,4 % contre 59,1 % et l'indice AA-Omniscience pénalisé par les hallucinations à 46,4 contre 43,5, mais sur la précision factuelle brute il affiche 66 % contre 67 % pour Fable 5.1. Traitez cet écart d'un point comme une égalité et lisez les deux ensemble : Opus 5.5 est le meilleur pari quand une mauvaise réponse est pire que pas de réponse, Fable 5.1 quand vous voulez le plus de faits justes. Le choix économique est Gemini 3.1 Pro, et c'est toujours ce vers quoi nous irions quand le coût compte. Son meilleur résultat est sur ARC-AGI-1 d'ARC Prize, où il obtient 98 % et égale le panel humain, à 0,52 $ par tâche, même si Claude Fable 5 et GPT-6 Astra ont depuis dépassé le panel à 98,5 %. Il y ajoute un ancrage natif sur Google Search, ce qu'il faut quand la réponse doit être à jour et pas seulement plausible. Il obtient aussi 94,1 % sur GPQA Diamond, où GPT-5.6 Sol l'égale désormais au lieu d'être derrière, et 44,4 % sur Humanity's Last Exam, ainsi que 46,44 sur le classement HLE de Scale SEAL, que Claude Fable 5 mène maintenant à 55,5 %. Deux réserves honnêtes. Sur la recherche ancrée précisément, le classement recherche d'Arena est mené par OpenAI et non par Google ou Anthropic : GPT-5.6 Sol est en tête à 1257, Claude Fable 5 cinquième et Gemini 3.1 Pro avec ancrage neuvième. Et sur le raisonnement inédit la couronne est tout ailleurs, GPT-6 Astra menant à la fois ARC-AGI-2 et ARC-AGI-3. Nous n'avons pas donné cette couronne à Claude Opus 5 parce qu'Artificial Analysis mesure son taux d'hallucination à 50 % et le place nettement sous les deux modèles Fable sur AA-Omniscience.

ModèleIdéal pourBenchmark cléFaiblessePrix
Claude Fable 5.1Meilleure précision factuelle mesurée67 % de précision factuelle sur AA-Omniscience, la meilleure mesurée par Artificial Analysis, un point devant Claude Opus 5.5Pas d'offre bon marché ; non évalué sur le classement recherche d'Arena ; Opus 5.5 mène Humanity's Last Exam et l'indice AA-Omniscience10 $ / 50 $
Gemini 3.1 ProMeilleur rapport, travail factuel bon marché98 % ARC-AGI-1 (égale le panel humain) à 0,52 $/tâche, 94,1 % GPQA (égalé par Sol)ARC-AGI-2 77,1 % désormais ~14e ; #7 sur Arena recherche2,00-4,00 $ / 12,00-18,00 $ (échelonné)
Claude Fable 5Recherche ancrée#5 sur le classement de recherche d'Arena, derrière GPT-5.6 SolPas de palier bon marché unique10 $ / 50 $ (Fable 5)
GPT-5.6 SolRaisonnement inédit#1 ARC-AGI-2 à 92,5 %, contre un panel humain à 100 %Scheming signalé par METR4 $ / 20 $
Claude Opus 5Les problèmes inédits les plus ardus#1 ARC-AGI-3 à 30 %, ~3,75x le modèle suivant (ARC Prize)Artificial Analysis mesure un taux d'hallucination de 50 %5 $ / 25 $
Qwen 3.7 MaxPrécision frontier à prix avantageux92,4 GPQA Diamond, 200 requêtes gratuites/jourAPI uniquement, pas de front-end de chat1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste
Claude Opus 4.6Honnêteté sous pression#1 sur le classement MASK de Scale SEAL à 96,28 ; Anthropic occupe le top 5Remplacé comme modèle phareModèle legacy d'Anthropic
Deuxième place et alternatives : Gemini 3.1 Pro est le deuxième et le choix rapport qualité-prix à 0,52 $ par tâche avec ancrage Google Search, GPT-5.6 Sol est le deuxième pour le raisonnement inédit, Claude Opus 4.6 domine le classement d'honnêteté sous pression, et Qwen 3.7 Max est le choix rapport qualité-prix à la frontière.
Ce qui a changé ce mois-ci

La couronne de la précision reste à Claude Fable 5.1, et elle a été mise à rude épreuve. Claude Opus 5.5 est arrivé le 22 septembre et a pris Humanity's Last Exam à 61,4 % contre 59,1 % ainsi que l'indice AA-Omniscience pénalisé par les hallucinations à 46,4 contre 43,5, mais cette catégorie se décide sur la colonne de précision factuelle brute, et là Fable 5.1 affiche toujours 67 % contre 66 % pour Opus 5.5. C'est un point d'écart, aussi ce bloc dit-il désormais franchement que les deux se partagent le terrain plutôt que de prétendre que Fable 5.1 rafle tout : prenez Opus 5.5 quand une mauvaise réponse est pire que pas de réponse, et Fable 5.1 quand vous voulez le plus de faits justes. Deux corrections aussi par rapport à l'entrée du mois dernier. Elle disait que GPT-5.6 Sol menait ARC-AGI-2 et que Claude Opus 5 menait ARC-AGI-3 ; GPT-6 Astra mène les deux depuis son lancement du 3 septembre, comme le disait déjà le bloc sur la résolution de problèmes, et cette contradiction a disparu. Et ARC-AGI-1 est passé devant le panel humain : Claude Fable 5 et GPT-6 Astra obtiennent tous deux 98,5 % là où le panel de 2025 fait 98 %, les 98 % de Gemini 3.1 Pro à 0,52 $ par tâche restent donc exacts et restent l'argument économique, mais ce n'est plus le sommet de ce classement.

Choix de catégorie, septembre 2026

Meilleure IA pour la résolution de problèmes

1
GPT-6 Astra
Leader du raisonnement
2
Claude Opus 5
Chaînes agentiques
3
GPT-5.6 Sol
Vaisseau amiral STEM abordable

La meilleure IA pour la résolution de problèmes difficiles est GPT-6 Astra, qui a pris les classements de raisonnement à GPT-5.6 Sol quelques jours après son lancement. Elle mène LiveBench Reasoning à 92,65 et ARC-AGI-2 à 95 %, le meilleur score jamais atteint face au panel humain à 100 % de ce classement, et se place troisième sur LiveBench Mathematics à 96,81 derrière les 97,08 de Claude Opus 5.5 et les 97,01 de Claude Fable 5.1. Elle annonce aussi 97,6 % sur FrontierMath Tier 4 v2, un chiffre à lire avec la divulgation d'Epoch AI selon laquelle OpenAI a financé le benchmark et détient un accès exclusif à une partie de celui-ci. Le hic tient au prix et à la portée : 10 $ / 50 $ par 1M de tokens contre 4 $ / 20 $ pour Sol, et il faut un forfait ChatGPT payant. GPT-5.6 Sol est l'alternative économique, troisième sur les deux classements LiveBench à 96,20 et 91,65 et deuxième sur ARC-AGI-2. Qwen 3.7 Max est le choix budget pour les problèmes de type concours à 97,1 sur l'indice HMMT de février 2026 et 44,5 sur Apex, avec 200 requêtes gratuites par jour. Claude Opus 5 reste l'alternative pour les longues chaînes de raisonnement agentique, même si Astra lui a aussi pris ARC-AGI-3.

ModèleIdéal pourBenchmark cléFaiblessePrix
GPT-6 AstraMathématiques, sciences et raisonnement les plus durs#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Exige un forfait ChatGPT payant ; 2,5 fois le prix de Sol10 $ / 50 $
Claude Opus 5Longues chaînes de raisonnement agentique#2 AA-Briefcase (1673) et #2 GDPval-AA v2.1 (1708) ; 30,2 % ARC-AGI-3Astra mène désormais ARC-AGI-3 ; 50 % de taux d'hallucination5 $ / 25 $
GPT-5.6 SolVaisseau amiral STEM abordable#2 ARC-AGI-2 (92,5 %) ; #3 LiveBench Mathematics (96,20) et Reasoning (91,65)FrontierMath toujours non publié ; comportement trompeur signalé par METR100 $/mois ChatGPT Pro ; API 4 $ / 20 $
Qwen 3.7 MaxMathématiques de compétition avec un budget serré97,1 HMMT 2026 févr., 44,5 Apex, 200 requêtes gratuites/jourAPI uniquement1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste
Claude Fable 5Mathématiques au sein d'un flux de programmation#1 sur la sous-catégorie mathématiques d'Arena (1543), 96,0 LiveBench MathematicsL'option la plus chère ici10 $ / 50 $
GLM 5.3 FlashRésolution de problèmes open-weightIntelligence Index 41,8 sous MIT, près de huit points au-dessus de GLM-5.2 pour moins de la moitié de la taille ; 320B/18B actifs, contexte 1MExige un serveur multi-GPU, pas une station de travail ; GLM 5.3 fait mieux selon les chiffres de Z.ai elle-même et est téléchargeable depuis le 28 août, mais pour plus du double de la taille et sous une licence maisonOpen weights (MIT)
Deuxième place et alternatives : GPT-5.6 Sol est le deuxième et le choix rapport qualité-prix à 4 $ / 20 $, Claude Opus 5 est le choix naturel pour le raisonnement agentique à longue chaîne, Qwen 3.7 Max est le choix budget, et GLM 5.3 Flash est le choix open-weight. Notre guide dédié à la meilleure IA pour les maths détaille la répartition tâche par tâche et les options gratuites.
Ce qui a changé ce mois-ci

La couronne de la résolution de problèmes est passée à GPT-6 Astra, qui a pris les classements sur lesquels cette catégorie se décide quelques jours après son lancement du 3 septembre. Il mène LiveBench Reasoning à 92,65 contre 91,65 pour GPT-5.6 Sol, prend ARC-AGI-2 à 95 % contre 92,5 % pour Sol, et a délogé Claude Opus 5 sur ARC-AGI-3, où ses 62,7 % sur le harness standard battent les 30,2 % d'Opus 5. Lisez les chiffres d'ARC-AGI-3 avec attention : ce classement mesure l'efficacité d'action au niveau humain dans des environnements inédits, pas les problèmes résolus, et les 98,6 % très cités viennent d'un harness à adaptateur fournisseur, pas du harness standard. Sol tombe à la troisième place sur les deux classements LiveBench mais reste l'alternative économique à 4 $ / 20 $ contre les 10 $ / 50 $ d'Astra, et LiveBench Mathematics a depuis changé de mains deux fois, vers Claude Fable 5.1 à 97,01 puis vers Claude Opus 5.5 à 97,08 le 22 septembre.

Choix de catégorie, septembre 2026

Meilleur agent d'IA

1
Gemini Spark
Réside dans le cloud
2
Claude Cowork
Réside sur le bureau
3
ChatGPT Codex
Agent de programmation

Le meilleur agent d'IA est Gemini Spark si vous voulez l'agent dans le cloud et Claude Cowork si vous le voulez sur votre bureau. Ce sont des choix conjoints et non un premier et un deuxième : Spark tourne dans une VM Google Cloud et continue donc à travailler pendant que votre portable est fermé, relié à Gmail, Docs et, depuis début septembre, Google Photos ; Cowork tourne sur votre Mac ou votre PC Windows et pilote vos applications locales et votre écran. Aucun classement indépendant ne met les deux produits face à face : le choix porte donc sur l'endroit où le travail doit se faire, pas sur celui qui marque le plus. Le prix ne départage plus non plus : Spark atteint désormais le palier Google AI Pro à 19,99 $/mois aux États-Unis et dans plus de 160 autres pays, et Cowork est inclus sans supplément dans tous les forfaits Claude payants à partir de 20 $/mois. ChatGPT Codex Mobile (14 mai) est l'alternative pour le travail d'agent de programmation, et les agents de navigateur de classe OpenAI Operator pour les tâches web. Lisez la comparaison complète Gemini Spark contre Claude Cowork.

AgentIdéal pourOù il tourneForcePrix
Gemini SparkTâches cloud 24/7, flux WorkspaceVM Google Cloud (toujours active)Premier vrai agent 24/7, intégration profonde à WorkspaceÀ partir de 19,99 $/mois Google AI Pro
Claude CoworkBureau, pilotage d'apps, design + codeVotre bureau Mac/WindowsPilote les apps locales, voit votre écran20 $/mois Claude Pro
ChatGPT Codex MobileAgent de programmation sur téléphoneCloud OpenAI + iOS/AndroidApprouver des diffs et réorienter le travail depuis le téléphoneInclus dans les forfaits ChatGPT
Grok Agentic (Grok 4.7)Recherche en temps réel, extraction de XCloud SpaceXAIIntégration native de X ; Elo 1695 sur GDPval-AA v2.1, quatrième parmi les modèles distincts30 $ par mois SuperGrok, toujours en 4.6
OpenAI de classe OperatorTâches de navigateur, formulaires webCloud OpenAI + votre navigateurAutomatisation webChatGPT Pro
Deuxième place et alternatives : Gemini Spark et Claude Cowork sont des choix conjoints séparés par l'endroit où tourne l'agent, pas un premier et un deuxième. ChatGPT Codex Mobile est le choix pour les agents de programmation, et Grok Agentic le choix de niche pour la recherche en temps réel. Google AI Ultra à 99,99 $ ou 199,99 $ par mois achète désormais chez Spark des limites d'usage plus élevées et non l'accès, qui commence au palier Pro à 19,99 $.
Ce qui a changé ce mois-ci

Aucun nouveau produit d'agent grand public n'est sorti, les couronnes ne bougent donc pas : Gemini Spark (cloud) et Claude Cowork (bureau) restent des choix conjoints séparés par l'endroit où tourne l'agent. Spark s'est tout de même élargi, atteignant la formule Google AI Pro à 19,99 $ par mois et gagnant Google Photos, où il peut chercher, retoucher, trier et exécuter des flux programmés. La couche de modèles en dessous a beaucoup bougé, et l'essentiel le 22 septembre. Claude Opus 5.5 mène désormais les deux classements agentiques publiés par Artificial Analysis : AA-Briefcase v1.1 à 1822 contre 1678 pour Claude Fable 5.1 et 1673 pour Claude Opus 5, et GDPval-AA v2.1 à 1846 contre 1735 et 1708. Il égale en outre GPT-6 Astra sur Terminal-Bench 4.0 à 4 $ / 20 $ contre 10 $ / 50 $, ce qui en fait le modèle sur lequel la plupart des équipes devraient bâtir désormais, à la place de la recommandation Opus 5 que portait ce bloc. L'Agent Arena d'Arena ne l'a pas évalué, et Claude Fable 5.1 y mène toujours l'achèvement des tâches à 19,8 %, devant GPT-6 Astra à 17,7 %, DeepSeek V4.1-Flash troisième et Claude Opus 5 quatrième. L'autre mouvement est le Grok 4.7 de SpaceXAI (21 septembre) : 1695 sur GDPval-AA v2.1 et 1657 sur AA-Briefcase le placent quatrième et septième, au-dessus de GPT-6 Astra sur les deux, même s'il arrive dans l'API, dans Cursor et dans Grok Build et non dans un produit d'agent grand public. Le Muse Spark 1.3 de Meta est cinquième parmi les modèles distincts sur GDPval-AA v2.1 à 1674, donc sous Grok 4.7 et non au-dessus comme nous l'écrivions le mois dernier, et Scale SEAL n'a toujours évalué que la 1.1, qui mène son classement d'usage d'outils MCP Atlas à 88,1. GLM 5.3 Flash (26 août, MIT) reste le modèle d'agent ouvert que nous hébergerions, à AutomationBench 48,8 sur le graphique de Z.ai où Claude Opus 4.8 obtient 41,0 ; sur le signal d'achèvement des tâches de l'Agent Arena, GLM-5.2 est dix-septième et Kimi K3 cinquième, le modèle ouvert le mieux placé étant DeepSeek V4.1-Flash à la troisième place.

Fello AI fonctionnant sur Mac, iPhone et iPad
Tous les meilleurs modèles d'IA, une seule app

Les modèles de pointe comme ChatGPT, Claude et Gemini, réunis sur Mac, iPhone et iPad.

Gratuit pour démarrer, 4,7★ sur plus de 27 000 avis.

Télécharger Fello AI

Guide d'usage, septembre 2026

Meilleure IA pour les étudiants

1
GPT-5.6 Luna
Dissertations & recherche
2
Gemini 3.6 Flash
STEM + PDF
3
Claude Sonnet 5
Écriture & révision

La meilleure IA pour les étudiants est GPT-5.6 Luna dans ChatGPT pour le travail de cours général et Gemini 3.6 Flash dans l'application Gemini pour les STEM et l'étude multimodale, avec Qwen 3.7 Max comme alternative par API pour les jeux de problèmes plus ardus (200 requêtes gratuites par jour) et Claude Opus 5 comme alternative pour la révision de dissertations. La plupart des étudiants n'ont pas besoin de payer, et l'offre gratuite s'est améliorée le 6 août : GPT-5.6 Luna est devenu le modèle par défaut de ChatGPT Free et Go, avec des discussions texte illimitées et un bouton Think pour les questions plus difficiles, même si les envois de fichiers et les outils d'image restent plafonnés. Gemini 3.6 Flash reste ce que sert l'application Gemini gratuite, Claude Sonnet 5 est le Claude gratuit par défaut, et DeepSeek V4 est gratuit sur le site de discussion de DeepSeek. Luna est le membre le moins cher de la famille GPT-5.6 et non le plus puissant, alors utilisez le bouton Think ou passez à GPT-5.5 quand une dissertation demande plus de soin. Pour le travail pas à pas sur les mathématiques les plus dures, GPT-5.6 Sol est le fleuron payant d'OpenAI et GPT-6 Astra annonce désormais 97,6 % sur FrontierMath Tier 4 v2 contre les 39,6 % vérifiés de GPT-5.5 Pro, même si Astra n'est pas disponible dans l'offre gratuite de ChatGPT ; Qwen 3.7 Max est l'alternative rapport qualité-prix avec 97,1 à l'indice HMMT février 2026 et des tarifs API de 1,25 $ / 3,75 $ dans sa promotion actuelle de 50 % (2,50 $ / 7,50 $ en tarif public).

TâcheMeilleur modèlePourquoiGratuit ?Alternative
Dissertations & travail de coursGPT-5.6 LunaPar défaut et gratuit dans ChatGPT depuis le 6 août ; discussions texte illimitéesOuiClaude Sonnet 5 (Claude gratuit)
Résolution de problèmes STEMGPT-5.6 Sol / Qwen 3.7 MaxFleuron STEM payant ; Astra annonce 97,6 % sur FrontierMath Tier 4 v2 / 97,1 HMMT févr. 2026Pro payant / Qwen API payantGemini 3.6 Flash (gratuit)
Recherche & précisionGemini 3.1 Pro98 % ARC-AGI-1 à 0,52 $/tâche, ancrage natif dans Google SearchOui (application Gemini)Claude Opus 5
Révision d'écritureClaude Sonnet 5Gratuit et par défaut sur claude.ai ; Claude Fable 5 est le leader en qualitéOui (Claude gratuit)Claude Fable 5
Étude multimodale (PDF, diapositives, images)Gemini 3.6 FlashContexte 1M, gratuit dans l'application GeminiOuiNotebookLM (Google)
Deuxième place et alternatives : Claude Sonnet 5 (gratuit) est le deuxième pour l'écriture et la révision de dissertations. Gemini 3.6 Flash (gratuit) est le deuxième pour l'étude multimodale et l'ingestion de PDF. DeepSeek V4 est le deuxième pour la résolution de problèmes avec un budget strictement à coût nul.
Ce qui a changé ce mois-ci

C'est l'offre gratuite qui a bougé dans ce guide. Le 6 août, OpenAI a fait de GPT-5.6 Luna le modèle par défaut de ChatGPT Free et Go et a donné aux deux des discussions texte illimitées ainsi qu'un bouton Think pour les questions plus difficiles, si bien que le choix gratuit est désormais Luna plutôt que GPT-5.5, qui reste sélectionnable quand une dissertation demande plus de soin. Les envois de fichiers, les images et les autres outils restent plafonnés. Côté Google, rien n'a bougé : Gemini 3.8 Flash est sorti le 2 septembre mais n'atteint les utilisateurs gratuits que via AI Studio et l'API, si bien que l'application Gemini gratuite sert toujours 3.6 Flash, qui conserve la ligne multimodale. GPT-6 Astra (3 septembre) est le modèle à surveiller pour les jeux de problèmes ardus, avec 97,6 % annoncés sur FrontierMath Tier 4 v2 contre les 39,6 % vérifiés de GPT-5.5 Pro, mais il exige un forfait ChatGPT payant et aucune offre gratuite ne l'inclut.

Guide d'usage, septembre 2026

Meilleure IA pour le travail & les professionnels

1
GPT-5.6
Travail de connaissance quotidien
2
Claude Opus 5
Programmation & écriture
3
Gemini 3.1 Pro
Recherche & briefings

La meilleure IA pour le travail professionnel est GPT-5.6 (par défaut de ChatGPT depuis le 9 juillet) pour le travail de connaissance quotidien, Claude Opus 5 pour la programmation et l'écriture à enjeux élevés, et Gemini Spark pour les flux agentiques 24/7. La plupart des professionnels en tirent le meilleur parti en cumulant deux abonnements payants (ChatGPT Plus à 20 $/mois plus Claude Pro à 20 $/mois, soit 40 $/mois au total), ou en consolidant avec Fello AI à 9,99 $/mois pour les cinq meilleurs modèles dans une seule app Mac/iOS. Pour le travail agentique qui tourne pendant que vous dormez, Gemini Spark est le seul vrai agent cloud 24/7, et depuis le 30 juillet il atteint le palier Google AI Pro à 19,99 $/mois en plus de Google AI Ultra.

Cas d'usageMeilleur modèleStat cléPrixAlternative
Travail de connaissance quotidienGPT-5.6Par défaut de ChatGPT depuis le 9 juillet ; l'assistant que la plupart peuvent ouvrir20 $/mois ChatGPT PlusClaude Opus 5
Programmation (propriétaire)Claude Opus 5.5#1 Terminal-Bench 4.0 (59,6 %) et #1 sur les deux classements de programmation de LiveBench, à 4 $ / 20 $20 $ par mois Claude ProGPT-6 Astra, qui conserve les deux classements de programmation d'Arena
Programmation (économique)Qwen3.8-Max-0902#4 Code Arena: WebDev (1681), derrière GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5 ; API uniquement sur QwenCloud2 $ / 6 $Qwen 3.7 Max ; DeepSeek V4.1-Flash
Recherche & briefingsGemini 3.1 Pro98 % ARC-AGI-1 à 0,52 $/tâche, ancrage GoogleGoogle AI Pro / UltraClaude Opus 5
Mathématiques ardues, physique, modélisation financièreGPT-6 Astra#1 LiveBench Reasoning et ARC-AGI-2 (95 %) ; annonce 97,6 % sur FrontierMath Tier 4 v2100 $/mois ChatGPT ProGPT-6 Astra ; Qwen 3.7 Max
Flux d'agent toujours actifsGemini SparkPremier agent cloud 24/7À partir de 19,99 $/mois Google AI ProClaude Cowork
Actualité en direct, créatif avec contexte XGrok 4.7Intelligence Index 46,3 + ancrage natif sur X ; l'application Grok sert toujours la 4.630 $ par mois SuperGrokGemini 3.1 Pro
Consolidation tout-en-unFello AIChatGPT + Claude + Gemini + Grok + DeepSeek9,99 $/moisPayer chaque fournisseur séparément
Deuxième et alternatives : pour la plupart des équipes professionnelles, Claude Opus 5.5 est le deuxième derrière GPT-5.6 pour le travail quotidien et en même temps le leader de la programmation sur chaque harness à 4 $ / 20 $, GPT-6 Astra étant deuxième sur les classements de programmation fondés sur les votes humains. Gemini 3.1 Pro est le deuxième pour les rôles à forte composante de recherche, et Gemini Spark est le choix unique si vous pouvez confier des tâches longues à un agent cloud.
Ce qui a changé ce mois-ci

Trois lancements sont tombés dans les trois premiers jours de septembre et un quatrième le 22 septembre, et c'est ce dernier qui change l'argument tarifaire sur lequel repose ce bloc. Claude Opus 5.5 domine l'Intelligence Index d'Artificial Analysis à 57,6 sur v4.3.2 ainsi que ses deux classements agentiques, et il le fait à 4 $ / 20 $ contre 5 $ / 25 $ pour Claude Opus 5. Le raisonnement que portait ce bloc, selon lequel les équipes devraient commencer par Opus 5 parce qu'il coûte la moitié des meilleurs modèles, ne tient plus : Opus 5.5 est à la fois meilleur et moins cher, il prend donc la ligne de la programmation propriétaire et c'est le modèle sur lequel nous bâtirions le travail quotidien. GPT-5.6 garde malgré tout la ligne de l'assistant quotidien, car cette ligne parle de portée et non de score, et ni Opus 5.5 ni GPT-6 Astra n'est un choix par défaut pour des centaines de millions de personnes. Le Qwen3.8-Max-0902 d'Alibaba (2 septembre) conserve la ligne de la programmation économique à 2 $ / 6 $, même s'il n'existe que via l'API QwenCloud sans interface grand public.

Comparatif de prix

Prix des modèles d'IA en septembre 2026

Des offres gratuites à 0 $ jusqu'à Google AI Ultra à 199,99 $ par mois. Le prix le plus lourd de conséquences de ce tableau est Claude Opus 5.5 à 4 $ / 20 $, car le 22 septembre Anthropic a publié le modèle le mieux noté qu'un évaluateur indépendant ait jamais mesuré à un tarif public inférieur à celui du modèle qu'il remplace : Claude Opus 5 coûte 5 $ / 25 $, les lectures de cache baissent de 60 % à 0,20 $, et le chiffre d'Anthropic elle-même situe une charge de travail typique 40 % moins chère que sur Opus 5. Cela inverse la forme qu'a eue cette section toute l'année, où le meilleur modèle était aussi le plus cher. Claude Fable 5.1 et GPT-6 Astra sont tous deux à 10 $ / 50 $ et marquent désormais tous deux en dessous. Le Muse Spark 1.3 de Meta est à 1,25 $ / 4,25 $, inchangé sur trois sauts de capacité depuis juillet, avec un palier Contributor à 0,10 $ / 0,20 $ pour qui accepte que Meta s'entraîne sur ses prompts, et Grok 4.6 comme Grok 4.7 sont à 2 $ / 6 $, avec la réserve qu'un prompt de 200 000 tokens ou plus refacture toute la requête à 4 $ / 12 $. Grok 4.7 est le cas le plus net de cette page d'un prix qui n'a pas bougé alors que le coût, lui, a bougé : les tokens coûtent pareil et une tâche de l'Intelligence Index coûte 2,73 $ contre 1,86 $ pour Grok 4.6, parce que la 4.7 émet environ deux fois plus de sortie pour y arriver. Le bas de gamme a bougé deux fois. DeepSeek a multiplié par environ quatre le tarif de ses deux modèles V4 le 16 août, ce qui a coûté à V4-Flash le choix rapport qualité-prix, puis en a annulé l'essentiel le 10 septembre : V4-Flash a été retiré et V4.1-Flash l'a remplacé à 0,15 $ / 0,60 $ hors pointe et 0,30 $ / 1,20 $ en pointe. Parmi les modèles qui s'achètent au token, le choix reste GLM 5.3 Flash, désormais à son tarif public simple de 0,15 $ / 0,50 $ depuis l'expiration de la promotion de lancement le 9 septembre, car Artificial Analysis le mesure à 0,25 $ par tâche de l'Intelligence Index pour un score de 41,8 contre 0,27 $ pour DeepSeek à 39,5. Hors pointe, les deux sont à égalité en entrée et GLM est moins cher en sortie ; en pointe, GLM gagne sur les deux. Un modèle les bat tous les deux au coût par tâche et il a quatre jours : le MiMo-V2.6-Pro de Xiaomi traite une tâche de l'indice pour 0,13 $ avec un score de 46,3 sous licence MIT simple, mais il faut héberger 1,02 billion de paramètres pour en profiter. À la frontière, le choix économique est le Muse Spark 1.3 de Meta, à 1,60 $ par tâche de l'indice pour 48,1. Parmi les modèles fermés, GPT-5.6 Luna est le moins cher au token à 0,20 $ / 1,20 $ après la baisse d'OpenAI du 30 juillet, et 0,18 $ par tâche de l'indice. Pour une analyse plus poussée, voyez notre guide complet de comparaison des prix de l'IA.

ModèleEntrée (par 1M)Sortie (par 1M)ContexteAccès gratuit ?
GPT-6 Astra$10.00$50.001 050 000 (entrée max. 922 000)ChatGPT Business/Pro depuis le 4 septembre, Plus quelques heures après ; pas d'offre gratuite. API, AWS et Azure à venir
GPT-5.5$5.00$30.001M (400K dans Codex)ChatGPT Free ; API payante
GPT-5.5 Pro$30.00$180.001MChatGPT Pro à partir de 100 $/mois (palier usage supérieur à 200 $)
GPT-5.6 Sol$4.00$20.00Non publiéEn ligne sur ChatGPT, Codex & API (9 juillet)
GPT-5.6 Terra$2.00$12.00Non publiéEn ligne sur ChatGPT, Codex & API (9 juillet)
GPT-5.6 Luna$0.20$1.20Non publiéEn ligne sur ChatGPT, Codex & API (9 juillet)
Claude Opus 5.54,00 $20,00 $1MClaude Pro/Max/Team ; API payante ; lectures de cache 0,20 $
Claude Opus 5$5.00$25.001MPar défaut sur Claude Pro/Max ; API payante
Claude Opus 4.8$5.00$25.001MModèle legacy chez Anthropic ; Pro/Max/API
Claude Fable 5.1$10.00$50.001MLectures de cache 0,25 $ ; dans Max/Team Premium (~50 % des limites d'usage) ; Pro/Team Standard via crédits. Mythos 5.1 se facture à l'identique, sur invitation uniquement
Claude Fable 5$10.00$50.001MPermanent dans Max/Team Premium (~50 % des limites d'usage) ; Pro/Team Standard via crédits
Claude Sonnet 5$2.00$10.001MPar défaut sur Claude Free & Pro ; API payante
Claude Sonnet 4.6$3.00$15.001MAPI payante (remplacé par Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MApplication Gemini limitée ; API payante
Gemini 3.8 Flash$0.75 introductif / $1.50 au 1/1/2027$3.75 introductif / $7.50 au 1/1/20271MAI Studio, Antigravity, Gemini Enterprise + API payante ; dans l'application Gemini rapporté pour AI Pro/Ultra
Gemini 3.7 Flash$0.75 introductif / $1.50 au 1/1/2027$3.75 introductif / $7.50 au 1/1/20271MAI Studio, Android Studio, Antigravity + API payante ; dans l'application Gemini via Spark uniquement (AI Pro/Ultra, hors EEE/RU/CH/Nigeria)
Gemini 3.6 Flash$0.75 introductif / $1.50 au 1/1/2027$3.75 introductif / $7.50 au 1/1/20271MModèle par défaut de l'application Gemini gratuite ; AI Studio ; palier API gratuit + API payante
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio ; palier API gratuit + API payante
Qwen3.8-Max-09022,00 $ (0,17 $ cache hit explicite, 0,25 $ implicite)6,00 $1M (sortie 128K)API QwenCloud uniquement ; pas de chat grand public, pas de poids ouverts
Qwen 3.7 Max$1.25 promo / $2.50 liste$3.75 promo / $7.50 liste1M200 requêtes gratuites/jour ; API payante au-delà
MiniMax M3$0.30 (50 % de remise sur $0.60)$1.20 (≤512K)1MOpen weights ; coûts d'hébergement applicables
LongCat-2.0Selon le fournisseurSelon le fournisseur1MOpen weights (MIT) ; coûts d'hébergement applicables
NVIDIA Nemotron 3 UltraSelon le fournisseurSelon le fournisseur1MOpen weights (OpenMDW) ; coûts d'hébergement applicables
Qwen 3.5 (open-weight)Auto-hébergement / TogetherAuto-hébergement / Together1MOpen weights ; coûts d'hébergement applicables
Nex-N2-ProAuto-hébergement / fournisseursAuto-hébergement / fournisseurs1MOpen weights (Apache 2.0) ; coûts d'hébergement applicables
Rio 3.5 Open 397BAuto-hébergement / fournisseursAuto-hébergement / fournisseurs1MOpen weights (MIT) ; coûts d'hébergement applicables
Grok 4.3$1.25$2.501MForfait grand public gratuit ; API payante
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Grok 4.72,00 $ (<200K) / 4,00 $ (≥200K)6,00 $ (<200K) / 12,00 $ (≥200K)500KAPI SpaceXAI, Cursor, Grok Build, harnesses et routeurs cloud ; pas dans l'application Grok
Muse Spark 1.3$1.25 ($0.10 palier Contributor)$4.25 ($0.20 palier Contributor)1MAPI payante ; Muse Code, Meta Model API et OpenRouter ; le palier Contributor échange des droits d'entraînement contre une remise de ~92 %
Kimi K3$3.00 ($0.30 cache-hit)$15.001MPalier de base gratuit dans l'application Kimi ; open weights sur Hugging Face (Kimi K3 License)
Gemini Omni Flash (vidéo)$1.50$17.50 (sortie vidéo)Clips de 10 secondesApplication Gemini / Flow ; AI Studio + API
DeepSeek V4-Pro$0.66 hors pointe / $1.32 en pointe ($0.022 cache-hit hors pointe)$1.98 hors pointe / $3.96 en pointe1MDeepSeek Chat gratuit ; API payante, tarifs de pointe et hors pointe depuis le 16 août
DeepSeek V4.1-Flash0,15 $ hors pointe / 0,30 $ en pointe (0,003 $ succès de cache hors pointe)0,60 $ hors pointe / 1,20 $ en pointe1MDeepSeek Chat gratuit ; API payante, tarifs heures pleines et creuses ; a remplacé V4-Flash le 10 septembre
Kimi K2.7 CodeSelon le fournisseurSelon le fournisseur256KOpen weights ; coûts d'hébergement applicables
GLM-5.2Selon le fournisseurSelon le fournisseur1MOpen weights ; coûts d'hébergement applicables
GLM 5.3$1.40 ($0.26 cache-hit)$4.401MAPI Z.ai, GLM Coding Plan et ZCode ; poids sur Hugging Face depuis le 28 août sous la licence maison GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 cache-hit) ; $0.075 en promo$0.50 ; $0.25 en promo1MAPI Z.ai, GLM Coding Plan, OpenRouter ; poids MIT sur Hugging Face ; promo jusqu'au 9 septembre
Tencent Hy4 Preview$0.834 ($0.042 cache-hit)$2.5011M+Poids ouverts (Apache 2.0) ; Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextSelon le fournisseurSelon le fournisseur262K (jusqu'à 1M)Poids ouverts (Qwen Community License 1.0) ; coûts d'hébergement en sus
MiMo-V2.6-Pro0,435 $0,87 $1MPoids ouverts (MIT) ; coûts d'hébergement à prévoir
ERNIE 5.1Tarif région ChineTarif région Chine256KPalier gratuit de Baidu
Gemini Spark (agent)Sans tarif APISans tarif API1M (base Gemini)Google AI Pro 19,99 $, AI Ultra 99,99 $ ou 199,99 $/mois
Fello AI (agrégateur)Acheminé via l'appAcheminé via l'appSelon le modèle9,99 $/mois, version gratuite disponible

Les tarifs de GPT-5.5 et GPT-5.5 Pro ci-dessus sont des prix de contexte court ; OpenAI ne publie plus les chiffres spécifiques de contexte long. Les paliers GPT-5.6 sont facturés à 2x l'entrée et 1,5x la sortie une fois qu'un prompt dépasse 272K tokens d'entrée, ce qui place Terra en contexte long à 4 $ / 18 $ et Luna à 0,40 $ / 1,80 $. Grok 4.6 fonctionne de la même façon, mais mord plus fort : à partir de 200 000 tokens de prompt, SpaceXAI refacture la requête entière au tarif supérieur plutôt que le seul dépassement, si bien que dépasser le seuil de mille tokens double le coût de tout l'appel. L'autre grille à lire deux fois est celle de DeepSeek : depuis le 16 août, ses deux modèles V4 sont facturés au tarif de pointe de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine, et à exactement la moitié à toute autre heure, si bien que la même tâche peut coûter le double selon le moment où vous la lancez. Si vous voulez accéder à plusieurs modèles d'IA sans gérer d'abonnements distincts, Fello AI propose GPT, Claude, Gemini, Grok, Perplexity et plus encore dans une seule app pour Mac, iPhone et iPad à partir de 9,99 $/mois.

Modèles open-weight

Meilleurs modèles open-weight en septembre 2026

Le meilleur modèle à poids ouverts en septembre 2026 est MiMo-V2.6-Pro, que Xiaomi a publié le 21 septembre sous licence MIT simple : 1,02 billion de paramètres dont 42 milliards actifs, un contexte de 1M de tokens et les poids sur Hugging Face le jour même. Artificial Analysis le mesure à 46,3 sur l'Intelligence Index v4.3.2, le meilleur score ouvert qu'elle ait jamais publié, au-dessus de GLM-5.3 à 44,8 et de Kimi K3 à 43,6, et il le fait à 0,13 $ par tâche de l'indice, moins cher que tout autre modèle de cette page. Il prend aussi 34,8 % sur Terminal-Bench 4.0 et 1673 sur GDPval-AA v2.1, ce qui le place au-dessus de Kimi K3 sur les deux. Deux limites honnêtes : aucun classement d'Arena ne l'a évalué, il n'existe donc aucune donnée de préférence humaine à son sujet, et il a été publié il y a quatre jours, sans historique indépendant. Kimi K3 reste le modèle ouvert le mieux classé sur Arena, cinquième sur WebDev à 1674 et cinquième sur le signal d'achèvement des tâches de l'Agent Arena, et GLM-5.3 reste le modèle ouvert le plus fort sur le Terminal-Bench 4.0 d'Artificial Analysis à 41,9 % contre 34,8 % pour MiMo, sous une licence Z.ai propre et non MIT. La recommandation pratique pour les équipes qui hébergent leurs propres poids reste GLM 5.3 Flash (Z.ai, MIT), sorti le 26 août et noté 41,8 sur v4.3.2, 320 Md au total dont 18 Md actifs, parce qu'un modèle de 1,02 billion de paramètres n'est pas une affaire de station de travail et que le téléchargement de K3 représente 96 fragments safetensors et environ 1,56 To. L'étage ouvert bon marché a de nouveau changé le 10 septembre : DeepSeek a retiré V4-Flash 0731 et l'a remplacé par DeepSeek-V4.1-Flash, 552 Md avec 8 Md actifs au prefill et 16 Md au décodage, nativement multimodal, sous MIT dès le premier jour, noté 39,5 sur v4.3.2 contre 34,3 pour la version remplacée, et revenu à 0,15 $ / 0,60 $ hors pointe. Il est aussi troisième sur le signal d'achèvement des tâches de l'Agent Arena, le modèle ouvert le mieux placé là-bas. Parmi les trois sorties qui ont clos août, GLM 5.3 a publié ses poids le 28 août sous une licence propre assortie d'une clause imposant à tout opérateur de model-as-a-service dépassant 10 milliards de dollars de chiffre d'affaires de passer d'abord une revue de sécurité Z.ai ; le Qwen3.8-Flash-Next d'Alibaba, un mélange d'experts de 125 Md avec seulement 6 Md actifs qui préfigure l'architecture Qwen4, obtient 39,8 et occupe la neuvième place du classement WebDev d'Arena ; et le Hy4 Preview de Tencent, 770 Md au total et 49 Md actifs sous Apache 2.0, n'a pas de note d'Artificial Analysis mais se situe onzième sur Arena WebDev à 1624. Notez aussi que GLM 5.3 Flash n'est pas un GLM 5.3 allégé mais un modèle distinct sur une base réentraînée, ce qui lui a permis de sortir sous MIT simple alors que le vaisseau amiral ne le pouvait pas.

ModèleIdéal pourBenchmark cléContexte / LicenceOù l'exécuter
MiMo-V2.6-ProLe plus haut Intelligence Index ouvert jamais mesuréII 46,3 (v4.3.2), au-dessus de GLM-5.3 et Kimi K3, à 0,13 $ par tâche ; 34,8 % Terminal-Bench 4.0 ; GDPval-AA v2.1 1673 ; 1,02 billion/42 Md actifs1M / MITHugging Face (XiaomiMiMo), fournisseurs, auto-hébergement
Kimi K3Modèle ouvert le mieux classé sur ArenaII 43,6 (v4.3.2) ; #5 Arena WebDev, meilleure place ouverte ; #5 Agent Arena ; 2.8T/104B actifs1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 To), Moonshot API, fournisseurs
GLM 5.3 FlashMeilleur modèle ouvert que la plupart des équipes peuvent réellement faire tournerII 41,8 (v4.3.2), sur la frontière de Pareto intelligence-coût à environ $0.25 par tâche de l'index ; 320B/18B actifs, nativement multimodal1M / MITHugging Face, API Z.ai ($0.15/$0.50), OpenRouter
GLM-5.2Repli avec un bilan indépendantII 33,7 (v4.3.2) ; #19 Arena WebDev (1,591.8), #17 Agent Arena ; 744B/40B actifs1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Ouvert depuis le 28 août, mais sous licence maisonII 44,8 (v4.3.2), le meilleur score ouvert que nous ayons trouvé ; même base 744B que GLM-5.2, post-entraînée seulement, checkpoint publié compté à 753B ; CyberGym 84,5 % et Terminal-Bench 3.0 28,3 (chiffres de l'éditeur)1M / GLM 5.3 License (model-as-a-service au-delà de 10 Md$ de CA nécessite une revue de sécurité Z.ai)Hugging Face, API Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4.1-FlashMeilleur rapport qualité-prix ouvert si vous l'hébergez vous-mêmeII 39,5 (v4.3.2) contre 34,3 pour la version V4-Flash 0731 qu'il remplace ; 552B, 8B actifs au prefill et 16B au décodage1M / MITDeepSeek API (0,15 $/0,60 $ hors pointe, 0,30 $/1,20 $ en pointe depuis le 10 septembre), local
Tencent Hy4 PreviewPlus grand modèle sous licence permissive à ce jour770B/49B actifs ; 2,99/4,00 sur le panel maison de Tencent de 203 tâches contre 2,94 pour Kimi K3 et 2,92 pour GLM 5.3 (éditeur) ; pas de note Artificial Analysis ; #11 Arena WebDev (1624)1M+ / Apache 2.0Hugging Face (BF16 et FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextAvant-goût de l'architecture Qwen4125B au total plus un embedding N-gramme de 51B, 6B actifs ; 91,7 GPQA Diamond et 62,5 SWE-Bench Pro (éditeur) ; II 39,8 (v4.3.2) ; #9 Arena WebDev (1635)262K à 1M / Qwen Community License 1.0Hugging Face, fournisseurs, auto-hébergement
LongCat-2.0Programmeur ouvert frontier entraîné sur des puces chinoisesII 33 (v4.1) ; 59,5 % SWE-Bench Pro (éditeur), 1.6T/~48B actifs1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de classe frontier bon marchéII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licence à déterminerHugging Face, API 0,30 $/1M (50 % de remise)
Nex-N2-ProMeilleur score de programmation ouvertII 41 (v4.1) ; 80,8 SWE-Bench Verified, 397B/17B actifsBasé sur Qwen / Apache 2.0Hugging Face, fournisseurs, auto-hébergement
Kimi K2.7 CodeMeilleur programmeur ouvert sous licence commerciale+21,8 % sur Kimi Code Bench v2 vs K2.6 (éditeur) ; 1T/32B actifs256K / Modified MITHugging Face, DeepInfra, fournisseurs
DeepSeek V4-ProTravail agentique en conditions réellesII 44 (v4.1), 1.6T/49B actifs1M / MITDeepSeek API (0,66 $/1,98 $ hors pointe, 1,32 $/3,96 $ en pointe depuis le 16 août), local
Hy3Le plus récent arrivant à licence permissiveII 41 (v4.1) ; #22 sur Arena WebDev (1,516.4)Apache 2.0Hugging Face, fournisseurs, auto-hébergement
InklingPremier open model de Thinking MachinesII 41 (v4.1), agentique 32,3, sorti le 15 juilletOpen weightsHugging Face, fournisseurs, auto-hébergement
Inkling SmallMême famille à un quart de la tailleII 40 (v4.1), agentique 30,8 ; 276B/12B actifs, entrée texte, image et audioApache 2.0Hugging Face (BF16 et NVFP4), fournisseurs, auto-hébergement
NVIDIA Nemotron 3 UltraAffiné par NVIDIA, licence entièrement permissiveII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B actifs1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 auto-hébergement)
Qwen 3.5 (397B / 17B actifs)Multimodal, décodage rapide88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / ouvertTogether, OpenRouter, local
Qwen3.6-35B-A3BProgrammeur agentique ouvert efficace (3B actifs)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B actifs262K (jusqu'à 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgrammeur dense exécutable sur portable87,8 GPQA Diamond, dense 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, raisonnement multilingue70,8 Terminal-Bench 2.1 (first-party), bat Qwen 3.7 Plus sur 4/5397B/17B actifs / MITHugging Face, fournisseurs, auto-hébergement
Llama 4 MaverickModèle phare de la lignée Meta17B actifs / 400B de paramètres au totalLlama 4 licenseCloud Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / faible consommationMultimodal, empreinte très réduiteCompact / ouvertLocal, outil NVIDIA

Ici la licence compte autant que le score brut, et août a creusé l'écart entre les deux groupes. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) et Nemotron 3 Ultra (OpenMDW) autorisent tous clairement l'usage commercial sans examen du chiffre d'affaires. Le reste porte des conditions à lire avant de construire dessus : MiniMax M3 et MiniMax H3 arrivent sous leurs propres licences communautaires, H3 exigeant en plus une demande depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud ; Kimi K3 se place sur une licence maison avec un seuil de revenus pour quiconque le revend comme service ; GLM 5.3 impose une revue de sécurité Z.ai à tout opérateur de model-as-a-service au-delà de 10 milliards de dollars de chiffre d'affaires ; et la Qwen Community License 1.0 de Qwen3.8-Flash-Next impose une licence distincte de Qwen pour exploiter une activité de model-as-a-service ou d'assistant de travail IA, l'usage interne restant exempté. Aucun open model n'est plus premier sur aucun classement d'Arena que nous suivons : Claude Opus 5 a pris le classement Agent en juillet, le dernier qu'un open model ait dominé.

Comment nous évaluons

Benchmarks, prix et usage sur le terrain

Chaque classement de cette page combine trois éléments : des benchmarks publics de sept maisons indépendantes (Artificial Analysis, Arena anciennement LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize et le classement officiel Terminal-Bench 4.0, couvrant l'index Intelligence, GPQA Diamond, ARC-AGI-1 à 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas et le Remote Labor Index), les tarifs d'API et d'abonnement publiés sur la page de prix officielle de chaque fournisseur, et l'usage sur le terrain par l'équipe éditoriale de FelloAI qui exécute de vrais prompts sur la même tâche sur chaque modèle. Nous récupérons de nouveau les sources officielles de prix et de benchmarks avant chaque mise à jour mensuelle.

Les benchmarks sont pondérés selon le cas d'usage : SWE-bench et Terminal-Bench portent la programmation, GPQA Diamond et ARC-AGI-2 portent la précision, GDPval-AA (le benchmark de livrables professionnels d'Artificial Analysis) informe la qualité des tâches professionnelles tandis que le style d'écriture est jugé avant tout par des tests sur le terrain, FrontierMath et HMMT portent la résolution de problèmes. Nous précisons quand un benchmark est annoncé par l'éditeur mais non vérifié de façon indépendante, et nous écartons toute affirmation que nous ne pouvons pas reproduire face à une source en direct. Nous classons sur les scores mesurés : la couronne d'une catégorie change dès qu'un modèle dépasse le tenant sur les classements qui définissent cette catégorie, sans attendre les classements fondés sur des votes, et un modèle qui n'est pas encore largement disponible est signalé sur sa carte plutôt que privé de carte. Nous revérifions les rangs autant que les chiffres, car un score peut rester exact pendant que le classement autour de lui bouge. Lorsqu'un modèle passe par une mise à niveau majeure entre deux mises à jour, nous reclassons la catégorie et ajoutons une ligne « Ce qui a changé ce mois-ci » au bas de l'analyse approfondie.

Fello AI fonctionnant sur Mac, iPhone et iPad
Vous ne savez pas quel modèle choisir ?

Fello AI réunit les meilleurs modèles d'IA dans une seule app native et légère.

Passez de l'un à l'autre à tout moment, sans abonnements séparés.

Télécharger Fello AI
Foire aux questions

Questions fréquentes

Quel est le meilleur modèle d'IA en ce moment en septembre 2026 ?
Cela dépend de la tâche, mais un modèle domine désormais plus de classements que tout autre. Sur le score global, Claude Opus 5.5 (22 septembre) est #1 de l'Intelligence Index d'Artificial Analysis à 57,6 sur v4.3.2, 4,3 points devant Claude Fable 5.1, et il mène aussi GDPval-AA v2.1 à 1846, AA-Briefcase v1.1 à 1822 et Humanity's Last Exam à 61,4 %, à 4 $ / 20 $ par million de tokens. Pour la programmation, Opus 5.5 mène le Terminal-Bench 4.0 d'Artificial Analysis à 59,6 % et les deux classements de programmation de LiveBench, tandis que GPT-6 Astra conserve les deux classements de programmation d'Arena, faute de votes pour Opus 5.5. Pour le chat quotidien, GPT-5.6 est le modèle par défaut de ChatGPT depuis le 9 juillet et l'assistant que le plus de gens peuvent réellement ouvrir, même si Claude Fable 5 domine le classement texte d'Arena. Pour l'écriture, Claude Fable 5.1 est le seul modèle présent dans les six premiers des trois classements de prose. Pour la précision, Claude Fable 5.1 conserve la meilleure précision factuelle mesurée par Artificial Analysis, 67 % sur AA-Omniscience, un point devant Opus 5.5. Pour les mathématiques difficiles et le raisonnement, GPT-6 Astra mène LiveBench Reasoning et ARC-AGI-2. Pour les images, ChatGPT Images 2.5 domine les quatre classements que nous suivons, et pour la vidéo Gemini Omni 1.1 Flash domine le texte-vers-vidéo d'Arena. Pour les agents, Gemini Spark est l'agent cloud en continu et Claude Cowork celui du bureau. Côté poids ouverts, le MiMo-V2.6-Pro de Xiaomi obtient 46,3 sous licence MIT simple à 0,13 $ par tâche de l'indice.
GPT-6 est-il sorti, et est-ce le meilleur modèle aujourd'hui ?
GPT-6 est sorti. OpenAI l'a lancé sous le nom de GPT-6 Astra le 3 septembre 2026, ce qui tranche la question posée depuis un an de savoir si Astra sortirait en GPT-6 ou en nouvelle version intermédiaire de GPT-5. Ce n'est pas le meilleur modèle sur les classements indépendants, et il a encore reculé le 22 septembre. Artificial Analysis lui donne 52,7 sur l'Intelligence Index v4.3.2, 5,7 points devant GPT-5.6 Sol mais 0,7 point derrière Claude Fable 5.1 à 53,4 et 4,9 points derrière Claude Opus 5.5 à 57,6, pour 10 $ / 50 $ par million de tokens contre 4 $ / 20 $ pour Sol comme pour Opus 5.5. La programmation était son argument le plus fort et elle est désormais partagée : Astra a pris le Terminal-Bench 4.0 d'Artificial Analysis à 59,1 % et l'a gardé jusqu'à ce qu'Opus 5.5 le dépasse à 59,6 %, un écart à l'intérieur des barres d'erreur de ce benchmark, tandis qu'Astra conserve les deux classements de programmation d'Arena faute de votes pour Opus 5.5. Il divise aussi grossièrement par deux les hallucinations sur AA-Omniscience, des 92 % de Sol à 51 % en effort maximal, et il gagne toujours l'AutomationBench de Zapier et le Terminal-Bench-Science 0.1 face à Opus 5.5. Il faut une formule payante : Astra est le premier modèle qu'OpenAI a classé Critical en cybersécurité, les défenseurs agréés de son programme Daybreak l'ont donc eu en premier, ChatGPT Business et Pro ont suivi le 4 septembre et Plus quelques heures plus tard, et rien n'a été annoncé pour l'offre gratuite. Notre analyse complète de GPT-6 Astra couvre les benchmarks et les réserves.
Qu'est-ce que Claude Opus 5 ?
Claude Opus 5 est le modèle phare d'Anthropic du 24 juillet 2026, et il a été le modèle #1 sur Artificial Analysis jusqu'à l'arrivée de Claude Fable 5.1 le 1er septembre. Il est désormais troisième sur l'Intelligence Index à 50,8, contre 53,4 pour Claude Fable 5.1 et 52,7 pour GPT-6 Astra, deuxième sur AA-Briefcase à 1673 contre 1678, et à effort max il domine même le classement GDPval-AA v2.1 de livrables professionnels avec 1708 contre les 1735 de Fable 5.1, sur des intervalles de confiance qui se recouvrent, toujours bien devant les 1695 de Grok 4.7 et les 1632 de Claude Fable 5. Le tarif de l'API est de 5 $ / 25 $ par 1M de tokens, le même qu'Opus 4.8 et moitié moins cher que Fable 5, avec une fenêtre de contexte de 1M de tokens et une date de connaissances de mai 2026. ARC Prize confirme de façon indépendante l'affirmation de lancement d'Anthropic sur ARC-AGI-3, où Opus 5 obtient 30 % contre 8 % pour le modèle suivant, environ 3,75x. Arena le place désormais troisième sur les deux classements de programmation, derrière GPT-6 Astra et Claude Fable 5.1, premier sur Document, quatrième sur le signal d'accomplissement des tâches de l'Agent Arena et dixième sur le texte. Une chose à garder à l'esprit : Artificial Analysis mesure son taux d'hallucination à 50 %, ce qui explique pourquoi il ne détient aucune couronne de précision sur cette page.
Qu'est-ce que Claude Fable 5.1 ?
Claude Fable 5.1 est la sortie d'Anthropic du 1er septembre 2026 et le modèle le mieux noté qu'Artificial Analysis ait mesuré, à 53,4 sur son Intelligence Index v4.3.2 en effort max et premier sur AA-Briefcase à 1678. Il est sorti aux côtés de Claude Mythos 5.1, le même modèle avec les garde-fous en biologie et en cybersécurité relâchés, disponible sur invitation uniquement et sans critères d'éligibilité publiés. Le tarif est de 10 $ / 50 $ par 1M de tokens, inchangé par rapport à Fable 5, mais les lectures de cache baissent de 75 % à 0,25 $, sur une fenêtre de contexte de 1M de tokens et avec une date de connaissances de juin 2026. Il est inclus dans Claude Max et Team Premium à environ 50 % des limites hebdomadaires et accessible depuis Pro via des crédits. Anthropic recommande toujours de commencer par Claude Opus 5 pour la plupart des charges, puisqu'il coûte moitié moins cher et tourne plus vite. Notre décryptage complet de Claude Fable 5.1 et Mythos 5.1 couvre la system card et le partage des garde-fous.
Claude Fable 5 est-il de retour ?
Oui. Anthropic a redéployé Claude Fable 5 le 1er juillet 2026 après que le gouvernement américain a levé la restriction de contrôle des exportations qu'il avait imposée le 12 juin. Il est de nouveau disponible sur la Claude API, Claude.ai, Claude Code et Claude Cowork. Anthropic a rendu Fable 5 permanent dans les forfaits payants le 20 juillet 2026. Max et Team Premium l'incluent à environ 50 % des limites d'usage habituelles ; Pro et Team Standard y accèdent via des crédits d'usage avec un crédit de départ unique de 100 $. Le tarif de l'API est de 10 $ / 50 $ par million de tokens. Fable 5 est un modèle de classe Mythos conçu pour le travail agentique de long horizon avec un contexte de 1M de tokens, et c'est le deuxième pour la programmation derrière Claude Opus 5, à #2 sur le classement image-to-WebDev d'Arena (1,625.7) et #4 sur WebDev.
Qu'est-ce que GPT-5.6 et puis-je l'utiliser ?
Oui, depuis le 9 juillet 2026. GPT-5.6 est la famille de modèles nouvelle génération d'OpenAI, et après un aperçu fermé de deux semaines qui a débuté le 26 juin derrière une revue de sécurité du gouvernement américain, elle a atteint la disponibilité générale le 9 juillet. Il y a trois paliers, du moins au plus capable : Luna, le palier rapide et le moins cher (0,20 $ / 1,20 $ par 1M de tokens) ; Terra, un modèle équilibré pour le quotidien qu'OpenAI dit égaler GPT-5.5 (2 $ / 12 $) ; et Sol, le modèle phare réglé pour la biologie, la chimie et la cybersécurité (4 $ / 20 $). OpenAI a réduit Luna de 80 % et Terra de 20 % le 30 juillet 2026 en laissant Sol intact, puis a baissé Sol de plus de 20 % le 21 août 2026, un tarif promotionnel d'environ trois mois. Aucun prix d'abonnement ChatGPT n'a changé. Il est désormais en ligne sur ChatGPT, Codex et l'API comme modèle par défaut d'OpenAI. Une réserve : la system card d'OpenAI et l'évaluateur externe METR ont signalé un comportement de « scheming » élevé chez Sol, alors traitez-le avec prudence pour un travail factuel à enjeux élevés jusqu'à ce que les résultats indépendants se stabilisent.
Grok 4.7 est-il déjà sorti ?
Oui. SpaceXAI a publié Grok 4.7 le 21 septembre 2026, remplaçant Grok 4.6 comme modèle phare. Contrairement à la 4.6, qui était un post-entraînement de la même base, la 4.7 repose sur un modèle de base nouveau et plus grand, entraîné avec une campagne d'apprentissage par renforcement plus longue orientée vers des travaux de plusieurs heures ; SpaceXAI ne publie aucun nombre de paramètres. Artificial Analysis lui donne 46,3 sur l'Intelligence Index v4.3.2 en effort élevé contre 44,3 pour Grok 4.6, et sur les deux classements agentiques il passe devant GPT-6 Astra, 1695 contre 1542 sur GDPval-AA v2.1 et 1657 contre 1569 sur AA-Briefcase v1.1. Le prix ne change pas, 2 $ / 6 $ par million de tokens sur une fenêtre de 500K, même si les prompts de 200 000 tokens et plus refacturent toute la requête à 4 $ / 12 $, et une variante rapide tourne à deux fois la vitesse de sortie pour deux fois le prix. Le coût par tâche de l'Intelligence Index, lui, a bougé, de 1,86 $ à 2,73 $, parce que la 4.7 émet environ deux fois plus de tokens de sortie. Il est disponible dans l'API Grok, dans Cursor, dans Grok Build, dans des harnesses de programmation tiers et dans des routeurs cloud. L'annonce de SpaceXAI ne dit rien de l'application grand public Grok, qui sert toujours Grok 4.6 à 30 $ par mois. Grok est aussi notre choix pour la créativité, pour des raisons de produit et non de qualité de prose ; pour le texte le mieux écrit, Claude Fable 5 l'emporte nettement. Tous les chiffres sont dans notre analyse de Grok 4.7.
Quelle IA est la meilleure pour programmer ?
Claude Opus 5.5 est le meilleur pour la programmation depuis qu'Anthropic l'a publié le 22 septembre. Il mène la campagne Terminal-Bench 4.0 d'Artificial Analysis à 59,6 % contre 59,1 % pour GPT-6 Astra, LiveBench Coding à 89,3 contre 80,4 et LiveBench Agentic Coding à 71,7 contre 57,3, et il le fait à 4 $ / 20 $ par million de tokens contre 10 $ / 50 $ pour Astra. Sur le harness maison d'Anthropic l'écart est plus large, 66,4 % sur Terminal-Bench 4.0 contre les 57,9 % qu'OpenAI rapporte pour Astra, avec 54,4 % sur FrontierCode v1.1 et 57,8 % sur CursorBench 4.0. GPT-6 Astra est le deuxième et conserve les deux classements de programmation d'Arena, WebDev à 1800 et image-vers-WebDev à 1733, parce qu'Opus 5.5 n'y a pas encore de votes ; la lecture honnête est donc qu'OpenAI domine la préférence humaine et Anthropic chaque harness mesuré. Traitez le demi-point d'écart sur Terminal-Bench comme une égalité, car Anthropic y annonce une erreur type d'environ 2,6 points. Claude Fable 5.1 est troisième. Côté poids ouverts, GLM-5.3 est le plus fort sur Terminal-Bench 4.0 à 41,9 % et Kimi K3 est le modèle ouvert le mieux classé sur Arena WebDev, en cinquième position, tandis que GLM 5.3 Flash est celui que la plupart des équipes peuvent héberger, à 0,25 $ par tâche sous licence MIT simple. Artificial Analysis a retiré son Coding Index et son Coding Agent Index.
Quelle IA est la meilleure pour écrire ?
Claude Fable 5.1 est la meilleure pour écrire et arrive en tête de Humanity's Last Exam à 59,1 % ainsi que du classement de livrables professionnels GDPval-AA v2.1. Claude Fable 5 est le choix si vous pondérez les votes humains : il mène toujours Arena écriture créative et LiveBench Language (90.7), mais il n'est plus que #8 sur EQ-Bench Creative Writing v3. Il coûte 10 $ / 50 $ par 1M de tokens. Claude Sonnet 5 est le choix rapport qualité-prix et ce que la plupart des gens devraient réellement utiliser, puisqu'il est gratuit et par défaut sur claude.ai à 2 $ / 10 $, un tarif de lancement rendu permanent par Anthropic en août 2026, bien qu'il se classe #53 sur Arena écriture créative. Kimi K3 est quatrième sur EQ-Bench à 2070.6 si vous voulez une fiction distinctive, Claude Fable 5.1 arrive en tête du classement GDPval-AA v2.1 de livrables professionnels à 1846, Claude Opus 5 étant deuxième à 1735, GPT-5.5 est l'alternative pour l'écriture professionnelle ancrée dans les faits, et Gemini 3.8 Flash est le choix rapport prix-performance pour le contenu en masse.
Quel est le meilleur modèle d'IA open-weight en 2026 ?
Le MiMo-V2.6-Pro de Xiaomi, publié le 21 septembre 2026 sous licence MIT simple. Artificial Analysis le mesure à 46,3 sur l'Intelligence Index v4.3.2, le meilleur score ouvert qu'elle ait jamais publié, au-dessus de GLM-5.3 à 44,8 et de Kimi K3 à 43,6, et il traite une tâche de l'indice pour 0,13 $, moins cher que tout autre modèle de cette page. C'est un mélange d'experts de 1,02 billion de paramètres dont 42 milliards actifs, avec un contexte de 1M de tokens et les poids sur Hugging Face dès le premier jour. Deux réserves : aucun classement d'Arena ne l'a évalué, il n'existe donc aucune donnée de préférence humaine, et il a quatre jours. Kimi K3 reste le modèle ouvert le mieux classé sur Arena, cinquième sur WebDev et cinquième sur le signal d'achèvement des tâches de l'Agent Arena, et GLM-5.3 reste le modèle ouvert le plus fort sur le Terminal-Bench 4.0 d'Artificial Analysis à 41,9 %, sous une licence Z.ai propre et non MIT. Pour les équipes qui veulent vraiment héberger le leur, GLM 5.3 Flash (Z.ai, MIT) reste la recommandation pratique, à 41,8 sur l'indice et 320 Md au total dont 18 Md actifs, car un modèle de 1,02 billion de paramètres demande un cluster et le téléchargement de Kimi K3 représente 96 fragments et environ 1,56 To.
Quel est le modèle d'IA de classe frontier le moins cher ?
Au tarif API par million de tokens, GPT-5.6 Luna est le modèle fermé de classe frontière le moins cher à 0,20 $ / 1,20 $, après la baisse de 80 % d'OpenAI du 30 juillet 2026, et Artificial Analysis le note 37,3 sur son index v4.3.2 contre 34,0 pour Gemini 3.6 Flash. Moins cher encore : GLM 5.3 Flash, notre choix rapport prix-performance depuis août, désormais à son simple tarif catalogue de 0,15 $ / 0,50 $ depuis l'expiration de la promotion de lancement le 9 septembre, avec 41,8 sous une simple licence MIT que vous pouvez auto-héberger. DeepSeek a détenu ce choix jusqu'à sa hausse d'environ quatre fois le 16 août, et a bien failli le reprendre le 10 septembre, quand V4.1-Flash a remplacé V4-Flash à 0,15 $ / 0,60 $ hors pointe et 0,30 $ / 1,20 $ en pointe : hors pointe, les deux sont désormais à égalité en entrée, GLM restant moins cher en sortie. Artificial Analysis les sépare encore sur le coût par tâche d'index, 0,25 $ pour GLM contre 0,27 $ pour DeepSeek. L'offre bon marché de Google s'est encore améliorée le 2 septembre, Gemini 3.8 Flash atteignant 40,9 au même tarif de lancement de 0,75 $ / 3,75 $, même si ce tarif double le 1er janvier 2027. MiniMax M3 est à 0,30 $ par million de tokens d'entrée avec une remise permanente de 50 %, LongCat-2.0 faisant une solide alternative sous MIT. Mesuré par tâche de l'Intelligence Index plutôt que par token, le modèle le moins cher de cette page est GPT-5.6 Luna à 0,18 $.
Quels modèles d'IA sont gratuits ?
ChatGPT Free utilise désormais GPT-5.6 par défaut (avec GPT-5.5 toujours disponible) sous des limites d'usage. Gemini Free fait tourner Gemini 3.6 Flash dans l'application Gemini et Google AI Studio. Claude Free fait tourner Claude Sonnet 5 (le nouveau par défaut) avec des limites quotidiennes. DeepSeek Chat fait tourner DeepSeek V4 gratuitement sur le site de DeepSeek. Grok a un forfait grand public gratuit limité (X Premium est un module payant). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash, MiMo-V2.6-Pro et Hy4 Preview de Tencent sont open-weight et gratuits à auto-héberger, mais les licences diffèrent et seuls certains sont en MIT ou Apache purs. Qwen 3.7 Max est API uniquement sans front-end de chat grand public, mais Alibaba inclut désormais 200 requêtes de modèle gratuites par jour. Kimi a un palier de base gratuit dans son app, l'usage agentique plus intensif étant facturé.
Qu'est-ce que Gemini Spark et quel abonnement faut-il ?
Gemini Spark est le premier agent d'IA de Google résident dans le cloud 24/7, lancé au Google I/O le 19 mai 2026 et il n'est plus exclusif à Ultra : depuis le 30 juillet 2026 il atteint aussi le palier Google AI Pro à 19,99 $/mois, aux États-Unis et dans plus de 160 autres pays, tandis que Google AI Ultra à 99,99 $ ou 199,99 $/mois porte le déploiement mondial plus large. Google AI Plus, le palier gratuit et les comptes professionnels ou scolaires ne l'incluent pas. Spark est construit sur les modèles de base Gemini avec le harness Antigravity de Google sur une VM Google Cloud, s'intègre à Gmail, Google Docs et d'autres apps Google Workspace, et peut interagir avec Chrome et le système Halo d'Android côté appareil. Il vaut la dépense pour les utilisateurs qui ont des flux répétables de longue durée (tri de la boîte de réception, synthèses de recherche, tâches planifiées). Pour des tâches ponctuelles, Claude Cowork à 20 $/mois couvre la plupart des besoins d'agent de bureau.
Qu'est-ce que Fello AI ?
Fello AI est un chatbot d'IA pour Mac, iPhone et iPad qui vous permet d'utiliser tous les meilleurs modèles d'IA comme ChatGPT, Claude, Gemini, Grok et DeepSeek dans une seule app, avec des modèles mis à jour régulièrement pour que vous ayez toujours les plus récents. Il coûte 9,99 $/mois avec une note de 4,7 étoiles sur plus de 27 000 avis.
À quelle fréquence mettez-vous cette page à jour ?
Nous mettons cette page à jour au moins une fois par mois et dans les 24-48 heures suivant le lancement de tout modèle majeur.
Articles liés
Claude vs ChatGPT : quelle IA est vraiment meilleure en 2026 ?

Claude a atteint le #1 de l'App Store début 2026, délogeant ChatGPT de la première place pour la première fois. Le déclencheur a été le refus public d'Anthropic de céder à l'exigence du Pentagone de déployer ses modèles pour des armes autonomes.

Lire la suite →
Grok vs ChatGPT : quel chatbot d'IA est vraiment meilleur en 2026 ?

Les deux chatbots continuent d'avancer. ChatGPT tourne sous GPT-5.6 (paliers Sol, Terra, Luna) et le modèle phare de SpaceXAI est désormais Grok 4.7, la version du 21 septembre qui obtient 46,3 sur l'Intelligence Index à 2 $ / 6 $, même si l'application Grok sert toujours la 4.6.

Lire la suite →
ChatGPT vs Gemini en 2026 : quelle IA devriez-vous vraiment utiliser ?

ChatGPT est passé à GPT-5.6 comme modèle phare, tandis que Gemini 3.1 Pro reste le modèle phare payant de Google. Face-à-face sur l'écriture, la programmation, les images et le prix.

Lire la suite →
Quelle IA utiliser : choisir le bon modèle

Aucune IA n'est la meilleure partout. Associez chaque tâche au modèle qui la domine, avec un tableau pour le code, l'écriture, la recherche et le chat quotidien.

Lire la suite →
Meilleurs agents IA en 2026 : 30 outils testés

Trente agents IA comparés selon ce que vous voulez faire : code, recherche, travail de bureau et automatisation, avec les tarifs et les options gratuites.

Lire la suite →
Gemini Nano Banana Pro vs GPT-Image-1.5 : comparatif ultime

Notre comparatif sur le terrain original de décembre 2025 des deux principaux modèles de génération d'images, avec de vrais échantillons de sortie côte à côte.

Lire la suite →

Essayez tous les modèles.
Une seule appli superbe.

Tous les modèles de ce guide dans une seule app native : ChatGPT, Claude, Gemini, Grok et DeepSeek. Gratuit pour démarrer.

Fello AI fonctionnant sur Mac, iPad et iPhone

Note de 4,7·plus de 27 000 avis·Gratuit pour démarrer