Meilleurs modèles d'IA en 2026
Classements, comparatifs et analyses approfondies, mis à jour chaque mois à mesure que de nouveaux modèles arrivent.
Anthropic a publié Claude Opus 5.5 le 22 septembre, et il prend la couronne de la programmation. Artificial Analysis le mesure à 57,6 sur l'Intelligence Index v4.3.2, le meilleur score qu'elle ait jamais publié et 4,3 points devant Claude Fable 5.1, et il emporte au passage GDPval-AA v2.1, AA-Briefcase v1.1 et Humanity's Last Exam. Il le fait à 4 $ / 20 $ par million de tokens, sous Claude Opus 5 à 5 $ / 25 $ : le meilleur modèle est désormais aussi le moins cher.
GPT-6 Astra conserve les deux classements de programmation d'Arena, faute de votes pour Opus 5.5, et Claude Fable 5.1 conserve l'écriture et la précision sur les classements qui décident ces catégories. Cette page classe selon les scores mesurés : une couronne change donc de mains dès qu'un modèle dépasse le tenant, sans attendre les classements fondés sur les votes. Notre guide des benchmarks d'IA explique comment cet indice est construit et pourquoi son numéro de version compte.
SpaceXAI a publié Grok 4.7 le 21 septembre sur un modèle de base nouveau et plus grand, et il passe devant Astra sur les deux classements agentiques publiés par Artificial Analysis. L'Intelligence Index affiche 46,3 contre 44,3 pour Grok 4.6 et le prix par token ne bouge pas, 2 $ / 6 $, mais une tâche de l'indice coûte 2,73 $ contre 1,86 $, parce que la 4.7 émet environ deux fois plus de sortie. Il est lancé dans l'API, dans Cursor et dans Grok Build ; l'application Grok sert toujours la 4.6.
Le champ ouvert a lui aussi un nouveau leader : le MiMo-V2.6-Pro de Xiaomi, publié le 21 septembre sous licence MIT simple, obtient 46,3 et traite une tâche de l'indice pour 0,13 $, le moins cher de cette page. Vous trouverez ci-dessous les gagnants par catégorie pour septembre 2026. Cliquez sur une carte pour aller directement à l'analyse complète, ou utilisez la navigation fixe pour passer d'une catégorie à l'autre. Classements, benchmarks et tarifs sont mis à jour dans les 48 heures suivant tout lancement majeur.
Vous voulez les meilleurs modèles d'IA sans jongler avec des abonnements séparés ? Fello AI réunit les modèles de pointe dans une seule app native pour Mac, iPhone et iPad.
Télécharger Fello AI22 sept. Anthropic Claude Opus 5.5 prend l'Intelligence Index à 57,6 et passe sous le prix d'Opus 5 Nouveau
21 sept. SpaceXAI Grok 4.7 arrive sur un modèle de base plus grand à 2 $ / 6 $ inchangés et coûte 47 % de plus par tâche Nouveau
21 sept. Xiaomi Le MiMo-V2.6-Pro de Xiaomi est le modèle ouvert le mieux noté jamais mesuré, à 0,13 $ par tâche sous licence MIT Nouveau
15 sept. TypeSafe TypeSafe sort de la furtivité avec Jev, un modèle qui renvoie des décisions typées au lieu de texte, à 0,042 $ par 1M de tokens Nouveau
10 sept. DeepSeek DeepSeek retire V4-Flash, le remplace par V4.1-Flash et baisse le tarif Flash d'environ un tiers Nouveau
3 sept. OpenAI GPT-6 Astra sort à 10 $ / 50 $ et, en un jour, il est sur Plus et Pro et domine les classements de programmation Nouveau
2 sept. Alibaba Qwen3.8-Max-0902 prend à Claude Opus 5 le classement WebDev d'Arena de trois points, à 2 $ / 6 $ Nouveau
2 sept. Muse Spark 1.3, Intelligence Index de 57 à 61 à un tarif inchangé de 1,25 $ / 4,25 $, gagne en programmation et perd toutes les lignes agent Nouveau
2 sept. Google Gemini 3.8 Flash, trois points de plus sur l'Intelligence Index au même tarif de 0,75 $ / 3,75 $ Nouveau
1er sept. Anthropic Claude Fable 5.1 et Mythos 5.1, un nouveau #1 sur Artificial Analysis à 66 et une baisse de 75 % sur les lectures de cache Nouveau
28 août Z.ai Les poids de GLM 5.3 sont sortis après la pause de sécurité, mais la licence n'est pas MIT Nouveau
28 août Tencent Tencent Hy4 Preview, 770B de poids ouverts sous Apache 2.0 et le plus grand modèle permissif à ce jour Nouveau
26 août Z.ai GLM 5.3 Flash, Ox Alpha démasqué, et les premiers poids MIT publiés par Z.ai depuis GLM-5.2 Nouveau
26 août Alibaba Qwen3.8-Flash-Next, poids ouverts et premier aperçu public de l'architecture Qwen4 Nouveau
21 août OpenAI GPT-5.6 Sol baisse de plus de 20 % et passe sous Claude Opus 5 des deux côtés Nouveau
16 août DeepSeek DeepSeek multiplie ses tarifs d'API par environ quatre et scinde sa grille en heures de pointe et heures creuses Nouveau
14 août Z.ai GLM 5.3, un grand bond agentique par le seul post-entraînement, sorti sans les open weights Nouveau
13 août Google Gemini 3.7 Flash, les scores de programmation bondissent et le prix est divisé par deux à 0,75 $ / 3,75 $, jusqu'en janvier Nouveau
12 août SpaceXAI Grok 4.6, le post-entraînement fait passer l'Intelligence Index de 56 à 61 à 2 $ / 6 $ inchangés Nouveau
5 août Muse Spark 1.2 et Muse Code, Intelligence Index de 51 à 57 à un tarif inchangé de 1,25 $ / 4,25 $, plus un agent de programmation en terminal Nouveau
3 août Alibaba Qwen 3.8 (Qwen3.8-Max), modèle phare multimodal de 2,4 billions de paramètres désormais disponible pour tous à 2 $ / 6 $ Nouveau
En attente Google Gemini 3.5 Pro, toujours pas sorti, des mois de retard selon Bloomberg Retardé
Meilleure IA pour l'écriture
La meilleure IA pour écrire est Claude Fable 5.1, et l'argument en sa faveur est la régularité, pas une première place isolée. C'est le seul modèle présent dans les six premiers des trois classements de prose : deuxième sur EQ-Bench Creative Writing v3 à 2152,7, deuxième sur LiveBench Language à 89,5 et sixième sur le classement d'écriture créative d'Arena. Aucun autre n'y parvient. GPT-6 Astra domine EQ-Bench à 2163,9 mais occupe la 25e place en écriture créative sur Arena ; Claude Fable 5 domine les classements texte et écriture créative d'Arena et arrive en tête de LiveBench Language à 90,7, mais est retombé huitième sur EQ-Bench. Claude Opus 5.5, qui a pris à Fable 5.1 l'Intelligence Index et Humanity's Last Exam le 22 septembre, n'est évalué ni sur EQ-Bench ni sur Arena et se classe huitième sur LiveBench Language : il n'a donc encore aucun argument sur les classements d'écriture, et la couronne ne lui revient pas. Si votre écriture est un livrable professionnel plutôt que de la prose, c'est une autre question, et le classement des livrables professionnels GDPval-AA v2.1 est mené par Claude Opus 5.5 à 1846 devant Claude Fable 5.1 à 1735 et Claude Opus 5 à 1708. Claude Sonnet 5 reste le meilleur rapport dans l'offre gratuite et Claude Fable 5 le choix si vous pesez les votes humains d'Arena plus que les scores de harness ; Fable 5 coûte 10 $ / 50 $ par million de tokens et est inclus en permanence dans Claude Max et Team Premium, à environ 50 % des limites d'usage habituelles. La traduction est une question distincte avec un gagnant distinct, que nous traitons dans notre guide de la meilleure IA pour traduire.
| Modèle | Idéal pour | Force | Faiblesse | Prix (par 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5.1 | Meilleure écriture globale | #2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) et #6 écriture créative Arena, le meilleur classement combiné de tous | N'en domine aucun des trois ; Claude Opus 5.5 a pris l'Intelligence Index et Humanity's Last Exam le 22 septembre | 10 $ / 50 $ |
| Claude Fable 5 | En tête des classements de votes humains d'Arena | #1 Arena texte global (1505,7), #1 LiveBench Language (90.7), #8 EQ-Bench | L'option la plus chère ici | 10 $ / 50 $ |
| Kimi K3 | Fiction créative et voix | #4 EQ-Bench Creative Writing (2070.6) | Seulement #27 sur Arena écriture créative | 3 $ / 15 $ |
| Claude Sonnet 5 | Écriture gratuite au quotidien | Gratuit et par défaut sur claude.ai, contexte 1M | #53 Arena écriture créative ; 75,0 LiveBench Language | 2 $ / 10 $, désormais permanent |
| Claude Opus 5 | Livrables professionnels au meilleur prix | #2 GDPval-AA v2.1 à 1708, devant Fable 5 (1632) | Derrière Fable 5 sur Arena texte, derrière Fable 5.1 sur GDPval-AA v2.1 | 5 $ / 25 $ |
| GPT-5.5 | Écriture professionnelle ancrée dans les faits | Gains documentés de fiabilité factuelle sur GPT-5.4 | Les paliers de raisonnement sont désormais marqués obsolètes | 5 $ / 30 $ |
| Gemini 3.8 Flash | Brouillons en masse à grande échelle | Intelligence Index 40,9, 308,4 tok/s en sortie, contexte 1M | Réglé pour les agents plutôt que la prose ; le tarif introductif double le 1er janvier 2027 | 0,75 $ / 3,75 $ |
La couronne de l'écriture reste à Claude Fable 5.1, mais son fondement a changé. Claude Opus 5.5 lui a pris l'Intelligence Index et Humanity's Last Exam le 22 septembre, c'est-à-dire exactement ce que citait cette carte, nous avons donc réancré ce choix sur les classements qui mesurent vraiment la prose. Sur ceux-là, Fable 5.1 est le seul modèle dans les six premiers des trois : deuxième sur EQ-Bench Creative Writing, deuxième sur LiveBench Language et sixième sur le classement d'écriture créative d'Arena. Opus 5.5 n'est évalué sur aucun des deux premiers et se classe huitième sur le troisième, il n'a donc encore aucun argument en écriture. Arena a désormais évalué Fable 5.1, ce qui lève la réserve que nous portions le mois dernier selon laquelle les classements de préférence humaine ne s'étaient pas prononcés : il est cinquième au classement texte à 1498,5, où Claude Fable 5 mène toujours à 1505,7. GDPval-AA v2.1 a de nouveau été réancré et affiche maintenant 1846 pour Opus 5.5, 1735 pour Fable 5.1 et 1708 pour Opus 5, les chiffres de ce bloc sont donc nettement inférieurs à ceux d'août.
Meilleure IA pour le chat & l'assistant du quotidien
La meilleure IA pour le chat du quotidien est GPT-5.6, et la raison honnête tient à la portée plutôt qu'à la position dans les classements. C'est le modèle que ChatGPT sert par défaut à la plus grande base d'utilisateurs de la catégorie, ce qui en fait le meilleur assistant que la plupart des gens peuvent réellement ouvrir. En préférence humaine pure, ce n'est pas le leader : GPT-5.6 Sol se situe #18 sur le classement texte d'Arena à 1483,5, où Claude Fable 5 domine à 1505,7. La plupart des utilisateurs de ChatGPT reçoivent le palier équilibré Terra, qu'OpenAI dit égaler GPT-5.5 et qui, depuis la baisse de prix du 30 juillet 2026, coûte 60 % de moins. Il est disponible dans ChatGPT (gratuit avec limites, Plus à 20 $/mois, Pro à 100 $/mois), via l'API (Luna 0,20 $ / 1,20 $, Terra 2 $ / 12 $, Sol 4 $ / 20 $ par 1M de tokens), et intégré dans Fello AI aux côtés de Claude, Gemini, Grok et DeepSeek. Une réserve : la system card d'OpenAI et l'évaluateur METR ont signalé un comportement de « scheming » élevé chez Sol, donc GPT-5.5 Instant reste le choix le plus sûr pour un travail sensible aux hallucinations.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| GPT-5.6 | Chat du quotidien, par défaut de ChatGPT | L'assistant que la plupart peuvent ouvrir ; Terra égale GPT-5.5 à ~moitié coût | #14 sur Arena texte ; scheming signalé par METR | Gratuit / 20 $/mois Plus ; API 0,20 $ / 1,20 $ à 4 $ / 20 $ |
| Claude Fable 5 | La conversation la mieux notée | #1 sur Arena texte global (1505,7) et sur quatre de ses huit sous-catégories | Pas de version gratuite ; accès par crédits d'usage sur Pro | 10 $ / 50 $ API |
| Claude Opus 5 | Réponses réfléchies et nuancées | Troisième sur l'Intelligence Index d'Artificial Analysis (50,8), derrière Claude Fable 5.1 et GPT-6 Astra | #10 sur Arena texte, derrière Claude Fable 5 | 20 $/mois Pro, 5 $ / 25 $ API |
| GPT-5.5 Instant | Travail quotidien sensible aux hallucinations | 52,5 % d'affirmations hallucinées en moins vs 5.3 Instant | Les paliers de raisonnement sont désormais marqués obsolètes | 20 $/mois Plus ; API 5 $ / 30 $ |
| Gemini 3.6 Flash | Rapide, gratuit, multimodal | Toujours le modèle servi par le palier gratuit de Gemini, contexte 1M, #12 sur Arena texte | Plus faible sur le raisonnement le plus ardu ; 3.8 Flash le surclasse au même prix | Gratuit / 0,75 $ / 3,75 $ API |
| Fello AI | Tous les meilleurs modèles, une seule app | ChatGPT + Claude + Gemini + Grok + DeepSeek et plus sur Mac, iPhone et iPad | Acheminé via l'app, pas en direct | 9,99 $/mois |
GPT-5.6 conserve le choix du chat grâce à sa portée, et l'écart avec le leader des préférences s'est de nouveau creusé. Sol occupe désormais la 18e place du classement texte d'Arena à 1483,5, contre la 14e auparavant, tandis que Claude Fable 5 mène à 1505,7. Rien n'a changé dans le produit, la couronne ne bouge donc pas : il s'agit toujours de savoir quel assistant le plus de gens peuvent réellement ouvrir. Deux lancements qui seraient sinon des candidats ne le sont pas : GPT-6 Astra a atteint ChatGPT Business, Pro et Plus début septembre mais OpenAI n'a rien annoncé pour l'offre gratuite, et Claude Opus 5.5, qui a pris l'Intelligence Index le 22 septembre, est un modèle pour l'API et les formules Claude, pas un assistant par défaut pour un milliard de personnes.
Meilleure IA pour les images
La meilleure IA pour générer des images est ChatGPT Images 2.5, qu'OpenAI a mis par défaut sur toutes les formules ChatGPT le 8 septembre et qui domine désormais les quatre classements d'image que nous suivons. Ses deux modèles occupent les deux premières places sur chacun : GPT-Image-2.5 Sunburst, conçu pour la précision, mène Arena texte-vers-image à 1423,2 et Arena édition d'images à 1526,0, et mène aussi l'Elo de qualité d'Artificial Analysis à 1196,8 et son classement d'édition à 1221,3, le plus rapide GPT-Image-2.5 Flare étant deuxième sur les quatre. C'est un changement par rapport au mois dernier, quand Artificial Analysis n'avait évalué ni l'un ni l'autre et que ses classements contredisaient ceux d'Arena. Lisez tout de même l'écart entre Sunburst et Flare comme provisoire, car ces places sur Arena reposent sur quelques milliers de votes chacune contre 83 000 et 259 000 pour GPT Image 2, et sur le texte-vers-image les deux partagent une même bande de rang. Le deuxième est MAI-Image-2.6, troisième au classement d'édition d'Artificial Analysis à 1191,6 et quatrième au texte-vers-image d'Arena à 1334,0, avec Muse Image de Meta en troisième. Reve 2.1 garde son argument de mise en page, de typographie et de 4K natif mais a quitté le podium : il est sixième sur Arena texte-vers-image et quatorzième sur Arena édition d'images. Notre analyse complète de ce qui est sorti se trouve dans ChatGPT Images 2.5.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| ChatGPT Images 2.5 | Images avec texte lisible | #1 et #2 sur les quatre classements : Arena texte-vers-image (1423,2 / 1401,3), Arena édition (1526,0 / 1481,8), qualité Artificial Analysis (1196,8 / 1190,4) et édition (1221,3 / 1207,0) | Les places sur Arena reposent sur quelques milliers de votes | Par défaut sur toutes les formules ChatGPT |
| MAI-Image-2.6 | Retoucher une image existante | #3 en édition d'images chez Artificial Analysis (1191,6) et #4 sur Arena texte-vers-image (1334,0) | Aperçu public, pas encore dans Copilot ni Bing ; a cédé la tête de l'édition chez Artificial Analysis à ChatGPT Images 2.5 | MAI Playground / Microsoft Foundry |
| Muse Image | Édition d'images, écosystème Meta | #5 en édition d'images chez Artificial Analysis (1171,3) et #7 à son Elo de qualité | Nouveau, outillage encore mince autour | Application Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Portraits et produits photoréalistes | #4 en texte vers image Artificial Analysis, devant Nano Banana Pro sur celui d'Arena | En édition d'images Arena, Nano Banana Pro passe devant | Application Gemini / AI Studio |
| Seedream 5.0 Pro | Texte multilingue + édition par régions | 10+ langues dont l'arabe RTL, édition au lasso et par calques | Autour de la dixième place sur les classements indépendants ; incertitude sur les droits d'auteur | BytePlus / Magnific |
| Midjourney v8 | Art stylisé, illustration | Base esthétique que la plupart des artistes préfèrent | Plus faible sur le texte dans l'image | 10-120 $/mois |
| Grok Imagine | NSFW / mode Spicy | Les garde-fous les plus permissifs ; Arena classe son modèle Image 2.0 #5 en texte-vers-image et #4 en édition d'images, et Artificial Analysis le place désormais #4 à l'Elo de qualité | Rien dans l'historique des sorties ne montre qu'Image 2.0 soit sorti comme produit | 30 $ par mois SuperGrok |
ChatGPT Images 2.5 conserve la couronne de l'image et son argument s'est renforcé. Le mois dernier, Artificial Analysis n'avait évalué aucun de ses deux modèles d'API, si bien que les classements que nous suivons se contredisaient : Arena plaçait Sunburst et Flare aux deux premières places tandis qu'Artificial Analysis gardait GPT Image 2 en tête du texte-vers-image et MAI-Image-2.6 de Microsoft en tête de l'édition. Artificial Analysis a désormais évalué les deux, et ils y prennent aussi les deux premières places, 1196,8 et 1190,4 à l'Elo de qualité et 1221,3 et 1207,0 en édition d'images. Cela en fait #1 et #2 sur les quatre classements. MAI-Image-2.6 reste deuxième mais recule à la troisième place du classement d'édition qu'il menait, et Grok Imagine Image 2.0 est maintenant quatrième à l'Elo de qualité d'Artificial Analysis et quatrième au classement d'édition d'Arena, une meilleure place que la troisième marche du podium ; nous continuons de le rapporter plutôt que de le couronner, car rien dans l'historique des sorties ne montre qu'il soit sorti comme produit.
Meilleure IA pour la vidéo
La meilleure IA pour générer de la vidéo est Gemini Omni 1.1 Flash, que Google a publié le 27 août et qui domine le classement texte-vers-vidéo d'Arena à 1516, juste devant son propre prédécesseur Gemini Omni Flash à 1513. Lisez cela comme une égalité : les deux se situent dans les intervalles de confiance l'un de l'autre et Arena elle-même attribue à 1.1 Flash une bande de rang de un à quatre. Ce qui tranche, c'est la fiche technique, où 1.1 Flash est nettement le modèle le plus capable : extension de scène par tranches de 10 secondes jusqu'à 40 secondes cumulées, contrôle de la première et de la dernière image, références vidéo, brouillons en 360p et sortie en 1080p ou 4K, à environ 0,03 $ la seconde en 360p, 0,10 $ en 720p, 0,15 $ en 1080p et 0,30 $ en 4K. Gemini Omni Flash reste l'option la moins chère, autour de 0,10 $ la seconde, mais plafonne à des clips de 10 secondes. Deux limites à connaître. Artificial Analysis n'a pas du tout évalué 1.1 Flash ; sur son classement texte-vers-vidéo, c'est l'ancien Omni Flash qui mène à 1512,8 devant le Wan 3.0 d'Alibaba à 1431,4 et MiniMax H3 à 1407,7. Et sur le classement image-vers-vidéo d'Arena, 1.1 Flash est deuxième à 1488,5 derrière MiniMax H3 à 1495,4 : la couronne repose donc sur le texte-vers-vidéo et sur la fiche technique, pas sur une razzia. S'il vous faut des plans plus longs dans l'outillage de Google, Veo 3.1 tourne toujours dans l'application Gemini, dans AI Studio et dans Vertex AI avec audio natif et sortie 1080p. MiniMax H3 (31 juillet) reste le concurrent sur la fiche technique, avec des clips 2K de 4 à 15 secondes et un son stéréo natif à partir de 0,13 $ la seconde.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash | Meilleure vidéo IA globale | #1 Arena texte-vers-vidéo (1516) ; extension de scène à 40 secondes, sortie 4K | Non évalué par Artificial Analysis ; deuxième derrière MiniMax H3 sur Arena image-vers-vidéo | 0,03-0,30 $/s ; Gemini API / AI Studio / Flow |
| Gemini Omni Flash | Clips de dix secondes moins chers | #2 Arena texte-vers-vidéo (1511), #2 vidéo AA (1238) ; édition conversationnelle | Plafonne à des générations de dix secondes | ~0,10 $/s ; app Gemini / AI Studio |
| Wan 3.0 | Vidéo à partir de documents et de diapositives | #1 sur le classement vidéo d'Artificial Analysis (1239) ; 2-30 s, jusqu'à 1080p, entrée Omni-Reference | API uniquement, aucun poids publié ; #3 sur Arena | 0,05-0,20 $/s |
| MiniMax H3 | Clips 2K avec audio natif | 4-15 s en 2K, son stéréo natif ; #8 Arena texte-vers-vidéo (1462) | #4 sur la vidéo AA (1227) ; les poids ouverts excluent l'upscaler 2K et exigent une demande aux États-Unis, dans l'UE, au Royaume-Uni et en Corée du Sud | 0,13 $/s en 2K |
| Dreamina Seedance 2.5 | Concurrent de ByteDance | #6 Arena texte-vers-vidéo (1482) ; mène l'image-vers-vidéo avec audio | Écosystème ByteDance, accès occidental limité | Dreamina / BytePlus |
| Muse Video | Vidéo dans l'écosystème Meta | #3 texte vers vidéo à 1459 | Le plus récent du groupe, outillage limité | Application Meta AI |
| Veo 3.1 | Clips de production plus longs | Audio natif, 1080p, forte cohérence physique | #6 sur Arena vidéo, pas le leader en qualité | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Itération rapide à moindre coût | 4K natif, 60fps, clips de 15 secondes ; Turbo sorti le 17 juin | Hors du top 16 sur Arena texte vers vidéo | À partir de 10 $/mois |
| Luma Ray 3 | Scènes photoréalistes | Fort réalisme pour les paysages | Communauté plus petite | Gratuit / à partir de 9,99 $/mois |
Gemini Omni 1.1 Flash conserve la couronne de la vidéo, mais le tableau autour est plus embrouillé que ne le laissait entendre l'entrée du mois dernier. Il domine toujours le classement texte-vers-vidéo d'Arena, 1516 contre 1513 pour Gemini Omni Flash, et Arena lui donne une bande de rang de un à quatre : cela reste une égalité tranchée par la fiche technique. Deux choses rapportées en août ont changé. Artificial Analysis a réancré son Elo vidéo et l'ancien trio 1239 / 1238 / 1235 n'existe plus : Gemini Omni Flash mène désormais ce classement à 1512,8 devant Wan 3.0 à 1431,4 et MiniMax H3 à 1407,7, et 1.1 Flash n'y est toujours pas évalué du tout. Et MiniMax H3 a pris la tête du classement image-vers-vidéo d'Arena à 1495,4, repoussant 1.1 Flash au deuxième rang à 1488,5, le premier classement que cette couronne ait perdu.
Meilleure IA pour la programmation
La meilleure IA pour programmer est Claude Opus 5.5, qu'Anthropic a publié le 22 septembre et qui domine tous les harnesses de programmation que nous suivons : la campagne Terminal-Bench 4.0 d'Artificial Analysis à 59,6 % contre 59,1 % pour GPT-6 Astra, LiveBench Coding à 89,3 contre 80,4 et LiveBench Agentic Coding à 71,7 contre 57,3. Il le fait à 4 $ / 20 $ par million de tokens, moins de la moitié du tarif public des deux modèles qui dominaient ce tableau le mois dernier, avec des lectures de cache à 0,20 $, et selon les tests d'Anthropic elle-même une charge de travail typique coûte 40 % de moins que sur Claude Opus 5. La campagne interne de Terminal-Bench 4.0 d'Anthropic creuse encore l'écart, 66,4 % contre les 57,9 % qu'OpenAI rapporte pour Astra, avec 54,4 % sur FrontierCode v1.1 et 57,8 % sur CursorBench 4.0. GPT-6 Astra conserve les deux classements de programmation d'Arena, WebDev à 1800 et image-vers-WebDev à 1733, car Opus 5.5 n'a encore aucun vote sur Arena, et c'est le partage honnête ici : OpenAI domine la préférence humaine, Anthropic chaque harness mesuré. Lisez avec prudence ce demi-point d'avance sur Terminal-Bench, car Anthropic annonce elle-même une erreur type d'environ 2,6 points sur ce benchmark : traitez-les donc comme à égalité et laissez les classements LiveBench et le prix trancher. Claude Fable 5.1 est deuxième sur les deux classements d'Arena et troisième sur les harnesses. Le Qwen3.8-Max-0902 d'Alibaba a tenu le classement WebDev d'Arena environ trois jours début septembre et se retrouve quatrième à 1681. Du côté des poids ouverts, le tableau a changé le 21 septembre : le MiMo-V2.6-Pro de Xiaomi prend 34,8 % sur Terminal-Bench 4.0 sous licence MIT simple à 0,13 $ par tâche de l'indice, tandis que GLM-5.3 reste le modèle ouvert le plus fort sur ce harness à 41,9 % et que Kimi K3 demeure le modèle ouvert le mieux classé sur Arena WebDev, cinquième à 1674, avec seulement 12,6 % sur le harness. Artificial Analysis a retiré son Coding Index et son Coding Agent Index, les deux classements composites de programmation que cette page citait n'existent donc plus.
| Modèle | Idéal pour | Force | Faiblesse | Prix (par 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5.5 | Meilleure programmation globale | #1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) et #1 LiveBench Coding (89,3) | Aucun vote sur Arena pour le moment, Astra garde donc ses deux classements de programmation | 4 $ / 20 $ |
| GPT-6 Astra | Sommet des deux classements de programmation d'Arena | #1 Arena WebDev (1800) et #1 image-vers-WebDev (1733) ; 59,1 % Terminal-Bench 4.0 | 2,5 fois le prix d'Opus 5.5 et derrière lui sur chaque harness | 10 $ / 50 $ |
| Claude Fable 5.1 | Meilleur score composite avant Opus 5.5 | #2 sur les deux classements de programmation d'Arena ; Intelligence Index 53,4 ; AA-Briefcase 1678 | 52,0 % Terminal-Bench 4.0 ; 2,5 fois le prix d'Opus 5.5 | 10 $ / 50 $ |
| Claude Opus 5 | Remplacé par Opus 5.5 | 49,0 % Terminal-Bench 4.0 et #3 sur les deux classements de programmation d'Arena | Coûte plus cher par token qu'Opus 5.5 et marque sept points de moins | 5 $ / 25 $ |
| Claude Fable 5 | Travail agentique le plus long et le plus dur | Intelligence Index 49,6 ; 42,4 % Terminal-Bench 4.0 ; contexte 1M | Le plus cher par tâche de ce tableau à 8,75 $ ; #6 sur Arena image-vers-WebDev | 10 $ / 50 $ |
| Qwen3.8-Max-0902 | Détenteur éphémère du classement WebDev | #4 Code Arena : WebDev (1681) ; Intelligence Index 45,4 ; 2,4 billions de paramètres, contexte 1M | API QwenCloud uniquement, sans interface grand public ; a perdu la tête de WebDev en quelques jours | 2 $ / 6 $ |
| Kimi K3 | Modèle ouvert le mieux classé sur Arena | #5 Arena WebDev (1674), la meilleure place ouverte sur ce classement ; 2,8 billions/104 Md actifs | Seulement 12,6 % sur Terminal-Bench 4.0 ; 1,56 To à héberger | 3 $ / 15 $ |
| GPT-5.6 Sol | Le vaisseau amiral bon marché d'OpenAI | Intelligence Index 47,0 ; 39,9 % Terminal-Bench 4.0 | Loin derrière Astra sur chaque classement de programmation ; manipulation des évaluations signalée par METR | 4 $ / 20 $ |
| Muse Spark 1.3 | Programmation agentique bon marché | Intelligence Index 48,1 à 1,25 $ / 4,25 $ et 1,60 $ par tâche | 33,3 % sur Terminal-Bench 4.0 ; les victoires en programmation viennent du graphique de Meta, mesuré sur une variante max réservée aux partenaires | 1,25 $ / 4,25 $ |
| Grok 4.7 | Codeur économique | 46,3 % CursorBench 4.0 et 71,0 % DeepSWE v1.1 selon les chiffres de SpaceXAI ; Intelligence Index 46,3 | 24,7 % sur Terminal-Bench 4.0 ; les prompts de 200K tokens et plus refacturent toute la requête au double | 2 $ / 6 $ |
| Gemini 3.8 Flash | Programmation agentique à grande échelle | Intelligence Index 40,9 ; 308,4 tokens de sortie par seconde | 19,7 % sur Terminal-Bench 4.0 ; le tarif de lancement double le 1er janvier 2027 | 0,75 $ / 3,75 $ |
| GLM 5.3 Flash | Le codeur sérieux le moins cher à héberger | 32,8 % Terminal-Bench 4.0 à 0,25 $ par tâche ; MIT, 320 Md/18 Md actifs | GLM-5.3 atteint 41,9 % sur le même harness ; aucun produit grand public | Poids ouverts (MIT) |
| MiMo-V2.6-Pro | Le plus haut Intelligence Index ouvert | 46,3 sur v4.3.2 et 34,8 % Terminal-Bench 4.0 à 0,13 $ par tâche ; MIT, 1,02 billion/42 Md actifs | Publié le 21 septembre, donc aucun vote sur Arena ni historique indépendant | 0,435 $ / 0,87 $ |
La couronne de la programmation est passée à Claude Opus 5.5, quatre jours après être passée à GPT-6 Astra. Anthropic l'a publié le 22 septembre et il domine chaque harness de programmation que nous suivons : 59,6 % contre 59,1 % pour Astra sur la campagne Terminal-Bench 4.0 d'Artificial Analysis, 89,3 contre 80,4 sur LiveBench Coding et 71,7 contre 57,3 sur LiveBench Agentic Coding, à 4 $ / 20 $ contre 10 $ / 50 $. Astra conserve les deux classements de programmation d'Arena parce qu'Opus 5.5 n'y a pas encore de votes, c'est donc un partage et non une razzia. L'écart sur Terminal-Bench est d'un demi-point face à une erreur type qu'Anthropic situe autour de 2,6 : ce sont donc les classements LiveBench et le prix qui tranchent réellement. Claude Opus 5 quitte le podium : Opus 5.5 coûte moins par token, en consomme moins et marque sept points de plus sur l'Intelligence Index, ce qui rend l'ancien argument tarifaire d'Opus 5 non pas plus faible mais caduc. Le MiMo-V2.6-Pro de Xiaomi et le Grok 4.7 de SpaceXAI entrent tous deux au tableau, et tous les chiffres d'indice de cette page sont passés en v4.3.2, d'où des valeurs légèrement inférieures à celles du mois dernier.
Meilleure IA pour la créativité
La meilleure IA pour un travail créatif non filtré et dans l'air du temps est Grok 4.7, et nous voulons être précis sur les raisons. Ce choix porte sur la gamme de produits, pas sur la qualité de la prose. Grok porte le moins de restrictions de contenu de tous les modèles de pointe et la seule intégration native de X en temps réel, ce qui en fait le seul modèle à accepter les briefs audacieux, d'actualité ou délibérément provocateurs que les autres refusent. Lisez la disponibilité avec attention : SpaceXAI a publié Grok 4.7 le 21 septembre pour l'API Grok, Cursor, Grok Build, des harnesses tiers et des routeurs cloud, et son annonce ne dit rien de l'application grand public, qui sert toujours Grok 4.6 aux abonnés SuperGrok et X Premium+ à 30 $ par mois. Ce n'est pas le meilleur rédacteur. Arena a désormais évalué Grok 4.6, qui occupe la 32e place du classement d'écriture créative, devant Grok 4.5 en 36e mais derrière l'ancien Grok 4.20-beta1 en 23e. EQ-Bench n'a évalué ni 4.6 ni 4.7, et sur ce classement Grok 4.5 est 46e à 1576,0, soit désormais juste devant Grok 4.20-beta plutôt que derrière. Comme SpaceXAI a orienté ces deux versions vers la programmation et le travail agentique plutôt que vers la prose, nous ne supposons pas que 4.7 ait changé quoi que ce soit ici. Si vous choisissez sur la seule qualité de sortie, Claude Fable 5 domine toujours le classement d'écriture créative d'Arena, tandis qu'EQ-Bench place GPT-6 Astra premier à 2163,9, Claude Fable 5.1 deuxième et Kimi K3 quatrième. Choisissez Grok pour ce qu'il vous laissera faire, pas pour la qualité de son écriture.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| Grok 4.7 | Non filtré, tranché, dans l'air du temps | Le moins de restrictions de contenu, ancrage natif sur X en temps réel | Aucun classement d'écriture créative ne l'a évalué ; Grok 4.6 est #32 en écriture créative sur Arena | 2 $ / 6 $ API ; application SuperGrok à 30 $ par mois, toujours en 4.6 |
| Claude Fable 5 | Prose créative de la plus haute qualité | #1 Arena écriture créative, #1 LiveBench Language | Garde-fous prudents sur les briefs audacieux | 10 $ / 50 $ API |
| Kimi K3 | Fiction et voix singulière | #4 EQ-Bench Creative Writing à 2070,6 | Seulement #27 en écriture créative sur Arena | 3 $ / 15 $ |
| Claude Opus 5 | Créativité structurée de format long | Tient de longs fils et s'auto-édite ; Intelligence Index 50,8, derrière Claude Fable 5.1 et GPT-6 Astra | Le plus prudent du groupe | 20 $/mois Pro ; 5 $ / 25 $ API |
| Gemini 3.1 Pro | Créatif multimodal | Chaîne texte, image et vidéo solide | Quotas dans l'application Gemini | Gratuit / 2,00-4,00 $ API entrée |
| Grok Imagine (Spicy Mode) | NSFW / créatif pour adultes | La génération d'images la plus permissive | Cas d'usage de niche | 30 $/mois SuperGrok |
Grok conserve ce choix, désormais avec Grok 4.7, que SpaceXAI a publié le 21 septembre sur un modèle de base nouveau et plus grand. Rien n'a changé dans la permissivité du produit ni dans son accès en direct à X, et c'est là-dessus que repose le choix. Le modèle sous-jacent est de nouveau plus fort, 46,3 sur l'Intelligence Index contre 44,3 pour Grok 4.6, mais ce gain a atterri dans la programmation et le travail agentique plutôt que dans la prose, et aucun classement d'écriture créative n'a évalué la 4.7. Une correction par rapport à l'entrée du mois dernier : Arena a depuis évalué Grok 4.6, qui occupe la 32e place de son classement d'écriture créative, la phrase selon laquelle aucun des deux classements ne l'avait évalué ne tient donc plus. Notez aussi la disponibilité partagée, car elle compte pour cette catégorie : la 4.7 est dans l'API, dans Cursor et dans Grok Build, tandis que l'application Grok à 30 $ par mois, dont relève réellement l'argument de permissivité, sert toujours la 4.6. Claude Fable 5 reste le modèle à utiliser quand on veut la meilleure écriture.
Meilleure IA pour la précision & la recherche
La meilleure IA pour la précision et la recherche est Claude Fable 5.1, qui détient la meilleure précision factuelle mesurée par Artificial Analysis, 67 % sur AA-Omniscience. C'est exactement la colonne qui décide cette catégorie, et elle a survécu à un test sévère le 22 septembre : Claude Opus 5.5 a battu Fable 5.1 sur presque tout le reste, y compris Humanity's Last Exam à 61,4 % contre 59,1 % et l'indice AA-Omniscience pénalisé par les hallucinations à 46,4 contre 43,5, mais sur la précision factuelle brute il affiche 66 % contre 67 % pour Fable 5.1. Traitez cet écart d'un point comme une égalité et lisez les deux ensemble : Opus 5.5 est le meilleur pari quand une mauvaise réponse est pire que pas de réponse, Fable 5.1 quand vous voulez le plus de faits justes. Le choix économique est Gemini 3.1 Pro, et c'est toujours ce vers quoi nous irions quand le coût compte. Son meilleur résultat est sur ARC-AGI-1 d'ARC Prize, où il obtient 98 % et égale le panel humain, à 0,52 $ par tâche, même si Claude Fable 5 et GPT-6 Astra ont depuis dépassé le panel à 98,5 %. Il y ajoute un ancrage natif sur Google Search, ce qu'il faut quand la réponse doit être à jour et pas seulement plausible. Il obtient aussi 94,1 % sur GPQA Diamond, où GPT-5.6 Sol l'égale désormais au lieu d'être derrière, et 44,4 % sur Humanity's Last Exam, ainsi que 46,44 sur le classement HLE de Scale SEAL, que Claude Fable 5 mène maintenant à 55,5 %. Deux réserves honnêtes. Sur la recherche ancrée précisément, le classement recherche d'Arena est mené par OpenAI et non par Google ou Anthropic : GPT-5.6 Sol est en tête à 1257, Claude Fable 5 cinquième et Gemini 3.1 Pro avec ancrage neuvième. Et sur le raisonnement inédit la couronne est tout ailleurs, GPT-6 Astra menant à la fois ARC-AGI-2 et ARC-AGI-3. Nous n'avons pas donné cette couronne à Claude Opus 5 parce qu'Artificial Analysis mesure son taux d'hallucination à 50 % et le place nettement sous les deux modèles Fable sur AA-Omniscience.
| Modèle | Idéal pour | Benchmark clé | Faiblesse | Prix |
|---|---|---|---|---|
| Claude Fable 5.1 | Meilleure précision factuelle mesurée | 67 % de précision factuelle sur AA-Omniscience, la meilleure mesurée par Artificial Analysis, un point devant Claude Opus 5.5 | Pas d'offre bon marché ; non évalué sur le classement recherche d'Arena ; Opus 5.5 mène Humanity's Last Exam et l'indice AA-Omniscience | 10 $ / 50 $ |
| Gemini 3.1 Pro | Meilleur rapport, travail factuel bon marché | 98 % ARC-AGI-1 (égale le panel humain) à 0,52 $/tâche, 94,1 % GPQA (égalé par Sol) | ARC-AGI-2 77,1 % désormais ~14e ; #7 sur Arena recherche | 2,00-4,00 $ / 12,00-18,00 $ (échelonné) |
| Claude Fable 5 | Recherche ancrée | #5 sur le classement de recherche d'Arena, derrière GPT-5.6 Sol | Pas de palier bon marché unique | 10 $ / 50 $ (Fable 5) |
| GPT-5.6 Sol | Raisonnement inédit | #1 ARC-AGI-2 à 92,5 %, contre un panel humain à 100 % | Scheming signalé par METR | 4 $ / 20 $ |
| Claude Opus 5 | Les problèmes inédits les plus ardus | #1 ARC-AGI-3 à 30 %, ~3,75x le modèle suivant (ARC Prize) | Artificial Analysis mesure un taux d'hallucination de 50 % | 5 $ / 25 $ |
| Qwen 3.7 Max | Précision frontier à prix avantageux | 92,4 GPQA Diamond, 200 requêtes gratuites/jour | API uniquement, pas de front-end de chat | 1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste |
| Claude Opus 4.6 | Honnêteté sous pression | #1 sur le classement MASK de Scale SEAL à 96,28 ; Anthropic occupe le top 5 | Remplacé comme modèle phare | Modèle legacy d'Anthropic |
La couronne de la précision reste à Claude Fable 5.1, et elle a été mise à rude épreuve. Claude Opus 5.5 est arrivé le 22 septembre et a pris Humanity's Last Exam à 61,4 % contre 59,1 % ainsi que l'indice AA-Omniscience pénalisé par les hallucinations à 46,4 contre 43,5, mais cette catégorie se décide sur la colonne de précision factuelle brute, et là Fable 5.1 affiche toujours 67 % contre 66 % pour Opus 5.5. C'est un point d'écart, aussi ce bloc dit-il désormais franchement que les deux se partagent le terrain plutôt que de prétendre que Fable 5.1 rafle tout : prenez Opus 5.5 quand une mauvaise réponse est pire que pas de réponse, et Fable 5.1 quand vous voulez le plus de faits justes. Deux corrections aussi par rapport à l'entrée du mois dernier. Elle disait que GPT-5.6 Sol menait ARC-AGI-2 et que Claude Opus 5 menait ARC-AGI-3 ; GPT-6 Astra mène les deux depuis son lancement du 3 septembre, comme le disait déjà le bloc sur la résolution de problèmes, et cette contradiction a disparu. Et ARC-AGI-1 est passé devant le panel humain : Claude Fable 5 et GPT-6 Astra obtiennent tous deux 98,5 % là où le panel de 2025 fait 98 %, les 98 % de Gemini 3.1 Pro à 0,52 $ par tâche restent donc exacts et restent l'argument économique, mais ce n'est plus le sommet de ce classement.
Meilleure IA pour la résolution de problèmes
La meilleure IA pour la résolution de problèmes difficiles est GPT-6 Astra, qui a pris les classements de raisonnement à GPT-5.6 Sol quelques jours après son lancement. Elle mène LiveBench Reasoning à 92,65 et ARC-AGI-2 à 95 %, le meilleur score jamais atteint face au panel humain à 100 % de ce classement, et se place troisième sur LiveBench Mathematics à 96,81 derrière les 97,08 de Claude Opus 5.5 et les 97,01 de Claude Fable 5.1. Elle annonce aussi 97,6 % sur FrontierMath Tier 4 v2, un chiffre à lire avec la divulgation d'Epoch AI selon laquelle OpenAI a financé le benchmark et détient un accès exclusif à une partie de celui-ci. Le hic tient au prix et à la portée : 10 $ / 50 $ par 1M de tokens contre 4 $ / 20 $ pour Sol, et il faut un forfait ChatGPT payant. GPT-5.6 Sol est l'alternative économique, troisième sur les deux classements LiveBench à 96,20 et 91,65 et deuxième sur ARC-AGI-2. Qwen 3.7 Max est le choix budget pour les problèmes de type concours à 97,1 sur l'indice HMMT de février 2026 et 44,5 sur Apex, avec 200 requêtes gratuites par jour. Claude Opus 5 reste l'alternative pour les longues chaînes de raisonnement agentique, même si Astra lui a aussi pris ARC-AGI-3.
| Modèle | Idéal pour | Benchmark clé | Faiblesse | Prix |
|---|---|---|---|---|
| GPT-6 Astra | Mathématiques, sciences et raisonnement les plus durs | #1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3 | Exige un forfait ChatGPT payant ; 2,5 fois le prix de Sol | 10 $ / 50 $ |
| Claude Opus 5 | Longues chaînes de raisonnement agentique | #2 AA-Briefcase (1673) et #2 GDPval-AA v2.1 (1708) ; 30,2 % ARC-AGI-3 | Astra mène désormais ARC-AGI-3 ; 50 % de taux d'hallucination | 5 $ / 25 $ |
| GPT-5.6 Sol | Vaisseau amiral STEM abordable | #2 ARC-AGI-2 (92,5 %) ; #3 LiveBench Mathematics (96,20) et Reasoning (91,65) | FrontierMath toujours non publié ; comportement trompeur signalé par METR | 100 $/mois ChatGPT Pro ; API 4 $ / 20 $ |
| Qwen 3.7 Max | Mathématiques de compétition avec un budget serré | 97,1 HMMT 2026 févr., 44,5 Apex, 200 requêtes gratuites/jour | API uniquement | 1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste |
| Claude Fable 5 | Mathématiques au sein d'un flux de programmation | #1 sur la sous-catégorie mathématiques d'Arena (1543), 96,0 LiveBench Mathematics | L'option la plus chère ici | 10 $ / 50 $ |
| GLM 5.3 Flash | Résolution de problèmes open-weight | Intelligence Index 41,8 sous MIT, près de huit points au-dessus de GLM-5.2 pour moins de la moitié de la taille ; 320B/18B actifs, contexte 1M | Exige un serveur multi-GPU, pas une station de travail ; GLM 5.3 fait mieux selon les chiffres de Z.ai elle-même et est téléchargeable depuis le 28 août, mais pour plus du double de la taille et sous une licence maison | Open weights (MIT) |
La couronne de la résolution de problèmes est passée à GPT-6 Astra, qui a pris les classements sur lesquels cette catégorie se décide quelques jours après son lancement du 3 septembre. Il mène LiveBench Reasoning à 92,65 contre 91,65 pour GPT-5.6 Sol, prend ARC-AGI-2 à 95 % contre 92,5 % pour Sol, et a délogé Claude Opus 5 sur ARC-AGI-3, où ses 62,7 % sur le harness standard battent les 30,2 % d'Opus 5. Lisez les chiffres d'ARC-AGI-3 avec attention : ce classement mesure l'efficacité d'action au niveau humain dans des environnements inédits, pas les problèmes résolus, et les 98,6 % très cités viennent d'un harness à adaptateur fournisseur, pas du harness standard. Sol tombe à la troisième place sur les deux classements LiveBench mais reste l'alternative économique à 4 $ / 20 $ contre les 10 $ / 50 $ d'Astra, et LiveBench Mathematics a depuis changé de mains deux fois, vers Claude Fable 5.1 à 97,01 puis vers Claude Opus 5.5 à 97,08 le 22 septembre.
Meilleur agent d'IA
Le meilleur agent d'IA est Gemini Spark si vous voulez l'agent dans le cloud et Claude Cowork si vous le voulez sur votre bureau. Ce sont des choix conjoints et non un premier et un deuxième : Spark tourne dans une VM Google Cloud et continue donc à travailler pendant que votre portable est fermé, relié à Gmail, Docs et, depuis début septembre, Google Photos ; Cowork tourne sur votre Mac ou votre PC Windows et pilote vos applications locales et votre écran. Aucun classement indépendant ne met les deux produits face à face : le choix porte donc sur l'endroit où le travail doit se faire, pas sur celui qui marque le plus. Le prix ne départage plus non plus : Spark atteint désormais le palier Google AI Pro à 19,99 $/mois aux États-Unis et dans plus de 160 autres pays, et Cowork est inclus sans supplément dans tous les forfaits Claude payants à partir de 20 $/mois. ChatGPT Codex Mobile (14 mai) est l'alternative pour le travail d'agent de programmation, et les agents de navigateur de classe OpenAI Operator pour les tâches web. Lisez la comparaison complète Gemini Spark contre Claude Cowork.
| Agent | Idéal pour | Où il tourne | Force | Prix |
|---|---|---|---|---|
| Gemini Spark | Tâches cloud 24/7, flux Workspace | VM Google Cloud (toujours active) | Premier vrai agent 24/7, intégration profonde à Workspace | À partir de 19,99 $/mois Google AI Pro |
| Claude Cowork | Bureau, pilotage d'apps, design + code | Votre bureau Mac/Windows | Pilote les apps locales, voit votre écran | 20 $/mois Claude Pro |
| ChatGPT Codex Mobile | Agent de programmation sur téléphone | Cloud OpenAI + iOS/Android | Approuver des diffs et réorienter le travail depuis le téléphone | Inclus dans les forfaits ChatGPT |
| Grok Agentic (Grok 4.7) | Recherche en temps réel, extraction de X | Cloud SpaceXAI | Intégration native de X ; Elo 1695 sur GDPval-AA v2.1, quatrième parmi les modèles distincts | 30 $ par mois SuperGrok, toujours en 4.6 |
| OpenAI de classe Operator | Tâches de navigateur, formulaires web | Cloud OpenAI + votre navigateur | Automatisation web | ChatGPT Pro |
Aucun nouveau produit d'agent grand public n'est sorti, les couronnes ne bougent donc pas : Gemini Spark (cloud) et Claude Cowork (bureau) restent des choix conjoints séparés par l'endroit où tourne l'agent. Spark s'est tout de même élargi, atteignant la formule Google AI Pro à 19,99 $ par mois et gagnant Google Photos, où il peut chercher, retoucher, trier et exécuter des flux programmés. La couche de modèles en dessous a beaucoup bougé, et l'essentiel le 22 septembre. Claude Opus 5.5 mène désormais les deux classements agentiques publiés par Artificial Analysis : AA-Briefcase v1.1 à 1822 contre 1678 pour Claude Fable 5.1 et 1673 pour Claude Opus 5, et GDPval-AA v2.1 à 1846 contre 1735 et 1708. Il égale en outre GPT-6 Astra sur Terminal-Bench 4.0 à 4 $ / 20 $ contre 10 $ / 50 $, ce qui en fait le modèle sur lequel la plupart des équipes devraient bâtir désormais, à la place de la recommandation Opus 5 que portait ce bloc. L'Agent Arena d'Arena ne l'a pas évalué, et Claude Fable 5.1 y mène toujours l'achèvement des tâches à 19,8 %, devant GPT-6 Astra à 17,7 %, DeepSeek V4.1-Flash troisième et Claude Opus 5 quatrième. L'autre mouvement est le Grok 4.7 de SpaceXAI (21 septembre) : 1695 sur GDPval-AA v2.1 et 1657 sur AA-Briefcase le placent quatrième et septième, au-dessus de GPT-6 Astra sur les deux, même s'il arrive dans l'API, dans Cursor et dans Grok Build et non dans un produit d'agent grand public. Le Muse Spark 1.3 de Meta est cinquième parmi les modèles distincts sur GDPval-AA v2.1 à 1674, donc sous Grok 4.7 et non au-dessus comme nous l'écrivions le mois dernier, et Scale SEAL n'a toujours évalué que la 1.1, qui mène son classement d'usage d'outils MCP Atlas à 88,1. GLM 5.3 Flash (26 août, MIT) reste le modèle d'agent ouvert que nous hébergerions, à AutomationBench 48,8 sur le graphique de Z.ai où Claude Opus 4.8 obtient 41,0 ; sur le signal d'achèvement des tâches de l'Agent Arena, GLM-5.2 est dix-septième et Kimi K3 cinquième, le modèle ouvert le mieux placé étant DeepSeek V4.1-Flash à la troisième place.
Les modèles de pointe comme ChatGPT, Claude et Gemini, réunis sur Mac, iPhone et iPad.
Gratuit pour démarrer, 4,7★ sur plus de 27 000 avis.
Télécharger Fello AIMeilleure IA pour les étudiants
La meilleure IA pour les étudiants est GPT-5.6 Luna dans ChatGPT pour le travail de cours général et Gemini 3.6 Flash dans l'application Gemini pour les STEM et l'étude multimodale, avec Qwen 3.7 Max comme alternative par API pour les jeux de problèmes plus ardus (200 requêtes gratuites par jour) et Claude Opus 5 comme alternative pour la révision de dissertations. La plupart des étudiants n'ont pas besoin de payer, et l'offre gratuite s'est améliorée le 6 août : GPT-5.6 Luna est devenu le modèle par défaut de ChatGPT Free et Go, avec des discussions texte illimitées et un bouton Think pour les questions plus difficiles, même si les envois de fichiers et les outils d'image restent plafonnés. Gemini 3.6 Flash reste ce que sert l'application Gemini gratuite, Claude Sonnet 5 est le Claude gratuit par défaut, et DeepSeek V4 est gratuit sur le site de discussion de DeepSeek. Luna est le membre le moins cher de la famille GPT-5.6 et non le plus puissant, alors utilisez le bouton Think ou passez à GPT-5.5 quand une dissertation demande plus de soin. Pour le travail pas à pas sur les mathématiques les plus dures, GPT-5.6 Sol est le fleuron payant d'OpenAI et GPT-6 Astra annonce désormais 97,6 % sur FrontierMath Tier 4 v2 contre les 39,6 % vérifiés de GPT-5.5 Pro, même si Astra n'est pas disponible dans l'offre gratuite de ChatGPT ; Qwen 3.7 Max est l'alternative rapport qualité-prix avec 97,1 à l'indice HMMT février 2026 et des tarifs API de 1,25 $ / 3,75 $ dans sa promotion actuelle de 50 % (2,50 $ / 7,50 $ en tarif public).
| Tâche | Meilleur modèle | Pourquoi | Gratuit ? | Alternative |
|---|---|---|---|---|
| Dissertations & travail de cours | GPT-5.6 Luna | Par défaut et gratuit dans ChatGPT depuis le 6 août ; discussions texte illimitées | Oui | Claude Sonnet 5 (Claude gratuit) |
| Résolution de problèmes STEM | GPT-5.6 Sol / Qwen 3.7 Max | Fleuron STEM payant ; Astra annonce 97,6 % sur FrontierMath Tier 4 v2 / 97,1 HMMT févr. 2026 | Pro payant / Qwen API payant | Gemini 3.6 Flash (gratuit) |
| Recherche & précision | Gemini 3.1 Pro | 98 % ARC-AGI-1 à 0,52 $/tâche, ancrage natif dans Google Search | Oui (application Gemini) | Claude Opus 5 |
| Révision d'écriture | Claude Sonnet 5 | Gratuit et par défaut sur claude.ai ; Claude Fable 5 est le leader en qualité | Oui (Claude gratuit) | Claude Fable 5 |
| Étude multimodale (PDF, diapositives, images) | Gemini 3.6 Flash | Contexte 1M, gratuit dans l'application Gemini | Oui | NotebookLM (Google) |
C'est l'offre gratuite qui a bougé dans ce guide. Le 6 août, OpenAI a fait de GPT-5.6 Luna le modèle par défaut de ChatGPT Free et Go et a donné aux deux des discussions texte illimitées ainsi qu'un bouton Think pour les questions plus difficiles, si bien que le choix gratuit est désormais Luna plutôt que GPT-5.5, qui reste sélectionnable quand une dissertation demande plus de soin. Les envois de fichiers, les images et les autres outils restent plafonnés. Côté Google, rien n'a bougé : Gemini 3.8 Flash est sorti le 2 septembre mais n'atteint les utilisateurs gratuits que via AI Studio et l'API, si bien que l'application Gemini gratuite sert toujours 3.6 Flash, qui conserve la ligne multimodale. GPT-6 Astra (3 septembre) est le modèle à surveiller pour les jeux de problèmes ardus, avec 97,6 % annoncés sur FrontierMath Tier 4 v2 contre les 39,6 % vérifiés de GPT-5.5 Pro, mais il exige un forfait ChatGPT payant et aucune offre gratuite ne l'inclut.
Meilleure IA pour le travail & les professionnels
La meilleure IA pour le travail professionnel est GPT-5.6 (par défaut de ChatGPT depuis le 9 juillet) pour le travail de connaissance quotidien, Claude Opus 5 pour la programmation et l'écriture à enjeux élevés, et Gemini Spark pour les flux agentiques 24/7. La plupart des professionnels en tirent le meilleur parti en cumulant deux abonnements payants (ChatGPT Plus à 20 $/mois plus Claude Pro à 20 $/mois, soit 40 $/mois au total), ou en consolidant avec Fello AI à 9,99 $/mois pour les cinq meilleurs modèles dans une seule app Mac/iOS. Pour le travail agentique qui tourne pendant que vous dormez, Gemini Spark est le seul vrai agent cloud 24/7, et depuis le 30 juillet il atteint le palier Google AI Pro à 19,99 $/mois en plus de Google AI Ultra.
| Cas d'usage | Meilleur modèle | Stat clé | Prix | Alternative |
|---|---|---|---|---|
| Travail de connaissance quotidien | GPT-5.6 | Par défaut de ChatGPT depuis le 9 juillet ; l'assistant que la plupart peuvent ouvrir | 20 $/mois ChatGPT Plus | Claude Opus 5 |
| Programmation (propriétaire) | Claude Opus 5.5 | #1 Terminal-Bench 4.0 (59,6 %) et #1 sur les deux classements de programmation de LiveBench, à 4 $ / 20 $ | 20 $ par mois Claude Pro | GPT-6 Astra, qui conserve les deux classements de programmation d'Arena |
| Programmation (économique) | Qwen3.8-Max-0902 | #4 Code Arena: WebDev (1681), derrière GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5 ; API uniquement sur QwenCloud | 2 $ / 6 $ | Qwen 3.7 Max ; DeepSeek V4.1-Flash |
| Recherche & briefings | Gemini 3.1 Pro | 98 % ARC-AGI-1 à 0,52 $/tâche, ancrage Google | Google AI Pro / Ultra | Claude Opus 5 |
| Mathématiques ardues, physique, modélisation financière | GPT-6 Astra | #1 LiveBench Reasoning et ARC-AGI-2 (95 %) ; annonce 97,6 % sur FrontierMath Tier 4 v2 | 100 $/mois ChatGPT Pro | GPT-6 Astra ; Qwen 3.7 Max |
| Flux d'agent toujours actifs | Gemini Spark | Premier agent cloud 24/7 | À partir de 19,99 $/mois Google AI Pro | Claude Cowork |
| Actualité en direct, créatif avec contexte X | Grok 4.7 | Intelligence Index 46,3 + ancrage natif sur X ; l'application Grok sert toujours la 4.6 | 30 $ par mois SuperGrok | Gemini 3.1 Pro |
| Consolidation tout-en-un | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | 9,99 $/mois | Payer chaque fournisseur séparément |
Trois lancements sont tombés dans les trois premiers jours de septembre et un quatrième le 22 septembre, et c'est ce dernier qui change l'argument tarifaire sur lequel repose ce bloc. Claude Opus 5.5 domine l'Intelligence Index d'Artificial Analysis à 57,6 sur v4.3.2 ainsi que ses deux classements agentiques, et il le fait à 4 $ / 20 $ contre 5 $ / 25 $ pour Claude Opus 5. Le raisonnement que portait ce bloc, selon lequel les équipes devraient commencer par Opus 5 parce qu'il coûte la moitié des meilleurs modèles, ne tient plus : Opus 5.5 est à la fois meilleur et moins cher, il prend donc la ligne de la programmation propriétaire et c'est le modèle sur lequel nous bâtirions le travail quotidien. GPT-5.6 garde malgré tout la ligne de l'assistant quotidien, car cette ligne parle de portée et non de score, et ni Opus 5.5 ni GPT-6 Astra n'est un choix par défaut pour des centaines de millions de personnes. Le Qwen3.8-Max-0902 d'Alibaba (2 septembre) conserve la ligne de la programmation économique à 2 $ / 6 $, même s'il n'existe que via l'API QwenCloud sans interface grand public.
Prix des modèles d'IA en septembre 2026
Des offres gratuites à 0 $ jusqu'à Google AI Ultra à 199,99 $ par mois. Le prix le plus lourd de conséquences de ce tableau est Claude Opus 5.5 à 4 $ / 20 $, car le 22 septembre Anthropic a publié le modèle le mieux noté qu'un évaluateur indépendant ait jamais mesuré à un tarif public inférieur à celui du modèle qu'il remplace : Claude Opus 5 coûte 5 $ / 25 $, les lectures de cache baissent de 60 % à 0,20 $, et le chiffre d'Anthropic elle-même situe une charge de travail typique 40 % moins chère que sur Opus 5. Cela inverse la forme qu'a eue cette section toute l'année, où le meilleur modèle était aussi le plus cher. Claude Fable 5.1 et GPT-6 Astra sont tous deux à 10 $ / 50 $ et marquent désormais tous deux en dessous. Le Muse Spark 1.3 de Meta est à 1,25 $ / 4,25 $, inchangé sur trois sauts de capacité depuis juillet, avec un palier Contributor à 0,10 $ / 0,20 $ pour qui accepte que Meta s'entraîne sur ses prompts, et Grok 4.6 comme Grok 4.7 sont à 2 $ / 6 $, avec la réserve qu'un prompt de 200 000 tokens ou plus refacture toute la requête à 4 $ / 12 $. Grok 4.7 est le cas le plus net de cette page d'un prix qui n'a pas bougé alors que le coût, lui, a bougé : les tokens coûtent pareil et une tâche de l'Intelligence Index coûte 2,73 $ contre 1,86 $ pour Grok 4.6, parce que la 4.7 émet environ deux fois plus de sortie pour y arriver. Le bas de gamme a bougé deux fois. DeepSeek a multiplié par environ quatre le tarif de ses deux modèles V4 le 16 août, ce qui a coûté à V4-Flash le choix rapport qualité-prix, puis en a annulé l'essentiel le 10 septembre : V4-Flash a été retiré et V4.1-Flash l'a remplacé à 0,15 $ / 0,60 $ hors pointe et 0,30 $ / 1,20 $ en pointe. Parmi les modèles qui s'achètent au token, le choix reste GLM 5.3 Flash, désormais à son tarif public simple de 0,15 $ / 0,50 $ depuis l'expiration de la promotion de lancement le 9 septembre, car Artificial Analysis le mesure à 0,25 $ par tâche de l'Intelligence Index pour un score de 41,8 contre 0,27 $ pour DeepSeek à 39,5. Hors pointe, les deux sont à égalité en entrée et GLM est moins cher en sortie ; en pointe, GLM gagne sur les deux. Un modèle les bat tous les deux au coût par tâche et il a quatre jours : le MiMo-V2.6-Pro de Xiaomi traite une tâche de l'indice pour 0,13 $ avec un score de 46,3 sous licence MIT simple, mais il faut héberger 1,02 billion de paramètres pour en profiter. À la frontière, le choix économique est le Muse Spark 1.3 de Meta, à 1,60 $ par tâche de l'indice pour 48,1. Parmi les modèles fermés, GPT-5.6 Luna est le moins cher au token à 0,20 $ / 1,20 $ après la baisse d'OpenAI du 30 juillet, et 0,18 $ par tâche de l'indice. Pour une analyse plus poussée, voyez notre guide complet de comparaison des prix de l'IA.
| Modèle | Entrée (par 1M) | Sortie (par 1M) | Contexte | Accès gratuit ? |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 | 1 050 000 (entrée max. 922 000) | ChatGPT Business/Pro depuis le 4 septembre, Plus quelques heures après ; pas d'offre gratuite. API, AWS et Azure à venir |
| GPT-5.5 | $5.00 | $30.00 | 1M (400K dans Codex) | ChatGPT Free ; API payante |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro à partir de 100 $/mois (palier usage supérieur à 200 $) |
| GPT-5.6 Sol | $4.00 | $20.00 | Non publié | En ligne sur ChatGPT, Codex & API (9 juillet) |
| GPT-5.6 Terra | $2.00 | $12.00 | Non publié | En ligne sur ChatGPT, Codex & API (9 juillet) |
| GPT-5.6 Luna | $0.20 | $1.20 | Non publié | En ligne sur ChatGPT, Codex & API (9 juillet) |
| Claude Opus 5.5 | 4,00 $ | 20,00 $ | 1M | Claude Pro/Max/Team ; API payante ; lectures de cache 0,20 $ |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Par défaut sur Claude Pro/Max ; API payante |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modèle legacy chez Anthropic ; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Lectures de cache 0,25 $ ; dans Max/Team Premium (~50 % des limites d'usage) ; Pro/Team Standard via crédits. Mythos 5.1 se facture à l'identique, sur invitation uniquement |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanent dans Max/Team Premium (~50 % des limites d'usage) ; Pro/Team Standard via crédits |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Par défaut sur Claude Free & Pro ; API payante |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API payante (remplacé par Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Application Gemini limitée ; API payante |
| Gemini 3.8 Flash | $0.75 introductif / $1.50 au 1/1/2027 | $3.75 introductif / $7.50 au 1/1/2027 | 1M | AI Studio, Antigravity, Gemini Enterprise + API payante ; dans l'application Gemini rapporté pour AI Pro/Ultra |
| Gemini 3.7 Flash | $0.75 introductif / $1.50 au 1/1/2027 | $3.75 introductif / $7.50 au 1/1/2027 | 1M | AI Studio, Android Studio, Antigravity + API payante ; dans l'application Gemini via Spark uniquement (AI Pro/Ultra, hors EEE/RU/CH/Nigeria) |
| Gemini 3.6 Flash | $0.75 introductif / $1.50 au 1/1/2027 | $3.75 introductif / $7.50 au 1/1/2027 | 1M | Modèle par défaut de l'application Gemini gratuite ; AI Studio ; palier API gratuit + API payante |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio ; palier API gratuit + API payante |
| Qwen3.8-Max-0902 | 2,00 $ (0,17 $ cache hit explicite, 0,25 $ implicite) | 6,00 $ | 1M (sortie 128K) | API QwenCloud uniquement ; pas de chat grand public, pas de poids ouverts |
| Qwen 3.7 Max | $1.25 promo / $2.50 liste | $3.75 promo / $7.50 liste | 1M | 200 requêtes gratuites/jour ; API payante au-delà |
| MiniMax M3 | $0.30 (50 % de remise sur $0.60) | $1.20 (≤512K) | 1M | Open weights ; coûts d'hébergement applicables |
| LongCat-2.0 | Selon le fournisseur | Selon le fournisseur | 1M | Open weights (MIT) ; coûts d'hébergement applicables |
| NVIDIA Nemotron 3 Ultra | Selon le fournisseur | Selon le fournisseur | 1M | Open weights (OpenMDW) ; coûts d'hébergement applicables |
| Qwen 3.5 (open-weight) | Auto-hébergement / Together | Auto-hébergement / Together | 1M | Open weights ; coûts d'hébergement applicables |
| Nex-N2-Pro | Auto-hébergement / fournisseurs | Auto-hébergement / fournisseurs | 1M | Open weights (Apache 2.0) ; coûts d'hébergement applicables |
| Rio 3.5 Open 397B | Auto-hébergement / fournisseurs | Auto-hébergement / fournisseurs | 1M | Open weights (MIT) ; coûts d'hébergement applicables |
| Grok 4.3 | $1.25 | $2.50 | 1M | Forfait grand public gratuit ; API payante |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Grok 4.7 | 2,00 $ (<200K) / 4,00 $ (≥200K) | 6,00 $ (<200K) / 12,00 $ (≥200K) | 500K | API SpaceXAI, Cursor, Grok Build, harnesses et routeurs cloud ; pas dans l'application Grok |
| Muse Spark 1.3 | $1.25 ($0.10 palier Contributor) | $4.25 ($0.20 palier Contributor) | 1M | API payante ; Muse Code, Meta Model API et OpenRouter ; le palier Contributor échange des droits d'entraînement contre une remise de ~92 % |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Palier de base gratuit dans l'application Kimi ; open weights sur Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vidéo) | $1.50 | $17.50 (sortie vidéo) | Clips de 10 secondes | Application Gemini / Flow ; AI Studio + API |
| DeepSeek V4-Pro | $0.66 hors pointe / $1.32 en pointe ($0.022 cache-hit hors pointe) | $1.98 hors pointe / $3.96 en pointe | 1M | DeepSeek Chat gratuit ; API payante, tarifs de pointe et hors pointe depuis le 16 août |
| DeepSeek V4.1-Flash | 0,15 $ hors pointe / 0,30 $ en pointe (0,003 $ succès de cache hors pointe) | 0,60 $ hors pointe / 1,20 $ en pointe | 1M | DeepSeek Chat gratuit ; API payante, tarifs heures pleines et creuses ; a remplacé V4-Flash le 10 septembre |
| Kimi K2.7 Code | Selon le fournisseur | Selon le fournisseur | 256K | Open weights ; coûts d'hébergement applicables |
| GLM-5.2 | Selon le fournisseur | Selon le fournisseur | 1M | Open weights ; coûts d'hébergement applicables |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | API Z.ai, GLM Coding Plan et ZCode ; poids sur Hugging Face depuis le 28 août sous la licence maison GLM 5.3 License |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit) ; $0.075 en promo | $0.50 ; $0.25 en promo | 1M | API Z.ai, GLM Coding Plan, OpenRouter ; poids MIT sur Hugging Face ; promo jusqu'au 9 septembre |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Poids ouverts (Apache 2.0) ; Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Selon le fournisseur | Selon le fournisseur | 262K (jusqu'à 1M) | Poids ouverts (Qwen Community License 1.0) ; coûts d'hébergement en sus |
| MiMo-V2.6-Pro | 0,435 $ | 0,87 $ | 1M | Poids ouverts (MIT) ; coûts d'hébergement à prévoir |
| ERNIE 5.1 | Tarif région Chine | Tarif région Chine | 256K | Palier gratuit de Baidu |
| Gemini Spark (agent) | Sans tarif API | Sans tarif API | 1M (base Gemini) | Google AI Pro 19,99 $, AI Ultra 99,99 $ ou 199,99 $/mois |
| Fello AI (agrégateur) | Acheminé via l'app | Acheminé via l'app | Selon le modèle | 9,99 $/mois, version gratuite disponible |
Les tarifs de GPT-5.5 et GPT-5.5 Pro ci-dessus sont des prix de contexte court ; OpenAI ne publie plus les chiffres spécifiques de contexte long. Les paliers GPT-5.6 sont facturés à 2x l'entrée et 1,5x la sortie une fois qu'un prompt dépasse 272K tokens d'entrée, ce qui place Terra en contexte long à 4 $ / 18 $ et Luna à 0,40 $ / 1,80 $. Grok 4.6 fonctionne de la même façon, mais mord plus fort : à partir de 200 000 tokens de prompt, SpaceXAI refacture la requête entière au tarif supérieur plutôt que le seul dépassement, si bien que dépasser le seuil de mille tokens double le coût de tout l'appel. L'autre grille à lire deux fois est celle de DeepSeek : depuis le 16 août, ses deux modèles V4 sont facturés au tarif de pointe de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine, et à exactement la moitié à toute autre heure, si bien que la même tâche peut coûter le double selon le moment où vous la lancez. Si vous voulez accéder à plusieurs modèles d'IA sans gérer d'abonnements distincts, Fello AI propose GPT, Claude, Gemini, Grok, Perplexity et plus encore dans une seule app pour Mac, iPhone et iPad à partir de 9,99 $/mois.
Meilleurs modèles open-weight en septembre 2026
Le meilleur modèle à poids ouverts en septembre 2026 est MiMo-V2.6-Pro, que Xiaomi a publié le 21 septembre sous licence MIT simple : 1,02 billion de paramètres dont 42 milliards actifs, un contexte de 1M de tokens et les poids sur Hugging Face le jour même. Artificial Analysis le mesure à 46,3 sur l'Intelligence Index v4.3.2, le meilleur score ouvert qu'elle ait jamais publié, au-dessus de GLM-5.3 à 44,8 et de Kimi K3 à 43,6, et il le fait à 0,13 $ par tâche de l'indice, moins cher que tout autre modèle de cette page. Il prend aussi 34,8 % sur Terminal-Bench 4.0 et 1673 sur GDPval-AA v2.1, ce qui le place au-dessus de Kimi K3 sur les deux. Deux limites honnêtes : aucun classement d'Arena ne l'a évalué, il n'existe donc aucune donnée de préférence humaine à son sujet, et il a été publié il y a quatre jours, sans historique indépendant. Kimi K3 reste le modèle ouvert le mieux classé sur Arena, cinquième sur WebDev à 1674 et cinquième sur le signal d'achèvement des tâches de l'Agent Arena, et GLM-5.3 reste le modèle ouvert le plus fort sur le Terminal-Bench 4.0 d'Artificial Analysis à 41,9 % contre 34,8 % pour MiMo, sous une licence Z.ai propre et non MIT. La recommandation pratique pour les équipes qui hébergent leurs propres poids reste GLM 5.3 Flash (Z.ai, MIT), sorti le 26 août et noté 41,8 sur v4.3.2, 320 Md au total dont 18 Md actifs, parce qu'un modèle de 1,02 billion de paramètres n'est pas une affaire de station de travail et que le téléchargement de K3 représente 96 fragments safetensors et environ 1,56 To. L'étage ouvert bon marché a de nouveau changé le 10 septembre : DeepSeek a retiré V4-Flash 0731 et l'a remplacé par DeepSeek-V4.1-Flash, 552 Md avec 8 Md actifs au prefill et 16 Md au décodage, nativement multimodal, sous MIT dès le premier jour, noté 39,5 sur v4.3.2 contre 34,3 pour la version remplacée, et revenu à 0,15 $ / 0,60 $ hors pointe. Il est aussi troisième sur le signal d'achèvement des tâches de l'Agent Arena, le modèle ouvert le mieux placé là-bas. Parmi les trois sorties qui ont clos août, GLM 5.3 a publié ses poids le 28 août sous une licence propre assortie d'une clause imposant à tout opérateur de model-as-a-service dépassant 10 milliards de dollars de chiffre d'affaires de passer d'abord une revue de sécurité Z.ai ; le Qwen3.8-Flash-Next d'Alibaba, un mélange d'experts de 125 Md avec seulement 6 Md actifs qui préfigure l'architecture Qwen4, obtient 39,8 et occupe la neuvième place du classement WebDev d'Arena ; et le Hy4 Preview de Tencent, 770 Md au total et 49 Md actifs sous Apache 2.0, n'a pas de note d'Artificial Analysis mais se situe onzième sur Arena WebDev à 1624. Notez aussi que GLM 5.3 Flash n'est pas un GLM 5.3 allégé mais un modèle distinct sur une base réentraînée, ce qui lui a permis de sortir sous MIT simple alors que le vaisseau amiral ne le pouvait pas.
| Modèle | Idéal pour | Benchmark clé | Contexte / Licence | Où l'exécuter |
|---|---|---|---|---|
| MiMo-V2.6-Pro | Le plus haut Intelligence Index ouvert jamais mesuré | II 46,3 (v4.3.2), au-dessus de GLM-5.3 et Kimi K3, à 0,13 $ par tâche ; 34,8 % Terminal-Bench 4.0 ; GDPval-AA v2.1 1673 ; 1,02 billion/42 Md actifs | 1M / MIT | Hugging Face (XiaomiMiMo), fournisseurs, auto-hébergement |
| Kimi K3 | Modèle ouvert le mieux classé sur Arena | II 43,6 (v4.3.2) ; #5 Arena WebDev, meilleure place ouverte ; #5 Agent Arena ; 2.8T/104B actifs | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 To), Moonshot API, fournisseurs |
| GLM 5.3 Flash | Meilleur modèle ouvert que la plupart des équipes peuvent réellement faire tourner | II 41,8 (v4.3.2), sur la frontière de Pareto intelligence-coût à environ $0.25 par tâche de l'index ; 320B/18B actifs, nativement multimodal | 1M / MIT | Hugging Face, API Z.ai ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Repli avec un bilan indépendant | II 33,7 (v4.3.2) ; #19 Arena WebDev (1,591.8), #17 Agent Arena ; 744B/40B actifs | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Ouvert depuis le 28 août, mais sous licence maison | II 44,8 (v4.3.2), le meilleur score ouvert que nous ayons trouvé ; même base 744B que GLM-5.2, post-entraînée seulement, checkpoint publié compté à 753B ; CyberGym 84,5 % et Terminal-Bench 3.0 28,3 (chiffres de l'éditeur) | 1M / GLM 5.3 License (model-as-a-service au-delà de 10 Md$ de CA nécessite une revue de sécurité Z.ai) | Hugging Face, API Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4.1-Flash | Meilleur rapport qualité-prix ouvert si vous l'hébergez vous-même | II 39,5 (v4.3.2) contre 34,3 pour la version V4-Flash 0731 qu'il remplace ; 552B, 8B actifs au prefill et 16B au décodage | 1M / MIT | DeepSeek API (0,15 $/0,60 $ hors pointe, 0,30 $/1,20 $ en pointe depuis le 10 septembre), local |
| Tencent Hy4 Preview | Plus grand modèle sous licence permissive à ce jour | 770B/49B actifs ; 2,99/4,00 sur le panel maison de Tencent de 203 tâches contre 2,94 pour Kimi K3 et 2,92 pour GLM 5.3 (éditeur) ; pas de note Artificial Analysis ; #11 Arena WebDev (1624) | 1M+ / Apache 2.0 | Hugging Face (BF16 et FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Avant-goût de l'architecture Qwen4 | 125B au total plus un embedding N-gramme de 51B, 6B actifs ; 91,7 GPQA Diamond et 62,5 SWE-Bench Pro (éditeur) ; II 39,8 (v4.3.2) ; #9 Arena WebDev (1635) | 262K à 1M / Qwen Community License 1.0 | Hugging Face, fournisseurs, auto-hébergement |
| LongCat-2.0 | Programmeur ouvert frontier entraîné sur des puces chinoises | II 33 (v4.1) ; 59,5 % SWE-Bench Pro (éditeur), 1.6T/~48B actifs | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de classe frontier bon marché | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licence à déterminer | Hugging Face, API 0,30 $/1M (50 % de remise) |
| Nex-N2-Pro | Meilleur score de programmation ouvert | II 41 (v4.1) ; 80,8 SWE-Bench Verified, 397B/17B actifs | Basé sur Qwen / Apache 2.0 | Hugging Face, fournisseurs, auto-hébergement |
| Kimi K2.7 Code | Meilleur programmeur ouvert sous licence commerciale | +21,8 % sur Kimi Code Bench v2 vs K2.6 (éditeur) ; 1T/32B actifs | 256K / Modified MIT | Hugging Face, DeepInfra, fournisseurs |
| DeepSeek V4-Pro | Travail agentique en conditions réelles | II 44 (v4.1), 1.6T/49B actifs | 1M / MIT | DeepSeek API (0,66 $/1,98 $ hors pointe, 1,32 $/3,96 $ en pointe depuis le 16 août), local |
| Hy3 | Le plus récent arrivant à licence permissive | II 41 (v4.1) ; #22 sur Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, fournisseurs, auto-hébergement |
| Inkling | Premier open model de Thinking Machines | II 41 (v4.1), agentique 32,3, sorti le 15 juillet | Open weights | Hugging Face, fournisseurs, auto-hébergement |
| Inkling Small | Même famille à un quart de la taille | II 40 (v4.1), agentique 30,8 ; 276B/12B actifs, entrée texte, image et audio | Apache 2.0 | Hugging Face (BF16 et NVFP4), fournisseurs, auto-hébergement |
| NVIDIA Nemotron 3 Ultra | Affiné par NVIDIA, licence entièrement permissive | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B actifs | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 auto-hébergement) |
| Qwen 3.5 (397B / 17B actifs) | Multimodal, décodage rapide | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / ouvert | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programmeur agentique ouvert efficace (3B actifs) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B actifs | 262K (jusqu'à 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programmeur dense exécutable sur portable | 87,8 GPQA Diamond, dense 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, raisonnement multilingue | 70,8 Terminal-Bench 2.1 (first-party), bat Qwen 3.7 Plus sur 4/5 | 397B/17B actifs / MIT | Hugging Face, fournisseurs, auto-hébergement |
| Llama 4 Maverick | Modèle phare de la lignée Meta | 17B actifs / 400B de paramètres au total | Llama 4 license | Cloud Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / faible consommation | Multimodal, empreinte très réduite | Compact / ouvert | Local, outil NVIDIA |
Ici la licence compte autant que le score brut, et août a creusé l'écart entre les deux groupes. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) et Nemotron 3 Ultra (OpenMDW) autorisent tous clairement l'usage commercial sans examen du chiffre d'affaires. Le reste porte des conditions à lire avant de construire dessus : MiniMax M3 et MiniMax H3 arrivent sous leurs propres licences communautaires, H3 exigeant en plus une demande depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud ; Kimi K3 se place sur une licence maison avec un seuil de revenus pour quiconque le revend comme service ; GLM 5.3 impose une revue de sécurité Z.ai à tout opérateur de model-as-a-service au-delà de 10 milliards de dollars de chiffre d'affaires ; et la Qwen Community License 1.0 de Qwen3.8-Flash-Next impose une licence distincte de Qwen pour exploiter une activité de model-as-a-service ou d'assistant de travail IA, l'usage interne restant exempté. Aucun open model n'est plus premier sur aucun classement d'Arena que nous suivons : Claude Opus 5 a pris le classement Agent en juillet, le dernier qu'un open model ait dominé.
Benchmarks, prix et usage sur le terrain
Chaque classement de cette page combine trois éléments : des benchmarks publics de sept maisons indépendantes (Artificial Analysis, Arena anciennement LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize et le classement officiel Terminal-Bench 4.0, couvrant l'index Intelligence, GPQA Diamond, ARC-AGI-1 à 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas et le Remote Labor Index), les tarifs d'API et d'abonnement publiés sur la page de prix officielle de chaque fournisseur, et l'usage sur le terrain par l'équipe éditoriale de FelloAI qui exécute de vrais prompts sur la même tâche sur chaque modèle. Nous récupérons de nouveau les sources officielles de prix et de benchmarks avant chaque mise à jour mensuelle.
Les benchmarks sont pondérés selon le cas d'usage : SWE-bench et Terminal-Bench portent la programmation, GPQA Diamond et ARC-AGI-2 portent la précision, GDPval-AA (le benchmark de livrables professionnels d'Artificial Analysis) informe la qualité des tâches professionnelles tandis que le style d'écriture est jugé avant tout par des tests sur le terrain, FrontierMath et HMMT portent la résolution de problèmes. Nous précisons quand un benchmark est annoncé par l'éditeur mais non vérifié de façon indépendante, et nous écartons toute affirmation que nous ne pouvons pas reproduire face à une source en direct. Nous classons sur les scores mesurés : la couronne d'une catégorie change dès qu'un modèle dépasse le tenant sur les classements qui définissent cette catégorie, sans attendre les classements fondés sur des votes, et un modèle qui n'est pas encore largement disponible est signalé sur sa carte plutôt que privé de carte. Nous revérifions les rangs autant que les chiffres, car un score peut rester exact pendant que le classement autour de lui bouge. Lorsqu'un modèle passe par une mise à niveau majeure entre deux mises à jour, nous reclassons la catégorie et ajoutons une ligne « Ce qui a changé ce mois-ci » au bas de l'analyse approfondie.
Fello AI réunit les meilleurs modèles d'IA dans une seule app native et légère.
Passez de l'un à l'autre à tout moment, sans abonnements séparés.
Télécharger Fello AI




