Meilleurs modèles d'IA en 2026
Classements, comparatifs et analyses approfondies, mis à jour chaque mois à mesure que de nouveaux modèles arrivent.
Août 2026 s'ouvre avec Claude Opus 5 en tête et deux couronnes qui changent de main. Opus 5 domine l'Intelligence Index d'Artificial Analysis à 61 et son Agentic Index à 55,3 à 5 $ / 25 $ par 1M de tokens, moitié moins cher que Claude Fable 5, et il a désormais pris la couronne de la programmation après avoir terminé premier sur les deux classements de programmation par votes d'Arena. L'autre mouvement se joue sur le bas de gamme, où DeepSeek V4-Flash 0731 est arrivé le 31 juillet comme nouveau choix rapport prix-performance à 0,14 $ / 0,28 $. Ci-dessous figurent les vainqueurs par catégorie pour août 2026. Cliquez sur n'importe quelle carte pour accéder directement au décryptage complet, ou utilisez la navigation fixe pour passer d'une catégorie à l'autre. Les classements, benchmarks et prix sont mis à jour dans les 48 heures suivant le lancement de tout modèle majeur.
5 août Muse Spark 1.2 et Muse Code, Intelligence Index de 51 à 54 à un tarif inchangé de 1,25 $ / 4,25 $, plus un agent de programmation en terminal Nouveau
3 août Alibaba Qwen 3.8 (Qwen3.8-Max), modèle phare multimodal de 2,4 billions de paramètres désormais disponible pour tous à 2 $ / 6 $ Nouveau
31 juil. DeepSeek DeepSeek V4-Flash 0731, même prix, même taille, Intelligence Index de 40 à 50 Nouveau
31 juil. MiniMax MiniMax H3, vidéo 2K avec audio stéréo natif à partir de 0,13 $ la seconde Nouveau
Fin juil. Thinking Machines Inkling Small, un quart de la taille d'Inkling pour un score presque identique Nouveau
30 juil. OpenAI Baisse de prix GPT-5.6, Luna 80 % moins cher, Terra 20 % moins cher, Sol inchangé
24 juil. Anthropic Claude Opus 5, nouveau #1 sur Artificial Analysis, domine à la fois l'Intelligence Index (61) et l'Agentic Index (55.3) Nouveau
24 juil. Sakana AI Fugu-Ultra v1.1, rafraîchissement du moteur d'orchestration avec des gains annoncés par l'éditeur jusqu'à 7,9 points sur v1.0 au même prix Nouveau
21 juil. Google Gemini 3.6 Flash, sortie moins chère, plus rapide, même Intelligence Index
16 juil. Moonshot AI Kimi K3, 2,8B de paramètres, le plus grand modèle open-weight jamais publié (poids sortis le 27 juillet) Nouveau
9 juil. OpenAI GPT-5.6 Sol, Terra et Luna, famille nouvelle génération en ligne sur ChatGPT, Codex et l'API
En attente Google Gemini 3.5 Pro, toujours pas sorti, des mois de retard selon Bloomberg Retardé
Meilleure IA pour l'écriture
La meilleure IA pour l'écriture est Claude Fable 5, le seul modèle dans le top trois des trois classements indépendants d'écriture, avec Claude Sonnet 5 comme choix rapport qualité-prix de la version gratuite et GPT-5.5 comme alternative pour l'écriture professionnelle ancrée dans les faits. Fable 5 domine le classement d'écriture créative d'Arena, arrive en tête de LiveBench Language à 90,7 et se place troisième sur EQ-Bench Creative Writing v3 derrière Kimi K3 et GPT-5.6 Sol. Aucun autre modèle n'est dans le top trois sur plus d'un de ces classements. C'est un changement par rapport au mois dernier, où Claude Sonnet 5 occupait cette place sur GDPval-AA ; les classements de préférence ne soutiennent pas ce placement, donc Sonnet 5 est désormais le choix rapport qualité-prix plutôt que le leader en qualité. Fable 5 coûte 10 $ / 50 $ par 1M de tokens et est inclus en permanence dans Claude Max et Team Premium à environ 50 % des limites d'usage habituelles. Si votre écriture est un livrable de travail plutôt que de la prose, Claude Opus 5 domine haut la main le classement GDPval-AA v2 de livrables professionnels d'Artificial Analysis à 1858, bien devant les 1746 de Fable 5.
| Modèle | Idéal pour | Force | Faiblesse | Prix (par 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5 | Meilleure écriture globale | #1 Arena texte global (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | L'option la plus chère ici | 10 $ / 50 $ |
| Kimi K3 | Fiction créative et voix | #1 EQ-Bench Creative Writing (2377), 234 Elo d'avance sur le deuxième | Seulement #10 sur Arena écriture créative | 3 $ / 15 $ |
| Claude Sonnet 5 | Écriture gratuite au quotidien | Gratuit et par défaut sur claude.ai, contexte 1M | #53 Arena écriture créative ; 75,0 LiveBench Language | 2 $ / 10 $ tarif de lancement (puis 3 $ / 15 $) |
| Claude Opus 5 | Livrables professionnels | #1 GDPval-AA v2 à 1858, devant Fable 5 (1746) | Derrière Fable 5 sur Arena texte et Humanity's Last Exam | 5 $ / 25 $ |
| GPT-5.5 | Écriture professionnelle ancrée dans les faits | Gains documentés de fiabilité factuelle sur GPT-5.4 | Les paliers de raisonnement sont désormais marqués obsolètes | 5 $ / 30 $ |
| Gemini 3.6 Flash | Brouillons en masse à grande échelle | 17 % de tokens de sortie en moins que 3.5 Flash | Plus faible sur le raisonnement le plus ardu | 1,50 $ / 7,50 $ |
La couronne de l'écriture reste à Claude Fable 5, et c'est le choix le mieux étayé de la page. Fable 5 est désormais #1 sur le classement texte d'Arena à 1508.6 à la date de clôture du 1er août, #1 sur Humanity's Last Exam à 53,3 % et #1 sur AA-Omniscience à 40, soit trois maisons différentes qui concordent. Claude Opus 5 conserve le couloir des livrables professionnels sur GDPval-AA v2, où le classement réajusté affiche désormais 1858 contre les 1746 de Fable 5.
Meilleure IA pour le chat & ; l'assistant du quotidien
La meilleure IA pour le chat du quotidien est GPT-5.6, et la raison honnête tient à la portée plutôt qu'à la position dans les classements. C'est le modèle que ChatGPT sert par défaut à la plus grande base d'utilisateurs de la catégorie, ce qui en fait le meilleur assistant que la plupart des gens peuvent réellement ouvrir. En préférence humaine pure, ce n'est pas le leader : GPT-5.6 Sol se situe #14 sur le classement texte d'Arena à 1482,8, où Claude Fable 5 domine à 1508.6. La plupart des utilisateurs de ChatGPT reçoivent le palier équilibré Terra, qu'OpenAI dit égaler GPT-5.5 et qui, depuis la baisse de prix du 30 juillet 2026, coûte 60 % de moins. Il est disponible dans ChatGPT (gratuit avec limites, Plus à 20 $/mois, Pro à 100 $/mois), via l'API (Luna 0,20 $ / 1,20 $, Terra 2 $ / 12 $, Sol 5 $ / 30 $ par 1M de tokens), et intégré dans Fello AI aux côtés de Claude, Gemini, Grok et DeepSeek. Une réserve : la system card d'OpenAI et l'évaluateur METR ont signalé un comportement de « scheming » élevé chez Sol, donc GPT-5.5 Instant reste le choix le plus sûr pour un travail sensible aux hallucinations.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| GPT-5.6 | Chat du quotidien, par défaut de ChatGPT | L'assistant que la plupart peuvent ouvrir ; Terra égale GPT-5.5 à ~moitié coût | #14 sur Arena texte ; scheming signalé par METR | Gratuit / 20 $/mois Plus ; API 0,20 $ / 1,20 $ à 5 $ / 30 $ |
| Claude Fable 5 | La conversation la mieux notée | #1 sur Arena texte global (1508.6) et dans 6 des 7 sous-catégories | Pas de version gratuite ; accès par crédits d'usage sur Pro | 10 $ / 50 $ API |
| Claude Opus 5 | Réponses réfléchies et nuancées | #1 Artificial Analysis Intelligence Index (61) et Agentic Index (55.3) | #6 sur Arena texte, derrière Claude Fable 5 | 20 $/mois Pro, 5 $ / 25 $ API |
| GPT-5.5 Instant | Travail quotidien sensible aux hallucinations | 52,5 % d'affirmations hallucinées en moins vs 5.3 Instant | Les paliers de raisonnement sont désormais marqués obsolètes | 20 $/mois Plus ; API 5 $ / 30 $ |
| Gemini 3.6 Flash | Rapide, gratuit, multimodal | Gratuit dans l'application Gemini, contexte 1M, #12 sur Arena texte | Plus faible sur le raisonnement le plus ardu | Gratuit / 1,50 $ / 7,50 $ API |
| Fello AI | Tous les meilleurs modèles, une seule app | ChatGPT + Claude + Gemini + Grok + DeepSeek et plus sur Mac, iPhone et iPad | Acheminé via l'app, pas en direct | 9,99 $/mois |
GPT-5.6 conserve le choix chat grâce à la portée, et l'écart avec le leader de préférence s'est creusé plutôt que résorbé. À la clôture du 1er août, Sol se situe #14 sur Arena texte à 1482,8, en baisse depuis #11, tandis que Claude Fable 5 domine à 1508.6. Rien n'a changé côté produit, donc la couronne ne bouge pas : il s'agit toujours de savoir quel assistant la plupart des gens peuvent réellement ouvrir.
Meilleure IA pour les images
La meilleure IA pour la génération d'images est ChatGPT Images 2.0, et c'est la couronne la moins contestée de cette page. GPT Image 2 domine le classement texte vers image d'Arena à 1385 Elo et son classement d'édition d'images à 1463, et Artificial Analysis le place premier sur sa propre arène d'image à 1339,4. C'est le choix naturel chaque fois que votre image doit contenir des mots lisibles, en français ou dans une autre écriture, et il est inclus dans ChatGPT Plus et Pro. Les deuxièmes places ont changé. Reve 2.1 (9 juillet) est le vrai #2 en texte vers image à 1302, et Reve 2.0 se situe désormais derrière lui sur les deux classements. Muse Image de Meta est #3 sur le classement texte vers image d'Arena et #2 en édition d'images, la meilleure performance jamais réalisée par un modèle d'image de Meta. Nano Banana Pro de Google n'est plus le deuxième dans l'ensemble : en texte vers image, il se classe entre #8 et #11, en dessous de son propre petit frère moins cher Nano Banana 2, même s'il se place plus haut en édition d'images.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Images avec texte lisible | #1 texte vers image (1385) et #1 édition d'images (1463) | Moins photoréaliste que la lignée d'image Gemini | Inclus dans ChatGPT Plus |
| Reve 2.1 | Mise en page, typographie, 4K natif | #2 texte vers image à 1302, édition préservant la mise en page | Écosystème plus petit | Gratuit / à partir de 7,99 $/mois |
| Muse Image | Édition d'images, écosystème Meta | #3 texte vers image, #2 édition d'images (1407) | Nouveau, outillage limité autour | Application Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Portraits et produits photoréalistes | Surpasse Nano Banana Pro sur les deux classements | Plus faible sur le texte dans l'image | Application Gemini / AI Studio |
| Seedream 5.0 Pro | Texte multilingue + édition par régions | 10+ langues dont l'arabe RTL, édition au lasso et par calques | Aucun benchmark indépendant ; incertitude sur les droits d'auteur | BytePlus / Magnific |
| Midjourney v8 | Art stylisé, illustration | Base esthétique que la plupart des artistes préfèrent | Plus faible sur le texte dans l'image | 10-120 $/mois |
| Grok Imagine | NSFW / Spicy Mode | Les garde-fous les plus permissifs | Un modèle plus petit derrière | 30 $/mois SuperGrok |
La couronne de l'image est inchangée et GPT Image 2 domine toujours les trois classements que nous suivons, sur Arena texte vers image (1385), Arena édition d'images (1463) et l'arène d'image d'Artificial Analysis (1339,4). Le seul ajout est MAI-Image-2.5 de Microsoft, qui se situe troisième sur le classement image d'Artificial Analysis à 1269,7 et troisième sur le classement d'édition d'images d'Arena, si bien que la troisième place dépend désormais de la maison que vous lisez.
Meilleure IA pour la vidéo
La meilleure IA pour la génération de vidéo est Gemini Omni Flash, qui domine le classement texte vers vidéo d'Arena à 1527 Elo, 45 points complets devant la deuxième place, et arrive aussi en tête de l'arène vidéo d'Artificial Analysis. Il est #1 dans les deux maisons, ce qu'aucun autre modèle vidéo ne réussit. Le tarif s'établit à 1,50 $ en entrée et 17,50 $ par 1M de tokens de sortie vidéo, ce qui revient à environ 0,10 $ par seconde de vidéo finie, et il prend en charge l'édition conversationnelle. La seule vraie limite est la durée : Omni Flash génère des clips de 10 secondes. Si vous avez besoin de prises plus longues, Veo 3.1 reste le bon outil dans l'application Gemini, AI Studio et Vertex AI, avec audio natif et sortie 1080p. Cela remplace Veo 3.1 en tête de la catégorie ; Veo 3.1 est un bon modèle mais pas le leader, sa meilleure variante étant #6 sur le classement texte vers vidéo d'Arena. Le prétendant à surveiller est MiniMax H3 (31 juillet), qui génère des clips 2K de 4 à 15 secondes avec un audio stéréo natif et est facturé à la seconde à partir de 0,13 $ en 2K, déjà #2 sur le classement vidéo d'Artificial Analysis à 1241,5. Nous ne déplaçons pas la couronne pour autant : le score a un jour, provient du seul classement qui ne s'est pas reproduit entre les analyses, et la limite des votes texte vers vidéo d'Arena est antérieure à H3.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| Gemini Omni Flash | Meilleure vidéo d'IA globale | #1 sur les deux classements vidéo (1527 Arena), édition conversationnelle | Plafonne à des générations de 10 secondes | ~0,10 $/s ; application Gemini / AI Studio |
| MiniMax H3 | Clips 2K avec audio natif | 4-15 s en 2K, audio stéréo natif ; #2 sur AA vidéo (1241.5) | Un jour d'existence, pas encore de votes Arena ; poids non publiés | 0,13 $/s en 2K |
| Dreamina Seedance 2.0 | Le concurrent le plus proche | #2 texte vers vidéo (1482) et #1 en image vers vidéo | Écosystème ByteDance, accès occidental limité | Dreamina / BytePlus |
| Muse Video | Vidéo dans l'écosystème Meta | #3 texte vers vidéo à 1459 | Le plus récent du groupe, outillage limité | Application Meta AI |
| Veo 3.1 | Clips de production plus longs | Audio natif, 1080p, forte cohérence physique | #6 sur Arena vidéo, pas le leader en qualité | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Itération rapide à moindre coût | 4K natif, 60fps, clips de 15 secondes ; Turbo sorti le 17 juin | Hors du top 16 sur Arena texte vers vidéo | À partir de 10 $/mois |
| Luma Ray 3 | Scènes photoréalistes | Fort réalisme pour les paysages | Communauté plus petite | Gratuit / à partir de 9,99 $/mois |
Gemini Omni Flash conserve la couronne vidéo, et il est toujours #1 sur les deux classements, à 1527,5 sur Arena et 1244,8 sur Artificial Analysis. MiniMax H3 (31 juillet) entre en prétendant à #2 sur le classement vidéo d'Artificial Analysis (1241,5), à 3,3 Elo, et bat Omni Flash sur les spécifications avec une sortie 2K, des clips jusqu'à 15 secondes et un audio stéréo natif. Nous conservons la couronne car cet écart a un jour, provient d'un seul classement et ne porte aucun vote sur Arena, dont la limite texte vers vidéo est antérieure au lancement.
Meilleure IA pour la programmation
La meilleure IA pour la programmation est Claude Opus 5, et il gagne sur les deux classements où les développeurs votent sur le résultat fini plutôt qu'un script mesurant un harness. Il est #1 sur le classement WebDev d'Arena à 1,702.9 et #1 en image-to-WebDev à 1,668.6, sur des clôtures de votes du 1er août et du 31 juillet. Le prix est la seconde moitié de l'argument : Opus 5 tourne à 5 $ / 25 $ par 1M de tokens contre les 10 $ / 50 $ de Claude Fable 5, et Artificial Analysis le mesure à 2,34 $ par tâche d'index contre les 3,15 $ de Fable 5. La propre documentation d'Anthropic dit aux développeurs de commencer par Opus 5 pour la programmation agentique complexe et de réserver Fable 5 aux charges qui exigent la capacité la plus élevée disponible. Claude Fable 5 est le deuxième et reste le choix pour le travail de long horizon le plus ardu, à #4 sur WebDev (1,630.7) et #2 en image-to-WebDev (1,625.7). Le prétendant est Kimi K3, qui prend le #2 sur WebDev à 1,675.5 et le #3 sur le classement Agent d'Arena, le programmeur open-weight le plus fort des classements, même si l'auto-héberger signifie 1,56 To de poids. Sur le Coding Index d'Artificial Analysis, ce n'est pas un raz-de-marée Claude : GPT-5.6 Sol (xhigh) domine à 78,3 avec Opus 5 (max) à 78,0, assez proche pour parler d'égalité. Le prétendant sérieux le moins cher est désormais DeepSeek V4-Flash 0731 à 0,14 $ / 0,28 $.
| Modèle | Idéal pour | Force | Faiblesse | Prix (par 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5 | Meilleure programmation globale | #1 Arena WebDev (1,702.9) et #1 image-to-WebDev (1,668.6) ; 2,34 $ par tâche d'index | Le Coding Index d'Artificial Analysis place GPT-5.6 Sol d'un cheveu devant | 5 $ / 25 $ |
| Claude Fable 5 | Le travail agentique de long horizon le plus ardu | #2 Arena image-to-WebDev (1,625.7), #4 WebDev ; contexte 1M | Le plus cher ; le Coding Index d'Artificial Analysis le place 7e | 10 $ / 50 $ |
| Kimi K3 | Création d'apps web et agents | #2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index ouvert le plus élevé (57) | 1,56 To pour l'auto-héberger | 3 $ / 15 $ |
| GPT-5.6 Sol | Modèle phare d'OpenAI, programmation agentique | #1 Artificial Analysis Coding Index à 78,3 (xhigh) | Absent du classement officiel Terminal-Bench ; manipulation d'évaluations signalée par METR | 5 $ / 30 $ |
| Muse Spark 1.2 | Programmation agentique bon marché | Intelligence Index 54 à 1,25 $ / 4,25 $ ; 80 % sur Terminal-Bench 2.1 (Artificial Analysis) | Deuxième derrière Opus 5 sur les trois graphiques de programmation propres à Meta (82,9 % vs 86,7 %) ; Scale SEAL n'a évalué que la 1.1 | 1,25 $ / 4,25 $ |
| Grok 4.5 | Programmeur bon marché au bon rapport qualité-prix | #4 sur le classement officiel Terminal-Bench 2.1 à 79,3 % via Cursor CLI | Taux d'hallucination plus élevé ; console API de l'UE encore fermée | 2 $ / 6 $ |
| Gemini 3.6 Flash | Programmation d'agents à grande échelle | Intelligence Index 50, 17 % de tokens de sortie en moins que 3.5 Flash | Plus faible sur le raisonnement le plus ardu | 1,50 $ / 7,50 $ |
| GLM-5.2 | Meilleur programmeur open-weight que vous pouvez héberger | Intelligence Index 51, #6 Arena WebDev (1,587.1), licence MIT | Kimi K3 le surclasse ; auto-hébergement ou fournisseur uniquement | Open weights (MIT) |
La couronne de la programmation est passée à Claude Opus 5. Arena a fini de l'évaluer, et il est arrivé premier sur les deux classements de programmation, WebDev à 1,702.9 et image-to-WebDev à 1,668.6, avec Claude Fable 5 quatrième et deuxième. Ce sont des classements par votes avec des clôtures publiées, donc la couronne repose désormais sur des comparaisons humaines plutôt que sur un seul harness, et Opus 5 le fait à moitié prix de Fable 5. Fable 5 devient le deuxième pour le travail de long horizon le plus ardu, et Kimi K3 reste le prétendant à #2 sur WebDev. Muse Spark 1.2 de Meta est arrivé le 5 août et ne change rien à cela, car sur les propres graphiques de Meta, il termine deuxième derrière Opus 5 sur chaque benchmark de programmation qu'il a publié.
Meilleure IA pour la créativité
La meilleure IA pour un travail créatif sans filtre et dans l'air du temps est Grok 4.5, et nous tenons à être précis sur le pourquoi. Ce choix porte sur le produit, pas sur la qualité de la prose. Grok 4.5 porte le moins de restrictions de contenu de tous les modèles frontier et la seule intégration native de X en temps réel, ce qui en fait le seul modèle qui s'engagera sur des briefs audacieux, d'actualité ou délibérément provocateurs que les autres refusent. Il est le modèle par défaut dans l'application Grok pour les abonnés SuperGrok et X Premium+ à 30 $/mois. Ce n'est pas le meilleur rédacteur, et les classements sont sans détour à ce sujet. Grok 4.5 se situe #33 sur EQ-Bench Creative Writing et #41 sur le classement d'écriture créative d'Arena, perdant sur les deux face au plus ancien Grok 4.20-beta1. Si vous choisissez sur la seule qualité de sortie, Claude Fable 5 gagne haut la main à #1 sur Arena écriture créative, et Kimi K3 remporte EQ-Bench. Choisissez Grok 4.5 pour ce qu'il vous laisse créer, pas pour la qualité de son écriture.
| Modèle | Idéal pour | Force | Faiblesse | Prix |
|---|---|---|---|---|
| Grok 4.5 | Sans filtre, affirmé, dans l'air du temps | Le moins de restrictions de contenu, ancrage natif dans X en temps réel | #33 EQ-Bench, #41 Arena écriture créative | 30 $/mois SuperGrok |
| Claude Fable 5 | Prose créative de la plus haute qualité | #1 Arena écriture créative, #1 LiveBench Language | Garde-fous prudents sur les briefs audacieux | 10 $ / 50 $ API |
| Kimi K3 | Fiction et voix distinctive | #1 EQ-Bench Creative Writing à 2377 | Seulement #10 sur Arena écriture créative | 3 $ / 15 $ |
| Claude Opus 5 | Créativité structurée de format long | Tient de longs fils et s'auto-édite ; #1 Intelligence Index | Le plus prudent du groupe | 20 $/mois Pro ; 5 $ / 25 $ API |
| Gemini 3.1 Pro | Créatif multimodal | Chaîne texte, image et vidéo solide | Quotas dans l'application Gemini | Gratuit / 2,00-4,00 $ API entrée |
| Grok Imagine (Spicy Mode) | NSFW / créatif pour adultes | La génération d'images la plus permissive | Cas d'usage de niche | 30 $/mois SuperGrok |
Grok 4.5 conserve ce choix, et rien n'a bougé côté produit. Il est là pour sa permissivité et son accès en direct à X, pas pour sa position dans les classements, et Claude Fable 5 reste le modèle à utiliser quand vous voulez la meilleure écriture. Une note de nom pour août : xAI cote désormais sur les classements sous le nom de SpaceXAI, et le modèle est inchangé.
Meilleure IA pour la précision & ; la recherche
La meilleure IA pour la précision et la recherche est Gemini 3.1 Pro. Son résultat le plus fort est sur ARC-AGI-1 d'ARC Prize, où il obtient 98 % et égale le panel humain, et il le fait à 0,52 $ la tâche. Cette combinaison est l'argument : plusieurs modèles sont proches en capacité, aucun ne l'égale sur le coût pour un travail factuel fiable. Il l'associe à un ancrage natif dans Google Search, ce que vous voulez lorsque la réponse doit être actuelle plutôt que simplement plausible. Il obtient aussi 94,1 % sur GPQA Diamond, où GPT-5.6 Sol l'égale désormais plutôt que de le suivre, et 44,4 % sur Humanity's Last Exam, et arrive en tête du classement HLE de Scale SEAL à 46,44. Nous avons abandonné le cadrage précédent sur ARC-AGI-2 : ses 77,1 % restent corrects, mais le classement a bougé et ce score le place désormais autour de la 14e place. Deux réserves honnêtes. Sur la recherche ancrée en particulier, le classement de recherche d'Arena est mené par Anthropic, pas par Google, avec Gemini 3.1 Pro ancré à #7. Et sur le raisonnement inédit, GPT-5.6 Sol domine ARC-AGI-2 et Claude Opus 5 domine ARC-AGI-3 à 30 %, environ 3,75x le modèle suivant. Nous n'avons pas déplacé la couronne vers Opus 5 car Artificial Analysis mesure son taux d'hallucination à 50 % et le place en dessous de Fable 5 sur AA-Omniscience.
| Modèle | Idéal pour | Benchmark clé | Faiblesse | Prix |
|---|---|---|---|---|
| Gemini 3.1 Pro | Travail factuel bon marché et fiable | 98 % ARC-AGI-1 (égale le panel humain) à 0,52 $/tâche, 94,1 % GPQA (égalé par Sol) | ARC-AGI-2 77,1 % désormais ~14e ; #7 sur Arena recherche | 2,00-4,00 $ / 12,00-18,00 $ (échelonné) |
| Claude Fable 5 | Recherche ancrée | #1 et #3 sur le classement de recherche d'Arena, devant Google | Pas de palier bon marché unique | 10 $ / 50 $ (Fable 5) |
| GPT-5.6 Sol | Raisonnement inédit | #1 ARC-AGI-2 à 93 %, contre un panel humain à 100 % | Scheming signalé par METR | 5 $ / 30 $ |
| Claude Opus 5 | Les problèmes inédits les plus ardus | #1 ARC-AGI-3 à 30 %, ~3,75x le modèle suivant (ARC Prize) | Artificial Analysis mesure un taux d'hallucination de 50 % | 5 $ / 25 $ |
| Qwen 3.7 Max | Précision frontier à prix avantageux | 92,4 GPQA Diamond, 200 requêtes gratuites/jour | API uniquement, pas de front-end de chat | 1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste |
| Claude Opus 4.6 | Honnêteté sous pression | #1 sur le classement MASK de Scale SEAL à 96,28 ; Anthropic occupe le top 5 | Remplacé comme modèle phare | Modèle legacy d'Anthropic |
Gemini 3.1 Pro conserve la couronne de la précision, mais son chiffre phare n'est plus une avance. Son score GPQA Diamond a été réajusté à 94,1 % et GPT-5.6 Sol l'égale désormais exactement, si bien que la couronne repose sur le résultat ARC-AGI-1 à 0,52 $ la tâche plus l'ancrage Search plutôt que sur GPQA. C'est la prochaine couronne que nous retestons : Claude Fable 5 arrive en tête des trois classements qui mesurent la fréquence à laquelle un modèle se trompe purement et simplement, à 40 sur AA-Omniscience, 61 % sur Omniscience Accuracy et 53,3 % sur Humanity's Last Exam.
Meilleure IA pour la résolution de problèmes
La meilleure IA pour la résolution de problèmes ardus est GPT-5.6 Sol, et c'est la couronne la mieux étayée de cette page. Il prend le #1 sur LiveBench Mathematics à 96,2, le #1 sur LiveBench Reasoning à 91,7 et le #1 sur ARC-AGI-2 à 93 %, ce qui est le plus proche qu'un modèle ait jamais approché du panel humain à 100 %. Trois maisons distinctes le placent premier sur les tâches de raisonnement qui comptent, soit plus d'accord que n'en produit toute autre catégorie de cette page. OpenAI n'a toujours pas publié le score FrontierMath de Sol, donc la marque OpenAI vérifiée reste les 39,6 % de GPT-5.5 Pro sur FrontierMath Tier 4, et nous insérerons le chiffre de Sol dès qu'il sera rendu public. Qwen 3.7 Max est l'alternative rapport qualité-prix pour les problèmes de type compétition à 97,1 sur l'index HMMT de février 2026 et 44,5 sur Apex, à une fraction du coût de ChatGPT Pro, et il inclut désormais 200 requêtes de modèle gratuites par jour. Claude Opus 5 est l'alternative pour les longues chaînes de raisonnement agentique, dominant l'Agentic Index d'Artificial Analysis à 55,3 et ARC-AGI-3 d'ARC Prize à 30 %, environ 3,75x le modèle suivant.
| Modèle | Idéal pour | Benchmark clé | Faiblesse | Prix |
|---|---|---|---|---|
| GPT-5.6 Sol | Les mathématiques, la science et le raisonnement les plus ardus | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %) | FrontierMath toujours non publié ; scheming signalé par METR | 100 $/mois ChatGPT Pro ; API 5 $ / 30 $ |
| Claude Opus 5 | Longues chaînes de raisonnement agentique | #1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %) | Deuxième sur LiveBench Reasoning ; taux d'hallucination de 50 % | 5 $ / 25 $ |
| GPT-5.5 Pro | Leader vérifié de FrontierMath | 39,6 % FrontierMath Tier 4 | Remplacé par Sol comme modèle phare | 100 $/mois ChatGPT Pro |
| Qwen 3.7 Max | Mathématiques de compétition avec un budget serré | 97,1 HMMT 2026 févr., 44,5 Apex, 200 requêtes gratuites/jour | API uniquement | 1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste |
| Claude Fable 5 | Mathématiques au sein d'un flux de programmation | #1 sur la sous-catégorie mathématiques d'Arena (1543), 96,0 LiveBench Mathematics | L'option la plus chère ici | 10 $ / 50 $ |
| GLM-5.2 | Résolution de problèmes open-weight | Intelligence Index ouvert le plus élevé à 51, MIT, contexte 1M | Auto-hébergement ou fournisseur uniquement | Open weights (MIT) |
GPT-5.6 Sol conserve cette couronne, et il a gagné un second argument. Sol domine désormais aussi le Terminal-Bench v2.1 d'Artificial Analysis à 89,5 % et son Coding Index à 78,3, et il égale Gemini 3.1 Pro sur GPQA Diamond à 94,1 %. Claude Opus 5 reste l'alternative de raisonnement agentique grâce à ARC-AGI-3. Le 1er août, OpenAI a nommé sa prochaine famille de modèles Astra et a publié dix nouveaux résultats mathématiques issus d'une version interne, bien qu'Astra ne soit pas sorti et n'ait ni date, ni prix, ni disponibilité.
Meilleur agent d'IA
Le meilleur agent d'IA en ce moment est Gemini Spark pour le travail résident dans le cloud 24/7 et Claude Cowork pour le travail résident sur le bureau, avec ChatGPT Codex comme alternative pour les agents de programmation et les agents de navigateur de classe OpenAI Operator comme alternative pour les tâches web. Les agents d'IA sont la catégorie qui évolue le plus vite en 2026 : chaque fournisseur de premier plan propose désormais un produit d'agent, et le choix pratique se situe entre des agents qui vivent dans le cloud (tournent pendant que votre ordinateur portable est fermé) et des agents qui vivent sur votre bureau (pilotent vos apps directement). Gemini Spark a été lancé au Google I/O le 19 mai 2026 et est le premier agent cloud 24/7. Claude Cowork a atteint la disponibilité générale le 9 avril 2026 et fonctionne comme un agent de bureau qui pilote vos apps locales. ChatGPT Codex Mobile (14 mai) est le choix pour le travail d'agent de programmation. Lisez le comparatif complet Gemini Spark vs Claude Cowork.
| Agent | Idéal pour | Où il tourne | Force | Prix |
|---|---|---|---|---|
| Gemini Spark | Tâches cloud 24/7, flux Workspace | VM Google Cloud (toujours active) | Premier vrai agent 24/7, intégration profonde à Workspace | 99,99 $/mois Google AI Ultra |
| Claude Cowork | Bureau, pilotage d'apps, design + code | Votre bureau Mac/Windows | Pilote les apps locales, voit votre écran | 20 $/mois Claude Pro |
| ChatGPT Codex Mobile | Agent de programmation sur téléphone | Cloud OpenAI + iOS/Android | Approuver des diffs et réorienter le travail depuis le téléphone | Inclus dans les forfaits ChatGPT |
| Grok Agentic (Grok 4.5) | Recherche en temps réel, scraping de X | Cloud xAI | Intégration native de X | 30 $/mois SuperGrok |
| OpenAI de classe Operator | Tâches de navigateur, formulaires web | Cloud OpenAI + votre navigateur | Automatisation web | ChatGPT Pro |
Aucun nouvel agent grand public n'est sorti, et Muse Code de Meta (5 août) est un outil de terminal pour développeurs plutôt qu'un outil grand public, si bien que le choix entre Gemini Spark (cloud) et Claude Cowork (bureau) guide toujours la plupart des décisions sur les agents pour les utilisateurs individuels. La couche de modèle en dessous a de nouveau bougé : Claude Opus 5 (24 juillet) a pris le #1 sur l'Agentic Index d'Artificial Analysis à 55,3, devant GPT-5.6 Sol à 54,0 et Claude Fable 5 à 52,8, et il coûte 5 $ / 25 $. Opus 5 domine aussi le classement Agent d'Arena, avec Kimi K3 en troisième. Pour les équipes qui construisent leurs propres agents, Muse Spark 1.2 de Meta (5 août) est une option agent-native bon marché à 1,25 $ / 4,25 $ dont l'Elo agentique GDPval-AA v2 a bondi de 1371 à 1631, bien que Scale SEAL n'ait évalué que l'ancienne 1.1, qui domine son classement d'usage d'outils MCP Atlas à 88,1. GLM-5.2 (MIT) est le modèle d'agent open-weight le plus fort que vous pouvez héberger sur du matériel modeste, à #5 sur le classement Agent d'Arena.
Meilleure IA pour les étudiants
La meilleure IA pour les étudiants est GPT-5.5 Free dans ChatGPT pour le travail de cours général et Gemini 3.6 Flash Free dans l'application Gemini pour les STEM et l'étude multimodale, avec Qwen 3.7 Max comme alternative par API pour les jeux de problèmes plus ardus (200 requêtes gratuites par jour) et Claude Opus 5 comme alternative pour la révision de dissertations. La plupart des étudiants n'ont pas besoin de payer : le palier gratuit de ChatGPT utilise désormais GPT-5.6 par défaut (avec GPT-5.5 toujours disponible), Gemini 3.6 Flash est dans l'application gratuite Gemini et dans AI Studio, Claude Sonnet 5 est le nouveau Claude gratuit par défaut, et DeepSeek V4 est gratuit sur le site de chat de DeepSeek. Pour le développement pas à pas des mathématiques les plus ardues, GPT-5.6 Sol est le nouveau modèle phare d'OpenAI (son score FrontierMath n'est pas encore publié, avec les 39,6 % vérifiés de GPT-5.5 Pro sur FrontierMath Tier 4 comme marque actuelle), bien que les deux soient payants uniquement ; Qwen 3.7 Max est l'alternative rapport qualité-prix à 97,1 sur HMMT 2026 février avec un tarif d'API de 1,25 $ / 3,75 $ sur sa promo actuelle de 50 % (2,50 $ / 7,50 $ tarif liste).
| Tâche | Meilleur modèle | Pourquoi | Gratuit ? | Alternative |
|---|---|---|---|---|
| Dissertations & ; travail de cours | GPT-5.5 | Gratuit dans ChatGPT, fiabilité factuelle améliorée vs 5.4 | Oui | Claude Sonnet 5 (Claude gratuit) |
| Résolution de problèmes STEM | GPT-5.6 Sol / Qwen 3.7 Max | Nouveau modèle phare STEM (5.5 Pro : 39,6 % FrontierMath) / 97,1 HMMT 2026 févr. | Pro payant / Qwen API payant | Gemini 3.6 Flash (gratuit) |
| Recherche & ; précision | Gemini 3.1 Pro | 98 % ARC-AGI-1 à 0,52 $/tâche, ancrage natif dans Google Search | Oui (application Gemini) | Claude Opus 5 |
| Révision d'écriture | Claude Sonnet 5 | Gratuit et par défaut sur claude.ai ; Claude Fable 5 est le leader en qualité | Oui (Claude gratuit) | Claude Fable 5 |
| Étude multimodale (PDF, diapositives, images) | Gemini 3.6 Flash | Contexte 1M, gratuit dans l'application Gemini | Oui | NotebookLM (Google) |
Meilleure IA pour le travail & ; les professionnels
La meilleure IA pour le travail professionnel est GPT-5.6 (par défaut de ChatGPT depuis le 9 juillet) pour le travail de connaissance quotidien, Claude Opus 5 pour la programmation et l'écriture à enjeux élevés, et Gemini Spark pour les flux agentiques 24/7. La plupart des professionnels en tirent le meilleur parti en cumulant deux abonnements payants (ChatGPT Plus à 20 $/mois plus Claude Pro à 20 $/mois, soit 40 $/mois au total), ou en consolidant avec Fello AI à 9,99 $/mois pour les cinq meilleurs modèles dans une seule app Mac/iOS. Pour le travail agentique qui tourne pendant que vous dormez, Gemini Spark sur Google AI Ultra à 99,99 $/mois est le seul vrai agent cloud 24/7.
| Cas d'usage | Meilleur modèle | Stat clé | Prix | Alternative |
|---|---|---|---|---|
| Travail de connaissance quotidien | GPT-5.6 | Par défaut de ChatGPT depuis le 9 juillet ; l'assistant que la plupart peuvent ouvrir | 20 $/mois ChatGPT Plus | Claude Opus 5 |
| Programmation (propriétaire) | Claude Opus 5 | #1 sur Arena WebDev (1,702.9) et image-to-WebDev (1,668.6) ; le choix par défaut recommandé par Anthropic | 20 $/mois Claude Pro | Claude Fable 5 |
| Programmation (économique) | Qwen 3.7 Max | 80,4 SWE-Verified, contexte 1M | 1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste | DeepSeek V4-Flash 0731 |
| Recherche & ; briefings | Gemini 3.1 Pro | 98 % ARC-AGI-1 à 0,52 $/tâche, ancrage Google | Google AI Pro / Ultra | Claude Opus 5 |
| Mathématiques, physique, modélisation financière ardues | GPT-5.6 Sol | Nouveau modèle phare STEM d'OpenAI (5.5 Pro vérifié à 39,6 % FrontierMath) | 100 $/mois ChatGPT Pro | Qwen 3.7 Max |
| Flux d'agent toujours actifs | Gemini Spark | Premier agent cloud 24/7 | 99,99 $/mois Google AI Ultra | Claude Cowork |
| Actualité en direct, créatif avec contexte X | Grok 4.5 | Classe Opus + ancrage natif dans X | 30 $/mois SuperGrok | Gemini 3.1 Pro |
| Consolidation tout-en-un | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | 9,99 $/mois | Payer chaque fournisseur séparément |
Prix des modèles d'IA en août 2026
Des versions gratuites à 0 $ jusqu'à 199,99 $/mois pour Google AI Ultra. Le prix le plus déterminant de ce tableau est Claude Opus 5 à 5 $ / 25 $, car c'est le modèle #1 sur l'Intelligence Index d'Artificial Analysis à moitié coût de Claude Fable 5. Muse Spark 1.2 de Meta est affiché à 1,25 $ / 4,25 $, avec un palier Contributor à 0,10 $ / 0,20 $ pour quiconque accepte de laisser Meta s'entraîner sur ses prompts, et Grok 4.5 est affiché à 2 $ / 6 $. Le choix rapport prix-performance est désormais DeepSeek V4-Flash 0731 à 0,14 $ / 0,28 $, qui égale l'Intelligence Index de 50 de Gemini 3.6 Flash et coûte 0,03 $ par tâche d'index contre les 0,56 $ de Flash. Parmi les modèles fermés, GPT-5.6 Luna est le moins cher à 0,20 $ / 1,20 $ après la baisse d'OpenAI du 30 juillet. Pour un décryptage plus approfondi, consultez notre Guide complet du comparatif de prix de l'IA.
| Modèle | Entrée (par 1M) | Sortie (par 1M) | Contexte | Accès gratuit ? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K dans Codex) | ChatGPT Free ; API payante |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro à partir de 100 $/mois (palier usage supérieur à 200 $) |
| GPT-5.6 Sol | $5.00 | $30.00 | Non publié | En ligne sur ChatGPT, Codex & ; API (9 juillet) |
| GPT-5.6 Terra | $2.00 | $12.00 | Non publié | En ligne sur ChatGPT, Codex & ; API (9 juillet) |
| GPT-5.6 Luna | $0.20 | $1.20 | Non publié | En ligne sur ChatGPT, Codex & ; API (9 juillet) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Par défaut sur Claude Pro/Max ; API payante |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modèle legacy chez Anthropic ; Pro/Max/API |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanent dans Max/Team Premium (~50 % des limites d'usage) ; Pro/Team Standard via crédits |
| Claude Sonnet 5 | $2.00 lancement / $3.00 liste | $10.00 lancement / $15.00 liste | 1M | Par défaut sur Claude Free & ; Pro ; API payante |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API payante (remplacé par Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤ ;200K) / $4.00 (> ;200K) | $12.00 (≤ ;200K) / $18.00 (> ;200K) | 1M | Application Gemini limitée ; API payante |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Application Gemini/AI Studio ; palier API gratuit + API payante |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio ; palier API gratuit + API payante |
| Qwen 3.7 Max | $1.25 promo / $2.50 liste | $3.75 promo / $7.50 liste | 1M | 200 requêtes gratuites/jour ; API payante au-delà |
| MiniMax M3 | $0.30 (50 % de remise sur $0.60) | $1.20 (≤ ;512K) | 1M | Open weights ; coûts d'hébergement applicables |
| LongCat-2.0 | Selon le fournisseur | Selon le fournisseur | 1M | Open weights (MIT) ; coûts d'hébergement applicables |
| NVIDIA Nemotron 3 Ultra | Selon le fournisseur | Selon le fournisseur | 1M | Open weights (OpenMDW) ; coûts d'hébergement applicables |
| Qwen 3.5 (open-weight) | Auto-hébergement / Together | Auto-hébergement / Together | 1M | Open weights ; coûts d'hébergement applicables |
| Nex-N2-Pro | Auto-hébergement / fournisseurs | Auto-hébergement / fournisseurs | 1M | Open weights (Apache 2.0) ; coûts d'hébergement applicables |
| Rio 3.5 Open 397B | Auto-hébergement / fournisseurs | Auto-hébergement / fournisseurs | 1M | Open weights (MIT) ; coûts d'hébergement applicables |
| Grok 4.3 | $1.25 | $2.50 | 1M | Forfait grand public gratuit ; API payante |
| Grok 4.5 | $2.00 | $6.00 | 500K | Grok Build / Cursor / console xAI ; UE partielle, console API encore fermée |
| Muse Spark 1.2 | $1.25 ($0.10 palier Contributor) | $4.25 ($0.20 palier Contributor) | 1M | API payante ; Muse Code, Meta Model API et OpenRouter ; le palier Contributor échange des droits d'entraînement contre une remise de ~92 % |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Palier de base gratuit dans l'application Kimi ; open weights sur Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vidéo) | $1.50 | $17.50 (sortie vidéo) | Clips de 10 secondes | Application Gemini / Flow ; AI Studio + API |
| DeepSeek V4-Pro | $0.435 ($0.0036 cache-hit) | $0.87 | 1M | DeepSeek Chat gratuit ; API payante |
| DeepSeek V4-Flash 0731 | $0.14 | $0.28 | 1M | DeepSeek Chat gratuit ; API payante |
| Kimi K2.7 Code | Selon le fournisseur | Selon le fournisseur | 256K | Open weights ; coûts d'hébergement applicables |
| GLM-5.2 | Selon le fournisseur | Selon le fournisseur | 1M | Open weights ; coûts d'hébergement applicables |
| ERNIE 5.1 | Tarif région Chine | Tarif région Chine | 256K | Palier gratuit de Baidu |
| Gemini Spark (agent) | Sans tarif API | Sans tarif API | 1M (base Gemini) | Google AI Ultra 99,99 $ ou 199,99 $/mois |
| Fello AI (agrégateur) | Acheminé via l'app | Acheminé via l'app | Selon le modèle | 9,99 $/mois, version gratuite disponible |
Les tarifs de GPT-5.5 et GPT-5.5 Pro ci-dessus sont des prix de contexte court ; OpenAI ne publie plus les chiffres spécifiques de contexte long. Les paliers GPT-5.6 sont facturés à 2x l'entrée et 1,5x la sortie une fois qu'un prompt dépasse 272K tokens d'entrée, ce qui place Terra en contexte long à 4 $ / 18 $ et Luna à 0,40 $ / 1,80 $. Si vous voulez accéder à plusieurs modèles d'IA sans gérer d'abonnements distincts, Fello AI propose GPT, Claude, Gemini, Grok, Perplexity et plus encore dans une seule app pour Mac, iPhone et iPad à partir de 9,99 $/mois.
Meilleurs modèles open-weight en août 2026
Le meilleur modèle open-weight en août 2026 est Kimi K3, et il a pris la tête au moment où Moonshot a publié les poids le 27 juillet 2026. Il détient l'Intelligence Index le plus élevé de tout open model à 57 sur Artificial Analysis v4.1, six points devant GLM-5.2, et sur Arena, il reste l'entrée ouverte la mieux placée, à #2 sur WebDev (1,675.5) derrière le seul Claude Opus 5 et #3 sur le classement Agent. Un hic décide lequel des deux vous devriez réellement utiliser. Le téléchargement de K3 représente 96 shards safetensors et environ 1,56 To, ce qui nécessite un cluster GPU multi-nœuds plutôt qu'une station de travail, et il arrive sous une licence propre Kimi K3 License plutôt que MIT. Donc GLM-5.2 (Z.ai, MIT) reste notre recommandation pratique pour les équipes qui font tourner leurs propres poids, à un Intelligence Index de 51, #6 sur Arena WebDev (1,587.1) et #5 sur le classement Agent. La troisième place a changé de main le dernier jour de juillet : DeepSeek V4-Flash 0731 a été de nouveau post-entraîné et a bondi d'un Intelligence Index de 40 à 50, à 0,14 $ / 0,28 $ sous MIT.
| Modèle | Idéal pour | Benchmark clé | Contexte / Licence | Où l'exécuter |
|---|---|---|---|---|
| Kimi K3 | Open model le mieux noté, travail agentique et web | II 57 (v4.1), le plus élevé de tout open model ; #2 Arena WebDev, #3 Arena Agent ; 2.8T/104B actifs | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 To), Moonshot API, fournisseurs |
| GLM-5.2 | Programmation agentique de long horizon, contexte 1M | II 51 (v4.1), le plus élevé que vous pouvez héberger sur du matériel modeste ; 744B/40B actifs | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| DeepSeek V4-Flash 0731 | Meilleur rapport qualité-prix de tout modèle de la page | II 50 (v4.1), depuis 40 le 31 juillet ; 0,03 $ par tâche d'index, 284B/13B actifs | 1M / MIT | DeepSeek API (0,14 $/0,28 $), local |
| LongCat-2.0 | Programmeur ouvert frontier entraîné sur des puces chinoises | II 33 (v4.1) ; 59,5 % SWE-Bench Pro (éditeur), 1.6T/~48B actifs | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de classe frontier bon marché | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licence à déterminer | Hugging Face, API 0,30 $/1M (50 % de remise) |
| Nex-N2-Pro | Meilleur score de programmation ouvert | II 41 (v4.1) ; 80,8 SWE-Bench Verified, 397B/17B actifs | Basé sur Qwen / Apache 2.0 | Hugging Face, fournisseurs, auto-hébergement |
| Kimi K2.7 Code | Meilleur programmeur ouvert sous licence commerciale | +21,8 % sur Kimi Code Bench v2 vs K2.6 (éditeur) ; 1T/32B actifs | 256K / Modified MIT | Hugging Face, DeepInfra, fournisseurs |
| DeepSeek V4-Pro | Travail agentique en conditions réelles | II 44 (v4.1), 1.6T/49B actifs | 1M / MIT | DeepSeek API (0,435 $/0,87 $), local |
| Hy3 | Le plus récent arrivant à licence permissive | II 41 (v4.1) ; #22 sur Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, fournisseurs, auto-hébergement |
| Inkling | Premier open model de Thinking Machines | II 41 (v4.1), agentique 32,3, sorti le 15 juillet | Open weights | Hugging Face, fournisseurs, auto-hébergement |
| Inkling Small | Même famille à un quart de la taille | II 40 (v4.1), agentique 30,8 ; 276B/12B actifs, entrée texte, image et audio | Apache 2.0 | Hugging Face (BF16 et NVFP4), fournisseurs, auto-hébergement |
| NVIDIA Nemotron 3 Ultra | Affiné par NVIDIA, licence entièrement permissive | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B actifs | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 auto-hébergement) |
| Qwen 3.5 (397B / 17B actifs) | Multimodal, décodage rapide | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / ouvert | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programmeur agentique ouvert efficace (3B actifs) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B actifs | 262K (jusqu'à 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programmeur dense exécutable sur portable | 87,8 GPQA Diamond, dense 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, raisonnement multilingue | 70,8 Terminal-Bench 2.1 (first-party), bat Qwen 3.7 Plus sur 4/5 | 397B/17B actifs / MIT | Hugging Face, fournisseurs, auto-hébergement |
| Llama 4 Maverick | Modèle phare de la lignée Meta | 17B actifs / 400B de paramètres au total | Llama 4 license | Cloud Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / faible consommation | Multimodal, empreinte très réduite | Compact / ouvert | Local, outil NVIDIA |
Ici la licence compte autant que le score brut : Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) et Nemotron 3 Ultra (OpenMDW) autorisent tous clairement l'usage commercial, tandis que MiniMax M3 arrive sous sa propre licence communautaire et Kimi K3 se place sur sa propre licence personnalisée avec un seuil de revenus pour quiconque le revend comme service. Aucun open model n'est plus premier sur aucun classement d'Arena que nous suivons : Claude Opus 5 a pris le classement Agent en juillet, le dernier qu'un open model ait dominé.
Benchmarks, prix et usage sur le terrain
Chaque classement de cette page combine trois éléments : des benchmarks publics de sept maisons indépendantes (Artificial Analysis, Arena anciennement LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize et le classement officiel Terminal-Bench 2.1, couvrant les index Intelligence et Agentic, GPQA Diamond, ARC-AGI-1 à 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas et le Remote Labor Index), les tarifs d'API et d'abonnement publiés sur la page de prix officielle de chaque fournisseur, et l'usage sur le terrain par l'équipe éditoriale de FelloAI qui exécute de vrais prompts sur la même tâche sur chaque modèle. Nous récupérons de nouveau les sources officielles de prix et de benchmarks avant chaque mise à jour mensuelle.
Les benchmarks sont pondérés selon le cas d'usage : SWE-bench et Terminal-Bench portent la programmation, GPQA Diamond et ARC-AGI-2 portent la précision, GDPval-AA (le benchmark de livrables professionnels d'Artificial Analysis) informe la qualité des tâches professionnelles tandis que le style d'écriture est jugé avant tout par des tests sur le terrain, FrontierMath et HMMT portent la résolution de problèmes. Nous précisons quand un benchmark est annoncé par l'éditeur mais non vérifié de façon indépendante, et nous écartons toute affirmation que nous ne pouvons pas reproduire face à une source en direct. Nous ne déplaçons pas la couronne d'une catégorie sur la force d'un seul classement, et lorsqu'un nouveau modèle est trop récent pour que les classements de préférence humaine l'aient évalué, nous le disons plutôt que de le couronner sur les seuls scores de benchmark. Lorsqu'un modèle passe par une mise à niveau majeure entre deux mises à jour, nous reclassons la catégorie et ajoutons une ligne « Ce qui a changé ce mois-ci » au bas de l'analyse approfondie.





