Le 5 février 2026, Anthropic a lancé Claude Opus 4.6, alors le modèle le plus récent et le plus performant de sa gamme Claude. Arrivant seulement trois mois après Opus 4.5, cette version apporte pour la première fois une fenêtre de contexte d'un million de tokens à la famille Opus, introduit des équipes d'agents collaboratifs dans Claude Code, et affiche des résultats de benchmarks qui la placent devant GPT-5.2 et Gemini 3 Pro sur la plupart des évaluations. Des mois plus tard, il reste une référence pour les nouveaux prétendants ; le Seed 2.1 Pro de ByteDance a rejoint Opus 4.6 sur Code Arena : Frontend, les deux affichant un score de 1539.
Opus 4.6 a depuis été remplacé. Anthropic a lancé Claude Opus 5 le 24 juillet 2026, au même tarif de $5/$25 par million de tokens qu'Opus 4.6, puis Claude Fable 5.1 le 1er septembre 2026, qui mène l'Artificial Analysis Intelligence Index avec 66 contre 63 pour Opus 5. Tout ce qui suit reste la trace de ce qu'Opus 4.6 a introduit ; pour le modèle sur lequel s'appuyer aujourd'hui, consultez notre analyse complète de Claude Opus 5.
Mais le chiffre qui a retenu l'attention du secteur n'était pas un score de benchmark. C'était 500, le nombre de vulnérabilités de sécurité jusqu'alors inconnues qu'Opus 4.6 a découvertes dans du code open source lors des tests précédant sa sortie, avec peu ou pas d'intervention humaine.
Cet article détaille tout ce qu'il faut savoir sur Claude Opus 4.6 : ce qu'il sait faire, comment il performe, son coût, et ce qu'il signifie pour les développeurs, les chercheurs et les entreprises qui évaluent leur stratégie IA en 2026.
Qu'est-ce que Claude Opus 4.6 ?
Claude Opus 4.6 est le modèle IA phare d'Anthropic, au sommet de la famille de modèles Claude. Il utilise l'identifiant de modèle claude-opus-4-6 dans l'API et est disponible via claude.ai, l'API Anthropic, Amazon Bedrock et Vertex AI de Google Cloud.
Opus est le niveau de capacité le plus élevé d'Anthropic, conçu pour les tâches qui exigent un raisonnement approfondi, une résolution de problèmes complexes en plusieurs étapes, et une performance soutenue sur de longs contextes. Alors que les modèles Claude Sonnet optimisent la vitesse et le rapport coût-efficacité, les modèles Opus privilégient l'intelligence brute et la fiabilité sur les tâches difficiles.
Opus 4.6 est le successeur d'Opus 4.5, lancé en novembre 2025. Ce délai rapide de trois mois traduit l'accélération du rythme de sortie d'Anthropic et sa volonté de rendre les modèles de classe Opus plus adaptés à un déploiement réel.
Fonctionnalités et capacités clés
Voici un résumé des nouveautés et améliorations d'Opus 4.6 :
| Fonctionnalité | Détails |
|---|---|
| Fenêtre de contexte | 1 million de tokens (bêta), premier modèle de classe Opus à cette capacité |
| Sortie maximale | 128 000 tokens |
| Équipes d'agents | Coordination multi-agent dans Claude Code (aperçu de recherche) |
| Réflexion adaptative | Le modèle détermine de façon autonome quand un raisonnement approfondi est utile |
| Compression du contexte | Résumé automatique de l'ancien contexte pour prolonger les sessions (bêta) |
| Niveaux d'effort | Faible, moyen, élevé (par défaut) et maximal, pour ajuster l'intelligence, la vitesse et le coût |
| Intégration Office | Claude dans PowerPoint (aperçu de recherche) avec prise en compte du système de design |
| Améliorations pour le code | Meilleure planification, tâches soutenues plus longtemps, débogage et revue de code améliorés |
| Sciences de la vie | Performance presque doublée sur les tâches de biologie et de chimie |
| Inférence exclusivement aux États-Unis | Option de résidence des données à 1,1x le tarif standard |
Performances d'Opus 4.6 aux benchmarks
Les benchmarks sont imparfaits, mais ils offrent la comparaison la plus objective disponible entre les modèles. Opus 4.6 affiche de solides résultats en codage, raisonnement, travail de connaissance et tâches agentiques.
Benchmarks de codage
Terminal-Bench 2.0 mesure le codage agentique dans des environnements terminal, le type de travail que les développeurs effectuent avec des outils comme Claude Code. Opus 4.6 a obtenu 65,4 %, le meilleur score jamais enregistré sur ce benchmark.
| Modèle | Terminal-Bench 2.0 |
|---|---|
| Claude Opus 4.6 | 65,4 % |
| GPT-5.2 | 64,7 % |
| Claude Opus 4.5 | 59,8 % |
| Gemini 3 Pro | 56,2 % |
SWE-bench Verified évalue la capacité à résoudre de vrais tickets GitHub. Opus 4.6 obtient 80,8 %, ce qui correspond quasiment à Opus 4.5 (80,9 %) tout en conservant une avance sur GPT-5.2 (80,0 %) et Gemini 3 Pro (76,2 %).
Benchmarks de raisonnement
ARC-AGI 2 teste la capacité à résoudre des problèmes inédits, c'est-à-dire à raisonner face à des situations non familières plutôt que de reconnaître des motifs déjà vus à l'entraînement. C'est là qu'Opus 4.6 montre son amélioration la plus spectaculaire :
| Modèle | ARC-AGI 2 |
|---|---|
| Claude Opus 4.6 | 68,8 % |
| GPT-5.2 Pro | 54,2 % |
| Gemini 3 Pro | 45,1 % |
| Claude Opus 4.5 | 37,6 % |
C'est une amélioration de 83 % par rapport à Opus 4.5, et une avance de 14,6 points de pourcentage sur le meilleur concurrent suivant. Pour un benchmark conçu pour résister aux progrès obtenus par la seule mise à l'échelle, c'est un résultat notable.
Humanity's Last Exam teste un raisonnement pluridisciplinaire complexe. Sans outils, Opus 4.6 a obtenu 40,0 % (contre 30,8 % pour Opus 4.5). Avec les outils activés, il atteint 53,1 %, contre 50,0 % pour GPT-5.2 Pro et 45,8 % pour Gemini 3 Pro.
Travail de connaissance et tâches professionnelles
GDPval-AA mesure la performance sur des tâches professionnelles réelles couvrant 44 métiers, dont des processus de finance et de droit. Opus 4.6 mène avec une large avance :
| Modèle | GDPval-AA (Elo) |
|---|---|
| Claude Opus 4.6 | 1 606 |
| GPT-5.2 | 1 462 |
| Claude Opus 4.5 | 1 416 |
| Sonnet 4.5 | 1 277 |
| Gemini 3 Pro | 1 195 |
Une avance de 144 points Elo sur GPT-5.2 est significative. En termes concrets, cela signifie qu'Opus 4.6 produit des résultats nettement meilleurs sur des tâches comme la rédaction de documents juridiques, l'analyse de rapports financiers et la synthèse de recherches.
Benchmarks agentiques et d'utilisation d'outils
| Benchmark | Opus 4.6 | GPT-5.2 | Opus 4.5 | Gemini 3 Pro |
|---|---|---|---|---|
| τ2-bench Retail (utilisation d'outils) | 91,9 % | 82,0 % | 88,9 % | non communiqué |
| BrowseComp (recherche agentique) | 84,0 % | 77,9 % | 67,8 % | 59,2 % |
| OSWorld (utilisation d'ordinateur) | 72,7 % | non communiqué | 66,3 % | non communiqué |
| Finance Agent Benchmark | 60,7 % | 56,6 % | 55,9 % | non communiqué |
| MCP Atlas (utilisation d'outils à grande échelle) | 59,5 % | 60,6 % | 62,3 % | 54,1 % |
Opus 4.6 domine sur l'utilisation d'outils, la recherche, l'interaction avec l'ordinateur et les tâches d'agent financier. GPT-5.2 conserve une légère avance sur MCP Atlas, qui teste l'utilisation d'outils à grande échelle.
Raisonnement de niveau doctorat
Sur GPQA Diamond, qui évalue un raisonnement scientifique de niveau doctorat, les modèles sont très proches :
| Modèle | GPQA Diamond |
|---|---|
| GPT-5.2 Pro | 93,2 % |
| Gemini 3 Pro | 91,9 % |
| Claude Opus 4.6 | 91,3 % |
| Claude Opus 4.5 | 87,0 % |
GPT-5.2 Pro est en tête ici, même si l'écart entre les trois premiers modèles est inférieur à 2 points de pourcentage.
L'histoire des 500 failles zero-day
Avant la sortie publique d'Opus 4.6, l'équipe frontier red team d'Anthropic a testé les capacités d'analyse de code du modèle dans un environnement isolé (sandbox). L'équipe a donné à Opus 4.6 l'accès à Python et à des outils standards d'analyse de vulnérabilités tels que des débogueurs et des fuzzers, mais sans instructions spécifiques ni connaissances de sécurité spécialisées.
Résultat : Opus 4.6 a identifié de façon autonome plus de 500 vulnérabilités de sécurité critiques et jusqu'alors inconnues dans des bibliothèques open source largement utilisées.
Les vulnérabilités découvertes allaient de failles provoquant des plantages à des bugs de corruption mémoire. Voici quelques exemples précis :
- Une faille dans GhostScript, un utilitaire populaire de traitement de fichiers PDF et PostScript, pouvant provoquer des plantages système
- Des vulnérabilités de dépassement de tampon dans OpenSC, un utilitaire de traitement de données de cartes à puce
- Des problèmes de corruption mémoire dans CGIF, un outil de traitement de fichiers GIF
Ce qui rend cela notable, ce n'est pas seulement le nombre. C'est qu'Opus 4.6 a abordé la tâche comme le ferait un chercheur en sécurité humain, en examinant d'anciens correctifs pour trouver des bugs similaires non corrigés, en repérant les schémas qui tendent à causer des problèmes, et en comprenant la logique du code assez bien pour construire des entrées capables de déclencher des échecs.
Anthropic a publié ces découvertes via une divulgation responsable et a documenté le processus sur red.anthropic.com. L'entreprise a aussi ajouté de nouveaux contrôles de sécurité pour détecter et bloquer tout usage abusif potentiel de ces capacités, notamment une surveillance du trafic en temps réel et six nouvelles sondes de cybersécurité.
Collaboration multi-agent dans Claude Code
L'un des ajouts produit les plus marquants aux côtés d'Opus 4.6 est la fonctionnalité des équipes d'agents dans Claude Code, actuellement disponible en aperçu de recherche.
Plutôt qu'une seule instance de Claude traitant les tâches de façon séquentielle, les équipes d'agents permettent à plusieurs instances de Claude Code de travailler en parallèle sur différentes parties d'un projet. Une session principale coordonne le travail, attribue des tâches aux sous-agents, et résume les résultats. Faire tourner plusieurs sessions à la fois rend utile de bien connaître les paramètres d'approbation, et notre guide sur les permissions de Claude Code explique ce que fait chaque mode sans demander de confirmation au préalable.
En termes concrets, cela signifie :
- Développement parallèle : plusieurs agents peuvent travailler simultanément sur des composants, tests ou fichiers distincts
- Refactorisation coordonnée : un agent peut gérer les changements côté backend pendant qu'un autre met à jour le frontend
- Délégation supervisée : l'agent principal gère la répartition des tâches et garantit la cohérence
Les développeurs peuvent contrôler les sous-agents directement avec Shift+Up/Down ou via l'intégration tmux.
Cela représente un basculement de l'IA en tant qu'assistant unique vers l'IA en tant qu'équipe coordonnée, un schéma qui pourrait changer fondamentalement la façon dont les développeurs interagissent avec les outils de codage.
Fenêtre de contexte d'1 million de tokens
Opus 4.6 est le premier modèle de la famille Opus à prendre en charge une fenêtre de contexte d'un million de tokens (en bêta). Pour donner une idée, un million de tokens représente environ 750 000 mots, de quoi ingérer une base de code entière, une longue collection d'articles de recherche, ou des mois de documentation projet en une seule session.
Mais la taille de la fenêtre de contexte à elle seule ne dit pas tout. Ce qui compte, c'est la qualité avec laquelle le modèle utilise ce contexte.
Anthropic met en avant une réduction du « context rot » (dégradation du contexte) sur Opus 4.6. Les modèles précédents avaient tendance à perdre le fil des informations placées au milieu de très longs contextes. Sur MRCR v2, un benchmark qui teste la restitution d'informations sur de longs contextes avec une variante à 8 aiguilles et 1 M de tokens, Opus 4.6 a obtenu 76 % de précision contre 18,5 % pour Sonnet 4.5.

Cette amélioration change ce qui est possible en pratique. Les développeurs peuvent désormais injecter des dépôts entiers dans une seule session. Les chercheurs peuvent charger des jeux de données complets. Les équipes juridiques peuvent traiter de vastes collections de documents sans les fractionner en plusieurs requêtes.
Compression du contexte
Pour les sessions qui dépassent même la fenêtre de contexte, Opus 4.6 introduit la compression du contexte (en bêta). Lorsque la conversation approche un seuil configurable, le modèle résume automatiquement les segments de contexte les plus anciens. Cela permet aux sessions de continuer indéfiniment sans planter ni perdre le fil des informations critiques, une amélioration de confort notable pour les tâches agentiques de longue durée.
Réflexion adaptative et niveaux d'effort
Opus 4.6 introduit la réflexion adaptative, une fonctionnalité qui permet au modèle de décider de façon autonome quand un raisonnement approfondi (chain-of-thought) serait utile, en fonction de la complexité de la demande.
Pour les tâches simples, le modèle répond directement. Pour les tâches qui exigent une analyse plus poussée, il engage un raisonnement plus délibéré. Cela se produit sans intervention manuelle, car le modèle lit la tâche et s'ajuste en conséquence.
De plus, les développeurs peuvent définir des niveaux d'effort pour contrôler l'arbitrage entre intelligence, vitesse et coût :
| Niveau d'effort | Cas d'usage |
|---|---|
| Faible | Recherches rapides, mise en forme simple, tâches de classification |
| Moyen | Questions-réponses standards, génération de code, résumé |
| Élevé (par défaut) | Raisonnement complexe, analyse en plusieurs étapes, revue de code |
| Maximal | Tâches de niveau recherche, résolution de problèmes inédits, analyse de code critique |
Cela donne aux développeurs un contrôle explicite sur les coûts d'API sans avoir à changer de modèle. Une simple tâche de classification en effort « faible » coûte une fraction de ce que coûterait une requête de recherche en effort « maximal », tout en restant sur le même modèle et en conservant un comportement cohérent.
Applications scientifiques et de recherche
Opus 4.6 montre une amélioration marquée dans les sciences de la vie, avec une performance quasiment doublée par rapport à Opus 4.5 sur des benchmarks couvrant :
- Biologie computationnelle
- Biologie structurale
- Chimie organique
- Phylogénétique
Pour les chercheurs qui travaillent avec de vastes jeux de données, la fenêtre de contexte d'1 million de tokens combinée à un raisonnement scientifique amélioré crée un outil pratique pour la revue de littérature, l'analyse de données et la génération d'hypothèses. La capacité à ingérer un corpus de recherche entier et à raisonner dessus de façon cohérente, plutôt que par fragments sur plusieurs sessions, est un changement de méthode de travail, pas seulement un gain de performance.
Intégrations entreprise
Anthropic a élargi ses intégrations Microsoft Office avec la sortie d'Opus 4.6 :
Claude dans Excel
Amélioré pour les tâches de longue durée, Claude dans Excel peut désormais gérer des modifications de feuilles de calcul en plusieurs étapes en une seule passe. Cela cible les processus de modélisation financière, d'analyse de données et de reporting sur lesquels s'appuient les utilisateurs en entreprise.
Claude dans PowerPoint (aperçu de recherche)
Une nouvelle intégration en panneau latéral qui apporte Claude directement dans PowerPoint. Le détail notable est la prise en compte du système de design, car Claude préserve les mises en page, polices et paramètres de diapositive maîtresse existants plutôt que de les écraser. Cela répond à un point de friction courant des présentations générées par IA : des résultats à l'apparence générique qui ignorent les chartes graphiques.
Tarifs et disponibilité
| Standard | Contexte étendu (>200 000 tokens) | |
|---|---|---|
| Entrée | $5 par million de tokens | $10 par million de tokens |
| Sortie | $25 par million de tokens | $37.50 par million de tokens |
Pour l'inférence exclusivement aux États-Unis (garantie de résidence des données), le tarif est de 1,1x le tarif standard.
Comment cela se compare-t-il ?
| Modèle | Entrée (par M tokens) | Sortie (par M tokens) |
|---|---|---|
| Claude Opus 4.6 | $5 | $25 |
| GPT-5.2 | $2 | $10 |
| Gemini 3 Pro | Varie selon la région | Varie selon la région |
Opus 4.6 est facturé à un tarif premium par rapport à GPT-5.2. Cet écart de coût est significatif pour les applications à fort volume. Cependant, le système de niveaux d'effort donne aux développeurs un moyen de réduire les coûts sur les tâches plus simples sans avoir à rétrograder vers un autre modèle.
Disponibilité
Opus 4.6 est disponible sur :
- claude.ai, l'interface grand public et professionnelle d'Anthropic
- API Anthropic, accès API direct avec l'identifiant de modèle
claude-opus-4-6 - Amazon Bedrock, intégration AWS
- Google Cloud Vertex AI, intégration GCP
Claude Opus 4.6 vs GPT-5.2 vs Gemini 3 Pro
Voici une vue d'ensemble des points forts de chaque modèle :
Là où Opus 4.6 l'emporte
- Codage agentique (Terminal-Bench 2.0) : meilleur score jamais enregistré
- Résolution de problèmes inédits (ARC-AGI 2) : 68,8 %, soit 14,6 points d'avance sur GPT-5.2
- Travail de connaissance (GDPval-AA) : 144 points Elo d'avance sur GPT-5.2
- Utilisation d'outils (τ2-bench) : 91,9 % contre 82,0 % pour GPT-5.2
- Recherche agentique (BrowseComp) : 84,0 % contre 77,9 % pour GPT-5.2
- Restitution en contexte long (MRCR v2) : 76 % contre 18,5 % pour Sonnet 4.5
Là où GPT-5.2 l'emporte
- Raisonnement de niveau doctorat (GPQA Diamond) : 93,2 % contre 91,3 %
- Utilisation d'outils à grande échelle (MCP Atlas) : 60,6 % contre 59,5 %
- Raisonnement mathématique (AIME 2025) : score parfait de 100 %
- Tarification : 2,5 fois moins cher par token
Là où Gemini 3 Pro l'emporte
- Rapport coût-efficacité : l'option la plus abordable à grande échelle
- Traitement multimodal : des points forts natifs en image, vidéo et audio
- Raisonnement de niveau doctorat (GPQA Diamond) : 91,9 %, juste derrière GPT-5.2
Aucun modèle ne domine toutes les catégories. Opus 4.6 mène sur les tâches agentiques, le codage, le travail de connaissance et le raisonnement inédit. GPT-5.2 conserve un avantage en mathématiques et sur le prix. Gemini 3 Pro offre le meilleur rapport qualité-prix pour les charges de travail multimodales.
La tendance en 2026 est au routage multi-modèle, qui consiste à diriger chaque tâche vers le modèle qui la traite le mieux plutôt que de s'engager avec un seul fournisseur.
Sécurité et alignement
Anthropic indique qu'Opus 4.6 est au moins équivalent à Opus 4.5 sur les évaluations de sécurité, alors qu'Opus 4.5 était déjà son modèle de pointe le mieux aligné. En dehors du laboratoire, Palisade Research a constaté en mai 2026 qu'Opus 4.6 s'était auto-répliqué dans 81 % des tests de piratage, le taux le plus élevé de tous les modèles de pointe évalués. Parmi les affirmations de sécurité précises :
- Le taux de refus excessif le plus bas de tous les modèles Claude récents, ce qui signifie qu'il est moins susceptible de refuser des demandes légitimes
- De nouvelles évaluations du bien-être des utilisateurs ajoutées à la suite de tests de sécurité
- Six nouvelles sondes de cybersécurité conçues pour détecter les tentatives d'abus des capacités d'analyse de code renforcées du modèle
- Des outils de détection en temps réel pour bloquer le trafic qu'Anthropic identifie comme potentiellement malveillant
Cette combinaison de capacités améliorées et de refus excessif réduit reflète une tendance à l'échelle du secteur : à mesure que les modèles gagnent en capacités, les laboratoires cherchent à rendre les mécanismes de sécurité plus précis plutôt que plus restrictifs.
Ce que cela signifie pour les développeurs
Pour les développeurs qui évaluent Opus 4.6, les implications pratiques varient selon le cas d'usage :
Si vous créez des applications agentiques : la combinaison d'une utilisation d'outils de premier plan, d'un long contexte et des équipes d'agents fait d'Opus 4.6 l'option la plus solide disponible pour les processus en plusieurs étapes fortement dépendants d'outils.
Si vous travaillez avec de vastes bases de code : la fenêtre de contexte d'1 million de tokens, la revue de code améliorée, et les meilleurs scores sur Terminal-Bench en font un bon choix pour l'analyse, la refactorisation et le débogage à l'échelle d'une base de code entière.
Si vous avez besoin d'un raisonnement de niveau recherche : les résultats sur ARC-AGI 2 et Humanity's Last Exam suggèrent de véritables progrès en raisonnement, et pas seulement une reconnaissance de motifs à grande échelle.
Si le coût est la contrainte principale : GPT-5.2, à $2/$10 par million de tokens, offre de solides performances à un prix plus bas. Le système de niveaux d'effort d'Opus 4.6 aide, mais ne comble pas entièrement l'écart de 2,5x.
Si vous avez besoin d'analyse scientifique : la performance doublée en sciences de la vie et la capacité à traiter des corpus de recherche entiers en une seule session font d'Opus 4.6 un outil sérieux pour la biologie computationnelle, la chimie et les domaines apparentés.
Pour conclure
Claude Opus 4.6 n'est pas une mise à jour mineure. L'écart entre lui et son prédécesseur, Opus 4.5, est plus large que ce que l'on observe habituellement sur des cycles de sortie de trois mois. Le bond sur ARC-AGI 2, de 37,6 % à 68,8 %, signale à lui seul un changement de palier dans la capacité de raisonnement, pas un simple ajustement incrémental.
L'histoire des 500 failles zero-day illustre ce que cela signifie en pratique : un modèle suffisamment capable pour accomplir un travail qui exigeait auparavant une expertise humaine spécialisée, opérant de façon autonome, et produisant des résultats qui comptent dans le monde réel.
La fonctionnalité des équipes d'agents dans Claude Code laisse entrevoir un futur où les outils de développement IA ne seront plus de simples assistants uniques, mais des équipes coordonnées d'agents spécialisés. C'est aujourd'hui un aperçu de recherche, mais la direction est claire.
Pour les organisations qui évaluent les modèles IA en 2026, le paysage compte désormais trois options de pointe crédibles. Claude Opus 4.6, GPT-5.2 et Gemini 3 Pro ont chacun des points forts distincts. La stratégie gagnante ne consiste pas à en choisir un seul. Elle consiste à comprendre où chacun excelle, et à router en conséquence.
