Le modèle Qwen3.7-Max d'Alibaba a été lancé le 20 mai 2026 lors de l'Alibaba Cloud Summit à Hangzhou, et les chiffres parlent d'eux-mêmes. Il a obtenu 56,6 sur l'Artificial Analysis Intelligence Index au lancement (5e place cette semaine-là, actuellement dans le top 10 sur 151 modèles évalués), ce qui en fait le modèle chinois le mieux classé sur ce leaderboard à ce jour. Il dispose d'une fenêtre de contexte d'un million de tokens, coûte $2.50 par million de tokens en entrée, et les tests internes d'Alibaba font état d'un run de codage autonome de 35 heures ayant déclenché 1 158 appels d'outils et atteint une accélération de 10× par rapport à la référence Triton standard.
Est-il vraiment meilleur que GPT-5.5, Claude Opus 4.7 ou Gemini 3.5 ? En résumé, sur la base du rapport intelligence/prix, Qwen3.7-Max est désormais l'un des modèles frontier les plus compétitifs accessibles via une API. La réponse longue comporte un bémol concernant son score d'hallucination que vous devriez connaître avant de parier votre workflow dessus. Nous avons analysé les benchmarks publiés, consulté la grille tarifaire officielle et décrypté ce que ce lancement signifie concrètement pour l'écosystème du codage, des agents et des outils IA à l'orée de mi-2026.
Les points clés
- Qwen3.7-Max obtient 56,6 sur l'Artificial Analysis Intelligence Index, classé dans le top 10 mondial et meilleur placement jamais atteint par un modèle chinois
- Fenêtre de contexte d'un million de tokens et sortie maximale de 65 536 tokens, avec le raisonnement étendu activé par défaut
- Tarif API de $2.50 en entrée / $7.50 en sortie par million de tokens, avec l'entrée mise en cache réduite à $0.25 par million (remise de 90 %)
- Démonstration de 35 heures de codage autonome continu, 1 158 appels d'outils et une accélération géométrique de 10× par rapport au noyau de référence Triton
- Modèle propriétaire (sans poids ouverts), disponible via Alibaba Cloud Model Studio, OpenRouter et l'intégration directe dans Claude Code via le protocole API Anthropic
Qu'est-ce que Qwen3.7-Max ?
Qwen3.7-Max est le modèle de raisonnement propriétaire phare d'Alibaba, conçu comme une « base pour agents » plutôt que comme un assistant conversationnel généraliste. Il succède à Qwen3.6 Max Preview et est le premier modèle Qwen à franchir la barre du million de tokens de contexte, passant de 256 K. Il utilise le raisonnement par chaîne de pensée étendu par défaut et est positionné pour rivaliser directement avec GPT-5.5, Claude Opus 4.7 et Gemini 3.5 Flash sur les tâches nécessitant une autonomie longue durée.
En parallèle de Qwen3.7-Max, Alibaba a discrètement publié Qwen3.7-Plus-Preview, une variante multimodale qui ajoute la vision et fonctionne à un prix plus bas. Plus est le choix économique pour les workloads de routine à fort volume, tandis que Max est le modèle de référence pour le raisonnement, le codage agentique et les contextes à l'échelle d'un document. Contrairement à de nombreuses versions Qwen précédentes, aucun des deux modèles n'est en open-weight ; tous deux fonctionnent exclusivement via l'API hébergée d'Alibaba. En juin 2026, la mairie de Rio de Janeiro a publié Rio 3.5 Open 397B, un fine-tune en open-weight qui se compare à Qwen 3.7 Plus dans ses benchmarks.
Benchmarks : comment se positionne Qwen3.7-Max ?
Les chiffres de lancement sont solides sur toute la ligne. Selon Artificial Analysis, Qwen3.7-Max se situe entre Gemini 3.5 Flash et Claude Opus 4.7 sur l'Intelligence Index global, mais dépasse sa catégorie sur plusieurs benchmarks de raisonnement exigeants.
| Modèle | AA Intelligence Index | Entrée $/M | Sortie $/M | Contexte |
|---|---|---|---|---|
| GPT-5.5 | 60,2 | $5.00 | $30.00 | 1M |
| Claude Opus 4.7 | 57,3 | $5.00 | $25.00 | 1M |
| Qwen3.7-Max | 56,6 | $2.50 | $7.50 | 1M |
| Gemini 3.5 Flash | 55,3 | $1.50 | $9.00 | 1M |
| DeepSeek V4 Pro | 52,0 | $1.74 | $3.48 | 1M |
Sur les benchmarks individuels, Qwen3.7-Max obtient 92,4 sur GPQA Diamond (devant Claude Opus 4.6 Max à 91,3, derrière GPT-5.5 à 93,6) et 97,1 sur HMMT 2026 February, le score le plus élevé de son groupe de comparaison. Il atteint également 44,5 sur Apex (bien devant DeepSeek V4 Pro à 38,3), 80,4 sur SWE-Verified pour les tâches d'ingénierie logicielle, et 41,4 sur Humanity's Last Exam, devançant légèrement Opus 4.6 Max à 40,0.
Le bémol honnête : le faible taux d'hallucination de Qwen3.7-Max est en partie dû à un taux d'abstention plus élevé. Selon l'analyse des benchmarks d'Officechai, le taux de tentative du modèle est tombé à 48,0 %, le plus bas parmi les modèles frontier comparables. En clair, il refuse de répondre plus souvent, ce qui réduit les erreurs mais aussi l'utilité sur les cas limites. Ce compromis est important si vous l'intégrez dans un agent qui doit avancer malgré l'ambiguïté.
Tarifs : $2.50 en entrée, $7.50 en sortie, $0.25 en cache
Qwen3.7-Max est l'un des modèles frontier les mieux tarifés du marché actuellement. L'API coûte $2.50 par million de tokens en entrée et $7.50 par million de tokens en sortie, avec une sortie maximale de 65 536 tokens par requête. L'entrée mise en cache descend à $0.25 par million de tokens, soit une remise de 90 % qui rend les appels répétés en contexte long très abordables.
$0.25 pour l'entrée en cache : l'atout décisif
Pour les workflows agentiques qui relisent la même base de code, le même document ou le même historique de conversation sur des centaines de tours, la remise sur le cache fait de Qwen3.7-Max une exception tarifaire. Claude Opus 4.7 facture $5 par million de tokens en entrée et $25 en sortie, soit le double en entrée et plus du triple en sortie par rapport à Qwen3.7-Max. GPT-5.5 est à $5 en entrée et $30 en sortie, le plus cher du lot. Gemini 3.5 Flash ($1.50/$9) et DeepSeek V4 Pro ($1.74/$3.48) sont moins chers mais obtiennent des scores inférieurs sur les benchmarks de raisonnement. Si votre workload repose sur un « long contexte, nombreux appels d'outils, réflexion occasionnelle », Qwen3.7-Max occupe la position idéale entre intelligence frontier et tarification frontier.
Où accéder au modèle
L'API est disponible sur Alibaba Cloud Model Studio, OpenRouter et Together AI, tandis que Qwen Chat (chat.qwen.ai) propose un accès en prévisualisation gratuite et limitée via le web. Il n'existe pas de niveau gratuit permanent, et la variante Plus-Preview est limitée au texte sur l'API même si elle accepte les images via l'interface de chat.
Le run autonome de 35 heures, expliqué
La démonstration phare du lancement est le run de codage autonome continu de 35 heures, qui mérite un examen attentif, car la plupart des articles de lancement ont passé sous silence ce qui s'est réellement passé. Selon les tests internes d'Alibaba (aucune vérification indépendante n'a encore été publiée), Qwen3.7-Max a été doté d'un serveur isolé équipé d'un accélérateur IA Zhenwu M890, une toute nouvelle architecture matérielle que le modèle n'avait jamais rencontrée à l'entraînement. La tâche consistait à optimiser un noyau d'attention de zéro.
Sur 35 heures consécutives, le modèle a exécuté 1 158 appels d'outils distincts, lancé 432 évaluations de noyaux, diagnostiqué lui-même des erreurs de compilation et réécrit son code de manière itérative. Il a abouti à une accélération géométrique de 10× par rapport à l'implémentation de référence Triton, selon VentureBeat. Cette seule démonstration ne prouve pas une intelligence agentique générale, mais elle montre que le modèle peut maintenir le contexte, se remettre d'un échec et rester cohérent sur une durée où la plupart des autres modèles de raisonnement commencent à halluciner des variables ou à boucler.
Pour les développeurs, la conclusion pratique est la suivante. Si vous faites tourner un agent de codage ou un assistant de recherche toute la nuit, Qwen3.7-Max est désormais l'un des rares modèles testés sur cette durée. La question de savoir si votre budget peut absorber la dépense en tokens est un sujet à part.
Comment essayer Qwen3.7-Max
Quatre options s'offrent à vous, et votre choix dépend de si vous souhaitez une interface de chat, une API ou un harness agentique.
Qwen Chat (chat.qwen.ai) est le point d'entrée gratuit en prévisualisation. Il est soumis à une limite quotidienne de messages et donne accès à Qwen3.7-Max et Qwen3.7-Plus-Preview via un menu déroulant. Utile pour tester rapidement avant de s'engager sur une dépense API.
Alibaba Cloud Model Studio est la plateforme API officielle avec la tarification complète et les limites de contexte les plus étendues. Il vous faudra un compte Alibaba Cloud, ce qui implique plus de friction que d'autres fournisseurs, mais permet le prompt caching et un support direct.
OpenRouter propose le modèle au même niveau de prix et est plus simple à rejoindre, notamment si vous routez déjà plusieurs modèles via une clé unique. Together AI l'héberge également pour les workloads compatibles avec le fine-tuning.
Claude Code est l'option qui a surpris beaucoup de monde. Qwen3.7-Max prend en charge nativement le protocole API Anthropic, ce qui signifie que vous pouvez pointer Claude Code, OpenClaw ou tout autre harness compatible Anthropic vers l'endpoint Qwen et l'utiliser en substitution directe. Si le tarif de Claude Code vous a mis hors budget mais que vous souhaitez conserver le même workflow, c'est l'alternative la plus crédible à laquelle vous avez eu accès depuis des mois.
Si vous préférez éviter la configuration API et simplement comparer les modèles frontier depuis une seule app, l'application Mac et iOS Fello AI regroupe Claude, ChatGPT, Gemini, Grok et DeepSeek sous un abonnement unique à $9.99/mois, pour tester vos prompts en A/B sur plusieurs fournisseurs sans jongler avec des comptes de facturation séparés.
Verdict : faut-il basculer ?
Qwen3.7-Max est le modèle frontier chinois le plus crédible lancé à ce jour, et la tarification en fait le choix naturel pour les workloads agentiques et en contexte long sensibles aux coûts. Si votre problème est le coût de l'API GPT-5.5 ou Claude Opus 4.7, c'est le moyen le plus direct de réduire la facture sans tomber dans la catégorie « Gemini 3.5 Flash, légèrement moins bon en raisonnement ».
Vous devriez basculer si vous développez des agents qui tournent pendant des heures, si vous traitez des contextes de millions de tokens, ou si vous avez besoin du tarif à $0.25 pour l'entrée en cache pour rentabiliser un cas d'usage. Vous ne devriez pas basculer si votre workload dépend d'une vision multimodale complète (utilisez Plus-Preview ou attendez Max-Vision), ou si votre application ne peut tolérer le taux d'abstention plus élevé sur les questions difficiles. Pour la pure intelligence brute et le suivi d'instructions à l'absolute frontier, GPT-5.5 conserve sa tête sur l'Intelligence Index, mais l'écart de prix se creuse.
L'enjeu plus large est ce que ce lancement révèle. Alibaba livre désormais un modèle propriétaire directement lié à son propre accélérateur IA personnalisé (le Zhenwu M890) et à son serveur rack (Panjiu AL128), la même semaine, sur la même scène. C'est le pari full-stack sur l'IA que NVIDIA et OpenAI poursuivent également, et Alibaba est le premier acteur chinois à rejoindre crédiblement cette course. Qwen3.7-Max est la couche modèle de ce pari, et au vu des chiffres disponibles, le pari porte ses fruits.
Pour une vue d'ensemble sur la manière dont les laboratoires d'IA chinois ont rattrapé leur retard si rapidement, notre analyse approfondie sur la course à l'IA chinoise et notre article sur Kimi K2.5 vous donnent le contexte préalable. Si vous cherchez les meilleurs modèles de codage gratuits, Qwen3.7-Max n'est pas gratuit, mais il vaut la peine d'être comparé en termes de benchmark par dollar. Pour les derniers développements dans cette lignée, consultez notre guide sur Kimi K2.7 Code, le dernier modèle de codage open-weight de Moonshot.
Qwen n'est pas le seul mouvement frontier chinois ce mois-ci. MiniMax a présenté en avant-première MiniMax M3, un LLM à attention creuse revendiquant des accélérations de 9,7× et 15,6× au seuil du million de tokens par rapport à M2.5, signalant que l'efficacité en contexte long, et non plus la simple montée en puissance brute, est le nouveau terrain de jeu des laboratoires chinois.
FAQ
Qwen3.7-Max est-il open source ?
Non. Qwen3.7-Max est propriétaire et ses poids ne sont pas publiés. Il est disponible uniquement via Alibaba Cloud Model Studio, OpenRouter et Together AI. Les modèles de la famille Qwen 3.6 précédents restent disponibles en open-weight sur Hugging Face.
Combien coûte Qwen3.7-Max ?
L'API coûte $2.50 par million de tokens en entrée et $7.50 par million de tokens en sortie, avec une remise de 90 % sur l'entrée en cache à $0.25 par million.
Qwen3.7-Max fonctionne-t-il avec Claude Code ?
Oui. Le modèle prend en charge nativement le protocole API Anthropic, ce qui vous permet de pointer Claude Code, OpenClaw ou tout harness compatible Anthropic directement vers l'endpoint Qwen en substitution directe.
Qwen3.7-Max est-il meilleur que GPT-5.5 ?
Sur l'Artificial Analysis Intelligence Index, GPT-5.5 reste en tête avec 60,2 contre 56,6 pour Qwen3.7-Max. Sur le rapport prix/intelligence et le codage agentique longue durée, Qwen3.7-Max est le meilleur choix.
Quelle est la différence entre Qwen3.7-Max et Qwen3.7-Plus-Preview ?
Max est le modèle de raisonnement phare, exclusivement textuel, avec les meilleurs benchmarks et le plus grand contexte. Plus-Preview est multimodal (entrée vision) et tarifé pour les workloads à fort volume et à enjeux moindres.