Si vous avez ouvert le classement d’OpenRouter cette semaine, vous avez vu un logo peu familier occuper les deux premières places : Grok 4 Fast (gratuit) et Grok Code Fast 1, signés xAI. Ensemble, ils représentent désormais bien plus d’un tiers de tous les tokens acheminés par la place de marché. Ensemble, ils ont propulsé xAI à la première place en part de marché globale, devançant Google, Anthropic, et même OpenAI.

Mais comment un modèle relativement jeune a-t-il pu dépasser les géants ? Et qu’est-ce qui rend Grok 4 Fast si populaire auprès des développeurs, des startups et des équipes en entreprise ? Un mélange de puissance, de tarifs imbattables et d’un point d’accès gratuit à durée limitée a fait de Grok 4 Fast le choix par défaut de nombreux créateurs. Voici un examen plus approfondi de ce qu’est ce modèle, de ses performances, et des raisons pour lesquelles les développeurs s’y ruent.

[Source]

Qu’est-ce que Grok 4 Fast ?

Grok 4 Fast est le modèle de xAI optimisé pour l’efficacité, conçu pour maximiser l’intelligence par token. Il prend en charge deux comportements (le raisonnement pour les problèmes complexes et le non-raisonnement pour les réponses rapides) sur le même jeu de poids, ce qui simplifie l’acheminement des requêtes et réduit la latence. C’est une version allégée du modèle phare de xAI, Grok 4. Il conserve les fonctionnalités phares, à savoir une fenêtre de contexte de 2 millions de tokens, l’utilisation native d’outils pour la recherche web et sur X, ainsi qu’une architecture unifiée « raisonnement/non-raisonnement », tout en réduisant d’environ 40 % le nombre moyen de « tokens de réflexion ».

Plutôt que de faire tourner deux modèles distincts pour la vitesse et la profondeur, vous pilotez un seul jeu de poids via un prompt système, ce qui simplifie l’acheminement et réduit la latence. Côté infrastructure, la grande nouveauté est la limite de 4 millions de tokens par minute, ainsi que la possibilité de faire transiter des manuels entiers, des contrats juridiques ou des bases de code volumineuses sans découpage agressif.

Caractéristiques clés

  • Fenêtre de contexte de 2 M tokens. Vous pouvez transmettre des manuels entiers, de longs documents juridiques ou des bases de code volumineuses en une seule fois, ce qui réduit le découpage, les tentatives répétées et le code de liaison.
  • Utilisation d’outils & recherche. Entraîné à décider quand naviguer, suivre des liens ou appeler des outils (y compris la recherche sur X). Cela aide sur les questions sensibles au facteur temps.
  • Efficacité des tokens. Le post-entraînement vise à utiliser moins de tokens de « réflexion » pour atteindre une qualité similaire, ce qui réduit la facture et souvent la latence de queue.
  • Cadre de sécurité. Le comportement de refus et la résistance au jailbreak sont explicitement entraînés, avec un préfixe de sécurité fixe dans le prompt système.

Benchmarks

Benchmark (Pass@1)Grok 4 FastGrok 4GPT-5 (High)Claude Opus 4.1
GPQA Diamond85,7 %87,5 %85,7 %environ 87 %
AIME 2025 (sans outils)92,0 %91,7 %94,6 %environ 92 %
LiveCodeBench80,0 %79,0 %86,8 %environ 78 %
Données agrégées à partir du billet de lancement de xAI et d’Artificial Analysis.

Le schéma est cohérent : Grok 4 Fast se maintient juste derrière les plus grands modèles de pointe en précision brute, les dépassant parfois sur les tâches de maths ou de code, tout en utilisant beaucoup moins de tokens et en terminant plus vite.

Tarification

Grok 4 Fast facture $0.20 /M en entrée et $0.50 /M en sortie (en dessous de 128 k de contexte) ; au-delà, les tarifs doublent, tandis que les entrées mises en cache tombent à $0.05 /M. C’est environ 15 fois moins cher que GPT-5 Turbo et 30 fois moins que Claude Opus, avec des économies supplémentaires dans les pipelines RAG ou agentiques grâce à sa fenêtre de 2 M tokens et à sa navigation native. Un point d’accès « :free » temporaire sur OpenRouter et Vercel AI Gateway permet de l’essayer gratuitement.

[source]

Pourquoi les développeurs choisissent Grok 4 Fast

De l'éditeur

Tous les modèles d'IA dans une seule app

Fello AI réunit GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 et plus dans une seule app native pour Mac et iPhone.

Téléchargez maintenant !

Ce qui distingue vraiment Grok 4 Fast, ce ne sont pas seulement ses scores aux benchmarks : c’est sa façon de s’intégrer dans des systèmes réels. Son architecture sans état et à faible latence le rend facile à déployer, même dans des environnements légers, y compris les configurations serverless et en périphérie. Les développeurs n’ont pas à se soucier d’une orchestration complexe ou d’une logique de changement de modèle. Avec un seul jeu de poids, il prend en charge à la fois des réponses rapides et un raisonnement approfondi, selon la seule orientation donnée au prompt.

Cette double fonctionnalité est particulièrement utile dans des flux de travail adaptatifs comme les agents multi-étapes, la recherche sémantique ou les assistants dynamiques. Un simple interrupteur dans le message système peut modifier le comportement du modèle sans nécessiter de point d’accès distinct ni de réentraînement. Les équipes qui construisent des pipelines RAG ont constaté des performances plus fluides, avec moins de tentatives répétées, moins de gaspillage de tokens et une sortie plus propre, ce qui se traduit par une meilleure expérience utilisateur et moins de dispersion de l’infrastructure.

La fenêtre de contexte de 2 M tokens n’est pas qu’un argument technique ; elle change la façon dont les développeurs conçoivent les interfaces d’IA. Elle permet d’injecter en un seul appel des bases de code entières, des corpus juridiques ou des historiques multi-documents, sans découpage, sans acrobaties d’embedding ni logique de cache fragile. C’est particulièrement précieux pour la recherche d’entreprise, les questions-réponses juridiques et l’automatisation du support client, où la robustesse compte plus que la vitesse brute.

Résultat : Grok 4 Fast ne se contente pas de faire économiser de l’argent, il réduit la complexité d’ingénierie sur toute la ligne. C’est pourquoi il ne se contente pas de faire le buzz dans les classements d’OpenRouter : il devient discrètement le choix par défaut des équipes qui livrent des produits d’IA sérieux.

Conclusion

Grok 4 Fast n’a pas grimpé au sommet d’OpenRouter par hasard : il est arrivé au point de rencontre parfait entre performance, prix et accessibilité. Une offre gratuite à durée limitée sur OpenRouter et Vercel AI Gateway a abaissé la barrière à l’essai pour les développeurs. Et une fois qu’ils l’ont testé, les chiffres ont parlé d’eux-mêmes : des benchmarks de premier plan, un débit fulgurant et un modèle de coûts qui reste avantageux même à grande échelle. Avec des tarifs aussi bas que $0.20 par million de tokens en entrée et $0.05 pour les entrées mises en cache, de nombreuses équipes considèrent désormais Grok comme le choix préféré.

Son ascension s’appuie aussi sur des preuves concrètes. Grok Code Fast 1 a bondi à la première place des usages réels en programmation, et xAI mène désormais la part de tokens par fournisseur sur OpenRouter. Ce n’est pas juste un effet de mode : c’est un usage étayé par des métriques. Les développeurs le voient fonctionner, partagent leurs résultats, et l’adoption s’accélère.

Cela dit, Grok 4 Fast n’est pas sans limites. Son comportement de refus face aux prompts sensibles peut être inconsistant, et les prompts à contexte long exigent toujours une surveillance attentive des traces pour éviter toute dérive. Et bien qu’il rivalise de près avec GPT-5 ou Claude sur de nombreuses tâches, ces modèles phares gardent encore une longueur d’avance en précision brute et en fiabilité sur certains cas d’usage à enjeux élevés.

Reste que, pour la majorité des applications réelles (surtout celles déployées à grande échelle), Grok 4 Fast offre une combinaison rare d’efficacité, de qualité et de praticité. Ce n’est pas juste une alternative solide ; il devient rapidement le choix par défaut pour les développeurs qui doivent avancer vite, évoluer intelligemment et garder leurs coûts sous contrôle.