Les tarifs GLM sont la principale raison pour laquelle les développeurs continuent de basculer vers les modèles de Zhipu AI. Le haut de gamme GLM-5.3 ne coûte que $1.40 par million de tokens en entrée et $4.40 par million en sortie sur l’API officielle, soit ce qui représentait autrefois un sixième de ce que facturait GPT-5.5, et le GLM-4.7 plus ancien est encore moins cher. OpenAI a baissé ses propres tarifs deux fois depuis, l’écart est donc aujourd’hui plus proche de la moitié. Vous pouvez aussi utiliser GLM gratuitement dans le navigateur, et trois des modèles ne coûtent rien du tout via l’API. GLM 5.3 reprend la même grille tarifaire que le GLM-5.2 qu’il remplace, si bien qu’un changement de version ne change pas votre facture.
Ce guide détaille chaque façon de payer GLM en 2026 : le niveau gratuit, les tarifs API au token pour chaque modèle, et l’abonnement GLM Coding Plan, qui démarre à $18 par mois. Nous terminons par une comparaison de coût face à Claude, ChatGPT, Gemini et DeepSeek, mise à jour pour la gamme GPT-6 d’OpenAI, où Luna à $0.10 / $0.50 passe sous tous les modèles GLM payants. Le prix ne fait que la moitié de l’histoire, alors consultez notre comparatif de GLM face aux meilleurs modèles fermés côté qualité aussi. Si vous découvrez la famille, commencez par ce qu’est GLM.
Les points clés à retenir
- GLM est gratuit sur chat.z.ai, et GLM-4.7 Flash, GLM-4.5 Flash et le modèle de vision GLM-4.6V Flash sont aussi entièrement gratuits sur l’API.
- Le tarif API de GLM-5.3 est de $1.40 en entrée / $4.40 en sortie par million de tokens, soit moins de la moitié de GPT-6 Sol sur la sortie et un cinquième de Claude Opus 5.5, même si GPT-6 Luna est moins cher que les deux.
- GLM-4.7 est le choix économique pour le code à $0.60 en entrée / $2.20 en sortie par million de tokens, avec une entrée en cache jusqu’à $0.11.
- Le GLM Coding Plan est un abonnement à tarif fixe à $18 (Lite), $80 (Pro) et $168 (Max) par mois, ou 30 % de moins en facturation annuelle.
- GLM-5.3 figure dans la grille tarifaire aux mêmes $1.40 / $4.40 que GLM-5.2, et depuis le 30 juillet 2026 le Coding Plan se compte en crédits et non en prompts, et ne sert plus GLM-5.2 du tout.
- Dans Fello AI, GLM-5.3 est réuni avec Claude, GPT et Gemini pour un tarif fixe unique de $9.99 par mois, sans facturation au token.
Les tarifs GLM en un coup d’œil
Voici l’ensemble des tarifs GLM dans un seul tableau. Les options gratuites le sont réellement, les tarifs API passent sous tous les modèles phares fermés sauf le palier le moins cher d’OpenAI, et le Coding Plan est un tarif mensuel fixe pour un usage intensif.
| Ce que vous payez | Coût |
|---|---|
| Chat GLM (chat.z.ai) | Gratuit |
| API GLM-4.7 Flash / GLM-4.5 Flash / GLM-4.6V Flash | Gratuit |
| API GLM-5.3 | $1.40 en entrée / $4.40 en sortie par million de tokens |
| API GLM-5.3 Flash | $0.15 en entrée / $0.50 en sortie par million de tokens |
| API GLM-4.7 | $0.60 en entrée / $2.20 en sortie par million de tokens |
| GLM Coding Plan | $18 / $80 / $168 par mois |
GLM est-il gratuit ?
Oui, et de plus de façons que la plupart des concurrents. Vous pouvez discuter gratuitement avec GLM-5.3 sur chat.z.ai, sans abonnement, de la même manière que vous utiliseriez un compte ChatGPT gratuit. Chaque GLM jusqu’à GLM-5.2 est en poids ouverts et sous licence MIT, vous pouvez donc télécharger les poids depuis Hugging Face et les exécuter vous-même sans aucun coût de licence. Les poids de GLM-5.3 sont publics aussi, sur Hugging Face depuis le 28 août 2026, mais sous une licence GLM 5.3 propre plutôt que MIT, et avec 753 milliards de paramètres ils exigent un serveur à plusieurs GPU, pas un portable.
La surprise, c’est que l’API propose aussi des modèles gratuits. GLM-4.7 Flash, GLM-4.5 Flash et le modèle de vision GLM-4.6V Flash sont affichés à $0 pour l’entrée, l’entrée en cache et la sortie, si bien que vous pouvez créer de vraies applications avec eux sans payer au token. Cela fait de GLM l’un des modèles sérieux les moins chers pour prototyper, et c’est une grande partie de la raison pour laquelle il figure dans les listes des meilleurs modèles d’IA open source.
Tarifs de l’API GLM par modèle
Sur l’API officielle de Z.ai, chaque modèle est facturé par million de tokens, réparti entre entrée, entrée en cache et sortie. L’entrée en cache s’applique lorsque vous réutilisez le même contexte, et elle réduit le tarif d’entrée à environ un cinquième. Les tarifs complets par modèle sont ci-dessous, tirés de la documentation tarifaire de Z.ai.
| Modèle | Entrée / M | Entrée en cache / M | Sortie / M |
|---|---|---|---|
| GLM-5.3 | $1.40 | $0.26 | $4.40 |
| GLM-5.3 Flash | $0.15 | $0.03 | $0.50 |
| GLM-4.7 | $0.60 | $0.11 | $2.20 |
| GLM-4.7 Flash | Gratuit | Gratuit | Gratuit |
| GLM-4.5 Air | $0.20 | $0.03 | $1.10 |
GLM-5.3 (tarif du modèle phare)
GLM-5.3 est le modèle que la plupart des gens visent aujourd’hui en parlant des tarifs GLM, et le GLM dont presque tout le monde cite le tarif. À $1.40 en entrée et $4.40 en sortie par million de tokens, il coûte moins de la moitié de GPT-6 Sol sur la sortie et un cinquième du tarif de sortie de $20.00 de Claude Opus 5.5. L’entrée en cache descend à $0.26, donc les contextes longs et répétés reviennent encore moins cher. À savoir avant de le présenter comme l’option économique : sur l’Intelligence Index v4.3.2 d’Artificial Analysis, GPT-6 Sol obtient 48 points contre 45 pour GLM-5.3 et coûte $1.06 par tâche d’index contre $2.01 pour GLM, si bien que l’argument d’une qualité comparable pour une fraction du prix s’inverse face au milieu de gamme d’OpenAI. Les benchmarks complets se trouvent dans notre analyse de GLM 5.3.
GLM-5.2 (même tarif, modèle plus ancien)
GLM-5.2 figure encore dans la grille tarifaire, aux mêmes $1.40 / $0.26 / $4.40, les deux générations coûtent donc la même chose et le guide de migration de Z.ai dit simplement aux développeurs de pointer l’identifiant du modèle vers glm-5.3. Dans le GLM Coding Plan, vous ne pouvez plus le choisir : depuis le 30 juillet 2026, les requêtes pour GLM-5.2 et GLM-5.1 sont routées vers GLM-5.3, et GLM-4.7 vers GLM-5.3 Flash. Ce que GLM-5.2 conserve, c’est sa licence, il s’agit du plus grand GLM publié sous MIT, et ses propres chiffres, qui se trouvent dans notre analyse de GLM 5.2. Son petit frère moins cher GLM 5.3 Flash est arrivé le 26 août 2026 à $0.15 en entrée et $0.50 en sortie par million de tokens, et la promotion qui divisait ces tarifs par deux s’est terminée le 9 septembre.
GLM-5.3 Flash et FlashX
GLM-5.3 Flash est le frère bon marché et nativement multimodal, à $0.15 en entrée et $0.50 en sortie par million de tokens, GLM-5.3 FlashX se plaçant entre lui et le modèle phare à $0.37 / $1.25. Flash obtient 42 points sur l’Intelligence Index v4.3.2 d’Artificial Analysis contre 45 pour le modèle phare, et ce à $0.25 par tâche d’index au lieu de $2.01, ce qui en fait le meilleur rapport des deux pour la plupart des travaux à fort volume.
GLM-4.7 (choix économique pour le code)
GLM-4.7 est le champion du rapport qualité-prix à $0.60 en entrée et $2.20 en sortie par million de tokens, avec une entrée en cache aussi basse que $0.11. Il obtient encore 73,8 % sur SWE-bench Verified, l’un des meilleurs résultats jamais publiés par un modèle ouvert, si bien que vous obtenez du code sérieux pour une fraction des prix des modèles phares. Dans le Coding Plan, en revanche, vous ne l’atteignez plus directement : depuis le 30 juillet 2026, les requêtes GLM-4.7 sont routées vers GLM-5.3 Flash.
GLM-4.7 Flash (gratuit)
GLM-4.7 Flash est entièrement gratuit sur l’API, pour l’entrée, l’entrée en cache et la sortie. C’est un modèle plus petit et plus rapide destiné au code local et à fort volume, et avec GLM-4.5 Flash, il vous permet de lancer un produit fonctionnel sans jamais payer au token.
GLM-4.5 Air
GLM-4.5 Air est l’option légère héritée de la gamme à $0.20 en entrée et $1.10 en sortie par million de tokens, avec une entrée en cache à seulement $0.03. Ce n’est plus le modèle payant le moins cher de la gamme, GLM-4.7-FlashX à $0.07 / $0.40 et GLM-5.3 Flash à $0.15 / $0.50 passent en dessous, mais il gère encore très bien le chat et le raisonnement du quotidien.
Le GLM Coding Plan : Lite, Pro et Max
Si vous codez toute la journée, la facturation au token devient fastidieuse, alors Zhipu vend à la place un GLM Coding Plan à tarif fixe. C’est l’abonnement devenu viral chez les développeurs à la recherche d’une alternative moins chère à Claude. Depuis le 30 juillet 2026, il ne sert plus que GLM-5.3 et GLM-5.3 Flash, route les requêtes GLM-5.2 et GLM-5.1 vers GLM-5.3 et GLM-4.7 vers GLM-5.3 Flash, et compte l’usage en crédits plutôt qu’en prompts. Les trois paliers, tirés de la page d’abonnement de Z.ai, sont ci-dessous.
| Palier | Mensuel | Facturation annuelle (-30 %) | Quota d’usage |
|---|---|---|---|
| Lite | $18 | $12.60 | 2 000 crédits / 5 h, 10 000 / semaine |
| Pro | $80 | $56 | 12 000 crédits / 5 h, 60 000 / semaine |
| Max | $168 | $117.60 | 28 000 crédits / 5 h, 140 000 / semaine |
Les trois paliers donnent accès à la même gamme de modèles et fonctionnent dans des outils de code comme Claude Code, Cline, OpenCode et plus de 20 autres clients. Le coût en crédits varie selon le modèle : GLM-5.3 est facturé avec des multiplicateurs de 6,9 en entrée, 1,7 en entrée en cache et 24 en sortie, GLM-5.3 Flash à 2,3, 0,56 et 8, et en heures creuses l’usage coûte la moitié du tarif de crédits standard, les heures de pointe étant du lundi au vendredi de 14h00 à 18h00 heure de Singapour. Du 25 septembre au 7 octobre 2026, Z.ai applique le tarif heures creuses 24 heures sur 24. La facturation annuelle fait baisser les prix à $151.20, $672 et $1,411.20 par an.
Comment réduire votre facture GLM
GLM est déjà bon marché, mais trois habitudes font encore baisser le coût. D’abord, appuyez-vous sur l’entrée en cache. Réutiliser le même prompt système ou contexte documentaire se facture au tarif en cache, qui représente environ un cinquième du tarif d’entrée standard. Ensuite, adaptez le modèle à la tâche, car GLM-4.7 ou les modèles Flash gratuits gèrent la plupart du code et du chat sans toucher au modèle phare.
Enfin, surveillez l’horloge. Le Coding Plan facture la moitié du tarif de crédits en heures creuses, et l’API standard reste bien moins chère que les paliers phares américains à toute heure. Cet écart ne tient toutefois plus face à tous les modèles américains : GPT-6 Luna à $0.10 / $0.50 coûte moins cher au token que tout modèle GLM payant, GLM-4.5 Air compris. Si votre charge de travail est irrégulière, un forfait au token peut battre un abonnement ; si vous codez régulièrement toute la journée, le Coding Plan à tarif fixe l’emporte généralement.
GLM face à Claude, ChatGPT, Gemini et DeepSeek côté coût
Tout l’argument de GLM, c’est une sortie de niveau frontière sans les prix qui vont avec. Le tableau ci-dessous compare les modèles phares GLM à ceux que vous payez sans doute déjà, avec les tarifs API standard par million de tokens. GLM ne détient plus le prix plancher : DeepSeek et GPT-6 Luna passent tous les deux en dessous.
| Modèle | Entrée / M | Sortie / M |
|---|---|---|
| GLM-5.3 (Zhipu) | $1.40 | $4.40 |
| GLM-4.7 (Zhipu) | $0.60 | $2.20 |
| Claude Opus 5.5 | $4.00 | $20.00 |
| Claude Sonnet 5 | $2.00* | $10.00* |
| GPT-6 Sol | $2.00 | $10.00 |
| GPT-6 Astra | $10.00 | $50.00 |
| GPT-6 Luna | $0.10 | $0.50 |
| Gemini 3.1 Pro | $2.00 | $12.00 |
| DeepSeek V4 Pro | $0.66** | $1.98** |
| GLM-5.3 Flash (Zhipu) | $0.15 | $0.50 |
*Les $2.00 / $10.00 de Claude Sonnet 5 étaient un tarif de lancement ; Anthropic a annulé la hausse à $3.00 / $15.00 prévue au 1er septembre 2026 et l’a confirmé le 10 août 2026, si bien que $2.00 / $10.00 est désormais le tarif standard. **DeepSeek facture en heures de pointe et en heures creuses : V4 Pro coûte $0.66 / $1.98 en heures creuses et $1.32 / $3.96 en heures de pointe, qui courent de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine.
Le tableau a changé deux fois. La gamme GPT-6 d’OpenAI a remplacé les tarifs GPT-5.6 sur lesquels reposait cette comparaison, et le nouveau milieu de gamme atterrit pile sur GLM. GLM-5.3 coûte encore moins de la moitié de GPT-6 Sol sur la sortie et un peu plus d’un tiers de Gemini 3.1 Pro, mais GPT-6 Luna à $0.10 / $0.50 passe sous GLM-5.3 de 14x en entrée et de près de 9x en sortie, et bat aussi GLM-4.7 sur les deux plans. Pire pour l’argument : Sol n’est pas seulement proche en prix, il est devant en qualité, 48 contre 45 sur l’Intelligence Index v4.3.2 d’Artificial Analysis, et ce à $1.06 par tâche d’index contre $2.01 pour GLM. L’avantage restant de GLM n’est pas le prix plancher ni une qualité comparable pour moins cher ; ce sont des poids ouverts que vous pouvez auto-héberger, un Coding Plan à tarif fixe, et des modèles Flash gratuits auxquels Luna n’a aucune réponse. Au sommet de la gamme d’OpenAI, GPT-6 Astra figure dans la grille tarifaire à $10.00 / $50.00. Pour une vue d’ensemble sur tous les grands modèles, consultez notre comparatif des tarifs IA, et pour l’autre grande référence à poids ouverts côté rapport qualité-prix, découvrez les tarifs de Qwen.
Une alternative plus simple à la facturation au token
La facturation au token est puissante mais épuisante, et la plupart des gens ne veulent pas suivre les tarifs d’entrée et de sortie ni gérer un compte z.ai séparé. Si c’est votre cas, la voie la plus simple est un abonnement à tarif fixe qui inclut GLM aux côtés des autres modèles phares.
Dans Fello, GLM-5.3 se trouve aux côtés de Claude, GPT et Gemini pour un tarif unique de $9.99 par mois. Vous pouvez lancer le même prompt sur plusieurs modèles à la fois et garder la meilleure réponse, sans facturation au token, sans jonglage de quotas et sans compte hébergé en Chine à configurer. C’est le moyen le plus simple d’essayer GLM sans frais avant de vous engager sur l’API. Sur Mac, il s’installe comme un client de bureau GLM natif, si bien que le tarif fixe couvre une vraie application plutôt qu’un onglet de navigateur.
Conclusion
Les tarifs GLM sont à peu près aussi accueillants que possible pour un modèle de niveau frontière. Le chat est gratuit, trois modèles de l’API ne coûtent rien, GLM-5.3 tourne à moins de la moitié de GPT-6 Sol sur la sortie, et le GLM Coding Plan plafonne l’usage intensif à un tarif mensuel fixe. Ce n’est plus l’option la moins chère au token, cela dit, maintenant que DeepSeek et GPT-6 Luna se situent tous les deux en dessous.
Pour la plupart des gens, le bon réflexe est de commencer gratuitement sur chat.z.ai, de passer à GLM-4.7 ou GLM-5.3 Flash quand vous avez besoin de code bon marché via l’API, puis de monter en gamme vers GLM-5.3 pour le modèle phare. Et si vous préférez éviter complètement la facturation au token, faites tourner GLM aux côtés de Claude et GPT dans Fello pour un tarif fixe unique.
FAQ
Combien coûte GLM ?
GLM-5.3 coûte $1.40 par million de tokens en entrée et $4.40 par million en sortie sur l’API officielle de Z.ai, soit moins de la moitié de GPT-6 Sol sur la sortie. GLM-4.7 est moins cher à $0.60 / $2.20 et GLM-5.3 Flash à $0.15 / $0.50, et le chat plus trois modèles Flash sont gratuits. GLM-5.2 figure encore exactement au même tarif que GLM-5.3.
GLM est-il gratuit ?
Oui. Vous pouvez discuter gratuitement avec GLM sur chat.z.ai, les poids des modèles jusqu’à GLM-5.2 sont open source sous licence MIT, et GLM-4.7 Flash, GLM-4.5 Flash et GLM-4.6V Flash sont gratuits sur l’API pour l’entrée, l’entrée en cache et la sortie. Les poids de GLM-5.3 sont publics aussi, sur Hugging Face depuis le 28 août 2026, mais sous une licence GLM 5.3 propre plutôt que MIT.
Combien coûte le GLM Coding Plan ?
Le GLM Coding Plan compte trois paliers : Lite à $18, Pro à $80 et Max à $168 par mois, ou 30 % de moins en facturation annuelle. Depuis le 30 juillet 2026, chaque palier ne sert que GLM-5.3 et GLM-5.3 Flash, comptés en crédits plutôt qu’en prompts, pour un usage dans des outils comme Claude Code et Cline.
GLM est-il moins cher que ChatGPT et Claude ?
Moins cher que les modèles phares, oui. GLM-5.3 tourne à moins de la moitié de GPT-6 Sol sur la sortie et à un cinquième de Claude Opus 5.5 ($4.00 / $20.00). Ce n’est pas l’option la moins chère dans l’absolu, cela dit, et ce n’est pas non plus le modèle le plus fort : DeepSeek et GPT-6 Luna ($0.10 / $0.50) passent tous les deux en dessous, et GPT-6 Sol le devance 48 à 45 sur l’Intelligence Index v4.3.2 d’Artificial Analysis.
Quel est le modèle GLM le moins cher ?
GLM-4.7 Flash, GLM-4.5 Flash et GLM-4.6V Flash sont gratuits sur l’API. Parmi les modèles de texte payants, le moins cher est GLM-4.7-FlashX à $0.07 en entrée et $0.40 en sortie par million de tokens, puis GLM-5.3 Flash à $0.15 / $0.50 et GLM-4.5 Air à $0.20 / $1.10.