GLM-Preise sind der Hauptgrund, warum Entwickler zu Zhipu AIs Modellen wechseln. Das Spitzenmodell GLM-5.2 kostet nur $1.40 pro Million Input-Tokens und $4.40 pro Million Output-Tokens über die offizielle API, etwa ein Sechstel von dem, was GPT-5.5 berechnet, und das ältere GLM-4.7 ist noch günstiger. GLM ist auch im Browser kostenlos nutzbar, und zwei der Modelle kosten über die API gar nichts. Das neueste Modell, GLM 5.3, bildet die einzige Ausnahme, da Z.ai noch keinen Token-Preis dafür veröffentlicht hat.

Dieser Leitfaden erklärt jeden Weg, wie du für GLM im Jahr 2026 zahlst: den Free Tier, die Token-basierten API-Preise für jedes Modell und das GLM Coding Plan-Abo ab $18 pro Monat. Abschließend vergleichen wir die Kosten mit Claude, ChatGPT, Gemini und DeepSeek, aktualisiert für OpenAIs API-Preissenkung vom 30. Juli 2026, die GPT-5.6 Luna auf $0.20 / $1.20 senkte und GLM-5.2 damit direkt unterbietet. Außerdem gibt es eine Flatrate-Alternative für alle, die keine Token-Mathematik betreiben wollen. Preis ist nur die halbe Geschichte, sieh dir also auch an, wie GLM im Qualitätsvergleich mit den führenden Closed-Source-Modellen abschneidet. Wenn du die Familie noch nicht kennst, lies zuerst was GLM ist.

Das Wichtigste auf einen Blick

  • GLM ist kostenlos unter chat.z.ai nutzbar, und GLM-4.7 Flash sowie GLM-4.5 Flash sind auch über die API vollständig kostenlos.
  • Der GLM-5.2-API-Preis beträgt $1.40 Input / $4.40 Output pro Million Tokens, etwa ein Siebtel von GPT-5.6 Sol beim Output und deutlich unter Claude Opus 5, wobei GPT-5.6 Luna mittlerweile beide unterbietet.
  • GLM-4.7 ist die günstige Wahl für Coding bei $0.60 Input / $2.20 Output pro Million Tokens, mit zwischengespeichertem Input ab nur $0.11.
  • Der GLM Coding Plan ist ein Flatrate-Abo für $18 (Lite), $72 (Pro) und $160 (Max) pro Monat, oder 30 % weniger bei Jahreszahlung.
  • GLM-5.3 hat keinen veröffentlichten Token-Preis. Es startete am 14. August 2026 exklusiv im Coding Plan und ZCode, daher endet die öffentliche API-Preisliste weiterhin bei GLM-5.2.
  • Bei Fello AI ist GLM-5.2 zusammen mit Claude, GPT und Gemini für einen einzigen Flatpreis von $9.99 pro Monat verfügbar, ohne Token-Abrechnung.

GLM-Preise im Überblick

Vom Herausgeber

Jedes KI-Modell in einer App

Fello AI vereint GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 und mehr in einer nativen App für Mac und iPhone.

Jetzt herunterladen!

Hier ist das gesamte GLM-Preisbild in einer Tabelle. Die kostenlosen Optionen sind wirklich kostenlos, die API-Preise gehören zu den niedrigsten aller Frontier-Modelle, und der Coding Plan ist eine monatliche Flatrate für intensiven Gebrauch.

Wofür du zahlstKosten
GLM-Chat (chat.z.ai)Kostenlos
GLM-4.7 Flash / GLM-4.5 Flash APIKostenlos
GLM-5.2 API$1.40 Input / $4.40 Output pro Million Tokens
GLM-5.3 APINicht veröffentlicht; nur Coding Plan und ZCode
GLM-4.7 API$0.60 Input / $2.20 Output pro Million Tokens
GLM Coding Plan$18 / $72 / $160 pro Monat

Ist GLM kostenlos?

Ja, und in mehr Varianten als bei den meisten Konkurrenten. Du kannst GLM-5.2 kostenlos unter chat.z.ai nutzen, ohne Abonnement, genauso wie ein kostenloses ChatGPT-Konto. Da alle Modelle bis einschließlich GLM-5.2 open-weight und MIT-lizenziert sind, kannst du die Gewichte auch von Hugging Face herunterladen und selbst betreiben, ganz ohne Lizenzkosten. GLM-5.3 ist die Ausnahme, dessen Gewichte sind noch zurückgehalten, bis ein Sicherheits-Review abgeschlossen ist.

Überraschend: Auch die API hat kostenlose Modelle. GLM-4.7 Flash, GLM-4.5 Flash und das Vision-Modell GLM-4.6V Flash werden mit $0 für Input, zwischengespeicherten Input und Output gelistet. Du kannst damit echte Apps bauen, ohne je pro Token zu zahlen. Das macht GLM zu einem der günstigsten Modelle für Prototypen und ist ein wesentlicher Grund, warum es auf Listen der besten Open-Source-KI-Modelle auftaucht.

GLM-API-Preise nach Modell

Über die offizielle Z.ai-API wird jedes Modell pro Million Tokens abgerechnet, aufgeteilt in Input, zwischengespeicherten Input und Output. Zwischengespeicherter Input gilt beim Wiederverwenden desselben Kontexts und reduziert den Input-Preis auf etwa ein Fünftel. Die vollständigen Preise pro Modell findest du unten, entnommen aus der Z.ai-Preisdokumentation.

ModellInput / MZwischengespeicherter Input / MOutput / M
GLM-5.2$1.40$0.26$4.40
GLM-5-Turbo$1.20$0.24$4.00
GLM-4.7$0.60$0.11$2.20
GLM-4.7 FlashKostenlosKostenlosKostenlos
GLM-4.5 Air$0.20$0.03$1.10

GLM-5.2 (Flagship-Preis)

GLM-5.2 ist das Modell, das die meisten meinen, wenn sie von GLM-Preisen sprechen, und das teuerste GLM mit veröffentlichtem Preis. Bei $1.40 Input und $4.40 Output pro Million Tokens kostet es etwa ein Siebtel von GPT-5.6 Sol beim Output und unter einem Fünftel von Claude Opus 5's Output-Preis von $25.00, und liefert dabei wettbewerbsfähige Ergebnisse in unabhängigen Benchmarks. Zwischengespeicherter Input sinkt auf $0.26, lange wiederholt genutzte Kontexte werden also noch günstiger. Vollständige Benchmarks findest du in unserer GLM-5.2-Analyse.

GLM-5.3 (Kein veröffentlichter Preis)

GLM-5.3 startete am 14. August 2026 und erscheint gar nicht in der Preisliste. Z.ai führt den Rollout schrittweise hinter einem Sicherheits-Review durch, daher ist das Modell zum Zeitpunkt dieser Veröffentlichung nur über den GLM Coding Plan und Z.ais ZCode-Agenten erreichbar, mit breiterem API-Zugang in Aussicht. Wer API-Ausgaben plant, arbeitet weiterhin mit den GLM-5.2-Preisen oben. Was du für das Abo erhältst und welche Benchmarks dahinterstehen, erfährst du in unserer GLM-5.3-Analyse.

GLM-5-Turbo

GLM-5-Turbo ist das auf Geschwindigkeit optimierte Geschwistermodell bei $1.20 Input und $4.00 Output pro Million Tokens. Es tauscht etwas rohe Qualität gegen schnellere Antworten und leicht niedrigere Kosten, was es ideal für hochvolumige oder latenzempfindliche Apps macht.

GLM-4.7 (Günstige Coding-Wahl)

GLM-4.7 ist der Preis-Leistungs-Champion bei $0.60 Input und $2.20 Output pro Million Tokens, mit zwischengespeichertem Input ab nur $0.11. Es erreicht dennoch 73,8 % auf SWE-bench Verified, eines der besten Ergebnisse, die ein Open-Source-Modell je erzielt hat, und liefert damit ernsthaftes Coding zu einem Bruchteil der Frontier-Preise. Es ist auch das Standardmodell im GLM Coding Plan.

GLM-4.7 Flash (Kostenlos)

GLM-4.7 Flash ist über die API vollständig kostenlos, für Input, zwischengespeicherten Input und Output gleichermaßen. Es ist ein kleineres, schnelleres Modell für lokales und hochvolumiges Coding, und zusammen mit GLM-4.5 Flash ermöglicht es dir, ein funktionierendes Produkt zu bauen, ohne pro Token zu zahlen.

GLM-4.5 Air

GLM-4.5 Air ist die günstigste Legacy-Option bei $0.20 Input und $1.10 Output pro Million Tokens, mit zwischengespeichertem Input für nur $0.03. Es ist das günstigste kostenpflichtige Modell in der Reihe und eignet sich gut für alltäglichen Chat und einfache Reasoning-Aufgaben.

Der GLM Coding Plan: Lite, Pro und Max

Wer den ganzen Tag programmiert, für den wird Token-basierte Abrechnung schnell lästig. Deshalb bietet Zhipu den GLM Coding Plan als Flatrate-Abo an. Dieses Abo wurde unter Entwicklern viral, die eine günstigere Alternative zu Claude suchen, denn es bündelt GLM-5.2, GLM-5-Turbo, GLM-4.7 und GLM-4.5-Air mit großzügigen Prompt-Kontingenten. Alle Tiers enthalten jetzt auch GLM-5.3, was heute der einzige Weg ist, dieses Modell zu nutzen. Die drei Tiers von der Z.ai-Aboseite sind unten aufgeführt.

TierMonatlichJährliche Abrechnung (-30 %)Nutzungskontingent
Lite$18$12.60~80 Prompts / 5 Std., ~400 / Woche
Pro$72$50.40~400 Prompts / 5 Std., ~2.000 / Woche
Max$160$112~1.600 Prompts / 5 Std., ~8.000 / Woche

Alle drei Tiers bieten dieselbe Modellauswahl und laufen in Coding-Tools wie Claude Code, Cline, Roo Code und über 20 weiteren Clients. Prompts mit GLM-5.2 und GLM-5-Turbo verbrauchen das Kontingent zu 3x in Stoßzeiten und 2x außerhalb, obwohl bis September 2026 eine 1x-Promo außerhalb der Stoßzeiten läuft. Die Jahresabrechnung senkt die Preise weiter, auf etwa $151, $605 und $1.344 pro Jahr.

So senkst du deine GLM-Kosten

GLM ist schon günstig, aber drei Gewohnheiten senken die Kosten noch weiter. Erstens: Nutze zwischengespeicherten Input. Wer denselben System-Prompt oder Dokumentenkontext wiederholt, zahlt den Cache-Preis, der etwa ein Fünftel des normalen Input-Preises beträgt. Zweitens: Wähle das Modell passend zur Aufgabe, denn GLM-4.7 oder die kostenlosen Flash-Modelle erledigen die meisten Coding- und Chat-Aufgaben, ohne das Flagship-Modell anfassen zu müssen.

Drittens: Beachte die Uhrzeit. Der Coding Plan verbraucht außerhalb der Stoßzeiten weniger Kontingent, und die Standard-API kostet zu jeder Stunde weit weniger als die US-Spitzenmodelle. Dieser Vorteil gilt allerdings nicht mehr für alle US-Modelle: Seit OpenAIs Preissenkung im Juli 2026 ist GPT-5.6 Luna bei $0.20 / $1.20 pro Token günstiger als alle kostenpflichtigen GLM-Modelle außer GLM-4.5 Air. Bei einem unregelmäßigen Workload kann ein Token-basierter Plan besser sein als ein Abo; wer gleichmäßig den ganzen Tag programmiert, fährt mit dem Coding Plan normalerweise besser.

GLM vs. Claude, ChatGPT, Gemini und DeepSeek im Preisvergleich

GLMs Versprechen ist Frontier-Qualität ohne Frontier-Preise. Die Tabelle unten stellt die GLM-Flagships den Modellen gegenüber, für die du wahrscheinlich schon zahlst, auf Basis der Standard-API-Preise pro Million Tokens. GLM hält nicht mehr die Preisführerschaft: DeepSeek und GPT-5.6 Luna unterbieten es beide.

ModellInput / MOutput / M
GLM-5.2 (Zhipu)$1.40$4.40
GLM-4.7 (Zhipu)$0.60$2.20
Claude Opus 5$5.00$25.00
Claude Sonnet 5$2.00*$10.00*
GPT-5.6 Sol$5.00$30.00
GPT-5.6 Terra$2.00$12.00
GPT-5.6 Luna$0.20$1.20
Gemini 3.1 Pro$2.00$12.00
DeepSeek V4 Pro$0.44$0.87
Qwen3.7 Max$1.25$3.75

*Claude Sonnet 5 hat einen Einführungspreis bis zum 31. August 2026; die Standardpreise von $3.00 / $15.00 gelten ab September wieder.

Das Bild änderte sich am 30. Juli 2026. GLM-5.2 kostet beim Output noch immer weniger als die Hälfte von Gemini 3.1 Pro und etwa ein Siebtel von GPT-5.6 Sol, aber OpenAIs Preissenkung bedeutet, dass GPT-5.6 Luna GLM-5.2 beim Input um etwa 7x und beim Output um 3,7x unterbietet, und auch GLM-4.7 auf beiden Ebenen schlägt. GLMs verbleibender Vorteil liegt nicht im reinen Preis; er liegt in den Open Weights zum Selbst-Hosten, einem Flatrate Coding Plan und kostenlosen Flash-Modellen, auf die Luna keine Antwort hat. Für einen vollständigen Überblick über alle wichtigen Modelle, siehe unseren KI-Preisvergleich, und für eine weitere günstige Open-Weight-Option lies mehr über Qwen-Preise.

Eine einfachere Alternative zur Token-Abrechnung

Token-Mathematik ist mächtig, aber anstrengend, und die meisten Menschen wollen nicht Input- und Output-Preise vergleichen oder ein separates z.ai-Konto verwalten. Wer das lieber vermeidet, ist mit einem Flatrate-Abo besser bedient, das GLM zusammen mit anderen Frontier-Modellen enthält.

Bei Fello steht GLM-5.2 neben Claude, GPT und Gemini für einen einzigen Preis von $9.99 pro Monat. Du kannst denselben Prompt durch mehrere Modelle laufen lassen und die beste Antwort behalten, ohne Token-Abrechnung, ohne Kontingent-Jonglage und ohne chinesisches Konto einrichten zu müssen. Es ist der einfachste Weg, GLM preisfrei auszuprobieren, bevor du dich für die API entscheidest.

Fazit

GLM-Preise sind so fair wie bei kaum einem anderen Frontier-Modell. Der Chat ist kostenlos, zwei API-Modelle kosten nichts, GLM-5.2 liegt beim Output bei etwa einem Siebtel von GPT-5.6 Sol, und der GLM Coding Plan begrenzt intensiven Gebrauch auf eine monatliche Flatrate. Die günstigste Option pro Token ist es allerdings nicht mehr, seit DeepSeek und GPT-5.6 Luna beide darunter liegen.

Für die meisten ist der klügste Einstieg kostenlos unter chat.z.ai, dann GLM-4.7 für günstiges API-Coding, und GLM-5.2 für Flagship-Ansprüche. Wer Token-Abrechnung ganz vermeiden möchte, nutzt GLM zusammen mit Claude und GPT in Fello für einen einzigen Flatpreis.

FAQ

Was kostet GLM?

GLM-5.2 kostet $1.40 pro Million Input-Tokens und $4.40 pro Million Output-Tokens über die offizielle Z.ai-API, etwa ein Siebtel von GPT-5.6 Sol beim Output. GLM-4.7 ist günstiger bei $0.60 / $2.20, und der Chat sowie zwei Flash-Modelle sind kostenlos. Das neuere GLM-5.3 hat keinen veröffentlichten Token-Preis und ist nur über den Coding Plan erhältlich.

Ist GLM kostenlos nutzbar?

Ja. Du kannst kostenlos mit GLM unter chat.z.ai chatten, die Modellgewichte bis einschließlich GLM-5.2 sind Open-Source unter der MIT-Lizenz, und GLM-4.7 Flash sowie GLM-4.5 Flash sind für Input, zwischengespeicherten Input und Output kostenlos über die API nutzbar. GLM-5.3 hat noch keine öffentlichen Gewichte.

Was kostet der GLM Coding Plan?

Der GLM Coding Plan hat drei Tiers: Lite für $18, Pro für $72 und Max für $160 pro Monat, oder 30 % weniger bei Jahreszahlung. Alle Tiers bündeln GLM-5.2, GLM-5-Turbo, GLM-4.7, GLM-4.5-Air und das neuere GLM-5.3 für die Nutzung in Tools wie Claude Code und Cline.

Ist GLM günstiger als ChatGPT und Claude?

Günstiger als die Flagships, ja. GLM-5.2 liegt beim Output bei etwa einem Siebtel von GPT-5.6 Sol und deutlich unter Claude Opus 5 ($5.00 / $25.00), und bewältigt dabei die meisten alltäglichen Aufgaben ebenbürtig. Die günstigste Option insgesamt ist es aber nicht: DeepSeek und GPT-5.6 Luna ($0.20 / $1.20) unterbieten es beide.

Was ist das günstigste GLM-Modell?

GLM-4.7 Flash und GLM-4.5 Flash sind über die API kostenlos. Unter den kostenpflichtigen Modellen ist GLM-4.5 Air mit $0.20 Input und $1.10 Output pro Million Tokens am günstigsten, gefolgt von GLM-4.7 bei $0.60 / $2.20.