Aktualisiert am 5. September 2026

Beste KI-Modelle 2026

Rankings, Vergleiche und ausführliche Analysen, monatlich aktualisiert, sobald neue Modelle erscheinen.

OpenAI hat GPT-6 Astra am 3. September gestartet, der größte Launch des Monats und nicht der höchste Wert. Artificial Analysis misst ihn mit 61 auf dem Intelligence Index, exakt gleichauf mit GPT-5.6 Sol und fünf Punkte hinter Claude Fable 5.1, bei $10 / $50 pro 1M Tokens gegen die $4 / $20 von Sol. Wo er sich wirklich bewegt, ist agentisches Programmieren: 67 auf dem Coding Agent Index von Artificial Analysis in Codex, gleichauf mit Claude Opus 5 und Claude Fable 5 und hinter den 70 von Fable 5.1, erreicht mit einem Drittel der Tokens von Sol und einem Fünftel derer von Opus 5. Es ist das erste Modell, das OpenAI bei Cybersicherheit als kritisch eingestuft hat, deshalb kamen zuerst zugelassene Verteidiger aus dem Daybreak-Programm; ChatGPT Business und Pro folgten am 4. September und Plus wenige Stunden später, während die API, AWS, Azure und der Gratis-Tarif noch ausstehen. Diese Seite bewertet nach gemessenen Werten, ein Modell übernimmt eine Krone also, sobald es den Titelhalter auf den Boards schlägt, die die Kategorie definieren, ohne auf die abstimmungsbasierten Boards zu warten. Ein Modell, das noch niemand nutzen kann, wird auf der Karte gekennzeichnet statt von ihr ausgeschlossen.

Claude Fable 5.1 erschien am 1. September und ging direkt an die Spitze des Intelligence Index von Artificial Analysis, mit 66 dem höchsten Wert, den das Haus je gemessen hat, und nahm den Agentic Index mit 61 gleich mit. Claude Opus 5 wird zum Preis-Leistungs-Tipp bei dem, wonach die meisten Leser tatsächlich entscheiden, dem Preis, $5 / $25 pro 1M Tokens gegen die $10 / $50 von Fable 5.1. Diese Krone ist schmaler als zuvor: Alibabas Qwen3.8-Max-0902 debütierte am 2. September mit 1691 Punkten gegen die 1688 von Opus 5 auf #1 von Arenas Code Arena: WebDev, sodass Opus 5 nun image-to-WebDev anführt und bei WebDev Zweiter ist. Kein Arena-Board hat bisher Stimmen für 5.1, also hat sich nichts bewegt, was auf dieser Seite über menschliche Präferenz entschieden wird. Grok 4.6 ist die eigentliche Überraschung des Monats: ein Post-Training-Update von Grok 4.5, das um fünf Punkte auf 61 springt, damit mit GPT-5.6 Sol gleichzieht und dabei $2 / $6 kostet, und das lange agentische Aufgaben in rund der Hälfte der Züge abschließt, die Opus 5 braucht. Meta steigt schneller als alle anderen: Muse Spark 1.3 landete am 2. September mit 61 auf demselben Index, acht Punkte mehr als im Juli, auch wenn es ein Entwickler-Release ohne Consumer-Produkt ist, das auf Metas eigenem Chart jede Agenten-Zeile verliert. Unser Leitfaden zu KI-Benchmarks erklärt, was diese Werte tatsächlich messen.

Der zweite Wechsel spielt sich am günstigen Ende ab, und er ging zum ersten Mal in diesem Jahr in die falsche Richtung. DeepSeek erhöhte die Preise beider V4-Modelle am 16. August um rund das Vierfache und teilte die Preisliste in Spitzen- und Nebenzeiten, sodass DeepSeek V4-Flash 0731 jetzt $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten kostet statt der glatten $0.14 / $0.28 zum Start, was ihm den Preis-Leistungs-Tipp kostet. Der geht an GLM 5.3 Flash, das am 26. August mit MIT-Gewichten am ersten Tag kam, einem Intelligence Index von 57 und einem Listenpreis von $0.15 / $0.50, bis zum 9. September halbiert auf $0.075 / $0.25, und das DeepSeek jetzt zu jeder Tagesstunde unterbietet. Google hatte seinen eigenen Flash-Tarif bereits halbiert: Gemini 3.7 Flash erschien am 13. August zu einem einführenden $0.75 / $3.75, wobei Gemini 3.6 Flash auf denselben Tarif umgestellt wurde, und am 2. September folgte Gemini 3.8 Flash zu genau diesem Preis, mit 59 Punkten auf dem Intelligence Index von Artificial Analysis gegenüber 56 für 3.7 Flash. Alle drei Preise verdoppeln sich am 1. Januar 2027.

Das offene Feld schloss den Monat dann mit drei Releases in drei Tagen: GLM 5.3 veröffentlichte am 28. August endlich seine Gewichte, allerdings unter einer eigenen Z.ai-Lizenz statt dem reinen MIT, das sein kleineres Geschwistermodell bekam, Alibaba öffnete am 26. August Qwen3.8-Flash-Next als ersten öffentlichen Blick auf die Qwen4-Architektur, und Tencent stellte am 28. August Hy4 Preview mit 770 Milliarden Parametern unter Apache 2.0 frei. Unten stehen die Kategoriesieger für September 2026. Klicke auf eine beliebige Karte, um direkt zur vollständigen Aufschlüsselung zu springen, oder nutze die feste Navigation, um zwischen den Kategorien zu wechseln. Rankings, Benchmarks und Preise werden innerhalb von 48 Stunden nach jedem größeren Modellstart aktualisiert.

Kategoriesieger September 2026
Schreiben
Claude Fable 5.1
#1 Intelligence Index (66) und #1 GDPval-AA v2 (1853)
Schlägt Claude Fable 5 auf jedem Board, das beide gemessen hat, bei denselben $10 / $50. Bestes Preis-Leistungs-Verhältnis: Claude Sonnet 5, kostenlos auf claude.ai.
Ausführliche Analyse →
Chat & täglicher Assistent
GPT-5.6
ChatGPT-Standard seit 9. Juli
Der beste Assistent, den die meisten Menschen tatsächlich öffnen können, mit einer Balance aus Leistung, Tempo und Reichweite.
Ausführliche Analyse →
Bilder
ChatGPT Images 2.5
#1 und #2 auf beiden Bild-Boards von Arena
Seine beiden Modelle holten sich Text-zu-Bild und Bildbearbeitung binnen eines Tages nach dem Start, und es ist der Standard in jedem ChatGPT-Tarif, auch im kostenlosen. Bester Wert: Flare, das schnellere der beiden, zum selben Tokenpreis wie GPT Image 2.
Ausführliche Analyse →
Video
Gemini Omni 1.1 Flash
#1 Arena Text-to-Video (1515), 40-Sekunden-Szenen
Googles neuestes Videomodell: Szenenverlängerung auf 40 Sekunden, 4K-Ausgabe, ab $0.03 pro Sekunde.
Ausführliche Analyse →
Programmieren
Claude Fable 5.1
55,8 % Terminal-Bench 4.0 und #1 Coding Agent Index (70)
Der am höchsten bewertete Coder in den Harness-Benchmarks, bei $10 / $50. Bestes Preis-Leistungs-Verhältnis: Claude Opus 5 bei $5 / $25.
Ausführliche Analyse →
Kreativität
Grok 4.6
Wenigste Inhaltsbeschränkungen + natives Echtzeit-X
Der Tipp für kantige, angesagte Arbeit: die wenigsten Leitplanken und native X-Integration.
Ausführliche Analyse →
Genauigkeit & Recherche
Claude Fable 5.1
Höchste faktische Genauigkeit, die Artificial Analysis gemessen hat (67 %)
Führt die Boards an, die messen, wie oft ein Modell schlicht falsch liegt. Bestes Preis-Leistungs-Verhältnis: Gemini 3.1 Pro bei $0,52 pro Aufgabe mit Google-Search-Grounding.
Ausführliche Analyse →
Problemlösung
GPT-6 Astra
#1 LiveBench Reasoning (92,65) und #1 ARC-AGI-2 (95 %)
Hat GPT-5.6 Sol die schwersten Reasoning-Boards wenige Tage nach dem Start abgenommen. Bestes Preis-Leistungs-Verhältnis: GPT-5.6 Sol zu $4 / $20, weiterhin Zweiter auf ARC-AGI-2.
Ausführliche Analyse →
KI-Agenten
Gemini Spark
Erster rund um die Uhr in der Cloud laufender KI-Agent
Läuft durchgehend in einer Google-Cloud-VM, tief integriert mit Gmail, Docs und Chrome.
Ausführliche Analyse →

Willst du die besten KI-Modelle, ohne mit separaten Abos zu jonglieren? Fello AI vereint die führenden Modelle in einer nativen App für Mac, iPhone und iPad.

Fello AI laden
Was im September 2026 neu ist
3. Sep. OpenAI GPT-6 Astra startet für $10 / $50, zieht auf dem Intelligence Index mit 61 mit GPT-5.6 Sol gleich, und fast niemand kann es nutzen Neu
OpenAI hat GPT-6 Astra am 3. September 2026 gestartet und damit den Streit beendet, der das ganze Jahr lief: Das ist GPT-6 und kein weiteres Point-Release der GPT-5-Reihe. Firmenpräsident Greg Brockman sagte bei einem Pressebriefing „Willkommen in der AGI-Ära.“ Die unabhängigen Zahlen fallen nüchterner aus als die Rahmung. Artificial Analysis gibt Astra 61 auf dem Intelligence Index v4.1.1 bei max, exakt gleichauf mit GPT-5.6 Sol, fünf Punkte hinter Claude Fable 5.1 mit 66 und zwei hinter Claude Opus 5 mit 63, und es kostet $10 / $50 pro 1M Tokens gegen die $4 / $20 von Sol, was pro Index-Aufgabe 75 % teurer ist als das Modell, das es ablöst. Das stärkere Ergebnis liefert der Coding Agent Index: Astra kommt in Codex auf 67, gleichauf mit Claude Opus 5 und Claude Fable 5 in Claude Code und hinter den 70 von Claude Fable 5.1, und erreicht das mit einem Drittel der Tokens von Sol und einem Fünftel derer von Opus 5, was es auf die Kosteneffizienz-Grenze bringt. Auf AA-Omniscience halbiert es zudem die Halluzinationsrate, von 92 % auf 51 % bei max, und gewinnt dabei vier Punkte Genauigkeit, legt rund 80 Elo auf AA-Briefcase zu und sechs Punkte auf Humanity's Last Exam. Dagegen verliert es etwa 80 Elo auf GDPval-AA v2 und fällt bei Kundensupport, SciCode und Long-Context-Reasoning um zwei bis drei Punkte zurück. Zwei Vorbehalte gehören zu den Launch-Zahlen: Die 98,6 % auf ARC-AGI-3 sind keine Lösungsquote, sondern ein Effizienzwert für Aktionen gegen eine menschliche Referenz, gemessen auf einem Harness, von dem OpenAI selbst gezeigt hat, dass es das Ergebnis verdreifachen kann, und Epoch AI legt offen, dass OpenAI FrontierMath finanziert hat und exklusiven Zugang zu einem Teil davon hält. Die eigentliche Hürde ist die Verfügbarkeit. Astra ist das erste Modell, das OpenAI in seinem Preparedness Framework bei Cybersicherheit als kritisch eingestuft hat, deshalb bekamen es zugelassene Verteidiger im Daybreak-Programm zuerst. ChatGPT Business und Pro folgten am 4. September und Plus wenige Stunden später, während die API, AWS, Azure und die Gratis-Stufe noch ausstehen. Auf dieser Seite wechselt vorerst nichts. Alle Details in unserer GPT-6-Astra-Analyse.
2. Sep. Alibaba Qwen3.8-Max-0902 nimmt Claude Opus 5 Arenas WebDev-Board um drei Punkte ab, für $2 / $6 Neu
Alibaba brachte am 2. September 2026 Qwen3.8-Max-0902, und die Benennung ist das Erste, was man richtig verstehen muss: Dies ist eine Post-Training-Auffrischung des am 3. August erschienenen Qwen3.8-Max, keine neue Version, mit denselben 2,4 Billionen Parametern und demselben 1M-Token-Kontextfenster. Qwen gibt an, es sei zusätzlich auf Coding und Cowork-artige Arbeit nachtrainiert worden. Wichtig ist das Board, das es bewegt hat. Arena meldete am selben Tag, dass Qwen3.8-Max-0902 mit 1691 Punkten insgesamt auf #1 der Code Arena: WebDev debütierte, drei Punkte vor Claude Opus 5 (Max), siebzehn vor Kimi K3 (Max) und zweiundzwanzig vor dem bisherigen Qwen3.8-Max, dazu #1 in den Kategorien Data & Analytics und Consumer Product. Es ist das erste Mal in diesem Jahr, dass ein Anthropic-Modell von der Spitze eines abstimmungsbasierten Coding-Boards verdrängt wurde. Der Preis liegt bei $2 / $6 pro 1M Tokens mit Cache-Hits zu $0.17 explizit und $0.25 implizit, was Arena als gemischte $5 pro Million und beste Position auf ihrer Pareto-Front verbucht. Lies das mit drei Vorbehalten. Drei Punkte liegen auf einem abstimmungsbasierten Board im Rauschen, Artificial Analysis hat für den 0902-Snapshot keinen Intelligence Index veröffentlicht, und dies ist ein gehostetes Modell auf QwenCloud ohne Consumer-Chat-Oberfläche: Die offenen Gewichte, die Alibaba im August für Qwen3.8-Max versprach, sind weiterhin nicht erschienen, also ändert sich unser Open-Weight-Tipp dadurch nicht. Arena sagt, Agent-Arena-Werte stünden noch aus. Wir belassen die Coding-Kategorie bei Opus 5, das image-to-WebDev behält und pro Index-Aufgabe weniger kostet. Alle Details in unserer Analyse zu Qwen 3.8.
2. Sep. Meta Muse Spark 1.3, Intelligence Index von 57 auf 61 bei unveränderten $1.25 / $4.25, gewinnt beim Coding und verliert jede Agenten-Zeile Neu
Meta veröffentlichte Muse Spark 1.3 am 2. September 2026, das vierte Muse-Spark-Modell in fünf Monaten, in Muse Code und der Meta Model API. Artificial Analysis bewertet es mit 61 auf dem Intelligence Index v4.1.1, gegenüber 57 für 1.2 und 53 für 1.1, also acht Punkte in zwei Monaten und der schnellste Anstieg, den auf dieser Seite irgendjemand hinlegt. Der Preis hat sich überhaupt nicht bewegt: $1.25 / $4.25 pro 1M Tokens auf einem Kontextfenster von 1M Tokens, mit der Contributor-Stufe weiterhin bei $0.10 / $0.20 im Gegenzug dafür, dass Meta auf deinen Prompts und Completions trainieren darf. Zwei Dinge an diesem Start muss man genau lesen. Auf Metas eigener Scorecard gewinnt das Modell jede Coding-Zeile, DeepSWE v1.1 mit 75,4 gegen die 74,0 von Claude Opus 5 und SWEAtlas CodeBase QnA mit 59,4, es zieht bei Terminal-Bench 2.1 mit GPT-5.6 Sol bei 88,8 gleich und nimmt beide MRCR-Long-Context-Bänder mit deutlichem Abstand, 98,1 im Band von 512K bis 1M gegen 55,5 für 1.2. Es verliert aber auch alle sechs Zeilen, die Meta unter Agent führt, vier an Opus 5 und zwei an GPT-5.6 Sol, und diese Hälfte des Charts wurde kaum berichtet. Der zweite Haken ist, welches Modell gemessen wurde: Die Benchmark-Spalte ist Muse Spark 1.3 (max), eine Limited Preview für Metas Partner mit 62 Punkten, während die Version, die heute jeder aufrufen kann, xhigh mit 61 ist, und Meta ließ die Vergleichsspalte für 1.2 auf xhigh statt auf max laufen. Meta nannte überhaupt kein Consumer-Produkt, also läuft dieses Modell weder in der Meta-AI-App noch in WhatsApp oder Instagram, und das Open-Weights-Versprechen verschob sich erneut: Aus der Zusage vom August, die Gewichte von Muse Spark 1.2 zu veröffentlichen, wurde ein undatierter Satz über bald kommende offene Gewichte. Alle Details in unserer Muse Spark 1.3 Analyse.
2. Sep. Google Gemini 3.8 Flash, drei Punkte mehr auf dem Intelligence Index zum selben $0.75 / $3.75 Neu
Google hat Gemini 3.8 Flash am 2. September 2026 allgemein verfügbar gemacht, drei Wochen nach 3.7 Flash und als dritter Flash-Release in 43 Tagen. Alle Spezifikationen bleiben unverändert: 1M Eingabekontext, ein Ausgabelimit von 64K, Wissensstand März 2026, dieselbe Modalitätsliste und dieselben einführenden $0.75 / $3.75 pro 1M Tokens, die sich am 1. Januar 2027 auf $1.50 / $7.50 verdoppeln. Bewegt haben sich nur die Werte, und zwar in jeder veröffentlichten Zeile. DeepSWE v1.1 steigt von 65,3 % auf 73,7 %, Terminal-bench 2.1 von 85,8 % auf 89,4 %, Terminal-bench 4.0 von 11,2 % auf 19,1 % und BioMysteryBench Human Difficult von 43,5 % auf 56,5 %. Artificial Analysis gibt ihm 59 auf dem Intelligence Index v4.1.1 gegenüber 56 für 3.7 Flash und misst 304,6 Ausgabe-Tokens pro Sekunde gegenüber 279,4, bei einer langsamen Zeit bis zum ersten Token von 13,39 Sekunden, was es eher zu einem Batch- und Agentenmodell macht als zu einem für interaktiven Chat. Lies die Siege zusammen mit den Niederlagen: Googles eigene Vergleichstabelle gibt 3.8 Flash 8 von 14 Zeilen, und Claude Opus 5 gewinnt weiterhin Terminal-bench 4.0 mit 51,8 % gegen 19,1 %, OSWorld-2.0 mit 75,4 % gegen 59,0 % und GDPVal-AA v2 mit 1824 gegen 1545 Elo. Die DeepSWE-Zahl, die ein Großteil der Launch-Berichterstattung übernommen hat, 71,0 %, steht so nicht in Googles PDF; dort sind es 73,7 % gegen 74,0 % für Opus 5. Der Entwicklerzugang war zur Ankündigung live, über die Gemini API, AI Studio, Antigravity und die Gemini Enterprise Agent Platform. Der Verbraucherzugang wird für Abonnenten von Google AI Pro und Ultra berichtet, doch die Release Notes der Gemini-Apps führen dazu noch keinen Eintrag, und die kostenlose Gemini-Stufe läuft weiterhin auf 3.6 Flash. Alle Details in unserer Analyse zu Gemini 3.8 Flash.
1. Sep. Anthropic Claude Fable 5.1 und Mythos 5.1, eine neue #1 auf Artificial Analysis mit 66 und 75 % weniger für Cache-Reads Neu
Anthropic veröffentlichte Claude Fable 5.1 und Claude Mythos 5.1 am 1. September 2026, und es sind ein Modell in zwei Safeguard-Konfigurationen statt zwei Modelle. Fable 5.1 ist allgemein verfügbar; Mythos 5.1 lockert die Beschränkungen in Biologie und Cybersicherheit und wird auf Einladung vergeben, ohne veröffentlichte Kriterien. Artificial Analysis bewertet Fable 5.1 mit 66 auf seinem Intelligence Index v4.1.1 bei max Effort, dem höchsten Wert, den es je gemessen hat, vor Claude Opus 5 mit 63, Claude Fable 5 mit 62 sowie GPT-5.6 Sol und Grok 4.6 mit 61. Es holt sich außerdem den Agentic Index mit 61 gegen die 59 von Opus 5, das GDPval-AA v2 Board für professionelle Deliverables mit 1853 gegen 1824 und Humanity's Last Exam mit 59,1 % gegen die 55,5 % von Fable 5. Die Effort-Einstellung zählt hier mehr als sonst: Dasselbe Modell liest 58 bei low, 60 bei medium, 62 bei high und 65 bei xhigh, und diese Einstellungen spannen einen elffachen Unterschied bei den Output-Tokens auf, von 13,1 Millionen bis 143,7 Millionen über die gesamte Suite. Die Preise bleiben unverändert bei $10 / $50 pro 1M Tokens, aber Cache-Reads fallen um 75 % auf $0.25 von den $1.00 bei Fable 5, und genau dort liegt bei langen agentischen Läufen die eigentliche Ersparnis. Nach Anthropics eigenen Zahlen erreicht es 52,6 % auf Terminal-Bench-Science 0.1 gegen die 29,0 % von Opus 5, und die 212-seitige System Card hob die eigene Alignment-Risikoeinschätzung des Unternehmens von sehr niedrig auf niedrig. Zwei Dinge vor dem Wechsel: Anthropic rät weiterhin, für die meisten Workloads mit Opus 5 zum halben Preis zu beginnen, und kein Arena-Board hat Stimmen für eines der beiden Modelle, also hat sich nichts bewegt, was auf dieser Seite auf menschlicher Präferenz ruht. Alle Details in unserer Aufschlüsselung zu Claude Fable 5.1 und Mythos 5.1.
28. Aug. Z.ai GLM-5.3-Gewichte sind nach der Sicherheitspause da, aber die Lizenz ist nicht MIT Neu
Z.ai veröffentlichte die GLM-5.3-Gewichte am 28. August 2026 auf Hugging Face, zwei Wochen nach dem API-Start und genau zu dem Datum, das der Platzhalter trug. Die zugesagte Sicherheitsbewertung hat also tatsächlich stattgefunden, und die Pause ist abgeschlossen statt offen. Geändert hat sich die Lizenz. GLM 5.3 Flash war zwei Tage zuvor unter reinem MIT erschienen; das Flaggschiff trägt ein eigenes Dokument mit dem Titel GLM 5.3 License, und das Lizenzfeld der Modellkarte lautet glm-5.3 statt mit. Die Rechteeinräumung selbst folgt MIT eng, mit dem Recht, das Modell auszuführen, bereitzustellen, nachzutrainieren, zu verändern, zu verbreiten und zu verkaufen, und mit Gewichten, die ausdrücklich in die Definition der Software aufgenommen sind, sodass die kommerzielle Nutzung fast allen offensteht. Eine Klausel ist wirklich neu: Ein Model-as-a-Service-Betreiber, dessen Umsatz in zwölf aufeinanderfolgenden Monaten 10 Milliarden Dollar übersteigt, muss vor dem kommerziellen Einsatz eine Sicherheitsprüfung von Z.ai bestehen, wobei Z.ai sich vorbehält, Umfang und Methode dieser Prüfung selbst zu bestimmen. Beachte außerdem, dass Hugging Face den veröffentlichten Checkpoint mit 753B Parametern zählt, gegenüber der 744B-Basis, die Z.ai mit GLM-5.2 zu teilen angibt; das ist die Art Abweichung, die eine mechanische Parameterzählung erzeugt, und kein Beleg für ein anderes Modell. Unseren Open-Weight-Tipp verschiebt das nicht. GLM 5.3 Flash bleibt das Modell, das wir hosten würden, denn 320B unter reinem MIT lässt sich deutlich leichter betreiben und rechtlich klären als 753B unter einer eigenen Lizenz. Alle Details in unserer GLM-5.3-Aufschlüsselung.
28. Aug. Tencent Tencent Hy4 Preview, 770B offene Gewichte unter Apache 2.0 und das bislang größte permissiv lizenzierte Modell Neu
Tencent veröffentlichte und öffnete Hy4 preview am 28. August 2026, das neue Flaggschiff seiner Hunyuan-Reihe und das größte Modell, das jemals unter Apache 2.0 erschienen ist. Es läuft mit 770 Milliarden Parametern insgesamt und 49 Milliarden aktiven pro Token in einem Mixture-of-Experts-Design, verarbeitet ein Kontextfenster, das Tencent als über 1M Tokens hinausgehend beschreibt, und erscheint neben den Gewichten in voller Präzision auch als FP8-Build. Die API-Preise liegen bei $0.834 pro 1M Input-Tokens, $2.501 für Output und $0.042 für zwischengespeicherten Input, was für diese Größe günstig ist. Die eigentliche Nachricht ist die Lizenz: Apache 2.0 ist permissiver als das eigene Dokument von Kimi K3 und als die Lizenz, die Z.ai am selben Tag an GLM 5.3 gehängt hat. Behandle die Qualitätsaussage mit Vorsicht, denn der einzige bisherige Beleg stammt vom Hersteller. Tencent führte eine interne Blindbewertung von 203 Engineering-Aufgaben durch, die von 163 Fachleuten bewertet wurden, und Hy4 preview erreicht dort 2,99 von 4,00 gegen 2,94 für Kimi K3 und 2,92 für GLM 5.3. Das ist Tencents eigenes Panel, die Abstände liegen innerhalb eines Zehntelpunkts, und kein unabhängiges Haus hat bisher einen Intelligence Index oder eine Arena-Bewertung dafür veröffentlicht, also führen wir es auf, statt es einzuordnen. Tencent gibt außerdem an, das Modell habe geholfen, die Optimierung seiner eigenen Trainingspipeline zu automatisieren, und seinen eigenen Inferenzdurchsatz um gemessene 31,8 % gesteigert. Es ist als offene Gewichte verfügbar sowie über WorkBuddy, CodeBuddy, Yuanbao und ima, dazu über Tencent Cloud TokenHub und OpenRouter, mit kostenlosem Zugang auf WorkBuddy und CodeBuddy für zwei Wochen ab Start. Alle Details in unserer Analyse zu Tencent Hy4 Preview.
26. Aug. Z.ai GLM 5.3 Flash, Ox Alpha enttarnt, und die ersten MIT-Gewichte seit GLM-5.2 Neu
Z.ai veröffentlichte GLM 5.3 Flash am 26. August 2026, und es ist nicht das Modell, auf das das Feld gewartet hat. Die am 14. August zurückgehaltenen Gewichte gehören zu GLM 5.3; dies hier ist ein eigenes Modell auf einer neu trainierten Basis, 320 Milliarden Parameter mit 18 Milliarden aktiven, das erste nativ multimodale Modell der GLM-5-Reihe, und es stand am selben Tag unter MIT auf Hugging Face. Es ist zugleich das Stealth-Modell, das auf OpenRouter als Ox Alpha Traffic bediente und während dieser Vorschau ausschließlich auf chinesischen KI-Chips lief, was beschreibt, wie es ausgeliefert wurde, nicht wie es trainiert wurde. Artificial Analysis bewertet es mit 57 auf dem Intelligence Index v4.1.1, vier Punkte über GLM-5.2 bei weniger als der halben Größe, und setzt es auf die Pareto-Front aus Intelligenz und Kosten, bei rund $0.09 pro Index-Aufgabe. Der Listenpreis liegt bei $0.15 / $0.50 pro 1M Tokens, mit einer 50-Prozent-Einführungsaktion bis 24:00 Uhr am 9. September, und nach DeepSeeks Preiserhöhung vom 16. August unterbietet dieser Listenpreis DeepSeek V4-Flash 0731 zu jeder Tagesstunde. Behandle die Coding- und Agentic-Zahlen mit Vorsicht: Sie stammen aus Z.ais eigenem Chart, das Claude Opus 4.8 und GPT-5.6 Terra als Vergleich wählt statt der aktuellen Spitzenreiter, und dort stehen Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 gegen 46,2 für GLM-5.2 und AutomationBench 48,8. Die einzige Zahl in diesem Chart, die Artificial Analysis erhoben hat, ist GDPval-AA v2, wo GLM 5.3 Flash 1773 Elo erreicht, den höchsten dort eingetragenen Wert. Arena-Stimmen gibt es noch keine. Unseren Open-Weight-Tipp verschiebt das sehr wohl: GLM 5.3 Flash ersetzt GLM-5.2 als das MIT-Modell, das wir hosten würden. Eine Warnung zur Hardware: 18B aktiv heißt nicht 18B zum Hosten, denn das Mixture-of-Experts-Routing braucht alle 320B Gewichte im Speicher, das ist also ein Multi-GPU-Server und keine Workstation. Alle Details in unserer GLM-5.3-Flash-Aufschlüsselung.
26. Aug. Alibaba Qwen3.8-Flash-Next, offene Gewichte und der erste öffentliche Blick auf die Qwen4-Architektur Neu
Alibaba veröffentlichte Qwen3.8-Flash-Next am 26. August 2026 auf Hugging Face, und es geht dabei eher um die Architektur als um die Punktetabelle: Qwen bezeichnet es als frühen Blick auf das Design, das die Qwen4-Familie nutzen wird, veröffentlicht, damit sich die Community darauf vorbereiten kann. Es ist ein Mixture-of-Experts mit 125 Milliarden Parametern und nur 6 Milliarden aktiven pro Token, dazu ein separates N-Gramm-Embedding mit 51 Milliarden Parametern, und es verarbeitet Text, Bild und Video. Der Kontext liegt nativ bei 262.144 Tokens, erweiterbar auf 1M. Zu Qwens veröffentlichten Werten gehören 91,7 auf GPQA Diamond, 62,5 auf SWE-Bench Pro, 58,7 auf DeepSWE 1.1, 81,0 auf SWE-Bench Multilingual und 84,5 auf AndroidWorld Vision, alle vom Hersteller, bisher ohne unabhängigen Intelligence Index und ohne Arena-Stimmen. Die Lizenz solltest du lesen, bevor du darauf aufbaust, denn es ist kein Apache. Die Qwen Community License 1.0 erlaubt kommerzielle Nutzung, Veränderung und Hosting, verlangt aber eine gut sichtbare Nennung des Modellnamens, sobald ein Produkt 100 Millionen monatlich aktive Nutzer oder 20 Millionen Dollar Monatsumsatz überschreitet, und verlangt eine separate Lizenz von Qwen, um ein Model-as-a-Service- oder ein KI-Arbeitsassistenz-Geschäft darauf zu betreiben. Interne Nutzung ist von dieser zweiten Bedingung ausgenommen.
21. Aug. OpenAI GPT-5.6 Sol um über 20% gesenkt, jetzt auf beiden Seiten unter Claude Opus 5 Neu
OpenAI senkte GPT-5.6 Sol am 21. August 2026 von $5 / $30 auf $4 / $20 pro 1M Tokens, die erste Senkung beim Flaggschiff seit dem Start der GPT-5.6-Familie im Juli. Der Preis ist ein Aktionspreis und gilt laut OpenAI rund drei Monate. Er umfasst die API sowie Credits für Codex und ChatGPT Work; die Abopreise für Plus, Pro und Business bleiben unverändert. Mit $4 / $20 unterbietet Sol jetzt Claude Opus 5 zu $5 / $25 bei Input und Output, zum ersten Mal ist OpenAIs Flaggschiff das günstigere der beiden.
16. Aug. DeepSeek DeepSeek erhöht die API-Preise um rund das Vierfache und teilt die Preisliste in Spitzen- und Nebenzeiten Neu
DeepSeek stellte beide V4-Modelle am 16. August 2026 um 16:00 UTC auf eine neue Preisliste um, und die Richtung ist für dieses Feld ungewöhnlich: Die Preise stiegen, zu Spitzenzeiten um rund das Vierfache. V4-Flash 0731 ging von glatten $0.14 / $0.28 pro 1M Tokens auf $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten, und V4-Pro 0813 von $0.435 / $0.87 auf $0.66 / $1.98 außerhalb der Spitzenzeiten und $1.32 / $3.96 zu Spitzenzeiten, mit zwischengespeichertem Input bei $0.007 beziehungsweise $0.022 außerhalb der Spitzenzeiten. Spitzenzeit ist von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC, Montag bis Freitag, und jede andere Stunde ist Nebenzeit zu genau der Hälfte des Spitzentarifs. DeepSeek stellte das als sinnvollere Verteilung der Kapazität dar. An den Modellen selbst hat sich nichts geändert, das ist also rein ein wirtschaftliches Ereignis, für diese Seite aber ein folgenreiches: Es kostet DeepSeek V4-Flash den Preis-Leistungs-Tipp, der an GLM 5.3 Flash mit $0.15 / $0.50 Listenpreis geht, ein Tarif, der selbst DeepSeeks günstigeren Nebenzeitpreis zu jeder Tagesstunde unterbietet. Die Gewichte stehen weiterhin unter MIT, wer selbst hostet, ist also nicht betroffen. Alle Details in unserer DeepSeek-V4-Aufschlüsselung.
14. Aug. Z.ai GLM 5.3, ein großer agentischer Sprung allein durch Nachtraining, erschien ohne die offenen Gewichte Neu
Z.ai veröffentlichte GLM 5.3 am 14. August 2026, und bemerkenswert ist, was sich nicht geändert hat: Es läuft auf derselben Basis mit 744 Milliarden Parametern wie GLM-5.2, ohne neues Pretraining. Jeder Zuwachs stammt aus skaliertem Nachtraining, und die agentischen sind groß. Auf Z.ais eigenem Chart steigt Terminal-Bench 3.0 von 4,6 auf 28,3, DeepSWE v1.1 von 46,2 auf 66,9 und CyberGym von 77,2 % auf 84,5 %, womit das Unternehmen nach eigenen Angaben Claude Mythos 5 mit 83,8 und GPT-5.6 Sol mit 83,6 knapp übertrifft. Alle diese Zahlen stammen vom Hersteller, bisher ohne unabhängige Prüfung, und an anderer Stelle ist das Chart weniger schmeichelhaft: Auf Z.ais internem Code Bench führt weiterhin Claude Fable 5 mit 39,5 % gegen 31,4 % für GLM 5.3, und auf ExploitBench liegen die Frontier-Spitzenreiter bei 78,0 % gegen 54,4 %. Der Haken ist die Lizenz, nicht der Wert. GLM-5.2 lieferte innerhalb weniger Tage MIT-lizenzierte Gewichte; GLM 5.3 erschien ohne jede, und Z.ai sagte, sie folgten nach einer Sicherheitsbewertung der Fähigkeit des Modells, Schwachstellen zu finden, rund zwei Wochen später. Das hat sich am 28. August 2026 erledigt, als Z.ai die Gewichte genau zu dem Datum veröffentlichte, das der Platzhalter trug, allerdings unter einer eigenen GLM 5.3 License statt dem reinen MIT, das GLM-5.2 und GLM 5.3 Flash beide bekamen. Der Tokenpreis ist inzwischen veröffentlicht, $1.40 / $4.40 pro 1M Tokens, neben dem GLM Coding Plan und ZCode. Was am 26. August stattdessen kam, war GLM 5.3 Flash, ein anderes und kleineres Modell, das MIT-Gewichte tatsächlich lieferte, und genau dieses Release hat unseren Open-Weight-Tipp verschoben. Alle Details in unserer GLM-5.3-Aufschlüsselung.
13. Aug. Google Gemini 3.7 Flash, Coding-Werte springen und der Preis halbiert sich auf $0.75 / $3.75, bis Januar Neu
Google brachte Gemini 3.7 Flash am 13. August 2026 heraus, 23 Tage nach 3.6 Flash und als dritte Flash-Version in weniger als zwei Monaten, während Gemini 3.5 Pro weiterhin nicht erschienen ist. Die Coding-Gewinne sind der Punkt: DeepSWE v1.1 steigt von 49,0 % auf 65,3 %, FrontierCode 1.1 Main von 34,4 % auf 43,6 %, und AutomationBench verdoppelt sich nahezu von 17,0 % auf 30,4 %. Artificial Analysis bewertet es mit 56 auf seinem Index v4.1.1 gegen 52 für 3.6 Flash und setzt es bei der Ausgabegeschwindigkeit mit 385,1 Tokens pro Sekunde auf Platz eins von 182 Modellen, was es auf die Pareto-Front von Intelligenz gegen Zeit bringt. Kontextfenster und das Output-Limit von 64K sind gegenüber 3.6 Flash unverändert, es wurde also nichts geopfert. Zwei Einschränkungen wiegen schwerer als die Benchmarks. Der Tarif von $0.75 / $3.75 ist einführend und läuft am 31. Dezember 2026 aus, danach verdoppelt er sich auf $1.50 / $7.50, genau das, was 3.6 Flash beim Start kostete; Google stellte 3.6 Flash zugleich auf denselben Tarif um, beide kosten jetzt also gleich viel, und das Upgrade ist eine reine Fähigkeitsentscheidung. Und der Verbraucherzugang läuft nur über Spark, das Google AI Pro oder Ultra erfordert und den Europäischen Wirtschaftsraum, das Vereinigte Königreich, die Schweiz und Nigeria ausschließt, sodass die meisten europäischen Leser es in der Gemini-App überhaupt nicht erreichen. Die kostenlose Gemini-Stufe erhält weiterhin 3.6 Flash. Der API-Zugang ist überall unberührt. Alle Details in unserer Gemini-3.7-Flash-Aufschlüsselung.
12. Aug. SpaceXAI Grok 4.6, Post-Training hebt den Intelligence Index von 56 auf 61 bei unverändert $2 / $6 Neu
SpaceXAI veröffentlichte Grok 4.6 am 12. August 2026, und es ist ausdrücklich kein neues Basismodell: Das Unternehmen behielt die Grundlage von Grok 4.5 und erkaufte die Gewinne mit einem längeren ergänzenden Trainingslauf, neu erzeugten Fine-Tuning-Trajektorien und Reinforcement Learning in agentischen Umgebungen. Eine neue Architektur oder Parameterzahl wurde nicht veröffentlicht. Artificial Analysis bewertet es mit Intelligence Index 61, fünf Punkte über Grok 4.5, womit es sich den dritten Platz mit GPT-5.6 Sol teilt, hinter Claude Opus 5 mit 63 und Claude Fable 5 mit 62, so wie der Index in jenem Monat stand; Claude Fable 5.1 hat sich seither mit 66 über alle drei geschoben. Die agentischen Zahlen sind stärker als der Gesamtindex: ein GDPval-AA-v2-Elo von 1753 nur hinter Opus 5, 88,4 % auf Terminal-Bench v2.1 und 50,7 % auf tau3-Banking. Das eigentliche Argument ist die Effizienz, bei $0.84 pro Index-Aufgabe und rund 53 Zügen und 0,5 Milliarden Input-Tokens bei langen Aufgaben gegen etwa 103 Züge und 2,0 Milliarden bei Opus 5. Die Preise bleiben unverändert bei $2 / $6 pro 1M Tokens mit gecachtem Input zu $0.50, beim selben Kontextfenster von 500K Tokens, aber es gibt eine Falle, die du kennen solltest: Erreicht ein Prompt 200.000 Tokens, rechnet SpaceXAI die gesamte Anfrage mit $4 / $12 ab, nicht nur den Überhang. Eine Warnung zur Benchmark-Abdeckung, weil viele Berichte das bereits verdreht haben: Terminal-Bench v3.0 ist ein anderer und deutlich härterer Test als v2.1, also sind 26 % auf v3.0 und 88,4 % auf v2.1 beide wahre Aussagen über dasselbe Modell. Es lief vom ersten Tag an in der SpaceXAI-API, in Cursor und Grok Build sowie bei Partnern wie OpenRouter, Vercel und Cloudflare. Alle Details in unserer Aufschlüsselung zu Benchmarks und Preisen von Grok 4.6.
5. Aug. Meta Muse Spark 1.2 und Muse Code, Intelligence Index von 51 auf 57 bei unverändert $1.25 / $4.25, plus ein Terminal-Coding-Agent Neu
Meta veröffentlichte Muse Spark 1.2 am 5. August 2026 zusammen mit Muse Code, seinem ersten Terminal-Coding-Agenten, der unter macOS und Linux ohne Desktop-App und ohne Abo läuft. Artificial Analysis bewertet das Modell mit Intelligence Index 57 bei höchster Reasoning-Einstellung auf seinem aktuellen Index v4.1.1, gegenüber 51 für 1.1 und 43 für die April-Version, und fast der gesamte Zuwachs ist agentisch statt Allgemeinwissen; sein GDPval-AA v2 Elo sprang von 1371 auf 1631, während Terminal-Bench v2.1 nur von 78 % auf 80 % anstieg. Die Preise bleiben unverändert bei $1.25 / $4.25 pro 1M Tokens auf einem Kontextfenster von 1M Tokens, und Meta ergänzte eine Contributor-Stufe zu $0.10 / $0.20, rund 92 % günstiger, im Gegenzug dafür, dass Meta auf deinen Prompts und Completions trainieren darf. Die Verfügbarkeit weitete sich von der US-only-Vorschau, unter der 1.1 startete, auf erweiterten globalen Zugang über Muse Code, die Meta Model API und OpenRouter aus. Auf Metas eigenen Launch-Charts landet das Modell bei allen drei veröffentlichten Coding-Benchmarks hinter Claude Opus 5 auf Platz zwei, mit 82,9 % gegen 86,7 % auf Terminal-Bench 2.1.
3. Aug. Alibaba Qwen 3.8 (Qwen3.8-Max), 2,4 Billionen Parameter starkes multimodales Flaggschiff jetzt allgemein verfügbar bei $2 / $6 Neu
Alibaba machte Qwen3.8-Max am 3. August 2026 allgemein verfügbar, zwei Wochen nach der Vorschau auf der WAIC Shanghai, und jede Zahl, die bei der Vorschau noch fehlte, hat jetzt einen Wert. Es läuft mit 2,4 Billionen Gesamtparametern und rund 95 Milliarden aktiven pro Token auf einem spärlichen Mixture-of-Experts-Design, verarbeitet Text, Bilder und Video und bestätigt ein Kontextfenster von 1M Tokens mit bis zu 128K Output-Tokens. Die API-Preise liegen bei $2 / $6 pro 1M Tokens, flach über den gesamten Kontext statt gestaffelt nach Prompt-Länge, mit Cache-Reads zu $0.25. Die Aussage „nur hinter Fable 5" spaltet sich jetzt sauber in zwei Teile: Auf Arenas Vision-Board ist es mit 1305 die #2, nur hinter Fable 5, doch auf dem Text-Board ist es mit 1496 die #5, hinter vier Anthropic-Einträgen. Beide Arena-Werte sind noch als vorläufig markiert, und die versprochenen offenen Gewichte sind nicht erschienen. Wir halten Qwen 3.8 aus den gerankten Tipps heraus, bis die Gewichte und die Lizenz tatsächlich vorliegen.
Ausstehend Google Gemini 3.5 Pro, weiterhin unveröffentlicht, laut Bloomberg Monate hinter dem Zeitplan Verzögert
Gemini 3.5 Pro bleibt der größte ausstehende Launch. Google kündigte es auf der I/O am 19. Mai zusammen mit Gemini 3.5 Flash an, doch nur Flash erschien, und das Juni-Ziel verstrich. Bloomberg berichtete am 16. Juli 2026, dass das Modell Monate hinter dem Zeitplan liegt und Googles interne Ziele verfehlt hat, wobei das Unternehmen weiterhin daran arbeitet, seine Fähigkeiten insbesondere beim Programmieren zu verbessern. Das ist das gesamte belegte Bild. Google hat nie öffentlich ein Startdatum bestätigt, und Google hat keine finalen Spezifikationen wie Kontextfenster oder Reasoning-Modi veröffentlicht, also behandle kursierende Zahlen als unbestätigt. Nutze in der Zwischenzeit Gemini 3.8 Flash, wenn du über die API arbeitest, oder Gemini 3.6 Flash, wenn du in der kostenlosen Gemini-App bist, die es weiterhin ausführt; wir nehmen 3.5 Pro in dem Moment ins Haupt-Ranking auf, in dem es live geht.
Kategorie-Tipp, September 2026

Beste KI zum Schreiben

1
Claude Fable 5.1
Bestes Schreiben insgesamt
2
Kimi K3
Kreative Fiktion
3
Claude Sonnet 5
Kostenlos für den Alltag

Die beste KI zum Schreiben ist Claude Fable 5.1, das Claude Fable 5 auf jedem Board schlägt, das beide gemessen hat, bei denselben $10 / $50, mit Claude Sonnet 5 als Preis-Leistungs-Tipp der Gratisversion und Claude Fable 5 als Wahl, wenn du Arenas menschliche Stimmen höher gewichtest als die Harness-Werte. Fable 5 führt Arenas Creative-Writing-Leaderboard an und ist mit 90,7 Spitzenreiter bei LiveBench Language, ist auf EQ-Bench Creative Writing v3 aber auf Platz acht abgerutscht. Dieses Board führt jetzt GPT-6 Astra mit 2163.9 an, gefolgt von Claude Fable 5.1 mit 2152.7. Das ist eine Änderung gegenüber dem letzten Monat, als Claude Sonnet 5 diesen Platz bei GDPval-AA hielt; die Präferenz-Boards stützen diese Platzierung nicht, also ist Sonnet 5 jetzt der Preis-Leistungs-Tipp statt der Qualitätsführer. Fable 5 kostet $10 / $50 pro 1M Tokens und ist dauerhaft in Claude Max und Team Premium bei rund 50 % der regulären Nutzungslimits enthalten. Wenn dein Text ein Arbeits-Deliverable statt Prosa ist: Das GDPval-AA v2 Board für professionelle Deliverables wird jetzt von Claude Fable 5.1 mit 1853 angeführt, vor Claude Opus 5 mit 1824 und Fable 5 mit 1723. Fable 5.1 kam am 1. September als leistungsfähigeres Modell zum selben Preis von $10 / $50 und schlägt Fable 5 auf jedem Board, das beide gemessen hat, einschließlich Humanity's Last Exam mit 59,1 % gegen 55,5 %. Wir haben die Krone an es vergeben, weil diese Seite nach gemessenen Werten bewertet; Arena hat es noch nicht bewertet, weshalb Fable 5 als Tipp nach menschlicher Präferenz in der Tabelle bleibt. Übersetzung ist eine eigene Frage mit einem eigenen Sieger, die wir in unserem Leitfaden zur besten KI für Übersetzungen aufarbeiten.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Fable 5.1Bestes Schreiben insgesamt#1 Humanity's Last Exam (59,1 %), #1 GDPval-AA v2 (1853), #1 Intelligence Index (66)Noch keine Arena-Stimmen, also auf den Präferenz-Boards unbewertet$10 / $50
Claude Fable 5Führt die Arena-Boards mit menschlichen Stimmen an#1 Arena Text insgesamt (1508.6), #1 LiveBench Language (90.7), #8 EQ-BenchTeuerste Option hier$10 / $50
Kimi K3Kreative Fiktion und Stimme#4 EQ-Bench Creative Writing (2070.6)Nur #10 auf Arena Creative Writing$3 / $15
Claude Sonnet 5Kostenloses AlltagsschreibenKostenlos und Standard auf claude.ai, 1M Kontext#53 Arena Creative Writing; 75,0 LiveBench Language$2 / $10, jetzt dauerhaft
Claude Opus 5Professionelle Deliverables mit Preisvorteil#2 GDPval-AA v2 mit 1824, vor Fable 5 (1723)Hinter Fable 5 bei Arena Text, hinter Fable 5.1 bei GDPval-AA v2$5 / $25
GPT-5.5Faktenbasiertes Business-SchreibenDokumentierte Zuwächse bei faktischer Verlässlichkeit gegenüber GPT-5.4Reasoning-Stufen jetzt als veraltet markiert$5 / $30
Gemini 3.8 FlashMassen-Entwürfe in großem UmfangIntelligence Index 59, 304,6 Tok/s Ausgabe, 1M KontextEher auf Agenten als auf Prosa getrimmt; Einführungspreis verdoppelt sich am 1. Januar 2027$0.75 / $3.75
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der Tipp, wenn du Arenas menschliche Stimmen höher gewichtest, Kimi K3 ist der Tipp für eigenwillige Fiktion, steht auf EQ-Bench aber inzwischen auf Platz vier, Claude Sonnet 5 ist der Preis-Leistungs-Tipp und das Modell, wenn du nicht zahlst, Claude Opus 5 ist der günstigere Tipp für professionelle Deliverables, und Gemini 3.8 Flash ist der Tipp für Massenentwürfe.
Was sich diesen Monat geändert hat

Die Schreibkrone ging an Claude Fable 5.1, und die Regel hinter dieser Seite ging mit: Wir bewerten jetzt nach gemessenen Werten, statt auf Arenas menschliche Stimmen zu warten. Fable 5.1 schlägt Fable 5 auf jedem Board, das beide gemessen hat, mit Humanity's Last Exam bei 59,1 % gegen 55,5 %, GDPval-AA v2 bei 1853 gegen 1723 und dem Intelligence Index bei 66 gegen 62, alles bei denselben $10 / $50. Claude Fable 5 behält Arenas Text- und Creative-Writing-Boards, wo es zum Stichtag 1. August weiterhin #1 mit 1508,6 ist, bleibt also für alle in der Tabelle, die menschliche Präferenz höher gewichten als Harness-Werte, und Claude Sonnet 5 bleibt der kostenlose Preis-Leistungs-Tipp. Zwei Zahlen aus dem Vormonat wurden ebenfalls neu angepasst: AA-Omniscience liest sich jetzt als 43 für beide Fable-Modelle statt 40, und Fable 5 auf Humanity's Last Exam liest sich als 55,5 % statt 53,3 %.

Kategorie-Tipp, September 2026

Beste KI für Chat & täglichen Assistenten

1
GPT-5.6
ChatGPTs Standard
2
Claude Fable 5
Am höchsten bewertet
3
Claude Opus 5
Durchdachte Tiefe

Die beste KI für den täglichen Chat ist GPT-5.6, und der ehrliche Grund ist Reichweite statt Board-Position. Es ist das Modell, das ChatGPT der größten Nutzerbasis der Kategorie standardmäßig ausliefert, was es zum besten Assistenten macht, den die meisten Menschen tatsächlich öffnen können. Bei der reinen menschlichen Präferenz ist es nicht der Spitzenreiter: GPT-5.6 Sol sitzt mit 1482,8 auf #14 von Arenas Text-Leaderboard, wo Claude Fable 5 mit 1508.6 führt. Die meisten ChatGPT-Nutzer bekommen die ausgewogene Terra-Stufe, von der OpenAI sagt, sie entspreche GPT-5.5 und koste seit der Preissenkung vom 30. Juli 2026 60 % weniger. Es ist verfügbar in ChatGPT (kostenlos mit Limits, Plus zu $20/Monat, Pro zu $100/Monat), über die API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 pro 1M Tokens) und gebündelt in Fello AI neben Claude, Gemini, Grok und DeepSeek. Ein Vorbehalt: OpenAIs System Card und der Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, sodass GPT-5.5 Instant der sicherere Tipp für halluzinationsempfindliche Arbeit bleibt.

ModellAm besten fürStärkeSchwächePreis
GPT-5.6Täglicher Chat, ChatGPTs StandardDer Assistent, den die meisten öffnen können; Terra entspricht GPT-5.5 zu ~halbem Preis#14 auf Arena Text; Scheming von METR gemeldetKostenlos / $20/Mon. Plus; API $0.20 / $1.20 bis $4 / $20
Claude Fable 5Am höchsten bewertete Konversation#1 auf Arena Text insgesamt (1508.6) und in 6 von 7 UnterkategorienKeine Gratisversion; Zugang über Nutzungscredits auf Pro$10 / $50 API
Claude Opus 5Durchdachte, differenzierte Antworten#1 Artificial Analysis Intelligence Index (63) und Agentic Index (55.3)#6 auf Arena Text, hinter Claude Fable 5$20/Mon. Pro, $5 / $25 API
GPT-5.5 InstantHalluzinationsempfindliche Alltagsarbeit52,5 % weniger halluzinierte Aussagen vs. 5.3 InstantReasoning-Stufen jetzt als veraltet markiert$20/Mon. Plus; API $5 / $30
Gemini 3.6 FlashSchnell, kostenlos, multimodalWeiterhin das Modell, das die kostenlose Gemini-Stufe bedient, 1M Kontext, #12 auf Arena TextSchwächer beim schwersten Reasoning; 3.8 Flash übertrifft es zum selben PreisKostenlos / $0.75 / $3.75 API
Fello AIAlle Top-Modelle, eine AppChatGPT + Claude + Gemini + Grok + DeepSeek und mehr auf Mac, iPhone und iPadÜber die App geroutet, nicht direkt$9.99/Mon.
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der eigentliche Präferenzführer, Claude Opus 5 ist der Zweitplatzierte für durchdachte Alltagsnutzung, Gemini 3.6 Flash ist der Zweitplatzierte für schnell und kostenlos, und Grok 4.6 ist der Nischen-Tipp für Live-News-Tage. Fello AI ist die naheliegende Wahl, wenn du die Top-Modelle in einer Mac- und iOS-App für $9.99/Monat willst, statt mit Abos zu jonglieren.
Was sich diesen Monat geändert hat

GPT-5.6 behält den Chat-Tipp aufgrund seiner Reichweite, und der Abstand zum Präferenzführer wuchs eher, als dass er sich schloss. Zum Stichtag 1. August sitzt Sol mit 1482,8 auf #14 bei Arena Text, herunter von #11, während Claude Fable 5 mit 1508.6 führt. Am Produkt änderte sich nichts, also bewegt sich die Krone nicht: Es geht weiterhin darum, welchen Assistenten die meisten Menschen tatsächlich öffnen können. OpenAIs GPT-6 Astra ist am 3. September erschienen und erreichte ChatGPT Business und Pro am 4. September, Plus wenige Stunden später, doch die Wahl bleibt wegen der Reichweite bei GPT-5.6: Astra ging zuerst an zugelassene Verteidiger im Daybreak-Programm, und für die Gratis-Stufe hat OpenAI nichts angekündigt.

Kategorie-Tipp, September 2026

Beste KI für Bilder

1
ChatGPT Images 2.5
Text in Bildern
2
MAI-Image-2.6
#1 AA Bildbearbeitung
3
Muse Image
Meta-AI-Ökosystem

Die beste KI für die Bildgenerierung ist ChatGPT Images 2.5, das OpenAI am 8. September in jedem ChatGPT-Tarif zum Standard gemacht hat und das binnen eines Tages beide Bild-Boards von Arena übernommen hat. Seine beiden Modelle wurden auf jedem davon Erster und Zweiter: GPT-Image-2.5 Sunburst, auf Präzision gebaut, führt Text-zu-Bild mit 1420,7 Elo und die Bildbearbeitung mit 1520,4 an, das schnellere GPT-Image-2.5 Flare liegt mit 1399,0 und 1490,6 auf Platz zwei, und GPT Image 2 aus dem Vormonat rutscht auf beiden auf Platz drei. Diese Platzierungen beruhen auf jeweils ein paar tausend Stimmen gegen die 79.000 und 236.000 von GPT Image 2, und bei Text-zu-Bild teilen sich die beiden ein Rangband, also lies den Abstand zwischen Sunburst und Flare als vorläufig. Artificial Analysis hat keines der beiden Modelle bewertet, und seine zwei Boards stimmen nicht mehr mit Arenas überein: GPT Image 2 führt dort weiterhin Text-zu-Bild mit 1178,1 an, aber Microsofts MAI-Image-2.6 hat die Bildbearbeitung mit 1122,5 übernommen. Damit ist MAI-Image-2.6 der Zweitplatzierte insgesamt, das höchstplatzierte Modell außerhalb von OpenAI auf Arenas Text-zu-Bild-Board und Erster oder Zweiter auf beiden Artificial-Analysis-Boards, und Metas Muse Image ist Dritter. Reve 2.1 verlässt das Podium: Auf dem Text-zu-Bild-Board von Artificial Analysis ist es weiterhin Dritter, auf Arenas ist es aber auf Platz sechs gefallen und auf den beiden Bildbearbeitungs-Boards auf Platz zwölf und vierzehn. Unsere vollständige Aufschlüsselung dessen, was ausgeliefert wurde, steht in ChatGPT Images 2.5.

ModellAm besten fürStärkeSchwächePreis
ChatGPT Images 2.5Bilder mit lesbarem Text#1 und #2 bei Arena Text-zu-Bild (1420,7 / 1399,0) und Bildbearbeitung (1520,4 / 1490,6)Von Artificial Analysis noch nicht bewertetStandard in jedem ChatGPT-Tarif
MAI-Image-2.6Ein vorhandenes Bild bearbeiten#1 bei Artificial Analysis Bildbearbeitung (1122,5) und #2 auf dessen Text-zu-Bild-Board (1149,4)Public Preview, noch nicht in Copilot oder BingMAI Playground / Microsoft Foundry
Muse ImageBildbearbeitung, Meta-Ökosystem#3 bei Artificial Analysis Bildbearbeitung (1105,1), #5 auf dessen Text-zu-Bild-BoardNeu, dünnes Tooling drumherumMeta-AI-App
Nano Banana 2 (Gemini 3.1 Flash Image)Fotorealistische Porträts und Produkte#4 bei Artificial Analysis Text-zu-Bild, vor Nano Banana Pro auf Arenas BoardBei Arenas Bildbearbeitung liegt Nano Banana Pro vornGemini-App / AI Studio
Seedream 5.0 ProMehrsprachiger Text + Regionenbearbeitung10+ Sprachen inkl. Arabisch RTL, Lasso- und EbenenbearbeitungEtwa Platz zehn auf den unabhängigen Boards; Urheberrechts-WolkeBytePlus / Magnific
Midjourney v8Stilisierte Kunst, IllustrationÄsthetische Basis, die die meisten Künstler bevorzugenSchwächer bei Text im Bild$10-$120/Mon.
Grok ImagineNSFW / Spicy ModeFreizügigste Leitplanken; Arena führt sein Modell Image 2.0 auf #5 bei Text-zu-Bild und #4 bei der BildbearbeitungImage 2.0 fehlt auf den Boards von Artificial Analysis$30/Mon. SuperGrok
Zweitplatzierte und Alternativen: MAI-Image-2.6 ist der Zweitplatzierte insgesamt und der Tipp, um ein bereits vorhandenes Bild zu bearbeiten, Muse Image ist Dritter und der Tipp innerhalb von Metas Apps, und Nano Banana 2 ist weiterhin der Foto-Real-Tipp. Reve 2.1 bleibt der Tipp für Layout, Typografie und natives 4K, auch nachdem es das Podium verlassen hat. Grok Imagine ist weiterhin das einzige Frontier-Modell, das Spicy-Mode-Inhalte für Erwachsene erlaubt, und Arena führt sein Modell Image 2.0 jetzt auf Platz fünf bei Text-zu-Bild und Platz vier bei der Bildbearbeitung.
Was sich diesen Monat geändert hat

Die Bildkrone hat gewechselt. OpenAI hat ChatGPT Images 2.5 am 8. September ausgeliefert, und seine beiden API-Modelle sind auf beiden Boards von Arena direkt an GPT Image 2 vorbeigezogen: Sunburst ist Erster bei Text-zu-Bild mit 1420,7 und bei der Bildbearbeitung mit 1520,4, Flare ist Zweiter mit 1399,0 und 1490,6, GPT Image 2 auf beiden Dritter. Die drei Boards, die wir verfolgen, stimmen nicht mehr überein. Artificial Analysis hat die 2.5-Modelle überhaupt nicht bewertet, führt GPT Image 2 bei Text-zu-Bild weiterhin mit 1178,1 an, und auf seinem Bildbearbeitungs-Board hat Microsofts MAI-Image-2.6 mit 1122,5 den ersten Platz übernommen. MAI-Image-2.6 löst Reve 2.1 als Zweitplatzierten ab, und Reve 2.1 verlässt das Podium ganz, nachdem es bei Arena Text-zu-Bild auf Platz sechs gefallen ist.

Kategorie-Tipp, September 2026

Beste KI für Video

1
Gemini Omni 1.1 Flash
#1 Arena Text-to-Video
2
MiniMax H3
2K + nativer Ton
3
Dreamina Seedance 2.0
Engster Herausforderer

Die beste KI für Videogenerierung ist Gemini Omni 1.1 Flash, das Google am 27. August ausgeliefert hat und das Arenas Text-to-Video-Board jetzt mit 1515 anführt, knapp vor dem eigenen Vorgänger Gemini Omni Flash mit 1511. Es ist auch das leistungsfähigere Modell laut Spezifikation: Szenenverlängerung in Zehn-Sekunden-Schritten auf kumulativ 40 Sekunden, Kontrolle über erstes und letztes Bild, Videoreferenzen, 360p-Entwürfe und 1080p- oder 4K-Ausgabe, zu rund $0.03 pro Sekunde bei 360p, $0.10 bei 720p, $0.15 bei 1080p und $0.30 bei 4K. Gemini Omni Flash bleibt mit etwa $0.10 pro Sekunde die günstigere Option und liegt auf Arena statistisch gleichauf, deckelt aber bei Zehn-Sekunden-Clips. Artificial Analysis' Video-Board führt keines von beiden mehr an: Alibabas Wan 3.0, ein am 24. August veröffentlichtes, nur über API verfügbares Modell, das Video aus Dokumenten, Tabellen und Folien baut, liegt dort mit 1239 vorn, Omni Flash bei 1238 und MiniMax H3 Max bei 1235. Wer längere Einstellungen in Googles Werkzeugen braucht, findet Veo 3.1 weiterhin in der Gemini-App, in AI Studio und in Vertex AI mit nativem Audio und 1080p-Ausgabe. MiniMax H3 (31. Juli) bleibt der Herausforderer laut Spezifikation, mit 2K-Clips von 4 bis 15 Sekunden und nativem Stereo-Audio ab $0.13 pro Sekunde.

ModellAm besten fürStärkeSchwächePreis
Gemini Omni 1.1 FlashBestes KI-Video insgesamt#1 Arena Text-to-Video (1515); Szenenverlängerung auf 40 s, 4K-AusgabeAuf Artificial Analysis' Board Zweiter hinter Wan 3.0$0.03-$0.30/s; Gemini API / AI Studio / Flow
Gemini Omni FlashGünstigere Zehn-Sekunden-Clips#2 Arena Text-to-Video (1511), #2 AA-Video (1238); konversationelle BearbeitungDeckelt bei Zehn-Sekunden-Generierungen~$0.10/s; Gemini-App / AI Studio
Wan 3.0Video aus Dokumenten und Folien#1 auf Artificial Analysis' Video-Board (1239); 2-30 s, bis 1080p, Omni-Reference-EingabeNur API, keine veröffentlichten Gewichte; #3 auf Arena$0.05-$0.20/s
MiniMax H32K-Clips mit nativem Audio4-15 s in 2K, natives Stereo-Audio; #8 Arena Text-to-Video (1462)#4 auf AA-Video (1227); die offenen Gewichte enthalten den 2K-Upscaler nicht und erfordern einen Antrag in den USA, der EU, Großbritannien und Südkorea$0.13/s in 2K
Dreamina Seedance 2.5ByteDance-Herausforderer#6 Arena Text-to-Video (1482); führt Image-to-Video mit Audio anByteDance-Ökosystem, eingeschränkter westlicher ZugangDreamina / BytePlus
Muse VideoVideo im Meta-Ökosystem#3 Text-zu-Video mit 1459Neuestes der Gruppe, dünnes ToolingMeta-AI-App
Veo 3.1Längere Produktions-ClipsNativer Ton, 1080p, starke physikalische Konsistenz#6 auf Arena Video, nicht der QualitätsführerGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboSchnelle Iteration zu niedrigeren KostenNatives 4K, 60fps, 15-Sekunden-Clips; Turbo am 17. Juni erschienenAußerhalb der Top 16 auf Arena Text-zu-VideoAb $10/Mon.
Luma Ray 3Fotorealistische SzenenStarker Realismus für LandschaftenKleinere CommunityKostenlos / ab $9.99/Mon.
Zweitplatzierte und Alternativen: Dreamina Seedance 2.0 ist der Zweitplatzierte insgesamt und schlägt Omni Flash bei Bild-zu-Video mit Audio, wo es mit 1198 gegen 1191 führt, während Omni Flash die Variante ohne Audio weiterhin anführt. Muse Video ist Dritter, und Veo 3.1 ist der Tipp, wenn 10 Sekunden nicht genug sind. OpenAI stellte die Sora-2-Consumer-App am 26. April 2026 ein, und nur die Entwickler-API bleibt, bis zum 24. September 2026. Die Abschaltdaten älterer Modelle verfolgen wir für jeden Anbieter in einer eigenen laufenden Liste.
Was sich diesen Monat geändert hat

Die Video-Krone ging an Gemini Omni 1.1 Flash, das Google am 27. August ausgeliefert hat und das Arenas Text-to-Video-Board jetzt mit 1515 gegen 1511 von Gemini Omni Flash anführt. Beide liegen in den Konfidenzintervallen des jeweils anderen, lies das also als ein über die Fähigkeiten entschiedenes Unentschieden statt als klaren Sieg: 1.1 Flash verlängert Szenen auf kumulativ 40 Sekunden und gibt 4K aus, während Omni Flash bei zehn Sekunden deckelt. Die größere Änderung ist, dass keines der beiden Modelle Artificial Analysis' Video-Board noch anführt. Alibabas Wan 3.0 übernahm es am 24. August mit 1239 vor Omni Flash mit 1238 und MiniMax H3 Max mit 1235, und es nimmt Dokumente, Tabellen und Folien als Eingabe. Wan 3.0 ist nur über API verfügbar und hat keine veröffentlichten Gewichte, ändert unsere Open-Weight-Tipps also nicht. MiniMax H3 hat diesen Monat ebenfalls Arena-Stimmen bekommen und steigt auf dem Text-to-Video-Board mit 1462 auf Platz 8 ein.

Kategorie-Tipp, September 2026

Beste KI zum Programmieren

1
Claude Fable 5.1
Höchste Benchmark-Werte
2
Claude Opus 5
Bestes Preis-Leistung, $5 / $25
3
Kimi K3
Web-Apps und Agenten

Die beste KI zum Programmieren ist Claude Fable 5.1, das die Harness-Benchmarks mit 55,8 % auf Terminal-Bench 4.0 und 70 auf dem Coding Agent Index von Artificial Analysis anführt, mit Claude Opus 5 als Preis-Leistungs-Tipp zum halben Preis, das die Boards weiterhin anführt, auf denen Entwickler über das fertige Ergebnis abstimmen. Alibabas Qwen3.8-Max-0902 debütierte am 2. September mit 1691 Punkten gegen die 1688 von Opus 5 auf #1 von Arenas WebDev-Board, ein Abstand von drei Punkten, und Opus 5 behält image-to-WebDev mit 1,668.6. Der Preis ist die zweite Hälfte des Arguments: Opus 5 läuft mit $5 / $25 pro 1M Tokens gegen die $10 / $50 von Claude Fable 5, und Artificial Analysis misst es mit $2.34 pro Index-Aufgabe gegen die $3.14 von Fable 5. Anthropics eigene Dokumentation rät Entwicklern, für komplexes agentisches Programmieren mit Opus 5 zu beginnen und Fable 5 für Workloads zu reservieren, die die höchste verfügbare Leistung brauchen. Claude Fable 5 ist der Zweitplatzierte und bleibt der Tipp für die schwerste Long-Horizon-Arbeit, auf bei WebDev mit 1,630.7 und #2 bei image-to-WebDev (1,625.7); sein Nachfolger vom 1. September, Claude Fable 5.1, ist auf den Harness-Benchmarks zum selben Preis das stärkere Modell und erreicht 55,8 % auf Terminal-Bench 4.0 gegen die 52,3 % von Opus 5 und die 42,0 % von Fable 5 nach Anthropics eigenen Zahlen, aber Arena hat noch keine Stimmen dafür. Der Kandidat ist Kimi K3, jetzt #3 bei WebDev mit 17 Punkten Rückstand auf die Spitze und #3 auf Arenas Agent-Board, der stärkste Open-Weight-Coder auf den Boards, wobei Selbst-Hosting 1,56 TB Gewichte bedeutet. Auf dem Coding Index von Artificial Analysis ist es kein Claude-Durchmarsch: GPT-5.6 Sol (xhigh) führt mit 78,3 vor Opus 5 (max) mit 78,0, nah genug, um es einen Gleichstand zu nennen. Der günstigste ernsthafte Kandidat ist jetzt GLM 5.3 Flash bei $0.15 / $0.50 unter MIT, nachdem DeepSeeks Preiserhöhung vom 16. August V4-Flash 0731 auf $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten gebracht hat, und das beste Preis-Leistungs-Verhältnis direkt an der Frontier bietet Grok 4.6 mit 88,4 % auf Terminal-Bench v2.1 und $0.84 pro Index-Aufgabe bei $2 / $6.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Fable 5.1Bestes Programmieren insgesamt#1 Intelligence Index (66) und #1 Agentic Index (61); 55,8 % auf Terminal-Bench 4.0 (Anthropic)Noch keine Arena-Stimmen; doppelt so teuer wie Opus 5$10 / $50
Claude Opus 5Bestes Preis-Leistungs-Verhältnis zum halben Preis#1 Arena image-to-WebDev (1,668.6) und #2 bei WebDev (1688); $2.34 pro Index-AufgabeVerlor Arenas WebDev-Board am 2. September an Qwen3.8-Max-0902; Artificial Analysis Coding Index hat GPT-5.6 Sol eine Spur voraus$5 / $25
Qwen3.8-Max-0902Spitze von Arenas WebDev-Board#1 Code Arena: WebDev (1691), drei Punkte vor Opus 5; 2,4T Parameter, 1M KontextNur API auf QwenCloud, kein Consumer-Frontend; noch kein unabhängiger Gesamtwert, und drei Punkte liegen im Rauschen$2 / $6
GPT-6 AstraToken-effizientes agentisches Programmieren67 auf dem Coding Agent Index von Artificial Analysis in Codex, gleichauf mit Opus 5 und Fable 5; ein Drittel der Tokens von GPT-5.6 Sol und ein Fünftel derer von Opus 5Nicht im kostenlosen ChatGPT-Tarif; doppelter Preis von Opus 5$10 / $50
Claude Fable 5Schwerste agentische Long-Horizon-Arbeit#2 Arena image-to-WebDev (1,625.7), #4 WebDev; 1M KontextTeuerstes; Artificial Analysis Coding Index setzt es auf Platz 7$10 / $50
Kimi K3Web-App-Bau und Agenten#3 Arena WebDev, #3 Arena Agent, höchster offener Intelligence Index (60)1,56 TB zum Selbst-Hosten$3 / $15
GPT-5.6 SolOpenAI-Flaggschiff, agentisches Programmieren#1 Artificial Analysis Coding Index mit 78,3 (xhigh)Fehlt auf dem offiziellen Terminal-Bench-Board; Eval-Gaming von METR gemeldet$4 / $20
Muse Spark 1.3Günstiges agentisches ProgrammierenIntelligence Index 61 bei $1.25 / $4.25; gewinnt alle drei Coding-Zeilen auf Metas eigenem Chart, 88,8 % auf Terminal-Bench 2.1Metas eigene Zahlen, gemessen an der max-Variante, die nur eine Partner-Vorschau ist; verliert auf demselben Chart alle sechs Agenten-Zeilen, und Scale SEAL hat nur 1.1 bewertet$1.25 / $4.25
Grok 4.6Günstiger Preis-Leistungs-Coder88,4 % auf Terminal-Bench v2.1 und Intelligence Index 61, bei $0.84 pro Index-AufgabePrompts ab 200K Tokens werden komplett zum doppelten Satz abgerechnet; höhere Halluzinationsrate$2 / $6
Gemini 3.8 FlashAgenten-Programmieren in großem UmfangIntelligence Index 59, 73,7 % DeepSWE v1.1, 89,4 % Terminal-bench 2.1, 304,6 Tok/s19,1 % auf Terminal-bench 4.0 gegen 51,8 % von Opus 5; Einführungspreis verdoppelt sich am 1. Januar 2027$0.75 / $3.75
GLM 5.3 FlashBester Open-Weight-Coder, den du hosten kannstIntelligence Index 57; DeepSWE v1.1 63,4 und Terminal Bench 2.1 84,3 (Herstellerangaben); MIT, 320B/18B aktivKimi K3 übertrifft es; die Coding-Zahlen stammen vom Hersteller, und Arena-Stimmen gibt es noch keineOpen weights (MIT)
Zweitplatzierte und Alternativen: Claude Opus 5 ist der Zweitplatzierte und der Preis-Leistungs-Tipp zum halben Preis, Qwen3.8-Max-0902 führt Arenas WebDev-Board an, Kimi K3 ist der stärkste Open-Weight-Coder auf den Boards, GPT-5.6 Sol ist der Zweitplatzierte auf dem Composite von Artificial Analysis, und GLM 5.3 Flash ist der Open-Weight-Tipp für Teams, die selbst hosten, bei Intelligence Index 57 unter reinem MIT. In IDEs ist Cursor mit Claude weiterhin die beliebteste Paarung, und Claude Code ist die natürliche Wahl, wenn du im Terminal lebst.
Was sich diesen Monat geändert hat

Die Programmierkrone ging unter derselben Regeländerung an Claude Fable 5.1. Es führt die Harness-Benchmarks mit 55,8 % auf Terminal-Bench 4.0 gegen die 52,3 % von Claude Opus 5 und die 42,0 % von Claude Fable 5 an und nimmt den Coding Agent Index von Artificial Analysis mit 70 gegen 67 für Opus 5 und GPT-6 Astra. Claude Opus 5 wird zum Preis-Leistungs-Tipp und behält ein echtes Argument: $5 / $25 gegen die $10 / $50 von Fable 5.1, $2,34 pro Index-Aufgabe, und Anthropics eigene Dokumentation sagt Entwicklern weiterhin, damit zu beginnen. Die abstimmungsbasierten Boards sind jetzt geteilt: Alibabas Qwen3.8-Max-0902 nahm am 2. September Arenas WebDev-Board mit 1691 gegen die 1688 von Opus 5, Opus 5 behält image-to-WebDev mit 1.668,6, und Arena hat überhaupt keine Stimmen für Fable 5.1. GPT-6 Astra (3. September) erreicht 67 auf dem Coding Agent Index mit einem Fünftel der Tokens von Opus 5, der größte in diesem Monat veröffentlichte Effizienzgewinn, listet aber zum doppelten Preis von Opus 5 und ist nicht im kostenlosen ChatGPT-Tarif verfügbar. Kimi K3 bleibt der stärkste Open-Weight-Coder, mit GLM 5.3 Flash als dem zum Selbsthosten, bei Intelligence Index 57 unter MIT.

Kategorie-Tipp, September 2026

Beste KI für Kreativität

1
Grok 4.6
Wenigste Leitplanken
2
Claude Fable 5
Prosa höchster Qualität
3
Kimi K3
Fiktion und Stimme

Die beste KI für ungefilterte, angesagte kreative Arbeit ist Grok 4.6, und wir wollen genau sein, warum. Dieser Tipp geht um das Produkt, nicht um die Prosa-Qualität. Grok trägt die wenigsten Inhaltsbeschränkungen aller Frontier-Modelle und als Einziges die native Echtzeit-X-Integration, was es zum einen Modell macht, das sich auf kantige, aktuelle oder bewusst provokante Briefings einlässt, die die anderen ablehnen. Es ist Standard in der Grok-App für SuperGrok- und X-Premium+-Abonnenten zu $30/Monat. Es ist nicht der beste Schreiber, und die Boards sagen es unverblümt. Grok 4.5 sitzt auf #33 bei EQ-Bench Creative Writing und #41 auf Arenas Creative-Writing-Leaderboard und verliert bei beiden gegen das ältere Grok 4.20-beta1. Wenn du allein nach Output-Qualität wählst, führt Claude Fable 5 weiterhin Arena Creative Writing an, während EQ-Bench jetzt GPT-6 Astra mit 2163.9 auf Platz eins sieht, Claude Fable 5.1 auf zwei und Kimi K3 auf vier. Wähle Grok 4.5 für das, was es dich erschaffen lässt, nicht dafür, wie gut es schreibt.

ModellAm besten fürStärkeSchwächePreis
Grok 4.6Ungefiltert, meinungsstark, angesagtWenigste Inhaltsbeschränkungen, native Echtzeit-X-GrundierungDie Creative-Writing-Boards haben es noch nicht bewertet; Grok 4.5 lag auf #33 EQ-Bench, #41 Arena$30/Mon. SuperGrok
Claude Fable 5Kreative Prosa höchster Qualität#1 Arena Creative Writing, #1 LiveBench LanguageVorsichtige Leitplanken bei kantigen Briefings$10 / $50 API
Kimi K3Fiktion und markante Stimme#4 EQ-Bench Creative Writing mit 2070.6Nur #10 auf Arena Creative Writing$3 / $15
Claude Opus 5Strukturierte Langform-KreativitätHält lange Threads und lektoriert sich selbst; Intelligence Index 63, nur hinter Claude Fable 5.1Vorsichtigstes der Gruppe$20/Mon. Pro; $5 / $25 API
Gemini 3.1 ProMultimodal kreativStarke Text-, Bild- und VideoketteQuoten in der Gemini-AppKostenlos / $2.00-$4.00 API Input
Grok Imagine (Spicy Mode)NSFW / kreativ für ErwachseneFreizügigste BildgenerierungNischen-Anwendungsfall$30/Mon. SuperGrok
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der richtige Tipp, wenn Qualität wichtiger ist als Freiheit, Kimi K3 ist der Tipp für Fiktion, und Claude Opus 5 ist der Tipp für kreative Projekte, die sich über viele Runden ziehen. Für kreative Arbeit für Erwachsene ist Grok Imagine Spicy Mode weiterhin die einzige Option auf Frontier-Niveau.
Was sich diesen Monat geändert hat

Grok behält diesen Tipp, jetzt mit Grok 4.6, das am 12. August Grok 4.5 als Flaggschiff von SpaceXAI ablöste. An der Freizügigkeit und am Live-X-Zugang, worauf dieser Tipp beruht, hat sich nichts geändert. Das Modell darunter ist deutlich stärker, fünf Punkte höher auf Intelligence Index 61, doch dieser Gewinn landete im Programmieren und in der agentischen Arbeit, nicht in der Prosa, und kein Creative-Writing-Board hat Grok 4.6 bisher bewertet. Claude Fable 5 bleibt das Modell der Wahl, wenn du das bessere Schreiben willst.

Kategorie-Tipp, September 2026

Beste KI für Genauigkeit & Recherche

1
Claude Fable 5.1
Höchste faktische Genauigkeit
2
Gemini 3.1 Pro
Bestes Preis-Leistung, $0,52/Aufgabe
3
GPT-5.6 Sol
Neuartiges Reasoning

Die beste KI für Genauigkeit und Recherche ist Claude Fable 5.1, das die höchste faktische Genauigkeit hält, die Artificial Analysis gemessen hat, 67 % auf AA-Omniscience, und Humanity's Last Exam mit 59,1 % anführt. Der Preis-Leistungs-Tipp ist Gemini 3.1 Pro, und es ist weiterhin das, wozu wir greifen würden, wenn die Kosten zählen. Sein stärkstes Ergebnis liegt auf ARC-AGI-1 vom ARC Prize, wo es 98 % erzielt und mit dem menschlichen Panel gleichzieht, und das bei $0.52 pro Aufgabe. Diese Kombination ist das Argument: Mehrere Modelle sind bei der Leistung nah dran, keines erreicht es bei den Kosten für verlässliche faktische Arbeit. Es kombiniert das mit nativer Google-Search-Grundierung, was du willst, wenn die Antwort aktuell statt bloß plausibel sein muss. Es erzielt außerdem 94,1 % auf GPQA Diamond, wo GPT-5.6 Sol jetzt gleichzieht statt zurückzuliegen, und 44,4 % auf Humanity's Last Exam, und erreicht 46,44 auf Scale SEALs HLE-Board, das inzwischen Claude Fable 5 mit 55,5 % anführt. Wir haben die vorherige ARC-AGI-2-Rahmung fallen gelassen: Seine 77,1 % sind weiterhin korrekt, aber das Board hat sich bewegt, und dieser Wert platziert es jetzt um Platz 14. Zwei ehrliche Vorbehalte. Bei grundierter Suche speziell wird Arenas Such-Leaderboard von OpenAI angeführt, nicht von Google oder Anthropic: GPT-5.6 Sol liegt mit 1257 vorn, Claude Fable 5 auf Platz fünf und Gemini 3.1 Pro mit Grundierung auf Platz neun. Und bei neuartigem Reasoning führt GPT-5.6 Sol ARC-AGI-2 an, und Claude Opus 5 führt ARC-AGI-3 mit 30 % an, rund 3,75-mal so viel wie das nächstbeste Modell. Wir haben die Krone nicht an Opus 5 gegeben, weil Artificial Analysis seine Halluzinationsrate mit 50 % misst und es auf AA-Omniscience unter Fable 5 setzt, einem Board, dessen Spitze Claude Fable 5.1 jetzt mit ihm teilt.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
Claude Fable 5.1Höchste gemessene faktische Genauigkeit67 % faktische Genauigkeit auf AA-Omniscience, der höchste von Artificial Analysis gemessene Wert; #1 Humanity's Last Exam (59,1 %)Keine günstige Stufe und ohne Wertung auf Arenas Such-Leaderboard$10 / $50
Gemini 3.1 ProBestes Preis-Leistung, günstige Faktenarbeit98 % ARC-AGI-1 (Gleichstand mit dem menschlichen Panel) bei $0.52/Aufgabe, 94,1 % GPQA (von Sol egalisiert)ARC-AGI-2 77,1 % rangiert jetzt ~14.; #7 auf Arena Search$2.00-$4.00 / $12.00-$18.00 (gestaffelt)
Claude Fable 5Grundierte Suche#5 auf Arenas Such-Leaderboard, hinter GPT-5.6 SolKeine einzelne günstige Stufe$10 / $50 (Fable 5)
GPT-5.6 SolNeuartiges Reasoning#1 ARC-AGI-2 mit 92,5 %, gegen ein 100-%-Menschen-PanelScheming von METR gemeldet$4 / $20
Claude Opus 5Schwerste unbekannte Probleme#1 ARC-AGI-3 mit 30 %, ~3,75-mal das nächste Modell (ARC Prize)Artificial Analysis misst eine Halluzinationsrate von 50 %$5 / $25
Qwen 3.7 MaxFrontier-Genauigkeit zum Preis-Leistungs-Verhältnis92,4 GPQA Diamond, 200 kostenlose Anfragen/TagNur API, kein Chat-Frontend$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Opus 4.6Ehrlichkeit unter Druck#1 auf Scale SEALs MASK-Board mit 96,28; Anthropic hält die Top 5Als Flaggschiff abgelöstLegacy-Anthropic-Modell
Zweitplatzierte und Alternativen: Gemini 3.1 Pro ist der Zweitplatzierte und der Preis-Leistungs-Tipp bei $0,52 pro Aufgabe mit Google-Search-Grounding, GPT-5.6 Sol ist der Zweitplatzierte für neuartiges Denken, Claude Opus 4.6 dominiert das Board für Ehrlichkeit unter Druck, und Qwen 3.7 Max ist der Preis-Leistungs-Tipp an der Spitze.
Was sich diesen Monat geändert hat

Die Genauigkeitskrone ging an Claude Fable 5.1, das die höchste faktische Genauigkeit hält, die Artificial Analysis gemessen hat, 67 % auf AA-Omniscience gegen die 65 % von Claude Fable 5, und Humanity's Last Exam mit 59,1 % gegen 55,5 % anführt. Der AA-Omniscience-Index selbst liest sich als 43 für beide Modelle, gegenüber den 40 aus dem Vormonat, weil 5.1 seine zusätzliche Genauigkeit mit einer höheren Versuchsrate bei Fragen erkauft, die es nicht beantworten kann. Gemini 3.1 Pro wird zum Preis-Leistungs-Tipp und ist weiterhin das, wozu wir bei den Kosten greifen würden: 98 % auf ARC-AGI-1 bei $0,52 pro Aufgabe, gleichauf mit dem menschlichen Panel, plus natives Google-Search-Grounding, auch wenn sein GPQA Diamond auf 94,1 % neu angepasst wurde und GPT-5.6 Sol es jetzt exakt erreicht. GPT-6 Astra (3. September) ist hier eher der Start zum Beobachten als eine neue Krone: Artificial Analysis misst, wie seine Halluzinationsrate von Sols 92 % auf 51 % bei maximalem Aufwand fällt, während die Genauigkeit um vier Punkte steigt, die größte Ehrlichkeitsverbesserung, die ein Anbieter dieses Jahr gemeldet hat, aber es verliert rund 80 Elo auf GDPval-AA v2 und ist nicht im kostenlosen ChatGPT-Tarif verfügbar.

Kategorie-Tipp, September 2026

Beste KI zur Problemlösung

1
GPT-6 Astra
Reasoning-Spitze
2
Claude Opus 5
Agentische Ketten
3
GPT-5.6 Sol
Günstiges STEM-Flaggschiff

Die beste KI für harte Problemlösung ist GPT-6 Astra, die GPT-5.6 Sol die Reasoning-Boards binnen Tagen nach dem Start abgenommen hat. Sie führt LiveBench Reasoning mit 92,65 und ARC-AGI-2 mit 95 % an, der höchste Wert, den je jemand gegen das 100-%-Humanpanel dieses Boards erreicht hat, und liegt auf LiveBench Mathematics mit 96,81 hinter den 97,01 von Claude Fable 5.1 auf Platz zwei. Sie meldet außerdem 97,6 % auf FrontierMath Tier 4 v2, eine Zahl, die man zusammen mit Epoch AIs Offenlegung lesen sollte, dass OpenAI den Benchmark finanziert hat und exklusiven Zugang zu einem Teil davon hält. Der Haken sind Preis und Reichweite: $10 / $50 pro 1M Tokens gegenüber $4 / $20 bei Sol, und es braucht einen kostenpflichtigen ChatGPT-Plan. GPT-5.6 Sol ist die günstige Alternative, auf beiden LiveBench-Boards Dritter mit 96,20 und 91,65 und Zweiter auf ARC-AGI-2. Qwen 3.7 Max ist der Spartipp für Wettbewerbsaufgaben mit 97,1 auf dem HMMT-Index vom Februar 2026 und 44,5 auf Apex, mit 200 kostenlosen Anfragen pro Tag. Claude Opus 5 bleibt die Alternative für lange agentische Reasoning-Ketten, auch wenn Astra ihm ARC-AGI-3 ebenfalls abgenommen hat.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
GPT-6 AstraSchwerste Mathematik, Wissenschaft und Reasoning#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Braucht einen kostenpflichtigen ChatGPT-Plan; 2,5-facher Sol-Preis$10 / $50
Claude Opus 5Lange agentische Reasoning-Ketten#2 AA-Briefcase (1645) und #2 GDPval-AA v2 (1737); 30,2 % ARC-AGI-3Astra führt jetzt ARC-AGI-3 an; 50 % Halluzinationsrate$5 / $25
GPT-5.6 SolGünstiges STEM-Flaggschiff#2 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) und Reasoning (91,65)FrontierMath weiterhin unveröffentlicht; Scheming von METR markiert$100/Mon. ChatGPT Pro; API $4 / $20
Qwen 3.7 MaxWettbewerbsmathematik mit knappem Budget97,1 HMMT 2026 Feb, 44,5 Apex, 200 kostenlose Anfragen/TagNur API$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Fable 5Mathematik in einem Coding-Workflow#1 auf Arenas Mathe-Unterkategorie (1543), 96,0 LiveBench MathematicsTeuerste Option hier$10 / $50
GLM 5.3 FlashOpen-Weight-ProblemlösungIntelligence Index 57 unter MIT, vier Punkte über GLM-5.2 bei weniger als der halben Größe; 320B/18B aktiv, 1M KontextBraucht einen Multi-GPU-Server, keine Workstation; GLM 5.3 liegt nach Z.ais eigenen Zahlen höher und ist seit dem 28. August herunterladbar, aber in mehr als doppelter Größe und unter einer eigenen LizenzOpen weights (MIT)
Zweitplatzierte und Alternativen: GPT-5.6 Sol ist der Zweitplatzierte und der Preis-Leistungs-Tipp zu $4 / $20, Claude Opus 5 ist der naheliegende Tipp für langkettiges agentisches Reasoning, Qwen 3.7 Max ist der Spartipp, und GLM 5.3 Flash ist der Open-Weight-Tipp. Unser eigener Leitfaden zur besten KI für Mathe geht die Aufteilung nach Aufgabe und die kostenlosen Optionen durch.
Was sich diesen Monat geändert hat

Die Krone für Problemlösung ging an GPT-6 Astra, das die Boards, über die diese Kategorie entschieden wird, binnen Tagen nach dem Start am 3. September übernommen hat. Es führt LiveBench Reasoning mit 92,65 gegen 91,65 von GPT-5.6 Sol an, nimmt ARC-AGI-2 mit 95 % gegen Sols 92,5 % und hat Claude Opus 5 auf ARC-AGI-3 verdrängt, wo seine 62,7 % auf dem Standard-Harness die 30,2 % von Opus 5 schlagen. Lies die ARC-AGI-3-Zahlen genau: Dieses Board misst menschengleiche Handlungseffizienz in unbekannten Umgebungen statt gelöster Aufgaben, und die viel zitierten 98,6 % stammen von einem Provider-Adapter-Harness, nicht vom Standard-Harness. Sol fällt auf beiden LiveBench-Boards auf Platz drei, bleibt aber die günstige Alternative zu $4 / $20 gegenüber Astras $10 / $50, und Claude Fable 5.1 hat LiveBench Mathematics mit 97,01 stillschweigend übernommen.

Kategorie-Tipp, September 2026

Bester KI-Agent

1
Gemini Spark
In der Cloud
2
Claude Cowork
Auf dem Desktop
3
ChatGPT Codex
Coding-Agent

Der beste KI-Agent ist Gemini Spark, wenn du den Agenten in der Cloud willst, und Claude Cowork, wenn du ihn auf dem Desktop willst. Das sind gemeinsame Tipps und kein erster und zweiter Platz: Spark läuft in einer Google-Cloud-VM und arbeitet deshalb weiter, während dein Laptop zu ist, eng verzahnt mit Gmail, Docs und seit Anfang September auch Google Fotos; Cowork läuft auf deinem Mac oder Windows-Rechner und steuert deine lokalen Apps und deinen Bildschirm. Kein unabhängiges Board misst die beiden Produkte gegeneinander, die Wahl hängt also davon ab, wo die Arbeit stattfinden muss, nicht davon, wer höher punktet. Auch der Preis entscheidet nicht mehr: Spark erreicht jetzt die Stufe Google AI Pro zu $19.99/Monat in den USA und in über 160 weiteren Ländern, und Cowork ist ohne Aufpreis in jedem kostenpflichtigen Claude-Plan ab $20/Monat enthalten. ChatGPT Codex Mobile (14. Mai) ist die Alternative für Coding-Agent-Arbeit und Browser-Agenten der OpenAI-Operator-Klasse für Web-Aufgaben. Lies den vollständigen Vergleich Gemini Spark vs Claude Cowork.

AgentAm besten fürWo er läuftStärkePreis
Gemini Spark24/7-Cloud-Aufgaben, Workspace-WorkflowsGoogle-Cloud-VM (immer an)Erster echter 24/7-Agent, tiefe Workspace-IntegrationAb $19.99/Mon. Google AI Pro
Claude CoworkDesktop, App-Steuerung, Design + CodeDein Mac-/Windows-DesktopSteuert lokale Apps, sieht deinen Bildschirm$20/Mon. Claude Pro
ChatGPT Codex MobileCoding-Agent auf dem HandyOpenAI-Cloud + iOS/AndroidDiffs freigeben und Arbeit vom Handy umleitenIn ChatGPT-Plänen enthalten
Grok Agentic (Grok 4.6)Echtzeit-Recherche, X-ScrapingSpaceXAI-CloudNative X-Integration; GDPval-AA-v2-Elo von 1665$30/Mon. SuperGrok
OpenAI Operator-KlasseBrowser-Aufgaben, Web-FormulareOpenAI-Cloud + dein BrowserWeb-AutomatisierungChatGPT Pro
Zweitplatzierte und Alternativen: Gemini Spark und Claude Cowork sind gemeinsame Tipps, getrennt danach, wo der Agent läuft, kein erster und zweiter Platz. ChatGPT Codex Mobile ist der Tipp für Coding-Agenten, und Grok Agentic ist der Nischentipp für Echtzeit-Recherche. Google AI Ultra zu $99.99 oder $199.99 im Monat kauft bei Spark inzwischen höhere Nutzungslimits statt Zugang, der auf der Pro-Stufe zu $19.99 beginnt.
Was sich diesen Monat geändert hat

Kein neues Endkunden-Agentenprodukt ist erschienen, Gemini Spark hat sich aber ausgeweitet: Es erreichte die Stufe Google AI Pro zu $19.99/Monat und kam zu Google Fotos hinzu, wo es suchen, bearbeiten, kuratieren und geplante Abläufe ausführen kann. Metas Muse Code (5. August) ist ein Terminal-Werkzeug für Entwickler und kein Endkundenprodukt, sodass die Wahl zwischen Spark (Cloud) und Cowork (Desktop) die meisten Agentenentscheidungen weiterhin bestimmt. Die Modellschicht darunter hat sich weit bewegt. Claude Fable 5.1 (1. September) führt Arenas Agent-Board jetzt klar an und hat es Claude Opus 5 abgenommen, das mit seinen zwei Effort-Einstellungen auf Platz zwei und drei liegt, und es führt außerdem Artificial Analysis' AA-Briefcase mit 1662 gegen 1645 von Opus 5 und GDPval-AA v2 mit 1766 gegen 1737 an. Zwei Anmerkungen zu diesen Zahlen: Artificial Analysis hat den eigenständigen Agentic Index am 4. September mit Intelligence Index v4.2 eingestellt und misst agentische Arbeit jetzt über AA-Briefcase und GDPval-AA v2, und es hat gleichzeitig die GDPval-AA-v2-Elo-Skala neu verankert, weshalb diese Werte rund 90 Punkte unter denen liegen, die wir letzten Monat genannt haben. Opus 5 ist weiterhin das Modell, auf dem die meisten Teams bauen sollten, zu $5 / $25 und damit dem halben Preis von Fable 5.1. Metas Muse Spark 1.3 (2. September) verdient eine fairere Behandlung, als seine eigene Launch-Tabelle ihm gibt: Meta fasst sechs Benchmarks unter Agent zusammen und 1.3 verliert alle sechs, aber auf Artificial Analysis' unabhängigem GDPval-AA-v2-Board liegt es mit 1719 auf Platz drei unter den verschiedenen Modellen, vor GLM 5.3, Grok 4.6 und Claude Fable 5, und das zu $1.25 / $4.25. Es gewinnt außerdem den langen Kontext, 98,1 auf MRCRs Band von 512K bis 1M gegen 55,5 für 1.2. Scale SEAL hat weiterhin nur das ältere 1.1 bewertet, das sein MCP-Atlas-Board zur Werkzeugnutzung mit 88,1 anführt. GLM 5.3 Flash (26. August, MIT) ist das Open-Weight-Agentenmodell, das wir hosten würden, mit AutomationBench 48,8 auf Z.ais eigener Tabelle, wo Claude Opus 4.8 auf 41,0 kommt; auf Arenas Agent-Board liegt GLM-5.2 jetzt auf Platz zwölf und Kimi K3 auf sieben. Grok 4.6 bleibt die Kostengeschichte statt eines neuen Agentenprodukts: ein GDPval-AA-v2-Elo von 1665, Sechster unter den verschiedenen Modellen, wobei es lange Aufgaben in rund 53 Zügen und 0,5 Milliarden Eingabe-Tokens abschließt gegenüber etwa 103 Zügen und 2,0 Milliarden bei Opus 5. GPT-6 Astra (3. September) spricht eher für Codex als für ein neues Agentenprodukt, mit 67 auf dem Coding Agent Index gegen 70 von Fable 5.1 und auf einem Fünftel der Tokens von Opus 5.

Fello AI auf Mac, iPhone und iPad
Alle Top-KI-Modelle, eine App

Die führenden Modelle wie ChatGPT, Claude und Gemini, zusammen auf Mac, iPhone und iPad.

Kostenlos starten, 4,7★ über 27.000+ Rezensionen.

Fello AI laden

Anwendungsfall-Leitfaden, September 2026

Beste KI für Studierende

1
GPT-5.6 Luna
Essays & Recherche
2
Gemini 3.6 Flash
STEM + PDFs
3
Claude Sonnet 5
Schreiben & Lektorat

Die beste KI für Studierende ist GPT-5.6 Luna in ChatGPT für allgemeine Studienarbeit und Gemini 3.6 Flash in der Gemini-App für STEM und multimodales Lernen, mit Qwen 3.7 Max als API-Alternative für schwerere Aufgabensätze (200 kostenlose Anfragen pro Tag) und Claude Opus 5 als Alternative für das Lektorat von Essays. Die meisten Studierenden müssen nicht zahlen, und die kostenlose Stufe wurde am 6. August besser: GPT-5.6 Luna wurde zum Standardmodell für ChatGPT Free und Go, mit unbegrenzten Textchats und einem Think-Button für schwerere Fragen, während Datei-Uploads und Bildwerkzeuge weiterhin begrenzt bleiben. Gemini 3.6 Flash ist weiterhin das, was die kostenlose Gemini-App ausliefert, Claude Sonnet 5 ist der kostenlose Claude-Standard, und DeepSeek V4 ist auf der Chat-Seite von DeepSeek kostenlos. Luna ist das günstigste und nicht das stärkste Mitglied der GPT-5.6-Familie, greif also zum Think-Button oder wechsle zu GPT-5.5, wenn ein Essay mehr Sorgfalt braucht. Für schrittweises Arbeiten an der härtesten Mathematik ist GPT-5.6 Sol das kostenpflichtige Flaggschiff von OpenAI, und GPT-6 Astra meldet jetzt 97,6 % auf FrontierMath Tier 4 v2 gegenüber den verifizierten 39,6 % von GPT-5.5 Pro, wobei Astra noch nicht im kostenlosen ChatGPT-Tarif verfügbar ist; Qwen 3.7 Max ist die Preis-Leistungs-Alternative mit 97,1 im HMMT-Index Februar 2026 und API-Preisen von $1,25 / $3,75 in der aktuellen 50%-Aktion ($2,50 / $7,50 Liste).

AufgabeBestes ModellWarumKostenlos?Alternative
Essays & StudienarbeitGPT-5.6 LunaKostenloser Standard in ChatGPT seit 6. August; unbegrenzte TextchatsJaClaude Sonnet 5 (Claude kostenlos)
STEM-ProblemlösungGPT-5.6 Sol / Qwen 3.7 MaxKostenpflichtiges STEM-Flaggschiff; Astra meldet 97,6 % FrontierMath Tier 4 v2 / 97,1 HMMT Feb 2026Pro kostenpflichtig / Qwen API kostenpflichtigGemini 3.6 Flash (kostenlos)
Recherche & GenauigkeitGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, native Google-Search-GrundierungJa (Gemini-App)Claude Opus 5
Schreib-LektoratClaude Sonnet 5Kostenlos und Standard auf claude.ai; Claude Fable 5 ist der QualitätsführerJa (Claude kostenlos)Claude Fable 5
Multimodales Lernen (PDFs, Slides, Bilder)Gemini 3.6 Flash1M Kontext, kostenlos in der Gemini-AppJaNotebookLM (Google)
Zweitplatzierte und Alternativen: Claude Sonnet 5 (kostenlos) ist der Zweitplatzierte fürs Essay-Schreiben und -Lektorat. Gemini 3.6 Flash (kostenlos) ist der Zweitplatzierte fürs multimodale Lernen und die PDF-Aufnahme. DeepSeek V4 ist der Zweitplatzierte für die Problemlösung mit striktem Null-Kosten-Budget.
Was sich diesen Monat geändert hat

Die kostenlose Stufe ist das, was sich in diesem Leitfaden bewegt hat. Am 6. August machte OpenAI GPT-5.6 Luna zum Standardmodell für ChatGPT Free und Go und gab beiden unbegrenzte Textchats plus einen Think-Button für schwerere Fragen, sodass die kostenlose Wahl jetzt Luna statt GPT-5.5 ist, das wählbar bleibt, wenn ein Essay mehr Sorgfalt braucht. Datei-Uploads, Bilder und andere Werkzeuge sind weiterhin begrenzt. Auf der Google-Seite hat sich nichts bewegt: Gemini 3.8 Flash erschien am 2. September, erreicht kostenlose Nutzer aber nur über AI Studio und die API, sodass die kostenlose Gemini-App weiterhin 3.6 Flash ausliefert und dieses die multimodale Zeile behält. GPT-6 Astra (3. September) ist das Modell, das man bei schweren Aufgabensätzen im Auge behalten sollte, mit gemeldeten 97,6 % auf FrontierMath Tier 4 v2 gegenüber den verifizierten 39,6 % von GPT-5.5 Pro, aber es setzt einen kostenpflichtigen ChatGPT-Plan voraus, und keine kostenlose Stufe enthält es.

Anwendungsfall-Leitfaden, September 2026

Beste KI für Arbeit & Profis

1
GPT-5.6
Tägliche Wissensarbeit
2
Claude Opus 5
Programmieren & Schreiben
3
Gemini 3.1 Pro
Recherche & Briefings

Die beste KI für professionelle Arbeit ist GPT-5.6 (ChatGPTs Standard seit 9. Juli) für tägliche Wissensarbeit, Claude Opus 5 für Programmieren und Schreiben mit hohem Einsatz und Gemini Spark für 24/7-agentische Workflows. Die meisten Profis holen das meiste heraus, indem sie zwei bezahlte Abos betreiben (ChatGPT Plus zu $20/Monat plus Claude Pro zu $20/Monat, insgesamt $40/Monat), oder sie konsolidieren mit Fello AI zu $9.99/Monat für alle fünf Top-Modelle in einer Mac-/iOS-App. Für agentische Arbeit, die läuft, während du schläfst, ist Gemini Spark der einzige echte 24/7-Cloud-Agent, und seit dem 30. Juli erreicht er neben Google AI Ultra auch die Stufe Google AI Pro zu $19.99/Monat.

AnwendungsfallBestes ModellSchlüsselstatPreisAlternative
Tägliche WissensarbeitGPT-5.6ChatGPTs Standard seit 9. Juli; der Assistent, den die meisten öffnen können$20/Mon. ChatGPT PlusClaude Opus 5
Programmieren (proprietär)Claude Opus 5#1 auf Arena image-to-WebDev (1,668.6) und #2 bei WebDev (1688); Anthropics empfohlener Standard$20/Mon. Claude ProClaude Fable 5
Programmierung (kostengünstig)Qwen3.8-Max-0902#1 Code Arena: WebDev (1691), drei Punkte über Claude Opus 5; nur API auf QwenCloud$2 / $6Qwen 3.7 Max; DeepSeek V4-Flash 0731
Recherche & BriefingsGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, Google-GrundierungGoogle AI Pro / UltraClaude Opus 5
Harte Mathematik, Physik, FinanzmodellierungGPT-6 Astra#1 LiveBench Reasoning und ARC-AGI-2 (95 %); meldet 97,6 % FrontierMath Tier 4 v2$100/Mon. ChatGPT ProGPT-5.6 Sol; Qwen 3.7 Max
Immer-an-Agenten-WorkflowsGemini SparkErster 24/7-Cloud-AgentAb $19.99/Mon. Google AI ProClaude Cowork
Live-News, X-Kontext-KreativitätGrok 4.6Intelligence Index 61 + native X-Grundierung$30/Mon. SuperGrokGemini 3.1 Pro
All-in-one-KonsolidierungFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/Mon.Jeden Anbieter separat bezahlen
Zweitplatzierte und Alternativen: Für die meisten professionellen Teams ist Claude Opus 5 der Zweitplatzierte hinter GPT-5.6 für die tägliche Arbeit und jetzt der Programmierführer bei image-to-WebDev und beim Preis bei $5 / $25, mit Claude Fable 5 als Zweitplatziertem für die schwerste Long-Horizon-Arbeit. Gemini 3.1 Pro ist der Zweitplatzierte für recherchelastige Rollen, und Gemini Spark ist die einzigartige Wahl, wenn du einen Cloud-Agenten an langen Aufgaben arbeiten lassen kannst.
Was sich diesen Monat geändert hat

In den ersten drei Septembertagen kamen drei Releases, und keines davon bewegt die Wahl für die tägliche Arbeit. Claude Fable 5.1 (1. September) führt den Intelligence Index von Artificial Analysis mit 66 und dessen Agentic Index mit 61 an, aber Claude Opus 5 bleibt hier die Empfehlung bei $5 / $25, der Hälfte des Preises von Fable 5.1, und Anthropics eigene Dokumentation sagt Teams weiterhin, mit Opus 5 zu beginnen. Alibabas Qwen3.8-Max-0902 (2. September) nahm Opus 5 das Arena-WebDev-Board um drei Punkte ab und übernimmt die Zeile für kostengünstige Programmierung bei $2 / $6, obwohl es nur über die API auf QwenCloud läuft und kein Endkunden-Frontend hat. GPT-6 Astra (3. September) ist das Release, das die Zeile für die tägliche Arbeit bewegen könnte, und hat es noch nicht: Astra erreichte Business- und Pro-Plätze am 4. September und Plus wenige Stunden später, aber mit $10 / $50 gegenüber $4 / $20 bei Sol ist es der teurere Standard, sodass GPT-5.6 die Zeile behält.

Preisvergleich

KI-Modell-Preise im September 2026

Von $0-Gratisversionen bis zu $199.99/Monat Google AI Ultra. Der folgenreichste Preis auf dieser Tabelle ist Claude Opus 5 bei $5 / $25, weil es der zweithöchste Wert auf Artificial Analysis' Intelligence Index zum halben Preis der beiden Fable-Modelle um es herum ist. Claude Fable 5.1, das sich am 1. September die Spitze dieses Index holte, behält denselben Listenpreis von $10 / $50 wie Fable 5, senkt aber Cache-Reads um 75 % auf $0.25, und genau dort statt beim Listenpreis liegt die Ersparnis bei langen agentischen Läufen. Metas Muse Spark 1.3 wird mit $1.25 / $4.25 gelistet, unverändert über drei Fähigkeitssprünge seit Juli, mit einer Contributor-Stufe zu $0.10 / $0.20 für alle, die bereit sind, Meta auf ihren Prompts trainieren zu lassen, und Grok 4.6 wird mit $2 / $6 gelistet, mit dem Vorbehalt, dass ein Prompt ab 200.000 Tokens die gesamte Anfrage mit $4 / $12 abrechnet. Der Preis-Leistungs-Tipp hat sich im August verschoben, und zwar nicht, weil irgendetwas günstiger geworden wäre: DeepSeek erhöhte die Preise beider V4-Modelle am 16. August um rund das Vierfache und brachte V4-Flash 0731 von glatten $0.14 / $0.28 auf $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten. Der Tipp ist jetzt GLM 5.3 Flash mit $0.15 / $0.50 Listenpreis, bis zum 9. September halbiert, das 57 Punkte auf dem Intelligence Index erreicht und selbst DeepSeeks Nebenzeitpreis auf beiden Seiten zu jeder Tagesstunde unterbietet. An der Frontier selbst ist Grok 4.6 der Preis-Leistungs-Tipp, mit 61 für $0.84 pro Index-Aufgabe, wo Opus 5 $2.34 kostet und GPT-5.6 Sol für denselben Wert nach der Senkung vom 21. August $4 / $20 verlangt. Unter den geschlossenen Modellen ist GPT-5.6 Luna nach OpenAIs Senkung vom 30. Juli das günstigste bei $0.20 / $1.20. Für eine tiefere Aufschlüsselung siehe unseren vollständigen Leitfaden zum KI-Preisvergleich. Das neue Flaggschiff des Monats ändert an diesem Bild nichts: GPT-6 Astra kam am 3. September für $10 / $50, denselben Listenpreis wie Claude Fable 5.1 und das 2,5-Fache von GPT-5.6 Sol, mit gecachtem Input für $1 und Cache-Schreibvorgängen für $12.50, und Artificial Analysis misst es pro Index-Aufgabe 75 % teurer als Sol bei demselben Wert von 61.

ModellInput (pro 1M)Output (pro 1M)KontextKostenloser Zugang?
GPT-6 Astra$10.00$50.001.050.000 (max. Eingabe 922.000)ChatGPT Business/Pro seit 4. September, Plus Stunden später; kein Gratis-Tarif. API, AWS und Azure stehen noch aus
GPT-5.5$5.00$30.001M (400K in Codex)ChatGPT Free; API bezahlt
GPT-5.5 Pro$30.00$180.001MChatGPT Pro ab $100/Mon. ($200 Stufe mit höherer Nutzung)
GPT-5.6 Sol$4.00$20.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
GPT-5.6 Terra$2.00$12.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
GPT-5.6 Luna$0.20$1.20Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
Claude Opus 5$5.00$25.001MClaude Pro/Max Standard; API bezahlt
Claude Opus 4.8$5.00$25.001MLegacy-Modell bei Anthropic; Pro/Max/API
Claude Fable 5.1$10.00$50.001MCache-Reads $0.25; in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits. Mythos 5.1 rechnet identisch ab, nur auf Einladung
Claude Fable 5$10.00$50.001MDauerhaft in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits
Claude Sonnet 5$2.00$10.001MClaude Free & Pro Standard; API bezahlt
Claude Sonnet 4.6$3.00$15.001MAPI bezahlt (abgelöst durch Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MEingeschränkte Gemini-App; API bezahlt
Gemini 3.8 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MAI Studio, Antigravity, Gemini Enterprise + bezahlte API; in der Gemini-App für AI Pro/Ultra berichtet
Gemini 3.7 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MAI Studio, Android Studio, Antigravity + bezahlte API; in der Gemini-App nur über Spark (AI Pro/Ultra, ohne EWR/UK/CH/Nigeria)
Gemini 3.6 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MStandard der kostenlosen Gemini-App; AI Studio; kostenlose API-Stufe + bezahlte API
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; kostenlose API-Stufe + bezahlte API
Qwen3.8-Max-0902$2.00 ($0.17 expliziter Cache-Hit, $0.25 impliziter)$6.001M (128K Ausgabe)Nur QwenCloud-API; kein Consumer-Chat, keine offenen Gewichte
Qwen 3.7 Max$1.25 Promo / $2.50 Liste$3.75 Promo / $7.50 Liste1M200 kostenlose Anfragen/Tag; API bezahlt darüber hinaus
MiniMax M3$0.30 (50 % Rabatt auf $0.60)$1.20 (≤512K)1MOpen weights; Hosting-Kosten fallen an
LongCat-2.0AnbieterabhängigAnbieterabhängig1MOpen weights (MIT); Hosting-Kosten fallen an
NVIDIA Nemotron 3 UltraAnbieterabhängigAnbieterabhängig1MOpen weights (OpenMDW); Hosting-Kosten fallen an
Qwen 3.5 (Open-Weight)Selbst-Host / TogetherSelbst-Host / Together1MOpen weights; Hosting-Kosten fallen an
Nex-N2-ProSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (Apache 2.0); Hosting-Kosten fallen an
Rio 3.5 Open 397BSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (MIT); Hosting-Kosten fallen an
Grok 4.3$1.25$2.501MKostenloser Consumer-Plan; API bezahlt
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KSpaceXAI-API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Muse Spark 1.3$1.25 ($0.10 Contributor-Stufe)$4.25 ($0.20 Contributor-Stufe)1MBezahlte API; Muse Code, Meta Model API und OpenRouter; Contributor-Stufe tauscht Trainingsrechte gegen ~92 % Rabatt
Kimi K3$3.00 ($0.30 Cache-Hit)$15.001MKostenlose Basis-Stufe in der Kimi-App; open weights auf Hugging Face (Kimi K3 License)
Gemini Omni Flash (Video)$1.50$17.50 (Video-Output)10-Sekunden-ClipsGemini-App / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 Nebenzeit / $1.32 Spitzenzeit ($0.022 Cache-Hit Nebenzeit)$1.98 Nebenzeit / $3.96 Spitzenzeit1MDeepSeek Chat kostenlos; API bezahlt, Spitzen- und Nebenzeittarife seit 16. August
DeepSeek V4-Flash 0731$0.22 Nebenzeit / $0.44 Spitzenzeit ($0.007 Cache-Hit Nebenzeit)$0.66 Nebenzeit / $1.32 Spitzenzeit1MDeepSeek Chat kostenlos; API bezahlt, Spitzen- und Nebenzeittarife seit 16. August
Kimi K2.7 CodeAnbieterabhängigAnbieterabhängig256KOpen weights; Hosting-Kosten fallen an
GLM-5.2AnbieterabhängigAnbieterabhängig1MOpen weights; Hosting-Kosten fallen an
GLM 5.3$1.40 ($0.26 Cache-Hit)$4.401MZ.ai API, GLM Coding Plan und ZCode; Gewichte seit dem 28. August auf Hugging Face unter der eigenen GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 Cache-Hit); $0.075 Aktion$0.50; $0.25 Aktion1MZ.ai API, GLM Coding Plan, OpenRouter; MIT-Gewichte auf Hugging Face; Aktion endet am 9. September
Tencent Hy4 Preview$0.834 ($0.042 Cache-Hit)$2.5011M+Offene Gewichte (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextAnbieterabhängigAnbieterabhängig262K (bis 1M)Offene Gewichte (Qwen Community License 1.0); Hosting-Kosten kommen hinzu
ERNIE 5.1China-Region-PreiseChina-Region-Preise256KBaidu Gratisversion
Gemini Spark (Agent)Nicht API-bepreistNicht API-bepreist1M (Gemini-Basis)Google AI Pro $19.99, AI Ultra $99.99 oder $199.99/Mon.
Fello AI (Aggregator)Über die App geroutetÜber die App geroutetModellabhängig$9.99/Mon., Gratisversion verfügbar

Die oben genannten Raten für GPT-5.5 und GPT-5.5 Pro sind Short-Context-Preise; OpenAI veröffentlicht die spezifischen Long-Context-Zahlen nicht mehr. Die GPT-5.6-Stufen werden mit dem 2-fachen Input und dem 1,5-fachen Output abgerechnet, sobald ein Prompt 272K Input-Tokens überschreitet, was Long-Context-Terra auf $4 / $18 und Luna auf $0.40 / $1.80 bringt. Grok 4.6 funktioniert genauso, beißt aber härter: Ab 200.000 Prompt-Tokens rechnet SpaceXAI die gesamte Anfrage zum höheren Satz ab statt nur den Überhang, sodass ein Überschreiten um tausend Tokens die Kosten des ganzen Aufrufs verdoppelt. Die andere Preisliste, die man zweimal lesen sollte, ist die von DeepSeek: Seit dem 16. August werden beide V4-Modelle werktags von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC zum Spitzentarif abgerechnet und in jeder anderen Stunde zu genau der Hälfte, sodass dieselbe Aufgabe je nach Ausführungszeitpunkt doppelt so viel kosten kann. Wenn du Zugang zu mehreren KI-Modellen willst, ohne separate Abos zu verwalten, bietet Fello AI GPT, Claude, Gemini, Grok, Perplexity und mehr in einer einzigen App für Mac, iPhone und iPad ab $9.99/Monat.

Open-Weight-Modelle

Beste Open-Weight-Modelle im September 2026

Das beste Open-Weight-Modell im September 2026 ist Kimi K3, und es übernahm die Führung in dem Moment, in dem Moonshot am 27. Juli 2026 die Gewichte veröffentlichte. Es hält den höchsten Intelligence Index aller offenen Modelle mit 60 auf Artificial Analysis, sieben Punkte vor GLM-5.2, und auf Arena ist es weiterhin der höchstplatzierte offene Eintrag, auf #3 bei WebDev hinter Qwen3.8-Max-0902 und Claude Opus 5 und #3 auf dem Agent-Board. Ein Haken entscheidet, welches der beiden du tatsächlich verwenden solltest. Der K3-Download besteht aus 96 safetensors-Shards und rund 1,56 TB, was ein Multi-Node-GPU-Cluster statt einer Workstation braucht, und es kommt unter einer eigenen Kimi K3 License statt MIT. Die praktische Empfehlung für Teams, die eigene Gewichte betreiben, ist damit jetzt GLM 5.3 Flash (Z.ai, MIT), erschienen am 26. August bei Intelligence Index 57, vier Punkte über GLM-5.2 und bei weniger als der halben Größe, 320B gesamt mit 18B aktiv. Es ist das erste nativ multimodale Modell der GLM-5-Reihe, es fasst 1M Tokens Kontext, und die Gewichte lagen am Tag des Starts unter MIT auf Hugging Face. GLM-5.2 (MIT) ist die Rückfalloption, bei Intelligence Index 53, und es hält weiterhin den unabhängigen Nachweis, für den das neuere Modell noch keine Zeit hatte, #6 auf Arena WebDev (1,587.1) und #5 auf dem Agent-Board. Der dritte Platz wechselte am letzten Julitag den Besitzer: DeepSeek V4-Flash 0731 wurde nachtrainiert und sprang von Intelligence Index 40 auf 52 auf dem aktuellen Index v4.1.1 unter MIT, doch sein API-Preis ist seitdem um rund das Vierfache gestiegen, auf $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten. Drei Releases schlossen dann den Monat ab, und keines davon hat bisher eine unabhängige Bewertung. GLM 5.3 veröffentlichte am 28. August endlich seine Gewichte, genau zu dem Datum, das sein Platzhalter trug, aber unter einer eigenen GLM 5.3 License statt MIT, mit einer Klausel, nach der jeder Model-as-a-Service-Betreiber mit mehr als 10 Milliarden Dollar Umsatz zuerst eine Sicherheitsprüfung von Z.ai bestehen muss; beachte außerdem, dass GLM 5.3 Flash kein abgespecktes GLM 5.3 ist, sondern ein eigenes Modell auf einer neu trainierten Basis, weshalb es unter reinem MIT erscheinen konnte, während das Flaggschiff das nicht konnte. Tencent öffnete am 28. August Hy4 Preview mit 770B gesamt und 49B aktiv unter Apache 2.0, das bislang größte permissiv lizenzierte veröffentlichte Modell, gestützt auf eine interne Blindbewertung statt auf ein unabhängiges Board. Und Alibaba veröffentlichte am 26. August Qwen3.8-Flash-Next, ein Mixture-of-Experts mit 125B und nur 6B aktiv, das die Qwen4-Architektur vorwegnimmt, unter der Qwen Community License 1.0 statt Apache. Alle drei sind unten aufgeführt statt eingeordnet.

ModellAm besten fürSchlüssel-BenchmarkKontext / LizenzWo laufen lassen
Kimi K3Höchstbewertetes open model, agentische und Web-ArbeitII 60, höchster aller open models; #3 Arena WebDev, #3 Arena Agent; 2.8T/104B aktiv1M / Kimi K3 LicenseHugging Face (96 Shards, 1.56 TB), Moonshot API, Anbieter
GLM 5.3 FlashBestes offenes Modell, das die meisten Teams wirklich betreiben könnenII 57 (v4.1.1), auf der Pareto-Front aus Intelligenz und Kosten bei rund $0.09 pro Index-Aufgabe; 320B/18B aktiv, nativ multimodal1M / MITHugging Face, Z.ai API ($0.15/$0.50), OpenRouter
GLM-5.2Rückfalloption mit unabhängigem NachweisII 53; #6 Arena WebDev (1,587.1), #5 Arena Agent; 744B/40B aktiv1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Seit dem 28. August offen, aber unter eigener LizenzGleiche 744B-Basis wie GLM-5.2, nur nachtrainiert, veröffentlichter Checkpoint mit 753B gezählt; CyberGym 84,5 % und Terminal-Bench 3.0 28,3 (Herstellerangaben)1M / GLM 5.3 License (Model-as-a-Service über 10 Mrd. USD Umsatz braucht eine Z.ai-Sicherheitsprüfung)Hugging Face, Z.ai API ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4-Flash 0731Bester offener Wert, wenn du selbst hostestII 52 (v4.1.1), von 40 am 31. Juli; 284B/13B aktiv1M / MITDeepSeek API ($0.22/$0.66 Nebenzeit, $0.44/$1.32 Spitzenzeit seit 16. August), lokal
Tencent Hy4 PreviewBislang größtes permissiv lizenziertes Modell770B/49B aktiv; 2,99/4,00 auf Tencents eigenem 203-Aufgaben-Panel gegen 2,94 für Kimi K3 und 2,92 für GLM 5.3 (Hersteller); bisher keine unabhängige Bewertung1M+ / Apache 2.0Hugging Face (BF16 und FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextVorschau auf die Qwen4-Architektur125B gesamt plus 51B N-Gramm-Embedding, 6B aktiv; 91,7 GPQA Diamond und 62,5 SWE-Bench Pro (Hersteller); bisher keine unabhängige Bewertung262K bis 1M / Qwen Community License 1.0Hugging Face, Anbieter, Self-Hosting
LongCat-2.0Frontier-offener Coder, trainiert auf chinesischen ChipsII 33 (v4.1); 59,5 % SWE-Bench Pro (Anbieter), 1.6T/~48B aktiv1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Günstig multimodal auf Frontier-NiveauII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / Lizenz TBDHugging Face, API $0.30/1M (50 % Rabatt)
Nex-N2-ProStärkster offener Coding-WertII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivQwen-basiert / Apache 2.0Hugging Face, Anbieter, Selbst-Host
Kimi K2.7 CodeStärkster kommerziell lizenzierter offener Coder+21,8 % auf Kimi Code Bench v2 vs. K2.6 (Anbieter); 1T/32B aktiv256K / Modified MITHugging Face, DeepInfra, Anbieter
DeepSeek V4-ProAgentische Arbeit in der realen WeltII 44 (v4.1), 1.6T/49B aktiv1M / MITDeepSeek API ($0.66/$1.98 außerhalb der Spitze, $1.32/$3.96 zur Spitze seit 16. August), lokal
Hy3Neuester Kandidat mit permissiver LizenzII 41 (v4.1); #22 auf Arena WebDev (1,516.4)Apache 2.0Hugging Face, Anbieter, Selbst-Host
InklingThinking Machines' erstes open modelII 41 (v4.1), agentisch 32,3, veröffentlicht 15. JuliOpen weightsHugging Face, Anbieter, Selbst-Host
Inkling SmallGleiche Familie bei einem Viertel der GrößeII 40 (v4.1), agentisch 30,8; 276B/12B aktiv, Text, Bild und Audio InputApache 2.0Hugging Face (BF16 und NVFP4), Anbieter, Selbst-Host
NVIDIA Nemotron 3 UltraNVIDIA-abgestimmt, voll permissive LizenzII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktiv1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 Selbst-Host)
Qwen 3.5 (397B / 17B aktiv)Multimodal, schnelles Decoding88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / offenTogether, OpenRouter, lokal
Qwen3.6-35B-A3BEffizienter offener agentischer Coder (3B aktiv)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktiv262K (bis 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, lokal
Qwen3.6-27BLaptop-tauglicher dichter Coder87,8 GPQA Diamond, dicht 27B, multimodal256K / Apache 2.0Lokal Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BQwen-3.5-Fine-tune, mehrsprachiges Reasoning70,8 Terminal-Bench 2.1 (First-Party), schlägt Qwen 3.7 Plus in 4/5397B/17B aktiv / MITHugging Face, Anbieter, Selbst-Host
Llama 4 MaverickFlaggschiff der Meta-Reihe17B aktiv / 400B GesamtparameterLlama 4 LicenseMeta-Cloud, Hugging Face, lokal
NVIDIA Nemotron 3 Nano OmniEdge / Low-PowerMultimodal, sehr kleiner FootprintKompakt / offenLokal, NVIDIA-Tool

Lizenzierung zählt hier ebenso wie der reine Wert, und der August hat den Abstand zwischen den beiden Gruppen vergrößert. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) und Nemotron 3 Ultra (OpenMDW) erlauben alle klar die kommerzielle Nutzung ohne Umsatzprüfung. Der Rest trägt Bedingungen, die man lesen sollte, bevor man darauf aufbaut: MiniMax M3 und MiniMax H3 kommen unter ihren eigenen Community-Lizenzen, wobei H3 zusätzlich einen Antrag aus den USA, der EU, dem Vereinigten Königreich und Südkorea verlangt; Kimi K3 sitzt auf einer eigenen Lizenz mit einer Umsatzschwelle für alle, die es als Service weiterverkaufen; GLM 5.3 verlangt eine Z.ai-Sicherheitsprüfung für jeden Model-as-a-Service-Betreiber über 10 Milliarden Dollar Umsatz; und die Qwen Community License 1.0 bei Qwen3.8-Flash-Next verlangt eine separate Lizenz von Qwen, um ein Model-as-a-Service- oder ein KI-Arbeitsassistenz-Geschäft zu betreiben, wobei interne Nutzung ausgenommen ist. Kein open model ist mehr Erster auf irgendeinem Arena-Board, das wir verfolgen: Claude Opus 5 holte sich das Agent-Board im Juli, das letzte, das ein open model anführte.

Wie wir bewerten

Benchmarks, Preise und Hands-on-Nutzung

Jedes Ranking auf dieser Seite kombiniert drei Eingaben: öffentliche Benchmarks von sieben unabhängigen Häusern (Artificial Analysis, Arena früher LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize und das offizielle Terminal-Bench-2.1-Board, mit Abdeckung der Intelligence- und Agentic-Indizes, GPQA Diamond, ARC-AGI-1 bis 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas und dem Remote Labor Index), veröffentlichte API- und Abo-Preise von der offiziellen Preisseite jedes Anbieters und Hands-on-Nutzung durch das FelloAI-Redaktionsteam, das echte Prompts über dieselbe Aufgabe auf jedem Modell laufen lässt. Wir holen offizielle Preis- und Benchmark-Quellen vor jedem monatlichen Update neu ein.

Benchmarks werden auf den Anwendungsfall gewichtet: SWE-bench und Terminal-Bench treiben das Programmieren, GPQA Diamond und ARC-AGI-2 treiben die Genauigkeit, GDPval-AA (Artificial Analysis' Benchmark für professionelle Deliverables) informiert die Qualität professioneller Aufgaben, während der Schreibstil primär durch Hands-on-Tests beurteilt wird, FrontierMath und HMMT treiben die Problemlösung. Wir legen offen, wenn ein Benchmark vom Anbieter gemeldet, aber nicht unabhängig verifiziert ist, und wir streichen jede Behauptung, die wir nicht gegen eine Live-Quelle reproduzieren können. Wir ranken nach gemessenen Werten: Eine Kategoriekrone wandert, sobald ein Modell den Titelhalter auf den Boards schlägt, die diese Kategorie definieren, ohne auf die stimmbasierten Boards zu warten, und ein Modell, das noch nicht breit verfügbar ist, wird auf seiner Karte gekennzeichnet statt von ihr ausgeschlossen. Wir prüfen Ränge ebenso nach wie Zahlen, denn ein Wert kann korrekt bleiben, während sich das Board darum herum bewegt. Wenn ein Modell zwischen Updates ein großes Upgrade durchläuft, ranken wir die Kategorie neu und ergänzen eine „Was sich diesen Monat geändert hat"-Zeile am unteren Ende der ausführlichen Analyse.

Fello AI auf Mac, iPhone und iPad
Unsicher, welches Modell du wählen sollst?

Fello AI vereint die besten KI-Modelle in einer leichten nativen App.

Wechsle jederzeit zwischen ihnen, keine separaten Abos.

Fello AI laden
Häufig gestellte Fragen

Häufige Fragen

Was ist das beste KI-Modell gerade jetzt im September 2026?
Es hängt von der Aufgabe ab. Beim Gesamt-Benchmark-Wert ist Claude Fable 5.1 (1. September) #1 auf Artificial Analysis' Intelligence Index mit 66 und seinem Agentic Index mit 61, mit Claude Opus 5 auf beiden Zweiter mit 63 und 59; Arena hat Opus 5 an die Spitze von vier seiner Boards gesetzt, einschließlich beider Coding-Boards, und hat für Fable 5.1 noch keine Stimmen. Grok 4.6 (12. August) ist der Preis-Leistungs-Tipp an der Frontier und teilt sich mit GPT-5.6 Sol die 61 zu einem Drittel des Preises. Für den täglichen Chat ist GPT-5.6 seit 9. Juli ChatGPTs Standard und der Assistent, den die meisten Menschen tatsächlich öffnen können, obwohl Claude Fable 5 Arenas Text-Leaderboard anführt. Fürs Programmieren ist Claude Opus 5 #1 auf Arenas image-to-WebDev-Board (1,668.6) und Zweiter bei WebDev (1688) hinter Qwen3.8-Max-0902, zum halben Preis von Fable 5. Fürs Schreiben ist Claude Fable 5 #1 auf Arenas Text-Leaderboard (1508.6), wobei Fable 5.1 bei Humanity's Last Exam (59,1 %) davor liegt und bei AA-Omniscience (43) gleichauf ist. Für die Genauigkeit zieht Gemini 3.1 Pro mit dem menschlichen Panel auf ARC-AGI-1 mit 98 % für $0.52 pro Aufgabe gleich. Für schwere Mathematik und Reasoning führt GPT-6 Astra LiveBench Reasoning und ARC-AGI-2 an, LiveBench Mathematics führt Claude Fable 5.1 an, und GPT-5.6 Sol ist auf beiden LiveBench-Boards Dritter. Für Bilder führt ChatGPT Images 2.5 beide Boards von Arena an, und für Video führt Gemini Omni Flash beide an. Für Agenten ist Gemini Spark der 24/7-Cloud-Agent und Claude Cowork der Desktop-Agent. GPT-6 Astra, OpenAIs Flaggschiff vom 3. September, holt sich keine davon: Es liegt auf dem Intelligence Index mit 61 gleichauf mit GPT-5.6 Sol bei 2,5-fachem Preis, kommt auf dem Coding Agent Index auf 67 gegen die 70 von Claude Fable 5.1 und ist noch nicht im kostenlosen ChatGPT-Tarif verfügbar.
Ist GPT-6 draußen, und ist es jetzt das beste Modell?
GPT-6 ist da. OpenAI hat es am 3. September 2026 als GPT-6 Astra gestartet, womit die ein Jahr alte Frage geklärt ist, ob Astra als GPT-6 oder als weiteres GPT-5-Point-Release erscheint. Das beste Modell auf den unabhängigen Boards ist es nicht. Artificial Analysis gibt ihm 61 auf dem Intelligence Index v4.1.1, exakt gleichauf mit GPT-5.6 Sol, fünf Punkte hinter Claude Fable 5.1 mit 66 und zwei hinter Claude Opus 5 mit 63, bei $10 / $50 pro 1M Tokens gegen die $4 / $20 von Sol. Stärker ist es beim agentischen Programmieren, mit 67 auf dem Coding Agent Index von Artificial Analysis in Codex, gleichauf mit Opus 5 und Fable 5 und hinter den 70 von Fable 5.1, und es erreicht das mit einem Drittel der Tokens von Sol. Auf AA-Omniscience halbiert es die Halluzinationen ungefähr, von 92 % auf 51 % bei max. Du brauchst einen kostenpflichtigen Plan: Astra ist das erste Modell, das OpenAI bei Cybersicherheit als kritisch eingestuft hat, deshalb bekamen es zugelassene Verteidiger im Daybreak-Programm zuerst, ChatGPT Business und Pro folgten am 4. September und Plus wenige Stunden später. Die API, AWS und Azure werden noch ausgerollt, und für die Gratis-Stufe wurde nichts angekündigt. Unsere vollständige GPT-6-Astra-Analyse behandelt die Benchmarks und die Vorbehalte.
Was ist Claude Opus 5?
Claude Opus 5 ist Anthropics Flaggschiff vom 24. Juli 2026 und war das #1-Modell auf Artificial Analysis, bis am 1. September Claude Fable 5.1 erschien. Es liegt jetzt Zweiter auf dem Intelligence Index mit 63 gegen 66, Zweiter auf dem Agentic Index mit 59 gegen 61 und Zweiter auf dem GDPval-AA v2 Board für professionelle Deliverables mit 1824 gegen 1853, weiterhin deutlich vor den 1755 von Grok 4.6 und den 1723 von Claude Fable 5. Die API-Preise liegen bei $5 / $25 pro 1M Tokens, dieselben wie Opus 4.8 und halb so teuer wie Fable 5, mit einem Kontextfenster von 1M Tokens und einem Wissensstand von Mai 2026. ARC Prize bestätigt unabhängig Anthropics Launch-Behauptung zu ARC-AGI-3, wo Opus 5 30 % gegen 8 % für das nächstbeste Modell erzielt, rund 3,75-mal. Arena hat es seither bewertet und setzt es auf #1 bei image-to-WebDev und Document, auf Platz zwei des Agent-Boards hinter Claude Fable 5.1 und auf #9 beim Text, und das brachte ihm die Programmierkrone ein; es führte auch WebDev an, bis Qwen3.8-Max-0902 es am 2. September um drei Punkte überholte. Eine Sache zum Bedenken: Artificial Analysis misst seine Halluzinationsrate mit 50 %, weshalb es auf dieser Seite keine Genauigkeitskrone hält.
Was ist Claude Fable 5.1?
Claude Fable 5.1 ist Anthropics Release vom 1. September 2026 und das höchstbewertete Modell, das Artificial Analysis je gemessen hat, mit 66 auf seinem Intelligence Index bei max Effort und 61 auf seinem Agentic Index. Es erschien zusammen mit Claude Mythos 5.1, demselben Modell mit gelockerten Safeguards in Biologie und Cybersicherheit, nur auf Einladung verfügbar und ohne veröffentlichte Kriterien. Die Preise liegen bei $10 / $50 pro 1M Tokens, unverändert gegenüber Fable 5, aber Cache-Reads fallen um 75 % auf $0.25, bei einem Kontextfenster von 1M Tokens und einem Wissensstand von Juni 2026. Es ist in Claude Max und Team Premium bei rund 50 % der Wochenlimits enthalten und aus Pro über Credits erreichbar. Anthropic rät weiterhin, für die meisten Workloads mit Claude Opus 5 zu beginnen, da es halb so viel kostet und schneller läuft. Unsere vollständige Aufschlüsselung zu Claude Fable 5.1 und Mythos 5.1 behandelt die System Card und die Aufteilung der Safeguards.
Ist Claude Fable 5 zurück?
Ja. Anthropic setzte Claude Fable 5 am 1. Juli 2026 wieder ein, nachdem die US-Regierung die Exportkontrollbeschränkung aufgehoben hatte, die sie am 12. Juni verhängt hatte. Es ist wieder auf der Claude API, Claude.ai, Claude Code und Claude Cowork verfügbar. Anthropic machte Fable 5 am 20. Juli 2026 in den bezahlten Plänen dauerhaft. Max und Team Premium enthalten es bei rund 50 % der regulären Nutzungslimits; Pro und Team Standard erreichen es über Nutzungscredits mit einem einmaligen Startguthaben von $100. Die API-Preise liegen bei $10 / $50 pro Million Tokens. Fable 5 ist ein Modell der Mythos-Klasse, gebaut für langfristige agentische Arbeit mit einem Kontext von 1M Tokens, und es ist der Zweitplatzierte fürs Programmieren hinter Claude Opus 5, auf #2 von Arenas image-to-WebDev-Board (1,625.7) und #4 auf WebDev.
Was ist GPT-5.6 und kann ich es nutzen?
Ja, seit dem 9. Juli 2026. GPT-5.6 ist OpenAIs Modellfamilie der nächsten Generation, und nach einer zweiwöchigen geschlossenen Vorschau, die am 26. Juni hinter einer Sicherheitsprüfung der US-Regierung begann, erreichte es am 9. Juli die allgemeine Verfügbarkeit. Es gibt drei Stufen, vom wenigsten zum leistungsstärksten: Luna, die schnelle, günstigste Stufe ($0.20 / $1.20 pro 1M Tokens); Terra, ein ausgewogenes Alltagsmodell, von dem OpenAI sagt, es entspreche GPT-5.5 ($2 / $12); und Sol, das Flaggschiff, abgestimmt auf Biologie, Chemie und Cybersicherheit ($4 / $20). OpenAI senkte Luna um 80 % und Terra um 20 % am 30. Juli 2026 und ließ Sol unangetastet, senkte Sol dann am 21. August 2026 um über 20 % als Aktionspreis für rund drei Monate. Kein ChatGPT-Abopreis hat sich geändert. Es ist jetzt live über ChatGPT, Codex und die API als OpenAIs Standardmodell. Ein Vorbehalt: OpenAIs System Card und der externe Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, also behandle es bei faktischer Arbeit mit hohem Einsatz vorsichtig, bis sich unabhängige Ergebnisse festigen.
Ist Grok 4.6 schon draußen?
Ja. SpaceXAI veröffentlichte Grok 4.6 am 12. August 2026 und löste damit Grok 4.5 als Flaggschiff ab, gut einen Monat nach dessen Start. Es ist kein neues Basismodell: Das Unternehmen behielt die Grundlage von Grok 4.5 und verbesserte das Modell durch zusätzliches Post-Training, einschließlich Reinforcement Learning in agentischen Umgebungen, und veröffentlichte weder eine neue Architektur noch eine Parameterzahl. Artificial Analysis bewertet es mit Intelligence Index 61, fünf Punkte über den 56 von Grok 4.5, womit es mit GPT-5.6 Sol bei 61 gleichzieht, hinter Claude Fable 5.1 mit 66, Claude Opus 5 mit 63 und Claude Fable 5 mit 62. Die Preise bleiben unverändert bei $2 / $6 pro 1M Tokens bei einem Kontextfenster von 500K Tokens, allerdings werden Prompts ab 200.000 Tokens komplett mit $4 / $12 abgerechnet. Es läuft in der SpaceXAI-API, in Cursor, Grok Build, OpenRouter, Vercel und Cloudflare. Grok 4.6 ist auch unser Kreativitäts-Tipp, aus Produktgründen statt wegen der Prosa-Qualität; für den bestgeschriebenen Output gewinnt Claude Fable 5 klar. Alle Zahlen in unserer Aufschlüsselung zu Grok 4.6.
Welche KI ist die beste zum Programmieren?
Claude Fable 5.1 ist die beste zum Programmieren und führt die Harness-Benchmarks mit 55,8 % auf Terminal-Bench 4.0 und 70 auf Artificial Analysis' Coding Agent Index an, wobei Claude Opus 5 zum halben Preis der Preis-Leistungs-Tipp ist. Alibabas Qwen3.8-Max-0902 debütierte am 2. September mit 1691 Punkten gegen die 1688 von Opus 5 auf #1 von Arenas WebDev-Board; Opus 5 behält image-to-WebDev mit 1,668.6. Es läuft mit $5 / $25 pro 1M Tokens, halb so viel wie Claude Fable 5, und Anthropics eigene Dokumentation rät, für komplexes agentisches Programmieren mit Opus 5 zu beginnen. Claude Fable 5 ist der Zweitplatzierte für die schwerste Long-Horizon-Arbeit auf #2 image-to-WebDev, und Kimi K3 ist der Kandidat auf #3 bei WebDev. Beachte, dass Artificial Analysis' Coding Index kein Claude-Durchmarsch ist: GPT-5.6 Sol (xhigh) führt ihn mit 78,3 an, mit Opus 5 bei 78,0, nah genug für einen Gleichstand. GLM 5.3 Flash (MIT, 26. August) ist jetzt sowohl der Preis-Leistungs-Tipp bei $0.15 / $0.50 als auch der beste Open-Weight-Coder, den du selbst hosten kannst, bei Intelligence Index 57; den ersten der beiden übernahm es von DeepSeek V4-Flash 0731, als DeepSeek am 16. August um rund das Vierfache erhöhte.
Welche KI ist die beste zum Schreiben?
Claude Fable 5.1 ist die beste zum Schreiben und führt Humanity's Last Exam mit 59,1 % sowie das GDPval-AA-v2-Board für professionelle Deliverables an. Claude Fable 5 ist der Tipp, wenn du menschliche Stimmen höher gewichtest: Es führt weiterhin Arena Creative Writing und LiveBench Language (90.7) an, steht auf EQ-Bench Creative Writing v3 aber inzwischen auf #8. Es kostet $10 / $50 pro 1M Tokens. Claude Sonnet 5 ist der Preis-Leistungs-Tipp und das, was die meisten tatsächlich verwenden sollten, da es kostenlos und Standard auf claude.ai bei $2 / $10 ist, einem Einführungspreis, den Anthropic im August 2026 dauerhaft gemacht hat, obwohl es auf #53 bei Arena Creative Writing rangiert. Kimi K3 steht auf EQ-Bench mit 2070.6 auf Platz vier, wenn du markante Fiktion willst, Claude Fable 5.1 führt das GDPval-AA v2 Board für professionelle Deliverables mit 1853 an, mit Claude Opus 5 als Zweitem bei 1824, GPT-5.5 ist die Alternative für faktenbasiertes Business-Schreiben, und Gemini 3.8 Flash ist der Preis-Leistungs-Tipp für Masseninhalte.
Was ist das beste Open-Weight-KI-Modell 2026?
Kimi K3 ist gerade jetzt das beste Open-Weight-Modell, und das ist es, seit Moonshot am 27. Juli 2026 die Gewichte veröffentlichte. Es hat den höchsten Intelligence Index aller open models mit 60 auf Artificial Analysis, und auf Arena ist es #3 bei WebDev und #3 auf dem Agent-Board. Der Haken ist, dass es 96 Shards und rund 1,56 TB unter einer eigenen Kimi K3 License ist, also ist GLM 5.3 Flash (26. August, MIT) jetzt das Modell, das die meisten Teams tatsächlich hosten können, bei Intelligence Index 57 mit 320B gesamt und 18B aktiven Parametern. Dritter ist DeepSeek V4-Flash 0731, das am 31. Juli von Intelligence Index 40 auf 52 sprang, ohne Größe oder Lizenz zu ändern, doch DeepSeek erhöhte seine API-Preise am 16. August um rund das Vierfache, auf $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten, was ihm den Preis-Leistungs-Tipp gekostet hat. GLM 5.3, erschienen am 14. August, ist ein anderes und größeres Modell, dessen Gewichte am 28. August doch noch kamen, allerdings unter einer eigenen GLM 5.3 License statt MIT. Zwei weitere offene Modelle schlossen den Monat ab, bisher ohne unabhängige Bewertung: Tencents Hy4 Preview am 28. August, 770B unter Apache 2.0 und das bislang größte permissiv lizenzierte Modell, und Alibabas Qwen3.8-Flash-Next am 26. August, eine Vorschau auf die Qwen4-Architektur unter der Qwen Community License 1.0. Ehrlicherweise wissenswert: Kein open model ist mehr Erster auf irgendeinem Arena-Board, das wir verfolgen.
Was ist das günstigste KI-Modell auf Frontier-Niveau?
Bei den API-Preisen pro Million Tokens ist GPT-5.6 Luna jetzt das günstigste geschlossene Modell auf Frontier-Niveau bei $0.20 / $1.20, nachdem OpenAI es am 30. Juli 2026 um 80 % gesenkt hat, und Artificial Analysis bewertet es mit Intelligence Index 52 auf seinem Index v4.1.1, gleichauf mit Gemini 3.6 Flash. Noch günstiger ist GLM 5.3 Flash, seit August unser Preis-Leistungs-Tipp, mit $0.15 / $0.50 Listenpreis und der Hälfte davon bis zum 9. September, mit 57 Punkten auf dem Intelligence Index und unter einer reinen MIT-Lizenz, die du selbst hosten kannst. DeepSeek V4-Flash 0731 hielt diesen Tipp, bis DeepSeek am 16. August um rund das Vierfache erhöhte, auf $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten. Googles eigene günstige Stufe legte am 2. September erneut nach: Gemini 3.8 Flash erreicht 59 Punkte zum selben einführenden $0.75 / $3.75, auch wenn sich dieser Tarif am 1. Januar 2027 verdoppelt. MiniMax M3 wird jetzt mit $0.30 pro Million Input-Tokens auf einem dauerhaften 50-%-Rabatt gelistet, mit LongCat-2.0 als starker MIT-Alternative. Qwen 3.7 Max bei $1.25 / $3.75 auf seiner aktuellen Promo ist der Preis-Leistungs-Tipp bei Intelligence Index 46, obwohl Luna es jetzt bei Preis und Wert unterbietet.
Welche KI-Modelle sind kostenlos?
ChatGPT Free verwendet jetzt standardmäßig GPT-5.6 (mit weiterhin verfügbarem GPT-5.5) unter Nutzungslimits. Gemini Free lässt Gemini 3.6 Flash in der Gemini-App und Google AI Studio laufen. Claude Free lässt Claude Sonnet 5 (den neuen Standard) mit täglichen Limits laufen. DeepSeek Chat lässt DeepSeek V4 kostenlos auf der DeepSeek-Website laufen. Grok hat einen begrenzten kostenlosen Consumer-Plan (X Premium ist ein bezahltes Add-on). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash und Tencents Hy4 Preview sind Open-Weight und kostenlos selbst zu hosten, wobei sich die Lizenzen unterscheiden und nur ein Teil davon reines MIT oder Apache ist. Qwen 3.7 Max ist nur API ohne Consumer-Chat-Frontend, aber Alibaba enthält jetzt 200 kostenlose Modellanfragen pro Tag. Kimi hat eine kostenlose Basis-Stufe in seiner App, mit abgerechneter intensiverer agentischer Nutzung.
Was ist Gemini Spark und welchen Plan brauchen Sie?
Gemini Spark ist Googles erster rund um die Uhr in der Cloud residierender KI-Agent, gestartet auf der Google I/O am 19. Mai 2026 und nicht mehr exklusiv für Ultra: Seit dem 30. Juli 2026 erreicht er auch die Stufe Google AI Pro zu $19.99/Monat, in den USA und in über 160 weiteren Ländern, während Google AI Ultra zu $99.99 oder $199.99/Monat den breiteren globalen Rollout trägt. Google AI Plus, die kostenlose Stufe sowie Arbeits- und Schulkonten enthalten ihn nicht. Spark ist auf Gemini-Basismodellen mit Googles Antigravity-Harness auf einer Google-Cloud-VM gebaut, integriert sich mit Gmail, Google Docs und anderen Google-Workspace-Apps und kann auf der Geräteseite mit Chrome und Androids Halo-System interagieren. Es ist die Ausgabe wert für Nutzer, die wiederholbare, langlaufende Workflows haben (Posteingangs-Triage, Recherche-Zusammenfassungen, geplante Aufgaben). Für einmalige Aufgaben deckt Claude Cowork zu $20/Monat die meisten Desktop-Agenten-Bedürfnisse ab.
Was ist Fello AI?
Fello AI ist ein KI-Chatbot für Mac, iPhone und iPad, mit dem du alle Top-KI-Modelle wie ChatGPT, Claude, Gemini, Grok und DeepSeek in einer App nutzen kannst, mit regelmäßig aktualisierten Modellen, sodass du immer die neuesten hast. Es kostet $9.99/Monat mit einer 4,7-Sterne-Bewertung über 27.000+ Rezensionen.
Wie oft aktualisiert ihr diese Seite?
Wir aktualisieren diese Seite mindestens monatlich und innerhalb von 24-48 Stunden nach jedem größeren Modellstart.
Verwandte Artikel
Claude vs. ChatGPT: Welche KI ist 2026 wirklich besser?

Claude erreichte Anfang 2026 #1 im App Store und drängte ChatGPT zum ersten Mal vom Spitzenplatz. Der Auslöser war Anthropics öffentliche Weigerung, der Forderung des Pentagons nachzukommen, seine Modelle für autonome Waffen einzusetzen.

Mehr lesen →
Grok vs. ChatGPT: Welcher KI-Chatbot ist 2026 wirklich besser?

Beide Chatbots sind gerade auf neue Flaggschiffmodelle umgestiegen. ChatGPT läuft jetzt mit GPT-5.6 (Stufen Sol, Terra, Luna) und Grok wird von Grok 4.6 angetrieben, SpaceXAIs Version vom 12. August, die sich auf dem Intelligence Index mit Sol den Wert teilt, zu einem Drittel des Preises.

Mehr lesen →
ChatGPT vs. Gemini 2026: Welche KI solltest du wirklich nutzen?

ChatGPT stieg auf GPT-5.6 als Flaggschiff um, während Gemini 3.1 Pro Googles bezahltes Flaggschiff bleibt. Direkter Vergleich über Schreiben, Programmieren, Bilder und Preis.

Mehr lesen →
Wann welche KI: das richtige Modell wählen

Es gibt keine beste KI für alles. Ordne die Aufgabe dem Modell zu, das darin führt, mit einer Tabelle für Coding, Schreiben, Recherche und Alltagschat.

Mehr lesen →
Beste KI-Agenten 2026: 30 Tools getestet

Dreißig KI-Agenten verglichen nach dem, was du wirklich tun willst: Coding, Recherche, Büroarbeit und Automatisierung, mit Preisen und Gratis-Optionen.

Mehr lesen →
Gemini Nano Banana Pro vs. GPT-Image-1.5: Ultimativer Vergleich

Unser ursprünglicher Hands-on-Vergleich vom Dezember 2025 der beiden führenden Bildgenerierungsmodelle, mit echten Output-Beispielen Seite an Seite.

Mehr lesen →

Probiere jedes Modell.
Eine schöne App.

Jedes Modell aus diesem Leitfaden in einer nativen App: ChatGPT, Claude, Gemini, Grok und DeepSeek. Kostenlos starten.

Fello AI auf Mac, iPad und iPhone

4,7 Bewertung·27.000+ Rezensionen·Kostenlos starten