Aktualisiert 23. September 2026

Beste KI-Modelle 2026

Rankings, Vergleiche und ausführliche Analysen, monatlich aktualisiert, sobald neue Modelle erscheinen.

Anthropic hat am 22. September Claude Opus 5.5 veröffentlicht, und es holt sich die Coding-Krone. Artificial Analysis misst 57,6 auf Intelligence Index v4.3.2, den höchsten je veröffentlichten Wert und 4,3 Punkte vor Claude Fable 5.1, und es führt zugleich GDPval-AA v2.1, AA-Briefcase v1.1 und Humanity's Last Exam an. Das gelingt zu $4 / $20 pro 1M Tokens, unter Claude Opus 5 mit $5 / $25: Das beste Modell ist jetzt auch das günstigere.

OpenAI hat rund neunzig Minuten später mit GPT-6 Sol und GPT-6 Luna geantwortet und dabei seine API-Preise halbiert: Sol kostet $2 / $10 pro 1M Tokens und Luna $0,10 / $0,50, und im Chatfenster von ChatGPT ist bisher keines von beiden. GPT-6 Astra behält beide Coding-Boards der Arena, weil Opus 5.5 dort noch keine Stimmen hat, und Claude Fable 5.1 behält Schreiben und Genauigkeit auf genau den Boards, nach denen diese Kategorien entschieden werden. Diese Seite bewertet nach gemessenen Werten, eine Krone wandert also, sobald ein Modell den Titelhalter schlägt, ohne auf die abstimmungsbasierten Boards zu warten. Unser Leitfaden zu KI-Benchmarks erklärt, wie dieser Index gebaut ist und warum seine Versionsnummer zählt.

SpaceXAI hat Grok 4.7 am 21. September auf einem neuen, größeren Basismodell veröffentlicht, und er liegt auf beiden agentischen Boards von Artificial Analysis über Astra. Der Intelligence Index zeigt 46,3 gegen 44,3 für Grok 4.6, und der Tokenpreis bewegt sich nicht, $2 / $6, doch eine Index-Aufgabe kostet $2,73 gegen $1,86, weil 4.7 rund doppelt so viel Ausgabe erzeugt. Gestartet ist er in der API, in Cursor und in Grok Build; die Grok-App liefert weiterhin 4.6.

Auch das offene Feld hat einen neuen Spitzenreiter: Xiaomis MiMo-V2.6-Pro, am 21. September unter schlichtem MIT veröffentlicht, erreicht 46,3 und erledigt eine Index-Aufgabe für $0,13, das Günstigste unter den offenen Modellen auf dieser Seite. Unten stehen die Kategoriesieger für September 2026. Klicken Sie auf eine Karte, um direkt zur vollständigen Analyse zu springen, oder nutzen Sie die klebende Navigation, um zwischen Kategorien zu wechseln. Rankings, Benchmarks und Preise aktualisieren wir innerhalb von 48 Stunden nach jedem größeren Modellstart.

Kategoriesieger September 2026
Schreiben
Claude Fable 5.1
#2 EQ-Bench Creative Writing und #2 LiveBench Language
Das einzige Modell, das auf allen drei Text-Boards in den Top sechs steht. Bestes Preis-Leistungs-Verhältnis: Claude Sonnet 5, kostenlos auf claude.ai.
Ausführliche Analyse →
Chat & täglicher Assistent
GPT-5.6
ChatGPT-Standard seit 9. Juli
Der beste Assistent, den die meisten Menschen tatsächlich öffnen können, mit einer Balance aus Leistung, Tempo und Reichweite.
Ausführliche Analyse →
Bilder
ChatGPT Images 2.5
#1 und #2 auf allen vier Bild-Boards, die wir verfolgen
Seine beiden Modelle belegen auf jedem Bild-Board, das wir verfolgen, die ersten beiden Plätze, bei Arena wie bei Artificial Analysis, und es ist der Standard in jedem ChatGPT-Tarif, auch im kostenlosen. Bester Wert: Flare, das schnellere der beiden, zum selben Tokenpreis wie GPT Image 2.
Ausführliche Analyse →
Video
Gemini Omni 1.1 Flash
#1 Arena Text-to-Video (1516), 40-Sekunden-Szenen
Googles neuestes Videomodell: Szenenverlängerung auf 40 Sekunden, 4K-Ausgabe, ab $0.03 pro Sekunde.
Ausführliche Analyse →
Programmieren
Claude Opus 5.5
#1 Terminal-Bench 4.0 (59,6 %) und #1 Intelligence Index (57,6)
Anthropics Flaggschiff vom 22. September führt den Terminal-Bench-4.0-Lauf von Artificial Analysis und beide Coding-Boards von LiveBench an, bei $4 / $20 gegen $10 / $50 für GPT-6 Astra. Astra behält beide Coding-Boards der Arena, für die es noch keine Stimmen für Opus 5.5 gibt.
Ausführliche Analyse →
Kreativität
Grok 4.7
Wenigste Inhaltsbeschränkungen + natives Echtzeit-X
Der Tipp für kantige, angesagte Arbeit: die wenigsten Leitplanken und native X-Integration. Grok 4.7 läuft in der API, in Cursor und in Grok Build; die Grok-App für $30 im Monat liefert weiterhin 4.6.
Ausführliche Analyse →
Genauigkeit & Recherche
Claude Fable 5.1
Höchste faktische Genauigkeit, die Artificial Analysis gemessen hat (67 %)
Führt die Boards an, die messen, wie oft ein Modell schlicht falsch liegt. Bestes Preis-Leistungs-Verhältnis: Gemini 3.1 Pro bei $0,52 pro Aufgabe mit Google-Search-Grounding.
Ausführliche Analyse →
Problemlösung
GPT-6 Astra
#1 LiveBench Reasoning (92,65) und #1 ARC-AGI-2 (95 %)
Hat GPT-5.6 Sol die schwersten Reasoning-Boards wenige Tage nach dem Start abgenommen. Bestes Preis-Leistungs-Verhältnis: GPT-6 Sol zu $2 / $10, das GPT-5.6 Sol auf dem Intelligence Index zum halben Preis übertrifft.
Ausführliche Analyse →
KI-Agenten
Gemini Spark
Erster rund um die Uhr in der Cloud laufender KI-Agent
Läuft durchgehend in einer Google-Cloud-VM, tief integriert mit Gmail, Docs und Chrome.
Ausführliche Analyse →

Willst du die besten KI-Modelle, ohne mit separaten Abos zu jonglieren? Fello AI vereint die führenden Modelle in einer nativen App für Mac, iPhone und iPad.

Fello AI laden
Was im September 2026 neu ist
22. Sep. OpenAI GPT-6 Sol und GPT-6 Luna halbieren OpenAIs API-Preise und landen überall außer im Chatfenster von ChatGPT Neu
OpenAI hat GPT-6 Sol und GPT-6 Luna am 22. September 2026 veröffentlicht, rund neunzig Minuten nachdem Anthropic Claude Opus 5.5 ausgeliefert hatte, und der Start ist ein Argument über Kosten pro Aufgabe, nicht über die Spitze des Boards. Sol fällt von $4 / $20 auf $2 / $10 pro 1M Tokens und Luna von $0,20 / $1,20 auf $0,10 / $0,50, Lesezugriffe aus dem Cache sind um 90 % rabattiert, auf $0,20 und $0,01. OpenAI bezeichnet beide Senkungen als 50 %, doch Lunas Ausgabe sinkt um 58,3 %, und verglichen wird mit den Aktionspreisen von GPT-5.6, nicht mit der Liste. Zwei Sprecher und Tibo Sottiaux von OpenAI sagen übereinstimmend, die neuen Sätze seien dauerhaft. Wo man sie nutzen kann, ist der Teil, den jede Zusammenfassung eingeebnet hat: Die Modelle stecken in ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu, Free- und Go-Nutzer erreichen Luna in der Desktop-App, und OpenAI schreibt klar, sie seien „not yet available in Chat“. Unabhängig davon misst Artificial Analysis Sol mit 47,5 auf Intelligence Index v4.3.2 bei maximalem Aufwand gegen 47,0 für GPT-5.6 Sol, zu $1,06 pro Index-Aufgabe gegen $1,99, mit 43,9 % auf Terminal-Bench 4.0 gegen 39,9 % und einer Halluzinationsrate, die von 92 % auf 60 % fällt. Luna liegt mit 37,3 gleichauf mit GPT-5.6 Luna, erledigt eine Index-Aufgabe aber für $0,07 gegen $0,18, womit es das günstigste Modell pro Index-Aufgabe auf dieser Seite ist. ARC Prize hat Luna bewertet, 59,3 % auf ARC-AGI-2 gegen 59,5 % für den 5.6er-Build, und zu Sol nichts veröffentlicht. OpenAIs eigene Evaluationen sind durchweg Kostenargumente: Auf AutomationBench 1.0.6 nimmt Sol bei xhigh-Aufwand 33,2 % zu $0,27 pro Aufgabe, und die nächstliegende Konkurrenzzeile ist Claude Fable 5.1 mit Opus-5-Fallback bei 31,4 %, der echte Vorsprung beträgt also 1,8 Punkte statt der 6,3, die die Zeile zu Claude Opus 5 nahelegt. OpenAI sagt, Sol mache etwa halb so viele Fehler wie GPT-5.6 Sol, „approaching Astra-level reliability at much lower cost“, und wiederholt, dass Astra insgesamt weiterhin sein bestes Modell ist. Eine Krone bewegt sich dadurch nicht: Sol und Luna sind günstiger, nicht besser. Ein GPT-6 Terra gibt es nicht, und OpenAI hat nicht gesagt, ob eines geplant ist. Alle Details in unserer Analyse zu GPT-6 Sol und Luna.
22. Sep. Anthropic Claude Opus 5.5 holt sich den Intelligence Index mit 57,6 und unterbietet Opus 5 im Preis Neu
Anthropic hat Claude Opus 5.5 am 22. September 2026 veröffentlicht, das erste Modell einer neuen Claude-5.5-Familie, und es ist die größte Bewegung an einem einzigen Tag, die diese Seite verzeichnet hat. Artificial Analysis misst es mit 57,6 auf Intelligence Index v4.3.2, 4,3 Punkte über Claude Fable 5.1 und der höchste Wert, den sie je für ein Modell veröffentlicht hat, und es nimmt GDPval-AA v2.1 mit 1846 gegen 1735 für Fable 5.1, AA-Briefcase v1.1 mit 1822 gegen 1678, Humanity's Last Exam mit 61,4 % gegen 59,1 % sowie den eigenen Terminal-Bench-4.0-Lauf von Artificial Analysis mit 59,6 % gegen 59,1 % für GPT-6 Astra gleich mit. Der Preis sinkt, statt zu steigen: $4 / $20 pro 1M Tokens gegen $5 / $25 für Opus 5, Cache-Lesen 60 % günstiger bei $0,20 und Cache-Schreiben bei $5, wobei Anthropics eigene Tests eine typische Arbeitslast 40 % günstiger als auf Opus 5 und die Ausgabe über 30 % schneller sehen. Ein schneller Modus in Claude Code und auf der Claude-Plattform verdoppelt den Preis für bis zu 2,5-fache Geschwindigkeit. Auf Anthropics eigenem Harness ist der Coding-Abstand noch größer, 66,4 % auf Terminal-Bench 4.0 gegen die 57,9 %, die OpenAI für Astra angibt, dazu 54,4 % auf FrontierCode v1.1 und 57,8 % auf CursorBench 4.0. Zwei Dinge gewinnt es nicht: Zapiers AutomationBench, wo Astra 41,4 % zu seinen 40,0 % erreicht, und Terminal-Bench-Science 0.1, wo Astra 64,6 % zu seinen 58,7 % erreicht. Lesen Sie die Abstände mit dem Vorbehalt, den Anthropic selbst abdruckt, dass das Modell „performs at the level of Claude Fable 5.1 on most work“ und dass „benchmark margins have become a less reliable guide to real-world differences“. Es ist allgemein verfügbar auf der Claude-Plattform als claude-opus-5-5 sowie auf AWS, Google Cloud und Microsoft Azure, die Fünf-Stunden-Limits steigen in Pro, Max und Team, und Claude Sonnet 5.5 und Claude Haiku 5.5 folgen in den kommenden Wochen. Da es in Biologie und Cybersicherheit an Claude Mythos 5.1 heranreicht, erscheint es mit den Schutzmaßnahmen von Fable 5.1 und einem neuen Life Sciences Verification Program für geprüfte Labore. Kein Arena-Board hat es bisher bewertet. Alle Details in unserer Analyse zu Claude Opus 5.5.
21. Sep. SpaceXAI Grok 4.7 kommt auf einem größeren Basismodell zu unveränderten $2 / $6 und kostet 47 % mehr pro Aufgabe Neu
SpaceXAI hat Grok 4.7 am 21. September 2026 als sein leistungsfähigstes Modell für Programmierung und Wissensarbeit veröffentlicht. Es nutzt ein neues, größeres Basismodell als Grok 4.6, mit einem längeren Reinforcement-Learning-Lauf, der auf Aufgaben mit vielen Stunden Dauer gewichtet ist, und wurde darauf trainiert, den Grok-Bot-Harness nativ zu verstehen. Eine Parameterzahl veröffentlicht das Unternehmen nicht. Nach eigenen Zahlen erreicht es 46,3 % auf CursorBench 4.0 gegen 40,4 % für Grok 4.6 und 41,7 % für GPT-5.6 Sol, 71,0 % auf DeepSWE v1.1 bei hohem Aufwand, 64,0 % auf EEBench, 38,0 % auf Terminal-Bench 4.0, 19,6 % auf dem Harvey-Rechtsagenten-Benchmark und 56,7 % auf HealthBench Professional. Unabhängig davon setzt Artificial Analysis es auf 46,3 im Intelligence Index v4.3.2 bei hohem Aufwand gegen 44,3 für Grok 4.6 sowie auf 1695 bei GDPval-AA v2.1 und 1657 bei AA-Briefcase v1.1, beides über GPT-6 Astras 1542 und 1569. Der Preis bewegt sich nicht, $2 / $6 pro 1M Tokens, wobei ab 200.000 Prompt-Tokens die gesamte Anfrage mit $4 / $12 neu berechnet wird, und eine schnelle Variante läuft mit doppelter Ausgabegeschwindigkeit zum doppelten Preis. Was sich bewegt, sind die Kosten pro Aufgabe: $2,73 gegen $1,86 bei Grok 4.6, weil 4.7 für dasselbe Ergebnis rund doppelt so viele Ausgabetokens erzeugt, und xhigh bringt in keiner der beiden Generationen zusätzliche Indexpunkte. Zur Sicherheit meldet SpaceXAI die stärkste getestete Verweigerungs- und Jailbreak-Resistenz, 62,4 % auf LatchBios Biosicherheits-Benchmark und 3,3 % durchgelassene riskante Dual-Use-Prompts auf dem eigenen HackerBench v0.3. Die Verfügbarkeit ist entwicklerseitig: Grok-API, Cursor, Grok Build, fremde Coding-Harnesses und Cloud-Router. Die Ankündigung sagt nichts über die Endkunden-App Grok, die weiterhin Grok 4.6 ausliefert. Alle Details in unserer Analyse zu Grok 4.7.
21. Sep. Xiaomi Xiaomis MiMo-V2.6-Pro ist das am höchsten bewertete offene Modell überhaupt, zu $0,13 pro Index-Aufgabe unter MIT Neu
Xiaomi hat MiMo-V2.6-Pro am 21. September 2026 unter schlichtem MIT veröffentlicht, die Gewichte lagen noch am selben Tag auf Hugging Face unter XiaomiMiMo/MiMo-V2.6-Pro-RL. Es ist ein Mixture-of-Experts mit 1,02 Billionen Parametern, davon 42 Milliarden aktiv, und 1M Tokens Kontext. Artificial Analysis misst es, statt es zu schätzen, mit 46,3 auf Intelligence Index v4.3.2, der höchste offene Wert, den sie je veröffentlicht hat: über GLM-5.3 mit 44,8, über Kimi K3 mit 43,6 und gleichauf mit SpaceXAIs brandneuem Grok 4.7. Die andere Hälfte der Geschichte sind die Kosten. Es erledigt eine Intelligence-Index-Aufgabe für $0,13 bei $0,435 / $0,87 pro 1M Tokens, günstiger pro Aufgabe als jedes andere offene Modell auf dieser Seite, rund die Hälfte von GLM 5.3 Flash bei viereinhalb Punkten mehr. Es nimmt außerdem 34,8 % auf Terminal-Bench 4.0, 1673 auf GDPval-AA v2.1, 49,4 % auf Humanity's Last Exam und 86,3 % auf AA-LCR, womit es Kimi K3 auf dreien dieser vier schlägt. Zwei Grenzen gehören klar gesagt. Kein Arena-Board hat es bewertet, es gibt also überhaupt keinen Beleg zur menschlichen Präferenz, und es ist vier Tage alt, hat also außerhalb von Artificial Analysis keine unabhängige Historie. Und 1,02 Billionen Parameter sind ein Cluster, keine Workstation, weshalb GLM 5.3 Flash unsere Empfehlung für Teams bleibt, die wirklich selbst hosten wollen. Die Open-Weight-Krone auf dieser Seite übernimmt es über gemessenen Wert und Kosten.
15. Sep. TypeSafe TypeSafe verlässt den Stealth-Modus mit Jev, einem Modell, das statt Text typisierte Entscheidungen liefert, für $0.042 pro 1M Tokens Neu
TypeSafe AI ist am 15. September 2026 nach zwei Jahren im Stealth-Modus an die Öffentlichkeit gegangen, mit 40 Millionen Dollar Seed-Finanzierung unter Führung von DCVC und einem Modell, das überhaupt keinen Text erzeugt. Jev ist das erste von dem, was das Unternehmen System-One-Modelle nennt: Sie schicken einen Zustandsblock und eine fest definierte Menge typisierter Fragen, und das Modell beantwortet alle in einem parallelen Durchlauf und liefert statt eines Satzes eine Auswahl, einen Score oder eine Ja-Nein-Wahrscheinlichkeit. Da der Antwortraum vor dem Aufruf feststeht, kann es kein fehlerhaft geformtes Ergebnis zurückgeben, und daher stammt die Aussage im Ankündigungsbeitrag, Jev könne nicht halluzinieren. Die falsche Option kann es trotzdem wählen, und die eigene Dokumentation von TypeSafe schreibt, dass Kalibrierung die Richtigkeit einer einzelnen Antwort nicht garantiert. Der Preis liegt bei $42 pro Milliarde Eingabetokens, also $0.042 pro 1M, Ausgabe kostenlos, bei 64k Kontext und reiner Texteingabe. Die Leistungsangaben brauchen Sorgfalt, denn das Unternehmen hat in drei Tagen vier verschiedene veröffentlicht: von unter 100 Millisekunden und bis zu 100x schneller in der Pressemitteilung bis zu 193.6x schneller und 444.6x günstiger auf der Startseite, jeweils gegen einen anderen Rivalen gemessen, wobei die eigene Fußnote die großen Zahlen als oberes Ende realer Gewinne bezeichnet. Das Workflow-Eval misst gegen den Durchschnitt von GPT-6 Astra und Fable 5.1 statt gegen eine belastbare Wahrheit, und öffentliche Benchmark-Werte veröffentlicht die Firma bewusst gar nicht. Zwei unabhängige Tests vom 18. September maßen rund 6x geringere Kosten und 8x mehr Tempo gegenüber einem günstigen Modell mit abgeschaltetem Reasoning, und die Kalibrierung hielt. Nichts davon verschiebt eine Wahl auf dieser Seite: Jev hat keine Verbraucheroberfläche und ist Early Access mit Warteliste. Alle Details in unserer Erklärung der System-One-Modelle.
10. Sep. DeepSeek DeepSeek stellt V4-Flash ein, ersetzt es durch V4.1-Flash und senkt den Flash-Tarif um rund ein Drittel Neu
DeepSeek hat DeepSeek-V4-Flash am 10. September 2026 eingestellt und DeepSeek-V4.1-Flash an seine Stelle gesetzt. Der Modellname lautet jetzt deepseek-flash; die alten Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp lösen weiterhin auf, die Modelle dahinter sind aber eingestellt, und die Anfragen bedient V4.1-Flash zum Flash-Preis. Dieser Preis liegt rund ein Drittel niedriger: $0.15 / $0.60 pro 1M Tokens außerhalb der Stoßzeiten und $0.30 / $1.20 zu Stoßzeiten, gegen $0.22 / $0.66 und $0.44 / $1.32 beim abgelösten Stand, mit Cache-Treffern zu $0.003 außerhalb der Stoßzeiten. Die Stoßzeitfenster bleiben unverändert, 01:00 bis 04:00 und 06:00 bis 10:00 UTC an Werktagen, jede andere Stunde zum halben Preis. V4-Pro bleibt unangetastet bei $0.66 / $1.98 außerhalb der Stoßzeiten, und DeepSeek hat angekündigt, es über das Abschaltdatum 14. September hinaus weiter anzubieten. Das neue Modell ist ein Mixture-of-Experts mit 552 Milliarden Parametern auf einem Causal-Encoder-Decoder-Design, das beim Prefill 8 Milliarden und beim Decode 16 Milliarden Parameter aktiviert, ein 1M-Token-Kontextfenster mitbringt, Bilder nativ liest und noch am selben Tag unter MIT auf Hugging Face erschien. Artificial Analysis bewertet es mit 39,5 auf dem Intelligence Index v4.3 gegen 34,5 für den abgelösten Stand V4-Flash 0731, bei $0.27 pro Index-Aufgabe. Den Preis-Leistungs-Tipp holt es sich damit nicht zurück: GLM 5.3 Flash steht bei 41,9 für $0.25 pro Aufgabe. Alle Details in unserem DeepSeek-Preisratgeber.
3. Sep. OpenAI GPT-6 Astra startet für $10 / $50 und ist binnen eines Tages auf Plus und Pro und führt die Coding-Boards an Neu
OpenAI hat GPT-6 Astra am 3. September 2026 gestartet und damit den Streit beendet, der das ganze Jahr lief: Das ist GPT-6 und kein weiteres Point-Release der GPT-5-Reihe. Firmenpräsident Greg Brockman sagte bei einem Pressebriefing „Willkommen in der AGI-Ära.“ Die unabhängigen Zahlen fallen nüchterner aus als die Rahmung. Artificial Analysis gibt Astra 61 auf dem Intelligence Index v4.1.1 bei max, exakt gleichauf mit GPT-5.6 Sol, fünf Punkte hinter Claude Fable 5.1 mit 66 und zwei hinter Claude Opus 5 mit 63, und es kostet $10 / $50 pro 1M Tokens gegen die $4 / $20 von Sol, was pro Index-Aufgabe 75 % teurer ist als das Modell, das es ablöst. Das stärkere Ergebnis liefert der Coding Agent Index: Astra kommt in Codex auf 67, gleichauf mit Claude Opus 5 und Claude Fable 5 in Claude Code und hinter den 70 von Claude Fable 5.1, und erreicht das mit einem Drittel der Tokens von Sol und einem Fünftel derer von Opus 5, was es auf die Kosteneffizienz-Grenze bringt. Auf AA-Omniscience halbiert es zudem die Halluzinationsrate, von 92 % auf 51 % bei max, und gewinnt dabei vier Punkte Genauigkeit, legt rund 80 Elo auf AA-Briefcase zu und sechs Punkte auf Humanity's Last Exam. Dagegen verliert es etwa 80 Elo auf GDPval-AA v2 und fällt bei Kundensupport, SciCode und Long-Context-Reasoning um zwei bis drei Punkte zurück. Zwei Vorbehalte gehören zu den Launch-Zahlen: Die 98,6 % auf ARC-AGI-3 sind keine Lösungsquote, sondern ein Effizienzwert für Aktionen gegen eine menschliche Referenz, gemessen auf einem Harness, von dem OpenAI selbst gezeigt hat, dass es das Ergebnis verdreifachen kann, und Epoch AI legt offen, dass OpenAI FrontierMath finanziert hat und exklusiven Zugang zu einem Teil davon hält. Die eigentliche Hürde ist die Verfügbarkeit. Astra ist das erste Modell, das OpenAI in seinem Preparedness Framework bei Cybersicherheit als kritisch eingestuft hat, deshalb bekamen es zugelassene Verteidiger im Daybreak-Programm zuerst. ChatGPT Business und Pro folgten am 4. September und Plus wenige Stunden später, während die API, AWS, Azure und die Gratis-Stufe noch ausstehen. Artificial Analysis hat den Coding Agent Index inzwischen eingestellt, und im eigenen Terminal-Bench-4.0-Lauf führt Astra nun klar, 60 % gegen die 55 % von Claude Fable 5.1, was die Coding-Krone auf dieser Seite zu Astra bewegt hat. Alle Details in unserer GPT-6-Astra-Analyse.
2. Sep. Alibaba Qwen3.8-Max-0902 nimmt Claude Opus 5 Arenas WebDev-Board um drei Punkte ab, für $2 / $6 Neu
Alibaba brachte am 2. September 2026 Qwen3.8-Max-0902, und die Benennung ist das Erste, was man richtig verstehen muss: Dies ist eine Post-Training-Auffrischung des am 3. August erschienenen Qwen3.8-Max, keine neue Version, mit denselben 2,4 Billionen Parametern und demselben 1M-Token-Kontextfenster. Qwen gibt an, es sei zusätzlich auf Coding und Cowork-artige Arbeit nachtrainiert worden. Wichtig ist das Board, das es bewegt hat. Arena meldete am selben Tag, dass Qwen3.8-Max-0902 mit 1691 Punkten insgesamt auf #1 der Code Arena: WebDev debütierte, drei Punkte vor Claude Opus 5 (Max), siebzehn vor Kimi K3 (Max) und zweiundzwanzig vor dem bisherigen Qwen3.8-Max, dazu #1 in den Kategorien Data & Analytics und Consumer Product. Es ist das erste Mal in diesem Jahr, dass ein Anthropic-Modell von der Spitze eines abstimmungsbasierten Coding-Boards verdrängt wurde. Der Preis liegt bei $2 / $6 pro 1M Tokens mit Cache-Hits zu $0.17 explizit und $0.25 implizit, was Arena als gemischte $5 pro Million und beste Position auf ihrer Pareto-Front verbucht. Lies das mit drei Vorbehalten. Drei Punkte liegen auf einem abstimmungsbasierten Board im Rauschen, Artificial Analysis hatte für den 0902-Snapshot damals keinen Intelligence Index veröffentlicht und bewertet ihn inzwischen mit 45,4 auf v4.3, und dies ist ein gehostetes Modell auf QwenCloud ohne Consumer-Chat-Oberfläche: Die offenen Gewichte, die Alibaba im August für Qwen3.8-Max versprach, sind weiterhin nicht erschienen, also ändert sich unser Open-Weight-Tipp dadurch nicht. Arena sagt, Agent-Arena-Werte stünden noch aus. Qwen3.8-Max-0902 ist inzwischen auf WebDev auf den vierten Platz zurückgefallen, hinter GPT-6 Astra, Claude Fable 5.1 und Claude Opus 5, und die Coding-Kategorie ist an Astra gegangen. Alle Details in unserer Analyse zu Qwen 3.8.
2. Sep. Meta Muse Spark 1.3, Intelligence Index von 57 auf 61 bei unveränderten $1.25 / $4.25, gewinnt beim Coding und verliert jede Agenten-Zeile Neu
Meta veröffentlichte Muse Spark 1.3 am 2. September 2026, das vierte Muse-Spark-Modell in fünf Monaten, in Muse Code und der Meta Model API. Artificial Analysis bewertet es mit 61 auf dem Intelligence Index v4.1.1, gegenüber 57 für 1.2 und 53 für 1.1, also acht Punkte in zwei Monaten und der schnellste Anstieg, den auf dieser Seite irgendjemand hinlegt. Der Preis hat sich überhaupt nicht bewegt: $1.25 / $4.25 pro 1M Tokens auf einem Kontextfenster von 1M Tokens, mit der Contributor-Stufe weiterhin bei $0.10 / $0.20 im Gegenzug dafür, dass Meta auf deinen Prompts und Completions trainieren darf. Zwei Dinge an diesem Start muss man genau lesen. Auf Metas eigener Scorecard gewinnt das Modell jede Coding-Zeile, DeepSWE v1.1 mit 75,4 gegen die 74,0 von Claude Opus 5 und SWEAtlas CodeBase QnA mit 59,4, es zieht bei Terminal-Bench 2.1 mit GPT-5.6 Sol bei 88,8 gleich und nimmt beide MRCR-Long-Context-Bänder mit deutlichem Abstand, 98,1 im Band von 512K bis 1M gegen 55,5 für 1.2. Es verliert aber auch alle sechs Zeilen, die Meta unter Agent führt, vier an Opus 5 und zwei an GPT-5.6 Sol, und diese Hälfte des Charts wurde kaum berichtet. Der zweite Haken ist, welches Modell gemessen wurde: Die Benchmark-Spalte ist Muse Spark 1.3 (max), eine Limited Preview für Metas Partner mit 62 Punkten, während die Version, die heute jeder aufrufen kann, xhigh mit 61 ist, und Meta ließ die Vergleichsspalte für 1.2 auf xhigh statt auf max laufen. Meta brachte es zuerst zu Entwicklern, über Muse Code und die Meta Model API, und kündigte an, ein Rollout zu Facebook, Instagram und der Meta-AI-App werde in den kommenden Tagen folgen, und das Open-Weights-Versprechen verschob sich erneut: Aus der Zusage vom August, die Gewichte von Muse Spark 1.2 zu veröffentlichen, wurde ein undatierter Satz über bald kommende offene Gewichte. Alle Details in unserer Muse Spark 1.3 Analyse.
2. Sep. Google Gemini 3.8 Flash, drei Punkte mehr auf dem Intelligence Index zum selben $0.75 / $3.75 Neu
Google hat Gemini 3.8 Flash am 2. September 2026 allgemein verfügbar gemacht, drei Wochen nach 3.7 Flash und als dritter Flash-Release in 43 Tagen. Alle Spezifikationen bleiben unverändert: 1M Eingabekontext, ein Ausgabelimit von 64K, Wissensstand März 2026, dieselbe Modalitätsliste und dieselben einführenden $0.75 / $3.75 pro 1M Tokens, die sich am 1. Januar 2027 auf $1.50 / $7.50 verdoppeln. Bewegt haben sich nur die Werte, und zwar in jeder veröffentlichten Zeile. DeepSWE v1.1 steigt von 65,3 % auf 73,7 %, Terminal-bench 2.1 von 85,8 % auf 89,4 %, Terminal-bench 4.0 von 11,2 % auf 19,1 % und BioMysteryBench Human Difficult von 43,5 % auf 56,5 %. Artificial Analysis gibt ihm 59 auf dem Intelligence Index v4.1.1 gegenüber 56 für 3.7 Flash und misst 304,6 Ausgabe-Tokens pro Sekunde gegenüber 279,4, bei einer langsamen Zeit bis zum ersten Token von 13,39 Sekunden, was es eher zu einem Batch- und Agentenmodell macht als zu einem für interaktiven Chat. Lies die Siege zusammen mit den Niederlagen: Googles eigene Vergleichstabelle gibt 3.8 Flash 8 von 14 Zeilen, und Claude Opus 5 gewinnt weiterhin Terminal-bench 4.0 mit 51,8 % gegen 19,1 %, OSWorld-2.0 mit 75,4 % gegen 59,0 % und GDPVal-AA v2 mit 1824 gegen 1545 Elo. Die DeepSWE-Zahl, die ein Großteil der Launch-Berichterstattung übernommen hat, 71,0 %, steht so nicht in Googles PDF; dort sind es 73,7 % gegen 74,0 % für Opus 5. Der Entwicklerzugang war zur Ankündigung live, über die Gemini API, AI Studio, Antigravity und die Gemini Enterprise Agent Platform. Der Verbraucherzugang wird für Abonnenten von Google AI Pro und Ultra berichtet, doch die Release Notes der Gemini-Apps führen dazu noch keinen Eintrag, und die kostenlose Gemini-Stufe läuft weiterhin auf 3.6 Flash. Alle Details in unserer Analyse zu Gemini 3.8 Flash.
1. Sep. Anthropic Claude Fable 5.1 und Mythos 5.1, eine neue #1 auf Artificial Analysis mit 66 und 75 % weniger für Cache-Reads Neu
Anthropic veröffentlichte Claude Fable 5.1 und Claude Mythos 5.1 am 1. September 2026, und es sind ein Modell in zwei Safeguard-Konfigurationen statt zwei Modelle. Fable 5.1 ist allgemein verfügbar; Mythos 5.1 lockert die Beschränkungen in Biologie und Cybersicherheit und wird auf Einladung vergeben, ohne veröffentlichte Kriterien. Artificial Analysis bewertet Fable 5.1 mit 66 auf seinem Intelligence Index v4.1.1 bei max Effort, dem höchsten Wert, den es je gemessen hat, vor Claude Opus 5 mit 63, Claude Fable 5 mit 62 sowie GPT-5.6 Sol und Grok 4.6 mit 61. Es holte sich damals außerdem den Agentic Index mit 61 gegen die 59 von Opus 5, das GDPval-AA v2 Board für professionelle Deliverables mit 1853 gegen 1824 und Humanity's Last Exam mit 59,1 % gegen die 55,5 % von Fable 5. Die Effort-Einstellung zählt hier mehr als sonst: Dasselbe Modell liest 58 bei low, 60 bei medium, 62 bei high und 65 bei xhigh, und diese Einstellungen spannen einen elffachen Unterschied bei den Output-Tokens auf, von 13,1 Millionen bis 143,7 Millionen über die gesamte Suite. Die Preise bleiben unverändert bei $10 / $50 pro 1M Tokens, aber Cache-Reads fallen um 75 % auf $0.25 von den $1.00 bei Fable 5, und genau dort liegt bei langen agentischen Läufen die eigentliche Ersparnis. Nach Anthropics eigenen Zahlen erreicht es 52,6 % auf Terminal-Bench-Science 0.1 gegen die 29,0 % von Opus 5, und die 212-seitige System Card hob die eigene Alignment-Risikoeinschätzung des Unternehmens von sehr niedrig auf niedrig. Zwei Dinge vor dem Wechsel: Anthropic rät weiterhin, für die meisten Workloads mit Opus 5 zum halben Preis zu beginnen, und zum Start hatte kein Arena-Board Stimmen für eines der beiden Modelle. Fable 5.1 ist inzwischen bewertet: Es ist auf beiden Coding-Boards der Arena Zweiter und auf dem Text-Board Fünfter. Alle Details in unserer Aufschlüsselung zu Claude Fable 5.1 und Mythos 5.1.
28. Aug. Z.ai GLM-5.3-Gewichte sind nach der Sicherheitspause da, aber die Lizenz ist nicht MIT Neu
Z.ai veröffentlichte die GLM-5.3-Gewichte am 28. August 2026 auf Hugging Face, zwei Wochen nach dem API-Start und genau zu dem Datum, das der Platzhalter trug. Die zugesagte Sicherheitsbewertung hat also tatsächlich stattgefunden, und die Pause ist abgeschlossen statt offen. Geändert hat sich die Lizenz. GLM 5.3 Flash war zwei Tage zuvor unter reinem MIT erschienen; das Flaggschiff trägt ein eigenes Dokument mit dem Titel GLM 5.3 License, und das Lizenzfeld der Modellkarte lautet glm-5.3 statt mit. Die Rechteeinräumung selbst folgt MIT eng, mit dem Recht, das Modell auszuführen, bereitzustellen, nachzutrainieren, zu verändern, zu verbreiten und zu verkaufen, und mit Gewichten, die ausdrücklich in die Definition der Software aufgenommen sind, sodass die kommerzielle Nutzung fast allen offensteht. Eine Klausel ist wirklich neu: Ein Model-as-a-Service-Betreiber, dessen Umsatz in zwölf aufeinanderfolgenden Monaten 10 Milliarden Dollar übersteigt, muss vor dem kommerziellen Einsatz eine Sicherheitsprüfung von Z.ai bestehen, wobei Z.ai sich vorbehält, Umfang und Methode dieser Prüfung selbst zu bestimmen. Beachte außerdem, dass Hugging Face den veröffentlichten Checkpoint mit 753B Parametern zählt, gegenüber der 744B-Basis, die Z.ai mit GLM-5.2 zu teilen angibt; das ist die Art Abweichung, die eine mechanische Parameterzählung erzeugt, und kein Beleg für ein anderes Modell. Unseren Open-Weight-Tipp verschiebt das nicht. GLM 5.3 Flash bleibt das Modell, das wir hosten würden, denn 320B unter reinem MIT lässt sich deutlich leichter betreiben und rechtlich klären als 753B unter einer eigenen Lizenz. Alle Details in unserer GLM-5.3-Aufschlüsselung.
28. Aug. Tencent Tencent Hy4 Preview, 770B offene Gewichte unter Apache 2.0 und das bislang größte permissiv lizenzierte Modell Neu
Tencent veröffentlichte und öffnete Hy4 preview am 28. August 2026, das neue Flaggschiff seiner Hunyuan-Reihe und das größte Modell, das jemals unter Apache 2.0 erschienen ist. Es läuft mit 770 Milliarden Parametern insgesamt und 49 Milliarden aktiven pro Token in einem Mixture-of-Experts-Design, verarbeitet ein Kontextfenster, das Tencent als über 1M Tokens hinausgehend beschreibt, und erscheint neben den Gewichten in voller Präzision auch als FP8-Build. Die API-Preise liegen bei $0.834 pro 1M Input-Tokens, $2.501 für Output und $0.042 für zwischengespeicherten Input, was für diese Größe günstig ist. Die eigentliche Nachricht ist die Lizenz: Apache 2.0 ist permissiver als das eigene Dokument von Kimi K3 und als die Lizenz, die Z.ai am selben Tag an GLM 5.3 gehängt hat. Behandle die Qualitätsaussage mit Vorsicht, denn der einzige bisherige Beleg stammt vom Hersteller. Tencent führte eine interne Blindbewertung von 203 Engineering-Aufgaben durch, die von 163 Fachleuten bewertet wurden, und Hy4 preview erreicht dort 2,99 von 4,00 gegen 2,94 für Kimi K3 und 2,92 für GLM 5.3. Das ist Tencents eigenes Panel, die Abstände liegen innerhalb eines Zehntelpunkts, und kein unabhängiges Haus hatte damals einen Intelligence Index oder eine Arena-Bewertung dafür veröffentlicht. Die Arena führt es inzwischen auf Platz elf bei WebDev mit 1624, einen Intelligence Index von Artificial Analysis gibt es weiterhin nicht, also führen wir es auf, statt es einzuordnen. Tencent gibt außerdem an, das Modell habe geholfen, die Optimierung seiner eigenen Trainingspipeline zu automatisieren, und seinen eigenen Inferenzdurchsatz um gemessene 31,8 % gesteigert. Es ist als offene Gewichte verfügbar sowie über WorkBuddy, CodeBuddy, Yuanbao und ima, dazu über Tencent Cloud TokenHub und OpenRouter, mit kostenlosem Zugang auf WorkBuddy und CodeBuddy für zwei Wochen ab Start. Alle Details in unserer Analyse zu Tencent Hy4 Preview.
26. Aug. Z.ai GLM 5.3 Flash, Ox Alpha enttarnt, und die ersten MIT-Gewichte seit GLM-5.2 Neu
Z.ai veröffentlichte GLM 5.3 Flash am 26. August 2026, und es ist nicht das Modell, auf das das Feld gewartet hat. Die am 14. August zurückgehaltenen Gewichte gehören zu GLM 5.3; dies hier ist ein eigenes Modell auf einer neu trainierten Basis, 320 Milliarden Parameter mit 18 Milliarden aktiven, das erste nativ multimodale Modell der GLM-5-Reihe, und es stand am selben Tag unter MIT auf Hugging Face. Es ist zugleich das Stealth-Modell, das auf OpenRouter als Ox Alpha Traffic bediente und während dieser Vorschau ausschließlich auf chinesischen KI-Chips lief, was beschreibt, wie es ausgeliefert wurde, nicht wie es trainiert wurde. Artificial Analysis bewertet es mit 57 auf dem Intelligence Index v4.1.1, vier Punkte über GLM-5.2 bei weniger als der halben Größe, und setzt es auf die Pareto-Front aus Intelligenz und Kosten. Auf dem heutigen v4.3-Index steht es bei 41,9 gegen 34,0 für GLM-5.2, bei $0.25 pro Index-Aufgabe. Der Listenpreis liegt bei $0.15 / $0.50 pro 1M Tokens; die 50-Prozent-Einführungsaktion lief bis 24:00 Uhr am 9. September und ist ausgelaufen. DeepSeeks Ablösung durch V4.1-Flash am 10. September hat den Abstand weitgehend geschlossen: außerhalb der Stoßzeiten liegen beide beim Input gleichauf bei $0.15, GLM ist beim Output mit $0.50 gegen $0.60 günstiger, und zu Stoßzeiten unterbietet GLM auf beiden Seiten. Behandle die Coding- und Agentic-Zahlen mit Vorsicht: Sie stammen aus Z.ais eigenem Chart, das Claude Opus 4.8 und GPT-5.6 Terra als Vergleich wählt statt der aktuellen Spitzenreiter, und dort stehen Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 gegen 46,2 für GLM-5.2 und AutomationBench 48,8. Die einzige Zahl in diesem Chart, die Artificial Analysis erhoben hat, ist GDPval-AA v2, wo GLM 5.3 Flash 1773 Elo erreicht, den höchsten dort eingetragenen Wert. Die Arena hat es inzwischen bewertet, Platz siebzehn bei WebDev und Platz zehn bei image-to-WebDev. Unseren Open-Weight-Tipp verschiebt das sehr wohl: GLM 5.3 Flash ersetzt GLM-5.2 als das MIT-Modell, das wir hosten würden. Eine Warnung zur Hardware: 18B aktiv heißt nicht 18B zum Hosten, denn das Mixture-of-Experts-Routing braucht alle 320B Gewichte im Speicher, das ist also ein Multi-GPU-Server und keine Workstation. Alle Details in unserer GLM-5.3-Flash-Aufschlüsselung.
26. Aug. Alibaba Qwen3.8-Flash-Next, offene Gewichte und der erste öffentliche Blick auf die Qwen4-Architektur Neu
Alibaba veröffentlichte Qwen3.8-Flash-Next am 26. August 2026 auf Hugging Face, und es geht dabei eher um die Architektur als um die Punktetabelle: Qwen bezeichnet es als frühen Blick auf das Design, das die Qwen4-Familie nutzen wird, veröffentlicht, damit sich die Community darauf vorbereiten kann. Es ist ein Mixture-of-Experts mit 125 Milliarden Parametern und nur 6 Milliarden aktiven pro Token, dazu ein separates N-Gramm-Embedding mit 51 Milliarden Parametern, und es verarbeitet Text, Bild und Video. Der Kontext liegt nativ bei 262.144 Tokens, erweiterbar auf 1M. Zu Qwens veröffentlichten Werten gehören 91,7 auf GPQA Diamond, 62,5 auf SWE-Bench Pro, 58,7 auf DeepSWE 1.1, 81,0 auf SWE-Bench Multilingual und 84,5 auf AndroidWorld Vision, alle vom Hersteller und damals ganz ohne unabhängige Bewertung. Artificial Analysis bewertet es inzwischen mit 39,9 auf dem Intelligence Index v4.3, und die Arena führt es bei WebDev auf Platz neun mit 1635. Die Lizenz solltest du lesen, bevor du darauf aufbaust, denn es ist kein Apache. Die Qwen Community License 1.0 erlaubt kommerzielle Nutzung, Veränderung und Hosting, verlangt aber eine gut sichtbare Nennung des Modellnamens, sobald ein Produkt 100 Millionen monatlich aktive Nutzer oder 20 Millionen Dollar Monatsumsatz überschreitet, und verlangt eine separate Lizenz von Qwen, um ein Model-as-a-Service- oder ein KI-Arbeitsassistenz-Geschäft darauf zu betreiben. Interne Nutzung ist von dieser zweiten Bedingung ausgenommen.
21. Aug. OpenAI GPT-5.6 Sol um über 20% gesenkt, jetzt auf beiden Seiten unter Claude Opus 5 Neu
OpenAI senkte GPT-5.6 Sol am 21. August 2026 von $5 / $30 auf $4 / $20 pro 1M Tokens, die erste Senkung beim Flaggschiff seit dem Start der GPT-5.6-Familie im Juli. Der Preis ist ein Aktionspreis und gilt laut OpenAI rund drei Monate. Er umfasst die API sowie Credits für Codex und ChatGPT Work; die Abopreise für Plus, Pro und Business bleiben unverändert. Mit $4 / $20 unterbietet Sol jetzt Claude Opus 5 zu $5 / $25 bei Input und Output, zum ersten Mal ist OpenAIs Flaggschiff das günstigere der beiden.
16. Aug. DeepSeek DeepSeek erhöht die API-Preise um rund das Vierfache und teilt die Preisliste in Spitzen- und Nebenzeiten Neu
DeepSeek stellte beide V4-Modelle am 16. August 2026 um 16:00 UTC auf eine neue Preisliste um, und die Richtung ist für dieses Feld ungewöhnlich: Die Preise stiegen, zu Spitzenzeiten um rund das Vierfache. V4-Flash 0731 ging von glatten $0.14 / $0.28 pro 1M Tokens auf $0.22 / $0.66 außerhalb der Spitzenzeiten und $0.44 / $1.32 zu Spitzenzeiten, und V4-Pro 0813 von $0.435 / $0.87 auf $0.66 / $1.98 außerhalb der Spitzenzeiten und $1.32 / $3.96 zu Spitzenzeiten, mit zwischengespeichertem Input bei $0.007 beziehungsweise $0.022 außerhalb der Spitzenzeiten. Spitzenzeit ist von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC, Montag bis Freitag, und jede andere Stunde ist Nebenzeit zu genau der Hälfte des Spitzentarifs. DeepSeek stellte das als sinnvollere Verteilung der Kapazität dar. An den Modellen selbst hat sich nichts geändert, das ist also rein ein wirtschaftliches Ereignis, für diese Seite aber ein folgenreiches: Es kostete DeepSeek V4-Flash den Preis-Leistungs-Tipp, der an GLM 5.3 Flash mit $0.15 / $0.50 Listenpreis ging. DeepSeek hat die Erhöhung am 10. September größtenteils zurückgenommen, V4-Flash eingestellt und durch V4.1-Flash zu $0.15 / $0.60 außerhalb der Stoßzeiten ersetzt, sodass beide beim Input außerhalb der Stoßzeiten wieder gleichauf liegen. Die Gewichte stehen weiterhin unter MIT, wer selbst hostet, ist also nicht betroffen. Alle Details in unserer DeepSeek-V4-Aufschlüsselung.
14. Aug. Z.ai GLM 5.3, ein großer agentischer Sprung allein durch Nachtraining, erschien ohne die offenen Gewichte Neu
Z.ai veröffentlichte GLM 5.3 am 14. August 2026, und bemerkenswert ist, was sich nicht geändert hat: Es läuft auf derselben Basis mit 744 Milliarden Parametern wie GLM-5.2, ohne neues Pretraining. Jeder Zuwachs stammt aus skaliertem Nachtraining, und die agentischen sind groß. Auf Z.ais eigenem Chart steigt Terminal-Bench 3.0 von 4,6 auf 28,3, DeepSWE v1.1 von 46,2 auf 66,9 und CyberGym von 77,2 % auf 84,5 %, womit das Unternehmen nach eigenen Angaben Claude Mythos 5 mit 83,8 und GPT-5.6 Sol mit 83,6 knapp übertrifft. Alle diese Zahlen stammen vom Hersteller, bisher ohne unabhängige Prüfung, und an anderer Stelle ist das Chart weniger schmeichelhaft: Auf Z.ais internem Code Bench führt weiterhin Claude Fable 5 mit 39,5 % gegen 31,4 % für GLM 5.3, und auf ExploitBench liegen die Frontier-Spitzenreiter bei 78,0 % gegen 54,4 %. Der Haken ist die Lizenz, nicht der Wert. GLM-5.2 lieferte innerhalb weniger Tage MIT-lizenzierte Gewichte; GLM 5.3 erschien ohne jede, und Z.ai sagte, sie folgten nach einer Sicherheitsbewertung der Fähigkeit des Modells, Schwachstellen zu finden, rund zwei Wochen später. Das hat sich am 28. August 2026 erledigt, als Z.ai die Gewichte genau zu dem Datum veröffentlichte, das der Platzhalter trug, allerdings unter einer eigenen GLM 5.3 License statt dem reinen MIT, das GLM-5.2 und GLM 5.3 Flash beide bekamen. Der Tokenpreis ist inzwischen veröffentlicht, $1.40 / $4.40 pro 1M Tokens, neben dem GLM Coding Plan und ZCode. Was am 26. August stattdessen kam, war GLM 5.3 Flash, ein anderes und kleineres Modell, das MIT-Gewichte tatsächlich lieferte, und genau dieses Release hat unseren Open-Weight-Tipp verschoben. Alle Details in unserer GLM-5.3-Aufschlüsselung.
13. Aug. Google Gemini 3.7 Flash, Coding-Werte springen und der Preis halbiert sich auf $0.75 / $3.75, bis Januar Neu
Google brachte Gemini 3.7 Flash am 13. August 2026 heraus, 23 Tage nach 3.6 Flash und als dritte Flash-Version in weniger als zwei Monaten, während Gemini 3.5 Pro weiterhin nicht erschienen ist. Die Coding-Gewinne sind der Punkt: DeepSWE v1.1 steigt von 49,0 % auf 65,3 %, FrontierCode 1.1 Main von 34,4 % auf 43,6 %, und AutomationBench verdoppelt sich nahezu von 17,0 % auf 30,4 %. Artificial Analysis bewertet es mit 56 auf seinem Index v4.1.1 gegen 52 für 3.6 Flash und setzt es bei der Ausgabegeschwindigkeit mit 385,1 Tokens pro Sekunde auf Platz eins von 182 Modellen, was es auf die Pareto-Front von Intelligenz gegen Zeit bringt. Kontextfenster und das Output-Limit von 64K sind gegenüber 3.6 Flash unverändert, es wurde also nichts geopfert. Zwei Einschränkungen wiegen schwerer als die Benchmarks. Der Tarif von $0.75 / $3.75 ist einführend und läuft am 31. Dezember 2026 aus, danach verdoppelt er sich auf $1.50 / $7.50, genau das, was 3.6 Flash beim Start kostete; Google stellte 3.6 Flash zugleich auf denselben Tarif um, beide kosten jetzt also gleich viel, und das Upgrade ist eine reine Fähigkeitsentscheidung. Und der Verbraucherzugang läuft nur über Spark, das Google AI Pro oder Ultra erfordert und den Europäischen Wirtschaftsraum, das Vereinigte Königreich, die Schweiz und Nigeria ausschließt, sodass die meisten europäischen Leser es in der Gemini-App überhaupt nicht erreichen. Die kostenlose Gemini-Stufe erhält weiterhin 3.6 Flash. Der API-Zugang ist überall unberührt. Alle Details in unserer Gemini-3.7-Flash-Aufschlüsselung.
12. Aug. SpaceXAI Grok 4.6, Post-Training hebt den Intelligence Index von 56 auf 61 bei unverändert $2 / $6 Neu
SpaceXAI veröffentlichte Grok 4.6 am 12. August 2026, und es ist ausdrücklich kein neues Basismodell: Das Unternehmen behielt die Grundlage von Grok 4.5 und erkaufte die Gewinne mit einem längeren ergänzenden Trainingslauf, neu erzeugten Fine-Tuning-Trajektorien und Reinforcement Learning in agentischen Umgebungen. Eine neue Architektur oder Parameterzahl wurde nicht veröffentlicht. Artificial Analysis bewertet es mit Intelligence Index 61, fünf Punkte über Grok 4.5, womit es sich den dritten Platz mit GPT-5.6 Sol teilt, hinter Claude Opus 5 mit 63 und Claude Fable 5 mit 62, so wie der Index in jenem Monat stand; Claude Fable 5.1 hat sich seither mit 66 über alle drei geschoben. Die agentischen Zahlen sind stärker als der Gesamtindex: ein GDPval-AA-v2-Elo von 1753 nur hinter Opus 5, 88,4 % auf Terminal-Bench v2.1 und 50,7 % auf tau3-Banking. Das Argument war damals die Effizienz, bei $0.84 pro Index-Aufgabe und rund 53 Zügen und 0,5 Milliarden Input-Tokens bei langen Aufgaben gegen etwa 103 Züge und 2,0 Milliarden bei Opus 5. Auf den aktuellen v4.3-Zahlen von Artificial Analysis ist dieses Argument schwächer: Grok 4.6 kostet $1.86 pro Index-Aufgabe, mehr als die $1.61 von Muse Spark 1.3 bei höherem Wert. Die Preise bleiben unverändert bei $2 / $6 pro 1M Tokens mit gecachtem Input zu $0.50, beim selben Kontextfenster von 500K Tokens, aber es gibt eine Falle, die du kennen solltest: Erreicht ein Prompt 200.000 Tokens, rechnet SpaceXAI die gesamte Anfrage mit $4 / $12 ab, nicht nur den Überhang. Eine Warnung zur Benchmark-Abdeckung, weil viele Berichte das bereits verdreht haben: Terminal-Bench v3.0 ist ein anderer und deutlich härterer Test als v2.1, also sind 26 % auf v3.0 und 88,4 % auf v2.1 beide wahre Aussagen über dasselbe Modell. Es lief vom ersten Tag an in der SpaceXAI-API, in Cursor und Grok Build sowie bei Partnern wie OpenRouter, Vercel und Cloudflare. Alle Details in unserer Aufschlüsselung zu Benchmarks und Preisen von Grok 4.6.
5. Aug. Meta Muse Spark 1.2 und Muse Code, Intelligence Index von 51 auf 57 bei unverändert $1.25 / $4.25, plus ein Terminal-Coding-Agent Neu
Meta veröffentlichte Muse Spark 1.2 am 5. August 2026 zusammen mit Muse Code, seinem ersten Terminal-Coding-Agenten, der unter macOS und Linux ohne Desktop-App und ohne Abo läuft. Artificial Analysis bewertet das Modell mit Intelligence Index 57 bei höchster Reasoning-Einstellung auf seinem aktuellen Index v4.1.1, gegenüber 51 für 1.1 und 43 für die April-Version, und fast der gesamte Zuwachs ist agentisch statt Allgemeinwissen; sein GDPval-AA v2 Elo sprang von 1371 auf 1631, während Terminal-Bench v2.1 nur von 78 % auf 80 % anstieg. Die Preise bleiben unverändert bei $1.25 / $4.25 pro 1M Tokens auf einem Kontextfenster von 1M Tokens, und Meta ergänzte eine Contributor-Stufe zu $0.10 / $0.20, rund 92 % günstiger, im Gegenzug dafür, dass Meta auf deinen Prompts und Completions trainieren darf. Die Verfügbarkeit weitete sich von der US-only-Vorschau, unter der 1.1 startete, auf erweiterten globalen Zugang über Muse Code, die Meta Model API und OpenRouter aus. Auf Metas eigenen Launch-Charts landet das Modell bei allen drei veröffentlichten Coding-Benchmarks hinter Claude Opus 5 auf Platz zwei, mit 82,9 % gegen 86,7 % auf Terminal-Bench 2.1.
3. Aug. Alibaba Qwen 3.8 (Qwen3.8-Max), 2,4 Billionen Parameter starkes multimodales Flaggschiff jetzt allgemein verfügbar bei $2 / $6 Neu
Alibaba machte Qwen3.8-Max am 3. August 2026 allgemein verfügbar, zwei Wochen nach der Vorschau auf der WAIC Shanghai, und jede Zahl, die bei der Vorschau noch fehlte, hat jetzt einen Wert. Es läuft mit 2,4 Billionen Gesamtparametern und rund 95 Milliarden aktiven pro Token auf einem spärlichen Mixture-of-Experts-Design, verarbeitet Text, Bilder und Video und bestätigt ein Kontextfenster von 1M Tokens mit bis zu 128K Output-Tokens. Die API-Preise liegen bei $2 / $6 pro 1M Tokens, flach über den gesamten Kontext statt gestaffelt nach Prompt-Länge, mit Cache-Reads zu $0.25. Die Aussage „nur hinter Fable 5" spaltet sich jetzt sauber in zwei Teile: Auf Arenas Vision-Board ist es mit 1305 die #2, nur hinter Fable 5, doch auf dem Text-Board ist es mit 1496 die #5, hinter vier Anthropic-Einträgen. Beide Arena-Werte sind noch als vorläufig markiert, und die versprochenen offenen Gewichte sind nicht erschienen. Wir halten Qwen 3.8 aus den gerankten Tipps heraus, bis die Gewichte und die Lizenz tatsächlich vorliegen.
Ausstehend Google Gemini 3.5 Pro, weiterhin unveröffentlicht, laut Bloomberg Monate hinter dem Zeitplan Verzögert
Gemini 3.5 Pro bleibt der größte ausstehende Launch. Google kündigte es auf der I/O am 19. Mai zusammen mit Gemini 3.5 Flash an, doch nur Flash erschien, und das Juni-Ziel verstrich. Bloomberg berichtete am 16. Juli 2026, dass das Modell Monate hinter dem Zeitplan liegt und Googles interne Ziele verfehlt hat, wobei das Unternehmen weiterhin daran arbeitet, seine Fähigkeiten insbesondere beim Programmieren zu verbessern. Das ist das gesamte belegte Bild. Google hat nie öffentlich ein Startdatum bestätigt, und Google hat keine finalen Spezifikationen wie Kontextfenster oder Reasoning-Modi veröffentlicht, also behandle kursierende Zahlen als unbestätigt. Nutze in der Zwischenzeit Gemini 3.8 Flash, wenn du über die API arbeitest, oder Gemini 3.6 Flash, wenn du in der kostenlosen Gemini-App bist, die es weiterhin ausführt; wir nehmen 3.5 Pro in dem Moment ins Haupt-Ranking auf, in dem es live geht.
Kategorie-Tipp, September 2026

Beste KI zum Schreiben

1
Claude Fable 5.1
Bestes Schreiben insgesamt
2
Kimi K3
Kreative Fiktion
3
Claude Sonnet 5
Kostenlos für den Alltag

Die beste KI zum Schreiben ist Claude Fable 5.1, und das Argument dafür ist Beständigkeit, nicht ein einzelner erster Platz. Es ist das einzige Modell in den Top sechs aller drei Text-Boards: Zweiter auf EQ-Bench Creative Writing v3 mit 2152,7, Zweiter auf LiveBench Language mit 89,5 und Sechster auf Arenas Board für kreatives Schreiben. Das schafft sonst keines. GPT-6 Astra führt EQ-Bench mit 2163,9 an, steht bei Arenas kreativem Schreiben aber auf Rang 25; Claude Fable 5 führt Arenas Text- und Kreativ-Board an und liegt mit 90,7 vorn auf LiveBench Language, ist auf EQ-Bench jedoch auf Rang acht abgerutscht. Claude Opus 5.5, der Fable 5.1 am 22. September den Intelligence Index und Humanity's Last Exam abgenommen hat, ist auf EQ-Bench und auf Arena unbewertet und auf LiveBench Language Achter, hat also bislang überhaupt kein Argument auf den Schreib-Boards, und die Krone wandert nicht zu ihm. Wenn Ihr Text ein Arbeitsergebnis statt Prosa ist, ist das eine andere Frage, und das Board für professionelle Arbeitsergebnisse GDPval-AA v2.1 führt Claude Opus 5.5 mit 1846 an, vor Claude Fable 5.1 mit 1735 und Claude Opus 5 mit 1708. Claude Sonnet 5 bleibt der Preis-Leistungs-Tipp im kostenlosen Tarif und Claude Fable 5 die Wahl, wenn Sie Arenas menschliche Stimmen höher gewichten als Harness-Werte; Fable 5 kostet $10 / $50 pro 1M Tokens und ist dauerhaft in Claude Max und Team Premium enthalten, bei rund 50 % der regulären Nutzungsgrenzen. Übersetzung ist eine eigene Frage mit einem eigenen Sieger, die wir in unserem Leitfaden zur besten KI für Übersetzungen durchgehen.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Fable 5.1Bestes Schreiben insgesamt#2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) und #6 Arena kreatives Schreiben, die beste Gesamtplatzierung aller ModelleFührt keines der drei klar an; Claude Opus 5.5 nahm am 22. September den Intelligence Index und Humanity's Last Exam$10 / $50
Claude Fable 5Führt die Arena-Boards mit menschlichen Stimmen an#1 Arena Text insgesamt (1505,7), #1 LiveBench Language (90.7), #8 EQ-BenchTeuerste Option hier$10 / $50
Kimi K3Kreative Fiktion und Stimme#4 EQ-Bench Creative Writing (2070.6)Nur #27 auf Arena Creative Writing$3 / $15
Claude Sonnet 5Kostenloses AlltagsschreibenKostenlos und Standard auf claude.ai, 1M Kontext#53 Arena Creative Writing; 75,0 LiveBench Language$2 / $10, jetzt dauerhaft
Claude Opus 5Professionelle Deliverables mit Preisvorteil#2 GDPval-AA v2.1 mit 1708, vor Fable 5 (1632)Hinter Fable 5 bei Arena Text, hinter Fable 5.1 bei GDPval-AA v2.1$5 / $25
GPT-5.5Faktenbasiertes Business-SchreibenDokumentierte Zuwächse bei faktischer Verlässlichkeit gegenüber GPT-5.4Reasoning-Stufen jetzt als veraltet markiert$5 / $30
Gemini 3.8 FlashMassen-Entwürfe in großem UmfangIntelligence Index 40,9, 308,4 Tok/s Ausgabe, 1M KontextEher auf Agenten als auf Prosa getrimmt; Einführungspreis verdoppelt sich am 1. Januar 2027$0.75 / $3.75
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der Tipp, wenn du Arenas menschliche Stimmen höher gewichtest, Kimi K3 ist der Tipp für eigenwillige Fiktion, steht auf EQ-Bench aber inzwischen auf Platz vier, Claude Sonnet 5 ist der Preis-Leistungs-Tipp und das Modell, wenn du nicht zahlst, Claude Opus 5 ist der günstigere Tipp für professionelle Deliverables, und Gemini 3.8 Flash ist der Tipp für Massenentwürfe.
Was sich diesen Monat geändert hat

Die Schreib-Krone bleibt bei Claude Fable 5.1, doch ihre Begründung hat sich geändert. Claude Opus 5.5 hat ihm am 22. September den Intelligence Index und Humanity's Last Exam abgenommen, also genau das, was diese Karte zitierte, deshalb haben wir den Tipp auf die Boards gestellt, die tatsächlich Prosa messen. Dort ist Fable 5.1 das einzige Modell in den Top sechs aller drei: Zweiter auf EQ-Bench Creative Writing, Zweiter auf LiveBench Language und Sechster auf Arenas Board für kreatives Schreiben. Opus 5.5 ist auf zweien der drei unbewertet und auf dem dritten Achter, hat für das Schreiben also noch kein Argument. Arena hat Fable 5.1 inzwischen bewertet, womit der Vorbehalt des Vormonats entfällt, die Präferenz-Boards hätten noch nicht gesprochen: Er ist Fünfter auf dem Text-Board mit 1498,5, wo Claude Fable 5 mit 1505,7 weiterhin führt. GDPval-AA v2.1 wurde erneut neu verankert und liest sich jetzt 1846 für Opus 5.5, 1735 für Fable 5.1 und 1708 für Opus 5, die Zahlen in diesem Block liegen also deutlich unter denen vom August.

Kategorie-Tipp, September 2026

Beste KI für Chat & täglichen Assistenten

1
GPT-5.6
ChatGPTs Standard
2
Claude Fable 5
Am höchsten bewertet
3
Claude Opus 5
Durchdachte Tiefe

Die beste KI für den täglichen Chat ist GPT-5.6, und der ehrliche Grund ist Reichweite statt Board-Position. Es ist das Modell, das ChatGPT der größten Nutzerbasis der Kategorie standardmäßig ausliefert, was es zum besten Assistenten macht, den die meisten Menschen tatsächlich öffnen können. Bei der reinen menschlichen Präferenz ist es nicht der Spitzenreiter: GPT-5.6 Sol sitzt mit 1483,5 auf #18 von Arenas Text-Leaderboard, wo Claude Fable 5 mit 1505,7 führt. Die meisten ChatGPT-Nutzer bekommen die ausgewogene Terra-Stufe, von der OpenAI sagt, sie entspreche GPT-5.5 und koste seit der Preissenkung vom 30. Juli 2026 60 % weniger. Es ist verfügbar in ChatGPT (kostenlos mit Limits, Plus zu $20/Monat, Pro zu $100/Monat), über die API (die 5.6-Stufen: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 pro 1M Tokens) und gebündelt in Fello AI neben Claude, Gemini, Grok und DeepSeek. Ein Vorbehalt: OpenAIs System Card und der Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, sodass GPT-5.5 Instant der sicherere Tipp für halluzinationsempfindliche Arbeit bleibt.

ModellAm besten fürStärkeSchwächePreis
GPT-5.6Täglicher Chat, ChatGPTs StandardDer Assistent, den die meisten öffnen können; Terra entspricht GPT-5.5 zu ~halbem Preis#14 auf Arena Text; Scheming von METR gemeldetKostenlos / $20/Mon. Plus; API $0.20 / $1.20 bis $4 / $20
Claude Fable 5Am höchsten bewertete Konversation#1 auf Arena Text gesamt (1505,7) und in vier von acht UnterkategorienKeine Gratisversion; Zugang über Nutzungscredits auf Pro$10 / $50 API
Claude Opus 5Durchdachte, differenzierte AntwortenDritter auf dem Intelligence Index von Artificial Analysis (50,8), hinter Claude Fable 5.1 und GPT-6 Astra#10 auf Arena Text, hinter Claude Fable 5$20/Mon. Pro, $5 / $25 API
GPT-5.5 InstantHalluzinationsempfindliche Alltagsarbeit52,5 % weniger halluzinierte Aussagen vs. 5.3 InstantReasoning-Stufen jetzt als veraltet markiert$20/Mon. Plus; API $5 / $30
Gemini 3.6 FlashSchnell, kostenlos, multimodalWeiterhin das Modell, das die kostenlose Gemini-Stufe bedient, 1M Kontext, #12 auf Arena TextSchwächer beim schwersten Reasoning; 3.8 Flash übertrifft es zum selben PreisKostenlos / $0.75 / $3.75 API
Fello AIAlle Top-Modelle, eine AppChatGPT + Claude + Gemini + Grok + DeepSeek und mehr auf Mac, iPhone und iPadÜber die App geroutet, nicht direkt$9.99/Mon.
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der eigentliche Präferenzführer, Claude Opus 5 ist der Zweitplatzierte für durchdachte Alltagsnutzung, Gemini 3.6 Flash ist der Zweitplatzierte für schnell und kostenlos, und Grok 4.6 ist der Nischen-Tipp für Live-News-Tage. Fello AI ist die naheliegende Wahl, wenn du die Top-Modelle in einer Mac- und iOS-App für $9.99/Monat willst, statt mit Abos zu jonglieren.
Was sich diesen Monat geändert hat

GPT-5.6 behält den Chat-Tipp wegen seiner Reichweite, und der Abstand zum Präferenzführer ist erneut gewachsen. Sol steht jetzt auf Rang 18 von Arenas Text-Board mit 1483,5, herunter von Rang 14, während Claude Fable 5 mit 1505,7 führt. Am Produkt hat sich nichts geändert, die Krone wandert also nicht: Es geht weiterhin darum, welchen Assistenten die meisten Menschen tatsächlich öffnen können. Zwei Starts, die sonst Kandidaten wären, sind es nicht: GPT-6 Astra erreichte Anfang September ChatGPT Business, Pro und Plus, doch OpenAI hat für den kostenlosen Tarif nichts angekündigt, und Claude Opus 5.5, der am 22. September den Intelligence Index übernahm, ist ein Modell für die API und für Claude-Tarife, kein Standardassistent für eine Milliarde Menschen. OpenAI hat GPT-6 Sol und GPT-6 Luna am 22. September ausgeliefert und in ChatGPT Work und Codex gesteckt, mit der klaren Ansage, dass sie noch nicht im Chat sind: Das Fenster, in das die meisten Menschen tippen, läuft weiter mit GPT-5.6.

Kategorie-Tipp, September 2026

Beste KI für Bilder

1
ChatGPT Images 2.5
Text in Bildern
2
MAI-Image-2.6
#1 AA Bildbearbeitung
3
Muse Image
Meta-AI-Ökosystem

Die beste KI für Bildgenerierung ist ChatGPT Images 2.5, das OpenAI am 8. September in jedem ChatGPT-Tarif zum Standard gemacht hat und das jetzt alle vier Bild-Boards anführt, die wir verfolgen. Seine beiden Modelle belegen auf jedem die ersten beiden Plätze: GPT-Image-2.5 Sunburst, auf Präzision gebaut, führt Arena Text-zu-Bild mit 1423,2 und Arena Bildbearbeitung mit 1526,0 an und führt ebenso das Qualitäts-Elo von Artificial Analysis mit 1196,8 und deren Bildbearbeitungs-Board mit 1221,3, während das schnellere GPT-Image-2.5 Flare auf allen vier Zweiter ist. Das ist eine Änderung gegenüber dem Vormonat, als Artificial Analysis keines der beiden bewertet hatte und ihre Boards Arenas widersprachen. Lesen Sie den Abstand zwischen Sunburst und Flare dennoch als vorläufig, denn diese Arena-Platzierungen beruhen auf je einigen tausend Stimmen gegen 83.000 und 259.000 für GPT Image 2, und bei Text-zu-Bild teilen sich die beiden ein Rangband. Zweiter ist MAI-Image-2.6, Dritter auf dem Bildbearbeitungs-Board von Artificial Analysis mit 1191,6 und Vierter auf Arenas Text-zu-Bild-Board mit 1334,0, mit Metas Muse Image auf Rang drei. Reve 2.1 behält sein Argument für Layout, Typografie und natives 4K, hat das Podium aber verlassen: Es ist Sechster bei Arena Text-zu-Bild und Vierzehnter bei Arena Bildbearbeitung. Unsere vollständige Analyse dessen, was erschienen ist, steht in ChatGPT Images 2.5.

ModellAm besten fürStärkeSchwächePreis
ChatGPT Images 2.5Bilder mit lesbarem Text#1 und #2 auf allen vier Boards: Arena Text-zu-Bild (1423,2 / 1401,3), Arena Bearbeitung (1526,0 / 1481,8), Qualität bei Artificial Analysis (1196,8 / 1190,4) und Bearbeitung (1221,3 / 1207,0)Die Arena-Platzierungen beruhen auf je einigen tausend StimmenStandard in jedem ChatGPT-Tarif
MAI-Image-2.6Ein vorhandenes Bild bearbeiten#3 bei der Bildbearbeitung von Artificial Analysis (1191,6) und #4 bei Arena Text-zu-Bild (1334,0)Public Preview, noch nicht in Copilot oder Bing; die Bearbeitungsführung bei Artificial Analysis ging an ChatGPT Images 2.5MAI Playground / Microsoft Foundry
Muse ImageBildbearbeitung, Meta-Ökosystem#5 bei der Bildbearbeitung von Artificial Analysis (1171,3) und #7 bei ihrem Qualitäts-EloNeu, wenig Werkzeuge drumherumMeta-AI-App
Nano Banana 2 (Gemini 3.1 Flash Image)Fotorealistische Porträts und Produkte#4 bei Artificial Analysis Text-zu-Bild, vor Nano Banana Pro auf Arenas BoardBei Arenas Bildbearbeitung liegt Nano Banana Pro vornGemini-App / AI Studio
Seedream 5.0 ProMehrsprachiger Text + Regionenbearbeitung10+ Sprachen inkl. Arabisch RTL, Lasso- und EbenenbearbeitungEtwa Platz zehn auf den unabhängigen Boards; Urheberrechts-WolkeBytePlus / Magnific
Midjourney v8Stilisierte Kunst, IllustrationÄsthetische Basis, die die meisten Künstler bevorzugenSchwächer bei Text im Bild$10-$120/Mon.
Grok ImagineNSFW / Spicy ModeFreizügigste Leitplanken; Arena führt sein Modell Image 2.0 auf #5 bei Text-zu-Bild und #4 bei Bildbearbeitung, und Artificial Analysis hat es jetzt auf #4 beim Qualitäts-EloNichts im Release-Verlauf zeigt, dass Image 2.0 als Produkt erschienen ist$30 im Monat SuperGrok
Zweitplatzierte und Alternativen: MAI-Image-2.6 ist der Zweitplatzierte insgesamt und der Tipp, um ein bereits vorhandenes Bild zu bearbeiten, Muse Image ist Dritter und der Tipp innerhalb von Metas Apps, und Nano Banana 2 ist weiterhin der Foto-Real-Tipp. Reve 2.1 bleibt der Tipp für Layout, Typografie und natives 4K, auch nachdem es das Podium verlassen hat. Grok Imagine ist weiterhin das einzige Frontier-Modell, das Spicy-Mode-Inhalte für Erwachsene erlaubt, und Arena führt sein Modell Image 2.0 jetzt auf Platz fünf bei Text-zu-Bild und Platz vier bei der Bildbearbeitung.
Was sich diesen Monat geändert hat

ChatGPT Images 2.5 behält die Bild-Krone, und sein Argument ist stärker geworden. Im Vormonat hatte Artificial Analysis keines seiner beiden API-Modelle bewertet, deshalb widersprachen sich die Boards, die wir verfolgen: Arena hatte Sunburst und Flare auf eins und zwei, während Artificial Analysis noch GPT Image 2 an der Spitze von Text-zu-Bild und Microsofts MAI-Image-2.6 an der Spitze der Bildbearbeitung führte. Artificial Analysis hat inzwischen beide bewertet, und sie liegen auch dort auf eins und zwei, 1196,8 und 1190,4 beim Qualitäts-Elo sowie 1221,3 und 1207,0 bei der Bildbearbeitung. Damit ist es #1 und #2 auf allen vier Boards. MAI-Image-2.6 bleibt Zweiter, rutscht aber auf dem Bearbeitungs-Board, das es früher anführte, auf Rang drei, und Grok Imagine Image 2.0 liegt jetzt auf Rang vier beim Qualitäts-Elo von Artificial Analysis und auf Rang vier bei Arenas Bearbeitungs-Board, eine bessere Platzierung als der dritte Podiumsplatz; wir berichten es weiterhin, statt es zu krönen, weil nichts im Release-Verlauf zeigt, dass es als Produkt erschienen ist.

Kategorie-Tipp, September 2026

Beste KI für Video

1
Gemini Omni 1.1 Flash
#1 Arena Text-to-Video
2
MiniMax H3
2K + nativer Ton
3
Dreamina Seedance 2.0
Engster Herausforderer

Die beste KI für Videogenerierung ist Gemini Omni 1.1 Flash, das Google am 27. August veröffentlicht hat und das Arenas Text-zu-Video-Board mit 1516 anführt, knapp vor dem eigenen Vorgänger Gemini Omni Flash mit 1513. Lesen Sie das als Gleichstand: Die beiden liegen in den Konfidenzintervallen des jeweils anderen, und Arena selbst gibt 1.1 Flash ein Rangband von eins bis vier. Den Ausschlag gibt die Spezifikation, bei der 1.1 Flash klar das leistungsfähigere Modell ist: Szenenverlängerung in 10-Sekunden-Schritten auf kumulativ 40 Sekunden, Kontrolle über erstes und letztes Bild, Videoreferenzen, 360p-Entwürfe und Ausgabe in 1080p oder 4K, zu etwa $0,03 pro Sekunde bei 360p, $0,10 bei 720p, $0,15 bei 1080p und $0,30 bei 4K. Gemini Omni Flash bleibt mit rund $0,10 pro Sekunde die günstigere Option, endet aber bei 10-Sekunden-Clips. Zwei Grenzen sind wichtig. Artificial Analysis hat 1.1 Flash überhaupt nicht bewertet; auf ihrem Text-zu-Video-Board führt das ältere Omni Flash mit 1512,8 vor Alibabas Wan 3.0 mit 1431,4 und MiniMax H3 mit 1407,7. Und auf Arenas Bild-zu-Video-Board liegt 1.1 Flash mit 1488,5 hinter MiniMax H3 mit 1495,4 auf Rang zwei, die Krone ruht also auf Text-zu-Video und auf der Spezifikation, nicht auf einem Durchmarsch. Wenn Sie längere Einstellungen innerhalb von Googles Werkzeugen brauchen, läuft Veo 3.1 weiterhin in der Gemini-App, in AI Studio und in Vertex AI mit nativem Ton und 1080p-Ausgabe. MiniMax H3 (31. Juli) bleibt der Herausforderer bei der Spezifikation, mit 2K-Clips von 4 bis 15 Sekunden und nativem Stereoton ab $0,13 pro Sekunde.

ModellAm besten fürStärkeSchwächePreis
Gemini Omni 1.1 FlashBestes KI-Video insgesamt#1 Arena Text-zu-Video (1516); Szenenverlängerung auf 40 Sekunden, 4K-AusgabeVon Artificial Analysis unbewertet; bei Arena Bild-zu-Video Zweiter hinter MiniMax H3$0,03-$0,30/Sek.; Gemini API / AI Studio / Flow
Gemini Omni FlashGünstigere Zehn-Sekunden-Clips#2 Arena Text-to-Video (1511), #2 AA-Video (1238); konversationelle BearbeitungDeckelt bei Zehn-Sekunden-Generierungen~$0.10/s; Gemini-App / AI Studio
Wan 3.0Video aus Dokumenten und Folien#1 auf Artificial Analysis' Video-Board (1239); 2-30 s, bis 1080p, Omni-Reference-EingabeNur API, keine veröffentlichten Gewichte; #3 auf Arena$0.05-$0.20/s
MiniMax H32K-Clips mit nativem Audio4-15 s in 2K, natives Stereo-Audio; #8 Arena Text-to-Video (1462)#4 auf AA-Video (1227); die offenen Gewichte enthalten den 2K-Upscaler nicht und erfordern einen Antrag in den USA, der EU, Großbritannien und Südkorea$0.13/s in 2K
Dreamina Seedance 2.5ByteDance-Herausforderer#6 Arena Text-to-Video (1482); führt Image-to-Video mit Audio anByteDance-Ökosystem, eingeschränkter westlicher ZugangDreamina / BytePlus
Muse VideoVideo im Meta-Ökosystem#3 Text-zu-Video mit 1459Neuestes der Gruppe, dünnes ToolingMeta-AI-App
Veo 3.1Längere Produktions-ClipsNativer Ton, 1080p, starke physikalische Konsistenz#6 auf Arena Video, nicht der QualitätsführerGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboSchnelle Iteration zu niedrigeren KostenNatives 4K, 60fps, 15-Sekunden-Clips; Turbo am 17. Juni erschienenAußerhalb der Top 16 auf Arena Text-zu-VideoAb $10/Mon.
Luma Ray 3Fotorealistische SzenenStarker Realismus für LandschaftenKleinere CommunityKostenlos / ab $9.99/Mon.
Zweiter Platz und Alternativen: MiniMax H3 ist der Zweite und führt jetzt Arenas Bild-zu-Video-Board mit 1495,4 an, vor Gemini Omni 1.1 Flash mit 1488,5. Dreamina Seedance 2.0 ist Dritter und bleibt die Wahl für Bild-zu-Video mit Ton. Veo 3.1 ist die Wahl, wenn 10 Sekunden nicht reichen, und Alibabas Wan 3.0 das Modell, wenn das Ausgangsmaterial ein Dokument, eine Tabelle oder eine Präsentation ist. OpenAI hat die Sora-2-Endkunden-App am 26. April 2026 eingestellt, es bleibt nur die Entwickler-API, und zwar bis zum 24. September 2026. Die Abschaltdaten älterer Modelle verfolgen wir für jeden Anbieter in einer eigenen laufenden Liste.
Was sich diesen Monat geändert hat

Gemini Omni 1.1 Flash behält die Video-Krone, doch das Bild darum herum ist unordentlicher, als der Eintrag des Vormonats nahelegte. Es führt weiterhin Arenas Text-zu-Video-Board an, 1516 gegen 1513 für Gemini Omni Flash, und Arena gibt ihm ein Rangband von eins bis vier, es bleibt also ein Gleichstand, der über die Fähigkeiten entschieden wird. Zwei Dinge, die wir im August berichtet haben, haben sich geändert. Artificial Analysis hat ihr Video-Elo neu verankert, und das alte Trio 1239 / 1238 / 1235 existiert nicht mehr: Gemini Omni Flash führt dieses Board jetzt mit 1512,8 vor Wan 3.0 mit 1431,4 und MiniMax H3 mit 1407,7 an, und 1.1 Flash ist dort weiterhin gar nicht bewertet. Und MiniMax H3 hat mit 1495,4 die Spitze von Arenas Bild-zu-Video-Board übernommen und 1.1 Flash mit 1488,5 auf Rang zwei verdrängt, das erste Board, das diese Krone verloren hat.

Kategorie-Tipp, September 2026

Beste KI zum Programmieren

1
Claude Opus 5.5
Führt jeden Harness an
2
GPT-6 Astra
Beide Coding-Boards der Arena
3
Claude Fable 5.1
Zweiter auf den Harnesses

Die beste KI zum Programmieren ist Claude Opus 5.5, den Anthropic am 22. September veröffentlicht hat und der jeden Coding-Harness anführt, den wir verfolgen: den eigenen Terminal-Bench-4.0-Lauf von Artificial Analysis mit 59,6 % gegen 59,1 % für GPT-6 Astra, LiveBench Coding mit 89,3 gegen 80,4 und LiveBench Agentic Coding mit 71,7 gegen 57,3. Das gelingt ihm zu $4 / $20 pro 1M Tokens, weniger als die Hälfte des Listenpreises der beiden Modelle, die diese Tabelle im Vormonat anführten, bei Cache-Lesekosten von $0,20, und nach Anthropics eigenen Tests kostet eine typische Arbeitslast 40 % weniger als auf Claude Opus 5. Anthropics hauseigener Terminal-Bench-4.0-Lauf macht den Abstand noch größer, 66,4 % gegen die 57,9 %, die OpenAI für Astra angibt, dazu 54,4 % auf FrontierCode v1.1 und 57,8 % auf CursorBench 4.0. GPT-6 Astra behält beide Coding-Boards der Arena, WebDev mit 1793 und image-to-WebDev mit 1733, denn für Opus 5.5 gibt es noch überhaupt keine Arena-Stimmen, und das ist hier die ehrliche Teilung: OpenAI führt bei der menschlichen Präferenz, Anthropic auf jedem gemessenen Harness. Lesen Sie den halben Punkt Vorsprung auf Terminal-Bench vorsichtig, denn Anthropic selbst nennt für diesen Benchmark einen Standardfehler von etwa 2,6 Punkten, behandeln Sie die beiden dort also als gleichauf und lassen Sie die LiveBench-Boards und den Preis entscheiden. Claude Fable 5.1 ist Zweiter auf beiden Arena-Boards und Dritter auf den Harnesses. Alibabas Qwen3.8-Max-0902 hielt Arenas WebDev-Board Anfang September rund drei Tage und liegt jetzt mit 1662 auf Rang fünf. Bei den offenen Gewichten hat sich das Bild am 21. September geändert: Xiaomis MiMo-V2.6-Pro nimmt 34,8 % auf Terminal-Bench 4.0 unter schlichtem MIT bei $0,13 pro Index-Aufgabe, während GLM-5.3 mit 41,9 % weiterhin das stärkste offene Modell auf diesem Harness ist und Kimi K3 mit Rang sieben und 1658 das am höchsten platzierte offene Modell auf Arena WebDev bleibt, allerdings bei nur 12,6 % auf dem Harness. Artificial Analysis hat sowohl den Coding Index als auch den Coding Agent Index eingestellt, die beiden zusammengesetzten Coding-Rankings, die diese Seite zitierte, gibt es also nicht mehr.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Opus 5.5Bestes Programmieren insgesamt#1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) und #1 LiveBench Coding (89,3)Noch keine Arena-Stimmen, daher behält Astra beide Coding-Boards$4 / $20
GPT-6 AstraSpitze beider Coding-Boards der Arena#1 Arena WebDev (1793) und #1 image-to-WebDev (1733); 59,1 % Terminal-Bench 4.02,5-facher Preis von Opus 5.5 und dahinter auf jedem Harness$10 / $50
Claude Fable 5.1Höchster Gesamtwert vor Opus 5.5#2 auf beiden Coding-Boards der Arena; Intelligence Index 53,4; AA-Briefcase 167852,0 % Terminal-Bench 4.0; 2,5-facher Preis von Opus 5.5$10 / $50
Claude Opus 5Von Opus 5.5 abgelöst49,0 % Terminal-Bench 4.0 und #3 auf beiden Coding-Boards der ArenaKostet pro Token mehr als Opus 5.5 und liegt sieben Punkte darunter$5 / $25
Claude Fable 5Härteste langfristige agentische ArbeitIntelligence Index 49,6; 42,4 % Terminal-Bench 4.0; 1M KontextTeuerster pro Index-Aufgabe in dieser Tabelle mit $8,75; #6 auf Arena image-to-WebDev$10 / $50
Qwen3.8-Max-0902Kurzzeitiger Halter des WebDev-Boards#5 Code Arena: WebDev (1662); Intelligence Index 45,4; 2,4 Billionen Parameter, 1M KontextNur QwenCloud-API ohne Endkunden-Oberfläche; verlor die WebDev-Führung binnen Tagen$2 / $6
Kimi K3Am höchsten platziertes offenes Modell auf Arena#7 Arena WebDev (1658), die beste offene Platzierung dort; 2,8 Billionen/104 Mrd. aktivNur 12,6 % auf Terminal-Bench 4.0; 1,56 TB zum Selbsthosten$3 / $15
GPT-5.6 SolOpenAIs günstigeres FlaggschiffIntelligence Index 47,0; 39,9 % Terminal-Bench 4.0Von GPT-6 Sol abgelöst, das zum halben Preis höher liegt; Eval-Gaming von METR angemerkt$4 / $20
GPT-6 SolGünstiges GPT-6-Coding in CodexIntelligence Index 47,5 (v4.3.2) und 43,9 % Terminal-Bench 4.0, beides über GPT-5.6 Sol, zum halben PreisKeine Arena-Stimmen; nur in Codex und ChatGPT Work, nicht im Chat$2 / $10
Muse Spark 1.3Günstiges agentisches ProgrammierenIntelligence Index 48,1 bei $1,25 / $4,25 und $1,60 pro Index-Aufgabe33,3 % auf Terminal-Bench 4.0; die Coding-Siege stammen aus Metas eigener Grafik, gemessen an einer Max-Variante nur für Partner$1,25 / $4,25
Grok 4.7Günstiger Preis-Leistungs-Coder46,3 % CursorBench 4.0 und 71,0 % DeepSWE v1.1 nach SpaceXAIs eigenen Zahlen; Intelligence Index 46,324,7 % auf Terminal-Bench 4.0; Prompts ab 200K Tokens werden komplett zum doppelten Satz neu berechnet$2 / $6
Gemini 3.8 FlashAgentisches Programmieren in großem MaßstabIntelligence Index 40,9; 308,4 Ausgabetokens pro Sekunde19,7 % auf Terminal-Bench 4.0; Einführungspreis verdoppelt sich am 1. Januar 2027$0,75 / $3,75
GLM 5.3 FlashGünstigster ernsthafter Coder zum Selbsthosten32,8 % Terminal-Bench 4.0 bei $0,25 pro Index-Aufgabe; MIT, 320 Mrd./18 Mrd. aktivGLM-5.3 erreicht auf demselben Harness 41,9 %; kein EndkundenproduktOffene Gewichte (MIT)
MiMo-V2.6-ProHöchster offener Intelligence Index46,3 auf v4.3.2 und 34,8 % Terminal-Bench 4.0 bei $0,13 pro Index-Aufgabe; MIT, 1,02 Billionen/42 Mrd. aktivAm 21. September veröffentlicht, daher noch keine Arena-Stimmen und keine unabhängige Historie$0,435 / $0,87
Zweiter Platz und Alternativen: GPT-6 Astra ist der Zweite und führt weiterhin beide Coding-Boards der Arena an, Claude Fable 5.1 ist dort Zweiter und auf den Harnesses Dritter, und Claude Opus 5 wird nun von einem Modell abgelöst, das zugleich günstiger und besser ist. Bei den offenen Gewichten ist Xiaomis MiMo-V2.6-Pro der neue Spitzenreiter bei Wert und Kosten, GLM-5.3 ist auf dem Terminal-Bench 4.0 von Artificial Analysis am stärksten, Kimi K3 bleibt das am höchsten platzierte offene Modell auf Arenas WebDev-Board, und GLM 5.3 Flash ist die Wahl für Teams, die selbst hosten, zu $0,25 pro Index-Aufgabe unter schlichtem MIT. In IDEs ist Cursor mit Claude weiterhin die beliebteste Kombination, und Claude Code ist die natürliche Wahl, wenn Sie im Terminal leben.
Was sich diesen Monat geändert hat

Die Coding-Krone ging an Claude Opus 5.5, vier Tage nachdem sie an GPT-6 Astra gegangen war. Anthropic hat ihn am 22. September veröffentlicht, und er führt jeden Coding-Harness an, den wir verfolgen: 59,6 % gegen Astras 59,1 % auf dem eigenen Terminal-Bench-4.0-Lauf von Artificial Analysis, 89,3 gegen 80,4 auf LiveBench Coding und 71,7 gegen 57,3 auf LiveBench Agentic Coding, zu $4 / $20 gegen $10 / $50. Astra behält beide Coding-Boards der Arena, weil Opus 5.5 dort noch keine Stimmen hat, es ist also eine Teilung und kein Durchmarsch. Der Terminal-Bench-Vorsprung beträgt einen halben Punkt gegenüber einem Standardfehler, den Anthropic mit etwa 2,6 angibt, entschieden wird also tatsächlich über die LiveBench-Boards und den Preis. Claude Opus 5 verlässt das Podium: Opus 5.5 kostet pro Token weniger, braucht weniger Tokens und liegt sieben Punkte höher im Intelligence Index, was das alte Preisargument für Opus 5 nicht bloß schwächt, sondern hinfällig macht. Xiaomis MiMo-V2.6-Pro und SpaceXAIs Grok 4.7 kommen beide in die Tabelle, und alle Indexwerte auf dieser Seite sind auf v4.3.2 umgestellt, weshalb diese Zahlen leicht unter denen des Vormonats liegen. GPT-6 Sol kommt am selben Tag zu $2 / $10 in die Tabelle: Artificial Analysis misst 47,5 auf dem Index und 43,9 % auf Terminal-Bench 4.0, in beidem über GPT-5.6 Sol und zum halben Preis, aber weit hinter Opus 5.5, und es erreicht Entwickler über Codex statt über das Chatfenster.

Kategorie-Tipp, September 2026

Beste KI für Kreativität

1
Grok 4.7
Wenigste Leitplanken
2
Claude Fable 5
Prosa höchster Qualität
3
Kimi K3
Fiktion und Stimme

Die beste KI für ungefilterte, angesagte kreative Arbeit ist Grok 4.7, und wir wollen genau sagen, warum. Dieser Tipp betrifft die Produktlinie, nicht die Qualität der Prosa. Grok hat die wenigsten Inhaltsbeschränkungen aller Spitzenmodelle und als einziges eine native Echtzeit-Anbindung an X, womit es das eine Modell ist, das sich auf kantige, tagesaktuelle oder bewusst provokante Briefings einlässt, die die anderen ablehnen. Lesen Sie die Verfügbarkeit genau: SpaceXAI hat Grok 4.7 am 21. September für die Grok-API, Cursor, Grok Build, fremde Harnesses und Cloud-Router veröffentlicht, und die Ankündigung sagt nichts über die Endkunden-App, die SuperGrok- und X-Premium+-Abonnenten für $30 im Monat weiterhin Grok 4.6 liefert. Der beste Schreiber ist es nicht. Arena hat Grok 4.6 inzwischen bewertet, es steht auf Rang 32 des Boards für kreatives Schreiben, vor Grok 4.5 auf Rang 36, aber hinter dem älteren Grok 4.20-beta1 auf Rang 23. EQ-Bench hat weder 4.6 noch 4.7 bewertet, und dort steht Grok 4.5 mit 1576,0 auf Rang 46, inzwischen also knapp vor Grok 4.20-beta statt dahinter. Da SpaceXAI beide Releases auf Programmieren und agentische Arbeit statt auf Prosa ausgerichtet hat, nehmen wir nicht an, dass 4.7 hier etwas bewegt hat. Wenn Sie allein nach Ausgabequalität wählen, führt Claude Fable 5 weiterhin Arenas Board für kreatives Schreiben an, während EQ-Bench GPT-6 Astra mit 2163,9 auf Platz eins setzt, Claude Fable 5.1 auf zwei und Kimi K3 auf vier. Wählen Sie Grok für das, was es Sie machen lässt, nicht dafür, wie gut es schreibt.

ModellAm besten fürStärkeSchwächePreis
Grok 4.7Ungefiltert, meinungsstark, am PulsWenigste Inhaltsbeschränkungen, natives Echtzeit-Grounding über XKein Board für kreatives Schreiben hat ihn bewertet; Grok 4.6 steht auf #32 bei Arenas kreativem Schreiben$2 / $6 API; SuperGrok-App für $30 im Monat, weiterhin auf 4.6
Claude Fable 5Kreative Prosa höchster Qualität#1 Arena Creative Writing, #1 LiveBench LanguageVorsichtige Leitplanken bei kantigen Briefings$10 / $50 API
Kimi K3Fiktion und eigene Stimme#4 EQ-Bench Creative Writing mit 2070,6Bei Arenas kreativem Schreiben nur #27$3 / $15
Claude Opus 5Strukturierte Langform-KreativitätHält lange Threads und lektoriert sich selbst; Intelligence Index 50,8, hinter Claude Fable 5.1 und GPT-6 AstraVorsichtigstes der Gruppe$20/Mon. Pro; $5 / $25 API
Gemini 3.1 ProMultimodal kreativStarke Text-, Bild- und VideoketteQuoten in der Gemini-AppKostenlos / $2.00-$4.00 API Input
Grok Imagine (Spicy Mode)NSFW / kreativ für ErwachseneFreizügigste BildgenerierungNischen-Anwendungsfall$30/Mon. SuperGrok
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der richtige Tipp, wenn Qualität wichtiger ist als Freiheit, Kimi K3 ist der Tipp für Fiktion, und Claude Opus 5 ist der Tipp für kreative Projekte, die sich über viele Runden ziehen. Für kreative Arbeit für Erwachsene ist Grok Imagine Spicy Mode weiterhin die einzige Option auf Frontier-Niveau.
Was sich diesen Monat geändert hat

Grok behält diesen Tipp, jetzt mit Grok 4.7, den SpaceXAI am 21. September auf einem neuen, größeren Basismodell veröffentlicht hat. An der Freizügigkeit des Produkts und am Live-Zugang zu X hat sich nichts geändert, und genau darauf beruht der Tipp. Das Modell darunter ist erneut stärker, 46,3 im Intelligence Index gegen 44,3 für Grok 4.6, doch dieser Zuwachs landete in Programmierung und agentischer Arbeit statt in Prosa, und kein Board für kreatives Schreiben hat 4.7 bewertet. Eine Korrektur zum Eintrag des Vormonats: Arena hat Grok 4.6 inzwischen bewertet, er steht auf Rang 32 ihres Boards für kreatives Schreiben, die Aussage, keines der Boards habe ihn bewertet, gilt also nicht mehr. Beachten Sie auch die geteilte Verfügbarkeit, denn für diese Kategorie zählt sie: 4.7 läuft in der API, in Cursor und in Grok Build, während die Grok-App für $30 im Monat, um die es beim Freizügigkeitsargument eigentlich geht, weiterhin 4.6 liefert. Claude Fable 5 bleibt das Modell, zu dem man greift, wenn man den besseren Text will.

Kategorie-Tipp, September 2026

Beste KI für Genauigkeit & Recherche

1
Claude Fable 5.1
Höchste faktische Genauigkeit
2
Gemini 3.1 Pro
Bestes Preis-Leistung, $0,52/Aufgabe
3
GPT-5.6 Sol
Neuartiges Reasoning

Die beste KI für Genauigkeit und Recherche ist Claude Fable 5.1, das mit 67 % auf AA-Omniscience die höchste faktische Genauigkeit hält, die Artificial Analysis gemessen hat. Das ist genau die Spalte, nach der diese Kategorie entschieden wird, und sie hat am 22. September einen harten Test überstanden: Claude Opus 5.5 schlug Fable 5.1 in fast allem anderen, darunter Humanity's Last Exam mit 61,4 % zu 59,1 % und der halluzinationsgewichtete AA-Omniscience-Index mit 46,4 zu 43,5, doch bei der reinen faktischen Genauigkeit steht es 66 % zu 67 % für Fable 5.1. Behandeln Sie diesen einen Punkt für sich als Gleichstand und lesen Sie beide zusammen: Opus 5.5 ist die bessere Wahl, wenn eine falsche Antwort schlimmer ist als keine, Fable 5.1, wenn Sie möglichst viele Fakten richtig wollen. Der Preis-Leistungs-Tipp ist Gemini 3.1 Pro, und es bleibt das Modell, zu dem wir greifen, wenn die Kosten zählen. Sein stärkstes Ergebnis liefert es auf ARC-AGI-1 von ARC Prize, wo es 98 % erreicht und das menschliche Panel einholt, und das zu $0,52 pro Aufgabe, auch wenn Claude Fable 5 und GPT-6 Astra das Panel inzwischen mit 98,5 % überholt haben. Dazu kommt natives Google-Search-Grounding, genau das, was man braucht, wenn die Antwort aktuell und nicht bloß plausibel sein soll. Es erreicht außerdem 94,1 % auf GPQA Diamond, wo GPT-5.6 Sol nun gleichzieht statt zurückzuliegen, und 44,4 % auf Humanity's Last Exam, sowie 46,44 auf dem HLE-Board von Scale SEAL, das jetzt Claude Fable 5 mit 55,5 % anführt. Zwei ehrliche Vorbehalte. Bei gegroundeter Suche führt Arenas Such-Board OpenAI an, nicht Google oder Anthropic: GPT-5.6 Sol steht mit 1257 an der Spitze, Claude Fable 5 auf fünf und Gemini 3.1 Pro mit Grounding auf neun. Und beim neuartigen Schlussfolgern sitzt die Krone ganz woanders, denn GPT-6 Astra führt sowohl ARC-AGI-2 als auch ARC-AGI-3 an. Wir haben diese Krone nicht an Claude Opus 5 vergeben, weil Artificial Analysis seine Halluzinationsrate mit 50 % misst und es auf AA-Omniscience deutlich unter beide Fable-Modelle setzt.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
Claude Fable 5.1Höchste gemessene faktische Genauigkeit67 % faktische Genauigkeit auf AA-Omniscience, der höchste je von Artificial Analysis gemessene Wert, einen Punkt über Claude Opus 5.5Keine günstige Stufe; auf Arenas Such-Board unbewertet; Opus 5.5 führt Humanity's Last Exam und den AA-Omniscience-Index an$10 / $50
Gemini 3.1 ProBestes Preis-Leistung, günstige Faktenarbeit98 % ARC-AGI-1 (Gleichstand mit dem menschlichen Panel) bei $0.52/Aufgabe, 94,1 % GPQA (von Sol egalisiert)ARC-AGI-2 77,1 % rangiert jetzt ~14.; #9 auf Arena Search$2.00-$4.00 / $12.00-$18.00 (gestaffelt)
Claude Fable 5Grundierte Suche#5 auf Arenas Such-Leaderboard, hinter GPT-5.6 SolKeine einzelne günstige Stufe$10 / $50 (Fable 5)
GPT-5.6 SolNeuartiges Reasoning#3 ARC-AGI-2 mit 92,5 %, hinter GPT-6 Astra (95 %) und Claude Opus 5.5 (93,3 %)Scheming von METR gemeldet$4 / $20
Claude Opus 5Schwerste unbekannte Probleme#1 ARC-AGI-3 mit 30 %, ~3,75-mal das nächste Modell (ARC Prize)Artificial Analysis misst eine Halluzinationsrate von 50 %$5 / $25
Qwen 3.7 MaxFrontier-Genauigkeit zum Preis-Leistungs-Verhältnis92,4 GPQA Diamond, 200 kostenlose Anfragen/TagNur API, kein Chat-Frontend$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Opus 4.6Ehrlichkeit unter Druck#1 auf Scale SEALs MASK-Board mit 96,28; Anthropic hält die Top 5Als Flaggschiff abgelöstLegacy-Anthropic-Modell
Zweitplatzierte und Alternativen: Gemini 3.1 Pro ist der Zweitplatzierte und der Preis-Leistungs-Tipp bei $0,52 pro Aufgabe mit Google-Search-Grounding, GPT-5.6 Sol ist der Zweitplatzierte für neuartiges Denken, Claude Opus 4.6 dominiert das Board für Ehrlichkeit unter Druck, und Qwen 3.7 Max ist der Preis-Leistungs-Tipp an der Spitze.
Was sich diesen Monat geändert hat

Die Genauigkeits-Krone bleibt bei Claude Fable 5.1, und sie wurde hart geprüft. Claude Opus 5.5 kam am 22. September und nahm Humanity's Last Exam mit 61,4 % gegen 59,1 % sowie den halluzinationsgewichteten AA-Omniscience-Index mit 46,4 gegen 43,5, doch diese Kategorie wird über die reine faktische Genauigkeit entschieden, und dort steht Fable 5.1 weiterhin bei 67 % gegen 66 % für Opus 5.5. Das ist ein Punkt Unterschied, deshalb sagt der Block jetzt offen, dass sich die beiden aufteilen, statt so zu tun, als räume Fable 5.1 alles ab: Nehmen Sie Opus 5.5, wenn eine falsche Antwort schlimmer ist als keine, und Fable 5.1, wenn Sie möglichst viele Fakten richtig wollen. Dazu zwei Korrekturen am Eintrag des Vormonats. Dort stand, GPT-5.6 Sol führe ARC-AGI-2 und Claude Opus 5 führe ARC-AGI-3 an; beide führt seit dem Start am 3. September GPT-6 Astra, wie der Block zum Problemlösen bereits sagte, und dieser Widerspruch ist beseitigt. Und ARC-AGI-1 ist über das menschliche Panel hinausgezogen: Claude Fable 5 und GPT-6 Astra erreichen beide 98,5 %, wo das Panel von 2025 bei 98 % liegt, die 98 % von Gemini 3.1 Pro zu $0,52 pro Aufgabe stimmen also weiterhin und bleiben das Preisargument, sind aber nicht mehr die Spitze dieses Boards. Die andere Genauigkeitsbewegung des Monats ist GPT-6 Sol, und sie passiert unterhalb der Krone: Artificial Analysis misst seine Halluzinationsrate mit 60 % gegen 92 % bei GPT-5.6 Sol, während die reine Faktengenauigkeit von 59 % auf 55 % nachgibt, was seinen AA-Omniscience-Index von 22,0 auf 27,1 hebt.

Kategorie-Tipp, September 2026

Beste KI zur Problemlösung

1
GPT-6 Astra
Reasoning-Spitze
2
Claude Opus 5
Agentische Ketten
3
GPT-5.6 Sol
Günstiges STEM-Flaggschiff

Die beste KI für harte Problemlösung ist GPT-6 Astra, die GPT-5.6 Sol die Reasoning-Boards binnen Tagen nach dem Start abgenommen hat. Sie führt LiveBench Reasoning mit 92,65 und ARC-AGI-2 mit 95 % an, der höchste Wert, den je jemand gegen das 100-%-Humanpanel dieses Boards erreicht hat, und liegt auf LiveBench Mathematics mit 96,81 hinter den 97,08 von Claude Opus 5.5 und den 97,01 von Claude Fable 5.1 auf Platz drei. Sie meldet außerdem 97,6 % auf FrontierMath Tier 4 v2, eine Zahl, die man zusammen mit Epoch AIs Offenlegung lesen sollte, dass OpenAI den Benchmark finanziert hat und exklusiven Zugang zu einem Teil davon hält. Der Haken sind Preis und Reichweite: $10 / $50 pro 1M Tokens gegenüber $4 / $20 bei Sol, und es braucht einen kostenpflichtigen ChatGPT-Plan. GPT-5.6 Sol ist die günstige Alternative, auf beiden LiveBench-Boards Dritter mit 96,20 und 91,65 und auf ARC-AGI-2 Dritter, seit Claude Opus 5.5 dort 93,3 % erreicht hat. GPT-6 Sol kostet die Hälfte, $2 / $10, und liegt auf dem Index von Artificial Analysis darüber, doch kein Reasoning-Board hat es bisher bewertet. Qwen 3.7 Max ist der Spartipp für Wettbewerbsaufgaben mit 97,1 auf dem HMMT-Index vom Februar 2026 und 44,5 auf Apex, mit 200 kostenlosen Anfragen pro Tag. Claude Opus 5 bleibt die Alternative für lange agentische Reasoning-Ketten, auch wenn Astra ihm ARC-AGI-3 ebenfalls abgenommen hat.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
GPT-6 AstraSchwerste Mathematik, Wissenschaft und Reasoning#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Braucht einen kostenpflichtigen ChatGPT-Plan; 2,5-facher Sol-Preis$10 / $50
Claude Opus 5Lange agentische Reasoning-Ketten#2 AA-Briefcase (1673) und #2 GDPval-AA v2.1 (1708); 30,2 % ARC-AGI-3Astra führt jetzt ARC-AGI-3 an; 50 % Halluzinationsrate$5 / $25
GPT-5.6 SolGünstiges STEM-Flaggschiff#3 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) und Reasoning (91,65)FrontierMath weiterhin unveröffentlicht; Scheming von METR markiert$100/Mon. ChatGPT Pro; API $4 / $20
GPT-6 SolDieselbe Stufe zum halben PreisIntelligence Index 47,5 (v4.3.2) gegen 47,0 bei GPT-5.6 Sol, zu $1,06 pro Index-Aufgabe gegen $1,99Weder LiveBench noch ARC Prize hat es bewertet, es hält hier also kein Board$2 / $10
Qwen 3.7 MaxWettbewerbsmathematik mit knappem Budget97,1 HMMT 2026 Feb, 44,5 Apex, 200 kostenlose Anfragen/TagNur API$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Fable 5Mathematik in einem Coding-Workflow#1 auf Arenas Mathe-Unterkategorie (1543), 96,0 LiveBench MathematicsTeuerste Option hier$10 / $50
GLM 5.3 FlashOpen-Weight-ProblemlösungIntelligence Index 41,8 unter MIT, fast acht Punkte über GLM-5.2 bei weniger als der halben Größe; 320B/18B aktiv, 1M KontextBraucht einen Multi-GPU-Server, keine Workstation; GLM 5.3 liegt nach Z.ais eigenen Zahlen höher und ist seit dem 28. August herunterladbar, aber in mehr als doppelter Größe und unter einer eigenen LizenzOpen weights (MIT)
Zweitplatzierte und Alternativen: GPT-5.6 Sol ist der Zweitplatzierte und der Preis-Leistungs-Tipp zu $4 / $20, Claude Opus 5 ist der naheliegende Tipp für langkettiges agentisches Reasoning, Qwen 3.7 Max ist der Spartipp, und GLM 5.3 Flash ist der Open-Weight-Tipp. Unser eigener Leitfaden zur besten KI für Mathe geht die Aufteilung nach Aufgabe und die kostenlosen Optionen durch.
Was sich diesen Monat geändert hat

Die Krone für Problemlösung ging an GPT-6 Astra, das die Boards, über die diese Kategorie entschieden wird, binnen Tagen nach dem Start am 3. September übernommen hat. Es führt LiveBench Reasoning mit 92,65 gegen 91,65 von GPT-5.6 Sol an, nimmt ARC-AGI-2 mit 95 % gegen Sols 92,5 % und hat Claude Opus 5 auf ARC-AGI-3 verdrängt, wo seine 62,7 % auf dem Standard-Harness die 30,2 % von Opus 5 schlagen. Lies die ARC-AGI-3-Zahlen genau: Dieses Board misst menschengleiche Handlungseffizienz in unbekannten Umgebungen statt gelöster Aufgaben, und die viel zitierten 98,6 % stammen von einem Provider-Adapter-Harness, nicht vom Standard-Harness. Sol fällt auf beiden LiveBench-Boards auf Platz drei, bleibt aber die günstige Alternative zu $4 / $20 gegenüber Astras $10 / $50, und LiveBench Mathematics hat seither zweimal den Besitzer gewechselt, zu Claude Fable 5.1 mit 97,01 und am 22. September zu Claude Opus 5.5 mit 97,08. Danach haben sich zwei Dinge bewegt. ARC Prize hat Claude Opus 5.5 auf ARC-AGI-2 mit 93,3 % bewertet, was GPT-5.6 Sol auf diesem Board auf Rang drei schiebt, und am 22. September kam GPT-6 Sol zu $2 / $10, der Hälfte des Preises der 5.6-Stufe, mit höherem Intelligence Index, aber noch ohne eigene Wertung bei LiveBench oder ARC Prize.

Kategorie-Tipp, September 2026

Bester KI-Agent

1
Gemini Spark
In der Cloud
2
Claude Cowork
Auf dem Desktop
3
ChatGPT Codex
Coding-Agent

Der beste KI-Agent ist Gemini Spark, wenn du den Agenten in der Cloud willst, und Claude Cowork, wenn du ihn auf dem Desktop willst. Das sind gemeinsame Tipps und kein erster und zweiter Platz: Spark läuft in einer Google-Cloud-VM und arbeitet deshalb weiter, während dein Laptop zu ist, eng verzahnt mit Gmail, Docs und seit Anfang September auch Google Fotos; Cowork läuft auf deinem Mac oder Windows-Rechner und steuert deine lokalen Apps und deinen Bildschirm. Kein unabhängiges Board misst die beiden Produkte gegeneinander, die Wahl hängt also davon ab, wo die Arbeit stattfinden muss, nicht davon, wer höher punktet. Auch der Preis entscheidet nicht mehr: Spark erreicht jetzt die Stufe Google AI Pro zu $19.99/Monat in den USA und in über 160 weiteren Ländern, und Cowork ist ohne Aufpreis in jedem kostenpflichtigen Claude-Plan ab $20/Monat enthalten. ChatGPT Codex Mobile (14. Mai) ist die Alternative für Coding-Agent-Arbeit und Browser-Agenten der OpenAI-Operator-Klasse für Web-Aufgaben. Lies den vollständigen Vergleich Gemini Spark vs Claude Cowork.

AgentAm besten fürWo er läuftStärkePreis
Gemini Spark24/7-Cloud-Aufgaben, Workspace-WorkflowsGoogle-Cloud-VM (immer an)Erster echter 24/7-Agent, tiefe Workspace-IntegrationAb $19.99/Mon. Google AI Pro
Claude CoworkDesktop, App-Steuerung, Design + CodeDein Mac-/Windows-DesktopSteuert lokale Apps, sieht deinen Bildschirm$20/Mon. Claude Pro
ChatGPT Codex MobileCoding-Agent auf dem HandyOpenAI-Cloud + iOS/AndroidDiffs freigeben und Arbeit vom Handy umleitenIn ChatGPT-Plänen enthalten
Grok Agentic (Grok 4.7)Echtzeit-Recherche, X-ScrapingSpaceXAI-CloudNative X-Integration; GDPval-AA v2.1 Elo 1695, Vierter unter den eigenständigen Modellen$30 im Monat SuperGrok, weiterhin auf 4.6
OpenAI Operator-KlasseBrowser-Aufgaben, Web-FormulareOpenAI-Cloud + dein BrowserWeb-AutomatisierungChatGPT Pro
Zweitplatzierte und Alternativen: Gemini Spark und Claude Cowork sind gemeinsame Tipps, getrennt danach, wo der Agent läuft, kein erster und zweiter Platz. ChatGPT Codex Mobile ist der Tipp für Coding-Agenten, und Grok Agentic ist der Nischentipp für Echtzeit-Recherche. Google AI Ultra zu $99.99 oder $199.99 im Monat kauft bei Spark inzwischen höhere Nutzungslimits statt Zugang, der auf der Pro-Stufe zu $19.99 beginnt.
Was sich diesen Monat geändert hat

Es ist kein neues Endkunden-Agentenprodukt erschienen, die Kronen wandern also nicht: Gemini Spark (Cloud) und Claude Cowork (Desktop) bleiben gemeinsame Tipps, getrennt danach, wo der Agent läuft. Spark hat sich dennoch ausgeweitet, erreichte den Google-AI-Pro-Tarif für $19,99 im Monat und bekam Google Fotos, wo es suchen, bearbeiten, kuratieren und geplante Abläufe ausführen kann. Die Modellebene darunter hat sich stark bewegt, und das meiste davon am 22. September. Claude Opus 5.5 führt jetzt beide agentischen Boards an, die Artificial Analysis publiziert: AA-Briefcase v1.1 mit 1822 gegen 1678 für Claude Fable 5.1 und 1673 für Claude Opus 5 sowie GDPval-AA v2.1 mit 1846 gegen 1735 und 1708. Es zieht außerdem auf Terminal-Bench 4.0 mit GPT-6 Astra gleich, zu $4 / $20 gegen $10 / $50, was es zum Modell macht, auf dem die meisten Teams nun aufbauen sollten, anstelle der Opus-5-Empfehlung, die dieser Block trug. Arenas Agent Arena hat es nicht bewertet, und dort führt weiterhin Claude Fable 5.1 die Aufgabenerfüllung mit 19,8 % an, GPT-6 Astra folgt mit 17,7 %, DeepSeek V4.1-Flash ist Dritter und Claude Opus 5 Vierter. Der andere Bewegungspunkt ist SpaceXAIs Grok 4.7 (21. September): 1695 auf GDPval-AA v2.1 und 1657 auf AA-Briefcase bringen ihn auf Rang vier und sieben, auf beiden über GPT-6 Astra, auch wenn er in die API, in Cursor und in Grok Build geht statt in ein Endkunden-Agentenprodukt. Metas Muse Spark 1.3 liegt auf GDPval-AA v2.1 mit 1674 auf Rang fünf unter den eigenständigen Modellen, also unter Grok 4.7 statt darüber wie im Vormonat berichtet, und Scale SEAL hat weiterhin nur das ältere 1.1 bewertet, das dessen MCP-Atlas-Board zur Werkzeugnutzung mit 88,1 anführt. GLM 5.3 Flash (26. August, MIT) bleibt das offene Agentenmodell, das wir hosten würden, mit AutomationBench 48,8 auf Z.ais eigener Grafik, wo Claude Opus 4.8 auf 41,0 kommt; beim Signal für Aufgabenerfüllung der Agent Arena steht GLM-5.2 auf Rang siebzehn und Kimi K3 auf Rang fünf, das am höchsten platzierte offene Modell ist DeepSeek V4.1-Flash auf Rang drei.

Fello AI auf Mac, iPhone und iPad
Alle Top-KI-Modelle, eine App

Die führenden Modelle wie ChatGPT, Claude und Gemini, zusammen auf Mac, iPhone und iPad.

Kostenlos starten, 4,7★ über 27.000+ Rezensionen.

Fello AI laden

Anwendungsfall-Leitfaden, September 2026

Beste KI für Studierende

1
GPT-5.6 Luna
Essays & Recherche
2
Gemini 3.6 Flash
STEM + PDFs
3
Claude Sonnet 5
Schreiben & Lektorat

Die beste KI für Studierende ist GPT-5.6 Luna in ChatGPT für allgemeine Studienarbeit und Gemini 3.6 Flash in der Gemini-App für STEM und multimodales Lernen, mit Qwen 3.7 Max als API-Alternative für schwerere Aufgabensätze (200 kostenlose Anfragen pro Tag) und Claude Opus 5 als Alternative für das Lektorat von Essays. Die meisten Studierenden müssen nicht zahlen, und die kostenlose Stufe wurde am 6. August besser: GPT-5.6 Luna wurde zum Standardmodell für ChatGPT Free und Go, mit unbegrenzten Textchats und einem Think-Button für schwerere Fragen, während Datei-Uploads und Bildwerkzeuge weiterhin begrenzt bleiben. Am 22. September hat OpenAI für Free- und Go-Nutzer GPT-6 Luna in der ChatGPT-Desktop-App ergänzt, ein Modell der aktuellen Generation auf der Gratisstufe schon am Starttag, auch wenn es auf dem Index von Artificial Analysis dieselben 37,3 erreicht wie GPT-5.6 Luna. Gemini 3.6 Flash ist weiterhin das, was die kostenlose Gemini-App ausliefert, Claude Sonnet 5 ist der kostenlose Claude-Standard, und DeepSeek V4 ist auf der Chat-Seite von DeepSeek kostenlos. Luna ist das günstigste und nicht das stärkste Mitglied der GPT-5.6-Familie, greif also zum Think-Button oder wechsle zu GPT-5.5, wenn ein Essay mehr Sorgfalt braucht. Für schrittweises Arbeiten an der härtesten Mathematik ist GPT-5.6 Sol das kostenpflichtige Flaggschiff von OpenAI, und GPT-6 Astra meldet jetzt 97,6 % auf FrontierMath Tier 4 v2 gegenüber den verifizierten 39,6 % von GPT-5.5 Pro, wobei Astra noch nicht im kostenlosen ChatGPT-Tarif verfügbar ist; Qwen 3.7 Max ist die Preis-Leistungs-Alternative mit 97,1 im HMMT-Index Februar 2026 und API-Preisen von $1,25 / $3,75 in der aktuellen 50%-Aktion ($2,50 / $7,50 Liste).

AufgabeBestes ModellWarumKostenlos?Alternative
Essays & StudienarbeitGPT-5.6 LunaKostenloser Standard in ChatGPT seit 6. August; unbegrenzte Textchats, dazu GPT-6 Luna in der Desktop-App seit 22. SeptemberJaClaude Sonnet 5 (Claude kostenlos)
STEM-ProblemlösungGPT-5.6 Sol / Qwen 3.7 MaxKostenpflichtiges STEM-Flaggschiff; Astra meldet 97,6 % FrontierMath Tier 4 v2 / 97,1 HMMT Feb 2026Pro kostenpflichtig / Qwen API kostenpflichtigGemini 3.6 Flash (kostenlos)
Recherche & GenauigkeitGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, native Google-Search-GrundierungJa (Gemini-App)Claude Opus 5
Schreib-LektoratClaude Sonnet 5Kostenlos und Standard auf claude.ai; Claude Fable 5 ist der QualitätsführerJa (Claude kostenlos)Claude Fable 5
Multimodales Lernen (PDFs, Slides, Bilder)Gemini 3.6 Flash1M Kontext, kostenlos in der Gemini-AppJaNotebookLM (Google)
Zweitplatzierte und Alternativen: Claude Sonnet 5 (kostenlos) ist der Zweitplatzierte fürs Essay-Schreiben und -Lektorat. Gemini 3.6 Flash (kostenlos) ist der Zweitplatzierte fürs multimodale Lernen und die PDF-Aufnahme. DeepSeek V4 ist der Zweitplatzierte für die Problemlösung mit striktem Null-Kosten-Budget.
Was sich diesen Monat geändert hat

Die kostenlose Stufe ist das, was sich in diesem Leitfaden bewegt hat. Am 6. August machte OpenAI GPT-5.6 Luna zum Standardmodell für ChatGPT Free und Go und gab beiden unbegrenzte Textchats plus einen Think-Button für schwerere Fragen, sodass die kostenlose Wahl jetzt Luna statt GPT-5.5 ist, das wählbar bleibt, wenn ein Essay mehr Sorgfalt braucht. Datei-Uploads, Bilder und andere Werkzeuge sind weiterhin begrenzt. Auf der Google-Seite hat sich nichts bewegt: Gemini 3.8 Flash erschien am 2. September, erreicht kostenlose Nutzer aber nur über AI Studio und die API, sodass die kostenlose Gemini-App weiterhin 3.6 Flash ausliefert und dieses die multimodale Zeile behält. GPT-6 Astra (3. September) ist das Modell, das man bei schweren Aufgabensätzen im Auge behalten sollte, mit gemeldeten 97,6 % auf FrontierMath Tier 4 v2 gegenüber den verifizierten 39,6 % von GPT-5.5 Pro, aber es setzt einen kostenpflichtigen ChatGPT-Plan voraus, und keine kostenlose Stufe enthält es. Die Gratisstufe hat sich am 22. September erneut bewegt: Free- und Go-Nutzer erreichen GPT-6 Luna jetzt in der ChatGPT-Desktop-App. Lies das als günstiger statt klüger, denn Artificial Analysis gibt ihm 37,3, gleichauf mit dem 5.6er-Build, und ARC Prize trennt die beiden auf ARC-AGI-2 um zwei Zehntelpunkte.

Anwendungsfall-Leitfaden, September 2026

Beste KI für Arbeit & Profis

1
GPT-5.6
Tägliche Wissensarbeit
2
Claude Opus 5
Programmieren & Schreiben
3
Gemini 3.1 Pro
Recherche & Briefings

Die beste KI für professionelle Arbeit ist GPT-5.6 (ChatGPTs Standard seit 9. Juli) für tägliche Wissensarbeit, Claude Opus 5 für Programmieren und Schreiben mit hohem Einsatz und Gemini Spark für 24/7-agentische Workflows. Die meisten Profis holen das meiste heraus, indem sie zwei bezahlte Abos betreiben (ChatGPT Plus zu $20/Monat plus Claude Pro zu $20/Monat, insgesamt $40/Monat), oder sie konsolidieren mit Fello AI zu $9.99/Monat für alle fünf Top-Modelle in einer Mac-/iOS-App. Für agentische Arbeit, die läuft, während du schläfst, ist Gemini Spark der einzige echte 24/7-Cloud-Agent, und seit dem 30. Juli erreicht er neben Google AI Ultra auch die Stufe Google AI Pro zu $19.99/Monat.

AnwendungsfallBestes ModellSchlüsselstatPreisAlternative
Tägliche WissensarbeitGPT-5.6ChatGPTs Standard seit 9. Juli; der Assistent, den die meisten öffnen können$20/Mon. ChatGPT PlusClaude Opus 5
ChatGPT Work & CodexGPT-6 SolIn ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu seit dem 22. September, in der API zu $2 / $10$20/Mon. ChatGPT PlusGPT-6 Luna für Mengenarbeit
Programmieren (proprietär)Claude Opus 5.5#1 Terminal-Bench 4.0 (59,6 %) und #1 auf beiden Coding-Boards von LiveBench, zu $4 / $20$20 im Monat Claude ProGPT-6 Astra, der beide Coding-Boards der Arena behält
Programmierung (kostengünstig)Qwen3.8-Max-0902#5 Code Arena: WebDev (1662), hinter GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 und dem älteren Qwen3.8-Max; nur API auf QwenCloud$2 / $6Qwen 3.7 Max; DeepSeek V4.1-Flash
Recherche & BriefingsGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, Google-GrundierungGoogle AI Pro / UltraClaude Opus 5
Harte Mathematik, Physik, FinanzmodellierungGPT-6 Astra#1 LiveBench Reasoning und ARC-AGI-2 (95 %); meldet 97,6 % FrontierMath Tier 4 v2$100/Mon. ChatGPT ProGPT-5.6 Sol; Qwen 3.7 Max
Immer-an-Agenten-WorkflowsGemini SparkErster 24/7-Cloud-AgentAb $19.99/Mon. Google AI ProClaude Cowork
Live-News, X-Kontext-KreativitätGrok 4.7Intelligence Index 46,3 + natives X-Grounding; die Grok-App liefert weiterhin 4.6$30 im Monat SuperGrokGemini 3.1 Pro
All-in-one-KonsolidierungFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/Mon.Jeden Anbieter separat bezahlen
Zweiter Platz und Alternativen: Für die meisten professionellen Teams ist Claude Opus 5.5 der Zweite hinter GPT-5.6 für die tägliche Arbeit und zugleich der Coding-Führer auf jedem Harness zu $4 / $20, während GPT-6 Astra auf den stimmenbasierten Coding-Boards Zweiter ist. Gemini 3.1 Pro ist der Zweite für recherchelastige Rollen, und Gemini Spark ist die einzigartige Wahl, wenn Sie einen Cloud-Agenten an lange Aufgaben setzen können.
Was sich diesen Monat geändert hat

Drei Starts fielen in die ersten drei Septembertage und ein vierter auf den 22. September, und der letzte verändert das Preisargument, auf dem dieser Block ruht. Claude Opus 5.5 führt den Intelligence Index von Artificial Analysis mit 57,6 auf v4.3.2 und beide agentischen Boards an, und das zu $4 / $20 gegen $5 / $25 für Claude Opus 5. Die Begründung, die dieser Block bisher trug, Teams sollten mit Opus 5 beginnen, weil er die Hälfte der besseren Modelle kostet, gilt nicht mehr: Opus 5.5 ist zugleich besser und günstiger, übernimmt also die Zeile für proprietäres Programmieren und ist das Modell, auf dem wir tägliche Arbeit aufbauen würden. Die Zeile für den Alltagsassistenten behält dennoch GPT-5.6, denn dort geht es um Reichweite statt um Punkte, und weder Opus 5.5 noch GPT-6 Astra ist ein Standard für Hunderte Millionen Menschen. Alibabas Qwen3.8-Max-0902 (2. September) behält die Zeile für kosteneffizientes Programmieren bei $2 / $6, ist aber nur über die QwenCloud-API und ohne Endkunden-Oberfläche verfügbar. GPT-6 Sol und GPT-6 Luna sind am 22. September genau in der Oberfläche gelandet, um die es in diesem Block geht: in ChatGPT Work und Codex, für Plus, Pro, Business, Enterprise und Edu, in der API zu $2 / $10 und $0,10 / $0,50, und nicht im gewöhnlichen Chatfenster.

Preisvergleich

KI-Modell-Preise im September 2026

Von kostenlosen Stufen für $0 bis zu Google AI Ultra für $199,99 im Monat. Der folgenreichste Preis in dieser Tabelle ist Claude Opus 5.5 mit $4 / $20, denn Anthropic hat am 22. September das am höchsten bewertete Modell, das ein unabhängiger Prüfer je gemessen hat, zu einem niedrigeren Listenpreis als sein Vorgängermodell veröffentlicht: Claude Opus 5 kostet $5 / $25, und die Cache-Lesekosten sinken um 60 % auf $0,20, wobei Anthropics eigene Angabe eine typische Arbeitslast 40 % günstiger als auf Opus 5 verortet. Das kehrt die Form um, die dieser Abschnitt das ganze Jahr hatte, in der das beste Modell zugleich das teuerste war. Claude Fable 5.1 und GPT-6 Astra stehen beide bei $10 / $50 und liegen beide jetzt darunter. Metas Muse Spark 1.3 kostet $1,25 / $4,25, unverändert über drei Leistungssprünge seit Juli, mit einer Contributor-Stufe zu $0,10 / $0,20 für alle, die Meta auf ihren Prompts trainieren lassen, und Grok 4.6 wie Grok 4.7 stehen bei $2 / $6, mit dem Vorbehalt, dass ein Prompt ab 200.000 Tokens die gesamte Anfrage mit $4 / $12 neu berechnet. Grok 4.7 ist auf dieser Seite der klarste Fall eines Preises, der sich nicht bewegt hat, während die Kosten es taten: Die Tokens kosten gleich viel, und eine Intelligence-Index-Aufgabe kostet $2,73 gegen $1,86 bei Grok 4.6, weil 4.7 dafür rund doppelt so viel Ausgabe erzeugt. Das günstige Ende hat sich zweimal bewegt. DeepSeek hob beide V4-Modelle am 16. August rund um das Vierfache an, was V4-Flash den Preis-Leistungs-Tipp kostete, und nahm das am 10. September größtenteils zurück: V4-Flash wurde eingestellt und V4.1-Flash trat an seine Stelle, zu $0,15 / $0,60 außerhalb der Spitzenzeiten und $0,30 / $1,20 zur Spitze. Unter den Modellen, die man nach Tokens kauft, bleibt der Tipp GLM 5.3 Flash, jetzt zum schlichten Listenpreis $0,15 / $0,50, seit die Einführungsaktion am 9. September auslief, denn Artificial Analysis misst dafür $0,25 pro Intelligence-Index-Aufgabe bei 41,8 Punkten gegen $0,27 bei DeepSeek für 39,5. Außerhalb der Spitzenzeiten sind beide beim Input gleichauf und GLM ist beim Output günstiger; zur Spitze gewinnt GLM beides. Ein offenes Modell schlägt beide bei den Kosten pro Aufgabe und ist vier Tage alt: Xiaomis MiMo-V2.6-Pro erledigt eine Index-Aufgabe für $0,13 bei 46,3 Punkten unter schlichtem MIT, allerdings müssen Sie dafür 1,02 Billionen Parameter selbst betreiben. An der Spitze ist der Preis-Leistungs-Tipp Metas Muse Spark 1.3, zu $1,60 pro Index-Aufgabe bei 48,1. Unter den geschlossenen Modellen hat GPT-6 Luna diesen Titel am 22. September übernommen, zu $0,10 / $0,50 nach Tokens und $0,07 pro Index-Aufgabe, dem günstigsten Wert pro Aufgabe auf dieser ganzen Seite; GPT-6 Sol ist genauso gefallen, von $4 / $20 auf $2 / $10, und liegt damit exakt auf dem Satz von Claude Sonnet 5, und OpenAI nennt beide Senkungen dauerhaft statt promotional. Eine tiefere Aufschlüsselung steht in unserem vollständigen KI-Preisvergleich.

ModellInput (pro 1M)Output (pro 1M)KontextKostenloser Zugang?
GPT-6 Astra$10.00$50.001.050.000 (max. Eingabe 922.000)Im Chat auf Pro, Business und Enterprise seit 4. September; Plus bekommt es in ChatGPT Work und Codex statt im Chat; kein Gratis-Tarif; in der API live
GPT-6 Sol$2.00$10.001.050.000 (max. Eingabe 922.000)ChatGPT Work & Codex auf Plus, Pro, Business, Enterprise und Edu seit 22. September; API; nicht im Chat
GPT-6 Luna$0.10$0.501.050.000 (max. Eingabe 922.000)Free und Go in der ChatGPT-Desktop-App; ChatGPT Work & Codex in bezahlten Tarifen; API; nicht im Chat
GPT-5.5$5.00$30.001M (400K in Codex)ChatGPT Free; API bezahlt
GPT-5.5 Pro$30.00$180.001MChatGPT Pro ab $100/Mon. ($200 Stufe mit höherer Nutzung)
GPT-5.6 Sol$4.00$20.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli); Aktionspreis mindestens bis 21. November 2026
GPT-5.6 Terra$2.00$12.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
GPT-5.6 Luna$0.20$1.20Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
Claude Opus 5.5$4.00$20.001MClaude Pro/Max/Team; API kostenpflichtig; Cache-Lesen $0,20
Claude Opus 5$5.00$25.001MClaude Pro/Max Standard; API bezahlt
Claude Opus 4.8$5.00$25.001MLegacy-Modell bei Anthropic; Pro/Max/API
Claude Fable 5.1$10.00$50.001MCache-Reads $0.25; in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits. Mythos 5.1 rechnet identisch ab, nur auf Einladung
Claude Fable 5$10.00$50.001MDauerhaft in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits
Claude Sonnet 5$2.00$10.001MClaude Free & Pro Standard; API bezahlt
Claude Sonnet 4.6$3.00$15.001MAPI bezahlt (abgelöst durch Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MEingeschränkte Gemini-App; API bezahlt
Gemini 3.8 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MAI Studio, Antigravity, Gemini Enterprise + bezahlte API; in der Gemini-App für AI Pro/Ultra berichtet
Gemini 3.7 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MAI Studio, Android Studio, Antigravity + bezahlte API; in der Gemini-App nur über Spark (AI Pro/Ultra, ohne EWR/UK/CH/Nigeria)
Gemini 3.6 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MStandard der kostenlosen Gemini-App; AI Studio; kostenlose API-Stufe + bezahlte API
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; kostenlose API-Stufe + bezahlte API
Qwen3.8-Max-0902$2.00 ($0.17 expliziter Cache-Hit, $0.25 impliziter)$6.001M (128K Ausgabe)Nur QwenCloud-API; kein Consumer-Chat, keine offenen Gewichte
Qwen 3.7 Max$1.25 Promo / $2.50 Liste$3.75 Promo / $7.50 Liste1M200 kostenlose Anfragen/Tag; API bezahlt darüber hinaus
MiniMax M3$0.30 (50 % Rabatt auf $0.60)$1.20 (≤512K)1MOpen weights; Hosting-Kosten fallen an
LongCat-2.0AnbieterabhängigAnbieterabhängig1MOpen weights (MIT); Hosting-Kosten fallen an
NVIDIA Nemotron 3 UltraAnbieterabhängigAnbieterabhängig1MOpen weights (OpenMDW); Hosting-Kosten fallen an
Qwen 3.5 (Open-Weight)Selbst-Host / TogetherSelbst-Host / Together1MOpen weights; Hosting-Kosten fallen an
Nex-N2-ProSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (Apache 2.0); Hosting-Kosten fallen an
Rio 3.5 Open 397BSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (MIT); Hosting-Kosten fallen an
Grok 4.3$1.25$2.501MKostenloser Consumer-Plan; API bezahlt
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KSpaceXAI-API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Grok 4.7$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KSpaceXAI-API, Cursor, Grok Build, Harnesses und Cloud-Router; nicht in der Grok-App
Muse Spark 1.3$1.25 ($0.10 Contributor-Stufe)$4.25 ($0.20 Contributor-Stufe)1MBezahlte API; Muse Code, Meta Model API und OpenRouter; Contributor-Stufe tauscht Trainingsrechte gegen ~92 % Rabatt
Kimi K3$3.00 ($0.30 Cache-Hit)$15.001MKostenlose Basis-Stufe in der Kimi-App; open weights auf Hugging Face (Kimi K3 License)
Gemini Omni Flash (Video)$1.50$17.50 (Video-Output)10-Sekunden-ClipsGemini-App / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 Nebenzeit / $1.32 Spitzenzeit ($0.022 Cache-Hit Nebenzeit)$1.98 Nebenzeit / $3.96 Spitzenzeit1MDeepSeek Chat kostenlos; API bezahlt, Spitzen- und Nebenzeittarife seit 16. August
DeepSeek V4.1-Flash$0.15 Nebenzeit / $0.30 Stoßzeit ($0.003 Cache-Treffer Nebenzeit)$0.60 Nebenzeit / $1.20 Stoßzeit1MDeepSeek Chat gratis; API kostenpflichtig, Stoß- und Nebenzeit-Tarife; löste V4-Flash am 10. September ab
Kimi K2.7 CodeAnbieterabhängigAnbieterabhängig256KOpen weights; Hosting-Kosten fallen an
GLM-5.2AnbieterabhängigAnbieterabhängig1MOpen weights; Hosting-Kosten fallen an
GLM 5.3$1.40 ($0.26 Cache-Hit)$4.401MZ.ai API, GLM Coding Plan und ZCode; Gewichte seit dem 28. August auf Hugging Face unter der eigenen GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 Cache-Hit); $0.075 Aktion$0.50; $0.25 Aktion1MZ.ai API, GLM Coding Plan, OpenRouter; MIT-Gewichte auf Hugging Face; Aktion endet am 9. September
Tencent Hy4 Preview$0.834 ($0.042 Cache-Hit)$2.5011M+Offene Gewichte (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextAnbieterabhängigAnbieterabhängig262K (bis 1M)Offene Gewichte (Qwen Community License 1.0); Hosting-Kosten kommen hinzu
MiMo-V2.6-Pro$0.435$0.871MOffene Gewichte (MIT); Hosting-Kosten fallen an
ERNIE 5.1China-Region-PreiseChina-Region-Preise256KBaidu Gratisversion
Gemini Spark (Agent)Nicht API-bepreistNicht API-bepreist1M (Gemini-Basis)Google AI Pro $19.99, AI Ultra $99.99 oder $199.99/Mon.
Fello AI (Aggregator)Über die App geroutetÜber die App geroutetModellabhängig$9.99/Mon., Gratisversion verfügbar

Die oben genannten Raten für GPT-5.5 und GPT-5.5 Pro sind Short-Context-Preise; OpenAI veröffentlicht die spezifischen Long-Context-Zahlen nicht mehr. Die GPT-5.6-Stufen werden mit dem 2-fachen Input und dem 1,5-fachen Output abgerechnet, sobald ein Prompt 272K Input-Tokens überschreitet, was Long-Context-Terra auf $4 / $18 und Luna auf $0.40 / $1.80 bringt. Für die GPT-6-Stufen veröffentlicht OpenAI keinen Long-Context-Aufschlag, und ihre Cache-Lesezugriffe sind 90 % günstiger: $1.00 für Astra, $0.20 für Sol und $0.01 für Luna. Grok 4.6 funktioniert genauso, beißt aber härter: Ab 200.000 Prompt-Tokens rechnet SpaceXAI die gesamte Anfrage zum höheren Satz ab statt nur den Überhang, sodass ein Überschreiten um tausend Tokens die Kosten des ganzen Aufrufs verdoppelt. Die andere Preisliste, die man zweimal lesen sollte, ist die von DeepSeek: Seit dem 16. August werden beide V4-Modelle werktags von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC zum Spitzentarif abgerechnet und in jeder anderen Stunde zu genau der Hälfte, sodass dieselbe Aufgabe je nach Ausführungszeitpunkt doppelt so viel kosten kann. Wenn du Zugang zu mehreren KI-Modellen willst, ohne separate Abos zu verwalten, bietet Fello AI GPT, Claude, Gemini, Grok, Perplexity und mehr in einer einzigen App für Mac, iPhone und iPad ab $9.99/Monat.

Open-Weight-Modelle

Beste Open-Weight-Modelle im September 2026

Das beste Modell mit offenen Gewichten im September 2026 ist MiMo-V2.6-Pro, das Xiaomi am 21. September unter schlichtem MIT veröffentlicht hat: 1,02 Billionen Parameter mit 42 Milliarden aktiven, 1M Tokens Kontext und die Gewichte am selben Tag auf Hugging Face. Artificial Analysis misst ihn mit 46,3 auf Intelligence Index v4.3.2, der höchste offene Wert, den sie je veröffentlicht hat, über GLM-5.3 mit 44,8 und Kimi K3 mit 43,6, und das zu $0,13 pro Index-Aufgabe, günstiger als jedes andere offene Modell auf dieser Seite. Er nimmt außerdem 34,8 % auf Terminal-Bench 4.0 und 1673 auf GDPval-AA v2.1, womit er Kimi K3 auf beiden schlägt. Zwei ehrliche Grenzen: Kein Arena-Board hat ihn bewertet, es gibt also überhaupt keinen Beleg zur menschlichen Präferenz, und er ist vier Tage alt, hat also keine unabhängige Historie. Das am höchsten platzierte offene Modell auf Arena bleibt Kimi K3, Siebter auf WebDev mit 1658 und Fünfter beim Signal für Aufgabenerfüllung der Agent Arena, und GLM-5.3 bleibt mit 41,9 % gegen MiMos 34,8 % das stärkste offene Modell auf dem Terminal-Bench 4.0 von Artificial Analysis, allerdings unter einer eigenen Z.ai-Lizenz statt MIT. Die praktische Empfehlung für Teams, die eigene Gewichte betreiben, ist weiterhin GLM 5.3 Flash (Z.ai, MIT), erschienen am 26. August mit 41,8 auf v4.3.2, 320 Mrd. gesamt und 18 Mrd. aktiv, denn ein Modell mit 1,02 Billionen Parametern ist nichts für eine Workstation, und der K3-Download umfasst 96 Safetensors-Shards und rund 1,56 TB. Die günstige offene Stufe hat sich am 10. September erneut geändert: DeepSeek hat V4-Flash 0731 eingestellt und durch DeepSeek-V4.1-Flash ersetzt, 552 Mrd. mit 8 Mrd. aktiv beim Prefill und 16 Mrd. beim Decode, nativ multimodal, am ersten Tag unter MIT, mit 39,5 auf v4.3.2 gegen 34,3 für den abgelösten Build, und preislich zurück auf $0,15 / $0,60 außerhalb der Spitzenzeiten. Er ist zudem Dritter beim Signal für Aufgabenerfüllung der Agent Arena, das beste offene Modell dort. Von den drei Releases, die den August abschlossen, veröffentlichte GLM 5.3 seine Gewichte am 28. August unter einer eigenen Lizenz mit einer Klausel, nach der jeder Model-as-a-Service-Betreiber mit mehr als 10 Milliarden Dollar Umsatz zuerst eine Z.ai-Sicherheitsprüfung bestehen muss; Alibabas Qwen3.8-Flash-Next, ein Mixture-of-Experts mit 125 Mrd. Parametern und nur 6 Mrd. aktiv, der die Qwen4-Architektur vorwegnimmt, erreicht 39,8 und liegt auf Rang neun von Arenas WebDev-Board; und Tencents Hy4 Preview, 770 Mrd. gesamt und 49 Mrd. aktiv unter Apache 2.0, hat keine Bewertung von Artificial Analysis, liegt aber mit 1624 auf Rang elf bei Arena WebDev. Beachten Sie außerdem, dass GLM 5.3 Flash kein beschnittener GLM 5.3 ist, sondern ein eigenes Modell auf neu trainierter Basis, weshalb es unter schlichtem MIT erscheinen konnte, das Flaggschiff aber nicht.

ModellAm besten fürSchlüssel-BenchmarkKontext / LizenzWo laufen lassen
MiMo-V2.6-ProHöchster je gemessener offener Intelligence IndexII 46,3 (v4.3.2), über GLM-5.3 und Kimi K3, bei $0,13 pro Index-Aufgabe; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1673; 1,02 Billionen/42 Mrd. aktiv1M / MITHugging Face (XiaomiMiMo), Anbieter, Selbsthosting
Kimi K3Am höchsten platziertes offenes Modell auf ArenaII 43,6 (v4.3.2); #5 Arena WebDev, beste offene Platzierung; #5 Agent Arena; 2.8T/104B aktiv1M / Kimi K3 LicenseHugging Face (96 Shards, 1.56 TB), Moonshot API, Anbieter
GLM 5.3 FlashBestes offenes Modell, das die meisten Teams wirklich betreiben könnenII 41,8 (v4.3.2), auf der Pareto-Front aus Intelligenz und Kosten bei rund $0.25 pro Index-Aufgabe; 320B/18B aktiv, nativ multimodal1M / MITHugging Face, Z.ai API ($0.15/$0.50), OpenRouter
GLM-5.2Rückfalloption mit unabhängigem NachweisII 33,7 (v4.3.2); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B aktiv1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Seit dem 28. August offen, aber unter eigener LizenzII 44,8 (v4.3.2), der höchste offene Wert, den wir gefunden haben; gleiche 744B-Basis wie GLM-5.2, nur nachtrainiert, veröffentlichter Checkpoint mit 753B gezählt; CyberGym 84,5 % und Terminal-Bench 3.0 28,3 (Herstellerangaben)1M / GLM 5.3 License (Model-as-a-Service über 10 Mrd. USD Umsatz braucht eine Z.ai-Sicherheitsprüfung)Hugging Face, Z.ai API ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4.1-FlashBester offener Wert, wenn du selbst hostestII 39,5 (v4.3.2) gegen 34,3 für den abgelösten Stand V4-Flash 0731; 552B, 8B aktiv beim Prefill und 16B beim Decode1M / MITDeepSeek API ($0.15/$0.60 Nebenzeit, $0.30/$1.20 Spitzenzeit seit 10. September), lokal
Tencent Hy4 PreviewBislang größtes permissiv lizenziertes Modell770B/49B aktiv; 2,99/4,00 auf Tencents eigenem 203-Aufgaben-Panel gegen 2,94 für Kimi K3 und 2,92 für GLM 5.3 (Hersteller); keine Bewertung von Artificial Analysis; #11 Arena WebDev (1624)1M+ / Apache 2.0Hugging Face (BF16 und FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextVorschau auf die Qwen4-Architektur125B gesamt plus 51B N-Gramm-Embedding, 6B aktiv; 91,7 GPQA Diamond und 62,5 SWE-Bench Pro (Hersteller); II 39,8 (v4.3.2); #9 Arena WebDev (1635)262K bis 1M / Qwen Community License 1.0Hugging Face, Anbieter, Self-Hosting
LongCat-2.0Frontier-offener Coder, trainiert auf chinesischen ChipsII 33 (v4.1); 59,5 % SWE-Bench Pro (Anbieter), 1.6T/~48B aktiv1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Günstig multimodal auf Frontier-NiveauII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / Lizenz TBDHugging Face, API $0.30/1M (50 % Rabatt)
Nex-N2-ProStärkster offener Coding-WertII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivQwen-basiert / Apache 2.0Hugging Face, Anbieter, Selbst-Host
Kimi K2.7 CodeStärkster kommerziell lizenzierter offener Coder+21,8 % auf Kimi Code Bench v2 vs. K2.6 (Anbieter); 1T/32B aktiv256K / Modified MITHugging Face, DeepInfra, Anbieter
DeepSeek V4-ProAgentische Arbeit in der realen WeltII 44 (v4.1), 1.6T/49B aktiv1M / MITDeepSeek API ($0.66/$1.98 außerhalb der Spitze, $1.32/$3.96 zur Spitze seit 16. August), lokal
Hy3Neuester Kandidat mit permissiver LizenzII 41 (v4.1); #22 auf Arena WebDev (1,516.4)Apache 2.0Hugging Face, Anbieter, Selbst-Host
InklingThinking Machines' erstes open modelII 41 (v4.1), agentisch 32,3, veröffentlicht 15. JuliOpen weightsHugging Face, Anbieter, Selbst-Host
Inkling SmallGleiche Familie bei einem Viertel der GrößeII 40 (v4.1), agentisch 30,8; 276B/12B aktiv, Text, Bild und Audio InputApache 2.0Hugging Face (BF16 und NVFP4), Anbieter, Selbst-Host
NVIDIA Nemotron 3 UltraNVIDIA-abgestimmt, voll permissive LizenzII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktiv1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 Selbst-Host)
Qwen 3.5 (397B / 17B aktiv)Multimodal, schnelles Decoding88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / offenTogether, OpenRouter, lokal
Qwen3.6-35B-A3BEffizienter offener agentischer Coder (3B aktiv)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktiv262K (bis 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, lokal
Qwen3.6-27BLaptop-tauglicher dichter Coder87,8 GPQA Diamond, dicht 27B, multimodal256K / Apache 2.0Lokal Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BQwen-3.5-Fine-tune, mehrsprachiges Reasoning70,8 Terminal-Bench 2.1 (First-Party), schlägt Qwen 3.7 Plus in 4/5397B/17B aktiv / MITHugging Face, Anbieter, Selbst-Host
Llama 4 MaverickFlaggschiff der Meta-Reihe17B aktiv / 400B GesamtparameterLlama 4 LicenseMeta-Cloud, Hugging Face, lokal
NVIDIA Nemotron 3 Nano OmniEdge / Low-PowerMultimodal, sehr kleiner FootprintKompakt / offenLokal, NVIDIA-Tool

Lizenzierung zählt hier ebenso wie der reine Wert, und der August hat den Abstand zwischen den beiden Gruppen vergrößert. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) und Nemotron 3 Ultra (OpenMDW) erlauben alle klar die kommerzielle Nutzung ohne Umsatzprüfung. Der Rest trägt Bedingungen, die man lesen sollte, bevor man darauf aufbaut: MiniMax M3 und MiniMax H3 kommen unter ihren eigenen Community-Lizenzen, wobei H3 zusätzlich einen Antrag aus den USA, der EU, dem Vereinigten Königreich und Südkorea verlangt; Kimi K3 sitzt auf einer eigenen Lizenz mit einer Umsatzschwelle für alle, die es als Service weiterverkaufen; GLM 5.3 verlangt eine Z.ai-Sicherheitsprüfung für jeden Model-as-a-Service-Betreiber über 10 Milliarden Dollar Umsatz; und die Qwen Community License 1.0 bei Qwen3.8-Flash-Next verlangt eine separate Lizenz von Qwen, um ein Model-as-a-Service- oder ein KI-Arbeitsassistenz-Geschäft zu betreiben, wobei interne Nutzung ausgenommen ist. Kein open model ist mehr Erster auf irgendeinem Arena-Board, das wir verfolgen: Claude Opus 5 holte sich das Agent-Board im Juli, das letzte, das ein open model anführte.

Wie wir bewerten

Benchmarks, Preise und Hands-on-Nutzung

Jedes Ranking auf dieser Seite kombiniert drei Eingaben: öffentliche Benchmarks von sieben unabhängigen Häusern (Artificial Analysis, Arena früher LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize und das offizielle Terminal-Bench-4.0-Board, mit Abdeckung der Intelligence Index, GPQA Diamond, ARC-AGI-1 bis 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas und dem Remote Labor Index), veröffentlichte API- und Abo-Preise von der offiziellen Preisseite jedes Anbieters und Hands-on-Nutzung durch das FelloAI-Redaktionsteam, das echte Prompts über dieselbe Aufgabe auf jedem Modell laufen lässt. Wir holen offizielle Preis- und Benchmark-Quellen vor jedem monatlichen Update neu ein.

Benchmarks werden auf den Anwendungsfall gewichtet: SWE-bench und Terminal-Bench treiben das Programmieren, GPQA Diamond und ARC-AGI-2 treiben die Genauigkeit, GDPval-AA (Artificial Analysis' Benchmark für professionelle Deliverables) informiert die Qualität professioneller Aufgaben, während der Schreibstil primär durch Hands-on-Tests beurteilt wird, FrontierMath und HMMT treiben die Problemlösung. Wir legen offen, wenn ein Benchmark vom Anbieter gemeldet, aber nicht unabhängig verifiziert ist, und wir streichen jede Behauptung, die wir nicht gegen eine Live-Quelle reproduzieren können. Wir ranken nach gemessenen Werten: Eine Kategoriekrone wandert, sobald ein Modell den Titelhalter auf den Boards schlägt, die diese Kategorie definieren, ohne auf die stimmbasierten Boards zu warten, und ein Modell, das noch nicht breit verfügbar ist, wird auf seiner Karte gekennzeichnet statt von ihr ausgeschlossen. Wir prüfen Ränge ebenso nach wie Zahlen, denn ein Wert kann korrekt bleiben, während sich das Board darum herum bewegt. Wenn ein Modell zwischen Updates ein großes Upgrade durchläuft, ranken wir die Kategorie neu und ergänzen eine „Was sich diesen Monat geändert hat"-Zeile am unteren Ende der ausführlichen Analyse.

Fello AI auf Mac, iPhone und iPad
Unsicher, welches Modell du wählen sollst?

Fello AI vereint die besten KI-Modelle in einer leichten nativen App.

Wechsle jederzeit zwischen ihnen, keine separaten Abos.

Fello AI laden
Häufig gestellte Fragen

Häufige Fragen

Was ist das beste KI-Modell gerade jetzt im September 2026?
Es kommt auf die Aufgabe an, doch ein Modell führt jetzt mehr Boards an als jedes andere. Beim Gesamtwert ist Claude Opus 5.5 (22. September) die Nummer eins auf dem Intelligence Index von Artificial Analysis mit 57,6 auf v4.3.2, 4,3 Punkte vor Claude Fable 5.1, und es führt außerdem GDPval-AA v2.1 mit 1846, AA-Briefcase v1.1 mit 1822 und Humanity's Last Exam mit 61,4 % an, zu $4 / $20 pro 1M Tokens. Beim Programmieren führt Opus 5.5 den Terminal-Bench-4.0-Lauf von Artificial Analysis mit 59,6 % und beide Coding-Boards von LiveBench an, während GPT-6 Astra beide Coding-Boards der Arena behält, weil Opus 5.5 dort noch keine Stimmen hat. Für den Alltags-Chat ist GPT-5.6 seit dem 9. Juli ChatGPTs Standard und der Assistent, den die meisten Menschen tatsächlich öffnen können, auch wenn Claude Fable 5 Arenas Text-Board anführt. Beim Schreiben ist Claude Fable 5.1 das einzige Modell in den Top sechs aller drei Text-Boards. Bei der Genauigkeit hält Claude Fable 5.1 weiterhin die höchste von Artificial Analysis gemessene faktische Genauigkeit mit 67 % auf AA-Omniscience, einen Punkt über Opus 5.5. Bei harter Mathematik und Logik führt GPT-6 Astra LiveBench Reasoning und ARC-AGI-2 an. Bei Bildern führt ChatGPT Images 2.5 alle vier Boards an, die wir verfolgen, und bei Video führt Gemini Omni 1.1 Flash Arenas Text-zu-Video-Board an. Bei Agenten ist Gemini Spark der 24/7-Cloud-Agent und Claude Cowork der für den Desktop. Bei den offenen Gewichten erreicht Xiaomis MiMo-V2.6-Pro 46,3 unter schlichtem MIT zu $0,13 pro Index-Aufgabe. OpenAI hat am 22. September die API-Preise seiner mittleren Stufen halbiert, womit GPT-6 Luna mit $0.07 das günstigste Modell pro Intelligence-Index-Aufgabe auf dieser Seite ist.
Ist GPT-6 draußen, und ist es jetzt das beste Modell?
GPT-6 ist da. OpenAI hat es am 3. September 2026 als GPT-6 Astra veröffentlicht, womit die ein Jahr alte Frage geklärt ist, ob Astra als GPT-6 oder als weitere GPT-5-Zwischenversion erscheint. Auf den unabhängigen Boards ist es nicht das Spitzenmodell, und am 22. September ist es weiter zurückgefallen. Artificial Analysis gibt ihm 52,7 auf Intelligence Index v4.3.2, 5,7 Punkte vor GPT-5.6 Sol, aber 0,7 Punkte hinter Claude Fable 5.1 mit 53,4 und 4,9 Punkte hinter Claude Opus 5.5 mit 57,6, bei $10 / $50 pro 1M Tokens gegen $4 / $20 für Sol wie für Opus 5.5. Programmieren war sein stärkstes Argument und ist nun geteilt: Astra nahm den Terminal-Bench 4.0 von Artificial Analysis mit 59,1 % und hielt ihn, bis Opus 5.5 mit 59,6 % vorbeizog, ein Abstand innerhalb der Fehlerbalken dieses Benchmarks, während Astra beide Coding-Boards der Arena behält, weil Opus 5.5 dort noch keine Stimmen hat. Es halbiert außerdem die Halluzinationen auf AA-Omniscience grob, von Sols 92 % auf 51 % bei maximalem Aufwand, und es gewinnt gegen Opus 5.5 weiterhin Zapiers AutomationBench und Terminal-Bench-Science 0.1. Sie brauchen einen bezahlten Tarif: Astra ist das erste Modell, das OpenAI für Cybersicherheit als Critical eingestuft hat, geprüfte Verteidiger im Daybreak-Programm bekamen es zuerst, ChatGPT Business und Pro folgten am 4. September und Plus wenige Stunden später, und für den kostenlosen Tarif wurde nichts angekündigt. Unsere vollständige Analyse zu GPT-6 Astra behandelt die Benchmarks und die Vorbehalte. Die Familie ist am 22. September um GPT-6 Sol zu $2 / $10 und GPT-6 Luna zu $0,10 / $0,50 gewachsen, die Artificial Analysis mit 47,5 und 37,3 gegen Astras 52,7 bewertet. Beide stecken in ChatGPT Work, Codex und der API, und OpenAI sagt, dass keines von beiden bisher im Chat ist; den Rest hat unsere Analyse zu GPT-6 Sol und Luna.
Was ist Claude Opus 5?
Claude Opus 5 ist Anthropics Flaggschiff vom 24. Juli 2026 und war das #1-Modell auf Artificial Analysis, bis am 1. September Claude Fable 5.1 erschien. Es liegt jetzt Dritter auf dem Intelligence Index mit 50,8 gegen die 53,4 von Claude Fable 5.1 und die 52,7 von GPT-6 Astra, Zweiter bei AA-Briefcase mit 1673 gegen 1678, und bei max-Aufwand führt es das GDPval-AA v2.1 Board für professionelle Deliverables sogar an, mit 1708 gegen die 1735 von Fable 5.1, bei überlappenden Konfidenzintervallen und weiterhin deutlich vor den 1695 von Grok 4.7 und den 1632 von Claude Fable 5. Die API-Preise liegen bei $5 / $25 pro 1M Tokens, dieselben wie Opus 4.8 und halb so teuer wie Fable 5, mit einem Kontextfenster von 1M Tokens und einem Wissensstand von Mai 2026. ARC Prize bestätigt unabhängig Anthropics Launch-Behauptung zu ARC-AGI-3, wo Opus 5 30 % gegen 8 % für das nächstbeste Modell erzielt, rund 3,75-mal. Arena setzt es jetzt auf Platz drei beider Coding-Boards, hinter GPT-6 Astra und Claude Fable 5.1, auf Platz eins bei Document, auf Platz vier beim Aufgabenerfüllungs-Signal der Agent Arena und auf Platz zehn beim Text. Eine Sache zum Bedenken: Artificial Analysis misst seine Halluzinationsrate mit 50 %, weshalb es auf dieser Seite keine Genauigkeitskrone hält.
Was ist Claude Fable 5.1?
Claude Fable 5.1 ist Anthropics Release vom 1. September 2026 und das höchstbewertete Modell, das Artificial Analysis je gemessen hat, mit 53,4 auf seinem Intelligence Index v4.3.2 bei max Effort und Platz eins bei AA-Briefcase mit 1678. Es erschien zusammen mit Claude Mythos 5.1, demselben Modell mit gelockerten Safeguards in Biologie und Cybersicherheit, nur auf Einladung verfügbar und ohne veröffentlichte Kriterien. Die Preise liegen bei $10 / $50 pro 1M Tokens, unverändert gegenüber Fable 5, aber Cache-Reads fallen um 75 % auf $0.25, bei einem Kontextfenster von 1M Tokens und einem Wissensstand von Juni 2026. Es ist in Claude Max und Team Premium bei rund 50 % der Wochenlimits enthalten und aus Pro über Credits erreichbar. Anthropic rät weiterhin, für die meisten Workloads mit Claude Opus 5 zu beginnen, da es halb so viel kostet und schneller läuft. Unsere vollständige Aufschlüsselung zu Claude Fable 5.1 und Mythos 5.1 behandelt die System Card und die Aufteilung der Safeguards.
Ist Claude Fable 5 zurück?
Ja. Anthropic setzte Claude Fable 5 am 1. Juli 2026 wieder ein, nachdem die US-Regierung die Exportkontrollbeschränkung aufgehoben hatte, die sie am 12. Juni verhängt hatte. Es ist wieder auf der Claude API, Claude.ai, Claude Code und Claude Cowork verfügbar. Anthropic machte Fable 5 am 20. Juli 2026 in den bezahlten Plänen dauerhaft. Max und Team Premium enthalten es bei rund 50 % der regulären Nutzungslimits; Pro und Team Standard erreichen es über Nutzungscredits mit einem einmaligen Startguthaben von $100. Die API-Preise liegen bei $10 / $50 pro Million Tokens. Fable 5 ist ein Modell der Mythos-Klasse, gebaut für langfristige agentische Arbeit mit einem Kontext von 1M Tokens, und es ist der Zweitplatzierte fürs Programmieren hinter Claude Opus 5, auf #2 von Arenas image-to-WebDev-Board (1,625.7) und #4 auf WebDev.
Was ist GPT-5.6 und kann ich es nutzen?
Ja, seit dem 9. Juli 2026. GPT-5.6 ist OpenAIs Modellfamilie der nächsten Generation, und nach einer zweiwöchigen geschlossenen Vorschau, die am 26. Juni hinter einer Sicherheitsprüfung der US-Regierung begann, erreichte es am 9. Juli die allgemeine Verfügbarkeit. Es gibt drei Stufen, vom wenigsten zum leistungsstärksten: Luna, die schnelle, günstigste Stufe ($0.20 / $1.20 pro 1M Tokens); Terra, ein ausgewogenes Alltagsmodell, von dem OpenAI sagt, es entspreche GPT-5.5 ($2 / $12); und Sol, das Flaggschiff, abgestimmt auf Biologie, Chemie und Cybersicherheit ($4 / $20). OpenAI senkte Luna um 80 % und Terra um 20 % am 30. Juli 2026 und ließ Sol unangetastet, senkte Sol dann am 21. August 2026 um über 20 % als Aktionspreis für rund drei Monate. Kein ChatGPT-Abopreis hat sich geändert. Es ist jetzt live über ChatGPT, Codex und die API als OpenAIs Standardmodell. Ein Vorbehalt: OpenAIs System Card und der externe Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, also behandle es bei faktischer Arbeit mit hohem Einsatz vorsichtig, bis sich unabhängige Ergebnisse festigen. Ein Namenshinweis seit dem 22. September: OpenAI hat Sol und Luna für die GPT-6-Generation wiederverwendet, ein bloßes „Sol“ oder „Luna“ ist also inzwischen mehrdeutig. GPT-6 Sol kostet $2 / $10 und GPT-6 Luna $0,10 / $0,50, gegen $4 / $20 und $0,20 / $1,20 für die 5.6-Stufen, die OpenAI weiter verkauft.
Ist Grok 4.7 schon draußen?
Ja. SpaceXAI hat Grok 4.7 am 21. September 2026 veröffentlicht und damit Grok 4.6 als Flaggschiff abgelöst. Anders als 4.6, das ein Nachtraining derselben Basis war, nutzt 4.7 ein neues, größeres Basismodell mit einem längeren Reinforcement-Learning-Lauf, der auf Aufgaben von vielen Stunden gewichtet ist; eine Parameterzahl veröffentlicht SpaceXAI nicht. Artificial Analysis gibt ihm 46,3 auf Intelligence Index v4.3.2 bei hohem Aufwand gegen 44,3 für Grok 4.6, und auf beiden agentischen Boards liegt er über GPT-6 Astra, 1695 zu 1542 auf GDPval-AA v2.1 und 1657 zu 1569 auf AA-Briefcase v1.1. Der Preis bleibt bei $2 / $6 pro 1M Tokens auf einem 500K-Kontextfenster, wobei Prompts ab 200.000 Tokens die gesamte Anfrage mit $4 / $12 neu berechnen, und eine schnelle Variante läuft mit doppelter Ausgabegeschwindigkeit zum doppelten Preis. Die Kosten pro Intelligence-Index-Aufgabe haben sich sehr wohl bewegt, von $1,86 auf $2,73, weil 4.7 rund doppelt so viele Ausgabetokens erzeugt. Verfügbar ist er in der Grok-API, in Cursor, in Grok Build, in fremden Coding-Harnesses und in Cloud-Routern. SpaceXAIs Ankündigung sagt nichts über die Endkunden-App Grok, die für $30 im Monat weiterhin Grok 4.6 ausliefert. Grok ist außerdem unser Kreativitäts-Tipp, aus Produktgründen und nicht wegen der Prosa; für den bestgeschriebenen Text gewinnt Claude Fable 5 klar. Alle Zahlen stehen in unserer Analyse zu Grok 4.7.
Welche KI ist die beste zum Programmieren?
Am besten zum Programmieren ist Claude Opus 5.5, seit Anthropic ihn am 22. September veröffentlicht hat. Er führt den eigenen Terminal-Bench-4.0-Lauf von Artificial Analysis mit 59,6 % gegen 59,1 % für GPT-6 Astra an, LiveBench Coding mit 89,3 gegen 80,4 und LiveBench Agentic Coding mit 71,7 gegen 57,3, und das zu $4 / $20 pro 1M Tokens gegen Astras $10 / $50. Auf Anthropics eigenem Harness ist der Abstand größer, 66,4 % auf Terminal-Bench 4.0 gegen die 57,9 %, die OpenAI für Astra angibt, dazu 54,4 % auf FrontierCode v1.1 und 57,8 % auf CursorBench 4.0. GPT-6 Astra ist der Zweite und behält beide Coding-Boards der Arena, WebDev mit 1793 und image-to-WebDev mit 1733, weil Opus 5.5 dort noch keine Stimmen hat. Die ehrliche Lesart lautet also: OpenAI führt bei der menschlichen Präferenz, Anthropic auf jedem gemessenen Harness. Behandeln Sie den halben Punkt auf Terminal-Bench als Gleichstand, denn Anthropic nennt dafür einen Standardfehler von etwa 2,6 Punkten. Claude Fable 5.1 ist Dritter. Bei den offenen Gewichten ist GLM-5.3 auf Terminal-Bench 4.0 mit 41,9 % am stärksten und Kimi K3 mit Rang sieben das am höchsten platzierte offene Modell auf Arena WebDev, während GLM 5.3 Flash dasjenige ist, das die meisten Teams hosten können, zu $0,25 pro Index-Aufgabe unter schlichtem MIT. Artificial Analysis hat sowohl den Coding Index als auch den Coding Agent Index eingestellt.
Welche KI ist die beste zum Schreiben?
Claude Fable 5.1 ist die beste zum Schreiben und führt Humanity's Last Exam mit 59,1 % sowie das GDPval-AA-v2-Board für professionelle Deliverables an. Claude Fable 5 ist der Tipp, wenn du menschliche Stimmen höher gewichtest: Es führt weiterhin Arena Creative Writing und LiveBench Language (90.7) an, steht auf EQ-Bench Creative Writing v3 aber inzwischen auf #8. Es kostet $10 / $50 pro 1M Tokens. Claude Sonnet 5 ist der Preis-Leistungs-Tipp und das, was die meisten tatsächlich verwenden sollten, da es kostenlos und Standard auf claude.ai bei $2 / $10 ist, einem Einführungspreis, den Anthropic im August 2026 dauerhaft gemacht hat, obwohl es auf #53 bei Arena Creative Writing rangiert. Kimi K3 steht auf EQ-Bench mit 2070.6 auf Platz vier, wenn du markante Fiktion willst, Claude Fable 5.1 führt das GDPval-AA v2.1 Board für professionelle Deliverables mit 1846 an, mit Claude Opus 5 als Zweitem bei 1735, GPT-5.5 ist die Alternative für faktenbasiertes Business-Schreiben, und Gemini 3.8 Flash ist der Preis-Leistungs-Tipp für Masseninhalte.
Was ist das beste Open-Weight-KI-Modell 2026?
Xiaomis MiMo-V2.6-Pro, veröffentlicht am 21. September 2026 unter schlichtem MIT. Artificial Analysis misst es mit 46,3 auf Intelligence Index v4.3.2, der höchste offene Wert, den sie je veröffentlicht hat, über GLM-5.3 mit 44,8 und Kimi K3 mit 43,6, und es erledigt eine Index-Aufgabe für $0,13, günstiger als jedes andere offene Modell auf dieser Seite. Es ist ein Mixture-of-Experts mit 1,02 Billionen Parametern, davon 42 Milliarden aktiv, 1M Tokens Kontext und den Gewichten vom ersten Tag an auf Hugging Face. Zwei Vorbehalte: Kein Arena-Board hat es bewertet, es gibt also überhaupt keinen Beleg zur menschlichen Präferenz, und es ist vier Tage alt. Kimi K3 bleibt das am höchsten platzierte offene Modell auf Arena, Siebter auf WebDev und Fünfter beim Signal für Aufgabenerfüllung der Agent Arena, und GLM-5.3 bleibt mit 41,9 % das stärkste offene Modell auf dem Terminal-Bench 4.0 von Artificial Analysis, allerdings unter einer eigenen Z.ai-Lizenz statt MIT. Für Teams, die wirklich selbst hosten wollen, bleibt GLM 5.3 Flash (Z.ai, MIT) die praktische Empfehlung, mit 41,8 im Index und 320 Mrd. gesamt bei 18 Mrd. aktiv, denn ein Modell mit 1,02 Billionen Parametern braucht einen Cluster, und der Kimi-K3-Download umfasst 96 Shards und rund 1,56 TB.
Was ist das günstigste KI-Modell auf Frontier-Niveau?
Beim API-Preis pro Million Tokens ist GPT-6 Luna mit $0.10 / $0.50 das günstigste geschlossene Modell der Spitzenklasse, nachdem OpenAI es am 22. September 2026 halbiert hat, und Artificial Analysis bewertet es auf dem v4.3.2-Index mit 37,3 gegen die 34,0 von Gemini 3.6 Flash. Unter den offenen Gewichten bleibt es GLM 5.3 Flash, unser Preis-Leistungs-Tipp seit August, jetzt zum schlichten Listenpreis $0.15 / $0.50, seit die Einführungsaktion am 9. September auslief, mit 41,8 unter einer schlichten MIT-Lizenz, die du selbst hosten kannst. DeepSeek hielt diesen Tipp, bis es am 16. August die Preise rund vervierfachte, und holte ihn sich am 10. September beinahe zurück, als V4.1-Flash das V4-Flash zu $0.15 / $0.60 außerhalb der Stoßzeiten und $0.30 / $1.20 zu Stoßzeiten ablöste: Außerhalb der Stoßzeiten liegen beide beim Input nun gleichauf, GLM ist beim Output günstiger. Artificial Analysis trennt sie weiterhin bei den Kosten pro Index-Aufgabe, $0.25 für GLM gegen $0.27 für DeepSeek. Googles günstige Stufe verbesserte sich am 2. September erneut, als Gemini 3.8 Flash bei gleichem Einführungspreis von $0.75 / $3.75 auf 40,9 kam, wobei sich dieser Tarif am 1. Januar 2027 verdoppelt. MiniMax M3 steht bei $0.30 pro Million Input-Tokens auf einem dauerhaften 50-Prozent-Rabatt, mit LongCat-2.0 als starker MIT-Alternative. Gemessen pro Intelligence-Index-Aufgabe statt pro Token ist das günstigste Modell auf dieser Seite GPT-6 Luna mit $0.07, vor GPT-5.6 Luna mit $0.18 und dem offenen MiMo-V2.6-Pro mit $0.13.
Welche KI-Modelle sind kostenlos?
ChatGPT Free verwendet jetzt standardmäßig GPT-5.6 (mit weiterhin verfügbarem GPT-5.5) unter Nutzungslimits. Free- und Go-Nutzer erreichen seit dem 22. September außerdem GPT-6 Luna in der ChatGPT-Desktop-App. Gemini Free lässt Gemini 3.6 Flash in der Gemini-App und Google AI Studio laufen. Claude Free lässt Claude Sonnet 5 (den neuen Standard) mit täglichen Limits laufen. DeepSeek Chat lässt DeepSeek V4 kostenlos auf der DeepSeek-Website laufen. Grok hat einen begrenzten kostenlosen Consumer-Plan (X Premium ist ein bezahltes Add-on). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash, MiMo-V2.6-Pro und Tencents Hy4 Preview sind Open-Weight und kostenlos selbst zu hosten, wobei sich die Lizenzen unterscheiden und nur ein Teil davon reines MIT oder Apache ist. Qwen 3.7 Max ist nur API ohne Consumer-Chat-Frontend, aber Alibaba enthält jetzt 200 kostenlose Modellanfragen pro Tag. Kimi hat eine kostenlose Basis-Stufe in seiner App, mit abgerechneter intensiverer agentischer Nutzung.
Was ist Gemini Spark und welchen Plan brauchen Sie?
Gemini Spark ist Googles erster rund um die Uhr in der Cloud residierender KI-Agent, gestartet auf der Google I/O am 19. Mai 2026 und nicht mehr exklusiv für Ultra: Seit dem 30. Juli 2026 erreicht er auch die Stufe Google AI Pro zu $19.99/Monat, in den USA und in über 160 weiteren Ländern, während Google AI Ultra zu $99.99 oder $199.99/Monat den breiteren globalen Rollout trägt. Google AI Plus, die kostenlose Stufe sowie Arbeits- und Schulkonten enthalten ihn nicht. Spark ist auf Gemini-Basismodellen mit Googles Antigravity-Harness auf einer Google-Cloud-VM gebaut, integriert sich mit Gmail, Google Docs und anderen Google-Workspace-Apps und kann auf der Geräteseite mit Chrome und Androids Halo-System interagieren. Es ist die Ausgabe wert für Nutzer, die wiederholbare, langlaufende Workflows haben (Posteingangs-Triage, Recherche-Zusammenfassungen, geplante Aufgaben). Für einmalige Aufgaben deckt Claude Cowork zu $20/Monat die meisten Desktop-Agenten-Bedürfnisse ab.
Was ist Fello AI?
Fello AI ist ein KI-Chatbot für Mac, iPhone und iPad, mit dem du alle Top-KI-Modelle wie ChatGPT, Claude, Gemini, Grok und DeepSeek in einer App nutzen kannst, mit regelmäßig aktualisierten Modellen, sodass du immer die neuesten hast. Es kostet $9.99/Monat mit einer 4,7-Sterne-Bewertung über 27.000+ Rezensionen.
Wie oft aktualisiert ihr diese Seite?
Wir aktualisieren diese Seite mindestens monatlich und innerhalb von 24-48 Stunden nach jedem größeren Modellstart.
Verwandte Artikel
Claude vs. ChatGPT: Welche KI ist 2026 wirklich besser?

Claude erreichte Anfang 2026 #1 im App Store und drängte ChatGPT zum ersten Mal vom Spitzenplatz. Der Auslöser war Anthropics öffentliche Weigerung, der Forderung des Pentagons nachzukommen, seine Modelle für autonome Waffen einzusetzen.

Mehr lesen →
Grok vs. ChatGPT: Welcher KI-Chatbot ist 2026 wirklich besser?

Beide Chatbots bewegen sich weiter. ChatGPT läuft mit GPT-5.6 (Stufen Sol, Terra, Luna), und SpaceXAIs Flaggschiff ist jetzt Grok 4.7, die Version vom 21. September mit 46,3 im Intelligence Index zu $2 / $6, auch wenn die Grok-App weiterhin 4.6 ausliefert.

Mehr lesen →
ChatGPT vs. Gemini 2026: Welche KI solltest du wirklich nutzen?

ChatGPT stieg auf GPT-5.6 als Flaggschiff um, während Gemini 3.1 Pro Googles bezahltes Flaggschiff bleibt. Direkter Vergleich über Schreiben, Programmieren, Bilder und Preis.

Mehr lesen →
Wann welche KI: das richtige Modell wählen

Es gibt keine beste KI für alles. Ordne die Aufgabe dem Modell zu, das darin führt, mit einer Tabelle für Coding, Schreiben, Recherche und Alltagschat.

Mehr lesen →
Beste KI-Agenten 2026: 30 Tools getestet

Dreißig KI-Agenten verglichen nach dem, was du wirklich tun willst: Coding, Recherche, Büroarbeit und Automatisierung, mit Preisen und Gratis-Optionen.

Mehr lesen →
Gemini Nano Banana Pro vs. GPT-Image-1.5: Ultimativer Vergleich

Unser ursprünglicher Hands-on-Vergleich vom Dezember 2025 der beiden führenden Bildgenerierungsmodelle, mit echten Output-Beispielen Seite an Seite.

Mehr lesen →

Probiere jedes Modell.
Eine schöne App.

Jedes Modell aus diesem Leitfaden in einer nativen App: ChatGPT, Claude, Gemini, Grok und DeepSeek. Kostenlos starten.

Fello AI auf Mac, iPad und iPhone

4,7 Bewertung·27.000+ Rezensionen·Kostenlos starten