Aktualisiert 5. Oktober 2026

Beste KI 2026: welche KI ist aktuell die beste?

KI-Ranking und KI-Vergleich nach Einsatzzweck, monatlich aktualisiert, sobald neue Modelle erscheinen.

Google hat am 30. September Gemini 4 Argon angekündigt, sein erstes Flaggschiff seit Gemini 3.1 Pro, und die unabhängigen Boards setzen es direkt in die Spitzengruppe: Artificial Analysis gibt ihm 52,6 auf Intelligence Index v4.3.2, gleichauf mit GPT-6 Astra und nur hinter Claude Opus 5.5, Claude Sonnet 5.5 und Claude Fable 5.1, mit der niedrigsten Halluzinationsrate, die es unter den führenden Modellen gemessen hat, und Arena führt es auf Platz eins seines Text-Boards und seines Boards für kreatives Schreiben. Auf dieser Seite gewinnt es keine Kategorie, aus zwei Gründen: Die meisten Boards, nach denen wir unsere Kategorien entscheiden, haben es noch nicht bewertet, und nutzen können es nur geprüfte Cyber-Verteidiger in Googles Fairwind-Programm. Laut Google folgen zahlende API-Kunden und Abonnenten von Google AI Ultra, ohne Datum, zum Einführungspreis von $2 / $10 pro 1M Tokens.

Die meisten gemessenen Kronen hält weiterhin Anthropic. Claude Opus 5.5 (22. September) ist #1 im Intelligence Index mit 57,6 und auf Arenas WebDev-Board und behält zu $4 / $20 die Coding-Krone; Claude Sonnet 5.5 (28. September) ist mit 56,0 Zweiter, führt Terminal-Bench 4.0 zum selben Preis von $2 / $10 wie Sonnet 5 an und ist das Claude-Modell, das Sie kostenlos auf claude.ai nutzen können. Claude Fable 5.1 behält Schreiben und Genauigkeit auf den Boards, nach denen diese Kategorien entschieden werden. Diese Seite rankt nach gemessenen Werten, eine Krone wandert also, sobald ein Modell den Halter übertrifft, ohne auf die abstimmungsbasierten Boards zu warten. Unser Leitfaden zu KI-Benchmarks erklärt, wie dieser Index aufgebaut ist und warum seine Versionsnummer zählt.

OpenAIs Antwort ist der Preis. GPT-6 Sol und GPT-6 Luna (22. September) haben die API-Preise halbiert, und GPT-6.1 Sol (29. September) erreicht zum selben Preis von $2 / $10 einen Wert von 51,8, unter den eigenständigen Modellen Platz sechs, mit $0,72 pro Index-Aufgabe aber das günstigste der Spitzengruppe. ARC Prize setzt es jetzt mit 94,2 % auf Platz zwei von ARC-AGI-2, 0,8 Punkte hinter GPT-6 Astra, und Arena auf Platz vier bei WebDev. Keines der GPT-6-Modelle ist bisher im Chatfenster von ChatGPT: Sie laufen in ChatGPT Work und Codex.

SpaceXAIs Grok 4.7 (21. September) kam zu unveränderten $2 / $6 in die API, zu Cursor und Grok Build, während die Grok-App weiterhin 4.6 ausliefert, und Xiaomis MiMo-V2.6-Pro (21. September, schlichtes MIT) bleibt mit 46,3 und $0,13 pro Index-Aufgabe das am höchsten bewertete offene Modell. Unten stehen die Kategoriesieger für Oktober 2026. Klicken Sie auf eine Karte, um direkt zur vollständigen Analyse zu springen, oder nutzen Sie die feststehende Navigation, um zwischen den Kategorien zu wechseln. Rankings, Benchmarks und Preise werden innerhalb von 48 Stunden nach jedem großen Modell-Launch aktualisiert.

Kategoriesieger Oktober 2026
Schreiben
Claude Fable 5.1
#2 EQ-Bench Creative Writing und #3 LiveBench Language
Auf allen drei Text-Boards in den Top zehn, Zweiter auf EQ-Bench und Dritter auf LiveBench Language. Bestes Preis-Leistungs-Verhältnis: Claude Sonnet 5.5, kostenlos auf claude.ai.
Ausführliche Analyse →
Chat & täglicher Assistent
GPT-5.6
ChatGPT-Standard seit 9. Juli
Der beste Assistent, den die meisten Menschen tatsächlich öffnen können, mit einer Balance aus Leistung, Tempo und Reichweite.
Ausführliche Analyse →
Bilder
ChatGPT Images 2.5
#1 und #2 auf allen vier Bild-Boards, die wir verfolgen
Seine beiden Modelle belegen auf jedem Bild-Board, das wir verfolgen, die ersten beiden Plätze, bei Arena wie bei Artificial Analysis, und es ist der Standard in jedem ChatGPT-Tarif, auch im kostenlosen. Bester Wert: Flare, das schnellere der beiden, zum selben Tokenpreis wie GPT Image 2.
Ausführliche Analyse →
Video
Gemini Omni 1.1 Flash
#1 Arena Text-to-Video (1516), 40-Sekunden-Szenen
Googles neuestes Videomodell: Szenenverlängerung auf 40 Sekunden, 4K-Ausgabe, ab $0.03 pro Sekunde.
Ausführliche Analyse →
Programmieren
Claude Opus 5.5
#1 Arena WebDev (1815) und #1 Intelligence Index (57,6)
Anthropics Flaggschiff vom 22. September führt jetzt das WebDev-Board der Arena an, schlägt Sonnet 5.5 bei LiveBench Agentic Coding um 15 Punkte und kostet pro Index-Aufgabe weniger als Sonnet 5.5 bei maximalem Aufwand. Bestes Preis-Leistungs-Verhältnis: Claude Sonnet 5.5 zu $2 / $10, das Terminal-Bench 4.0 (63,6 %) und LiveBench Coding anführt.
Ausführliche Analyse →
Kreativität
Grok 4.7
Wenigste Inhaltsbeschränkungen + natives Echtzeit-X
Der Tipp für kantige, angesagte Arbeit: die wenigsten Leitplanken und native X-Integration. Grok 4.7 läuft in der API, in Cursor und in Grok Build; die Grok-App für $30 im Monat liefert weiterhin 4.6.
Ausführliche Analyse →
Genauigkeit & Recherche
Claude Fable 5.1
Höchste faktische Genauigkeit, die Artificial Analysis gemessen hat (67 %)
Führt die Boards an, die messen, wie oft ein Modell schlicht falsch liegt. Bestes Preis-Leistungs-Verhältnis: GPT-6.1 Sol, 62 % Faktengenauigkeit bei $0,72 pro Index-Aufgabe.
Ausführliche Analyse →
Problemlösung
GPT-6 Astra
#1 LiveBench Reasoning (92,65) und #1 ARC-AGI-2 (95 %)
Hat GPT-5.6 Sol die schwersten Reasoning-Boards wenige Tage nach dem Start abgenommen. Bestes Preis-Leistungs-Verhältnis: GPT-6.1 Sol zu $2 / $10, auf LiveBench Reasoning nur 0,02 dahinter und auf ARC-AGI-2 Zweiter.
Ausführliche Analyse →
KI-Agenten
Gemini Spark
Rund um die Uhr laufender Cloud-Agent ab $19,99 im Monat
Läuft durchgehend in einer Google-Cloud-VM, tief integriert mit Gmail, Docs und Chrome.
Ausführliche Analyse →

Willst du die besten KI-Modelle, ohne mit separaten Abos zu jonglieren? Fello AI vereint die führenden Modelle in einer nativen App für Mac, iPhone und iPad.

Fello AI laden
Was im Oktober 2026 neu ist
30. Sep. Google Gemini 4 Argon führt Arenas Text-Board an und zieht im Intelligence Index mit GPT-6 Astra gleich, nutzen können es aber nur Cyber-Verteidiger Neu
Google hat am 30. September 2026 Gemini 4 Argon angekündigt, das erste Modell der Gemini-4-Generation und sein erstes Flaggschiff seit Gemini 3.1 Pro im Februar. Es ist ein Reasoning-Modell für lange, komplexe Arbeit, Programmierung, juristische und finanzielle Recherche und Cyberabwehr, und es kann in einer Antwort bis zu 1M Ausgabe-Tokens schreiben statt bisher 64K. Artificial Analysis gibt ihm bei hohem Aufwand 52,6 auf Intelligence Index v4.3.2, gleichauf mit GPT-6 Astra bei 52,7 und unter den eigenständigen Modellen Fünfter hinter Claude Opus 5.5, Claude Sonnet 5.5 und Claude Fable 5.1, zum Einführungspreis bei $1,99 pro Index-Aufgabe. Herausragend ist dort die Zuverlässigkeit: eine Halluzinationsrate von 15 % auf AA-Omniscience, die niedrigste, die Artificial Analysis unter den führenden Modellen gemessen hat, auch wenn es nur 50 % der Fragen richtig beantwortet, gegen 67 % bei Fable 5.1. Es führt außerdem AutomationBench-AA mit 77,5 % vor den 71,3 % von Claude Sonnet 5.5 an, liegt aber auf Terminal-Bench 4.0 mit 57,1 % hinter den 63,6 % von Sonnet 5.5. Arena setzte es binnen eines Tages auf Platz eins bei Text mit 1524,8 sowie bei kreativem Schreiben und Mathematik, bei WebDev aber nur auf Platz acht mit 1679. In Googles eigener Tabelle führt es DeepSWE v1.1 mit 77,9 % und den Vals Index an und verliert Terminal-Bench 4.0 an Claude Opus 5.5 und FrontierSWE v2 an GPT-6 Astra. Der Haken ist der Zugang: Argon ging nur an geprüfte Cyber-Verteidiger in Googles Fairwind-Programm, als Nächstes folgen zahlende API-Kunden und Abonnenten von Google AI Ultra, ohne Datum. Der Einführungspreis liegt bei $2 / $10 pro 1M Tokens mit 95 % Rabatt auf Cache-Input, der Standardpreis bei $4 / $20. Keine Krone auf dieser Seite wandert, bevor Menschen es nutzen können und die anderen Boards es bewerten. Alle Details in unserer Analyse zu Gemini 4 Argon.
29. Sep. OpenAI GPT-6.1 Sol erreicht zu $2 / $10 Platz fünf im Intelligence Index, pro Aufgabe das günstigste Modell der Spitzengruppe Neu
OpenAI hat GPT-6.1 Sol am 29. September 2026 auf dem DevDay veröffentlicht, eine Woche nach GPT-6 Sol, zum selben Preis von $2 / $10 pro 1M Tokens und mit auf $0,10 halbiertem Cache-Input. OpenAI sagt, es erreiche bei agentischem Programmieren, Computersteuerung und professioneller Arbeit fast GPT-6 Astra, zu einem Fünftel von Astras Tokenpreisen, und die unabhängigen Zahlen zeigen es nah dran, aber nicht gleichauf. Artificial Analysis bewertet es auf Intelligence Index v4.3.2 bei maximalem Aufwand mit 51,8, Platz fünf unter den eigenständigen Modellen hinter Claude Opus 5.5 mit 57,6, Claude Sonnet 5.5 mit 56,0, Claude Fable 5.1 mit 53,4 und Astra mit 52,7, gegenüber 47,5 für GPT-6 Sol, und eine Index-Aufgabe kostet $0,72, gegenüber $3,26 bei Astra und $5,98 bei Opus 5.5. LiveBench sieht es bei Reasoning mit 92,63 auf Platz zwei, 0,02 hinter Astra, bei Mathematics mit 96,83 auf Platz drei und bei Language mit 90,13 auf Platz zwei, bei Coding aber mit 80,7 weit außerhalb der Top zehn. Auf Terminal-Bench 4.0 erreicht es 56,1 % gegenüber 43,9 % bei GPT-6 Sol, und auf GDPval-AA v2.1 kommt es auf 1575, mehr als Astras 1542. Arena, EQ-Bench und ARC Prize haben es noch nicht bewertet. Es steht in ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu bereit, nicht im Chat, und jede GPT-6-Stufe berechnet ab 272K Prompt-Tokens den 2-fachen Input und den 1,5-fachen Output auf die gesamte Anfrage. Ein GPT-6.1 Astra kam nicht dazu; laut Wall Street Journal wurde dessen Veröffentlichung im Oktober nach internen Sicherheitstests abgesagt. Auf derselben Veranstaltung stellte OpenAI die OpenAI dots vor, rund um die Uhr laufende Agenten auf GPT-6 Astra, dazu einen ChatGPT-Pro-Tarif für $500. Seitdem hat Arena es mit 1759 auf Platz drei bei WebDev gesetzt, ARC Prize hat ihm 94,2 % auf ARC-AGI-2 gegeben, Platz zwei direkt hinter Astra, und Gemini 4 Argon hat es im Index auf Platz sechs verdrängt.
28. Sep. Anthropic Claude Sonnet 5.5 landet mit 56,0 auf Platz zwei des Intelligence Index, zum Sonnet-Preis von $2 / $10 Neu
Anthropic hat am 28. September 2026 Claude Sonnet 5.5 veröffentlicht, das zweite Modell der Claude-5.5-Familie, zum selben Preis wie Sonnet 5, $2 / $10 pro 1M Tokens, mit Cache Reads für $0,20. Laut Anthropic läuft es mehr als 30 % schneller und kostet pro Aufgabe bis zu 30 % weniger, und die unabhängigen Zahlen stützen die Aussage zur Leistung: Artificial Analysis misst bei maximalem Aufwand 56,0 auf Intelligence Index v4.3.2, nur hinter Claude Opus 5.5 mit 57,6 und vor Claude Fable 5.1 mit 53,4 und GPT-6 Astra mit 52,7, gegenüber 38,2 für Sonnet 5. Es gewinnt den Terminal-Bench-4.0-Lauf von Artificial Analysis mit 63,6 % gegen 59,6 % für Opus 5.5, LiveBench Coding mit 91,4 gegen 89,3 und AutomationBench-AA mit 71,3 % gegen 69,5 %, und auf GDPval-AA v2.1 liegt es zwei Elo-Punkte hinter Opus 5.5, 1844 zu 1846. Der Haken ist der Aufwand. Bei maximalem Aufwand hat Sonnet 5.5 für den Index 410 Millionen Tokens verbraucht, und eine Aufgabe kostet $7,60, gegenüber $5,98 für Opus 5.5 und $5,09 für Sonnet 5. Bei xhigh erreicht es 51,9 für $2,74 pro Aufgabe, nah an den 52,7 von GPT-6 Astra und günstiger als dessen $3,26, bei high 46,7 für $1,08. Die Claude-Apps nutzen standardmäßig den Aufwand Medium, die API High. Schwächer ist es dort, wo Opus 5.5 am stärksten ist: 56,3 bei LiveBench Agentic Coding gegen 71,7 und 32,3 auf dem AA-Omniscience-Index, der Halluzinationen bestraft, gegen 46,4. Die Arena hat es noch nicht eingestuft. Laut Anthropic kann jeder auf claude.ai mit Sonnet 5.5 chatten, und riskantere Cybersicherheitsanfragen fallen auf Sonnet 5 zurück, das jetzt ein Legacy-Modell ist. Arena hat es inzwischen mit 1709 auf Platz fünf bei WebDev eingestuft.
22. Sep. OpenAI GPT-6 Sol und GPT-6 Luna halbieren OpenAIs API-Preise und landen überall außer im Chatfenster von ChatGPT Neu
OpenAI hat GPT-6 Sol und GPT-6 Luna am 22. September 2026 veröffentlicht, rund neunzig Minuten nachdem Anthropic Claude Opus 5.5 ausgeliefert hatte, und der Start ist ein Argument über Kosten pro Aufgabe, nicht über die Spitze des Boards. Sol fällt von $4 / $20 auf $2 / $10 pro 1M Tokens und Luna von $0,20 / $1,20 auf $0,10 / $0,50, Lesezugriffe aus dem Cache sind um 90 % rabattiert, auf $0,20 und $0,01. OpenAI bezeichnet beide Senkungen als 50 %, doch Lunas Ausgabe sinkt um 58,3 %, und verglichen wird mit den Aktionspreisen von GPT-5.6, nicht mit der Liste. Zwei Sprecher und Tibo Sottiaux von OpenAI sagen übereinstimmend, die neuen Sätze seien dauerhaft. Wo man sie nutzen kann, ist der Teil, den jede Zusammenfassung eingeebnet hat: Die Modelle stecken in ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu, Free- und Go-Nutzer erreichen Luna in der Desktop-App, und OpenAI schreibt klar, sie seien „not yet available in Chat“. Unabhängig davon misst Artificial Analysis Sol mit 47,5 auf Intelligence Index v4.3.2 bei maximalem Aufwand gegen 47,0 für GPT-5.6 Sol, zu $1,06 pro Index-Aufgabe gegen $1,99, mit 43,9 % auf Terminal-Bench 4.0 gegen 39,9 % und einer Halluzinationsrate, die von 92 % auf 60 % fällt. Luna liegt mit 37,3 gleichauf mit GPT-5.6 Luna, erledigt eine Index-Aufgabe aber für $0,07 gegen $0,18, womit es das günstigste Modell pro Index-Aufgabe auf dieser Seite ist. ARC Prize hat Luna bewertet, 59,3 % auf ARC-AGI-2 gegen 59,5 % für den 5.6er-Build, und zu Sol nichts veröffentlicht. OpenAIs eigene Evaluationen sind durchweg Kostenargumente: Auf AutomationBench 1.0.6 nimmt Sol bei xhigh-Aufwand 33,2 % zu $0,27 pro Aufgabe, und die nächstliegende Konkurrenzzeile ist Claude Fable 5.1 mit Opus-5-Fallback bei 31,4 %, der echte Vorsprung beträgt also 1,8 Punkte statt der 6,3, die die Zeile zu Claude Opus 5 nahelegt. OpenAI sagt, Sol mache etwa halb so viele Fehler wie GPT-5.6 Sol, „approaching Astra-level reliability at much lower cost“, und wiederholt, dass Astra insgesamt weiterhin sein bestes Modell ist. Eine Krone bewegt sich dadurch nicht: Sol und Luna sind günstiger, nicht besser. Ein GPT-6 Terra gibt es nicht, und OpenAI hat nicht gesagt, ob eines geplant ist. Alle Details in unserer Analyse zu GPT-6 Sol und Luna.
22. Sep. Anthropic Claude Opus 5.5 holt sich den Intelligence Index mit 57,6 und unterbietet Opus 5 im Preis Neu
Anthropic hat Claude Opus 5.5 am 22. September 2026 veröffentlicht, das erste Modell einer neuen Claude-5.5-Familie, und es ist die größte Bewegung an einem einzigen Tag, die diese Seite verzeichnet hat. Artificial Analysis misst es mit 57,6 auf Intelligence Index v4.3.2, 4,3 Punkte über Claude Fable 5.1 und der höchste Wert, den sie je für ein Modell veröffentlicht hat, und es nimmt GDPval-AA v2.1 mit 1846 gegen 1735 für Fable 5.1, AA-Briefcase v1.1 mit 1822 gegen 1678, Humanity's Last Exam mit 61,4 % gegen 59,1 % sowie den eigenen Terminal-Bench-4.0-Lauf von Artificial Analysis mit 59,6 % gegen 59,1 % für GPT-6 Astra gleich mit. Der Preis sinkt, statt zu steigen: $4 / $20 pro 1M Tokens gegen $5 / $25 für Opus 5, Cache-Lesen 60 % günstiger bei $0,20 und Cache-Schreiben bei $5, wobei Anthropics eigene Tests eine typische Arbeitslast 40 % günstiger als auf Opus 5 und die Ausgabe über 30 % schneller sehen. Ein schneller Modus in Claude Code und auf der Claude-Plattform verdoppelt den Preis für bis zu 2,5-fache Geschwindigkeit. Auf Anthropics eigenem Harness ist der Coding-Abstand noch größer, 66,4 % auf Terminal-Bench 4.0 gegen die 57,9 %, die OpenAI für Astra angibt, dazu 54,4 % auf FrontierCode v1.1 und 57,8 % auf CursorBench 4.0. Zwei Dinge gewinnt es nicht: Zapiers AutomationBench, wo Astra 41,4 % zu seinen 40,0 % erreicht, und Terminal-Bench-Science 0.1, wo Astra 64,6 % zu seinen 58,7 % erreicht. Lesen Sie die Abstände mit dem Vorbehalt, den Anthropic selbst abdruckt, dass das Modell „performs at the level of Claude Fable 5.1 on most work“ und dass „benchmark margins have become a less reliable guide to real-world differences“. Es ist allgemein verfügbar auf der Claude-Plattform als claude-opus-5-5 sowie auf AWS, Google Cloud und Microsoft Azure, die Fünf-Stunden-Limits steigen in Pro, Max und Team, und Claude Sonnet 5.5 und Claude Haiku 5.5 folgen in den kommenden Wochen. Da es in Biologie und Cybersicherheit an Claude Mythos 5.1 heranreicht, erscheint es mit den Schutzmaßnahmen von Fable 5.1 und einem neuen Life Sciences Verification Program für geprüfte Labore. Kein Arena-Board hat es bisher bewertet. Arena führt es inzwischen auf Platz eins bei WebDev und Platz vier bei Text. Alle Details in unserer Analyse zu Claude Opus 5.5.
21. Sep. SpaceXAI Grok 4.7 kommt auf einem größeren Basismodell zu unveränderten $2 / $6 und kostet 47 % mehr pro Aufgabe Neu
SpaceXAI hat Grok 4.7 am 21. September 2026 als sein leistungsfähigstes Modell für Programmierung und Wissensarbeit veröffentlicht. Es nutzt ein neues, größeres Basismodell als Grok 4.6, mit einem längeren Reinforcement-Learning-Lauf, der auf Aufgaben mit vielen Stunden Dauer gewichtet ist, und wurde darauf trainiert, den Grok-Bot-Harness nativ zu verstehen. Eine Parameterzahl veröffentlicht das Unternehmen nicht. Nach eigenen Zahlen erreicht es 46,3 % auf CursorBench 4.0 gegen 40,4 % für Grok 4.6 und 41,7 % für GPT-5.6 Sol, 71,0 % auf DeepSWE v1.1 bei hohem Aufwand, 64,0 % auf EEBench, 38,0 % auf Terminal-Bench 4.0, 19,6 % auf dem Harvey-Rechtsagenten-Benchmark und 56,7 % auf HealthBench Professional. Unabhängig davon setzt Artificial Analysis es auf 46,3 im Intelligence Index v4.3.2 bei hohem Aufwand gegen 44,3 für Grok 4.6 sowie auf 1695 bei GDPval-AA v2.1 und 1657 bei AA-Briefcase v1.1, beides über GPT-6 Astras 1542 und 1569. Der Preis bewegt sich nicht, $2 / $6 pro 1M Tokens, wobei ab 200.000 Prompt-Tokens die gesamte Anfrage mit $4 / $12 neu berechnet wird, und eine schnelle Variante läuft mit doppelter Ausgabegeschwindigkeit zum doppelten Preis. Was sich bewegt, sind die Kosten pro Aufgabe: $2,73 gegen $1,86 bei Grok 4.6, weil 4.7 für dasselbe Ergebnis rund doppelt so viele Ausgabetokens erzeugt, und xhigh bringt in keiner der beiden Generationen zusätzliche Indexpunkte. Zur Sicherheit meldet SpaceXAI die stärkste getestete Verweigerungs- und Jailbreak-Resistenz, 62,4 % auf LatchBios Biosicherheits-Benchmark und 3,3 % durchgelassene riskante Dual-Use-Prompts auf dem eigenen HackerBench v0.3. Die Verfügbarkeit ist entwicklerseitig: Grok-API, Cursor, Grok Build, fremde Coding-Harnesses und Cloud-Router. Die Ankündigung sagt nichts über die Endkunden-App Grok, die weiterhin Grok 4.6 ausliefert. Alle Details in unserer Analyse zu Grok 4.7.
21. Sep. Xiaomi Xiaomis MiMo-V2.6-Pro ist das am höchsten bewertete offene Modell überhaupt, zu $0,13 pro Index-Aufgabe unter MIT Neu
Xiaomi hat MiMo-V2.6-Pro am 21. September 2026 unter schlichtem MIT veröffentlicht, die Gewichte lagen noch am selben Tag auf Hugging Face unter XiaomiMiMo/MiMo-V2.6-Pro-RL. Es ist ein Mixture-of-Experts mit 1,02 Billionen Parametern, davon 42 Milliarden aktiv, und 1M Tokens Kontext. Artificial Analysis misst es, statt es zu schätzen, mit 46,3 auf Intelligence Index v4.3.2, der höchste offene Wert, den sie je veröffentlicht hat: über GLM-5.3 mit 44,8, über Kimi K3 mit 43,6 und gleichauf mit SpaceXAIs brandneuem Grok 4.7. Die andere Hälfte der Geschichte sind die Kosten. Es erledigt eine Intelligence-Index-Aufgabe für $0,13 bei $0,435 / $0,87 pro 1M Tokens, günstiger pro Aufgabe als jedes andere offene Modell auf dieser Seite, rund die Hälfte von GLM 5.3 Flash bei viereinhalb Punkten mehr. Es nimmt außerdem 34,8 % auf Terminal-Bench 4.0, 1673 auf GDPval-AA v2.1, 49,4 % auf Humanity's Last Exam und 86,3 % auf AA-LCR, womit es Kimi K3 auf dreien dieser vier schlägt. Zwei Grenzen gehören klar gesagt. Kein Arena-Board hat es bewertet, es gibt also überhaupt keinen Beleg zur menschlichen Präferenz, und es ist vier Tage alt, hat also außerhalb von Artificial Analysis keine unabhängige Historie. Und 1,02 Billionen Parameter sind ein Cluster, keine Workstation, weshalb GLM 5.3 Flash unsere Empfehlung für Teams bleibt, die wirklich selbst hosten wollen. Die Open-Weight-Krone auf dieser Seite übernimmt es über gemessenen Wert und Kosten. Arena hat es inzwischen bewertet, auf Rang 23 bei WebDev und Rang 25 bei Text.
20. Sep. Alibaba Qwen-Image-2.1 ist das beste Bildmodell zum Herunterladen, doch die Lizenz erlaubt nur Forschung Neu
Alibabas Qwen-Team hat Qwen-Image-2.1 am 20. September 2026 gleichzeitig auf Hugging Face, ModelScope und GitHub veröffentlicht, und es ist jetzt das beste Bildmodell, das Sie herunterladen können. Es ist ein einziges Modell für Generierung und Bearbeitung, mit einem Generator von 7 Milliarden Parametern statt rund 20 Milliarden beim ursprünglichen Qwen-Image. Es erzeugt nativ transparente PNGs und bearbeitet mit bis zu 10 Referenzbildern. Auf den unabhängigen Boards ist es auf allen vier das am höchsten platzierte Open-Weight-Modell: #17 bei Arena Bildbearbeitung (1366,4), #18 bei Arena Text-zu-Bild (1227,6) und #18 auf beiden Boards von Artificial Analysis. Der Haken ist die Lizenz. Die 2.1-Gewichte stehen unter der Qwen Research License „nur für Forschungs- oder Evaluierungszwecke“, eine Abkehr von den Apache-2.0-Bedingungen früherer Qwen-Image-Releases, und sind damit keine kostenlose kommerzielle Option. Für kommerzielle Arbeit sind die älteren Apache-2.0-Releases die sichere Wahl, auch wenn sie weit tiefer stehen, Qwen-Image-2512 auf Platz 43 bei Arena Text-zu-Bild. Alibabas gehostetes Qwen-Image-3.0-Pro, im Juli gestartet, steht mit Platz 12 bei Arena Text-zu-Bild höher, hat aber keine Gewichte und kostet in der API $0,04 bis $0,075 pro Bild. Alle Details in unserem Ratgeber zum Qwen-Bildgenerator.
15. Sep. TypeSafe TypeSafe verlässt den Stealth-Modus mit Jev, einem Modell, das statt Text typisierte Entscheidungen liefert, für $0.042 pro 1M Tokens Neu
TypeSafe AI ist am 15. September 2026 nach zwei Jahren im Stealth-Modus an die Öffentlichkeit gegangen, mit 40 Millionen Dollar Seed-Finanzierung unter Führung von DCVC und einem Modell, das überhaupt keinen Text erzeugt. Jev ist das erste von dem, was das Unternehmen System-One-Modelle nennt: Sie schicken einen Zustandsblock und eine fest definierte Menge typisierter Fragen, und das Modell beantwortet alle in einem parallelen Durchlauf und liefert statt eines Satzes eine Auswahl, einen Score oder eine Ja-Nein-Wahrscheinlichkeit. Da der Antwortraum vor dem Aufruf feststeht, kann es kein fehlerhaft geformtes Ergebnis zurückgeben, und daher stammt die Aussage im Ankündigungsbeitrag, Jev könne nicht halluzinieren. Die falsche Option kann es trotzdem wählen, und die eigene Dokumentation von TypeSafe schreibt, dass Kalibrierung die Richtigkeit einer einzelnen Antwort nicht garantiert. Der Preis liegt bei $42 pro Milliarde Eingabetokens, also $0.042 pro 1M, Ausgabe kostenlos, bei 64k Kontext und reiner Texteingabe. Die Leistungsangaben brauchen Sorgfalt, denn das Unternehmen hat in drei Tagen vier verschiedene veröffentlicht: von unter 100 Millisekunden und bis zu 100x schneller in der Pressemitteilung bis zu 193.6x schneller und 444.6x günstiger auf der Startseite, jeweils gegen einen anderen Rivalen gemessen, wobei die eigene Fußnote die großen Zahlen als oberes Ende realer Gewinne bezeichnet. Das Workflow-Eval misst gegen den Durchschnitt von GPT-6 Astra und Fable 5.1 statt gegen eine belastbare Wahrheit, und öffentliche Benchmark-Werte veröffentlicht die Firma bewusst gar nicht. Zwei unabhängige Tests vom 18. September maßen rund 6x geringere Kosten und 8x mehr Tempo gegenüber einem günstigen Modell mit abgeschaltetem Reasoning, und die Kalibrierung hielt. Nichts davon verschiebt eine Wahl auf dieser Seite: Jev hat keine Verbraucheroberfläche und ist Early Access mit Warteliste. Alle Details in unserer Erklärung der System-One-Modelle.
10. Sep. DeepSeek DeepSeek stellt V4-Flash ein, ersetzt es durch V4.1-Flash und senkt den Flash-Tarif um rund ein Drittel Neu
DeepSeek hat DeepSeek-V4-Flash am 10. September 2026 eingestellt und DeepSeek-V4.1-Flash an seine Stelle gesetzt. Der Modellname lautet jetzt deepseek-flash; die alten Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp lösen weiterhin auf, die Modelle dahinter sind aber eingestellt, und die Anfragen bedient V4.1-Flash zum Flash-Preis. Dieser Preis liegt rund ein Drittel niedriger: $0.15 / $0.60 pro 1M Tokens außerhalb der Stoßzeiten und $0.30 / $1.20 zu Stoßzeiten, gegen $0.22 / $0.66 und $0.44 / $1.32 beim abgelösten Stand, mit Cache-Treffern zu $0.003 außerhalb der Stoßzeiten. Die Stoßzeitfenster bleiben unverändert, 01:00 bis 04:00 und 06:00 bis 10:00 UTC an Werktagen, jede andere Stunde zum halben Preis. V4-Pro bleibt unangetastet bei $0.66 / $1.98 außerhalb der Stoßzeiten, und DeepSeek hat angekündigt, es über das Abschaltdatum 14. September hinaus weiter anzubieten. Das neue Modell ist ein Mixture-of-Experts mit 552 Milliarden Parametern auf einem Causal-Encoder-Decoder-Design, das beim Prefill 8 Milliarden und beim Decode 16 Milliarden Parameter aktiviert, ein 1M-Token-Kontextfenster mitbringt, Bilder nativ liest und noch am selben Tag unter MIT auf Hugging Face erschien. Artificial Analysis bewertet es mit 39,5 auf dem Intelligence Index v4.3 gegen 34,5 für den abgelösten Stand V4-Flash 0731, bei $0.27 pro Index-Aufgabe. Den Preis-Leistungs-Tipp holt es sich damit nicht zurück: GLM 5.3 Flash steht bei 41,9 für $0.25 pro Aufgabe. Alle Details in unserem DeepSeek-Preisratgeber.
3. Sep. OpenAI GPT-6 Astra startet für $10 / $50 und ist binnen eines Tages auf Plus und Pro und führt die Coding-Boards an Neu
OpenAI hat GPT-6 Astra am 3. September 2026 gestartet und damit den Streit beendet, der das ganze Jahr lief: Das ist GPT-6 und kein weiteres Point-Release der GPT-5-Reihe. Firmenpräsident Greg Brockman sagte bei einem Pressebriefing „Willkommen in der AGI-Ära.“ Die unabhängigen Zahlen fallen nüchterner aus als die Rahmung. Artificial Analysis gibt Astra 61 auf dem Intelligence Index v4.1.1 bei max, exakt gleichauf mit GPT-5.6 Sol, fünf Punkte hinter Claude Fable 5.1 mit 66 und zwei hinter Claude Opus 5 mit 63, und es kostet $10 / $50 pro 1M Tokens gegen die $4 / $20 von Sol, was pro Index-Aufgabe 75 % teurer ist als das Modell, das es ablöst. Das stärkere Ergebnis liefert der Coding Agent Index: Astra kommt in Codex auf 67, gleichauf mit Claude Opus 5 und Claude Fable 5 in Claude Code und hinter den 70 von Claude Fable 5.1, und erreicht das mit einem Drittel der Tokens von Sol und einem Fünftel derer von Opus 5, was es auf die Kosteneffizienz-Grenze bringt. Auf AA-Omniscience halbiert es zudem die Halluzinationsrate, von 92 % auf 51 % bei max, und gewinnt dabei vier Punkte Genauigkeit, legt rund 80 Elo auf AA-Briefcase zu und sechs Punkte auf Humanity's Last Exam. Dagegen verliert es etwa 80 Elo auf GDPval-AA v2 und fällt bei Kundensupport, SciCode und Long-Context-Reasoning um zwei bis drei Punkte zurück. Zwei Vorbehalte gehören zu den Launch-Zahlen: Die 98,6 % auf ARC-AGI-3 sind keine Lösungsquote, sondern ein Effizienzwert für Aktionen gegen eine menschliche Referenz, gemessen auf einem Harness, von dem OpenAI selbst gezeigt hat, dass es das Ergebnis verdreifachen kann, und Epoch AI legt offen, dass OpenAI FrontierMath finanziert hat und exklusiven Zugang zu einem Teil davon hält. Die eigentliche Hürde ist die Verfügbarkeit. Astra ist das erste Modell, das OpenAI in seinem Preparedness Framework bei Cybersicherheit als kritisch eingestuft hat, deshalb bekamen es zugelassene Verteidiger im Daybreak-Programm zuerst. ChatGPT Business und Pro folgten am 4. September und Plus wenige Stunden später, während die API, AWS, Azure und die Gratis-Stufe noch ausstehen. Artificial Analysis hat den Coding Agent Index inzwischen eingestellt, und im eigenen Terminal-Bench-4.0-Lauf führt Astra nun klar, 60 % gegen die 55 % von Claude Fable 5.1, was die Coding-Krone auf dieser Seite zu Astra bewegt hat. Claude Opus 5.5 hat ihm diese Krone am 22. September abgenommen. Alle Details in unserer GPT-6-Astra-Analyse.
2. Sep. Alibaba Qwen3.8-Max-0902 nimmt Claude Opus 5 Arenas WebDev-Board um drei Punkte ab, für $2 / $6 Neu
Alibaba brachte am 2. September 2026 Qwen3.8-Max-0902, und die Benennung ist das Erste, was man richtig verstehen muss: Dies ist eine Post-Training-Auffrischung des am 3. August erschienenen Qwen3.8-Max, keine neue Version, mit denselben 2,4 Billionen Parametern und demselben 1M-Token-Kontextfenster. Qwen gibt an, es sei zusätzlich auf Coding und Cowork-artige Arbeit nachtrainiert worden. Wichtig ist das Board, das es bewegt hat. Arena meldete am selben Tag, dass Qwen3.8-Max-0902 mit 1691 Punkten insgesamt auf #1 der Code Arena: WebDev debütierte, drei Punkte vor Claude Opus 5 (Max), siebzehn vor Kimi K3 (Max) und zweiundzwanzig vor dem bisherigen Qwen3.8-Max, dazu #1 in den Kategorien Data & Analytics und Consumer Product. Es ist das erste Mal in diesem Jahr, dass ein Anthropic-Modell von der Spitze eines abstimmungsbasierten Coding-Boards verdrängt wurde. Der Preis liegt bei $2 / $6 pro 1M Tokens mit Cache-Hits zu $0.17 explizit und $0.25 implizit, was Arena als gemischte $5 pro Million und beste Position auf ihrer Pareto-Front verbucht. Lies das mit drei Vorbehalten. Drei Punkte liegen auf einem abstimmungsbasierten Board im Rauschen, Artificial Analysis hatte für den 0902-Snapshot damals keinen Intelligence Index veröffentlicht und bewertet ihn inzwischen mit 45,4 auf v4.3, und dies ist ein gehostetes Modell auf QwenCloud ohne Consumer-Chat-Oberfläche: Die offenen Gewichte, die Alibaba im August für Qwen3.8-Max versprach, sind weiterhin nicht erschienen, also ändert sich unser Open-Weight-Tipp dadurch nicht. Arena sagt, Agent-Arena-Werte stünden noch aus. Qwen3.8-Max-0902 ist inzwischen auf WebDev auf den zehnten Platz zurückgefallen, und die Coding-Kategorie ist an Claude Opus 5.5 gegangen. Alle Details in unserer Analyse zu Qwen 3.8.
2. Sep. Meta Muse Spark 1.3, Intelligence Index von 57 auf 61 bei unveränderten $1.25 / $4.25, gewinnt beim Coding und verliert jede Agenten-Zeile Neu
Meta veröffentlichte Muse Spark 1.3 am 2. September 2026, das vierte Muse-Spark-Modell in fünf Monaten, in Muse Code und der Meta Model API. Artificial Analysis bewertet es mit 61 auf dem Intelligence Index v4.1.1, gegenüber 57 für 1.2 und 53 für 1.1, also acht Punkte in zwei Monaten und der schnellste Anstieg, den auf dieser Seite irgendjemand hinlegt. Der Preis hat sich überhaupt nicht bewegt: $1.25 / $4.25 pro 1M Tokens auf einem Kontextfenster von 1M Tokens, mit der Contributor-Stufe weiterhin bei $0.10 / $0.20 im Gegenzug dafür, dass Meta auf deinen Prompts und Completions trainieren darf. Zwei Dinge an diesem Start muss man genau lesen. Auf Metas eigener Scorecard gewinnt das Modell jede Coding-Zeile, DeepSWE v1.1 mit 75,4 gegen die 74,0 von Claude Opus 5 und SWEAtlas CodeBase QnA mit 59,4, es zieht bei Terminal-Bench 2.1 mit GPT-5.6 Sol bei 88,8 gleich und nimmt beide MRCR-Long-Context-Bänder mit deutlichem Abstand, 98,1 im Band von 512K bis 1M gegen 55,5 für 1.2. Es verliert aber auch alle sechs Zeilen, die Meta unter Agent führt, vier an Opus 5 und zwei an GPT-5.6 Sol, und diese Hälfte des Charts wurde kaum berichtet. Der zweite Haken ist, welches Modell gemessen wurde: Die Benchmark-Spalte ist Muse Spark 1.3 (max), eine Limited Preview für Metas Partner mit 62 Punkten, während die Version, die heute jeder aufrufen kann, xhigh mit 61 ist, und Meta ließ die Vergleichsspalte für 1.2 auf xhigh statt auf max laufen. Meta brachte es zuerst zu Entwicklern, über Muse Code und die Meta Model API, und kündigte an, ein Rollout zu Facebook, Instagram und der Meta-AI-App werde in den kommenden Tagen folgen, und das Open-Weights-Versprechen verschob sich erneut: Aus der Zusage vom August, die Gewichte von Muse Spark 1.2 zu veröffentlichen, wurde ein undatierter Satz über bald kommende offene Gewichte. Alle Details in unserer Muse Spark 1.3 Analyse.
2. Sep. Google Gemini 3.8 Flash, drei Punkte mehr auf dem Intelligence Index zum selben $0.75 / $3.75 Neu
Google hat Gemini 3.8 Flash am 2. September 2026 allgemein verfügbar gemacht, drei Wochen nach 3.7 Flash und als dritter Flash-Release in 43 Tagen. Alle Spezifikationen bleiben unverändert: 1M Eingabekontext, ein Ausgabelimit von 64K, Wissensstand März 2026, dieselbe Modalitätsliste und dieselben einführenden $0.75 / $3.75 pro 1M Tokens, die sich am 1. Januar 2027 auf $1.50 / $7.50 verdoppeln. Bewegt haben sich nur die Werte, und zwar in jeder veröffentlichten Zeile. DeepSWE v1.1 steigt von 65,3 % auf 73,7 %, Terminal-bench 2.1 von 85,8 % auf 89,4 %, Terminal-bench 4.0 von 11,2 % auf 19,1 % und BioMysteryBench Human Difficult von 43,5 % auf 56,5 %. Artificial Analysis gibt ihm 59 auf dem Intelligence Index v4.1.1 gegenüber 56 für 3.7 Flash und misst 304,6 Ausgabe-Tokens pro Sekunde gegenüber 279,4, bei einer langsamen Zeit bis zum ersten Token von 13,39 Sekunden, was es eher zu einem Batch- und Agentenmodell macht als zu einem für interaktiven Chat. Lies die Siege zusammen mit den Niederlagen: Googles eigene Vergleichstabelle gibt 3.8 Flash 8 von 14 Zeilen, und Claude Opus 5 gewinnt weiterhin Terminal-bench 4.0 mit 51,8 % gegen 19,1 %, OSWorld-2.0 mit 75,4 % gegen 59,0 % und GDPVal-AA v2 mit 1824 gegen 1545 Elo. Die DeepSWE-Zahl, die ein Großteil der Launch-Berichterstattung übernommen hat, 71,0 %, steht so nicht in Googles PDF; dort sind es 73,7 % gegen 74,0 % für Opus 5. Der Entwicklerzugang war zur Ankündigung live, über die Gemini API, AI Studio, Antigravity und die Gemini Enterprise Agent Platform. Der Verbraucherzugang wird für Abonnenten von Google AI Pro und Ultra berichtet, doch die Release Notes der Gemini-Apps führen dazu noch keinen Eintrag, und die kostenlose Gemini-Stufe fällt am 9. Oktober 2026 von 3.6 Flash auf Flash-Lite zurück. Alle Details in unserer Analyse zu Gemini 3.8 Flash.
1. Sep. Anthropic Claude Fable 5.1 und Mythos 5.1, eine neue #1 auf Artificial Analysis mit 66 und 75 % weniger für Cache-Reads Neu
Anthropic veröffentlichte Claude Fable 5.1 und Claude Mythos 5.1 am 1. September 2026, und es sind ein Modell in zwei Safeguard-Konfigurationen statt zwei Modelle. Fable 5.1 ist allgemein verfügbar; Mythos 5.1 lockert die Beschränkungen in Biologie und Cybersicherheit und wird auf Einladung vergeben, ohne veröffentlichte Kriterien. Artificial Analysis bewertet Fable 5.1 mit 66 auf seinem Intelligence Index v4.1.1 bei max Effort, dem höchsten Wert, den es je gemessen hat, vor Claude Opus 5 mit 63, Claude Fable 5 mit 62 sowie GPT-5.6 Sol und Grok 4.6 mit 61. Es holte sich damals außerdem den Agentic Index mit 61 gegen die 59 von Opus 5, das GDPval-AA v2 Board für professionelle Deliverables mit 1853 gegen 1824 und Humanity's Last Exam mit 59,1 % gegen die 55,5 % von Fable 5. Die Effort-Einstellung zählt hier mehr als sonst: Dasselbe Modell liest 58 bei low, 60 bei medium, 62 bei high und 65 bei xhigh, und diese Einstellungen spannen einen elffachen Unterschied bei den Output-Tokens auf, von 13,1 Millionen bis 143,7 Millionen über die gesamte Suite. Die Preise bleiben unverändert bei $10 / $50 pro 1M Tokens, aber Cache-Reads fallen um 75 % auf $0.25 von den $1.00 bei Fable 5, und genau dort liegt bei langen agentischen Läufen die eigentliche Ersparnis. Nach Anthropics eigenen Zahlen erreicht es 52,6 % auf Terminal-Bench-Science 0.1 gegen die 29,0 % von Opus 5, und die 212-seitige System Card hob die eigene Alignment-Risikoeinschätzung des Unternehmens von sehr niedrig auf niedrig. Zwei Dinge vor dem Wechsel: Anthropic rät weiterhin, für die meisten Workloads mit Opus 5 zum halben Preis zu beginnen, und zum Start hatte kein Arena-Board Stimmen für eines der beiden Modelle. Fable 5.1 ist inzwischen bewertet: Es ist bei Arena WebDev Vierter, bei image-to-WebDev Zweiter und auf dem Text-Board Sechster. Alle Details in unserer Aufschlüsselung zu Claude Fable 5.1 und Mythos 5.1.
Ausstehend Google Gemini 3.5 Pro, weiterhin unveröffentlicht, und Gemini 4 Argon hat es überholt Verzögert
Gemini 3.5 Pro ist weiterhin nicht erschienen. Google kündigte es auf der I/O am 19. Mai zusammen mit Gemini 3.5 Flash an, doch nur Flash erschien, und Bloomberg berichtete am 16. Juli 2026, das Modell liege Monate hinter dem Zeitplan. Koray Kavukcuoglu von Google DeepMind sagte am 24. September, das Unternehmen sei einen kleinen Schritt zurückgetreten, um sich auf seine Flash-Modelle und auf Gemini 4 zu konzentrieren, und am 30. September kündigte Google stattdessen Gemini 4 Argon als nächstes Flaggschiff an. Ob 3.5 Pro überhaupt noch erscheint, hat Google nicht gesagt. Nutzen Sie bis dahin Gemini 3.8 Flash, wenn Sie über die API arbeiten, oder Gemini 3.6 Flash in der Gemini-App, wo es ab dem 9. Oktober 2026 Google AI Plus oder höher voraussetzt.
Kategorie-Tipp, Oktober 2026

Beste KI zum Schreiben

1
Claude Fable 5.1
Bestes Schreiben insgesamt
→
2
Kimi K3
Kreative Fiktion
→
3
Claude Sonnet 5.5
Kostenlos für den Alltag

Die beste KI zum Schreiben ist Claude Fable 5.1, und das Argument dafür ist Beständigkeit statt eines einzelnen ersten Platzes. Auf allen drei Text-Boards liegt es in den Top zehn: Zweiter auf EQ-Bench Creative Writing v3 mit 2162,0, Dritter auf LiveBench Language mit 89,5 und Zehnter auf Arenas Board für kreatives Schreiben. Kein anderes Modell platziert sich auf allen dreien so gut. Gemini 4 Argon führt jetzt Arenas Boards für kreatives Schreiben und Text an, mit 1518,8 und 1525,2, doch weder EQ-Bench noch LiveBench haben es bewertet, und nutzen können es nur Googles Fairwind-Partner. Claude Opus 5.5 ist auf Arenas Board für kreatives Schreiben mit 1516 Zweiter, auf EQ-Bench aber Siebter und auf LiveBench Language Achter; GPT-6 Astra führt EQ-Bench mit 2173,3 an, liegt auf Arenas Board für kreatives Schreiben aber nur auf Rang 39; Claude Fable 5 führt LiveBench Language mit 90,7 an und ist auf Arenas Board für kreatives Schreiben Dritter, auf EQ-Bench aber Elfter. Wenn Ihr Schreiben eher ein Arbeitsergebnis als Prosa ist, ist das Board für professionelle Deliverables GDPval-AA v2.1 eine andere Frage: Dort führt Claude Opus 5.5 mit 1867, Claude Sonnet 5.5 liegt 27 Punkte dahinter bei 1840 und Claude Fable 5.1 bei 1758. Claude Sonnet 5.5 ist der Preis-Leistungs-Tipp im kostenlosen Tarif, da es jeder auf claude.ai nutzen kann, erreicht aber nur 83,4 auf LiveBench Language, liegt auf Arenas Board für kreatives Schreiben erst auf Rang 42 und hat noch keine EQ-Bench-Bewertung. Claude Fable 5 ist der Tipp, wenn Sie Arenas menschliche Stimmen höher gewichten als die Harness-Werte; es kostet $10 / $50 pro 1M Tokens und ist dauerhaft in Claude Max und Team Premium mit etwa 50 % der regulären Nutzungsgrenzen enthalten. Übersetzung ist eine eigene Frage mit eigenem Sieger, die wir in unserem Leitfaden zur besten KI für Übersetzungen durchgehen.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Fable 5.1Bestes Schreiben insgesamt#2 EQ-Bench Creative Writing (2162,0), #3 LiveBench Language (89,5) und #10 Arena kreatives Schreiben, die beste Gesamtplatzierung aller ModelleFührt keines der drei klar an; Arenas Board für kreatives Schreiben führt jetzt Gemini 4 Argon an, vor Claude Opus 5.5$10 / $50
Claude Fable 5Stark auf den Boards mit menschlichen Stimmen#1 LiveBench Language (90,7), #3 Arena kreatives Schreiben (1503,0), #3 Arena Text (1504,9)#11 EQ-Bench; teuerste Option hier$10 / $50
Kimi K3Kreative Fiktion und Stimme#5 EQ-Bench Creative Writing (2082,3)Nur #26 auf Arena Creative Writing$3 / $15
Claude Sonnet 5.5Kostenloses AlltagsschreibenKostenlos auf claude.ai, 1M Kontext; #2 GDPval-AA v2.1 (1840), 27 Punkte hinter Opus 5.583,4 LiveBench Language; #42 Arena kreatives Schreiben; auf EQ-Bench noch unbewertet$2 / $10
Claude Opus 5.5Bestes verfügbares Modell bei Arenas kreativem Schreiben#2 Arena kreatives Schreiben (1516) und #4 Arena Text (1504); #1 GDPval-AA v2.1 (1867)#7 EQ-Bench und #8 LiveBench Language$4 / $20
Gemini 4 ArgonNoch nicht verfügbar#1 Arena kreatives Schreiben (1521,8) und #1 Arena Text (1524,8)Auf EQ-Bench und LiveBench nicht bewertet; nur Fairwind-Partner$2 / $10 zur Einführung, $4 / $20 regulär
GPT-5.5Faktenbasiertes Business-SchreibenDokumentierte Zuwächse bei faktischer Verlässlichkeit gegenüber GPT-5.4Reasoning-Stufen jetzt als veraltet markiert$5 / $30
Gemini 3.8 FlashMassen-Entwürfe in großem UmfangIntelligence Index 40,9, 308,4 Tok/s Ausgabe, 1M KontextEher auf Agenten als auf Prosa getrimmt; Einführungspreis verdoppelt sich am 1. Januar 2027$0.75 / $3.75
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der Tipp, wenn du Arenas menschliche Stimmen höher gewichtest, Claude Opus 5.5 ist das am höchsten platzierte verfügbare Modell auf Arenas Board für kreatives Schreiben und führt bei professionellen Deliverables, Kimi K3 ist der Tipp für eigenwillige Fiktion, steht auf EQ-Bench aber inzwischen auf Platz fünf, Claude Sonnet 5.5 ist der Preis-Leistungs-Tipp und das Modell, wenn du nicht zahlst, und Gemini 3.8 Flash ist der Tipp für Massenentwürfe. Gemini 4 Argon ist das Modell, das man im Blick behalten sollte, sobald Google den Zugang öffnet.
Was sich diesen Monat geändert hat

Die Schreibkrone bleibt bei Claude Fable 5.1, doch sein Vorsprung auf Arena ist geschrumpft. Googles Gemini 4 Argon, angekündigt am 30. September, ging mit 1521,8 direkt auf Platz eins von Arenas Board für kreatives Schreiben, schob Claude Opus 5.5 auf Platz zwei und Claude Fable 5 auf Platz drei, und Fable 5.1 rutschte von Rang sieben auf Rang zehn, weshalb diese Karte jetzt die Top zehn auf allen drei Text-Boards beansprucht statt der Top sieben. Argon kann die Krone nicht holen: EQ-Bench und LiveBench haben es nicht bewertet, und nutzen können es nur Googles Fairwind-Partner. Im September kamen Claude Opus 5.5 und Claude Sonnet 5.5, Sonnet 5.5 löste Sonnet 5 als kostenlosen Tipp ab, und GPT-6.1 Sol stieg auf LiveBench Language als Zweiter ein und verdrängte Fable 5.1 dort auf Platz drei.

Kategorie-Tipp, Oktober 2026

Beste KI für Chat & Alltag

1
GPT-5.6
ChatGPTs Standard
→
2
Claude Opus 5.5
#1 im Index
→
3
Claude Sonnet 5.5
Claude kostenlos

Die beste KI für den täglichen Chat ist GPT-5.6, und der ehrliche Grund ist Reichweite statt Board-Position. Es ist das Modell, das ChatGPT der größten Nutzerbasis der Kategorie standardmäßig ausliefert, was es zum besten Assistenten macht, den die meisten Menschen tatsächlich öffnen können. Bei der reinen menschlichen Präferenz ist es nicht der Spitzenreiter: GPT-5.6 Sol sitzt mit 1483,8 auf #20 von Arenas Text-Leaderboard, wo jetzt Gemini 4 Argon mit 1524,8 führt und Claude Opus 5.5 mit 1504,0 Vierter ist. Die meisten ChatGPT-Nutzer bekommen die ausgewogene Terra-Stufe, von der OpenAI sagt, sie entspreche GPT-5.5 und koste seit der Preissenkung vom 30. Juli 2026 60 % weniger. Es ist verfügbar in ChatGPT (kostenlos mit Limits, Plus zu $20/Monat, Pro zu $100/Monat), über die API (die 5.6-Stufen: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 pro 1M Tokens) und gebündelt in Fello AI neben Claude, Gemini, Grok und DeepSeek. Ein Vorbehalt: OpenAIs System Card und der Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, sodass GPT-5.5 Instant der sicherere Tipp für halluzinationsempfindliche Arbeit bleibt.

ModellAm besten fürStärkeSchwächePreis
GPT-5.6Täglicher Chat, ChatGPTs StandardDer Assistent, den die meisten öffnen können; Terra entspricht GPT-5.5 zu ~halbem Preis#20 auf Arena Text; Scheming von METR gemeldetKostenlos / $20/Mon. Plus; API $0.20 / $1.20 bis $4 / $20
Claude Opus 5.5Konversation mit dem höchsten Indexwert#1 auf dem Intelligence Index (57,6) und #4 auf Arena Text (1504,0)Nicht im Free-Tarif; auf Pro mit Nutzungsgrenzen$20/Mon. Pro, $4 / $20 API
Gemini 4 ArgonNoch nicht verfügbar#1 auf Arena Text (1524,8); 15 % Halluzinationsrate, die niedrigste unter den führenden ModellenNur Fairwind-Partner; nicht in der Gemini-App$2 / $10 API zur Einführung, sobald verfügbar
Claude Sonnet 5.5Kostenloser Claude-ChatKostenlos auf claude.ai; #2 auf dem Intelligence Index (56,0), nur hinter Claude Opus 5.5Auf Arena Text noch unbewertet; läuft in den Apps standardmäßig mit dem Aufwand MediumKostenlos / $20/Mon. Pro, $2 / $10 API
GPT-5.5 InstantHalluzinationsempfindliche Alltagsarbeit52,5 % weniger halluzinierte Aussagen vs. 5.3 InstantReasoning-Stufen jetzt als veraltet markiert$20/Mon. Plus; API $5 / $30
Gemini 3.6 FlashSchnell, günstig, multimodalModell der kostenlosen Gemini-Stufe bis zum 9. Oktober (danach AI Plus), 1M Kontext, #21 auf Arena TextSchwächer beim schwersten Reasoning; 3.8 Flash übertrifft es zum selben PreisKostenlos / $0.75 / $3.75 API
Fello AIAlle Top-Modelle, eine AppChatGPT + Claude + Gemini + Grok + DeepSeek und mehr auf Mac, iPhone und iPadÜber die App geroutet, nicht direkt$9.99/Mon.
Zweitplatzierte und Alternativen: Claude Opus 5.5 ist der Zweitplatzierte und führt den Index von Artificial Analysis an, Claude Sonnet 5.5 ist der Tipp für kostenlosen Claude-Chat, Gemini 3.6 Flash ist der Zweitplatzierte für schnell und günstig (kostenlos bis zum 9. Oktober, danach Google AI Plus), und Grok 4.6 ist der Nischen-Tipp für Live-News-Tage. Fello AI ist die naheliegende Wahl, wenn du die Top-Modelle in einer Mac- und iOS-App für $9.99/Monat willst, statt mit Abos zu jonglieren.
Was sich diesen Monat geändert hat

GPT-5.6 behält den Chat-Tipp wegen der Reichweite, und daran, wer was öffnen kann, hat sich nichts geändert: GPT-5.6 Luna ist weiterhin ChatGPTs kostenloser Standard, und die GPT-6-Modelle laufen weiterhin in ChatGPT Work und Codex statt im Chat. Das Präferenz-Board hat sich erneut bewegt. Gemini 4 Argon, angekündigt am 30. September, übernahm mit 1524,8 Platz eins auf Arenas Text-Board, und Claude Opus 5.5, das es vor einer Woche anführte, ist mit 1504,0 jetzt Vierter, etwa einen Punkt hinter Claude Opus 4.6 und Claude Fable 5. Opus 5.5 behält den zweiten Podiumsplatz als bestbewertetes Modell im Index von Artificial Analysis; Argon bleibt vom Podium fern, weil es nur Googles Fairwind-Partner nutzen können und es nicht in der Gemini-App ist. Im September wurde Claude Sonnet 5.5 das kostenlose Claude-Modell und übernahm den dritten Podiumsplatz von Claude Opus 5.

Kategorie-Tipp, Oktober 2026

Beste KI für Bilder

1
ChatGPT Images 2.5
Text in Bildern
→
2
MAI-Image-2.6
#3 AA Bildbearbeitung
→
3
Grok Imagine Image 2.0
Wenigste Beschränkungen

Die beste KI für Bildgenerierung ist ChatGPT Images 2.5, das OpenAI am 8. September in jedem ChatGPT-Tarif zum Standard gemacht hat und das alle vier von uns verfolgten Bild-Boards anführt. Seine zwei Modelle belegen auf jedem die Plätze eins und zwei: GPT-Image-2.5 Sunburst, auf Präzision ausgelegt, führt Arena Text-zu-Bild mit 1423,6 und Arenas Bildbearbeitung mit 1522,4 an, bei Artificial Analysis AA-Image-T2I v2.0 mit 1197 und AA-Image-Editing v2.0 mit 1182, und das schnellere GPT-Image-2.5 Flare ist auf allen vier Zweiter. Den Abstand zwischen Sunburst und Flare bei Arena Text-zu-Bild sollten Sie als vorläufig lesen, denn jedes beruht auf etwa 11.000 Stimmen gegenüber 89.000 für GPT Image 2. MAI-Image-2.6 ist Zweiter, Dritter auf dem Bearbeitungs-Board von Artificial Analysis und Vierter bei Arena Text-zu-Bild mit 1335,0. Dritter ist Grok Imagine Image 2.0 von SpaceXAI, im August erschienen und in Grok Imagine sowie über die xAI-API verfügbar: Es ist Vierter auf dem Text-zu-Bild-Board von Artificial Analysis und Vierter bei Arenas Bildbearbeitung und liegt damit auf drei der vier Boards vor Metas Muse Image. Das beste Bildmodell zum Herunterladen ist Alibabas Qwen-Image-2.1, am 20. September erschienen und jetzt das am höchsten platzierte Open-Weight-Modell auf allen vier Boards, Platz 17 bei Arenas Bildbearbeitung und Platz 18 auf den anderen drei. Seine Lizenz erlaubt allerdings nur Forschung und Evaluierung, eine kostenlose kommerzielle Option ist es also nicht. Unsere vollständige Übersicht über die Neuerungen finden Sie in ChatGPT Images 2.5.

ModellAm besten fürStärkeSchwächePreis
ChatGPT Images 2.5Bilder mit lesbarem Text#1 und #2 auf allen vier Boards: Arena Text-zu-Bild (1423,6 / 1400,9), Arena Bearbeitung (1522,4 / 1478,5), Text-zu-Bild bei Artificial Analysis (1197 / 1191) und Bearbeitung (1182 / 1162)Die Führung bei Arena Text-zu-Bild beruht auf etwa 11.000 Stimmen pro ModellStandard in jedem ChatGPT-Tarif
MAI-Image-2.6Ein vorhandenes Bild bearbeiten#3 bei der Bildbearbeitung von Artificial Analysis (1137) und #4 bei Arena Text-zu-Bild (1335,0)Public Preview, noch nicht in Copilot oder Bing; die Bearbeitungsführung bei Artificial Analysis ging an ChatGPT Images 2.5MAI Playground / Microsoft Foundry
Grok Imagine Image 2.0Wenigste Beschränkungen, Spicy Mode#4 bei Artificial Analysis Text-zu-Bild (1155) und #4 bei Arenas Bildbearbeitung (1441,5); Platz fünf bei Arena Text-zu-BildBei der Bildbearbeitung von Artificial Analysis nur #10$30 im Monat SuperGrok; xAI-API
Nano Banana 2 (Gemini 3.1 Flash Image)Fotorealistische Porträts und Produkte#6 bei Artificial Analysis Text-zu-Bild, vor Nano Banana Pro auf Arenas BoardBei Arenas Bildbearbeitung liegt Nano Banana Pro vornGemini-App / AI Studio
Seedream 5.0 ProMehrsprachiger Text + Regionenbearbeitung10+ Sprachen inkl. Arabisch RTL, Lasso- und EbenenbearbeitungEtwa Platz zehn auf den unabhängigen Boards; Urheberrechts-WolkeBytePlus / Magnific
Midjourney v8Stilisierte Kunst, IllustrationÄsthetische Basis, die die meisten Künstler bevorzugenSchwächer bei Text im Bild$10-$120/Mon.
Qwen-Image-2.1Bestes Bildmodell zum HerunterladenAm höchsten platziertes Open-Weight-Modell auf allen vier Boards: #17 Arena Bildbearbeitung (1366,4), #18 Arena Text-zu-Bild (1227,6) und #18 auf beiden Boards von Artificial Analysis; 7B-Generator, transparente PNGs, bis zu 10 ReferenzbilderQwen Research License, nur für Forschung oder Evaluierung, keine kommerzielle NutzungKostenloser Download (Hugging Face)
Qwen-Image-3.0-ProDichte, textlastige Layouts#12 Arena Text-zu-Bild (1255,9) und #14 Artificial Analysis Text-zu-Bild (1090); Prompts bis 4500 Tokens, Text in 12 SprachenNur gehostet, keine Gewichte; bei Arenas Bildbearbeitung unbewertetQwen Chat; $0,04-$0,075 pro Bild in der API
Muse ImageBildbearbeitung, Meta-Ökosystem#6 bei der Bildbearbeitung von Artificial Analysis (1118) und #7 bei ihrem Text-zu-Bild-BoardNicht mehr auf dem Podium; #8 bei Arena Text-zu-Bild und #7 bei Arena BearbeitungMeta-AI-App
Zweitplatzierte und Alternativen: MAI-Image-2.6 ist der Zweitplatzierte insgesamt und der Tipp, um ein bereits vorhandenes Bild zu bearbeiten, und Grok Imagine Image 2.0 ist Dritter und weiterhin das einzige Frontier-Modell, das Spicy-Mode-Inhalte für Erwachsene erlaubt. Muse Image ist der Tipp innerhalb von Metas Apps, Nano Banana 2 ist weiterhin der Foto-Real-Tipp, und Reve 2.1 bleibt der Tipp für Layout, Typografie und natives 4K, auf Platz sechs bei Arena Text-zu-Bild. Wenn Sie ein Modell auf eigener Hardware betreiben wollen, schneidet Qwen-Image-2.1 von allen offenen Modellen am besten ab, allerdings nur für Forschung und Evaluierung; für kommerzielle Arbeit sind die älteren Qwen-Image-Releases unter Apache 2.0 die sichere Wahl, auch wenn sie weit tiefer stehen, Qwen-Image-2512 auf Platz 43 bei Arena Text-zu-Bild.
Was sich diesen Monat geändert hat

ChatGPT Images 2.5 behält die Bildkrone und hält auf allen vier verfolgten Boards weiterhin die Plätze eins und zwei. Seit dem letzten Update hat Grok Imagine Image 2.0 Muse Image den dritten Platz abgenommen: Ein neuer Arena-Eintrag stieg bei Text-zu-Bild auf Platz fünf und bei der Bearbeitung auf Platz vier ein und schob Reve 2.1 auf Platz sechs, und auf dem Text-zu-Bild-Board von Artificial Analysis ist es Vierter, Muse Image dagegen Siebter. Artificial Analysis hat außerdem beide Bild-Boards auf v2.0 umgestellt und die Bearbeitung neu skaliert, sodass Sunburst dort jetzt 1182 statt 1221 erreicht. Alibabas Qwen-Image-2.1, erschienen am 20. September, ist jetzt auf allen vier Boards bewertet und auf jedem das am höchsten platzierte Open-Weight-Modell. Im September löste 2.5 am 8. September GPT Image 2 an der Spitze ab.

Kategorie-Tipp, Oktober 2026

Beste KI für Video

1
Gemini Omni 1.1 Flash
#1 Arena Text-to-Video
→
2
MiniMax H3
2K + nativer Ton
→
3
Dreamina Seedance 2.0
Engster Herausforderer

Die beste KI für Videogenerierung ist Gemini Omni 1.1 Flash, das Google am 27. August veröffentlicht hat und das Arenas Text-zu-Video-Board mit 1516 anführt, knapp vor dem eigenen Vorgänger Gemini Omni Flash mit 1513. Lesen Sie das als Gleichstand: Die beiden liegen in den Konfidenzintervallen des jeweils anderen, und Arena selbst gibt 1.1 Flash ein Rangband von eins bis vier. Den Ausschlag gibt die Spezifikation, bei der 1.1 Flash klar das leistungsfähigere Modell ist: Szenenverlängerung in 10-Sekunden-Schritten auf kumulativ 40 Sekunden, Kontrolle über erstes und letztes Bild, Videoreferenzen, 360p-Entwürfe und Ausgabe in 1080p oder 4K, zu etwa $0,03 pro Sekunde bei 360p, $0,10 bei 720p, $0,15 bei 1080p und $0,30 bei 4K. Gemini Omni Flash bleibt mit rund $0,10 pro Sekunde die günstigere Option, endet aber bei 10-Sekunden-Clips. Zwei Grenzen sind wichtig. Artificial Analysis hat 1.1 Flash überhaupt nicht bewertet; auf ihrem Text-zu-Video-Board führt das ältere Omni Flash mit 1512,8 vor Alibabas Wan 3.0 mit 1431,4 und MiniMax H3 mit 1407,7. Und auf Arenas Bild-zu-Video-Board liegt 1.1 Flash mit 1488,5 hinter MiniMax H3 mit 1495,4 auf Rang zwei, die Krone ruht also auf Text-zu-Video und auf der Spezifikation, nicht auf einem Durchmarsch. Wenn Sie längere Einstellungen innerhalb von Googles Werkzeugen brauchen, läuft Veo 3.1 weiterhin in der Gemini-App, in AI Studio und in Vertex AI mit nativem Ton und 1080p-Ausgabe. MiniMax H3 (31. Juli) bleibt der Herausforderer bei der Spezifikation, mit 2K-Clips von 4 bis 15 Sekunden und nativem Stereoton ab $0,13 pro Sekunde.

ModellAm besten fürStärkeSchwächePreis
Gemini Omni 1.1 FlashBestes KI-Video insgesamt#1 Arena Text-zu-Video (1516); Szenenverlängerung auf 40 Sekunden, 4K-AusgabeVon Artificial Analysis unbewertet; bei Arena Bild-zu-Video Zweiter hinter MiniMax H3$0,03-$0,30/Sek.; Gemini API / AI Studio / Flow
Gemini Omni FlashGünstigere Zehn-Sekunden-Clips#2 Arena Text-to-Video (1513), #2 AA-Video (1238); konversationelle BearbeitungDeckelt bei Zehn-Sekunden-Generierungen~$0.10/s; Gemini-App / AI Studio
Wan 3.0Video aus Dokumenten und Folien#1 auf Artificial Analysis' Video-Board (1239); 2-30 s, bis 1080p, Omni-Reference-EingabeNur API, keine veröffentlichten Gewichte; #6 auf Arena$0.05-$0.20/s
MiniMax H32K-Clips mit nativem Audio4-15 s in 2K, natives Stereo-Audio; #8 Arena Text-to-Video (1460)#4 auf AA-Video (1227); die offenen Gewichte enthalten den 2K-Upscaler nicht und erfordern einen Antrag in den USA, der EU, Großbritannien und Südkorea$0.13/s in 2K
Dreamina Seedance 2.5ByteDance-Herausforderer#7 Arena Text-to-Video (1474); führt Image-to-Video mit Audio anByteDance-Ökosystem, eingeschränkter westlicher ZugangDreamina / BytePlus
Muse VideoVideo im Meta-Ökosystem#9 bei Arena Text-to-Video mit 1456Neuestes der Gruppe, dünnes ToolingMeta-AI-App
Veo 3.1Längere Produktions-ClipsNativer Ton, 1080p, starke physikalische Konsistenz#12 auf Arena Video, nicht der QualitätsführerGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboSchnelle Iteration zu niedrigeren KostenNatives 4K, 60fps, 15-Sekunden-Clips; Turbo am 17. Juni erschienenAußerhalb der Top 16 auf Arena Text-zu-VideoAb $10/Mon.
Luma Ray 3Fotorealistische SzenenStarker Realismus für LandschaftenKleinere CommunityKostenlos / ab $9.99/Mon.
Zweiter Platz und Alternativen: MiniMax H3 ist der Zweite und führt jetzt Arenas Bild-zu-Video-Board mit 1495,4 an, vor Gemini Omni 1.1 Flash mit 1488,5. Dreamina Seedance 2.0 ist Dritter und bleibt die Wahl für Bild-zu-Video mit Ton. Veo 3.1 ist die Wahl, wenn 10 Sekunden nicht reichen, und Alibabas Wan 3.0 das Modell, wenn das Ausgangsmaterial ein Dokument, eine Tabelle oder eine Präsentation ist. OpenAI hat die Sora-2-Endkunden-App am 26. April 2026 eingestellt, die Entwickler-API sollte am 24. September 2026 folgen. Die Abschaltdaten älterer Modelle verfolgen wir für jeden Anbieter in einer eigenen laufenden Liste.
Was sich diesen Monat geändert hat

Gemini Omni 1.1 Flash behält die Videokrone mit 1516 bei Arena Text-to-Video, weiterhin ein statistisches Patt mit Gemini Omni Flash bei 1513, das die Fähigkeiten entscheiden. Zwei Modelle, die schon vor Monaten erschienen sind, haben jetzt genug Arena-Stimmen für eine Platzierung gesammelt, jeweils etwa 1.200 bis 1.300: FLUX 3 Video von Black Forest Labs steigt mit 1493 auf Platz drei ein und SpaceXAIs Grok Imagine Video 1.5 mit 1492 auf Platz vier, womit Wan 3.0 auf Platz sechs und Metas Muse Video von Platz drei auf Platz neun rutscht. MiniMax H3 führt weiterhin Arenas Image-to-Video-Board mit 1495,4 vor Omni 1.1 Flash mit 1488,5 an. Im September hat Artificial Analysis sein Video-Elo neu verankert, und Omni 1.1 Flash hat es weiterhin nicht bewertet.

Kategorie-Tipp, Oktober 2026

Beste KI zum Programmieren

1
Claude Opus 5.5
#1 Arena WebDev
→
2
Claude Sonnet 5.5
Preis-Leistung, #1 Terminal-Bench
→
3
GPT-6 Astra
#1 image-to-WebDev

Die beste KI zum Programmieren ist Claude Opus 5.5, das Anthropic am 22. September veröffentlicht hat, doch es führt nicht mehr jedes Board an, und das Modell, das ihm zwei davon abgenommen hat, ist sein eigenes günstigeres Geschwister. Claude Sonnet 5.5, veröffentlicht am 28. September, führt den eigenen Terminal-Bench-4.0-Lauf von Artificial Analysis mit 63,6 % gegen 59,6 % für Opus 5.5 an und LiveBench Coding mit 91,4 gegen 89,3. Opus 5.5 behält die Krone wegen der übrigen Belege. Es führt Arenas WebDev-Board mit 1815 an, vor GPT-6 Astra mit 1788 und Claude Sonnet 5.5 mit 1786. Auf LiveBench Agentic Coding erreicht es 71,7, nur hinter DeepSeek V4.1-Flash, während Sonnet 5.5 auf 56,3 kommt, und auf Anthropics eigenen Harnesses schlägt es Sonnet 5.5 bei FrontierCode v1.1 mit 54,4 % zu 52,1 % und bei CursorBench 4.0 mit 57,8 % zu 55,5 %. Der Preis entscheidet es nicht so, wie die Token-Preise nahelegen. Sonnet 5.5 kostet $2 / $10 pro 1M Tokens gegenüber $4 / $20 für Opus 5.5, verbraucht bei maximalem Aufwand aber so viele Tokens, dass eine Intelligence-Index-Aufgabe $7,60 kostet gegenüber $5,98 bei Opus 5.5. Sein Wert liegt bei geringerem Aufwand: Bei xhigh erreicht es 51,9 im Index für $2,74 pro Aufgabe und bei high 46,7 für $1,08. GPT-6 Astra behält Arenas Image-to-WebDev-Board mit 1733 und erreicht bei xhigh auf Terminal-Bench 4.0 dieselben 59,6 % wie Opus 5.5, zu $10 / $50, und Claude Fable 5.1 ist bei WebDev Fünfter und bei Image-to-WebDev Zweiter. GPT-6.1 Sol ist die günstige OpenAI-Option: Vierter bei WebDev und 56,1 % auf Terminal-Bench 4.0 für $0,72 pro Index-Aufgabe, wobei LiveBench es bei Coding mit 80,7 weit außerhalb der Top zehn sieht. Gemini 4 Argon führt Googles eigene DeepSWE-v1.1-Tabelle mit 77,9 % an, doch Artificial Analysis misst 57,1 % auf Terminal-Bench 4.0, Arena setzt es bei WebDev auf Platz neun, und außerhalb von Googles Fairwind-Programm ist es nicht verfügbar. Unter den offenen Gewichten erreicht Xiaomis MiMo-V2.6-Pro 34,8 % auf Terminal-Bench 4.0 unter schlichtem MIT bei $0,13 pro Index-Aufgabe, GLM-5.3 bleibt mit 41,9 % das stärkste offene Modell auf diesem Harness, und Kimi K3 ist das am höchsten platzierte offene Modell bei Arena WebDev, Dreizehnter mit 1658, bei nur 12,6 % auf dem Harness. Artificial Analysis hat sowohl seinen Coding Index als auch seinen Coding Agent Index eingestellt, die beiden zusammengesetzten Coding-Rankings, die diese Seite früher zitierte, gibt es also nicht mehr.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Opus 5.5Bestes Programmieren insgesamt#1 Arena WebDev (1815) und #1 Intelligence Index (57,6, v4.3.2); 71,7 LiveBench Agentic Coding, 15 Punkte über Sonnet 5.5Bei Terminal-Bench 4.0 (59,6 % zu 63,6 %) und LiveBench Coding (89,3 zu 91,4) Zweiter hinter Sonnet 5.5$4 / $20
Claude Sonnet 5.5Preis-Leistungs-Tipp fürs Programmieren#1 Terminal-Bench 4.0 (63,6 %) und #1 LiveBench Coding (91,4), #3 Arena WebDev (1786); bei xhigh 51,9 auf dem Index für $2,74 pro Aufgabe56,3 LiveBench Agentic Coding; bei maximalem Aufwand $7,60 pro Index-Aufgabe, mehr als Opus 5.5$2 / $10
GPT-6 AstraSpitze von Arena image-to-WebDev#1 Arena image-to-WebDev (1733), #2 WebDev (1788); 59,6 % Terminal-Bench 4.0 bei xhigh2,5-facher Preis von Opus 5.5; auf Terminal-Bench hinter Sonnet 5.5 und auf LiveBench Coding weit hinter beiden Claude-Modellen$10 / $50
Claude Fable 5.1Höchster Gesamtwert vor Opus 5.5#5 Arena WebDev und #2 image-to-WebDev; Intelligence Index 53,4; AA-Briefcase 167652,0 % Terminal-Bench 4.0; 2,5-facher Preis von Opus 5.5$10 / $50
Claude Opus 5Von Opus 5.5 abgelöst49,0 % Terminal-Bench 4.0 und #7 Arena WebDev und #3 image-to-WebDevKostet pro Token mehr als Opus 5.5 und liegt sieben Punkte darunter$5 / $25
Claude Fable 5Härteste langfristige agentische ArbeitIntelligence Index 49,6; 42,4 % Terminal-Bench 4.0; 1M KontextTeuerster pro Index-Aufgabe in dieser Tabelle mit $8,75; #6 auf Arena image-to-WebDev$10 / $50
Qwen3.8-Max-0902Kurzzeitiger Halter des WebDev-Boards#11 Code Arena: WebDev (1670); Intelligence Index 45,4; 2,4 Billionen Parameter, 1M KontextNur QwenCloud-API ohne Endkunden-Oberfläche; verlor die WebDev-Führung binnen Tagen$2 / $6
Kimi K3Am höchsten platziertes offenes Modell auf Arena#13 Arena WebDev (1658), die beste offene Platzierung dort; 2,8 Billionen/104 Mrd. aktivNur 12,6 % auf Terminal-Bench 4.0; 1,56 TB zum Selbsthosten$3 / $15
GPT-5.6 SolOpenAIs günstigeres FlaggschiffIntelligence Index 47,0; 39,9 % Terminal-Bench 4.0Von GPT-6 Sol abgelöst, das zum halben Preis höher liegt; Eval-Gaming von METR angemerkt$4 / $20
GPT-6 SolGünstiges GPT-6-Coding in CodexIntelligence Index 47,5 (v4.3.2) und 43,9 % Terminal-Bench 4.0, beides über GPT-5.6 Sol, zum halben Preis#8 Arena WebDev (1689); nur in Codex und ChatGPT Work, nicht im Chat$2 / $10
GPT-6.1 SolGünstigstes Spitzenmodell pro AufgabeIntelligence Index 51,8 (v4.3.2), #4 Arena WebDev (1758) und 56,1 % Terminal-Bench 4.0 bei $0,72 pro Index-Aufgabe, Cache-Input zu $0,1080,7 auf LiveBench Coding, weit außerhalb der Top zehn; nur in Codex und ChatGPT Work, nicht im Chat$2 / $10
Gemini 4 ArgonNoch nicht verfügbar77,9 % DeepSWE v1.1 nach Googles eigenen Zahlen; Intelligence Index 52,6 bei $1,99 pro Index-Aufgabe57,1 % Terminal-Bench 4.0 und #9 Arena WebDev (1680); nur Fairwind-Partner$2 / $10 zur Einführung, $4 / $20 regulär
Muse Spark 1.3Günstiges agentisches ProgrammierenIntelligence Index 48,1 bei $1,25 / $4,25 und $1,60 pro Index-Aufgabe33,3 % auf Terminal-Bench 4.0; die Coding-Siege stammen aus Metas eigener Grafik, gemessen an einer Max-Variante nur für Partner$1,25 / $4,25
Grok 4.7Günstiger Preis-Leistungs-Coder46,3 % CursorBench 4.0 und 71,0 % DeepSWE v1.1 nach SpaceXAIs eigenen Zahlen; Intelligence Index 46,324,7 % auf Terminal-Bench 4.0; Prompts ab 200K Tokens werden komplett zum doppelten Satz neu berechnet$2 / $6
Gemini 3.8 FlashAgentisches Programmieren in großem MaßstabIntelligence Index 40,9; 308,4 Ausgabetokens pro Sekunde19,7 % auf Terminal-Bench 4.0; Einführungspreis verdoppelt sich am 1. Januar 2027$0,75 / $3,75
GLM 5.3 FlashGünstigster ernsthafter Coder zum Selbsthosten32,8 % Terminal-Bench 4.0 bei $0,25 pro Index-Aufgabe; MIT, 320 Mrd./18 Mrd. aktivGLM-5.3 erreicht auf demselben Harness 41,9 %; kein EndkundenproduktOffene Gewichte (MIT)
MiMo-V2.6-ProHöchster offener Intelligence Index46,3 auf v4.3.2 und 34,8 % Terminal-Bench 4.0 bei $0,13 pro Index-Aufgabe; MIT, 1,02 Billionen/42 Mrd. aktivAuf Arena WebDev nur #24 (1618), elf Plätze hinter Kimi K3$0,435 / $0,87
Zweitplatzierte und Alternativen: Claude Sonnet 5.5 ist der Zweitplatzierte und der Preis-Leistungs-Tipp, führt Terminal-Bench 4.0 und LiveBench Coding zum halben Token-Preis von Opus 5.5 an, solange Sie es unter maximalem Aufwand halten, GPT-6 Astra ist Dritter und führt weiterhin Arenas Image-to-WebDev-Board an, GPT-6.1 Sol ist Vierter bei WebDev zu einem Fünftel von Astras Token-Preis, und Claude Opus 5 wurde von einem Modell abgelöst, das günstiger und besser ist. Unter den offenen Gewichten ist Xiaomis MiMo-V2.6-Pro bei Wert und Kosten vorn, GLM-5.3 ist das stärkste auf dem Terminal-Bench 4.0 von Artificial Analysis, Kimi K3 ist das am höchsten platzierte offene Modell auf Arenas WebDev-Board, und GLM 5.3 Flash ist der Tipp für Teams, die selbst hosten, bei $0,25 pro Index-Aufgabe unter schlichtem MIT. In IDEs ist Cursor mit Claude weiterhin die beliebteste Kombination, und Claude Code ist die naheliegende Wahl, wenn Sie im Terminal leben.
Was sich diesen Monat geändert hat

Claude Opus 5.5 behält die Programmierkrone. Seit dem letzten Update ist Claude Sonnet 5.5 mit 1786 auf Platz drei in Arenas WebDev-Board eingestiegen, zwei Punkte hinter GPT-6 Astra, was GPT-6.1 Sol auf Platz vier und Claude Fable 5.1 auf Platz fünf schiebt, und Gemini 4 Argon, das Anfang des Monats einstieg, liegt jetzt auf Platz neun. Argon führt Googles eigene DeepSWE-v1.1-Tabelle mit 77,9 % an, erreicht auf dem Terminal-Bench 4.0 von Artificial Analysis aber 57,1 %, hinter Sonnet 5.5, Opus 5.5 und GPT-6 Astra, und außerhalb von Googles Fairwind-Programm kann es niemand nutzen. Im September wechselte die Krone zweimal, von Claude Fable 5.1 zu GPT-6 Astra und dann zu Opus 5.5, und Claude Sonnet 5.5 holte sich als Preis-Leistungs-Tipp Terminal-Bench 4.0 und LiveBench Coding.

Kategorie-Tipp, Oktober 2026

Beste KI für Kreativität

1
Grok 4.7
Wenigste Leitplanken
→
2
Claude Fable 5
Prosa höchster Qualität
→
3
Kimi K3
Fiktion und Stimme

Die beste KI für ungefilterte, angesagte kreative Arbeit ist Grok 4.7, und wir wollen genau sagen, warum. Dieser Tipp betrifft die Produktlinie, nicht die Qualität der Prosa. Grok hat die wenigsten Inhaltsbeschränkungen aller Spitzenmodelle und als einziges eine native Echtzeit-Anbindung an X, womit es das eine Modell ist, das sich auf kantige, tagesaktuelle oder bewusst provokante Briefings einlässt, die die anderen ablehnen. Lesen Sie die Verfügbarkeit genau: SpaceXAI hat Grok 4.7 am 21. September für die Grok-API, Cursor, Grok Build, fremde Harnesses und Cloud-Router veröffentlicht, und die Ankündigung sagt nichts über die Endkunden-App, die SuperGrok- und X-Premium+-Abonnenten für $30 im Monat weiterhin Grok 4.6 liefert. Der beste Schreiber ist es nicht, auch wenn das Bild gemischter ist als zuvor. EQ-Bench hat Grok 4.7 inzwischen bewertet und setzt es mit 2006,7 auf Rang acht, also in die Top zehn und weit vor Grok 4.5 auf Rang 52, doch Arenas menschliche Abstimmende setzen 4.7 beim kreativen Schreiben nur auf Rang 64, hinter Grok 4.6 auf Rang 52 und das ältere Grok 4.20-beta1 auf Rang 24. Wenn Sie allein nach Ausgabequalität wählen, führt jetzt Gemini 4 Argon Arenas Board für kreatives Schreiben an, das aber noch kaum jemand nutzen kann, Claude Opus 5.5 ist Zweiter und Claude Fable 5 Dritter, während EQ-Bench GPT-6 Astra mit 2173,3 auf Platz eins setzt, Claude Fable 5.1 auf zwei und Kimi K3 auf fünf. Wählen Sie Grok für das, was es Sie machen lässt, nicht dafür, wie gut es schreibt.

ModellAm besten fürStärkeSchwächePreis
Grok 4.7Ungefiltert, meinungsstark, am PulsWenigste Inhaltsbeschränkungen, natives Echtzeit-Grounding über X#64 bei Arenas kreativem Schreiben, aber #8 auf EQ-Bench (2006,7)$2 / $6 API; SuperGrok-App für $30 im Monat, weiterhin auf 4.6
Claude Fable 5Kreative Prosa höchster Qualität#3 Arena Creative Writing, #1 LiveBench LanguageVorsichtige Leitplanken bei kantigen Briefings$10 / $50 API
Kimi K3Fiktion und eigene Stimme#5 EQ-Bench Creative Writing mit 2082,3Bei Arenas kreativem Schreiben nur #26$3 / $15
Claude Opus 5Strukturierte Langform-KreativitätHält lange Threads und lektoriert sich selbst; Intelligence Index 50,8, inzwischen hinter sechs neueren ModellenVorsichtigstes der Gruppe$20/Mon. Pro; $5 / $25 API
Gemini 3.1 ProMultimodal kreativStarke Text-, Bild- und VideoketteQuoten in der Gemini-AppKostenlos / $2.00-$4.00 API Input
Grok Imagine (Spicy Mode)NSFW / kreativ für ErwachseneFreizügigste BildgenerierungNischen-Anwendungsfall$30/Mon. SuperGrok
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der richtige Tipp, wenn Qualität wichtiger ist als Freiheit, Kimi K3 ist der Tipp für Fiktion, und Claude Opus 5 ist der Tipp für kreative Projekte, die sich über viele Runden ziehen. Für kreative Arbeit für Erwachsene ist Grok Imagine Spicy Mode weiterhin die einzige Option auf Frontier-Niveau.
Was sich diesen Monat geändert hat

Grok behält diesen Tipp mit Grok 4.7, und an der Freizügigkeit des Produkts und seinem Live-Zugriff auf X, auf denen der Tipp beruht, hat sich nichts geändert. Arenas Board für kreatives Schreiben hat sich um ihn herum bewegt: Gemini 4 Argon, angekündigt am 30. September, stieg auf Platz eins ein, Claude Opus 5.5 ist jetzt Zweiter und Claude Fable 5 Dritter, und Grok 4.7 rückte von Rang 72 auf Rang 68 vor. EQ-Bench hat sich nicht verändert und setzt 4.7 weiterhin auf Rang acht. Die geteilte Verfügbarkeit bleibt für diese Kategorie wichtig: 4.7 ist in der API, in Cursor und in Grok Build, während die Grok-App für $30 im Monat, um die es beim Freizügigkeits-Argument eigentlich geht, weiterhin 4.6 ausliefert. Im September löste Grok 4.7 am 21. September Grok 4.6 als SpaceXAIs Flaggschiff ab, und beide Boards für kreatives Schreiben bewerteten es.

Kategorie-Tipp, Oktober 2026

Beste KI für Genauigkeit & Recherche

1
Claude Fable 5.1
Höchste faktische Genauigkeit
→
2
GPT-6.1 Sol
Bestes Preis-Leistung, $0,72/Aufgabe
→
3
Claude Opus 5.5
Wenn Fehler am meisten kosten

Die beste KI für Genauigkeit und Recherche ist Claude Fable 5.1, das die höchste Faktengenauigkeit hält, die Artificial Analysis gemessen hat, 67 % auf AA-Omniscience. Genau nach dieser Spalte wird diese Kategorie entschieden. Claude Opus 5.5 schlug Fable 5.1 bei seinem Start am 22. September in fast allem anderen, darunter Humanity's Last Exam mit 61,4 % zu 59,1 % und den halluzinationsbereinigten AA-Omniscience-Index mit 46,4 zu 43,5, bei der reinen Faktengenauigkeit liegt es aber mit 66 % hinter den 67 % von Fable 5.1. Behandeln Sie diesen Abstand von einem Punkt als Gleichstand und lesen Sie beide zusammen: Opus 5.5 ist die bessere Wahl, wenn eine falsche Antwort schlimmer ist als keine, Fable 5.1, wenn Sie möglichst viele Fakten richtig haben wollen. Der Preis-Leistungs-Tipp ist jetzt GPT-6.1 Sol, das 62 % richtig beantwortet, mit einem AA-Omniscience-Index von 41,5, zu $2 / $10 pro 1M Tokens und $0,72 pro Index-Aufgabe, und auf ARC-AGI-1 von ARC Prize 98,5 % für $0,06 pro Aufgabe erreicht. Damit schlägt es Gemini 3.1 Pro, unseren Preis-Leistungs-Tipp bis zu diesem Update, bei jeder Genauigkeitsmessung, die Artificial Analysis veröffentlicht: Gemini 3.1 Pro kommt auf 55 % reine Genauigkeit und einen Index von 31,9. Gemini 3.1 Pro behält seine Stärke, wo die Antwort aktuell sein muss, weil es Antworten in der Google-Suche verankert und in der Gemini-App steckt (ab dem 9. Oktober mit Google AI Pro), während GPT-6.1 Sol in ChatGPT Work, Codex und der API läuft statt im Chatfenster von ChatGPT. Gemini 4 Argon ist das Modell, das man im Blick behalten sollte: Artificial Analysis misst eine Halluzinationsrate von 15 %, die niedrigste unter den führenden Modellen, weil es lieber ablehnt als rät, doch es beantwortet nur 50 % richtig, und nutzen können es nur Googles Fairwind-Partner. Bei der verankerten Suche führt OpenAI Arenas Search-Leaderboard an: GPT-5.6 Sol liegt mit 1257 vorn, Claude Fable 5 ist Fünfter und Gemini 3.1 Pro mit Grounding Neunter. Beim neuartigen Reasoning liegt die Krone woanders, GPT-6 Astra führt ARC-AGI-2 und ARC-AGI-3 an. Claude Opus 5 hält keine Genauigkeitskrone, weil Artificial Analysis seine Halluzinationsrate mit 61 % misst.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
Claude Fable 5.1Höchste gemessene faktische Genauigkeit67 % faktische Genauigkeit auf AA-Omniscience, der höchste je von Artificial Analysis gemessene Wert, einen Punkt über Claude Opus 5.5Keine günstige Stufe; auf Arenas Such-Board unbewertet; Opus 5.5 führt Humanity's Last Exam und den AA-Omniscience-Index an$10 / $50
Claude Opus 5.5Wenn eine falsche Antwort schlimmer ist als keine#1 AA-Omniscience-Index (46,4) und #1 Humanity's Last Exam (61,4 %); 66 % reine GenauigkeitBei reiner Genauigkeit einen Punkt hinter Fable 5.1$4 / $20
GPT-6.1 SolBestes Preis-Leistungs-Verhältnis62 % reine Genauigkeit und ein AA-Omniscience-Index von 41,5 bei $0,72 pro Index-Aufgabe; 98,5 % ARC-AGI-1 bei $0,06 pro Aufgabe54 % Halluzinationsrate; in ChatGPT Work und Codex, nicht im Chat$2 / $10
Gemini 4 ArgonWenigste Halluzinationen, sobald verfügbar15 % Halluzinationsrate auf AA-Omniscience, die niedrigste unter den führenden ModellenNur 50 % reine Genauigkeit; nur Fairwind-Partner$2 / $10 zur Einführung
Gemini 3.1 ProVerankerte Suche; Gemini-App ab 9. Okt. mit AI ProNatives Grounding in der Google-Suche; 98 % ARC-AGI-1 bei $0.52/Aufgabe55 % reine Genauigkeit auf AA-Omniscience, unter GPT-6.1 Sol; #9 auf Arena Search$2.00-$4.00 / $12.00-$18.00 (gestaffelt)
Claude Fable 5Grundierte Suche#5 auf Arenas Such-Leaderboard, hinter GPT-5.6 SolKeine einzelne günstige Stufe$10 / $50 (Fable 5)
GPT-5.6 SolNeuartiges Reasoning#4 ARC-AGI-2 mit 92,5 %, hinter GPT-6 Astra (95 %), GPT-6.1 Sol (94,2 %) und Claude Opus 5.5 (93,3 %)Scheming von METR gemeldet$4 / $20
Claude Opus 5Schwerste unbekannte Probleme30,2 % ARC-AGI-3 auf dem Standard-Harness, Zweiter hinter GPT-6 Astra (ARC Prize)Artificial Analysis misst eine Halluzinationsrate von 61 %$5 / $25
Qwen 3.7 MaxFrontier-Genauigkeit zum Preis-Leistungs-Verhältnis92,4 GPQA Diamond, 200 kostenlose Anfragen/TagNur API, kein Chat-Frontend$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Opus 4.6Ehrlichkeit unter Druck#1 auf Scale SEALs MASK-Board mit 96,28; Anthropic hält die Top 5Als Flaggschiff abgelöstLegacy-Anthropic-Modell
Zweitplatzierte und Alternativen: Claude Opus 5.5 ist der Zweitplatzierte und der Tipp, wenn eine falsche Antwort mehr kostet als keine, GPT-6.1 Sol ist der Preis-Leistungs-Tipp bei $0,72 pro Index-Aufgabe, Gemini 3.1 Pro ist der Tipp, wenn Antworten in der Google-Suche verankert sein müssen oder Sie es in der Gemini-App wollen (ab dem 9. Oktober mit Google AI Pro), Claude Opus 4.6 dominiert das Board für Ehrlichkeit unter Druck, und Qwen 3.7 Max ist der Preis-Leistungs-Tipp an der Spitze.
Was sich diesen Monat geändert hat

Die Genauigkeitskrone bleibt bei Claude Fable 5.1, mit 67 % reiner Faktengenauigkeit gegenüber 66 % bei Claude Opus 5.5, und der Preis-Leistungs-Tipp hat gewechselt. GPT-6.1 Sol schlägt Gemini 3.1 Pro jetzt bei jeder Genauigkeitsmessung, die Artificial Analysis veröffentlicht, mit 62 % gegen 55 % reiner Genauigkeit und einem AA-Omniscience-Index von 41,5 gegen 31,9, und ARC Prize gibt ihm 98,5 % auf ARC-AGI-1 für $0,06 pro Aufgabe gegenüber 98 % für $0,52 bei Gemini 3.1 Pro, also übernimmt es die Preis-Leistungs-Karte. Gemini 3.1 Pro bleibt für verankerte Suche und die Gemini-App in der Tabelle, wo es ab dem 9. Oktober Google AI Pro braucht. Gemini 4 Argon, angekündigt am 30. September, bringt mit 15 % die niedrigste Halluzinationsrate, die Artificial Analysis unter den führenden Modellen gemessen hat, beantwortet aber nur die Hälfte seiner Fragen richtig und ist noch nicht verfügbar, an der Spitze ändert es also nichts. Zwei ältere Zeilen sind ebenfalls korrigiert: Claude Opus 5 hat jetzt eine Halluzinationsrate von 61 % statt 50 %, und es führt ARC-AGI-3 nicht mehr an. Im September holte sich Opus 5.5 den halluzinationsbereinigten Index und Humanity's Last Exam, weshalb dieser Block die beiden Claude-Modelle jetzt aufteilt, statt eines klar zu krönen.

Kategorie-Tipp, Oktober 2026

Beste KI zur Problemlösung

1
GPT-6 Astra
Reasoning-Spitze
→
2
Claude Opus 5
Agentische Ketten
→
3
GPT-6.1 Sol
Preis-Leistungs-Tipp, $2 / $10

Die beste KI für schwierige Problemlösung ist GPT-6 Astra, das GPT-5.6 Sol die Reasoning-Boards wenige Tage nach dem Start abgenommen hat. Es führt LiveBench Reasoning mit 92,65 und ARC-AGI-2 mit 95 % an, dem höchsten Wert, den jemand gegen das 100-%-Menschenpanel dieses Boards erreicht hat, und liegt bei LiveBench Mathematics mit 96,81 auf Platz vier, hinter Claude Opus 5.5 mit 97,08, Claude Fable 5.1 mit 97,01 und GPT-6.1 Sol mit 96,83. Es meldet außerdem 97,6 % auf FrontierMath Tier 4 v2, eine Zahl, zu der der Hinweis von Epoch AI gehört, dass OpenAI den Benchmark finanziert hat und auf einen Teil davon exklusiven Zugriff hat. Der Haken sind Preis und Reichweite: $10 / $50 pro 1M Tokens gegenüber $2 / $10 bei GPT-6.1 Sol, und es braucht einen bezahlten ChatGPT-Tarif. GPT-6.1 Sol, veröffentlicht am 29. September, ist die Preis-Leistungs-Alternative und fast ein Mitführender: 92,63 auf LiveBench Reasoning, 0,02 hinter Astra, und 94,2 % auf ARC-AGI-2, 0,8 Punkte dahinter, für $0,25 pro Aufgabe gegenüber $1,12 bei Astra. Astra behält die Krone, weil es beide Boards und ARC-AGI-3 weiterhin anführt, wo es auf dem Standard-Harness 62,7 % gegen 52,7 % für GPT-6.1 Sol erreicht. Gemini 4 Argon führt Arenas Mathe-Kategorie an, allerdings mit nur wenigen hundert Stimmen, und weder LiveBench noch ARC Prize haben es bewertet. GPT-5.6 Sol, der frühere Preis-Leistungs-Tipp, ist jetzt Fünfter bei LiveBench Reasoning und mit 92,5 % Vierter bei ARC-AGI-2. Qwen 3.7 Max ist der günstige Tipp für Wettbewerbsaufgaben mit 97,1 im HMMT-Index vom Februar 2026 und 44,5 bei Apex, dazu 200 kostenlose Modellanfragen pro Tag. Claude Opus 5 bleibt die Alternative für lange agentische Reasoning-Ketten, auch wenn Astra ihm auch ARC-AGI-3 abgenommen hat.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
GPT-6 AstraSchwerste Mathematik, Wissenschaft und Reasoning#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Braucht einen kostenpflichtigen ChatGPT-Plan; 5-facher Preis von GPT-6.1 Sol$10 / $50
Claude Opus 5Lange agentische Reasoning-Ketten1662 auf AA-Briefcase v1.1 und 1726 auf GDPval-AA v2.1, auf beiden Vierter unter den eigenständigen Modellen; 30,2 % ARC-AGI-3Astra führt jetzt ARC-AGI-3 an; 61 % Halluzinationsrate; inzwischen ein Legacy-Modell$5 / $25
GPT-5.6 SolGünstiges STEM-Flaggschiff#4 ARC-AGI-2 (92,5 %); #5 LiveBench Reasoning (91,65), Mathematics 96,20FrontierMath weiterhin unveröffentlicht; Scheming von METR markiert$100/Mon. ChatGPT Pro; API $4 / $20
GPT-6.1 SolPreis-Leistungs-Tipp, Reasoning fast auf Astra-Niveau#2 LiveBench Reasoning (92,63), #2 ARC-AGI-2 (94,2 %), #3 LiveBench Mathematics (96,83); Intelligence Index 51,8 bei $0,72 pro Index-Aufgabe52,7 % auf ARC-AGI-3 gegen 62,7 % bei Astra; in ChatGPT Work und Codex, nicht im Chat$2 / $10
Qwen 3.7 MaxWettbewerbsmathematik mit knappem Budget97,1 HMMT 2026 Feb, 44,5 Apex, 200 kostenlose Anfragen/TagNur API$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Fable 5Mathematik in einem Coding-Workflow#3 auf Arenas Mathe-Unterkategorie (1522), hinter Gemini 4 Argon und Claude Opus 5; 96,0 LiveBench MathematicsTeuerste Option hier$10 / $50
GLM 5.3 FlashOpen-Weight-ProblemlösungIntelligence Index 41,8 unter MIT, fast acht Punkte über GLM-5.2 bei weniger als der halben Größe; 320B/18B aktiv, 1M KontextBraucht einen Multi-GPU-Server, keine Workstation; GLM 5.3 liegt nach Z.ais eigenen Zahlen höher und ist seit dem 28. August herunterladbar, aber in mehr als doppelter Größe und unter einer eigenen LizenzOpen weights (MIT)
Zweitplatzierte und Alternativen: GPT-6.1 Sol ist der Zweitplatzierte und der Preis-Leistungs-Tipp zu $2 / $10, Claude Opus 5 ist der naheliegende Tipp für langkettiges agentisches Reasoning, Qwen 3.7 Max ist der Spartipp, und GLM 5.3 Flash ist der Open-Weight-Tipp. Unser eigener Leitfaden zur besten KI für Mathe geht die Aufteilung nach Aufgabe und die kostenlosen Optionen durch.
Was sich diesen Monat geändert hat

GPT-6 Astra behält die Problemlöse-Krone, mit weniger als einem Punkt Vorsprung. ARC Prize hat jetzt GPT-6.1 Sol bewertet, und es erreicht 94,2 % auf ARC-AGI-2, Zweiter hinter Astras 95 % und vor Claude Opus 5.5 mit 93,3 %, für weniger als ein Viertel von Astras Kosten pro Aufgabe. Zusammen mit seinen 92,63 auf LiveBench Reasoning, 0,02 hinter Astra, macht das GPT-6.1 Sol fast zum Mitführenden, doch Astra führt weiterhin beide Boards und ARC-AGI-3 an, die Krone wandert also nicht. GPT-5.6 Sol fällt bei ARC-AGI-2 auf Platz vier. Gemini 4 Argon, angekündigt am 30. September, führt Arenas Mathe-Kategorie mit wenigen hundert Stimmen an, hat aber noch keinen Wert von LiveBench oder ARC Prize, und Claude Fable 5, das diese Arena-Kategorie anführte, ist jetzt Dritter. Im September übernahm Astra diese Krone nach seinem Start am 3. September von GPT-5.6 Sol, und LiveBench Mathematics ging an Claude Opus 5.5.

Kategorie-Tipp, Oktober 2026

Bester KI-Agent

1
Gemini Spark
In der Cloud
→
2
Claude Cowork
Auf dem Desktop
→
3
OpenAI dots
Immer an, läuft auf GPT-6 Astra

Der beste KI-Agent ist Gemini Spark, wenn du den Agenten in der Cloud willst, und Claude Cowork, wenn du ihn auf dem Desktop willst. Das sind gemeinsame Tipps und kein erster und zweiter Platz: Spark läuft in einer Google-Cloud-VM und arbeitet deshalb weiter, während dein Laptop zu ist, eng verzahnt mit Gmail, Docs und seit Anfang September auch Google Fotos; Cowork läuft auf deinem Mac oder Windows-Rechner und steuert deine lokalen Apps und deinen Bildschirm. Spark ist nicht mehr der einzige Agent, der in der Cloud weiterarbeitet. SpaceXAIs Grok Bot (11. August) gibt jedem Konto einen dauerhaften Cloud-Rechner, der sich in Ihre Apps einloggt, ab einem Cursor-Pro-Tarif zu $20/Monat; Metas Muse (8. September) erledigt Besorgungen aus einer eigenen Cloud-VM und ist bis 100 Millionen Tokens pro Woche kostenlos; und OpenAI dots (29. September) laufen auf GPT-6 Astra mit eigenem Cloud-Rechner und Browser, ab dem Pro-Tarif zu $100/Monat, der sie im EWR, im Vereinigten Königreich und in der Schweiz nicht enthält. Kein unabhängiges Board misst diese Produkte gegeneinander, die Wahl hängt also davon ab, wo die Arbeit stattfinden muss, nicht davon, wer höher punktet. Auch der Preis entscheidet nicht mehr: Spark erreicht jetzt die Stufe Google AI Pro zu $19.99/Monat in den USA und in über 160 weiteren Ländern, und Cowork ist ohne Aufpreis in jedem kostenpflichtigen Claude-Plan ab $20/Monat enthalten. ChatGPT Codex Mobile (14. Mai) ist die Alternative für Coding-Agent-Arbeit. Lies den vollständigen Vergleich Gemini Spark vs Claude Cowork.

AgentAm besten fürWo er läuftStärkePreis
Gemini Spark24/7-Cloud-Aufgaben, Workspace-WorkflowsGoogle-Cloud-VM (immer an)Läuft rund um die Uhr, tiefe Workspace-IntegrationAb $19.99/Mon. Google AI Pro
Claude CoworkDesktop, App-Steuerung, Design + CodeDein Mac-/Windows-DesktopSteuert lokale Apps, sieht deinen Bildschirm$20/Mon. Claude Pro
ChatGPT Codex MobileCoding-Agent auf dem HandyOpenAI-Cloud + iOS/AndroidDiffs freigeben und Arbeit vom Handy umleitenIn ChatGPT-Plänen enthalten
Grok BotBrowser-Aufgaben quer durch angemeldete AppsEin dauerhafter SpaceXAI-Cloud-Rechner, den sich alle Ihre Bots teilenMeldet sich mit Ihren eigenen Zugangsdaten in Apps an und arbeitet bei zugeklapptem Laptop weiterAb $20/Mon. Cursor Pro oder ein verknüpfter SuperGrok-Tarif
OpenAI dotsLaufende Zuständigkeiten statt EinzelaufgabenOpenAI-Cloud-Rechner mit BrowserLäuft auf GPT-6 Astra; arbeitet bei ausgeschaltetem Computer weiter; erreichbar in ChatGPT, Slack und per SpracheAb $100/Mon. ChatGPT Pro (nicht EWR/UK/CH); Business Premium
Meta MuseKostenlose persönliche ErledigungenEine Muse Secure VM in Metas CloudKostenlos bis 100 Mio. Tokens pro Woche; ein separater Sentinel-Agent gibt frei, was er nach außen sendetKostenlos; Power $20/Mon., Maximum $100/Mon.
Zweitplatzierte und Alternativen: Gemini Spark und Claude Cowork sind gemeinsame Tipps, getrennt danach, wo der Agent läuft, kein erster und zweiter Platz. OpenAI dots sind der Tipp, wenn Sie ohnehin ChatGPT Pro bezahlen und einen Agenten auf OpenAIs Flaggschiff wollen, Grok Bot ist der Tipp für Browser-Aufgaben quer durch Ihre angemeldeten Apps, ab einem Cursor-Pro-Tarif zu $20 im Monat, Metas Muse ist der, den man kostenlos ausprobiert, und ChatGPT Codex Mobile ist der Tipp für Coding-Agenten. Google AI Ultra zu $99.99 oder $199.99 im Monat kauft bei Spark inzwischen höhere Nutzungslimits statt Zugang, der auf der Pro-Stufe zu $19.99 beginnt.
Was sich diesen Monat geändert hat

Gemini Spark (Cloud) und Claude Cowork (Desktop) bleiben gemeinsame Tipps, denn diese Kategorie kürt Produkte, und seit dem letzten Update ist kein neues Agentenprodukt erschienen. Bewegt hat sich die Modellebene. Claude Sonnet 5.5 ist auf Platz drei in die Agent Arena eingestiegen, hinter Claude Fable 5.1, das sie mit 17,6 % bestätigtem Erfolg weiter anführt, und Claude Opus 5.5, und hat mit 1824 die Führung auf AA-Briefcase v1.1 von Artificial Analysis übernommen, Opus 5.5 ist mit 1808 Zweiter. GDPval-AA v2.1 führt weiterhin Opus 5.5 mit 1867 an, Sonnet 5.5 ist mit 1840 Zweiter. Gemini 4 Argon, angekündigt am 30. September, führt AutomationBench von Artificial Analysis mit 77,5 % an und hat in der Agent Arena eine bestätigte Erfolgsquote von 15,4 %, mehr als die 14,1 % von Opus 5.5, liegt dort insgesamt aber auf Platz zehn und ist außerhalb von Googles Fairwind-Programm noch nicht verfügbar. Unter den offenen Modellen in der Agent Arena liegt jetzt Kimi K3 auf Platz 14 vorn, vor DeepSeek V4.1-Flash auf Platz 17 und Tencents Hy4 Preview auf Platz 19. Im September kamen Grok Bot, Metas Muse und OpenAI dots als dauerhaft laufende Cloud-Agenten zu Gemini Spark hinzu, und Spark erreichte den Tarif Google AI Pro für $19,99 im Monat.

Fello AI auf Mac, iPhone und iPad
Alle Top-KI-Modelle, eine App

Die führenden Modelle wie ChatGPT, Claude und Gemini, zusammen auf Mac, iPhone und iPad.

Kostenlos starten, 4,7★ über 27.000+ Rezensionen.

Fello AI laden

Anwendungsfall-Leitfaden, Oktober 2026

Beste KI zum Lernen

1
GPT-5.6 Luna
Essays & Recherche
→
2
Gemini 3.6 Flash
STEM + PDFs
→
3
Claude Sonnet 5.5
Schreiben & Lektorat

Die beste KI für Studierende ist GPT-5.6 Luna in ChatGPT für allgemeine Studienarbeit und Gemini 3.6 Flash in der Gemini-App für STEM und multimodales Lernen, mit Qwen 3.7 Max als API-Alternative für schwerere Aufgabensätze (200 kostenlose Anfragen pro Tag) und Claude Sonnet 5.5 als kostenlose Alternative für das Lektorat von Essays. Die meisten Studierenden müssen nicht zahlen, und die kostenlose Stufe wurde am 6. August besser: GPT-5.6 Luna wurde zum Standardmodell für ChatGPT Free und Go, mit unbegrenzten Textchats und einem Think-Button für schwerere Fragen, während Datei-Uploads und Bildwerkzeuge weiterhin begrenzt bleiben. Am 22. September hat OpenAI für Free- und Go-Nutzer GPT-6 Luna in der ChatGPT-Desktop-App ergänzt, ein Modell der aktuellen Generation auf der Gratisstufe schon am Starttag, auch wenn es auf dem Index von Artificial Analysis dieselben 37,3 erreicht wie GPT-5.6 Luna. Gemini 3.6 Flash liefert die kostenlose Gemini-App nur bis zum 9. Oktober aus, dann fallen Gratiskonten auf Flash-Lite zurück, Claude Sonnet 5.5, erschienen am 28. September, ist auf claude.ai kostenlos, und DeepSeek V4 ist auf der Chat-Seite von DeepSeek kostenlos. Luna ist das günstigste und nicht das stärkste Mitglied der GPT-5.6-Familie, greif also zum Think-Button oder wechsle zu GPT-5.5, wenn ein Essay mehr Sorgfalt braucht. Für schrittweises Arbeiten an der härtesten Mathematik ist GPT-5.6 Sol das kostenpflichtige Flaggschiff von OpenAI, und GPT-6 Astra meldet jetzt 97,6 % auf FrontierMath Tier 4 v2 gegenüber den verifizierten 39,6 % von GPT-5.5 Pro, wobei Astra noch nicht im kostenlosen ChatGPT-Tarif verfügbar ist; Qwen 3.7 Max ist die Preis-Leistungs-Alternative mit 97,1 im HMMT-Index Februar 2026 und API-Preisen von $1,25 / $3,75 in der aktuellen 50%-Aktion ($2,50 / $7,50 Liste).

AufgabeBestes ModellWarumKostenlos?Alternative
Essays & StudienarbeitGPT-5.6 LunaKostenloser Standard in ChatGPT seit 6. August; unbegrenzte Textchats, dazu GPT-6 Luna in der Desktop-App seit 22. SeptemberJaClaude Sonnet 5.5 (Claude kostenlos)
STEM-ProblemlösungGPT-5.6 Sol / Qwen 3.7 MaxKostenpflichtiges STEM-Flaggschiff; Astra meldet 97,6 % FrontierMath Tier 4 v2 / 97,1 HMMT Feb 2026Pro kostenpflichtig / Qwen API kostenpflichtigGemini 3.6 Flash (kostenlos bis 9. Okt., dann AI Plus)
Recherche & GenauigkeitGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, native Google-Search-GrundierungBis 9. Okt. (Gemini-App), dann AI ProClaude Opus 5
Schreib-LektoratClaude Sonnet 5.5Seit 28. September kostenlos auf claude.ai und auf dem Intelligence Index nur hinter Opus 5.5; Qualitätsführer ist Claude Fable 5.1Ja (Claude kostenlos)Claude Fable 5.1
Multimodales Lernen (PDFs, Slides, Bilder)Gemini 3.6 Flash1M Kontext über AI Studio; Gemini-App ab 9. Okt. mit AI PlusKostenlos in AI Studio; App bis 9. Okt.NotebookLM (Google)
Zweitplatzierte und Alternativen: Claude Sonnet 5.5 (kostenlos) ist der Zweitplatzierte fürs Essay-Schreiben und -Lektorat. Gemini 3.6 Flash (kostenlos bis zum 9. Oktober, danach Google AI Plus) ist der Zweitplatzierte fürs multimodale Lernen und die PDF-Aufnahme. DeepSeek V4 ist der Zweitplatzierte für die Problemlösung mit striktem Null-Kosten-Budget.
Was sich diesen Monat geändert hat

Eine Änderung für Studierende steht an: Ab dem 9. Oktober fällt die kostenlose Gemini-App von Gemini 3.6 Flash auf Flash-Lite zurück, 3.6 Flash braucht dann Google AI Plus. Ansonsten ist GPT-5.6 Luna weiterhin ChatGPTs kostenloser Standard, und Claude Sonnet 5.5 ist weiterhin kostenlos auf claude.ai. Gemini 4 Argon, angekündigt am 30. September, steht Studierenden noch gar nicht zur Verfügung, und Google hat nichts dazu gesagt, es in die kostenlose Gemini-App oder den Tarif Google AI Pro zu bringen. Im September löste Claude Sonnet 5.5 Sonnet 5 als kostenlosen Tipp für Schreiben und Lektorat ab, und OpenAI ergänzte GPT-6 Luna für Free- und Go-Nutzer in der ChatGPT-Desktop-App, ein günstigeres Modell mit demselben Wert wie GPT-5.6 Luna.

Anwendungsfall-Leitfaden, Oktober 2026

Beste KI für Arbeit & Profis

1
GPT-5.6
Tägliche Wissensarbeit
→
2
Claude Opus 5.5
Programmieren & Schreiben
→
3
Gemini 3.1 Pro
Recherche & Briefings

Die beste KI für professionelle Arbeit ist GPT-5.6 (ChatGPTs Standard seit 9. Juli) für tägliche Wissensarbeit, Claude Opus 5.5 für Programmieren und Schreiben mit hohem Einsatz und Gemini Spark für 24/7-agentische Workflows. Die meisten Profis holen das meiste heraus, indem sie zwei bezahlte Abos betreiben (ChatGPT Plus zu $20/Monat plus Claude Pro zu $20/Monat, insgesamt $40/Monat), oder sie konsolidieren mit Fello AI zu $9.99/Monat für alle fünf Top-Modelle in einer Mac-/iOS-App. Für agentische Arbeit, die läuft, während du schläfst, ist Gemini Spark der rund um die Uhr laufende Cloud-Agent, der direkt in Google Workspace lebt, und seit dem 30. Juli erreicht er neben Google AI Ultra auch die Stufe Google AI Pro zu $19.99/Monat; Alternativen sind OpenAI dots, Grok Bot und Metas Muse, die wir oben im Agenten-Abschnitt behandeln.

AnwendungsfallBestes ModellSchlüsselstatPreisAlternative
Tägliche WissensarbeitGPT-5.6ChatGPTs Standard seit 9. Juli; der Assistent, den die meisten öffnen können$20/Mon. ChatGPT PlusClaude Opus 5.5
ChatGPT Work & CodexGPT-6.1 SolIn ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu seit dem 29. September, in der API zu $2 / $10$20/Mon. ChatGPT PlusGPT-6 Luna für Mengenarbeit
Programmieren (proprietär)Claude Opus 5.5#1 Arena WebDev (1815) und #1 Intelligence Index (57,6), zu $4 / $20$20 im Monat Claude ProClaude Sonnet 5.5, das Terminal-Bench 4.0 zum halben Token-Preis anführt
Programmierung (kostengünstig)Claude Sonnet 5.5#1 Terminal-Bench 4.0 (63,6 %) und #1 LiveBench Coding (91,4); bei high $1,08 pro Index-Aufgabe$2 / $10Qwen3.8-Max-0902; DeepSeek V4.1-Flash
Recherche & BriefingsGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, Google-GrundierungGoogle AI Pro / UltraClaude Opus 5.5
Harte Mathematik, Physik, FinanzmodellierungGPT-6 Astra#1 LiveBench Reasoning und ARC-AGI-2 (95 %); meldet 97,6 % FrontierMath Tier 4 v2$100/Mon. ChatGPT ProGPT-5.6 Sol; Qwen 3.7 Max
Immer-an-Agenten-WorkflowsGemini Spark24/7-Cloud-Agent in Google WorkspaceAb $19.99/Mon. Google AI ProClaude Cowork
Live-News, X-Kontext-KreativitätGrok 4.7Intelligence Index 46,3 + natives X-Grounding; die Grok-App liefert weiterhin 4.6$30 im Monat SuperGrokGemini 3.1 Pro
All-in-one-KonsolidierungFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/Mon.Jeden Anbieter separat bezahlen
Zweiter Platz und Alternativen: Für die meisten professionellen Teams ist Claude Opus 5.5 der Zweite hinter GPT-5.6 für die tägliche Arbeit und zugleich der Coding-Führer zu $4 / $20, während Claude Sonnet 5.5 der günstigere Coding-Tipp ist, der Terminal-Bench 4.0 anführt, und GPT-6 Astra der Tipp für Arenas image-to-WebDev-Board. Gemini 3.1 Pro ist der Zweite für recherchelastige Rollen, und Gemini Spark ist die Wahl, wenn Sie einen Cloud-Agenten an lange Aufgaben in Google Workspace setzen können, mit OpenAI dots als Alternative für Abonnenten von ChatGPT Pro.
Was sich diesen Monat geändert hat

Keine Zeile dieses Leitfadens wechselt den Besitzer. Gemini 4 Argon, angekündigt am 30. September, führt den Vals Index für Finanz-, Rechts- und Steuerarbeit sowie das AutomationBench von Artificial Analysis an, was es zum Modell macht, das man für professionelle Arbeit im Blick behalten sollte, doch nutzen können es nur Googles Fairwind-Partner, als Nächstes folgen zahlende API-Kunden und Abonnenten von Google AI Ultra, ohne Datum. Im September übernahm Claude Opus 5.5 die Zeile für proprietäres Programmieren zu einem niedrigeren Preis als Opus 5, Claude Sonnet 5.5 die Zeile für kosteneffizientes Programmieren und GPT-6.1 Sol am 29. September die Zeile für ChatGPT Work und Codex.

Preisvergleich

KI-Modell-Preise im Oktober 2026

Von kostenlosen Stufen für $0 bis zu Google AI Ultra für $199,99 im Monat. Der folgenreichste Preis in dieser Tabelle ist Claude Opus 5.5 mit $4 / $20, denn Anthropic hat am 22. September das am höchsten bewertete Modell, das ein unabhängiger Prüfer je gemessen hat, zu einem niedrigeren Listenpreis als sein Vorgängermodell veröffentlicht: Claude Opus 5 kostet $5 / $25, und die Cache-Lesekosten sinken um 60 % auf $0,20, wobei Anthropics eigene Angabe eine typische Arbeitslast 40 % günstiger als auf Opus 5 verortet. Das kehrt die Form um, die dieser Abschnitt das ganze Jahr hatte, in der das beste Modell zugleich das teuerste war. Claude Fable 5.1 und GPT-6 Astra stehen beide bei $10 / $50 und liegen beide jetzt darunter. Sechs Tage später hat Anthropic Claude Sonnet 5.5 für $2 / $10 nachgelegt, auf dem Index nur hinter Opus 5.5, doch prüfen Sie die Aufwandsstufe, bevor Sie die Ersparnis einrechnen: Bei maximalem Aufwand kostet eine Index-Aufgabe $7,60, mehr als die $5,98 von Opus 5.5, bei high dagegen $1,08. Metas Muse Spark 1.3 kostet $1,25 / $4,25, unverändert über drei Leistungssprünge seit Juli, mit einer Contributor-Stufe zu $0,10 / $0,20 für alle, die Meta auf ihren Prompts trainieren lassen, und Grok 4.6 wie Grok 4.7 stehen bei $2 / $6, mit dem Vorbehalt, dass ein Prompt ab 200.000 Tokens die gesamte Anfrage mit $4 / $12 neu berechnet. Grok 4.7 ist auf dieser Seite der klarste Fall eines Preises, der sich nicht bewegt hat, während die Kosten es taten: Die Tokens kosten gleich viel, und eine Intelligence-Index-Aufgabe kostet $2,73 gegen $1,86 bei Grok 4.6, weil 4.7 dafür rund doppelt so viel Ausgabe erzeugt. Das günstige Ende hat sich zweimal bewegt. DeepSeek hob beide V4-Modelle am 16. August rund um das Vierfache an, was V4-Flash den Preis-Leistungs-Tipp kostete, und nahm das am 10. September größtenteils zurück: V4-Flash wurde eingestellt und V4.1-Flash trat an seine Stelle, zu $0,15 / $0,60 außerhalb der Spitzenzeiten und $0,30 / $1,20 zur Spitze. Unter den Modellen, die man nach Tokens kauft, bleibt der Tipp GLM 5.3 Flash, jetzt zum schlichten Listenpreis $0,15 / $0,50, seit die Einführungsaktion am 9. September auslief, denn Artificial Analysis misst dafür $0,25 pro Intelligence-Index-Aufgabe bei 41,8 Punkten gegen $0,27 bei DeepSeek für 39,5. Außerhalb der Spitzenzeiten sind beide beim Input gleichauf und GLM ist beim Output günstiger; zur Spitze gewinnt GLM beides. Ein offenes Modell schlägt beide bei den Kosten pro Aufgabe und erschien am 21. September: Xiaomis MiMo-V2.6-Pro erledigt eine Index-Aufgabe für $0,13 bei 46,3 Punkten unter schlichtem MIT, allerdings müssen Sie dafür 1,02 Billionen Parameter selbst betreiben. An der Spitze ist der Preis-Leistungs-Tipp Metas Muse Spark 1.3, zu $1,60 pro Index-Aufgabe bei 48,1. Unter den geschlossenen Modellen hat GPT-6 Luna diesen Titel am 22. September übernommen, zu $0,10 / $0,50 nach Tokens und $0,07 pro Index-Aufgabe, dem günstigsten Wert pro Aufgabe auf dieser ganzen Seite; GPT-6 Sol ist genauso gefallen, von $4 / $20 auf $2 / $10, und liegt damit exakt auf dem Satz von Claude Sonnet 5.5, und OpenAI nennt beide Senkungen dauerhaft statt promotional. GPT-6.1 Sol kam am 29. September zum selben Preis von $2 / $10 mit Cache-Input zu $0,10, und mit $0,72 pro Index-Aufgabe ist es der günstigste Weg zu einem Wert unter den ersten sechs des Intelligence Index. Googles Gemini 4 Argon, angekündigt am 30. September, startet zum Einführungspreis von $2 / $10 mit 95 % Rabatt auf Cache-Input, was eine Index-Aufgabe auf $1,99 bringt, der Standardpreis liegt aber bei $4 / $20, und kaufen können es bisher nur Googles Fairwind-Partner. Eine tiefere Aufschlüsselung steht in unserem vollständigen KI-Preisvergleich.

ModellInput (pro 1M)Output (pro 1M)KontextKostenloser Zugang?
GPT-6 Astra$10.00$50.001.050.000 (max. Eingabe 922.000)Im Chat auf Pro, Business und Enterprise seit 4. September; Plus bekommt es in ChatGPT Work und Codex statt im Chat; kein Gratis-Tarif; in der API live
GPT-6 Sol$2.00$10.001.050.000 (max. Eingabe 922.000)ChatGPT Work & Codex auf Plus, Pro, Business, Enterprise und Edu seit 22. September; API; nicht im Chat
GPT-6.1 Sol$2.00$10.001.050.000 (max. Eingabe 922.000)ChatGPT Work & Codex auf Plus, Pro, Business, Enterprise und Edu seit 29. September; API; nicht im Chat; Cache-Lesen $0,10
GPT-6 Luna$0.10$0.501.050.000 (max. Eingabe 922.000)Free und Go in der ChatGPT-Desktop-App; ChatGPT Work & Codex in bezahlten Tarifen; API; nicht im Chat
GPT-5.5$5.00$30.001M (400K in Codex)ChatGPT Free; API bezahlt
GPT-5.5 Pro$30.00$180.001MChatGPT Pro ab $100/Mon. ($200 und $500 als Stufen mit höherer Nutzung)
GPT-5.6 Sol$4.00$20.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli); Aktionspreis mindestens bis 21. November 2026
GPT-5.6 Terra$2.00$12.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
GPT-5.6 Luna$0.20$1.20Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
Claude Opus 5.5$4.00$20.001MClaude Pro/Max/Team; API kostenpflichtig; Cache-Lesen $0,20
Claude Opus 5$5.00$25.001MLegacy-Modell bei Anthropic; Pro/Max/API
Claude Opus 4.8$5.00$25.001MLegacy-Modell bei Anthropic; Pro/Max/API
Claude Fable 5.1$10.00$50.001MCache-Reads $0.25; in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits. Mythos 5.1 rechnet identisch ab, nur auf Einladung
Claude Fable 5$10.00$50.001MDauerhaft in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits
Claude Sonnet 5.5$2.00$10.001MKostenlos auf claude.ai; Pro/Max/Team; API kostenpflichtig; Cache-Lesen $0,20
Claude Sonnet 5$2.00$10.001MLegacy-Modell seit 28. September; Rückfallmodell für markierte Cybersicherheitsanfragen; API bezahlt
Claude Sonnet 4.6$3.00$15.001MAPI bezahlt (abgelöst durch Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MEingeschränkte Gemini-App; API bezahlt
Gemini 4 Argon$2.00 Einführung / $4.00 regulär ($0.10 Cache, Einführung)$10.00 Einführung / $20.00 regulär1M (1M Output)Nur Partner des Fairwind-Programms; als Nächstes bezahlte API und Google AI Ultra, ohne Datum
Gemini 3.8 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MAI Studio, Antigravity, Gemini Enterprise + bezahlte API; in der Gemini-App für AI Pro/Ultra berichtet
Gemini 3.7 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MAI Studio, Android Studio, Antigravity + bezahlte API; in der Gemini-App nur über Spark (AI Pro/Ultra, ohne EWR/UK/CH/Nigeria)
Gemini 3.6 Flash$0.75 Einführung / $1.50 ab 1.1.2027$3.75 Einführung / $7.50 ab 1.1.20271MStandard der kostenlosen Gemini-App bis 9. Okt., dann AI Plus; AI Studio; kostenlose API-Stufe + bezahlte API
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; kostenlose API-Stufe + bezahlte API
Qwen3.8-Max-0902$2.00 ($0.17 expliziter Cache-Hit, $0.25 impliziter)$6.001M (128K Ausgabe)Nur QwenCloud-API; kein Consumer-Chat, keine offenen Gewichte
Qwen 3.7 Max$1.25 Promo / $2.50 Liste$3.75 Promo / $7.50 Liste1M200 kostenlose Anfragen/Tag; API bezahlt darüber hinaus
MiniMax M3$0.30 (50 % Rabatt auf $0.60)$1.20 (≤512K)1MOpen weights; Hosting-Kosten fallen an
LongCat-2.0AnbieterabhängigAnbieterabhängig1MOpen weights (MIT); Hosting-Kosten fallen an
NVIDIA Nemotron 3 UltraAnbieterabhängigAnbieterabhängig1MOpen weights (OpenMDW); Hosting-Kosten fallen an
Qwen 3.5 (Open-Weight)Selbst-Host / TogetherSelbst-Host / Together1MOpen weights; Hosting-Kosten fallen an
Nex-N2-ProSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (Apache 2.0); Hosting-Kosten fallen an
Rio 3.5 Open 397BSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (MIT); Hosting-Kosten fallen an
Grok 4.3$1.25$2.501MKostenloser Consumer-Plan; API bezahlt
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KSpaceXAI-API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Grok 4.7$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KSpaceXAI-API, Cursor, Grok Build, Harnesses und Cloud-Router; nicht in der Grok-App
Muse Spark 1.3$1.25 ($0.10 Contributor-Stufe)$4.25 ($0.20 Contributor-Stufe)1MBezahlte API; Muse Code, Meta Model API und OpenRouter; Contributor-Stufe tauscht Trainingsrechte gegen ~92 % Rabatt
Kimi K3$3.00 ($0.30 Cache-Hit)$15.001MKostenlose Basis-Stufe in der Kimi-App; open weights auf Hugging Face (Kimi K3 License)
Gemini Omni Flash (Video)$1.50$17.50 (Video-Output)10-Sekunden-ClipsGemini-App / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 Nebenzeit / $1.32 Spitzenzeit ($0.022 Cache-Hit Nebenzeit)$1.98 Nebenzeit / $3.96 Spitzenzeit1MDeepSeek Chat kostenlos; API bezahlt, Spitzen- und Nebenzeittarife seit 16. August
DeepSeek V4.1-Flash$0.15 Nebenzeit / $0.30 Stoßzeit ($0.003 Cache-Treffer Nebenzeit)$0.60 Nebenzeit / $1.20 Stoßzeit1MDeepSeek Chat gratis; API kostenpflichtig, Stoß- und Nebenzeit-Tarife; löste V4-Flash am 10. September ab
Kimi K2.7 CodeAnbieterabhängigAnbieterabhängig256KOpen weights; Hosting-Kosten fallen an
GLM-5.2AnbieterabhängigAnbieterabhängig1MOpen weights; Hosting-Kosten fallen an
GLM 5.3$1.40 ($0.26 Cache-Hit)$4.401MZ.ai API, GLM Coding Plan und ZCode; Gewichte seit dem 28. August auf Hugging Face unter der eigenen GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 Cache-Hit)$0.501MZ.ai API, GLM Coding Plan, OpenRouter; MIT-Gewichte auf Hugging Face; die Einführungsaktion endete am 9. September
Tencent Hy4 Preview$0.834 ($0.042 Cache-Hit)$2.5011M+Offene Gewichte (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextAnbieterabhängigAnbieterabhängig262K (bis 1M)Offene Gewichte (Qwen Community License 1.0); Hosting-Kosten kommen hinzu
MiMo-V2.6-Pro$0.435$0.871MOffene Gewichte (MIT); Hosting-Kosten fallen an
ERNIE 5.1China-Region-PreiseChina-Region-Preise256KBaidu Gratisversion
Gemini Spark (Agent)Nicht API-bepreistNicht API-bepreist1M (Gemini-Basis)Google AI Pro $19.99, AI Ultra $99.99 oder $199.99/Mon.
Fello AI (Aggregator)Über die App geroutetÜber die App geroutetModellabhängig$9.99/Mon., Gratisversion verfügbar

Die oben genannten Raten für GPT-5.5 und GPT-5.5 Pro sind Short-Context-Preise; OpenAI veröffentlicht die spezifischen Long-Context-Zahlen nicht mehr. Die GPT-5.6-Stufen werden mit dem 2-fachen Input und dem 1,5-fachen Output abgerechnet, sobald ein Prompt 272K Input-Tokens überschreitet, was Long-Context-Terra auf $4 / $18 und Luna auf $0.40 / $1.80 bringt. Die GPT-6-Stufen tragen ab 272K Input-Tokens denselben Aufschlag, angewendet auf die gesamte Anfrage, und ihre Cache-Lesezugriffe sind 90 % günstiger: $1.00 für Astra, $0.20 für GPT-6 Sol und $0.01 für Luna, bei GPT-6.1 Sol 95 %, also $0.10. Grok 4.6 funktioniert genauso, beißt aber härter: Ab 200.000 Prompt-Tokens rechnet SpaceXAI die gesamte Anfrage zum höheren Satz ab statt nur den Überhang, sodass ein Überschreiten um tausend Tokens die Kosten des ganzen Aufrufs verdoppelt. Die andere Preisliste, die man zweimal lesen sollte, ist die von DeepSeek: Seit dem 16. August werden beide V4-Modelle werktags von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC zum Spitzentarif abgerechnet und in jeder anderen Stunde zu genau der Hälfte, sodass dieselbe Aufgabe je nach Ausführungszeitpunkt doppelt so viel kosten kann. Wenn du Zugang zu mehreren KI-Modellen willst, ohne separate Abos zu verwalten, bietet Fello AI GPT, Claude, Gemini, Grok, Perplexity und mehr in einer einzigen App für Mac, iPhone und iPad ab $9.99/Monat.

Open-Weight-Modelle

Beste Open-Weight-Modelle im Oktober 2026

Das beste Modell mit offenen Gewichten im Oktober 2026 ist MiMo-V2.6-Pro, das Xiaomi am 21. September unter schlichtem MIT veröffentlicht hat: 1,02 Billionen Parameter mit 42 Milliarden aktiven, 1M Tokens Kontext und die Gewichte am selben Tag auf Hugging Face. Artificial Analysis misst ihn mit 46,3 auf Intelligence Index v4.3.2, der höchste offene Wert, den sie je veröffentlicht hat, über GLM-5.3 mit 44,8 und Kimi K3 mit 43,6, und das zu $0,13 pro Index-Aufgabe, günstiger als jedes andere offene Modell auf dieser Seite. Er nimmt außerdem 34,8 % auf Terminal-Bench 4.0 und 1688 auf GDPval-AA v2.1, womit er Kimi K3 auf beiden schlägt. Zwei ehrliche Grenzen: Arenas menschliche Abstimmende sehen ihn zurückhaltend, auf Rang 24 bei WebDev und Rang 26 bei Text, und er hat kaum zehn Tage unabhängige Historie. Das am höchsten platzierte offene Modell auf Arena bleibt Kimi K3, Dreizehnter auf WebDev mit 1658, und inzwischen ist es auch das beste offene Modell in der Agent Arena, auf Platz 14 vor DeepSeek V4.1-Flash auf Platz 17 und Tencents Hy4 Preview auf Platz 19, und GLM-5.3 bleibt mit 41,9 % gegen MiMos 34,8 % das stärkste offene Modell auf dem Terminal-Bench 4.0 von Artificial Analysis, allerdings unter einer eigenen Z.ai-Lizenz statt MIT. Die praktische Empfehlung für Teams, die eigene Gewichte betreiben, ist weiterhin GLM 5.3 Flash (Z.ai, MIT), erschienen am 26. August mit 41,8 auf v4.3.2, 320 Mrd. gesamt und 18 Mrd. aktiv, denn ein Modell mit 1,02 Billionen Parametern ist nichts für eine Workstation, und der K3-Download umfasst 96 Safetensors-Shards und rund 1,56 TB. Die günstige offene Stufe hat sich am 10. September erneut geändert: DeepSeek hat V4-Flash 0731 eingestellt und durch DeepSeek-V4.1-Flash ersetzt, 552 Mrd. mit 8 Mrd. aktiv beim Prefill und 16 Mrd. beim Decode, nativ multimodal, am ersten Tag unter MIT, mit 39,5 auf v4.3.2 gegen 34,3 für den abgelösten Build, und preislich zurück auf $0,15 / $0,60 außerhalb der Spitzenzeiten. Er hat zudem die höchste bestätigte Erfolgsquote aller offenen Modelle in der Agent Arena, 8,4 %, liegt dort insgesamt aber auf Rang 17. Von den drei Releases, die den August abschlossen, veröffentlichte GLM 5.3 seine Gewichte am 28. August unter einer eigenen Lizenz mit einer Klausel, nach der jeder Model-as-a-Service-Betreiber mit mehr als 10 Milliarden Dollar Umsatz zuerst eine Z.ai-Sicherheitsprüfung bestehen muss; Alibabas Qwen3.8-Flash-Next, ein Mixture-of-Experts mit 125 Mrd. Parametern und nur 6 Mrd. aktiv, der die Qwen4-Architektur vorwegnimmt, erreicht 39,8 und liegt auf Rang 16 von Arenas WebDev-Board; und Tencents Hy4 Preview, 770 Mrd. gesamt und 49 Mrd. aktiv unter Apache 2.0, hat keine Bewertung von Artificial Analysis, liegt aber mit 1633 auf Rang 17 bei Arena WebDev. Beachten Sie außerdem, dass GLM 5.3 Flash kein beschnittener GLM 5.3 ist, sondern ein eigenes Modell auf neu trainierter Basis, weshalb es unter schlichtem MIT erscheinen konnte, das Flaggschiff aber nicht.

ModellAm besten fürSchlüssel-BenchmarkKontext / LizenzWo laufen lassen
MiMo-V2.6-ProHöchster je gemessener offener Intelligence IndexII 46,3 (v4.3.2), über GLM-5.3 und Kimi K3, bei $0,13 pro Index-Aufgabe; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1688; 1,02 Billionen/42 Mrd. aktiv1M / MITHugging Face (XiaomiMiMo), Anbieter, Selbsthosting
Kimi K3Am höchsten platziertes offenes Modell auf ArenaII 43,6 (v4.3.2); #13 Arena WebDev, beste offene Platzierung; #14 Agent Arena; 2.8T/104B aktiv1M / Kimi K3 LicenseHugging Face (96 Shards, 1.56 TB), Moonshot API, Anbieter
GLM 5.3 FlashBestes offenes Modell, das die meisten Teams wirklich betreiben könnenII 41,8 (v4.3.2), auf der Pareto-Front aus Intelligenz und Kosten bei rund $0.25 pro Index-Aufgabe; 320B/18B aktiv, nativ multimodal1M / MITHugging Face, Z.ai API ($0.15/$0.50), OpenRouter
GLM-5.2Rückfalloption mit unabhängigem NachweisII 33,7 (v4.3.2); #26 Arena WebDev (1,605.0), #20 Agent Arena; 744B/40B aktiv1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Seit dem 28. August offen, aber unter eigener LizenzII 44,8 (v4.3.2), der höchste offene Wert, den wir gefunden haben; gleiche 744B-Basis wie GLM-5.2, nur nachtrainiert, veröffentlichter Checkpoint mit 753B gezählt; CyberGym 84,5 % und Terminal-Bench 3.0 28,3 (Herstellerangaben)1M / GLM 5.3 License (Model-as-a-Service über 10 Mrd. USD Umsatz braucht eine Z.ai-Sicherheitsprüfung)Hugging Face, Z.ai API ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4.1-FlashBester offener Wert, wenn du selbst hostestII 39,5 (v4.3.2) gegen 34,3 für den abgelösten Stand V4-Flash 0731; 552B, 8B aktiv beim Prefill und 16B beim Decode1M / MITDeepSeek API ($0.15/$0.60 Nebenzeit, $0.30/$1.20 Spitzenzeit seit 10. September), lokal
Tencent Hy4 PreviewBislang größtes permissiv lizenziertes Modell770B/49B aktiv; 2,99/4,00 auf Tencents eigenem 203-Aufgaben-Panel gegen 2,94 für Kimi K3 und 2,92 für GLM 5.3 (Hersteller); keine Bewertung von Artificial Analysis; #17 Arena WebDev (1633), #19 Agent Arena1M+ / Apache 2.0Hugging Face (BF16 und FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextVorschau auf die Qwen4-Architektur125B gesamt plus 51B N-Gramm-Embedding, 6B aktiv; 91,7 GPQA Diamond und 62,5 SWE-Bench Pro (Hersteller); II 39,8 (v4.3.2); #16 Arena WebDev (1637)262K bis 1M / Qwen Community License 1.0Hugging Face, Anbieter, Self-Hosting
LongCat-2.0Frontier-offener Coder, trainiert auf chinesischen ChipsII 33 (v4.1); 59,5 % SWE-Bench Pro (Anbieter), 1.6T/~48B aktiv1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Günstig multimodal auf Frontier-NiveauII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / Lizenz TBDHugging Face, API $0.30/1M (50 % Rabatt)
Nex-N2-ProStärkster offener Coding-WertII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivQwen-basiert / Apache 2.0Hugging Face, Anbieter, Selbst-Host
Kimi K2.7 CodeStärkster kommerziell lizenzierter offener Coder+21,8 % auf Kimi Code Bench v2 vs. K2.6 (Anbieter); 1T/32B aktiv256K / Modified MITHugging Face, DeepInfra, Anbieter
DeepSeek V4-ProAgentische Arbeit in der realen WeltII 44 (v4.1), 1.6T/49B aktiv1M / MITDeepSeek API ($0.66/$1.98 außerhalb der Spitze, $1.32/$3.96 zur Spitze seit 16. August), lokal
Hy3Neuester Kandidat mit permissiver LizenzII 41 (v4.1); #53 auf Arena WebDev (1,507.4)Apache 2.0Hugging Face, Anbieter, Selbst-Host
InklingThinking Machines' erstes open modelII 41 (v4.1), agentisch 32,3, veröffentlicht 15. JuliOpen weightsHugging Face, Anbieter, Selbst-Host
Inkling SmallGleiche Familie bei einem Viertel der GrößeII 40 (v4.1), agentisch 30,8; 276B/12B aktiv, Text, Bild und Audio InputApache 2.0Hugging Face (BF16 und NVFP4), Anbieter, Selbst-Host
NVIDIA Nemotron 3 UltraNVIDIA-abgestimmt, voll permissive LizenzII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktiv1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 Selbst-Host)
Qwen 3.5 (397B / 17B aktiv)Multimodal, schnelles Decoding88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / offenTogether, OpenRouter, lokal
Qwen3.6-35B-A3BEffizienter offener agentischer Coder (3B aktiv)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktiv262K (bis 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, lokal
Qwen3.6-27BLaptop-tauglicher dichter Coder87,8 GPQA Diamond, dicht 27B, multimodal256K / Apache 2.0Lokal Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BQwen-3.5-Fine-tune, mehrsprachiges Reasoning70,8 Terminal-Bench 2.1 (First-Party), schlägt Qwen 3.7 Plus in 4/5397B/17B aktiv / MITHugging Face, Anbieter, Selbst-Host
Llama 4 MaverickFlaggschiff der Meta-Reihe17B aktiv / 400B GesamtparameterLlama 4 LicenseMeta-Cloud, Hugging Face, lokal
NVIDIA Nemotron 3 Nano OmniEdge / Low-PowerMultimodal, sehr kleiner FootprintKompakt / offenLokal, NVIDIA-Tool

Lizenzierung zählt hier ebenso wie der reine Wert, und der August hat den Abstand zwischen den beiden Gruppen vergrößert. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) und Nemotron 3 Ultra (OpenMDW) erlauben alle klar die kommerzielle Nutzung ohne Umsatzprüfung. Der Rest trägt Bedingungen, die man lesen sollte, bevor man darauf aufbaut: MiniMax M3 und MiniMax H3 kommen unter ihren eigenen Community-Lizenzen, wobei H3 zusätzlich einen Antrag aus den USA, der EU, dem Vereinigten Königreich und Südkorea verlangt; Kimi K3 sitzt auf einer eigenen Lizenz mit einer Umsatzschwelle für alle, die es als Service weiterverkaufen; GLM 5.3 verlangt eine Z.ai-Sicherheitsprüfung für jeden Model-as-a-Service-Betreiber über 10 Milliarden Dollar Umsatz; und die Qwen Community License 1.0 bei Qwen3.8-Flash-Next verlangt eine separate Lizenz von Qwen, um ein Model-as-a-Service- oder ein KI-Arbeitsassistenz-Geschäft zu betreiben, wobei interne Nutzung ausgenommen ist. Kein open model ist mehr Erster auf irgendeinem Arena-Board, das wir verfolgen: Claude Opus 5 holte sich das Agent-Board im Juli, das letzte, das ein open model anführte.

Wie wir bewerten

Benchmarks, Preise und Hands-on-Nutzung

Jedes Ranking auf dieser Seite kombiniert drei Eingaben: öffentliche Benchmarks von sieben unabhängigen Häusern (Artificial Analysis, Arena früher LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize und das offizielle Terminal-Bench-4.0-Board, mit Abdeckung der Intelligence Index, GPQA Diamond, ARC-AGI-1 bis 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas und dem Remote Labor Index), veröffentlichte API- und Abo-Preise von der offiziellen Preisseite jedes Anbieters und Hands-on-Nutzung durch das FelloAI-Redaktionsteam, das echte Prompts über dieselbe Aufgabe auf jedem Modell laufen lässt. Wir holen offizielle Preis- und Benchmark-Quellen vor jedem monatlichen Update neu ein.

Benchmarks werden auf den Anwendungsfall gewichtet: SWE-bench und Terminal-Bench treiben das Programmieren, GPQA Diamond und ARC-AGI-2 treiben die Genauigkeit, GDPval-AA (Artificial Analysis' Benchmark für professionelle Deliverables) informiert die Qualität professioneller Aufgaben, während der Schreibstil primär durch Hands-on-Tests beurteilt wird, FrontierMath und HMMT treiben die Problemlösung. Wir legen offen, wenn ein Benchmark vom Anbieter gemeldet, aber nicht unabhängig verifiziert ist, und wir streichen jede Behauptung, die wir nicht gegen eine Live-Quelle reproduzieren können. Wir ranken nach gemessenen Werten: Eine Kategoriekrone wandert, sobald ein Modell den Titelhalter auf den Boards schlägt, die diese Kategorie definieren, ohne auf die stimmbasierten Boards zu warten, und ein Modell, das noch nicht breit verfügbar ist, wird auf seiner Karte gekennzeichnet statt von ihr ausgeschlossen. Wir prüfen Ränge ebenso nach wie Zahlen, denn ein Wert kann korrekt bleiben, während sich das Board darum herum bewegt. Wenn ein Modell zwischen Updates ein großes Upgrade durchläuft, ranken wir die Kategorie neu und ergänzen eine „Was sich diesen Monat geändert hat"-Zeile am unteren Ende der ausführlichen Analyse.

Fello AI auf Mac, iPhone und iPad
Unsicher, welches Modell du wählen sollst?

Fello AI vereint die besten KI-Modelle in einer leichten nativen App.

Wechsle jederzeit zwischen ihnen, keine separaten Abos.

Fello AI laden
Häufig gestellte Fragen

Häufige Fragen

Welche KI ist aktuell die beste (Oktober 2026)?
Das hängt von der Aufgabe ab, aber Anthropics zwei September-Releases stehen weiterhin an der Spitze der meisten Boards. Beim Gesamtwert der Benchmarks ist Claude Opus 5.5 (22. September) mit 57,6 auf v4.3.2 #1 im Intelligence Index von Artificial Analysis und Claude Sonnet 5.5 (28. September) mit 56,0 Zweiter, vor Claude Fable 5.1 mit 53,4, GPT-6 Astra mit 52,7 und Googles neuem Gemini 4 Argon mit 52,6. Argon, angekündigt am 30. September, führt außerdem Arenas Boards für Text und kreatives Schreiben an, nutzen können es bisher aber nur geprüfte Cyber-Verteidiger. Beim Programmieren hält Opus 5.5 die Krone bei Arena WebDev und LiveBench Agentic Coding, während Sonnet 5.5 Terminal-Bench 4.0 und LiveBench Coding zu $2 / $10 anführt und der Preis-Leistungs-Tipp ist. Für den täglichen Chat ist GPT-5.6 ChatGPTs Standard und der Assistent, den die meisten tatsächlich öffnen können. Beim Schreiben hat Claude Fable 5.1 die beste Gesamtplatzierung über die drei Text-Boards. Bei der Genauigkeit hält Claude Fable 5.1 weiterhin mit 67 % die höchste Faktengenauigkeit, die Artificial Analysis gemessen hat, mit GPT-6.1 Sol als Preis-Leistungs-Tipp. Für schwierige Mathematik und Reasoning führt GPT-6 Astra LiveBench Reasoning und ARC-AGI-2 an, mit GPT-6.1 Sol auf beiden weniger als einen Punkt dahinter. Bei Bildern führt ChatGPT Images 2.5 alle vier verfolgten Boards an, und bei Video führt Gemini Omni 1.1 Flash Arena Text-to-Video an. Bei Agenten ist Gemini Spark der Cloud-Agent rund um die Uhr und Claude Cowork der für den Desktop. Unter den offenen Gewichten erreicht Xiaomis MiMo-V2.6-Pro 46,3 unter schlichtem MIT bei $0,13 pro Index-Aufgabe. GPT-6 Luna ist mit $0,07 das günstigste Modell pro Intelligence-Index-Aufgabe auf dieser Seite, und Claude Sonnet 5.5 ist kostenlos auf claude.ai.
Ist GPT-6 draußen, und ist es jetzt das beste Modell?
GPT-6 ist da. OpenAI hat es am 3. September 2026 als GPT-6 Astra veröffentlicht, womit die ein Jahr alte Frage geklärt ist, ob Astra als GPT-6 oder als weitere GPT-5-Zwischenversion erscheint. Auf den unabhängigen Boards ist es nicht das Spitzenmodell, und am 22. September ist es weiter zurückgefallen. Artificial Analysis gibt ihm 52,7 auf Intelligence Index v4.3.2, 5,7 Punkte vor GPT-5.6 Sol, aber 0,7 Punkte hinter Claude Fable 5.1 mit 53,4, 3,3 Punkte hinter Claude Sonnet 5.5 mit 56,0 und 4,9 Punkte hinter Claude Opus 5.5 mit 57,6, bei $10 / $50 pro 1M Tokens gegen $4 / $20 für Sol wie für Opus 5.5. Programmieren war sein stärkstes Argument und ist nun geteilt: Astra nahm den Terminal-Bench 4.0 von Artificial Analysis und hielt ihn, bis Opus 5.5 mit 59,6 % gleichzog und Claude Sonnet 5.5 mit 63,6 % vorbeizog, und die Arena hat Opus 5.5 inzwischen auch bei WebDev vor Astra gesetzt, sodass ihm nur das image-to-WebDev-Board bleibt. Es halbiert außerdem die Halluzinationen auf AA-Omniscience grob, von Sols 92 % auf 51 % bei maximalem Aufwand, und es gewinnt gegen Opus 5.5 weiterhin Zapiers AutomationBench und Terminal-Bench-Science 0.1. Sie brauchen einen bezahlten Tarif: Astra ist das erste Modell, das OpenAI für Cybersicherheit als Critical eingestuft hat, geprüfte Verteidiger im Daybreak-Programm bekamen es zuerst, ChatGPT Business und Pro folgten am 4. September und Plus wenige Stunden später, und für den kostenlosen Tarif wurde nichts angekündigt. Unsere vollständige Analyse zu GPT-6 Astra behandelt die Benchmarks und die Vorbehalte. Die Familie ist am 22. September um GPT-6 Sol zu $2 / $10 und GPT-6 Luna zu $0,10 / $0,50 gewachsen, die Artificial Analysis mit 47,5 und 37,3 gegen Astras 52,7 bewertet. Beide stecken in ChatGPT Work, Codex und der API, und OpenAI sagt, dass keines von beiden bisher im Chat ist; den Rest hat unsere Analyse zu GPT-6 Sol und Luna. OpenAI hat am 29. September GPT-6.1 Sol zum selben Preis von $2 / $10 wie GPT-6 Sol nachgelegt, und Artificial Analysis bewertet es mit 51,8, 0,9 hinter Astra zu einem Fünftel des Tokenpreises. Ein GPT-6.1 Astra gibt es nicht: Laut Wall Street Journal hat OpenAI dessen Veröffentlichung im Oktober nach internen Sicherheitstests abgesagt.
Ist Gemini 4 draußen?
Teilweise. Google hat am 30. September 2026 Gemini 4 Argon angekündigt, das erste Gemini-4-Modell, doch es ging nur an geprüfte Cyber-Verteidiger in Googles Fairwind-Programm. Laut Google folgen zahlende API-Kunden und Abonnenten von Google AI Ultra und danach so bald wie möglich Entwickler, Unternehmen und Verbraucher, ein Datum hat Google aber nicht genannt und zur kostenlosen Gemini-App nichts gesagt. Auf den unabhängigen Boards ist es ein echtes Spitzenmodell: Artificial Analysis gibt ihm 52,6 auf Intelligence Index v4.3.2, gleichauf mit GPT-6 Astra, mit der niedrigsten Halluzinationsrate, die es unter den führenden Modellen gemessen hat, und Arena führt es auf Platz eins bei Text und kreativem Schreiben. Beim Programmieren ist es schwächer als die Spitze, Neunter bei Arena WebDev und 57,1 % auf Terminal-Bench 4.0. Der Einführungspreis der API liegt bei $2 / $10 pro 1M Tokens und steigt danach auf $4 / $20. Gemini 3.5 Pro, das Google im Mai angekündigt hat, ist weiterhin nicht erschienen. Alle Details in unserer Analyse zu Gemini 4 Argon.
Was ist Claude Opus 5?
Claude Opus 5 ist Anthropics Flaggschiff vom 24. Juli 2026 und war bei Artificial Analysis das Modell Nummer eins, bis am 1. September Claude Fable 5.1 kam. Am 22. September hat Claude Opus 5.5 es abgelöst, und Anthropic führt Opus 5 jetzt als Legacy-Modell. Auf Intelligence Index v4.3.2 erreicht es 50,8, hinter Opus 5.5 mit 57,6, Claude Sonnet 5.5 mit 56,0, Claude Fable 5.1 mit 53,4, GPT-6 Astra mit 52,7, Gemini 4 Argon mit 52,6 und GPT-6.1 Sol mit 51,8, und auf beiden agentischen Boards von Artificial Analysis ist es Vierter unter den eigenständigen Modellen, mit 1662 auf AA-Briefcase v1.1 und 1726 auf GDPval-AA v2.1. Der API-Preis liegt bei $5 / $25 pro 1M Tokens, gleich wie Opus 4.8 und über den $4 / $20 von Opus 5.5, mit einem Kontextfenster von 1M Tokens und Wissensstand Mai 2026. ARC Prize hat Anthropics Launch-Aussage zu ARC-AGI-3 unabhängig bestätigt, wo Opus 5 30 % gegen 8 % für das damals nächstbeste Modell erreichte, doch GPT-6 Astra hat es seitdem überholt. Die Arena führt es auf Platz sieben bei WebDev, Platz drei bei image-to-WebDev, Platz eins bei Document und Platz 13 bei Text. Eines sollten Sie bedenken: Artificial Analysis misst eine Halluzinationsrate von 61 %, weshalb es auf dieser Seite keine Genauigkeitskrone hält.
Was ist Claude Fable 5.1?
Claude Fable 5.1 ist Anthropics Release vom 1. September 2026 und war das am höchsten bewertete Modell, das Artificial Analysis gemessen hatte, bis am 22. September Claude Opus 5.5 kam. Jetzt erreicht es auf Intelligence Index v4.3.2 bei maximalem Aufwand 53,4 und ist Dritter unter den eigenständigen Modellen, hinter Opus 5.5 mit 57,6 und Claude Sonnet 5.5 mit 56,0. Es hält weiterhin die höchste reine Faktengenauigkeit auf AA-Omniscience, 67 %, womit es die Genauigkeitskrone dieser Seite behält, und die beste Gesamtplatzierung auf den drei Prosa-Boards, womit es die Schreib-Krone behält. Es kam zusammen mit Claude Mythos 5.1, demselben Modell mit gelockerten Schutzmaßnahmen für Biologie und Cybersicherheit, nur auf Einladung verfügbar und ohne veröffentlichte Zulassungskriterien. Der Preis liegt bei $10 / $50 pro 1M Tokens, unverändert gegenüber Fable 5, doch Cache-Lesezugriffe werden um 75 % günstiger, auf $0,25, bei einem Kontextfenster von 1M Tokens und Wissensstand Juni 2026. Es ist in Claude Max und Team Premium mit rund 50 % der wöchentlichen Limits enthalten und aus Pro über Nutzungscredits erreichbar. Für die meisten Aufgaben ist Claude Opus 5.5 jetzt der bessere Kauf, weil es höher abschneidet und weniger als die Hälfte pro Token kostet. Unsere vollständige Analyse zu Claude Fable 5.1 und Mythos 5.1 behandelt die System Card und die Aufteilung der Schutzmaßnahmen.
Ist Claude Fable 5 zurück?
Ja. Anthropic setzte Claude Fable 5 am 1. Juli 2026 wieder ein, nachdem die US-Regierung die Exportkontrollbeschränkung aufgehoben hatte, die sie am 12. Juni verhängt hatte. Es ist wieder auf der Claude API, Claude.ai, Claude Code und Claude Cowork verfügbar. Anthropic machte Fable 5 am 20. Juli 2026 in den bezahlten Plänen dauerhaft. Max und Team Premium enthalten es bei rund 50 % der regulären Nutzungslimits; Pro und Team Standard erreichen es über Nutzungscredits mit einem einmaligen Startguthaben von $100. Die API-Preise liegen bei $10 / $50 pro Million Tokens. Fable 5 ist ein Modell der Mythos-Klasse, gebaut für langfristige agentische Arbeit mit einem Kontext von 1M Tokens, und es liegt auf Arenas image-to-WebDev-Board auf Platz sechs (1,622.8) und bei WebDev auf Platz 18, beim Programmieren also weit hinter Claude Opus 5.5.
Was ist GPT-5.6 und kann ich es nutzen?
Ja, seit dem 9. Juli 2026. GPT-5.6 ist OpenAIs Modellfamilie der nächsten Generation, und nach einer zweiwöchigen geschlossenen Vorschau, die am 26. Juni hinter einer Sicherheitsprüfung der US-Regierung begann, erreichte es am 9. Juli die allgemeine Verfügbarkeit. Es gibt drei Stufen, vom wenigsten zum leistungsstärksten: Luna, die schnelle, günstigste Stufe ($0.20 / $1.20 pro 1M Tokens); Terra, ein ausgewogenes Alltagsmodell, von dem OpenAI sagt, es entspreche GPT-5.5 ($2 / $12); und Sol, das Flaggschiff, abgestimmt auf Biologie, Chemie und Cybersicherheit ($4 / $20). OpenAI senkte Luna um 80 % und Terra um 20 % am 30. Juli 2026 und ließ Sol unangetastet, senkte Sol dann am 21. August 2026 um über 20 % als Aktionspreis für rund drei Monate. Kein ChatGPT-Abopreis hat sich geändert. Es ist jetzt live über ChatGPT, Codex und die API als OpenAIs Standardmodell. Ein Vorbehalt: OpenAIs System Card und der externe Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, also behandle es bei faktischer Arbeit mit hohem Einsatz vorsichtig, bis sich unabhängige Ergebnisse festigen. Ein Namenshinweis seit dem 22. September: OpenAI hat Sol und Luna für die GPT-6-Generation wiederverwendet, ein bloßes „Sol“ oder „Luna“ ist also inzwischen mehrdeutig. GPT-6 Sol kostet $2 / $10 und GPT-6 Luna $0,10 / $0,50, gegen $4 / $20 und $0,20 / $1,20 für die 5.6-Stufen, die OpenAI weiter verkauft.
Ist Grok 4.7 schon draußen?
Ja. SpaceXAI hat Grok 4.7 am 21. September 2026 veröffentlicht und damit Grok 4.6 als Flaggschiff abgelöst. Anders als 4.6, das ein Nachtraining derselben Basis war, nutzt 4.7 ein neues, größeres Basismodell mit einem längeren Reinforcement-Learning-Lauf, der auf Aufgaben von vielen Stunden gewichtet ist; eine Parameterzahl veröffentlicht SpaceXAI nicht. Artificial Analysis gibt ihm 46,3 auf Intelligence Index v4.3.2 bei hohem Aufwand gegen 44,3 für Grok 4.6, und auf beiden agentischen Boards liegt er über GPT-6 Astra, 1716 zu 1542 auf GDPval-AA v2.1 und 1645 zu 1569 auf AA-Briefcase v1.1. Der Preis bleibt bei $2 / $6 pro 1M Tokens auf einem 500K-Kontextfenster, wobei Prompts ab 200.000 Tokens die gesamte Anfrage mit $4 / $12 neu berechnen, und eine schnelle Variante läuft mit doppelter Ausgabegeschwindigkeit zum doppelten Preis. Die Kosten pro Intelligence-Index-Aufgabe haben sich sehr wohl bewegt, von $1,86 auf $2,73, weil 4.7 rund doppelt so viele Ausgabetokens erzeugt. Verfügbar ist er in der Grok-API, in Cursor, in Grok Build, in fremden Coding-Harnesses und in Cloud-Routern. SpaceXAIs Ankündigung sagt nichts über die Endkunden-App Grok, die für $30 im Monat weiterhin Grok 4.6 ausliefert. Grok ist außerdem unser Kreativitäts-Tipp, aus Produktgründen und nicht wegen der Prosa; für den bestgeschriebenen Text hält Claude Fable 5.1 unsere Schreibkrone. Alle Zahlen stehen in unserer Analyse zu Grok 4.7.
Welche KI ist die beste zum Programmieren?
Claude Opus 5.5 ist das Beste zum Programmieren, und sein günstigeres Geschwister liegt knapp dahinter. Opus 5.5, veröffentlicht am 22. September, führt Arenas WebDev-Board mit 1815 an, vor GPT-6 Astra mit 1788 und Claude Sonnet 5.5 mit 1786, und erreicht 71,7 auf LiveBench Agentic Coding, nur hinter DeepSeek V4.1-Flash und 15 Punkte über Claude Sonnet 5.5, zu $4 / $20 pro 1M Tokens. Sonnet 5.5, veröffentlicht am 28. September zu $2 / $10, führt den Terminal-Bench 4.0 von Artificial Analysis mit 63,6 % gegen 59,6 % für Opus 5.5 an und LiveBench Coding mit 91,4 gegen 89,3, was es zum Preis-Leistungs-Tipp macht, solange Sie es unter maximalem Aufwand halten, wo eine Index-Aufgabe $7,60 gegenüber $5,98 bei Opus 5.5 kostet. GPT-6 Astra ist Dritter und behält Arenas Image-to-WebDev-Board mit 1733. Googles neues Gemini 4 Argon führt die eigene DeepSWE-v1.1-Tabelle mit 77,9 % an, erreicht auf Terminal-Bench 4.0 aber 57,1 % und liegt bei Arena WebDev auf Platz neun, und außerhalb von Googles Fairwind-Programm ist es noch nicht verfügbar. Unter den offenen Gewichten ist GLM-5.3 mit 41,9 % das stärkste auf Terminal-Bench 4.0 und Kimi K3 als Dreizehnter das am höchsten platzierte offene Modell bei Arena WebDev, während GLM 5.3 Flash das ist, das die meisten Teams selbst hosten können, bei $0,25 pro Index-Aufgabe unter schlichtem MIT. Artificial Analysis hat sowohl seinen Coding Index als auch seinen Coding Agent Index eingestellt.
Welche KI ist die beste zum Schreiben?
Claude Fable 5.1 ist das Beste zum Schreiben, weil es die beste Gesamtplatzierung über die drei Text-Boards hat: Zweiter auf EQ-Bench Creative Writing v3, Dritter auf LiveBench Language und Zehnter auf Arenas Board für kreatives Schreiben. Googles Gemini 4 Argon führt jetzt Arenas Board für kreatives Schreiben mit 1518,8 an, doch die anderen beiden Boards haben es nicht bewertet, und außerhalb von Googles Fairwind-Programm ist es noch nicht verfügbar. Claude Opus 5.5 ist dort mit 1516 Zweiter und der Tipp, wenn Sie Arenas menschlichen Stimmen am meisten vertrauen, auf EQ-Bench aber nur Siebter und auf LiveBench Language Achter. Claude Fable 5 führt LiveBench Language mit 90,7 an und ist auf Arenas Board für kreatives Schreiben Dritter, auf EQ-Bench aber Elfter. Fable 5.1 und Fable 5 kosten $10 / $50 pro 1M Tokens. Claude Sonnet 5.5 ist der Preis-Leistungs-Tipp und das, was die meisten Menschen tatsächlich nutzen sollten, da es kostenlos auf claude.ai ist und in der API $2 / $10 kostet, auch wenn Arenas Board für kreatives Schreiben es nur auf Rang 42 führt und EQ-Bench es noch nicht bewertet hat. Bei professionellen Deliverables führt Claude Opus 5.5 GDPval-AA v2.1 mit 1867 an, Sonnet 5.5 liegt 27 Punkte dahinter bei 1840. Kimi K3 ist mit 2082,3 Fünfter auf EQ-Bench, wenn Sie eigenwillige Fiktion wollen, GPT-5.5 ist die Alternative für faktenbasierte Geschäftstexte, und Gemini 3.8 Flash ist der Preis-Leistungs-Tipp für Inhalte in großen Mengen.
Was ist das beste Open-Weight-KI-Modell 2026?
Xiaomis MiMo-V2.6-Pro, veröffentlicht am 21. September 2026 unter schlichtem MIT. Artificial Analysis misst es mit 46,3 auf Intelligence Index v4.3.2, der höchste offene Wert, den sie je veröffentlicht hat, über GLM-5.3 mit 44,8 und Kimi K3 mit 43,6, und es erledigt eine Index-Aufgabe für $0,13, günstiger als jedes andere offene Modell auf dieser Seite. Es ist ein Mixture-of-Experts mit 1,02 Billionen Parametern, davon 42 Milliarden aktiv, 1M Tokens Kontext und den Gewichten vom ersten Tag an auf Hugging Face. Zwei Vorbehalte: Arenas menschliche Abstimmende setzen es nur auf Rang 24 bei WebDev und Rang 26 bei Text, und es hat kaum zehn Tage unabhängige Historie. Kimi K3 bleibt als Dreizehnter das am höchsten platzierte offene Modell auf Arena WebDev und ist jetzt auf Platz 14 auch das beste offene Modell der Agent Arena, und GLM-5.3 bleibt mit 41,9 % das stärkste offene Modell auf dem Terminal-Bench 4.0 von Artificial Analysis, allerdings unter einer eigenen Z.ai-Lizenz statt MIT. Für Teams, die wirklich selbst hosten wollen, bleibt GLM 5.3 Flash (Z.ai, MIT) die praktische Empfehlung, mit 41,8 im Index und 320 Mrd. gesamt bei 18 Mrd. aktiv, denn ein Modell mit 1,02 Billionen Parametern braucht einen Cluster, und der Kimi-K3-Download umfasst 96 Shards und rund 1,56 TB.
Was ist das günstigste KI-Modell auf Frontier-Niveau?
Beim API-Preis pro Million Tokens ist GPT-6 Luna mit $0.10 / $0.50 das günstigste geschlossene Modell der Spitzenklasse, nachdem OpenAI es am 22. September 2026 halbiert hat, und Artificial Analysis bewertet es auf dem v4.3.2-Index mit 37,3 gegen die 34,0 von Gemini 3.6 Flash. Unter den offenen Gewichten bleibt es GLM 5.3 Flash, unser Preis-Leistungs-Tipp seit August, jetzt zum schlichten Listenpreis $0.15 / $0.50, seit die Einführungsaktion am 9. September auslief, mit 41,8 unter einer schlichten MIT-Lizenz, die du selbst hosten kannst. DeepSeek hielt diesen Tipp, bis es am 16. August die Preise rund vervierfachte, und holte ihn sich am 10. September beinahe zurück, als V4.1-Flash das V4-Flash zu $0.15 / $0.60 außerhalb der Stoßzeiten und $0.30 / $1.20 zu Stoßzeiten ablöste: Außerhalb der Stoßzeiten liegen beide beim Input nun gleichauf, GLM ist beim Output günstiger. Artificial Analysis trennt sie weiterhin bei den Kosten pro Index-Aufgabe, $0.25 für GLM gegen $0.27 für DeepSeek. Googles günstige Stufe verbesserte sich am 2. September erneut, als Gemini 3.8 Flash bei gleichem Einführungspreis von $0.75 / $3.75 auf 40,9 kam, wobei sich dieser Tarif am 1. Januar 2027 verdoppelt. MiniMax M3 steht bei $0.30 pro Million Input-Tokens auf einem dauerhaften 50-Prozent-Rabatt, mit LongCat-2.0 als starker MIT-Alternative. Gemessen pro Intelligence-Index-Aufgabe statt pro Token ist das günstigste Modell auf dieser Seite GPT-6 Luna mit $0.07, vor GPT-5.6 Luna mit $0.18 und dem offenen MiMo-V2.6-Pro mit $0.13.
Welche KI-Modelle sind kostenlos?
ChatGPT Free verwendet jetzt standardmäßig GPT-5.6 (mit weiterhin verfügbarem GPT-5.5) unter Nutzungslimits. Free- und Go-Nutzer erreichen seit dem 22. September außerdem GPT-6 Luna in der ChatGPT-Desktop-App. Gemini Free läuft in der Gemini-App ab dem 9. Oktober mit Gemini Flash-Lite (davor 3.6 Flash), und Gemini 3.6 Flash bleibt in Google AI Studio kostenlos. Claude Free lässt Claude Sonnet 5.5, erschienen am 28. September, mit Nutzungsgrenzen laufen. DeepSeek Chat lässt DeepSeek V4 kostenlos auf der DeepSeek-Website laufen. Grok hat einen begrenzten kostenlosen Consumer-Plan (X Premium ist ein bezahltes Add-on). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash, MiMo-V2.6-Pro und Tencents Hy4 Preview sind Open-Weight und kostenlos selbst zu hosten, wobei sich die Lizenzen unterscheiden und nur ein Teil davon reines MIT oder Apache ist. Qwen 3.7 Max ist nur API ohne Consumer-Chat-Frontend, aber Alibaba enthält jetzt 200 kostenlose Modellanfragen pro Tag. Kimi hat eine kostenlose Basis-Stufe in seiner App, mit abgerechneter intensiverer agentischer Nutzung.
Was ist Gemini Spark und welchen Plan brauchen Sie?
Gemini Spark ist Googles erster rund um die Uhr in der Cloud residierender KI-Agent, gestartet auf der Google I/O am 19. Mai 2026 und nicht mehr exklusiv für Ultra: Seit dem 30. Juli 2026 erreicht er auch die Stufe Google AI Pro zu $19.99/Monat, in den USA und in über 160 weiteren Ländern, während Google AI Ultra zu $99.99 oder $199.99/Monat den breiteren globalen Rollout trägt. Google AI Plus, die kostenlose Stufe sowie Arbeits- und Schulkonten enthalten ihn nicht. Spark ist auf Gemini-Basismodellen mit Googles Antigravity-Harness auf einer Google-Cloud-VM gebaut, integriert sich mit Gmail, Google Docs und anderen Google-Workspace-Apps und kann auf der Geräteseite mit Chrome und Androids Halo-System interagieren. Es ist die Ausgabe wert für Nutzer, die wiederholbare, langlaufende Workflows haben (Posteingangs-Triage, Recherche-Zusammenfassungen, geplante Aufgaben). Für einmalige Aufgaben deckt Claude Cowork zu $20/Monat die meisten Desktop-Agenten-Bedürfnisse ab.
Was ist Fello AI?
Fello AI ist ein KI-Chatbot für Mac, iPhone und iPad, mit dem du alle Top-KI-Modelle wie ChatGPT, Claude, Gemini, Grok und DeepSeek in einer App nutzen kannst, mit regelmäßig aktualisierten Modellen, sodass du immer die neuesten hast. Es kostet $9.99/Monat mit einer 4,7-Sterne-Bewertung über 27.000+ Rezensionen.
Wie oft aktualisiert ihr diese Seite?
Wir aktualisieren diese Seite mindestens monatlich und innerhalb von 24-48 Stunden nach jedem größeren Modellstart.
Verwandte Artikel
Claude vs. ChatGPT: Welche KI ist 2026 wirklich besser?

Claude erreichte Anfang 2026 #1 im App Store und drängte ChatGPT zum ersten Mal vom Spitzenplatz. Der Auslöser war Anthropics öffentliche Weigerung, der Forderung des Pentagons nachzukommen, seine Modelle für autonome Waffen einzusetzen.

Mehr lesen →
Grok vs. ChatGPT: Welcher KI-Chatbot ist 2026 wirklich besser?

Keiner der beiden Chatbots liefert schon das neueste Modell seines Labors: ChatGPT-Chats laufen weiter mit GPT-5.6 Sol und die Grok-App mit Grok 4.6, während GPT-6.1 Sol und Grok 4.7 (21. September, $2 / $6) in ChatGPT Work, Codex und den Entwicklertools von SpaceXAI bleiben.

Mehr lesen →
ChatGPT vs. Gemini 2026: Welche KI solltest du wirklich nutzen?

ChatGPT antwortet im Chat weiter mit GPT-5.6 Sol und die Gemini-App liefert weiter Gemini 3.1 Pro, während GPT-6 und Gemini 4 Argon hinter Work, Codex und dem Fairwind-Programm bleiben. Direkter Vergleich über Schreiben, Programmieren, Bilder und Preis.

Mehr lesen →
Wann welche KI: das richtige Modell wählen

Es gibt keine beste KI für alles. Ordne die Aufgabe dem Modell zu, das darin führt, mit einer Tabelle für Coding, Schreiben, Recherche und Alltagschat.

Mehr lesen →
Beste KI-Agenten 2026: 30 Tools getestet

Dreißig KI-Agenten verglichen nach dem, was du wirklich tun willst: Coding, Recherche, Büroarbeit und Automatisierung, mit Preisen und Gratis-Optionen.

Mehr lesen →
Gemini Nano Banana Pro vs. GPT-Image-1.5: Ultimativer Vergleich

Unser ursprünglicher Hands-on-Vergleich vom Dezember 2025 der damals beiden führenden Bildgenerierungsmodelle, mit echten Output-Beispielen Seite an Seite. Beide haben inzwischen Nachfolger.

Mehr lesen →

Probiere jedes Modell.
Eine schöne App.

Jedes Modell aus diesem Leitfaden in einer nativen App: ChatGPT, Claude, Gemini, Grok und DeepSeek. Kostenlos starten.

Fello AI auf Mac, iPad und iPhone

4,7 Bewertung·27.000+ Rezensionen·Kostenlos starten