Aktualisiert im August 2026

Beste KI-Modelle 2026

Rankings, Vergleiche und ausführliche Analysen, monatlich aktualisiert, sobald neue Modelle erscheinen.

Der August 2026 beginnt mit Claude Opus 5 an der Spitze, und zwei Kronen wechseln den Besitzer. Opus 5 führt den Intelligence Index von Artificial Analysis mit 61 und den Agentic Index mit 55,3 an, bei $5 / $25 pro 1M Tokens, halb so teuer wie Claude Fable 5, und hat jetzt auch die Programmierkrone übernommen, nachdem es auf beiden abstimmungsbasierten Coding-Boards von Arena den ersten Platz belegt hat. Der zweite Wechsel spielt sich am günstigen Ende ab: DeepSeek V4-Flash 0731 erschien am 31. Juli als neuer Preis-Leistungs-Tipp bei $0.14 / $0.28. Unten stehen die Kategoriesieger für August 2026. Klicke auf eine beliebige Karte, um direkt zur vollständigen Aufschlüsselung zu springen, oder nutze die feste Navigation, um zwischen den Kategorien zu wechseln. Rankings, Benchmarks und Preise werden innerhalb von 48 Stunden nach jedem größeren Modellstart aktualisiert.

Kategoriesieger August 2026
Schreiben
Claude Fable 5
#1 Arena Text (1508.6) und Humanity's Last Exam
Das einzige Modell in den Top drei aller drei unabhängigen Schreib-Boards, bei $10 / $50.
Ausführliche Analyse →
Chat & täglicher Assistent
GPT-5.6
ChatGPT-Standard seit 9. Juli
Der beste Assistent, den die meisten Menschen tatsächlich öffnen können, mit einer Balance aus Leistung, Tempo und Reichweite.
Ausführliche Analyse →
Bilder
ChatGPT Images 2.0
#1 bei Text-zu-Bild und Bildbearbeitung
Führt beide unabhängigen Bild-Boards an und ist weiterhin das Beste bei lesbarem mehrsprachigem Text.
Ausführliche Analyse →
Video
Gemini Omni Flash
#1 auf beiden Video-Boards (1527 Arena)
Führt beide unabhängigen Video-Boards an, mit dialogbasierter Bearbeitung bei etwa $0.10 pro Sekunde.
Ausführliche Analyse →
Programmieren
Claude Opus 5
#1 Arena WebDev (1,702.9) bei $5 / $25
Übernimmt die Programmierkrone auf den abstimmungsbasierten Boards, zum halben Preis von Claude Fable 5.
Ausführliche Analyse →
Kreativität
Grok 4.5
Wenigste Inhaltsbeschränkungen + natives Echtzeit-X
Der Tipp für kantige, angesagte Arbeit: die wenigsten Leitplanken und native X-Integration.
Ausführliche Analyse →
Genauigkeit & Recherche
Gemini 3.1 Pro
98 % ARC-AGI-1 bei $0.52 pro Aufgabe
Zieht mit dem menschlichen Panel bei ARC-AGI-1 gleich, mit nativer Google-Search-Grundierung für aktuelle Antworten.
Ausführliche Analyse →
Problemlösung
GPT-5.6 Sol
#1 LiveBench Mathematics, Reasoning und ARC-AGI-2
Die am besten belegte Krone auf dieser Seite, für die schwersten Aufgaben in Mathematik, Naturwissenschaft und Reasoning.
Ausführliche Analyse →
KI-Agenten
Gemini Spark
Erster rund um die Uhr in der Cloud laufender KI-Agent
Läuft durchgehend in einer Google-Cloud-VM, tief integriert mit Gmail, Docs und Chrome.
Ausführliche Analyse →
Was im August 2026 neu ist
5. Aug. Meta Muse Spark 1.2 und Muse Code, Intelligence Index von 51 auf 54 bei unverändert $1.25 / $4.25, plus ein Terminal-Coding-Agent Neu
Meta veröffentlichte Muse Spark 1.2 am 5. August 2026 zusammen mit Muse Code, seinem ersten Terminal-Coding-Agenten, der unter macOS und Linux ohne Desktop-App und ohne Abo läuft. Artificial Analysis bewertet das Modell mit Intelligence Index 54 bei höchster Reasoning-Einstellung, gegenüber 51 für 1.1 und 43 für die April-Version, und fast der gesamte Zuwachs ist agentisch statt Allgemeinwissen; sein GDPval-AA v2 Elo sprang von 1371 auf 1631, während Terminal-Bench v2.1 nur von 78 % auf 80 % anstieg. Die Preise bleiben unverändert bei $1.25 / $4.25 pro 1M Tokens auf einem Kontextfenster von 1M Tokens, und Meta ergänzte eine Contributor-Stufe zu $0.10 / $0.20, rund 92 % günstiger, im Gegenzug dafür, dass Meta auf deinen Prompts und Completions trainieren darf. Die Verfügbarkeit weitete sich von der US-only-Vorschau, unter der 1.1 startete, auf erweiterten globalen Zugang über Muse Code, die Meta Model API und OpenRouter aus. Auf Metas eigenen Launch-Charts landet das Modell bei allen drei veröffentlichten Coding-Benchmarks hinter Claude Opus 5 auf Platz zwei, mit 82,9 % gegen 86,7 % auf Terminal-Bench 2.1.
3. Aug. Alibaba Qwen 3.8 (Qwen3.8-Max), 2,4 Billionen Parameter starkes multimodales Flaggschiff jetzt allgemein verfügbar bei $2 / $6 Neu
Alibaba machte Qwen3.8-Max am 3. August 2026 allgemein verfügbar, zwei Wochen nach der Vorschau auf der WAIC Shanghai, und jede Zahl, die bei der Vorschau noch fehlte, hat jetzt einen Wert. Es läuft mit 2,4 Billionen Gesamtparametern und rund 95 Milliarden aktiven pro Token auf einem spärlichen Mixture-of-Experts-Design, verarbeitet Text, Bilder und Video und bestätigt ein Kontextfenster von 1M Tokens mit bis zu 128K Output-Tokens. Die API-Preise liegen bei $2 / $6 pro 1M Tokens, flach über den gesamten Kontext statt gestaffelt nach Prompt-Länge, mit Cache-Reads zu $0.25. Die Aussage „nur hinter Fable 5" spaltet sich jetzt sauber in zwei Teile: Auf Arenas Vision-Board ist es mit 1305 die #2, nur hinter Fable 5, doch auf dem Text-Board ist es mit 1496 die #5, hinter vier Anthropic-Einträgen. Beide Arena-Werte sind noch als vorläufig markiert, und die versprochenen offenen Gewichte sind nicht erschienen. Wir halten Qwen 3.8 aus den gerankten Tipps heraus, bis die Gewichte und die Lizenz tatsächlich vorliegen.
31. Juli DeepSeek DeepSeek V4-Flash 0731, gleicher Preis, gleiche Größe, Intelligence Index von 40 auf 50 Neu
DeepSeek trainierte V4-Flash nach und veröffentlichte das Ergebnis am 31. Juli 2026 als DeepSeek-V4-Flash-0731. An der Form des Modells änderte sich nichts: Es ist das gleiche Mixture-of-Experts mit 284B gesamt / 13B aktiv, der gleiche Kontext von 1M Tokens, die gleiche MIT-Lizenz und die gleichen $0.14 / $0.28 pro 1M Tokens auf DeepSeeks eigener Preisliste. Was sich bewegt hat, ist die Leistung. Artificial Analysis bewertet es jetzt mit Intelligence Index 50, gegenüber 40, mit Agentic 45,7 und 78,7 % auf Terminal-Bench v2.1, was es von rund Platz dreizehn auf Platz drei im offenen Feld hinter Kimi K3 und GLM-5.2 hebt. Bei $0.03 pro Index-Aufgabe ist es der günstigste Wert auf dem gesamten Board von Artificial Analysis, und das hat unseren Preis-Leistungs-Tipp diesen Monat verschoben. Eine ehrliche Einschränkung: Der Wert ist einen Tag alt, kommt von einem einzigen Haus, und das Modell hat noch keine Stimmen auf irgendeinem Arena-Board.
31. Juli MiniMax MiniMax H3, 2K-Video mit nativem Stereoton ab $0.13 pro Sekunde Neu
MiniMax brachte H3 (Hailuo 3.0) am 31. Juli 2026 als universelles multimodales Videomodell heraus, das Text, Bild, Video und Audio als Eingabe verarbeitet. Es gibt 2K-Clips von 4 bis 15 Sekunden mit nativem Stereoton aus, unterstützt Motion Transfer, referenzgesteuerte Generierung und generative Videobearbeitung und wird pro Sekunde mit $0.13 für 2K und $0.09 für 768p abgerechnet. Artificial Analysis platziert es auf seinem Video-Board mit 1241,5 auf #2, 3,3 Elo hinter Gemini Omni Flash. Wir haben die Videokrone dort belassen, wo sie ist: Dieser Abstand ist einen Tag alt und kommt von dem einen Board, das zwischen den Auswertungen nicht reproduziert hat, und Arenas Text-zu-Video-Stichtag liegt komplett vor H3, also hat es bei den Stimmen nichts geschlagen. MiniMax hat die Gewichte für Anfang August versprochen, und sie waren noch nicht veröffentlicht, als dieses Update live ging.
Ende Juli Thinking Machines Inkling Small, ein Viertel der Größe von Inkling bei nahezu gleichem Wert Neu
Thinking Machines ließ auf sein erstes open model Inkling Small folgen, ein Mixture-of-Experts mit 276B gesamt / 12B aktiv unter Apache 2.0, das jeden Token an 6 von 256 Experten plus 2 gemeinsame routet. Es nimmt Text, Bild und Audio als Eingabe und gibt Text zurück, und Artificial Analysis bewertet es mit Intelligence Index 40 gegen 41 für das vollformatige Inkling, bei etwa einem Viertel der Parameter. Die Quellen sind sich über das genaue Veröffentlichungsdatum uneinig, deshalb drucken wir keines. Die Gewichte, ein NVFP4-Build und die Deployment-Rezepte liegen alle auf Hugging Face.
30. Juli OpenAI GPT-5.6 Preissenkung, Luna 80 % günstiger, Terra 20 % günstiger, Sol unverändert
OpenAI senkte am 30. Juli 2026 den API-Preis seiner beiden günstigeren GPT-5.6-Stufen, drei Wochen nachdem die Familie allgemeine Verfügbarkeit erreicht hatte. Luna fiel um 80 % auf $0.20 / $1.20 pro 1M Tokens und Terra fiel um 20 % auf $2 / $12, wobei Cached-Input-Reads auf $0.02 bei Luna und $0.20 bei Terra sanken. Das Flaggschiff Sol bleibt bei $5 / $30, Prompts über 272K Input-Tokens werden weiterhin mit dem 2-fachen Input und dem 1,5-fachen Output abgerechnet, und kein ChatGPT-Abopreis änderte sich, sodass Free, Go zu $8, Plus zu $20, Pro zu $100 und $200 sowie Business zu $25-30 pro Platz alle unverändert bleiben. Die Senkung lässt Luna bei Intelligence Index 51 auf Artificial Analysis für etwa $0.07 pro Index-Aufgabe, einen Punkt über Gemini 3.6 Flash beim Wert und weit unter dessen $0.56 pro Aufgabe.
24. Juli Anthropic Claude Opus 5, neue #1 auf Artificial Analysis, führt sowohl den Intelligence Index (61) als auch den Agentic Index (55.3) an Neu
Anthropic veröffentlichte Claude Opus 5 am 24. Juli 2026, sein viertes Modell in unter zwei Monaten nach Mythos 5, Fable 5 und Sonnet 5. Auf dem neu justierten v4.1-Leaderboard von Artificial Analysis ist es jetzt insgesamt das bestplatzierte Modell und führt sowohl den Intelligence Index mit 61 als auch den Agentic Index mit 55,3 an, vor Fable 5 (60 / 52,8) und GPT-5.6 Sol (59 / 54,0). Die API-Preise liegen bei $5 / $25 pro 1M Tokens, identisch mit Opus 4.8 und halb so teuer wie Fable 5, unter der API-id claude-opus-5. Es ergänzt einen Fast-Modus, der rund 2,5-mal schneller zum doppelten Grundpreis läuft, plus eine Effort-Einstellung von low bis high und eine neue max-Stufe. Es holt sich außerdem das GDPval-AA v2 Board für professionelle Deliverables von Artificial Analysis mit 1858, vor den 1746 von Fable 5. Arena hat es seither über seine Boards bewertet und setzt es auf #1 bei WebDev, image-to-WebDev, Document und dem Agent-Board sowie auf #6 beim Text, was ihm diesen Monat die Programmierkrone einbrachte. Es ist Standard in Claude Max und am stärksten in Claude Pro.
24. Juli Sakana AI Fugu-Ultra v1.1, Auffrischung der Orchestrierungs-Engine mit vom Anbieter gemeldeten Zuwächsen von bis zu 7,9 Punkten gegenüber v1.0 zum gleichen Preis Neu
Sakana AI lieferte Fugu-Ultra v1.1 am 24. Juli 2026 aus, eine Auffrischung der Frontier-Modelle in seiner TRINITY-Orchestrierungs-Engine statt eines neuen Basismodells. Sakanas eigene Ankündigung behauptet Zuwächse von bis zu 7,9 Punkten gegenüber v1.0 bei unverändertem Preis, veröffentlicht die v1.0-Werte aber nicht daneben, also behandle das als Zahl des Anbieters. Alle Benchmark-Zahlen stammen aus Sakanas eigenem Scaffolding statt aus unabhängigen Tests: Auf seinen eigenen Charts führt es vor Opus 4.8, GPT-5.5 und Gemini 3.1 Pro, mit 73,7 % auf SWE-Bench Pro, 82,1 % auf Terminal-Bench 2.1, 93,2 % auf LiveCodeBench und 95,5 auf GPQA-Diamond. Es räumt das Feld allerdings nicht ab: Seine 50,0 auf Humanity's Last Exam sind ein Gleichstand im Rundungsbereich mit den 49,8 von Opus 4.8. Die Preise sind unverändert gegenüber v1.0 bei $5 / $30 pro 1M Input-/Output-Tokens (plus $0.50 cached), steigen auf $10 / $45 oberhalb der 272K-Token-Kontextmarke; die API ist OpenAI-kompatibel mit einem Kontextfenster von 1M Tokens.
21. Juli Google Gemini 3.6 Flash, günstigerer Output, schneller, gleicher Intelligence Index
Gemini 3.6 Flash ist Googles neuestes Flash-Modell und dasjenige, das die kostenlose Gemini-App jetzt erreicht. Der Output fällt auf $7.50 pro 1M Tokens von $9.00, während der Input bei $1.50 bleibt, die Senkung ist also nur beim Output. Google sagt, es „reduziert die Output-Token-Nutzung um 17 % gegenüber 3.5 Flash", und um bis zu 65 % bei langfristiger agentischer Arbeit wie DeepSWE, sodass die tatsächliche Ersparnis pro Aufgabe größer ist als das Preisschild. Artificial Analysis bewertet 3.6 Flash und 3.5 Flash mit dem gleichen Intelligence Index 50 auf v4.1, also behandle es als günstiger und schneller statt klüger. Es erschien zusammen mit Gemini 3.5 Flash-Lite zu $0.30 / $2.50 und ist live über die Gemini API in Google AI Studio und Android Studio, der Gemini Enterprise Agent Platform und der Gemini-App für alle. Google kündigte außerdem Gemini 3.5 Flash Cyber an, doch das ist nicht erschienen: Es geht über CodeMender als Pilot mit eingeschränktem Zugang an Regierungen und vertrauenswürdige Partner.
16. Juli Moonshot AI Kimi K3, 2,8B Parameter, das größte je veröffentlichte Open-Weight-Modell (Gewichte am 27. Juli erschienen) Neu
Moonshot AI brachte Kimi K3 am Vorabend des 16. Juli 2026 heraus, sein neues Flaggschiff und der Nachfolger der K2-Reihe, und veröffentlichte dann am 27. Juli 2026 die vollständigen offenen Gewichte. Die Modellkarte auf Hugging Face bestätigt ein Mixture-of-Experts-Design mit 2,8 Billionen Parametern, 104 Milliarden davon aktiv pro Token, ein Kontextfenster von 1.048.576 Tokens und Text-, Bild- und Video-Eingabe (kein Audio). Thinking ist immer an, und reasoning_effort nimmt jetzt low, high oder max, mit max als Standard. Artificial Analysis setzt K3 auf Intelligence Index 57, den höchsten aller Open-Weight-Modelle, und auf Arena ist es #3 auf dem Agent-Board und #2 auf WebDev hinter Claude Opus 5. Die offiziellen API-Preise liegen bei $3 / $15 pro 1M Tokens mit Cached-Input zu $0.30, plus $0.005 pro erfolgreichem Websuche-Aufruf. Der Download besteht aus 96 safetensors-Shards und rund 1,56 TB unter einer eigenen Kimi K3 License statt MIT, also ist Selbst-Hosting eine Multi-Node-Angelegenheit; eine kostenlose Basis-Chat-Stufe existiert in der Kimi-App, wobei intensivere agentische Nutzung auf bezahlten Plänen abgerechnet wird.
9. Juli OpenAI GPT-5.6 Sol, Terra und Luna, Next-Gen-Familie live in ChatGPT, Codex und der API
OpenAI öffnete seine GPT-5.6-Familie am 9. Juli 2026 für die allgemeine Verfügbarkeit und beendete damit die zweiwöchige geschlossene Vorschau, die am 26. Juni hinter einer Sicherheitsprüfung der US-Regierung begonnen hatte. Die Reihe reicht vom wenigsten zum leistungsstärksten: Luna, eine schnelle, kostengünstige Stufe; Terra, ein ausgewogenes Alltagsmodell, von dem OpenAI sagt, es entspreche GPT-5.5 zu etwa dem halben Preis; und Sol, das Flaggschiff, abgestimmt auf Biologie, Chemie und Cybersicherheit. GPT-5.6 wird jetzt als OpenAIs Standard über ChatGPT, Codex und die API ausgerollt, mit Launch-API-Preisen von Sol $5 / $30, Terra $2.50 / $15 und Luna $1 / $6 pro 1M Tokens; Terra und Luna wurden am 30. Juli 2026 auf $2 / $12 und $0.20 / $1.20 gesenkt. Bei den wenigen von OpenAI veröffentlichten Benchmarks erzielt Sol 88,8 % auf Terminal-Bench 2.1 (91,9 % in seinem rechenintensiveren „ultra"-Modus) gegenüber den 88,0 % von GPT-5.5, und 60,5 auf HealthBench Professional; OpenAI hielt auffällig die üblichen SWE-bench Verified-, GPQA- und FrontierMath-Zahlen zurück, und sein Kontextfenster ist weiterhin nicht offiziell veröffentlicht. Ein Vorbehalt: OpenAIs eigene System Card und der externe Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, einschließlich des Manipulierens eines Software-Engineering-Tests mit der höchsten Rate, die METR je aufgezeichnet hat.
Ausstehend Google Gemini 3.5 Pro, weiterhin unveröffentlicht, laut Bloomberg Monate hinter dem Zeitplan Verzögert
Gemini 3.5 Pro bleibt der größte ausstehende Launch. Google kündigte es auf der I/O am 19. Mai zusammen mit Gemini 3.5 Flash an, doch nur Flash erschien, und das Juni-Ziel verstrich. Bloomberg berichtete am 16. Juli 2026, dass das Modell Monate hinter dem Zeitplan liegt und Googles interne Ziele verfehlt hat, wobei das Unternehmen weiterhin daran arbeitet, seine Fähigkeiten insbesondere beim Programmieren zu verbessern. Das ist das gesamte belegte Bild. Google hat nie öffentlich ein Startdatum bestätigt, und Google hat keine finalen Spezifikationen wie Kontextfenster oder Reasoning-Modi veröffentlicht, also behandle kursierende Zahlen als unbestätigt. Nutze in der Zwischenzeit Gemini 3.6 Flash; wir nehmen 3.5 Pro in dem Moment ins Haupt-Ranking auf, in dem es live geht.
Kategorie-Tipp, August 2026

Beste KI zum Schreiben

1
Claude Fable 5
Bestes Schreiben insgesamt
2
Kimi K3
Kreative Fiktion
3
Claude Sonnet 5
Kostenlos für den Alltag

Die beste KI zum Schreiben ist Claude Fable 5, das einzige Modell in den Top drei aller drei unabhängigen Schreib-Boards, mit Claude Sonnet 5 als Preis-Leistungs-Tipp der Gratisversion und GPT-5.5 als Alternative für faktenbasiertes Business-Schreiben. Fable 5 führt Arenas Creative-Writing-Leaderboard an, ist mit 90,7 Spitzenreiter bei LiveBench Language und belegt Platz drei auf EQ-Bench Creative Writing v3 hinter Kimi K3 und GPT-5.6 Sol. Kein anderes Modell ist auf mehr als einem davon in den Top drei. Das ist eine Änderung gegenüber dem letzten Monat, als Claude Sonnet 5 diesen Platz bei GDPval-AA hielt; die Präferenz-Boards stützen diese Platzierung nicht, also ist Sonnet 5 jetzt der Preis-Leistungs-Tipp statt der Qualitätsführer. Fable 5 kostet $10 / $50 pro 1M Tokens und ist dauerhaft in Claude Max und Team Premium bei rund 50 % der regulären Nutzungslimits enthalten. Wenn dein Text ein Arbeits-Deliverable statt Prosa ist, holt sich Claude Opus 5 das GDPval-AA v2 Board für professionelle Deliverables von Artificial Analysis mit 1858, deutlich vor den 1746 von Fable 5.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Fable 5Bestes Schreiben insgesamt#1 Arena Text insgesamt (1508.6), #1 LiveBench Language (90.7), #3 EQ-BenchTeuerste Option hier$10 / $50
Kimi K3Kreative Fiktion und Stimme#1 EQ-Bench Creative Writing (2377), 234 Elo Vorsprung auf Platz zweiNur #10 auf Arena Creative Writing$3 / $15
Claude Sonnet 5Kostenloses AlltagsschreibenKostenlos und Standard auf claude.ai, 1M Kontext#53 Arena Creative Writing; 75,0 LiveBench Language$2 / $10 Einführung (dann $3 / $15)
Claude Opus 5Professionelle Deliverables#1 GDPval-AA v2 mit 1858, vor Fable 5 (1746)Hinter Fable 5 bei Arena Text und Humanity's Last Exam$5 / $25
GPT-5.5Faktenbasiertes Business-SchreibenDokumentierte Zuwächse bei faktischer Verlässlichkeit gegenüber GPT-5.4Reasoning-Stufen jetzt als veraltet markiert$5 / $30
Gemini 3.6 FlashMassen-Entwürfe in großem Umfang17 % weniger Output-Tokens als 3.5 FlashSchwächer beim schwersten Reasoning$1.50 / $7.50
Zweitplatzierte und Alternativen: Kimi K3 ist der Zweitplatzierte für kreative Fiktion und gewinnt EQ-Bench klar, Claude Sonnet 5 ist der Zweitplatzierte beim Preis-Leistungs-Verhältnis und das Modell der Wahl, wenn du nicht zahlst, Claude Opus 5 ist der Tipp für professionelle Deliverables, und Gemini 3.6 Flash ist der Tipp fürs Massen-Drafting.
Was sich diesen Monat geändert hat

Die Schreibkrone bleibt bei Claude Fable 5, und es ist die am besten belegte Entscheidung auf der Seite. Fable 5 ist jetzt #1 auf Arenas Text-Leaderboard mit 1508.6 zum Stichtag 1. August, #1 auf Humanity's Last Exam mit 53,3 % und #1 auf AA-Omniscience mit 40, was drei verschiedene Häuser übereinstimmend bestätigen. Claude Opus 5 behält die Spur der professionellen Deliverables auf GDPval-AA v2, wo das neu justierte Board jetzt 1858 gegen die 1746 von Fable 5 liest.

Kategorie-Tipp, August 2026

Beste KI für Chat & täglichen Assistenten

1
GPT-5.6
ChatGPTs Standard
2
Claude Fable 5
Am höchsten bewertet
3
Claude Opus 5
Durchdachte Tiefe

Die beste KI für den täglichen Chat ist GPT-5.6, und der ehrliche Grund ist Reichweite statt Board-Position. Es ist das Modell, das ChatGPT der größten Nutzerbasis der Kategorie standardmäßig ausliefert, was es zum besten Assistenten macht, den die meisten Menschen tatsächlich öffnen können. Bei der reinen menschlichen Präferenz ist es nicht der Spitzenreiter: GPT-5.6 Sol sitzt mit 1482,8 auf #14 von Arenas Text-Leaderboard, wo Claude Fable 5 mit 1508.6 führt. Die meisten ChatGPT-Nutzer bekommen die ausgewogene Terra-Stufe, von der OpenAI sagt, sie entspreche GPT-5.5 und koste seit der Preissenkung vom 30. Juli 2026 60 % weniger. Es ist verfügbar in ChatGPT (kostenlos mit Limits, Plus zu $20/Monat, Pro zu $100/Monat), über die API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $5 / $30 pro 1M Tokens) und gebündelt in Fello AI neben Claude, Gemini, Grok und DeepSeek. Ein Vorbehalt: OpenAIs System Card und der Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, sodass GPT-5.5 Instant der sicherere Tipp für halluzinationsempfindliche Arbeit bleibt.

ModellAm besten fürStärkeSchwächePreis
GPT-5.6Täglicher Chat, ChatGPTs StandardDer Assistent, den die meisten öffnen können; Terra entspricht GPT-5.5 zu ~halbem Preis#14 auf Arena Text; Scheming von METR gemeldetKostenlos / $20/Mon. Plus; API $0.20 / $1.20 bis $5 / $30
Claude Fable 5Am höchsten bewertete Konversation#1 auf Arena Text insgesamt (1508.6) und in 6 von 7 UnterkategorienKeine Gratisversion; Zugang über Nutzungscredits auf Pro$10 / $50 API
Claude Opus 5Durchdachte, differenzierte Antworten#1 Artificial Analysis Intelligence Index (61) und Agentic Index (55.3)#6 auf Arena Text, hinter Claude Fable 5$20/Mon. Pro, $5 / $25 API
GPT-5.5 InstantHalluzinationsempfindliche Alltagsarbeit52,5 % weniger halluzinierte Aussagen vs. 5.3 InstantReasoning-Stufen jetzt als veraltet markiert$20/Mon. Plus; API $5 / $30
Gemini 3.6 FlashSchnell, kostenlos, multimodalKostenlos in der Gemini-App, 1M Kontext, #12 auf Arena TextSchwächer beim schwersten ReasoningKostenlos / $1.50 / $7.50 API
Fello AIAlle Top-Modelle, eine AppChatGPT + Claude + Gemini + Grok + DeepSeek und mehr auf Mac, iPhone und iPadÜber die App geroutet, nicht direkt$9.99/Mon.
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der eigentliche Präferenzführer, Claude Opus 5 ist der Zweitplatzierte für durchdachte Alltagsnutzung, Gemini 3.6 Flash ist der Zweitplatzierte für schnell und kostenlos, und Grok 4.5 ist der Nischen-Tipp für Live-News-Tage. Fello AI ist die naheliegende Wahl, wenn du die Top-Modelle in einer Mac- und iOS-App für $9.99/Monat willst, statt mit Abos zu jonglieren.
Was sich diesen Monat geändert hat

GPT-5.6 behält den Chat-Tipp aufgrund seiner Reichweite, und der Abstand zum Präferenzführer wuchs eher, als dass er sich schloss. Zum Stichtag 1. August sitzt Sol mit 1482,8 auf #14 bei Arena Text, herunter von #11, während Claude Fable 5 mit 1508.6 führt. Am Produkt änderte sich nichts, also bewegt sich die Krone nicht: Es geht weiterhin darum, welchen Assistenten die meisten Menschen tatsächlich öffnen können.

Kategorie-Tipp, August 2026

Beste KI für Bilder

1
ChatGPT Images 2.0
Text in Bildern
2
Reve 2.1
Layout & 4K
3
Muse Image
Bildbearbeitung

Die beste KI für die Bildgenerierung ist ChatGPT Images 2.0, und es ist die unumstrittenste Krone auf dieser Seite. GPT Image 2 führt Arenas Text-zu-Bild-Board mit 1385 Elo und sein Bildbearbeitungs-Board mit 1463 an, und Artificial Analysis setzt es mit 1339,4 an die Spitze seiner eigenen Bild-Arena. Es ist die naheliegende Wahl, wann immer dein Bild lesbare Wörter enthalten soll, auf Deutsch oder in einer anderen Schrift, und es ist in ChatGPT Plus und Pro enthalten. Die Zweitplatzierten haben sich geändert. Reve 2.1 (9. Juli) ist die echte #2 bei Text-zu-Bild mit 1302, und Reve 2.0 liegt jetzt auf beiden Boards dahinter. Metas Muse Image ist #3 auf Arenas Text-zu-Bild-Board und #2 bei der Bildbearbeitung, das stärkste Abschneiden, das je ein Meta-Bildmodell geschafft hat. Googles Nano Banana Pro ist nicht mehr der Zweitplatzierte insgesamt: Bei Text-zu-Bild rangiert es zwischen #8 und #11, unter seinem eigenen günstigeren Geschwistermodell Nano Banana 2, obwohl es bei der Bildbearbeitung höher platziert.

ModellAm besten fürStärkeSchwächePreis
ChatGPT Images 2.0Bilder mit lesbarem Text#1 Text-zu-Bild (1385) und #1 Bildbearbeitung (1463)Weniger fotorealistisch als die Gemini-BildreiheIn ChatGPT Plus enthalten
Reve 2.1Layout, Typografie, natives 4K#2 Text-zu-Bild mit 1302, layouterhaltende BearbeitungKleineres ÖkosystemKostenlos / ab $7.99/Mon.
Muse ImageBildbearbeitung, Meta-Ökosystem#3 Text-zu-Bild, #2 Bildbearbeitung (1407)Neu, dünnes Tooling drumherumMeta-AI-App
Nano Banana 2 (Gemini 3.1 Flash Image)Fotorealistische Porträts und ProdukteÜbertrifft Nano Banana Pro auf beiden BoardsSchwächer bei Text im BildGemini-App / AI Studio
Seedream 5.0 ProMehrsprachiger Text + Regionenbearbeitung10+ Sprachen inkl. Arabisch RTL, Lasso- und EbenenbearbeitungKeine unabhängigen Benchmarks; Urheberrechts-WolkeBytePlus / Magnific
Midjourney v8Stilisierte Kunst, IllustrationÄsthetische Basis, die die meisten Künstler bevorzugenSchwächer bei Text im Bild$10-$120/Mon.
Grok ImagineNSFW / Spicy ModeFreizügigste LeitplankenKleineres Modell dahinter$30/Mon. SuperGrok
Zweitplatzierte und Alternativen: Reve 2.1 ist der Zweitplatzierte insgesamt und der Tipp für Layout und Typografie, Muse Image ist der Zweitplatzierte, um ein bereits vorhandenes Bild zu bearbeiten, und Nano Banana 2 ist der Foto-Real-Tipp. Grok Imagine ist weiterhin das einzige Frontier-Modell, das Spicy-Mode-Inhalte für Erwachsene erlaubt.
Was sich diesen Monat geändert hat

Die Bildkrone ist unverändert und GPT Image 2 führt weiterhin alle drei Boards an, die wir verfolgen, auf Arena Text-zu-Bild (1385), Arena Bildbearbeitung (1463) und Artificial Analysis' Bild-Arena (1339,4). Die eine Ergänzung ist Microsofts MAI-Image-2.5, das auf dem Bild-Board von Artificial Analysis mit 1269,7 auf Platz drei sitzt und auf Arenas Bildbearbeitungs-Board Platz drei belegt, sodass der dritte Platz jetzt davon abhängt, welches Haus du liest.

Kategorie-Tipp, August 2026

Beste KI für Video

1
Gemini Omni Flash
#1 auf beiden Video-Boards
2
MiniMax H3
2K + nativer Ton
3
Dreamina Seedance 2.0
Engster Herausforderer

Die beste KI für die Videogenerierung ist Gemini Omni Flash, das Arenas Text-zu-Video-Board mit 1527 Elo anführt, ganze 45 Punkte vor dem zweiten Platz, und außerdem Artificial Analysis' Video-Arena anführt. Es ist #1 bei beiden Häusern, was kein anderes Videomodell schafft. Die Preise laufen bei $1.50 Input und $17.50 pro 1M Video-Output-Tokens, was auf etwa $0.10 pro Sekunde fertiges Video hinausläuft, und es unterstützt dialogbasierte Bearbeitung. Die eine echte Grenze ist die Länge: Omni Flash generiert 10-Sekunden-Clips. Wenn du längere Aufnahmen brauchst, bleibt Veo 3.1 das richtige Werkzeug in der Gemini-App, in AI Studio und Vertex AI, mit nativem Ton und 1080p-Output. Das ersetzt Veo 3.1 an der Spitze der Kategorie; Veo 3.1 ist ein gutes Modell, aber nicht das führende, mit seiner besten Variante auf #6 von Arenas Text-zu-Video-Board. Der zu beobachtende Kandidat ist MiniMax H3 (31. Juli), das 2K-Clips von 4 bis 15 Sekunden mit nativem Stereoton generiert und pro Sekunde ab $0.13 bei 2K abgerechnet wird, bereits #2 auf dem Video-Board von Artificial Analysis mit 1241,5. Wir bewegen die Krone deswegen nicht: Der Wert ist einen Tag alt, kommt vom einzigen Board, das zwischen den Auswertungen nicht reproduziert hat, und Arenas Text-zu-Video-Abstimmungsstichtag liegt vor H3.

ModellAm besten fürStärkeSchwächePreis
Gemini Omni FlashBeste KI-Videos insgesamt#1 auf beiden Video-Boards (1527 Arena), dialogbasierte BearbeitungDeckelt bei 10-Sekunden-Generierungen~$0.10/Sek.; Gemini-App / AI Studio
MiniMax H32K-Clips mit nativem Ton4-15 s bei 2K, nativer Stereoton; #2 auf AA Video (1241.5)Einen Tag alt, noch keine Arena-Stimmen; Gewichte nicht veröffentlicht$0.13/Sek. bei 2K
Dreamina Seedance 2.0Engster Herausforderer#2 Text-zu-Video (1482) und #1 bei Bild-zu-VideoByteDance-Ökosystem, eingeschränkter westlicher ZugangDreamina / BytePlus
Muse VideoVideo im Meta-Ökosystem#3 Text-zu-Video mit 1459Neuestes der Gruppe, dünnes ToolingMeta-AI-App
Veo 3.1Längere Produktions-ClipsNativer Ton, 1080p, starke physikalische Konsistenz#6 auf Arena Video, nicht der QualitätsführerGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboSchnelle Iteration zu niedrigeren KostenNatives 4K, 60fps, 15-Sekunden-Clips; Turbo am 17. Juni erschienenAußerhalb der Top 16 auf Arena Text-zu-VideoAb $10/Mon.
Luma Ray 3Fotorealistische SzenenStarker Realismus für LandschaftenKleinere CommunityKostenlos / ab $9.99/Mon.
Zweitplatzierte und Alternativen: Dreamina Seedance 2.0 ist der Zweitplatzierte insgesamt und schlägt Omni Flash sogar bei Bild-zu-Video, Muse Video ist Dritter, und Veo 3.1 ist der Tipp, wenn 10 Sekunden nicht genug sind. OpenAI stellte die Sora-2-Consumer-App am 26. April 2026 ein, und nur die Entwickler-API bleibt, bis zum 24. September 2026.
Was sich diesen Monat geändert hat

Gemini Omni Flash behält die Videokrone und ist weiterhin #1 auf beiden Boards, mit 1527,5 auf Arena und 1244,8 auf Artificial Analysis. MiniMax H3 (31. Juli) tritt als Kandidat auf #2 auf dem Video-Board von Artificial Analysis (1241,5) ein, 3,3 Elo dahinter, und schlägt Omni Flash bei den Spezifikationen mit 2K-Output, Clips bis 15 Sekunden und nativem Stereoton. Wir halten die Krone, weil dieser Abstand einen Tag alt, einbrettrig ist und keine Stimmen auf Arena trägt, dessen Text-zu-Video-Stichtag vor dem Launch liegt.

Kategorie-Tipp, August 2026

Beste KI zum Programmieren

1
Claude Opus 5
#1 Arena WebDev
2
Claude Fable 5
Schwerstes Long-Horizon
3
Kimi K3
Web-Apps und Agenten

Die beste KI zum Programmieren ist Claude Opus 5, und es gewinnt auf den beiden Boards, wo Entwickler über das fertige Ergebnis abstimmen statt ein Skript ein Harness zu messen. Es ist #1 auf Arenas WebDev-Board mit 1,702.9 und #1 bei image-to-WebDev mit 1,668.6, zu den Abstimmungsstichtagen 1. August und 31. Juli. Der Preis ist die zweite Hälfte des Arguments: Opus 5 läuft mit $5 / $25 pro 1M Tokens gegen die $10 / $50 von Claude Fable 5, und Artificial Analysis misst es mit $2.34 pro Index-Aufgabe gegen die $3.15 von Fable 5. Anthropics eigene Dokumentation rät Entwicklern, für komplexes agentisches Programmieren mit Opus 5 zu beginnen und Fable 5 für Workloads zu reservieren, die die höchste verfügbare Leistung brauchen. Claude Fable 5 ist der Zweitplatzierte und bleibt der Tipp für die schwerste Long-Horizon-Arbeit, auf #4 bei WebDev (1,630.7) und #2 bei image-to-WebDev (1,625.7). Der Kandidat ist Kimi K3, das #2 bei WebDev mit 1,675.5 und #3 auf Arenas Agent-Board belegt, der stärkste Open-Weight-Coder auf den Boards, wobei Selbst-Hosting 1,56 TB Gewichte bedeutet. Auf dem Coding Index von Artificial Analysis ist es kein Claude-Durchmarsch: GPT-5.6 Sol (xhigh) führt mit 78,3 vor Opus 5 (max) mit 78,0, nah genug, um es einen Gleichstand zu nennen. Der günstigste ernsthafte Kandidat ist jetzt DeepSeek V4-Flash 0731 bei $0.14 / $0.28.

ModellAm besten fürStärkeSchwächePreis (pro 1M Tokens)
Claude Opus 5Bestes Programmieren insgesamt#1 Arena WebDev (1,702.9) und #1 image-to-WebDev (1,668.6); $2.34 pro Index-AufgabeArtificial Analysis Coding Index hat GPT-5.6 Sol eine Spur voraus$5 / $25
Claude Fable 5Schwerste agentische Long-Horizon-Arbeit#2 Arena image-to-WebDev (1,625.7), #4 WebDev; 1M KontextTeuerstes; Artificial Analysis Coding Index setzt es auf Platz 7$10 / $50
Kimi K3Web-App-Bau und Agenten#2 Arena WebDev (1,675.5), #3 Arena Agent, höchster offener Intelligence Index (57)1,56 TB zum Selbst-Hosten$3 / $15
GPT-5.6 SolOpenAI-Flaggschiff, agentisches Programmieren#1 Artificial Analysis Coding Index mit 78,3 (xhigh)Fehlt auf dem offiziellen Terminal-Bench-Board; Eval-Gaming von METR gemeldet$5 / $30
Muse Spark 1.2Günstiges agentisches ProgrammierenIntelligence Index 54 bei $1.25 / $4.25; 80 % auf Terminal-Bench 2.1 (Artificial Analysis)Zweiter hinter Opus 5 auf allen drei von Metas eigenen Coding-Charts (82,9 % vs. 86,7 %); Scale SEAL hat nur 1.1 bewertet$1.25 / $4.25
Grok 4.5Günstiger Preis-Leistungs-Coder#4 auf dem offiziellen Terminal-Bench-2.1-Board mit 79,3 % über Cursor CLIHöhere Halluzinationsrate; EU-API-Konsole weiterhin geschlossen$2 / $6
Gemini 3.6 FlashAgenten-Programmieren in großem UmfangIntelligence Index 50, 17 % weniger Output-Tokens als 3.5 FlashSchwächer beim schwersten Reasoning$1.50 / $7.50
GLM-5.2Bester Open-Weight-Coder, den du hosten kannstIntelligence Index 51, #6 Arena WebDev (1,587.1), MIT-LizenzKimi K3 übertrifft es; nur Selbst-Host oder AnbieterOpen weights (MIT)
Zweitplatzierte und Alternativen: Kimi K3 ist der Zweitplatzierte auf Arenas WebDev-Board und der Tipp, wenn du die stärksten offenen Gewichte willst, Claude Fable 5 ist der Zweitplatzierte für die schwerste Long-Horizon-Arbeit, GPT-5.6 Sol ist der Zweitplatzierte auf Artificial Analysis' Komposit, und GLM-5.2 ist der Open-Weight-Tipp für Teams, die es selbst hosten. In IDEs ist Cursor mit Claude weiterhin die beliebteste Kombination, und Claude Code ist der naheliegende Tipp, wenn du im Terminal lebst.
Was sich diesen Monat geändert hat

Die Programmierkrone ging an Claude Opus 5. Arena beendete die Bewertung, und es kam auf beiden Coding-Boards zuerst, WebDev mit 1,702.9 und image-to-WebDev mit 1,668.6, mit Claude Fable 5 auf Platz vier und zwei. Das sind abstimmungsbasierte Boards mit veröffentlichten Stichtagen, sodass die Krone jetzt auf menschlichen Vergleichen statt auf einem einzelnen Harness ruht, und Opus 5 schafft das zum halben Preis von Fable 5. Fable 5 wird zum Zweitplatzierten für die schwerste Long-Horizon-Arbeit, und Kimi K3 bleibt der Kandidat auf #2 bei WebDev. Metas Muse Spark 1.2 erschien am 5. August und ändert das nicht, weil es auf Metas eigenen Charts bei jedem veröffentlichten Coding-Benchmark hinter Opus 5 auf Platz zwei landet.

Kategorie-Tipp, August 2026

Beste KI für Kreativität

1
Grok 4.5
Wenigste Leitplanken
2
Claude Fable 5
Prosa höchster Qualität
3
Kimi K3
Fiktion und Stimme

Die beste KI für ungefilterte, angesagte kreative Arbeit ist Grok 4.5, und wir wollen genau sein, warum. Dieser Tipp geht um das Produkt, nicht um die Prosa-Qualität. Grok 4.5 trägt die wenigsten Inhaltsbeschränkungen aller Frontier-Modelle und als Einziges die native Echtzeit-X-Integration, was es zum einen Modell macht, das sich auf kantige, aktuelle oder bewusst provokante Briefings einlässt, die die anderen ablehnen. Es ist Standard in der Grok-App für SuperGrok- und X-Premium+-Abonnenten zu $30/Monat. Es ist nicht der beste Schreiber, und die Boards sagen es unverblümt. Grok 4.5 sitzt auf #33 bei EQ-Bench Creative Writing und #41 auf Arenas Creative-Writing-Leaderboard und verliert bei beiden gegen das ältere Grok 4.20-beta1. Wenn du allein nach Output-Qualität wählst, gewinnt Claude Fable 5 klar auf #1 bei Arena Creative Writing, und Kimi K3 gewinnt EQ-Bench. Wähle Grok 4.5 für das, was es dich erschaffen lässt, nicht dafür, wie gut es schreibt.

ModellAm besten fürStärkeSchwächePreis
Grok 4.5Ungefiltert, meinungsstark, angesagtWenigste Inhaltsbeschränkungen, native Echtzeit-X-Grundierung#33 EQ-Bench, #41 Arena Creative Writing$30/Mon. SuperGrok
Claude Fable 5Kreative Prosa höchster Qualität#1 Arena Creative Writing, #1 LiveBench LanguageVorsichtige Leitplanken bei kantigen Briefings$10 / $50 API
Kimi K3Fiktion und markante Stimme#1 EQ-Bench Creative Writing mit 2377Nur #10 auf Arena Creative Writing$3 / $15
Claude Opus 5Strukturierte Langform-KreativitätHält lange Threads und lektoriert sich selbst; #1 Intelligence IndexVorsichtigstes der Gruppe$20/Mon. Pro; $5 / $25 API
Gemini 3.1 ProMultimodal kreativStarke Text-, Bild- und VideoketteQuoten in der Gemini-AppKostenlos / $2.00-$4.00 API Input
Grok Imagine (Spicy Mode)NSFW / kreativ für ErwachseneFreizügigste BildgenerierungNischen-Anwendungsfall$30/Mon. SuperGrok
Zweitplatzierte und Alternativen: Claude Fable 5 ist der Zweitplatzierte und der richtige Tipp, wenn Qualität wichtiger ist als Freiheit, Kimi K3 ist der Tipp für Fiktion, und Claude Opus 5 ist der Tipp für kreative Projekte, die sich über viele Runden ziehen. Für kreative Arbeit für Erwachsene ist Grok Imagine Spicy Mode weiterhin die einzige Option auf Frontier-Niveau.
Was sich diesen Monat geändert hat

Grok 4.5 behält diesen Tipp, und am Produkt bewegte sich nichts. Es ist hier für seine Freizügigkeit und seinen Live-X-Zugang, nicht für die Board-Position, und Claude Fable 5 bleibt das Modell der Wahl, wenn du das bessere Schreiben willst. Ein Namenshinweis für August: xAI firmiert auf den Leaderboards jetzt als SpaceXAI, und das Modell ist unverändert.

Kategorie-Tipp, August 2026

Beste KI für Genauigkeit & Recherche

1
Gemini 3.1 Pro
98 % ARC-AGI-1
2
Claude Fable 5
Grundierte Suche
3
GPT-5.6 Sol
Neuartiges Reasoning

Die beste KI für Genauigkeit und Recherche ist Gemini 3.1 Pro. Sein stärkstes Ergebnis liegt auf ARC-AGI-1 vom ARC Prize, wo es 98 % erzielt und mit dem menschlichen Panel gleichzieht, und das bei $0.52 pro Aufgabe. Diese Kombination ist das Argument: Mehrere Modelle sind bei der Leistung nah dran, keines erreicht es bei den Kosten für verlässliche faktische Arbeit. Es kombiniert das mit nativer Google-Search-Grundierung, was du willst, wenn die Antwort aktuell statt bloß plausibel sein muss. Es erzielt außerdem 94,1 % auf GPQA Diamond, wo GPT-5.6 Sol jetzt gleichzieht statt zurückzuliegen, und 44,4 % auf Humanity's Last Exam, und führt Scale SEALs HLE-Board mit 46,44 an. Wir haben die vorherige ARC-AGI-2-Rahmung fallen gelassen: Seine 77,1 % sind weiterhin korrekt, aber das Board hat sich bewegt, und dieser Wert platziert es jetzt um Platz 14. Zwei ehrliche Vorbehalte. Bei grundierter Suche speziell wird Arenas Such-Leaderboard von Anthropic angeführt, nicht von Google, wobei Gemini 3.1 Pro mit Grundierung auf #7 liegt. Und bei neuartigem Reasoning führt GPT-5.6 Sol ARC-AGI-2 an, und Claude Opus 5 führt ARC-AGI-3 mit 30 % an, rund 3,75-mal so viel wie das nächstbeste Modell. Wir haben die Krone nicht an Opus 5 gegeben, weil Artificial Analysis seine Halluzinationsrate mit 50 % misst und es auf AA-Omniscience unter Fable 5 setzt.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
Gemini 3.1 ProGünstige, verlässliche faktische Arbeit98 % ARC-AGI-1 (Gleichstand mit dem menschlichen Panel) bei $0.52/Aufgabe, 94,1 % GPQA (von Sol egalisiert)ARC-AGI-2 77,1 % rangiert jetzt ~14.; #7 auf Arena Search$2.00-$4.00 / $12.00-$18.00 (gestaffelt)
Claude Fable 5Grundierte Suche#1 und #3 auf Arenas Such-Leaderboard, vor GoogleKeine einzelne günstige Stufe$10 / $50 (Fable 5)
GPT-5.6 SolNeuartiges Reasoning#1 ARC-AGI-2 mit 93 %, gegen ein 100-%-Menschen-PanelScheming von METR gemeldet$5 / $30
Claude Opus 5Schwerste unbekannte Probleme#1 ARC-AGI-3 mit 30 %, ~3,75-mal das nächste Modell (ARC Prize)Artificial Analysis misst eine Halluzinationsrate von 50 %$5 / $25
Qwen 3.7 MaxFrontier-Genauigkeit zum Preis-Leistungs-Verhältnis92,4 GPQA Diamond, 200 kostenlose Anfragen/TagNur API, kein Chat-Frontend$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Opus 4.6Ehrlichkeit unter Druck#1 auf Scale SEALs MASK-Board mit 96,28; Anthropic hält die Top 5Als Flaggschiff abgelöstLegacy-Anthropic-Modell
Zweitplatzierte und Alternativen: Anthropics Modelle sind die Zweitplatzierten für grundierte Suche und räumen das Board zur Ehrlichkeit unter Druck ab, GPT-5.6 Sol ist der Zweitplatzierte für neuartiges Reasoning, und Qwen 3.7 Max ist der Preis-Leistungs-Tipp am Frontier.
Was sich diesen Monat geändert hat

Gemini 3.1 Pro behält die Genauigkeitskrone, doch seine Kopfzahl ist keine Führung mehr. Sein GPQA-Diamond-Wert wurde auf 94,1 % neu justiert, und GPT-5.6 Sol zieht jetzt exakt gleich, sodass die Krone auf dem ARC-AGI-1-Ergebnis bei $0.52 pro Aufgabe plus Search-Grundierung ruht statt auf GPQA. Das ist die nächste Krone, die wir neu testen: Claude Fable 5 führt alle drei Boards an, die messen, wie oft ein Modell schlicht falsch liegt, mit 40 auf AA-Omniscience, 61 % auf Omniscience Accuracy und 53,3 % auf Humanity's Last Exam.

Kategorie-Tipp, August 2026

Beste KI zur Problemlösung

1
GPT-5.6 Sol
STEM-Flaggschiff
2
Claude Opus 5
Agentische Ketten
3
GPT-5.5 Pro
Verifizierter FrontierMath

Die beste KI zur schweren Problemlösung ist GPT-5.6 Sol, und es ist die am besten belegte Krone auf dieser Seite. Es holt sich #1 auf LiveBench Mathematics mit 96,2, #1 auf LiveBench Reasoning mit 91,7 und #1 auf ARC-AGI-2 mit 93 %, das Näheste, das je ein Modell dem 100-%-Menschen-Panel gekommen ist. Drei separate Häuser setzen es bei den entscheidenden Reasoning-Aufgaben auf den ersten Platz, was mehr Übereinstimmung ist, als jede andere Kategorie auf dieser Seite erzeugt. OpenAI hat Sols FrontierMath-Wert weiterhin nicht veröffentlicht, also bleibt die verifizierte OpenAI-Marke die 39,6 % von GPT-5.5 Pro auf FrontierMath Tier 4, und wir schieben Sols Zahl in dem Moment ein, in dem sie öffentlich wird. Qwen 3.7 Max ist die Preis-Leistungs-Alternative für Aufgaben im Wettbewerbsstil mit 97,1 auf dem HMMT-Index vom Februar 2026 und 44,5 auf Apex, zu einem Bruchteil der Kosten von ChatGPT Pro, und es enthält jetzt 200 kostenlose Modellanfragen pro Tag. Claude Opus 5 ist die Alternative für lange agentische Reasoning-Ketten, führt Artificial Analysis' Agentic Index mit 55,3 und ARC Prizes ARC-AGI-3 mit 30 %, rund 3,75-mal das nächstbeste Modell.

ModellAm besten fürSchlüssel-BenchmarkSchwächePreis
GPT-5.6 SolSchwerste Mathematik, Wissenschaft und Reasoning#1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %)FrontierMath weiterhin unveröffentlicht; Scheming von METR gemeldet$100/Mon. ChatGPT Pro; API $5 / $30
Claude Opus 5Lange agentische Reasoning-Ketten#1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %)Zweiter auf LiveBench Reasoning; 50 % Halluzinationsrate$5 / $25
GPT-5.5 ProVerifizierter FrontierMath-Führer39,6 % FrontierMath Tier 4Von Sol als Flaggschiff abgelöst$100/Mon. ChatGPT Pro
Qwen 3.7 MaxWettbewerbsmathematik mit knappem Budget97,1 HMMT 2026 Feb, 44,5 Apex, 200 kostenlose Anfragen/TagNur API$1.25 / $3.75 Promo; $2.50 / $7.50 Liste
Claude Fable 5Mathematik in einem Coding-Workflow#1 auf Arenas Mathe-Unterkategorie (1543), 96,0 LiveBench MathematicsTeuerste Option hier$10 / $50
GLM-5.2Open-Weight-ProblemlösungHöchster open Intelligence Index mit 51, MIT, 1M KontextNur Selbst-Host oder AnbieterOpen weights (MIT)
Zweitplatzierte und Alternativen: Claude Opus 5 ist der Zweitplatzierte und der naheliegende Tipp für langkettiges agentisches Reasoning, Claude Fable 5 ist der Zweitplatzierte auf Arenas Mathe-Board, Qwen 3.7 Max ist der Preis-Leistungs-Tipp, und GLM-5.2 ist der Open-Weight-Tipp.
Was sich diesen Monat geändert hat

GPT-5.6 Sol behält diese Krone und holte sich ein zweites Argument. Sol führt jetzt außerdem Artificial Analysis' Terminal-Bench v2.1 mit 89,5 % und seinen Coding Index mit 78,3 an, und es zieht mit Gemini 3.1 Pro auf GPQA Diamond mit 94,1 % gleich. Claude Opus 5 bleibt die Agentic-Reasoning-Alternative auf der Stärke von ARC-AGI-3. Am 1. August benannte OpenAI seine nächste Modellfamilie Astra und veröffentlichte zehn neue mathematische Ergebnisse aus einer internen Version, obwohl Astra unveröffentlicht ist und kein Datum, keinen Preis und keine Verfügbarkeit hat.

Kategorie-Tipp, August 2026

Bester KI-Agent

1
Gemini Spark
Rund um die Uhr in der Cloud
2
Claude Cowork
Desktop-KI
3
ChatGPT Codex
Coding-Agent

Der beste KI-Agent ist derzeit Gemini Spark für rund um die Uhr in der Cloud residierende Arbeit und Claude Cowork für auf dem Desktop residierende Arbeit, mit ChatGPT Codex als Alternative für Coding-Agenten und Browser-Agenten der OpenAI-Operator-Klasse als Alternative für Web-Aufgaben. KI-Agenten sind die am schnellsten bewegte Kategorie 2026: Jeder Top-Anbieter liefert jetzt ein Agenten-Produkt, und die praktische Wahl liegt zwischen Agenten, die in der Cloud leben (laufen, während dein Laptop geschlossen ist), und Agenten, die auf deinem Desktop leben (steuern deine Apps direkt). Gemini Spark startete auf der Google I/O am 19. Mai 2026 und ist der erste 24/7-Cloud-Agent. Claude Cowork erreichte am 9. April 2026 die allgemeine Verfügbarkeit und läuft als Desktop-Agent, der deine lokalen Apps steuert. ChatGPT Codex Mobile (14. Mai) ist der Tipp für Coding-Agenten-Arbeit. Lies den vollständigen Vergleich Gemini Spark vs. Claude Cowork.

AgentAm besten fürWo er läuftStärkePreis
Gemini Spark24/7-Cloud-Aufgaben, Workspace-WorkflowsGoogle-Cloud-VM (immer an)Erster echter 24/7-Agent, tiefe Workspace-Integration$99.99/Mon. Google AI Ultra
Claude CoworkDesktop, App-Steuerung, Design + CodeDein Mac-/Windows-DesktopSteuert lokale Apps, sieht deinen Bildschirm$20/Mon. Claude Pro
ChatGPT Codex MobileCoding-Agent auf dem HandyOpenAI-Cloud + iOS/AndroidDiffs freigeben und Arbeit vom Handy umleitenIn ChatGPT-Plänen enthalten
Grok Agentic (Grok 4.5)Echtzeit-Recherche, X-ScrapingxAI-CloudNative X-Integration$30/Mon. SuperGrok
OpenAI Operator-KlasseBrowser-Aufgaben, Web-FormulareOpenAI-Cloud + dein BrowserWeb-AutomatisierungChatGPT Pro
Zweitplatzierte und Alternativen: Claude Cowork ist der Zweitplatzierte insgesamt und der naheliegende Tipp, wenn du den Agenten auf deiner Maschine haben willst, der deine Apps steuert. ChatGPT Codex Mobile ist der Zweitplatzierte für Coding-Agenten. Grok Agentic ist der Nischen-Tipp für Echtzeit-Recherche.
Was sich diesen Monat geändert hat

Keine neuen Consumer-Agenten erschienen, und Metas Muse Code (5. August) ist ein Terminal-Entwickler-Tool statt eines für Consumer, sodass die Wahl zwischen Gemini Spark (Cloud) und Claude Cowork (Desktop) weiterhin die meisten Agenten-Entscheidungen für einzelne Nutzer bestimmt. Die Modellschicht darunter bewegte sich erneut: Claude Opus 5 (24. Juli) holte sich #1 auf Artificial Analysis' Agentic Index mit 55,3, vor GPT-5.6 Sol mit 54,0 und Claude Fable 5 mit 52,8, und es kostet $5 / $25. Opus 5 führt außerdem Arenas Agent-Board an, mit Kimi K3 auf Platz drei. Für Teams, die eigene Agenten bauen, ist Metas Muse Spark 1.2 (5. August) eine günstige agenten-native Option zu $1.25 / $4.25, deren GDPval-AA v2 agentisches Elo von 1371 auf 1631 sprang, obwohl Scale SEAL nur das ältere 1.1 bewertet hat, das dessen MCP-Atlas-Tool-Use-Board mit 88,1 anführt. GLM-5.2 (MIT) ist das stärkste Open-Weight-Agentenmodell, das du auf bescheidener Hardware hosten kannst, auf #5 von Arenas Agent-Board.

Anwendungsfall-Leitfaden, August 2026

Beste KI für Studierende

1
GPT-5.5 Free
Essays & Recherche
2
Gemini 3.6 Flash
STEM + PDFs
3
Claude Sonnet 5
Schreiben & Lektorat

Die beste KI für Studierende ist GPT-5.5 Free in ChatGPT für allgemeine Studienarbeit und Gemini 3.6 Flash Free in der Gemini-App für STEM und multimodales Lernen, mit Qwen 3.7 Max als API-Alternative für schwerere Aufgabensätze (200 kostenlose Anfragen pro Tag) und Claude Opus 5 als Alternative für das Lektorat von Essays. Die meisten Studierenden müssen nicht zahlen: Die kostenlose ChatGPT-Stufe verwendet jetzt standardmäßig GPT-5.6 (mit weiterhin verfügbarem GPT-5.5), Gemini 3.6 Flash ist in der kostenlosen Gemini-App und in AI Studio, Claude Sonnet 5 ist der neue kostenlose Claude-Standard, und DeepSeek V4 ist kostenlos auf DeepSeeks Chat-Seite. Für schrittweises Rechnen bei der schwersten Mathematik ist GPT-5.6 Sol OpenAIs neues Flaggschiff (sein FrontierMath-Wert ist noch nicht veröffentlicht, mit den verifizierten 39,6 % von GPT-5.5 Pro auf FrontierMath Tier 4 als aktueller Marke), obwohl beide nur bezahlt sind; Qwen 3.7 Max ist die Preis-Leistungs-Alternative mit 97,1 HMMT 2026 Februar bei API-Preisen von $1.25 / $3.75 auf seiner aktuellen 50-%-Promo ($2.50 / $7.50 Liste).

AufgabeBestes ModellWarumKostenlos?Alternative
Essays & StudienarbeitGPT-5.5Kostenlos in ChatGPT, verbesserte faktische Verlässlichkeit vs. 5.4JaClaude Sonnet 5 (kostenloses Claude)
STEM-ProblemlösungGPT-5.6 Sol / Qwen 3.7 MaxNeues STEM-Flaggschiff (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 FebPro bezahlt / Qwen API bezahltGemini 3.6 Flash (kostenlos)
Recherche & GenauigkeitGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, native Google-Search-GrundierungJa (Gemini-App)Claude Opus 5
Schreib-LektoratClaude Sonnet 5Kostenlos und Standard auf claude.ai; Claude Fable 5 ist der QualitätsführerJa (Claude kostenlos)Claude Fable 5
Multimodales Lernen (PDFs, Slides, Bilder)Gemini 3.6 Flash1M Kontext, kostenlos in der Gemini-AppJaNotebookLM (Google)
Zweitplatzierte und Alternativen: Claude Sonnet 5 (kostenlos) ist der Zweitplatzierte fürs Essay-Schreiben und -Lektorat. Gemini 3.6 Flash (kostenlos) ist der Zweitplatzierte fürs multimodale Lernen und die PDF-Aufnahme. DeepSeek V4 ist der Zweitplatzierte für die Problemlösung mit striktem Null-Kosten-Budget.
Anwendungsfall-Leitfaden, August 2026

Beste KI für Arbeit & Profis

1
GPT-5.6
Tägliche Wissensarbeit
2
Claude Opus 5
Programmieren & Schreiben
3
Gemini 3.1 Pro
Recherche & Briefings

Die beste KI für professionelle Arbeit ist GPT-5.6 (ChatGPTs Standard seit 9. Juli) für tägliche Wissensarbeit, Claude Opus 5 für Programmieren und Schreiben mit hohem Einsatz und Gemini Spark für 24/7-agentische Workflows. Die meisten Profis holen das meiste heraus, indem sie zwei bezahlte Abos betreiben (ChatGPT Plus zu $20/Monat plus Claude Pro zu $20/Monat, insgesamt $40/Monat), oder sie konsolidieren mit Fello AI zu $9.99/Monat für alle fünf Top-Modelle in einer Mac-/iOS-App. Für agentische Arbeit, die läuft, während du schläfst, ist Gemini Spark auf Google AI Ultra zu $99.99/Monat der einzige echte 24/7-Cloud-Agent.

AnwendungsfallBestes ModellSchlüsselstatPreisAlternative
Tägliche WissensarbeitGPT-5.6ChatGPTs Standard seit 9. Juli; der Assistent, den die meisten öffnen können$20/Mon. ChatGPT PlusClaude Opus 5
Programmieren (proprietär)Claude Opus 5#1 auf Arena WebDev (1,702.9) und image-to-WebDev (1,668.6); Anthropics empfohlener Standard$20/Mon. Claude ProClaude Fable 5
Programmieren (kosteneffizient)Qwen 3.7 Max80,4 SWE-Verified, 1M Kontext$1.25 / $3.75 Promo; $2.50 / $7.50 ListeDeepSeek V4-Flash 0731
Recherche & BriefingsGemini 3.1 Pro98 % ARC-AGI-1 bei $0.52/Aufgabe, Google-GrundierungGoogle AI Pro / UltraClaude Opus 5
Schwere Mathematik, Physik, FinanzmodellierungGPT-5.6 SolOpenAIs neues STEM-Flaggschiff (5.5 Pro verifiziert bei 39,6 % FrontierMath)$100/Mon. ChatGPT ProQwen 3.7 Max
Immer-an-Agenten-WorkflowsGemini SparkErster 24/7-Cloud-Agent$99.99/Mon. Google AI UltraClaude Cowork
Live-News, X-Kontext-KreativitätGrok 4.5Opus-Klasse + native X-Grundierung$30/Mon. SuperGrokGemini 3.1 Pro
All-in-one-KonsolidierungFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/Mon.Jeden Anbieter separat bezahlen
Zweitplatzierte und Alternativen: Für die meisten professionellen Teams ist Claude Opus 5 der Zweitplatzierte hinter GPT-5.6 für die tägliche Arbeit und jetzt der Programmierführer schlechthin bei $5 / $25, mit Claude Fable 5 als Zweitplatziertem für die schwerste Long-Horizon-Arbeit. Gemini 3.1 Pro ist der Zweitplatzierte für recherchelastige Rollen, und Gemini Spark ist die einzigartige Wahl, wenn du einen Cloud-Agenten an langen Aufgaben arbeiten lassen kannst.
Preisvergleich

KI-Modell-Preise im August 2026

Von $0-Gratisversionen bis zu $199.99/Monat Google AI Ultra. Der folgenreichste Preis auf dieser Tabelle ist Claude Opus 5 bei $5 / $25, weil es das #1-Modell auf Artificial Analysis' Intelligence Index zum halben Preis von Claude Fable 5 ist. Metas Muse Spark 1.2 wird mit $1.25 / $4.25 gelistet, mit einer Contributor-Stufe zu $0.10 / $0.20 für alle, die bereit sind, Meta auf ihren Prompts trainieren zu lassen, und Grok 4.5 wird mit $2 / $6 gelistet. Der Preis-Leistungs-Tipp ist jetzt DeepSeek V4-Flash 0731 bei $0.14 / $0.28, das Gemini 3.6 Flashs Intelligence Index von 50 erreicht und $0.03 pro Index-Aufgabe kostet gegen die $0.56 von Flash. Unter den geschlossenen Modellen ist GPT-5.6 Luna nach OpenAIs Senkung vom 30. Juli das günstigste bei $0.20 / $1.20. Für eine tiefere Aufschlüsselung siehe unseren vollständigen Leitfaden zum KI-Preisvergleich.

ModellInput (pro 1M)Output (pro 1M)KontextKostenloser Zugang?
GPT-5.5$5.00$30.001M (400K in Codex)ChatGPT Free; API bezahlt
GPT-5.5 Pro$30.00$180.001MChatGPT Pro ab $100/Mon. ($200 Stufe mit höherer Nutzung)
GPT-5.6 Sol$5.00$30.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
GPT-5.6 Terra$2.00$12.00Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
GPT-5.6 Luna$0.20$1.20Nicht veröffentlichtLive in ChatGPT, Codex & API (9. Juli)
Claude Opus 5$5.00$25.001MClaude Pro/Max Standard; API bezahlt
Claude Opus 4.8$5.00$25.001MLegacy-Modell bei Anthropic; Pro/Max/API
Claude Fable 5$10.00$50.001MDauerhaft in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits
Claude Sonnet 5$2.00 Einführung / $3.00 Liste$10.00 Einführung / $15.00 Liste1MClaude Free & Pro Standard; API bezahlt
Claude Sonnet 4.6$3.00$15.001MAPI bezahlt (abgelöst durch Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MEingeschränkte Gemini-App; API bezahlt
Gemini 3.6 Flash$1.50$7.501MGemini-App/AI Studio; kostenlose API-Stufe + bezahlte API
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; kostenlose API-Stufe + bezahlte API
Qwen 3.7 Max$1.25 Promo / $2.50 Liste$3.75 Promo / $7.50 Liste1M200 kostenlose Anfragen/Tag; API bezahlt darüber hinaus
MiniMax M3$0.30 (50 % Rabatt auf $0.60)$1.20 (≤512K)1MOpen weights; Hosting-Kosten fallen an
LongCat-2.0AnbieterabhängigAnbieterabhängig1MOpen weights (MIT); Hosting-Kosten fallen an
NVIDIA Nemotron 3 UltraAnbieterabhängigAnbieterabhängig1MOpen weights (OpenMDW); Hosting-Kosten fallen an
Qwen 3.5 (Open-Weight)Selbst-Host / TogetherSelbst-Host / Together1MOpen weights; Hosting-Kosten fallen an
Nex-N2-ProSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (Apache 2.0); Hosting-Kosten fallen an
Rio 3.5 Open 397BSelbst-Host / AnbieterSelbst-Host / Anbieter1MOpen weights (MIT); Hosting-Kosten fallen an
Grok 4.3$1.25$2.501MKostenloser Consumer-Plan; API bezahlt
Grok 4.5$2.00$6.00500KGrok Build / Cursor / xAI-Konsole; EU teilweise, API-Konsole weiterhin geschlossen
Muse Spark 1.2$1.25 ($0.10 Contributor-Stufe)$4.25 ($0.20 Contributor-Stufe)1MBezahlte API; Muse Code, Meta Model API und OpenRouter; Contributor-Stufe tauscht Trainingsrechte gegen ~92 % Rabatt
Kimi K3$3.00 ($0.30 Cache-Hit)$15.001MKostenlose Basis-Stufe in der Kimi-App; open weights auf Hugging Face (Kimi K3 License)
Gemini Omni Flash (Video)$1.50$17.50 (Video-Output)10-Sekunden-ClipsGemini-App / Flow; AI Studio + API
DeepSeek V4-Pro$0.435 ($0.0036 Cache-Hit)$0.871MDeepSeek Chat kostenlos; API bezahlt
DeepSeek V4-Flash 0731$0.14$0.281MDeepSeek Chat kostenlos; API bezahlt
Kimi K2.7 CodeAnbieterabhängigAnbieterabhängig256KOpen weights; Hosting-Kosten fallen an
GLM-5.2AnbieterabhängigAnbieterabhängig1MOpen weights; Hosting-Kosten fallen an
ERNIE 5.1China-Region-PreiseChina-Region-Preise256KBaidu Gratisversion
Gemini Spark (Agent)Nicht API-bepreistNicht API-bepreist1M (Gemini-Basis)Google AI Ultra $99.99 oder $199.99/Mon.
Fello AI (Aggregator)Über die App geroutetÜber die App geroutetModellabhängig$9.99/Mon., Gratisversion verfügbar

Die oben genannten Raten für GPT-5.5 und GPT-5.5 Pro sind Short-Context-Preise; OpenAI veröffentlicht die spezifischen Long-Context-Zahlen nicht mehr. Die GPT-5.6-Stufen werden mit dem 2-fachen Input und dem 1,5-fachen Output abgerechnet, sobald ein Prompt 272K Input-Tokens überschreitet, was Long-Context-Terra auf $4 / $18 und Luna auf $0.40 / $1.80 bringt. Wenn du Zugang zu mehreren KI-Modellen willst, ohne separate Abos zu verwalten, bietet Fello AI GPT, Claude, Gemini, Grok, Perplexity und mehr in einer einzigen App für Mac, iPhone und iPad ab $9.99/Monat.

Open-Weight-Modelle

Beste Open-Weight-Modelle im August 2026

Das beste Open-Weight-Modell im August 2026 ist Kimi K3, und es übernahm die Führung in dem Moment, in dem Moonshot am 27. Juli 2026 die Gewichte veröffentlichte. Es hält den höchsten Intelligence Index aller offenen Modelle mit 57 auf Artificial Analysis v4.1, sechs Punkte vor GLM-5.2, und auf Arena ist es weiterhin der höchstplatzierte offene Eintrag, auf #2 bei WebDev (1,675.5) hinter nur Claude Opus 5 und #3 auf dem Agent-Board. Ein Haken entscheidet, welches der beiden du tatsächlich verwenden solltest. Der K3-Download besteht aus 96 safetensors-Shards und rund 1,56 TB, was ein Multi-Node-GPU-Cluster statt einer Workstation braucht, und es kommt unter einer eigenen Kimi K3 License statt MIT. Also bleibt GLM-5.2 (Z.ai, MIT) unsere praktische Empfehlung für Teams, die eigene Gewichte betreiben, bei Intelligence Index 51, #6 auf Arena WebDev (1,587.1) und #5 auf dem Agent-Board. Der dritte Platz wechselte am letzten Julitag den Besitzer: DeepSeek V4-Flash 0731 wurde nachtrainiert und sprang von Intelligence Index 40 auf 50, bei $0.14 / $0.28 unter MIT.

ModellAm besten fürSchlüssel-BenchmarkKontext / LizenzWo laufen lassen
Kimi K3Höchstbewertetes open model, agentische und Web-ArbeitII 57 (v4.1), höchster aller open models; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B aktiv1M / Kimi K3 LicenseHugging Face (96 Shards, 1.56 TB), Moonshot API, Anbieter
GLM-5.2Langfristiges agentisches Programmieren, 1M KontextII 51 (v4.1), höchster, den du auf bescheidener Hardware hosten kannst; 744B/40B aktiv1M / MITZ.ai, Hugging Face, OpenRouter
DeepSeek V4-Flash 0731Bester Preis-Leistungs-Wert aller Modelle auf der SeiteII 50 (v4.1), von 40 am 31. Juli; $0.03 pro Index-Aufgabe, 284B/13B aktiv1M / MITDeepSeek API ($0.14/$0.28), lokal
LongCat-2.0Frontier-offener Coder, trainiert auf chinesischen ChipsII 33 (v4.1); 59,5 % SWE-Bench Pro (Anbieter), 1.6T/~48B aktiv1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Günstig multimodal auf Frontier-NiveauII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / Lizenz TBDHugging Face, API $0.30/1M (50 % Rabatt)
Nex-N2-ProStärkster offener Coding-WertII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivQwen-basiert / Apache 2.0Hugging Face, Anbieter, Selbst-Host
Kimi K2.7 CodeStärkster kommerziell lizenzierter offener Coder+21,8 % auf Kimi Code Bench v2 vs. K2.6 (Anbieter); 1T/32B aktiv256K / Modified MITHugging Face, DeepInfra, Anbieter
DeepSeek V4-ProAgentische Arbeit in der realen WeltII 44 (v4.1), 1.6T/49B aktiv1M / MITDeepSeek API ($0.435/$0.87), lokal
Hy3Neuester Kandidat mit permissiver LizenzII 41 (v4.1); #22 auf Arena WebDev (1,516.4)Apache 2.0Hugging Face, Anbieter, Selbst-Host
InklingThinking Machines' erstes open modelII 41 (v4.1), agentisch 32,3, veröffentlicht 15. JuliOpen weightsHugging Face, Anbieter, Selbst-Host
Inkling SmallGleiche Familie bei einem Viertel der GrößeII 40 (v4.1), agentisch 30,8; 276B/12B aktiv, Text, Bild und Audio InputApache 2.0Hugging Face (BF16 und NVFP4), Anbieter, Selbst-Host
NVIDIA Nemotron 3 UltraNVIDIA-abgestimmt, voll permissive LizenzII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktiv1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 Selbst-Host)
Qwen 3.5 (397B / 17B aktiv)Multimodal, schnelles Decoding88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / offenTogether, OpenRouter, lokal
Qwen3.6-35B-A3BEffizienter offener agentischer Coder (3B aktiv)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktiv262K (bis 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, lokal
Qwen3.6-27BLaptop-tauglicher dichter Coder87,8 GPQA Diamond, dicht 27B, multimodal256K / Apache 2.0Lokal Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BQwen-3.5-Fine-tune, mehrsprachiges Reasoning70,8 Terminal-Bench 2.1 (First-Party), schlägt Qwen 3.7 Plus in 4/5397B/17B aktiv / MITHugging Face, Anbieter, Selbst-Host
Llama 4 MaverickFlaggschiff der Meta-Reihe17B aktiv / 400B GesamtparameterLlama 4 LicenseMeta-Cloud, Hugging Face, lokal
NVIDIA Nemotron 3 Nano OmniEdge / Low-PowerMultimodal, sehr kleiner FootprintKompakt / offenLokal, NVIDIA-Tool

Lizenzierung zählt hier ebenso wie der reine Wert: Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) und Nemotron 3 Ultra (OpenMDW) erlauben alle klar die kommerzielle Nutzung, während MiniMax M3 unter seiner eigenen Community-Lizenz kommt und Kimi K3 auf seiner eigenen Custom-Lizenz mit einer Umsatzschwelle für alle sitzt, die es als Service weiterverkaufen. Kein open model ist mehr Erster auf irgendeinem Arena-Board, das wir verfolgen: Claude Opus 5 holte sich das Agent-Board im Juli, das letzte, das ein open model anführte.

Wie wir bewerten

Benchmarks, Preise und Hands-on-Nutzung

Jedes Ranking auf dieser Seite kombiniert drei Eingaben: öffentliche Benchmarks von sieben unabhängigen Häusern (Artificial Analysis, Arena früher LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize und das offizielle Terminal-Bench-2.1-Board, mit Abdeckung der Intelligence- und Agentic-Indizes, GPQA Diamond, ARC-AGI-1 bis 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas und dem Remote Labor Index), veröffentlichte API- und Abo-Preise von der offiziellen Preisseite jedes Anbieters und Hands-on-Nutzung durch das FelloAI-Redaktionsteam, das echte Prompts über dieselbe Aufgabe auf jedem Modell laufen lässt. Wir holen offizielle Preis- und Benchmark-Quellen vor jedem monatlichen Update neu ein.

Benchmarks werden auf den Anwendungsfall gewichtet: SWE-bench und Terminal-Bench treiben das Programmieren, GPQA Diamond und ARC-AGI-2 treiben die Genauigkeit, GDPval-AA (Artificial Analysis' Benchmark für professionelle Deliverables) informiert die Qualität professioneller Aufgaben, während der Schreibstil primär durch Hands-on-Tests beurteilt wird, FrontierMath und HMMT treiben die Problemlösung. Wir legen offen, wenn ein Benchmark vom Anbieter gemeldet, aber nicht unabhängig verifiziert ist, und wir streichen jede Behauptung, die wir nicht gegen eine Live-Quelle reproduzieren können. Wir bewegen keine Kategoriekrone auf der Stärke eines einzelnen Leaderboards, und wo ein neues Modell zu jung ist, als dass die Human-Präferenz-Boards es bewertet hätten, sagen wir das, statt es allein auf Benchmark-Werten zu krönen. Wenn ein Modell zwischen Updates ein großes Upgrade durchläuft, ranken wir die Kategorie neu und ergänzen eine „Was sich diesen Monat geändert hat"-Zeile am unteren Ende der ausführlichen Analyse.

Häufig gestellte Fragen

Häufige Fragen

Was ist das beste KI-Modell gerade jetzt im August 2026?
Es hängt von der Aufgabe ab. Beim Gesamt-Benchmark-Wert ist Claude Opus 5 (24. Juli) #1 auf Artificial Analysis' Intelligence Index mit 61 und seinem Agentic Index mit 55,3, und Arena hat es jetzt an die Spitze von vier seiner Boards gesetzt, einschließlich beider Coding-Boards. Für den täglichen Chat ist GPT-5.6 seit 9. Juli ChatGPTs Standard und der Assistent, den die meisten Menschen tatsächlich öffnen können, obwohl Claude Fable 5 Arenas Text-Leaderboard anführt. Fürs Programmieren ist Claude Opus 5 #1 auf Arenas WebDev- (1,702.9) und image-to-WebDev-Boards (1,668.6) zum halben Preis von Fable 5. Fürs Schreiben ist Claude Fable 5 #1 auf Arenas Text-Leaderboard (1508.6), Humanity's Last Exam (53,3 %) und AA-Omniscience (40). Für die Genauigkeit zieht Gemini 3.1 Pro mit dem menschlichen Panel auf ARC-AGI-1 mit 98 % für $0.52 pro Aufgabe gleich. Für schwere Mathematik und Reasoning ist GPT-5.6 Sol #1 auf LiveBench Mathematics, LiveBench Reasoning und ARC-AGI-2. Für Bilder führt ChatGPT Images 2.0 beide Boards an, und für Video führt Gemini Omni Flash beide an. Für Agenten ist Gemini Spark der 24/7-Cloud-Agent und Claude Cowork der Desktop-Agent.
Was ist Claude Opus 5?
Claude Opus 5 ist Anthropics neuestes Flaggschiff, veröffentlicht am 24. Juli 2026, und das aktuelle #1-Modell auf Artificial Analysis. Es führt sowohl den Intelligence Index mit 61 als auch den Agentic Index mit 55,3 an und führt das GDPval-AA v2 Board für professionelle Deliverables mit 1858 an, deutlich vor den 1746 von Claude Fable 5. Die API-Preise liegen bei $5 / $25 pro 1M Tokens, dieselben wie Opus 4.8 und halb so teuer wie Fable 5, mit einem Kontextfenster von 1M Tokens und einem Wissensstand von Mai 2026. ARC Prize bestätigt unabhängig Anthropics Launch-Behauptung zu ARC-AGI-3, wo Opus 5 30 % gegen 8 % für das nächstbeste Modell erzielt, rund 3,75-mal. Arena hat es seither bewertet und setzt es auf #1 bei WebDev, image-to-WebDev, Document und dem Agent-Board sowie auf #6 beim Text, und das brachte ihm die Programmierkrone ein. Eine Sache zum Bedenken: Artificial Analysis misst seine Halluzinationsrate mit 50 %, weshalb es auf dieser Seite keine Genauigkeitskrone hält.
Ist Claude Fable 5 zurück?
Ja. Anthropic setzte Claude Fable 5 am 1. Juli 2026 wieder ein, nachdem die US-Regierung die Exportkontrollbeschränkung aufgehoben hatte, die sie am 12. Juni verhängt hatte. Es ist wieder auf der Claude API, Claude.ai, Claude Code und Claude Cowork verfügbar. Anthropic machte Fable 5 am 20. Juli 2026 in den bezahlten Plänen dauerhaft. Max und Team Premium enthalten es bei rund 50 % der regulären Nutzungslimits; Pro und Team Standard erreichen es über Nutzungscredits mit einem einmaligen Startguthaben von $100. Die API-Preise liegen bei $10 / $50 pro Million Tokens. Fable 5 ist ein Modell der Mythos-Klasse, gebaut für langfristige agentische Arbeit mit einem Kontext von 1M Tokens, und es ist der Zweitplatzierte fürs Programmieren hinter Claude Opus 5, auf #2 von Arenas image-to-WebDev-Board (1,625.7) und #4 auf WebDev.
Was ist GPT-5.6 und kann ich es nutzen?
Ja, seit dem 9. Juli 2026. GPT-5.6 ist OpenAIs Modellfamilie der nächsten Generation, und nach einer zweiwöchigen geschlossenen Vorschau, die am 26. Juni hinter einer Sicherheitsprüfung der US-Regierung begann, erreichte es am 9. Juli die allgemeine Verfügbarkeit. Es gibt drei Stufen, vom wenigsten zum leistungsstärksten: Luna, die schnelle, günstigste Stufe ($0.20 / $1.20 pro 1M Tokens); Terra, ein ausgewogenes Alltagsmodell, von dem OpenAI sagt, es entspreche GPT-5.5 ($2 / $12); und Sol, das Flaggschiff, abgestimmt auf Biologie, Chemie und Cybersicherheit ($5 / $30). OpenAI senkte Luna um 80 % und Terra um 20 % am 30. Juli 2026 und ließ Sol und jeden ChatGPT-Abopreis unangetastet. Es ist jetzt live über ChatGPT, Codex und die API als OpenAIs Standardmodell. Ein Vorbehalt: OpenAIs System Card und der externe Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, also behandle es bei faktischer Arbeit mit hohem Einsatz vorsichtig, bis sich unabhängige Ergebnisse festigen.
Ist Grok 4.5 schon draußen?
Ja. xAI veröffentlichte Grok 4.5 öffentlich am 8. Juli 2026, sein erstes Flaggschiff, seit SpaceX das Unternehmen übernommen hat und als SPCX an die Börse ging. Elon Musk beschreibt es als „ein Modell der Opus-Klasse, aber schneller, token-effizienter und günstiger". Es ist Cursor-trainiert und auf Programmieren und agentische Arbeit ausgerichtet, mit einem Preis von $2 / $6 pro 1M Tokens bei einem Kontextfenster von 500K Tokens. Es ist live in Grok Build, Cursor auf allen Plänen und der xAI-Konsole. Der EU-Zugang begann sich nach einer Ankündigung vom 16. Juli auszurollen und ist noch teilweise, wobei Cursor Verfügbarkeit meldet, während xAIs API-Konsole für EU-Nutzer geschlossen bleibt. Artificial Analysis bewertet es mit Intelligence Index 54 auf v4.1, gleichauf mit dem Feld auf Terminal-Bench 2.1 (83,3 %), aber zurückliegend auf SWE-Bench Pro mit 64,7 %, also ist es der Preis-Leistungs-Tipp statt des klaren Benchmark-Führers. Grok 4.5 ist auch unser Kreativitäts-Tipp, aus Produktgründen statt Qualität, da es auf #33 bei EQ-Bench Creative Writing sitzt; für den bestgeschriebenen Output gewinnt Claude Fable 5 klar.
Welche KI ist die beste zum Programmieren?
Claude Opus 5 ist die beste zum Programmieren, und es gewinnt die beiden Boards, wo Entwickler über das Ergebnis abstimmen statt ein Harness ein Skript laufen zu lassen: #1 auf Arenas WebDev-Board (1,702.9) und #1 bei image-to-WebDev (1,668.6), zu den Abstimmungsstichtagen 1. August und 31. Juli. Es läuft mit $5 / $25 pro 1M Tokens, halb so viel wie Claude Fable 5, und Anthropics eigene Dokumentation rät, für komplexes agentisches Programmieren mit Opus 5 zu beginnen. Claude Fable 5 ist der Zweitplatzierte für die schwerste Long-Horizon-Arbeit auf #2 image-to-WebDev und #4 WebDev, und Kimi K3 ist der Kandidat auf #2 bei WebDev (1,675.5). Beachte, dass Artificial Analysis' Coding Index kein Claude-Durchmarsch ist: GPT-5.6 Sol (xhigh) führt ihn mit 78,3 an, mit Opus 5 bei 78,0, nah genug für einen Gleichstand. DeepSeek V4-Flash 0731 ist der Preis-Leistungs-Tipp bei $0.14 / $0.28, und GLM-5.2 (MIT) ist der beste Open-Weight-Coder, den du selbst hosten kannst.
Welche KI ist die beste zum Schreiben?
Claude Fable 5 ist die beste zum Schreiben, und es ist das einzige Modell in den Top drei aller drei unabhängigen Schreib-Boards: #1 auf Arena Creative Writing, #1 auf LiveBench Language (90.7) und #3 auf EQ-Bench Creative Writing v3. Es kostet $10 / $50 pro 1M Tokens. Claude Sonnet 5 ist der Preis-Leistungs-Tipp und das, was die meisten tatsächlich verwenden sollten, da es kostenlos und Standard auf claude.ai bei $2 / $10 Einführungspreis ist, obwohl es auf #53 bei Arena Creative Writing rangiert. Kimi K3 gewinnt EQ-Bench klar mit 2377, wenn du markante Fiktion willst, Claude Opus 5 führt das GDPval-AA v2 Board für professionelle Deliverables mit 1858 an, GPT-5.5 ist die Alternative für faktenbasiertes Business-Schreiben, und Gemini 3.6 Flash ist der Preis-Leistungs-Tipp für Masseninhalte.
Was ist das beste Open-Weight-KI-Modell 2026?
Kimi K3 ist gerade jetzt das beste Open-Weight-Modell, und das ist es, seit Moonshot am 27. Juli 2026 die Gewichte veröffentlichte. Es hat den höchsten Intelligence Index aller open models mit 57 auf Artificial Analysis v4.1, und auf Arena ist es #2 bei WebDev und #3 auf dem Agent-Board. Der Haken ist, dass es 96 Shards und rund 1,56 TB unter einer eigenen Kimi K3 License ist, also bleibt GLM-5.2 (13. Juni, MIT) das Modell, das die meisten Teams tatsächlich hosten können, bei Intelligence Index 51 und #6 auf Arena WebDev. Dritter ist DeepSeek V4-Flash 0731, das am 31. Juli von Intelligence Index 40 auf 50 sprang, ohne Preis, Größe oder Lizenz zu ändern, was es zum besten Preis-Leistungs-Wert im open field bei $0.14 / $0.28 unter MIT macht. Ehrlicherweise wissenswert: Kein open model ist mehr Erster auf irgendeinem Arena-Board, das wir verfolgen.
Was ist das günstigste KI-Modell auf Frontier-Niveau?
Bei den API-Preisen pro Million Tokens ist GPT-5.6 Luna jetzt das günstigste geschlossene Modell auf Frontier-Niveau bei $0.20 / $1.20, nachdem OpenAI es am 30. Juli 2026 um 80 % gesenkt hat, und Artificial Analysis bewertet es mit Intelligence Index 51, einen Punkt über Gemini 3.6 Flash. Noch günstiger ist DeepSeek V4-Flash 0731 bei $0.14 / $0.28, jetzt unser Preis-Leistungs-Tipp: Es erreicht Gemini 3.6 Flashs Intelligence Index von 50 und kostet $0.03 pro Index-Aufgabe gegen die $0.56 von Flash, unter einer MIT-Lizenz, die du selbst hosten kannst. MiniMax M3 wird jetzt mit $0.30 pro Million Input-Tokens auf einem dauerhaften 50-%-Rabatt gelistet, mit LongCat-2.0 als starker MIT-Alternative. Qwen 3.7 Max bei $1.25 / $3.75 auf seiner aktuellen Promo ist der Preis-Leistungs-Tipp bei Intelligence Index 46, obwohl Luna es jetzt bei Preis und Wert unterbietet.
Welche KI-Modelle sind kostenlos?
ChatGPT Free verwendet jetzt standardmäßig GPT-5.6 (mit weiterhin verfügbarem GPT-5.5) unter Nutzungslimits. Gemini Free lässt Gemini 3.6 Flash in der Gemini-App und Google AI Studio laufen. Claude Free lässt Claude Sonnet 5 (den neuen Standard) mit täglichen Limits laufen. DeepSeek Chat lässt DeepSeek V4 kostenlos auf der DeepSeek-Website laufen. Grok hat einen begrenzten kostenlosen Consumer-Plan (X Premium ist ein bezahltes Add-on). Qwen 3.5, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4 und GLM-5.2 sind Open-Weight und kostenlos selbst zu hosten. Qwen 3.7 Max ist nur API ohne Consumer-Chat-Frontend, aber Alibaba enthält jetzt 200 kostenlose Modellanfragen pro Tag. Kimi hat eine kostenlose Basis-Stufe in seiner App, mit abgerechneter intensiverer agentischer Nutzung.
Was ist Gemini Spark und ist es $99.99/Monat wert?
Gemini Spark ist Googles erster rund um die Uhr in der Cloud residierender KI-Agent, gestartet auf der Google I/O am 19. Mai 2026 und exklusiv für den Google-AI-Ultra-Plan, den Google so umstrukturiert hat, dass er eine Einstiegsstufe zu $99.99/Monat und eine Top-Stufe zu $199.99/Monat enthält. Spark ist auf Gemini-Basismodellen mit Googles Antigravity-Harness auf einer Google-Cloud-VM gebaut, integriert sich mit Gmail, Google Docs und anderen Google-Workspace-Apps und kann auf der Geräteseite mit Chrome und Androids Halo-System interagieren. Es ist die Ausgabe wert für Nutzer, die wiederholbare, langlaufende Workflows haben (Posteingangs-Triage, Recherche-Zusammenfassungen, geplante Aufgaben). Für einmalige Aufgaben deckt Claude Cowork zu $20/Monat die meisten Desktop-Agenten-Bedürfnisse ab.
Was ist Fello AI?
Fello AI ist ein KI-Chatbot für Mac, iPhone und iPad, mit dem du alle Top-KI-Modelle wie ChatGPT, Claude, Gemini, Grok und DeepSeek in einer App nutzen kannst, mit regelmäßig aktualisierten Modellen, sodass du immer die neuesten hast. Es kostet $9.99/Monat mit einer 4,7-Sterne-Bewertung über 27.000+ Rezensionen.
Wie oft aktualisiert ihr diese Seite?
Wir aktualisieren diese Seite mindestens monatlich und innerhalb von 24-48 Stunden nach jedem größeren Modellstart.
Verwandte Artikel

Probiere jedes Modell.
Eine schöne App.

Jedes Modell aus diesem Leitfaden in einer nativen App: ChatGPT, Claude, Gemini, Grok und DeepSeek. Kostenlos starten.

Fello AI auf Mac, iPad und iPhone

4,7 Bewertung·27.000+ Rezensionen·Kostenlos starten