OpenAI je opět pod skutečným tlakem. Na konci roku 2025 Gemini 3 od Googlu a Claude Opus 4.5 od Anthropicu uzavřely to, co bývalo pohodlným náskokem ve výkonu. Benchmarky se přiblížily. Nálada uživatelů se změnila. Poprvé po letech nebyla OpenAI jednoznačným lídrem zároveň v uvažování, programování a běžné použitelnosti.

Jen pár týdnů po GPT-5.1 (a pouhé dva měsíce po GPT-5.0) OpenAI vydala GPT-5.2. Podle několika zpráv za tím uvnitř firmy stál moment zvaný „Code Red“: plošná snaha zlepšit konkurenceschopnost ChatGPT poté, co Gemini 3 začal v několika interních i externích hodnoceních překonávat modely OpenAI.

Na papíře vypadá GPT-5.2 jako velké vítězství. V několika sledovaných benchmarcích dosahuje nejlepších výsledků nebo se jim vyrovná. Přináší výrazné zlepšení ve vyhledávání v dlouhém kontextu, autonomii při programování, generování tabulek a prezentací a v agentních úlohách. OpenAI ji prezentuje jako „nejschopnější řadu modelů, jaká kdy vznikla pro profesionální znalostní práci“.

Reakce uživatelů je ale nezvykle negativní. Na Redditu, síti X, ve vývojářských fórech i v nezávislých hodnoceních se objevuje stejný vzorec: GPT-5.2 je výkonný, pomalý, strnulý a v komunikaci hluboce nepříjemný. Řada uživatelů ho popisuje jako chladnější, cenzurovanější a v běžném provozu méně spolehlivý než GPT-5.1, přestože je v úzkých, měřitelných úlohách objektivně silnější.

https://twitter.com/theo/status/1999985196901540205

Slib – „největší vydání od GPT-5“

Pozice, do níž OpenAI GPT-5.2 staví, je jednoznačná. Podle firmy jde o motor produktivity pro profesionální práci: tabulky, prezentace, kódové báze, dlouhé dokumenty, volání nástrojů a vícekrokové projekty.

Klíčovou metrikou je GDPval, benchmark, který OpenAI navrhla k měření toho, jak často lidé dávají výstupu AI přednost před prací lidských profesionálů u přesně zadaných znalostních úloh.

Podle OpenAI GPT-5.2 Thinking poráží lidské experty nebo se jim vyrovná v 70,9 % případů napříč 44 profesemi, a to za zhruba 1 % nákladů a 11× rychleji než člověk. To je dramatický skok oproti udávaným 38,8 % u GPT-5.1.

Rozšířila se také nabídka modelů:

  • GPT-5.2 Instant – rychlý, odlehčený, agresivně optimalizovaný
  • GPT-5.2 Thinking – vyšší úsilí při uvažování, pomalejší, hlubší analýza
  • GPT-5.2 Pro – maximální uvažování, cena nastavená pro firmy
  • GPT-5.2 Pro (Extended) – extrémně hluboké uvažování, velmi vysoká odezva i cena

Toto rozdělení má význam. Řada stížností nesměřuje k rodině modelů jako celku, ale k tomu, jak automatické směrování a přepínání režimů ovlivňuje reálné používání uvnitř ChatGPT. Uživatelé často nevědí, který dílčí model jejich dotaz zpracoval, ani proč se chování uprostřed konverzace změnilo.

Gemini 3 i Claude Opus 4.5 na konci roku 2025 výrazně posílily. Gemini se zlepšil v multimodálním uvažování a generování uživatelských rozhraní. Claude si udržel prvenství v rychlosti, tónu a běžné použitelnosti. GPT-5.2 byl pokusem OpenAI rychle si zpět vydobýt technickou nadvládu.

Benchmarky neodpovídají realitě

Od vydavatele

Každý AI model v jedné aplikaci

Fello AI přináší GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 a další v jedné nativní aplikaci pro Mac a iPhone.

Stáhnout hned!

Hlavní kritika GPT-5.2 nezní, že by byl slabý. Zní, že působí přeoptimalizovaně na úspěch v benchmarcích. Nezávislí testeři i uživatelé hlásí rostoucí propast mezi tím, jak si GPT-5.2 vede v čistých, přesně zadaných hodnoceních, a tím, jak se chová v nepřehledném provozu reálného světa. Projevuje se to několika způsoby.

Vybrané výsledky benchmarků [zdroj]

Velké množství zpětné vazby popisuje GPT-5.2 jako:

  • Chladný
  • Přehnaně formální
  • Hašteřivý
  • Poslušný pravidlům
  • Citově plochý

Řada uživatelů výslovně říká, že o žádnou změnu osobnosti nežádali. GPT-5.1 se mírně přiblížil konverzačnímu tónu podobnému Claude. GPT-5.2 tento posun otočil zpět. Výsledek působí náhle, zejména na uživatele, kteří neprogramují.

Vlastní systémová karta OpenAI přiznává propady kvality v režimu Instant oproti GPT-5.1. Uživatelé opakovaně hlásí, že GPT-5.2 Instant působí „hloupěji“ než model, který nahradil, zejména v jemných nuancích psaní, překladu, kreativních úlohách a v konzistenci navazujících odpovědí,… To posiluje dojem, že GPT-5.2 je horší, i když režimy Thinking nebo Pro starší modely překonávají.

GPT-5.2 se silně spoléhá na automatické směrování modelů. V praxi to znamená:

  • Na složitý dotaz může odpovědět slabší dílčí model
  • Jednoduchý navazující dotaz může náhle spustit náročné uvažování
  • Chování se může uprostřed vlákna změnit bez vysvětlení

Pro produkční nasazení je tato nepředvídatelnost škodlivá. Jak to shrnul jeden vývojář: „Produkty nevydávají benchmarky. Vydává je spolehlivost.“

Cenzura, odmítání a atmosféra „compliance“

Další velkou osou kontroverze je cenzura. Několik nezávislých testerů uvádí, že GPT-5.2 je aktuálně nejvíce cenzurovaný dostupný špičkový model. V benchmarku Sansa se GPT-5.2 Thinking řadí jako nejrestriktivnější testovaný model, co do četnosti odmítání předčí Claude i Gemini.

Stížnosti uživatelů mají společný vzorec:

  • Odmítání u zjevně nekontroverzních promptů
  • Dlouhé bezpečnostní preambule místo přímé odpovědi
  • Tón popisovaný jako „firemní školení compliance“

OpenAI je v obtížné pozici. Uvolnění pojistek riskuje zneužití, regulatorní tlak a poškození značky. Jejich utažení riskuje odcizení uživatelů.

Problém není v tom, že by GPT-5.2 byl bezpečnější. Je v tom, že jeho pravidla často působí nekonzistentně a bez vysvětlení. Když stejný prompt jeden den funguje a druhý den selže, důvěra se rychle vytrácí.

Jak to vyjádřil jeden recenzent: komunikace s GPT-5.2 není zábavná. Působí svázaně, napjatě a nešťastně, a tuto napjatost cítí i uživatelé.

U úloh, kde záleží na kreativitě, zkoumání nebo tónu, je to zásadní problém. U ryze faktické nebo technické práce to řada uživatelů toleruje.

Širší obraz krajiny AI

GPT-5.2 existuje ve velmi jiné krajině AI než GPT-4, a právě tento kontext vysvětluje, proč „vyhrát benchmarky“ už automaticky neznamená „vyhrát uživatele“.

V roce 2025 se vývoj špičkové AI zrychlil na několika frontách zároveň.

Zaprvé, ve výstupu špičkových modelů dnes dominuje průmysl. Podle Stanford AI Index 2025 pocházelo v roce 2024 z průmyslu téměř 90 % významných modelů AI, prudký nárůst oproti zhruba 60 % o rok dříve. OpenAI už nesoutěží hlavně s výzkumnými laboratořemi, ale s hyperscalery, výrobci čipů a dobře financovanými firmami zaměřenými na AI, které dodávají vysokým tempem.

Zadruhé, křivka škálování se nezploštila. Stejná zpráva ukazuje, že se výpočetní výkon použitý na trénování zhruba každých pět měsíců zdvojnásobuje, spolu s rychlým růstem velikosti datových sad a spotřeby energie. To vysvětluje, proč modely jako Gemini 3, Claude Opus 4.5 a GPT-5.2 dokážou přinést citelné zlepšení během pár týdnů od sebe, ale zároveň proč jsou tato zlepšení stále více přírůstková než převratná.

Zatřetí, rozdíl ve výkonu mezi špičkovými modely se propadl. AI Index uvádí, že rozdíl mezi modelem na 1. a 10. místě je u řady benchmarků dnes zhruba 5,4 % a rozdíl mezi dvěma nejlepšími modely může být jen 0,7 %. Na této úrovni hraje statistický šum, kolísání promptů a návrh hodnocení téměř stejně velkou roli jako samotné schopnosti. Vnímání uživatelů tak čím dál víc určují UX, výchozí nastavení, rychlost a spolehlivost.

Geograficky stále vedou Spojené státy v celkovém počtu špičkových modelů, s 40 významnými modely vydanými v roce 2024 oproti 15 z Číny a jen hrstce z Evropy. Čínské laboratoře se ale v benchmarcích jako MMLU a HumanEval přiblížily téměř na stejnou úroveň a celkovým trendem je spíše sbližování než nadvláda. Špička oboru je přeplněná, rychle se mění a nic neodpouští.

Proto je přijetí GPT-5.2 paradoxní.

OpenAI si oprávněně může nárokovat prvenství ve vyhledávání v dlouhém kontextu, agentním programování, generování tabulek a prezentací a strukturovaných profesionálních úlohách, tedy přesně v oblastech zdůrazněných v oznámení GPT-5.2. Na papíře tak nabízí přesně to, co firmy chtějí.

Na trhu, kde jsou špičkové modely namačkané těsně u sebe, si ale lidé už nevybírají „ten nejchytřejší model“. Vybírají si:

  • nejrychlejšího každodenního pomocníka
  • nejpředvídatelnějšího asistenta
  • toho, se kterým je nejméně tření
  • toho, se kterým je práce baví

Proto řada uživatelů stále volí jako výchozí Claude Opus 4.5 pro psaní a běžnou práci, nebo Gemini 3 pro úlohy náročné na uživatelské rozhraní a multimodalitu, i když je GPT-5.2 ve vybraných benchmarcích poráží.

Strategická realita: GPT-5.2 jednoznačně vyhrává určitá hodnocení, ale u řady uživatelů prohrává pozici výchozího asistenta. V roce 2025 na tomto rozdílu záleží víc než kdy dřív.

OpenAI si toto napětí zjevně uvědomuje. Veřejná vyjádření i reporty naznačují, že je GPT-5.3 už v plánu, s výslovným zaměřením na rychlost, osobnost a propady v použitelnosti. Code Red nebyl jen o vydání GPT-5.2, šlo o to zůstat relevantní ve světě, kde už samotná syrová inteligence nestačí. OpenAI od té doby toto období daleko předstihla a v červnu 2026 vydala GPT-5.6 jako tříčlennou rodinu modelů Sol, Terra a Luna.

Závěr

GPT-5.2 není špatný model. Je to vysoce specializovaný model. Na papíře přináší skutečný pokrok: silnější práci s dlouhým kontextem, lepší agentní programování, vylepšené strukturované výstupy a silný výkon v benchmarcích. U náročných profesionálních úloh, kde na hloubce a správnosti záleží víc než na rychlosti nebo tónu, může být GPT-5.2 správným nástrojem.

Benchmarky už ale nestačí. V běžném provozu řada uživatelů vnímá GPT-5.2 jako pomalý, strnulý, přehnaně cenzurovaný a kvůli směrování a přepínání režimů nepředvídatelný. Jeho osobnost a vzorce odmítání aktivně překážejí při psaní, brainstormingu i běžné pomoci. V přeplněné špičce oboru, kde se nejlepší modely liší jen o pár procentních bodů, o rozšíření rozhodují právě tyto detaily UX.

GPT-5.2 jednoznačně vyhrává určitá hodnocení, ale u řady uživatelů prohrává roli výchozího asistenta. OpenAI si to zjevně uvědomuje. GPT-5.2 tak působí méně jako definitivní odpověď a víc jako provizorní řešení pod konkurenčním tlakem. Zda OpenAI znovu nabere dynamiku, bude záležet na tom, jestli si další vydání udrží inteligenci a zároveň opraví uživatelský zážitek.