AI model PewDiePie dosáhl 39 % na benchmarku Aider Polyglot a překonal GPT-4o (23,1 %) a Gemini 2.0 Pro Exp (35,6 %) v kódovacím testu hojně využívaném v AI výzkumu. Pensionovaný YouTuber Felix Kjellberg strávil měsíce budováním domácí GPU sestavy za $41 000, studiem vědeckých prací o strojovém učení a broušením přes neúspěšné trénovací běhy, než se mu to podařilo. Celou cestu zveřejnil ve videu vydaném 26. února 2026.

Tohle není PewDiePie, jak bezmyšlenkovitě žádá ChatGPT o napsání kódu. Postavil pracovní stanici s 10 GPU, scrapoval GitHub pro trénovací data, generoval syntetické datové sady pomocí DeepSeek API a doladil Qwen 32B, open source model s 32 miliardami parametrů. Výsledkem je skutečný projekt fine-tuningu AI, který by mnoho profesionálních ML inženýrů uznalo jako legitimní práci, byť zasazenou do příběhu o napájecích konektorech, které málem zapálily jeho dům.

Klíčové body

– Doladěný model PewDiePie dosáhl 39 % na Aider Polyglot a překonal GPT-4o (23,1 %) a Gemini 2.0 Pro Exp (35,6 %)
– Jako základní model použil Qwen 32B a doladil ho na vlastních kódovacích datech, netrénoval od nuly
– Domácí AI sestava stála přibližně $41 000 s 10 GPU a 424 GB VRAM
– Cesta benchmarkem vedla od 8 % až na 39 % napříč měsíci selhání a závažnou krizí kontaminace
– Průlom přineslo použití DeepSeek API pro generování vysoce kvalitních syntetických trénovacích dat

Čím AI model PewDiePie skutečně je

Od vydavatele

Každý AI model v jedné aplikaci

Fello AI přináší GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 a další v jedné nativní aplikaci pro Mac a iPhone.

Stáhnout hned!

Buďme přesní, protože většina médií to není. PewDiePie netrénoval velký jazykový model od nuly. Provedl fine-tuning modelu Qwen 32B, stávajícího open source modelu vyvinutého Alibabou, který byl již silný v kódovacích úkolech.

Fine-tuning znamená vzít model, který již byl trénován na obrovském množství dat, a pokračovat v jeho trénování na specifické, kurátorované datové sadě, aby se vylepšil výkon na užším úkolu. Jde o standardní a hojně využívanou techniku v profesionálním vývoji AI. Firmy a výzkumníci ji neustále používají k tomu, aby vzali open source základní modely a specializovali je pro svůj případ použití.

Co dělá projekt PewDiePie pozoruhodným, je rozsah úsilí, přísnost, kterou aplikoval při komplikacích, a konečný výsledek. Nejen zadával dotazy chatbotu, ale budoval a iteroval trénovací pipeline.

Hardwarová sestava

PewDiePie sestavil pracovní stanici, o jejíž stavbě by většina jednotlivců nikdy neuvažovala:

Komponenta Specifikace
GPU 8x modifikovaná RTX 4090 (48 GB VRAM každá) + 2x RTX 4000 Ada
Celková VRAM 424 GB
Odhadované náklady ~$41 000

Svou lokální AI sestavu přezdil ChatOS, vlastní rozhraní pro provoz a experimenty s lokálními modely. Hardware mu poskytuje paměťovou kapacitu pro provoz a fine-tuning modelů, které by jinak vyžadovaly cloudový výpočetní výkon.

Jak si AI model PewDiePie stojí na Aider Polyglot

Co je benchmark Aider Polyglot?

Benchmark Aider Polyglot testuje AI modely na 225 náročných programovacích cvičeních z Exercism v šesti jazycích: C++, Go, Java, JavaScript, Python a Rust. Každý model dostane dva pokusy na každý problém a skóre je procento cvičení, ve kterých projdou všechny testy. Na rozdíl od SWE-Bench, který se zaměřuje na opravy chyb v Pythonu v úzké sadě repozitářů, Aider Polyglot testuje schopnost modelu psát a integrovat funkční kód napříč různorodými, vícejazyčnými projekty.

Zde je, jak si model PewDiePie stojí oproti ostatním modelům na aktuálním žebříčku:

Model Skóre Aider Polyglot Poznámky
GPT-5 88,0 % Aktuální špička
Gemini 2.5 Pro Preview 83,1 % Špičková úroveň
GPT-4.1 52,4 % Nad PewDiePiem
Model PewDiePie 39 % Fine-tune Qwen 32B
Gemini 2.0 Pro Exp 35,6 % Překonán
GPT-4o 23,1 % Překonán
GPT-4o mini 3,6 % Překonán s velkým náskokem

*(Skóre z žebříčku Aider Polyglot na aider.chat, únor 2026)*

Jeho model leží hluboko pod současnými špičkovými výkony, které dosahují 80–88 %. Pohodlně však překonává jak GPT-4o, tak Gemini 2.0 Pro Exp, což byl přesně jeho záměr. Původní cíl na začátku projektu bylo skóre GPT-4o tehdy 16 % na benchmarku, takže jeho konečný výsledek více než zdvojnásobil počáteční cíl.

Cesta skórem: od 8 % na 39 %

Tady příběh nabývá opravdové zajímavosti. Cesta PewDiePie k 39 % nebyla přímá. Zde je celý postup:

  1. 8 % — Základní Qwen 32B testovaný ve špatném výstupním formátu. Model byl schopný, ale odpovídal ve formátu, který benchmark nedokázal správně vyhodnotit.
  2. 16 % — Po přechodu na správný formát a raném fine-tuningu na datech scrapovaných z GitHubu. Toto odpovídalo jeho původnímu cíli na GPT-4o.
  3. ~19,6 % — Jeden běh dosáhl tohoto skóre při experimentech se syntetickými daty ve stylu Magicoder, ale výsledek se nedal konzistentně reprodukovat.
  4. 4,4 % — Katastrofa. PewDiePie zjistil, že trénoval na špatném základním modelu a jeho benchmarková data byla kontaminována. Model si zapamatovával testovací data místo toho, aby se naučil kódovat. Musel začít od nuly.
  5. 25,3 % — Po opravě základního modelu a přetrénování od nuly.
  6. 36 % — Po správném spuštění celého benchmarku (třetina z něj předtím nebežela).
  7. 39 % — Po aplikaci post-trénovacích vylepšení pomocí syntetických dat generovaných přes DeepSeek API.

Kontaminace benchmarku, kdy se trénovací data modelu překrývají s testovacími daty a uměle navyšují skóre, je reálný a běžný problém ve výzkumu ML. To, že PewDiePie tento problém identifikoval, diagnostikoval ho a opravil směr místo zveřejnění nafouklého čísla, je část příběhu, kterou stojí za to brát vážně.

Datový průlom: syntetická trénovací data přes DeepSeek

Zlomovým bodem projektu PewDiePie byla kvalita dat, nikoli výpočetní výkon. Po přečtení výzkumného článku Magicoder, který ukázal, jak generovat vysoce kvalitní kódovací příklady synteticky místo jejich scrapování z GitHubu, začal používat DeepSeek API k produkci trénovacích dat ve velkém měřítku.

Modely DeepSeek jsou silné v generování kódu, takže jsou užitečné pro produkci příkladů, které mohly naučit jeho fine-tune řešit programovací problémy ve správném formátu. Pokud chcete vědět více o tom, proč se DeepSeek stal tak významným hráčem v open source AI, podrobně jsme popsali průlom DeepSeek-R1 v open source.

Klíčový poznatek z Magicoderu: pokud nemůžete najít dostatek vysoce kvalitních příkladů úkolu, který chcete vylepšit, generujete je pomocí schopného modelu. Riziko spočívá v tom, že špatná syntetická data výkon degradují místo zlepšení, což se přesně stalo v dřívějších bězích PewDiePie, než zdokonalil pipeline. Správné nastavení syntetických dat vyžadovalo více neúspěšných pokusů a teprve kombinace se správným základním modelem a správným formátem benchmarku vše dala dohromady.

Co to znamená pro AI v roce 2026

Projekt PewDiePie je pozoruhodnou ilustrací toho, jak dostupný se fine-tuning AI stal. Jeho model předčí Gemini 2.0 Pro Exp na reálném kódovacím benchmarku. To je pozoruhodné nikoli proto, že dokazuje, že nadšenci mohou nahradit frontierové laboratoře, ale proto, že ukazuje, jak daleko dokáže cílený fine-tuning posunout open source model.

Aktuální nejlepší AI modely pro kódování v roce 2026 dosahují 80–88 % na Aider Polyglot. Model PewDiePie na 39 % na této úrovni nesoutěží. Jeho benchmarkově specifický fine-tuning však vytvořil model, který překonává univerzální verze GPT-4o a Gemini 2.0 Pro Exp. Tato mezera mezi doladěným specialistou a univerzálním modelem je přesně to, co celé odvětví objevuje, jak se přesouvá k menší, úkolem specifické AI.

Fine-tuning open source modelů na cílených datových sadách se stává jedním z nejnákladově efektivnějších způsobů, jak budovat schopné, specializované AI nástroje. PewDiePie narazil na techniku, kterou mnoho AI firem již nasazuje ve velkém měřítku. Rozdíl je v tom, že každé selhání dokumentoval veřejně a tím nejzábavnějším způsobem.

Závěr

AI model PewDiePie je lepším příběhem, než mu většina médií dává za pravdu. Zahrnuje reálné ML techniky, reálná selhání, skutečnou dramu s kontaminací benchmarku a reálný konečný výsledek. Jeho doladěný model Qwen 32B dosáhl 39 % na Aider Polyglot, benchmarku používaném AI výzkumníky k hodnocení kódovacích schopností, čímž překonal GPT-4o a Gemini 2.0 Pro Exp. Nesoutěží s frontierovými laboratořemi a jako první to uznává: projekt byl v konečném důsledku benchmaxxing, nikoli obecný AI výzkum.

Pokud chcete přesně sledovat, jak si modely stojí na kódovacích benchmarcích, žebříček Aider Polyglot na aider.chat se pravidelně aktualizuje a je jedním z nejužitečnějších veřejných zdrojů pro porovnávání kódovacích schopností AI.

Časté dotazy

Trénoval PewDiePie skutečně vlastní AI model?

Doladil existující open source model Qwen 32B. Fine-tuning je standardní technika vývoje AI, při níž se předem trénovaný model dále trénuje na vlastních datech za účelem zlepšení výkonu u konkrétních úkolů. Nevytvářel ani netrénoval model od nuly.

Jakého skóre dosáhl PewDiePie na AI benchmarku?

Jeho model dosáhl 39 % na benchmarku Aider Polyglot, který testuje kódovací schopnosti na 225 cvičeních v C++, Go, Java, JavaScript, Pythonu a Rustu. GPT-4o dosahuje 23,1 % na stejném benchmarku a Gemini 2.0 Pro Exp 35,6 %.

Překonal PewDiePie GPT-4o?

Ano, konkrétně na benchmarku Aider Polyglot. GPT-4o dosahuje 23,1 % a jeho model 39 %. GPT-4o je však univerzální model a jeho fine-tune byl specificky optimalizován pro tento kódovací benchmark. Špičkové modely jako GPT-5 dosahují na stejném testu 88 %.

Kolik stála AI sestava PewDiePie?

Přibližně $41 000. Sestava zahrnuje 10 GPU: 8 modifikovaných RTX 4090 s 48 GB VRAM každá a 2 karty RTX 4000 Ada, celkem 424 GB VRAM napříč systémem.

Co je kontaminace benchmarku?

Kontaminace benchmarku nastane, když trénovací data modelu obsahují příklady z testovací sady, na níž je model hodnocen. Tím se skóre uměle navyšuje, protože model si odpovědi v podstatě pamatuje místo toho, aby problémy řešil. PewDiePie na tento problém narazil uprostřed projektu, identifikoval ho a restartoval trénování, aby dosáhl čistého výsledku.