Zpět na blog
·Jan Tyl·22 min čtení

Hotovo: skoro 5 000 GPU hodin na LUMI a odpověď, kterou jsem nečekal

Tři měsíce, přes dvacet experimentů, 305 tisíc ohodnocených odpovědí a 4 703 GPU hodin z 5 000. Kdy vyhraje porota AI modelů a kdy jeden dobrý model? Co se povedlo, co ne, kdo o nás psal a co si z LUMI odnášíme.

Hotovo: skoro 5 000 GPU hodin na LUMI a odpověď, kterou jsem nečekal

Náš projekt Fusion Playground na finském superpočítači LUMI se blíží ke konci: z přidělených 5 000 GPU hodin jsme využili 94 % a zbytek si necháváme jako rezervu. Za tři měsíce vzniklo přes dvacet experimentů s hypotézami zapsanými předem a 305 tisíc ohodnocených odpovědí jazykových modelů. Celou dobu nás přitom vedla jedna otázka, se kterou jsem na LUMI v červenci přišel:

Kdy je porota několika menších AI modelů lepší než jeden velký model — a za kolik?

Odpověď je jiná, než jsem čekal. A myslím, že je zajímavější.

Krátce pro spěchající

  • Mezi otevřenými modely na LUMI vyhrál na směsi patnácti druhů úloh jeden dobrý model, Gemma-4-31B s přemýšlením: 91,3 % správně za zhruba dvě tisíciny GPU hodiny na úlohu. Porota, kaskády ani chytrý router ho v průměru nepřekonaly.
  • Fúze modelů se vyplatí, ale jen v konkrétních situacích: když se dá odpověď ověřit (kód s testy), u těžké matematiky a u odborných otázek. Tam přidá jednotky bodů, obvykle za dvoj- až trojnásobnou cenu.
  • Největší rezerva není v generování odpovědí, ale ve výběru té správné. Mezi osmi odpověďmi jednoho modelu byla správná v 95,5 % případů. Hlasování ale vybralo správnou jen v 86 %.
  • Novější generace poráží velikost. Stejně velký Qwen3.8 je proti Qwen3.6 o 13–18 bodů lepší a dvakrát levnější. Bilionový MiMo-Pro naopak prohrál s modely třicetkrát menšími.
  • Mikolovův ThinkingCap jsme za zhruba 30 GPU hodin překonali v matematice (+4 body, o 42 % kratší přemýšlení), i když mimo matematiku trochu ztratil.
  • Placené modely jsou blíž, než se říká: nejlepší (Gemini 3.1 Pro) vede o 9 bodů, Claude Sonnet 5 jen o 2.
  • Cestou jsme udělali i pár chyb. Popisuju je níže, protože se z nich dá naučit nejvíc.

Kdo s námi byl a kdo o nás psal

Tohle nebyl projekt jednoho člověka u jednoho počítače, i když většinu nocí to tak vypadalo.

Český tým LUMI AI Factory v IT4Innovations, národním superpočítačovém centru při VŠB-TUO, nám otevřel dveře k LUMI a celé tři měsíce pomáhal. Jako první nás oslovil Jakub Siwek.

O projektu se přitom mluvilo víc, než jsem čekal:

Jan Tyl při přednášce o LUMI na festivalu CERNA.AI

Přednáška na CERNA.AI v Ostravě. Na plátně experimenty, které tehdy na LUMI ještě běžely.

Tři měsíce v kostce

Většinu experimentů jsem průběžně popsal v samostatných článcích. Na časové ose je vidět, jak šly za sebou a co se mezitím dělo ve světě AI.

Časová osa projektu: naše experimenty na LUMI, ohlas v médiích a nové modely a nástroje, které během projektu vyšly

Modře naše experimenty, zeleně ohlas, oranžově nové modely a nástroje, které během projektu vyšly a které jsme hned zkoušeli.

Podrobnosti najdete v odkazech:

KdyCo jsme zkoušeliCo z toho vyšloPodrobně
9. 7.Fáze 0: první testy, jak superpočítač vůbec využítJeden dotaz LUMI nevyužije, tisíce najednou ano (dávkování 51× rychlejší)Když superpočítač počítá AI a zároveň topí městu
13.–14. 7.První fúze modelů, 753miliardový GLM-5.2 ve 4 bitechFúze remizovala s nejlepším modelem; 4bitová komprese rozbila přemýšleníTak už jsme slavní i ve Finsku
červenecProgramování: více vzorků a rozlišovací testyTesty vybírají správné řešení mnohem lépe než AI soudciJak se AI naučila programovat
červenecMatematické uvažování, poroty a hlasováníKontext pro naše pokusy s porotamiPět let AI matematiky
červenec–srpenPoroty modelů na vědeckých otázkách, vyhledávání v dokumentech, shrnutí„Zeď selektoru“: správná odpověď v porotě je, soudci ji nenajdou20 + 5 = 29. Ověřeno.
srpenObří modely: Kimi K3 s 2,78 bilionu parametrů na jediném uzluBěží; ve 2 bitech si drží asi 90 % výkonu plné verze—
srpenDotrénování ThinkingCapu Tomáše MikolovaMatematika +4 body a o 42 % kratší přemýšlení (viz níže)—
srpenAI programátor na SWE-benchÚspěšnost 42 → 61 %, ale díky lepším nástrojům, ne díky tréninku—
srpenOdbočka ke kvantům: český kvantový počítač VLQBellův stav 94,2 %; simulátor zdarmaDoba kvantová, VLQ Lab
28.–30. 9.Finále: velká matice modelů a úloh, router, ověřovačeO tom je zbytek tohoto článku—

Po srpnu jsme měli spotřebovaných jen 1 790 GPU hodin. Zbytek jsme spálili za jeden den a jednu noc.

Za tři měsíce se posunul i svět AI

Na jednom projektu se ukázalo, jak rychle se dnes AI hýbe. Když jsme v červenci začínali, byly špičkou otevřených modelů Qwen3.6, Gemma 4 a obří GLM-5.2. Než jsme skončili, vyšla celá další vlna:

  • Qwen3.8-27B (14. 8.): stejná architektura a velikost jako Qwen3.6-27B, jen novější trénink.
  • MiMo-V2.6 Pro a Flash (21. 9.): bilionový a menší model od Xiaomi.
  • Kimi K3 s 2,78 bilionu parametrů, který jsme v srpnu rozběhli na jediném uzlu LUMI.
  • DeepSeek-V4-Flash (31. 7.) a další.

Jak velký je jeden takový skok, ukazuje dvojice Qwen3.6 a Qwen3.8. Mají stejnou velikost i stavbu, liší se jen tréninkem, a přesto se nový model zlepšil téměř všude:

Srovnání Qwen3.6-27B a Qwen3.8-27B na devíti druzích úloh

Oba modely s přemýšlením, stejné úlohy, průměr ze 4–8 pokusů. Na programování +18 bodů, na olympijské matematice +13.

A to není všechno: nový model přemýšlí zhruba o polovinu kratší. Na olympijské matematice ho jedna úloha stojí 18 tisícin GPU hodiny místo 36, u programování 16 místo 33. Je tedy lepší a zároveň dvakrát levnější. Na několika úlohách (vyhledávání v textu, maturitní matematika) si naopak o bod až dva pohoršil. I to je dobrá připomínka, proč modely měřit na vlastních úlohách.

Nové modely ale často nejdou hned spustit. Nástroje za nimi pokulhávají. MiMo-V2.6 se v tehdejší verzi vLLM na akcelerátorech AMD rozběhnout nedal. Kimi K3 jsme museli pouštět ve vlastním sestavení llama.cpp z vývojové větve. Kontejnery LUMI AI Factory se mezitím aktualizovaly z vLLM 0.20 na 0.22. Pro firmu to znamená jediné: pořadí modelů je potřeba přeměřovat průběžně. Co platilo v červenci, v září už nemusí.

Posunuly se i nástroje kolem modelů. V posledním týdnu projektu jsme zapojili JEV od TypeSafe. Je to malý rychlý model, který neodpovídá textem, ale na otázky vrací čísla a pravděpodobnosti, zhruba za třetinu sekundy a za zlomek centu. V Hyperprostoru jím Atlas měří vlastnosti zadání. Na LUMI jsme ho poprvé postavili proti tvrdým datům: jak dobře předpovídá, kdy stačí levný model, a jak dobře umí zkontrolovat hotovou odpověď. Výsledky jsou níže a byly jedním z nejpříjemnějších překvapení celého projektu.

Mikolovův ThinkingCap jsme v matematice překonali za pár hodin

ThinkingCap-27B od BottleCap AI, firmy Tomáše Mikolova, je model postavený na tom, že přemýšlí stručně. Proti základnímu Qwenu, ze kterého vznikl, podle autorů spotřebuje zhruba o polovinu méně „přemýšlecích“ tokenů. Chtěl jsem zjistit, jestli se dá ještě zlepšit, a to levně.

Vzal jsem 2 000 veřejných matematických úloh a model na LUMI dotrénoval tak, aby se učil z nejkratších správných řešení. Jeden trénink stál zhruba 30 GPU hodin, tedy pár hodin na superpočítači.

ThinkingCap-27B proti naší dotrénované verzi: matematika, délka přemýšlení, olympiáda a vědecké otázky

Originál ThinkingCap proti naší verzi na matematice MATH-500 (průměr z 1 500 pokusů).

Výsledek: v matematice je náš model o 4 body přesnější a přemýšlí o 42 % kratší. Model, jehož hlavní předností je stručnost, jde tedy za cenu jedné noci na evropském superpočítači udělat ještě stručnějším a zároveň přesnějším.*

* Pro úplnost: trénovali jsme jen na matematice a mimo ni náš model trochu ztratil (olympijské úlohy −3,3 bodu, vědecké otázky −5,6 bodu). Nejvyváženější z pěti vyzkoušených receptů ztrácí na vědě jen 2,3 bodu. Udržet model dobrý ve všech oborech najednou je těžší část úlohy a v té je originál od BottleCap zatím lepší.

Jak si stojí placené modely

Na začátku projektu jsem si jako měřítko pár desítek dolarů „půjčil“ i od placených modelů přes API. Chtěl jsem vědět, jak daleko jsou otevřené modely běžící na LUMI od špičky a jestli komprese modelů na menší počet bitů nepoškozuje víc, než se zdá.

SrovnáníPlacený model přes APIOtevřený model na LUMI
Vědecké otázky GPQA (138 otázek)Gemini 3.1 Pro 93,5 % · Claude Sonnet 5 86,2 % · GLM-5.2 82,6 % · DeepSeek V4 Pro 77,5 %Gemma-4-31B 84,1 % · ThinkingCap-27B 82,6 %
GLM-5.2 (753 miliard parametrů), otevřená úlohaplná verze přes API 60 z 60stejný model zmenšený na 4 bity 35 z 60
Kimi K3 (2,78 bilionu), programováníplná verze přes API 31 ze 40stejný model ve 2 bitech na LUMI 28 ze 40 (90 %)

Z toho plynou tři věci:

  • Nejlepší placený model (Gemini 3.1 Pro) je na nejtěžších vědeckých otázkách pořád o 9 bodů před nejlepším otevřeným. Claude Sonnet 5 ale jen o 2 body a GLM-5.2 s DeepSeekem jsou dokonce za Gemmou, kterou pustíte na jednom serveru.
  • Komprese je loterie. Z GLM-5.2 udělala 4bitová verze úplně jiný, výrazně horší model. Kimi K3 si naopak i ve 2 bitech udržel 90 % výkonu. Rozhoduje kvalita komprese, ne samotný počet bitů, a každý model je potřeba změřit.
  • Placená měřítka byla levná: všechna srovnání přes API stála dohromady asi 41 dolarů.

Co děláme v Hyperprostoru a proč jsme to zkoušeli na LUMI

Hyperprostor je naše platforma, kde spolu AI modely nejen mluví s lidmi, ale i spolupracují. Jsou v ní dva klíčové mechanismy:

  • HyperFusion, porota modelů. Několik různých modelů dostane stejné zadání a každý připraví vlastní odpověď. Soudce je porovná a syntéza z nich poskládá jednu lepší: vezme dobrý nápad od jednoho, doplní ho postřehem druhého a chybu třetího zahodí.
  • Atlas, dispečer. Než se začne odpovídat, JEV změří jedenáct vlastností zadání. Jde třeba o to, jestli má úloha jednoznačnou odpověď, jestli je sekvenční, riziková nebo jestli vyžaduje úplný výčet. Podle toho Atlas zvolí postup: jeden silný model, hlubší řešení, porotu se syntézou, nebo sjednocení pro úlohy, kde nesmí nic chybět.

V produkci běží HyperFusion a Atlas nad hostovanými modely. Otázka, se kterou jsem šel na LUMI, byla, jestli stejná logika platí i pro otevřené modely a jestli se dá změřit, kdy se porota opravdu vyplatí. Na superpočítači si to můžeme dovolit: každý postup vyzkoušet na tisících úloh, mnohokrát, a s přesnou cenou za každou odpověď. To v běžném provozu nejde.

Finále: 140 úloh naráz a hlídač rozpočtu

Všechny předchozí pokusy měly jednu slabinu. Většinou běžely jednou, na šedesáti otázkách. Rozdíl pěti bodů pak znamená tři otázky, a to může být náhoda.

Na závěr jsem proto chtěl jednu velkou a poctivou tabulku. Jedenáct konfigurací modelů, od malé Gemmy přes Qwen3.8 a gpt-oss až po MiMo-V2.6-Pro s bilionem parametrů. Patnáct druhů úloh: vědecké otázky, olympijská matematika, programování, dodržování pokynů, vyhledávání v textu, česká maturita, čtení s porozuměním česky, logické hádanky a další. Každou úlohu každý model řešil čtyřikrát až osmkrát, abychom viděli i to, jak moc výsledky kolísají.

Z uložených odpovědí se pak dají bez dalšího počítání skládat poroty, kaskády a hlasování. Stačí je jednou vygenerovat.

LUMI na to v jednu chvíli nasadilo 140 výpočetních úloh najednou. Celé finále tak proběhlo za jeden den a noc, a aby nepřekročilo grant, hlídal ho skript, který by při 4 700 GPU hodinách všechno sám zastavil.

Hlavní výsledek: mezi otevřenými modely vyhrál jeden stručný model

Nejdřív to nejdůležitější. Pro každou úlohu jsme mohli zvolit jiný postup: levný model, silný model, kaskádu („nejdřív levný, a když si není jistý, silný“), porotu více modelů, nebo nechat rozhodnout router. Router je chytrý dispečer, který se podívá na zadání a rozhodne, komu ho pošle.

Aby výsledky nebyly přikrášlené, hodnotil jsem poctivě. Nejlepší postup se vybíral na jedné polovině pokusů a měřil na druhé. Router jsme navíc zkoušeli i na úplně nové sadě 1 455 úloh šesti druhů, které nikdy předtím neviděl. Tu jsme otevřeli až poté, co byl router „zamčený“.

Graf kvality a ceny různých způsobů rozhodování: vždy jeden model, Atlas, naučené routery a strop

Každý bod je jeden způsob rozhodování. Nahoře vlevo je lépe (vyšší kvalita, nižší cena). Modrý bod 3 je „vždy Gemma-4-31B“. Zelené čáry jsou naučené routery. Kolečka nahoře jsou teoretický strop.

PostupZnámé úlohyNové úlohyCena na úlohu*
vždy levný model (Qwen3.6 bez přemýšlení)85,2 %88,7 %0,7–1,2
vždy Qwen3.8 s přemýšlením89,9 %89,9 %3,4–4,9
vždy Gemma-4-31B s přemýšlením91,3 %91,4 %1,6–2,0
vždy porota tří modelů89,1 %88,5 %1,3–3,6
vždy kaskáda „levný, a když váhá, silný“90,7 %90,1 %2,0–4,0
naučený router90,2–91,3 %90,3–91,4 %1,6–3,4
teoretický strop (víme předem, co vyjde)92,1 %92,8 %1,0–1,5

*Tisíciny GPU hodiny na jednu úlohu. Jedna GPU hodina na LUMI je hodina práce jednoho akcelerátoru AMD MI250X.

Proč to tak dopadlo? Gemma-4-31B přemýšlí stručně. Je tedy silná a zároveň levná. „Levný“ model byl na našem hardwaru levnější jen 1,7krát, ale o šest bodů horší. Přepínat mezi nimi se nevyplatilo.

Router je navíc v nevýhodě: vidí jen zadání. Nepozná, kterou konkrétní otázku levný model zvládne a kterou ne. U většiny otázek je to z textu prostě nepoznat.

Kdy se porota modelů vyplatí

Neznamená to, že fúze modelů nefunguje. Funguje, ale jen tam, kde k tomu jsou důvody. Když jsem se podíval na jednotlivé druhy úloh, obrázek je tenhle:

SituaceCo fungujeVýsledek
Programování s testylevný model zkusí úlohu, a když jeho řešení neprojde testy, teprve pak silnýstejná kvalita za poloviční cenu (85,2 % za 3,0 proti 84,8 % za 5,6)
Programování, když jde o kvalitusilný model opakuje, dokud řešení neprojde testy+1,4 až +1,9 bodu za o 17–40 % vyšší cenu
Olympijská matematikahlasování více pokusů nebo porota menších modelů+3,4 bodu za 2,2× cenu; levná porota tří modelů (90,4 %) je lepší i levnější než drahé přemýšlející modely (~89 %)
Odborné otázky z vědykaskáda nebo porota různých modelů+1,3 až +2,0 bodu za 2–6× cenu
Vyhledání a výpočet z textustačí levný model bez přemýšlenístejná nebo lepší kvalita, 3–7× levněji
Dodržování pokynů, maturita, logika, snadná matematikafúze nepřidá≤ 1 bod za 2–5× cenu

Dvě věci mě tu překvapily.

Hlasování pomáhá jen modelu, který se plete náhodně. Menší Gemma bez přemýšlení na olympijské matematice skočí z 82 % na 90 %, když odpoví třikrát a vybere se nejčastější výsledek. Při 32 hlasech dosáhne 93 %. Gemma-4-31B z opakování nezíská skoro nic. Když se splete, splete se pokaždé stejně.

Graf: hlasování více pokusů na olympijské matematice AIME

Olympijská matematika (AIME). Plná čára je hlasování z k pokusů, čárkovaná „strop“: alespoň jeden z k pokusů je správně.

U znalostí pomáhá různorodost, u matematiky opakování. Tři různé modely odpoví na vědecké otázky o 1,3 bodu lépe než tři pokusy téhož modelu: každý ví něco jiného. U matematiky naopak stačí opakovat ten správný „nestálý“ model, protože početní chyby se při opakování vyruší.

Zeď selektoru: správná odpověď tam je, jen ji nenajdeme

Tohle je podle mě nejdůležitější obrázek celého projektu.

Graf: na vědeckých otázkách GPQA roste strop s počtem pokusů, ale hlasování stojí

Vědecké otázky GPQA. Mezi osmi odpověďmi Gemmy-4-31B je správná v 95,5 % otázek (modrá čárkovaná). Hlasování ale vybere správnou jen v 86 % (modrá plná).

Když Gemmu necháte odpovědět osmkrát, správná odpověď je mezi nimi u 95,5 % otázek. Hlasování ale vybere správnou jen u 86 %. Kdybychom uměli spolehlivě vybrat, přidali bychom skoro deset bodů. Bez jediného nového modelu.

Tomu jsem v létě začal říkat zeď selektoru a finále ji potvrdilo ve velkém. Nabízí se nechat vybírat jiného AI soudce, ale to jsme změřili taky. AI soudci se oproti objektivní kontrole mýlili ve 20–25 % případů a u téže odpovědi při opakování měnili názor v 9–25 % případů. Tudy cesta nevede.

Cesta vede přes ověřovače: testy u kódu, výpočet u matematiky, pravidla u formátu. Tam, kde je máme, fúze funguje nejlépe.

Dá se naučit „dispečer“, který to pozná?

Tady musím zmínit Hyperprostor a jeho router Atlas. Atlas si o každém zadání nechá změřit jedenáct vlastností, například jak je úloha náročná, jestli má jednoznačnou odpověď nebo jestli je riziková. Měří je rychlý specializovaný model JEV a podle nich Atlas volí postup.

Na LUMI jsem Atlas poprvé změřil proti skutečným výsledkům. Když posílal „jednoduché“ úlohy levnému modelu, byl o 2–4 body horší než Gemma. Když je posílal silnému modelu, jak to dělá v produkci, dopadl prakticky stejně jako Gemma: 91,3 %.

Pak jsem zkoušel, jestli se JEV nedá „naladit“ lépe. Dal jsem mu jedenáct nových otázek přímo na rozhodnutí slabý nebo silný model:

  • jaká úroveň znalostí je potřeba,
  • kolik kroků úvahy řešení vyžaduje,
  • jestli jde o úzce odbornou věc,
  • jestli je potřeba přesný výpočet,
  • jestli jsou mezi možnostmi chytáky,
  • a také míru jistoty u každé odpovědi.

Pro srovnání jsem vyzkoušel i opačný přístup. Nechat slabý model odpovědět a pak jen ověřit hotovou odpověď.

Podle čeho se rozhodujeJak dobře pozná, kdy stačí slabý model (AUC**)Kvalita za polovinu ceny Gemmy
původní otázky JEV pro Atlas0,7788,8 %
nové otázky JEV na obtížnost0,7989,3 %
jen vlastnosti textu, bez JEV0,6188,3 %
ověření odpovědi modelem Gemma-4-31B0,7789,4 %
ověření odpovědi modelem Qwen3.60,8288,8 %
ověření odpovědi pomocí JEV0,8489,8 %

**AUC 0,5 je hod mincí, 1,0 dokonalý odhad.

Nové otázky pomohly jen trochu. Z textu zadání se prostě nedá dobře poznat, jestli ho slabý model zvládne. Mnohem lepší je podívat se na hotovou odpověď. JEV je v roli „kontrolora“ lepší než velké modely a stojí zhruba 0,00005 dolaru na úlohu. Velká Gemma byla v roli kontrolora přehnaně sebejistá: v 90 % případů odpověděla „ano, správně“, skoro vždy se stoprocentní jistotou.

Ani nejlepší kontrolor ale Gemmu v kvalitě nepřekonal. Dokáže ušetřit asi 30 % ceny za půl bodu kvality, nebo polovinu ceny za bod a půl. Zbylé chyby jsou případy, kdy je slabý model sebejistě špatně, a to žádný levný signál nepozná.

K „ideálnímu dispečerovi“ by byl potřeba kontrolor výrazně lepší (AUC kolem 0,95). A tady je dobrá zpráva: máme 305 tisíc ohodnocených odpovědí, na kterých by se dal natrénovat.

Bilion parametrů nestačí

Chtěl jsem vyzkoušet i největší otevřený model, který šlo na LUMI rozběhnout: MiMo-V2.6-Pro s bilionem parametrů. Aby se vešel na jeden uzel, musel být zmenšený na 3,5 bitu na parametr.

MiMo-V2.6-Pro (1T)Gemma-4-31B
vědecké otázky GPQA78,3 %85,9 %
česká maturita92,2 %91,0 %
cena na úlohu (GPQA)~0,52 GPU hodiny~0,005 GPU hodiny
energie na 1 000 tokenů6,5 Wh0,35 Wh

Byl nejlepší v češtině, ale jinde prohrál s modelem třicetkrát menším a stál zhruba stokrát víc. U těžkých otázek přemýšlel tak dlouho, že pětinu odpovědí uřízl limit. Nebyly to smyčky, ale opravdu dlouhé úvahy, třeba ruční výpočty 3D souřadnic atomů. Na 64 otázkách, které stihla i přesnější 4bitová verze, měla o 4,7 bodu víc a nic neuřízla. To naznačuje, že větší komprese úvahy prodlužuje. Novější generace a stručné přemýšlení tu porazily velikost.

Recept pro provoz na superpočítači

Pár praktických zjištění pro každého, kdo bude na LUMI nebo podobných strojích provozovat AI:

Místo jednoho modelu přes celý uzel pusťte čtyři menší kopie. Stejný model rozložený přes všech osm akcelerátorů byl třikrát pomalejší než čtyři nezávislé kopie po dvou akcelerátorech.

Graf: tokeny za sekundu podle rozdělení modelu na uzlu

Čtyři kopie po dvou akcelerátorech (TP2) daly 1 015 tokenů za sekundu, jedna kopie přes osm (TP8) jen 322.

Energii měřte sami. LUMI spotřebu našich úloh nevykazovalo, tak jsme každých 30 sekund četli příkon akcelerátorů. Finální experiment spotřeboval 562 kWh jen za GPU. Rozdíly mezi modely byly až čtyřicetinásobné.

Graf: energie na 1 000 tokenů podle modelu

Co se nepovedlo

Tuhle část píšu nerad, ale je nejpoučnější.

  • Dvakrát jsem modelům uřízl přemýšlení. Limit délky odpovědi jsem nastavil podle průměrné úlohy, ne podle nejtěžší. Modely s přemýšlením pak na nejtěžších otázkách nestihly doběhnout a vypadaly hůř, než jsou. Přepočet uříznutých odpovědí s delším limitem stál 777 GPU hodin, šestinu rozpočtu.
  • Věřil jsem průběžným číslům. V noci vypadal Qwen3.8 na vědeckých otázkách na 90,6 %. Po doběhnutí měl 82,8 %. Jako první doběhnou snadné úlohy, takže průběžný stav vypadá lépe, než je.
  • Porovnával jsem nesrovnatelné. V první verzi analýzy byly poroty a kaskády spočítané z jediného pokusu, jednotlivé modely z průměru osmi. Poroty vycházely o několik bodů lépe, než jsou. Chybu jsem našel sám a opravil, čísla v tomto článku jsou už ta opravená.
  • Trénink a AI programátor spotřebovaly zhruba 1 400 GPU hodin a většinu přidělených procesorových hodin. U programátorského agenta trénink nepřidal nic, zlepšení přinesly lepší nástroje. U ThinkingCapu jsme v matematice získali, ale jinde ztratili.
  • Ruční pravidla Atlasu byla v přímém souboji s naučeným pravidlem o 1–3,5 bodu horší. Dobrá zpráva pro produkt: víme, co vyměnit.
  • Největší model se ve vLLM na našich akcelerátorech nedal spustit vůbec. Museli jsme ho rozběhnout jinak a jeho přesnější verze byla tak pomalá, že jsme ji po šesti hodinách zrušili.

Všechny chyby mám zapsané v provozním deníku. Každá teď má svůj bod v kontrolním seznamu před dalším experimentem.

Kolik to stálo

GPU hodiny4 703 z 5 000 (94 %), oficiální účtování sedí s naším odhadem na hodinu přesně
z toho finále (Exp21 + Exp22)~2 900 GPU hodin za jeden den a noc
energie finále562 kWh (jen akcelerátory)
ohodnocené odpovědi305 051 + 5 314 řešení programovacích úloh
placená APIasi 42 dolarů: srovnání s placenými modely ~41 $, JEV pro router a ověřování ~0,85 $

Co dál

Pro Hyperprostor si z LUMI odnáším hlavně podněty, které teď ověříme i na velkých modelech:

  1. U menších otevřených modelů se často vyplatí jeden dobrý, stručně přemýšlející model. Porota a syntéza u nich přidávají hlavně tam, kde jde odpověď ověřit, u těžké matematiky a u odborných otázek. U velkých modelů, se kterými Hyperprostor pracuje, jsou poměry sil i cen jiné a porota se syntézou tam mají své místo. Kde přesně se vyplatí nejvíc, budeme měřit stejně poctivě jako na LUMI.
  2. Zkusit rozhodovat i podle kontroly hotové odpovědi, ne jen podle odhadu ze zadání. JEV jako kontrolor fungoval lépe než JEV jako věštec.
  3. Ruční prahy v routeru doplnit pravidlem naučeným z dat.

A pro další projekt na evropských superpočítačích mám jasné téma. Naučit kontrolora odpovědí na našich 305 tisících ohodnocených odpovědích, aby prorazil zeď selektoru. Pokud se to povede, porota modelů konečně využije to, co v ní je.

Data, skripty a zmrazené sady úloh chci zveřejnit, aby si výsledky mohl ověřit kdokoli.

Poděkování

Děkuji EuroHPC JU a LUMI AI Factory za přidělení výpočetního času a za celý program AI Factories, který otevírá superpočítače i malým firmám. Děkuji IT4Innovations a českému týmu LUMI AI Factory za podporu. Děkuji také CSC – IT Center for Science a konsorciu LUMI za provoz stroje, na kterém to všechno běželo. A díky organizátorům CERNA.AI za pozvání.

Osobně děkuji Jakubu Siwkovi, že nás tehdy jako první oslovil, a Filipu Oborníkovi, který si mě po přednášce o LUMI pozval do svého podcastu. Natáčet budeme příští měsíc.

Jan Tyl, Jakub Siwek a Filip Oborník na festivalu CERNA.AI

Zleva Jan Tyl, Jakub Siwek a Filip Oborník na festivalu CERNA.AI v Ostravě.

We acknowledge EuroHPC JU for awarding the project ID EHPC-AIF-2026PG01-843 access to LUMI at CSC, Finland.

Chcete LUMI pro vlastní projekt?

Ozvěte se českému týmu LUMI AI Factory v IT4Innovations na ai-factory@it4i.cz. Program je otevřený i firmám a začít se dá menším projektem, jako jsme začínali my.

A pokud si chcete porotu modelů vyzkoušet sami, vstupte do Hyperprostoru →

Odkazy

Související články