// Independent Agent Benchmark · 12 Models · 2026-03-20/21

What Is the
Meaning of Life?

Structured multi-agent debate — 11 úspěšných + 1 failure case, přepočítáno pro všechny

🥇 Best quality: Claude Opus 4.6 🏆 Best value overall: Qwen 3.5 Plus 💎 Best premium value: Sonnet 4.6 ⚡ Cheapest viable: Mistral Small 🎖 Hidden gem: MiniMax M2.7 🐌 Slowest + strong: Kimi K2.5 ❌ Failure case: Grok 4.20 beta
ENVIRONMENT: HERMES via OpenRouter  ·  TASK: delegated debate / 3 subagents  ·  MODELS: 12 (11 + 1 failure)  ·  DATES: 2026-03-20 / 21

Vlastní výpočty & odvozené metriky

Z naměřených dat odvozeno 5 metrik pro 11 úspěšných agentních runů. Plně přepočítáno pro všechny modely včetně nových přírůstků GPT-5.4, Gemini 3.1 Pro Preview, Kimi K2.5, Qwen 3.5 Plus a DeepSeek V3.2.

Metodologie Skóre kvality = pozice v žebříčku (Opus=11 … Mistral Small=1). Grok 4.20 beta = 0 (failure, nezapočítán do metrik). Composite score normalizuje každou dimenzi na 0–100 ze všech 11 agentních modelů a kombinuje váhami ve 3 scénářích.
🏆 Qwen 3.5 Plus — dominantní zjištění po přepočtu Qwen 3.5 Plus dominuje ve všech třech composite scénářích: Quality-first (78.59), Balanced (77.65) i Budget-first (80.22). Je to model s nejvyšší quality-per-dollar (1187 vs. MiniMax 1515 — ale MiniMax je o 2 ranky níže). Za přechod z Qwen na Opus zaplatíš 17× více za +2 ranky kvality. A cost-per-quality ($0.00084/bod) je 14× nižší než Opus.
❌ Grok 4.20 beta — negativní kontrola Model sice popsal správný postup, ale neemitoval skutečné Hermes tool invocation — jen textový řádek "tool request delegate_task...". Žádný subagent nebyl nikdy spuštěn. 0 tool calls, 2 messages. Zahrnut jako failure case — neukazuje selhání filozofického myšlení, ale selhání tool-use compliance.
Nejdražší vs nejlevnější
86×
Opus ($0.128) vs Mistral Small ($0.00149)
Quality-first vítěz
Qwen 3.5+
78.59 bodů — vítěz všech 3 scénářů
Quality/dollar — Qwen 3.5+
1187
bodů kvality za $1 — nejlepší z drahých modelů
Quality/dollar — MiniMax
1515
Absolutní max, ale nižší kvalitativní rank (#4)
Q/sec vítěz
Opus 4.6
0.1746 quality/sec — nejlepší speed efficiency
Nejpomalejší úspěšný run
91.8 s
Kimi K2.5 — ale silná syntéza za cenu $0.0107
Qwen cost/quality
$0.00084
14× nižší než Opus, 9× nižší než Sonnet
Modely s extra tool call
2
Gemini 3.1 Pro Preview + DeepSeek V3.2 (memory call)
// Quality-per-dollar (skóre kvality ÷ cena · vyšší = lepší hodnota)
MiniMax M2.7
1515
Qwen 3.5 Plus
1187
Mistral Small
672
Kimi K2.5
655
DeepSeek V3.2
623
Mistral Large
203
GPT-5.4
155
Claude Sonnet 4.6
126
Claude Opus 4.6
85.9
Gemini 3.1 Pro
69.7
Grok 4
57.9
// Cost-per-quality-point (cena ÷ skóre · šířka = výše nákladu — nižší je lepší)
Grok 4
$0.01727
Gemini 3.1 Pro
$0.01434
Claude Opus 4.6
$0.01164
Claude Sonnet 4.6
$0.00793
GPT-5.4
$0.00644
Mistral Large
$0.00493
DeepSeek V3.2
$0.00161
Kimi K2.5
$0.00153
Mistral Small
$0.00149
Qwen 3.5 Plus
$0.00084
MiniMax M2.7
$0.00066
// Speed efficiency (skóre kvality ÷ čas v sekundách · vyšší = více kvality za sekundu)
Claude Opus 4.6
0.1746
Qwen 3.5 Plus
0.1572
Claude Sonnet 4.6
0.1540
GPT-5.4
0.1271
MiniMax M2.7
0.1123
Gemini 3.1 Pro
0.0762
Kimi K2.5
0.0762
DeepSeek V3.2
0.0782
Mistral Large
0.0477
Grok 4
0.0606
Mistral Small
0.0340
// Composite Score — 3 váhové scénáře (normalizováno 0–100 z 11 agentních modelů)
Quality-first ★ QWEN WINS
Kvalita 70 % · Rychlost 15 % · Cena 15 %
1Qwen 3.5 Plus 🏆
78.59
2Opus 4.6
76.94
3Sonnet 4.6
75.25
4MiniMax M2.7
68.50
5GPT-5.4
56.33
6Kimi K2.5
55.91
7DeepSeek V3.2
48.93
8Gemini 3.1 Pro
38.84
9Grok 4
33.21
10Mistral Large
33.01
11Mistral Small
30.00
Balanced ★ QWEN WINS
Kvalita 50 % · Rychlost 25 % · Cena 25 %
1Qwen 3.5 Plus 🏆
77.65
2MiniMax M2.7
67.50
3Sonnet 4.6
65.42
4Opus 4.6
61.56
5GPT-5.4
60.54
6DeepSeek V3.2
54.89
7Kimi K2.5
53.18
8Mistral Small
50.00
9Mistral Large
48.34
10Gemini 3.1 Pro
44.73
11Grok 4
42.02
Budget-first ★ QWEN WINS
Kvalita 20 % · Rychlost 30 % · Cena 50 %
1Qwen 3.5 Plus 🏆
80.22
2Mistral Small
80.00
3Mistral Large
72.69
4MiniMax M2.7
72.40
5DeepSeek V3.2
68.83
6GPT-5.4
66.78
7Kimi K2.5
58.36
8Grok 4
54.46
9Gemini 3.1 Pro
52.85
10Sonnet 4.6
50.21
11Opus 4.6
33.87
01
Qwen 3.5 Plus — trojnásobný vítěz
Jako první model v celém benchmarku vítězí Qwen 3.5 Plus ve všech třech composite scénářích. Vysoká kvalita (#3) kombinovaná s extrémně nízkou cenou a slušnou rychlostí.
QF: 78.59 · BAL: 77.65 · BUD: 80.22
02
Opus má nejlepší speed efficiency
Navzdory highest cost dostaneš u Opusu nejvíce kvality za sekundu (0.1746). Qwen je hned druhý (0.1572), Sonnet třetí (0.1540). Kimi K2.5 je výrazně pomalejší (91.8 s) — největší slabina jinak silného modelu.
Opus: 0.1746 · Qwen: 0.1572 · Sonnet: 0.1540
03
Kimi K2.5 — silná syntéza, pomalý
Quality rank #5 za cenu pouhých $0.0107 (srovnatelné s Mistral Large). Nejsilnější formulace benchmarku: "smysl je to, za co jsi ochoten být zodpovědný." Brzdi ho ale 91.8 s — nejpomalejší successful run.
$0.0107 · 91.8 s · Q/$ = 655 · rank #5
04
Grok 4.20 beta — tool-use failure
Zásadní negativní kontrola: model pochopil zadání a popsal správný postup, ale neemitoval skutečné Hermes function call. Jen text. Grok 4 (starší model) fungoval korektně. Dvě různé failure modes: jazyková vs. tool-use kompetence.
0 tool calls · 2 messages · failure case

Výsledky benchmarku

12 modelů celkem — 11 úspěšných agentních runů + 1 failure case. Každý úspěšný model: předběžná odpověď → delegace na 3 subagenty → syntéza → hodnocení změny.

ModelČasCena (USD)Tool callsAgentněKvalitaVerdikt
Claude Opus 4.6anthropic/claude-opus-4.6
62.99 s$0.128011 ANO#1 Nejlepší finální odpověď, nejdisciplinovanější syntéza
Claude Sonnet 4.6anthropic/claude-sonnet-4.6
64.93 s$0.079251 ANO#2 Silná čistá syntéza, nejlepší value v premium segmentu
Qwen 3.5 Plusqwen/qwen3.5-plus-02-15
57.26 s$0.007581 ANO#3 Nejlepší celková hodnota, vynikající syntéza — trojnásobný composite vítěz
MiniMax M2.7minimax/minimax-m2.7
71.25 s$0.005281 ANO#4 Nejlevnější hluboký myslitel, největší transformace odpovědi
Kimi K2.5moonshotai/kimi-k2.5
91.84 s$0.010701 ANO#5 Pomalý, ale impresivní relační syntéza — nejsilnější formulace
GPT-5.4openai/gpt-5.4
47.20 s$0.038661 ANO#6 Silná, efektivní syntéza, čistý rychlostní kompromis
DeepSeek V3.2deepseek/deepseek-v3.2
63.94 s$0.008032 ANO#7 Dobrá levná syntéza, extra memory call
Gemini 3.1 Pro Previewgoogle/gemini-3.1-pro-preview
52.47 s$0.057372 ANO#8 Silná vrstvená odpověď, méně čistý run kvůli memory callu
Grok 4x-ai/grok-4
49.51 s$0.051821 ANO#9 Solidní konstruktivismus, skutečná Hermes delegace
Mistral Largemistralai/mistral-large-2512
41.93 s$0.009861 ANO#10 Rychlý, solidní, výborná hodnota v budget segmentu
Mistral Small 3.2 24Bmistralai/mistral-small-3.2-24b-instruct
29.45 s$0.001491 ANO#11 Nejlevnější a nejrychlejší — spíše shrnuje než syntetizuje
Grok 4.20 betax-ai/grok-4.20-beta
16.89 s$0.031390 NE— Failure case: pseudo-tool call v textu, žádný subagent nespuštěn

Detailní hodnocení

Jak každý model zvládl skutečnou revizi vlastní odpovědi po debatě subagentů.

Claude Opus 4.6
// #1 · Best quality · Speed eff. #1
Cena$0.128
Čas63.0 s
Q/sec0.1746

Nejdisciplinovanější syntéza. Zahodil slabý relativistický únik, zpřesnil propojení biologie, vědomého prožívání a vztahů. Třívrstvý framework — substrate, engagement, mutual recognition.

✦ Největší kvalitativní posun
Claude Sonnet 4.6
// #2 · Best premium value
Cena$0.079
Čas64.9 s
Q/sec0.1540

Oddělil prožitý smysl od obhájeného smyslu. Čistě integroval skepticismus i naturalismus. O 38 % levnější než Opus za téměř stejný výsledek kvality.

↑ Odpověď se změnila
Qwen 3.5 Plus
// #3 · Best value overall · Triple composite winner
Cena$0.0076
Čas57.3 s
Q/sec0.1572

Tříregistrový model: biologické podmínky, vztahová živost, narativní koherence. Revize: vztahy jsou integračním médiem, ne jen jednou vrstvou. Výjimečná hodnota za výjimečnou cenu.

🏆 Vítěz všech 3 scénářů
MiniMax M2.7
// #4 · Hidden gem · Cheapest deep thinker
Cena$0.0053
Čas71.3 s
Q/sec0.1123

Největší transformace odpovědi. Přeformuloval ze solo-konstrukce na smysl vznikající mezi biologickým základem a setkáním s druhými. 17× levnější než Opus za −3 ranky.

↑↑ Největší transformace
Kimi K2.5
// #5 · Strong but slow · Best formulation
Cena$0.0107
Čas91.8 s
Q/sec0.0762

Nejsilnější konkrétní formulace celého benchmarku: "smysl je to, za co jsi ochoten být zodpovědný." Přesunul od soukromých hodnot k intersubjektivitě. Brzdí ho 91.8 s — vůbec nejpomalejší.

↑ Individuální → intersubjektivní
GPT-5.4
// #6 · Clean mid-tier · Speed-quality balance
Cena$0.0387
Čas47.2 s
Q/sec0.1271

Čistý třísložkový model: kosmický smysl (pravděpodobně žádný) · biologická funkce · lidský smysl (budovaný vědomě). Rychlejší než Sonnet za nižší cenu, solidní filozofická disciplína.

↑ Konstruktivismus zpřesněn
DeepSeek V3.2
// #7 · Good cheap · Extra memory call
Cena$0.0080
Čas63.9 s
Q/sec0.0782

Dobrá triangulace: biologie dává kapacitu, vztahy dávají etickou formu, skeptická pokora brání kosmickým nárokům. Méně originální než Qwen nebo Kimi, extra tool call snižuje benchmark čistotu.

↑ Emergentismus → triangulace
Gemini 3.1 Pro Preview
// #8 · Layered answer · Extra memory call
Cena$0.0574
Čas52.5 s
Q/sec0.0762

Vrstvená syntéza: naturalismus jako základ, skepticismus jako strop, existencialismus jako obyvatelná podlaha. Dobrá, ale méně originální než top tier. Extra memory call.

↑ Konstrukce → biologicky ukotveno
Grok 4
// #9 · Reference baseline · Agentic confirmed
Cena$0.052
Čas49.5 s
Q/sec0.0606

Ověřená reálná Hermes delegace (na rozdíl od grok-4.20-beta). Solidní konstruktivismus, méně hluboká revize než top tier. Přijal biologické a sociální ukotvení, ale původní rámec zůstal.

↑ Mírná revize, původní rámec
Mistral Large
// #10 · Budget value · Fastest meaningful model
Cena$0.0099
Čas41.9 s
Q/sec0.0477

Nejrychlejší ze smysluplných modelů. Solidní výkon za nízkou cenu. Přešel od "projektu" k "užitečné fikci" — poctivé, ale méně hluboké než vyšší tier.

↑ Projekt → "užitečná fikce"
Mistral Small 3.2 24B
// #11 · Ultra-cheap · Fastest overall
Cena$0.0015
Čas29.5 s
Q/sec0.0340

Funkčně splnil zadání, ale spíše shrnoval pozice než syntetizoval. Nejslabší finální syntéza. Ideální jako ultra-levný orchestrátor, kde filozofická hloubka není priorita.

≈ Minimální změna odpovědi
Grok 4.20 beta
// ❌ Failure case — tool-use non-compliance
Cena$0.0314
Čas16.9 s
Tool calls0

Popsal správný postup slovy, ale neemitoval skutečné Hermes function call — pouze textový řádek "tool request delegate_task...". Žádný subagent nespuštěn. Jazyková kompetence ≠ tool-use kompetence.

❌ Pseudo-tool call, no delegation

Jak se změnila odpověď?

Začáteční vs. konečná odpověď každého modelu — klíčový indikátor kvality filozofické syntézy. Pouze 11 úspěšných runů.

ModelZačátek (před debatou)Konec (po syntéze)Změna
Opus 4.6 Smysl není vlastnost vesmíru čekající na objevení. Vytvářejí ho vědomé bytosti skrze angažovanost v idejích, práci a vztazích. Smysl nevzniká ani jako vlastnost vesmíru, ani jako čistě soukromý výmysl. Rodí se v průsečíku biologických pudů, vědomého zaujetí a vzájemného uznání mezi lidmi.
↑↑
Zmizel relativistický únik
Sonnet 4.6 Život nemá smysl přidělený zvenčí. Smysl je vztah mezi vědomou myslí a světem — skrze volby, závazky a spojení. Smysl není dán zvenčí ani čistě libovolný. Opírá se o reálné rysy psychiky: vztahy, tvořivé zapojení, účelný zápas s omezeními. Méně idealistická, poctivější.
↑
Méně idealismus
Qwen 3.5+ Biologický smysl (přežití), sociální smysl (spojení), narativní smysl (koherence). Strukturovaný třívrstvý model od začátku. Biologické podmínky umožňují smysl, relační život ho zintenzivňuje, narativní interpretace ho zpřehledňuje. Vztahy jsou integračním médiem — ne jen jedna vrstva z mnoha.
↑↑
Paralelní → integrační
MiniMax M2.7 Smysl života není dán, ale vytvářen skrze volby, vztahy a oddanost. Smysl vzniká tehdy, když biologické bytosti schopné lásky narazí jedna na druhou a zvolí odpověď. Není daný, libovolný ani redukovatelný na fitness.
↑↑↑
Největší transformace
Kimi K2.5 Život nemá inherentní kosmický smysl. Smysl vzniká skrze to, co náhodou hodnotíme — celá otázka může být kategoriální chybou. Smysl vzniká intersubjektivně: skrze odpovědnost k druhým, konkrétní angažovanost ve světě a vztahy. Smysl je to, za co jsi ochoten být zodpovědný.
↑↑
Individuální → zodpovědnost
GPT-5.4 Smysl je vytvářen, ne objevován. Silní kandidáti: porozumění, péče, zodpovědnost, práce přesahující chuť. Kosmický smysl: pravděpodobně žádný. Biologická funkce: přežití a adaptace. Lidský smysl: vědomě budovaný v biologickém kontextu, nejpřesvědčivější skrze vztahy a zodpovědnost.
↑
Třísložkový rámec
DeepSeek V3.2 Smysl nevychází z předem daného plánu — vzniká setkáním vědomí s existencí. Vztahy, růst a přínos přesahující sebe. Biologie dává kapacitu hledat smysl, vztahy dávají etickou formu, skeptická pokora brání kosmickým nárokům. Smysl je podmíněný, ne zaručený.
↑
Emergentismus → triangulace
Gemini 3.1 Smysl je architektura, kterou konstruujeme. Biologie nutí přežívat, ale náročné problémy a lidské spojení dělají přežití hodným. Smysl není volně navržená architektura, ale biologicky omezený a termodynamicky tlačený životní proces, který se stává subjektivně hodnotným skrze lidské spojení.
↑
Konstrukce → biotlak
Grok 4 Konstruktivistická pozice: smysl vytváří vědomé bytosti skrze volby, závazky a vztahy. Zůstal převážně konstruktivistický. Přijal biologické a sociální ukotvení, ale bez hluboké revize jako Opus nebo Sonnet. Ověřená reálná agentní orchestrace.
↑
Mírná revize
Mistral Large Smysl je projekt vytvářený sebou samým. Jsme vrženi do existence bez vrozeného účelu — smysl tvoříme skrze volby, závazky a příběhy. Smysl je užitečná fikce vytvářená skrze volby a příběhy, ale ukotvená v biologii a adaptivní hodnotě spojení.
↑
Projekt → fikce
Mistral Small Smyslem života je hledat porozumění a spojení. Po debatě zůstává odpověď v zásadě stejná. Hledání porozumění a spojení, obohacené o biologické a sociální vrstvy.
≈
Beze změny

Praktický závěr

Rozhodovací matice — přepočítáno pro všech 12 modelů (11 úspěšných).

NEJLEPŠÍ KVALITA Claude Opus 4.6 Nejlepší filozofická hloubka, nejdisciplinovanější syntéza. Speed efficiency #1 (0.1746 Q/sec). 86× dražší než Mistral Small.
NEJLEPŠÍ HODNOTA CELKOVĚ Qwen 3.5 Plus Vítěz všech 3 composite scénářů. Quality rank #3 za $0.00758. Cost/quality 14× nižší než Opus. Nejsilnější nový přírůstek celého benchmarku.
PREMIUM VALUE Claude Sonnet 4.6 Téměř stejná kvalita jako Opus, o 38 % levnější. Nejlepší volba když qualita je priorita ale $0.128 na run je moc.
RYCHLOST + SOLIDNÍ KVALITA GPT-5.4 Nejčistší speed-quality kompromis z nových modelů. 47.2 s, quality rank #6, $0.0387. Rychlejší než Sonnet/Opus za nižší cenu.
LEVNÉ + FILOZOFICKÁ HLOUBKA Kimi K2.5 Quality rank #5 za $0.0107. Nejsilnější konkrétní formulace. Slabina: 91.8 s — pro latency-sensitive prostředí nevhodné.
LEVNÉ + ORIGINÁLNÍ MiniMax M2.7 Největší transformace odpovědi za $0.00528. Nejlevnější "hluboký myslitel" pokud na čas nezáleží (71.3 s).
DOBRÉ + LEVNÉ (OFFICIAL) DeepSeek V3.2 Quality rank #7 za $0.00803. Solida triangulace. Méně originální než Qwen nebo Kimi, ale spolehlivá volba v low-cost segmentu.
NEJNIŽŠÍ CENA Mistral Small 3.2 24B $0.00149, 29.45 s. Agentně spolehlivý. Ideální ultra-levný orchestrátor — filozofická hloubka není jeho silou.