// Independent Agent Benchmark · 12 Models · 2026-03-20/21

What Is the
Meaning of Life?

Structured multi-agent debate — 11 úspěšných + 1 failure case, přepočítáno pro všechny

🥇 Best quality: Claude Opus 4.6 🏆 Best value overall: Qwen 3.5 Plus 💎 Best premium value: Sonnet 4.6 ⚡ Cheapest viable: Mistral Small 🎖 Hidden gem: MiniMax M2.7 🐌 Slowest + strong: Kimi K2.5 ❌ Failure case: Grok 4.20 beta
ENVIRONMENT: HERMES via OpenRouter  ·  TASK: delegated debate / 3 subagents  ·  MODELS: 12 (11 + 1 failure)  ·  DATES: 2026-03-20 / 21

Vlastní výpočty & odvozené metriky

Z naměřených dat odvozeno 5 metrik pro 11 úspěšných agentních runů. Plně přepočítáno pro všechny modely včetně nových přírůstků GPT-5.4, Gemini 3.1 Pro Preview, Kimi K2.5, Qwen 3.5 Plus a DeepSeek V3.2.

Metodologie Skóre kvality = pozice v žebříčku (Opus=11 … Mistral Small=1). Grok 4.20 beta = 0 (failure, nezapočítán do metrik). Composite score normalizuje každou dimenzi na 0–100 ze všech 11 agentních modelů a kombinuje váhami ve 3 scénářích.
🏆 Qwen 3.5 Plus — dominantní zjištění po přepočtu Qwen 3.5 Plus dominuje ve všech třech composite scénářích: Quality-first (78.59), Balanced (77.65) i Budget-first (80.22). Je to model s nejvyšší quality-per-dollar (1187 vs. MiniMax 1515 — ale MiniMax je o 2 ranky níže). Za přechod z Qwen na Opus zaplatíš 17× více za +2 ranky kvality. A cost-per-quality ($0.00084/bod) je 14× nižší než Opus.
❌ Grok 4.20 beta — negativní kontrola Model sice popsal správný postup, ale neemitoval skutečné Hermes tool invocation — jen textový řádek "tool request delegate_task...". Žádný subagent nebyl nikdy spuštěn. 0 tool calls, 2 messages. Zahrnut jako failure case — neukazuje selhání filozofického myšlení, ale selhání tool-use compliance.
Nejdražší vs nejlevnější
86×
Opus ($0.128) vs Mistral Small ($0.00149)
Quality-first vítěz
Qwen 3.5+
78.59 bodů — vítěz všech 3 scénářů
Quality/dollar — Qwen 3.5+
1187
bodů kvality za $1 — nejlepší z drahých modelů
Quality/dollar — MiniMax
1515
Absolutní max, ale nižší kvalitativní rank (#4)
Q/sec vítěz
Opus 4.6
0.1746 quality/sec — nejlepší speed efficiency
Nejpomalejší úspěšný run
91.8 s
Kimi K2.5 — ale silná syntéza za cenu $0.0107
Qwen cost/quality
$0.00084
14× nižší než Opus, 9× nižší než Sonnet
Modely s extra tool call
2
Gemini 3.1 Pro Preview + DeepSeek V3.2 (memory call)
// Quality-per-dollar (skóre kvality ÷ cena · vyšší = lepší hodnota)
MiniMax M2.7
1515
Qwen 3.5 Plus
1187
Mistral Small
672
Kimi K2.5
655
DeepSeek V3.2
623
Mistral Large
203
GPT-5.4
155
Claude Sonnet 4.6
126
Claude Opus 4.6
85.9
Gemini 3.1 Pro
69.7
Grok 4
57.9
// Cost-per-quality-point (cena ÷ skóre · šířka = výše nákladu — nižší je lepší)
Grok 4
$0.01727
Gemini 3.1 Pro
$0.01434
Claude Opus 4.6
$0.01164
Claude Sonnet 4.6
$0.00793
GPT-5.4
$0.00644
Mistral Large
$0.00493
DeepSeek V3.2
$0.00161
Kimi K2.5
$0.00153
Mistral Small
$0.00149
Qwen 3.5 Plus
$0.00084
MiniMax M2.7
$0.00066
// Speed efficiency (skóre kvality ÷ čas v sekundách · vyšší = více kvality za sekundu)
Claude Opus 4.6
0.1746
Qwen 3.5 Plus
0.1572
Claude Sonnet 4.6
0.1540
GPT-5.4
0.1271
MiniMax M2.7
0.1123
Gemini 3.1 Pro
0.0762
Kimi K2.5
0.0762
DeepSeek V3.2
0.0782
Mistral Large
0.0477
Grok 4
0.0606
Mistral Small
0.0340
// Composite Score — 3 váhové scénáře (normalizováno 0–100 z 11 agentních modelů)
Quality-first ★ QWEN WINS
Kvalita 70 % · Rychlost 15 % · Cena 15 %
1Qwen 3.5 Plus 🏆
78.59
2Opus 4.6
76.94
3Sonnet 4.6
75.25
4MiniMax M2.7
68.50
5GPT-5.4
56.33
6Kimi K2.5
55.91
7DeepSeek V3.2
48.93
8Gemini 3.1 Pro
38.84
9Grok 4
33.21
10Mistral Large
33.01
11Mistral Small
30.00
Balanced ★ QWEN WINS
Kvalita 50 % · Rychlost 25 % · Cena 25 %
1Qwen 3.5 Plus 🏆
77.65
2MiniMax M2.7
67.50
3Sonnet 4.6
65.42
4Opus 4.6
61.56
5GPT-5.4
60.54
6DeepSeek V3.2
54.89
7Kimi K2.5
53.18
8Mistral Small
50.00
9Mistral Large
48.34
10Gemini 3.1 Pro
44.73
11Grok 4
42.02
Budget-first ★ QWEN WINS
Kvalita 20 % · Rychlost 30 % · Cena 50 %
1Qwen 3.5 Plus 🏆
80.22
2Mistral Small
80.00
3Mistral Large
72.69
4MiniMax M2.7
72.40
5DeepSeek V3.2
68.83
6GPT-5.4
66.78
7Kimi K2.5
58.36
8Grok 4
54.46
9Gemini 3.1 Pro
52.85
10Sonnet 4.6
50.21
11Opus 4.6
33.87
01
Qwen 3.5 Plus — trojnásobný vítěz
Jako první model v celém benchmarku vítězí Qwen 3.5 Plus ve všech třech composite scénářích. Vysoká kvalita (#3) kombinovaná s extrémně nízkou cenou a slušnou rychlostí.
QF: 78.59 · BAL: 77.65 · BUD: 80.22
02
Opus má nejlepší speed efficiency
Navzdory highest cost dostaneš u Opusu nejvíce kvality za sekundu (0.1746). Qwen je hned druhý (0.1572), Sonnet třetí (0.1540). Kimi K2.5 je výrazně pomalejší (91.8 s) — největší slabina jinak silného modelu.
Opus: 0.1746 · Qwen: 0.1572 · Sonnet: 0.1540
03
Kimi K2.5 — silná syntéza, pomalý
Quality rank #5 za cenu pouhých $0.0107 (srovnatelné s Mistral Large). Nejsilnější formulace benchmarku: "smysl je to, za co jsi ochoten být zodpovědný." Brzdi ho ale 91.8 s — nejpomalejší successful run.
$0.0107 · 91.8 s · Q/$ = 655 · rank #5
04
Grok 4.20 beta — tool-use failure
Zásadní negativní kontrola: model pochopil zadání a popsal správný postup, ale neemitoval skutečné Hermes function call. Jen text. Grok 4 (starší model) fungoval korektně. Dvě různé failure modes: jazyková vs. tool-use kompetence.
0 tool calls · 2 messages · failure case

Výsledky benchmarku

12 modelů celkem — 11 úspěšných agentních runů + 1 failure case. Každý úspěšný model: předběžná odpověď → delegace na 3 subagenty → syntéza → hodnocení změny.

ModelČasCena (USD)Tool callsAgentněKvalitaVerdikt
Claude Opus 4.6anthropic/claude-opus-4.6
62.99 s$0.128011 ANO#1 Nejlepší finální odpověď, nejdisciplinovanější syntéza
Claude Sonnet 4.6anthropic/claude-sonnet-4.6
64.93 s$0.079251 ANO#2 Silná čistá syntéza, nejlepší value v premium segmentu
Qwen 3.5 Plusqwen/qwen3.5-plus-02-15
57.26 s$0.007581 ANO#3 Nejlepší celková hodnota, vynikající syntéza — trojnásobný composite vítěz
MiniMax M2.7minimax/minimax-m2.7
71.25 s$0.005281 ANO#4 Nejlevnější hluboký myslitel, největší transformace odpovědi
Kimi K2.5moonshotai/kimi-k2.5
91.84 s$0.010701 ANO#5 Pomalý, ale impresivní relační syntéza — nejsilnější formulace
GPT-5.4openai/gpt-5.4
47.20 s$0.038661 ANO#6 Silná, efektivní syntéza, čistý rychlostní kompromis
DeepSeek V3.2deepseek/deepseek-v3.2
63.94 s$0.008032 ANO#7 Dobrá levná syntéza, extra memory call
Gemini 3.1 Pro Previewgoogle/gemini-3.1-pro-preview
52.47 s$0.057372 ANO#8 Silná vrstvená odpověď, méně čistý run kvůli memory callu
Grok 4x-ai/grok-4
49.51 s$0.051821 ANO#9 Solidní konstruktivismus, skutečná Hermes delegace
Mistral Largemistralai/mistral-large-2512
41.93 s$0.009861 ANO#10 Rychlý, solidní, výborná hodnota v budget segmentu
Mistral Small 3.2 24Bmistralai/mistral-small-3.2-24b-instruct
29.45 s$0.001491 ANO#11 Nejlevnější a nejrychlejší — spíše shrnuje než syntetizuje
Grok 4.20 betax-ai/grok-4.20-beta
16.89 s$0.031390 NE Failure case: pseudo-tool call v textu, žádný subagent nespuštěn

Detailní hodnocení

Jak každý model zvládl skutečnou revizi vlastní odpovědi po debatě subagentů.

Claude Opus 4.6
// #1 · Best quality · Speed eff. #1
Cena$0.128
Čas63.0 s
Q/sec0.1746

Nejdisciplinovanější syntéza. Zahodil slabý relativistický únik, zpřesnil propojení biologie, vědomého prožívání a vztahů. Třívrstvý framework — substrate, engagement, mutual recognition.

✦ Největší kvalitativní posun
Claude Sonnet 4.6
// #2 · Best premium value
Cena$0.079
Čas64.9 s
Q/sec0.1540

Oddělil prožitý smysl od obhájeného smyslu. Čistě integroval skepticismus i naturalismus. O 38 % levnější než Opus za téměř stejný výsledek kvality.

↑ Odpověď se změnila
Qwen 3.5 Plus
// #3 · Best value overall · Triple composite winner
Cena$0.0076
Čas57.3 s
Q/sec0.1572

Tříregistrový model: biologické podmínky, vztahová živost, narativní koherence. Revize: vztahy jsou integračním médiem, ne jen jednou vrstvou. Výjimečná hodnota za výjimečnou cenu.

🏆 Vítěz všech 3 scénářů
MiniMax M2.7
// #4 · Hidden gem · Cheapest deep thinker
Cena$0.0053
Čas71.3 s
Q/sec0.1123

Největší transformace odpovědi. Přeformuloval ze solo-konstrukce na smysl vznikající mezi biologickým základem a setkáním s druhými. 17× levnější než Opus za −3 ranky.

↑↑ Největší transformace
Kimi K2.5
// #5 · Strong but slow · Best formulation
Cena$0.0107
Čas91.8 s
Q/sec0.0762

Nejsilnější konkrétní formulace celého benchmarku: "smysl je to, za co jsi ochoten být zodpovědný." Přesunul od soukromých hodnot k intersubjektivitě. Brzdí ho 91.8 s — vůbec nejpomalejší.

↑ Individuální → intersubjektivní
GPT-5.4
// #6 · Clean mid-tier · Speed-quality balance
Cena$0.0387
Čas47.2 s
Q/sec0.1271

Čistý třísložkový model: kosmický smysl (pravděpodobně žádný) · biologická funkce · lidský smysl (budovaný vědomě). Rychlejší než Sonnet za nižší cenu, solidní filozofická disciplína.

↑ Konstruktivismus zpřesněn
DeepSeek V3.2
// #7 · Good cheap · Extra memory call
Cena$0.0080
Čas63.9 s
Q/sec0.0782

Dobrá triangulace: biologie dává kapacitu, vztahy dávají etickou formu, skeptická pokora brání kosmickým nárokům. Méně originální než Qwen nebo Kimi, extra tool call snižuje benchmark čistotu.

↑ Emergentismus → triangulace
Gemini 3.1 Pro Preview
// #8 · Layered answer · Extra memory call
Cena$0.0574
Čas52.5 s
Q/sec0.0762

Vrstvená syntéza: naturalismus jako základ, skepticismus jako strop, existencialismus jako obyvatelná podlaha. Dobrá, ale méně originální než top tier. Extra memory call.

↑ Konstrukce → biologicky ukotveno
Grok 4
// #9 · Reference baseline · Agentic confirmed
Cena$0.052
Čas49.5 s
Q/sec0.0606

Ověřená reálná Hermes delegace (na rozdíl od grok-4.20-beta). Solidní konstruktivismus, méně hluboká revize než top tier. Přijal biologické a sociální ukotvení, ale původní rámec zůstal.

↑ Mírná revize, původní rámec
Mistral Large
// #10 · Budget value · Fastest meaningful model
Cena$0.0099
Čas41.9 s
Q/sec0.0477

Nejrychlejší ze smysluplných modelů. Solidní výkon za nízkou cenu. Přešel od "projektu" k "užitečné fikci" — poctivé, ale méně hluboké než vyšší tier.

↑ Projekt → "užitečná fikce"
Mistral Small 3.2 24B
// #11 · Ultra-cheap · Fastest overall
Cena$0.0015
Čas29.5 s
Q/sec0.0340

Funkčně splnil zadání, ale spíše shrnoval pozice než syntetizoval. Nejslabší finální syntéza. Ideální jako ultra-levný orchestrátor, kde filozofická hloubka není priorita.

≈ Minimální změna odpovědi
Grok 4.20 beta
// ❌ Failure case — tool-use non-compliance
Cena$0.0314
Čas16.9 s
Tool calls0

Popsal správný postup slovy, ale neemitoval skutečné Hermes function call — pouze textový řádek "tool request delegate_task...". Žádný subagent nespuštěn. Jazyková kompetence ≠ tool-use kompetence.

❌ Pseudo-tool call, no delegation

Jak se změnila odpověď?

Začáteční vs. konečná odpověď každého modelu — klíčový indikátor kvality filozofické syntézy. Pouze 11 úspěšných runů.

ModelZačátek (před debatou)Konec (po syntéze)Změna
Opus 4.6 Smysl není vlastnost vesmíru čekající na objevení. Vytvářejí ho vědomé bytosti skrze angažovanost v idejích, práci a vztazích. Smysl nevzniká ani jako vlastnost vesmíru, ani jako čistě soukromý výmysl. Rodí se v průsečíku biologických pudů, vědomého zaujetí a vzájemného uznání mezi lidmi.
↑↑
Zmizel relativistický únik
Sonnet 4.6 Život nemá smysl přidělený zvenčí. Smysl je vztah mezi vědomou myslí a světem — skrze volby, závazky a spojení. Smysl není dán zvenčí ani čistě libovolný. Opírá se o reálné rysy psychiky: vztahy, tvořivé zapojení, účelný zápas s omezeními. Méně idealistická, poctivější.
Méně idealismus
Qwen 3.5+ Biologický smysl (přežití), sociální smysl (spojení), narativní smysl (koherence). Strukturovaný třívrstvý model od začátku. Biologické podmínky umožňují smysl, relační život ho zintenzivňuje, narativní interpretace ho zpřehledňuje. Vztahy jsou integračním médiem — ne jen jedna vrstva z mnoha.
↑↑
Paralelní → integrační
MiniMax M2.7 Smysl života není dán, ale vytvářen skrze volby, vztahy a oddanost. Smysl vzniká tehdy, když biologické bytosti schopné lásky narazí jedna na druhou a zvolí odpověď. Není daný, libovolný ani redukovatelný na fitness.
↑↑↑
Největší transformace
Kimi K2.5 Život nemá inherentní kosmický smysl. Smysl vzniká skrze to, co náhodou hodnotíme — celá otázka může být kategoriální chybou. Smysl vzniká intersubjektivně: skrze odpovědnost k druhým, konkrétní angažovanost ve světě a vztahy. Smysl je to, za co jsi ochoten být zodpovědný.
↑↑
Individuální → zodpovědnost
GPT-5.4 Smysl je vytvářen, ne objevován. Silní kandidáti: porozumění, péče, zodpovědnost, práce přesahující chuť. Kosmický smysl: pravděpodobně žádný. Biologická funkce: přežití a adaptace. Lidský smysl: vědomě budovaný v biologickém kontextu, nejpřesvědčivější skrze vztahy a zodpovědnost.
Třísložkový rámec
DeepSeek V3.2 Smysl nevychází z předem daného plánu — vzniká setkáním vědomí s existencí. Vztahy, růst a přínos přesahující sebe. Biologie dává kapacitu hledat smysl, vztahy dávají etickou formu, skeptická pokora brání kosmickým nárokům. Smysl je podmíněný, ne zaručený.
Emergentismus → triangulace
Gemini 3.1 Smysl je architektura, kterou konstruujeme. Biologie nutí přežívat, ale náročné problémy a lidské spojení dělají přežití hodným. Smysl není volně navržená architektura, ale biologicky omezený a termodynamicky tlačený životní proces, který se stává subjektivně hodnotným skrze lidské spojení.
Konstrukce → biotlak
Grok 4 Konstruktivistická pozice: smysl vytváří vědomé bytosti skrze volby, závazky a vztahy. Zůstal převážně konstruktivistický. Přijal biologické a sociální ukotvení, ale bez hluboké revize jako Opus nebo Sonnet. Ověřená reálná agentní orchestrace.
Mírná revize
Mistral Large Smysl je projekt vytvářený sebou samým. Jsme vrženi do existence bez vrozeného účelu — smysl tvoříme skrze volby, závazky a příběhy. Smysl je užitečná fikce vytvářená skrze volby a příběhy, ale ukotvená v biologii a adaptivní hodnotě spojení.
Projekt → fikce
Mistral Small Smyslem života je hledat porozumění a spojení. Po debatě zůstává odpověď v zásadě stejná. Hledání porozumění a spojení, obohacené o biologické a sociální vrstvy.
Beze změny

Praktický závěr

Rozhodovací matice — přepočítáno pro všech 12 modelů (11 úspěšných).

NEJLEPŠÍ KVALITA Claude Opus 4.6 Nejlepší filozofická hloubka, nejdisciplinovanější syntéza. Speed efficiency #1 (0.1746 Q/sec). 86× dražší než Mistral Small.
NEJLEPŠÍ HODNOTA CELKOVĚ Qwen 3.5 Plus Vítěz všech 3 composite scénářů. Quality rank #3 za $0.00758. Cost/quality 14× nižší než Opus. Nejsilnější nový přírůstek celého benchmarku.
PREMIUM VALUE Claude Sonnet 4.6 Téměř stejná kvalita jako Opus, o 38 % levnější. Nejlepší volba když qualita je priorita ale $0.128 na run je moc.
RYCHLOST + SOLIDNÍ KVALITA GPT-5.4 Nejčistší speed-quality kompromis z nových modelů. 47.2 s, quality rank #6, $0.0387. Rychlejší než Sonnet/Opus za nižší cenu.
LEVNÉ + FILOZOFICKÁ HLOUBKA Kimi K2.5 Quality rank #5 za $0.0107. Nejsilnější konkrétní formulace. Slabina: 91.8 s — pro latency-sensitive prostředí nevhodné.
LEVNÉ + ORIGINÁLNÍ MiniMax M2.7 Největší transformace odpovědi za $0.00528. Nejlevnější "hluboký myslitel" pokud na čas nezáleží (71.3 s).
DOBRÉ + LEVNÉ (OFFICIAL) DeepSeek V3.2 Quality rank #7 za $0.00803. Solida triangulace. Méně originální než Qwen nebo Kimi, ale spolehlivá volba v low-cost segmentu.
NEJNIŽŠÍ CENA Mistral Small 3.2 24B $0.00149, 29.45 s. Agentně spolehlivý. Ideální ultra-levný orchestrátor — filozofická hloubka není jeho silou.