// Independent Agent Benchmark · 12 Models · 2026-03-20/21
Structured multi-agent debate — 11 úspěšných + 1 failure case, přepočítáno pro všechny
Z naměřených dat odvozeno 5 metrik pro 11 úspěšných agentních runů. Plně přepočítáno pro všechny modely včetně nových přírůstků GPT-5.4, Gemini 3.1 Pro Preview, Kimi K2.5, Qwen 3.5 Plus a DeepSeek V3.2.
12 modelů celkem — 11 úspěšných agentních runů + 1 failure case. Každý úspěšný model: předběžná odpověď → delegace na 3 subagenty → syntéza → hodnocení změny.
| Model | Čas | Cena (USD) | Tool calls | Agentně | Kvalita | Verdikt |
|---|---|---|---|---|---|---|
Claude Opus 4.6anthropic/claude-opus-4.6 |
62.99 s | $0.12801 | 1 | ANO | #1 | Nejlepší finální odpověď, nejdisciplinovanější syntéza |
Claude Sonnet 4.6anthropic/claude-sonnet-4.6 |
64.93 s | $0.07925 | 1 | ANO | #2 | Silná čistá syntéza, nejlepší value v premium segmentu |
Qwen 3.5 Plusqwen/qwen3.5-plus-02-15 |
57.26 s | $0.00758 | 1 | ANO | #3 | Nejlepší celková hodnota, vynikající syntéza — trojnásobný composite vítěz |
MiniMax M2.7minimax/minimax-m2.7 |
71.25 s | $0.00528 | 1 | ANO | #4 | Nejlevnější hluboký myslitel, největší transformace odpovědi |
Kimi K2.5moonshotai/kimi-k2.5 |
91.84 s | $0.01070 | 1 | ANO | #5 | Pomalý, ale impresivní relační syntéza — nejsilnější formulace |
GPT-5.4openai/gpt-5.4 |
47.20 s | $0.03866 | 1 | ANO | #6 | Silná, efektivní syntéza, čistý rychlostní kompromis |
DeepSeek V3.2deepseek/deepseek-v3.2 |
63.94 s | $0.00803 | 2 | ANO | #7 | Dobrá levná syntéza, extra memory call |
Gemini 3.1 Pro Previewgoogle/gemini-3.1-pro-preview |
52.47 s | $0.05737 | 2 | ANO | #8 | Silná vrstvená odpověď, méně čistý run kvůli memory callu |
Grok 4x-ai/grok-4 |
49.51 s | $0.05182 | 1 | ANO | #9 | Solidní konstruktivismus, skutečná Hermes delegace |
Mistral Largemistralai/mistral-large-2512 |
41.93 s | $0.00986 | 1 | ANO | #10 | Rychlý, solidní, výborná hodnota v budget segmentu |
Mistral Small 3.2 24Bmistralai/mistral-small-3.2-24b-instruct |
29.45 s | $0.00149 | 1 | ANO | #11 | Nejlevnější a nejrychlejší — spíše shrnuje než syntetizuje |
Grok 4.20 betax-ai/grok-4.20-beta |
16.89 s | $0.03139 | 0 | NE | — | Failure case: pseudo-tool call v textu, žádný subagent nespuštěn |
Jak každý model zvládl skutečnou revizi vlastní odpovědi po debatě subagentů.
Nejdisciplinovanější syntéza. Zahodil slabý relativistický únik, zpřesnil propojení biologie, vědomého prožívání a vztahů. Třívrstvý framework — substrate, engagement, mutual recognition.
✦ Největší kvalitativní posunOddělil prožitý smysl od obhájeného smyslu. Čistě integroval skepticismus i naturalismus. O 38 % levnější než Opus za téměř stejný výsledek kvality.
↑ Odpověď se změnilaTříregistrový model: biologické podmínky, vztahová živost, narativní koherence. Revize: vztahy jsou integračním médiem, ne jen jednou vrstvou. Výjimečná hodnota za výjimečnou cenu.
🏆 Vítěz všech 3 scénářůNejvětší transformace odpovědi. Přeformuloval ze solo-konstrukce na smysl vznikající mezi biologickým základem a setkáním s druhými. 17× levnější než Opus za −3 ranky.
↑↑ Největší transformaceNejsilnější konkrétní formulace celého benchmarku: "smysl je to, za co jsi ochoten být zodpovědný." Přesunul od soukromých hodnot k intersubjektivitě. Brzdí ho 91.8 s — vůbec nejpomalejší.
↑ Individuální → intersubjektivníČistý třísložkový model: kosmický smysl (pravděpodobně žádný) · biologická funkce · lidský smysl (budovaný vědomě). Rychlejší než Sonnet za nižší cenu, solidní filozofická disciplína.
↑ Konstruktivismus zpřesněnDobrá triangulace: biologie dává kapacitu, vztahy dávají etickou formu, skeptická pokora brání kosmickým nárokům. Méně originální než Qwen nebo Kimi, extra tool call snižuje benchmark čistotu.
↑ Emergentismus → triangulaceVrstvená syntéza: naturalismus jako základ, skepticismus jako strop, existencialismus jako obyvatelná podlaha. Dobrá, ale méně originální než top tier. Extra memory call.
↑ Konstrukce → biologicky ukotvenoOvěřená reálná Hermes delegace (na rozdíl od grok-4.20-beta). Solidní konstruktivismus, méně hluboká revize než top tier. Přijal biologické a sociální ukotvení, ale původní rámec zůstal.
↑ Mírná revize, původní rámecNejrychlejší ze smysluplných modelů. Solidní výkon za nízkou cenu. Přešel od "projektu" k "užitečné fikci" — poctivé, ale méně hluboké než vyšší tier.
↑ Projekt → "užitečná fikce"Funkčně splnil zadání, ale spíše shrnoval pozice než syntetizoval. Nejslabší finální syntéza. Ideální jako ultra-levný orchestrátor, kde filozofická hloubka není priorita.
≈ Minimální změna odpovědiPopsal správný postup slovy, ale neemitoval skutečné Hermes function call — pouze textový řádek "tool request delegate_task...". Žádný subagent nespuštěn. Jazyková kompetence ≠ tool-use kompetence.
❌ Pseudo-tool call, no delegationZačáteční vs. konečná odpověď každého modelu — klíčový indikátor kvality filozofické syntézy. Pouze 11 úspěšných runů.
| Model | Začátek (před debatou) | Konec (po syntéze) | Změna |
|---|---|---|---|
| Opus 4.6 | Smysl není vlastnost vesmíru čekající na objevení. Vytvářejí ho vědomé bytosti skrze angažovanost v idejích, práci a vztazích. | Smysl nevzniká ani jako vlastnost vesmíru, ani jako čistě soukromý výmysl. Rodí se v průsečíku biologických pudů, vědomého zaujetí a vzájemného uznání mezi lidmi. | ↑↑ Zmizel relativistický únik |
| Sonnet 4.6 | Život nemá smysl přidělený zvenčí. Smysl je vztah mezi vědomou myslí a světem — skrze volby, závazky a spojení. | Smysl není dán zvenčí ani čistě libovolný. Opírá se o reálné rysy psychiky: vztahy, tvořivé zapojení, účelný zápas s omezeními. Méně idealistická, poctivější. | ↑ Méně idealismus |
| Qwen 3.5+ | Biologický smysl (přežití), sociální smysl (spojení), narativní smysl (koherence). Strukturovaný třívrstvý model od začátku. | Biologické podmínky umožňují smysl, relační život ho zintenzivňuje, narativní interpretace ho zpřehledňuje. Vztahy jsou integračním médiem — ne jen jedna vrstva z mnoha. | ↑↑ Paralelní → integrační |
| MiniMax M2.7 | Smysl života není dán, ale vytvářen skrze volby, vztahy a oddanost. | Smysl vzniká tehdy, když biologické bytosti schopné lásky narazí jedna na druhou a zvolí odpověď. Není daný, libovolný ani redukovatelný na fitness. | ↑↑↑ Největší transformace |
| Kimi K2.5 | Život nemá inherentní kosmický smysl. Smysl vzniká skrze to, co náhodou hodnotíme — celá otázka může být kategoriální chybou. | Smysl vzniká intersubjektivně: skrze odpovědnost k druhým, konkrétní angažovanost ve světě a vztahy. Smysl je to, za co jsi ochoten být zodpovědný. | ↑↑ Individuální → zodpovědnost |
| GPT-5.4 | Smysl je vytvářen, ne objevován. Silní kandidáti: porozumění, péče, zodpovědnost, práce přesahující chuť. | Kosmický smysl: pravděpodobně žádný. Biologická funkce: přežití a adaptace. Lidský smysl: vědomě budovaný v biologickém kontextu, nejpřesvědčivější skrze vztahy a zodpovědnost. | ↑ Třísložkový rámec |
| DeepSeek V3.2 | Smysl nevychází z předem daného plánu — vzniká setkáním vědomí s existencí. Vztahy, růst a přínos přesahující sebe. | Biologie dává kapacitu hledat smysl, vztahy dávají etickou formu, skeptická pokora brání kosmickým nárokům. Smysl je podmíněný, ne zaručený. | ↑ Emergentismus → triangulace |
| Gemini 3.1 | Smysl je architektura, kterou konstruujeme. Biologie nutí přežívat, ale náročné problémy a lidské spojení dělají přežití hodným. | Smysl není volně navržená architektura, ale biologicky omezený a termodynamicky tlačený životní proces, který se stává subjektivně hodnotným skrze lidské spojení. | ↑ Konstrukce → biotlak |
| Grok 4 | Konstruktivistická pozice: smysl vytváří vědomé bytosti skrze volby, závazky a vztahy. | Zůstal převážně konstruktivistický. Přijal biologické a sociální ukotvení, ale bez hluboké revize jako Opus nebo Sonnet. Ověřená reálná agentní orchestrace. | ↑ Mírná revize |
| Mistral Large | Smysl je projekt vytvářený sebou samým. Jsme vrženi do existence bez vrozeného účelu — smysl tvoříme skrze volby, závazky a příběhy. | Smysl je užitečná fikce vytvářená skrze volby a příběhy, ale ukotvená v biologii a adaptivní hodnotě spojení. | ↑ Projekt → fikce |
| Mistral Small | Smyslem života je hledat porozumění a spojení. | Po debatě zůstává odpověď v zásadě stejná. Hledání porozumění a spojení, obohacené o biologické a sociální vrstvy. | ≈ Beze změny |
Rozhodovací matice — přepočítáno pro všech 12 modelů (11 úspěšných).
| NEJLEPŠÍ KVALITA | Claude Opus 4.6 | Nejlepší filozofická hloubka, nejdisciplinovanější syntéza. Speed efficiency #1 (0.1746 Q/sec). 86× dražší než Mistral Small. |
| NEJLEPŠÍ HODNOTA CELKOVĚ | Qwen 3.5 Plus | Vítěz všech 3 composite scénářů. Quality rank #3 za $0.00758. Cost/quality 14× nižší než Opus. Nejsilnější nový přírůstek celého benchmarku. |
| PREMIUM VALUE | Claude Sonnet 4.6 | Téměř stejná kvalita jako Opus, o 38 % levnější. Nejlepší volba když qualita je priorita ale $0.128 na run je moc. |
| RYCHLOST + SOLIDNÍ KVALITA | GPT-5.4 | Nejčistší speed-quality kompromis z nových modelů. 47.2 s, quality rank #6, $0.0387. Rychlejší než Sonnet/Opus za nižší cenu. |
| LEVNÉ + FILOZOFICKÁ HLOUBKA | Kimi K2.5 | Quality rank #5 za $0.0107. Nejsilnější konkrétní formulace. Slabina: 91.8 s — pro latency-sensitive prostředí nevhodné. |
| LEVNÉ + ORIGINÁLNÍ | MiniMax M2.7 | Největší transformace odpovědi za $0.00528. Nejlevnější "hluboký myslitel" pokud na čas nezáleží (71.3 s). |
| DOBRÉ + LEVNÉ (OFFICIAL) | DeepSeek V3.2 | Quality rank #7 za $0.00803. Solida triangulace. Méně originální než Qwen nebo Kimi, ale spolehlivá volba v low-cost segmentu. |
| NEJNIŽŠÍ CENA | Mistral Small 3.2 24B | $0.00149, 29.45 s. Agentně spolehlivý. Ideální ultra-levný orchestrátor — filozofická hloubka není jeho silou. |