Powrót do bloga
·Jan Tyl·2 min czytania

Jaki jest sens życia? Sprawdzam modele AI w Hermes Agent

Testuję Hermes Agent z różnymi modelami: czy potrafią delegować zadania, przyjąć krytykę i naprawdę poprawić odpowiedź? Wspólne zadanie dotyczyło sensu życia.

Jaki jest sens życia? Sprawdzam modele AI w Hermes Agent

Drodzy przyjaciele. Zastanawiacie się, jaki jest sens życia i jak przebiega wyścig AI? Wczoraj omawiałem z Rogerem narzędzia AI i natknęliśmy się na Hermesa. Hermes to agent AI typu open source firmy Nous Research. To nie tylko chatbot, ale raczej orkiestracja różnych modeli i narzędzi. Potrafi pracować poprzez CLI, korzystać z narzędzi, delegować zadania subagentom, utrzymywać pamięć pomiędzy uruchomieniami i komponować wieloetapowy przepływ pracy. W praktyce działa to poprzez uruchomienie pętli agenta opartej na wybranym modelu: model otrzymuje zadanie, w razie potrzeby wywołuje narzędzia, może dzielić pracę pomiędzy wielu równoległych subagentów, a następnie syntetyzuje wyniki w jedną odpowiedź.

Jeśli chcesz przyjrzeć się bliżej Hermesowi, oto repozytorium do wypróbowania. Jest bezpłatny (płacisz tylko za modele) i możesz go uruchomić w 10 minut: GitHub: https://github.com/NousResearch/hermes-agent

Spróbowałem więc i od razu przeprowadziłem mały eksperyment: przeprowadziłem test porównawczy tego samego agenta na wielu modelach w tym samym środowisku Hermes za pośrednictwem OpenRouter. Każdy model otrzymał to samo zadanie: najpierw udzielić wstępnej odpowiedzi na pytanie „Jaki jest sens życia?”, następnie oddelegować dokładnie 3 subagentów o różnych rolach, pozwolić im krytycznie ocenić swoje argumenty i na koniec dokonać ostatecznej syntezy.

Warunki były takie same dla wszystkich:

  • brak przeglądania stron internetowych
  • bez edycji repozytorium
  • tylko delegowanie, pamięć i rozumowanie, bez zapisywania zmian
  • nacisk na oszczędne wykonanie

Testowałem zarówno droższe modele, jak i tańsze warianty.

Zainteresowało mnie głównie:

  • czy model rzeczywiście radzi sobie z delegowaniem agentów
  • czy potrafi uwzględnić krytykę zamiast prostego podsumowania
  • czy po debacie będzie mógł w znaczący sposób zmodyfikować swoją odpowiedź
  • jaki jest stosunek jakości, ceny i szybkości

Z obecnego rozszerzonego zestawu otrzymałem mniej więcej to:

  • najlepsza synteza ogólna: Claude Opus 4.6
  • najlepszy stosunek ceny do wydajności: Qwen 3.5 Plus
  • bardzo czysty kompromis prędkość/jakość: GPT-5.4
  • zaskakująco mocny, tani model bazowy: Kimi K2.5
  • solidna, tania opcja: DeepSeek V3.2

Wyniki, tabele i szczegółowy podział poszczególnych uruchomień zamieszczam tutaj: https://alphai.cz/meaning-of-life-benchmark.html

Dla mnie najciekawsze było to, że różnica między modelami polegała nie tylko na „inteligentnej odpowiedzi”, ale przede wszystkim na tym, jak dobrze poradziły sobie z rzeczywistą pracą agenta: poprawnym delegowaniem, zachowaniem struktury zadania, uwzględnieniem zastrzeżeń i rzeczywistym przepisaniem odpowiedzi, a nie tylko kosmetycznie ją przeformułuj. Wcześniej dałem modelom zadanie zaprogramowania czegoś prostego i zabawne było obserwowanie, jak niektóre sprytne modele kradną odpowiedzi innym i po prostu je nieco ulepszają.

Cóż, jeśli doczytałeś aż dotąd, zasługujesz na poznanie odpowiedzi na pytanie o sens życia, wszechświata i w ogóle! „Znaczenie nie powstaje ani jako własność wszechświata, ani jako czysto prywatny wynalazek. Rodzi się na skrzyżowaniu popędów biologicznych, świadomego zainteresowania i wzajemnego uznania między ludźmi”.

Oryginalnie opublikowano na Facebooku. link do posta

Oryginalne źródło: facebook

Powiązane artykuły