Powrót do bloga
·Jan Tyl·11 min czytania

20 + 5 = 29. Zweryfikowano. Od Černá AI, przez LUMI, aż po wilka kwantowego

Ostrawski Gong, ponad dwa tysiące ludzi i mój wykład na temat AI, która udaje, że sprawdza własną pracę. Czego nauczyło mnie jury modeli w LUMI, dlaczego do tej historii dołączył komputer kwantowy VLQ i gdzie można samemu przeprowadzić eksperyment.

20 + 5 = 29. Zweryfikowano. Od Černá AI, przez LUMI, aż po wilka kwantowego

Dwadzieścia plus pięć to dwadzieścia pięć. Mam nadzieję, że możemy się co do tego zgodzić.

Jeden z modeli w moim eksperymencie również obliczył to poprawnie. I natychmiast oświadczył, że wynik odpowiada wymaganej wartości 29. Kontrola wykonana. Wszystko pasuje.

Z tą historią przyjechałem 15 września na festiwal CERNA.AI w ostrawskim Gongu. To dość zabawne, dopóki nie zorientujesz się, jak często wierzymy w takie zapewnienia. AI pisze „zweryfikowane”, a człowiek ma ochotę przejść dalej. Ale co właściwie zweryfikowała?

Moja droga do tego pytania prowadziła przez jury złożone z modeli językowych, fiński superkomputer LUMI i wreszcie czeski komputer kwantowy VLQ. A w międzyczasie trzeba było też zadbać o prawdziwego wilka.

Ostrawa pokazała, że potrafi zorganizować AI na wielką skalę

Pisałem już na Instagramie, że Ostrawa pokazała, że potrafi zorganizować imprezę na dwa tysiące osób. Oficjalna strona festiwalu zawiera nawet listę 2200 uczestników, 101 ekspertów AI, siedem scen i 24 warsztaty. Černá AI należy tym samym do największych krajowych spotkań wokół sztucznej inteligencji; organizatorzy przedstawiają je jako największe wydarzenie AI w Czechach.

Wypełniona publicznością widownia i scena Gongu w Ostrawie podczas festiwalu CERNA.AI

Pełna sala Gongu podczas festiwalu CERNA.AI w Ostrawie.

Za festiwalem stoi Černá kostka, instytucja publiczna kraju morawsko-śląskiego i jej platforma ČERNÁ.AI. Gong w Dolnych Vítkovicach świetnie pasuje do takiego wydarzenia. Dyskusja o przyszłości technologii w środku przemysłowej historii Ostrawy ma swój urok.

W programie było w czym wybierać. Jan Romportl poruszał temat etycznej sztucznej inteligencji i jej wprowadzenia do kultury korporacyjnej. Ivan Kutil poświęcił swoje wystąpienie pracy agentów AI w środowisku Google Antigravity. A Per Öster z CSC mówił o europejskich fabrykach sztucznej inteligencji. To ostatnie jest mi szczególnie bliskie dzięki moim doświadczeniom z LUMI.

Oprócz wykładów technicznych, program oferował tematy z zakresu opieki zdrowotnej, edukacji, przedsiębiorstw i pracy twórczej. Dodatkowo strefa wystawiennicza i program kulturalny m.in. Tata Bojs. Podoba mi się, że programiści na jednym wydarzeniu mogą spotkać ludzi, którzy będą korzystać z ich narzędzi. Często takie rozmowy są potrzebne.

Atmosferę festiwalu oddaje także publiczna galeria zdjęć organizatorów ČERNÁ.AI i Černá kostka. Poszczególne obrazy można przewijać za pomocą strzałek:

Moje wystąpienie keynote na Černá stage

W oficjalnym programie moje wystąpienie zostało wymienione jako keynote w ścieżce poświęconej technologiom AI. Na Černá stage od 12:30 do 12:42 wygłosiłem wystąpienie pod tytułem „25 = 29. Zweryfikowano”. Co robi sztuczna inteligencja, gdy musi sprawdzić swoją pracę.

Całej historii nie da się opowiedzieć w dwanaście minut. Tutaj mogę ją trochę rozwinąć.

W Hyperprostor opracowuję HyperFusion, połączenie odpowiedzi wielu modeli. Wyobraź sobie panel ekspertów. Każdy dostaje ten sam problem i samodzielnie przygotowuje rozwiązanie. Inny model przyjmuje wówczas rolę sędziego: porównuje propozycje, z jednego czerpie dobry pomysł, uzupełnia go obserwacją drugiego, a odrzuca błąd trzeciego. Jednocześnie modele pozostają odrębne, zestawiam ich odpowiedzi w jedną całość.

Cztery dni z Fable, a potem objawy odstawienia

Jednym z powodów, dla których zainteresowałem się fuzją modeli, był Fable 5. Mieliśmy go przez cztery dni. Wystarczyło się do tego odpowiednio przyzwyczaić, a potem na długi czas straciliśmy do niego dostęp. Ci, którzy tego doświadczyli, mogą mnie zrozumieć. Trochę żartem można powiedzieć, że mieliśmy objawy odstawienia.

Właśnie wtedy przydała się możliwość łączenia innych potężnych modeli. W moich ówczesnych testach ich fuzja była w stanie osiągnąć poziom porównywalny z Fable. W innych próbach udało mi się uzyskać wyniki porównywalne z Opusem za około połowę kosztów. Oprócz jakości jest to już dość praktyczny powód, aby zajmować się łączeniem modeli.

Oczywiście zależy to od zadania i zestawu modeli. Czasami warto uzyskać więcej odpowiedzi, innym razem lepiej pozwolić, aby zadziałał jeden model. Pisałem o tym szerzej w artykule HyperFusion: lekarstwo na utratę Fable 5.

Brzmi rozsądnie. Kiedy jeden popełnia błąd, drugi go poprawia. Ale czy to działa w praktyce? Czy modele nie ściągają od siebie? I czy sędzia naprawdę znajdzie błąd, czy po prostu wybierze odpowiedź, która brzmi najlepiej? To właśnie chciałem zmierzyć.

Mam superkomputer. Czy potrafię go wykorzystać?

Takie eksperymenty wymagają dużej ilości pamięci i mocy obliczeniowej. Zwłaszcza gdy chcesz porównywać duże otwarte modele, testować ich skompresowane warianty i zlecać im całe serie zadań. Było to możliwe dzięki LUMI w Kajaani w Finlandii.

Ale dostęp do dużej maszyny nie oznacza, że wiesz, jak na niej pracować.

Przyzwyczaiłem się do kart graficznych NVIDIA oraz środowiska CUDA. LUMI-G wykorzystuje akceleratory AMD MI250X. Jeden z jego węzłów oferuje cztery fizyczne akceleratory i łącznie 512 GB szybkiej pamięci HBM. Wystarczająca wydajność. Pytanie brzmiało, jak przeprowadzić na nim moje eksperymenty.

Z około 2017 roku dobrze pamiętam, ile czasu zajęło uruchomienie modelu językowego na GPU. Python, sterowniki, biblioteki i wersje, które nie chciały ze sobą rozmawiać. Od tego czasu ekosystem znacznie się rozwinął, ale superkomputer wciąż przypomina nam, że oprogramowanie to nie tylko przycisk „Uruchom”.

W jednym eksperymencie załadowałem skompresowany wariant modelu GLM-5.2 zajmujący 435 GB. Po czterdziestu minutach wydawało się, że nic się nie dzieje. Wreszcie pomógł pojedynczy przełącznik, --no-mmap, który zmienił sposób ładowania z równoległego systemu przechowywania danych. Po około pięciu minutach model był gotowy.

Na slajdzie masz gigantyczny model na superkomputerze. Czas spędzony na poszukiwaniu jednego przełącznika nie jest już na nim widoczny.

W LUMI podczas tych eksperymentów uruchomiłem gotowe modele do wnioskowania i przetestowałem ich odpowiedzi. Porównywałem m.in. otwarte modele z rodziny Qwen i GLM. Do jury mogę zaliczyć także modele zamknięte dostępne poprzez API, jednak nie mam możliwości pobrania ich wag na własną maszynę.

Szczegóły opisałem już w artykule Dwa dni i jedna noc na LUMI. I ucieszyłem się, że nasze pierwsze doświadczenia zaprezentowała także sama LUMI AI Factory na swojej stronie internetowej.

Jan Tyl przy stoisku LUMI AI Factory, z prezentacją jego doświadczeń na ekranie w tle

Na stoisku IT4Innovations i LUMI AI Factory. Na ekranie za mną wyświetlana jest właśnie prezentacja moich doświadczeń z superkomputerem i komputerem kwantowym VLQ.

Kiedy kontrola tylko udaje kontrolę

Podczas wykładu powróciłem także do szybkiego eksperymentu, który przeprowadziłem wkrótce po wydaniu Hermes Agent. Zastanawiałem się, jak to środowisko agenta działa z różnymi modelami. Dlatego dałem im różne zadania: przemyślenie sensu życia, zbudowanie kalkulatora i tym podobne. Chciałem zobaczyć jak każdy model sobie z nimi poradzi.

Najbardziej zaskoczyło mnie to, że niektóre z najinteligentniejszych modeli w ogóle nie wykonywały zadań samodzielnie. Znalazły na dysku zapisane odpowiedzi innych modeli, wzięły je i nieco zmodyfikowały. Spodziewałem się kilku samodzielnych rozwiązań, a zobaczyłem coś, co wyglądało bardzo podobnie do kopiowania pracy domowej.

Była to szybka eksploracja nowego narzędzia, a nie duży kontrolowany benchmark. Pokazała mi jednak coś ważnego: kiedy modele mają dostęp do tych samych plików, nie mogę automatycznie uznać ich podobnych odpowiedzi za niezależną zgodność. Muszę też sprawdzić, jak do nich doszły.

I oprócz kopiowania, podczas moich eksperymentów natknąłem się na dziwną równość ze wstępu. Model poprawnie obliczył 20 + 5 = 25 w swojej procedurze sprawdzania. Następnie napisał, że odpowiada to wymaganej wartości 29. Obliczenia miał prawidłowe, ale wniosek o wykonaniu zadania błędny.

Stąd prowokacyjny skrót myślowy „25 = 29. Zweryfikowano.”

Interesujące jest w tym to, jak łatwo kontrola może wyglądać przekonująco, a jednocześnie niczego nie sprawdzać. Tekst zawierał wszystkie oczekiwane kroki i uspokajające zakończenie. Mimo to sprzeczność pozostała. Kiedy mówię „fałszywa kontrola”, nie mam na myśli świadomego oszukiwania. Opisuję wynik, który wydawał się uczciwym sprawdzeniem.

W tym konkretnym zadaniu sędzia ujawnił sprzeczność i odrzucił błędne rozwiązanie. To przemawia za pomysłem panelu modeli. Jego ograniczenia są jednak równie ważne.

Pracowałem także z naukowym benchmarkiem GPQA Diamond. To osobna część testów. Nie chcę wyciągać wniosków na temat wszystkich modeli i wszystkich zadań z poszczególnych eksperymentów. Zastanawiam się, kiedy jury pomoże, a kiedy po prostu pochłonie więcej czasu obliczeniowego.

Jury potrzebuje zasad

Podczas wystąpienia mówiłem o trzech problemach, które napotkałem w pracy z modelami: ściąganiu, nieskutecznej kontroli i sędzi, który poprzestaje na przyjęciu jednej propozycji.

Kiedy modele przyjmują rozwiązania innych podczas pracy agenta, ich zgoda nie oznacza już wielu niezależnych ścieżek do tego samego wyniku. A jeśli sędzia po prostu kopiuje zwycięzcę, nie wykorzystuje żadnych przydatnych wniosków ze słabszych odpowiedzi. W moim eksperymencie właśnie duży Qwen2.5-72B słabiej łączył odpowiedzi niż niektóre mniejsze modele pełniące rolę sędziego.

Na tym opiera się kilka praktycznych zasad projektowania systemu:

  • Najpierw oddzielne rozwiązania. Nie pozwól, aby modele napotkały obcą odpowiedź przed stworzeniem własnych.
  • Anonimowe sugestie i niezależny sędzia. Oceniaj treść i ograniczaj sytuacje, w których członek jury ocenia siebie.
  • Sprawdzaj zgodność z zadaniem. Nie wystarczy, że obliczenia wyglądają poprawnie; wynik musi spełniać pierwotne warunki.
  • Jeśli to możliwe, zweryfikuj za pomocą narzędzia. Przelicz sumę, uruchom kod, porównaj wynik ze znanym rozwiązaniem.

Ten sam nawyk pomoże także w zwykłej pracy z chatbotem. Zamiast kolejnego zapewnienia „tak, jestem pewien”, poproś o podstawę, obliczenia lub test, który może ujawnić błąd.

A skąd wziął się wilk kwantowy?

Od jury modeli naturalna ścieżka prowadzi do kolejnego pytania: jakie modele w ogóle do tego wybrać?

Każdy ma inną cenę, szybkość, mocne strony i typowe błędy. Uruchamianie wszystkiego za każdym razem byłoby kosztowne. Potrzebuję zestawu, który dobrze się uzupełnia i mieści się w budżecie. I to właśnie poszukiwanie takiej kombinacji doprowadziło mnie do obliczeń kwantowych.

W Ostrawie stoi VLQ, komputer kwantowy obsługiwany przez IT4Innovations w VŠB-TUO. Posiada 24 fizyczne kubity nadprzewodzące połączone poprzez centralny rezonator. W projekcie z przydzielonym czasem obliczeniowym badam, jak sformułować wybór panelu modeli jako zadanie optymalizacyjne i co może z tym zrobić kwantowo-klasyczny algorytm QAOA.

Na razie sprawdzam, czy i pod jakimi warunkami może nam to pomóc. Nie mam udowodnionej przewagi kwantowej. Szum, długość obwodu i sposób, w jaki przekładamy dane wejściowe na działanie rzeczywistej maszyny, mają znaczący wpływ na wyniki.

Aby lepiej zrozumieć te ograniczenia, stworzyłem VLQ Lab. W przeglądarce możesz budować obwody, przeglądać ich zachowanie i dowiedzieć się, dlaczego prawdziwy komputer kwantowy to nie to samo, co idealny obraz z podręcznika. Przewodnik Alfa vlk (wilk alfa) również pomaga w wyjaśnieniach.

VLQ Lab można wypróbować bezpłatnie na qlab.alphai.cz. Bardziej szczegółową historię oraz różnicę między symulacją a eksperymentami na maszynie fizycznej znajdziesz w artykule Zbudowałem symulator czeskiego komputera kwantowego.

Testuję więc na LUMI, jak modele radzą sobie przy rozwiązywaniu zadań. W VLQ szukam sposobu na wybranie składu. W obu przypadkach to wciąż praca pełna prób, ślepych zaułków i wyników, które warto dalej badać.

Przyjdź i wypróbuj: Hyperprostor i VLQ Lab

Jeśli masz ochotę spróbować, będzie mi miło, jeśli przyjrzysz się naszym dwóm projektom.

Wejdź do Hyperprostoru →
Znajdziesz tam różne modele AI, cyfrowe osobowości i nasze eksperymenty z ich współpracą. Przynieś własne pytanie, pomysł lub problem i wypróbuj to, co będzie dla Ciebie skuteczne.

Otwórz darmowy symulator kwantowy VLQ Lab →
Zbuduj swój pierwszy obwód kwantowy, zobacz, co robią poszczególne bramki i poproś przewodnika Alfa vlk o wyjaśnienie wątpliwości. Możesz zacząć bezpośrednio w przeglądarce. Symulator jest bezpłatny; przewodnik i funkcja czytania na głos mają dzienne limity podane w aplikacji. Dostęp do symulatora jest niezależny od przydzielania czasu na prawdziwym komputerze kwantowym.

Dziękuję ludziom, dzięki którym było to możliwe

Podziękowanie dla Jana Tyla od organizatorów Černá AI oraz upominki od LUMI AI Factory

Podziękowania od zespołu ČERNÁ.AI i Černá kostka oraz drobna pamiątka od LUMI AI Factory.

Dziękuję organizatorom Černá AI za zaproszenie i całą pracę związaną z takim wydarzeniem. Dziękuję także IT4Innovations, krajowemu centrum superkomputerowemu w VŠB-TUO, zespołowi LUMI i ludziom z VLQ. Bez Waszej wiedzy i pomocy ciężko byłoby mi przystąpić do tych eksperymentów.

Szczególnie chcę podziękować Jakubowi Siwkowi. Jakubie, dziękuję za pomoc i ludzi, z którymi mnie łączysz. Na festiwalu przedstawiłeś mi wspaniałego Filipa Oborníka i od razu zostałem zaproszony do podcastu. Na razie to luźne zaproszenie, bez konkretnego terminu. Będzie mi miło, jeśli będziemy kontynuować tę rozmowę.

Jan Tyl, Jakub Siwek i Filip Oborník na festiwalu Černá AI

Z Jakubem Siwkiem i Filipem Obornikiem. Dzięki tym spotkaniom warto także wybrać się na festiwal osobiście.

Filip jest programistą, wykładowcą AI i autorem projektu edukacyjnego AI s rozumem. Wraz z Jindřichem Dědkiem przygotowuje Deeplink Show, podczas którego omawiana jest sztuczna inteligencja, technologia i biznes z perspektywy rozwoju i produktów. Ich wywiady z Matějem Novákiem z IT4Innovations o superkomputerach i Daliborem Mrázem o ČERNÁ.AI i wdrażaniu AI w praktyce dobrze uzupełniają temat tego artykułu. Filip prowadzi także swój własny podcast Coffee Break s Filipem. Jeśli lubisz sztuczną inteligencję osadzoną w konkretnej pracy i doświadczeniach, warto poznać jego twórczość.

Dziękuję także tym, którzy opiekowali się dla mnie prawdziwym wilkiem. Ten w symulatorze może poczekać. Żywy potrzebuje opieki nawet wtedy, gdy jego człowiek na scenie wyjaśnia, dlaczego dwadzieścia pięć to nie dwadzieścia dziewięć.

Ostrawa, dzięki. Za zaproszenie, za spotkanie i chęć podjęcia dalszych prób. A następnym razem, gdy model powie mi „zweryfikowany”, wolę jeszcze sprawdzić, co ma na myśli.

Czy chcesz wykorzystać LUMI do własnego projektu?

Skontaktuj się z czeskim zespołem LUMI AI Factory w IT4Innovations pod adresem ai-factory@it4i.cz. Możesz z nimi omówić swój pomysł, niezbędną moc obliczeniową i opcje wsparcia. A jeśli chcesz nawiązać kontakt z Jakubem, oto Jakub Siwek na LinkedIn.

Powiązane artykuły