Eval modeli LLM: czym jest i jak go zrobić
Eval modeli LLM sprawdza, czy skill AI działa, zanim dotknie klientów. Poznaj rodzaje testów, metryki i proces w 5 krokach. Zobacz, jak ocenić asystenta!
Eval modeli LLM to powtarzalny test, który sprawdza, czy skill albo asystent AI działa tak, jak oczekujesz, zanim dotknie prawdziwych klientów. Zamiast wierzyć deklaracjom dostawcy, odpalasz model na gotowym zestawie pytań, porównujesz odpowiedzi z oczekiwanymi i dostajesz liczbę, na przykład 87 poprawnych odpowiedzi na 100 pytań. Ten artykuł jest dla właścicieli i menedżerów małych i średnich firm, które wdrażają albo planują wdrożyć chatbota lub asystenta AI i chcą oceniać jego jakość na faktach, nie na wrażeniach.
TL;DR: Eval to zestaw pytań testowych plus sposób oceniania odpowiedzi. Budujesz go w 5 krokach: zbierasz 30-100 prawdziwych pytań klientów, ustalasz poprawne odpowiedzi, wybierasz metodę oceny, odpalasz test i poprawiasz skilla tam, gdzie oblewa. Test powtarzasz po każdej zmianie modelu, promptu albo bazy wiedzy. Koszt startu to godziny pracy, nie licencje.
Eval modeli LLM w 60 sekund: definicja bez żargonu
Słowo eval to skrót od angielskiego *evaluation*, czyli ewaluacja. W świecie modeli językowych oznacza konkretny sprawdzian: dajesz modelowi listę zadań i mierzysz, ile z nich wykonał poprawnie. Najprostszy eval wygląda tak: 50 pytań, które klienci naprawdę zadają, oraz wzorcowe odpowiedzi napisane przez człowieka. Odpalasz skilla, porównujesz wyniki i widzisz, czy zmiana promptu pomogła, czy zaszkodziła.
Eval różni się od zwykłego testowania jedną rzeczą: powtarzalnością. Ręczne poklikanie po każdej zmianie daje wrażenia, eval daje liczbę, którą porównasz w czasie. Dlatego zespoły budujące asystentów AI traktują evale jak testy jednostkowe w programowaniu: każda zmiana przechodzi przez ten sam zestaw sprawdzeń.
Poznaj trzy pokrewne terminy. Benchmark to publiczny, standardowy eval, na którym porównują się dostawcy modeli (przykład: HumanEval ze 164 zadaniami programistycznymi). Skill to spakowana umiejętność modelu albo agenta: prompt, instrukcje i narzędzia do konkretnego zadania. Regresja to sytuacja, w której nowa wersja psuje coś, co wcześniej działało, a eval wykrywa ją, zanim zobaczą ją klienci.
Z czego składa się eval: 3 elementy
Każdy eval, prosty czy zaawansowany, ma te same trzy części:
- Zestaw zadań (dataset). Pytania albo polecenia wejściowe. Najlepsze pochodzą z prawdziwych rozmów z klientami, a nie z głowy autora. Dla chatbota firmowego wystarczy zacząć od 30-50 pytań skopiowanych z maili, czatu i telefonu.
- Oczekiwane odpowiedzi (ground truth). Wzorzec, z którym porównujesz wynik. Czasem to dokładna odpowiedź ("godziny otwarcia: 9-17"), czasem lista faktów, które muszą się pojawić, a czasem opis zachowania ("asystent prosi o numer telefonu, zanim umówi wizytę").
- Metoda oceny (grader). Sposób uznania odpowiedzi za poprawną. Może to być prosta reguła ("odpowiedź zawiera cenę 1 200 zł"), wykonanie kodu (testy jednostkowe sprawdzają wygenerowaną funkcję) albo drugi model oceniający (tzw. sędzia AI). Każdą metodę opisuję w kolejnej sekcji.
Te trzy elementy mieszczą się w jednym pliku. Popularny otwarty framework openai/evals definiuje eval właśnie tak: zestaw promptów plus logika sprawdzania wyników, uruchamiane jednym poleceniem. Do podobnych zadań służy też otwarty framework Inspect AI, używany między innymi do testów zgodności modeli z deklarowanymi zasadami.
Rodzaje ewaluacji: od prostych reguł po sędziego AI
Metodę oceny dobierasz do tego, co skill ma robić. Poniższa tabela porządkuje pięć podejść od najtańszego do najdroższego.
| Metoda | Jak działa | Kiedy się sprawdza | Słabość |
|---|---|---|---|
| Reguły tekstowe | Szukasz frazy albo wzorca (regex) w odpowiedzi | Godziny otwarcia, ceny, numery telefonów | Krucha wobec parafraz |
| Dopasowanie ścisłe | Odpowiedź musi zgadzać się ze wzorcem co do słowa | Testy wyboru, kody pocztowe, formaty danych | Karze poprawne odpowiedzi innymi słowami |
| Testy wykonywalne | Uruchamiasz kod albo sprawdzasz JSON schemą | Skille piszące kod, wywołania narzędzi, API | Wymaga środowiska testowego |
| Sędzia AI (LLM-as-judge) | Drugi model ocenia odpowiedź według rubryki 1-10 | Ton wypowiedzi, kompletność, grzeczność | Niedeterministyczny, wymaga kalibracji z człowiekiem |
| Ocena ludzka | Ekspert przegląda próbkę odpowiedzi | Decyzje wrażliwe, reklamacje, język marki | Droga i wolna, nie skaluje się |
W firmach zwykle wygrywa kombinacja: reguły łapią fakty (ceny, terminy, dane kontaktowe), a sędzia AI albo człowiek ocenia resztę. Zasada jest prosta: skalibruj wyniki sędziego AI z ocenami ludzi, zanim zaczniesz im ufać. Jeśli sędzia zgadza się z człowiekiem w 9 na 10 przypadków, oddaj mu większość pracy i zostaw ludziom tylko próbkę kontrolną.
Osobna miara warta zapamiętania to pass@k: model dostaje to samo zadanie k razy i zalicza, jeśli choć jedna próba się uda. Pokazuje, czy skill potrafi rozwiązać problem w ogóle, w odróżnieniu od skuteczności za pierwszym podejściem. Dla chatbota firmowego liczy się zwykle ta druga, bo klient nie zapyta pięć razy.
Eval skilli krok po kroku: proces w 5 krokach
Poniższa checklista to minimalny proces, który działa w małej firmie bez zespołu badawczego:
- Zbierz 30-100 prawdziwych pytań. Przejrzyj maile, czat i notatki z rozmów. Podziel je na grupy: oferta, ceny, terminy, reklamacje, sprawy poza zakresem. Dopisz 5-10 podchwytliwych przypadków (pytanie niejasne, dwa pytania w jednym, próba wyciągnięcia danych).
- Napisz wzorcowe odpowiedzi. Krótko, na faktach z Twojej oferty. Przy każdej zaznacz fakty obowiązkowe, czyli informacje, bez których odpowiedź jest zła (cena, termin, warunek). To jest Twój ground truth.
- Wybierz metodę oceny. Fakty sprawdzaj regułami, styl i kompletność sędzią AI albo człowiekiem. Ustal próg zaliczenia przed pierwszym odpaleniem, na przykład 90 poprawnych odpowiedzi na 100 pytań.
- Odpal test i policz wynik. Zapisz wynik z datą, wersją promptu i wersją modelu. Każdą wpadkę wpisz do jednej z trzech szufladek: zły prompt, zła baza wiedzy, zły model.
- Popraw i powtórz. Napraw najczęstszą kategorię błędów, odpal ten sam zestaw jeszcze raz i porównaj liczby. Eval staje się bramką jakości: żadna zmiana nie trafia do klientów bez przejścia testu.
Cały zestaw trzymaj w arkuszu albo pliku tekstowym. Przykładowy wpis w formacie YAML może wyglądać tak:
- pytanie: "Ile kosztuje pakiet Start?"
musi_zawierac: ["1 200 zł", "jeden kanał"]
nie_moze_zawierac: ["za darmo"]
- pytanie: "Czy oddzwonisz do mnie jutro?"
musi_zawierac: ["numer telefonu"]
Taki plik to zalążek prawdziwego evala. Gdy urośniesz do kilkuset pytań, przeniesiesz go do frameworka takiego jak openai/evals bez zmiany logiki.
Metryki i benchmarki: liczby, które coś znaczą
Publiczne benchmarki służą do jednego: pokazują, jak Twój model wypada na tle innych w standardowych zadaniach. Klasyczny przykład to HumanEval, zestaw 164 zadań programistycznych opisany w pracy twórców modelu Codex (Chen i in., 2021). Dla zadań serwisowych bliższy jest SWE-bench, benchmark rozwiązywania prawdziwych zgłoszeń z GitHuba (Jimenez i in., 2023), którego okrojona wersja Lite liczy 300 instancji, a wersję zweryfikowaną opisała firma OpenAI na swoim blogu o SWE-bench Verified. Pełną listę zadań i aktualne wyniki znajdziesz na stronie swebench.com.
Jak czytać te liczby w realiach firmy? Trzymaj się trzech zasad:
- Liczy się Twój eval, nie ranking. To, że model X wygrywa benchmark programistyczny, nie znaczy, że dobrze odpowiada na pytania o Twoje usługi. Benchmark dobieraj pod zadanie, a werdykt i tak wydaje Twój własny zestaw pytań.
- Różnica 2-3 punktów procentowych to zwykle szum. Przy 100 pytaniach jedno pytanie to cały punkt procentowy. Małe różnice między modelami rozstrzygaj większym zestawem albo kosztem, nie tabelą lidera.
- Mierz też to, co benchmarki pomijają. Czas odpowiedzi, koszt 1 000 rozmów i odsetek odpowiedzi "nie wiem" potrafią przeważyć nad przewagą kilku punktów w teście. Dobry eval firmowy mierzy jakość, koszt i szybkość naraz.
Błędy, które psują evale
Większość evali upada nie na technologii, tylko na pięciu klasycznych błędach:
- Testujesz na tym, na czym trenujesz. Jeśli pytania z evala trafiły do promptu albo bazy wiedzy słowo w słowo, wynik 100% nic nie znaczy. Trzymaj część pytań w ukrytej puli kontrolnej.
- Oceniasz tylko szczęśliwą ścieżkę. Eval bez pytań trudnych, niejasnych i złośliwych to dekoracja. Minimum to 10-20% pytań spoza głównego scenariusza.
- Sędzia AI bez kalibracji. Wynik drugiego modelu, którego nikt nie porównał z ocenami człowieka, to opinia, nie pomiar. Zanim zaufasz sędziemu, sprawdź zgodność na 30-50 odpowiedziach.
- Eval, który nie starzeje się z produktem. Zmieniasz ofertę, a pytania testowe zostają stare? Eval zaczyna karać poprawne odpowiedzi. Aktualizuj zestaw przy każdej zmianie cennika i procesu.
- Jedna liczba zamiast diagnozy. Sam wynik "87%" nie mówi, co naprawić. Zawsze rozbijaj go na kategorie: fakty, kompletność, ton, sprawy poza zakresem.
Eval w małej firmie: po co Ci to wszystko
Masz dość zgadywania, czy asystent mówi prawdę o Twojej ofercie? Eval odpowiada na dwa pytania: ile błędów przepuszcza do klientów i czy kolejna zmiana go poprawiła. Bez evala każdą aktualizację przyjmujesz na wiarę. Z evalem masz liczbę sprzed i po zmianie oraz listę pytań, na których skill się wywraca.
Koszt wejścia jest niski: zebranie 50 pytań i wzorcowych odpowiedzi to zwykle 2-4 godziny pracy osoby, która zna ofertę. Dla porównania samo wdrożenie asystenta AI trwa zwykle od 1 do 3 tygodni, pakiet Start zaczyna się od 1 200 zł, a opcjonalna opieka z monitoringiem kosztuje 700 zł miesięcznie. Eval nie zastępuje tych wydatków, ale pilnuje, żeby nie poszły na marne: wyłapuje wpadkę w teście, zanim wyłapią ją klienci. Więcej o samych kosztach piszę w artykule o tym, ile kosztuje wdrożenie chatbota, a cały proces wdrożenia opisuję w przewodniku wdrożenie krok po kroku.
Pamiętaj też o dwóch ryzykach. Po pierwsze, dane: do zestawu testowego nie wklejaj prawdziwych danych klientów (nazwisk, telefonów, historii zakupów), zwłaszcza jeśli testy odpalasz na publicznym modelu. Anonimizuj przykłady i sprawdź, co trafia do dostawcy modelu, o czym piszę w tekście chatbot a RODO. Po drugie, zakres: eval sprawdza to, co mu zadasz, więc testuj też odmowy. Asystent ma grzecznie odmawiać w sprawach spoza oferty, a nie zmyślać. Jak odróżnić dobrego asystenta od naciągacza, podpowiada artykuł jak działa chatbot AI.
FAQ: najczęstsze pytania o evale
Ile pytań testowych potrzebuje dobry eval?
Na start wystarczy 30-50 pytań, żeby wykryć największe wpadki skilla. Dojrzały eval to zwykle 100-300 pytań, w tym 10-20% przypadków trudnych i podchwytliwych. Większy zestaw ma sens dopiero wtedy, gdy mały przestaje rozróżniać wersje, czyli kolejne poprawki dają ten sam wynik mimo realnych zmian.
Czym eval różni się od zwykłego klikania i sprawdzania?
Ręczne testy dają wrażenia, eval daje porównywalną liczbę. Ten sam zestaw pytań odpalasz po każdej zmianie promptu, modelu albo bazy wiedzy i widzisz, czy wynik rośnie, czy spada. Bez tego nie wiesz, czy poprawka pomogła, czy tylko przesunęła błędy w inne miejsce.
Czy eval zastąpi testy z udziałem ludzi?
Nie, eval je uzupełnia. Ludzie oceniają ton, niuanse i sprawy wrażliwe, a automat sprawdza fakty i pilnuje regresji przy każdej zmianie. Dobra praktyka to kalibracja: sędzia AI przejmuje większość ocen dopiero wtedy, gdy zgadza się z człowiekiem w co najmniej 9 na 10 przypadków.
Jak często powtarzać eval po wdrożeniu?
Po każdej zmianie promptu, modelu albo bazy wiedzy oraz po każdej zmianie oferty, bo stare wzorcowe odpowiedzi przestają być prawdziwe. Minimum to jedno pełne odpalenie w miesiącu na stałym zestawie pytań. Wyniki zapisuj z datą i wersją, żeby widzieć trend, a nie pojedynczy pomiar.
Podsumowanie: eval to licznik prawdy Twojego asystenta
Eval modeli LLM to powtarzalny test z trzech części: prawdziwych pytań, wzorcowych odpowiedzi i metody oceny. Zaczynasz od 30-50 pytań z własnych rozmów z klientami, fakty sprawdzasz regułami, resztę sędzią AI skalibrowanym z człowiekiem, a test powtarzasz po każdej zmianie. Publiczne benchmarki pomagają wybrać model, ale werdykt zawsze wydaje Twój własny zestaw. Następny krok: zbierz dziś 10 prawdziwych pytań klientów i dopisz do nich poprawne odpowiedzi, zalążek evala masz gotowy.
Jeśli chcesz sprawdzić, czy asystent AI sprawdzi się w Twojej firmie, opisz jedno powtarzalne zadanie: bezpłatna diagnoza procesu w 48 godzin.