NAJWAŻNIEJSZA ODPOWIEDŹ
Evals to powtarzalne próby oceny systemu AI na zadaniach z określonym wynikiem lub kryteriami. Łącz sprawdzalne reguły, ocenę eksperta i pomocniczą ocenę modelu. Testuj zarówno wykonanie zadania, jak i poprawne powstrzymanie się od działania.
Przypadek testowy zaczyna się od decyzji użytkownika
Opisz wejście, dostępne dane i oczekiwany rezultat. Dla ekstrakcji może to być zestaw pól, dla asystenta wskazanie właściwej procedury, a dla agenta faktyczna zmiana stanu w systemie. Komunikat „gotowe” nie wystarcza, jeśli zamówienie nie zostało zapisane. Kryterium powinno odpowiadać temu, co użytkownik uznaje za zakończenie pracy.
Uwzględnij także sytuacje, w których działanie jest niepożądane: brak zgody, niewłaściwe uprawnienia, niepełne dane. Zestaw złożony wyłącznie z zadań do wykonania może premiować system, który działa zbyt pochopnie. Własna lista przypadków powinna wynikać z procesu i realnych zgłoszeń, a nie tylko z katalogu przykładowych promptów.
Kontekst i materiały: Anthropic: Demystifying evals for AI agents
Dobierz metodę oceny do właściwości wyniku
Liczby, identyfikatory i format można często sprawdzić kodem. Zgodność odpowiedzi z procedurą może wymagać eksperta. Model oceniający przydaje się przy większej liczbie tekstów, ale jego werdykt również trzeba zweryfikować. Nie zastępuj braku kryteriów kolejnym pytaniem „czy odpowiedź jest dobra?”.
Zaproponuj skalę z opisem różnic. Oddziel błąd krytyczny od drobnej niezręczności językowej. Jedna średnia może ukryć rzadkie naruszenie, którego biznes nie akceptuje. Pokazuj wyniki według typu zadania i kategorii błędu. Pozwala to zdecydować, czy można wdrożyć rozwiązanie dla części zakresu, zamiast akceptować lub odrzucać całość.
Porównanie musi być powtarzalne
Zachowaj wersję danych, konfiguracji i sposobu oceny. Przy zmianie modelu nie modyfikuj równocześnie wszystkich przykładów. Oddziel zbiór rozwojowy od odbiorowego, aby nie dostrajać systemu tylko do znanych odpowiedzi. Dla zadań o zmiennych wynikach przeprowadź kilka prób i pokaż rozrzut.
Środowisko testowe powinno zaczynać od znanego stanu. Agent nie może korzystać z zamówienia utworzonego w poprzedniej próbie ani odziedziczonych uprawnień. Kontroluj również awarie narzędzi, aby nie pomylić błędu środowiska z błędem modelu. Wynik bez możliwości odtworzenia przyczyny ma ograniczoną wartość przy decyzji o wydaniu.
Jak przenieść wynik do procesu wydawniczego?
Ustal minimalne warunki wdrożenia i klasy błędów blokujących publikację. Po zmianie porównaj wynik z aktualną wersją oraz sprawdź świeże przykłady. Jeśli poprawa jednego obszaru pogarsza inny, decyzja powinna uwzględniać wagę obu zadań. Nie wybieraj wersji wyłącznie na podstawie korzystnej liczby zbiorczej.
Po wdrożeniu dodawaj reprezentatywne błędy do zestawu, usuwając zbędne dane użytkowników. Regularnie przeglądaj przypadki, których oczekiwania stały się nieaktualne. Evals są częścią utrzymania produktu. Powinny pomagać szybciej podejmować decyzje, a nie tworzyć rozbudowaną ceremonię niezwiązaną z rzeczywistą jakością.
OD CZEGO ZACZĄĆ
Zabierz to do swojego projektu.
- Zapisz wejście, stan początkowy i oczekiwany efekt.
- Dodaj przypadki wymagające odmowy lub doprecyzowania.
- Rozdziel błędy krytyczne od kosmetycznych.
- Wersjonuj dane i kontroluj niezależność prób.
Wybierz jeden punkt, którego dziś brakuje w Twoim procesie. To dobry temat na pierwszą rozmowę z zespołem.
PYTANIA I ODPOWIEDZI
Pytania, które pojawiają się najczęściej.
Ile przykładów potrzeba na start?
Zacznij od zestawu pokrywającego najważniejsze rodzaje zadań i błędów. Liczba zależy od różnorodności procesu. Mały, dobrze opisany zbiór jest przydatniejszy niż duży zestaw bez wiarygodnych oczekiwań.
Czy drugi model może oceniać pierwszy?
Może wspierać ocenę, ale nie powinien być niezweryfikowanym arbitrem. Sprawdź jego zgodność z oceną ludzi, przypadki sporne i podatność na treści, które ocenia.
Źródła i kontekst
- Anthropic: Demystifying evals for AI agents ↗
Źródło opisuje zadania, próby oraz różne metody oceniania agentów. Szczegółowy plan odbioru powinien wynikać z wymagań konkretnego produktu.
Opracowanie: Zespół ALGOV. Stan wiedzy: 8 września 2026. Przykłady opisują możliwe scenariusze i nie są wynikami projektów klientów. Jak powstają nasze poradniki.