cashcrown // ewaluacja jakości ai · 09/11
Harness do ewaluacji systemów LLM/RAG: złoty zestaw, automatyczne metryki, sędzia-LLM kalibrowany na ludzkich ocenach i bramka regresji, która blokuje deploy przy spadku jakości.

Bez ewaluacji nie wiesz, czy nowy prompt, model albo zmiana w RAG poprawiły jakość, czy ją cicho zepsuły. Ocena „na oko" nie skaluje się i nie wyłapuje regresji, zanim trafi do klienta.
Wybierz węzeł, aby zobaczyć opis i przepływ danych.
Pracujemy w przedziałach zależnych od zakresu — zaczynamy od pilotażu o stałym koszcie, w którym budujemy złoty zestaw i pierwszą bramkę regresji. Eval zwykle zwraca się przy pierwszej wyłapanej regresji, zanim trafi do klienta — oszczędza godziny ręcznego przeglądu i kosztowne wpadki. Zwrot policzysz w kalkulatorze ROI.
Tak. Harness uruchamiamy w Waszym CI jako bramkę przed deployem — czerwony wynik blokuje wypuszczenie. Działa self-hosted z zero-retention: dane testowe i embeddingi (BGE-M3) zostają u Ciebie, PII maskujemy przed chmurą, wrażliwe ścieżki obsługujemy lokalnie — zgodność z RODO i AI Act projektujemy od początku.
Zaczynamy od kilkudziesięciu reprezentatywnych przypadków i ich ręcznej oceny — to złoty zestaw, na którym kalibrujemy sędziego-LLM. Eval uzupełnia, ale nigdy nie zastępuje ludzkiej oceny przy wynikach wysokiego ryzyka: automat łapie regresje i mierzy trend, człowiek podejmuje decyzje krytyczne i ma ostatnie słowo przy bramce.