Harness do ewaluacji systemów LLM/RAG: złoty zestaw, automatyczne metryki, sędzia-LLM kalibrowany na ludzkich ocenach i bramka regresji, która blokuje deploy przy spadku jakości.
4 tryby
metryki
self-host
deploy
zero-retention
dane
CI gate
regresja
// 01
Problem
Bez ewaluacji nie wiesz, czy nowy prompt, model albo zmiana w RAG poprawiły jakość, czy ją cicho zepsuły. Ocena „na oko" nie skaluje się i nie wyłapuje regresji, zanim trafi do klienta.
bramka regresji blokująca deploy przy spadku jakości
pełna historia przebiegów pod analizę trendów
// 05
Integracje
routerBGE-M3QdrantOllamaFastAPIn8n
// 06
Architektura
Architektura: Eval Harnessewaluacja jakości ai
Wybierz węzeł, aby zobaczyć opis i przepływ danych.
Architektura — opis tekstowy
Wejście / dane
Źródła danych — Treści, dokumenty i zdarzenia trafiają do indeksu. (Przepływ do: BGE-M3)
BGE-M3 — Lokalne embeddingi (1024-dim) — PII zostaje na miejscu. (Przepływ do: Router OpenClaw)
Rdzeń AI
Router OpenClaw — Jedyne wejście do modeli — maskuje PII, dobiera model, limituje. (Przepływ do: Eval Harness)
Eval Harness — Harness do ewaluacji systemów LLM/RAG: złoty zestaw, automatyczne metryki, sędzia-LLM kalibrowany na ludzkich ocenach i bramka regresji, która blokuje deploy przy spadku jakości. (Przepływ do: API)
Wyjście / integracje
API — Powierzchnia REST — odpowiedzi z cytatami i kontrolą dostępu. (Przepływ do: router, BGE-M3, Qdrant, Ollama)
router — Integracja: router.
BGE-M3 — Integracja: BGE-M3.
Qdrant — Integracja: Qdrant.
Ollama — Integracja: Ollama.
// 07
Demo na żywo
// 08
FAQ
Ile kosztuje i jak wygląda wdrożenie?
Pracujemy w przedziałach zależnych od zakresu — zaczynamy od pilotażu o stałym koszcie, w którym budujemy złoty zestaw i pierwszą bramkę regresji. Eval zwykle zwraca się przy pierwszej wyłapanej regresji, zanim trafi do klienta — oszczędza godziny ręcznego przeglądu i kosztowne wpadki. Zwrot policzysz w kalkulatorze ROI.
Czy integruje się z naszym CI i jest zgodne z RODO?
Tak. Harness uruchamiamy w Waszym CI jako bramkę przed deployem — czerwony wynik blokuje wypuszczenie. Działa self-hosted z zero-retention: dane testowe i embeddingi (BGE-M3) zostają u Ciebie, PII maskujemy przed chmurą, wrażliwe ścieżki obsługujemy lokalnie — zgodność z RODO i AI Act projektujemy od początku.
Od czego zacząć i czy eval zastąpi człowieka?
Zaczynamy od kilkudziesięciu reprezentatywnych przypadków i ich ręcznej oceny — to złoty zestaw, na którym kalibrujemy sędziego-LLM. Eval uzupełnia, ale nigdy nie zastępuje ludzkiej oceny przy wynikach wysokiego ryzyka: automat łapie regresje i mierzy trend, człowiek podejmuje decyzje krytyczne i ma ostatnie słowo przy bramce.