cashcrown // ai quality evaluation
Ein Evaluations-Harness für LLM-/RAG-Systeme: ein Golden Set, automatische Metriken, ein an menschlichen Labels kalibrierter LLM-as-Judge und ein Regressions-Gate, das ein Deployment bei Qualitätsabfall blockiert.

Ohne Evaluation wissen Sie nicht, ob ein neuer Prompt, ein neues Modell oder eine RAG-Änderung die Qualität verbessert oder still beschädigt hat. Antworten „mit dem Auge" zu prüfen skaliert nicht und fängt Regressionen nicht ab, bevor sie den Kunden erreichen.
Knoten wählen, um Beschreibung und Datenfluss zu sehen.
Wir arbeiten in Spannen je nach Umfang — wir starten mit einem Pilot zu Festkosten, in dem wir das Golden Set und das erste Regressions-Gate aufbauen. Ein Eval rechnet sich meist schon bei der ersten Regression, die er abfängt, bevor sie den Kunden erreicht — er spart Stunden manueller Prüfung und kostspielige Ausrutscher. Die Rendite berechnen Sie im ROI-Rechner.
Ja. Wir führen den Harness in Ihrem CI als Gate vor dem Deployment aus — ein rotes Ergebnis blockiert das Release. Er läuft self-hosted mit Zero-Retention: Testdaten und Embeddings (BGE-M3) bleiben bei Ihnen, wir maskieren PII vor der Cloud und verarbeiten sensible Pfade lokal — DSGVO- und AI-Act-Konformität von Anfang an eingeplant.
Wir starten mit einigen Dutzend repräsentativen Fällen und ihren manuellen Labels — das ist das Golden Set, an dem wir den LLM-as-Judge kalibrieren. Ein Eval ergänzt, ersetzt aber niemals das menschliche Urteil bei Ergebnissen mit hohem Risiko: die Automatisierung fängt Regressionen ab und verfolgt den Trend, während ein Mensch die kritischen Entscheidungen trifft und das letzte Wort am Gate hat.