\n\n Zum Inhalt springen
✓ Herstellerunabhängig◇ Praxisnah & nachvollziehbar▣ Datenschutz im Blick
chrishob.deIT KLAR ENTSCHEIDEN.
UMSETZUNG

Projekt: RAG-Qualität mit Berechtigungs- und Testdatensatz prüfen

Ein kleiner RAG-Pilot wird erst belastbar, wenn gute Fragen, erwartete Quellen, verbotene Quellen und messbare Retrieval- sowie Antwortkriterien vorliegen.

RAGEvaluationPilot
Zeitraum4–8 Wochen
Voraussetzungenein abgegrenzter Dokumentbestand und 30–80 kuratierte Testfragen
Ergebnisreproduzierbarer RAG-Benchmark mit Berechtigungs- und Go/No-Go-Kriterien

1. Goldene Fragen und erwartete Quellen definieren

Fachseite und IT erstellen typische, schwierige und bewusst nicht beantwortbare Fragen. Zu jeder Frage werden erwartete Quelldokumente und relevante Abschnitte festgehalten.

2. Negative Berechtigungstests ergänzen

Ein Teil des Datensatzes ist absichtlich nur für bestimmte Testidentitäten sichtbar. Der Benchmark prüft explizit, dass nicht berechtigte Dokumente weder als Treffer noch als Antwortbeleg auftauchen.

3. Retrieval und Generation getrennt protokollieren

Für jeden Lauf werden Treffer, Ranking, verwendete Chunks, Antwort, Quellen und Laufparameter gespeichert. So lassen sich Fehler dem Index, den Filtern, dem Retriever oder dem Modell zuordnen.

4. Go/No-Go vor dem Breitenrollout

Freigabe erfolgt nur bei festgelegter Trefferqualität, bestandenen Berechtigungstests, nachvollziehbaren Quellen und akzeptablem Fehlverhalten bei unbeantwortbaren Fragen. Erst danach lohnt der Vergleich weiterer Modelle oder Plattformen.