Anforderungsprofil: RAG-Pilot Verwaltung
Herstellerneutrales technisches Anforderungs- und Beschaffungspaket zum Entscheidungspaket „RAG-Pilot Verwaltung“.
Am Ende steht ein begrenzter RAG-Dienst mit dokumentierten Quellen und Berechtigungen, reproduzierbarer Evaluation, messbarer Antwortqualität und einer Entscheidung über Skalierung, weitere Datenquellen oder Abbruch.
Thema: ai-rag · Stand 2026-09-20Vor jeder Punktebewertung nachweisen
Diese Kriterien sind als technische Mindestnachweise formuliert. Nicht erfüllte Muss-Kriterien sollten nicht durch Komfort- oder Preisvorteile kompensiert werden.
| ID | Kriterium | Geforderter Nachweis |
|---|---|---|
| M01 | Mit einem repräsentativen Testkorpus Retrieval-Qualität, Antwortqualität, Quellenbezug und Halluzinations-/Abstinenzverhalten messbar evaluieren. | Hersteller-/Angebotsnachweis plus Pilot- oder Betriebsnachweis. |
| M02 | Quellberechtigungen Ende-zu-Ende prüfen: Ein Benutzer darf über Retrieval keine Inhalte erhalten, die er in der Originalquelle nicht lesen darf. | Hersteller-/Angebotsnachweis plus Pilot- oder Betriebsnachweis. |
| M03 | Prompt-Injection, schädliche Dokumente, Connector-Credentials, Service-Identitäten und Datenexfiltration in einem Security-Test abdecken. | Hersteller-/Angebotsnachweis plus Pilot- oder Betriebsnachweis. |
| M04 | Datenhaltung, Regionen, private Netzpfade, Logging, Modell-/Provider-Wechsel sowie Löschung und Retention vertraglich und technisch verifizieren. | Hersteller-/Angebotsnachweis plus Pilot- oder Betriebsnachweis. |
| M05 | Exit-Probe durchführen: Quellen, Prompts, Policies, Vektordaten/Indizes und Evaluationssets müssen exportierbar oder reproduzierbar sein. | Hersteller-/Angebotsnachweis plus Pilot- oder Betriebsnachweis. |
Mehrwert nur mit realem Betriebsnutzen bewerten
| ID | Kriterium | Bewertungshinweis |
|---|---|---|
| K01 | Modell-/Provider-Abstraktion ermöglicht einen Wechsel ohne vollständigen Neuaufbau der Anwendung. | Als Mehrwert nur bewerten, wenn die Funktion für den Zielbetrieb nachweisbar nutzbar ist. |
| K02 | Evaluationssets und Qualitätsmetriken können versioniert und automatisiert wiederholt werden. | Als Mehrwert nur bewerten, wenn die Funktion für den Zielbetrieb nachweisbar nutzbar ist. |
| K03 | Private Netzwerkpfade, kundenseitige Schlüssel oder restriktive Datenzonen sind abbildbar. | Als Mehrwert nur bewerten, wenn die Funktion für den Zielbetrieb nachweisbar nutzbar ist. |
| K04 | Index-/Vektor-Daten und Retrieval-Konfiguration lassen sich reproduzierbar neu aufbauen oder exportieren. | Als Mehrwert nur bewerten, wenn die Funktion für den Zielbetrieb nachweisbar nutzbar ist. |
Fragen für Angebot, Workshop und technische Klärung
Erbt Retrieval die effektiven Zugriffsgrenzen der Quellen und verhindert Cross-User-Datenlecks?
Sind Antworten auf konkrete, versionierte Quellen zurückführbar und kann fehlende Evidenz sichtbar gemacht werden?
Wird die Leistung mit einem reproduzierbaren Testkorpus statt nur anhand von Demo-Fragen bewertet?
Sind Indexierung, Aufbewahrung, Löschung, Modellzugriff und technische Identitäten nachvollziehbar?
Sind Reindex, Modellwechsel, Kostenanstieg, Incident und Deaktivierung als Betriebsfälle vorbereitet?
Sind menschliche Kontrolle, Transparenz und erforderliche rechtliche/organisatorische Prüfungen in den Prozess eingebaut?
Gates als objektive Abnahmekriterien verwenden
Der Pilot hat einen begrenzten Wissensraum, klar benannte Nutzer und messbare Qualitätsziele.
Berechtigungsgrenzen sind technisch getestet und nicht nur organisatorisch beschrieben.
Die Shortlist erfüllt die Muss-Kriterien für Datenzugriff, Identität, Logging und Evaluation.
Die gemessene Qualität ist für den gewählten Assistenzfall ausreichend und kritische Fehler sind sichtbar statt verborgen.
Weitere Datenquellen oder agentische Aktionen folgen erst nach stabilem, nachvollziehbarem Assistenzbetrieb.
Vor Produktivsetzung klären
- Connector-, Index- und Berechtigungsfehler überwachen.
- Fallback bei Modell-/Provider-Ausfall und kontrollierte Deaktivierung vorsehen.
- Kosten-/Token-/Kapazitätsgrenzen und Qualitätsdrift überwachen.
- Evaluationssets, Prompts, Policies und Modellversionen nachvollziehbar versionieren.
Vor Vertragsbindung nachweisen
- Quellenkonfiguration, Prompts, Policies, Evaluationssets und relevante Metadaten exportierbar bzw. reproduzierbar halten.
- Vektor-/Indexdaten löschen oder auf einer Folgelösung reproduzierbar neu aufbauen können.
- Modell-/Provider-Wechsel ohne Verlust der fachlichen Evaluationsbasis und Berechtigungslogik testen.
Gewichtete Bewertung erst nach den Muss-Kriterien
Die Gewichte ergeben zusammen 100 %. Die Skala bewertet nachgewiesene Eignung – nicht Herstellergröße oder Markenpräferenz.
| Kategorie | Gewicht | Skala | Dokumentation |
|---|---|---|---|
| Datenzugriff & Security | 25 % | 0 = nicht nachgewiesen · 1 = teilweise · 2 = erfüllt · 3 = übertroffen | Nachweis/Kommentar |
| Qualität & Evaluation | 25 % | 0 = nicht nachgewiesen · 1 = teilweise · 2 = erfüllt · 3 = übertroffen | Nachweis/Kommentar |
| Architektur & Integration | 20 % | 0 = nicht nachgewiesen · 1 = teilweise · 2 = erfüllt · 3 = übertroffen | Nachweis/Kommentar |
| Betrieb & Governance | 15 % | 0 = nicht nachgewiesen · 1 = teilweise · 2 = erfüllt · 3 = übertroffen | Nachweis/Kommentar |
| Commercial & Exit | 15 % | 0 = nicht nachgewiesen · 1 = teilweise · 2 = erfüllt · 3 = übertroffen | Nachweis/Kommentar |
Für Pilot, Entscheidung und Vertrag dokumentieren
- Use-Case-Steckbrief
- Quellen-/Owner-Register
- Schutzbedarfs- und Berechtigungsmatrix
- RAG-Architektur
- Finder-Profil
- Vergleichsmatrix
- Testkorpus
- Retrieval-/Qualitätsbericht
- Fehlerkatalog
- Logging-/Monitoringkonzept
- Reindex-/Fallback-Runbook
- Skalierungsentscheidung