Die Genauigkeit von RAG-Zitaten hängt davon ab, den richtigen Quellenabschnitt abzurufen und ihn genau der Aussage zuzuordnen, die er belegt – nicht lediglich davon, relevante Dokumente aufzulisten.
Eine heimische Wissensdatenbank kann aus einer Versicherungspolice, einer Geräteanleitung oder einer gescannten Rechnung antworten und trotzdem die falsche Seite zitieren. Das richtige Dokument kann vorhanden sein, während der unterstützende Satz aufgeteilt, hinter einem anderen Chunk eingestuft oder mit der falschen generierten Aussage verknüpft wurde. Die Qualität von Zitaten spiegelt daher das Zusammenspiel von Erfassung, Abruf, Generierung, Zuordnung und Versionskontrolle wider.
Quellen- und Chunk-Qualität setzen die Beweisschranke
OCR-Fehler, fehlende Tabellen, veraltete Kopien und verlorene Überschriften beeinträchtigen die Belege bereits vor Beginn des Abrufs. Chunk-Grenzen müssen die Aussage, die Einschränkung und den identifizierenden Kontext bewahren, die zum Belegen einer Behauptung erforderlich sind. Ein Fragment, das nur eine Zahl enthält, kann zwar passen, beweist aber nicht, was diese Zahl misst.
Forschungen zum Vergleich fortgeschrittener Chunking-Strategien zeigen, dass Entscheidungen zur Dokumentsegmentierung die Abrufleistung verändern, weil feste Chunks Konzepte aufteilen oder nicht zusammengehörige Inhalte vermischen können. Die Genauigkeit von Zitaten kann die Qualität des zitierbaren Abschnitts nicht überschreiten.
Metadaten sollten die Dokumentversion, Seite, Abschnitt und Koordinaten bewahren, damit das Zitat auf überprüfbare Belege verweist. Die Deduplizierung muss verhindern, dass veraltete und aktuelle Kopien miteinander konkurrieren, ohne die historische Version zu löschen, die für eine frühere Antwort verwendet wurde.
Abruf und Generierung müssen die Zuordnung auf Aussageebene bewahren
Ein Retriever kann eine thematisch relevante Seite zurückgeben, die den endgültigen Satz jedoch nicht stützt. Das Reranking sollte direkte Belege priorisieren, während die Generierung die Grenzen der Aussagen und die Quellenkennungen sichtbar halten sollte, damit jeder faktische Abschnitt den tatsächlich im Kontext vorhandenen Belegen zugeordnet werden kann.
Forschungen zur Zitiertreue unterscheiden zwischen Zitatkorrektheit und Zitiertreue und berichten, dass scheinbar unterstützende Zitate angebracht werden können, nachdem das Modell auf andere Informationen zurückgegriffen hat. Deshalb kann eine bloße Übereinstimmung an der Oberfläche das Vertrauen überhöhen.
Zitatabdeckung und Zitatkorrektheit sind getrennte Aspekte. Eine Antwort kann zwei Aussagen korrekt zitieren, während drei weitere unbelegt bleiben, oder jeden Satz auf ein einziges umfassendes Dokument verweisen, das keine der Aussagen präzise stützt. Beide Dimensionen müssen unabhängig gemessen werden. Dieser Unterschied bleibt auch bei späteren Tests im Haushalt sichtbar.
Nachbearbeitung kann Verknüpfungen korrigieren, aber fehlende Belege nicht ersetzen
Ein Prüfer kann jede generierte Aussage mit möglichen Textpassagen vergleichen, ein Zitat einer besseren Quelle zuordnen oder eine unbelegte Aussage entfernen. Dadurch lassen sich Zuordnungsfehler nach der Generierung erkennen, fehlende Belege, die bei Erfassung oder Abruf nicht bereitgestellt wurden, können jedoch nicht wiederhergestellt werden.
Das System zur Zitatkorrektur gleicht generierte Zitate mit abgerufenen Artikeln ab und berichtet über eine verbesserte Zitatgenauigkeit bei begrenzten zusätzlichen Kosten. Die Ergebnisse zeigen den Wert einer eigenen Zuordnungsphase nach dem Entwurf der Antwort. Das Zwischenergebnis muss überprüfbar bleiben, bevor die Automatisierung fortgesetzt wird.
Die kritische Fehlergrenze ist eine selbstsichere Aussage ohne eine sie stützende Quelle im abgerufenen Datensatz. Der Prüfer sollte die Antwort verweigern, erneut abrufen oder die Aussage löschen, anstatt das ähnlichste Zitat zuzuweisen und die Antwort dadurch scheinbar zu belegen.
Zitatunterstützung und Abdeckung getrennt bewerten
Erstelle fünfzig Fragen mit verifizierten Antwortabschnitten aus sauberen PDFs, OCR-Scans, Tabellen, doppelten Versionen und Fällen ohne Antwort. Teile jede generierte Antwort in atomare Aussagen auf und beurteile anschließend, ob jedes Zitat seine Aussage stützt und ob jede faktische Aussage ein Zitat besitzt.
Verwende das Rahmenwerk für Recall, Präzision und Abdeckung aus dem RAG-Bewertungsrahmenwerk, ergänze es jedoch um Zitatentailment, Versionskorrektheit sowie eine auflösbare Seite oder Region. Vergleiche die Ergebnisse nach Dokumenttyp, statt nur einen aggregierten Wert zu melden. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Akzeptiere eine Antwort nur, wenn die Zitate auf aktuelle, überprüfbare Abschnitte verweisen und unbelegte Aussagen eine Verweigerung oder einen weiteren Abruf auslösen. Wenn eine Quelle relevant ist, den Satz aber nicht stützt, muss sie als ungenaues Zitat und nicht als Teilerfolg gewertet werden.
Tech- & KI-Zentrum
Mehr zum Lesen

Welche Funktionen ermöglichen eine zuverlässige JSON-Ausgabe von einem lokalen LLM?
Erfahren Sie, welche Funktionen die JSON-Syntax erzwingen, welche die semantische Korrektheit schützen und wie Sie ein lokales Modell über verschiedene Schemas, Prompts und Fehlerfälle...

Herkunft lokaler KI-Daten: Warum jede Antwort einen nachvollziehbaren Quellenpfad benötigt
Erfahren Sie, wie Quellpfade lokale KI-Antworten überprüfbar machen, warum Zitate allein unvollständig sind und wie sich die Herkunft durch Aktualisierungen und Löschungen testen lässt.

Inhalts-Hash-Indexierung: Wie Datei-Fingerabdrücke redundante KI-Arbeit verhindern
Erfahren Sie, wie Datei- und Chunk-Fingerprints die inkrementelle Indizierung steuern, warum Metadaten nicht ausreichen und wo Hashes keine semantische Gleichwertigkeit beweisen können.

