Private Wissensgraphen erweitern die Suche in Dokumenten zu Hause, indem sie wiederkehrende Entitäten und Beziehungen verknüpfen und so Suchpfade über gemeinsame Wörter oder Ähnlichkeiten von Embeddings hinaus bieten.
Ein Haushaltsarchiv kann „Maple Street“, „die alte Wohnung“, den Nachnamen eines Vermieters und eine Reparaturrechnung erwähnen, ohne eine gemeinsame durchsuchbare Formulierung zu wiederholen. Die Entitätsextraktion kann Personen, Orte, Geräte, Daten und Projekte erkennen, während die Auflösung gleichbedeutende Erwähnungen miteinander verknüpft. Ein Graph ermöglicht es der Suche dann, von einem bekannten Knoten zu verwandten Dateien zu navigieren, die ansonsten semantisch weit voneinander entfernt blieben.
Die Entitätsauflösung macht aus Erwähnungen wiederverwendbare Knoten
Die Extraktion findet in jedem Dokument potenzielle Namen, Kennungen, Orte, Daten und Organisationen. Die Auflösung entscheidet, ob sich zwei Erwähnungen auf dieselbe Entität beziehen, und verknüpft anschließend Quelltextstellen sowie Beziehungskanten wie „gehört zu“, „befindet sich an“ oder „erwähnt in“.
Der Ansatz des Entitätswissensgraphen erstellt aus Quelldokumenten zunächst einen Entitätswissensgraphen, bevor Zusammenfassungen auf Gruppenebene erzeugt werden. Sein Aufbau zeigt, wie Entitäts- und Beziehungsstrukturen Fragen unterstützen können, deren Informationen über viele Dateien verteilt sind.
Ein stabiler Knoten ermöglicht es einer einzelnen Abfrage, Aliase und verbundene Belege zu sammeln. Die Suche nach dem Spitznamen eines Geräts kann dessen Seriennummer, Kaufbeleg, Wartungsnotizen und Raum finden, ohne dass jedes Dokument den Spitznamen selbst enthalten muss.
Die Graphnavigation ergänzt beziehungsbasierte Suchpfade
Die Vektorsuche findet semantisch ähnliche Textpassagen, während die Graphsuche expliziten Kanten von Abfrageentitäten folgt. Eine Suche kann bei einer Person beginnen, zu einer Adresse navigieren und anschließend Dokumente abrufen, die mit einem zugehörigen Konto oder Ereignis verknüpft sind.
Eine umfassende Übersicht zu GraphRAG-Pipelines beschreibt Entitätserkennung, Verknüpfung, Graphaufbau, Abruf und Generierung als getrennte Phasen. Diese Aufteilung hilft dabei zu diagnostizieren, ob ein Trefferverlust auf einen fehlenden Knoten, eine falsche Kante oder eine Abrufstrategie zurückzuführen ist.
Eine hybride Kandidatengenerierung funktioniert häufig besser als eine reine Graphsuche, da erzählerische Belege ähnlich sein können, ohne dass extrahierte Kanten vorhanden sind. Der Graph erweitert den Beziehungsabruf, während lexikalische und Vektormethoden Pfade erhalten, die das Entitätsmodell nicht abbilden konnte.
Eine falsche Entitätszusammenführung verbreitet Fehler über viele Dateien
In Haushalten werden Vornamen, Abkürzungen, Adressen und Gerätemodelle wiederverwendet. Werden zwei Personen oder Projekte zusammengeführt, entstehen falsche Pfade; wird eine einzelne Entität in mehrere Knoten aufgeteilt, bleiben Verbindungen verborgen. Eine falsche Kante kann daher mehr Ergebnisse verunreinigen als ein einzelnes fehlerhaftes Embedding.
Eine Dokument-GraphRAG-Implementierung bewertet den durch Wissensgraphen erweiterten Dokumentabruf und beschreibt die zusätzlichen Extraktions- und Graphphasen, die für eine robuste Suche erforderlich sind. Diese Phasen erweitern die Möglichkeiten, schaffen aber auch neue Qualitätsabhängigkeiten. Dieser Unterschied bleibt bei späteren Tests im Haushalt sichtbar.
Die offene Grenze ist die ungeklärte Identität. Bewahre Quelltextstellen, Konfidenzwerte, Aliase und konkurrierende Kandidaten auf; führe Knoten nicht automatisch zusammen, wenn unterscheidende Attribute fehlen. Private Speicherung schützt den Graphen vor externer Offenlegung, macht seine Beziehungen jedoch nicht automatisch korrekt.
Prüfe zehn Graphpfade bis zu den Quelltextstellen zurück
Wähle zehn Fragen aus, die ein oder zwei Beziehungsschritte erfordern, und dokumentiere die erwartete Entität, Kante, Datei und unterstützende Textstelle. Vergleiche lexikalischen, Vektor-, reinen Graph- und hybriden Abruf mit demselben abschließenden Kandidatenlimit. Das Zwischenergebnis muss überprüfbar bleiben, bevor die Automatisierung darauf aufbaut.
Wende die Disziplin zur Quellenherkunft aus dem Beitrag zur Herkunft von Familienarchiven an, damit jeder Knoten und jede Kante die Dokumentversion und Extraktionsstelle behält, durch die sie erstellt wurden. Untersuche falsche Ergebnisse nach Extraktions-, Auflösungs-, Kanten-, Navigations- und Rankingphase. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Verwende die Graphausweitung nur, wenn sie verifizierte Belege hinzufügt, ohne übermäßig viele falsche Pfade zu erzeugen. Teile mehrdeutige Entitäten auf, entferne Kanten, wenn ihre Quelle gelöscht wird, und begrenze die Navigationstiefe dort, wo weit gefasste Haushaltsknoten wie eine Adresse nicht zusammengehörige Datensätze verbinden.
Tech- & KI-Zentrum
Mehr zum Lesen

Welche Faktoren bestimmen die Genauigkeit von RAG-Zitaten in einer heimischen Wissensdatenbank?
Erfahren Sie, warum eine relevante Quelle dennoch ein falsches Zitat sein kann, welche Pipeline-Phasen die Belegbarkeit und Abdeckung steuern und wie sich RAG-Aussagen zu...

Welche Funktionen ermöglichen eine zuverlässige JSON-Ausgabe von einem lokalen LLM?
Erfahren Sie, welche Funktionen die JSON-Syntax erzwingen, welche die semantische Korrektheit schützen und wie Sie ein lokales Modell über verschiedene Schemas, Prompts und Fehlerfälle...

Herkunft lokaler KI-Daten: Warum jede Antwort einen nachvollziehbaren Quellenpfad benötigt
Erfahren Sie, wie Quellpfade lokale KI-Antworten überprüfbar machen, warum Zitate allein unvollständig sind und wie sich die Herkunft durch Aktualisierungen und Löschungen testen lässt.

