Warum sehen lokale RAG-Antworten bei narrativen Dokumenten besser aus als bei Tabellenkalkulationen?

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Lokales RAG beantwortet narrative Dokumente oft besser, weil gewöhnliches Chunking den Kontext von Prosa bewahrt, aber die relationale Struktur zerstört, die Tabellenzellen ihre Bedeutung verleiht.

Ein Richtlinienabsatz enthält sein Thema und seine Einschränkungen in benachbarten Sätzen, während „42“ in einer Arbeitsmappe von einer Zeilenbezeichnung, einem Spaltendatum, einer Einheit, einer Formel und einem Blattnamen abhängen kann. Wenn ein Home-Server beides in einfache Text-Chunks umwandelt, übersteht die narrative Struktur diese Transformation bei der Generierung fundierter Antworten getreuer als das Raster mit seinen verborgenen Beziehungen zwischen Zellen.

Narrative Chunks enthalten ihre eigene semantische Nachbarschaft

Prosa wiederholt Entitäten, Verben und kausale Beziehungen in aufeinanderfolgenden Sätzen. Ein Chunk fester Größe enthält normalerweise genügend Sprache, damit ein Embedding das Thema repräsentieren und ein Generator die Belege interpretieren kann. Überlappungen können einen Satz bewahren, der über eine Grenze hinweggeht.

Ein tabellenorientierter RAG-Ansatz weist darauf hin, dass herkömmliches RAG bei narrativem Text gut funktioniert, aber scheitert, wenn wichtige Informationen in Tabellen und Strukturen enthalten sind. Die Diskrepanz beginnt bereits vor der Generierung, bei Repräsentation und Retrieval.

Die Qualität narrativer Inhalte kann dennoch täuschen: Flüssige Passagen begünstigen flüssige Antworten, selbst wenn der falsche Chunk abgerufen wurde. Der strukturelle Vorteil besteht in der Bewahrung der Struktur und ist keine Garantie für faktisch korrekte Antworten aus Prosa.

Die Bedeutung von Tabellenkalkulationen liegt in Koordinaten und Operationen

Die Bedeutung einer Zelle ergibt sich aus Beziehungen entlang mehrerer Achsen. Beim zeilenweisen Abflachen können Überschriften, verbundene Bezeichnungen, Formeln, ausgeblendete Tabellenblätter oder Einheiten abgetrennt werden. Embeddings vergleichen dann isolierte Zeichenfolgen statt der Operation, nach der eine Frage verlangt, etwa das Filtern eines Quartals und das Aufsummieren einer Kategorie.

Forschungen zur Tabellentopologie modellieren Text und Tabellentopologie explizit, weil hybride Dokumente Verbindungen enthalten, die gewöhnliche lineare Chunks verlieren. Die Bewahrung von Nachbarschaft und Hierarchie verändert, welche Belege wiedergefunden werden können.

Selbst perfektes Retrieval kann eine Frage zu einer Tabellenkalkulation möglicherweise nicht vollständig beantworten. Der Generator muss Zellen auswählen, Datentypen berücksichtigen, arithmetische Berechnungen ausführen und Koordinaten zitieren. Ein Sprachmodell, das einen Absatz gut zusammenfasst, kann dennoch Spalten vertauschen oder Berechnungen anhand formatierten Anzeigetexts durchführen.

Wo narratives RAG seinen Vorteil verliert

Der narrative Vorteil verschwindet, wenn Dokumente dichte Querverweise, lange Anhänge oder von ihren Definitionen getrennte Fakten enthalten. Umgekehrt können Tabellenkalkulationen mit eindeutigen Überschriften, übersichtlichen Zeilen und einer semantischen Abfrageschicht leichter zu beantworten sein als mehrdeutige Prosa.

Ein Leitfaden zur Bewertung von RAG für tabellarische Daten betont die Bewertung anhand von Fragen mit Tabellenbezug statt anhand allgemeiner Textmetriken. Die Antwort sollte mit den exakten Zellen und Operationen abgeglichen werden.

Der Mechanismus scheitert auch, wenn die Pipelines für narrative Inhalte und Tabellenkalkulationen unterschiedliche OCR-Verfahren, Embedding-Modelle oder Berechtigungen verwenden. In diesem Fall wird das Format mit den verwendeten Werkzeugen vermischt. „Besser lesbar“ bedeutet nicht automatisch besser fundiert; beide Formate benötigen eine Überprüfung auf Antwortebene.

Bewerten Sie Retrieval und Berechnung als getrennte Phasen

Erstellen Sie aus einem narrativen Bericht und einer übersichtlichen Arbeitsmappe jeweils passende Fragen: Nachschlage-, Vergleichs-, Aggregations- und Ausnahmefragen. Erfassen Sie die erforderlichen Textpassagen oder Zellkoordinaten und führen Sie anschließend beide durch dasselbe Modell mit demselben Retrieval-Budget. Bewerten Sie Retrieval, Berechnung, Zitation und finale Antwort getrennt.

Verwenden Sie eine lokale Vektordatenbank, um Vektoren und Quelldateien lokal zu speichern und dabei eine tabellenbewusste Serialisierung mit einfachem Zeilentext zu vergleichen. Halten Sie Modelltemperatur und Prompt konstant.

Wenn Tabellenbelege abgerufen werden, aber die Arithmetik fehlschlägt, fügen Sie einen strukturierten Ausführungsschritt hinzu. Wenn Überschriften vor dem Retrieval verschwinden, verbessern Sie Extraktion und Serialisierung. Wenn narrative Antworten nur besser klingen, aber falsche Passagen zitieren, passen Sie die Bewertung an, statt die Prosa-Pipeline für überlegen zu erklären.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.