Ein zweites Modell verändert die Reihenfolge der Belege, indem es jedes Anfrage-Kandidaten-Paar gemeinsam liest und feinere Relevanzsignale anwendet, als der Vektorvergleich der ersten Stufe darstellen kann.
Ein privates Archiv kann innerhalb von Millisekunden zwanzig plausible Textabschnitte abrufen, doch die nützlichste Passage steht möglicherweise unter allgemeinem Material, das denselben Wortschatz wie die Anfrage verwendet. Ein Reranker investiert mehr Rechenleistung in diese kleine Kandidatenmenge und erstellt für jedes Paar einen neuen Score. Der endgültige Kontext kann sich verbessern, obwohl sich weder Dokumente noch Embeddings oder Nutzerfragen geändert haben.
Die Suche der ersten Stufe optimiert die Abdeckung unter einem Geschwindigkeitsbudget
Dense- oder hybride Suche vergleicht kompakte Repräsentationen im gesamten Korpus. Sie muss schnell genug sein, um viele Kandidaten zu scannen oder zu durchlaufen, und codiert daher jedes Dokument unabhängig von der aktuellen Anfrage. Das begünstigt einen umfassenden Recall, kann aber feine Beziehungen wie Negation, Rollen, Chronologie oder exakte Bedingungen übersehen.
Eine Übersicht über Anfrage-Dokument-Paare beschreibt den Reranker als Cross-Encoder, der eine Anfrage und ein Dokument gemeinsam bewertet. Diese gemeinsame Aufmerksamkeit ist ausdrucksstärker als der Vergleich separat erzeugter Vektoren, aber zu kostspielig, um sie auf jedes Dokument in einer großen Bibliothek anzuwenden.
Die Suche in zwei Stufen teilt die Arbeit auf: Das erste Modell erstellt einen Kandidatenpool, das zweite investiert Präzision in diesen Pool. Wenn die korrekten Belege nie in den Pool gelangen, kann das Reranking sie nicht wiederherstellen, wodurch der Recall der Kandidaten zu einer zwingenden Abhängigkeit wird.
Die gemeinsame Bewertung verändert, welche Belege den Generator erreichen
Der Reranker sieht die vollständige Anfrage neben jedem Kandidaten und kann eine exakte Folgerung, übereinstimmende Entitäten oder erforderliche Bedingungen positiv bewerten. Er kann eine allgemein ähnliche Übersicht hinter einen kurzen Absatz zurückstufen, der die Frage direkt beantwortet. Die an das LLM übergebenen Top-k enthalten daher andere Belege.
Eine ausführliche Darstellung der Cross-Encoder-Interaktion erklärt, wie Cross-Encoder die Einschränkungen der Bi-Encoder-Ähnlichkeit durch gemeinsame Verarbeitung überwinden. Diese zusätzliche Interaktion ist der Mechanismus hinter der besseren Reihenfolge, nicht eine zweite Vektorsuche. Dieser Unterschied verändert die daraus resultierende Entscheidung im Haushalt.
Die Reihenfolge ist wichtig, weil Kontextfenster und Aufmerksamkeit begrenzt sind. Eine bessere erste Passage kann die Antwort früh verankern, während niedriger eingestufte Duplikate ergänzende Belege verdrängen können. Beim Reranking sollten daher sowohl Relevanz als auch Abdeckung berücksichtigt werden, statt lediglich zehn Versionen derselben Tatsache zu erzeugen.
Wo Reranking die private Suche verschlechtert
Ein Reranker übernimmt die Präferenzen seiner Trainingsdaten. Er kann ausformulierte Texte gegenüber Tabellen, dominante Sprachen gegenüber dem Dialekt eines Haushalts oder explizite Schlüsselwortübereinstimmungen gegenüber impliziten Belegen bevorzugen. Kleine Kandidatenpools verstärken Fehler der ersten Stufe, während große Pools die Latenz erhöhen und die interaktive Suche unausgewogen wirken lassen können.
Eine aktuelle Diskussion über Belegsvielfalt weist darauf hin, dass ein ausschließlich auf Relevanz ausgerichtetes Reranking die Belegsvielfalt verringern kann, was einen späteren Diversitätsschritt nahelegt. Das zeigt, warum ein höherer Relevanz-Score nicht automatisch eine vollständigere Belegsammlung bedeutet. Diese Grenze bleibt auch bei der späteren Belegprüfung sichtbar.
Die Aussage scheitert, wenn der Reranker nicht zur Domäne passt oder die Latenz das Interaktionsbudget überschreitet. Er sollte umgangen oder ersetzt werden, wenn er verifizierte Antworten regelmäßig zurückstuft, die Quellenvielfalt verringert oder die Reihenfolge verändert, ohne die gestützten Antworten zu verbessern.
Die Reihenfolge mit gepaarten Suchläufen bewerten
Erstellen Sie einen Testsatz mit Anfragen, akzeptablen Belegpassagen und wichtigen Quellenkategorien. Speichern Sie für jede Anfrage das Ranking der ersten Stufe und die Reihenfolge nach dem Reranking. Messen Sie anschließend den Recall im Kandidatenpool, die Präzision am endgültigen Grenzwert, den reziproken Rang, die Zitierunterstützung und die Latenz.
Verwenden Sie wiederholbare Bewertungen statt einprägsamer Demo-Fragen und folgen Sie dabei dem Ansatz des Rerankings der ersten Stufe. Untersuchen Sie Rangumkehrungen manuell, insbesondere bei Tabellen, mehrsprachigen Texten, Negationen, Datumsangaben und nahezu identischen Textabschnitten. Die Abhängigkeit muss daher in der Praxis separat gemessen werden.
Behalten Sie den Reranker nur bei, wenn er im gesamten Testsatz gestützte Belege nach oben bringt, ohne eine unakzeptable Latenz oder einen Verlust an Vielfalt zu verursachen. Ein niedrigerer Score der endgültigen Antwort sollte eine Untersuchung des Kandidaten-Recalls unabhängig von der Qualität des Rerankers auslösen, da die beiden Stufen auf unterschiedliche Weise versagen.
Tech- & KI-Zentrum
Mehr zum Lesen

Mehrsprachige Embeddings: Wie ein einziger Vektorraum Haushaltsdokumente sprachübergreifend verbindet
Erfahren Sie, wie ausgerichtete Embeddings Dokumente über Sprachgrenzen hinweg verknüpfen, warum die Qualität der Informationsabfrage variiert und wie Sie die Abdeckung sprachübergreifender Belege lokal...

Konflikte im Agentengedächtnis: Warum aktuelle Korrekturen gegenüber wiederholt genannten älteren Fakten verlieren können
Erfahren Sie, wie doppelte alte Erinnerungen Korrekturen überlagern, wann Aktualitätsregeln versagen und wie Sie die Ablösung in einem privaten Agenten-Speicher für Erinnerungen testen.

Lokales LLM-Sampling: Warum Decodierungseinstellungen Wiederholungen und Stabilität verändern
Erfahre, wie Temperatur, Top-p, Min-p, Seeds und Strafwerte zusammenspielen – und wie du Decodierungseinstellungen testest, ohne Zufälligkeit mit Qualität zu verwechseln.

