Privézoekresultaten opnieuw rangschikken: hoe een tweede model de uiteindelijke volgorde van het bewijsmateriaal verandert

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Een tweede model verandert de volgorde van het bewijsmateriaal door elk query-kandidaatpaar gezamenlijk te lezen en verfijndere relevantiesignalen toe te passen dan de vectorvergelijking in de eerste fase kan weergeven.

Een privéarchief kan in milliseconden twintig plausibele fragmenten ophalen, terwijl de nuttigste passage onder generiek materiaal staat dat dezelfde woordenschat als de query deelt. Een reranker besteedt meer rekenkracht aan die kleine kandidaatset en produceert voor elk paar een nieuwe score. De uiteindelijke context kan verbeteren, ook al zijn er geen documenten, embeddings of gebruikersvragen veranderd.

Ophalen in de eerste fase optimaliseert dekking binnen een snelheidsbudget

Dense of hybride retrieval vergelijkt compacte representaties in het hele corpus. Het proces moet snel genoeg zijn om veel kandidaten te scannen of te doorzoeken en codeert daarom elk document onafhankelijk van de huidige query. Dit bevordert een brede recall, maar kan subtiele relaties missen, zoals ontkenning, rol, chronologie of exacte voorwaarden.

Een overzicht van query-documentparen beschrijft de reranker als een cross-encoder die een query en document gezamenlijk scoort. Die gezamenlijke aandacht is expressiever dan het vergelijken van afzonderlijk geproduceerde vectoren, maar te duur om op elk document in een grote bibliotheek toe te passen.

Retrieval in twee fasen verdeelt het werk: het eerste model maakt een kandidaatpool; het tweede besteedt precisie aan die pool. Als het juiste bewijsmateriaal nooit in de pool terechtkomt, kan reranking het niet terughalen. Daarmee is de recall van kandidaten een harde afhankelijkheid.

Gezamenlijk scoren bepaalt welk bewijsmateriaal de generator bereikt

De reranker ziet de volledige query naast elke kandidaat en kan exacte gevolgtrekking, overeenkomende entiteiten of vereiste voorwaarden belonen. Hij kan een breed vergelijkbaar overzicht lager plaatsen dan een korte alinea die de vraag rechtstreeks beantwoordt. De top-k die aan de LLM wordt doorgegeven bevat daardoor ander bewijsmateriaal.

Een gedetailleerde behandeling van interactie tussen cross-encoders legt uit hoe cross-encoders de beperkingen van bi-encoders voor gelijkenis oplossen door gezamenlijke verwerking. Die extra interactie vormt het mechanisme achter een betere volgorde, niet een tweede vectorzoekopdracht. Dat onderscheid verandert de uiteindelijke beslissing in het huishouden.

De volgorde is belangrijk omdat contextvensters en aandacht eindig zijn. Een betere eerste passage kan het antwoord vroeg onderbouwen, terwijl lager gerangschikte duplicaten aanvullend bewijsmateriaal kunnen verdringen. Reranking moet daarom zowel relevantie als dekking in aanmerking nemen en niet slechts tien versies van één feit produceren.

Wanneer reranking privézoeken slechter maakt

Een reranker neemt de voorkeuren uit zijn training over. Hij kan verzorgde proza verkiezen boven tabellen, dominante talen boven dialecten uit het huishouden, of expliciete zoekwoordmatches boven impliciet bewijsmateriaal. Kleine kandidaatpools versterken missers uit de eerste fase, terwijl grote pools latentie toevoegen en interactief zoeken ongelijkmatig kunnen laten aanvoelen.

Een recente bespreking van diversiteit van bewijsmateriaal merkt op dat reranking op basis van alleen relevantie de diversiteit van bewijsmateriaal kan verkleinen, wat aanleiding geeft tot een latere diversiteitsstap. Dit laat zien waarom een hogere relevantiescore niet automatisch een completere bewijsset oplevert. Deze grens blijft zichtbaar tijdens een latere beoordeling van het bewijsmateriaal.

De bewering gaat niet op wanneer de reranker niet aansluit bij het domein of wanneer de latentie het interactiebudget overschrijdt. Hij moet worden omzeild of vervangen als hij geverifieerde antwoorden consequent lager rangschikt, de diversiteit van bronnen laat instorten of de volgorde verandert zonder de onderbouwde antwoorden te verbeteren.

-15% OFF
Single board computer zimaboard2

Beoordeel de volgorde met gepaarde retrievalruns

Stel een testset samen met queries, aanvaardbare bewijspassages en belangrijke bronnencategorieën. Sla voor elke query de rangschikking uit de eerste fase en de volgorde na reranking op en meet de recall in de kandidaatpool, de precisie bij de uiteindelijke afkapgrens, de reciproke rang, de ondersteuning van citaten en de latentie.

Gebruik herhaalbare evaluatie in plaats van memorabele demovragen, volgens de aanpak in reranking in de eerste fase. Inspecteer omkeringen in de rangschikking handmatig, vooral bij spreadsheets, meertalige tekst, ontkenningen, datums en bijna-duplicaatfragmenten. De afhankelijkheid moet daarom in de praktijk afzonderlijk worden gemeten.

Behoud de reranker alleen als hij onderbouwd bewijsmateriaal in de hele testset hoger plaatst zonder onaanvaardbare latentie of verlies aan diversiteit. Een lagere score voor het uiteindelijke antwoord moet aanleiding zijn om de recall van kandidaten afzonderlijk van de kwaliteit van de reranker te onderzoeken, omdat de twee fasen op verschillende manieren falen.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.