En andra modell ändrar evidensordningen genom att läsa varje fråga–kandidat-par gemensamt och tillämpa finare relevanssignaler än vad jämförelsen av vektorer i första steget kan representera.
Ett privat arkiv kan hämta tjugo plausibla textavsnitt på millisekunder, men det mest användbara stycket hamnar under generiskt material som delar frågans vokabulär. En omrankare lägger mer beräkningskraft på denna lilla kandidatmängd och skapar en ny poäng för varje par. Det slutliga sammanhanget kan förbättras även om inga dokument, embeddingar eller användarfrågor har ändrats.
Hämtning i första steget optimerar täckning inom en hastighetsbudget
Tät eller hybrid hämtning jämför kompakta representationer i hela korpusen. Den måste vara tillräckligt snabb för att skanna eller gå igenom många kandidater, så den kodar varje dokument oberoende av den aktuella frågan. Detta gynnar bred återkallning men kan missa finare relationer som negationer, roller, kronologi eller exakta begränsningar.
En översikt av fråge–dokument-par beskriver omrankaren som en korskodare som poängsätter en fråga och ett dokument tillsammans. Den gemensamma uppmärksamheten är mer uttrycksfull än att jämföra separat framställda vektorer, men för dyr för att tillämpas på varje dokument i ett stort bibliotek.
Hämtning i två steg delar upp arbetet: den första modellen skapar en kandidatpool; den andra lägger precision på denna pool. Om den korrekta evidensen aldrig kommer med i poolen kan omrankningen inte återställa den, vilket gör kandidattäckning till ett absolut beroende.
Gemensam poängsättning ändrar vilken evidens som når generatorn
Omrankaren ser hela frågan bredvid varje kandidat och kan belöna exakt följdriktighet, matchande entiteter eller nödvändiga villkor. Den kan sänka en brett liknande översikt under ett smalt stycke som direkt besvarar frågan. De översta k som skickas till LLM:en innehåller därför en annan evidens.
En detaljerad genomgång av interaktion mellan korskodare förklarar hur korskodare löser begränsningar hos likheten mellan bi-kodare genom gemensam bearbetning. Denna extra interaktion är mekanismen bakom bättre ordning, inte en andra vektorsökning. Den skillnaden förändrar det resulterande hushållsbeslutet.
Ordningen spelar roll eftersom kontextfönster och uppmärksamhet är begränsade. Ett bättre första stycke kan förankra svaret tidigt, medan lägre rankade dubbletter kan tränga undan kompletterande evidens. Omrankning bör därför ta hänsyn till både relevans och täckning, inte bara skapa tio versioner av samma faktum.
Var omrankning försämrar privat sökning
En omrankare ärver sina träningspreferenser. Den kan gynna välformulerad prosa framför tabeller, dominerande språk framför hushållsdialekter eller explicita nyckelordsträffar framför implicit evidens. Små kandidatpooler förstärker missar i första steget, medan stora pooler ökar latensen och kan få interaktiv sökning att kännas ojämn.
En aktuell diskussion om evidensmångfald noterar att omrankning som enbart fokuserar på relevans kan minska evidensmångfalden, vilket motiverar ett senare mångfaldssteg. Detta visar varför en högre relevanspoäng inte automatiskt innebär en mer komplett evidensmängd. Denna gräns förblir synlig under den senare evidensgranskningen.
Påståendet faller när omrankaren är felanpassad för domänen eller när latensen överskrider interaktionsbudgeten. Den bör kringgås eller ersättas om den konsekvent sänker verifierade svar, sammanför källmångfalden eller ändrar ordningen utan att förbättra svar med stöd i källorna.
Utvärdera ordningen med parvisa hämtningskörningar
Skapa en testmängd med frågor, godtagbara evidensstycken och viktiga källkategorier. Spara rangordningen från första steget och den omrankade ordningen för varje fråga, och mät sedan återkallning i kandidatpoolen, precision vid den slutliga gränsen, reciprok rang, citatstöd och latens.
Använd en repeterbar utvärdering i stället för minnesvärda demofrågor, enligt metoden i omrankning i första steget. Granska omkastningar i rankningen manuellt, särskilt för kalkylblad, flerspråkig text, negationer, datum och nästan identiska textavsnitt. Beroendet måste därför mätas separat i praktiken.
Behåll omrankaren endast om den främjar evidens med stöd i källorna genom hela testmängden utan oacceptabel latens eller förlust av mångfald. Ett lägre slutligt svarsbetyg bör leda till en separat undersökning av kandidattäckningen och omrankarens kvalitet, eftersom de två stegen misslyckas på olika sätt.
Teknik- och AI-hubb
Mer att läsa

Flerspråkiga inbäddningar: Hur ett enda vektorrum kopplar samman hushållsdokument på olika språk
Se hur anpassade embeddingar kopplar samman dokument på olika språk, varför kvaliteten på informationshämtningen varierar och hur du kan testa täckningen av tvärspråkliga belägg...

Konflikter i agentminnet: Varför nyliga korrigeringar kan ge vika för upprepade äldre fakta
Lär dig hur dubbletter av gamla minnen övertrumfar korrigeringar, när regler för aktualitet misslyckas och hur du testar ersättning i en privat minneslagring för...

Sampling av lokala LLM: Varför avkodningsinställningar påverkar upprepning och stabilitet
Lär dig hur temperatur, top-p, min-p, frön och straffvärden samverkar – och hur du testar avkodningsinställningar utan att förväxla slumpmässighet med kvalitet.

