Kalibrering av sökpoäng omvandlar rå likhet till en användbar konfidenssignal genom att relatera poäng till observerad relevans för en definierad privat sökuppgift.
En cosinuspoäng på 0,82 kan vara utmärkt för en inbäddningsmodell och ordinär för en annan. Dess betydelse förändras också med uppdelning i textstycken, dokumentspråk, frågans svårighetsgrad och korpusens täthet. Kalibrering använder märkta exempel för att uppskatta hur ofta resultat inom ett visst poängintervall faktiskt är relevanta, så att trösklar och regler för att avstå kan bygga på evidens i stället för intuition.
Likhet rangordnar kandidater men uttrycker inte sannolikhet
Cosinuslikhet, skalärprodukt och avstånd är geometriska rangordningssignaler. De jämför en frågevektor med dokumentvektorer enligt en viss modell och normalisering. Även när värdet ligger mellan noll och ett betyder det inte en motsvarande procentuell sannolikhet för relevans.
Pinecones indexöversikt förklarar att semantisk sökning returnerar poster som ligger närmast en frågevektor. Den mekanismen fastställer det relativa grannskapet, men den råa poängskalan beror fortfarande på måttet, kodaren, korpusen och frågan. Denna åtskillnad är fortsatt viktig under realistiska förhållanden i hemmet.
En tröskel som kopieras från en annan driftsättning kan därför avvisa bra träffar i hemmet eller acceptera plausibla distraktorer. Det första steget är att definiera relevans för den avsedda uppgiften, till exempel om ett textstycke direkt stöder ett svar i stället för att bara handla om samma ämne.
Märkta frågor kopplar poängintervall till empiriska utfall
Skapa en separat uppsättning realistiska frågor och bedöm kandidattextstycken som stödjande, relaterade eller irrelevanta. En kalibrator, exempelvis logistisk regression, isotonic regression eller intervallbaserad tillförlitlighetskartläggning, kan sedan koppla råpoäng och kompletterande egenskaper till observerade relevansfrekvenser.
Forskning om kalibrering av hämtning hävdar att osäkerhet i hämtningen bör komplettera punktpoängen och visar kalibreringsmedveten rangordning och förutsägelse av avgränsningar. Detta talar för att använda valideringsdata för att lära sig en beslutsignal i stället för att tolka rangordningspoängen direkt.
Kalibrering är villkorad. Separata mappningar kan behövas för olika språk, dokumenttyper eller frågeklasser när deras poängfördelningar skiljer sig åt. Resultatet kan styra avstående, begära bredare hämtning eller utlösa omrangordning, medan rangordningskvaliteten fortfarande bör mätas separat.
Förändringar i korpus och modell orsakar kalibreringsdrift
Om många nästan identiska dokument läggs till, textstyckenas storlek ändras, en inbäddningsmodell uppgraderas eller hybridsökning aktiveras förändras kandidat- och poängfördelningarna. En tidigare tillförlitlig tröskel kan bli överdrivet självsäker även när återkallningen för topp-k verkar stabil. Mellanläget bör förbli synligt vid senare felsökning och granskning.
Scikit-learns dokumentation om tillförlitlighetskalibrering skiljer sannolikheternas tillförlitlighet från rå prediktiv prestanda och presenterar tillförlitlighetsdiagram och kalibreringsmetoder. Samma utvärderingslogik gäller efter att en hämtningspoäng har modellerats som en relevanssannolikhet.
Felgränsen är all användning av kalibrerad konfidens utanför de data och den beslutsdefinition som användes för att anpassa modellen. Kalibrering kan inte reparera saknade belägg, snedvridna etiketter eller en felaktig entitetsmatchning; den uppskattar endast observerad korrekthet under jämförbara förhållanden.
Skapa ett tillförlitlighetsdiagram för hämtning
Samla in minst femtio representativa frågor från hemmet med bedömda kandidattextstycken och håll en separat testuppdelning. Dela in förutsagd konfidens i intervall, jämför varje intervall med dess observerade relevansgrad och registrera kalibreringsfel tillsammans med återkallning, precision, rangordningskvalitet och täckning.
Använd utvärderingsramverket i utvärdering av RAG-hämtning för att hålla hämtningens kvalitet åtskild från täckningen av svarsciteringar. Testa direkta frågor, förkortningar, flerspråkiga frågor, OCR-text och fall utan svar, eftersom deras poängfördelningar kan skilja sig åt. Detta beroende måste mätas separat innan automatisering aktiveras.
Fastställ en tröskel för att avstå eller göra omrangering först efter att kostnaden för felaktigt accepterande och felaktigt avvisande har mätts. Anpassa eller validera om när kodaren, uppdelningen i textstycken, fusionen eller korpusens sammansättning ändras; visa annars värdet som likhet, inte konfidens.
Teknik- och AI-hubb
Mer att läsa

Lokal AI-NUMA-lokalitet: Varför minnesplacering ändrar matningshastigheten till acceleratorn
Lär dig hur CPU-, RAM- och PCIe-topologin påverkar matningen av acceleratorer, varför automatisk placering kan variera och hur du säkert kan benchmarka NUMA-bindning.

Minnesavbildning av modellfiler: Hur delade sidor minskar duplicerad RAM-användning
Förstå hur mappade modellsidor läses in och delas, varför RSS kan vara missvisande och vilka cachar och buffertar som fortfarande förbrukar RAM per process.

Privata granskningsspår för AI: Så återskapar händelseloggar agenters beslut
Lär dig vad en granskningskedja för en agent måste registrera, varför vanliga loggar är ofullständiga och hur du kan spela upp ett privat arbetsflöde...

