Kalibracja wyniku wyszukiwania przekształca surowe podobieństwo w użyteczny sygnał pewności, odnosząc wyniki do zaobserwowanej trafności w ramach zdefiniowanego zadania wyszukiwania prywatnego.
Wynik podobieństwa cosinusowego równy 0,82 może być znakomity dla jednego modelu osadzania, a przeciętny dla innego. Jego znaczenie zmienia się również w zależności od dzielenia na fragmenty, języka dokumentów, trudności zapytania i gęstości korpusu. Kalibracja wykorzystuje oznaczone przykłady, aby oszacować, jak często wyniki z danego przedziału punktowego są rzeczywiście trafne, dzięki czemu progi i reguły rezygnacji z odpowiedzi opierają się na dowodach, a nie na intuicji.
Podobieństwo porządkuje kandydatów, ale nie wyraża prawdopodobieństwa
Podobieństwo cosinusowe, iloczyn skalarny i odległość to geometryczne sygnały rankingowe. Porównują wektor zapytania z wektorami dokumentów w ramach konkretnego modelu i sposobu normalizacji. Nawet gdy wartość mieści się między zerem a jedynką, nie oznacza to równoważnego procentowego prawdopodobieństwa trafności.
Przegląd indeksu Pinecone wyjaśnia, że wyszukiwanie semantyczne zwraca rekordy znajdujące się najbliżej wektora zapytania. Mechanizm ten wyznacza względne sąsiedztwo, ale skala surowego wyniku nadal zależy od metryki, kodera, korpusu i zapytania. Rozróżnienie to pozostaje istotne w realistycznych warunkach użytkowania domowego.
Próg skopiowany z innego wdrożenia może więc odrzucać dobre dopasowania w domowym środowisku albo akceptować wiarygodnie wyglądające wyniki rozpraszające. Pierwszym krokiem jest zdefiniowanie trafności dla danego zadania, na przykład określenie, czy fragment bezpośrednio wspiera odpowiedź, zamiast jedynie dotyczyć tego samego tematu.
Oznaczone zapytania łączą przedziały wyników z wynikami empirycznymi
Utwórz wydzielony zbiór realistycznych zapytań i oceń kandydujące fragmenty jako wspierające, powiązane lub nieistotne. Następnie kalibrator, taki jak regresja logistyczna, regresja izotoniczna albo mapowanie wiarygodności według przedziałów, może połączyć surowe wyniki i dodatkowe cechy z zaobserwowaną częstotliwością trafności.
Badania nad kalibracją wyszukiwania wskazują, że niepewność wyszukiwania powinna towarzyszyć wynikowi punktowemu, oraz pokazują ranking uwzględniający kalibrację i przewidywanie punktów odcięcia. Uzasadnia to wykorzystanie danych walidacyjnych do nauczenia sygnału decyzyjnego zamiast bezpośredniej interpretacji wyniku rankingu.
Kalibracja jest warunkowa. W przypadku różnych rozkładów wyników mogą być potrzebne osobne mapowania dla języków, typów dokumentów lub klas zapytań. Wynik może sterować rezygnacją z odpowiedzi, żądaniem szerszego wyszukiwania albo uruchomieniem ponownego rankingowania, natomiast jakość rankingu nadal należy mierzyć niezależnie.
Zmiany korpusu i modelu powodują dryf kalibracji
Dodanie wielu niemal identycznych dokumentów, zmiana rozmiaru fragmentów, aktualizacja modelu osadzania albo włączenie wyszukiwania hybrydowego zmienia rozkłady kandydatów i wyników. Wcześniej wiarygodny próg może stać się nadmiernie pewny siebie, nawet gdy czułość top-k pozostaje stabilna. Stan pośredni powinien pozostać widoczny podczas późniejszej diagnostyki i przeglądu.
Dokumentacja Scikit-learn dotycząca kalibracji wiarygodności rozróżnia wiarygodność prawdopodobieństw od surowej skuteczności predykcyjnej oraz przedstawia wykresy wiarygodności i metody kalibracji. Ta sama logika oceny ma zastosowanie po zamodelowaniu wyniku wyszukiwania jako prawdopodobieństwa trafności.
Granica niepowodzenia obejmuje każde użycie skalibrowanej pewności poza danymi i definicją decyzji wykorzystanymi do jej dopasowania. Kalibracja nie naprawi brakujących dowodów, obciążonych etykiet ani błędnego dopasowania encji; jedynie szacuje zaobserwowaną poprawność w porównywalnych warunkach.
Utwórz wykres wiarygodności wyszukiwania
Zbierz co najmniej pięćdziesiąt reprezentatywnych zapytań z domowego środowiska wraz z ocenionymi fragmentami kandydackimi, zachowując oddzielny podział testowy. Podziel przewidywaną pewność na przedziały, porównaj każdy przedział z zaobserwowaną częstością trafności i rejestruj błąd kalibracji wraz z czułością, precyzją, jakością rankingu i pokryciem.
Skorzystaj ze struktury oceny opisanej w ocenie wyszukiwania RAG, aby oddzielić jakość wyszukiwania od pokrycia cytowaniami w odpowiedziach. Testuj pytania bezpośrednie, skróty, zapytania wielojęzyczne, tekst z OCR oraz przypadki bez odpowiedzi, ponieważ ich rozkłady wyników mogą się różnić. Zależność tę należy zmierzyć osobno przed włączeniem automatyzacji.
Ustal próg rezygnacji z odpowiedzi lub ponownego rankingowania dopiero po zmierzeniu kosztu fałszywej akceptacji i fałszywego odrzucenia. Ponownie dopasuj model lub przeprowadź walidację za każdym razem, gdy zmieni się koder, dzielenie na fragmenty, scalanie wyników lub skład korpusu; w przeciwnym razie wyświetlaj tę wartość jako podobieństwo, a nie pewność.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie czynniki decydują o dokładności cytowań RAG w domowej bazie wiedzy?
Dowiedz się, dlaczego trafne źródło może nadal być błędnym cytowaniem, które etapy potoku kontrolują poparcie i zakres oraz jak audytować twierdzenia RAG dotyczące gospodarstw...

Jakie funkcje umożliwiają niezawodne generowanie danych JSON przez lokalny model LLM?
Sprawdź, które funkcje wymuszają składnię JSON, które chronią poprawność semantyczną oraz jak testować lokalny model w różnych schematach, promptach i przypadkach błędów.

Lokalne pochodzenie danych AI: dlaczego każda odpowiedź potrzebuje możliwej do prześledzenia ścieżki źródłowej
Dowiedz się, jak ścieżki źródłowe sprawiają, że lokalne odpowiedzi AI można poddać audytowi, dlaczego same cytowania są niepełne oraz jak testować pochodzenie danych po...

