Fuzja odwrotnych rang łączy wyszukiwanie słów kluczowych i wyszukiwanie wektorowe, dodając wkłady zależne od pozycji w rankingu zamiast próbować porównywać ich niekompatybilne surowe wyniki trafności.
Zapytanie dotyczące domowej bazy wiedzy może wymagać BM25 do znalezienia dokładnego numeru modelu, podczas gdy gęste wyszukiwanie odnajdzie sparafrazowaną notatkę dotyczącą rozwiązywania problemów. Ich wyniki używają różnych skal, więc bezpośrednie uśrednianie jest niestabilne. RRF zamiast tego przekształca pozycję każdego kandydata w wartość taką jak `1/(k + rank)`, sumuje wkłady z poszczególnych list i sortuje łączny wynik.
Każdy moduł wyszukiwania tworzy niezależną listę rankingową
Wyszukiwanie słów kluczowych szereguje dopasowania leksykalne na podstawie częstości terminów i statystyk dokumentów, podczas gdy wyszukiwanie wektorowe szereguje podobieństwo semantyczne w przestrzeni osadzeń. Filtry i głębokość zbioru kandydatów są stosowane przed fuzją, dlatego listy mogą częściowo się pokrywać albo nie pokrywać się wcale.
Wyjaśnienie hybrydowego wyszukiwania dotyczące fuzji kandydatów opisuje szeroki etap tworzenia kandydatów na podstawie słów kluczowych i wektorów, po którym następuje precyzyjne ponowne szeregowanie. To rozdzielenie wyjaśnia, że fuzja decyduje, które dowody trafią do wspólnej puli. Różnica ta pozostaje widoczna podczas późniejszych testów domowych.
RRF potrzebuje rang i tożsamości dokumentów, a nie porównywalnych wyników. Zduplikowane fragmenty muszą używać stabilnego klucza, aby te same dowody mogły otrzymać wsparcie od obu modułów wyszukiwania. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja przejdzie dalej.
Wkłady odwrotne nagradzają wysokie pozycje i zgodność
Dla każdej listy zawierającej kandydata RRF dodaje odwrotność stałej powiększonej o jego rangę. Wynik znajdujący się blisko początku otrzymuje większą wagę, a wynik pojawiający się na obu listach gromadzi dwa wkłady, nawet jeśli żaden z surowych wyników nie jest liczbowo porównywalny.
Przegląd fuzji wyników opartej na rangach wyjaśnia, jak wyniki wyszukiwania słów kluczowych i wyszukiwania wektorowego stają się jednym rankingiem. Stała rangi wygładza różnicę między sąsiednimi pozycjami i zapobiega temu, aby pierwszy wynik zdominował wszystkich niżej sklasyfikowanych kandydatów.
Kandydat znaleziony tylko przez jeden moduł wyszukiwania nadal może uzyskać wysoką pozycję, jeśli zajmuje mocną pozycję na swojej liście. Zgodność pomaga, ale RRF nie wymaga części wspólnej, dzięki czemu zachowuje uzupełniające się dowody leksykalne lub semantyczne. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Głębokość zbioru kandydatów i stała rangi kształtują wynik
Fuzja nie może odzyskać istotnego dokumentu wykluczonego z obu list wejściowych. Głębsze pule kandydatów zwiększają szanse znalezienia wyniku, ale dodają opóźnienia i szumu; stała rangi kontroluje, jak wyraźnie różnią się pozycje na początku listy, a listy zawierające wiele duplikatów mogą zniekształcać reprezentację.
Opis wdrożenia produkcyjnego dotyczący komplementarności słów kluczowych i wektorów pokazuje, dlaczego wyszukiwanie słów kluczowych może odzyskać dokładne terminy dotyczące planu i funkcji, z którymi wyszukiwanie semantyczne radzi sobie słabiej. Umieszcza również fuzję przed wyborem kolejnych elementów, zamiast traktować wynik po fuzji jako końcową ocenę jakości dowodów.
Granica zawodności przebiega przy słabej kompletności pierwszego etapu lub niespójnych filtrach. RRF zmienia kolejność dostarczonych kandydatów; nie naprawi brakujących uprawnień, nieaktualnych fragmentów, słabych osadzeń ani analizatora leksykalnego, który nigdy nie zwrócił odpowiedniego dokumentu. Praktyczna konsekwencja pojawia się, gdy kilka źródeł konkuruje o ograniczony kontekst.
Oceniaj fuzję względem obu pojedynczych modułów wyszukiwania
Przygotuj oceniane zapytania obejmujące dokładne nazwy, skróty, parafrazy, terminy wielojęzyczne, błędy OCR i przypadki bez odpowiedzi. Zapisuj rangi słów kluczowych, rangi wektorowe, wkłady po fuzji, głębokość zbioru kandydatów, filtry, końcową kolejność i wszelkie wyniki ponownego szeregowania. Ta zależność powinna pozostać wyraźnie określona w końcowym interfejsie.
Porównaj architekturę kandydatów z hybrydowym wyszukiwaniem NAS. Zmierz kompletność przed fuzją, precyzję po fuzji, pokrycie cytowaniami, opóźnienie oraz odsetek istotnych wyników wnoszonych wyłącznie przez każdy z modułów wyszukiwania. Wynik należy zatem sprawdzić względem oryginalnych dowodów.
Zachowaj RRF, jeśli poprawia pokrycie dowodów w zbiorze testowym przy akceptowalnym koszcie szumu kontekstowego. Dostosuj głębokość zbioru kandydatów i stałą na podstawie zbioru testowego, a następnie zbadaj braki charakterystyczne dla poszczególnych modułów wyszukiwania, zamiast bez końca dostrajać fuzję dla nieobecnych dowodów. Różnica ta pozostaje widoczna podczas późniejszych testów domowych.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak zmniejszanie rozdzielczości szeregów czasowych wpływa na wykrywanie anomalii w inteligentnym domu?
Zobacz, jak szerokość przedziałów, agregacja, antyaliasing, brakujące dane, czas trwania zdarzenia i przechowywanie danych w wielu skalach wpływają na wykrywanie anomalii w inteligentnym domu.

Jak mapa zajętości łączy słabe sygnały inteligentnego domu?
Dowiedz się, jak komórki przestrzenne, modele czujników, aktualizacje log-ilorazów szans, wygaszanie, skorelowane dane i wartości progowe przekształcają słabe sygnały z domu w szacunki obecności...

Jak normalizacja fotometryczna wpływa na klasteryzację prywatnych twarzy?
Zobacz, jak korekcja oświetlenia zmienia kadry twarzy, reprezentacje wektorowe, odległości między klastrami, wartości progowe, nadmierną normalizację i ocenę wyszukiwania prywatnych zdjęć.

