Ocena RAG staje się ważniejsza wraz z rozrostem biblioteki, ponieważ niejednoznaczność wyszukiwania i zakres regresji zwiększają się, nawet gdy użytkownicy zadają tę samą liczbę pytań.
Rodzina może nadal wykonywać 100 wyszukiwań tygodniowo po zwiększeniu archiwum z 10 000 do miliona fragmentów. Jednak każde zapytanie ma teraz więcej niemal identycznych wyników, nieaktualnych wersji, języków i ograniczeń uprawnień, które mogą konkurować o wysoką pozycję. Mały, stały zestaw testowy obejmuje coraz mniejszą część możliwych błędów wyszukiwania w każdej nowo dodanej warstwie treści.
Więcej kandydatów oznacza więcej sposobów na znalezienie pozornie wiarygodnych błędów
Wyszukiwanie przybliżone nie ocenia dokładnie każdego fragmentu. Wraz z rozrostem korpusu więcej fragmentów może znajdować się blisko zapytania, w tym nadmiarowe i nieaktualne dowody. Precyzja może spaść, nawet jeśli liczba zapytań i top-k pozostają bez zmian.
Kontrolowane badanie strategii wyszukiwania porównuje wyszukiwanie gęste, hybrydowe, z ponownym rangowaniem oraz rozszerzone w stałych warunkach generowania, pokazując, że zmiany strategii prowadzą do mierzalnych kompromisów między precyzją a czułością.
Ocena musi więc uwzględniać trafność, pozycję, wersję i uprawnienia, a nie tylko to, czy odpowiedź istnieje. Większa liczba dokumentów zwiększa również ryzyko, że płynna odpowiedź powoła się na wiarygodny, lecz nieautorytatywny duplikat.
Zakres i etykietowanie rosną wraz z różnorodnością korpusu
Zestaw testowy reprezentuje typy dokumentów, języki, daty, encje i intencje zapytań. Gdy biblioteka zyskuje nowe rodziny treści, stare pytania nie obejmują już całego obszaru ryzyka. Zwiększenie zakresu wymaga ocen trafności i określenia oczekiwanych dowodów, nawet przy niezmienionym ruchu produkcyjnym.
Badania nad pokryciem informacji wskazują, że klasyczne miary precyzji i czułości mogą nie wykrywać, czy wyniki obejmują odrębne potrzeby informacyjne. Różnorodność korpusu może rosnąć szybciej niż liczba zapytań.
Każdy indeks, dzielenie na fragmenty, model osadzania, polityka filtrowania i wariant ponownego rangowania zwielokrotnia liczbę porównań. Automatyczne oceny zmniejszają nakład pracy, ale zwiększają koszt wnioskowania i wymagają własnej kalibracji. Koszt oceny to cena wiedzy o tym, czy rozrost korpusu zmienił działanie systemu.
Kiedy rozmiar biblioteki nie jest głównym czynnikiem kosztowym
Rozmiar indeksu może mieć niewielki wpływ, gdy zapytania dotyczą unikalnych identyfikatorów, a deterministyczne filtry najpierw zawężają zbiór kandydatów. Większy korpus jednorodnych duplikatów może zwiększać ilość danych bez istotnego zwiększania różnorodności zapytań.
Struktura dotycząca weryfikowalności twierdzeń rozkłada zapytania i odpowiedzi na jednostki pokrycia i weryfikowalności, pokazując, że obciążenie związane z oceną zależy zarówno od struktury twierdzeń, jak i od rozmiaru korpusu.
Mechanizm ten nie sprawdza się również, jeśli koszt oceny wynika głównie z drogiego generowania lub ręcznej weryfikacji każdej odpowiedzi. W takim przypadku rozrost biblioteki ma znaczenie drugorzędne. Więcej testów nie zawsze oznacza lepsze wyniki; nadmiarowe pytania mogą zwiększać wydatki bez zwiększania pokrycia ryzyka.
Powiąż wydatki na ocenę z nowym ryzykiem wynikającym z rozrostu korpusu
Utrzymuj podstawowy zestaw regresyjny, a następnie dodawaj pytania warstwowe tylko wtedy, gdy biblioteka zyskuje nowy język, typ dokumentu, klasę uprawnień, okres lub ważną encję. Oznaczaj wymagane dowody i znane trudne negatywne przykłady. Przed kosztownymi miarami generowania uruchamiaj metryki dotyczące wyłącznie wyszukiwania.
Powiąż aktualizacje testów ze zdarzeniami aktualizacji indeksu, aby nowo zindeksowane lub pominięte pliki uruchamiały ukierunkowaną ocenę zamiast pełnego, nieustrukturyzowanego ponownego testu. Zachowaj stały zbiór kontrolny do porównywania trendów.
Śledź koszt przypadający na objętą zakresem warstwę i wykrytą usterkę, a nie koszt przypadający na zapytanie produkcyjne. Próbkuj rutynowe warstwy niskiego ryzyka i w pełni testuj treści wrażliwe na uprawnienia lub często zmieniane. Jeśli wyniki pogarszają się tylko w jednej nowej warstwie, napraw ją i ponownie uruchom ten fragment przed rozszerzeniem całego zestawu.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak mierzyć jakość lokalnego wyszukiwania RAG oraz interpretować kompletność przywołań, precyzję i pokrycie cytowaniami
Zbuduj lokalny zestaw testowy RAG, oblicz podstawowe metryki wyszukiwania, zinterpretuj kompromisy między nimi i sprawdź, czy twierdzenia zawarte w odpowiedziach są poparte przytoczonymi dowodami.

Dlaczego obliczenia funkcji inteligentnego domu stają się ważniejsze wraz ze wzrostem liczby czujników przy tej samej częstotliwości próbkowania?
Śledź obliczenia dla poszczególnych czujników i między czujnikami wraz ze wzrostem liczby urządzeń, identyfikuj nieliniowe koszty fuzji danych i porównaj wydajność potoku cech, zanim...

Dlaczego narzut narzędzi agenta ma coraz większe znaczenie wraz ze wzrostem liczby kroków przepływu pracy przy tej samej wielkości modelu?
Prześledź, jak oczekiwanie na operacje szeregowe, rozrost kontekstu, ponowienia i niezawodność kumulują się na kolejnych etapach działania agenta, a następnie zmierz narzut wykonania oddzielnie...

