Jak mierzyć jakość lokalnego wyszukiwania RAG oraz interpretować kompletność przywołań, precyzję i pokrycie cytowaniami

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Jakość lokalnego RAG można mierzyć, gdy oznaczone dowody, metryki wyszukiwania oraz kontrole cytowań na poziomie twierdzeń są oceniane osobno na reprezentatywnym zestawie zapytań.

Płynna odpowiedź może ukrywać pominięte źródło, podobnie jak skuteczny moduł wyszukujący może przekazać poprawne fragmenty generatorowi, który źle je cytuje. Zacznij od zapytań, dla których znane są odpowiednie fragmenty, a następnie oceń listę top-k przed wygenerowaniem odpowiedzi. Pokrycie cytowaniami należy do warstwy odpowiedzi i nie może zastępować miary pełności wyszukiwania.

Utwórz dane referencyjne przed obliczeniem dowolnej metryki

Dla każdego zapytania testowego wskaż wszystkie akceptowalne fragmenty dowodowe albo przynajmniej uzasadniony zbiór oceniany. Uwzględnij bezpośrednie wyszukiwanie informacji, pytania wymagające syntezy, przypadki zależne od aktualności, skróty, języki oraz ograniczenia uprawnień. Podziel pytania używane do dostrajania od odłożonego zbioru testowego.

Praktyczny przegląd oceny RAG zaleca osobną ocenę modułów wyszukującego i generującego, ponieważ wyniki całościowe nie pozwalają zlokalizować źródła błędu.

Dane referencyjne mogą być niepełne w dużej bibliotece. Zbierz wyniki z kilku modułów wyszukujących, oceń ich sumę i oznacz niepewne przypadki, zamiast uznawać każdy nieoceniony fragment za nieistotny. Słabe etykiety tworzą precyzyjnie wyglądające, lecz mylące metryki.

Pełność i precyzja odpowiadają na różne pytania dotyczące wyszukiwania

Recall@k to liczba odpowiednich fragmentów znalezionych w top k podzielona przez liczbę wszystkich znanych odpowiednich fragmentów. Precision@k to liczba odpowiednich fragmentów w top k podzielona przez k. Wyższa wartość k zwykle zwiększa pełność, ale dopuszcza więcej szumu, dlatego obie metryki należy odczytywać łącznie.

Klasyczne definicje precyzji i pełności opisują ten kompromis w wyszukiwaniu informacji. Nie uwzględniają pozycji w rankingu, dlatego gdy znaczenie ma wczesny dostęp do dowodów, dodaj MRR lub nDCG.

Zapytanie z jednym odpowiednim fragmentem ma Recall@5 równy 1,0, jeśli ten fragment pojawia się gdziekolwiek wśród pięciu wyników, ale Precision@5 wynosi tylko 0,2. Może to być akceptowalne dla rerankera, lecz zbyt zaszumione dla generatora korzystającego z małego kontekstu. Docelowe wartości metryk zależą od budżetu dowodów na dalszym etapie.

Pokrycie cytowaniami sprawdza twierdzenia, a nie linki

Podziel wygenerowaną odpowiedź na twierdzenia, które można zweryfikować. Pokrycie cytowaniami to liczba twierdzeń popartych dowodami podzielona przez liczbę twierdzeń wymagających dowodów; poprawność cytowania oznacza sprawdzenie, czy każdy cytowany fragment rzeczywiście potwierdza przypisane mu twierdzenie. Odpowiedź może zawierać wiele linków, a mimo to mieć słabe pokrycie.

Najnowsze prace nad wyszukiwaniem uwzględniającym cytowania oceniają pokrycie zapytań i weryfikowalność atomowych twierdzeń, ponieważ jeden zagregowany wynik trafności nie ujawnia niepopartych fragmentów odpowiedzi.

Pokrycie cytowaniami przestaje być miarodajne, gdy twierdzenia nie są dzielone w spójny sposób albo gdy wiedza ogólna i twierdzenia wymagające źródeł są mieszane bez określonej polityki. Nie może też dowieść, że odpowiedź jest kompletna. Więcej cytowań nie oznacza automatycznie lepszego ugruntowania.

Stosuj regułę decyzyjną zachowującą rozdzielenie diagnostyczne

Najpierw uruchom wyszukiwanie i zapisz identyfikatory uszeregowanych fragmentów, wyniki oraz wersje. Oblicz Recall@k, Precision@k, MRR lub nDCG, a następnie wygeneruj odpowiedzi z zamrożonych wyników i oceń wierność, trafność odpowiedzi, pokrycie cytowaniami oraz poprawność cytowań.

Kontrolowana ocena metryk RAG jednocześnie raportuje precyzję kontekstową, pełność kontekstową, wierność i trafność odpowiedzi, pokazując, dlaczego żadna pojedyncza metryka nie jest wystarczająca.

Dopuszczaj wydanie tylko wtedy, gdy pełność wyszukiwania osiąga ustalony próg, precyzja mieści się w budżecie kontekstu, a każde istotne twierdzenie odpowiedzi jest poparte dowodami lub wyraźnie zastrzeżone. Jeśli zawodzi pełność, napraw indeksowanie lub wyszukiwanie; jeśli zawodzą cytowania mimo obecności poprawnych dowodów, napraw generowanie i przypisywanie źródeł.

Zastosuj jedną bramkę wydania dla wyszukiwania i cytowań

Przygotuj co najmniej 50 reprezentatywnych zapytań dla niewielkiego systemu domowego, zwiększając ich liczbę do 100–200 wraz ze wzrostem różnorodności typów dokumentów i języków. Oceniaj dowody top-5 i top-10, zamroź zbiór wyników, a następnie przeprowadź audyt wygenerowanych twierdzeń. Raportuj średnie makro oraz najsłabiej działające warstwy zapytań.

Umieść test obok treści dotyczących oceny formatów RAG, aby źródła tabelaryczne i narracyjne były reprezentowane, zamiast uśredniania ich razem. Wersjonuj każdy identyfikator fragmentu i każdą ocenę trafności.

Stosuj początkowe progi, takie jak Recall@5 na poziomie 0,85 i poprawność cytowań na poziomie 0,95, wyłącznie jako lokalne wartości początkowe, a nie uniwersalne standardy. Zaostrzaj je odpowiednio do ryzyka. Nigdy nie poświęcaj poprawności uprawnień ani niepopartych twierdzeń o dużym znaczeniu w zamian za wyższy wynik zagregowany.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.