Dokładność cytowań w RAG zależy od wyszukania właściwego fragmentu źródłowego i przypisania go do konkretnego twierdzenia, które ten fragment potwierdza, a nie tylko od wyświetlenia powiązanych dokumentów.
Domowa baza wiedzy może udzielić odpowiedzi na podstawie polisy ubezpieczeniowej, instrukcji obsługi urządzenia lub zeskanowanej faktury, a mimo to wskazać niewłaściwą stronę. Właściwy dokument może być dostępny, podczas gdy zdanie zawierające uzasadnienie zostało podzielone, sklasyfikowane niżej niż inny fragment albo powiązane z niewłaściwym wygenerowanym twierdzeniem. Jakość cytowań odzwierciedla więc jednocześnie proces pozyskiwania danych, wyszukiwanie, generowanie, zgodność oraz kontrolę wersji.
Jakość źródła i fragmentów wyznacza maksymalny poziom dowodów
Błędy OCR, brakujące tabele, nieaktualne kopie i utracone nagłówki zniekształcają dowody, zanim rozpocznie się wyszukiwanie. Granice fragmentów muszą zachowywać twierdzenie, zastrzeżenie i kontekst identyfikacyjny potrzebne do poparcia tezy; fragment zawierający wyłącznie liczbę może pasować, ale nie potwierdza, czego ta liczba dotyczy.
Badania porównujące zaawansowane strategie dzielenia na fragmenty pokazują, że wybór sposobu segmentacji dokumentu wpływa na skuteczność wyszukiwania, ponieważ fragmenty o stałej długości mogą rozdzielać pojęcia lub łączyć niepowiązane treści. Dokładność cytowania nie może przewyższać jakości dostępnego do zacytowania fragmentu.
Metadane powinny zachowywać wersję dokumentu, stronę, sekcję i współrzędne, aby cytowanie prowadziło do dowodów możliwych do sprawdzenia. Deduplikacja musi zapobiegać konkurowaniu nieaktualnych i bieżących kopii, nie usuwając przy tym historycznej wersji wykorzystanej we wcześniejszej odpowiedzi.
Wyszukiwanie i generowanie muszą zachowywać zgodność na poziomie twierdzeń
Mechanizm wyszukiwania może zwrócić stronę powiązaną tematycznie, która nie potwierdza końcowego zdania. Ponowne szeregowanie powinno traktować bezpośrednie poparcie jako priorytet, a generowanie powinno zachowywać granice twierdzeń i identyfikatory źródeł, aby każdy faktyczny fragment można było powiązać z dowodami rzeczywiście obecnymi w kontekście.
Badania nad wiernością cytowań rozróżniają poprawność cytowania od jego wierności i wskazują, że pozornie uzasadniające cytowania mogą zostać dołączone po tym, jak model oparł się na innych informacjach. Dlatego sama zgodność powierzchniowa może zawyżać poziom zaufania.
Pokrycie cytowaniami i ich poprawność to odrębne kwestie. Odpowiedź może dokładnie cytować dwa twierdzenia, pozostawiając trzy bez uzasadnienia, albo przypisywać każde zdanie do jednego obszernego dokumentu, który w rzeczywistości nie potwierdza żadnego z nich w sposób precyzyjny. Oba wymiary wymagają niezależnego pomiaru. Rozróżnienie to pozostaje widoczne podczas późniejszych testów domowych.
Przetwarzanie po wygenerowaniu może poprawić odnośniki, ale nie uzupełni brakujących dowodów
Weryfikator może porównać każde wygenerowane twierdzenie z potencjalnymi fragmentami, przenieść cytowanie do lepszego źródła albo usunąć niepoparte twierdzenie. Pozwala to wychwycić błędy zgodności po wygenerowaniu, ale nie odzyska dowodów, których nie dostarczyły proces pozyskiwania danych ani wyszukiwanie.
System korekty cytowań porównuje wygenerowane cytowania z wyszukanymi artykułami i odnotowuje poprawę dokładności cytowań przy niewielkim dodatkowym koszcie. Wyniki pokazują wartość dedykowanego etapu dopasowania po przygotowaniu odpowiedzi. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja przejdzie dalej.
Granica błędu pojawia się wtedy, gdy pewne siebie twierdzenie nie ma w zbiorze wyszukanych materiałów źródła, które je potwierdza. Weryfikator powinien wstrzymać odpowiedź, ponowić wyszukiwanie albo usunąć twierdzenie, zamiast przypisywać mu cytowanie wyglądające na najbardziej zbliżone i stwarzać pozory oparcia odpowiedzi na źródłach.
Oceniaj poparcie cytowaniami i ich pokrycie oddzielnie
Przygotuj pięćdziesiąt pytań ze zweryfikowanymi fragmentami odpowiedzi, obejmujących czyste pliki PDF, skany OCR, tabele, zduplikowane wersje i przypadki bez odpowiedzi. Podziel każdą wygenerowaną odpowiedź na atomowe twierdzenia, a następnie oceń, czy każde cytowanie potwierdza dane twierdzenie oraz czy każde twierdzenie faktyczne ma cytowanie.
Wykorzystaj schemat przywołania, precyzji i pokrycia cytowaniami opisany w schemacie oceny RAG, ale dodaj wynikanie cytowania, poprawność wersji oraz rozwiązywalną stronę lub region. Porównuj wyniki według rodzaju dokumentu, zamiast raportować tylko jeden łączny wynik. Tę granicę należy mierzyć oddzielnie w realistycznych warunkach działania.
Zaakceptuj wynik tylko wtedy, gdy cytowania prowadzą do aktualnych, możliwych do sprawdzenia fragmentów, a niepoparte twierdzenia uruchamiają wstrzymanie odpowiedzi lub kolejną próbę wyszukiwania. Gdy źródło jest powiązane z tematem, ale nie potwierdza zdania, uznaj je za niedokładne cytowanie, a nie za częściowy sukces.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie funkcje umożliwiają niezawodne generowanie danych JSON przez lokalny model LLM?
Sprawdź, które funkcje wymuszają składnię JSON, które chronią poprawność semantyczną oraz jak testować lokalny model w różnych schematach, promptach i przypadkach błędów.

Lokalne pochodzenie danych AI: dlaczego każda odpowiedź potrzebuje możliwej do prześledzenia ścieżki źródłowej
Dowiedz się, jak ścieżki źródłowe sprawiają, że lokalne odpowiedzi AI można poddać audytowi, dlaczego same cytowania są niepełne oraz jak testować pochodzenie danych po...

Indeksowanie skrótów treści: jak odciski plików zapobiegają zbędnej pracy AI
Dowiedz się, jak odciski plików i fragmentów sterują indeksowaniem przyrostowym, dlaczego same metadane są niewystarczające oraz w jakich sytuacjach skróty nie mogą potwierdzić równoważności...

