Potok RAG może wskazywać właściwy plik, ale niewłaściwy fragment, gdy wykrywanie dokumentu działa poprawnie, a pobieranie fragmentów lub mapowanie cytowań zawodzi.
Duże pliki często zawierają wiele sekcji posługujących się tą samą terminologią, powtarzające się nagłówki, podobne przykłady lub wiele wersji tego samego faktu. Wyszukiwarka działająca na poziomie plików może prawidłowo zidentyfikować odpowiednią instrukcję, raport lub notatkę domową, podczas gdy etap wyszukiwania fragmentów wybierze sąsiedni fragment. Model generujący odpowiedź może następnie wywnioskować brakujący szczegół z własnej wiedzy lub z innego fragmentu, ale przypisać odpowiedzi metadane wybranego pliku. Wiarygodne cytowanie wymaga niezależnej poprawności na etapach dokumentu, strony, fragmentu, zakresu tekstu i generowania.
Przywoływanie dokumentów i przywoływanie fragmentów to różne problemy wyszukiwania
Plik może uzyskać wysoką pozycję, ponieważ jego tytuł, metadane lub ogólne osadzenie pasują do pytania. Nie oznacza to, że akapit zawierający odpowiedź znajduje się w zestawie pobranych fragmentów.
Praktyczny przewodnik po awariach RAG rozdziela warstwy awarii wyszukiwania i zaleca sprawdzanie dokładnych fragmentów, a nie tylko końcowej odpowiedzi.
Potok powinien osobno mierzyć przywołanie dokumentu, strony i fragmentu. Prawidłowa nazwa pliku może ukrywać pominięcie zakresu tekstu zawierającego odpowiedź.
Granice fragmentów mogą oddzielić dowody od ich kontekstu
Podział na fragmenty o stałym rozmiarze może umieścić nagłówek w jednym fragmencie, stwierdzenie w innym, a wyjątek lub etykietę tabeli w trzecim.
Przewodnik Edtek opisuje, jak niewłaściwe granice fragmentów tworzą treści wspominające o zapytaniu, ale nie zawierające pełnej odpowiedzi.
Wyszukiwarka może mimo to wybrać właściwy plik, ponieważ wiele fragmentów dotyczy tego samego tematu. Generator otrzymuje niepełny fragment i cytuje źródło na poziomie pliku, jak gdyby potwierdzało ono dane twierdzenie.
Dzielenie strukturalne, wyszukiwanie nadrzędny–podrzędny i rozszerzanie o sąsiednie fragmenty pomagają tylko wtedy, gdy zachowana jest możliwość prześledzenia przesunięć w źródle.
Metadane cytowania mogą być przypisane na niewłaściwym poziomie szczegółowości
Niektóre potoki kopiują jeden adres URL dokumentu lub nazwę pliku do każdego fragmentu, nie zapisując strony, sekcji, obwiedni ani przesunięć znakowych.
Przewodnik Tensorlake dotyczący cytowań pokazuje, jak kotwice przestrzenne mogą być przekazywane od wstępnego przetwarzania dokumentu przez wyszukiwanie aż po generowanie odpowiedzi.
Wskaźnik ograniczony do pliku potwierdza, skąd pochodzi element korpusu, ale nie wskazuje, które bajty uzasadniają dane zdanie. Cytowania na poziomie fragmentu wymagają stabilnego identyfikatora fragmentu i metadanych jego lokalizacji.
OCR, ponowne formatowanie PDF-ów i edytowane dokumenty mogą unieważnić przesunięcia, chyba że cytowanie zawiera również identyfikator indeksowanej migawki lub skrót treści.
Podobne fragmenty mogą spowodować pomieszanie identyfikatorów przez generator
Kontekst może zawierać kilka fragmentów z tego samego pliku, posługujących się podobnym językiem. Model może wykorzystać treść jednego fragmentu, a następnie wygenerować etykietę cytowania innego, sąsiedniego fragmentu.
Artykuł o RAG o krytycznym znaczeniu dla cytowań ostrzega, że błędy dotyczące sąsiednich fragmentów nadal są możliwe, nawet gdy cytowany dokument jest wiarygodny.
Oznaczaj fragmenty wyraźnymi, niepodobnymi do siebie identyfikatorami i umieszczaj cytowanie bezpośrednio obok popierającego je tekstu. Wymaganie od modelu zapamiętania oddzielnej mapy cytowań po zakończeniu syntezy zwiększa ryzyko niezgodności.
Deterministyczna weryfikacja cytatu względem fragmentu może wykryć sytuację, w której cytowany fragment nie zawiera przypisanego mu twierdzenia ani przytoczonego tekstu.
Reranking powinien oceniać poparcie fragmentu, a nie tylko podobieństwo tematyczne
Wyszukiwarka pierwszego etapu może zwrócić wiele fragmentów z właściwego pliku. Reranking powinien odróżniać sekcję, która bezpośrednio odpowiada na pytanie, od sekcji, które jedynie dotyczą tego samego tematu.
Przewodnik Databricks dotyczący dzielenia na fragmenty podkreśla, że spójne jednostki wyszukiwania są niezbędne, aby późniejsze etapy mogły dokładnie szeregować fragmenty.
Wykonuj reranking z użyciem pełnego zapytania, zachowuj nagłówek fragmentu i kontekst nadrzędny, a także obniżaj ocenę fragmentów, którym brakuje żądanego pola, daty, encji lub rodzaju dowodu.
Proces wyszukiwania dokumentów ZimaSpace traktuje te elementy jako osobne etapy, a nie jako jeden ogólny wynik „jakości RAG”.
Zweryfikuj dokładny fragment przed wyświetleniem cytowania
Po wygenerowaniu odpowiedzi przypisz każde zdanie faktograficzne lub cytat do fragmentu zawierającego potwierdzające je informacje. Odrzucaj cytowania wskazujące wyłącznie właściwy plik.
Infolitz zaleca dołączanie cytowań do fragmentów zawierających źródło, zamiast odtwarzania ich na poziomie całego pliku.
Oceniaj precyzję fragmentu, kompletność dowodów, zawieranie cytatu, ważność przesunięcia cytowania oraz to, czy wskazany zakres tekstu popiera dokładnie wygenerowane twierdzenie.
System można uznać za naprawiony dopiero wtedy, gdy kliknięcie cytowania otwiera najmniejszy wystarczający fragment, a nie tylko właściwy dokument znajdujący się gdzieś w pobliżu odpowiedzi.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie funkcje umożliwiają utworzenie domowej granicy zaufania AI wokół wrażliwych plików?
Domowa granica zaufania dla AI łączy szyfrowanie danych w spoczynku, uprawnienia zgodne z zasadą najmniejszych przywilejów, sandboxing w czasie działania oraz zakresowe pobieranie danych...

Co powoduje, że prywatne wyniki wyszukiwania faworyzują często edytowane pliki?
Często edytowane pliki zyskują przewagę w rankingu, gdy każda aktualizacja dodaje sygnały świeżości, fragmentów, wersji lub interakcji bez normalizacji względem źródła.

Co powoduje, że modele obecności w inteligentnym domu mylą gości z mieszkańcami?
Goście mogą wyglądać jak domownicy, gdy system obserwuje wzorce aktywności gospodarstwa domowego, ale nie ma stabilnego sygnału tożsamości osoby, która je generuje.

