Prywatne grafy wiedzy rozszerzają wyszukiwanie dokumentów domowych, łącząc powtarzające się encje i relacje oraz zapewniając ścieżki wyszukiwania wykraczające poza wspólne słowa lub podobieństwo osadzeń.
Domowe archiwum może wspominać „Maple Street”, „stare mieszkanie”, nazwisko wynajmującego i fakturę za naprawę, nie powtarzając przy tym jednej frazy, której można wyszukać. Ekstrakcja encji może identyfikować osoby, miejsca, urządzenia, daty i projekty, a rozpoznawanie encji łączy równoważne wzmianki. Graf pozwala następnie wyszukiwarce przechodzić od znanego węzła do powiązanych plików, które w przeciwnym razie pozostałyby semantycznie odległe.
Rozpoznawanie encji zamienia wzmianki w wielokrotnego użytku węzły
Ekstrakcja wyszukuje w każdym dokumencie potencjalne nazwy, identyfikatory, lokalizacje, daty i organizacje. Rozpoznawanie ustala, czy dwie wzmianki odnoszą się do tej samej encji, a następnie dołącza fragmenty źródłowe i krawędzie relacji, takie jak „należy do”, „znajduje się w” lub „wspomniano w”.
Podejście oparte na grafie wiedzy encji buduje graf wiedzy encji na podstawie dokumentów źródłowych przed wygenerowaniem podsumowań na poziomie grup. Jego konstrukcja pokazuje, jak struktura encji i relacji może wspierać pytania wymagające informacji rozproszonych w wielu plikach.
Stabilny węzeł pozwala jednemu zapytaniu zebrać aliasy i powiązane dowody. Wyszukanie pseudonimu urządzenia może doprowadzić do jego numeru seryjnego, rachunku zakupu, notatek dotyczących konserwacji i pomieszczenia, bez konieczności powtarzania pseudonimu w każdym dokumencie.
Przechodzenie po grafie dodaje ścieżki kandydatów oparte na relacjach
Wyszukiwanie wektorowe znajduje semantycznie podobne fragmenty, podczas gdy wyszukiwanie grafowe podąża za jawnymi krawędziami od encji z zapytania. Wyszukiwanie może rozpocząć się od osoby, przejść do adresu, a następnie pobrać dokumenty powiązane z odpowiednim kontem lub wydarzeniem.
Obszerny przegląd potoku GraphRAG opisuje rozpoznawanie encji, ich łączenie, budowę grafu, wyszukiwanie i generowanie jako odrębne etapy. Taki podział ułatwia ustalenie, czy pominięcie wynikało z braku węzła, niewłaściwej krawędzi czy zasad wyszukiwania.
Hybrydowe generowanie kandydatów często działa lepiej niż wyszukiwanie wyłącznie grafowe, ponieważ dowody narracyjne mogą być podobne, nawet jeśli nie wyodrębniono między nimi krawędzi. Graf zwiększa trafność relacyjną, a metody leksykalne i wektorowe zachowują ścieżki, których model encji nie zdołał odwzorować.
Nieprawidłowe połączenie encji rozprzestrzenia błędy w wielu plikach
Gospodarstwa domowe używają tych samych imion, skrótów, adresów i modeli urządzeń. Połączenie dwóch osób lub projektów tworzy fałszywe ścieżki, a rozdzielenie jednej encji na kilka węzłów ukrywa powiązania. Nieprawidłowa krawędź może więc zanieczyścić więcej wyników niż jedno błędne osadzenie.
Implementacja Document GraphRAG ocenia wyszukiwanie dokumentów wzbogacone o graf wiedzy i opisuje dodatkowe etapy ekstrakcji oraz budowy grafu wymagane do zapewnienia niezawodnego wyszukiwania. Etapy te zwiększają możliwości, ale tworzą również nowe zależności jakościowe. Różnica ta pozostaje widoczna podczas późniejszych testów domowych.
Nierozstrzygniętą kwestią jest tożsamość encji. Zachowuj fragmenty źródłowe, poziom pewności, aliasy i konkurencyjnych kandydatów; nie łącz automatycznie węzłów, gdy brakuje atrybutów rozróżniających. Prywatne przechowywanie chroni graf przed ujawnieniem na zewnątrz, ale nie sprawia, że jego relacje stają się poprawne.
Przeanalizuj dziesięć ścieżek grafu aż do fragmentów źródłowych
Wybierz dziesięć pytań wymagających jednego lub dwóch przejść po relacjach i zapisz oczekiwaną encję, krawędź, dokument oraz wspierający fragment. Porównaj wyszukiwanie leksykalne, wektorowe, wyłącznie grafowe i hybrydowe przy tym samym limicie końcowej liczby kandydatów. Wynik pośredni musi pozostać możliwy do skontrolowania, zanim automatyzacja będzie kontynuować działanie.
Zastosuj zasady śledzenia pochodzenia źródeł opisane w artykule o pochodzeniu danych w archiwach rodzinnych, aby każdy węzeł i każda krawędź zachowywały wersję dokumentu oraz fragment ekstrakcji, które je utworzyły. Analizuj błędne wyniki według etapów: ekstrakcja, rozpoznawanie, krawędź, przechodzenie i ranking. Tę granicę należy mierzyć osobno w realistycznych warunkach działania.
Stosuj rozszerzanie grafu tylko wtedy, gdy dodaje ono zweryfikowane dowody bez tworzenia nadmiernej liczby fałszywych ścieżek. Rozdzielaj niejednoznaczne encje, wycofuj krawędzie po usunięciu ich źródła i ograniczaj głębokość przechodzenia w miejscach, gdzie szerokie węzły domowe, takie jak adres, łączą niezwiązane ze sobą rekordy.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie czynniki decydują o dokładności cytowań RAG w domowej bazie wiedzy?
Dowiedz się, dlaczego trafne źródło może nadal być błędnym cytowaniem, które etapy potoku kontrolują poparcie i zakres oraz jak audytować twierdzenia RAG dotyczące gospodarstw...

Jakie funkcje umożliwiają niezawodne generowanie danych JSON przez lokalny model LLM?
Sprawdź, które funkcje wymuszają składnię JSON, które chronią poprawność semantyczną oraz jak testować lokalny model w różnych schematach, promptach i przypadkach błędów.

Lokalne pochodzenie danych AI: dlaczego każda odpowiedź potrzebuje możliwej do prześledzenia ścieżki źródłowej
Dowiedz się, jak ścieżki źródłowe sprawiają, że lokalne odpowiedzi AI można poddać audytowi, dlaczego same cytowania są niepełne oraz jak testować pochodzenie danych po...

