Prywatne grafy wiedzy: jak powiązania encji rozszerzają wyszukiwanie dokumentów w domu

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Prywatne grafy wiedzy rozszerzają wyszukiwanie dokumentów domowych, łącząc powtarzające się encje i relacje oraz zapewniając ścieżki wyszukiwania wykraczające poza wspólne słowa lub podobieństwo osadzeń.

Domowe archiwum może wspominać „Maple Street”, „stare mieszkanie”, nazwisko wynajmującego i fakturę za naprawę, nie powtarzając przy tym jednej frazy, której można wyszukać. Ekstrakcja encji może identyfikować osoby, miejsca, urządzenia, daty i projekty, a rozpoznawanie encji łączy równoważne wzmianki. Graf pozwala następnie wyszukiwarce przechodzić od znanego węzła do powiązanych plików, które w przeciwnym razie pozostałyby semantycznie odległe.

Rozpoznawanie encji zamienia wzmianki w wielokrotnego użytku węzły

Ekstrakcja wyszukuje w każdym dokumencie potencjalne nazwy, identyfikatory, lokalizacje, daty i organizacje. Rozpoznawanie ustala, czy dwie wzmianki odnoszą się do tej samej encji, a następnie dołącza fragmenty źródłowe i krawędzie relacji, takie jak „należy do”, „znajduje się w” lub „wspomniano w”.

Podejście oparte na grafie wiedzy encji buduje graf wiedzy encji na podstawie dokumentów źródłowych przed wygenerowaniem podsumowań na poziomie grup. Jego konstrukcja pokazuje, jak struktura encji i relacji może wspierać pytania wymagające informacji rozproszonych w wielu plikach.

Stabilny węzeł pozwala jednemu zapytaniu zebrać aliasy i powiązane dowody. Wyszukanie pseudonimu urządzenia może doprowadzić do jego numeru seryjnego, rachunku zakupu, notatek dotyczących konserwacji i pomieszczenia, bez konieczności powtarzania pseudonimu w każdym dokumencie.

Przechodzenie po grafie dodaje ścieżki kandydatów oparte na relacjach

Wyszukiwanie wektorowe znajduje semantycznie podobne fragmenty, podczas gdy wyszukiwanie grafowe podąża za jawnymi krawędziami od encji z zapytania. Wyszukiwanie może rozpocząć się od osoby, przejść do adresu, a następnie pobrać dokumenty powiązane z odpowiednim kontem lub wydarzeniem.

Obszerny przegląd potoku GraphRAG opisuje rozpoznawanie encji, ich łączenie, budowę grafu, wyszukiwanie i generowanie jako odrębne etapy. Taki podział ułatwia ustalenie, czy pominięcie wynikało z braku węzła, niewłaściwej krawędzi czy zasad wyszukiwania.

Hybrydowe generowanie kandydatów często działa lepiej niż wyszukiwanie wyłącznie grafowe, ponieważ dowody narracyjne mogą być podobne, nawet jeśli nie wyodrębniono między nimi krawędzi. Graf zwiększa trafność relacyjną, a metody leksykalne i wektorowe zachowują ścieżki, których model encji nie zdołał odwzorować.

Nieprawidłowe połączenie encji rozprzestrzenia błędy w wielu plikach

Gospodarstwa domowe używają tych samych imion, skrótów, adresów i modeli urządzeń. Połączenie dwóch osób lub projektów tworzy fałszywe ścieżki, a rozdzielenie jednej encji na kilka węzłów ukrywa powiązania. Nieprawidłowa krawędź może więc zanieczyścić więcej wyników niż jedno błędne osadzenie.

Implementacja Document GraphRAG ocenia wyszukiwanie dokumentów wzbogacone o graf wiedzy i opisuje dodatkowe etapy ekstrakcji oraz budowy grafu wymagane do zapewnienia niezawodnego wyszukiwania. Etapy te zwiększają możliwości, ale tworzą również nowe zależności jakościowe. Różnica ta pozostaje widoczna podczas późniejszych testów domowych.

Nierozstrzygniętą kwestią jest tożsamość encji. Zachowuj fragmenty źródłowe, poziom pewności, aliasy i konkurencyjnych kandydatów; nie łącz automatycznie węzłów, gdy brakuje atrybutów rozróżniających. Prywatne przechowywanie chroni graf przed ujawnieniem na zewnątrz, ale nie sprawia, że jego relacje stają się poprawne.

Przeanalizuj dziesięć ścieżek grafu aż do fragmentów źródłowych

Wybierz dziesięć pytań wymagających jednego lub dwóch przejść po relacjach i zapisz oczekiwaną encję, krawędź, dokument oraz wspierający fragment. Porównaj wyszukiwanie leksykalne, wektorowe, wyłącznie grafowe i hybrydowe przy tym samym limicie końcowej liczby kandydatów. Wynik pośredni musi pozostać możliwy do skontrolowania, zanim automatyzacja będzie kontynuować działanie.

Zastosuj zasady śledzenia pochodzenia źródeł opisane w artykule o pochodzeniu danych w archiwach rodzinnych, aby każdy węzeł i każda krawędź zachowywały wersję dokumentu oraz fragment ekstrakcji, które je utworzyły. Analizuj błędne wyniki według etapów: ekstrakcja, rozpoznawanie, krawędź, przechodzenie i ranking. Tę granicę należy mierzyć osobno w realistycznych warunkach działania.

Stosuj rozszerzanie grafu tylko wtedy, gdy dodaje ono zweryfikowane dowody bez tworzenia nadmiernej liczby fałszywych ścieżek. Rozdzielaj niejednoznaczne encje, wycofuj krawędzie po usunięciu ich źródła i ograniczaj głębokość przechodzenia w miejscach, gdzie szerokie węzły domowe, takie jak adres, łączą niezwiązane ze sobą rekordy.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.