Lokalne RAG dla rodzinnych archiwów: jak pochodzenie źródeł zmienia badania i odtwarzanie informacji

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Pochodzenie źródłowe zmienia RAG w archiwach rodzinnych, sprawiając, że każde pobrane twierdzenie można prześledzić do dokładnego oryginału, pochodnej, transformacji i wersji, które się za nim kryją.

Historyk rodzinny może przeszukiwać zeskanowane akty, odręcznie pisane listy, transkrypcje wywiadów, zredagowane podpisy i kilka kopii tego samego zdjęcia. Zwykłe wyszukiwanie semantyczne może zwrócić wygodną pochodną bez ujawnienia, co zostało zmienione lub pominięte. Pochodzenie zachowuje te relacje, dzięki czemu wyszukiwanie obejmuje właściwe materiały, a wnioski badawcze pozostają bezpośrednio powiązane z możliwymi do zweryfikowania dowodami pierwotnymi.

Pochodzenie oddziela oryginał od jego przeszukiwalnych pochodnych

Archiwa rodzinne często zawierają oryginalny obraz, oczyszczony skan, tekst OCR, przetłumaczoną transkrypcję, przyciętą kopię i podpis napisany wiele lat później. Embeddingi mogą wysoko ocenić dowolny z tych elementów, ale nie kodują informacji o tym, który obiekt jest najbliższy wydarzeniu historycznemu. Pochodzenie uzupełnia tę brakującą relację.

Badania archiwalne rozróżniają źródła oryginalne i pochodne, ponieważ skopiowane lub zinterpretowane materiały mogą wprowadzać błędy nieobecne w pierwszym zachowanym zapisie. Przydatny indeks RAG powinien zachowywać to rozróżnienie, zamiast spłaszczać każdy plik do równoważnych fragmentów.

Wynik wyszukiwania może więc prezentować twierdzenie wraz z łańcuchem nadrzędnym: fragment OCR prowadzący do skanu, skan do fizycznego obiektu, tłumaczenie do transkrypcji, a adnotację do autora. Badacze mogą korzystać z pochodnej dla szybkości, a przed zaakceptowaniem wniosku wrócić do najsilniejszego dostępnego źródła.

Pochodzenie zmienia wyszukiwanie z odnajdywania tekstu w odzyskiwanie kontekstu

Konwencjonalna miara Recall@k sprawdza, czy pojawił się istotny fragment. W archiwach trafność wyszukiwania zależy również od tego, czy wynik zawiera datę, twórcę, kolekcję, relacje i pierwotny układ. Akapit pozbawiony tego kontekstu może odpowiadać na słowa zapytania, jednocześnie fałszując znaczenie zapisu.

Prace dotyczące cyfrowych dowodów archiwalnych wyjaśniają, że selekcja, wyszukiwanie i metadane kształtują podstawę dowodową, z którą badacze stykają się w kolekcjach cyfrowych. Sprawia to, że projektowanie wyszukiwania staje się częścią interpretacji historycznej, a nie neutralną warstwą wyszukiwania.

System uwzględniający pochodzenie może rozszerzyć jeden wynik o elementy pokrewne, obiekty nadrzędne lub współczesne zapisy, nie mieszając niepowiązanych gałęzi. Użytkownik widzi nie tylko najważniejszy fragment, lecz także, dlaczego należy on do danej osoby, wydarzenia, albumu lub nabytku. Badanie staje się przechodzeniem po grafie zakotwiczonym w dowodach.

Gdzie pochodzenie nie naprawi słabych dowodów rodzinnych

Pochodzenie może udokumentować łańcuch, ale nie dowodzi, że jego pierwsze źródło jest poprawne. Zdjęcie opatrzone pewnym podpisem może nadal przedstawiać niewłaściwą osobę; historia mówiona może zachowywać wspomnienie, a nie fakt; OCR może pominąć odręczne pismo; a brakującego oryginału nie da się odtworzyć na podstawie samych metadanych.

Badania nad badaniami historii rodzinnej pokazują, że historycy rodzinni łączą wiele platform cyfrowych i wybiórczo zapisują informacje, tworząc luki i niespójności, zanim powstanie lokalny indeks.

Większa ilość danych o pochodzeniu nie oznacza automatycznie większej prawdy. Łańcuch pomaga użytkownikom oceniać i korygować dowody, ale nie może przekształcić niepopartego twierdzenia w zweryfikowany fakt. Wrażliwe relacje rodzinne wymagają również kontroli dostępu, aby pochodzenie nie ujawniało więcej niż zapis źródłowy.

Prześledź jedno twierdzenie od odpowiedzi z powrotem do oryginału

Wybierz 30 pytań dotyczących historii rodzinnej, obejmujących nazwiska, daty, miejsca, relacje, fotografie, wywiady i sprzeczne relacje. Określ oczekiwany obiekt źródłowy, akceptowalne pochodne, wymagany kontekst oraz to, czy twierdzenie pozostaje niepewne.

Uruchom wyszukiwanie z użyciem pochodzenia danych w prywatnej AI i bez niego. Zmierz Recall@k na poziomie źródeł, scalanie duplikatów, pokrycie kontekstu, poprawność wersji oraz liczbę odpowiedzi prowadzących do możliwego do zweryfikowania oryginału.

Zachowaj pola pochodzenia, które pomagają badaczowi zidentyfikować twórcę, datę, pieczę nad materiałem, transformację, wersję i powiązane zapisy. Oznaczaj twierdzenia kończące się na niezweryfikowanej adnotacji, zachowuj widoczną niepewność i nigdy nie pozwalaj, aby płynne podsumowanie po cichu zastąpiło łańcuch dowodowy.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.