Granice fragmentów RAG zmieniają dowody wyszukiwania, ponieważ system wyszukujący może oceniać wyłącznie jednostki tekstu utworzone podczas przetwarzania dokumentów.
Domowa baza wiedzy może zawierać prawidłowy fakt, a mimo to wyszukiwanie może zwrócić niekompletny lub mylący fragment, gdy podział oddzieli tezę od jej wyjątku, nagłówka, etykiety tabeli, źródła lub otaczającej definicji. Dzielenie dokumentu wpływa również na liczbę przechowywanych wektorów, sposób uśredniania podobieństwa oraz ilość niezwiązanego tekstu trafiającego do promptu odpowiedzi. Poniższe sekcje przedstawiają drogę od jednej decyzji dotyczącej granicy fragmentu do dowodu, na który może powołać się lokalny asystent AI.
Fragment staje się jednostką dowodową dostępną dla wyszukiwarki
Większość potoków RAG osadza i indeksuje fragmenty zamiast całych książek, instrukcji lub folderów. System wyszukiwania pobiera rekordy tych fragmentów wraz z ich metadanymi.
Najnowsze badania nad dzieleniem dokumentów określają segmentację jako czynnik niezawodności wyszukiwania, ponieważ wpływa ona zarówno na to, co można dopasować, jak i na to, jaki kontekst zostanie dostarczony wraz z dopasowaniem.
Jeśli dwa fakty zostaną umieszczone w oddzielnych fragmentach, system musi pobrać je niezależnie. Jeśli pozostaną w jednym fragmencie, będą dzielić jeden wynik podobieństwa i jedną jednostkę cytowania.
Granica może oddzielić tezę od jej zastrzeżenia
Dokumenty techniczne często przedstawiają ogólną zasadę w jednym zdaniu, a jej wyjątek, jednostkę, datę lub zakres w następnym. Stałe cięcie według liczby tokenów może wyodrębnić atrakcyjną tezę, pozostawiając warunek ograniczający w innym fragmencie.
Metoda Late Chunking rozwiązuje problem utraty kontekstu na granicach, nadając tokenom kontekst z całego dłuższego dokumentu przed utworzeniem osadzeń fragmentów.
Pobrany tekst nadal wymaga czytelnej granicy cytowania. Osadzenia uwzględniające kontekst mogą poprawić reprezentację wyszukiwawczą, ale nie naprawią automatycznie wyświetlanego fragmentu, w którym pominięto zastrzeżenie.
Granice zdań, akapitów, nagłówków i tabel należy zatem zachowywać, gdy niosą znaczenie tezy.
Małe fragmenty poprawiają precyzję, ale mogą usuwać niezbędny kontekst
Krótki fragment może silnie dopasować się do konkretnego zapytania, ponieważ niezwiązane sekcje nie rozmywają jego osadzenia. Zajmuje też mniej miejsca w prompcie po pobraniu.
Systematyczne badanie rozmiaru fragmentów wykazało niemonotoniczny wpływ rozmiaru fragmentu: jeden uniwersalny rozmiar nie zapewnia najlepszego wyszukiwania we wszystkich modelach i zbiorach danych.
Bardzo małe fragmenty mogą pomijać definicje, odniesienia zaimkowe, kolejność czynności, nagłówki tabel lub relację między dowodem a wnioskiem.
Zwrócenie kilku sąsiednich fragmentów może odtworzyć kontekst, ale zwiększa długość promptu i zależy od stabilnych metadanych dotyczących położenia w dokumencie.
Duże fragmenty zachowują kontekst, ale rozmywają podobieństwo i zajmują miejsce w prompcie
Duży fragment może zachować kompletną podsekcję, ale jego wektor podsumowuje kilka tematów. Zdanie istotne dla zapytania może stanowić tylko niewielką część reprezentacji.
Badania porównujące metody dzielenia dokumentów wskazują na kompromis między precyzją a kosztem pomiędzy bardziej kontekstowymi segmentami a rzeczywistymi korzyściami obliczeniowymi lub wyszukiwawczymi, jakie zapewniają.
Duże fragmenty zajmują również więcej miejsca w kontekście modelu językowego. Pobranie kilku takich fragmentów może zepchnąć inne dowody do środka długiego promptu albo wymusić jego obcięcie.
Nakładanie fragmentów może odzyskać tekst z granicy, ale duplikuje dowody
Przesuwne nakładanie powtarza tokeny z końca jednego fragmentu na początku następnego, zwiększając prawdopodobieństwo, że fraza przebiegająca przez granicę pojawi się w co najmniej jednej jednostce dostępnej dla wyszukiwarki.
Systematyczne badanie z 2026 roku pokazuje, że wybór sposobu dzielenia wpływa na rozmiar indeksu i wyszukiwanie, a nie tylko na jakość semantyczną.
Duże nakładanie tworzy niemal identyczne wektory, powtarzające się cytaty, większe zużycie pamięci oraz wyniki top-k, które mogą pochodzić wyłącznie z tego samego akapitu.
Gdy nakładanie powoduje, że powtarzające się dowody wypierają niezależne fragmenty potwierdzające, potrzebne jest usuwanie duplikatów lub grupowanie według dokumentu nadrzędnego.
Struktura dokumentu powinna wyznaczać niektóre granice
Nagłówki, listy, funkcje kodu, wiersze tabel, wypowiedzi rozmówców i klauzule prawne zawierają relacje, których arbitralna liczba znaków nie potrafi rozpoznać.
Dzielenie tabel z uwzględnieniem struktury zachowuje relacje między polami, zamiast dzielić wiersze jak zwykły tekst.
Domowa baza wiedzy może wymagać różnych mechanizmów dzielenia dla notatek Markdown, plików PDF, arkuszy kalkulacyjnych, instrukcji, kodu źródłowego i transkrypcji. Jedna reguła stałego rozmiaru nie zachowa gramatyki każdego rodzaju dokumentu.
Lokalny przewodnik ZimaSpace dotyczący wyszukiwania dokumentów wskazuje jakość fragmentów jako jeden z fundamentów, których RAG nie może naprawić po utracie dowodów podczas przetwarzania dokumentów.
Oceniaj wyszukiwanie dowodów przed oceną końcowej odpowiedzi
Twórz pytania, na które odpowiedzi przebiegają przez nagłówki, zdania, wiersze tabel lub sąsiednie akapity. Oznacz kompletny zakres dowodu oraz lokalizację źródła, którą należy zacytować.
Badania nad dzieleniem dokumentów w RAG zalecają mierzenie kompletności dowodów obok trafności rankingu.
Porównuj rozmiary fragmentów, nakładanie, reguły strukturalne, metody osadzania, rozszerzanie o sąsiadujące fragmenty, wyszukiwanie hybrydowe i ponowne ustalanie rankingu. Sprawdzaj, czy najlepsze wyniki zawierają pełną tezę oraz ograniczający ją kontekst.
Najlepsza granica to nie ta, która maksymalizuje pojedynczy wynik wyszukiwania. To ta, która konsekwentnie zwraca możliwą do zacytowania, minimalnie wystarczającą jednostkę dowodową dla pytań, które rzeczywiście zadaje domownik.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego przewidywania dotyczące inteligentnego domu stają się mniej trafne po sezonowych zmianach rutyny?
Sezonowe rutyny zmieniają zależność między czasem, czujnikami, obecnością domowników a pożądanymi działaniami, przez co model wytrenowany na podstawie wcześniejszych nawyków staje się nieaktualny.

Dlaczego domowy rejestrator NVR pomija krótkie zdarzenia, gdy włączone jest śledzenie obiektów?
Śledzenie wymaga wystarczającej liczby detekcji, aby rozpocząć i potwierdzić trajektorię, dlatego obiekt obecny przez krótki czas może zniknąć, zanim rejestrator NVR utworzy prawidłowe zdarzenie.

Dlaczego etykiety zdjęć generowane przez AI zmieniają się po aktualizacji modelu?
Aktualizacja modelu zmienia sposób reprezentacji i ustalania rankingu używanych do przypisywania etykiet, dlatego to samo zdjęcie może przekroczyć inne granice semantyczne lub poziomy pewności.

