Syntetyczne rozszerzanie zapytań często poprawia czułość RAG, dodając prawdopodobne parafrazy i terminy dziedzinowe, które wypełniają luki słownikowe między pytaniami a zapisanymi dowodami.
Członek rodziny może poprosić o „przegląd kotła”, podczas gdy zeskanowana faktura mówi „coroczny serwis instalacji wodnej” i nie używa domowego określenia. Wyszukiwanie leksykalne oparte na dokładnym dopasowaniu nie wykryje tego powiązania. Rozszerzanie zapytania generuje alternatywne sformułowania lub hipotetyczną odpowiedź, przeszukuje każdą reprezentację i scala kandydatów przed ponownym rankingiem, dając istotnym dowodom więcej niż jedną drogę do okna kontekstowego.
Jedno pytanie może reprezentować kilka intencji wyszukiwania
Krótkie zapytanie dotyczące gospodarstwa domowego może pomijać formalną nazwę produktu, datę, lokalizację lub terminologię używaną w źródle. Rozszerzanie ujawnia te ukryte interpretacje, tworząc powiązane frazy, podzapytania lub syntetyczny fragment. Wyszukiwanie rzadkie zyskuje nowe terminy dopasowania, a wyszukiwanie gęste otrzymuje dodatkowe perspektywy semantyczne.
Metoda Query2doc wykorzystuje model językowy do wygenerowania pseudodokumentu i dołącza go do oryginalnego zapytania. Eksperymenty pokazują, że dodany tekst może poprawić zarówno wyszukiwanie rzadkie, jak i gęste, bez ponownego trenowania bazowego modułu wyszukiwania.
Mechanizm ten nie sprawia, że zapytanie staje się bardziej prawdziwe. Poszerza powierzchnię generowania kandydatów, po czym scalanie i ponowny ranking muszą rozstrzygnąć, którzy kandydaci nadal odpowiadają na pierwotne pytanie, a nie na wygenerowane rozwinięcie. To rozróżnienie pozostaje widoczne podczas późniejszych testów domowych.
Syntetyczne fragmenty wypełniają lukę słownikową między zapytaniem a dokumentem
Hipotetyczny dokument może przypominać styl i słownictwo prawdopodobnych dowodów, nawet jeśli zawiera zmyślone fakty. System tworzy reprezentację wektorową takiego syntetycznego fragmentu i wyszukuje rzeczywiste dokumenty znajdujące się w jego pobliżu, wykorzystując generowanie jako most semantyczny, a nie jako dowód przedstawiany użytkownikowi.
osadzanie hipotetycznych dokumentów tworzy hipotetyczne dokumenty przed utworzeniem ich reprezentacji wektorowych na potrzeby gęstego wyszukiwania bez przykładów. Najważniejsze jest rozdzielenie tych ról: wygenerowany tekst kieruje wyszukiwaniem, natomiast zwrócone dokumenty korpusu pozostają jedynymi dopuszczalnymi dowodami w odpowiedzi końcowej.
Wiele rozszerzeń może obejmować skróty, przezwiska, tłumaczenia i różne poziomy szczegółowości technicznej. Połączenie kandydatów zwiększa czułość, ale deduplikacja i ponowny ranking są konieczne, ponieważ dziesięć przeredagowanych wersji może w przeciwnym razie zapełnić listę niemal identycznymi lub słabo powiązanymi fragmentami.
Rozszerzanie może skierować wyszukiwanie ku prawdopodobnemu, lecz błędnemu tematowi
Generator może błędnie rozstrzygnąć niejednoznaczną nazwę, wprowadzić produkt, którego gospodarstwo domowe nie posiada, lub wymyślić datę. Terminy te mogą wyszukać wewnętrznie spójne dokumenty dotyczące niewłaściwego obiektu, tworząc bardziej przekonujący szum niż pierwotne zapytanie rzadkie.
Kontrolowane badanie uzupełniającego przeredagowywania zapytań pokazuje, że łączenie metod może poprawiać pokrycie w niektórych zbiorach danych, a jednocześnie pogarszać wyniki na zbiorze pytań niejednoznacznych. Wynik ten pokazuje, dlaczego rozszerzanie powinno być uzależnione od typu zapytania i oceniane względem silnego punktu odniesienia.
Granica zawodności pojawia się w przypadku każdego zapytania, którego główny obiekt lub intencja są niepewne. Zachowaj oryginalne zapytanie, oznacz tekst syntetyczny jako pomoc przy wyszukiwaniu, ogranicz jego wpływ podczas scalania i wstrzymaj się z odpowiedzią, gdy rozszerzenia nie są zgodne co do zbioru dowodów.
Przeprowadź test wkładu rozszerzania
Utwórz trzydzieści rzeczywistych pytań dotyczących gospodarstwa domowego, zawierających skróty, nazwy potoczne, tłumaczenia i formalne terminy nieobecne w zapytaniu. Zapisz zweryfikowane fragmenty wspierające odpowiedzi, a następnie uruchom wyszukiwanie wyłącznie na podstawie oryginału oraz proponowaną ścieżkę z rozszerzaniem, korzystając z tego samego indeksu, budżetu top-k i modułu ponownego rankingu.
Śledź czułość i pokrycie cytowaniami, korzystając z metody oceny opisanej w artykule wyszukiwanie skrótów. Dla każdego dodanego istotnego fragmentu zapisz, które przeredagowanie go znalazło; dla każdego nowego elementu rozpraszającego odnotuj termin, który spowodował odejście od tematu, oraz to, czy ponowny ranking go usunął.
Włączaj rozszerzanie tylko tam, gdzie zwiększa ono czułość na zbiorze testowym bez niedopuszczalnej utraty precyzji lub wzrostu opóźnienia. Jeśli poprawa wynika jedynie z większego budżetu kandydatów, porównaj ją z uruchomieniem na oryginalnym zapytaniu przy tym samym budżecie, zanim przypiszesz wzrost syntetycznemu słownictwu.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie czynniki decydują o dokładności cytowań RAG w domowej bazie wiedzy?
Dowiedz się, dlaczego trafne źródło może nadal być błędnym cytowaniem, które etapy potoku kontrolują poparcie i zakres oraz jak audytować twierdzenia RAG dotyczące gospodarstw...

Jakie funkcje umożliwiają niezawodne generowanie danych JSON przez lokalny model LLM?
Sprawdź, które funkcje wymuszają składnię JSON, które chronią poprawność semantyczną oraz jak testować lokalny model w różnych schematach, promptach i przypadkach błędów.

Lokalne pochodzenie danych AI: dlaczego każda odpowiedź potrzebuje możliwej do prześledzenia ścieżki źródłowej
Dowiedz się, jak ścieżki źródłowe sprawiają, że lokalne odpowiedzi AI można poddać audytowi, dlaczego same cytowania są niepełne oraz jak testować pochodzenie danych po...

