Jakie czynniki powodują spadek trafności wyszukiwania wektorowego w kolekcjach wielojęzycznych?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Odzyskiwanie wektorów w przypadku treści w wielu językach często zawodzi, ponieważ jedna przestrzeń osadzeń nie zapewnia jednakowej precyzji dla każdego języka, pisma, obszaru tematycznego i zapytania przełączającego języki.

Domowe archiwum może zawierać angielskie instrukcje, chińskie paragony, hiszpańskie notatki, kody produktów oraz nazwy plików zapisane w kilku alfabetach. Zapytanie może wyrażać właściwe znaczenie, a mimo to znaleźć się daleko od odpowiedniego fragmentu, gdy model słabo obsługuje jeden z języków lub gdy segmentacja usuwa wspólny kontekst. Przybliżone indeksowanie może pogłębić tę lukę reprezentacji, ale nie jest w stanie jej naprawić.

Pokrycie osadzeń jest nierównomierne w różnych językach i domenach

Modele wielojęzyczne uczą się wspólnej geometrii na podstawie nierównomiernych danych treningowych. Języki o dużej liczbie zasobów oraz popularne domeny internetowe zwykle otrzymują bogatsze sygnały dopasowania niż języki mniejszościowe, domowe skróty, nazwy czy terminy techniczne. Dlatego dwa tłumaczenia mogą zajmować różne sąsiedztwa, nawet jeśli człowiek uznaje je za równoważne.

Szerokie badanie wielojęzycznego RAG wykazuje, że jakość wyszukiwania i generowania różni się w zależności od języka, a kontekst wielojęzyczny stwarza dodatkowe trudności. To ostrzeżenie przed traktowaniem jednej średniej z wielojęzycznego benchmarku jako dowodu jednakowego odzyskiwania treści w całym archiwum rodzinnym.

Wybór modelu wyznacza górną granicę jakości reprezentacji. Model jednojęzyczny może dobrze grupować treści w jednym języku, ale zawodzić między językami, podczas gdy model wielojęzyczny może poświęcać część precyzji w obrębie języka na rzecz dopasowania między językami. Należy mierzyć zarówno wyszukiwanie w tym samym języku, jak i wyszukiwanie między językami, zamiast zakładać, że jedno zastępuje drugie.

Tokenizacja i dzielenie na fragmenty mogą rozdzielać równoważne informacje

Poszczególne pisma różnią się granicami słów, morfologią, zagęszczeniem znaków i interpunkcją. Stały fragment o długości 500 tokenów obejmuje inną ilość znaczenia w języku angielskim, chińskim, niemieckich złożeniach czy mieszanym kodzie. OCR i normalizacja Unicode mogą dodatkowo rozdzielać akcenty lub wizualnie podobne znaki.

Badania nad wyszukiwaniem między językami analizują takie wyszukiwanie z wykorzystaniem danych jednojęzycznych i pokazują, że wybór próbkowania oraz reprezentacji istotnie zmienia odzyskiwanie treści. Potwierdza to potrzebę testowania konkretnego kierunku językowego, a nie tylko etykiety modelu. Różnica ta pozostaje widoczna podczas późniejszych testów domowych.

Segmentacja uwzględniająca język powinna zachowywać nagłówki, zdania, tabele i równoległe tłumaczenia. Do tworzenia osadzeń należy przechowywać tekst znormalizowany, zachowując oryginalny tekst do cytowania; agresywne tłumaczenie lub transliteracja mogą ułatwić dopasowanie, ale usunąć nazwy, kody i sformułowania potrzebne do weryfikacji źródła.

Wyszukiwanie przybliżone i nierównowaga językowa pogłębiają lukę

Indeksy przybliżonych najbliższych sąsiadów wymieniają pełne odzyskiwanie treści na rzecz szybkości. Gdy odpowiednie wektory międzyjęzykowe są już nieznacznie oddalone, mała szerokość wyszukiwania, agresywna kompresja lub niewielka pula kandydatów mogą usunąć je przed ponownym szeregowanie. Wówczas czołowe wyniki wypełniają niemal identyczne treści w dominującym języku.

Niezależny benchmark wielojęzycznych osadzeń porównuje wielojęzyczne modele osadzeń w sześciu językach i wskazuje istotnie różne zachowanie wyszukiwania w zależności od modelu i języka. Praktyczny wniosek jest taki, że zbiorcze rankingi ukrywają błędy zależne od kierunku. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim zostanie zastosowana automatyzacja.

Granica błędu ujawnia się w zbiorze testowym zdominowanym przez język angielski lub dosłowne tłumaczenia. Taki zbiór może wykazywać dobry średni poziom odzyskiwania, podczas gdy pseudonimy, przełączanie języków, tekst OCR i pary języków o małej liczbie zasobów zawodzą. Ponowne szeregowanie nie odzyska informacji, która nigdy nie trafiła do puli kandydatów.

Zbuduj macierz odzyskiwania dla par językowych

Oznacz pięćdziesiąt domowych pytań obejmujących przypadki jednojęzyczne, międzyjęzykowe, przełączanie języków, transliterację, OCR i kody produktów. Dla każdego zapytania wskaż wszystkie akceptowalne fragmenty zawierające informacje i zapisz język zapytania, język źródłowy, pismo, typ dokumentu oraz klasę encji. Ta granica powinna być mierzona oddzielnie w realistycznych warunkach działania.

Wykorzystaj rozdzielenie oceny opisane w zachowaniu wielojęzycznych osadzeń, aby obliczać Recall@k dla każdego kierunku, zamiast jednej łącznej wartości. Powtórz testy z segmentacją uwzględniającą język, większą szerokością wyszukiwania, kandydatami leksykalnymi i wielojęzycznym modelem ponownego szeregowania, zachowując ten sam korpus.

Ustawienia wybieraj na podstawie najsłabszej istotnej pary językowej, a nie średniej globalnej. Jeśli odzyskiwanie treści poprawia się dopiero po przetłumaczeniu zapytań, zachowaj oryginalne brzmienie i ścieżkę cytowania, aby pomoc w dopasowaniu nie stała się niemożliwym do prześledzenia dowodem. Praktyczne konsekwencje pojawiają się, gdy kilka źródeł konkuruje o ograniczony kontekst.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.