Skuteczność wyszukiwania wektorowego może spaść po połączeniu języków, ponieważ wielojęzyczne embeddingi nie wyrównują wszystkich języków, domen i kierunków zapytań równie dobrze.
Domowy indeks może początkowo zawierać angielskie instrukcje i notatki, a następnie chińskie rachunki, hiszpańskie wiadomości, japońskie strony produktów lub rodzinne dokumenty z przełączaniem języków. Baza danych wektorowych nadal wykonuje tę samą operację wyszukiwania najbliższych sąsiadów, ale przestrzeń reprezentacji się zmienia: języki mogą zajmować nierówne obszary, nieidealnie współdzielić pojęcia, różnić się efektywnością tokenizacji i tworzyć nowe trudne negatywy. Jeden globalny parametr top-k może więc faworyzować dominujący język albo zwracać semantycznie szerokich sąsiadów międzyjęzykowych, pomijając właściwy fragment.
Model wielojęzyczny musi umieszczać równoważne znaczenia blisko siebie
Wyszukiwanie międzyjęzykowe działa tylko wtedy, gdy zapytanie w jednym języku i odpowiedni dokument w innym są mapowane do zgodnych obszarów wspólnej przestrzeni embeddingów.
LaBSE zaprojektowano do tworzenia niezależnych od języka embeddingów z wykorzystaniem obszernych jednojęzycznych i dwujęzycznych danych treningowych.
Obsługa wielu języków nie oznacza identycznej jakości wyszukiwania dla każdego z nich. Wyrównanie zależy od ilości i rodzaju danych, które każdy język wniósł do treningu.
Nierównowaga danych treningowych tworzy nierówną geometrię języków
Języki o dużych zasobach zwykle mają więcej tekstów, par tłumaczeniowych i trudnych negatywów dostępnych podczas trenowania modelu. Języki o małych zasobach lub specjalistyczne odmiany językowe mogą być słabiej wyrównane.
Badania nad reprezentacjami wielojęzycznymi wskazują na nierówną skuteczność językową i wiążą ją z ograniczeniami danych do wyrównania międzyjęzykowego.
Gdy języki te trafiają do jednego domowego indeksu, wspólny próg cosinusowy lub parametr top-k zakłada porównywalność, której model embeddingów może w rzeczywistości nie zapewniać.
Dominujący język może wydawać się dobrze dostrojony, podczas gdy inny język po cichu traci istotnych sąsiadów.
Wyszukiwanie jednojęzyczne i międzyjęzykowe to różne testy
Angielskie zapytanie zwracające angielskie dokumenty testuje wyszukiwanie semantyczne w obrębie jednego języka. Chińskie zapytanie zwracające angielską instrukcję testuje zarówno wyrównanie międzyjęzykowe, jak i trafność.
M3-Embedding ocenia tryby wyszukiwania wielojęzycznego dla reprezentacji gęstych, rzadkich i wielowektorowych.
Model może działać dobrze, gdy zapytanie i dokument są w tym samym języku, ale tracić skuteczność, gdy języki się różnią. Uśrednienie obu przypadków do jednej metryki ukrywa kierunek, w którym występuje problem.
Mierz poszczególne pary językowe: działanie z angielskiego na chiński nie musi być takie samo jak z chińskiego na angielski.
Jeden model embeddingów może poświęcać jakość angielskiego na rzecz szerszego pokrycia
Wielojęzyczny enkoder ma ograniczoną pojemność modelu i musi reprezentować wiele systemów pisma, słowników oraz rozkładów semantycznych.
Arctic-Embed 2.0 analizuje równowagę wyszukiwania wielojęzycznego, zamiast zakładać, że szersza obsługa języków nie wpłynie na dotychczasową skuteczność w języku angielskim.
Po połączeniu języków odpowiednie angielskie dokumenty mogą konkurować z dodatkowymi, semantycznie podobnymi kandydatami w innych językach. Model musi zachować zarówno równoważność międzyjęzykową, jak i subtelne różnice w obrębie każdego języka.
Hubness może sprawiać, że niektóre wielojęzyczne wektory pojawiają się zbyt często
W przestrzeniach wielowymiarowych niewielki zbiór wektorów może stać się najbliższymi sąsiadami wielu niezwiązanych ze sobą zapytań. Te huby zajmują pozycje top-k, które powinny zawierać istotne informacje.
Nowsze analizy wielojęzyczne wskazują na hubness międzyjęzykowe jako czynnik asymetrycznego działania wyszukiwania.
Połączenie języków może ujawnić huby, które były mniej widoczne w indeksie jednojęzycznym, szczególnie wokół ogólnych fragmentów szablonowych, przetłumaczonych szablonów lub krótkich, powszechnych fraz.
Deduplicacja, lepsze negatywy, filtrowanie uwzględniające język, reranking lub punktacja uwzględniająca hubness mogą przywrócić skuteczność, zależnie od przyczyny problemu.
Tokenizacja i długość dokumentu zmieniają jakość reprezentacji
Ta sama ilość znaczenia może wymagać bardzo różnej liczby tokenów w różnych językach i systemach pisma. Dzielenie tekstu według stałego limitu znaków lub tokenów tworzy więc nierówne jednostki semantyczne.
MMTEB rozszerza ocenę wielojęzycznych embeddingów na setki języków i zadania wyszukiwania, zamiast opierać się na niewielkim, skoncentrowanym na języku angielskim benchmarku.
Dzielnik dostrojony do angielskich akapitów może rozcinać dokumenty chińskie, japońskie, aglutynacyjne lub wielojęzyczne w niewłaściwych miejscach. W efekcie powstałe wektory kodują niepełne albo zbyt szerokie informacje.
Oceniaj i kieruj wyszukiwanie według par językowych
Utwórz oznaczone zestawy wyszukiwań dla każdego ważnego języka zapytania, języka dokumentu i kierunku. Uwzględnij dokładne nazwy, parafrazy, przełączanie języków, tabele, tekst z OCR oraz terminologię używaną w domu.
Prace Snowflake nad embeddingami wielojęzycznymi przedstawiają ocenę dla poszczególnych języków, ponieważ jedna globalna średnia może ukrywać istotne różnice.
Przewodnik ZimaSpace dotyczący semantycznego indeksowania NAS pokazuje, że ekstrakcja i jakość fragmentów nadal mają wpływ na wyszukiwanie, nawet gdy model wektorowy obsługuje dany język.
Korzystaj z jednego indeksu wielojęzycznego, gdy zmierzona skuteczność jest wystarczająca. W przeciwnym razie dodaj filtry językowe, hybrydowe wyszukiwanie słów kluczowych, zapytania wspomagane tłumaczeniem, retrievery dla poszczególnych języków lub reranker cross-encoder dla słabszych kierunków.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jakie funkcje umożliwiają utworzenie domowej granicy zaufania AI wokół wrażliwych plików?
Domowa granica zaufania dla AI łączy szyfrowanie danych w spoczynku, uprawnienia zgodne z zasadą najmniejszych przywilejów, sandboxing w czasie działania oraz zakresowe pobieranie danych...

Co powoduje, że prywatne wyniki wyszukiwania faworyzują często edytowane pliki?
Często edytowane pliki zyskują przewagę w rankingu, gdy każda aktualizacja dodaje sygnały świeżości, fragmentów, wersji lub interakcji bez normalizacji względem źródła.

Co powoduje, że modele obecności w inteligentnym domu mylą gości z mieszkańcami?
Goście mogą wyglądać jak domownicy, gdy system obserwuje wzorce aktywności gospodarstwa domowego, ale nie ma stabilnego sygnału tożsamości osoby, która je generuje.

