Modele embeddingowe mogą grupować niezwiązane ze sobą dokumenty domowe po zmianie domeny, ponieważ wyuczona przez nie geometria podobieństwa przestaje pasować do nowego słownictwa i zadań.
Prywatny indeks może zacząć od osobistych notatek i instrukcji, a następnie rozszerzyć się o dokumentację medyczną, kod źródłowy, faktury, pliki prawne, artykuły naukowe lub wielojęzyczne archiwa. Ten sam embedder ogólnego przeznaczenia nadal mapuje każdy fragment do jednej przestrzeni wektorowej, ale znaczenie słowa „podobny” uległo zmianie. Specjalistyczne terminy, powtarzalne szablony, nowe długości dokumentów i inna intencja zapytań mogą zbliżać do siebie niezwiązane rekordy. Poniższe sekcje wyjaśniają, jak przesunięcie domeny zmienia sąsiedztwa bez żadnego oczywistego błędu indeksowania.
Podobieństwo embeddingów odzwierciedla rozkład danych treningowych modelu
Model embeddingowy uczy się, które teksty powinny znajdować się blisko siebie, na podstawie pretreningu i przykładów kontrastywnych. Przykłady te definiują robocze pojęcie podobieństwa, zanim domowy korpus zostanie w ogóle zindeksowany.
Google Research analizuje wyszukiwanie spoza domeny, pokazując, że jakość reprezentacji zmienia się, gdy docelowy zbiór różni się od rozkładu danych treningowych.
Model wytrenowany do kojarzenia szerokich parafraz tematycznych może nie rozdzielać precyzyjnych encji, procedur ani typów rekordów istotnych w nowym domowym zbiorze danych.
Nowe słownictwo może zredukować odrębne dokumenty do jednego szerokiego tematu
Dokumenty specjalistyczne często zawierają wspólne terminy rzadko spotykane w ogólnych tekstach. Model może rozpoznawać ogólny temat, ale nie mieć wystarczającego kontrastu domenowego, aby rozdzielić sąsiadujące pojęcia.
Badania nad embeddingami dostosowanymi do domeny pokazują, że dokładność i zachowanie podobieństwa w domenie technicznej mogą zmienić się po dostrojeniu na danych docelowych.
Po zmianie domeny kilka niezwiązanych ze sobą plików może stać się najbliższymi sąsiadami, ponieważ wszystkie zawierają to samo techniczne słownictwo, mimo że odpowiadają na różne pytania.
Gdy reprezentacja gęsta zachowuje jedynie wspólny temat, do rozróżniania nazw encji, jednostek, dat i ról dokumentów mogą być potrzebne wyszukiwanie leksykalne lub filtry metadanych.
Powtarzalne szablony i długie dokumenty mogą zdominować wektor
Faktury, raporty, formularze i eksportowane dzienniki często powtarzają nagłówki, zastrzeżenia, nazwy pól lub tekst szablonowy w skądinąd niezwiązanych rekordach.
Badanie Length-Induced Embedding Collapse pokazuje, że embeddingi długich tekstów mogą stawać się coraz bardziej podobne i tworzyć klastry w miarę dodawania kolejnych treści.
Jeśli tekst szablonowy zajmuje dużą część fragmentu, wektory mogą grupować się według szablonu, a nie według unikalnego zdarzenia, osoby, urządzenia lub decyzji opisanych w jego treści.
Usunięcie powtarzalnego tekstu, zachowanie pól strukturalnych i tworzenie embeddingów z mniejszych, znaczących sekcji może przywrócić bardziej rozróżnialne sąsiedztwa.
Hubness sprawia, że niektóre dokumenty wydają się podobne do wielu innych
Wielowymiarowe przestrzenie wektorowe mogą zawierać huby: dokumenty, które stają się najbliższymi sąsiadami wyjątkowo dużej liczby zapytań i innych dokumentów.
Analiza Sentence-BERT wykazała, że hubness embeddingów tworzy asymetryczne sąsiedztwa i zwiększa liczbę błędów klasyfikacji.
Ogólny przegląd, glosariusz lub powtarzalny szablon może stać się hubem po zmianie korpusu, powodując, że niezwiązane ze sobą dokumenty domowe będą wyglądać na pogrupowane wokół niego.
Korekta wyników podobieństwa, diagnostyka hubness, reranking i dostosowanie do konkretnego korpusu mogą ograniczyć ten efekt, ale właściwe rozwiązanie zależy od zmierzonej geometrii.
Wymieszane tematy w jednym fragmencie powodują splątanie semantyczne
Długi fragment łączący instrukcje, rozwiązywanie problemów, tekst gwarancji i osobiste notatki tworzy jeden wektor, który musi jednocześnie podsumować kilka znaczeń.
IBM Research informuje, że embeddingi specyficzne dla domeny lepiej zachowują specjalistyczne relacje niż modele ogólne w docelowych zadaniach wyszukiwania.
Zmiana domeny często wprowadza nowe struktury dokumentów, dlatego stary dzielnik na fragmenty oparty na liczbie znaków może nagle łączyć sekcje, które powinny stanowić oddzielne jednostki dowodowe.
Stare progi podobieństwa przestają oddzielać dopasowania od szumu
Próg skalibrowany na podstawie notatek domowych może nie działać po dodaniu tysięcy dokumentów technicznych. Rozkłady podobieństwa pozytywnego i losowego mogą zbliżyć się do siebie.
Badania nad ciągłym wyszukiwaniem mierzą dryf embeddingów, zamiast zakładać, że jeden stary próg cosinusowy pozostaje prawidłowy po zmianie rozkładu docelowego.
Indeks może więc generować więcej fałszywych sąsiadów, mimo że model embeddingowy, baza danych i kod wyszukiwania pozostają bez zmian.
Progi należy ponownie skalibrować osobno dla nowego korpusu, typów zapytań, rozmiarów fragmentów i wszelkich filtrów metadanych stosowanych przed wyszukiwaniem wektorowym.
Zbuduj zbiór ewaluacyjny na nowo dla nowej domeny
Utwórz reprezentatywne zapytania z oznaczonymi trafnymi wynikami, trudnymi negatywami, prawie identycznymi szablonami, specjalistycznymi terminami oraz dokumentami, które dzielą temat, ale nie powinny być grupowane.
Badanie dotyczące dostrojonego wyszukiwania pokazuje, dlaczego nowa domena potrzebuje własnego zbioru zapytań i oceny trafności.
Przewodnik ZimaSpace dotyczący semantycznego wyszukiwania plików pokazuje, dlaczego ekstrakcję, dzielenie na fragmenty, metadane i wyszukiwanie należy oceniać jako jeden lokalny potok.
Porównaj stary i nowy korpus za pomocą miar takich jak recall, pozycja trudnych negatywów, czystość klastrów, częstotliwość hubów, rozkłady wyników i rezultaty rerankera. Problem jest rozwiązany dopiero wtedy, gdy istotne rozróżnienia nowej domeny ponownie pojawiają się w wynikach wyszukiwania.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak zmniejszanie rozdzielczości szeregów czasowych wpływa na wykrywanie anomalii w inteligentnym domu?
Zobacz, jak szerokość przedziałów, agregacja, antyaliasing, brakujące dane, czas trwania zdarzenia i przechowywanie danych w wielu skalach wpływają na wykrywanie anomalii w inteligentnym domu.

Jak mapa zajętości łączy słabe sygnały inteligentnego domu?
Dowiedz się, jak komórki przestrzenne, modele czujników, aktualizacje log-ilorazów szans, wygaszanie, skorelowane dane i wartości progowe przekształcają słabe sygnały z domu w szacunki obecności...

Jak normalizacja fotometryczna wpływa na klasteryzację prywatnych twarzy?
Zobacz, jak korekcja oświetlenia zmienia kadry twarzy, reprezentacje wektorowe, odległości między klastrami, wartości progowe, nadmierną normalizację i ocenę wyszukiwania prywatnych zdjęć.

