Waarom groeperen embeddingmodellen niet-gerelateerde thuisdocumenten na een domeinwijziging?

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Embeddingmodellen kunnen niet-gerelateerde documenten op een thuissysteem groeperen na een domeinwijziging, omdat hun aangeleerde gelijkenisgeometrie niet langer aansluit op de nieuwe woordenschat en taken.

Een privé-index kan beginnen met persoonlijke notities en handleidingen en zich vervolgens uitbreiden naar medische dossiers, broncode, facturen, juridische bestanden, academische artikelen of meertalige archieven. Dezelfde algemene embedder brengt elk tekstfragment nog steeds onder in één vectorruimte, maar de betekenis van “vergelijkbaar” is veranderd. Gespecialiseerde termen, herhaalde sjablonen, nieuwe documentlengtes en een andere zoekintentie kunnen niet-gerelateerde records bij elkaar brengen. In de onderstaande secties wordt uitgelegd hoe een domeinverschuiving buurten verandert zonder dat er een duidelijke indexeringsfout optreedt.

Embeddinggelijkenis weerspiegelt de trainingsverdeling van het model

Een embeddingmodel leert welke teksten dicht bij elkaar moeten liggen op basis van de voortraining en contrastieve voorbeelden. Die voorbeelden bepalen een werkbare opvatting van gelijkenis voordat het thuiscorpus überhaupt wordt geïndexeerd.

Google Research evalueert retrieval buiten het domein en laat zien dat de kwaliteit van representaties verandert wanneer de doelverzameling afwijkt van de trainingsverdeling.

Een model dat is getraind om brede thematische parafrasen met elkaar te verbinden, maakt mogelijk geen onderscheid tussen de precieze entiteiten, procedures of recordtypen die in een nieuwe huishoudelijke verzameling van belang zijn.

Nieuwe woordenschat kan verschillende documenten laten samenvallen in één breed onderwerp

Gespecialiseerde documenten bevatten vaak termen die zeldzaam zijn in algemene tekst. Het model herkent mogelijk het brede onderwerp, maar beschikt niet over voldoende domeinspecifiek contrast om naburige concepten van elkaar te onderscheiden.

Onderzoek naar domeinaangepaste embeddings laat zien dat de nauwkeurigheid en het gelijkenisgedrag binnen technische domeinen kunnen veranderen nadat het model is verfijnd met doelgegevens.

Na een domeinwijziging kunnen verschillende niet-gerelateerde bestanden elkaars naaste buren worden, omdat ze allemaal dezelfde technische woordenschat bevatten, ook al beantwoorden ze verschillende vragen.

Entiteitsnamen, eenheden, datums en documentrollen vereisen mogelijk lexicale retrieval of metadat filters wanneer de dichte representatie alleen het gedeelde onderwerp behoudt.

Herhaalde sjablonen en lange documenten kunnen de vector domineren

Facturen, rapporten, formulieren en geëxporteerde logboeken bevatten vaak herhaalde kopteksten, disclaimers, veldnamen of standaardtekst in verder niet-gerelateerde records.

Length-Induced Embedding Collapse laat zien dat embeddings van lange teksten meer op elkaar kunnen gaan lijken en samen kunnen clusteren wanneer extra inhoud wordt toegevoegd.

Als standaardtekst een groot deel van een tekstfragment inneemt, kunnen vectoren clusteren op basis van het sjabloon in plaats van op basis van de unieke gebeurtenis, persoon, het apparaat of de beslissing die erin staat.

Door herhaalde tekst te verwijderen, structurele velden te behouden en kleinere betekenisvolle secties te embedden, kunnen beter onderscheidende buurten worden hersteld.

-15% OFF
Single board computer zimaboard2

Hubness zorgt ervoor dat sommige documenten op veel andere lijken

Hoogdimensionale vectorruimten kunnen hubs bevatten: documenten die voor een ongewoon groot aantal zoekopdrachten en andere documenten de naaste buren worden.

Een analyse van Sentence-BERT toonde aan dat hubness van embeddings asymmetrische buurten creëert en classificatiefouten verhoogt.

Een algemene inleiding, woordenlijst of herhaald sjabloon kan na een wijziging van het corpus een hub worden, waardoor niet-gerelateerde documenten op het thuissysteem eromheen gegroepeerd lijken.

Correctie van gelijkenisscores, hubness-diagnostiek, herordening en corpus-specifieke aanpassing kunnen het effect verminderen, maar de juiste oplossing hangt af van de gemeten geometrie.

Gemengde onderwerpen in één tekstfragment creëren semantische verstrengeling

Een lang tekstfragment waarin instructies, probleemoplossing, garantietekst en persoonlijke notities worden gecombineerd, produceert één vector die meerdere betekenissen tegelijk moet samenvatten.

IBM Research meldt dat domeinspecifieke embeddings gespecialiseerde relaties beter behouden dan algemene modellen bij retrievaltaken binnen het doelgebied.

Een domeinwijziging introduceert vaak nieuwe documentstructuren, waardoor een oude chunker op basis van tekens plotseling secties kan combineren die afzonderlijke bewijseenheden zouden moeten zijn.

Oude gelijkenisdrempels scheiden overeenkomsten niet langer van ruis

Een drempel die is afgestemd op huishoudelijke notities werkt mogelijk niet meer nadat duizenden technische records zijn toegevoegd. De verdelingen van positieve en willekeurige gelijkenisscores kunnen dichter bij elkaar komen te liggen.

Onderzoek naar continue retrieval meet embeddingdrift in plaats van ervan uit te gaan dat één oude cosinusdrempel geldig blijft nadat de doelverdeling is veranderd.

De index kan daardoor meer foutieve buren opleveren, ook al zijn het embeddingmodel, de database en de zoekcode ongewijzigd.

Drempels moeten afzonderlijk opnieuw worden gekalibreerd voor het nieuwe corpus, de verschillende typen zoekopdrachten, de grootte van tekstfragmenten en alle metadat filters die vóór de vectorzoekopdracht worden gebruikt.

Bouw de evaluatieset opnieuw op rond het nieuwe domein

Maak representatieve zoekopdrachten met gelabelde positieve voorbeelden, moeilijke negatieve voorbeelden, bijna identieke sjablonen, gespecialiseerde termen en documenten die hetzelfde onderwerp delen maar niet bij elkaar gegroepeerd zouden moeten worden.

Een onderzoek naar verfijnde retrieval laat zien waarom het nieuwe domein een eigen zoekopdrachtenset en relevantie-evaluatie nodig heeft.

De handleiding van ZimaSpace over semantisch zoeken in bestanden laat zien waarom extractie, chunking, metadata en retrieval als één lokale pijplijn moeten worden geëvalueerd.

Vergelijk het oude en nieuwe corpus op het gebied van recall, rang van moeilijke negatieve voorbeelden, clust zuiverheid, hubfrequentie, scoreverdelingen en resultaten van de herordener. Het probleem is pas opgelost wanneer de belangrijke onderscheidingen van het nieuwe domein opnieuw zichtbaar worden in de zoekresultaten.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.