Waarom daalt de recall van vectorzoekopdrachten nadat meerdere talen in één index zijn gecombineerd?

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

De recall van vectorzoekopdrachten kan afnemen na het combineren van talen, omdat meertalige embeddings niet elke taal, elk domein en elke zoekrichting even goed op elkaar afstemmen.

Een thuisindex kan beginnen met Engelse handleidingen en notities en vervolgens Chinese bonnetjes, Spaanse berichten, Japanse productpagina’s of documenten van familieleden met meerdere talen toevoegen. De vectordatabase voert nog steeds dezelfde bewerking voor dichtstbijzijnde buren uit, maar de representatieruimte is veranderd: talen kunnen ongelijke regio’s innemen, concepten slechts gedeeltelijk delen, verschillende tokenisatie-efficiëntie hebben en nieuwe moeilijke negatieve voorbeelden creëren. Eén globale top-k kan dan de voorkeur geven aan de dominante taal of semantisch brede buren uit andere talen ophalen, terwijl de relevante passage wordt gemist.

Een meertalig model moet gelijkwaardige betekenissen dicht bij elkaar plaatsen

Zoeken tussen talen werkt alleen wanneer een zoekopdracht in de ene taal en een relevant document in een andere taal in compatibele regio’s van de gedeelde embeddingruimte terechtkomen.

LaBSE is ontworpen om taalagnostische embeddings te creëren met behulp van grote eentalige en meertalige trainingsdatasets.

Ondersteuning voor veel talen betekent niet dat de zoekkwaliteit voor al die talen identiek is. De afstemming hangt af van de hoeveelheid en het soort gegevens dat elke taal tijdens de training heeft bijgedragen.

Een onevenwichtige training leidt tot ongelijke taalgeometrie

Talen met veel bronnen beschikken doorgaans over meer tekst, vertaalparen en moeilijke negatieve voorbeelden tijdens het trainen van modellen. Talen met weinig bronnen of taalspecifieke varianten binnen een domein kunnen daardoor minder goed worden afgestemd.

Onderzoek naar meertalige representaties rapporteert ongelijke taalprestaties en brengt die in verband met beperkingen in gegevens voor afstemming tussen talen.

Wanneer deze talen in één thuisindex terechtkomen, veronderstelt een gedeelde cosinusdrempel of top-k een vergelijkbaarheid die het embeddingmodel mogelijk niet daadwerkelijk biedt.

De dominante taal kan goed afgestemd lijken, terwijl een andere taal ongemerkt relevante buren verliest.

Eentalig en meertalig zoeken zijn verschillende tests

Een Engelse zoekopdracht die Engelse documenten ophaalt, test semantisch zoeken binnen één taal. Een Chinese zoekopdracht die een Engelse handleiding ophaalt, test zowel afstemming tussen talen als relevantie.

M3-Embedding evalueert meertalige zoekmodi voor dichte, schaarse en multivectorrepresentaties.

Een model kan goed presteren wanneer de zoekopdracht en het document dezelfde taal gebruiken, maar recall verliezen wanneer de talen verschillen. Door beide gevallen samen te voegen tot één metriek blijft de richting waarin het misgaat verborgen.

Meet taalparen expliciet: Engels naar Chinees werkt niet gegarandeerd hetzelfde als Chinees naar Engels.

Eén embeddingmodel kan Engelse kwaliteit inruilen voor bredere dekking

Een meertalige encoder heeft een beperkte modelcapaciteit en moet veel schriftsystemen, woordenschatten en semantische verdelingen representeren.

Arctic-Embed 2.0 onderzoekt de balans van meertalig zoeken in plaats van ervan uit te gaan dat een bredere taalondersteuning geen effect heeft op de bestaande Engelse prestaties.

Na het combineren van talen kunnen relevante Engelse documenten te maken krijgen met extra semantisch vergelijkbare kandidaten in andere talen. Het model moet zowel gelijkwaardigheid tussen talen als fijne verschillen binnen elke taal behouden.

Hubness kan ervoor zorgen dat sommige meertalige vectoren te vaak verschijnen

In hoogdimensionale ruimten kan een kleine groep vectoren de dichtstbijzijnde buur worden voor veel niet-gerelateerde zoekopdrachten. Deze hubs nemen top-k-posities in die relevante informatie zouden moeten bevatten.

Recente meertalige analyses identificeren hubness tussen talen als een oorzaak van asymmetrisch zoekgedrag.

Het combineren van talen kan hubs zichtbaar maken die in een index met één taal minder opvielen, vooral rond algemene standaardtekst, vertaalde sjablonen of korte veelvoorkomende zinnen.

Deduplicatie, betere negatieve voorbeelden, taalbewuste filtering, herordening of hubbewuste scoring kunnen de recall verbeteren, afhankelijk van de oorzaak van het probleem.

Tokenisatie en documentlengte veranderen de kwaliteit van representaties

Voor dezelfde hoeveelheid betekenis kunnen in verschillende talen en schriftsystemen zeer uiteenlopende aantallen tokens nodig zijn. Segmenteren op basis van een vaste teken- of tokenlimiet levert daarom semantisch ongelijke eenheden op.

MMTEB breidt meertalige embeddingevaluatie uit naar honderden talen en zoekopdrachten, in plaats van te vertrouwen op een kleine, op het Engels gerichte benchmark.

Een segmentatiesysteem dat is afgestemd op Engelse alinea’s kan Chinese, Japanse, agglutinerende of meertalige documenten op ongunstige punten splitsen. De resulterende vectoren coderen dan onvolledige of juist te brede informatie.

Evalueer zoekopdrachten en stuur ze op basis van taalparen

Maak gelabelde zoekopdrachten voor elke belangrijke zoektaal, documenttaal en richting. Neem exacte namen, parafrasen, codewisseling, tabellen, OCR-tekst en huishoudelijke terminologie op.

Snowflakes werk aan meertalige embeddings rapporteert evaluaties per taal, omdat één globaal gemiddelde betekenisvolle verschillen kan verbergen.

De handleiding van ZimaSpace voor semantische NAS-indexering laat zien dat extractie en segmentkwaliteit onderdeel blijven van het zoekproces, ook wanneer het vectormodel de taal ondersteunt.

Gebruik één meertalige index wanneer de gemeten recall acceptabel is. Voeg anders taalf filters, hybride zoeken op trefwoorden, vertaalde zoekopdrachten, zoekmodules per taal of een herordenende cross-encoder toe voor de zwakke richtingen.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.