AI-zoekopdrachten voelen vaak anders na een vocabulairewijziging, omdat nieuwe aliassen zowel letterlijke overeenkomsten als de semantische omgeving die voor de rangschikking wordt gebruikt, veranderen.
Stel dat een huishouden de bijkeuken “de studio” gaat noemen en één persoon in notities, foto's en spraakopdrachten het label “Coach” krijgt. Een lokale zoekdienst ontvangt nu nieuwe verschijningsvormen voor bestaande entiteiten in meerdere privécollecties. Of de resultaten verbeteren, hangt ervan af hoe snel het woordenboek, de index, de embeddings en de feedbackgeschiedenis die vormen met elkaar verbinden binnen veranderende huishoudcontexten.
Een vocabulairewijziging beïnvloedt eerst het terugvinden van kandidaten
Zoeken begint met bepalen welke records in aanmerking komen. Exacte en op tokens gebaseerde zoekmethoden kunnen een oud document missen wanneer de nieuwe huishoudterm er nooit in voorkomt. Een aliaskaart of query-uitbreider kan de recall herstellen door de oude term toe te voegen, maar daardoor wordt ook de kandidatenpool groter.
Praktische richtlijnen over zoeksynoniemen beschrijven synoniemen als alternatieve uitdrukkingen die naar hetzelfde concept moeten verwijzen. In een privé-index worden “studio” en “bijkeuken” pas equivalent nadat die relatie is vastgelegd of geleerd.
Semantisch zoeken werkt anders, maar is niet immuun. Een nieuwe bijnaam kan in de embeddingruimte dicht bij meerdere concepten terechtkomen, waardoor ook zonder herindexering andere benaderende kandidaten worden geselecteerd. Eerst verandert de recall van kandidaten; daarna bepaalt de herordening welke van de nieuw toegelaten records bovenaan verschijnen.
Herhaald gebruik kan de rangschikkingscontext opnieuw wegen
Sommige systemen leren van klikken, correcties, recente gesprekken of herschreven zoekopdrachten. Herhaald gebruik van een huishoudterm kan één interpretatie waarschijnlijker maken, terwijl oudere formuleringen relatief minder gewicht krijgen. De interface kan daardoor lijken alsof die het gezin al “begrijpt”, voordat elk gearchiveerd document het nieuwe woord bevat.
Onderzoek naar vocabulairemismatch beschouwt vocabulairemismatch als een centraal probleem bij het terugvinden van informatie: gebruikers en documenten kunnen dezelfde intentie met verschillende termen uitdrukken. Uitbreiding verbetert de toegang alleen wanneer de toegevoegde termen de bedoelde betekenis behouden.
Het effect is contextueel en geen universele modelupdate. “Coach” kan voor de ene persoon een familielid, een bus of een merk betekenen. Als identiteit, ruimte, tijd en inhoudstype niet worden weergegeven, kan de nieuwe term meerdere niet-gerelateerde clusters samenbrengen en de precisie verminderen.
Waar vocabulaireaanpassing niet meer helpt
Aanpassing mislukt wanneer het label dubbelzinnig, zelden gebruikt of inconsistent gekoppeld is. Ook kunnen geen records worden teruggevonden waarvan de tekst- of beeldrepresentatie nooit is geïndexeerd. Meer synoniemen verbeteren zoekopdrachten niet automatisch; brede uitbreiding kan de recall verhogen, maar het bedoelde item onder ruisachtige kandidaten duwen.
Een uitleg van fuzzy matching laat zien waarom typefouten en woordvarianten zonder exacte gelijkheid kunnen worden gematcht. Dat mechanisme verwerkt variatie in de vorm, maar levert op zichzelf geen ontbrekende huishoudelijke betekenis.
De vocabulaireverklaring schiet ook tekort als de rangschikking veranderde na een update van een model, chunking of filter. Een vaste aliastabel kan verschillende resultaten voor een ongewijzigde zoekopdracht niet verklaren, tenzij een andere index of rangschikkingscomponent is gewijzigd. Versie- en tijdstempelgegevens zijn nodig voordat huishoudtaal als oorzaak kan worden aangemerkt.
Voer een vaste reeks zoekopdrachten uit voordat je nieuwe termen aanleert
Maak twintig representatieve zoekopdrachten met oude termen, nieuwe termen en dubbelzinnige bijnamen, en bewaar voor elke opdracht de verwachte drie bovenste items. Voer de reeks uit vóór en na het één voor één toevoegen van aliassen, terwijl de indexsnapshot, het embeddingmodel, de filters en de herordener constant blijven.
Bewaar de test samen met de lokale kennisbank, zodat vocabulairewijzigingen en relevantiebeoordelingen lokaal en controleerbaar blijven. Leg zowel vast of het verwachte item is teruggevonden als wat de uiteindelijke rang was.
Als de recall van kandidaten verbetert maar de rang verslechtert, pas dan de gewichten voor uitbreiding of de herordening aan. Als het item nooit in de kandidatenlijst terechtkomt, werk dan aliassen of documentrepresentaties bij. Als zowel oude als nieuwe zoekopdrachten verschuiven zonder vocabulairewijziging, onderzoek dan eerst wijzigingen in de index- of modelversie.
Tech & AI HUB
Meer om te lezen

Hoe je de kwaliteit van lokale RAG-opvragingen meet en recall, precisie en citatiedekking interpreteert
Bouw een lokale RAG-testset, bereken de belangrijkste retrievalmetrics, interpreteer de afwegingen ertussen en controleer of beweringen in antwoorden worden ondersteund door aangehaald bewijs.

Waarom wordt computation in smart homes belangrijker naarmate het aantal sensoren toeneemt bij dezelfde bemonsteringsfrequentie?
Houd de berekeningen per sensor en tussen sensoren bij naarmate het aantal apparaten toeneemt, identificeer niet-lineaire fusiekosten en benchmark de functiepijplijn voordat automatiseringen vertraging...

Waarom worden de kosten van RAG-evaluatie belangrijker naarmate de documentbibliotheek groeit bij hetzelfde aantal zoekopdrachten?
Begrijp waarom groei van het corpus de evaluatie-inspanning voor RAG verhoogt zonder meer gebruikersvragen, en hoe gestratificeerde tests de kosten aan het risico koppelen.

