Il drift degli embedding si verifica quando la geometria vettoriale o i dati rappresentati cambiano abbastanza da fare sì che i vettori dei documenti archiviati non corrispondano più in modo affidabile al comportamento attuale delle query.
Un indice privato può continuare a restituire elementi vicini dopo una modifica del modello di embedding, della pipeline OCR, del sistema di suddivisione in segmenti o del vocabolario domestico, senza che alcun errore evidente segnali la mancata corrispondenza. Alcune modifiche creano spazi vettoriali incompatibili e richiedono una ricostruzione completa; altre alterano solo una parte del corpus o della distribuzione delle query e richiedono un nuovo embedding mirato, una valutazione o una ricalibrazione delle soglie. La distinzione dipende dalla provenienza e dalla qualità misurata del recupero.
Il drift del modello può rendere incomparabili i vettori vecchi e nuovi
Un modello di embedding mappa il testo in un sistema di coordinate appreso dai suoi parametri e dal suo obiettivo di addestramento. Un nuovo modello, un fine-tuning, un metodo di pooling, una dimensione o una regola di normalizzazione possono ruotare e deformare questo spazio anche quando entrambi gli output hanno la stessa lunghezza.
Gli studi sulle rappresentazioni compatibili con le versioni precedenti trattano la compatibilità degli embedding come un obiettivo di addestramento esplicito, perché gli embedding appresi in modo indipendente non sono automaticamente interoperabili. Senza questa garanzia, i nuovi vettori delle query non dovrebbero cercare in un vecchio indice di documenti. Questa distinzione resta visibile durante i successivi test domestici.
Una differenza di dimensione causa un errore evidente, ma dimensioni uguali possono fallire silenziosamente. L'indice accetta il vettore e calcola un punteggio di similarità preciso in uno spazio misto che non ha un'interpretazione semantica affidabile. Il risultato intermedio deve restare ispezionabile prima che proceda l'automazione.
Il drift della pipeline e dei dati cambia il significato senza modificare il modello
I pacchetti linguistici OCR, la normalizzazione Unicode, i confini dei segmenti, l'estrazione delle tabelle, le didascalie e i prefissi dei metadati modificano il testo presentato a un encoder invariato. Anche nuovi termini domestici o nuovi tipi di documenti possono spostare le distribuzioni delle query e del corpus lontano dal set di valutazione.
MTEB dimostra un'ampia variazione tra le attività di embedding in recupero, clustering, classificazione, lingue e domini. Un modello che rimane tecnicamente identico può quindi diventare meno adatto man mano che cambia la raccolta privata. Questo limite deve essere misurato separatamente in condizioni operative realistiche.
Un nuovo embedding mirato può essere sufficiente quando sono cambiati solo documenti identificati all'interno di una pipeline versionata. Il drift delle query può invece richiedere test aggiornati, un recupero ibrido o un encoder diverso, anziché ricostruire ciecamente vettori identici. La conseguenza pratica emerge quando diverse fonti competono per un contesto limitato.
La ricostruzione è una migrazione di versione, non una compattazione ordinaria
Una ricostruzione completa rielabora ogni fonte attiva attraverso una configurazione fissata di estrazione, suddivisione in segmenti ed embedding, crea una generazione di indice separata, convalida il recupero e modifica atomicamente la destinazione delle query. Mescolare le generazioni durante la ricostruzione ne vanifica lo scopo.
Gli studi sulla compensazione del drift delle query analizzano metodi di proiezione delle query tra versioni che indirizzano le nuove query verso spazi di attività precedenti, mostrando che evitare una ricostruzione richiede un metodo di compatibilità esplicito, non la speranza che versioni vicine del modello siano allineate. Questa dipendenza deve restare esplicita nell'interfaccia finale.
Il limite di errore è rappresentato da una modifica non versionata del modello o della pre-elaborazione. Quando la provenienza non può dimostrare quale pipeline abbia creato ciascun vettore, la riparazione selettiva non è sicura; ricostruisci a partire dalle fonti autorevoli e conserva la vecchia generazione finché la valutazione e il rollback non sono completati.
Usa la provenienza e i test di recupero per scegliere l'ambito della ricostruzione
Registra la revisione dell'encoder, la dimensione, il pooling, la normalizzazione, il parser, l'OCR, il sistema di suddivisione in segmenti, il modello dei metadati, la versione della fonte e la generazione dell'indice per ogni vettore. Rifiuta le scritture miste quando cambia la chiave di compatibilità. Il risultato deve quindi essere verificato rispetto all'evidenza originale.
Confronta i risultati ordinati con il comportamento dopo una ricostruzione completa dell'indice. Esegui un set di query ripetibile per misurare richiamo, precisione, supporto delle citazioni, distribuzioni dei punteggi, lingua e tipo di documento sugli indici precedente, parallelo e candidato. Questa distinzione resta visibile durante i successivi test domestici.
Esegui una ricostruzione completa dopo una modifica incompatibile del modello o una modifica con provenienza sconosciuta; crea nuovi embedding per le fonti interessate dopo una modifica versionata della pipeline; ricalibra solo quando i vettori rimangono identici ma cambiano le soglie o la composizione delle query. Effettua il passaggio solo dopo aver misurato un miglioramento.
Hub Tecnologico e AI
Altro da leggere

Che cos'è la compatibilità dei tokenizzatori e perché può compromettere il passaggio da un modello all'altro?
Decodifica l'identità del vocabolario, la semantica dei token speciali, i modelli di chat, i token memorizzati nella cache, gli adattatori e i controlli di...

Che cos'è la permanenza del modello e quando un servizio di IA locale dovrebbe mantenere i pesi caricati?
Comprendi la permanenza dei pesi, i livelli della cache, gli avvii a freddo, l'espulsione, il multiplexing, la pressione sulla memoria e quando un servizio...

Che cos'è il tasso di accettazione della decodifica speculativa e perché è importante?
Decodifica la metrica di accettazione, definisci la verifica, il comportamento in caso di rifiuto, i limiti di accelerazione, la variazione del carico di lavoro...

