La deriva de los embeddings ocurre cuando la geometría vectorial o los datos representados cambian lo suficiente como para que los vectores de documentos almacenados ya no coincidan de forma fiable con el comportamiento actual de las consultas.
Un índice privado puede seguir devolviendo vecinos después de que cambien el modelo de embeddings, la canalización de OCR, el segmentador o el vocabulario del hogar, sin que ningún error evidente anuncie la incompatibilidad. Algunos cambios crean espacios vectoriales incompatibles y requieren una reconstrucción completa; otros modifican solo parte del corpus o de la distribución de consultas y requieren volver a generar embeddings de forma selectiva, realizar una evaluación o recalibrar los umbrales. La distinción depende de la procedencia y de la calidad de recuperación medida.
La deriva del modelo puede hacer que los vectores antiguos y nuevos sean incomparables
Un modelo de embeddings asigna el texto a un sistema de coordenadas aprendido a partir de sus parámetros y objetivo de entrenamiento. Un modelo nuevo, un ajuste fino, un método de pooling, una dimensión o una regla de normalización diferentes pueden rotar y transformar ese espacio, incluso cuando ambas salidas tienen la misma longitud.
El trabajo sobre representaciones compatibles con versiones anteriores considera la compatibilidad de embeddings un objetivo de entrenamiento explícito, porque los embeddings aprendidos de forma independiente no son interoperables automáticamente. Sin esa garantía, los nuevos vectores de consulta no deberían buscar en un índice antiguo de documentos. Esta distinción sigue siendo visible durante las pruebas posteriores en el hogar.
Una incompatibilidad de dimensiones falla de forma visible, pero las dimensiones iguales pueden fallar silenciosamente. El índice acepta el vector y calcula una puntuación de similitud precisa en un espacio mixto que carece de una interpretación semántica fiable. El resultado intermedio debe seguir siendo inspeccionable antes de que continúe la automatización.
La deriva de la canalización y de los datos cambia el significado sin cambiar el modelo
Los paquetes de idiomas del OCR, la normalización Unicode, los límites de los fragmentos, la extracción de tablas, los pies de imagen y los prefijos de metadatos cambian el texto que se presenta a un codificador que no ha cambiado. Los nuevos términos del hogar o los nuevos tipos de documentos también pueden desplazar las distribuciones de consultas y del corpus con respecto al conjunto de evaluación.
MTEB demuestra una amplia variación entre tareas de embeddings en recuperación, agrupación, clasificación, idiomas y dominios. Por tanto, un modelo que siga siendo técnicamente idéntico puede volverse menos adecuado a medida que cambia la colección privada. Ese límite debe medirse por separado en condiciones operativas realistas.
Volver a generar embeddings de forma selectiva puede ser suficiente cuando solo han cambiado documentos identificados dentro de una canalización versionada. La deriva de las consultas puede requerir pruebas actualizadas, recuperación híbrida o un codificador diferente, en lugar de reconstruir a ciegas vectores idénticos. La consecuencia práctica aparece cuando varias fuentes compiten por un contexto limitado.
Reconstruir es una migración de versión, no una compactación rutinaria
Una reconstrucción completa vuelve a procesar cada fuente activa mediante una única configuración fijada de extracción, segmentación y generación de embeddings, crea una generación de índice separada, valida la recuperación y cambia atómicamente el destino de las consultas. Mezclar generaciones durante la reconstrucción anula su propósito.
Query Drift Compensation estudia métodos de proyección de consultas entre versiones que asignan las nuevas consultas a espacios de tareas antiguos, lo que demuestra que evitar una reconstrucción requiere un método de compatibilidad explícito, no confiar en que versiones cercanas del modelo estén alineadas. Esta dependencia debe seguir siendo explícita en la interfaz final.
El límite de fallo es un cambio no versionado del modelo o del preprocesamiento. Cuando la procedencia no puede demostrar qué canalización creó cada vector, la reparación selectiva no es segura; reconstruye a partir de fuentes autorizadas y conserva la generación antigua hasta completar la evaluación y la reversión.
Usa la procedencia y las pruebas de recuperación para elegir el alcance de la reconstrucción
Registra la revisión del codificador, la dimensión, el pooling, la normalización, el analizador, el OCR, el segmentador, la plantilla de metadatos, la versión de la fuente y la generación del índice para cada vector. Rechaza las escrituras mezcladas cuando cambie la clave de compatibilidad. Por tanto, el resultado debe comprobarse frente a la evidencia original.
Compara los resultados ordenados con el comportamiento de una reconstrucción completa del índice. Ejecuta un conjunto de consultas reproducible para medir cobertura, precisión, respaldo de citas, distribuciones de puntuaciones, idioma y tipo de documento en los índices antiguo, paralelo y candidato. Esta distinción sigue siendo visible durante las pruebas posteriores en el hogar.
Reconstruye por completo después de un cambio de modelo incompatible o de procedencia desconocida; vuelve a generar los embeddings de las fuentes afectadas después de un cambio versionado de la canalización; recalibra únicamente cuando los vectores sigan siendo idénticos, pero hayan cambiado los umbrales o la mezcla de consultas. Cambia al nuevo índice solo después de medir una mejora.
Centro de Tecnología e IA
Más para leer

¿Qué es la compatibilidad del tokenizador y por qué puede hacer que el cambio de modelo falle?
Descifra la identidad del vocabulario, la semántica de los tokens especiales, las plantillas de chat, los tokens en caché, los adaptadores y las comprobaciones...

¿Qué es la permanencia del modelo y cuándo debe un servicio de IA local mantener las ponderaciones cargadas?
Descubre la permanencia de los pesos, los niveles de caché, los arranques en frío, la expulsión, la multiplexación, la presión de memoria y cuándo...

¿Qué es la tasa de aceptación de la decodificación especulativa y por qué es importante?
Descifra la métrica de aceptación, redacta la verificación, el comportamiento de rechazo, los límites de aceleración, la variación de la carga de trabajo y...

