La deriva de los embeddings aparece cuando la reindexación cambia el modelo, el texto, la configuración del codificador, la ruta numérica o las reglas de comparación utilizadas para representar la biblioteca.
Una base de conocimientos doméstica puede contener los mismos PDF, notas, manuales y registros familiares antes y después de una reconstrucción y, aun así, devolver vecinos más cercanos o puntuaciones de similitud diferentes. Algunos cambios son una verdadera deriva de embeddings: el vector producido para una entrada idéntica se desplazó. Otros son una deriva de ingesta, en la que cambió el texto enviado al codificador, o una deriva de recuperación, en la que se buscan vectores idénticos con métricas o configuraciones de índice diferentes. Por lo tanto, el primer límite de diagnóstico consiste en comparar los bytes de origen, el texto extraído, la identidad de los fragmentos, los vectores sin procesar y los resultados ordenados como artefactos independientes.
La deriva vectorial real y la deriva aparente de recuperación son diferentes
La deriva real significa que el mismo texto normalizado produce un vector diferente. La deriva aparente significa que el vector permanece estable, pero cambian la pertenencia de los fragmentos, la métrica de similitud, el filtrado, la cuantización o la búsqueda aproximada de vecinos, lo que modifica los resultados ordenados.
Las colecciones de Qdrant definen el tamaño del vector y la métrica de distancia como parámetros de nivel de colección. Reconstruir una colección con otra métrica puede cambiar las puntuaciones y el orden sin modificar los valores de los embeddings.
Comparar únicamente los primeros resultados de búsqueda mezcla estas causas. Una suma de comprobación de los vectores sin procesar para cadenas de prueba fijas permite separar la deriva del codificador de la deriva del índice o del ordenamiento.
Una revisión de modelo no fijada puede reemplazar el codificador
El nombre de un modelo no siempre representa un conjunto permanente de pesos y archivos de configuración. El propietario de un repositorio puede actualizar los pesos, los archivos del tokenizador, la configuración de agrupación o el código del modelo y conservar el mismo nombre público del repositorio.
Los repositorios de Hugging Face utilizan control de versiones, y las descargas pueden usar una revisión específica en lugar del estado de la rama más reciente.
Esta causa produce un desplazamiento generalizado en un conjunto fijo de pruebas, normalmente acompañado de un cambio en el commit del modelo, la ruta de la caché, el hash de configuración o los recursos del tokenizador. Se diferencia de la deriva específica de documentos, que solo afecta a los archivos cuya extracción o segmentación cambió.
Las opciones del codificador pueden cambiar la longitud, la escala y la geometría del vector
Los mismos pesos pueden producir representaciones diferentes cuando cambian la agrupación, la normalización, la precisión, los prefijos de las indicaciones, la longitud máxima de secuencia o las dimensiones de salida.
Sentence Transformers ofrece controles del codificador, incluida la precisión, la normalización, las indicaciones y las dimensiones truncadas.
Un cambio de normalización puede conservar la dirección y modificar la magnitud del vector; un prefijo de indicación puede trasladar todos los documentos a otro espacio condicionado por la tarea; la truncación puede descartar dimensiones. Estos son cambios de configuración, no inestabilidad aleatoria.
El texto que llega al codificador puede no ser el mismo
La reindexación puede invocar otra versión del analizador, otra ruta de OCR, otro normalizador de espacios en blanco, otra regla de orden de páginas o una estrategia de segmentación diferente, aunque los archivos originales sean idénticos byte a byte.
Unstructured realiza la segmentación después de la partición y documenta cómo el tamaño de los fragmentos, el solapamiento y los límites de las secciones determinan qué texto entra en cada fragmento.
Si se detecta un encabezado nuevo o una página produce un OCR diferente, pueden desplazarse todos los límites de los fragmentos posteriores. Los vectores resultantes no son representaciones alteradas de una entrada idéntica; representan fragmentos de texto diferentes.
La ejecución no determinista puede crear pequeñas diferencias numéricas
Los kernels paralelos, las bibliotecas de hardware, el orden de las operaciones y los componentes aleatorios pueden hacer que la inferencia repetida difiera ligeramente, incluso con el mismo modelo y la misma entrada.
PyTorch señala que no se garantiza una reproducibilidad completa entre versiones, plataformas o dispositivos, y ofrece controles para algoritmos deterministas en las operaciones compatibles.
Esta causa normalmente genera pequeñas diferencias en las coordenadas, no una reorganización completa del espacio semántico. Si la similitud coseno entre los vectores de prueba antiguos y nuevos sigue siendo extremadamente alta, el cambio puede ser ruido numérico que solo se vuelve visible cerca de empates en el ordenamiento.
La precisión y la cuantización pueden desplazar a los vecinos límite
Una reconstrucción puede cambiar de float32 a float16, int8 u otro perfil de ejecución optimizado para reducir el uso de memoria y mejorar el rendimiento.
ONNX Runtime explica que la conversión a float16 puede introducir diferencias de exactitud que requieren pruebas de tolerancia.
El efecto semántico suele ser pequeño, pero una biblioteca local puede contener muchos fragmentos similares. Pequeños desplazamientos de las coordenadas pueden intercambiar el orden de vecinos cuyas puntuaciones originales eran casi iguales.
La reindexación puede mezclar generaciones de vectores antiguas y nuevas
Una colección reconstruida parcialmente puede contener vectores generados con distintos commits del modelo, configuraciones de fragmentación, dimensiones o reglas de normalización.
Las generaciones mezcladas producen un comportamiento irregular: los documentos sin cambios pueden permanecer estables mientras solo se desplazan los archivos reprocesados, y los vectores de consulta pueden ser incompatibles con parte de la colección almacenada.
La guía de ZimaSpace sobre la indexación semántica en NAS ofrece el límite relacionado: la biblioteca de origen, los registros extraídos, los embeddings y el índice de búsqueda son capas independientes y no deben tratarse como un único objeto inmutable.
Preguntas frecuentes
¿El mismo texto debería producir siempre embeddings idénticos bit a bit?
Solo con un modelo fijado, una configuración idéntica, una ruta de ejecución determinista y un entorno de hardware y software coincidente. De lo contrario, aún pueden producirse pequeñas diferencias de coma flotante.
¿Los resultados de búsqueda sin cambios pueden demostrar que los embeddings no derivaron?
No. Los vectores pueden desplazarse sin cruzar los límites del ordenamiento. Compara los vectores sin procesar, sus hashes y sus similitudes en un conjunto fijo de pruebas.
¿Un vecino más cercano diferente siempre indica una deriva del modelo?
No. La segmentación, los filtros, las métricas de distancia, la cuantización y la construcción aproximada del índice pueden cambiar la recuperación aunque la salida del codificador permanezca estable.
Centro de Tecnología e IA
Más para leer

¿Qué hace que un planificador de agentes de IA repita pasos que ya completó?
Rastrea los pasos repetidos del planificador mediante la persistencia del estado, la evidencia de finalización, el análisis de los resultados de las herramientas, la...

¿Qué causa errores de permisos solo dentro de los subprocesos de agentes de IA?
Compare la identidad del proceso principal y del proceso secundario, la vista del sistema de archivos, el entorno, las capacidades, la política de seguridad...

¿Qué causa la saturación de la CPU cuando se ejecutan simultáneamente la transcodificación por hardware y la IA de vídeo?
Rastrea la saturación de la CPU en la descarga de códecs, la conversión de píxeles, las copias de fotogramas, el preprocesamiento de IA, el...

