Los modelos de embeddings pueden agrupar documentos domésticos no relacionados después de un cambio de dominio porque su geometría de similitud aprendida ya no coincide con el nuevo vocabulario y las nuevas tareas.
Un índice privado puede comenzar con notas personales y manuales, y luego ampliarse para incluir historiales médicos, código fuente, facturas, archivos legales, artículos académicos o archivos multilingües. El mismo modelo de embeddings de propósito general sigue asignando cada fragmento al mismo espacio vectorial, pero el significado de «similar» ha cambiado. Los términos especializados, las plantillas repetidas, las nuevas longitudes de documento y una intención de consulta diferente pueden acercar registros no relacionados. Las secciones siguientes explican cómo el cambio de dominio modifica las vecindades sin que exista ningún error evidente de indexación.
La similitud de los embeddings refleja la distribución de entrenamiento del modelo
Un modelo de embeddings aprende qué textos deben estar cerca a partir de su preentrenamiento y de ejemplos contrastivos. Esos ejemplos definen una noción operativa de similitud antes de que se indexe el corpus doméstico.
Google Research evalúa la recuperación fuera del dominio y muestra que la calidad de las representaciones cambia cuando la colección objetivo difiere de la distribución de entrenamiento.
Es posible que un modelo entrenado para asociar paráfrasis temáticas generales no separe las entidades, los procedimientos o los tipos de registro precisos que importan en una nueva colección doméstica.
El nuevo vocabulario puede colapsar documentos distintos en un mismo tema amplio
Los documentos especializados suelen compartir términos poco frecuentes en el texto general. El modelo puede reconocer el tema general, pero carecer del contraste específico del dominio necesario para separar conceptos cercanos.
Las investigaciones sobre embeddings adaptados al dominio muestran que la precisión y el comportamiento de la similitud en dominios técnicos pueden cambiar después de ajustar el modelo con datos objetivo.
Después de un cambio de dominio, varios archivos no relacionados pueden convertirse en vecinos más cercanos porque todos contienen el mismo vocabulario técnico, aunque respondan a preguntas diferentes.
Los nombres de entidades, las unidades, las fechas y las funciones de los documentos pueden requerir recuperación léxica o filtros de metadatos cuando la representación densa solo conserva el tema compartido.
Las plantillas repetidas y los documentos largos pueden dominar el vector
Las facturas, los informes, los formularios y los registros exportados suelen repetir encabezados, avisos legales, nombres de campos o texto estándar en registros que, por lo demás, no están relacionados.
El estudio Length-Induced Embedding Collapse concluye que los embeddings de textos largos pueden volverse más similares y agruparse a medida que se añade contenido.
Si el texto estándar ocupa gran parte de un fragmento, los vectores pueden agruparse por plantilla en lugar de hacerlo por el evento, la persona, el dispositivo o la decisión únicos que contiene.
Eliminar el texto repetido, conservar los campos estructurales e insertar secciones significativas más pequeñas puede recuperar vecindades más discriminativas.
La hubness hace que algunos documentos parezcan similares a muchos otros
Los espacios vectoriales de alta dimensionalidad pueden contener hubs: documentos que se convierten en vecinos más cercanos de un número inusualmente elevado de consultas y otros documentos.
Un análisis de Sentence-BERT descubrió que la hubness de los embeddings crea vecindades asimétricas y aumenta los errores de clasificación.
Un resumen general, un glosario o una plantilla repetitiva puede convertirse en un hub después de que cambie el corpus, lo que hace que documentos domésticos no relacionados parezcan agrupados a su alrededor.
La corrección de las puntuaciones de similitud, el diagnóstico de la hubness, la reclasificación y la adaptación específica al corpus pueden reducir el efecto, pero la solución adecuada depende de la geometría medida.
Los temas mezclados dentro de un mismo fragmento crean entrelazamiento semántico
Un fragmento largo que combina instrucciones, resolución de problemas, texto de garantía y notas personales produce un único vector que debe resumir varios significados a la vez.
IBM Research informa de que los embeddings específicos del dominio conservan mejor las relaciones especializadas que los modelos generales en tareas de recuperación objetivo.
Un cambio de dominio suele introducir nuevas estructuras documentales, por lo que un segmentador antiguo basado en el número de caracteres puede combinar de repente secciones que deberían ser unidades de evidencia independientes.
Los umbrales de similitud antiguos dejan de separar las coincidencias del ruido
Un umbral calibrado con notas domésticas puede no funcionar después de añadir miles de registros técnicos. Las distribuciones de similitud positiva y aleatoria pueden acercarse entre sí.
La investigación sobre recuperación continua mide el desplazamiento de los embeddings en lugar de asumir que un único umbral de coseno antiguo sigue siendo válido después de que cambie la distribución objetivo.
Por tanto, el índice puede producir más vecinos falsos aunque el modelo de embeddings, la base de datos y el código de búsqueda no hayan cambiado.
Los umbrales deben recalibrarse por separado para el nuevo corpus, los tipos de consulta, los tamaños de fragmento y cualquier filtro de metadatos utilizado antes de la búsqueda vectorial.
Reconstruye el conjunto de evaluación en torno al nuevo dominio
Crea consultas representativas con positivos etiquetados, negativos difíciles, plantillas casi duplicadas, términos especializados y documentos que compartan un tema, pero que no deban agruparse.
Un estudio sobre la recuperación ajustada muestra por qué el nuevo dominio necesita su propio conjunto de consultas y evaluación de relevancia.
La guía de ZimaSpace sobre la búsqueda semántica de archivos muestra por qué la extracción, la segmentación, los metadatos y la recuperación deben evaluarse como una única canalización local.
Compara el corpus antiguo y el nuevo mediante la recuperación, la posición de los negativos difíciles, la pureza de los clústeres, la frecuencia de los hubs, las distribuciones de puntuaciones y los resultados del reclasificador. El problema solo está resuelto cuando las distinciones importantes del nuevo dominio vuelven a aparecer en la búsqueda.
Centro de Tecnología e IA
Más para leer

¿Qué funciones permiten establecer un límite de confianza de IA doméstica alrededor de archivos confidenciales?
Un límite de confianza para la IA doméstica combina cifrado en reposo, permisos de mínimo privilegio, aislamiento del entorno de ejecución y recuperación con...

¿Qué hace que los resultados de búsqueda privados favorezcan los archivos editados con frecuencia?
Los archivos editados con frecuencia obtienen ventajas de posicionamiento cuando cada actualización añade señales de frescura, fragmentos, versiones o interacción sin normalizarlas por fuente.

¿Qué hace que los modelos de presencia del hogar inteligente confundan a los invitados con los residentes?
Los invitados pueden parecer residentes cuando el sistema observa patrones de actividad del hogar, pero carece de una señal de identidad estable de la...

