Un segundo modelo cambia el orden de la evidencia al leer conjuntamente cada par de consulta y candidato, aplicando señales de relevancia más precisas de las que puede representar la comparación vectorial de la primera etapa.
Un archivo privado puede recuperar veinte fragmentos plausibles en milisegundos, pero el pasaje más útil queda por debajo de material genérico que comparte el vocabulario de la consulta. Un reordenador dedica más cómputo a ese pequeño conjunto de candidatos y produce una nueva puntuación para cada par. El contexto final puede mejorar aunque no hayan cambiado los documentos, las incorporaciones ni las preguntas de los usuarios.
La recuperación de primera etapa optimiza la cobertura dentro de un presupuesto de velocidad
La recuperación densa o híbrida compara representaciones compactas en todo el corpus. Debe ser lo bastante rápida para explorar o recorrer muchos candidatos, por lo que codifica cada documento independientemente de la consulta actual. Esto favorece una recuperación amplia, pero puede pasar por alto relaciones sutiles como la negación, el rol, la cronología o las restricciones exactas.
Una descripción general de los pares de consulta y documento describe el reordenador como un codificador cruzado que puntúa conjuntamente una consulta y un documento. Esa atención conjunta es más expresiva que comparar vectores generados por separado, pero resulta demasiado costosa para aplicarla a todos los documentos de una biblioteca grande.
La recuperación en dos etapas divide el trabajo: el primer modelo crea un conjunto de candidatos; el segundo dedica precisión a ese conjunto. Si la evidencia correcta nunca entra en el conjunto, el reordenamiento no puede recuperarla, lo que convierte la recuperación de candidatos en una dependencia crítica.
La puntuación conjunta cambia qué evidencia llega al generador
El reordenador ve la consulta completa junto a cada candidato y puede premiar la implicación exacta, la coincidencia de entidades o las condiciones requeridas. Puede relegar una descripción general ampliamente similar por debajo de un párrafo específico que responde directamente a la pregunta. Por tanto, los primeros k elementos que se envían al LLM contienen evidencia diferente.
Un análisis detallado de la interacción de los codificadores cruzados explica cómo estos resuelven las limitaciones de la similitud de los bi-codificadores mediante un procesamiento conjunto. Esta interacción adicional es el mecanismo que mejora el orden, no una segunda búsqueda vectorial. Esa distinción cambia la decisión final del hogar.
El orden importa porque las ventanas de contexto y la atención son limitadas. Un primer pasaje mejor puede fundamentar la respuesta desde el principio, mientras que los duplicados de menor rango pueden desplazar evidencia complementaria. Por tanto, el reordenamiento debe considerar tanto la relevancia como la cobertura, no limitarse a producir diez versiones del mismo hecho.
Cuándo el reordenamiento empeora la búsqueda privada
Un reordenador hereda las preferencias de sus datos de entrenamiento. Puede favorecer la prosa pulida frente a las tablas, los idiomas dominantes frente a los dialectos del hogar o las coincidencias explícitas de palabras clave frente a la evidencia implícita. Los conjuntos pequeños de candidatos amplifican los errores de la primera etapa, mientras que los conjuntos grandes añaden latencia y pueden hacer que la búsqueda interactiva se sienta irregular.
Un debate reciente sobre la diversidad de la evidencia señala que el reordenamiento basado únicamente en la relevancia puede reducirla, lo que motiva una etapa posterior de diversidad. Esto muestra por qué una puntuación de relevancia más alta no equivale automáticamente a un conjunto de evidencia más completo. Este límite sigue siendo visible durante la revisión posterior de la evidencia.
La afirmación falla cuando el reordenador no se adapta al dominio o cuando la latencia supera el presupuesto de interacción. Debe omitirse o sustituirse si relega sistemáticamente respuestas verificadas, reduce la diversidad de fuentes o cambia el orden sin mejorar las respuestas respaldadas.
Evalúa el orden con ejecuciones de recuperación emparejadas
Construye un conjunto de prueba con consultas, pasajes de evidencia aceptables y categorías de fuentes importantes. Para cada consulta, guarda la clasificación de la primera etapa y el orden reordenado; después, mide la recuperación en el conjunto de candidatos, la precisión en el corte final, el rango recíproco, el respaldo de las citas y la latencia.
Usa una evaluación repetible en lugar de preguntas de demostración memorables, siguiendo el enfoque del reordenamiento de primera etapa. Inspecciona manualmente las inversiones de rango, especialmente en hojas de cálculo, texto multilingüe, negaciones, fechas y fragmentos casi duplicados. Por tanto, la dependencia debe medirse por separado en la práctica.
Conserva el reordenador solo si promueve evidencia respaldada en todo el conjunto de prueba sin una latencia inaceptable ni pérdida de diversidad. Una puntuación más baja de la respuesta final debe activar una investigación independiente de la recuperación de candidatos y de la calidad del reordenador, porque ambas etapas fallan de forma diferente.
Centro de Tecnología e IA
Más para leer

Embeddings multilingües: cómo un único espacio vectorial conecta documentos domésticos en distintos idiomas
Descubre cómo los embeddings alineados conectan documentos entre idiomas, por qué varía la calidad de recuperación y cómo probar localmente la cobertura de evidencia...

Conflictos en la memoria del agente: por qué las correcciones recientes pueden perder frente a hechos antiguos repetidos
Aprende cómo los recuerdos antiguos duplicados prevalecen sobre las correcciones, cuándo fallan las reglas de recencia y cómo probar la sustitución en un almacén...

Muestreo de LLM locales: por qué los ajustes de decodificación cambian la repetición y la estabilidad
Aprende cómo interactúan la temperatura, top-p, min-p, las semillas y las penalizaciones, y cómo probar los ajustes de decodificación sin confundir la aleatoriedad con...

