Un second modèle modifie l’ordre des éléments probants en lisant conjointement chaque paire requête-candidat et en appliquant des signaux de pertinence plus fins que ceux que peut représenter la comparaison vectorielle de première étape.
Une archive privée peut récupérer vingt extraits plausibles en quelques millisecondes, alors que le passage le plus utile se trouve sous des contenus génériques partageant le vocabulaire de la requête. Un réordonnanceur consacre davantage de calcul à ce petit ensemble de candidats et produit un nouveau score pour chaque paire. Le contexte final peut ainsi s’améliorer, même si aucun document, embedding ou question utilisateur n’a changé.
La récupération de première étape optimise la couverture dans une limite de rapidité
La récupération dense ou hybride compare des représentations compactes dans l’ensemble du corpus. Elle doit être suffisamment rapide pour analyser ou parcourir de nombreux candidats ; elle encode donc chaque document indépendamment de la requête actuelle. Cela favorise un rappel large, mais peut manquer des relations fines comme la négation, le rôle, la chronologie ou les contraintes exactes.
Une présentation des paires requête-document décrit le réordonnanceur comme un cross-encodeur qui évalue conjointement une requête et un document. Cette attention conjointe est plus expressive que la comparaison de vecteurs produits séparément, mais son application à chaque document d’une grande bibliothèque coûterait trop cher.
La récupération en deux étapes répartit le travail : le premier modèle crée un ensemble de candidats ; le second y consacre davantage de précision. Si les éléments probants corrects n’entrent jamais dans cet ensemble, le réordonnancement ne peut pas les récupérer, ce qui fait du rappel des candidats une dépendance critique.
Le score conjoint modifie les éléments probants transmis au générateur
Le réordonnanceur voit la requête complète à côté de chaque candidat et peut valoriser l’implication exacte, la correspondance entre entités ou les conditions requises. Il peut rétrograder une présentation largement similaire derrière un paragraphe précis qui répond directement à la question. Le top-k transmis au LLM contient donc des éléments probants différents.
Une analyse détaillée de l’interaction entre cross-encodeurs explique comment ceux-ci résolvent les limites de la similarité des bi-encodeurs grâce à un traitement conjoint. Cette interaction supplémentaire est le mécanisme qui améliore l’ordre, et non une seconde recherche vectorielle. Cette distinction modifie la décision finale du foyer.
L’ordre compte, car les fenêtres de contexte et l’attention sont limitées. Un meilleur premier passage peut ancrer rapidement la réponse, tandis que des doublons moins bien classés peuvent évincer des éléments probants complémentaires. Le réordonnancement doit donc tenir compte à la fois de la pertinence et de la couverture, plutôt que de produire simplement dix versions d’un même fait.
Quand le réordonnancement dégrade la recherche privée
Un réordonnanceur hérite des préférences de son entraînement. Il peut privilégier une prose soignée aux tableaux, les langues dominantes aux dialectes utilisés dans les foyers, ou les correspondances explicites de mots-clés aux éléments probants implicites. Les petits ensembles de candidats amplifient les omissions de la première étape, tandis que les grands ensembles ajoutent de la latence et peuvent rendre la recherche interactive irrégulière.
Une discussion récente sur la diversité des éléments probants souligne qu’un réordonnancement fondé uniquement sur la pertinence peut réduire cette diversité, ce qui justifie l’ajout ultérieur d’une étape de diversification. Cela montre pourquoi un score de pertinence plus élevé ne produit pas automatiquement un ensemble d’éléments probants plus complet. Cette limite reste visible lors de l’examen ultérieur des éléments probants.
L’affirmation échoue lorsque le réordonnanceur est mal adapté au domaine ou lorsque la latence dépasse le budget d’interaction. Il faut le contourner ou le remplacer s’il rétrograde régulièrement des réponses vérifiées, réduit la diversité des sources ou modifie l’ordre sans améliorer les réponses étayées.
Évaluer l’ordre avec des exécutions de récupération appariées
Constituez un jeu de test contenant des requêtes, des passages d’éléments probants acceptables et les catégories de sources importantes. Pour chaque requête, enregistrez le classement de première étape et l’ordre après réordonnancement, puis mesurez le rappel dans l’ensemble de candidats, la précision au seuil final, le rang réciproque, l’étayage des citations et la latence.
Utilisez une évaluation reproductible plutôt que des questions de démonstration mémorables, en suivant l’approche décrite dans le réordonnancement de première étape. Examinez manuellement les inversions de rang, notamment pour les feuilles de calcul, les textes multilingues, la négation, les dates et les extraits quasi dupliqués. Cette dépendance doit donc être mesurée séparément en pratique.
Ne conservez le réordonnanceur que s’il favorise les éléments probants étayés dans l’ensemble de test sans latence inacceptable ni perte de diversité. Une baisse du score de la réponse finale doit déclencher une analyse distincte du rappel des candidats et de la qualité du réordonnanceur, car les deux étapes échouent de manière différente.
Centre Tech & IA
Plus à lire

Étalonnage du score de recherche privée : comment la similarité brute devient un indicateur de confiance exploitable
Découvrez pourquoi la similarité cosinus n’est pas un indicateur de confiance, comment les requêtes étiquetées calibrent les scores et comment surveiller les seuils lorsqu’un...

Localité NUMA de l’IA locale : pourquoi le placement de la mémoire modifie le débit d’alimentation de l’accélérateur
Découvrez comment la topologie du CPU, de la RAM et du PCIe affecte l’alimentation de l’accélérateur, pourquoi le placement automatique peut varier et comment...

Mappage mémoire des fichiers de modèle : comment les pages partagées réduisent l’utilisation de RAM en double
Comprenez comment les pages mémoire mappées sont chargées en mémoire et partagées, pourquoi le RSS peut être trompeur et quels caches et tampons consomment...

