Um segundo modelo altera a ordem das evidências ao ler conjuntamente cada par consulta-candidato, aplicando sinais de relevância mais refinados do que os que a comparação vetorial da primeira fase consegue representar.
Um arquivo privado pode recuperar vinte fragmentos plausíveis em milissegundos, mas a passagem mais útil pode ficar abaixo de material genérico que partilha o vocabulário da consulta. Um reranker usa mais capacidade de processamento nesse pequeno conjunto de candidatos e produz uma nova pontuação para cada par. O contexto final pode melhorar, mesmo sem alterações nos documentos, embeddings ou perguntas dos utilizadores.
A Recuperação da Primeira Fase Otimiza a Cobertura Dentro de um Orçamento de Velocidade
A recuperação densa ou híbrida compara representações compactas em todo o corpus. Tem de ser suficientemente rápida para analisar ou percorrer muitos candidatos, pelo que codifica cada documento independentemente da consulta atual. Isto favorece uma recuperação abrangente, mas pode não detetar relações subtis, como negação, função, cronologia ou restrições exatas.
Uma visão geral de pares consulta-documento descreve o reranker como um cross-encoder que pontua uma consulta e um documento em conjunto. Essa atenção conjunta é mais expressiva do que comparar vetores produzidos separadamente, mas é demasiado dispendiosa para ser aplicada a todos os documentos de uma biblioteca de grandes dimensões.
A recuperação em duas fases divide o trabalho: o primeiro modelo cria um conjunto de candidatos; o segundo dedica precisão a esse conjunto. Se a evidência correta nunca entrar no conjunto, o reranking não a consegue recuperar, o que torna a recuperação de candidatos uma dependência essencial.
A Pontuação Conjunta Altera as Evidências que Chegam ao Gerador
O reranker vê a consulta completa junto de cada candidato e pode valorizar a implicação exata, entidades coincidentes ou condições exigidas. Pode rebaixar uma visão geral amplamente semelhante abaixo de um parágrafo específico que responde diretamente à pergunta. Assim, os primeiros resultados transmitidos ao LLM contêm evidências diferentes.
Uma análise detalhada da interação do cross-encoder explica como os cross-encoders resolvem limitações da similaridade dos bi-encoders através de um processamento conjunto. Esta interação adicional é o mecanismo por trás de uma ordenação melhor, não uma segunda pesquisa vetorial. Essa distinção altera a decisão final do agregado familiar.
A ordem é importante porque as janelas de contexto e a atenção são limitadas. Uma primeira passagem melhor pode fundamentar a resposta desde o início, enquanto duplicados com uma classificação inferior podem excluir evidências complementares. Por isso, o reranking deve considerar tanto a relevância como a cobertura, em vez de produzir apenas dez versões do mesmo facto.
Quando o Reranking Piora a Pesquisa Privada
Um reranker herda as preferências do seu treino. Pode favorecer prosa bem elaborada em detrimento de tabelas, línguas dominantes em detrimento de dialetos familiares ou correspondências explícitas de palavras-chave em detrimento de evidências implícitas. Conjuntos pequenos de candidatos amplificam as falhas da primeira fase, enquanto conjuntos grandes aumentam a latência e podem tornar a pesquisa interativa irregular.
Uma discussão recente sobre diversidade das evidências observa que o reranking baseado apenas na relevância pode reduzir essa diversidade, incentivando uma etapa posterior de diversificação. Isto mostra por que motivo uma pontuação de relevância mais elevada não corresponde automaticamente a um conjunto de evidências mais completo. Este limite continua visível durante a revisão posterior das evidências.
A afirmação falha quando o reranker não é adequado ao domínio ou quando a latência excede o orçamento da interação. Deve ser ignorado ou substituído se rebaixar consistentemente respostas verificadas, reduzir a diversidade das fontes ou alterar a ordenação sem melhorar as respostas fundamentadas.
Avalie a Ordenação Com Execuções de Recuperação Emparelhadas
Crie um conjunto de testes com consultas, passagens de evidência aceitáveis e categorias de fontes importantes. Para cada consulta, guarde a classificação da primeira fase e a ordem após o reranking; em seguida, meça a recuperação no conjunto de candidatos, a precisão no limite final, a classificação recíproca, o suporte das citações e a latência.
Utilize uma avaliação repetível em vez de perguntas de demonstração memoráveis, seguindo a abordagem descrita em reranking da primeira fase. Inspecione manualmente as inversões de classificação, sobretudo em folhas de cálculo, texto multilingue, negações, datas e fragmentos quase duplicados. A dependência deve, portanto, ser medida separadamente na prática.
Mantenha o reranker apenas se este promover evidências fundamentadas em todo o conjunto de testes sem latência inaceitável nem perda de diversidade. Uma pontuação inferior da resposta final deve desencadear uma investigação separada da recuperação de candidatos e da qualidade do reranker, porque as duas fases falham de formas diferentes.
Centro de Tecnologia e IA
Mais para Ler

Embeddings multilingues: como um único espaço vetorial liga documentos domésticos em diferentes idiomas
Veja como os embeddings alinhados ligam documentos entre idiomas, por que a qualidade da recuperação varia e como testar localmente a cobertura de evidências...

Conflitos na memória do agente: por que motivo correções recentes podem perder para factos antigos repetidos
Saiba como memórias antigas duplicadas se sobrepõem às correções, onde as regras de recência falham e como testar a substituição num armazenamento privado de...

Amostragem de LLM local: por que as definições de descodificação alteram a repetição e a estabilidade
Saiba como a temperatura, top-p, min-p, as sementes e as penalizações interagem — e como testar definições de descodificação sem confundir aleatoriedade com qualidade.

