A calibração da pontuação de pesquisa transforma a similaridade bruta num sinal de confiança utilizável, relacionando as pontuações com a relevância observada numa tarefa de pesquisa privada definida.
Uma pontuação de cosseno de 0,82 pode ser excelente para um modelo de embeddings e vulgar para outro. O seu significado também muda consoante a divisão em segmentos, o idioma dos documentos, a dificuldade da consulta e a densidade do corpus. A calibração utiliza exemplos rotulados para estimar a frequência com que os resultados num determinado intervalo de pontuação são efetivamente relevantes, permitindo que os limiares e as regras de abstenção reflitam evidências em vez de intuição.
A Similaridade Ordena os Candidatos, mas Não Exprime Probabilidade
A similaridade de cosseno, o produto escalar e a distância são sinais geométricos de ordenação. Comparam um vetor de consulta com vetores de documentos segundo um determinado modelo e uma determinada normalização. Mesmo quando o valor se situa entre zero e um, isso não significa uma percentagem equivalente de probabilidade de relevância.
A visão geral dos índices da Pinecone explica que a pesquisa semântica devolve os registos mais próximos de um vetor de consulta. Esse mecanismo estabelece a vizinhança relativa, mas a escala da pontuação bruta continua a depender da métrica, do codificador, do corpus e da consulta. Esta distinção continua a ser importante em condições domésticas realistas.
Por conseguinte, um limiar copiado de outra implementação pode rejeitar boas correspondências domésticas ou aceitar distrações plausíveis. O primeiro passo consiste em definir a relevância para a tarefa pretendida, por exemplo, determinar se um segmento apoia diretamente uma resposta, em vez de apenas partilhar o mesmo tema.
As Consultas Rotuladas Associam Intervalos de Pontuação a Resultados Empíricos
Crie um conjunto separado de consultas realistas e avalie os segmentos candidatos como apoiantes, relacionados ou irrelevantes. Um calibrador, como a regressão logística, a regressão isotónica ou o mapeamento de fiabilidade por intervalos, pode depois relacionar as pontuações brutas e as funcionalidades auxiliares com as frequências de relevância observadas.
A investigação sobre calibração da recuperação defende que a incerteza da recuperação deve acompanhar a pontuação pontual e demonstra a ordenação e a previsão de limites conscientes da calibração. Isto apoia a utilização de dados de validação para aprender um sinal de decisão, em vez de interpretar diretamente a pontuação de ordenação.
A calibração é condicional. Podem ser necessários mapeamentos separados para idiomas, tipos de documentos ou classes de consultas quando as respetivas distribuições de pontuação diferem. O resultado pode determinar a abstenção, solicitar uma recuperação mais abrangente ou acionar uma nova ordenação, enquanto a qualidade da ordenação deve continuar a ser medida de forma independente.
As Alterações no Corpus e no Modelo Provocam Deriva na Calibração
Adicionar muitos documentos quase duplicados, alterar o tamanho dos segmentos, atualizar um modelo de embeddings ou ativar a pesquisa híbrida modifica as distribuições de candidatos e pontuações. Um limiar anteriormente fiável pode tornar-se excessivamente confiante, mesmo quando a recuperação dos primeiros k resultados parece estável. O estado intermédio deve continuar visível durante diagnósticos e revisões posteriores.
A documentação do Scikit-learn sobre calibração da fiabilidade distingue a fiabilidade das probabilidades do desempenho preditivo bruto e apresenta diagramas de fiabilidade e métodos de calibração. A mesma lógica de avaliação aplica-se depois de uma pontuação de recuperação ser modelada como probabilidade de relevância.
O limite de falha corresponde a qualquer utilização da confiança calibrada fora dos dados e da definição de decisão usados para a ajustar. A calibração não pode corrigir evidências em falta, rótulos enviesados ou uma correspondência de entidade incorreta; apenas estima a correção observada em condições comparáveis.
Crie um Diagrama de Fiabilidade da Recuperação
Recolha pelo menos cinquenta consultas domésticas representativas com segmentos candidatos avaliados, mantendo uma divisão de teste separada. Agrupe a confiança prevista, compare cada grupo com a respetiva taxa de relevância observada e registe o erro de calibração juntamente com a recuperação, a precisão, a qualidade da ordenação e a cobertura.
Utilize o enquadramento de avaliação em avaliação da recuperação RAG para manter a qualidade da recuperação separada da cobertura das citações nas respostas. Teste perguntas diretas, abreviaturas, consultas multilingues, texto obtido por OCR e casos sem resposta, porque as respetivas distribuições de pontuação podem diferir. Essa dependência deve ser medida separadamente antes de ativar a automatização.
Defina um limiar de abstenção ou de nova ordenação apenas depois de medir o custo das aceitações e rejeições incorretas. Ajuste novamente ou revalide sempre que o codificador, a divisão em segmentos, a fusão ou a composição do corpus sofrer alterações; caso contrário, apresente o valor como similaridade, não como confiança.
Centro de Tecnologia e IA
Mais para Ler

Que fatores determinam a precisão das citações RAG numa base de conhecimento doméstica?
Saiba por que motivo uma fonte relevante pode ainda assim ser uma citação incorreta, que fases do pipeline controlam o suporte e a cobertura,...

Que funcionalidades permitem obter uma saída JSON fiável de um LLM local?
Veja quais funcionalidades impõem a sintaxe JSON, quais protegem a correção semântica e como testar um modelo local com diferentes esquemas, prompts e casos...

Linhagem de dados de IA local: porque cada resposta precisa de um percurso de origem rastreável
Saiba como os caminhos de origem tornam as respostas locais de IA auditáveis, por que motivo as citações, por si só, são incompletas e...

