Como medir a qualidade da recuperação RAG local e interpretar a cobertura da recuperação, da precisão e das citações

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

A qualidade do RAG local é mensurável quando as evidências identificadas, as métricas de recuperação e as verificações de citações ao nível das afirmações são avaliadas separadamente num conjunto representativo de consultas.

Uma resposta fluente pode ocultar uma fonte não encontrada, enquanto um recuperador eficaz pode fornecer os excertos corretos a um gerador que os cita de forma deficiente. Comece por consultas cujos fragmentos relevantes sejam conhecidos e, em seguida, avalie a lista dos k melhores resultados antes de gerar respostas. A cobertura das citações pertence à camada da resposta e não deve ser utilizada como substituto da recuperação.

Crie a verdade de referência antes de calcular qualquer métrica

Para cada consulta de teste, identifique todos os fragmentos de evidência aceitáveis ou, pelo menos, um conjunto avaliado defensável. Inclua pesquisas diretas, perguntas de síntese, casos de atualidade, abreviaturas, idiomas e limites de permissões. Separe as perguntas utilizadas para afinação de um conjunto reservado para teste.

Uma avaliação de RAG prática recomenda avaliar separadamente os componentes de recuperação e de geração, porque as pontuações de ponta a ponta não permitem localizar a falha.

A verdade de referência pode estar incompleta numa biblioteca de grandes dimensões. Reúna resultados de vários recuperadores, avalie a união e marque os casos incertos, em vez de considerar irrelevante cada fragmento não avaliado. Rótulos fracos criam métricas com um aspeto preciso, mas enganadoras.

A recuperação e a precisão respondem a perguntas diferentes sobre a recuperação

Recall@k é o número de fragmentos relevantes recuperados nos k melhores resultados dividido pelo número total de fragmentos relevantes conhecidos. Precision@k é o número de fragmentos relevantes nos k melhores resultados dividido por k. Um k mais elevado normalmente melhora a recuperação, mas introduz mais ruído; por isso, as duas métricas devem ser analisadas em conjunto.

As definições clássicas de precisão e recuperação estabelecem este compromisso na recuperação de informação. Não têm em conta a posição na ordenação; por isso, adicione MRR ou nDCG quando as evidências iniciais forem importantes.

Uma consulta com uma única passagem relevante tem Recall@5 de 1,0 se essa passagem aparecer em qualquer posição entre cinco resultados, mas Precision@5 é apenas 0,2. Isso pode ser aceitável para um reordenador, mas ruidoso para um gerador com um contexto pequeno. Os objetivos das métricas dependem do orçamento de evidências a jusante.

A cobertura das citações testa afirmações, não ligações

Divida a resposta gerada em afirmações verificáveis. A cobertura das citações é o número de afirmações apoiadas dividido pelo número de afirmações que requerem evidências; a correção das citações pergunta se cada passagem citada apoia realmente a afirmação associada. Uma resposta pode conter muitas ligações e, ainda assim, ter uma cobertura fraca.

Trabalhos recentes sobre recuperação consciente das citações avaliam a cobertura da consulta e a verificabilidade de afirmações atómicas, porque uma única pontuação agregada de relevância não consegue revelar fragmentos de resposta sem suporte.

A cobertura das citações deixa de ser significativa quando as afirmações não são segmentadas de forma consistente ou quando o conhecimento geral e as afirmações que exigem fontes são misturados sem uma política definida. Também não pode provar que a resposta está completa. Mais citações não significam automaticamente uma melhor fundamentação.

Utilize uma regra de decisão que preserve a separação do diagnóstico

Execute primeiro a recuperação e guarde os IDs dos fragmentos ordenados, as pontuações e as versões. Calcule Recall@k, Precision@k, MRR ou nDCG; em seguida, gere a partir dos resultados congelados e avalie a fidelidade, a relevância da resposta, a cobertura das citações e a correção das citações.

Uma avaliação controlada de RAG apresenta em conjunto a precisão contextual, a recuperação contextual, a fidelidade e a relevância da resposta, ilustrando por que razão nenhuma pontuação isolada é suficiente.

Aprove uma versão apenas quando a recuperação atingir o seu limite mínimo, a precisão se mantiver dentro do orçamento de contexto e todas as afirmações materiais da resposta tiverem suporte ou forem explicitamente qualificadas. Se a recuperação falhar, corrija a indexação ou a recuperação; se as citações falharem apesar de existirem evidências corretas, corrija a geração e a atribuição.

Aplique um único critério de lançamento à recuperação e às citações

Crie pelo menos 50 consultas representativas para um sistema doméstico pequeno, aumentando para 100–200 à medida que crescem os tipos de documentos e os idiomas. Avalie as evidências nos 5 e nos 10 melhores resultados, congele o conjunto de resultados e, em seguida, audite as afirmações geradas. Apresente médias macro e também os estratos de consultas com pior desempenho.

Mantenha o teste junto do conteúdo de avaliação do formato de RAG, para que as fontes com muitas tabelas e as fontes narrativas sejam representadas, em vez de serem calculadas em conjunto. Crie uma versão para cada ID de fragmento e avaliação de relevância.

Utilize limites mínimos iniciais, como Recall@5 de 0,85 e correção das citações de 0,95, apenas como critérios locais de partida, não como normas universais. Torne-os mais exigentes de acordo com o risco. Nunca troque a correção das permissões ou afirmações de elevado impacto sem suporte por uma pontuação agregada mais alta.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.