As citações RAG apontam para versões substituídas quando a recuperação e os metadados das citações não coincidem quanto ao estado do documento que é atualmente considerado oficial.
Uma base de conhecimento privada pode atualizar uma política, um manual, um modelo de fatura ou um procedimento doméstico, enquanto a resposta continua a estabelecer uma ligação para a redação anterior. A citação visível é criada depois de várias etapas distintas: ingestão da fonte, criação de segmentos, geração de embeddings, indexação, recuperação, reclassificação, geração e apresentação da fonte. Um erro de versão pode começar em qualquer uma dessas camadas, mesmo quando a ligação final abre corretamente e o nome do ficheiro citado parece familiar.
A citação pode ser resolvida corretamente, mas identificar a versão errada
Uma ligação de citação pode abrir o documento esperado enquanto direciona silenciosamente para uma revisão arquivada, um instantâneo antigo ou um segmento copiado de um estado anterior do ficheiro.
As orientações da Oracle sobre deriva do índice descrevem como os segmentos substituídos podem permanecer pesquisáveis quando os processos de eliminação, substituição e reconciliação não permanecem sincronizados.
O sinal distintivo é que o nome da fonte está correto, enquanto a frase citada, a página ou o marcador de revisão é antigo. Uma fonte completamente não relacionada aponta, em vez disso, para problemas de relevância da recuperação ou de apresentação da citação.
IDs de segmentos instáveis quebram a ligação entre a evidência e o estado da fonte
Uma citação armazena normalmente um ID de documento, um ID de segmento, uma página, um deslocamento ou um URL de origem. A nova análise e a nova segmentação podem mover a mesma frase para outro registo ou atribuir o registo antigo a texto diferente.
O RAGVersion documenta o versionamento ao nível dos segmentos para corpora em mudança, refletindo que uma fonte mutável precisa de mais do que um único identificador intemporal.
Se as citações derivarem algumas linhas após cada reconstrução, a fonte pode estar atual, mas o ponteiro posicional está obsoleto. Se a redação citada for obsoleta, continua a participar um registo de conteúdo antigo.
Os segmentos antigos e novos podem permanecer ativos em simultâneo
Um pipeline de atualização pode inserir os segmentos de substituição antes de eliminar a família de documentos anterior, ou pode nunca expressar as eliminações.
Quando ambas as versões partilham o tema, a terminologia e a estrutura, o segmento antigo pode obter uma classificação tão elevada como o novo. O gerador recebe então duas afirmações aparentemente relevantes sem saber qual é a oficial.
Este padrão produz respostas mistas e citações alternadas em consultas repetidas. É diferente de um mapeamento de fonte estável, mas incorreto, que normalmente devolve sempre a mesma versão errada.
A similaridade semântica não codifica a validade temporal
Os embeddings colocam textos semanticamente relacionados próximos uns dos outros, mas não assinalam inerentemente uma afirmação como atual e outra como substituída.
O VersionRAG trata os documentos em evolução como um problema de recuperação distinto e modela sequências de versões e alterações nos documentos, em vez de depender apenas da similaridade.
Uma frase revista pode ser quase idêntica à frase antiga, exceto por um número, uma data, um nome ou um procedimento. Essa pequena diferença factual pode ser mais importante do que a grande sobreposição semântica entre ambas.
A proveniência da citação pode perder-se após a recuperação
O recuperador pode devolver corretamente os metadados da fonte, mas um reclassificador, compressor de contexto, deduplicador ou construtor de prompts posterior pode desligar o texto do seu registo original.
As orientações de segurança RAG da OWASP recomendam devolver a atribuição da fonte e os metadados de proveniência juntamente com a evidência recuperada.
Um rastreio suspeito contém texto da resposta proveniente de um segmento, associado ao URL ou número de página de outro. Trata-se de uma falha de junção da proveniência, não de uma decisão de classificação sobre a atualidade do documento.
A recuperação em cache ou as respostas geradas podem preservar uma citação antiga
Uma atualização da fonte pode atualizar o índice vetorial, enquanto uma cache de consultas, uma cache do reclassificador, uma cache de prompts ou uma cache de respostas geradas continua a devolver um conjunto de evidências anterior.
O resultado obsoleto pode desaparecer apenas após a expiração da cache, o reinício do serviço ou uma variação da consulta, embora a inspeção direta do índice já mostre os segmentos atuais.
Esta causa é identificável quando exatamente a mesma consulta devolve a citação antiga, enquanto uma paráfrase recupera a versão nova. Ambos os pedidos podem chegar ao mesmo modelo, mas utilizar chaves de cache diferentes.
Os metadados de versão não têm efeito se os filtros de recuperação não os utilizarem
Armazenar campos como version, is_current, valid_from ou superseded_by não altera automaticamente a pesquisa pelo vizinho mais próximo.
O Qdrant suporta filtros de payload durante a pesquisa vetorial, permitindo restringir o conjunto de candidatos por metadados indexados antes da classificação.
Se a aplicação recuperar todo o espaço de nomes e apenas apresentar os metadados de versão posteriormente, um segmento obsoleto pode ainda entrar no prompt e receber a citação final.
Filtrar a versão atual requer uma regra de fonte canónica
Um filtro precisa de uma resposta fiável à questão de qual é o registo atual. A data de modificação, por si só, pode promover um arquivo copiado, um ficheiro antigo recentemente alterado ou um rascunho que não deveria substituir a fonte publicada.
O Pinecone documenta a pesquisa filtrada por metadados, mas a aplicação continua a definir os campos de versão e estado utilizados pela expressão.
O artigo da ZimaSpace sobre a razão pela qual um índice de pesquisa de uma NAS com IA expõe mais do que os ficheiros de origem estabelece o limite: as citações devem ser resolvidas a partir de um registo canónico da versão da fonte, e não do segmento que por acaso obtiver a classificação mais elevada.
FAQ
Uma resposta correta ainda pode conter uma citação substituída?
Sim. O modelo pode indicar o facto atual a partir de um segmento, enquanto o gerador de citações associa metadados de um registo antigo ou adjacente.
A eliminação do ficheiro de origem antigo remove os respetivos vetores?
Não automaticamente. O sistema de ingestão tem de propagar a eliminação ou marcar todos os segmentos derivados como inativos no índice pesquisável.
As citações devem apontar para IDs de segmentos ou URLs de documentos?
Ambas as identidades são úteis. O segmento identifica a evidência exata, enquanto o URL do documento e o registo de versão fornecem uma fonte estável e legível por humanos, bem como o respetivo estado de validade.
Centro de Tecnologia e IA
Mais para Ler

Que funcionalidades permitem criar um limite de confiança de IA doméstico em torno de ficheiros sensíveis?
Uma fronteira de confiança para IA doméstica combina encriptação em repouso, permissões de privilégio mínimo, sandboxing em tempo de execução e recuperação com âmbito...

O que faz com que os resultados de pesquisa privada favoreçam ficheiros editados com frequência?
Os ficheiros editados frequentemente obtêm vantagens no posicionamento quando cada atualização acrescenta sinais de atualidade, fragmentos, versões ou interação, sem normalização por fonte.

O que faz com que os modelos de presença de casas inteligentes confundam visitantes com residentes?
Os visitantes podem parecer residentes quando o sistema observa padrões de atividade doméstica, mas não dispõe de um sinal de identidade estável da pessoa...

