Os modelos de embeddings podem agrupar documentos domésticos não relacionados após uma mudança de domínio, porque a geometria de similaridade aprendida já não corresponde ao novo vocabulário e às novas tarefas.
Um índice privado pode começar com notas pessoais e manuais e depois expandir-se para registos médicos, código-fonte, faturas, ficheiros jurídicos, artigos académicos ou arquivos multilingues. O mesmo modelo de embeddings de uso geral continua a mapear cada fragmento para o mesmo espaço vetorial, mas o significado de “semelhante” mudou. Termos especializados, modelos repetidos, novos comprimentos de documentos e diferentes intenções de consulta podem aproximar registos não relacionados. As secções abaixo explicam como a mudança de domínio altera as vizinhanças sem qualquer erro evidente na indexação.
A Similaridade dos Embeddings Reflete a Distribuição de Treino do Modelo
Um modelo de embeddings aprende que textos devem estar próximos a partir do pré-treino e de exemplos contrastivos. Esses exemplos definem uma noção funcional de similaridade antes de o corpus doméstico ser sequer indexado.
A Google Research avalia a recuperação fora do domínio, mostrando que a qualidade das representações muda quando a coleção-alvo difere da distribuição de treino.
Um modelo treinado para associar paráfrases tópicas abrangentes pode não conseguir distinguir as entidades, os procedimentos ou os tipos de registo específicos que são importantes numa nova coleção doméstica.
O Novo Vocabulário Pode Fundir Documentos Distintos Num Único Tema Abrangente
Os documentos especializados partilham frequentemente termos raros no texto geral. O modelo pode reconhecer o tema abrangente, mas não dispor de contraste específico do domínio suficiente para separar conceitos próximos.
A investigação sobre embeddings adaptados ao domínio mostra que a precisão e o comportamento da similaridade em domínios técnicos podem mudar após o ajuste fino com dados-alvo.
Depois de uma mudança de domínio, vários ficheiros não relacionados podem tornar-se vizinhos mais próximos porque contêm todos o mesmo vocabulário técnico, apesar de responderem a perguntas diferentes.
Os nomes de entidades, as unidades, as datas e as funções dos documentos podem exigir recuperação lexical ou filtros de metadados quando a representação densa preserva apenas o tema partilhado.
Modelos Repetidos e Documentos Longos Podem Dominar o Vetor
Faturas, relatórios, formulários e registos exportados repetem frequentemente cabeçalhos, avisos legais, nomes de campos ou texto padrão em registos que, de resto, não estão relacionados.
O estudo Length-Induced Embedding Collapse conclui que os embeddings de textos longos podem tornar-se mais semelhantes e agrupar-se à medida que é acrescentado mais conteúdo.
Se o texto padrão ocupar grande parte de um fragmento, os vetores podem agrupar-se pelo modelo, em vez de pelo evento, pessoa, dispositivo ou decisão específica nele contida.
A remoção de texto repetido, a preservação de campos estruturais e a criação de embeddings de secções significativas mais pequenas podem recuperar vizinhanças mais discriminativas.
A Hubness Faz Com Que Alguns Documentos Pareçam Semelhantes a Muitos Outros
Os espaços vetoriais de alta dimensionalidade podem conter hubs: documentos que se tornam os vizinhos mais próximos de um número invulgarmente elevado de consultas e de outros documentos.
Uma análise do Sentence-BERT concluiu que a hubness dos embeddings cria vizinhanças assimétricas e aumenta os erros de classificação.
Uma visão geral, um glossário ou um modelo repetitivo pode tornar-se um hub depois de o corpus mudar, fazendo com que documentos domésticos não relacionados pareçam agrupar-se à sua volta.
A correção das pontuações de similaridade, o diagnóstico de hubness, o reranking e a adaptação específica ao corpus podem reduzir o efeito, mas a solução adequada depende da geometria medida.
Temas Mistos Num Único Fragmento Criam Emaranhamento Semântico
Um fragmento longo que combine instruções, resolução de problemas, texto da garantia e notas pessoais produz um único vetor que tem de resumir vários significados ao mesmo tempo.
A IBM Research relata que os embeddings específicos do domínio preservam melhor as relações especializadas do que os modelos gerais em tarefas de recuperação-alvo.
Uma mudança de domínio introduz frequentemente novas estruturas documentais, pelo que um divisor de fragmentos baseado na contagem de caracteres pode, de repente, combinar secções que deveriam constituir unidades de evidência separadas.
Os Limiares de Similaridade Antigos Deixam de Separar Correspondências de Ruído
Um limiar calibrado com base em notas domésticas pode não funcionar depois de serem acrescentados milhares de registos técnicos. As distribuições de similaridade positiva e aleatória podem aproximar-se.
A investigação sobre recuperação contínua mede a deriva dos embeddings, em vez de presumir que um antigo limiar de cosseno continua válido depois de a distribuição-alvo mudar.
Por isso, o índice pode produzir mais vizinhos falsos, apesar de o modelo de embeddings, a base de dados e o código de pesquisa permanecerem inalterados.
Os limiares devem ser recalibrados separadamente para o novo corpus, os tipos de consulta, os tamanhos dos fragmentos e quaisquer filtros de metadados utilizados antes da pesquisa vetorial.
Reconstrua o Conjunto de Avaliação em Torno do Novo Domínio
Crie consultas representativas com positivos identificados, negativos difíceis, modelos quase duplicados, termos especializados e documentos que partilhem um tema, mas não devam ser agrupados.
Um estudo sobre recuperação com ajuste fino mostra por que razão o novo domínio precisa do seu próprio conjunto de consultas e da sua própria avaliação de relevância.
O guia da ZimaSpace sobre pesquisa semântica de ficheiros mostra por que razão a extração, a divisão em fragmentos, os metadados e a recuperação devem ser avaliados como um único pipeline local.
Compare o corpus antigo e o novo utilizando a recuperação, a posição dos negativos difíceis, a pureza dos agrupamentos, a frequência dos hubs, as distribuições de pontuações e os resultados do reranker. O problema só está resolvido quando as distinções importantes do novo domínio voltam a aparecer na pesquisa.
Centro de Tecnologia e IA
Mais para Ler

Como é que um corretor secreto fornece credenciais a um agente de IA sem as expor nos prompts?
Acompanhe a identidade da carga de trabalho, a política, a emissão de tokens, a injeção de pedidos, a redação, a expiração e a revogação...

Como é que uma sandbox de ferramentas contém os efeitos secundários de um agente de IA?
Veja como o isolamento, as restrições de capacidades, o estado descartável, o controlo de saída, as quotas e os registos de auditoria limitam os...

Como é que a descodificação condicionada produz JSON válido de acordo com o esquema?
Compreenda a compilação de esquemas, o mascaramento de tokens, o estado do analisador, os subconjuntos suportados, a latência, o truncamento e por que motivo...

