A recuperação vetorial em vários idiomas falha frequentemente porque um único espaço de embeddings não alinha todas as línguas, escritas, domínios e consultas com alternância de códigos com a mesma precisão.
Um arquivo doméstico pode combinar manuais em inglês, recibos em chinês, notas em espanhol, códigos de produto e nomes de ficheiros escritos em vários sistemas de escrita. Uma consulta pode expressar o significado correto e, ainda assim, ficar longe do fragmento relevante quando o modelo tem cobertura insuficiente para uma língua ou quando a segmentação remove o contexto partilhado. A aproximação do índice pode amplificar essa diferença de representação, mas não a consegue corrigir.
A Cobertura dos Embeddings É Irregular entre Línguas e Domínios
Os modelos multilingues aprendem uma geometria partilhada a partir de dados de treino desiguais. As línguas com muitos recursos e os domínios comuns da Web recebem geralmente sinais de alinhamento mais ricos do que as línguas minoritárias, as abreviaturas domésticas, os nomes ou os termos técnicos. Por isso, duas traduções podem ocupar vizinhanças diferentes, mesmo quando um ser humano as considera equivalentes.
Um amplo estudo de avaliação de RAG multilingue relata que a qualidade da recuperação e da geração varia entre línguas e que o contexto em vários idiomas cria dificuldades adicionais. O resultado é um alerta contra tratar a média de um único benchmark multilingue como prova de uma recuperação igual em todo um arquivo doméstico.
A escolha do modelo define o limite superior da representação. Um modelo monolingue pode agrupar bem uma língua e falhar entre línguas, enquanto um modelo multilingue pode trocar alguma precisão dentro da mesma língua por alinhamento entre línguas. Meça a recuperação tanto na mesma língua como entre línguas, em vez de presumir que uma substitui a outra.
A Tokenização e a Divisão em Fragmentos Podem Separar Evidências Equivalentes
Os sistemas de escrita diferem nos limites das palavras, na morfologia, na densidade de caracteres e na pontuação. Um fragmento fixo de 500 tokens abrange uma quantidade diferente de significado em inglês, chinês, compostos alemães ou código misto. O OCR e a normalização Unicode podem ainda separar acentos ou caracteres visualmente semelhantes.
A investigação sobre recuperação entre línguas analisa a recuperação entre línguas utilizando dados monolingues e conclui que as escolhas de amostragem e representação alteram materialmente a recuperação. Isto apoia o teste da direção linguística exata, em vez de apenas do nome do modelo. Esta distinção continua visível durante os testes domésticos posteriores.
A segmentação sensível à língua deve preservar títulos, frases, tabelas e traduções paralelas. Armazene texto normalizado para criar embeddings, mantendo o texto original para citações; a tradução ou transliteração agressiva pode ajudar a correspondência, mas pode eliminar nomes, códigos e formulações necessárias para verificar a fonte.
A Pesquisa Aproximada e o Desequilíbrio Linguístico Agravam a Diferença
Os índices de vizinhos mais próximos aproximados trocam recuperação exaustiva por velocidade. Quando os vetores relevantes entre línguas já estão marginalmente separados, uma amplitude de pesquisa reduzida, uma compressão agressiva ou um conjunto pequeno de candidatos pode eliminá-los antes da reordenação. Os quase-duplicados na língua dominante ocupam então os primeiros resultados.
Um benchmark independente de embeddings multilingues compara modelos de embeddings multilingues em seis línguas e relata comportamentos de recuperação materialmente diferentes consoante o modelo e a língua. A sua lição prática é que as tabelas classificativas agregadas ocultam falhas específicas de cada direção. O resultado intermédio deve continuar a ser inspecionável antes de se avançar para a automatização.
A fronteira da falha é um conjunto de testes dominado pelo inglês ou por traduções literais. Pode apresentar uma recuperação média saudável, enquanto as alcunhas, a alternância de códigos, o texto obtido por OCR e os pares de línguas com poucos recursos falham. A reordenação não consegue recuperar evidências que nunca entram no conjunto de candidatos.
Crie uma Matriz de Recuperação por Par de Línguas
Identifique cinquenta perguntas domésticas abrangendo casos na mesma língua, entre línguas, com alternância de códigos, transliterados, de OCR e de códigos de produto. Para cada consulta, identifique todos os fragmentos de evidência aceitáveis e registe a língua da consulta, a língua de origem, o sistema de escrita, o tipo de documento e a classe da entidade. Esse limite deve ser medido separadamente em condições de funcionamento realistas.
Utilize a separação de avaliação descrita em comportamento dos embeddings multilingues para calcular o Recall@k de cada direção, em vez de um único total combinado. Repita o teste com divisão em fragmentos sensível à língua, maior amplitude de pesquisa, candidatos lexicais e um reclassificador multilingue, mantendo o corpus fixo.
Escolha as definições com base no par de línguas importante mais fraco, não na média global. Se a recuperação só melhorar depois de traduzir as consultas, mantenha a formulação original e o percurso de citação, para que a assistência à correspondência não se transforme em evidência impossível de rastrear. A consequência prática surge quando várias fontes competem por um contexto limitado.
Centro de Tecnologia e IA
Mais para Ler

Claude Opus 5.5: Why Anthropic Made Its Flagship Model Cheaper, Not Just Smarter
Claude Opus 5.5 combines stronger agent performance, cheaper cached context, 1M tokens, and lower task costs for long-running AI workflows.

Que componentes permitem a pesquisa híbrida em ficheiros NAS?
Saiba como identificadores exatos e significado semântico conduzem a um único resultado de pesquisa NAS classificado, sem contornar permissões nem ocultar evidências insuficientes.

Que funcionalidades permitem uma seleção fiável de versões de documentos em RAG?
Veja como o RAG seleciona a revisão aplicável em vez da cópia desatualizada mais semelhante e como testar atualizações explícitas, implícitas e sobrepostas.

