O RAG local responde frequentemente melhor a documentos narrativos porque a divisão comum em blocos preserva o contexto da prosa, mas quebra a estrutura relacional que dá significado às células das folhas de cálculo.
Um parágrafo de uma política contém o seu tema e qualificadores em frases próximas, enquanto “42” num livro de cálculo pode depender de um rótulo de linha, de uma data de coluna, de uma unidade, de uma fórmula e do nome da folha. Quando um servidor doméstico converte ambos em blocos de texto simples, a narrativa sobrevive a essa transformação de forma mais fiel do que a grelha e as suas relações ocultas entre células durante a geração de respostas fundamentadas.
Os blocos narrativos transportam o seu próprio contexto semântico
A prosa repete entidades, verbos e relações causais em frases adjacentes. Um bloco de tamanho fixo normalmente retém linguagem suficiente para que uma incorporação represente o tema e para que um gerador interprete as evidências. A sobreposição pode preservar uma frase que atravesse uma fronteira.
Uma abordagem RAG centrada primeiro nas tabelas observa que o RAG convencional funciona bem para texto narrativo, mas falha quando as informações essenciais estão em tabelas e estruturas. A incompatibilidade começa antes da geração, durante a representação e a recuperação.
A qualidade narrativa pode, ainda assim, ser enganadora: as passagens fluentes incentivam respostas fluentes, mesmo quando foi recuperado o bloco errado. A vantagem comparativa é a preservação estrutural, não uma garantia de que as respostas narrativas estejam factualmente corretas.
O significado das folhas de cálculo vive nas coordenadas e nas operações
O significado de uma célula resulta das relações entre eixos. Aplanar linha a linha pode separar cabeçalhos, rótulos unidos, fórmulas, folhas ocultas ou unidades. As incorporações passam então a comparar cadeias de texto isoladas, em vez da operação pedida pela pergunta, como filtrar um trimestre e somar uma categoria.
A investigação sobre a topologia das tabelas modela explicitamente o texto e a topologia das tabelas, porque os documentos híbridos contêm ligações que os blocos lineares comuns perdem. Preservar a adjacência e a hierarquia altera as evidências que podem ser recuperadas.
Mesmo uma recuperação perfeita pode não ser suficiente para responder a uma pergunta sobre uma folha de cálculo. O gerador tem de selecionar células, respeitar os tipos de dados, executar operações aritméticas e citar coordenadas. Um modelo de linguagem que resume bem um parágrafo pode, ainda assim, trocar colunas ou calcular com base em texto formatado para apresentação.
Onde o RAG narrativo perde a sua vantagem
A vantagem narrativa desaparece quando os documentos contêm referências cruzadas densas, anexos longos ou factos separados das respetivas definições. Por outro lado, as folhas de cálculo com cabeçalhos explícitos, linhas organizadas e uma camada de consulta semântica podem ser mais fáceis de interpretar do que uma prosa ambígua.
Um guia sobre a avaliação de RAG tabular salienta a avaliação com base em perguntas fundamentadas em tabelas, em vez de métricas genéricas de texto. A resposta deve ser verificada comparando-a com as células e operações exatas.
O mecanismo também falha se as pipelines narrativa e de folhas de cálculo utilizarem OCR, modelos de incorporação ou permissões diferentes. Nesse caso, o formato fica confundido com as ferramentas. “Ter melhor aspeto” não equivale a estar melhor fundamentado; ambos os formatos precisam de verificação ao nível da resposta.
Avalie a recuperação e o cálculo como etapas separadas
Crie perguntas emparelhadas a partir de um relatório narrativo e de um livro de cálculo organizado: perguntas de consulta, comparação, agregação e exceção. Registe as passagens ou coordenadas das células necessárias e, em seguida, processe ambas com o mesmo modelo e o mesmo orçamento de recuperação. Avalie separadamente a recuperação, o cálculo, a citação e a resposta final.
Utilize uma base de dados vetorial local para manter os vetores e os ficheiros de origem localmente, enquanto testa a serialização consciente das tabelas em comparação com texto simples organizado por linhas. Mantenha fixa a temperatura do modelo e o prompt.
Se as evidências da folha de cálculo forem recuperadas, mas a aritmética falhar, adicione uma etapa de execução estruturada. Se os cabeçalhos desaparecerem antes da recuperação, corrija a extração e a serialização. Se as respostas narrativas apenas parecerem melhores, mas citarem passagens erradas, ajuste a avaliação em vez de declarar superior a pipeline de prosa.
Centro de Tecnologia e IA
Mais para Ler

Como medir a qualidade da recuperação RAG local e interpretar a cobertura da recuperação, da precisão e das citações
Crie um conjunto de teste RAG local, calcule as principais métricas de recuperação, interprete os seus compromissos e audite se as afirmações das respostas...

Porque é que a computação das funcionalidades de casa inteligente se torna mais importante à medida que aumenta o número de sensores à mesma taxa de amostragem?
Monitorize o processamento por sensor e entre sensores à medida que o número de dispositivos aumenta, identifique os custos não lineares da fusão e...

Porque é que o custo da avaliação de RAG se torna mais importante à medida que a biblioteca de documentos cresce, com o mesmo volume de consultas?
Compreenda por que o crescimento do corpus aumenta o esforço de avaliação do RAG sem mais consultas dos utilizadores e como os testes estratificados...

