¿Por qué las respuestas de RAG local parecen mejores con documentos narrativos que con hojas de cálculo?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

El RAG local suele responder mejor a los documentos narrativos porque la fragmentación ordinaria conserva el contexto de la prosa, pero rompe la estructura relacional que da significado a las celdas de las hojas de cálculo.

Un párrafo de una política contiene su tema y sus calificadores en las oraciones cercanas, mientras que “42” en un libro de trabajo puede depender de una etiqueta de fila, una fecha de columna, una unidad, una fórmula y el nombre de la hoja. Cuando un servidor doméstico convierte ambos elementos en fragmentos de texto sin formato, la narrativa sobrevive a esa transformación con mayor fidelidad que la cuadrícula y sus relaciones ocultas entre celdas durante la generación de respuestas fundamentadas.

Los fragmentos narrativos contienen su propio contexto semántico

La prosa repite entidades, verbos y relaciones causales entre oraciones adyacentes. Un fragmento de tamaño fijo suele conservar suficiente lenguaje para que una incrustación represente el tema y para que un generador interprete la evidencia. La superposición puede conservar una oración que atraviesa un límite.

Un enfoque RAG basado primero en tablas señala que el RAG convencional funciona bien con texto narrativo, pero falla cuando la información clave reside en tablas y estructuras. El desajuste comienza antes de la generación, durante la representación y la recuperación.

La calidad narrativa también puede resultar engañosa: los pasajes fluidos fomentan respuestas fluidas incluso cuando se recuperó el fragmento equivocado. La ventaja comparativa es la preservación estructural, no una garantía de que las respuestas en prosa sean fácticamente correctas.

El significado de una hoja de cálculo reside en las coordenadas y las operaciones

El significado de una celda proviene de las relaciones entre los ejes. Aplanar fila por fila puede separar los encabezados, las etiquetas combinadas, las fórmulas, las hojas ocultas o las unidades. Así, las incrustaciones comparan cadenas aisladas en lugar de la operación que solicita una pregunta, como filtrar un trimestre y sumar una categoría.

La investigación sobre la topología de las tablas modela explícitamente el texto y la topología de las tablas porque los documentos híbridos contienen conexiones que los fragmentos lineales ordinarios pierden. Preservar la adyacencia y la jerarquía cambia qué evidencias pueden recuperarse.

Incluso una recuperación perfecta puede no bastar para completar una pregunta sobre una hoja de cálculo. El generador debe seleccionar celdas, respetar los tipos de datos, ejecutar operaciones aritméticas y citar las coordenadas. Un modelo de lenguaje que resume bien un párrafo aún puede intercambiar columnas o calcular sobre texto con formato de presentación.

Cuándo el RAG narrativo pierde su ventaja

La ventaja narrativa desaparece cuando los documentos contienen referencias cruzadas densas, apéndices extensos o datos separados de sus definiciones. Por el contrario, las hojas de cálculo con encabezados explícitos, filas ordenadas y una capa de consulta semántica pueden ser más fáciles de responder que una prosa ambigua.

Una guía sobre la evaluación del RAG tabular destaca la evaluación con preguntas fundamentadas en tablas, en lugar de métricas genéricas de texto. La respuesta debe comprobarse con respecto a las celdas y operaciones exactas.

El mecanismo también falla si las canalizaciones de narrativa y hojas de cálculo utilizan distintos sistemas OCR, modelos de incrustación o permisos. En ese caso, el formato queda confundido con las herramientas. “Mejor aspecto” no equivale a una mejor fundamentación; ambos formatos necesitan verificación al nivel de la respuesta.

Evalúa la recuperación y el cálculo como etapas separadas

Crea preguntas emparejadas a partir de un informe narrativo y un libro de trabajo ordenado: preguntas de búsqueda, comparación, agregación y excepciones. Registra los pasajes o las coordenadas de celda necesarios y, después, procesa ambos con el mismo modelo y el mismo presupuesto de recuperación. Evalúa por separado la recuperación, el cálculo, la citación y la respuesta final.

Usa una base de datos vectorial local para conservar localmente los vectores y los archivos de origen mientras pruebas una serialización consciente de las tablas frente a texto sin formato organizado por filas. Mantén fijas la temperatura del modelo y la instrucción.

Si se recupera la evidencia de la hoja de cálculo, pero falla la aritmética, añade una etapa de ejecución estructurada. Si los encabezados desaparecen antes de la recuperación, corrige la extracción y la serialización. Si las respuestas narrativas solo parecen mejores, pero citan pasajes equivocados, ajusta la evaluación en lugar de declarar superior la canalización de prosa.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.