La precisión de las citas en RAG depende de recuperar el fragmento de fuente correcto y asociarlo con la afirmación exacta que respalda, no simplemente de enumerar documentos relevantes.
Una base de conocimientos doméstica puede responder a partir de una póliza de seguro, un manual de electrodomésticos o una factura escaneada y aun así citar la página equivocada. El documento correcto puede estar presente, mientras que la oración de respaldo se dividió, quedó por debajo de otro fragmento en la clasificación o se vinculó con la afirmación generada incorrecta. Por tanto, la calidad de las citas refleja conjuntamente la ingesta, la recuperación, la generación, la alineación y el control de versiones.
La calidad de la fuente y de los fragmentos establece el límite máximo de la evidencia
Los errores de OCR, las tablas faltantes, las copias obsoletas y los encabezados perdidos corrompen la evidencia antes de que comience la recuperación. Los límites de los fragmentos deben conservar la afirmación, el calificador y el contexto identificativo necesarios para respaldar una afirmación; un fragmento que contenga solo un número puede coincidir sin demostrar qué mide.
Las investigaciones que comparan estrategias avanzadas de fragmentación concluyen que las decisiones de segmentación de documentos modifican el rendimiento de la recuperación, ya que los fragmentos de tamaño fijo pueden dividir conceptos o mezclar material no relacionado. La precisión de las citas no puede superar la calidad del fragmento disponible para citar.
Los metadatos deben conservar la versión del documento, la página, la sección y las coordenadas para que la cita dirija a una evidencia que pueda inspeccionarse. La deduplicación debe impedir que las copias obsoletas y actuales compitan entre sí sin eliminar la versión histórica utilizada por una respuesta anterior.
La recuperación y la generación deben preservar la alineación a nivel de afirmación
Un recuperador puede devolver una página relevante por tema que no implique la oración final. La reclasificación debe priorizar el respaldo directo, mientras que la generación debe mantener visibles los límites de las afirmaciones y los identificadores de las fuentes para que cada fragmento factual se corresponda con la evidencia realmente presente en el contexto.
Las investigaciones sobre la fidelidad de las citas distinguen entre la corrección y la fidelidad de las citas, y señalan que unas citas aparentemente respaldadas pueden haberse añadido después de que el modelo se basara en otra información. Por eso, la simple coincidencia superficial puede sobrestimar la confianza.
La cobertura y la corrección de las citas son aspectos distintos. Una respuesta puede citar correctamente dos afirmaciones y dejar tres sin respaldo, o citar cada oración con un único documento amplio que no respalde ninguna con precisión. Ambas dimensiones necesitan mediciones independientes. Esta distinción sigue siendo visible durante las pruebas domésticas posteriores.
El procesamiento posterior puede corregir los enlaces, pero no recuperar la evidencia faltante
Un verificador puede comparar cada afirmación generada con pasajes candidatos, trasladar una cita a una fuente mejor o eliminar una afirmación sin respaldo. Esto detecta errores de alineación después de la generación, pero no puede recuperar evidencia que la ingesta o la recuperación nunca proporcionaron.
El sistema de corrección de citas contrasta las citas generadas con los artículos recuperados e informa de una mayor precisión de las citas con un coste adicional limitado. Sus resultados demuestran el valor de una etapa específica de alineación después de redactar la respuesta. El resultado intermedio debe seguir siendo inspeccionable antes de continuar con la automatización.
El límite del fallo aparece cuando hay una afirmación expresada con confianza sin ninguna fuente que la implique dentro del conjunto recuperado. El verificador debe abstenerse, realizar otra recuperación o eliminar la afirmación, en lugar de asignarle la cita más parecida y hacer que la respuesta parezca fundamentada.
Evalúa por separado el respaldo y la cobertura de las citas
Elabora cincuenta preguntas con fragmentos de respuesta verificados que abarquen PDF limpios, escaneos con OCR, tablas, versiones duplicadas y casos sin respuesta. Divide cada respuesta generada en afirmaciones atómicas y juzga si cada cita implica su afirmación y si toda afirmación factual tiene una cita.
Utiliza el marco de precisión, exhaustividad y cobertura de evaluación de RAG, pero añade la implicación de la cita, la corrección de la versión y una página o región resoluble. Compara los resultados por tipo de documento en lugar de informar únicamente de una puntuación agregada. Este límite debe medirse por separado en condiciones operativas realistas.
Aprueba solo cuando las citas dirijan a fragmentos actuales e inspeccionables y las afirmaciones sin respaldo desencadenen una abstención u otro intento de recuperación. Cuando una fuente sea relevante pero no implique la oración, considérala una cita inexacta, no un éxito parcial.
Centro de Tecnología e IA
Más para leer

¿Qué funciones permiten obtener una salida JSON fiable de un LLM local?
Descubre qué funciones imponen la sintaxis JSON, cuáles protegen la corrección semántica y cómo probar un modelo local con distintos esquemas, prompts y casos...

Linaje de datos de IA local: por qué cada respuesta necesita una ruta de origen trazable
Aprende cómo las rutas de origen hacen auditables las respuestas de IA local, por qué las citas por sí solas son incompletas y cómo...

Indexación mediante hash de contenido: cómo las huellas digitales de los archivos evitan trabajo redundante de la IA
Descubre cómo las huellas digitales de archivos y fragmentos impulsan la indexación incremental, por qué los metadatos son insuficientes y en qué casos los...

