La calidad del RAG local se puede medir cuando la evidencia etiquetada, las métricas de recuperación y las comprobaciones de citas a nivel de afirmación se evalúan por separado en un conjunto representativo de consultas.
Una respuesta fluida puede ocultar una fuente omitida, mientras que un buen recuperador puede proporcionar pasajes correctos a un generador que los cite deficientemente. Empieza con consultas cuyos fragmentos relevantes se conozcan y, después, puntúa la lista de los primeros k resultados antes de generar respuestas. La cobertura de citas pertenece a la capa de respuesta y no debe utilizarse como sustituto de la exhaustividad de recuperación.
Crea la verdad de referencia antes de calcular cualquier métrica
Para cada consulta de prueba, identifica todos los fragmentos de evidencia aceptables o, al menos, un conjunto de evaluación justificable. Incluye búsquedas directas, preguntas de síntesis, casos de actualidad, abreviaturas, idiomas y límites de permisos. Separa las preguntas utilizadas para el ajuste de un conjunto reservado para la evaluación.
Una evaluación de RAG práctica recomienda evaluar por separado los componentes de recuperación y generación, porque las puntuaciones de extremo a extremo no permiten localizar los fallos.
La verdad de referencia puede estar incompleta en una biblioteca grande. Combina resultados de varios recuperadores, evalúa la unión y marca los casos inciertos en lugar de considerar irrelevante cada fragmento no evaluado. Las etiquetas débiles crean métricas de apariencia precisa, pero engañosas.
La exhaustividad y la precisión responden a preguntas distintas sobre la recuperación
Recall@k es el número de fragmentos relevantes recuperados entre los k primeros, dividido por el número total de fragmentos relevantes conocidos. Precision@k es el número de fragmentos relevantes entre los k primeros, dividido por k. Un valor de k más alto suele mejorar la exhaustividad, aunque admite más ruido, por lo que ambas métricas deben interpretarse juntas.
Las definiciones clásicas de precisión y exhaustividad establecen este equilibrio en la recuperación de información. No tienen en cuenta la posición en el orden, así que añade MRR o nDCG cuando la evidencia inicial sea importante.
Una consulta con un solo pasaje relevante tiene un Recall@5 de 1,0 si ese pasaje aparece en cualquier posición entre cinco resultados, pero su Precision@5 es de solo 0,2. Esto puede ser aceptable para un reranker, pero resultar ruidoso para un generador con un contexto pequeño. Los objetivos de las métricas dependen del presupuesto de evidencia posterior.
La cobertura de citas evalúa afirmaciones, no enlaces
Divide la respuesta generada en afirmaciones comprobables. La cobertura de citas es el número de afirmaciones respaldadas dividido por el número de afirmaciones que requieren evidencia; la corrección de las citas pregunta si cada pasaje citado respalda realmente la afirmación a la que está asociado. Una respuesta puede contener muchos enlaces y, aun así, tener una cobertura deficiente.
Trabajos recientes sobre la recuperación consciente de las citas evalúan la cobertura de consultas y la verificabilidad de afirmaciones atómicas, porque una sola puntuación de relevancia agregada no puede revelar fragmentos de respuesta sin respaldo.
La cobertura de citas deja de ser significativa cuando las afirmaciones no se segmentan de forma coherente o cuando el conocimiento general y las afirmaciones que requieren fuentes se mezclan sin una política definida. Tampoco puede demostrar que la respuesta sea completa. Más citas no significan automáticamente una mejor fundamentación.
Usa una regla de decisión que preserve la separación diagnóstica
Ejecuta primero la recuperación y guarda los ID de los fragmentos ordenados, las puntuaciones y las versiones. Calcula Recall@k, Precision@k, MRR o nDCG; después, genera a partir de los resultados congelados y puntúa la fidelidad, la relevancia de la respuesta, la cobertura de citas y la corrección de las citas.
Una evaluación controlada de las métricas de evaluación de RAG informa conjuntamente sobre la precisión contextual, la exhaustividad contextual, la fidelidad y la relevancia de la respuesta, lo que demuestra por qué ninguna puntuación individual es suficiente.
Aprueba una versión solo cuando la exhaustividad de recuperación alcance su umbral mínimo, la precisión se mantenga dentro del presupuesto de contexto y cada afirmación material de la respuesta esté respaldada o se califique explícitamente. Si falla la exhaustividad, corrige la indexación o la recuperación; si fallan las citas pese a que la evidencia sea correcta, corrige la generación y la atribución.
Aplica un único criterio de lanzamiento a la recuperación y las citas
Crea al menos 50 consultas representativas para un sistema doméstico pequeño y amplía la cifra a 100–200 a medida que aumenten los tipos de documentos y los idiomas. Evalúa la evidencia de los cinco y diez primeros resultados, congela el conjunto de resultados y, después, audita las afirmaciones generadas. Informa de los promedios macro y de los estratos de consultas con peor rendimiento.
Mantén la prueba junto al contenido de evaluación del formato de RAG para que las fuentes con muchas tablas y las narrativas estén representadas en lugar de promediarse conjuntamente. Versiona cada ID de fragmento y cada evaluación de relevancia.
Usa umbrales mínimos iniciales, como un Recall@5 de 0,85 y una corrección de citas de 0,95, solo como criterios locales de partida, no como estándares universales. Endurécelos según el riesgo. Nunca sacrifiques la corrección de los permisos ni las afirmaciones de alto impacto sin respaldo a cambio de una puntuación agregada más alta.
Centro de Tecnología e IA
Más para leer

¿Por qué es cada vez más importante la computación de funciones del hogar inteligente a medida que aumenta la cantidad de sensores con la misma frecuencia de muestreo?
Rastrea el procesamiento por sensor y entre sensores a medida que aumenta el número de dispositivos, identifica los costos no lineales de la fusión...

¿Por qué importa más el costo de evaluar RAG a medida que crece la biblioteca de documentos con el mismo volumen de consultas?
Comprende por qué el crecimiento del corpus aumenta el esfuerzo de evaluación de RAG sin más consultas de los usuarios y cómo las pruebas...

¿Por qué la sobrecarga de las herramientas de los agentes importa más a medida que aumentan los pasos del flujo de trabajo con el mismo tamaño de modelo?
Rastrea cómo se acumulan las esperas seriales, el crecimiento del contexto, los reintentos y la fiabilidad a lo largo de los pasos del agente,...

