Un conjunto de datos de evaluación de RAG es un conjunto repetible de consultas y evidencias esperadas o comportamientos de respuesta que se utiliza para medir de forma coherente los cambios en la búsqueda privada.
Sin un conjunto de evaluación fijo, una base de conocimientos doméstica puede parecer mejor después de cambiar el tamaño de los fragmentos, el modelo de embeddings, el reranker o una regla de metadatos, simplemente porque se probaron preguntas diferentes. Un conjunto de datos útil fija consultas representativas del hogar, etiqueta la evidencia que debería recuperarse, registra el comportamiento de respuesta aceptable e incluye casos en los que el sistema debería admitir que el corpus no contiene la respuesta.
Un conjunto de evaluación fija las preguntas y la evidencia esperada
La unidad básica es un caso de prueba que puede volver a ejecutarse después de cambiar la canalización de RAG. Puede contener una pregunta, una respuesta de referencia, pasajes de origen relevantes, la identidad del documento, restricciones de metadatos y notas sobre cómo debería ser una negativa correcta.
Una prueba estable puede asociar preguntas y respuestas esperadas antes de medir repetidamente la aplicación.
En la búsqueda privada, las etiquetas de evidencia suelen ser más valiosas que el texto de la respuesta por sí solo, porque muestran si el archivo y la versión correctos llegaron al contexto, incluso cuando el modelo de lenguaje produjo una frase final plausible.
Un caso de prueba debe conservar la identidad del origen con el mismo nivel de granularidad con el que recupera el sistema. Si las etiquetas de evaluación solo identifican un PDF completo mientras el índice devuelve fragmentos, un fallo puede ocultarse dentro de una coincidencia aparentemente correcta a nivel de documento.
La búsqueda privada necesita modos de fallo del corpus doméstico real
Los benchmarks públicos rara vez contienen los nombres de archivo duplicados, los escaneos con OCR, los manuales revisados, el vocabulario específico de la familia, los números de serie exactos, las reglas de carpetas privadas y las versiones obsoletas que dan forma a una base de conocimientos doméstica.
Distintos corpus pueden requerir una evaluación de RAG específica del dominio, en lugar de asumir que un único benchmark general de preguntas y respuestas representa todos los entornos de recuperación.
Construye casos a partir de registros de búsqueda reales y archivos conocidos por ser difíciles, y añade variaciones sintéticas solo cuando evalúen un límite claramente definido. Los identificadores exactos, las paráfrasis, la síntesis de varios documentos, los conflictos entre versiones antiguas y actuales, y las consultas cuya respuesta no está presente no deberían representarse mediante un único tipo de pregunta genérico.
La recuperación y la generación necesitan etiquetas independientes
Una respuesta final correcta puede ocultar una recuperación deficiente si el modelo ya conocía el dato por su entrenamiento previo, mientras que una respuesta incorrecta puede producirse incluso cuando se recuperó el pasaje perfecto. Por ello, el conjunto de datos debería admitir métricas por etapa en lugar de una única puntuación de todo o nada.
Las muestras de evaluación estructuradas permiten que las métricas evalúen la calidad de la recuperación y de la respuesta a partir de entradas de prueba coherentes.
Para cada consulta, etiqueta qué evidencias deben estar presentes, qué versiones están prohibidas y qué propiedades de la respuesta son importantes. Después, compara por separado la recuperación, la calidad de la clasificación, la precisión del contexto, la fidelidad, la corrección de la respuesta, la identidad de la cita y el comportamiento de negativa.
Esta separación hace que las regresiones sean accionables. Una puntuación de respuesta más baja puede atribuirse al fragmentado o a la recuperación cuando la evidencia desapareció de los primeros resultados, o a la generación cuando la evidencia permaneció intacta pero la respuesta la utilizó incorrectamente.
Los casos negativos y límite evitan que el sistema manipule el conjunto de datos
Un conjunto de datos que solo contiene preguntas fáciles y con respuesta recompensa a los sistemas que siempre responden con confianza. La búsqueda privada también necesita consultas cuya respuesta esté ausente, sea ambigua, esté restringida por permisos, haya quedado reemplazada o dependa de más de una fuente.
Los casos fuera de la base de conocimientos son necesarios para medir un comportamiento prudente, no solo la recuperación de respuestas conocidas.
Las pruebas de permisos son igual de importantes para un índice doméstico. Un resultado semánticamente perfecto pero no autorizado debe considerarse un fallo del sistema, no una recuperación excelente.
Incluye ejemplos de casi duplicados y conflictos entre versiones para que el sistema no pueda mejorar las métricas medias simplemente devolviendo más candidatos. La evidencia esperada debe identificar la fuente autorizada, no solo el tema.
El versionado del conjunto de datos convierte las pruebas puntuales en control de regresiones
El corpus y las preguntas cambian con el tiempo. Los dispositivos nuevos, las carpetas renombradas, las políticas actualizadas y los cambios en el vocabulario de los usuarios pueden hacer que un conjunto de evaluación antiguo deje de ser representativo, por lo que los propios datos de prueba necesitan un ciclo de vida controlado.
El versionado del conjunto de datos permite comparar los resultados de la canalización con un estado conocido de los ejemplos de evaluación.
El flujo de trabajo de la base de conocimientos privada es la capa de aplicación; el conjunto de datos de evaluación es lo que hace que los cambios en ese flujo de trabajo sean medibles en lugar de anecdóticos.
Actualiza el conjunto de datos cuando cambien el corpus o el comportamiento de los usuarios, pero conserva las versiones históricas para que un conjunto de evaluación nuevo no borre las pruebas de que un cambio en la recuperación hizo retroceder un flujo de trabajo crítico anterior.
Centro de Tecnología e IA
Más para leer

¿Qué es el estado de Plex y qué partes deben persistir?
El estado persistente de Plex es la información que conserva la experiencia del servidor entre reinicios y reconstrucciones; los datos multimedia y los datos...

¿Cómo gestiona Plex la autenticación entre sesiones locales y remotas?
La autenticación de Plex comienza con la identidad del servidor y de la cuenta; después, las rutas de red locales o remotas determinan la...

¿Por qué puede ralentizarse la búsqueda en Plex a medida que crecen los datos de la biblioteca?
El crecimiento de la biblioteca por sí solo no es el diagnóstico. Comprueba la estructura de las consultas, los índices, el estado de la...

