레이블이 지정된 증거, 검색 지표, 주장 단위 인용 검사를 대표 쿼리 세트에서 별도로 평가하면 로컬 RAG 품질을 측정할 수 있습니다.
유창한 답변은 누락된 출처를 감출 수 있으며, 성능이 뛰어난 검색기가 올바른 구절을 생성기에 전달하더라도 생성기가 이를 부실하게 인용할 수 있습니다. 관련 청크가 알려진 쿼리부터 시작한 다음, 답변을 생성하기 전에 상위 k개 목록을 평가하세요. 인용 포함률은 답변 계층에 속하며 검색 재현율의 대체 지표로 사용해서는 안 됩니다.
지표를 계산하기 전에 정답 데이터 만들기
각 테스트 쿼리에 대해 허용 가능한 모든 증거 청크 또는 최소한 타당하게 판정된 풀을 식별하세요. 직접 조회, 종합 질문, 최신성 사례, 약어, 언어, 권한 경계를 포함하세요. 튜닝에 사용한 질문은 별도의 홀드아웃 세트로 분리하세요.
RAG 평가에 대한 실용적인 개요에서는 엔드투엔드 점수만으로는 실패 지점을 특정할 수 없으므로 검색기와 생성기 구성 요소를 별도로 평가할 것을 권장합니다.
대규모 라이브러리에서는 정답 데이터가 불완전할 수 있습니다. 여러 검색기의 결과를 모아 합집합을 판정하고, 판정되지 않은 모든 청크를 관련 없음으로 처리하는 대신 불확실한 사례로 표시하세요. 부실한 레이블은 정밀해 보이지만 오해를 부르는 지표를 만듭니다.
재현율과 정밀도는 서로 다른 검색 질문에 답합니다
Recall@k는 상위 k개 결과에서 검색된 관련 청크 수를 알려진 전체 관련 청크 수로 나눈 값입니다. Precision@k는 상위 k개 결과에 포함된 관련 청크 수를 k로 나눈 값입니다. 일반적으로 k가 높아지면 재현율이 향상되지만 노이즈도 늘어나므로 두 지표를 함께 해석해야 합니다.
정밀도와 재현율의 고전적 정의는 정보 검색에서 이러한 상충 관계를 설명합니다. 하지만 순위 위치는 반영하지 않으므로 초기 증거가 중요하다면 MRR 또는 nDCG를 추가하세요.
관련 구절이 하나인 쿼리의 경우, 해당 구절이 5개 결과 중 어디에든 나타나면 Recall@5는 1.0이지만 Precision@5는 0.2에 불과합니다. 이는 재순위 지정기에는 허용될 수 있지만, 컨텍스트가 작은 생성기에는 노이즈가 많을 수 있습니다. 지표의 목표치는 다운스트림 증거 예산에 따라 달라집니다.
인용 포함률은 링크가 아니라 주장을 검사합니다
생성된 답변을 검증 가능한 주장으로 나누세요. 인용 포함률은 지원되는 주장을 증거가 필요한 전체 주장으로 나눈 값입니다. 인용 정확성은 인용된 각 구절이 연결된 주장을 실제로 뒷받침하는지를 묻습니다. 링크가 많아도 포함률이 낮은 답변일 수 있습니다.
인용 인식 검색에 관한 최근 연구는 하나의 종합 관련성 점수만으로는 답변의 뒷받침되지 않은 일부를 드러낼 수 없기 때문에 쿼리 포함률과 원자적 주장 검증 가능성을 평가합니다.
주장을 일관되게 분할하지 않거나 일반 지식과 출처가 필요한 주장을 정책 없이 섞으면 인용 포함률은 의미를 잃습니다. 또한 답변이 완전하다는 것을 증명할 수도 없습니다. 인용이 많다고 해서 자동으로 더 잘 근거를 갖춘 답변이 되는 것은 아닙니다.
진단 분리를 유지하는 의사결정 규칙 사용
먼저 검색을 실행하고 순위가 매겨진 청크 ID, 점수, 버전을 저장하세요. Recall@k, Precision@k, MRR 또는 nDCG를 계산한 다음, 고정된 결과로 답변을 생성하고 충실성, 답변 관련성, 인용 포함률, 인용 정확성을 평가하세요.
통제된 RAG 평가 지표는 컨텍스트 정밀도, 컨텍스트 재현율, 충실성, 답변 관련성을 함께 보고하며, 단일 점수만으로는 충분하지 않은 이유를 보여줍니다.
검색 재현율이 기준을 충족하고, 정밀도가 컨텍스트 예산 범위에 머물며, 중요한 답변 주장이 모두 뒷받침되거나 명시적으로 한정된 경우에만 릴리스를 통과시키세요. 재현율이 낮으면 인덱싱 또는 검색을 개선하고, 올바른 증거가 있는데도 인용이 실패하면 생성과 출처 연결을 개선하세요.
검색과 인용에 하나의 릴리스 게이트 적용
소규모 가정용 시스템에는 대표 쿼리를 최소 50개 구성하고, 문서 유형과 언어가 늘어나면 100~200개로 확대하세요. 상위 5개와 상위 10개의 증거를 판정하고, 결과 세트를 고정한 다음 생성된 주장을 감사하세요. 전체 평균과 함께 성능이 가장 낮은 쿼리 계층도 보고하세요.
표 중심 소스와 서술형 소스가 한데 평균 처리되지 않도록 RAG 형식 평가 콘텐츠 옆에 테스트를 유지하세요. 모든 청크 ID와 관련성 판정을 버전 관리하세요.
Recall@5 0.85와 인용 정확성 0.95 같은 초기 기준은 보편적인 표준이 아니라 로컬 시작 게이트로만 사용하세요. 위험도에 따라 기준을 강화하세요. 더 높은 종합 점수를 얻기 위해 권한의 정확성이나 영향이 큰 근거 없는 주장을 절대 희생하지 마세요.
기술 및 AI 허브
더 읽어보기

동일한 샘플링 속도에서 센서 수가 증가할수록 스마트 홈 기능의 연산이 더 중요해지는 이유
장치 수가 늘어날 때 센서별 및 센서 간 연산을 추적하고, 비선형 융합 비용을 파악하며, 자동화가 지연되기 전에 특성 파이프라인을 벤치마킹하세요.

동일한 쿼리량에서 문서 라이브러리가 커질수록 RAG 평가 비용이 더 중요한 이유ાહી
사용자 쿼리가 늘지 않아도 코퍼스 규모가 커지면 RAG 평가 작업이 증가하는 이유와, 층화 테스트를 통해 비용을 위험도에 맞게 유지하는 방법을 이해하세요.

동일한 모델 크기에서 워크플로 단계가 늘어날수록 에이전트 도구 오버헤드가 더 중요한 이유
에이전트 단계 전반에서 직렬 대기, 컨텍스트 증가, 재시도, 안정성이 어떻게 누적되는지 추적한 다음, 모델 추론과 실행 오버헤드를 별도로 측정하세요.

