يمكن قياس جودة RAG المحلي عند تقييم الأدلة المعلّمة، ومقاييس الاسترجاع، وفحوصات الاستشهادات على مستوى الادعاء بشكل منفصل، وذلك على مجموعة استعلامات تمثيلية.
قد تخفي الإجابة الطليقة مصدرًا فائتًا، بينما قد يسلّم نظام استرجاع قوي مقاطع صحيحة إلى مولّد يستشهد بها بطريقة سيئة. ابدأ باستعلامات تكون مقاطعها ذات الصلة معروفة، ثم قيّم قائمة النتائج الأعلى k قبل إنشاء الإجابات. تنتمي تغطية الاستشهادات إلى طبقة الإجابة، ولا يجوز استخدامها بديلًا عن استدعاء الاسترجاع.
أنشئ الحقيقة المرجعية قبل حساب أي مقياس
لكل استعلام اختباري، حدّد جميع مقاطع الأدلة المقبولة أو على الأقل مجموعة محكّمة يمكن الدفاع عنها. أدرج عمليات البحث المباشر، وأسئلة التركيب، وحالات الحداثة، والاختصارات، واللغات، وحدود الصلاحيات. افصل الأسئلة المستخدمة للضبط عن مجموعة اختبار محجوزة.
يوصي تقييم RAG بتقييم مكوّنَي المسترجِع والمولّد بشكل منفصل، لأن الدرجات الشاملة من البداية إلى النهاية لا تحدد موضع الإخفاق.
قد تكون الحقيقة المرجعية غير مكتملة في مكتبة كبيرة. اجمع النتائج من عدة مسترجِعات، وحكّم في اتحادها، وعلّم الحالات غير المؤكدة بدلًا من اعتبار كل مقطع غير محكّم غير ذي صلة. تؤدي التسميات الضعيفة إلى مقاييس تبدو دقيقة لكنها مضللة.
يجيب الاستدعاء والدقة عن سؤالين مختلفين حول الاسترجاع
استدعاء@k هو عدد المقاطع ذات الصلة المسترجعة ضمن أعلى k مقاطع مقسومًا على إجمالي المقاطع ذات الصلة المعروفة. أما الدقة@k فهي عدد المقاطع ذات الصلة ضمن أعلى k مقاطع مقسومًا على k. تؤدي زيادة k عادةً إلى تحسين الاستدعاء مع إدخال مزيد من الضوضاء، لذا ينبغي قراءة المقياسين معًا.
توضح التعريفات الكلاسيكية لـالدقة والاستدعاء هذه المفاضلة في استرجاع المعلومات. لكنها لا تراعي موضع الترتيب، لذا أضف MRR أو nDCG عندما تكون الأدلة المبكرة مهمة.
إذا احتوى استعلام ما على مقطع واحد ذي صلة، فسيكون الاستدعاء@5 مساويًا لـ 1.0 إذا ظهر ذلك المقطع في أي موضع ضمن خمس نتائج، لكن الدقة@5 ستكون 0.2 فقط. قد يكون ذلك مقبولًا لنظام إعادة ترتيب، لكنه قد يكون مليئًا بالضوضاء لمولّد ذي سياق صغير. تعتمد أهداف المقاييس على ميزانية الأدلة في النظام اللاحق.
تختبر تغطية الاستشهادات الادعاءات، لا الروابط
قسّم الإجابة المُنشأة إلى ادعاءات يمكن التحقق منها. تغطية الاستشهادات هي نسبة الادعاءات المدعومة إلى الادعاءات التي تتطلب دليلًا؛ أما صحة الاستشهاد فتسأل عما إذا كان كل مقطع مستشهد به يدعم فعلًا الادعاء المرتبط به. قد تحتوي الإجابة على روابط كثيرة مع ذلك تكون تغطيتها ضعيفة.
تقيّم أعمال حديثة حول الاسترجاع الواعي بالاستشهادات تغطية الاستعلام وقابلية التحقق من الادعاءات الذرية، لأن درجة ملاءمة إجمالية واحدة لا تكشف أجزاء الإجابة غير المدعومة.
تفقد تغطية الاستشهادات معناها عندما لا تُقسَّم الادعاءات باستمرار، أو عندما تُخلط المعرفة العامة بالادعاءات التي تتطلب مصدرًا من دون سياسة واضحة. كما أنها لا تستطيع إثبات اكتمال الإجابة. لا تعني زيادة الاستشهادات تلقائيًا تحسن الإسناد إلى الأدلة.
استخدم قاعدة قرار تحافظ على الفصل التشخيصي
شغّل الاسترجاع أولًا واحفظ معرّفات المقاطع المرتبة ودرجاتها وإصداراتها. احسب الاستدعاء@k والدقة@k وMRR أو nDCG، ثم أنشئ الإجابة من النتائج المجمدة وقيّم الوفاء، وملاءمة الإجابة، وتغطية الاستشهادات، وصحة الاستشهادات.
يعرض تقييم RAG المنضبط الدقة السياقية والاستدعاء السياقي والوفاء وملاءمة الإجابة معًا، موضحًا سبب عدم كفاية أي درجة واحدة.
لا تجتاز الإصدار إلا عندما يحقق استدعاء الاسترجاع حده الأدنى، وتظل الدقة ضمن ميزانية السياق، ويكون كل ادعاء جوهري في الإجابة مدعومًا أو موضحًا صراحةً بأنه مشروط. إذا فشل الاستدعاء، فأصلح الفهرسة أو الاسترجاع؛ وإذا فشلت الاستشهادات مع وجود الأدلة الصحيحة، فأصلح التوليد والإسناد.
طبّق بوابة إصدار واحدة على الاسترجاع والاستشهادات
أنشئ 50 استعلامًا تمثيليًا على الأقل لنظام منزلي صغير، ووسّعها إلى 100–200 مع زيادة أنواع المستندات واللغات. حكّم في الأدلة ضمن أعلى 5 وأعلى 10 نتائج، ثم جمّد مجموعة النتائج ودقّق الادعاءات المُنشأة. أبلغ عن المتوسطات الكلية إضافةً إلى شرائح الاستعلامات الأسوأ أداءً.
احتفظ بالاختبار بجوار محتوى تقييم تنسيق RAG حتى تكون المصادر التي تكثر فيها الجداول والمصادر السردية ممثلة بدلًا من دمجها في متوسط واحد. أصدِر كل معرّف مقطع وحكم ملاءمة.
استخدم حدودًا دنيا أولية مثل استدعاء@5 البالغ 0.85 وصحة الاستشهاد البالغة 0.95 بوصفها بوابات بداية محلية فقط، لا معايير عالمية. شدّدها وفقًا للمخاطر. لا تضحِّ أبدًا بصحة الصلاحيات أو بالادعاءات عالية التأثير غير المدعومة من أجل رفع درجة إجمالية.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

لماذا تصبح حوسبة ميزات المنزل الذكي أكثر أهمية مع زيادة عدد المستشعرات عند معدل أخذ العينات نفسه؟
تتبّع الحوسبة لكل مستشعر وعبر المستشعرات مع زيادة عدد الأجهزة، وحدّد تكاليف الدمج غير الخطية، وقِس أداء مسار الميزات قبل أن تبدأ الأتمتة بالتباطؤ.

لماذا تصبح تكلفة تقييم RAG أكثر أهمية كلما اتسعت مكتبة المستندات مع ثبات حجم الاستعلامات؟
افهم لماذا يؤدي نمو مجموعة البيانات إلى زيادة جهد تقييم نظام RAG من دون زيادة في استفسارات المستخدمين، وكيف تحافظ الاختبارات الطبقية على ارتباط...

لماذا تصبح تكلفة أداة الوكيل أكثر أهمية مع زيادة خطوات سير العمل عند استخدام النموذج نفسه؟
تتبّع كيف تتراكم فترات الانتظار التسلسلية، ونمو السياق، وإعادات المحاولة، والموثوقية عبر خطوات الوكيل، ثم قِس تكلفة التنفيذ بشكل منفصل عن استدلال النموذج.

