ما هي مجموعة بيانات تقييم RAG، ومتى تكون مهمة للبحث الخاص؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

مجموعة بيانات تقييم RAG هي مجموعة قابلة لإعادة الاستخدام من الاستعلامات والأدلة المتوقعة أو سلوك الإجابة، وتُستخدم لقياس تغييرات البحث الخاص باستمرار.

من دون مجموعة تقييم ثابتة، قد تبدو قاعدة المعرفة المنزلية أفضل بعد تغيير حجم المقاطع أو نموذج التضمين أو أداة إعادة الترتيب أو قاعدة البيانات الوصفية، لمجرد طرح أسئلة مختلفة. وتعمل مجموعة البيانات المفيدة على تثبيت استعلامات منزلية تمثيلية، وتحديد الأدلة التي ينبغي استرجاعها، وتسجيل سلوك الإجابة المقبول، وضم حالات ينبغي فيها للنظام الاعتراف بأن المتن لا يحتوي على الإجابة.

تثبّت مجموعة التقييم الأسئلة والأدلة المتوقعة

الوحدة الأساسية هي حالة اختبار يمكن تشغيلها مجددًا بعد تغيير خط أنابيب RAG. وقد تتضمن سؤالًا، وإجابة مرجعية، ومقاطع مصدر ذات صلة، وهوية المستند، وقيود البيانات الوصفية، وملاحظات حول شكل الرفض الصحيح.

يمكن للاختبار المستقر في RAG أن يقرن الأسئلة بالإجابات المتوقعة قبل قياس التطبيق بشكل متكرر.

في البحث الخاص، غالبًا ما تكون تسميات الأدلة أكثر قيمة من نص الإجابة وحده، لأنها تكشف ما إذا كان الملف والإصدار الصحيحان قد دخلا في السياق، حتى عندما صادف أن النموذج اللغوي أنتج جملة نهائية تبدو معقولة.

ينبغي أن تحافظ حالة الاختبار على هوية المصدر بالمستوى نفسه من الدقة الذي يسترجع به النظام البيانات. فإذا لم تحدد تسميات التقييم سوى ملف PDF كامل، بينما يعيد الفهرس مقاطع، فقد يختبئ الفشل داخل تطابق يبدو صحيحًا على مستوى المستند.

يحتاج البحث الخاص إلى أنماط فشل من مجموعة المستندات المنزلية الفعلية

نادراً ما تتضمن المعايير العامة أسماء الملفات المكررة، وعمليات مسح OCR، والكتيبات المنقحة، والمفردات الخاصة بالعائلة، والأرقام التسلسلية الدقيقة، وقواعد المجلدات الخاصة، والإصدارات القديمة التي تشكل قاعدة المعرفة المنزلية.

قد تتطلب المجموعات المختلفة تقييم RAG خاصًا بالمجال بدل افتراض أن معيارًا عامًا واحدًا للأسئلة والأجوبة يمثل كل بيئة استرجاع.

أنشئ الحالات من سجلات البحث الفعلية والملفات المعروفة بصعوبتها، ثم أضف تنويعات اصطناعية فقط عندما تختبر حدًا محددًا بوضوح. وينبغي ألا تمثل المعرّفات الدقيقة، وإعادة الصياغة، والتركيب من مستندات متعددة، والتعارض بين الإصدارات القديمة والحالية، والاستعلامات التي لا توجد إجاباتها، نوعًا عامًا واحدًا من الأسئلة.

يحتاج الاسترجاع والتوليد إلى تسميات منفصلة

قد تخفي الإجابة النهائية الصحيحة ضعف الاسترجاع إذا كان النموذج يعرف الحقيقة من بيانات تدريبه السابقة، بينما قد تحدث إجابة سيئة حتى عند استرجاع المقطع المثالي. لذلك ينبغي أن تدعم مجموعة البيانات مقاييس على مستوى المراحل بدلًا من درجة واحدة شاملة لا تميز بين النجاح والفشل.

تتيح عينات التقييم المنظمة للمقاييس تقييم جودة الاسترجاع والاستجابة انطلاقًا من مدخلات اختبار متسقة.

لكل استعلام، حدّد الأدلة التي يجب أن تكون موجودة، والإصدارات المحظورة، وخصائص الإجابة المهمة. ثم قارن بشكل منفصل بين الاستدعاء، وجودة الترتيب، ودقة السياق، والوفاء للمصدر، وصحة الإجابة، وهوية الاستشهاد، وسلوك الرفض.

يجعل هذا الفصل التراجعات قابلة للتنفيذ. فقد يُعزى انخفاض درجة الإجابة إلى تقسيم المقاطع أو الاسترجاع عندما تختفي الأدلة من أفضل النتائج، أو إلى التوليد عندما تبقى الأدلة سليمة لكن الإجابة تسيء استخدامها.

-15% OFF

تحافظ الحالات السلبية والحدّية على عدم تلاعب النظام بمجموعة البيانات

تكافئ مجموعة البيانات التي لا تحتوي إلا على أسئلة سهلة وقابلة للإجابة الأنظمة التي تستجيب دائمًا بثقة. ويحتاج البحث الخاص أيضًا إلى استعلامات تكون إجاباتها غائبة أو ملتبسة أو مقيدة الصلاحيات أو مستبدلة بإصدارات أحدث أو معتمدة على أكثر من مصدر.

تُعد حالات الأسئلة الخارجة عن قاعدة المعرفة ضرورية لقياس السلوك المتحفظ، لا مجرد الاستدعاء عند وجود إجابات معروفة.

وتتسم اختبارات الصلاحيات بالأهمية نفسها بالنسبة إلى الفهرس المنزلي. فالنتيجة المطابقة دلاليًا تمامًا، لكنها غير مصرح بها، ينبغي أن تُسجّل كفشل للنظام، لا كاسترجاع ممتاز.

ضمّن أمثلة على التكرارات شبه المتطابقة وتعارضات الإصدارات حتى لا يتمكن النظام من تحسين المقاييس المتوسطة ببساطة عبر إرجاع عدد أكبر من المرشحين. وينبغي أن تحدد الأدلة المتوقعة المصدر المعتمد، لا الموضوع فقط.

يحوّل إصدار مجموعات البيانات الاختبار لمرة واحدة إلى ضبط للتراجعات

يتغير كل من المتن والأسئلة بمرور الوقت. فقد تجعل الأجهزة الجديدة، والمجلدات التي أُعيدت تسميتها، والسياسات المحدثة، والمفردات المختلفة للمستخدم، مجموعة تقييم قديمة غير ممثلة للواقع، ولذلك تحتاج بيانات الاختبار نفسها إلى دورة حياة مُدارة.

يتيح إصدار مجموعات البيانات مقارنة نتائج خط الأنابيب بحالة معروفة من أمثلة التقييم.

إن سير عمل قاعدة المعرفة الخاصة هو طبقة التطبيق؛ أما مجموعة بيانات التقييم فهي ما يجعل التغييرات في سير العمل قابلة للقياس بدل أن تبقى انطباعية.

حدّث مجموعة البيانات عندما يتغير المتن أو سلوك المستخدم، لكن احتفظ بالإصدارات التاريخية حتى لا تمحو مجموعة تقييم جديدة الدليل على أن تغييرًا في الاسترجاع أدى إلى تراجع في سير عمل حرج أقدم.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.