يحتاج كل جواب للذكاء الاصطناعي المحلي إلى مسار مصدر قابل للتتبع، حتى يمكن التحقق من ادعاءاته مقابل الملفات والإصدارات والتحويلات الدقيقة المستخدمة.
لا تكفي إحالة تقول «دليل المنزل» عندما توجد ثلاث نسخ، خضعت إحداها لمعالجة OCR، وواحدة فقط تعكس أحدث مراجعة. يسجل نسب البيانات المسار من الملف الأصلي مرورًا بالتحليل والتقسيم والتضمين والاسترجاع وتجميع المطالبة ومقطع الإجابة. ويجعل هذا المسار أخطاء الحداثة والوصول والتحويل قابلة للتشخيص، من دون إرسال المستندات الخاصة إلى جهة أخرى أو إضعاف التحكم المحلي.
يربط نسب البيانات الإجابة بسلسلة التحويل الخاصة بها
يبدأ السجل المفيد بهوية المصدر وإصداره، ثم يلتقط مخرجات المحلل وOCR، وحدود المقاطع، ونموذج التضمين، وإنشاء الفهرس، ونتيجة الاسترجاع، وموضع المطالبة. وتشير ادعاءات الإجابة إلى معرّفات المقاطع التي تعود إلى المقاطع الأصلية أو مناطق الصفحات.
يصف تحليل مفصل لـنسب مصادر RAG تتبع مصادر RAG ومدخلات الوكلاء، بحيث يمكن ربط الإجابة بأصل المصدر وحداثته وتفويضه. ويوضح سبب ضرورة أن تشمل قابلية مراقبة النموذج مصنوعات البيانات، لا زمن الاستجابة والرموز فقط.
تفصل هذه السلسلة بين الإخفاقات التي تبدو متطابقة على السطح. فقد تنتج الإجابة الخاطئة عن وحدات بايت قديمة للمصدر، أو إغفال في المحلل، أو مقطع سيئ، أو فشل في الاسترجاع، أو توليد غير مدعوم؛ ويحدد نسب البيانات المرحلة التي حدث فيها الانحراف أولًا.
تحافظ المعرّفات المستقرة على المسارات عبر إعادة الفهرسة
تتغير المسارات وأسماء الملفات، لذلك يحتاج نسب البيانات إلى معرّفات مستقرة للمستند والإصدار، إضافة إلى عمليات ربط بالمواقع الحالية. ويجب أن يسجل كل تحويل معرّفات مدخلاته ومخرجاته، وإعداده، وطابعه الزمني، وحالته، بما يشكل رسمًا بيانيًا موجّهًا للمصنوعات المشتقة.
يغلّف تصميم عملي لـتتبع معرّفات المصادر المقاطع المسترجعة بمعرّفات المصادر، ويربط حالات الفشل المبلغ عنها بالتتبع الدقيق للاستعلام والسياق والاستجابة. ويتيح هذا النهج الخفيف إعادة البناء لاحقًا حتى في حزمة صغيرة مستضافة ذاتيًا.
تميز حواف الإصدارات بين الاستبدال والتكرار. ويمكن لإجابة سابقة الاحتفاظ بالإصدار الذي استخدمته، بينما يرشح الاستعلام الحالي الإصدار النشط. ويجب أن يؤدي حذف ملف إلى إخراج المصنوعات القابلة للبحث من الخدمة، من دون محو سجل التدقيق المطلوب لتفسير الإجابات التاريخية.
قد تخفي الإحالة الظاهرة مسارًا معطوبًا
قد يكون المستند المعروض صحيحًا، بينما جاء المقطع المقتبس من إصدار آخر، أو قد يضيف النموذج إحالة معقولة بعد التوليد اعتمادًا على معرفة سابقة غير مدعومة. يسجل نسب البيانات التوافر والمسار، لكنه لا يثبت وحده أن النص المحال إليه يدعم الادعاء.
يؤكد إطار قابلية تتبع الأدلة أهمية ثقة التوليد وقابلية تتبع الأدلة عند تحليل سلوك RAG. ويوضح منظوره المنظم سبب ضرورة بقاء الأدلة المسترجعة والادعاءات المولدة مترابطة على مستوى أدق من قائمة مصادر واحدة تغطي الإجابة بأكملها.
حد الفشل هو أي حافة تحويل مفقودة أو إصدار مصدر لم يُحسم. ضع علامة «غير قابل للتحقق» على الادعاء، واحتفظ بالتتبع غير المكتمل للتشخيص، وتجنب تقديم شارة إحالة مصقولة بوصفها دليلًا على الدعم. ويظل هذا التمييز ظاهرًا أثناء الاختبار المنزلي اللاحق.
تتبّع ادعاءً واحدًا إلى الخلف عبر كل مرحلة
اختر خمس إجابات تحتوي على نص OCR، ومستندات محدثة، وملفات مكررة، ومصدر محذوف. وبدءًا من ادعاء واحد، احلّ إحالته إلى المقطع، والكتلة المحللة، وإصدار المستند، والمسار الأصلي، وحدث الإدخال، وقرار الوصول، من دون الرجوع إلى معرفة غير موثقة لدى المشغّل.
قارن النتيجة بإعادة البناء المعتمدة على سجل الأحداث في مسارات تدقيق الوكلاء. يجب أن يشرح نسب البيانات اشتقاق البيانات، بينما يشرح سجل التدقيق القرارات والإجراءات؛ اربط معرّفاتهما من دون معاملتهما كسجل واحد. ويجب أن تظل النتيجة الوسيطة قابلة للفحص قبل أن يتبعها التشغيل الآلي.
لا تُجتز الاختبار إلا إذا وصل كل ادعاء حالي إلى مقطع مصدر يمكن الوصول إليه، ووصل كل ادعاء تاريخي إلى إصداره المحتفظ به أو إلى سجل حذف صريح. وتصبح أي حافة مكسورة فشلًا في خط المعالجة، لا مجرد مشكلة تجميلية في الإحالة.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

ما العوامل التي تحدد دقة الاستشهادات في نظام RAG لقاعدة معرفية منزلية؟
تعرّف على سبب إمكانية أن يكون المصدر ذو الصلة استشهادًا خاطئًا، وتعرّف على مراحل خط أنابيب البيانات التي تتحكم في الإسناد والتغطية، وكيفية تدقيق...

ما الميزات التي تتيح إخراج JSON موثوقًا من نموذج لغوي كبير محلي؟
تعرّف على الميزات التي تفرض بنية JSON، وتلك التي تحمي الصحة الدلالية، وكيفية اختبار نموذج محلي عبر المخططات والمطالبات وحالات الفشل.

فهرسة تجزئات المحتوى: كيف تمنع بصمات الملفات تكرار عمل الذكاء الاصطناعي
تعرّف على كيفية توجيه بصمات الملفات وأجزاء الملفات للفهرسة التزايدية، ولماذا لا تكفي البيانات الوصفية، والمواضع التي لا تستطيع فيها التجزئات إثبات التكافؤ الدلالي.

