لماذا تُبطئ مهام إنشاء التضمينات الدردشة التفاعلية للذكاء الاصطناعي على الخادم المنزلي؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

تُبطئ مهام التضمين الدردشة التفاعلية للذكاء الاصطناعي المنزلي، لأن الدُفعات الخلفية الطويلة تتنافس مع الدردشة على وقت المُسرّع، وتجهيز وحدة المعالجة المركزية، والذاكرة، والوصول إلى التخزين.

قد تقسم قاعدة المعرفة الشخصية آلاف المستندات إلى مقاطع، وتحوّلها إلى رموز، وتشغّل نموذج تضمين، وتطبّع المتجهات، وتكتب الفهارس لدقائق أو ساعات. تصل طلبات الدردشة بشكل غير متوقع وتحتاج إلى زمن منخفض للوصول إلى الرمز الأول، بينما تفضّل أنابيب التضمين الدُفعات الكبيرة التي تزيد معدل النقل إلى أقصى حد. إذا اشتركت أعباء العمل في وحدة معالجة رسومات واحدة، أو وحدة معالجة مركزية، أو مجموعة ذاكرة وصول عشوائي، أو جهاز NVMe، فقد تشغل المهمة الخلفية قوائم الانتظار قبل أن يصل طلب المستخدم إلى النموذج. تتتبّع الأقسام أدناه كل نقطة تنافس وتوضح كيفية حماية الاستجابة التفاعلية.

أنابيب التضمين هي أعباء عمل طويلة تعمل على دفعات

تتضمن عملية إدخال المستندات أكثر من استدعاء واحد للنموذج. فهي تعدّد الملفات، وتستخرج النصوص، وتقسم المحتوى إلى مقاطع، وتحول الدُفعات إلى رموز، وتحسب المتجهات، وتحفظ البيانات الوصفية وهياكل الفهرسة.

تحسّن الدُفعات الكبيرة معدل نقل الدُفعات، لكنها قد تطيل الفترة التي تسبق حصول طلب حساس لزمن الاستجابة على وقت من المُسرّع.

لذلك يختلف استيراد مكتبة للمرة الأولى أو إعادة فهرسة كاملة كثيرًا عن تضمين ملاحظة جديدة واحدة بعد حفظها.

تتنافس عملية تهيئة الدردشة وحساب التضمين على المُسرّع نفسه

تبدأ الدردشة التفاعلية بتهيئة الطلب، وهي عملية كثيفة حسابيًا. كما تعالج نماذج التضمين تسلسلات الرموز الكاملة عبر طبقات المحوّل، وغالبًا ضمن دُفعات متوازية كبيرة.

توضح الأبحاث حول تداخل التهيئة سبب إمكانية إبطاء الحساب الكثيف شبيه معالجة الطلبات لاستجابات فك الترميز المتزامنة وخدمة الرمز الأول.

إذا لم يقم وقت التشغيل بإيقاف الدُفعات مؤقتًا أو إعطاء الدردشة أولوية، فقد ينتظر سؤال قصير خلف دفعة التضمين الحالية، حتى لو كان نموذج الدردشة نفسه محمّلًا بالفعل.

تقلل دُفعات التضمين الأصغر أطول فترة حجب، لكنها قد تخفض إجمالي معدل نقل الإدخال.

تزيد النماذج المنفصلة ضغط الذاكرة

قد يحتفظ نموذج الدردشة، ونموذج التضمين، ونموذج إعادة الترتيب، ووقت تشغيل المتجهات بالأوزان ومجمّعات الذاكرة مخصّصة لها في الذاكرة. ويقلل حجمها الإجمالي المساحة المتاحة لذاكرة KV المؤقتة للدردشة وللمستخدمين المتزامنين.

تشرح مقالة ZimaSpace حول تنافس خدمات الذكاء الاصطناعي على ذاكرة المُسرّع سبب عدم دلالة انخفاض استخدام الحسابات على بقاء ذاكرة كافية لطلب تفاعلي.

عندما تضيق الذاكرة، قد يقلل النظام عدد جلسات الدردشة المتزامنة، أو يخرج نموذجًا من الذاكرة، أو ينقل بعض الطبقات، أو يفعّل إعادة تحميل باردة بعد انتهاء مرحلة التضمين.

يمكن استخدام مُشفّر مشترك واحد للاسترجاع والدردشة في بعض البنى، لكن النماذج المنفصلة المخصصة لمهام محددة غالبًا ما تقدم نتائج أفضل وتفرض تكاليف ذاكرة منفصلة.

قد يؤخر عمل وحدة المعالجة المركزية والتخزين عملية الاسترجاع قبل الاستدلال

قد تؤدي عملية تحويل النص إلى رموز، وتحليل ملفات PDF، والتعرّف الضوئي على الحروف، وحساب التجزئة، وكتابة قاعدة بيانات المتجهات إلى استنفاد خيوط وحدة المعالجة المركزية وإنتاج عمليات إدخال وإخراج عشوائية على وحدة التخزين نفسها المستخدمة لملفات النماذج وسجل الدردشة.

تسبب الفهرسة في الخلفية تنافسًا على الفهرسة حتى عندما لا يبدو أي مخطط لوحدة المعالجة المركزية الموجهة للمستخدم مستنفدًا بالكامل.

وقد ينتظر استرجاع الدردشة عندئذ أقفال قاعدة البيانات، أو حالات فقدان الذاكرة المؤقتة، أو طابور NVMe مشغولًا قبل تجميع الطلب.

تحمي قواعد الأولوية والقبول الدردشة

جدول عملية الإدخال على دفعات محدودة، وتوقف مؤقتًا بين الدُفعات، وقيّد التزامن، ولا تسمح بعمل خلفي جديد إلا عندما تكون قوائم الانتظار التفاعلية فارغة أو أقل من حد معين.

يستخدم Llumnix أولويات ديناميكية للتعامل مع الطلبات ذات متطلبات زمن الاستجابة والموارد المختلفة.

يمكن للخادم المنزلي تطبيق سياسة أبسط: تحصل الدردشة والصوت على قبول فوري، بينما تعمل التضمينات بأولوية أقل أو خلال نوافذ الصيانة.

قِس التداخل بدلًا من التخمين

سجّل زمن وصول الدردشة إلى الرمز الأول، والفاصل بين الرموز، وزمن الاسترجاع، وعدد مقاطع التضمين في الثانية، وذاكرة وحدة معالجة الرسومات، وتشبع وحدة المعالجة المركزية، وزمن التخزين، مع إيقاف مهمة التضمين وتشغيلها.

إذا كانت الدردشة تنتظر فقط عند حدود الدُفعات، فقلل حجم الدُفعة أو فعّل الإيقاف المؤقت. وإذا ظهرت عمليات إعادة تحميل للنموذج، فقلل عدد النماذج الموجودة في الذاكرة أو افصل بين العاملين. وإذا تعطل الاسترجاع، فانقل كتابات الفهرس أو ملفات النماذج إلى مسار إدخال وإخراج مختلف.

الهدف المفيد ليس إعادة الفهرسة بأقصى سرعة ممكنة، بل تحقيق أعلى معدل إدخال خلفي يحافظ على زمن الاستجابة التفاعلية المعتاد في المنزل.

بعد إنشاء المكتبة، انتقل من عمليات الفحص الكامل المتكررة إلى اكتشاف التغييرات التدريجي، بحيث يظل عبء العمل الخلفي متناسبًا مع المحتوى الجديد.

الأسئلة الشائعة

هل سيؤدي نموذج التضمين المنفصل دائمًا إلى إبطاء الدردشة؟

لا. فقد يظل خاملاً أو يعمل على جهاز آخر. ويظهر التباطؤ عندما تتداخل مسارات الحساب أو الذاكرة أو وحدة المعالجة المركزية أو التخزين أو الجدولة.

هل يساعد تقليل حجم دفعة التضمين دائمًا؟

إنه يقصر فترات الحجب الفردية، لكنه قد يزيد النفقات الإضافية والوقت الإجمالي للإدخال. وقد تحافظ الأولوية والإيقاف المؤقت على معدل نقل أعلى.

هل ينبغي تشغيل التضمينات ليلًا؟

غالبًا ينبغي تشغيل عمليات الاستيراد الكبيرة ليلًا. أما التحديثات التدريجية فيمكن تشغيلها نهارًا عندما تكون محدودة وتتنازل عن الموارد للطلبات التفاعلية.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.