يُحسّن التجميع في الذكاء الاصطناعي المنزلي إجمالي معدل الإنتاجية عبر دمج المهام المتوافقة، لكن قد تضطر كل مطالبة إلى الانتظار مدة أطول أو مشاركة دورات أبطأ مع مستخدمين آخرين.
يمكن لمطالبة واحدة أن تدخل مُسرّعًا خاملًا فورًا، بينما يتلقى الخادم العائلي غالبًا محادثات متداخلة، ومطالبات خاصة بالمستندات، وطلبات صوتية، ومهام تعمل في الخلفية. قد يحتفظ وقت التشغيل بالمطالبة لفترة قصيرة لتكوين دفعة، أو يضيف تسلسلات جديدة بين دورات فك الترميز، أو يقسم عمليات التهيئة الطويلة إلى أجزاء أصغر. تُبقي هذه الخيارات قدرًا أكبر من المُسرّع قيد الاستخدام، لكنها تغيّر أيضًا زمن ظهور الرمز الأول، والفاصل بين الرموز، والإنصاف. توضح الأقسام التالية الحالات التي يفيد فيها التجميع، ومتى تتوقف مكاسب الإنتاجية عن تحسين تجربة التفاعل.
يحوّل التجميع سعة المُسرّع الاحتياطية إلى عمل مشترك
قد لا تستخدم مطالبة واحدة كل مسارات التنفيذ المتوازية بكفاءة، لا سيما أثناء عمليات المصفوفات الصغيرة أو التسلسلات القصيرة. يؤدي دمج عدة مطالبات إلى إنشاء عمليات موتر أكبر يمكنها استخدام المُسرّع بكفاءة أعلى.
قدّم Orca مفهوم الجدولة على مستوى الدورة، مما يسمح للمطالبات بالانضمام والمغادرة بين دورات التوليد بدلًا من إجبار دفعة ثابتة واحدة على البقاء معًا حتى انتهاء كل التسلسلات.
يُقاس المكسب بعدد الرموز أو الطلبات المكتملة لكل وحدة زمنية. ولا يضمن ذلك حصول أي مستخدم على رمز في وقت أقرب.
تضيف نافذة التجميع وقتًا إلى قائمة الانتظار قبل بدء الحوسبة
يمكن لوقت التشغيل الذي ينتظر وصول مزيد من الطلبات أن يبني دفعة أكبر وأكثر كفاءة، لكن المطالبة الأقدم تتحمل وقت الانتظار هذا حتى عندما يكون المُسرّع متاحًا.
يظهر التوازن بين الإنتاجية وزمن الاستجابة عندما تحسّن الدفعات الأكبر كفاءة الجهاز، مع إطالة وقت الانتظار أو وقت الدورة.
يحتاج الذكاء الاصطناعي التفاعلي المنزلي عادةً إلى نافذة تجميع قصيرة أو متكيفة. ويمكن للتضمينات التي تعمل في الخلفية تحمل قدر أكبر من الانتظار، لأن هدفها هو إنجاز العمل لا تقديم استجابة حوارية.
يمكن لعمليات التهيئة الطويلة أن تعطل عمل فك الترميز القصير
تعالج معالجة المطالبة عملية تهيئة كبيرة وكثيفة الحوسبة، بينما تعود المحادثات النشطة مرارًا لتنفيذ خطوات فك ترميز محدودة بالذاكرة. وقد يؤدي خلطها في دفعة واحدة إلى جعل عملية فك ترميز تفاعلية صغيرة تنتظر خلف مطالبة طويلة خاصة بمستند.
يعزل DistServe التداخل بين التهيئة وفك الترميز، لأن المرحلتين تختلفان في خصائص الموارد وزمن الاستجابة.
تُعد التهيئة المجزأة حلًا وسطًا؛ فهي تقسم المطالبة الطويلة بحيث يمكن لطلبات فك الترميز العمل بين الأجزاء، لكن المستند يحتاج إلى جولات جدولة أكثر حتى يكتمل.
يعتمد الإعداد الأفضل على ما إذا كان الخادم يعطي الأولوية لمهمة تحليل طويلة واحدة، أو لعدة مستخدمين يتلقون إجابات متدفقة بالفعل.
تجعل أطوال التسلسلات المتباينة كل دفعة غير متوازنة
تختلف الطلبات في طول المطالبة، وطول المخرجات، وشروط التوقف، وميزات النموذج. تنتهي بعض الطلبات بسرعة، بينما تظل طلبات أخرى نشطة، لذلك يتغير تكوين الدفعة باستمرار.
يستخدم vLLM التجميع المستمر مع ذاكرة KV مؤقتة مقسّمة إلى صفحات، لقبول طلبات جديدة عند توفر السعة بدلًا من انتظار حد ثابت للدفعة.
حتى مع الإدارة الفعالة للذاكرة، تستهلك استجابة طويلة جدًا فتحات فك الترميز وذاكرة KV المؤقتة لعدد كبير من الدورات. لذلك ينبغي التعبير عن حجم الدفعة ضمن ميزانيات الرموز والذاكرة، لا بعدد الطلبات فقط.
يمكن للدفعات الأكبر أن تخفض معدل الرموز لكل مستخدم
قد يرتفع إجمالي عدد الرموز في الثانية، بينما يحصل كل مستخدم على حصة أصغر من دورات فك الترميز. ويمكن أن تتعايش لوحة معلومات تعرض إنتاجية إجمالية أعلى مع تدفق مرئي أبطأ.
يشرح دليل ZimaSpace حول التزامن العائلي سبب عدم قدرة اختبارات المستخدم الواحد على التنبؤ بزمن استجابة عدة محادثات متداخلة.
قِس زمن ظهور الرمز الأول، والزمن بين الرموز، وزمن إكمال كل طلب، إلى جانب الإنتاجية الإجمالية. وإلا فقد يجري ضبط التجميع وفق مقياس لا يختبره المستخدمون مباشرة.
اضبط سياسات تجميع مختلفة للعمل التفاعلي والعمل في الخلفية
خصص نوافذ انتظار قصيرة، وتزامنًا محدودًا، وأولوية أعلى للطلبات الصوتية والمحادثات. واسمح بدفعات أكبر وأولوية أقل للتضمينات، والفهرسة، والملخصات، والتحويلات غير المتصلة.
يستخدم بحث تقديم النماذج اللغوية الكبيرة بإنصاف الإنصاف الواعي بعدد الرموز، حتى لا تشغل مطالبة ذات مدخلات أو مخرجات طويلة حصة غير متناسبة إلى أجل غير محدد.
اختبر النظام تحت حمل عائلي واقعي، لا عند أقصى حجم للدفعة فقط. ويكون الإعداد المفيد هو أعلى إنتاجية تظل مستوفية لأهداف زمن ظهور الرمز الأول وزمن الاستجابة أثناء التدفق للمسار التفاعلي.
عندما لا يستطيع مُسرّع واحد تلبية الفئتين معًا، قد يكون فصل العاملين أو جداول التشغيل أبسط من استخدام سياسة تجميع عالمية واحدة.
الأسئلة الشائعة
هل يزيد التجميع زمن الاستجابة دائمًا؟
لا. يمكن للتجميع الفعال تقصير إجمالي وقت تفريغ قائمة الانتظار ومنع التحميل الزائد، لكن انتظار تكوين دفعة ومشاركة دورات أطول قد يزيدان زمن استجابة الطلب الفردي.
هل حجم الدفعة هو عدد المستخدمين؟
ليس تمامًا. قد تضع أوقات التشغيل ميزانية بناءً على التسلسلات النشطة، أو الرموز، أو كتل KV، أو إجمالي العمل، كما يمكن لمستخدم واحد إنشاء عدة طلبات متزامنة.
هل ينبغي تجميع الطلبات الصوتية مع التضمينات؟
عادةً لا، إذا كانت تخضع لسياسة زمن الاستجابة نفسها. فالطلبات الصوتية تفاعلية، بينما يمكن لمهام التضمين الانتظار واستخدام دفعات أكبر أثناء توفر سعة احتياطية.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

لماذا تصبح تنبؤات المنزل الذكي أقل دقة بعد تغيّر الروتين الموسمي؟
تغيّر الروتينات الموسمية العلاقة بين الوقت وأجهزة الاستشعار والإشغال والإجراءات المطلوبة، مما يجعل النموذج المدرَّب على العادات الأقدم متقادماً.

لماذا يفوّت جهاز NVR المنزلي الأحداث القصيرة عند تفعيل تتبّع الأجسام؟
يحتاج التتبع إلى عدد كافٍ من عمليات الكشف لبدء المسار وتأكيده، لذا قد يختفي جسم لفترة وجيزة قبل أن ينشئ جهاز تسجيل الفيديو الشبكي...

لماذا تتغير تسميات الصور بالذكاء الاصطناعي بعد ترقية النموذج؟
يغيّر ترقية النموذج التمثيلَ والترتيبَ المستخدمَين لتعيين التصنيفات، لذا قد تتجاوز الصورة نفسها حدودًا دلالية أو حدود ثقة مختلفة.

