كيف يؤثر التجميع المستمر في الإنصاف على خادم ذكاء اصطناعي منزلي؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

تُحسّن الدُفعات المستمرة الاستفادة من الموارد عبر إعادة ملء الدُفعات النشطة، لكن الإنصاف يعتمد على كيفية حصول المستخدمين على القبول وخدمة الرموز والذاكرة بمرور الوقت.

يمكن لخادم ذكاء اصطناعي منزلي دمج عدة محادثات من دون انتظار انتهاء كل تسلسل معًا. تغادر الطلبات المكتملة، وتدخل طلبات جديدة، ويتشارك المستخدمون النشطون دورات الاستدلال المتكررة. يرفع ذلك معدل الإنتاجية، لكن الطلبات ليست متساوية: فقد يرسل مستخدم أمرًا قصيرًا، ويرسل آخر مستندًا طويلًا، بينما يستخدم ثالث وكيلًا يُنشئ مئات الرموز. يجب على المُجدوِل العادل أن يحدد وحدة العمل المعتمدة، وكيفية دخول الطلبات الجديدة، وكيف تتفاعل الأولويات مع أطوال المخرجات غير المتوقعة.

تغيّر الدُفعات المستمرة وحدة الجدولة من دفعة ثابتة إلى دورات

تحافظ الدُفعات الثابتة على مجموعة واحدة معًا حتى تكتمل، مما يهدر السعة عندما تنتهي الطلبات القصيرة مبكرًا. أما الدُفعات المستمرة فتستطيع إعادة ملء الخانات الشاغرة بين دورات التوليد.

قدّمت Orca مفهوم الجدولة على مستوى الدورة، بحيث يمكن للطلبات الانضمام والمغادرة مع تغيّر حالة تسلسلها.

يُحسّن ذلك الاستفادة من الموارد، لكنه يعني أيضًا أن المستخدمين يتنافسون مرارًا على مكان في الدورة التالية بدلًا من الحصول على خانة طلب واحدة غير قابلة للتجزئة.

يحدد ترتيب القبول من يبدأ في تراكم الخدمة

لا يحصل الطلب الموجود خارج الدفعة النشطة على أي تقدم من النموذج. وقد يقبل المُجدوِل الطلبات حسب وقت الوصول، أو الطول المُقدّر، أو الأولوية، أو كتل KV المتاحة، أو عدّاد للإنصاف.

تجمع vLLM بين القبول المستمر وإدارة ذاكرة KV المُقسّمة إلى صفحات، بحيث يمكن تخصيص الذاكرة مع نمو التسلسلات.

تُعدّ أولوية الوصول أولًا والخدمة أولًا بسيطة، لكن طابورًا من الطلبات الطويلة قد يؤخر أوامر منزلية قصيرة لاحقة، حتى لو كانت تلك الأوامر ستكتمل بسرعة.

قد يؤدي احتساب الطلبات بالتساوي إلى خدمة غير متساوية للمسرّع

تُعدّ إجابة من خمسة رموز وإجابة من خمسمئة رمز طلبًا واحدًا لكل منهما، لكنهما تشغلان عددًا مختلفًا جدًا من دورات فك الترميز. كما تنتج أطوال المطالبات كميات مختلفة من عمل التهيئة المسبقة.

يعرّف Virtual Token Counter مفهوم الإنصاف القائم على الرموز، لأن عدد الطلبات وحده لا يمثل مقدار الخدمة المستهلكة في أعباء عمل نماذج اللغة الكبيرة غير المتجانسة.

ينبغي للسياسة المنزلية أن تحدد ما إذا كان الإنصاف يعني تساوي عمل الرموز، أو تساوي وقت الانتظار، أو تساوي فرص الإكمال، أو منح الأولوية للمهام الحساسة لزمن الاستجابة.

لا يوجد مقياس واحد يناسب كل أعباء العمل. فلا ينبغي بالضرورة أن يتلقى أمر صوتي وملخص يُنشأ في الخلفية المعاملة نفسها.

-15% OFF

يجعل طول المخرجات غير المعروف الخدمة المستقبلية صعبة التنبؤ

يعرف المُجدوِل حجم المطالبة عند القبول، لكنه لا يعرف عادةً عدد رموز المخرجات التي سيُنشئها النموذج بالضبط. وقد يظل أحد الطلبات نشطًا مدة أطول بكثير من المتوقع.

تسلّط أبحاث الإنصاف الضوء على أطوال الطلبات غير المتوقعة بوصفها تحديًا مميزًا لخدمة نماذج اللغة الكبيرة.

يؤدي احتساب الخدمة وفق الرموز التي عولجت فعليًا إلى تجنب الاعتماد الكامل على تقدير ضعيف للطول، لكنه قد يسمح مع ذلك لطلب طويل باحتلال الذاكرة لعدد كبير من الدورات.

قد تؤدي التهيئة المسبقة الكبيرة إلى تعطيل المستخدمين الذين يتلقون الرموز بالفعل

قد تدخل مطالبة مستند جديد بينما يفك عدة مستخدمين الترميز. وقد تؤدي التهيئة المسبقة كثيفة الحوسبة إلى إطالة الدورة التي يجب على المحادثات النشطة انتظارها.

يستخدم Sarathi-Serve الجدولة الخالية من التوقفات لتقسيم عمليات التهيئة المسبقة الكبيرة وتقليل تأثيرها في زمن استجابة فك الترميز المستمر.

ومع ذلك، قد يظل المُجدوِل الذي يحتسب رموز فك الترميز فقط غير عادل إذا كان أحد المستخدمين يُدخل مرارًا عمليات تهيئة مسبقة كبيرة تؤخر المخرجات المتدفقة للجميع.

لذلك ينبغي أن يشمل الاحتساب العادل معالجة الإدخال إلى جانب الرموز المُنشأة.

قد تؤدي ضغوط الذاكرة إلى مشكلات إنصاف قبل بلوغ الحوسبة حد التشبع

تحتاج كل محادثة نشطة إلى ذاكرة التخزين المؤقت KV، وتستهلك السياقات الأطول عددًا أكبر من الكتل. وقد يقلل مستخدم لديه سياق واحد كبير عدد الطلبات الأخرى التي يمكن أن تتسع لها الدفعة النشطة.

يربط تحليل ZimaSpace متعدد المستخدمين التزامن المنزلي بذاكرة النموذج المشتركة وقرارات المُجدوِل.

قد تؤدي إيقاف أولوية طلب أو تبديله إلى استعادة السعة، لكن المستخدم الذي قوطع طلبه قد يتحمل لاحقًا كلفة إعادة الحساب أو إعادة تحميل ذاكرة التخزين المؤقت أو زمن إكمال أطول.

لذلك يجب أن يتبع قبول الذاكرة وجدولة الحوسبة سياسة الإنصاف نفسها، بدلًا من عمل كل منهما كحد مستقل عن الآخر.

تحتاج الأولويات إلى التقادم والحصص وقياسات ظاهرة للمستخدم

قد تستحق ميزة التحكم الصوتي وأدوات تسهيل الوصول والمحادثة التفاعلية القصيرة أولوية أعلى من عمليات التضمين أو الملخصات الليلية. ومع ذلك، قد تؤدي جدولة الأولوية الخالصة إلى حرمان العمل منخفض الأولوية من الخدمة.

يستخدم Llumnix الجدولة الديناميكية لتكييف موضع الطلبات وقرارات الموارد مع تغيّر ظروف الخدمة.

أضف التقادم، وحصصًا لكل مستخدم، وحدودًا قصوى للسياق أو المخرجات، وحصة خلفية محجوزة، حتى تستجيب المهام المفضلة بسرعة من دون حجب كل ما عداها إلى أجل غير مسمى.

قِس وقت الانتظار في الطابور، والزمن حتى أول رمز، والفاصل بين الرموز، ووقت الإكمال، والرموز المقدمة، وعمليات إيقاف الأولوية حسب المستخدم أو فئة عبء العمل. لا تكون الدُفعات المستمرة عادلة إلا عندما يتوافق التوزيع المرصود مع سياسة المنزل، وليس فقط عندما يكون إجمالي الرموز في الثانية مرتفعًا.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.