لماذا يمكن لمعالجة المطالبات أن تتفوق على توليد الرموز المميزة للذكاء الاصطناعي محليًا؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

قد تتجاوز معالجة المطالبة سرعة توليد الرموز، لأن المسرّع يقيّم العديد من رموز الإدخال بالتوازي، بينما يجب فك ترميز رموز الإخراج بالتتابع.

قد تعرض لوحة تحكم للذكاء الاصطناعي المنزلي مئات أو آلاف رموز المطالبة في الثانية، بينما يصل الإخراج المتدفق بمعدل أقل بكثير. تصف هذه الأرقام مرحلتين مختلفتين من التنفيذ، وليست قياسات متناقضة. تعالج مرحلة التهيئة السياق المُدخل على شكل كتلة وتبني حالة الانتباه، بينما تعيد مرحلة فك الترميز تشغيل النموذج مرارًا لقبول رمز جديد واحد في كل مرة. ويعتمد الفرق على طول المطالبة، وحجم النموذج، وعرض نطاق الذاكرة، والتجميع، وتخطيط ذاكرة التخزين المؤقت، وما إذا كانت الطلبات التي تعمل في الخلفية تشارك المسرّع نفسه.

التهيئة وفك الترميز يحلان مشكلتين حسابيتين مختلفتين

تقيّم معالجة المطالبة، التي تُسمى غالبًا التهيئة، تسلسل الإدخال وتنشئ حالة KV اللازمة للتوليد اللاحق. ولا يبدأ فك الترميز إلا بعد وجود تلك الحالة الأولية، ثم يمدد التسلسل رمزًا تلو الآخر.

تصف أبحاث خدمة نماذج اللغة الكبيرة التهيئة المقيدة بالحوسبة وفك الترميز المقيد بعرض نطاق الذاكرة كمرحلتين متميزتين لهما سلوك مختلف على العتاد.

لذلك يمكن للنموذج نفسه أن يحقق معدل إنتاجية مرتفعًا أثناء التهيئة ومعدلًا أقل بكثير لرموز الإخراج من دون وجود أي خلل. إذ يحصي كل مقياس الرموز التي تمر عبر مسار تنفيذ مختلف.

يمكن تقييم رموز المطالبة ضمن مصفوفات متوازية كبيرة

أثناء التهيئة، تتوفر مواضع استعلام عديدة في الوقت نفسه. ويمكن لعمليات ضرب المصفوفات الجمع بين العمل عبر التسلسل والدفعة والرؤوس والأبعاد المخفية، ما يوفر للمسرّع عددًا كافيًا من العمليات المتوازية ليظل مشغولًا.

يقلل FlashAttention من عبء الانتباه عبر حساب الانتباه المجزأ الذي يتجنب إنشاء مصفوفة الانتباه الكاملة مرارًا في ذاكرة الجهاز البطيئة.

تزيد المطالبات الأطول إجمالي عمل التهيئة، لكنها قد تحسن أيضًا الاستفادة الحسابية إلى أن تصبح سعة الذاكرة أو حدود النواة أو تعقيد الانتباه العامل المهيمن.

هذه إنتاجية عبر كتلة الإدخال، وليست مؤشرًا على أن الخادم يستطيع إصدار العدد نفسه من رموز الإخراج المستقلة كل ثانية.

لا يمكن لفك الترميز إنهاء الرمز التالي قبل الرمز الحالي

يختار التوليد التلقائي الرمزَ أو ينتقيه، ثم يضيفه إلى التسلسل، وبعد ذلك يشغّل خطوة أخرى من النموذج مشروطة بالنتيجة المقبولة. ولا يكون الرمز التالي المقبول معروفًا مسبقًا.

يفصل DistServe بين المرحلتين لأن تكرارات فك الترميز تصل مرارًا إلى أوزان النموذج وحالة KV النشطة، بينما تنتج كمية صغيرة فقط من الإخراج الجديد لكل تسلسل.

يمكن لتجميع عدة مستخدمين تنفيذ تسلسلات فك ترميز متعددة بالتوازي، لكن المحادثة الواحدة لا تزال تتقدم عبر سلسلة من قرارات الرموز المترابطة.

يمكن لفك الترميز التخميني التحقق من عدة مرشحين مُنشئين مسبقًا معًا، إلا أن فك الترميز العادي يظل تسلسليًا عند عدم قبول أي مرشحين مسبقًا.

قد تؤدي إنتاجية المطالبة المرتفعة إلى تأخير طويل قبل ظهور الرمز الأول

يقسم معدل الرموز في الثانية عمل المطالبة المكتمل على حجمها. وقد يحقق سياق طويل جدًا إنتاجية مذهلة، لكنه قد يستغرق عدة ثوانٍ قبل ظهور أول رمز مولد.

يفصل ZimaSpace بين التحميل وتقييم المطالبة والتوليد في حديثه عن مراحل زمن استجابة الذكاء الاصطناعي. يزيل النموذج المحمّل مسبقًا تأخير إعادة التحميل، لكنه لا يلغي تكلفة تقييم مطالبة كبيرة.

لذلك يُعد الوقت اللازم لظهور الرمز الأول مقياسًا تفاعليًا أفضل للتهيئة. أما معدل رموز المطالبة في الثانية، فهو مفيد لمقارنة كفاءة بيئة التشغيل في معالجة أطوال الإدخال المختلفة.

قد تؤدي عمليات التهيئة الطويلة إلى إبطاء المستخدمين الذين يفكون الترميز بالفعل

قد تدخل مطالبة مستند كثيفة الحساب إلى المسرّع نفسه أثناء تلقي مستخدم آخر رموز متدفقة. وإذا جمعت بيئة التشغيل عبءَي العمل من دون ضبط، فقد تؤدي التهيئة الكبيرة إلى إطالة تكرارات فك الترميز.

يسجل DistServe تداخلًا قويًا بين التهيئة وفك الترميز عندما تُوضع المرحلتان معًا وتُجدولان معًا.

قد يظل الخادم يعرض استخدامًا إجماليًا مرتفعًا، لكن المحادثة النشطة تعاني فجوات أكبر بين الرموز. وقد تتحرك الإنتاجية والسلاسة التي يراها المستخدم في اتجاهين متعاكسين.

يمكن للعمال المنفصلين، أو الجدولة الواعية بالمرحلة، أو حجز فرص لفك الترميز، حماية الإخراج التفاعلي عندما يدعمها العتاد وبيئة التشغيل.

تبادل التجزئة بعض كفاءة التهيئة مقابل استجابة أفضل

يمكن لبيئة التشغيل تقسيم مطالبة طويلة واحدة إلى أجزاء أصغر وتشبيك هذه الأجزاء مع عمل فك الترميز. وتحتاج المطالبة إلى عدد أكبر من دورات الجدولة، لكن لا تستحوذ أي تهيئة منفردة على دورة طويلة جدًا.

يستخدم Sarathi-Serve التهيئة المجزأة لتقليل التداخل مع الحفاظ على فرص مفيدة للتجميع.

يعتمد أفضل حجم للجزء على أطوال المطالبات، وبنية النموذج، وسعة المسرّع، وهدف زمن الاستجابة للمحادثات النشطة.

قِس زمن معالجة المطالبة، والوقت اللازم لظهور الرمز الأول، والزمن بين الرموز، ورموز الإخراج في الثانية كلًّا على حدة. فالمرحلة ذات الإنتاجية الاسمية الأقل ليست بالضرورة المرحلة التي تتسبب في أطول فترة انتظار للمستخدم.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.