يمكن أن يمنع تجزؤ ذاكرة GPU نموذجَ ذكاء اصطناعي محليًا من العمل عندما تتوزع السعة الحرة على مناطق لا تستطيع تلبية نمط التخصيص التالي لوقت التشغيل.
يظهر العطل غالبًا بعد التبديل بين النماذج، أو تغيير أطوال السياق، أو تشغيل أحمال الصور واللغة معًا، أو معالجة طلبات تتزايد فيها المصفوفات المؤقتة وتنكمش. قد تُظهر المراقبة وجود VRAM غير مستخدمة، ومع ذلك يتعذر على المخصِّص وضع مساحة عمل كبيرة أو جزء من النموذج أو توسيع ذاكرة KV المؤقتة من دون تحرير الكتل الحالية أو إعادة تنظيمها. تفصل الأقسام أدناه بين النقص الحقيقي في السعة وتجزؤ المخصِّص، وتوضح سبب تمكّن إعادة تشغيل وقت التشغيل مؤقتًا من جعل النموذج نفسه يلائم الذاكرة مجددًا.
إجمالي VRAM الحرة لا يساوي مساحة التخصيص القابلة للاستخدام
يعرض مراقب الذاكرة السعة الإجمالية، لكن على المخصِّص تلبية الطلبات عبر الكتل والتعيينات الافتراضية التي يديرها. قد يتجاوز مجموع عدة مناطق حرة صغيرة حجم الطلب المطلوب، ومع ذلك تظل غير قابلة للاستخدام بموجب قاعدة التخصيص المتجاور.
يصف تحليل لعمليات نماذج اللغة الكبيرة هذا التباين في الذاكرة الحرة عندما تترك ذاكرة KV المؤقتة والمصفوفات متغيرة الحجم فجوات أصغر من الطلب التالي. لذلك يرتبط نفاد الذاكرة الظاهر بتخطيط الذاكرة بقدر ارتباطه بإجمالي عدد البايتات.
وقد تعرض برامج التشغيل والأطر البرمجية ذاكرة الجهاز الحرة، والمحجوزة، والمخصَّصة، وغير النشطة بطرق مختلفة. قارن بين عرض مخصِّص وقت التشغيل واستخدام الجهاز على مستوى النظام بدلًا من الاعتماد على رقم رئيسي واحد.
تغيّر أحجام المصفوفات ينشئ فجوات بمرور الوقت
تخصّص أحمال الذكاء الاصطناعي المصفوفات وتحررها مرارًا بأحجام مختلفة للمطالبات، والدفعات، وأبعاد الصور، ومساحات عمل الانتباه، وعمليات التحويل المؤقتة. يحتفظ المخصِّص القائم على التخزين المؤقت بالكتل لإعادة استخدامها، لأن إعادتها إلى برنامج التشغيل مرارًا مكلفة.
توضح أبحاث GMLake أن التخصيصات غير المنتظمة يمكن أن تضعف مجمعات الذاكرة القائمة على تقسيم الكتل، وأن تسبب تجزؤًا ملحوظًا في النماذج الكبيرة. وتكون إعادة استخدام الأحجام المطابقة تمامًا فعّالة، بينما يصعب التعامل مع التقسيم والدمج المتكرر لأحجام غير متطابقة.
ويكون الخادم المنزلي الذي يبدّل بين النماذج عرضة لذلك على نحو خاص، لأن أوقات تشغيل اللغة، والانتشار، والرؤية، والصوت تطلب أشكالًا مختلفة جدًا من الكتل على وحدة GPU نفسها.
يمكن أن يتراكم التجزؤ من دون وجود تسرّب للذاكرة. فقد يُحرَّر كل تخصيص في النهاية إلى المجمع، لكن شكل المجمع قد يظل غير ملائم للحمل التالي.
النمو المتزايد لذاكرة KV المؤقتة يجعل تجزؤ الاستدلال ديناميكيًا
تظل أوزان نماذج اللغة الكبيرة مستقرة نسبيًا بعد تحميلها، بينما تنمو ذاكرة KV المؤقتة مع عدد المستخدمين النشطين، وطول المطالبة، والرموز المُولَّدة. كما تنتهي الطلبات في أوقات مختلفة، فتُحرِّر مناطق غير متساوية.
صُممت PagedAttention لتقليل تجزؤ ذاكرة KV المؤقتة عبر تخزين حالة الطلب في كتل أصغر، بدل حجز منطقة كبيرة متجاورة لطول نهائي غير معروف للتسلسل.
تختلف هذه المشكلة عن التجزؤ في مخصِّص المصفوفات العام للإطار البرمجي، لكن قد يحدث الاثنان معًا. ولا يستطيع مدير KV القائم على الصفحات ضغط مساحات عمل النموذج أو التخصيصات التي تملكها عملية أخرى تلقائيًا.
يوضح نقاش ZimaSpace حول السياقات المتزامنة سبب قدرة نموذج على العمل لمستخدم واحد، ثم تجاوزه حدًا من حدود الذاكرة عندما تتوسع عدة محادثات في الوقت نفسه.
يمكن أن تجعل الذاكرة المحجوزة العطل يبدو كتسرّب
غالبًا ما تحتفظ مخصّصات الأطر البرمجية بالكتل المحرَّرة لتسريع الطلبات اللاحقة. وتعدّ أدوات الجهاز هذه الكتل مستخدمة من العملية، حتى عندما لا يحتفظ النموذج الحالي بمصفوفات نشطة في جميعها.
يفصل دليل عملي لأخطاء نفاد الذاكرة الذاكرة المحجوزة عن متطلبات النموذج وذاكرة التخزين المؤقت النشطة. وقد تشير الفجوة الكبيرة إلى كتل قابلة لإعادة الاستخدام في المخصِّص، أو إلى التجزؤ، أو إلى حمل بلغ ذروته مستوى أعلى من حالته الحالية.
قد تؤدي تهيئة ذاكرة التخزين المؤقت إلى إعادة بعض الكتل إلى برنامج التشغيل، لكنها لا تستطيع تحرير الأوزان الحية، أو حالة KV النشطة، أو سياق عملية أخرى، أو مساحة العمل المطلوبة للعملية التالية.
تقلل أشكال التخصيص المستقرة والترحيل من تكرار الأعطال
أعد إنتاج العطل باستخدام نموذج واحد، وحد أقصى ثابت للسياق، وحجم دفعة ثابت، ومن دون خدمات ذكاء اصطناعي منافسة. وسجّل الذاكرة المخصَّصة والمحجوزة على مستوى العملية، والذاكرة الحرة على مستوى الجهاز، وأكبر طلب، وتسلسل الحمل الذي سبق نفاد الذاكرة.
تستخدم vAttention تعيين الذاكرة الافتراضية لفصل مساحة KV الافتراضية المتجاورة عن التخصيص المادي. وتقلل أساليب الترحيل والتخصيص المجزأ المماثلة الاعتماد على منطقة مادية متصلة واحدة.
بالنسبة إلى الخادم المنزلي، تشمل الإجراءات العملية ترك هامش في VRAM، والحد من تبديل النماذج، واستخدام حدود قصوى مستقرة للسياق والدفعات، وتنسيق الخدمات عبر وقت تشغيل واحد، وإعادة تشغيل العملية المتجزئة أثناء الصيانة بدلًا من انتظار فشل طلب أحد المستخدمين.
إذا لم تجعل إعادة التشغيل النظيفة النموذج يلائم الذاكرة، فمن المرجح أن تكون المشكلة الأساسية سعة حقيقية لا تجزؤًا متراكمًا. صغّر حجم النموذج، أو بصمة التكميم، أو السياق، أو الدفعة، أو التخصيصات المنافسة.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

لماذا تصبح تنبؤات المنزل الذكي أقل دقة بعد تغيّر الروتين الموسمي؟
تغيّر الروتينات الموسمية العلاقة بين الوقت وأجهزة الاستشعار والإشغال والإجراءات المطلوبة، مما يجعل النموذج المدرَّب على العادات الأقدم متقادماً.

لماذا يفوّت جهاز NVR المنزلي الأحداث القصيرة عند تفعيل تتبّع الأجسام؟
يحتاج التتبع إلى عدد كافٍ من عمليات الكشف لبدء المسار وتأكيده، لذا قد يختفي جسم لفترة وجيزة قبل أن ينشئ جهاز تسجيل الفيديو الشبكي...

لماذا تتغير تسميات الصور بالذكاء الاصطناعي بعد ترقية النموذج؟
يغيّر ترقية النموذج التمثيلَ والترتيبَ المستخدمَين لتعيين التصنيفات، لذا قد تتجاوز الصورة نفسها حدودًا دلالية أو حدود ثقة مختلفة.

