لماذا يرتفع زمن استجابة الرمز الأول لنموذج LLM المحلي بعد بقاء الخادم خاملاً؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

غالبًا ما يرتفع زمن الاستجابة حتى ظهور الرمز الأول بعد فترة الخمول، لأن الطلب التالي يجب أن يعيد بناء حالة النموذج والذاكرة والمسرّع والطاقة التي تعيد الطلبات الدافئة استخدامها.

يمكن لخادم ذكاء اصطناعي منزلي الإجابة عن المطالبات المتكررة بسرعة، ثم يبدو بطيئًا عند وصول أول طلب في صباح اليوم التالي. قد يظل النموذج موجودًا على القرص، لكن صفحاته وتخصيص وحدة معالجة الرسومات والنواة البرمجية وسياق التنفيذ قد لا تكون دافئة. وتحدد سرعة التخزين وضغط الذاكرة وإخلاء وقت التشغيل وإدارة طاقة الجهاز وطول المطالبة مقدار التأخير العائد.

وقت الخمول يزيل عدة أنواع مختلفة من الحالة الدافئة

يمكن للطلب الدافئ إعادة استخدام الأوزان الموجودة مسبقًا في ذاكرة RAM أو VRAM، وصفحات نظام الملفات التي يحتفظ بها نظام التشغيل، ومكتبات المسرّع المهيأة، والنوى المترجمة، وتجمعات الذاكرة، وعامل النموذج النشط. وقد تزيل عملية التنظيف أثناء الخمول طبقة واحدة فقط أو توقف العملية بأكملها.

تحميل نقاط التحقق متعدد المستويات يقلل بدء تشغيل النموذج دون خادم عبر إبقاء نقاط التحقق قريبة من المسرّعات، وتحميلها من خلال مستويات تخزين متعددة، وجدولة الطلبات في المواقع التي تكون فيها حالة النموذج محلية بالفعل. ويوضح تصميمه أن زمن الاستجابة البارد سلسلة من عمليات النقل والتهيئة، وليس رقمًا واحدًا لقراءة القرص.

يعتمد التأخير الملحوظ على الطبقة التي أصبحت باردة. فقد تحتاج عملية ظلت قيد التشغيل إلى رفع تردد الجهاز فقط، بينما يجب على النموذج الذي أُخلي من الذاكرة قراءة الأوزان وتخصيص ذاكرة الجهاز وإعادة بناء هياكل وقت التشغيل، ثم معالجة المطالبة قبل إصدار رمز.

يتراكم تحميل النموذج والتهيئة المسبقة قبل ظهور أي رمز

يشمل زمن ظهور الرمز الأول الانتظار في الطابور، وتوافر الأوزان، وتهيئة وقت التشغيل، وتحويل الرموز، والتهيئة المسبقة على كامل الإدخال. ولا يمكن لمعدل فك الترميز السريع إخفاء هذه المراحل، إذ لا يوجد رمز ناتج حتى تنتج التهيئة المسبقة حالة فك الترميز الأولى.

إعادة استخدام ذاكرة GPU تحتفظ بالمعلمات في ذاكرة GPU غير المستخدمة وتستخدم جدولة تراعي الارتباط لتقليل عمليات النقل المتكررة. وتوضح التحسينات المبلغ عنها في بدء التشغيل البارد سبب أهمية الحفاظ على الإقامة الجزئية حتى عندما يتعذر على الخدمة إبقاء كل نموذج محملًا بالكامل.

لذلك قد تظل المطالبة الطويلة بالنظام بطيئة بعد أن تصبح الأوزان دافئة، بينما قد تتوقف المطالبة القصيرة بسبب تحميل نموذج بارد. ويساعد فصل زمن التحميل والتهيئة والتهيئة المسبقة وفك الترميز الأول على منع قيمة TTFT واحدة متوسطة من إخفاء المكوّن البارد الفعلي.

يُعد توفير الطاقة عادةً طبقة أصغر، لكنها قابلة للقياس

يمكن لوحدات المعالجة المركزية ووحدات معالجة الرسومات وأجهزة NVMe ووصلات PCIe الانتقال إلى حالات طاقة منخفضة أثناء الخمول. ويجب على الدفعة الأولى رفع الترددات واستعادة المسارات النشطة، ما يضيف فترة قصيرة من التصاعد قبل بدء الحوسبة المستمرة؛ وقد يضيف سكون المضيف المكثف وقتًا أطول بكثير عبر تعليق الخدمات أو الأقراص.

تداخل مراحل بدء التشغيل البارد يداخل تحميل النموذج والاتصال والحوسبة لبدء التشغيل البارد للنماذج اللغوية الكبيرة عند الحافة. ويوضح العمل أن إخفاء مرحلة بدء تشغيل واحدة يتطلب تنسيقًا مع المراحل الأخرى، خصوصًا عندما تكون الأوزان والحوسبة موزعة على أجهزة محدودة الموارد.

ويتمثل الخطأ في إلقاء اللوم على حالة الطاقة في كل إجابة أولى بطيئة. فإذا قيس التأخير بالثواني الكثيرة، فعادةً ما يهيمن إخلاء النموذج أو قراءات التخزين أو بدء تشغيل الحاوية أو التهيئة المسبقة للمطالبة، وليس انتقالًا في التردد يستغرق أجزاء من الألف من الثانية. شخّص الخط الزمني بدلًا من تعطيل كل ميزات توفير الطاقة افتراضيًا.

افصل بين تكلفة بدء التشغيل البارد وتكلفة المطالبة الباردة

أرسل مطالبة قصيرة ثابتة بعد 0 و1 و10 و60 و480 دقيقة من الخمول. وسجّل مدة بقاء العملية، وإقامة النموذج، واستخدام RAM وVRAM، وعدد البايتات المقروءة، وترددات الجهاز، ووقت الانتظار في الطابور، وتحويل الرموز، والتهيئة المسبقة، وفك الترميز الأول، وإجمالي TTFT لكل فترة.

قارن طبقة التخزين مع تخزين بدء تشغيل النموذج البارد، ثم كرر الاختبار مع تثبيت العامل، وتسخين ذاكرة التخزين المؤقت لنظام الملفات فقط، وإبقاء ذاكرة المضيف RAM دافئة فقط، وتغيير طول المطالبة. ويجب أن يغيّر كل تشغيل طبقة حالة واحدة بدلًا من جمع كل تحسين في الوقت نفسه.

اعتبر الخادم دافئًا فقط عندما تحافظ فترات الخمول المتكررة على TTFT المطلوب من دون إضعاف الخدمات الأخرى. وإذا تسبب تثبيت النموذج في ضغط على الذاكرة أو أعاق أعباء العمل ذات الأولوية الأعلى، فتقبّل بدء تشغيل بارد محدودًا وأظهره بدلًا من إخفاء المفاضلة.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

ما الذي يسبب تشبّع وحدة المعالجة المركزية عند تشغيل تحويل ترميز الأجهزة والذكاء الاصطناعي للفيديو معًا؟
Oct 04, 2026

ما الذي يسبب تشبّع وحدة المعالجة المركزية عند تشغيل تحويل ترميز الأجهزة والذكاء الاصطناعي للفيديو معًا؟

تتبّع تشبّع وحدة المعالجة المركزية عبر تفريغ ترميز الفيديو، وتحويل وحدات البكسل، ونسخ الإطارات، والمعالجة المسبقة للذكاء الاصطناعي، والصوت، والترجمة، والتخزين، وجدولة العمليات.

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.