نعم. يمكن لخادم ذكاء اصطناعي منزلي واحد تحميل نموذج مرة واحدة وتقديم الخدمة لعدة جلسات مستخدمين. صُممت خوادم الاستدلال الحديثة لمشاركة أوزان النموذج المكلفة مع الحفاظ على حالة طلب منفصلة لكل محادثة. وهذا أكثر كفاءة بكثير من تحميل نسخة ثانية من النموذج نفسه لكل فرد من أفراد العائلة.
عادةً لا يتمثل حد التوسع الرئيسي في الأوزان، بل في ذاكرة KV المؤقتة المتزايدة، وطول السياق، وتوليد الرموز المتزامن، وقوائم الانتظار التي ينشئها المستخدمون النشطون. لذلك فإن تقديم الخدمة لعدة مستخدمين هو مشكلة جدولة بقدر ما هو مشكلة في حجم النموذج.
ما الذي يُتشارك فعليًا بين المستخدمين؟
نموذج واحد مُحمَّل
الأوزان في RAM/VRAM
|
+-----------------+-----------------+
| | |
الجلسة A الجلسة B الجلسة C
ذاكرة KV المؤقتة A ذاكرة KV المؤقتة B ذاكرة KV المؤقتة C
السجل A السجل B السجل C
تُقرأ أوزان المحوّل فقط أثناء الاستدلال العادي، لذا يمكن لطلبات كثيرة استخدام النسخة نفسها. ومع ذلك، يحتاج كل تسلسل إلى حالة الرموز المميزة الخاصة به وذاكرة الانتباه المؤقتة الخاصة به.
| المورد | مشتركة؟ | لماذا |
|---|---|---|
| أوزان النموذج | نعم | تخدم المعلمات نفسها جميع الطلبات |
| ذاكرة KV المؤقتة | لا، باستثناء إعادة استخدام البادئة المُتحكَّم بها | يعتمد على كل تسلسل |
| سجل المحادثة | لا | بيانات التطبيق/المستخدم |
| المُرمِّز | نعم | مفردات النموذج نفسها |
| حوسبة GPU | مُجدوَل | تتشارك الطلبات في معدل الإنتاج |
| المصادقة | لا | يجب تحديد هوية كل مستدعٍ |
كيف تتعامل خوادم الاستدلال مع الطلبات المتزامنة؟
توفّر بيئات التشغيل المختلفة عناصر تحكم مختلفة في الجدولة، لكن المبدأ متشابه: قبول عدة تسلسلات، وتجميع العمل حيثما أمكن، ووضع الطلبات الزائدة في قائمة انتظار.
يوثّق الأسئلة الشائعة في Ollama عناصر التحكم في الطلبات المتوازية، ويشير إلى أن زيادة توازي السياق ترفع متطلبات الذاكرة. كما يوضّح مثال التوازي في llama.cpp استخدام عدة عملاء مُحاكين لخادم نموذج واحد.
تستخدم الخوادم الأعلى إنتاجية، مثل vLLM، التجميع والجدولة الواعية بذاكرة KV المؤقتة لإبقاء المسرّعات مشغولة عبر عدة تسلسلات واردة.
لماذا قد يستهلك طول السياق ذاكرة أكبر مما يشير إليه مستخدم آخر
لنفترض أن أوزان النموذج تتسع بسهولة في ذاكرة VRAM. فتح أربعة مستخدمين محادثة طويلة جدًا لكل منهم. لا تتضاعف الأوزان أربع مرات، لكن ذاكرة KV المؤقتة يمكن أن تنمو كثيرًا لكل تسلسل نشط.
ميزانية ذاكرة VRAM
|
+-- أوزان النموذج ثابتة
+-- ذاكرة KV المؤقتة للمستخدم A تزداد مع طول السياق
+-- ذاكرة KV المؤقتة للمستخدم B تزداد مع طول السياق
+-- ذاكرة KV المؤقتة للمستخدم C تزداد مع طول السياق
+-- الحمل الزائد لوقت التشغيل
لهذا السبب لا يكفي أن «النموذج يتسع في الذاكرة» لتخطيط السعة. ينبغي للأنظمة متعددة المستخدمين تحديد الحد الأقصى لطول السياق، والحد الأقصى للتسلسلات المتزامنة، وقائمة انتظار محدودة.
يوسّع دليل ZimaSpace الحالي حول جدولة المسرّعات للذكاء الاصطناعي المنزلي متعدد المستخدمين شرح حدود الموارد نفسها.
هل ينبغي أن يحصل كل مستخدم على عملية نموذج مخصصة؟
عادةً لا. تؤدي العمليات المنفصلة إلى تكرار الأوزان وتقليل عدد النماذج التي يمكن أن تتسع لها الذاكرة. لكنها قد تكون منطقية عندما:
- يحتاج المستخدمون إلى نماذج ضبط دقيق أو تكميمات مختلفة؛
- يكون عزل العمليات القوي أهم من الكفاءة؛
- يستخدم أحد أعباء العمل بيئة تشغيل مخصصة؛
- تريد تخصيصًا صارمًا لوحدة معالجة الرسومات لكل مستخدم؛
- يملك نموذج واحد سياقًا أو متطلبات أخذ عينات غير متوافقة.
بالنسبة إلى عائلة أو فريق صغير يستخدم النموذج نفسه، تكون خدمة استدلال واحدة خلف تطبيق مُصادَق عليه أبسط عادةً.
أبقِ ذاكرة المحادثة خارج خادم النموذج
يجب ألا يكون خادم الاستدلال قاعدة البيانات المرجعية لتحديد «من قال ماذا». خزّن سجل المحادثات وتفضيلات المستخدم في طبقة التطبيق ضمن معرّف صريح للمستخدم/الجلسة.
المتصفح / التطبيق
|
| معرّف المستخدم المُصادَق عليه user_id
v
تطبيق الدردشة
|
+-- قاعدة بيانات السجل (لكل مستخدم)
+-- أذونات RAG
|
v
خادم نموذج مشترك
قبل كل عملية توليد، يجمع التطبيق فقط سجل المحادثة وسياق الاسترجاع الخاص اللذين يُسمح للمستخدم الحالي برؤيتهما.
يكتسب هذا أهمية خاصة بالنسبة إلى مساعد ذكاء اصطناعي خاص على جهاز NAS، حيث قد يحتوي الخادم نفسه على مستندات شخصية تخص عدة أفراد من الأسرة.
التخزين المؤقت للبادئات المشتركة ليس ذاكرة محادثة مشتركة
يمكن لبعض أُطر التشغيل إعادة استخدام ذاكرة KV المؤقتة أو أعمال أخرى للبادئات الشائعة في المطالبات. لذلك قد تُحسب تعليمة نظام مشتركة أو بادئة مستند متكررة مرة واحدة وتُعاد الاستفادة منها بكفاءة.
يجب عدم الخلط بين هذا التحسين والسماح بدخول سياق خاص بمستخدم إلى طلب مستخدم آخر. تحتاج أنظمة التخزين المؤقت إلى عزل صحيح ودلالات تجزئة سليمة؛ وتظل أذونات التطبيق هي التي تحدد المحتوى الذي يمكن تقديمه إلى الطلب.
استخدم جدولة عادلة حتى لا يتمكن مستخدم واحد من شغل الخادم
يمكن لطلب واحد يطلب مخرجات طويلة جدًا أن يستهلك سعة فك الترميز بينما ينتظر المستخدمون الآخرون. أضف ضوابط قبول مثل:
- حد الطلبات المتزامنة لكل مستخدم؛
- الحد الأقصى لرموز الإخراج؛
- الحد الأقصى لنافذة السياق؛
- الحد الأقصى العالمي للتسلسلات النشطة؛
- مهلة انتظار قائمة الانتظار؛
- أولوية للطلبات التفاعلية القصيرة؛
- قائمة انتظار منفصلة للمهام التي تعمل في الخلفية.
يجب ألا تتنافس الدردشة التفاعلية وتلخيص المستندات طوال الليل ضمن سياسة جدولة متطابقة.
ماذا يحدث عندما ينفد الخادم من الذاكرة؟
ترفض الخدمة الجيدة العمل الجديد أو تضعه في قائمة الانتظار قبل أن تتعطل وحدة التسريع. وينبغي أن تستخدم ضوابط السعة السياق المُهيّأ فعليًا، لا مجرد متوسط متفائل.
| الضغط | الاستجابة الأكثر أمانًا |
|---|---|
| جميع خانات التسلسل مشغولة | ضعه في قائمة الانتظار لفترة وجيزة |
| قائمة الانتظار طويلة جدًا | أعِد إشارة «مشغول / أعد المحاولة» |
| السياق يتجاوز السياسة | لخّص أو ارفض |
| دفعة في الخلفية نشطة | أوقفه مؤقتًا أو خفّض أولويته |
| الذاكرة تقترب من الحد | خفّض التزامن قبل نفاد الذاكرة |
لا تُقلّص نافذة سياق كل مستخدم بصمت حتى يتوقف الخادم عن الانهيار. اجعل سياسة السياق واضحة حتى يعرف المستخدمون ما يمكن للنظام الاحتفاظ به.
تزداد أهمية الخصوصية والمصادقة في وضع تعدد المستخدمين
عندما يخدم نموذج واحد مسؤولًا واحدًا، قد تكون نقطة نهاية محلية فقط كافية. وبمجرد أن يستخدمه عدة أشخاص، ينبغي للتطبيق مصادقة المستخدمين والتأكد من صلاحيتهم للوصول إلى مصادر بياناتهم.
احمِ:
- سجلات الدردشة؛
- مجموعات RAG وقوائم التحكم في الوصول إلى المستندات؛
- المطالبات المحفوظة؛
- بيانات اعتماد الأدوات؛
- الملفات المُنشأة؛
- السجلات وآثار التتبع.
ينبغي ألا ترى عملية النموذج المشتركة سوى سياق الطلب الحالي، وألا تتحول إلى وسيلة مريحة لتجاوز نموذج الأذونات المعتاد في جهاز NAS.
كم عدد المستخدمين الذين يمكن لخادم ذكاء اصطناعي منزلي واحد دعمهم؟
لا يوجد رقم ثابت مفيد. قد يدعم الخادم عددًا كبيرًا من المستخدمين المسجّلين إذا كان مستخدم أو اثنان فقط نشطين، بينما قد يستنفد مستخدمان متزامنان بسياق طويل وحدة معالجة رسومات صغيرة.
اختبر ثلاثة سيناريوهات:
- مستخدم تفاعلي واحد؛
- الحمل المنزلي المتزامن المتوقع لديك؛
- مستخدم واحد كثيف الاستخدام بالإضافة إلى عدة طلبات قصيرة.
قِس الوقت حتى أول رمز، وعدد الرموز في الثانية لكل مستخدم، ووقت الانتظار في قائمة الانتظار، واستخدام ذاكرة KV المؤقتة، واستخدام RAM/VRAM، ومعدل فشل الطلبات.
الأسئلة الشائعة
هل سيرى المستخدمون محادثات بعضهم بعضًا لأن النموذج مشترك؟
ليس إذا كان التطبيق يحتفظ بسجل المحادثة وسياق الاسترجاع بشكل منفصل. فمشاركة أوزان النموذج لا تعني بطبيعتها مشاركة سجل الدردشة.
هل يجعل الاستدلال المتوازي كل مستخدم أسرع؟
يمكن أن يزيد ذلك إجمالي معدل النقل، لكن قد تحصل كل طلبات فردية على قدرة حوسبة أقل عند نشاط عدة تسلسلات. والهدف عادةً هو تحسين الخدمة الإجمالية وتقليل وقت الانتظار في قائمة الانتظار.
هل يمكن لخادم واحد استضافة عدة نماذج أيضًا؟
نعم، إذا سمحت الذاكرة. تحمّل بعض بيئات التشغيل النماذج وتفرغها حسب الحاجة، بينما صُممت أخرى حول عملية خدمة واحدة أو عدة عمليات دائمة. تضيف جدولة النماذج المتعددة طبقة سعة أخرى تتجاوز جدولة المستخدمين المتعددين.
الحكم النهائي
إن مشاركة نموذج مُحمّل واحد هي تحديدًا المورد الذي ينبغي أن تتشاركه عادةً خدمة ذكاء اصطناعي منزلية صغيرة. أبقِ أوزان النموذج مشتركة، واعزل سجل الجلسة وحالة KV، وصادِق على كل مستخدم، وحدّد السياق والتزامن، وجدول العمل في الخلفية بشكل منفصل عن الدردشة التفاعلية. يصبح الذكاء الاصطناعي متعدد المستخدمين موثوقًا عندما تخطّط لحالة كل جلسة وسلوك قائمة الانتظار بدلًا من مضاعفة عملية النموذج.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

أفضل 10 واجهات ويب للذكاء الاصطناعي المحلي لمختبرات المنزل في عام 2026
قارن بين 10 واجهات ويب للذكاء الاصطناعي المحلي المستضاف ذاتيًا لمختبرات المنازل، مع تغطية دعم Ollama، وتقنية RAG، والوكلاء، والوصول متعدد المستخدمين، وسهولة الإعداد،...

كم تبلغ تكلفة GPT-6 Astra بمرور الوقت؟ ومتى يكون الذكاء الاصطناعي السحابي خيارًا منطقيًا مقارنةً بالذكاء الاصطناعي المحلي؟
دليل عملي لتكلفة GPT-6 Astra يغطي استخدام الرموز، وأحمال عمل الذكاء الاصطناعي طويلة الأمد، والمفاضلة بين السحابة والتشغيل المحلي، ولماذا تُعد البنية التحتية الهجينة...

GPT-6 Astra مقابل الذكاء الاصطناعي المحلي: ما الأجزاء من الوكيل التي ينبغي أن تبقى على خادمك المنزلي؟
يمكن لـ GPT-6 Astra أن يبقى في السحابة، بينما يحتفظ خادمك المنزلي بالملفات والذاكرة وRAG والأدوات والأذونات وحالة الوكيل الدائمة محليًا.

