لا يحتاج مساعد المستندات المحلي إلى ذاكرة VRAM مخصصة عندما تتم عملية التوليد عن بُعد أو على خادم استدلال منفصل. أما بالنسبة إلى الاستدلال على الجهاز نفسه، فتُعد سعة 8 جيجابايت نقطة بداية عملية للنماذج الصغيرة المكمّمة، بينما قد تتجاوز المتطلبات 16–24 جيجابايت بكثير مع النماذج الأكبر، والسياق الأطول، وتعدد الطلبات. حدّد حجم النموذج الدقيق وسياق العمل قبل الشراء، لأن تطبيق RAG نفسه لا يحدد متطلبات VRAM.
حدّد ما إذا كان المساعد يحتاج فعلاً إلى وحدة معالجة رسومات محلية
يتكون مساعد المستندات من طبقتين على الأقل: التطبيق الذي يخزّن الملفات، ويقسّم النصوص، ويبحث عن المقاطع أو يسترجعها، ويعرض الإجابات؛ والواجهة الخلفية للنموذج التي تنفّذ عملية التوليد. ولا يلزم تشغيل هاتين الطبقتين على العتاد نفسه. يمكن لخادم صغير استضافة مكتبة المستندات الخاصة ومجموعة أدوات الاسترجاع، مع إرسال طلبات النموذج إلى جهاز محلي آخر مزود بوحدة معالجة رسومات أو إلى مزود خدمة عن بُعد.
توضح وثائق الاستضافة الذاتية لـ AnythingLLM هذا الفصل بوضوح، إذ تتيح للتطبيق الاتصال بخدمات النماذج والتضمين الموجودة في أماكن أخرى. لذلك فإن متطلبات الاستضافة الذاتية أقل بكثير من العتاد اللازم لتشغيل نموذج لغوي كبير على الجهاز نفسه.
إذا كان المطلوب هو «بقاء المستندات على خادمي» وليس «توليد كل رمز من رموز النموذج على هذا الخادم»، فقد يكون شراء جهاز من دون VRAM مخصصة خيارًا صالحًا. ومع ذلك، يجب التحقق من النصوص التي تغادر الجهاز، ومكان إنشاء التضمينات، وطريقة تعامل النموذج البعيد مع الطلبات، وما إذا كان حد الخصوصية يتوافق مع حالة الاستخدام.
قرار الشراء الأول معماري: فعند استخدام الاستدلال عن بُعد أو على جهاز منفصل، حدّد سعة وحدة المعالجة المركزية وذاكرة RAM والتخزين وفقًا لمتطلبات الاسترجاع؛ أما عند استخدام الاستدلال على الجهاز نفسه، فتصبح VRAM عاملًا أساسيًا في اختيار النموذج.
حدّد أوزان النموذج قبل إضافة أعباء RAG
يبدأ تخطيط VRAM بتحديد النموذج الدقيق ودقة التمثيل. فأوزان الدقة الكاملة أكبر بكثير من إصدارات 8 بت أو 4 بت، ولهذا قد تختلف متطلبات الذاكرة كثيرًا بين مستخدمين يقولان «أشغّل نموذجًا بحجم 7B». يمكن للتكميم أن يجعل نموذجًا صغيرًا مفيدًا مناسبًا لعتاد شائع، لكنه قد يغيّر سلوك المخرجات أيضًا، ولذلك ينبغي تقييمه باستخدام مهمة المستندات الفعلية.
توضح Hugging Face أن التكميم يقلل تكاليف الذاكرة والحوسبة من خلال تمثيل الأوزان والتنشيطات بأنواع بيانات أقل دقة، كما يدعم مسارات شائعة بدقة 8 بت و4 بت. وهذا يجعل الدقة متغيرًا في قرار الشراء، وليس مجرد إعداد برمجي يُطبّق بعد اختيار العتاد.
كقاعدة تقريبية للتخطيط الحالي، غالبًا ما تناسب النماذج من فئة 7–8B المكمّمة بدقة 4 بت نطاق 6–8 جيجابايت، بينما تتجه النماذج من فئة 13–14B عادةً إلى نحو 10–12 جيجابايت، وغالبًا ما تحتاج النماذج من فئة 27–32B إلى نطاق يقارب أوائل العشرينات من الجيجابايت قبل إضافة هامش للسياق. ويقدم دليل Spheron لتحديد VRAM أرقامًا مشابهة للتخطيط باستخدام INT4، ويضيف صراحةً الأعباء التشغيلية إلى جانب تقدير حجم الأوزان.
لا تشترِ سعة تساوي حجم ملف النموذج الذي تم تنزيله بالضبط. اترك مساحة لبيئة التشغيل وحالة السياق، ثم تحقّق من النموذج الفعلي داخل محرك الاستدلال المقصود. فقد ينجح تحميل نموذج باستخدام طلب اختباري قصير، ثم يفشل أو ينقل بعض العمليات إلى موارد أخرى عندما يتلقى المساعد سياقًا طويلًا مسترجعًا.
قد يغيّر طول السياق فئة VRAM بعد نجاح تحميل النموذج
غالبًا ما يحتاج مساعد المستندات إلى سياق أكبر من روبوت الدردشة العادي، لأن المقاطع المسترجعة والاستشهادات وتعليمات النظام وسجل المحادثة وأسئلة المستخدم تُجمع في طلب واحد. وقد تظل أوزان النموذج ثابتة، بينما تنمو ذاكرة التخزين المؤقت للقيم والمفاتيح وغيرها من حالات الطلب مع زيادة طول السياق.
تُظهر وثائق السياق الحالية في Ollama هذه المفاضلة بوضوح: إذ يزداد طول السياق الافتراضي مع توفر VRAM، من 4K عند أقل من 24GiB إلى 32K عند 24–48GiB، وإلى مستويات أعلى بكثير عند توفر 48GiB أو أكثر. وهذه الإعدادات الافتراضية خيارات خاصة ببيئة التشغيل، لكن درس الشراء هو أن العمل على المستندات بسياق طويل يستهلك ذاكرة تتجاوز أوزان النموذج.
لا تعالج المشكلة بزيادة السياق إلى الحد الأقصى دون تمييز. ينبغي للاسترجاع اختيار أصغر مجموعة من المقاطع التي تجيب عن السؤال، كما ينبغي للتقسيم أو إعادة الترتيب إزالة النص غير ذي الصلة قبل التوليد. فمساعد المستندات الذي يحتاج إلى حشو كل المستندات في مطالبة واحدة يستخدم VRAM لتعويض ضعف تصميم الاسترجاع.
انتقل إلى فئة VRAM التالية عندما يكون النموذج المختبر دقيقًا بما يكفي، لكن تتسبب مطالبات المستندات الفعلية في نقل بعض العمليات، أو أخطاء نفاد الذاكرة، أو زمن استجابة غير مقبول عند طول السياق الذي تحتاج إليه فعلًا. وإذا كانت جودة الاسترجاع ضعيفة قبل وصول السياق إلى النموذج، فأصلح الفهرس والترتيب أولًا.
خصّص ميزانية منفصلة للتضمينات وإعادة الترتيب والتعرّف الضوئي على الحروف وتعدد الطلبات
النموذج اللغوي المحلي ليس المكوّن الوحيد الذي قد يستخدم ذاكرة وحدة معالجة الرسومات. فبعض مساعدين المستندات يسرّعون أيضًا التضمينات، أو نماذج إعادة الترتيب، أو التعرّف الضوئي على الحروف، أو تفريغ الكلام، أو نماذج الرؤية على وحدة معالجة الرسومات نفسها. وقد يؤدي تشغيل هذه النماذج في الوقت نفسه إلى تقليل VRAM المتاحة للمولّد، حتى إذا كان كل مكوّن مناسبًا عند اختباره منفردًا.
تشرح مقالة ZimaSpace حول البصمة الكاملة لذاكرة النموذج سبب ضرورة احتساب المخازن المؤقتة التشغيلية وحالة الطلب إلى جانب حجم نقطة التحقق. وبالنسبة إلى مساعد المستندات، يضيف السياق المسترجع والخدمات المتوازية طبقة أخرى من الضغط على الذاكرة المشتركة.
يغيّر تعدد الطلبات الإجابة أيضًا. فقد يحتاج مستخدمان نشطان إلى حالتي KV-cache منفصلتين حتى عند اشتراكهما في نموذج مقيم واحد. ويمكن لخادم موجه للمعالجة الدفعية تحسين الاستفادة من المسرّع، لكنه لا يلغي الذاكرة اللازمة لكل طلب. قِس أطول استعلام مستندي عادي في ظل العدد المتوقع من المستخدمين المتزامنين.
إذا كان المولّد هو حمل العمل الوحيد على وحدة معالجة الرسومات، فيمكنك اختيار سعة أقرب إلى مجموعة العمل المختبرة. أما إذا كان يجب تشغيل التعرّف الضوئي على الحروف والتضمينات وإعادة الترتيب والتوليد بالتوازي، فإما أن تشتري VRAM أكبر، أو تجعل المراحل الثقيلة متسلسلة، أو توزّع الخدمات بين موارد وحدة المعالجة المركزية ووحدة معالجة الرسومات. والخيار الأقل تكلفة هو الذي يحافظ على زمن الاستجابة المطلوب من دون الدفع مقابل تسريع غير مستخدم.
استخدم فئات VRAM لتضييق قائمة النماذج، ثم اختبر الجودة
يمكن تنظيم قائمة مختصرة مفيدة وفقًا لما يجب أن ينجزه مساعد المستندات، بدلًا من اختيار أكبر نموذج يمكن تحميله. عند سعة 6–8 جيجابايت من VRAM، ابدأ بنماذج صغيرة من فئة 7–8B مكمّمة بدقة 4 بت مع استرجاع مضبوط. وعند 12–16 جيجابايت، تحصل على مساحة أكبر للنماذج الأضخم، أو الدقة الأعلى، أو السياق الأطول. وعند 24 جيجابايت، تصبح نماذج كثيرة من فئة 27–32B المكمّمة عملية مع هامش عمل أكبر. أما سعة 40–48 جيجابايت تقريبًا أو أكثر، فهي الفئة التي تبدأ فيها نماذج 70B المكمّمة بدقة 4 بت بأن تصبح واقعية من دون نقل مكثف للعمليات.
يشير دليل SitePoint لعام 2026 حول النماذج اللغوية المحلية إلى أن نموذج 7B من نوع Q4_K_M يمكنه العمل بسهولة مع نحو 6 جيجابايت من VRAM. وتضع أدلة أخرى حديثة لتحديد السعة النماذج المكمّمة بحجم 14B و32B في مستويات أعلى، ما يعزز قاعدة أن الفئة تتحدد وفق نقطة التحقق الفعلية، لا وفق تسمية عامة مثل «حاسوب للذكاء الاصطناعي».
أنشئ مجموعة تقييم من مستنداتك الخاصة قبل شراء الفئة التالية. أدرج أسئلة تتطلب استخراجًا دقيقًا، وتركيبًا للمعلومات من مقاطع متعددة، ورفضًا عند غياب المصدر، وجداول أو نصًا منظمًا عند الحاجة، إلى جانب أطول سياق تتوقع استخدامه. وقارن جودة الإجابات، وسلوك الاستشهادات، وزمن ظهور الرمز الأول، وسرعة التوليد، وذروة استهلاك VRAM.
اشترِ VRAM أكبر عندما يفشل النموذج الأصغر لأن قدرته أو سعة سياقه غير كافيتين فعلًا. ولا تقم بالترقية لمجرد وجود نقطة تحقق أكبر. فقد يجعل الاسترجاع نموذجًا أصغر وأسرع أكثر فائدة لقاعدة معرفية خاصة ومحددة من نموذج أبطأ ذي إسناد ضعيف إلى المصادر.
أبقِ مضيف التخزين والاسترجاع منفصلًا عن قرار VRAM
يحتاج مساعد المستندات أيضًا إلى تخزين دائم للملفات الأصلية، والنصوص المستخرجة، والفهارس، وقواعد بيانات التطبيقات، والسجلات، والنسخ الاحتياطية. وتستهلك هذه الأصول عادةً ذاكرة النظام وسعة القرص، لا VRAM. ويؤدي جمع كل الموارد في رقم واحد باسم «ذاكرة الذكاء الاصطناعي» إلى قرارات عتادية سيئة.
يصف عرض ZimaSpace حول مساعد الذكاء الاصطناعي الخاص على NAS دور الملفات المحلية المعتمد أولًا على الاسترجاع. وتتيح هذه البنية بقاء نظام التخزين مستقرًا حتى عند تغيير عتاد الاستدلال لاحقًا.
يُعد ZimaBoard 2 1664 مناسبًا عندما تتمثل مهمة الخادم الصغير في تخزين المستندات، والفهرسة، والتطبيقات، والتنسيق، بينما يعمل النموذج اللغوي عن بُعد أو على جهاز منفصل مزود بوحدة معالجة رسومات. ولا ينبغي اعتبار رسومات Intel المدمجة فيه VRAM مخصصة للنماذج اللغوية الكبيرة.
اختر مضيف التخزين وفقًا لحجم المستندات، والنسخ الاحتياطية، وذاكرة التطبيق، واحتياجات الشبكة. واختر المسرّع وفقًا للنموذج الدقيق، والتكميم، والسياق، وتعدد الطلبات. ويسمح فصل هذين القرارين بترقية وحدة معالجة الرسومات من دون إعادة بناء مخزن المستندات الأساسي.
تحقق من أي إعداد لوحدة معالجة الرسومات على الجهاز نفسه قبل الشراء
إذا كنت تريد جمع التخزين والاسترجاع والتوليد المحلي في هيكل واحد، فإن الفحص النهائي قبل الشراء هو سعة ذاكرة وحدة معالجة الرسومات المتاحة فعليًا لبيئة التشغيل. لا توضح أسماء المنتجات مثل «للذكاء الاصطناعي» أو «للمبدعين» أو «RTX» ما إذا كان النموذج المحلي المختار سيعمل عليها. لذلك يجب التحقق من VRAM، ودعم برامج التشغيل، والوصول من الحاويات، والطاقة، والتبريد، وإمكانات التوسعة الفعلية.
تُعد ZimaCube 2 Creator Pack خيار Zima الذي ينبغي تقييمه عندما يريد المشتري تخزينًا متعدد الفتحات ووحدة معالجة رسومات NVIDIA مخصصة في النظام نفسه. وتحدد صفحة المنتج الحالية عائلة وحدة معالجة الرسومات، لكنها لا تنشر رقم VRAM في نص المواصفات الرئيسي، لذلك لا تنسبها إلى فئة نموذج بسعة 8 أو 16 أو 24 أو 48 جيجابايت قبل تأكيد سعة الذاكرة المثبتة فعليًا.
قبل إتمام الشراء، شغّل اختبارًا بنموذج ممثل أو اطلب إجراءه متى أمكن. سجّل ذروة VRAM مع التكميم والسياق المعتادين، ثم كرر الاختبار مع تفعيل التضمينات وإعادة الترتيب والتعرّف الضوئي على الحروف أو خدمات وحدة معالجة الرسومات الأخرى الخاصة بالمساعد. وتأكد من أن بيئة التشغيل تستخدم وحدة معالجة الرسومات المقصودة فعلًا، بدلًا من نقل الطبقات بصمت إلى ذاكرة النظام.
القاعدة النهائية هي شراء VRAM وفق مجموعة العمل التي تم التحقق منها، لا وفق الفئة التسويقية. استخدم صفرًا من VRAM المخصصة عندما يمكن تشغيل الاستدلال في مكان آخر؛ وابدأ بنحو 6–8 جيجابايت للنماذج المحلية الصغيرة المكمّمة؛ وانتقل إلى 12–16 جيجابايت للنماذج الأكبر أو للحصول على هامش إضافي؛ ولا تفكر في 24 جيجابايت أو أكثر إلا عندما يثبت سير عمل المستندات المختبر أن حجم النموذج أو السياق أو تعدد الطلبات يحتاج إليها.
الأسئلة الشائعة
هل يقلل RAG مقدار VRAM الذي أحتاج إليه؟
يمكن لـ RAG أن يتيح لنموذج أصغر الإجابة اعتمادًا على الأدلة المسترجعة بدلًا من الاعتماد على المعرفة الداخلية لنموذج أكبر، ما قد يقلل فئة النموذج التي تحتاج إليها. لكن المقاطع المسترجعة لا تزال تستهلك ذاكرة السياق، ولذلك قد يؤدي الاسترجاع الضعيف الذي يرسل نصًا زائدًا إلى زيادة الضغط على VRAM.
هل تتطلب نماذج التضمين مقدار VRAM نفسه الذي يتطلبه نموذج المحادثة؟
لا. فلنماذج التضمين بصمتها الخاصة على وحدة المعالجة المركزية أو ذاكرة RAM أو وحدة معالجة الرسومات، ويمكنها العمل على وحدة المعالجة المركزية أو عبر خدمة منفصلة. وإذا اشتركت التضمينات والتوليد في وحدة معالجة رسومات واحدة، فقِس ذروة استهلاكهما المجمّعة بدلًا من جمع أحجام ملفات النماذج على الورق.
دليل الشراء
المزيد للقراءة

كيفية ترجمة مواصفات وحدة المعالجة المركزية (CPU) والذاكرة العشوائية (RAM) وعمليات الإدخال والإخراج في الثانية (IOPS) إلى أداء Plex
دليل شراء لتحويل قياسات عبء عمل Plex إلى الحد الأدنى من متطلبات وحدة المعالجة المركزية والذاكرة العشوائية والتخزين والشبكة دون شراء مواصفات تفوق الحاجة.

كيفية إعداد قائمة مختصرة بخوادم منزلية لـ Plex باستخدام معايير مُرجّحة
مصفوفة شراء قابلة لإعادة الإنتاج لـ Plex تفصل بين الشروط الإلزامية والتفضيلات، وتكشف مواطن عدم اليقين قبل الشراء.

ما دورة الدعم والترقية التي ينبغي لخادم Plex توفيرها؟
إطار شراء بنظام النجاح أو الفشل لدعم خادم Plex، وسجل التحديثات، والتوافق، وقابلية الإصلاح، والتكاليف، والجاهزية للترحيل.

