يُعد Qwen3.5-9B أفضل نموذج ذكاء اصطناعي محلي شامل لمعظم أجهزة الكمبيوتر الاستهلاكية في عام 2026.
مع ذلك، قد يتغير الاختيار الأفضل حسب عبء العمل لديك: فالنماذج المدمجة أسرع على وحدات المعالجة المركزية وأجهزة الكمبيوتر المحمولة، وتقدم النماذج ذات 8B–14B عادةً أفضل توازن بين الجودة والذاكرة، بينما تكون النماذج الأكبر أو نماذج مزيج الخبراء مناسبة عندما تكون دقة البرمجة أو الاستدلال أو تعدد الوسائط أهم من السرعة.
تعتمد المقارنة أدناه على عمليات نشر عملية بدقة 4 بت كأساس لها، بحيث يمكنك مطابقة النموذج مع سعة RAM أو VRAM المتوفرة لديك قبل تنزيل عشرات الغيغابايت من الأوزان.
مقارنة نماذج الذكاء الاصطناعي المحلية: القائمة المختصرة
| الترتيب | النموذج | الأفضل لـ | الحجم التقريبي بدقة 4 بت | الأجهزة العملية للبدء | المقايضة الأساسية |
|---|---|---|---|---|---|
| 1 | Qwen3.5-9B | الأفضل إجمالًا | 6–8 غيغابايت | ذاكرة RAM بسعة 16 جيجابايت أو VRAM بسعة 8–12 جيجابايت | تتطلب السياقات الطويلة ذاكرة أكبر بكثير |
| 2 | Gemma 4 12B | العمل متعدد الوسائط | 9–12 غيغابايت | ذاكرة RAM بسعة 24 غيغابايت أو VRAM بسعة 12–16 غيغابايت | أثقل من النماذج النصية فقط |
| 3 | gpt-oss-20b | الاستدلال المحلي | نحو 16 غيغابايت بتنسيق MXFP4 | ذاكرة موحّدة أو VRAM بسعة 16 غيغابايت | يتطلب أجهزة استهلاكية متطورة |
| 4 | Ministral 3 14B Instruct | الوكلاء واستخدام الأدوات | 9–12 غيغابايت | ذاكرة RAM بسعة 24 غيغابايت أو VRAM بسعة 12–16 غيغابايت | أبطأ من النماذج الأصغر ذات 8B–9B |
| 5 | Qwen3-Coder-30B-A3B | البرمجة المحلية | 18–22 غيغابايت | ذاكرة RAM بسعة 32 غيغابايت أو VRAM بسعة 24 غيغابايت | تظل الأوزان الإجمالية كبيرة رغم وجود 3.3 مليار مَعلمة نشطة |
| 6 | DeepSeek-R1-Distill-Qwen-14B | الاستدلال بميزانية محدودة | 9–11 غيغابايت | ذاكرة RAM بسعة 24 غيغابايت أو VRAM بسعة 12–16 غيغابايت | قد تكون مخرجات الاستدلال مطوّلة وبطيئة |
| 7 | Qwen3-VL-8B Instruct | الصور والمستندات | 7–10 غيغابايت، بما في ذلك مكونات الرؤية | ذاكرة RAM بسعة 16–24 غيغابايت أو VRAM بسعة 12 غيغابايت | تؤثر دقة الصورة في استهلاك الذاكرة |
| 8 | Phi-4 Mini Instruct | الاستدلال على الأجهزة الصغيرة | 3–5 غيغابايت | ذاكرة RAM بسعة 8–16 غيغابايت أو VRAM بسعة 6 غيغابايت | معرفة أقل شمولًا من النماذج الأكبر |
| 9 | Gemma 3n E4B | الذكاء الاصطناعي متعدد الوسائط للأجهزة المحمولة وذات الموارد المحدودة | 4–7 غيغابايت | ذاكرة RAM موحّدة بسعة 8–16 غيغابايت | يختلف دعم بيئات التشغيل حسب المنصة |
| 10 | Llama 3.2 3B Instruct | توافق واسع مع منظومة بيئات التشغيل | 2–4 غيغابايت | ذاكرة RAM بسعة 8 جيجابايت أو VRAM بسعة 4–6 جيجابايت | أقدم وأقل قدرة من النماذج الصغيرة الأحدث |
أرقام الذاكرة تقديرات للتخطيط وليست ضمانات. وهي تفترض إصدارًا عمليًا بدقة 4 بت حيثما كان متاحًا، مع نافذة سياق متوسطة. وقد تضيف تكاليف التشغيل الإضافية، وذاكرة التخزين المؤقت KV، ومشفّرات الرؤية، وحجم الدفعة، وتفريغ المعالجة إلى GPU عدة غيغابايت.
كيف اخترنا أفضل النماذج للاستخدام المحلي
هذا ليس تصنيفًا يعتمد على نتائج الاختبارات فقط. فالنموذج الذي يتفوق في اختبار ما، لكنه لا يمكن تشغيله على جهازك، ليس أفضل نموذج محلي لك. أعطينا الأولوية لخمسة عوامل: جودة المخرجات المفيدة، وملاءمة واقعية للأجهزة الاستهلاكية، وتوافر بيئات تشغيل محلية أو إصدارات مكمّمة، وتغطية المهام، وسهولة الترخيص أو الوصول.
تعاملنا أيضًا مع مصطلح «الأجهزة الاستهلاكية» بمعناه الواسع: أجهزة كمبيوتر Windows وLinux، وأجهزة Mac المزودة بمعالجات Apple Silicon، وخوادم منزلية مدمجة، ومختبرات منزلية تتمحور حول أجهزة NAS. إذا كنت تختار المكونات أولًا، فاستخدم دليل الأجهزة الاقتصادية لخادم الذكاء الاصطناعي المحلي لتحديد مواصفات النظام الكامل بدلًا من التركيز على ذاكرة GPU وحدها.
1. Qwen3.5-9B — أفضل نموذج ذكاء اصطناعي محلي إجمالًا
يُعد Qwen3.5-9B التوصية الأكثر توازنًا لحاسوب حديث بذاكرة 16 جيجابايت أو لوحدة معالجة رسومات بذاكرة 8–12 جيجابايت. فهو صغير بما يكفي لتشغيله بتنسيق مُكمَّم عملي، لكنه قادر بما يكفي للمحادثة، والتلخيص، والتوليد المعزّز بالاسترجاع، والعمل متعدد اللغات، والبرمجة الخفيفة.

تسرد بطاقة النموذج الرسمية نافذة سياق أصلية تبلغ 262,144 رمزًا، لكن لا ينبغي أن يصبح هذا الرقم إعدادك المحلي الافتراضي. تنمو ذاكرة التخزين المؤقت للمفاتيح والقيم مع حجم السياق، لذا ابدأ بنحو 8 آلاف إلى 16 ألف رمز، وزِد الحجم فقط عندما تبرر أعباء العمل ذلك. ويساعد هذا على إبقاء زمن الاستجابة واستخدام الذاكرة تحت السيطرة.
- اختره إذا: كنت تريد نموذجًا واحدًا متعدد الأغراض للاستخدام المحلي اليومي.
- تخطّه إذا: كانت مهمتك الأساسية هي توليد الشيفرة المتقدم أو فهم الصوت والفيديو.
- النقطة المثلى: تكميم 4 بت على وحدة معالجة رسومات بسعة 12 جيجابايت، أو استدلال هجين بين وحدة المعالجة المركزية ووحدة معالجة الرسومات مع ذاكرة نظام بسعة 16–24 جيجابايت.
2. Gemma 4 12B — الأفضل للذكاء الاصطناعي المحلي متعدد الوسائط
يُعد Gemma 4 12B الخيار الأقوى عندما يعني «الذكاء الاصطناعي المحلي» أكثر من مجرد النصوص. تصف بطاقة النموذج من Google إدخالًا أصليًا للنصوص والصور والصوت والفيديو، ونافذة سياق تصل إلى 256 ألف رمز، ودعمًا متعدد اللغات لأكثر من 140 لغة، وبنية مصممة للتنفيذ المحلي المبسّط.
تضيف هذه المرونة أعباءً إضافية. خطط لذاكرة وصول عشوائي للنظام بسعة 24 جيجابايت أو ذاكرة فيديو بسعة 12–16 جيجابايت لتشغيل مُكمَّم مريح، ثم اترك سعة إضافية لمدخلات الوسائط. وهو مفيد خصوصًا لتحليل الصور الخاصة، وفهم المستندات، وسير عمل وسائط الاجتماعات، والبحث متعدد الوسائط.
- اختره إذا: كنت تحتاج إلى نموذج واحد لفهم النصوص والوسائط.
- تخطّه إذا: كنت تحتاج فقط إلى محادثة نصية سريعة على حاسوب محمول بذاكرة 8 جيجابايت.
- النقطة المثلى: ذاكرة فيديو بسعة 16 جيجابايت أو ذاكرة موحّدة بسعة 32 جيجابايت.
3. gpt-oss-20b — الأفضل للاستدلال عالي الجودة على وحدة معالجة رسومات استهلاكية
يستهدف gpt-oss-20b الفئة العليا من الأجهزة الاستهلاكية. وتقول OpenAI إنه يمكن تشغيله بذاكرة سعتها 16 جيجابايت، بينما يوصي دليل Ollama الرسمي بذاكرة فيديو أو ذاكرة موحّدة لا تقل عن 16 جيجابايت للنموذج الأصغر.
إنه مناسب جدًا للمستخدمين الذين يريدون استدلالًا متأنيًا، أو مخرجات منظمة، أو تجارب محلية دون الانتقال إلى وحدات معالجة رسومات من فئة محطات العمل. لكن العائق العملي هو أن سعة 16 غيغابايت تمثل نقطة بداية وليست هامشًا واسعًا: فقد تؤدي السياقات الطويلة، أو الطلبات المتوازية، أو التنسيقات غير MXFP4 إلى زيادة استهلاك الذاكرة.
- اختره إذا: كانت جودة الاستدلال أهم من زمن الاستجابة المنخفض.
- تجاوزه إذا: كانت لديك ذاكرة VRAM بسعة 8 غيغابايت فقط أو كنت تعتمد على الاستدلال باستخدام وحدة المعالجة المركزية وحدها.
- النقطة المثلى: وحدة معالجة رسومات بسعة 16–24 غيغابايت أو نظام Apple Silicon مزود بذاكرة موحدة لا تقل عن 24 غيغابايت.
4. Ministral 3 14B Instruct — الأفضل للوكلاء المحليين واستخدام الأدوات
يجمع Ministral 3 14B Instruct بين النص والرؤية مع دعم أصلي لاستدعاء الدوال، وإخراج JSON، ودعم متعدد اللغات، والالتزام القوي بموجّه النظام. وتطرح Mistral هذه العائلة للنشر على الأجهزة الطرفية، وتشير إلى أن نموذج 14B يعمل ضمن ذاكرة VRAM بسعة 24 غيغابايت بصيغة FP8، مع متطلبات أقل بعد إجراء مزيد من التكميم.
بالنسبة إلى مساعد منزلي خاص يستدعي أدوات البحث أو الأتمتة أو الملفات، قد تكون ميزات الموثوقية هذه أهم من تفوق صغير في الاختبارات المعيارية. وينبغي أن تتسع نسخة 4-بت على الأجهزة ذات الذاكرة الأقل، لكن ذاكرة VRAM بسعة 12–16 غيغابايت توفر نطاق تشغيل أكثر راحة.
- اختره إذا: كنت تبني وكلاء يستخدمون الأدوات أو سير عمل منظمًا.
- تجاوزه إذا: كانت أولويتك تحقيق أقصى عدد من الرموز في الثانية على وحدة معالجة رسومات للمبتدئين.
- النقطة المثلى: ذاكرة VRAM بسعة 16 غيغابايت ونافذة سياق متوسطة.
5. Qwen3-Coder-30B-A3B Instruct — أفضل نموذج برمجة محلي
Qwen3-Coder-30B-A3B Instruct مصمم خصيصًا للبرمجة الوكيلة، وفهم المستودعات على نطاق واسع، واستدعاء الدوال. وتضم بنيته القائمة على مزيج من الخبراء 30.5 مليار مُعامل إجمالًا، لكنها تُفعّل نحو 3.3 مليارات مُعامل لكل رمز، ما يساعد على تحسين كفاءة الحوسبة دون إلغاء الحاجة إلى تخزين الأوزان الكاملة بعد تكميمها.
هذا التمييز مهم عند التخطيط للأجهزة. ينتمي الإصدار ذي 4 بت عمومًا إلى وحدة معالجة رسومات بسعة 24 غيغابايت أو إلى جهاز يضم ذاكرة نظام لا تقل عن 32 غيغابايت. ويُعد السياق الأصلي بسعة 256K جذابًا للمستودعات الكبيرة، لكن ينبغي للمستخدمين المحليين البدء بحجم أصغر لأن سياق الشيفرة يمكن أن يستهلك سريعًا ذاكرة التخزين المؤقت KV.
- اختره إذا: كانت البرمجة تمثل عبء العمل الأساسي لديك، وكانت لديك ذاكرة رسومية بسعة 24 غيغابايت تقريبًا.
- تخطَّه إذا: كنت تريد مساعدًا خفيفًا للاستخدام اليومي.
- النطاق المثالي: ذاكرة VRAM بسعة 24 غيغابايت، ووحدة تخزين NVMe سريعة، وذاكرة RAM للنظام بسعة 64 غيغابايت لتوفير هامش إضافي.
6. DeepSeek-R1-Distill-Qwen-14B — أفضل نموذج استدلال اقتصادي
يُكثّف DeepSeek-R1-Distill-Qwen-14B أنماط الاستدلال التي تعلّمها DeepSeek-R1 في نقطة تحقق كثيفة بحجم 14B مبنية على Qwen2.5. ويظل خيارًا عمليًا للرياضيات والمنطق وحل المشكلات خطوة بخطوة على الأجهزة التي لا يمكنها استضافة نموذج DeepSeek-R1 الكامل.
المقابل هو كفاءة الإخراج. قد تكون مسارات الاستدلال طويلة، ما يزيد زمن الوصول إلى الإجابة واستهلاك الطاقة. استخدم حدًا مناسبًا لعدد الرموز، وخصّصه للمشكلات التي تستفيد من الاستدلال المتأني بدلًا من الدردشة الروتينية.
- اختره إذا: كنت تريد استدلالًا محليًا اقتصاديًا مع إصدارات مُكمَّمة متاحة على نطاق واسع.
- تخطَّه إذا: كنت تفضّل الإجابات الموجزة والفورية على عمق الاستدلال.
- النطاق المثالي: ذاكرة VRAM بسعة 12–16 غيغابايت أو ذاكرة RAM للنظام بسعة 24–32 غيغابايت.
7. Qwen3-VL-8B Instruct — الأفضل للصور وفهم المستندات
يُعد Qwen3-VL-8B Instruct خيارًا متخصصًا في الرؤية واللغة للتعامل مع لقطات الشاشة والصفحات الممسوحة ضوئيًا والمخططات والرسوم البيانية والإجابة عن الأسئلة المرئية. تتضمن إصدارات GGUF الرسمية أوزان Q4_K_M وملفات منفصلة لإسقاط الرؤية، ما يسهّل نشره عبر الأدوات المتوافقة مع llama.cpp.
يعتمد استخدامه الفعلي للذاكرة على عدد الصور ودقتها، لذا اترك هامشًا أكبر مما تتركه لنموذج نصي فقط بحجم 8B. بالنسبة إلى الأرشيفات الخاصة، اجمع بين النموذج وتقنية OCR والاسترجاع بدلًا من إرسال كل صفحة بدقة كاملة ضمن مطالبة واحدة. يوضح دليل مقارنة أجهزة الذكاء الاصطناعي للصور وRAG للمستندات الاختناقات المختلفة.
- اختره إذا: كنت تعمل مع الصور أو ملفات PDF أو لقطات الشاشة أو السجلات المرئية.
- تجنّبه إذا: كان عبء العمل لديك نصيًا بالكامل.
- النطاق المثالي: ذاكرة فيديو بسعة 12 جيجابايت أو ذاكرة نظام مشتركة بسعة 24 جيجابايت.
8. Phi-4 Mini Instruct — الأفضل للاستدلال مع ذاكرة محدودة
صُمّم Phi-4 Mini Instruct للبيئات المقيّدة من حيث القدرة الحاسوبية والحساسة لزمن الاستجابة، مع التركيز على اتباع التعليمات والرياضيات والمنطق. تذكر Microsoft أن نافذة السياق تبلغ 128K، مع أن تحذير الذاكرة المحلية نفسه ينطبق هنا: فالقدرة لا تعني أنه ينبغي لك تخصيص الحد الأقصى للسياق على جهاز صغير.
إنه نموذج أول ذكي لحاسوب مدمج أو حاسوب محمول قديم أو خادم يركّز على وحدة المعالجة المركزية. كما توفر Microsoft إصدارات ONNX محسّنة للنشر على وحدة المعالجة المركزية ووحدة معالجة الرسومات في بيئات سطح المكتب والأجهزة المحمولة.
- اختره إذا: كنت تحتاج إلى الاستدلال ضمن حدود ذاكرة صغيرة.
- تجنّبه إذا: كان الاستدعاء الواسع للحقائق والكتابة الإبداعية على رأس أولوياتك.
- النطاق المثالي: ذاكرة وصول عشوائي للنظام بسعة 8–16 جيجابايت أو وحدة معالجة رسومات بسعة 6 جيجابايت.
9. Gemma 3n E4B — الأفضل للاستخدام متعدد الوسائط على الأجهزة المحمولة ومحدودة الموارد
صُمّم Gemma 3n E4B للعمل بكفاءة على الأجهزة محدودة الموارد، مع دعم إدخالات النصوص والصور والفيديو والصوت. وهو خيار مفيد عندما تكون وحدة معالجة الرسومات المدمجة أو الحاسوب المحمول بذاكرة موحّدة أهم من تحقيق أقصى أداء على أجهزة سطح المكتب.
تحقق من توافق بيئة التشغيل قبل الالتزام بسير عمل معين. قد يتطلب الدعم متعدد الوسائط مكتبات حديثة وواجهات خلفية خاصة بالمنصة، كما قد يتطلب الوصول إلى النموذج الموافقة على شروط ترخيص Google. وعند توفر الدعم، تجعل بصمته الصغيرة خيارًا جذابًا لأدوات ميدانية خاصة وتحليل الوسائط دون اتصال.
- اختره إذا: كنت تريد ميزات متعددة الوسائط على جهاز محمول فعال أو جهاز طرفي.
- تخطَّه إذا: كنت تحتاج إلى أبسط إعداد متعدد المنصات.
- النقطة المثالية: ذاكرة موحدة بسعة 16 جيجابايت مع بيئة تشغيل أصلية محسّنة.
10. Llama 3.2 3B Instruct — أفضل خيار لمنظومة خفيفة
لم يعد Llama 3.2 3B Instruct أحدث نموذج صغير، لكنه يظل مفيدًا بفضل الدعم الواسع لبيئات التشغيل والأدلة والمجتمع. صممت Meta نموذجي النص 1B و3B للحوار متعدد اللغات والاسترجاع والتلخيص والاستخدام على الجهاز.
اختره من أجل التوافق، لا من أجل الذكاء المتصدر لفئته. فهو يعمل على الأنظمة المتواضعة وسهل الدمج، ما يجعله خط أساس موثوقًا لاختبار تطبيق قبل الانتقال إلى نموذج أكبر.
- اختره إذا: كنت تقدر الأدوات الناضجة والتنزيل الصغير.
- تخطَّه إذا: كنت تريد أعلى جودة إخراج متاحة في عام 2026.
- النقطة المثالية: ذاكرة RAM للنظام بسعة 8 جيجابايت، مع إمكانية تفريغ جزء من الحمل إلى GPU.
ما النموذج المناسب لأجهزتك؟
ذاكرة RAM بسعة 8 جيجابايت أو VRAM بسعة 4–6 جيجابايت
ابدأ باستخدام Phi-4 Mini أو Llama 3.2 3B مع تكميم 4-bit. حافظ على السياق بين 4K و8K، وشغّل طلبًا واحدًا في كل مرة، وتوقع أن يكون التوليد عبر CPU قابلًا للاستخدام وليس فوريًا. تعمل الأنظمة الصغيرة جيدًا في التصنيف والتلخيص وRAG البسيط وأتمتة المنزل.
ذاكرة RAM بسعة 16 جيجابايت أو VRAM بسعة 8–12 جيجابايت
يُعد Qwen3.5-9B التوصية الافتراضية. كما يناسب Qwen3-VL-8B الحالات التي تتطلب إدخالًا بصريًا، رغم أنه يحتاج إلى هامش أكبر. توفر هذه الفئة أفضل توازن لأجهزة الألعاب الشائعة وأجهزة MacBook وتجميعات الذكاء الاصطناعي المحلية المدمجة.
ذاكرة RAM بسعة 24–32 جيجابايت أو VRAM بسعة 16 جيجابايت
تصبح نماذج Gemma 4 12B وMinistral 3 14B وDeepSeek-R1-Distill-Qwen-14B وgpt-oss-20b خيارات واقعية. وتفيد فئة وحدات GPU بسعة 16 جيجابايت خصوصًا لأنها تتجنب عمليات النقل البطيئة من CPU إلى GPU، مع الحفاظ على سعة كافية لسياق متوسط.
ذاكرة RAM بسعة 64 جيجابايت أو VRAM بسعة 24 جيجابايت
يُعد Qwen3-Coder-30B-A3B خيارًا عمليًا هنا، إلى جانب الإصدارات المُكمَّمة الأعلى جودة من النماذج الأصغر. تناسب هذه الفئة مساعدين برمجيين جادين، وخدمات محلية متعددة، ومجموعات RAG أكبر، وتجارب باستخدام سياقات أطول.
إذا كان الأداء مخيبًا للآمال، فحدّد عنق الزجاجة الفعلي قبل استبدال النموذج. يساعدك دليلنا حول اختناقات الحوسبة والذاكرة والتخزين والشبكة في الذكاء الاصطناعي المحلي على التمييز بين بطء توليد الرموز وبطء تحميل النموذج أو الاسترجاع.
كيفية تشغيل هذه النماذج محليًا
- اختر بيئة التشغيل. يوفّر Ollama استخدامًا مريحًا عبر سطر الأوامر وواجهة برمجة التطبيقات، بينما يقدّم LM Studio واجهة سطح مكتب سهلة الاستخدام، ويوفّر llama.cpp تحكمًا واسعًا في استدلال GGUF ونقل العمليات إلى العتاد.
- نزّل إصدارًا مكمّمًا. يُعد Q4_K_M نقطة بداية عامة معقولة لنماذج GGUF. توفر التنسيقات ذات عدد البتات الأقل الذاكرة، لكنها قد تقلل الجودة؛ أما التنسيقات ذات عدد البتات الأعلى فتحسّن الدقة، لكنها تستهلك قدرًا أكبر من ذاكرة RAM.
- ابدأ بسياق قصير. اضبطه أولًا على 4K–8K، وراقب الذاكرة والسرعة، ثم زد القيمة تدريجيًا. إن الإعلان عن سياق بسعة 128K أو 256K لا يعني أن السياق الأقصى متاح دون تكلفة.
- انقل الطبقات إلى وحدة معالجة الرسومات. إذا لم يتسع VRAM للنموذج كاملًا، فلا يزال بإمكان النقل الجزئي تسريع الاستدلال، بينما تحتفظ ذاكرة النظام RAM بالباقي.
- اختبر مطالباتك الخاصة. قيّم الدقة وزمن الاستجابة واستدعاءات الأدوات والتنسيق والهلوسات في المهام التي تنفذها فعليًا. لا يمكن للمعايير العامة إعادة إنتاج مستنداتك أو سير عملك.
للحصول على خطة نشر متكاملة، اتبع دليل ZimaSpace لإنشاء خادم ذكاء اصطناعي محلي. وإذا كانت خصوصية البيانات هي السبب الرئيسي لاختيار التشغيل المحلي، فإن دليل خصوصية نماذج اللغة الكبيرة المحلية ذاتية الاستضافة يغطي التخزين والتعرّض للشبكة والسجلات وعناصر التحكم في الوصول.
أين تتناسب أجهزة Zima
لا يتعيّن على نظام الذكاء الاصطناعي المحلي أن يضع التخزين والتنسيق والاستدلال في جهاز واحد. يمكن لـ ZimaBoard 2 تنسيق واجهات برمجة تطبيقات النماذج، والاسترجاع المعزّز بالتوليد (RAG) الخفيف، وعمليات التشغيل الآلية، وخدمات البيانات الخاصة. ويجعله معالج Intel N150 وذاكرة LPDDR5 بسعة تصل إلى 16 جيجابايت ومنفذا 2.5GbE مزدوجان وSATA وتوسعة PCIe أنسب لتشغيل النماذج الصغيرة المعتمدة على وحدة المعالجة المركزية أو للتنسيق، وليس للاستدلال على نماذج اللغة الكبيرة المتقدمة.
بالنسبة إلى مجموعات البيانات الأكبر والعتاد القابل للتوسعة للذكاء الاصطناعي، يجمع ZimaCube 2 بين التخزين متعدد الأقراص، وتوسعة SSD، وThunderbolt 4، وخيارات PCIe. ويمكنه استضافة ملفات النماذج الخاصة وبيانات RAG، بينما يتولى نظام مزود بوحدة معالجة رسومات مهمة الاستدلال، أو يمكن أن يكون مركزًا لمختبر منزلي أكثر تكاملًا للذكاء الاصطناعي. يحافظ هذا الفصل على بياناتك القيّمة محليًا من دون إرغام كل خدمة على العمل على الجهاز الأعلى استهلاكًا للطاقة.
الأسئلة الشائعة
ما أفضل نموذج ذكاء اصطناعي لتشغيله محليًا في عام 2026؟
يُعد Qwen3.5-9B أفضل نقطة بداية شاملة لمعظم المستخدمين، لأنه يوازن بين القدرات والسرعة والأداء متعدد اللغات وحجم مكمّم يمكن التعامل معه. اختر Gemma 4 12B للعمل متعدد الوسائط، أو gpt-oss-20b للاستدلال الأقوى، أو Qwen3-Coder-30B-A3B للبرمجة الجادة.
هل يمكنني تشغيل نموذج ذكاء اصطناعي محلي من دون وحدة معالجة رسومات؟
نعم. يعمل الاستدلال عبر وحدة المعالجة المركزية جيدًا مع النماذج الأصغر بحجم 3B–4B، ويمكنه تشغيل نماذج بحجم 8B–9B إذا كانت لديك ذاكرة RAM كافية، لكن التوليد سيكون أبطأ. يمكن لمعالجات Apple Silicon ووحدات معالجة الرسومات المدمجة الحديثة استخدام الذاكرة المشتركة، بينما تستفيد أنظمة x86 غالبًا من الإسناد الجزئي إلى وحدة معالجة الرسومات.
ما مقدار ذاكرة RAM التي أحتاج إليها لنموذج LLM محلي؟
تكفي 8 غيغابايت للنماذج المكمّمة المدمجة، وتُعد 16 غيغابايت الحد الأدنى العملي للاستخدام الشائع، بينما تتيح 32 غيغابايت تشغيل نماذج بحجم 12B–20B مع هامش مفيد. بالنسبة للأوزان المكمّمة من فئة 30B، قد تكفي 32 غيغابايت لتشغيل النموذج، لكن 64 غيغابايت تكون أكثر راحة عند تشغيل خدمات أخرى واستخدام سياقات طويلة.
هل يفقد النموذج ذي 4 بت من الجودة؟
عادةً بفارق بسيط، لكن نماذج التكميم الجيدة بمعدل 4 بت تحافظ على جودة كافية للدردشة وRAG والمساعدة في البرمجة والاستخدام المنزلي، مع تقليل استهلاك الذاكرة بدرجة كبيرة. يعتمد التأثير الدقيق على النموذج وطريقة التكميم، لذا قارن بين عدد قليل من المطالبات التمثيلية قبل اعتماد إعدادك على نطاق واسع.
هل ذاكرة VRAM أهم من ذاكرة النظام RAM؟
تحدد ذاكرة VRAM عادةً مقدار النموذج الذي يمكن تشغيله بسرعة GPU كاملة. يمكن لذاكرة النظام RAM استيعاب الأوزان التي لا تتسع لها VRAM، لكن نقل البيانات بين وحدة المعالجة المركزية ووحدة معالجة الرسومات يقلل الأداء. تخفف الأنظمة ذات الذاكرة الموحدة هذا الفاصل، إلا أن عرض النطاق الترددي للذاكرة يظل مهمًا.
الحكم النهائي
ابدأ بأصغر نموذج يُكمل مهامك الفعلية بموثوقية. بالنسبة لمعظم الأشخاص، يعني ذلك Qwen3.5-9B؛ وانتقل إلى Gemma 4 12B للمدخلات متعددة الوسائط، أو gpt-oss-20b أو DeepSeek-R1-Distill-Qwen-14B للاستدلال، أو Qwen3-Coder-30B-A3B للبرمجة. طابق مستوى التكميم وطول السياق مع الذاكرة المتاحة لديك، ثم لا تُرقّي العتاد إلا بعد قياس عنق الزجاجة.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

أفضل 10 أطر عمل لوكلاء الذكاء الاصطناعي تستحق التجربة في عام 2026
قارن بين أفضل أطر عمل وكلاء الذكاء الاصطناعي في عام 2026، بما في ذلك LangGraph وOpenAI Agents SDK وCrewAI وGoogle ADK وLlamaIndex وMastra وغير...

لماذا يختلف أداء Jellyfin بين الاتصالات عبر الشبكة المحلية والاتصالات عن بُعد
قد يكون الخادم متطابقًا، لكن الوصول عن بُعد يغيّر ميزانية الشبكة وغالبًا ما يستدعي قرارًا مختلفًا بشأن التوصيل أو تحويل الترميز.

هل يعمل Jellyfin بشكل موثوق خلف CGNAT أو NAT المزدوج؟
يظل خادم الوسائط يعمل بشكلٍ سليم؛ وتتمثل المشكلة العالقة في إنشاء مسار آمن يمكن الوصول إليه عبر ترجمة العناوين، مع معدل نقل مستدام وكافٍ.

