يُعد Qwen3.8-27B عمليًا على نحو غير معتاد بالنسبة إلى نموذج من فئة القدرات هذه. فالإصدار الرسمي هو نموذج كثيف للرؤية واللغة بحجم 27B مع نافذة سياق أصلية من 262,144 رمزًا، في حين يبلغ حجم إصدارات GGUF الحالية ذات الأربعة بتات حوالي 16–18 غيغابايت. وهذا يجعل الاستدلال المحلي المفيد ممكنًا باستخدام وحدة معالجة رسومات NVIDIA واحدة بسعة 24 غيغابايت، أو نظام بذاكرة موحدة كبيرة، أو حتى جهاز يركز على وحدة المعالجة المركزية ويملك ذاكرة RAM كافية—مع أن هذه الإعدادات الثلاثة تقدم سرعات مختلفة جدًا.
بالنسبة إلى معظم المستخدمين المحليين، تتمثل أفضل نقطة بداية في إعداد من فئة Q4 مع ذاكرة نظام لا تقل عن 32 غيغابايت، أو وحدة معالجة رسومات بسعة 24 غيغابايت إذا أردت إبقاء النموذج بالكامل تقريبًا على وحدة معالجة الرسومات. لكن حجم النموذج ليس سوى جزء من حسابات العتاد. إذ يستهلك السياق الطويل ذاكرة إضافية، ويضيف الإدخال متعدد الوسائط مكوّنًا للرؤية، وتبادل تكميمات 1 بت و2 بت الجودة بالسعة، كما يمكن أن يغيّر الاختيار بين Ollama وllama.cpp وvLLM وبيئات التشغيل الأخرى كلًا من التوافق ومعدل المعالجة. يفصل هذا الدليل هذه المتغيرات لتتمكن من اختيار العتاد والتكميم انطلاقًا من متطلبات الحمل.
هل يمكنك تشغيل Qwen3.8-27B محليًا؟
نعم. يُعد Qwen3.8-27B أحد نماذج Qwen عالية القدرات الأكثر واقعية للتشغيل على عتاد المستهلكين. وعلى خلاف Qwen3.8-Flash-Next، الذي يستخدم بنية متناثرة أكبر بكثير، فإن Qwen3.8-27B نموذج كثيف تقليدي بحجم 27B. ويمكن للتكميم تقليل حجم نقطة التحقق الرسمية البالغ نحو 55.6 غيغابايت إلى حوالي 16–18 غيغابايت عند دقة أربعة بتات.
تصف بطاقة النموذج الرسمية لـ Qwen3.8-27B نموذجًا من 64 طبقة مع فهم أصلي للصور والفيديو، وتحكمًا مرنًا في التفكير، ونافذة سياق من 262,144 رمزًا يمكن تمديدها إلى مليون رمز. أصدرت Qwen النموذج في 14 أغسطس 2026 بموجب ترخيص Apache 2.0.
يتمثل الفرق المهم في العتاد المحلي في أن النموذج الكثيف 27B يخزّن جميع أوزان نموذج اللغة ويستخدمها، بدلًا من تنشيط مجموعة فرعية صغيرة من خبراء MoE. لذلك يؤثر التكميم مباشرةً في مقدار ذاكرة RAM أو VRAM المطلوبة.
| النشر | هل يمكنه تشغيل Qwen3.8-27B؟ | التوقعات العملية |
|---|---|---|
| حاسوب صغير بذاكرة وصول عشوائي 16 غيغابايت | فقط مع تكميم شديد العدوانية | ممكن للتجربة، لكن التنازلات في الجودة والسرعة كبيرة |
| حاسوب بذاكرة وصول عشوائي 32 غيغابايت | نعم | يناسب نموذجًا من فئة Q4؛ وتعتمد سرعة وحدة المعالجة المركزية أو وحدة معالجة الرسومات المدمجة بدرجة كبيرة على عرض نطاق الذاكرة |
| حاسوب بذاكرة وصول عشوائي 64 غيغابايت | نعم | سعة مريحة لتكميم Q4/Q6/Q8 مع مساحة أكبر بكثير للسياق |
| وحدة معالجة رسومات بسعة 16 غيغابايت | جزئيًا | يتطلب تكميمًا أصغر، أو سياقًا محدودًا، أو تفريغ بعض العمليات إلى وحدة المعالجة المركزية |
| وحدة معالجة رسومات بسعة 24 غيغابايت | نعم | خيار ممتاز لـ Q4/Q5 ولأحجام سياق عملية عديدة |
| وحدة معالجة رسومات بسعة 32 غيغابايت | نعم | مساحة أكبر لتكميمات أعلى جودة، وحالة KV/ذاكرة التخزين المؤقت، والسياق الطويل |
| وحدة معالجة رسوميات بسعة 48GB | نعم | Q8 مع هامش كبير للاستدلال |
| ذاكرة موحدة بسعة 32GB فأكثر | نعم | تعمل السعة بشكل جيد؛ أما الأداء فيعتمد على النطاق الترددي للذاكرة وتحسين الواجهة الخلفية |
أول خطأ يجب تجنبه هو اعتبار «الملاءمة» و«التشغيل الجيد» سؤالًا واحدًا. يمكن لملف GGUF بحجم 17GB أن يتسع ضمن 32GB من ذاكرة الوصول العشوائي العادية، لكن الاستدلال عبر وحدة المعالجة المركزية باستخدام DDR5 يختلف جذريًا عن وضع النموذج نفسه في ذاكرة فيديو عالية النطاق الترددي بسعة 24GB.
ما مقدار ذاكرة الوصول العشوائي التي يحتاجها Qwen3.8-27B؟
تُعد سعة 32GB من ذاكرة الوصول العشوائي للنظام نقطة البداية العملية لنشر Q4 العادي. يمكن لسعة 16GB استيعاب بعض الإصدارات منخفضة البتات جدًا من الناحية التقنية، لكنها لا تترك هامشًا كبيرًا لنظام التشغيل وحالة السياق ومخازن التشغيل المؤقتة ومعالجة الرؤية والتطبيقات الأخرى.
يبلغ حجم مستودع النموذج الرسمي نفسه نحو 55.6GB. أما للاستدلال المحلي، فسيختار معظم المستخدمين تمثيلًا بصيغة GGUF أو تمثيلًا مكمّمًا آخر بدلًا من تحميل أوزان BF16 الأصلية.
يوفر مستودع Qwen3.8-27B بصيغة GGUF الحالي من Unsloth صورة مفيدة عن نطاق الذاكرة:
| التكميم | الحجم التقريبي للنموذج | ذاكرة الوصول العشوائي المقترحة للنظام | أفضل استخدام |
|---|---|---|---|
| UD-IQ1_M | 6.73GB | 16GB فأكثر | قيود ذاكرة شديدة والتجارب |
| UD-Q2_K_XL | 9.83GB | 16GB فأكثر | أنظمة ذات ذاكرة منخفضة جدًا عندما يتعين التضحية بالجودة لصالح السعة |
| UD-IQ3_S | 12GB | 24–32GB | حل وسط للأجهزة محدودة الإمكانات |
| UD-IQ4_XS | 14.3GB | 24–32GB | نشر مدمج من فئة الأربع بتات |
| UD-Q4_K_M | 16.5GB | 32GB فأكثر | خيار افتراضي قوي للاستخدام المحلي |
| UD-Q4_K_XL | 17.6GB | 32GB فأكثر | خيار Q4 أعلى جودة |
| UD-Q5_K_M | 19.8GB | 32GB فأكثر | جودة أعلى عندما تسمح الذاكرة |
| UD-Q6_K | 22GB | 32GB على الحد / 48GB فأكثر | استدلال محلي أعلى جودة |
| Q8_0 | 29GB | 48–64GB فأكثر | تكميم عالي الجودة مع ضغط أقل |
| BF16 الرسمي | حوالي 55.6GB في المستودع | 64GB على الحد / 96GB فأكثر | النشر المتخصص عالي الذاكرة |
تُعد قيم ذاكرة الوصول العشوائي هذه نطاقاتٍ للتخطيط وليست الحد الأدنى الرسمي لمتطلبات العتاد لدى Qwen. فملف النموذج لا يمثل كامل استهلاك الذاكرة أثناء الاستدلال. يحتاج النظام أيضًا إلى ذاكرة لحالة التشغيل والسياق ونظام التشغيل، وفي أعباء العمل متعددة الوسائط، لمسار الرؤية.
ولهذا السبب، تُعد سعة 32GB حدًا أساسيًا منطقيًا لتكميم Q4، بينما تُعد سعة 64GB التهيئة المحلية الأكثر مرونة للذكاء الاصطناعي. تتيح لك الذاكرة الإضافية زيادة السياق، وتشغيل خدمات أخرى إلى جانب النموذج، واختبار إصدارات Q6 أو Q8، وتجنب العمل بالقرب من الحد الفعلي لذاكرة النظام.
ما مقدار ذاكرة الفيديو التي يحتاجها Qwen3.8-27B؟
إذا كنت تستخدم وحدة معالجة رسوميات منفصلة، فإن الإجابة الأكثر فائدة تتحدد وفقًا للتكميم الذي تريد الاحتفاظ به في ذاكرة الفيديو.
إصدار Ollama القياسي حاليًا هو نموذج Q4_K_M بحجم يقارب 18 جيجابايت. يعرّفه Ollama بأنه بنية qwen35 ذات 27.3 مليار معلمة، ويتضمن مُسقِط رؤية منفصلًا بحجم 461 مليون معلمة بتنسيق BF16. يمكنك فحص الإصدار الحالي على صفحة نموذج Ollama Qwen3.8-27B.
| ذاكرة VRAM لوحدة معالجة الرسوميات | الاتجاه الموصى به | ماذا يعني ذلك |
|---|---|---|
| 8GB | تفريغ مكثف إلى وحدة المعالجة المركزية / تكميم صغير جدًا | ليس خيارًا مثاليًا لـ Qwen3.8-27B |
| 12GB | Q2/Q3 أو تفريغ جزئي | ممكن، لكن التنازلات تصبح كبيرة |
| 16GB | IQ4 أو Q4 جزئي | قابل للاستخدام مع الاختيار الدقيق للتكميم والسياق |
| 20GB | Q4 | يمكن أن تتسع الأوزان الأساسية، لكن تصبح مساحة السياق ووقت التشغيل الاحتياطية مهمة |
| 24GB | النقطة المثالية لـ Q4/Q5 | أحد أقوى الخيارات الاستهلاكية للإقامة الكاملة أو شبه الكاملة على وحدة معالجة الرسوميات |
| 32GB | Q6/Q8 أو Q4 مع سياق كبير | حرية أكبر لذاكرة التخزين المؤقت وأحمال العمل ذات السياق الطويل |
| 48GB | Q8 مع مساحة احتياطية واسعة | النشر على محطات العمل عالية الأداء |
وهذا ما يجعل البطاقات الأقدم بسعة 24 جيجابايت مثيرة للاهتمام بشكل خاص. إذ تتمتع RTX 3090 بسعة VRAM كافية لتشغيل إصدار Qwen3.8-27B من فئة Q4، رغم أنها أقدم بعدة أجيال من وحدات معالجة الرسوميات. وينطبق الأمر نفسه على RTX 4090، بينما توفر RTX 5090 بسعة 32 جيجابايت مساحة أكبر بكثير للتشغيل بدقة أعلى أو بسياق أكبر.
يعتمد الأداء الفعلي على ما هو أكثر بكثير من سعة VRAM. إذ يمكن أن يغيّر عرض النطاق الترددي للذاكرة، والنوى البرمجية، وتنسيق التكميم، وبيئة التشغيل، وفك الترميز التخميني، وتنسيق ذاكرة التخزين المؤقت KV، وطول المطالبة، وحدود الطاقة، عدد الرموز في الثانية.
هل يمكن لـ RTX 3090 أو RTX 4090 تشغيل Qwen3.8-27B؟
نعم. يُعد RTX 3090 أو RTX 4090 بسعة 24 جيجابايت، على نحو يمكن الدفاع عنه، أحد أكثر التكوينات الطبيعية لوحدة معالجة رسوميات واحدة لتشغيل Qwen3.8-27B Q4.
لم يعد الأمر مجرد تقدير للسعة. فقد أسفرت الاختبارات المبكرة التي أجراها المجتمع عن عدة أمثلة ملموسة. أفاد أحد مستخدمي RTX 3090 بتشغيل Q4_K_M مع MTP ونافذة سياق من 64 ألفًا لمهمة برمجة وكيلية. وشغّل مستخدم آخر Qwen3.8-27B على RTX 4090 واحدة مع تفريغ كامل لطبقات النموذج إلى وحدة معالجة الرسوميات وإعداد من 160 ألف رمز، وأفاد بنحو 47–57 رمزًا في الثانية في ذلك الإعداد تحديدًا.
يُعد اختبار المجتمع على RTX 4090 واحدة مفيدًا بشكل خاص لأنه يوضح العلاقة بين أوزان النموذج وسياق الاستخدام: فإدخال نموذج حجمه نحو 17 جيجابايت في ذاكرة VRAM بسعة 24 جيجابايت لا يعني إمكانية تجاهل الجيجابايتات السبعة المتبقية. إذ تحدد اختيارات وقت التشغيل والسياق ما إذا كانت هذه المساحة الاحتياطية كافية.
استخدم مثال لبرمجة باستخدام RTX 3090 وQ4 سياقًا بسعة 64K وذاكرة RAM للنظام بسعة 64 غيغابايت. هذه إعدادات مجتمعية فردية وليست معايير موحّدة لاختبارات Qwen، لكنها تثبت أن البطاقات بسعة 24 غيغابايت مفيدة فعلًا وليست مجرد أهداف نظرية.
بالنسبة إلى المستخدم العادي الذي يبدأ اليوم، يُعدّ تشغيل Q4 على بطاقة بسعة 24 غيغابايت إعدادًا أكثر قابلية للدفاع عنه من محاولة زيادة دقة التكميم إلى أقصى حد. وغالبًا ما يكون ترك بضعة غيغابايت من ذاكرة VRAM متاحة للسياق، وتخصيصات بيئة التشغيل، ومعالجة الرؤية، واستخدام سطح المكتب، أهم من ضغط تكميم أكبر قليلًا على وحدة معالجة الرسومات.
هل يمكن لبطاقة RTX 5090 تشغيل Qwen3.8-27B محليًا؟
نعم، إذ تتيح ذاكرة VRAM بسعة 32 غيغابايت خيارات أكثر بكثير من بطاقة بسعة 24 غيغابايت. والطريقة المباشرة هي تشغيل Q4 أو Q5 أو Q6 مع الاحتفاظ بذاكرة أكبر للسياق وذاكرة التخزين المؤقت. كما أن حزم الاستدلال التجريبية تدفع الحدود إلى أبعد من ذلك بكثير.
على سبيل المثال، استخدم نشر مجتمعي حديث إصدار NVFP4 من Qwen3.8-27B على بطاقة RTX 5090 واحدة، إلى جانب ذاكرة KV مؤقتة مضغوطة وفك ترميز استقرائي باستخدام DFlash2. وأفاد المؤلف بدعم سياق كامل يبلغ 262K ومعدل نقل إجمالي مرتفع جدًا أثناء التشغيل المتزامن. وأفاد اختبار آخر باستخدام نحو 24.5 غيغابايت من ذاكرة VRAM بالقرب من نافذة السياق الكاملة للنموذج بعد تطبيق حزمة استدلال متخصصة.
تُعدّ هذه النتائج عروضًا مفيدة لما يمكن أن يصل إليه الاستدلال المحسّن، لكن لا ينبغي اعتبارها أداءً اعتياديًا على Ollama. فهي تعتمد على صيغ تكميم محددة، ومسارات تشغيل مخصصة أو سريعة التغيّر، وصيغ ذاكرة تخزين مؤقت مضغوطة، وفك ترميز استقرائي.
الخلاصة العملية أبسط: تمنح ذاكرة VRAM بسعة 32 غيغابايت نموذج Qwen3.8-27B مساحة كافية، بحيث يصبح السياق الطويل مسألة ضبط بدلًا من كونه مشكلة أساسية في تشغيل النموذج.
أي إصدار Qwen3.8-27B المكمَّم ينبغي أن تستخدم؟
بالنسبة إلى معظم المستخدمين المحليين، يظل Q4 أفضل نقطة للبدء. الانتقال إلى مستوى أدنى يوفّر الذاكرة بسرعة، لكن التكميم لا يضرّ جميع القدرات بالقدر نفسه. فالبرمجة الوكيلة، والاستدلال الطويل متعدد الخطوات، واستخدام الأدوات، والعمل متعدد الوسائط، كلها مهام يمكن أن تستحق الحفاظ على جودة النموذج فيها بضعة غيغابايت إضافية.
| إذا كانت أجهزتك تحتوي على... | ابدأ بـ | لماذا |
|---|---|---|
| ذاكرة النظام RAM بسعة 16 غيغابايت فقط | Q2 | الأولوية للسعة؛ توقّع تنازلًا ملحوظًا في الجودة |
| ذاكرة RAM بسعة 24–32 غيغابايت | IQ4 / Q4_K_M | توازن جيد بين الحجم وقدرات النموذج |
| ذاكرة RAM بسعة 32–64 جيجابايت | Q4_K_M أو Q4_K_XL | أفضل إعداد افتراضي لمعظم المستخدمين |
| ذاكرة VRAM بسعة 24 غيغابايت | Q4_K_M | يوفّر مساحة أكبر لبيئة التشغيل والسياق مقارنةً بـ Q6 |
| ذاكرة VRAM بسعة 32 غيغابايت | Q5 / Q6 أو Q4 مع سياق طويل | اختر الجودة أو هامش الذاكرة المتاح وفقًا لحِمل العمل |
| ذاكرة VRAM بسعة 48 غيغابايت أو أكثر | Q8 | استدلال محلي عالي الجودة دون ضغط قوي |
| ذاكرة موحّدة بسعة 64 غيغابايت أو أكثر | Q6 / Q8 | السعة تدعم دقة أعلى؛ وعرض النطاق الترددي يحدد السرعة |
إصدار البت الواحد الصغير للغاية مثير للاهتمام لأنه يضغط نموذجًا بحجم 27B إلى نحو 6–7 غيغابايت، لكن ذلك لا يجعله الخيار الواضح للعمل الفعلي. إذا كان هدفك مجرد إثبات إمكانية تشغيل Qwen3.8-27B على ذاكرة صغيرة جدًا، فهو مفيد. أما إذا كان هدفك البرمجة أو تنفيذ الوكلاء أو سير عمل المستندات أو استخدام الأدوات بشكل موثوق، فعادةً ما يكون الحفاظ على دقة أكبر هو المقايضة الأفضل.
قاعدة مفيدة هي:
اختر تكميمًا بأعلى جودة يترك مساحة كافية للسياق وعبء العمل الذي تنوي استخدامه فعليًا.
لا تختر تكميمًا بحجم 22 غيغابايت لمجرد أن بطاقتك بسعة 24 غيغابايت، ثم تكتشف أنه لم يتبقَّ تقريبًا أي مجال لبقية الاستدلال.

ما مقدار الذاكرة التي يحتاج إليها سياق بحجم 262 ألف رمز؟
يدعم Qwen3.8-27B طول سياق أصليًا يبلغ 262,144 رمزًا، لكن لا تحتاج إلى تخصيص سياق قدره 262 ألف رمز لمجرد أن النموذج يدعمه.
يستخدم هذا النموذج بنية انتباه هجينة. يبدّل الإعداد الرسمي بين طبقات Gated DeltaNet وطبقات Gated Attention دورية بدلًا من استخدام الانتباه الكامل التقليدي في كل طبقة. ويساعد ذلك على جعل السياق الطويل جدًا أكثر قابلية للتعامل مما سيكون عليه في محوّل 27B مباشر.
لا يجعل ذلك السياق الطويل مجانيًا.
تستهلك حالة التشغيل، وحالة الانتباه أو الحالة التكرارية، وذاكرة KV المؤقتة عند الاقتضاء، وفك الترميز التخميني، والبيانات متعددة الوسائط، والمعالجة الدفعية، والمخازن المؤقتة الخاصة بالواجهة الخلفية، قدرًا من الذاكرة يتجاوز أوزان النموذج. يمكن لتكميم الذاكرة المؤقتة تقليل هذا الاحتياج، لكنه قد يفرض مقايضات خاصة به في الجودة أو الأداء.
| هدف السياق | مناسب لـ | استراتيجية العتاد |
|---|---|---|
| 8K–16K | الدردشة وأسئلة البرمجة العادية والمستندات القصيرة | نقطة بداية سهلة |
| 32K | المستودعات والمستندات الطويلة وجلسات الوكلاء | إعداد عملي افتراضي جيد |
| 64K | سير عمل أكبر للبرمجة والأبحاث | لا يزال واقعيًا على وحدة معالجة رسومات بسعة 24 غيغابايت باستخدام تكميم وبيئة تشغيل مناسبين |
| 128K | المستودعات الكبيرة والوكلاء الذين يعملون لفترات طويلة | يصبح تخطيط الذاكرة أكثر أهمية |
| 262K | أعباء العمل التي تتطلب أقصى سياق أصلي | استخدمه فقط عندما يحتاج عبء العمل إليه فعلًا |
تُعدّ نافذة السياق البالغة 262 ألف رمز جذابة خصوصًا لبرمجة المستودعات، وتحليل المستندات الخاصة، ومجموعات الأبحاث الكبيرة، وسجلات الوكلاء الطويلة. لكن حجز أقصى سياق لمحادثة من خمس رسائل يهدر ذاكرة كان يمكن استخدامها لتكميم أفضل، أو خدمات محلية أخرى، أو طلبات متزامنة إضافية.
كيفية تشغيل Qwen3.8-27B محليًا باستخدام Ollama
بالنسبة لمعظم المستخدمين، تُعدّ Ollama أبسط خيار لأنها تنشر بالفعل إصدارًا من Qwen3.8-27B يدعم الرؤية والأدوات والتفكير.
يبلغ حجم النموذج الافتراضي الحالي نحو 18GB ويستخدم تكميم Q4_K_M.
ollama run qwen3.8:27b
ينزّل ذلك الأمر النموذج إذا لم يكن موجودًا بالفعل ويفتح جلسة تفاعلية.
يمكنك التأكد من تثبيت النموذج باستخدام:
ollama list
بالنسبة إلى التطبيقات التي تحتاج إلى واجهة API محلية، تكشف Ollama عن خدمتها المحلية عبر نقطة نهاية API المعتادة. يبدو الطلب الأساسي كما يلي:
curl http://localhost:11434/api/chat \
-d '{
"model": "qwen3.8:27b",
"messages": [
{
"role": "user",
"content": "اشرح لقطات ZFS بلغة إنجليزية بسيطة."
}
]
}'
يكون التفكير مفعّلًا افتراضيًا في Qwen3.8. بالنسبة إلى الاستخراج أو التصنيف أو التنسيق أو مهام المساعد البسيطة، قد يؤدي تعطيل التفكير أو تقليله إلى تحسين زمن الاستجابة المُدرَك. أما في مهام البرمجة والوكلاء الصعبة، فقد يكون التفكير الإضافي مستحقًا للتوكنات الإضافية.
تحذّر Qwen نفسها من أن تقليل جهد الاستدلال لا يقلل بالضرورة من إجمالي وقت الإكمال للمهام الوكيلة الطويلة؛ فقد يؤدي التحليل الأضعف إلى محاولات واستدعاءات أدوات إضافية. تدعم بطاقة النموذج الرسمية حاليًا xhigh, متوسط، و منخفض مستويات reasoning-effort، رغم أن عناصر التحكم الدقيقة تختلف باختلاف إطار الاستدلال.
كيفية تشغيل Qwen3.8-27B باستخدام llama.cpp
يمنحك llama.cpp تحكمًا أكبر في اختيار GGUF، وتفريغ المعالجة إلى وحدة معالجة الرسومات، والسياق، والتقديم المحلي.
يمكن تشغيل إصدارات Unsloth الحالية مباشرةً من Hugging Face باستخدام إصدار حديث من llama.cpp:
llama cli \
-hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M
لكشف النموذج كخادم محلي متوافق مع OpenAI:
llama serve \
-hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M
توثّق تعليمات النشر الحالية لـ GGUF أيضًا استخدام Ollama وLM Studio وJan وPi وOpenClaw وHermes Agent وواجهات أمامية أخرى متوافقة.
إذا فشل Qwen3.8-27B وظهر خطأ يذكر قيمة غير معروفة qwen35 البنية، حدّث llama.cpp أو التطبيق القائم على llama.cpp قبل قضاء الوقت في تصحيح أخطاء ملف النموذج. تتطلب البنية الهجينة لـ Qwen دعمًا حديثًا من بيئة التشغيل.
هذه النقطة مهمة لأن Qwen نفسها توصي باستخدام إصدارات حديثة من أطر العمل. وتشير بطاقة النموذج الرسمية إلى أن كفاءة الاستدلال تختلف اختلافًا كبيرًا بين أطر العمل، وتوصي بمحركات تقديم مخصصة مثل vLLM أو SGLang أو TokenSpeed لأحمال الإنتاج والأحمال ذات معدل النقل العالي.
هل ينبغي لك استخدام Ollama أم llama.cpp أم vLLM أم SGLang؟
| بيئة التشغيل | الأفضل لـ | لماذا تختاره |
|---|---|---|
| Ollama | أسرع إعداد | سحب بسيط للنموذج، وواجهة API محلية، وسير عمل ملائم للرؤية والأدوات |
| llama.cpp | التحكم في GGUF والأجهزة الاستهلاكية | تكميم دقيق، وتفريغ المعالجة إلى وحدة معالجة الرسومات، واستدلال محلي متعدد المنصات |
| LM Studio | مستخدمو واجهة سطح المكتب الرسومية | إدارة مريحة للنماذج محليًا فوق بيئات التشغيل المتوافقة |
| vLLM | خدمة وحدات معالجة الرسومات ومعدل النقل | مسار قوي لواجهة API الإنتاجية وتجميع الطلبات |
| SGLang | خدمة محسّنة واستدلال متقدم | مفيد لتجارب الأداء العالي وفك الترميز التخميني |
بالنسبة إلى شخص واحد يشغّل النموذج على محطة عمل مخصصة للألعاب، تكون Ollama أو llama.cpp عادةً نقطة البداية المناسبة. وقد يستفيد خادم ذكاء اصطناعي محلي متعدد المستخدمين، أو فريق برمجة، أو واجهة خلفية لتطبيق، أكثر من vLLM أو SGLang.
هل يمكن تشغيل Qwen3.8-27B على Apple Silicon؟
نعم. تُعد Apple Silicon مناسبة لأنها تشترك بين CPU ووحدة معالجة الرسومات في مساحة ذاكرة موحّدة واحدة. ويمكن لجهاز Mac بسعة 32 غيغابايت أو أكثر استيعاب Qwen3.8-27B من فئة Q4 من دون تقسيم سعة النموذج بين مساحتين منفصلتين لذاكرة النظام وذاكرة VRAM.
لكن السعة لا تساوي سرعة الاستدلال بأسلوب NVIDIA. يعتمد الأداء بدرجة كبيرة على الواجهة الخلفية Metal، ونطاق ترددي للذاكرة، وتهيئة وحدة معالجة الرسومات، ومدى نضج نوى وقت التشغيل لبنية Qwen3.8 الهجينة.
ينبغي النظر إلى جهاز Mac بذاكرة موحّدة سعة 32 غيغابايت على أنه يستهدف أساسًا سعة Q4. أما النظام بسعة 64 غيغابايت أو أكثر، فيوفر مرونة أكبر بكثير لاستخدام Q6/Q8، وسياق أطول، وترك التطبيقات الأخرى مفتوحة. ويمكن لتهيئات Mac Studio ذات الذاكرة الكبيرة تشغيل تمثيلات النموذج الأصلي أو الأعلى دقة، التي يستحيل احتواؤها في وحدات معالجة الرسومات الاستهلاكية العادية، رغم أن السعة الأكبر لا تؤدي تلقائيًا إلى سرعة أعلى لتوليد الرموز.
هل يمكن تشغيل Qwen3.8-27B على AMD Strix Halo؟
نعم. تُعد أنظمة Strix Halo ذات الذاكرة الكبيرة مهمة خصوصًا، لأن منصات Ryzen AI Max يمكنها تخصيص جزء كبير من ذاكرة النظام الموحّدة لوحدة معالجة الرسومات المدمجة.
وهذا يجعل جهاز Strix Halo بسعة 64 غيغابايت أو 128 غيغابايت مختلفًا جوهريًا عن حاسوب محمول تقليدي مزود بوحدة iGPU يمكنها الوصول إلى ذاكرة النظام، لكنها تملك نطاقًا تردديًا محدودًا للذاكرة وموارد محدودة لوحدة معالجة الرسومات. يتسع Qwen3.8-27B Q4 بسهولة من ناحية السعة، ويمكن للأنظمة ذات الذاكرة الأكبر استخدام كمّية أقل حدة مع الحفاظ على مساحة لسياق كبير.
وتتمثل المفاضلة هنا مجددًا في النطاق الترددي ونضج الواجهة الخلفية. يمكن لوحدة RTX 4090 أو RTX 5090 المنفصلة توفير نطاق ترددي أعلى بكثير لذاكرة وحدة معالجة الرسومات، بينما يوفر جهاز بذاكرة موحّدة سعة مشتركة أكبر من دون عمليات نقل عبر PCIe بين ذاكرة CPU وذاكرة VRAM.
ينتج عن ذلك استراتيجيتان صالحتان للذكاء الاصطناعي المحلي:
استراتيجية وحدة معالجة الرسومات المنفصلة: تعظيم سرعة الاستدلال ضمن مساحة صغيرة نسبيًا من ذاكرة VRAM عالية النطاق الترددي بسعة 24–32 غيغابايت.
استراتيجية الذاكرة الموحّدة: مقايضة بعض سرعة وحدة معالجة الرسومات الخام مقابل سعة أكبر بكثير يمكنها استيعاب نماذج بدقة أعلى وأحمال عمل أكبر.
ما العتاد الذي ينبغي شراؤه لـ Qwen3.8-27B؟
إذا كان Qwen3.8-27B هو الهدف، وليس مجرد نموذج واحد ضمن العديد من النماذج، فلا حاجة إلى الانتقال فورًا إلى عتاد من فئة الخوادم. فالكمّية ذات الأربعة بتات تضع النموذج بوضوح ضمن نطاق الأجهزة الاستهلاكية المتطورة.
| الهدف | فئة الأجهزة الموصى بها | التكميم الموصى به |
|---|---|---|
| أرخص خيار للتجربة | ذاكرة RAM بسعة 16 جيجابايت | Q2 |
| مساعد خلفي قائم على وحدة المعالجة المركزية | ذاكرة RAM بسعة 32–64 جيجابايت | Q4 |
| محطة عمل عامة للذكاء الاصطناعي المحلي | ذاكرة RAM بسعة 64 جيجابايت + وحدة معالجة رسومات بسعة 16 جيجابايت | IQ4 / Q4 مع التفريغ |
| الهدف الأفضل لوحدة معالجة رسومات واحدة من حيث القيمة | ذاكرة RAM بسعة 64 جيجابايت + RTX 3090/4090 بسعة 24 جيجابايت | Q4 |
| وحدة معالجة رسومات استهلاكية متطورة | ذاكرة RAM بسعة 64 جيجابايت أو أكثر + RTX 5090 بسعة 32 جيجابايت | Q4/Q5/Q6 |
| محطة عمل بذاكرة موحدة | ذاكرة موحدة بسعة 64–128 جيجابايت | Q6/Q8 |
| خادم ذكاء اصطناعي محلي | ذاكرة RAM بسعة 128 جيجابايت أو أكثر + وحدة معالجة رسومات بسعة 48 جيجابايت أو أكثر أو عدة وحدات معالجة رسومات | Q8 / تكميم الإنتاج |
إذا كنت تملك RTX 3090 بالفعل، فمن الصعب تبرير استبدالها لمجرد وجود Qwen3.8-27B. فسعة ذاكرتها البالغة 24 جيجابايت تقع تحديدًا ضمن النطاق الذي يجعل Q4 عمليًا. وقد توفر وحدة معالجة رسومات أحدث كفاءة وسرعة أفضل، لكن سعة ذاكرة البطاقة الأقدم تظل ذات قيمة كبيرة لأعمال نماذج اللغة الكبيرة المحلية.
إذا كنت تشتري نظامًا من الصفر، ففكّر فيما يتجاوز النموذج نفسه. تحتاج آلة الذكاء الاصطناعي المحلية أيضًا إلى مساحة لإصدارات النماذج ومتجهات التضمين وفهارس RAG ومستودعات الشيفرة المصدرية والمستندات والصور ومساحات عمل الوكلاء. ويمكن لعدة ملفات نماذج بحجم 15–30 جيجابايت أن تتحول سريعًا إلى مئات الجيجابايت.
هنا تبرز أهمية البنية الأوسع ذات الأولوية للمحلي. يمكن لوحدة معالجة الرسومات أو الجهاز ذي الذاكرة الموحدة عالية النطاق الترددي التعامل مع الاستدلال، بينما يخزن التخزين المحلي السريع ملفات النماذج وبيانات العمل الخاصة. ويمكن لطبقة تخزين مستضافة ذاتيًا الاحتفاظ بشكل منفصل بمكتبات المستندات ومجموعات البيانات والنسخ الاحتياطية والملفات التي يمكن للوكلاء الوصول إليها، من دون فرض تخزين كل بايت على وحدة التخزين SSD الداخلية لمحطة عمل الذكاء الاصطناعي.
هل Qwen3.8-27B جيد بما يكفي لتشغيله كوكيل برمجي أو وكيل ذكاء اصطناعي محلي؟
هذا هو السؤال الأكثر إثارة للاهتمام من مجرد معرفة ما إذا كان النموذج سيعمل.
تطرح Qwen نموذج Qwen3.8-27B تحديدًا للبرمجة والعمل المهني والبحث والمهام الوكيلة طويلة الأفق. وفي تقييم Qwen الخاص، يسجل النموذج 61.7 في SWE-bench Pro و73.0 في Terminal Bench 2.1، مع تحسينات كبيرة مقارنةً بـ Qwen3.6-27B. وهذه نتائج معايير أبلغت عنها الشركة، ولا ينبغي اعتبارها ضمانًا مباشرًا لكل سير عمل برمجي محلي، لكنها تفسر سبب تركّز اهتمام المجتمع بشدة على الوكلاء بدلًا من المحادثة العادية.
يدعم النموذج أيضًا الفهم الأصلي للصور والفيديو. وهذا مهم للوكلاء المحليين، لأن لقطات الشاشة والمخططات والمستندات الممسوحة ضوئيًا وواجهات الويب وتصحيح الأخطاء المرئي يمكن أن تظل جزءًا من سير عمل النموذج نفسه بدلًا من توجيهها إلى واجهة برمجة سحابية منفصلة للرؤية.
تستخدم تجارب مجتمعية حديثة بالفعل Qwen3.8-27B مع أُطر عمل للبرمجة وسلاسل طويلة من استدعاءات الأدوات على وحدات معالجة رسومات منفردة بسعة 24 جيجابايت. وهذا المزيج—قدرة وكيل مفيدة إلى جانب نموذج رباعي البِتات بحجم يقارب 17 جيجابايت—أهم للذكاء الاصطناعي المحلي من تحسّن طفيف في معيار عام للمحادثة.
إنه ينقل فئة من مهام سير العمل التي كانت تدفع المستخدمين سابقًا نحو نماذج الاستضافة المتقدمة إلى عتاد يمكن وضعه تحت المكتب وتشغيله على ملفات خاصة دون رسوم رموز محسوبة.
هل ينبغي لك تشغيل Qwen3.8-27B محليًا؟
يُعد Qwen3.8-27B خيارًا محليًا قويًا للغاية، لا سيما إذا كانت لديك ذاكرة GPU بسعة 24 جيجابايت أو ذاكرة نظام أو ذاكرة موحدة عالية النطاق الترددي بسعة لا تقل عن 32–64 جيجابايت. فنموذج Q4 صغير بما يكفي ليكون عمليًا فعلًا، مع الاحتفاظ بقدرات تستهدف البرمجة، والرؤية، والأدوات، والوكلاء ذوي التشغيل طويل الأمد.
يصبح النموذج أقل جاذبية على جهاز يحتاج إلى تكميم 1-بت أو 2-بت لمجرد استيعابه. وعندئذ، قد يوفر استخدام نموذج أصغر بتكميم أفضل تجربة إجمالية. وبالمثل، لا يوجد سبب كبير لتخصيص سياق بسعة 262 ألفًا لأحمال عمل لا تستخدم عادةً سوى بضعة آلاف من الرموز.
لذلك، لا تتمثل أفضل تهيئة في أصغر ملف يبدأ تشغيله بنجاح. بل تتمثل بالنسبة إلى معظم المستخدمين في Q4، وذاكرة RAM أو VRAM كافية لتجنب التحميل المستمر، وحد للسياق يتناسب مع المهمة، وبيئة تشغيل استدلال حديثة.
هذا ما يميز Qwen3.8-27B عن النماذج المفتوحة الحديثة الأكبر بكثير. فليس تشغيله محليًا ممكنًا من الناحية التقنية فحسب. بل يقع ضمن نطاق عتاد يمكن لمحطة عمل متطورة عادية تشغيل إصدار مفيد منه دون أن يتحول النشر نفسه إلى مشروع.
الأسئلة الشائعة: تشغيل Qwen3.8-27B محليًا
ما مقدار ذاكرة RAM التي أحتاج إليها لـ Qwen3.8-27B؟
بالنسبة إلى معظم المستخدمين، تُعد ذاكرة RAM بسعة 32 جيجابايت الحد الأدنى العملي لنشر Qwen3.8-27B من فئة Q4. ويبلغ حجم ملفات GGUF الحالية من فئة Q4 نحو 16–18 جيجابايت. ويوفر النظام بسعة 64 جيجابايت مساحة أكبر بكثير للسياق، والتكميمات الأعلى جودة، والتطبيقات الأخرى، وخدمات الذكاء الاصطناعي المحلية.
هل يمكن تشغيل Qwen3.8-27B على ذاكرة RAM بسعة 16 جيجابايت؟
نعم، ولكن فقط مع تكميم مكثف مثل Q2 أو أقل. ويقل حجم إصدارات Q2 الحالية عن 10 جيجابايت، بينما تبلغ إصدارات البت الواحد نحو 6–7 جيجابايت. ولا يضمن احتواء النموذج جودة مماثلة، لا سيما في البرمجة، والمهام المعتمدة على الوكلاء، والمهام ذات الاستدلال المطول.
هل تكفي ذاكرة فيديو بسعة 24 جيجابايت لـ Qwen3.8-27B؟
نعم. تُعد وحدة معالجة الرسومات بسعة 24 جيجابايت من أفضل الخيارات العملية لـ Qwen3.8-27B. ويبلغ حجم إصدارات Q4 الحالية نحو 16–18 جيجابايت، ما يترك عدة جيجابايت للسياق وحالة بيئة التشغيل. وقد أبلغ مستخدمو RTX 3090 وRTX 4090 بالفعل عن عمليات نشر Q4 باستخدام وحدة معالجة الرسومات بالكامل، رغم أن السياق القابل للاستخدام يعتمد على بيئة التشغيل وإعداد ذاكرة التخزين المؤقت المحددين.
هل يمكن لـ RTX 4090 تشغيل Qwen3.8-27B؟
نعم. يمكن لذاكرة الفيديو بسعة 24 جيجابايت في RTX 4090 استيعاب نموذج من فئة Q4، وهي تهيئة قوية تعتمد على وحدة معالجة رسومات واحدة. وقد أفاد مستخدمون من المجتمع بتحميل النموذج بالكامل على وحدة معالجة الرسومات وتشغيله بسياق طويل على بطاقة واحدة. وتختلف سرعة الرموز بدقة اختلافًا كبيرًا حسب بيئة التشغيل، والتكميم، والسياق، وفك التشفير التخميني.
هل يمكن لـ RTX 3090 تشغيل Qwen3.8-27B؟
نعم. تكفي سعة VRAM البالغة 24 جيجابايت لتشغيل Q4، رغم أن RTX 3090 وحدة معالجة رسومات أقدم. وتتضمن الأمثلة المجتمعية الحديثة تشغيل Q4_K_M على RTX 3090 واحدة لأحمال عمل البرمجة والوكلاء. ولا تزال هذه البطاقة مفيدة بشكل استثنائي للذكاء الاصطناعي المحلي بفضل سعتها الكبيرة من الذاكرة.
هل يمكن تشغيل Qwen3.8-27B على RTX 5090؟
نعم. توفر ذاكرة VRAM بسعة 32 جيجابايت في RTX 5090 سعة كافية لتشغيل Q4 أو Q5 أو Q6، أو إعدادات أكثر تطلبًا للسياق الطويل. وتُظهر عمليات النشر التجريبية باستخدام NVFP4 وفك الترميز التخميني إنتاجية أعلى بكثير بالفعل، لكن لا ينبغي الخلط بين هذه النتائج وأداء Ollama الافتراضي.
ما أفضل إصدار تكميم لـ Qwen3.8-27B؟
يُعد Q4_K_M الخيار الافتراضي الأكثر أمانًا لمعظم المستخدمين المحليين، إذ يحافظ على حجم النموذج في حدود 16–18 جيجابايت مع الحفاظ على جودة أعلى بكثير من الإصدارات شديدة الانخفاض في عدد البتات. ويمكن للمستخدمين الذين يملكون ذاكرة أكبر الانتقال إلى Q5 أو Q6 أو Q8، بينما قد تحتاج الأنظمة محدودة الموارد إلى Q3 أو Q2.
ما حجم Qwen3.8-27B؟
يبلغ حجم مستودع Hugging Face الرسمي حاليًا نحو 55.6 جيجابايت. وتتراوح إصدارات GGUF المجتمعية من نحو 6 جيجابايت عند استخدام تكميم شديد بمقدار بت واحد، إلى 29 جيجابايت لإصدار Q8_0. ويبلغ حجم حزمة Q4_K_M الافتراضية الحالية في Ollama نحو 18 جيجابايت، وتتضمن مُسقِطًا بصريًا.
هل يدعم Qwen3.8-27B الرؤية محليًا؟
نعم. Qwen3.8-27B نموذج أصلي متعدد الوسائط للرؤية واللغة، وليس نموذج LLM نصيًا فقط. تتضمن حزمة Ollama الحالية مُسقِطًا بصريًا يضم نحو 461 مليون معلمة. لذلك يتوفر فهم الصور في مسارات العمل المحلية المدعومة، بينما لا يزال دعم الفيديو الفعلي يعتمد على بيئة التشغيل والواجهة الأمامية.
هل يدعم Qwen3.8-27B فعلًا سياقًا بحجم 262 ألف رمز محليًا؟
يدعم النموذج أصليًا 262,144 رمزًا، لكن يجب أن تتوفر في الأجهزة المحلية ذاكرة كافية لحالة التشغيل المقابلة، كما يجب أن تدعم واجهة الاستدلال الإعداد بكفاءة. لست بحاجة إلى استخدام نافذة السياق كاملة؛ فغالبًا ما يكون 32K أو 64K إعدادًا عمليًا أفضل للبرمجة المحلية وأحمال عمل الوكلاء.
هل ينبغي أن أستخدم Ollama أم llama.cpp مع Qwen3.8-27B؟
استخدم Ollama إذا كنت تريد أبسط تثبيت وواجهة API محلية. واستخدم llama.cpp إذا كنت تريد تحكمًا مباشرًا في اختيار GGUF، وتفريغ الحمل إلى وحدة معالجة الرسوميات، وسياق النموذج، وإعدادات التشغيل التفصيلية. ولتشغيل الخدمة على وحدة معالجة رسومات في بيئة إنتاجية أو لدعم التزامن، يُعد كل من vLLM وSGLang خيارين مدعومين رسميًا أيضًا.
هل تشغيل Qwen3.8-27B محليًا أسهل من تشغيل Qwen3.8-Flash-Next؟
نعم، بفارق كبير. Qwen3.8-27B هو نموذج كثيف بحجم 27 مليار معلمة، وتتراوح أحجام إصدارات Q4 بين 16 و18 جيجابايت تقريبًا. أما Qwen3.8-Flash-Next فيحتوي على حالة نموذج أكبر بكثير، وتقترب إصدارات فئة الأربعة بت الحالية من 100 جيجابايت أو تتجاوزها. يُعد Flash-Next تجربة لمحطة عمل عالية الذاكرة، بينما يُعد Qwen3.8-27B خيارًا حقيقيًا لمحطات العمل الاستهلاكية.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

أفضل 10 بدائل مستضافة ذاتيًا لـ GitHub Copilot في عام 2026
قارن بين بدائل Copilot المستضافة ذاتيًا للإكمال التلقائي الخاص، والنماذج المحلية، ووكلاء البرمجة، وسير عمل بيئات التطوير المتكاملة، والتطوير داخل الموقع.

تشغيل Qwen3.8-Flash-Next محليًا: ماذا تعني المعلمات النشطة البالغ عددها 6 مليارات فعلًا لذاكرة RAM وVRAM وNVMe؟
دليل عملي لاحتياجات الذاكرة لنموذج Qwen3.8-Flash-Next، ويغطي 6 مليارات من المعلمات النشطة، وحجم GGUF، وذاكرة RAM، وذاكرة VRAM، وNVMe، والسياق الطويل.

أفضل 10 أدوات ذكاء اصطناعي لسطر الأوامر ووكلاء برمجة في عام 2026
قارن بين 10 أدوات ذكاء اصطناعي لسطر الأوامر للبرمجة، واستخدام مفتاحك الخاص (BYOK)، والنماذج المحلية، وسير عمل GitHub، والتكامل المستمر/التسليم المستمر (CI/CD)، وMCP، وأتمتة...

