تشغيل نموذج Kimi K3 الكامل محليًا ممكن باستخدام الأوزان الصادرة، لكن النشر العملي لا يزال يتطلب ذاكرة على نطاق عنقودي، ومعجلات، وروابط اتصال.
بعد إصدار الأوزان المفتوحة في 27 يوليو، لم يعد السؤال ما إذا كانت نقطة التحقق موجودة، بل ما إذا كان نظامك يمكنه تنزيلها وتحميلها وتقديمها بسرعة مفيدة. المستودع العام حوالي 1.56 تيرابايت موزعة على 96 شظية safetensor، بينما يحتوي النموذج على 2.8 تريليون معلمة إجمالية ويفعل 104 مليارات لكل رمز. هذه الأرقام تبعد جهاز كمبيوتر شخصي عادي أو ماك أو NAS منزلي أو خادم GPU واحد عن نطاق النموذج الكامل العملي، لذا تفصل الأقسام أدناه التخزين والذاكرة وطوبولوجيا المعجل ودعم وقت التشغيل ومسارات التراجع الواقعية.
| فحص ما بعد الإصدار | الإجابة الحالية |
|---|---|
| هل الأوزان الكاملة متاحة؟ | نعم. مستودع النموذج والتقرير الفني متاحان للجمهور. |
| هل يمكن لجهاز كمبيوتر شخصي عادي أو ماك أو NAS منزلي تشغيل النموذج الكامل عمليًا؟ | لا. قد يطلق التحميل التجريبي أجزاء من عبء العمل، لكن تقديم النموذج الكامل التفاعلي لا يزال مهمة على نطاق عنقودي. |
| ما حجم المستودع القابل للتنزيل؟ | حوالي 1.56 تيرابايت موزعة على 96 شظية safetensor، قبل التخزين المؤقت الإضافي وبيانات وقت التشغيل. |
| ما هو الحد الأدنى الشفاف للأوزان فقط؟ | حوالي 1.4 تيرابايت، أو 1.27 تيبيبايت، من 2.8 تريليون معلمة بأربعة بتات لكل منها. |
| ما هي محركات الخدمة الموصى بها حاليًا؟ | vLLM وSGLang وTokenSpeed، باستخدام مسارات نشر مخصصة لـ Kimi K3. |
ما المتاح الآن بعد إصدار أوزان Kimi K3؟
يتضمن إصدار الأوزان المفتوحة Kimi K3 نقطة التحقق الكاملة للنموذج والتقرير الفني. يعرض مستودع النموذج العام حاليًا حوالي 1.56 تيرابايت من الملفات و96 شظية safetensor مرقمة. هذا الرقم مفيد لتخطيط التنزيلات وسعة القرص، لكنه ليس مواصفة الحد الأدنى لذاكرة الفيديو (VRAM).
تؤكد ملخص النموذج الصادر وجود 2.8 تريليون معلمة إجمالية، و104 مليار معلمة مفعلة، و93 طبقة، و69 طبقة انتباه كيمي دلتا، و24 طبقة MLA مسيطر عليها. يختار توجيه Stable LatentMoE 16 من بين 896 خبيرًا موجهًا لكل رمز ويستخدم أيضًا خبيرين مشتركين. الأوزان هي MXFP4، والتفعيلات هي MXFP8، والحد الأقصى للسياق المعلن هو 1,048,576 رمزًا.
دعم النشر أصبح أكثر وضوحًا مما كان عليه قبل الإصدار. تم إدراج vLLM وSGLang وTokenSpeed كمحركات استدلال موصى بها، لكن كلًا منها يتطلب نوى، وكود نموذج، وتقسيم، وإعدادات ذاكرة مدركة لـ K3. الأمر العام المعروض من مكتبة العميل لا يحول نقطة التحقق إلى نموذج محلي بمقياس استهلاكي.
لماذا لا يزال MoE المتفرق يتطلب ذاكرة هائلة؟
يقوم Kimi K3 بالحوسبة باستخدام 104 مليار معلمة مفعلة لكل رمز، لكن جميع خبراء MoE لا يزالون يستهلكون الذاكرة والتخزين. يمكن للموجه اختيار خبراء مختلفين للرمز التالي، لذا يجب أن تظل مجموعة الأوزان الكاملة 2.8 تريليون متاحة في مكان ما في النشر.
اختيار 16 من 896 خبيرًا موجهًا يقلل من العمل الخبيري المنجز لرمز واحد. هذا لا يعني أن الجهاز يمكنه الاحتفاظ بـ 16 خبيرًا فقط، والتخلص من الباقي، ولا يزال يشغل النموذج المنشور دون تغيير. تقليم الخبراء، التقطير، أو البث سيخلق مقايضة تشغيلية مختلفة ويجب ألا يُخلط مع التفعيل المتفرق العادي.
لذلك فإن رقم 104 مليار المعلمات المفعلة هو وصف لمقياس الحوسبة، وليس اختصارًا لتقدير حجم نقطة التحقق. ضرب 104 مليار في أربع بتات والادعاء بأن النموذج يحتاج فقط إلى حوالي 52 جيجابايت سيتجاهل أوزان الخبراء غير النشطة ولكن المطلوبة، والمكونات الكثيفة، والخبراء المشتركين، وطبقات الانتباه، وأوزان الرؤية، وحالة وقت التشغيل.
| الرقم المنشور | ما يصفه | ما لا يعنيه ذلك |
|---|---|---|
| 2.8 تريليون معلمة إجمالاً | مجموعة الأوزان الكاملة التي يجب تخزينها وجعلها متاحة | أن كل معلمة تُحسب لكل رمز |
| 104 مليار معلمة مفعلة | مقياس المعلمات التقريبي المستخدم أثناء تمرير الأمام لرمز واحد | أن النموذج الكامل يتسع في 52 جيجابايت عند أربع بتات |
| 16 من 896 خبيرًا موجهًا | نمط توجيه الخبراء المتفرق لكل رمز | أن 16 خبيرًا فقط يحتاجون إلى التنزيل أو التحميل |
ما هو الحد الأدنى لذاكرة الوزن؟
عند 2.8 تريليون معلمة، أبسط حساب للحد الأدنى هو إجمالي المعلمات مضروبًا في عدد البتات المخزنة لكل معلمة. يوفر MXFP4 حدًا أدنى بحجم أربع بتات: 2.8 تريليون × 4 بتات يعادل حوالي 1.4 تيرابايت، أو تقريبًا 1.27 تيبيبايت، فقط لحجم وزن البيانات الخام.
المستودع المنشور يبلغ حوالي 1.56 تيرابايت، مما يوضح لماذا تمتد ذاكرة الخدمة إلى ما هو أبعد من حساب الوزن البسيط. تغليف نقطة التحقق، مقاييس الكتل، محاذاة الموترات، ملفات التكوين، أصول المرمز، مكونات الرؤية، وبيانات النموذج الأخرى ترفع التنزيل الحقيقي فوق الحد النظري لأربعة بتات.
يجب التخطيط لأربعة ميزانيات مختلفة بشكل منفصل: تخزين التنزيل الدائم، مساحة التهيئة المؤقتة، ذاكرة الوصول العشوائي للمضيف، وذاكرة HBM أو VRAM للمعجل. ثم يحتاج الخدمة الجارية إلى مساحة إضافية لحالة KDA، ذاكرة التخزين المؤقت MLA KV، التنشيطات، مخازن الاتصالات، النوى، التقاط الرسم البياني، وهامش الفشل. لذلك، حجم المستودع 1.56 تيرابايت ليس متطلب ذاكرة RAM كاملًا ولا متطلب ذاكرة GPU كاملًا.
| تمثيل الوزن | ذاكرة الوزن التقريبية فقط | ما يستثنيه الرقم |
|---|---|---|
| ما يعادل 16-بت | ~5.6 تيرابايت | التخزين المؤقت، التنشيطات، مخازن التشغيل، النسخ، ومساحة عمل الاتصالات |
| ما يعادل 8-بت | ~2.8 تيرابايت | بيانات تقنين وكل التحميل الزائد غير المتعلق بالأوزان |
| الحد النظري لـ MXFP4 | ~1.4 تيرابايت / ~1.27 تيبيبايت | مقاييس الكتل، التغليف، التخزين المؤقت، التنشيطات، والسعة الاحتياطية |
| المستودع العام الحالي | ~1.56 تيرابايت | مساحة تحميل مؤقتة وكل الذاكرة المطلوبة بعد التحميل |
ما الأجهزة التي يمكنها تشغيل Kimi K3 محليًا فعليًا؟
لا توجد قائمة صادقة للحد الأدنى من بطاقات الرسومات الموجهة للمستهلكين للنموذج الكامل. النظام الذي يمكنه تقنيًا تعيين أو بث نقطة التحقق ليس بالضرورة قادرًا على تقديم خدمة مستقرة وتفاعلية. تعتمد متطلبات الأجهزة العملية لـ Kimi K3 على إقامة الأوزان، نوى MXFP4 المدعومة، عرض النطاق الترددي للاتصال، سعة التخزين المؤقت، طول السياق، التزامن، ومحرك الخدمة.
الدعم المنشور لتشغيل Kimi K3 من اليوم الأول يضع فئة البداية الواقعية عند عقدة مؤسسة تحتوي على ثمانية معجلات. تصف مواد vLLM الحالية معجلات من فئة GB300 أو MI350X/MI355X كنقاط بداية، بينما تنشر SGLang أمثلة واعية بالتوبولوجيا تشمل B300 1×8، GB300 2×4، B200 2×8، H200 2×8، H100 4×8، وMI350X/MI355X 1×8.
هذه وصفات تشغيل منشورة وتكوينات بدء، وليست الحد الأدنى المعتمد لكل عبء عمل. قد تتطلب المعجلات الأقدم أو الأصغر عددًا أكبر من العقد، أو نوى تقنين مختلفة، أو تقليل السياق، أو توازي خبير إضافي. كما يحتاج حركة الإنتاج إلى سعة للطلبات المتزامنة، والعاملين الفاشلين، وهامش أداء بدلاً من مجرد تحميل نقطة التحقق مرة واحدة.
| فئة الأجهزة | إمكانية تشغيل كاملة لـ Kimi K3 | الحد الرئيسي |
|---|---|---|
| كمبيوتر شخصي عادي، ماك، جهاز تخزين منزلي NAS، أو بطاقة رسومات واحدة للمستهلك | غير عملي | تجاوزت نقطة التحقق والتحميل الزائد سعة الذاكرة المحلية العادية |
| عدة وحدات GPU استهلاكية بالإضافة إلى تفريغ RAM/NVMe | تجريبي فقط | يمكن أن تجعل عرض نطاق PCIe، وRAM، والتخزين حركة الخبراء بطيئة جدًا للاستخدام |
| عقدة معجل من الجيل الحالي بثماني بطاقات | فئة بدء منشورة | يتطلب نوى مدعومة، وHBM كافية، وطوبولوجيا متوافقة مع وقت التشغيل |
| عنقود معجلات متعدد العقد | فئة إنتاج واقعية | يتطلب RDMA أو نسيج مكافئ، وتنظيم موزع، ومعالجة الفشل |
لماذا لا تزال محطة العمل أو NAS واحدة هي الطوبولوجيا الخاطئة؟
تقسيم السعة الخام يقلل من حجم المشكلة. حتى إذا تم تجميع ذاكرة كافية، يحول التوازي الخبيري التوجيه إلى حركة مرور شبكية. يجب أن تصل الرموز إلى المعجلات التي تحمل خبراءها المختارين ثم تعود إلى بقية خط أنابيب النموذج.
توفر عقد المعجل المؤسسية أكثر من مجرد الذاكرة. فهي تجمع بين وصلات GPU عالية النطاق الترددي، وشبكات تدعم RDMA، ومكتبات اتصال جماعية، ونوى مصممة للتوازي في التنسور، والخبراء، والبيانات، أو خطوط الأنابيب. قد يظهر مجموعة من وحدات GPU الاستهلاكية المتصلة عبر PCIe عادي أو شبكة منزلية سعة اسمية كافية بينما تظل بطيئة جدًا أو هشة جدًا للخدمة المفيدة.
يعد NAS ذا قيمة لتخزين شظايا نقاط التحقق، والسجلات، ومجموعات البيانات، وفهارس الاسترجاع، وبيانات التطبيقات، لكن التخزين الشبكي لا يحل محل عرض نطاق ذاكرة المعجل. عادةً ما يكون الدور الأفضل لخادم المنزل هو الاحتفاظ بالبيانات الخاصة والاسترجاع قريبًا من المستخدم مع ترك استدلال النموذج المتقدم إلى مجموعة مناسبة أو نقطة نهاية مستضافة. في هذا التصميم، يفصل خادم المنزل طبقة البيانات المحلية عن استدلال النموذج المتقدم.
كيف ترفع حالة KDA، وذاكرة MLA KV، وطول السياق الميزانية؟
لا يستخدم Kimi K3 ذاكرة تخزين مؤقت كاملة موحدة عبر جميع الطبقات الـ 93. حيث تخلق طبقاته الـ 69 من KDA وطبقات MLA الـ 24 ذات البوابة طلبين مختلفين على ذاكرة الخدمة: تجمع حالة KDA بهيكلية نموذج ثابت للطلبات المقبولة، وتجمع MLA KV المصفح الذي ينمو مع الرموز المخزنة.
هذا التقسيم يعني أن KDA يمكن أن يقلل من نمو السياق الطويل الموجود في الانتباه التقليدي، لكنه لا يجعل طلب مليون رمز مجانيًا. كما تتنافس حالة KDA وذاكرة MLA KV على سعة المعجل، يمكن لجانب KDA تحديد الطلبات المقبولة بينما يحد جانب MLA من إجمالي الرموز المخزنة مؤقتًا.
حجم الدُفعة، التزامن، متوسط طول الموجه، طول الاستدلال المولد، المدخلات متعددة الوسائط، دقة التخزين المؤقت، واستراتيجية التعبئة المسبقة/فك التشفير كلها تغير السعة القابلة للاستخدام. رقم 1 مليون رمز هو أقصى قدرة للنموذج، وليس الإعداد الافتراضي الموصى به. يجب أن يبدأ النشر الأولي بسياق أقصر، حجم دفعة واحد، وتزامن منخفض قبل قياس حالات نفاد الذاكرة، وقت التعبئة المسبقة، سرعة فك التشفير، وحركة المرور بين العقد.
كيف يمكنك تشغيل Kimi K3 محليًا بعد إصدار الوزن المفتوح؟
تشغيل Kimi K3 محليًا الآن يعني بناء خدمة استدلال موزعة حول نقطة التحقق الصادرة، وليس تثبيت تطبيق سطح مكتب عادي. التسلسل الأكثر أمانًا هو التحقق من التخزين، دعم بيئة التشغيل، الطوبولوجيا، ونقطة تشغيل صغيرة قبل زيادة السياق أو حركة المرور.
- جهز التخزين. احجز على الأقل مساحة تقارب 1.56 تيرابايت لمستودع النموذج بالإضافة إلى مساحة إضافية للتنزيلات الجزئية، التخزين المؤقت، صور الحاويات، السجلات، والملفات المؤقتة.
- اختر محركًا مدعومًا. استخدم مسار نشر vLLM الخاص بـ Kimi K3، أو SGLang، أو TokenSpeed مع رمز النموذج، النوى، وإصدار الحاوية أو الفرع المطلوب.
- طابق الطوبولوجيا. اختر تخطيط متعدد وحدات معالجة الرسوميات أو متعدد العقد للمؤسسات مع ذاكرة HBM كافية ومسار NVLink أو MNNVL أو RDMA المتوقع من إعدادات التنسور والتوازي الخبير.
- ابدأ تحت حدود العنوان. قلل الحد الأقصى لطول النموذج، حجم الدُفعة، والتزامن، ثم تحقق من التحميل، سلوك نفاد الذاكرة، صحة المخرجات، سرعة التعبئة المسبقة، سرعة فك التشفير، وحركة المرور بين جميع العقد.
- قم بالتوسع فقط بعد القياس. أضف السياق، الطلبات المتزامنة، ميزات التخزين المؤقت، المدخلات متعددة الوسائط، أو فك التشفير التخميني متغيرًا واحدًا في كل مرة.
أمر مثل vllm serve أو sglang serve يصف كيفية بدء بيئة تشغيل موزعة متوافقة؛ لكنه لا يلغي متطلبات الأجهزة. عندما لا يتوفر فئة المعجل المطلوبة، الخيارات الواقعية هي API مستضافة، أو بنية هجينة تحتفظ بالملفات والاسترجاع محليًا، أو نموذج محلي أصغر يناسب ذاكرة وموثوقية الخادم المنزلي الفعلية.
الأسئلة الشائعة
هل يمكنني تشغيل Kimi K3 محليًا على جهاز كمبيوتر عادي أو ماك أو NAS منزلي؟
ليست بسرعة النموذج الكامل العملية. المستودع حوالي 1.56 تيرابايت قبل حساب الحمل الإضافي للخدمة، في حين أن النظام المحلي العادي يفتقر أيضًا إلى ذاكرة المعجل والطوبولوجيا عالية النطاق الترددي المتوقعة من بيئات التشغيل الحالية. قد يثبت البث التجريبي الخبير أو التحميل الثقيل أن الإطلاق ممكن تقنيًا، لكنه لا يعادل خدمة سريعة الاستجابة أو جاهزة للإنتاج.
كم من التخزين والذاكرة يتطلب Kimi K3؟
الحد الأدنى الشفاف لحمل وزن MXFP4 هو حوالي 1.4 تيرابايت، بينما المستودع العام حوالي 1.56 تيرابايت. ثم تحتاج إلى مساحة إضافية على القرص، وذاكرة RAM للمضيف، وذاكرة HBM أو VRAM للمسرع، وحالة KDA، وذاكرة تخزين مؤقت MLA KV، والتنشيطات، ومساحة عمل الاتصالات، وهامش تشغيل. لا يوجد رقم واحد يمثل كل هذه الطبقات.
ما هو الحد الأدنى المنشور لإعداد GPU لنموذج Kimi K3؟
أصغر التكوينات المنشورة في اليوم الأول هي عقد مسرع مؤسسية مكونة من ثمانية بطاقات، مع مسارات vLLM وSGLang الحالية التي تركز على أجهزة من فئة B300 أو GB300 أو MI350X/MI355X. اعتبر هذه كنقاط بداية لتشغيل الوقت، وليس كحد أدنى مضمون عالميًا؛ السياق والتزامن وإصدار المحرك وأهداف الإنتاج قد تتطلب موارد أكثر.
هل يمكن تشغيل Kimi K3 من تخزين SSD أو NAS مع التفريغ؟
يمكن لتخزين SSD أو NAS أن يحتفظ بشظايا نقطة التحقق، وقد تقوم بيئات التشغيل التجريبية ببث الأوزان عبر ذاكرة المضيف. المشكلة المحددة هي الحركة المتكررة لأوزان الخبراء والحالة عبر التخزين والشبكة وذاكرة الوصول العشوائي وروابط PCIe. هذه المسارات أبطأ بكثير من ذاكرة HBM للمسرع وأقمشة GPU عالية السرعة، لذا قد يؤدي الإطلاق التجريبي إلى زمن استجابة غير قابل للاستخدام.
هل يشغل Ollama نموذج Kimi K3 بالكامل محليًا؟
الإدخال الحالي لـ Ollama Kimi K3 يستخدم العلامة kimi-k3:cloud. تشغيل عميل Ollama محليًا لا يعني أن نقطة التحقق بحجم 1.56 تيرابايت محملة على الجهاز المحلي؛ المسار المدرج مدعوم من السحابة.
الخلاصة النهائية
Kimi K3 متاح الآن فعليًا كنموذج مفتوح الوزن، لذا يمكن لمشغلي العناقيد تنزيل ونشر نقطة التحقق الكاملة بدلاً من الاعتماد على تقديرات ما قبل الإصدار. يغير الإصدار التحقق وتوفر الأدوات، لكنه لا يغير الحجم الفعلي لنموذج يحتوي على 2.8 تريليون معلمة.
أكثر أرقام ذاكرة Kimi K3 فائدة تجيب على أسئلة مختلفة: حوالي 1.4 تيرابايت هو الحد الأدنى الشفاف للوزن بأربعة بتات فقط، وحوالي 1.56 تيرابايت هو حجم المستودع الحالي، و104 مليار هو مقياس الحوسبة النشط لكل رمز. لا يصف أي من هذه الأرقام بمفردها الذاكرة الكاملة المطلوبة لخدمة تعمل.
بالنسبة لمعظم الأفراد ومستخدمي خوادم المنازل، فإن حد التوقف واضح: بدون عقدة مؤلفة من ثمانية مسرعات للمؤسسات أو عنقود موزع، استخدم الاستدلال المستضاف، واحتفظ بالبيانات الخاصة وطبقة الاسترجاع محليًا، أو اختر نموذجًا أصغر. هذه هي الطريقة العملية للاستفادة من Kimi K3 دون التعامل مع NAS أو محطة عمل أو GPU واحد كنقطة عُقدة نموذج متقدمة.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

لماذا تصبح تنبؤات المنزل الذكي أقل دقة بعد تغيّر الروتين الموسمي؟
تغيّر الروتينات الموسمية العلاقة بين الوقت وأجهزة الاستشعار والإشغال والإجراءات المطلوبة، مما يجعل النموذج المدرَّب على العادات الأقدم متقادماً.

لماذا يفوّت جهاز NVR المنزلي الأحداث القصيرة عند تفعيل تتبّع الأجسام؟
يحتاج التتبع إلى عدد كافٍ من عمليات الكشف لبدء المسار وتأكيده، لذا قد يختفي جسم لفترة وجيزة قبل أن ينشئ جهاز تسجيل الفيديو الشبكي...

لماذا تتغير تسميات الصور بالذكاء الاصطناعي بعد ترقية النموذج؟
يغيّر ترقية النموذج التمثيلَ والترتيبَ المستخدمَين لتعيين التصنيفات، لذا قد تتجاوز الصورة نفسها حدودًا دلالية أو حدود ثقة مختلفة.

