كيف يؤثر النقل من نظير إلى نظير عبر PCIe في الاستدلال المحلي متعدد وحدات معالجة الرسومات؟

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

يمكن لنقل البيانات من نظير إلى نظير عبر PCIe تقليل الحمل الزائد للاستدلال على عدة وحدات معالجة رسومات، من خلال نقل الموترات مباشرةً بين ذاكرات وحدات معالجة الرسومات المتوافقة بدلاً من تمريرها مؤقتًا عبر ذاكرة RAM المضيفة.

يجب على نموذج محلي موزع بين وحدتي معالجة رسومات نقل عمليات التنشيط أو كتل KV أو مخرجات الخبراء كلما انتقل التنفيذ عبر حد فاصل بين الأجهزة. ومن دون وصول مباشر إلى النظير، قد تنتقل البيانات من وحدة معالجة رسومات إلى ذاكرة المضيف ثم تعود إلى الأخرى، ما يستهلك وصلات الاتصال بوحدة المعالجة المركزية ويضيف عمليات نسخ. يختصر النقل من نظير إلى نظير هذا المسار، لكن قيمته تعتمد على البنية الطوبولوجية وحجم النقل والمزامنة وعدد مرات اتصال النموذج.

يستبدل الوصول إلى النظير مسار النسخ المرحلي عبر المضيف

عند تفعيل الوصول إلى النظير، يمكن لوحدة معالجة رسومات واحدة عنونة البيانات أو نسخها من ذاكرة وحدة معالجة رسومات أخرى عبر مسار الاتصال البيني المدعوم. ويتجنب النقل وجود مخزن ارتداد صريح في ذاكرة النظام القابلة للترحيل أو المثبتة، كما يمكن أن يقلل تدخل وحدة المعالجة المركزية.

يوضح دليل برمجة CUDA أن الوصول إلى ذاكرة النظير يجب أن يكون مدعومًا ومفعّلًا بين أزواج الأجهزة. وتكون الإمكانية اتجاهية وتعتمد على البنية الطوبولوجية، لذلك ينبغي للبرمجيات الاستعلام عن كل زوج بدلاً من افتراض أن كل وحدة معالجة رسومات في المضيف نفسه يمكنها الاتصال مباشرةً.

لا يزال النموذج بحاجة إلى المزامنة حتى لا تقرأ وحدة معالجة الرسومات المستهلكة عمليات تنشيط غير مكتملة. يزيل النقل من نظير إلى نظير خطوة الترحيل المؤقت، لكنه لا يلغي تكاليف الترتيب أو إطلاق النواة أو الاتصال الجماعي. ويظل هذا التمييز ظاهرًا أثناء الاختبارات المنزلية اللاحقة.

تحدد طوبولوجيا PCIe النطاق الترددي الفعلي للمسار المباشر

غالبًا ما تستطيع وحدتا معالجة رسومات أسفل محول PCIe نفسه تبادل البيانات دون عبور مقبس وحدة المعالجة المركزية، بينما قد تتطلب الأجهزة الموجودة خلف مجمعات جذر مختلفة مسارًا عبر المضيف أو قد تفقد دعم النقل من نظير إلى نظير. ويحدد جيل الوصلة وعرضها، وفرط اشتراك المحول، وحركة المرور المتزامنة الحد الأقصى.

يوثق NCCL أنه يفضل الاتصال المباشر بين وحدات معالجة الرسومات عندما تبلغ CUDA عن وحدات معالجة رسومات متوافقة، مستخدمًا PCIe أو NVLink وفقًا للطوبولوجيا المتاحة. وتوضح أدوات الطوبولوجيا الخاصة به ما إذا كان بإمكان كل زوج من الأجهزة استخدام وصول مباشر عبر PCIe. ويجب أن تظل النتيجة الوسيطة قابلة للفحص قبل أن تعتمد عليها الأتمتة.

قد تظل عمليات النقل الصغيرة خاضعةً غالبًا لزمن الإطلاق والمزامنة، بينما تقترب عمليات نقل الموترات الكبيرة من عرض نطاق الوصلة. وقد تحقق البنية ذات الحدود المتكررة والضيقة مكاسب أقل من تصميم يتصل عبر عدد أقل من الكتل الأكبر حجمًا. وينبغي قياس هذا الحد بصورة منفصلة في ظروف تشغيل واقعية.

يحدد التقسيم ما إذا كانت النسخ الأسرع مهمة

يتصل التوازي الموترّي داخل العديد من الطبقات، وينقل التوازي المرحلي عمليات التنشيط بين حدود المراحل، بينما يتبادل توازي الخبراء الرموز الموجّهة. لذلك قد تُستخدم وصلة النقل من نظير إلى نظير استخدامًا محدودًا أو تصبح العامل المحدِّد الرئيسي، تبعًا لاستراتيجية التقسيم.

يوضح نقاش تصميم NVIDIA لـ GPUDirect كيف يؤثر توزيع طوبولوجيا PCIe وموقع المحول في حركة البيانات المباشرة مقارنةً بالمسارات المرحلية عبر المضيف. وينطبق هذا المبدأ رغم أن أطر الاستدلال تضيف طبقاتها الخاصة للاتصال الجماعي والجدولة. وتظهر النتيجة العملية عندما تتنافس عدة مصادر على سياق محدود.

يتمثل حد الفشل في طوبولوجيا غير مدعومة أو قيود IOMMU أو المحاكاة الافتراضية أو اتصال يتجاوز بالفعل ميزانية PCIe. وعندها تعود البرمجيات إلى الترحيل المرحلي عبر المضيف أو تعاني من ازدحام الوصلة، وقد تؤدي إضافة وحدة معالجة رسومات ثانية إلى إبطاء الاستدلال رغم زيادة القدرة الحسابية.

قِس كل زوج من وحدات معالجة الرسومات وكل حد من حدود النموذج

ارسم خريطة لوحدة معالجة الرسومات، ومقبس وحدة المعالجة المركزية، وجذر PCIe، والمحول، وجيل الوصلة، وعرضها، وإمكانية النقل من نظير إلى نظير، وذاكرة NUMA. وقِس عمليات النسخ من نظير إلى نظير أحادية الاتجاه وثنائية الاتجاه، إلى جانب عمليات النسخ المرحلية عبر المضيف، باستخدام أحجام نقل تمثيلية. وينبغي أن تظل هذه التبعية واضحة في الواجهة النهائية.

اربط النتيجة بـ التوزيع الواعي بـ NUMA. وحلّل زمن الحساب وزمن الاتصال والمزامنة وعرض نطاق الاتصال الجماعي وعدد الرموز في الثانية وزمن استجابة الطلب عند المئين 99 لكل تقسيم للنموذج مع تفعيل النقل من نظير إلى نظير وتعطيله. ولذلك يجب التحقق من النتيجة مقابل الأدلة الأصلية.

احتفظ بخطة الوحدات المتعددة فقط عندما يتحسن زمن الاستجابة الشامل أو السعة. وإذا كانت عمليات النسخ المباشرة سريعة لكن الاستدلال لا يزال مقيدًا بالاتصال، فقلل عمليات العبور بين التقسيمات أو اختر توزيعًا واعيًا بالطوبولوجيا بدلاً من اعتبار دعم النقل من نظير إلى نظير كافيًا.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.