يقسّم التوازي التوتري الاستدلال المحلي للذكاء الاصطناعي عبر تقسيم موترات الأوزان الكبيرة داخل كل طبقة من طبقات المحوّل على عدة وحدات معالجة رسومية، ثم دمج نتائجها الجزئية.
وهذا يختلف عن منح كل وحدة معالجة رسومية طلبًا منفصلًا أو تعيين طبقات مختلفة لأجهزة مختلفة. فكل وحدة معالجة رسومية ضمن التوازي التوتري تشارك في الطبقة نفسها، وغالبًا في كل رمز مُولَّد. ويمكن لهذا النهج أن يجعل النموذج يعمل عبر عدة وحدات معالجة رسومية منزلية، لكنه يجعل الاتصال بين وحدات المعالجة الرسومية جزءًا من مسار الاستدلال الحرج.
يقسّم التوازي التوتري طبقة واحدة بدلًا من نسخ النموذج كاملًا
يمنح التوازي بالبيانات كل وحدة معالجة رسومية نسخة من النموذج ويقسّم الطلبات أو الدُفعات. أما التوازي التوتري فيفعل العكس لنموذج واحد: إذ يقسّم موترات المعلمات الكبيرة داخل الطبقات الفردية على عدة أجهزة.
يعرّف NVIDIA NeMo التوازي التوتري بأنه توزيع موتر معلمات طبقة فردية على وحدات معالجة رسومية. وتحتفظ كل وحدة معالجة رسومية بجزء فقط من المصفوفة المعنية.
يفيد ذلك عندما لا يتسع نموذج واحد، أو حتى طبقة كبيرة واحدة، بشكل مريح على وحدة معالجة رسومية منزلية واحدة.
تقسّم الأجزاء العمودية والأفقية عمل ضرب المصفوفات
تتضمن طبقات المحوّل إسقاطات خطية كبيرة. ويعيّن التقسيم المتوازي عموديًا أعمدة إخراج مختلفة لوحدات معالجة رسومية مختلفة، بينما يعيّن التقسيم المتوازي أفقيًا صفوف إدخال مختلفة أو نطاقات مختلفة من السمات.
يطبّق البرنامج التعليمي للتوازي التوتري في PyTorch أسلوبي التوازي الصفّي والعمودي على طبقات المحوّل. وتحسب كل رتبة حاصل ضرب مصفوفات جزئيًا باستخدام جزء الأوزان المحلي لديها.
ويظل النموذج يمثل طبقة منطقية واحدة. أما التقسيم فيغيّر مكان إجراء أجزاء العمليات الحسابية وكيفية دمج النتائج الجزئية.
يعيد الاتصال الجماعي بناء المخرج المنطقي للطبقة
بما أن كل وحدة معالجة رسومية لا ترى سوى جزء من الموتر، تحتاج بعض العمليات إلى الاختزال الشامل أو التجميع الشامل أو التوزيع مع الاختزال أو عمليات جماعية مكافئة، قبل أن يتوفر التمثيل المطلوب للحساب التالي.
تعرّف Open MPI عملية AllReduce بأنها دمج القيم عبر العمليات وتوزيع النتيجة مجددًا على جميع المشاركين. وتستخدم بيئات تشغيل التوازي التوتري هذا النوع من العمليات الجماعية، إلى جانب التجميع الشامل والتوزيع مع الاختزال، لإعادة بناء نتائج الطبقات المقسّمة أو إعادة توزيعها.
على محطة عمل منزلية، قد تحدد جودة مسار الاتصال بين وحدات المعالجة الرسومية ما إذا كان التقسيم سيوفر الوقت أم سيزيد السعة فقط.
تكتسب الوصلات البينية السريعة أهمية لأن الاتصال يحدث بوتيرة الطبقات
قد يتطلب التوازي التوتري عدة عمليات جماعية لكل كتلة من كتل المحوّل ولكل رمز مُولَّد. وتوفر الأنظمة المعتمدة على PCIe فقط نطاقًا تردديًا أقل بكثير بين الأجهزة مقارنةً بوصلات مسرّعات متطورة مصممة للمهام الموزعة الكبيرة.
توثّق AMD RCCL النقل من نظير إلى نظير لوحدات المعالجة الرسومية المتصلة عبر PCIe. وتختلف مكتبة العمليات الجماعية الدقيقة باختلاف المنصة، لكن قيد البنية الشبكية نفسه يظل قائمًا.
قد تتمكن وحدتا معالجة رسومية تتمتعان بذاكرة رسومية عشوائية كافية مجتمعتين من تشغيل نموذج أكبر بنجاح، لكنهما قد تحققان معدل رموز أقل من المتوقع لأن كل طبقة تنتظر المزامنة.
قد تجعل وحدات المعالجة الرسومية غير المتطابقة أبطأ جزء هو الذي يحدد الوتيرة
لا تتقدم طبقة ذات توازي توتري إلا بعد وصول النتائج الجزئية المطلوبة. فإذا كانت إحدى وحدات المعالجة الرسومية تتمتع بمعدل معالجة أقل، أو بنطاق ترددي أقل للذاكرة، أو بوصلة أبطأ، فقد تقضي الرتبة الأسرع وقتًا في الانتظار.
صُممت ميزة الاستدلال ذات التوازي التوتري التلقائي في DeepSpeed حول تقسيم النموذج عبر مجموعة عمليات الاستدلال. وتعتمد الكفاءة العملية على قدرة الأجهزة المشاركة على تقديم عمل متوازن.
ولا تزال مجموعة مختلطة من وحدات المعالجة الرسومية المنزلية مفيدة من ناحية استيعاب النموذج، لكن أحجام الأجزاء المتساوية لا تكون مثالية تلقائيًا عندما تختلف الأجهزة اختلافًا كبيرًا.
اختر التوازي التوتري للطبقات العريضة وعندما تكون ذاكرة الوحدة الواحدة محدودة
تتمثل الحالة الأقوى في نموذج تحتاج أبعاده الخفية الكبيرة وموترات طبقاته إلى التقسيم على عدة وحدات معالجة رسومية، ولا سيما عندما تكون الأجهزة مزودة بوصلة بينية محلية سريعة. وليس هذا تلقائيًا أفضل طريقة لخدمة عدة طلبات صغيرة مستقلة.
يوفر مقال ZimaSpace حول تخطيط ذاكرة مسرّعات الذكاء الاصطناعي المحلية خط الأساس للسعة؛ ويغيّر التوازي التوتري هذا الخط عبر توزيع طبقات نموذج واحد على عدة أجهزة.
اختبر وحدة معالجة رسومية واحدة عندما يكون ذلك ممكنًا، ثم اختبر وحدتين أو أكثر باستخدام النموذج والموجّه والسياق وحجم الدفعة نفسه. وسجّل الذاكرة المستخدمة لكل وحدة معالجة رسومية، ومعدل الرموز في الثانية، ووقت الاستجابة، ووقت العمليات الجماعية، واستخدام الوصلة.
ويمثل مقال ZimaSpace حول ضغط الذكاء الاصطناعي المحلي لعدة مستخدمين المقارنة من جانب الخدمة: إذ يجعل التوازي التوتري نموذجًا واحدًا يمتد عبر عدة أجهزة، بينما يحدد تزامن الطلبات عدد السياقات المستقلة التي تتنافس على ذلك النموذج الموزع.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

Why Plex May Re-Analyze Media After a Server Upgrade
Plex may re-analyze media after an upgrade. Separate finite maintenance work from repeated scans, path issues, or database faults.

What Actually Sets the Plex Performance Ceiling?
A dependency model for Plex performance that helps you identify the first saturated stage instead of upgrading every component at once.

Plex Networking Explained: Discovery, DNS, Routing, and Remote Reachability
A layer-by-layer model of Plex reachability that separates local discovery from IP routing and remote NAT or port-forwarding problems.

