يغيّر التكميم جودة إجابات الذكاء الاصطناعي المحلي عبر استبدال القيم عالية الدقة بتمثيلات أكثر خشونة تُدخل تقريبات عددية تعتمد على النموذج.
يمكن لتوفير الذاكرة أن يجعل تشغيل نموذج أكبر أو أسرع عمليًا على الأجهزة المنزلية، لكن التكميم بأربع بتات أو ثماني بتات لا يصف مستوى جودة موحدًا. تختلف الأساليب في الموترات التي تُكمّمها، وكيفية اختيار المقاييس، وما إذا كانت تحمي القيم الشاذة، وبيانات المعايرة التي تستخدمها. وقد يخفي التغير الطفيف في أحد الاختبارات المعيارية إخفاقات في البرمجة أو الرياضيات أو المطالبات متعددة اللغات أو المخرجات المنظمة أو سير عمل RAG خاص. تربط الأقسام أدناه التغير العددي بالإجابات التي يراها المستخدم فعليًا في المنزل.
يستبدل التكميم نطاقًا مستمرًا بعدد أقل من المستويات القابلة للتمثيل
يمكن للأوزان والتنشيطات ذات الفاصلة العائمة التعبير عن مقادير متميزة كثيرة. وتحوّل التنسيقات ذات عدد البتات الأقل تلك القيم إلى مجموعة أصغر من المستويات، ما يقلل حركة الذاكرة والتخزين على حساب خطأ التقريب أو القص.
يوضح GPTQ تكميم الأوزان منخفض البتات الذي يضغط النماذج الكبيرة مع تقليل الخطأ الناتج عن استبدال الأوزان كاملة الدقة.
لا يفقد النموذج نسبة ثابتة من الذكاء. إذ تؤثر التقريبات في كثير من الحسابات الداخلية، ويعتمد الأثر الظاهر على ما إذا كانت تلك الاضطرابات تغيّر احتمالات الرموز ذات الصلة بالمهمة.
يغيّر عدد البتات ميزانية الخطأ، لكن ليس بطريقة سلسة تمامًا
تمنح الدقة الأعلى أداة التكميم عادةً عددًا أكبر من المستويات، وبالتالي مساحة أكبر للحفاظ على الفروق الصغيرة. ويؤدي الانتقال من ثماني بتات إلى أربع أو ثلاث أو بتّين إلى زيادة ضغط الضغط.
وجد تقييم واسع أن النماذج المكمّمة بأربع بتات قد تظل قابلة للمقارنة مع النماذج المرجعية غير المكمّمة عبر كثير من الإعدادات المختبرة، لكن هذه النتيجة لا تضمن الأداء نفسه لكل نموذج أو أسلوب أو توزيع مطالبات.
قد تتغير الجودة فجأة عندما تتجاوز طبقة أو قناة حساسة أو قرار إخراج عتبة عددية. لذلك قد يتصرف مستويان متقاربان من التكميم بصورة متشابهة في المتوسط، لكنهما يختلفان في سلسلة استدلال معينة.
كما أن الضغط الشديد جدًا يترك مساحة أقل للأسلوب كي يحمي القيم النادرة ولكن المهمة.
تؤثر الأوزان والتنشيطات وذاكرة KV في أجزاء مختلفة من الاستدلال
يضغط تكميم الأوزان فقط معاملات النموذج التي تُحمّل لكل طلب. أما تكميم الأوزان والتنشيطات فيقلل أيضًا دقة القيم الوسيطة الناتجة أثناء الحساب.
يستخدم SmoothQuant تنعيم التنشيطات لدعم الأوزان والتنشيطات ذات الثماني بتات مع الحفاظ على الدقة عبر نماذج اللغة الكبيرة المختبرة. وتوجد هذه الطريقة لأن القيم الشاذة في التنشيطات أصعب في التكميم من قيم الأوزان العادية.
يؤثر تكميم ذاكرة KV في حالة الانتباه المخزنة للسياق الحالي بدلًا من معاملات النموذج الثابتة. ويمكنه توسيع السياق أو زيادة التزامن، لكن أخطاءه تتراكم عبر مسار الانتباه بطريقة مختلفة.
يظل وصف مثل Q4 ناقصًا ما لم يحدد وقت التشغيل أيضًا المكونات التي تبقى بدقة أعلى.
قد تحمل القيم الشاذة والقنوات البارزة أهمية غير متناسبة
يفترض تكميم كل قناة بصورة موحدة أن الدقة نفسها مفيدة بالقدر ذاته في كل مكان. لكن النماذج الواقعية تحتوي على قنوات تجعل أنماط تنشيطها أوزانها أكثر حساسية للتقريب.
يحمي AWQ قنوات الأوزان البارزة باستخدام إحصاءات التنشيط، ما يقلل خطأ التكميم من دون الاحتفاظ بنموذج كبير مختلط الدقة.
وهذا يفسر سبب إمكانية إنتاج ملفين لهما عدد البتات الاسمي نفسه جودة مختلفة. فحجم المجموعة وطريقة التحجيم ومعالجة القيم الشاذة والطبقات التي تبقى غير مكمّمة كلها تغيّر التقريب الفعلي.
قد تؤثر بيانات المعايرة في السلوكيات التي يجري الحفاظ عليها
غالبًا ما تراقب أساليب ما بعد التدريب مجموعة بيانات للمعايرة لاختيار المقاييس أو عتبات القص أو تحويلات القنوات. ولا تمثل تلك المجموعة سوى عينة من المطالبات المستقبلية.
تُظهر دراسات التكميم أن جودة المعايرة قد تؤثر في استعادة الدقة، لا سيما مع زيادة حجم النموذج وصعوبة التكميم.
قد لا تحمي مجموعة معايرة تهيمن عليها المحادثات الإنجليزية رموز البرمجة أو الصياغة الرياضية أو لغة أخرى أو أسلوب المستندات المستخدم في قاعدة معارف منزلية.
يمكن للتدريب الواعي بالتكميم تكييف النموذج مع الدقة المنخفضة، بينما يجب على تكميم ما بعد التدريب الحفاظ على السلوك من دون دورة إعادة تدريب كاملة. ولا ينبغي اعتبارهما متكافئين لمجرد أن تنسيق الإخراج له عدد البتات نفسه.
يظهر فقدان الجودة بصورة مختلفة بين المهام والنماذج
تلخص الحيرة والاختبارات المعيارية الواسعة السلوك المتوسط، لكن سير العمل المحلي قد يعتمد على JSON دقيق، أو معاملات أدوات صحيحة، أو استرجاع من سياق طويل، أو صياغة برمجية، أو لغة متخصصة واحدة.
تبحث دراسة تجريبية حول LLaMA 3 في التدهور الخاص بالمهام بدل افتراض أن مقياسًا واحدًا يصف السلوك المكمّم بالكامل.
قد لا يكون توزيع احتمالات أكثر ضوضاء قليلًا ملحوظًا في النثر المفتوح، لكنه قد يعطل الاستخراج الحتمي أو يختار مقطع الأدلة الخاطئ في RAG. كما قد تستجيب النماذج الأصغر بصورة مختلفة عن النماذج الأكبر عند استخدام عدد البتات نفسه.
يضع العرض العام للذكاء الاصطناعي المحلي في ZimaSpace ملاءمة عبء العمل قبل اسم النموذج. والمقارنة المفيدة هي بين إعداد التكميم الذي يشغّل سير العمل الخاص الفعلي، لا بين درجات لوحة المتصدرين العامة وحدها.
اختبر التكميم مقابل تكلفة فشل سير العمل
أنشئ مجموعة تقييم ثابتة من المطالبات الفعلية: محادثات عادية، وأسئلة صعبة، واستدعاءات أدوات، ومخرجات منظمة، ومستندات طويلة، ومدخلات متعددة اللغات، وحالات تكون فيها الإجابة الخاطئة مؤثرة.
يتعامل تقييم منهجي على الجهاز مع القدرة والكفاءة باعتبارهما قرارًا مشتركًا، بدل تحسين الذاكرة وحدها.
قارن بين الدقة الكاملة وثماني بتات وأربع بتات وأي تنسيق أكثر ضغطًا يمكنه فعليًا العمل على الخادم. وسجّل صحة الإجابات وسلوك الرفض وصلاحية التنسيق وزمن الاستجابة والذاكرة وقابلية التكرار باستخدام إعدادات فك ترميز متطابقة.
التكميم المناسب هو التنسيق الأقل تكلفة الذي يحافظ على السلوك المطلوب لسير العمل. فلا قيمة لتوفير صغير في الذاكرة إذا تسبب في أخطاء صامتة، بينما قد يكون فقدان طفيف في الاختبار المعياري مقبولًا عندما يتيح تشغيل نموذج أقوى بكثير محليًا.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

كيف يؤثر تقليل عينات السلاسل الزمنية على اكتشاف الحالات الشاذة في المنازل الذكية؟
تعرّف على كيفية تأثير عرض الفواصل، والتجميع، ومنع التعرّج، والبيانات المفقودة، ومدة الأحداث، والاحتفاظ متعدد المقاييس في استدعاء الحالات الشاذة للمنزل الذكي.

كيف تدمج شبكة الإشغال إشارات المنزل الذكي الضعيفة؟
تعرّف على كيفية تحويل الخلايا المكانية، ونماذج المستشعرات، وتحديثات لوغاريتم نسب الترجيح، والاضمحلال، والأدلة المترابطة، والعتبات، للإشارات المنزلية الضعيفة إلى تقديرات للإشغال.

كيف يؤثر التطبيع الفوتومتري في تجميع الوجوه الخاصة؟
تعرّف على كيفية تغيّر تصحيح الإضاءة لقصاصات الوجوه، والتمثيلات المتجهية، ومسافات العناقيد، والعتبات، وفرط التطبيع، وتقييم البحث في الصور الخاصة.

