أخذ العينات من نماذج اللغة الكبيرة المحلية: لماذا تغيّر إعدادات فك الترميز التكرار والاستقرار

إيفا وونغ هي كاتبة تقنية و ومهندسة هاوية في ZimaSpace. مهووسة بالتكنولوجيا مدى الحياة ولديها شغف بالمختبرات المنزلية والبرمجيات مفتوحة المصدر، تتخصص في تبسيط المفاهيم التقنية المعقدة إلى أدلة عملية وسهلة الفهم. تؤمن إيفا بأن الاستضافة الذاتية يجب أن تكون ممتعة وليست مخيفة. من خلال دروسها، تمكّن المجتمع من تبسيط إعدادات الأجهزة، بدءًا من بناء أول نظام تخزين شبكي NAS وحتى إتقان حاويات Docker.

تغيّر إعدادات فك الترميز سلوك نماذج اللغة الكبيرة المحلية من خلال إعادة تشكيل الرموز التالية التي تظل مؤهلة للاختيار، ومدى تأثير فروق الاحتمالات في كل اختيار.

قد يجيب نموذج منزلي عن سؤال واقعي واحد باستمرار، لكنه يصبح تكراريًا أثناء جلسة صوتية طويلة أو غير مستقر أثناء الكتابة الإبداعية. لم تتغير الأوزان؛ بل يختار المفكك من توزيع الاحتمالات الخاص بها بطريقة مختلفة في كل خطوة. وتحدد درجة الحرارة، والاقتطاع، وعقوبات التكرار، والبذرة، والسياق معًا ما إذا كان الناتج سينهار إلى حلقات مألوفة أو يتجول نحو استكمالات منخفضة الاحتمال.

تعيد درجة الحرارة تحجيم الثقة قبل اختيار الرمز

في كل خطوة، يعيّن النموذج قيمًا لوجيتية للرموز المحتملة. وتعيد درجة الحرارة تحجيم هذه القيم قبل التطبيع: فالقيم المنخفضة تزيد حدة الفروق وتفضّل الخيارات المتصدرة، بينما تسطّح القيم المرتفعة هذه الفروق وتمنح المرشحين الأضعف احتمالًا أكبر. ويتجاوز فك الترميز الجشع أخذ العينات، ويختار دائمًا القيمة القصوى الحالية.

يميّز الشرح التقني بين درجة الحرارة ومرشحات الرموز: إذ تغيّر درجة الحرارة الاحتمالات النسبية عبر التوزيع، بينما يحتفظ top-k بعدد ثابت من المرشحين، ويحتفظ top-p بأصغر مجموعة تصل إلى كتلة احتمالية معينة. وترتبط هذه الأدوات ببعضها، لكنها ليست قابلة للتبادل.

يمكن لانخفاض العشوائية أن يثبت التنسيق والصياغة الواقعية، لكنه قد يختار الاستكمال المحلي الجذاب نفسه مرارًا. وقد تساعد العشوائية المرتفعة على الخروج من ذلك المسار، لكنها قد تسمح أيضًا بوقوع الأخطاء. لذلك تعني الاستقرارية تباينًا مضبوطًا بما يلائم المهمة، لا مجرد استخدام أدنى درجة حرارة.

تغيّر المرشحات الديناميكية مجموعة المرشحين مع تغيّر الثقة

يستخدم top-p الاحتمال التراكمي، لذا يتسع عدد المرشحين عندما يكون النموذج غير واثق، وينكمش عندما يهيمن رمز واحد. أما min-p فيضع عتبة نسبةً إلى الرمز الأكثر احتمالًا، فيكيّف حد القطع مع مستوى الثقة من دون استهداف كتلة احتمالية تراكمية ثابتة.

تفيد أبحاث حول أخذ عينات min-p بتحسن الجودة الإبداعية والتنوع مقارنةً بـ top-p في إعدادات درجات الحرارة المرتفعة التي اختُبرت. وتكمن أهمية الآلية محليًا لأن النماذج الصغيرة أو المكمّمة قد تمتلك توزيعات أكثر حدة أو ضجيجًا من التوزيعات التي تفترضها الواجهة المستضافة افتراضيًا.

تعمل المرشحات قبل السحب العشوائي، بينما تعدّل العقوبات الدرجات استنادًا إلى الرموز السابقة. وقد يؤدي الجمع بين اقتطاع شديد وعقوبة تكرار قوية إلى ترك بدائل غير مألوفة، فيبدو الناتج غير مستقر رغم أن كل إعداد بدا محافظًا بمفرده.

متى تتوقف العشوائية الإضافية عن تحسين الطبيعية؟

لا يتحرك التنوع الإبداعي ودقة الاستدلال معًا. فقد تنتج درجة الحرارة المرتفعة قصصًا متنوعة، لكنها تضر بالحساب، والبرمجة، ودقة الاستشهادات، والناتج المنظم. وعلى العكس، قد يكون فك الترميز الجشع مناسبًا للاستخراج المقيّد، رغم أنه يبدو جامدًا في المحادثة.

تجد أبحاث حول أخذ العينات الانتقائي أن الاختيارات ذات درجة الحرارة المرتفعة قد تضعف الاستدلال في مواضع رمزية حساسة، مما يحفّز استخدام عشوائية انتقائية بدلًا من العشوائية الموحدة. ولا يمكن لإعداد عام واحد تحسين كل جزء من كل مهمة. ويغيّر هذا التمييز القرار المنزلي الناتج.

يظهر حد الفشل عندما ينتهك الناتج قيد المهمة: JSON غير صالح، أو ادعاءات غير مدعومة، أو شفرة معطوبة، أو حلقات متكررة. ولا يمكن لأخذ العينات إصلاح مطالبة ضعيفة، أو سياق مفقود، أو نموذج غير ملائم، أو سجل محادثة تالف؛ فهو يغيّر فقط الاختيار من الاحتمالات المتاحة.

-15% OFF

أنشئ شبكة اختبارات قابلة لإعادة الإنتاج لأخذ العينات

اختر ثلاث مطالبات تمثيلية: استخراجًا حتميًا، ومحادثة عادية، وتوليدًا مفتوح النهاية. ثبّت ملف النموذج، والتكميم، والمطالبة، والسياق، والحد الأقصى لعدد الرموز. وشغّل كل مطالبة عبر شبكة صغيرة من درجات الحرارة وإحدى طرق الاقتطاع، باستخدام بذرة ثابتة وعدة بذور عشوائية.

تتبّع المخرجات غير الصالحة، وتكرار العبارات حرفيًا، ونسبة الرموز الفريدة، ودقة المهمة، وزمن الاستجابة. ويعزل ذلك فك الترميز عن مشكلة التماسك الموضحة في تماسك السياق الطويل، حيث يمكن لسياق المحادثة الطويل أن يقلل جودة الإجابة بصورة مستقلة. ويظل هذا الحد ظاهرًا أثناء مراجعة الأدلة اللاحقة.

اختر إعدادات مسبقة منفصلة حسب عبء العمل، بدلًا من استخدام قيمة عامة واحدة. وارفض الإعداد المسبق إذا حسّن التنوع مع الإخفاق في القيود الصارمة للمهمة، ثم أعد تشغيل الشبكة بعد تغيير النموذج، أو التكميم، أو قالب المطالبة، أو عقوبة التكرار.

مركز التكنولوجيا والذكاء الاصطناعي

المزيد للقراءة

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.