قد يخدم نموذج ذكاء اصطناعي منزلي واحد مستخدمًا تفاعليًا واحدًا إلى عدة مستخدمين بموثوقية، لكن الحد المستقر يعتمد على الطلب على الرموز، والتجميع، وأهداف زمن الاستجابة.
قد يبدو نموذج ينتج 30 رمزًا في الثانية سريعًا في محادثة قصيرة مع مستخدم واحد، لكنه قد يتوقف عند إرسال أربعة أشخاص مطالبات طويلة معًا. يستهلك التزامن ذاكرة التخزين المؤقت KV، ويشارك سعة فك الترميز، وينشئ دفعات من الانتظار في قائمة الانتظار. والحد الصحيح هو أعلى حمل مقدَّم لا يزال يحقق هدفًا محددًا للمئين 95 لزمن ظهور الرمز الأول ومعدل الرموز أثناء الاستخدام العائلي المعتاد.
يحوّل التزامن معدل النقل إلى وقت انتظار
يقدّر حساب تقريبي للسعة قسمة معدل إنتاج الرموز المستدام على متوسط عدد الرموز المطلوبة في الثانية عبر الجلسات النشطة. عندما يقترب الطلب من سعة الخدمة، تتسبب الدفعات الصغيرة في إنشاء قوائم انتظار طويلة. ولا يتصرف المستخدمون كوحدات متطابقة؛ فالإجابة المؤلفة من 50 رمزًا تشغل الخادم بطريقة مختلفة عن إجابة مؤلفة من 2,000 رمز.
يوضح تحليل زمن الاستجابة ومعدل النقل أن التجميع يحسّن معدل النقل الإجمالي، لكنه غالبًا ما يساوم على زمن استجابة كل طلب. ويحدد هذا التوتر ما إذا كانت الجلسات الإضافية ستبدو مستقرة.
قد يؤدي ملء المطالبة الأولي أيضًا إلى حجب عمل فك الترميز، اعتمادًا على المجدول. وقد يضر مستخدمان يلصقان مستندات كبيرة بالجميع أكثر من ستة مستخدمين يطرحون أسئلة قصيرة. لذلك لا يمكن تعميم عدد المستخدمين من دون معرفة توزيعات المطالبات والمخرجات.
تنشئ ذاكرة التخزين المؤقت KV والجدولة حدًا ثانيًا
تخزن كل سلسلة نشطة مفاتيح وقيم الانتباه الخاصة بسياقها. ويؤدي ازدياد السجلّات الطويلة والدفعات الكبيرة إلى رفع استخدام ذاكرة التخزين المؤقت KV حتى تُرفض الطلبات أو تُبدّل أو تتأخر. ويمكن للتجميع المستمر قبول أعمال جديدة بين تكرارات فك الترميز، ما يحسّن الاستفادة، لكنه لا ينشئ ذاكرة مجانية.
يوضح شرح تقني لـ التجميع المستمر كيف تملأ الجدولة على مستوى التكرار خانات الدفعة الخاملة otherwise. وتعتمد الفائدة على عبء العمل، وقد تزيد التنافسية لكل طلب زيادة طفيفة.
يصبح زمن الاستجابة غير مستقر بالقرب من التشبع، لأن طول قائمة الانتظار يتفاعل بشدة مع تباين الوصول. وقد يرتفع متوسط زمن الاستجابة تدريجيًا، بينما يقفز زمن الاستجابة عند المئين 95 والحد الأقصى. وينبغي أن تقع السعة المستقرة أسفل نقطة التحول تلك، لا عند أعلى نقطة للرموز في الثانية في الاختبار المعياري.
متى يتوقف عدد المستخدمين عن التنبؤ بتجربة الاستخدام
يمكن للخادم نفسه دعم عدد أكبر من المستخدمين في الإكمال التلقائي مقارنةً بالاسترجاع المعزز بالتوليد (RAG)، أو استخدام الأدوات، أو التوليد المطول. وتضيف عمليات البدء البارد، والخنق الحراري، والاسترجاع، وتوليد الكلام مراحل خارج نطاق تقديم النموذج. لذلك لا يمكن لرقم التزامن الخاص بالنموذج وحده ضمان استجابة التطبيق بأكمله.
يصف دليل تقديم على ذاكرة التقديم الذاكرة والسياق والتجميع والتوازي باعتبارها قيودًا متفاعلة. ويمكن أن يؤدي تغيير أي منها إلى تحريك نقطة التحول في السعة.
يفشل هذا التنبؤ أيضًا إذا وصلت طلبات العائلة على شكل دفعات متزامنة بدلًا من وصولها بصورة مستقلة. فقد يكون أربعة مستخدمين نادرًا ما يتداخلون أمرًا سهلًا، بينما يستطيع وكيلان آليان إشباع النموذج باستمرار. قِس العمل المقدَّم، لا الحسابات المسجلة.
اعثر على نقطة التحول في التزامن باستخدام اختبار حمل
أعِد تشغيل طلبات واقعية قصيرة ومتوسطة وطويلة عند جلسة متزامنة واحدة واثنتين وأربع وأربع وثماني جلسات. ثبّت النموذج والتكميم وحد السياق وأخذ العينات. وسجّل وقت الانتظار، وزمن ظهور الرمز الأول، والزمن بين الرموز، ومعدل إكمال الطلبات، واستخدام ذاكرة التخزين المؤقت KV، وقيم المئين 50 والمئين 95 والحد الأقصى.
استخدم بنية جلسات النموذج المشترك كسياق للاختبار عندما تشارك عدة جلسات منزلية نموذجًا واحدًا. وأبقِ مراحل RAG والأدوات معطلة، أو قِسها منفصلة.
أعلن أن الحد المستقر هو أعلى تزامن يبقى عنده زمن ظهور الرمز الأول في المئين 95 ضمن هدف المنزل، من دون اتجاه متزايد في قائمة الانتظار أو أخطاء في الذاكرة. واترك هامشًا يتراوح بين 20 و30 بالمئة في معدل النقل للتعامل مع الدفعات المفاجئة. وأعد الاختبار كلما تغير طول السياق أو النموذج أو المجدول.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

كيفية قياس جودة استرجاع RAG المحلي وتفسير الاستدعاء والدقة وتغطية الاستشهادات
أنشئ مجموعة اختبار محلية لـ RAG، واحسب مقاييس الاسترجاع الأساسية، وفسّر المفاضلات بينها، ودقّق فيما إذا كانت ادعاءات الإجابات مدعومة بالأدلة المُستشهد بها.

لماذا تصبح حوسبة ميزات المنزل الذكي أكثر أهمية مع زيادة عدد المستشعرات عند معدل أخذ العينات نفسه؟
تتبّع الحوسبة لكل مستشعر وعبر المستشعرات مع زيادة عدد الأجهزة، وحدّد تكاليف الدمج غير الخطية، وقِس أداء مسار الميزات قبل أن تبدأ الأتمتة بالتباطؤ.

لماذا تصبح تكلفة تقييم RAG أكثر أهمية كلما اتسعت مكتبة المستندات مع ثبات حجم الاستعلامات؟
افهم لماذا يؤدي نمو مجموعة البيانات إلى زيادة جهد تقييم نظام RAG من دون زيادة في استفسارات المستخدمين، وكيف تحافظ الاختبارات الطبقية على ارتباط...

