يُحدث الفهم الوكيلي للفيديو في Gemini تغييرًا في ذكاء الفيديو الاصطناعي، إذ يتيح للنموذج تحديد اللحظات التي تستحق الانتباه بدلًا من معالجة فيديو كامل بمعدل أخذ عينات ثابت. وتفيد Google بأن أعباء العمل التي اختبرتها يمكن أن تستخدم رموزًا أقل بنسبة تصل إلى 88%، وتتكلف أقل بنسبة تصل إلى 66%، وتحسّن الجودة بنسبة تصل إلى 7%. ولا يقتصر التحول المهم على جعل تحليل الفيديو أقل تكلفة؛ إذ يستطيع Gemini البحث في الخط الزمني، وفحص لحظة واعدة، ثم العودة إليها بتفصيل أعلى عندما يتطلب السؤال ذلك.
بالنسبة إلى وحدة NAS التي تحتفظ بسنوات من تسجيلات المراقبة ومقاطع العائلة والاجتماعات أو أرشيفات المبدعين، فهذا لا يعني أن Gemini يستطيع فجأة «مشاهدة» المكتبة بأكملها محليًا. فما زال Gemini يعمل على سحابة Google. وتتمثل البنية الأكثر إثارة للاهتمام في تضييق نطاق أرشيف خاص كبير محليًا، ثم تزويد نموذج متعدد الوسائط بالمقاطع أو النطاقات الزمنية التي تستحق فحصًا أعمق فقط. بعبارة أخرى، تتحول مشكلة البنية التحتية إلى تحويل الفيديو على نطاق التخزين إلى سياق على نطاق الاستعلام.
ما هو الفهم الوكيلي للفيديو في Gemini؟
فهم الفيديو الوكيلي في Gemini هو وضع لمعالجة الفيديو يتيح لـ Gemini التنقل بنشاط داخل الفيديو بدلًا من تحميل الإطارات بمعدل ثابت واحد في تمريرة واحدة.
قدّمت Google هذه الإمكانية في 1 سبتمبر 2026. وقد غطى إعلان الإطلاق في البداية Gemini 3.7 Flash و3.6 Flash و3.5 Flash-Lite؛ كما تسرد وثائق المطورين الحالية من Google أيضًا Gemini 3.8 Flash ضمن النماذج التي تدعم معالجة الفيديو الوكيلة.
وفقًا لـ إعلان Google عن الفهم الوكيلي للفيديو، يجمع النموذج بين الاستدلال وأدوات الفيديو الأصلية للبحث عن الأجزاء ذات الصلة من الإطارات والصوت والنصوص المفرغة وفحصها واستعراضها.
| وضع المعالجة | كيف يشاهد الفيديو | الملاءمة المثلى |
|---|---|---|
| ثابتة | يأخذ عينات من الإطارات بمعدل ثابت، إطار واحد في الثانية افتراضيًا، ويضعها في السياق دفعة واحدة | المقاطع القصيرة أو المتوقعة |
| وكيلية | يتنقل ديناميكيًا عبر الخط الزمني ويحمّل الإطارات أو النص المفرغ أو الصوت ذي الصلة فقط | الفيديوهات الطويلة والاستعلامات التي تستهدف لحظات محددة |
هذا التمييز مهم لأن النموذج لم يعد مجرد مشاهد سلبي.
يمكنه أن يطرح داخليًا سؤالًا من قبيل: أين ينبغي أن أبحث بعد ذلك؟
لماذا تكون مشاهدة الفيديو بمعدل ثابت قدره إطار واحد في الثانية غير فعّالة؟
معالجة الفيديو الثابتة بسيطة ويمكن التنبؤ بها. يأخذ Gemini عينات من الفيديو بمعدل إطارات ثابت—إطار واحد في الثانية افتراضيًا—ويعالج تلك الإطارات المأخوذة مع الصوت.
يعمل ذلك جيدًا عندما يكون الفيديو قصيرًا. لكنه يصبح أقل جاذبية بكثير عندما يستمر الإدخال ساعة أو عدة ساعات.
معالجة الفيديو الثابتة
الفيديو
|
v
أخذ عينات ثابتة بمعدل إطار واحد في الثانية
|
v
الإطار 1
الإطار 2
الإطار 3
الإطار 4
...
|
v
سياق كبير
|
v
النموذج
|
v
الإجابة
تقدّم وثائق Gemini الحالية الخاصة بالرموز من Google مثالًا مفيدًا: فقد تتطلب محاضرة مدتها ساعة نحو 1.08 مليون رمز عند المعالجة الثابتة عالية الدقة، بينما قد تستخدم نحو 108,000 رمز عند المعالجة الوكيلة، بحسب السؤال والمحتوى.
يوجد هذا الاختلاف لأن معظم الأسئلة لا تتطلب كل ثانية من الفيديو.
إذا سأل المستخدم: «ما الاستنتاج الذي توصل إليه المتحدث بشأن تكاليف التخزين؟»، فقد تشغل الأدلة المفيدة 90 ثانية ضمن عرض تقديمي مدته ساعة.
إن معالجة الدقائق الثماني والخمسين الأخرى لا تجعل الإجابة أفضل تلقائيًا.
لماذا قد يفوّت أخذ عينات الإطارات الثابتة أحداثًا مهمة رغم ذلك؟
استهلاك الرموز ليس سوى نصف المشكلة. فقد تنظر أخذ العينات الثابتة أيضًا إلى اللحظات الخاطئة.
لنفترض وجود تسجيل لكاميرا أمنية يضع فيه شخص طردًا على شرفة بين إطارين مأخوذين للعينة:
00:10.0
شرفة فارغة
|
| وُضع الطرد هنا
|
00:11.0
طرد على الشرفة
قد تلتقط معاينة بمعدل إطار واحد في الثانية الحالة قبل الإجراء وبعده، بينما تفوّت الإجراء نفسه.
تسلّط Google الضوء تحديدًا على استرجاع اللحظات التي تقل مدتها عن ثانية باعتباره إحدى القدرات الجديدة للفيديو الوكيلي. إذ يمكن للنموذج تحديد نطاق زمني واعد وإعادة أخذ عينات من تلك النافذة بكثافة أكبر، بدلاً من تطبيق معدل إطارات مرتفع على التسجيل بأكمله.
يكتسب هذا النوع من الفحص الموجّه أهمية خاصة بالنسبة إلى أحداث وتسجيلات كاميرات الأمان المخزنة محليًا، حيث قد يشغل حدث مفيد واحد ثوانٍ معدودة فقط ضمن ساعات من اللقطات.
المبدأ بسيط:
أنفق نطاقًا بصريًا أكبر حيث يُرجّح وجود الإجابة.
كيف يقرر Gemini الأجزاء التي يشاهدها من الفيديو؟
يحوّل الفيديو الوكيلي فهم الفيديو إلى عملية تكرارية. فبدلاً من الالتزام باستراتيجية أخذ عينات واحدة قبل بدء الاستدلال، يمكن لـ Gemini تغيير طريقة فحصه للمدخلات مع تطور المهمة.
تصف Google النظام بأنه يختار ما يشاهده، وبأي سرعة، ومن خلال أي نمط.
USER QUERY
|
v
Reason about what evidence is needed
|
v
استعلام المستخدم
|
+---------------------+
| | |
الاستدلال بشأن الأدلة المطلوبة
التنقل في المخطط الزمني للفيديو
| | |
+----------+----------+
|
v
النص المُفرَّغ الصوت الإطارات
|
+----+----+
| |
هل تم العثور على اللحظة ذات الصلة؟
| |
لا نعم
البحث مجددًا الفحص بعمق أكبر
معدل إطارات أعلى
تفاصيل أعلى
|
v
الإجابة
يؤدي ذلك إلى إنشاء حلقة أقرب إلى التحقيق منها إلى المطالبة متعددة الوسائط العادية.
قد يكشف النص المُفرَّغ أولًا عن الموضع التقريبي الذي يُناقش فيه موضوع ما. ثم يمكن للإطارات التحقق مما ظهر على الشاشة. وإذا كان حدث بصري سريع مهمًا، فيمكن للنموذج فحص ذلك الجزء الضيق بمعدل إطارات أعلى.
تصبح الوسيلة نفسها جزءًا من قرار الاستدلال.
لماذا يمكن لـ Agentic Video استخدام رموز أقل بنسبة تصل إلى 88%؟
يوفّر Agentic Video الرموز من خلال تجنّب الوسائط التي لا تسهم في الإجابة. فهو لا يضغط الفيديو بأكمله ببساطة بنسبة 88%.
توضح ملاحظات تسعير Google الحالية أن استهلاك الرموز متغير لأنه يعتمد على ما يحمّله النموذج ديناميكيًا. وتؤثر في النتيجة كل من درجة تعقيد الاستعلام، ومحتوى الفيديو، وعمق أخذ العينات.
| النتيجة التي أبلغت عنها Google | المعنى |
|---|---|
| رموز أقل بنسبة تصل إلى 88% | يمكن أن يؤدي التحميل الانتقائي إلى تقليل الوسائط الموضوعة في سياق النموذج بشكل كبير |
| خفض في تكلفة التحليل يصل إلى 66% | يمكن أن يؤدي انخفاض استخدام الرموز إلى تقليل التكلفة الإجمالية، لكن ليس بنسبة واحد إلى واحد |
| تحسين في الجودة يصل إلى 7% | يمكن للفحص الديناميكي أيضًا استعادة أدلة قد يفوّتها أخذ العينات الثابت |
هذه هي نتائج Google عبر أعباء عمل الفيديو التي اختبرتها، وليست ضمانات ثابتة لكل إدخال.
توضح ملاحظات تسعير Gemini API الحالية صراحةً أن أعداد رموز Agentic Video تعتمد على المحتوى الذي يحمّله النموذج، لا على المدة الكاملة للفيديو المصدر فحسب.
قد يستهلك السؤال الصعب الذي يجعل النموذج يعيد فحص أقسام عديدة موارد أكبر بكثير من استعلام بسيط يطلب لحظة محددة واحدة.
لماذا لا يعني تقليل عدد الرموز بنسبة 88% خفض التكلفة بنسبة 88%؟
لا يزال الفيديو القائم على الوكلاء ينفّذ الاستدلال والتنقل. فقد يفحص النصوص المُفرَّغة، ويحمّل الإطارات، ويعيد أخذ عينات من مقطع، وينتج إجابة نهائية.
ولهذا فإن أعلى خفض مُعلن من Google في عدد الرموز هو 88%، بينما يبلغ أعلى خفض مُعلن في تكلفة التحليل 66%.
قد تتضمن تكلفة الرموز عدة أنواع من العمل:
- المطالبة النصية الأصلية،
- الاستدلال الملاحي،
- النص المُفرَّغ المحمَّل ديناميكيًا،
- تحميل الإطارات للفحص،
- تحميل الصوت عند الحاجة،
- والاستجابة المُنشأة النهائية.
لذلك، لا يتمثل الهدف في الوصول إلى معالجة معدومة، بل في توجيه المعالجة إلى المواضع التي تحقق أعلى قيمة معلوماتية.
ما الذي يمكن للفيديو القائم على الوكلاء اكتشافه وقد يفوّتُه التحليل الثابت؟
تؤكد Google على العديد من أعباء العمل التي يكون فيها الفحص الزمني التكيفي أهم من مجرد تقليل عدد الرموز.
| حالة الاستخدام | لماذا يساعد الفحص القائم على الوكلاء |
|---|---|
| استرجاع اللحظات التي تقل مدتها عن ثانية | يعيد فحص النوافذ الزمنية الضيقة التي قد تفوتها عينة بمعدل إطار واحد في الثانية |
| البحث عن إبرة في كومة قش | يبحث في تسجيلات تمتد لساعات متعددة دون تحميل كل لحظة بالقدر نفسه |
| اكتشاف الحالات الشاذة | يعيد أخذ عينات الفترات المشبوهة بمعدل إطارات أعلى |
| عدّ الحركات السريعة | يمكنه إعادة مشاهدة النشاط بمعدلات أخذ عينات مختلفة |
| تحرير الفيديو | يمكنه تحديد الانتقالات المرئية الدقيقة وحدود الأحداث |
تكتسب هذه الإمكانات أهمية خاصة في كاميرات المراقبة، ولقطات الرياضات، والبرامج التعليمية، وأرشيفات الاجتماعات، وتسجيلات الشاشة، ووسائط المبدعين.
في كل حالة، قد تكون اللحظة المفيدة بالغة القِصر مقارنةً بالمدة الإجمالية للمادة.
هل تكون المعالجة الوكيلة للفيديو أفضل دائمًا من المعالجة الثابتة؟
لا. قد تظل الفيديوهات القصيرة مرشحةً أفضل للمعالجة الثابتة.
تشير إرشادات التحسين من Google إلى أن الوضع الثابت قد يوفر زمنًا أسرع حتى ظهور الرمز المميز الأول للمقاطع الحساسة لزمن الاستجابة التي تقل مدتها تقريبًا عن خمس دقائق، لأن المعالجة الوكيلة تحتاج إلى الاستدلال والتنقل وتنفيذ جولات داخلية بين الأدوات قبل إنشاء إجابة.
| الحالة | نقطة بداية أفضل |
|---|---|
| مقطع منتج مدته 30 ثانية | ثابتة |
| مقطع قصير تكون فيه سرعة الاستجابة هي العامل الأهم | ثابتة |
| محاضرة مدتها 90 دقيقة | وكيلية |
| العثور على حدث واحد ضمن ساعات من اللقطات | وكيلية |
| فحص حركة سريعة حول طابع زمني واحد | وكيلية |
| ملخص بسيط لفيديو قصير | قد تكون المعالجة الثابتة كافية |
الدرس المفيد ليس أن «المعالجة الوكيلة تستبدل الفيديو الثابت».
إن الاستراتيجية هي أن معالجة الفيديو يمكنها الآن التكيف مع عبء العمل.
هل يستبدل Gemini Agentic Video نظام الاسترجاع المعزز بالفيديو؟
لا. يحلّ تصفح الفيديو وقت الاستعلام والاسترجاع الدائم للفيديو مشكلتين مختلفتين.
يبدأ Gemini Agentic Video بإدخال فيديو ويقرر أي أجزاء من ذلك الإدخال تستحق فحصًا أدق. أما نظام الاسترجاع المعزز بالفيديو فعادةً ما يبدأ قبل ذلك بمرحلة: إذ يساعد في تحديد الفيديوهات أو المقاطع من مجموعة أكبر بكثير التي ينبغي أن تصل إلى النموذج متعدد الوسائط أصلًا.
| الاسترجاع المعزز بالفيديو | الفهم الوكيلي للفيديو |
|---|---|
| يفهرس مجموعة دائمة | يفحص الفيديو المقدَّم وقت الاستعلام |
| يسترجع فيديوهات أو مقاطع مرشحة | يقرر كيفية فحص تلك العناصر المرشحة |
| قد يستخدم النصوص المفرغة والتعرّف الضوئي على الحروف والبيانات الوصفية والتضمينات | يستخدم النص المفرغ والصوت والإطارات ديناميكيًا |
| مفيد عبر أرشيفات ضخمة جدًا | مفيد للاستدلال المتعمق على الوسائط المحددة |
يدعم هذا التمييزَ البحثُ حول فهم الفيديوهات الطويلة.
يتضمن بحث LongVideoBench حول الاستدلال على فيديوهات تمتد لساعات 3,763 فيديو و6,678 سؤالًا مشروحًا بشريًا عبر 17 فئة. ويعرض مؤلفوه التحدي الأساسي بوصفه استرجاع المعلومات التفصيلية متعددة الوسائط من المدخلات الطويلة والاستدلال عليها.
هذه الصياغة مهمة: الاسترجاع والاستدلال، وليس مجرد «وضع الفيديو في سياقه».
كيف يختلف Video RAG عن مجرد إعطاء Gemini فيديو طويلًا؟
يصبح Video RAG مفيدًا بشكل خاص عندما تكون المجموعة أكبر بكثير من تسجيل واحد.
يستكشف بحث VideoRAG حول مجموعات الفيديو الطويلة للغاية هذه المشكلة عبر معيار يضم أكثر من 160 فيديو بإجمالي يتجاوز 134 ساعة.
يجمع النظام المقترح بين إرساء المعرفة النصية والاسترجاع متعدد الوسائط، بدلًا من توقع أن يلتهم استدعاء واحد للنموذج المكتبة بأكملها.
يشير ذلك إلى بنية مفيدة من مرحلتين:
المرحلة 1
استرجاع الفيديو المستمر
أرشيف الفيديو
|
v
النصوص المفرّغة
البيانات الوصفية
المشاهد
OCR
التضمينات
الطوابع الزمنية
|
v
الفيديوهات المرشحة
النطاقات الزمنية المرشحة
|
v
المرحلة 2
فحص الفيديو الوكيلي
المقطع المحدد
|
v
التنقل
إعادة المشاهدة
تغيير معدل الإطارات
فحص الصوت / النص المفرغ / الإطارات
|
v
إجابة متعمقة
وتتكامل الطبقتان.
يحدد الاسترجاع أي فيديو ينبغي فحصه؛ بينما يحدد الفهم الوكيلي للفيديو مدى عمق فحصه.
لماذا ينبغي لمكتبات الفيديو الكبيرة إجراء البحث قبل التحليل العميق بالذكاء الاصطناعي؟
قد يحتوي خادم الوسائط الشخصي على 20 تيرابايت من الفيديو. وقد ينمو أرشيف المراقبة الأمنية إلى حجم أكبر بكثير. ومع ذلك، قد يعتمد سؤال المستخدم في النهاية على ثماني ثوانٍ من التسجيل.
هذا الاختلاف يغيّر البنية.
لا ينبغي للنموذج متعدد الوسائط أن يضطر إلى أن يصبح فهرسًا للأرشيف بأكمله.
بدلًا من ذلك:
أرشيف فيديو بسعة 50 تيرابايت
|
v
فهرس محلي قابل للبحث
|
v
20 فيديو مرشحًا
|
v
3 نطاقات زمنية مرشحة
|
v
45 ثانية من الفيديو ذي الصلة
|
v
استدلال عميق متعدد الوسائط
الأرقام الدقيقة توضيحية، لكن المبدأ قابل للتوسع.
تتمثل مشكلة البنية التحتية في تحويل الفيديو على نطاق التخزين إلى سياق على نطاق الاستعلام.
كلما نما الأرشيف، أصبحت طبقة الاختيار هذه أكثر أهمية، لا أقل. يوضح دليلنا حول أجهزة AI NAS لفهرسة الوسائط ومعالجتها والتعامل مع مجموعات البيانات المحلية الكبيرة سبب ضرورة تحديد سعة التخزين وطبقة SSD النشطة والشبكة وقدرات الحوسبة بالذكاء الاصطناعي كموارد منفصلة، بدل التعامل معها كمتطلب عام واحد للذكاء الاصطناعي.
كيف سيبدو خط معالجة الفيديو في جهاز NAS مزوّد بالذكاء الاصطناعي؟
لا يحتاج جهاز NAS مزوّد بالذكاء الاصطناعي يفهرس الوسائط المخزنة ويفهمها إلى تشغيل Gemini بنفسه كي يساهم بذكاء مفيد. إذ يمكنه تولّي العمل المستمر والمتكرر الأقرب إلى الوسائط الأصلية.
يمكن أن تبدو البنية الهجينة العملية على النحو التالي:
أرشيف فيديو NAS
الفيديوهات الأصلية
|
v
المعالجة المحلية
البيانات الوصفية للملف
النصوص المفرّغة
حدود المشاهد
الطوابع الزمنية
OCR
الصور المصغرة
وسوم الكائنات
التضمينات
|
v
البحث المحلي
|
v
الفيديو المرشح
النطاق الزمني المرشح
|
v
السياسة / قرار المستخدم
|
+--------------------+
| |
v v
نموذج محلي نموذج سحابي
|
v
الفيديو الوكيلي من Gemini
|
v
استدلال عميق على الفيديو
هذا نمط معماري، وليس تكاملًا معلنًا من Google مع منتجات NAS.
وتتمثل الميزة في أن التخزين والفهرسة واستدلال النموذج لم تعد مضطرة إلى الحدوث على الجهاز نفسه.
يمكن لشبكة NAS سحابية شخصية متعددة الأقراص، مثل ZimaCube 2، أن تظل طبقة الوسائط الدائمة. ويمكن لوحدة معالجة مركزية أو وحدة معالجة رسومات محلية إنشاء البيانات الوصفية. كما يمكن تخصيص نموذج سحابي متعدد الوسائط للأسئلة التي يستحق فيها استدلاله الزمني الأقوى تكلفة النقل وواجهة API.
في إعداد مقسّم، يمكن لخادم محلي مدمج للفهرسة والمعالجة المسبقة، مثل ZimaBoard 2، تشغيل خدمات قريبة من التخزين أيضًا، من دون الحاجة إلى إبقاء جهاز الاستدلال عالي القدرة نشطًا لكل مهمة في الخلفية.
هل ينبغي أن تكون البيانات الوصفية للفيديو وفهارس الذكاء الاصطناعي بجوار الملفات الأصلية؟
ليس بالضرورة، لكن إبقاء الطبقة القابلة للبحث قريبة من الأرشيف يمكن أن يبسط عدة جوانب من سير عمل الوسائط الخاصة.
| طبقة البيانات المحلية | لماذا نُبقيه قريبًا من الأرشيف؟ |
|---|---|
| البيانات الوصفية للملف | يسهل إعادة إنشائها وتحديثها عند تغيّر الوسائط |
| النصوص المفرّغة | يمكن البحث فيها دون إعادة فتح كل فيديو |
| الطوابع الزمنية للمشاهد | يوفّر مسارات مباشرة إلى المقاطع الأصلية |
| الصور المصغرة | يتيح التصفح البصري الخفيف |
| التضمينات | يتيح الاسترجاع الدلالي عبر المجموعة |
| نصوص OCR | يجعل اللافتات والشرائح والواجهات والتعليقات قابلة للبحث |
وتهم المسارات الثابتة أيضًا. فإذا أشار الفهرس إلى وقوع حدث في camera-02/2026-09-01.mp4 عند 18:41:12، يحتاج نظام الاسترجاع إلى طريقة موثوقة للعثور على ذلك الملف الأصلي لاحقًا.
لذلك، في مجموعات الوسائط طويلة الأمد، يرتبط الفهرس والأرشيف ارتباطًا وثيقًا حتى عندما يكونان مخزنين تقنيًا في قواعد بيانات أو وحدات تخزين منفصلة.
يظهر التقسيم نفسه للتخزين في أنظمة الصور والفيديو المستضافة ذاتيًا. على سبيل المثال، يفصل دليل أجهزة Immich لمكتبات الصور والفيديو بين الملفات الأصلية الكبيرة وأحمال قواعد البيانات والصور المصغرة والتعلّم الآلي ومعالجة الفيديو الحساسة لزمن الاستجابة.
ما بنية الذكاء الاصطناعي للفيديو الساخن والدافئ والبارد؟
كما أن أرشيفات الفيديو الكبيرة لا تحتاج إلى تخزين كل جزء من البيانات بمستوى المعالجة نفسه.
يفصل التصميم المفيد بين ثلاث طبقات:
| الطبقة | المحتويات | الأولوية |
|---|---|---|
| الأرشيف البارد | لقطات أصلية بدقة 4K، وتسجيلات قديمة، وأرشيف المراقبة | السعة والمتانة |
| فهرس الذكاء الاصطناعي الدافئ | النصوص المفرغة، والطوابع الزمنية، والصور المصغرة، والتعرف الضوئي على الحروف، والتضمينات، والوسوم | قابلية البحث |
| مجموعة العمل الساخنة | مقاطع مرشحة، واقتصاصات مؤقتة، ومقاطع بمعدل إطارات مرتفع | تحليل سريع بالذكاء الاصطناعي |
بارد
20 تيرابايت من الوسائط الأصلية
|
v
دافئ
بيانات وصفية قابلة للبحث + فهارس
|
v
ساخن
مقطع ذو صلة مدته من 10 إلى 60 ثانية
|
v
نموذج الذكاء الاصطناعي
تحافظ هذه البنية على تركيز التحليل المكلف على جزء صغير جدًا من البيانات الأصلية.
كما تتجنب إعادة إنشاء البيانات الوصفية الأساسية نفسها في كل مرة يصل فيها سؤال جديد.
عادةً ما تحتاج الطبقتان الدافئة والساخنة إلى سعة أقل بكثير من أرشيف الفيديو الأصلي، لكنهما تستفيدان من تخزين SSD سريع لقواعد البيانات والصور المصغرة والتضمينات والفهارس والمقاطع المؤقتة. وعلى خادم منزلي قابل للتوسعة، يمكن لـ توسعة PCIe إلى NVMe SSD للفهارس النشطة وذاكرات التخزين المؤقت للذكاء الاصطناعي أن تفصل بيانات العمل هذه عن تخزين الأقراص الصلبة الضخمة.
هل يستطيع Gemini Agentic Video تحليل لقطات NAS الخاصة دون تحميلها؟
لا. إن Gemini Agentic Video بحد ذاته قدرة سحابية، لذا يجب أن يصبح محتوى الفيديو الذي يحلله Gemini متاحًا لخدمة Google.
تدعم Google حاليًا عدة مسارات لإدخال الفيديو، بما في ذلك الوسائط المُحمَّلة، وتسجيل Cloud Storage، والبيانات المضمّنة للمدخلات الصغيرة، وعناوين URL العامة على YouTube.
توصي وثائق معالجة الفيديو في Gemini باستخدام Files API للعديد من مدخلات الوسائط الأكبر حجمًا أو القابلة لإعادة الاستخدام.
تُخزَّن الملفات التي تُحمَّل عبر Gemini Files API لمدة 48 ساعة قبل حذفها تلقائيًا، وفقًا لوثائق Google الحالية.
وهذا يختلف تمامًا عن القول إن اللقطات تبقى داخل الشبكة المنزلية.
تنص وثائق تسعير واجهة برمجة التطبيقات الحالية من Google للفئة المدفوعة أيضًا على أن بيانات الفئة المدفوعة لا تُستخدم افتراضيًا لتحسين منتجاتها. ومع ذلك، ينبغي للمطورين تقييم متطلبات الاحتفاظ بالبيانات والتسجيل والموقع الجغرافي والمتطلبات التنظيمية والامتثال قبل إرسال التسجيلات الحساسة إلى خدمة خارجية.
كيف يمكن لأرشيف فيديو خاص استخدام الذكاء الاصطناعي السحابي بشكل انتقائي؟
يمكن لسير عمل هجين تقليل حجم الوسائط الخاصة التي تحتاج إلى معالجة خارجية.
يمكن أن تبقى المرحلة الأولى محلية:
- تحديد الملف،
- البحث في نص التفريغ،
- التصفية حسب الكاميرا أو التاريخ،
- اكتشاف الحركة أو تغيّرات المشهد،
- استرجاع الطوابع الزمنية المرشحة،
- وإنشاء مقطع مرشح قصير.
يتبع هذا النوع من الفصل المبدأ نفسه الذي نناقشه في دليلنا حول إبقاء معالجة الذكاء الاصطناعي القريبة من التخزين قريبةً من البيانات الخاصة: يمكن لجهاز NAS أن يظل طبقة بيانات مستقرة حتى عندما يحدث الاستدلال الأثقل في مكان آخر.
عندها فقط تحدد آلية العمل ما إذا كان الاستدلال السحابي ضروريًا.
أرشيف فيديو خاص
|
v
البحث المحلي + التصفية
|
v
العثور على المقطع ذي الصلة
|
v
هل يتطلب هذا السؤال
هل تحتاج إلى استدلال أقوى متعدد الوسائط؟
|
+---+---+
| |
لا نعم
| |
v v
محلي مقطع معتمد
الإجابة |
v
الفيديو الوكيلي من Gemini
هذا لا يجعل Gemini محليًا، بل يجعل حدود البيانات أضيق.
بدلًا من اعتبار أرشيف خاص كامل سياقًا محتملًا للسحابة، يمكن للنظام تحديد الوسائط التي تستحق التصعيد.
متى ينبغي أن يبقى تحليل الفيديو محليًا، ومتى يُنقل إلى Gemini؟
تعتمد الإجابة الصحيحة على الخصوصية والصعوبة والحجم والعتاد ومدى احتياج المهمة إلى الاستدلال متعدد الوسائط.
| مهمة الفيديو | نقطة البداية المرجحة |
|---|---|
| البحث في نص التفريغ عن عبارة | محلي |
| تصفية اللقطات حسب التاريخ أو الكاميرا | محلي |
| إنشاء صور مصغرة | محلي |
| اكتشاف الحركة الأساسي | محلي |
| إنشاء تمثيلات متجهية لأرشيف خاص | محلي |
| العثور على فيديو ذي صلة دلالية | يمكن أن يكون الاسترجاع المحلي قويًا |
| تفسير تسلسل معقد من الأحداث | نموذج متقدم متعدد الوسائط |
| تحديد حركة دقيقة تستغرق أقل من ثانية | قد يساعد تحليل الفيديو الوكيلي |
| الاستدلال عبر المرئيات والكلام والترتيب الزمني | نموذج متقدم متعدد الوسائط |
| لقطات أمنية شديدة الحساسية | أبقِ المعالجة محلية ما لم تكن المعالجة الخارجية مقبولة صراحةً |
بالنسبة إلى عمليات النشر التي تعتمد بكثافة على الكاميرات، تكتسب هذه الموازنة أهمية خاصة لأن التسجيل المستمر والكشف الفوري ينشئان أعباء عمل مختلفة. يغطّي دليلنا حول تخزين مسجل الفيديو الشبكي الخاص وذكاء الفيديو المحلي جانب التخزين والكشف الدائم التشغيل بشكل منفصل عن الاستدلال السحابي متعدد الوسائط.
الهدف ليس تعظيم المعالجة المحلية أو السحابية.
بل استخدام الطبقة الأرخص والأكثر أمانًا القادرة على حل كل جزء من المهمة.
هل يغيّر الفيديو الوكيلي من Gemini ما ينبغي أن يفعله جهاز NAS مزوّد بالذكاء الاصطناعي؟
نعم، ولكن ليس بتحويل جهاز NAS إلى آلة يتعين عليها فهم كل إطار باستخدام أكبر نموذج متعدد الوسائط ممكن.
الدور الأكثر قابلية للتوسع هو جعل مجموعة الوسائط قابلة للتنقل باستخدام الذكاء الاصطناعي.
وهذا يعني الحفاظ على النسخ الأصلية مع صيانة ما يلي:
- والنصوص القابلة للبحث،
- والبيانات الوصفية المتزامنة مع الوقت،
- وفهارس المشاهد،
- والتعرف الضوئي على الحروف،
- والتمثيلات المتجهية،
- والصور المصغرة،
- الأذونات،
- وروابط موثوقة تعيد الوصول إلى لقطات المصدر.
وهذا هو الدور الأوسع الذي يصفه التخزين الشبكي المدعوم بالذكاء الاصطناعي باعتباره طبقة ذكاء محلية للبيانات المخزنة: تظل مساحة التخزين هي الأساس، بينما تجعل الفهارس وخدمات الذكاء الاصطناعي البحث في تلك البيانات وفهمها وإعادة استخدامها أسهل.
وبمجرد وجود هذه الطبقة، يصبح نموذج الاستدلال قابلًا للاستبدال.
قد يكون Gemini Agentic Video هو المستخدم اليوم. وقد تستخدم سيرورة عمل أخرى نموذجًا محليًا متعدد الوسائط. وربما يدمج نظام مستقبلي عدة نماذج اعتمادًا على الخصوصية أو التكلفة أو الدقة.
لا ينبغي أن يُعاد بناء الأرشيف لكل نموذج.
هذا هو الدرس المعماري نفسه الذي يظهر عبر أشكال أخرى من بيانات الذكاء الاصطناعي: لا يحتاج النموذج إلى جميع معلومات المستخدم، بل يحتاج إلى أصغر جزء صحيح من المعلومات للمهمة الحالية.
وبالنسبة إلى النص، قد يعني ذلك حفنة من المستندات المسترجعة.
وبالنسبة إلى ذاكرة الوكيل، قد يعني ذلك مجموعة صغيرة من ملفات المعرفة المنظّمة.
بالنسبة إلى الفيديو، قد يعني ذلك اثنتي عشرة ثانية مخفية داخل خمسين تيرابايت من التسجيلات.
يُعد Gemini Agentic Video مهمًا لأنه يقرّب الاستدلال متعدد الوسائط من ذلك النموذج. فبدلًا من التعامل مع الفيديو على أنه كتلة سياق عملاقة، يستطيع النظام أن يقرر بنشاط أين يستحق الانتباه أن يُبذل.
بالنسبة إلى مكتبات الوسائط الخاصة الكبيرة، تصبح الخطوة التالية أكثر أهمية:
لا ينبغي أن يصبح النموذج متعدد الوسائط هو الفهرس، بل ينبغي أن يصبح المحقق الذي يصل بعد أن يكون الفهرس قد ضيّق نطاق البحث.
الأسئلة الشائعة: Gemini Agentic Video والتخزين الشبكي المدعوم بالذكاء الاصطناعي والبحث الخاص في الوسائط
ما المقصود بفهم الفيديو الوكيلي في Gemini؟
إنه وضع لمعالجة الفيديو في Gemini يتنقل ديناميكيًا عبر الخط الزمني للفيديو بدلًا من معالجة جميع الإطارات المأخوذة عيناتها في تمريرة ثابتة واحدة. ويمكن للنموذج فحص النصوص والصوت والإطارات المرئية انتقائيًا وزيادة تفصيل أخذ العينات عندما يحتاج مقطع واعد إلى تحليل أدق.
كم عدد الرموز الأقل التي يستخدمها Gemini Agentic Video؟
تفيد Google باستخدام رموز أقل بنسبة تصل إلى 88% في أعباء عمل الفيديو الطويل التي اختبرتها. وهذا ليس خفضًا ثابتًا. يعتمد الاستخدام الفعلي للرموز على الفيديو وتعقيد الاستعلام ومقدار المحتوى الذي يختار النموذج فحصه.
هل يعني استخدام رموز أقل بنسبة 88% أن Gemini Agentic Video أرخص بنسبة 88%؟
لا. تفيد Google بخفض تكاليف التحليل بنسبة تصل إلى 66%. ولا تزال المعالجة الوكيلة تستخدم الرموز للتنقل والاستدلال ومحتوى الفيديو المُحمّل ديناميكيًا والمخرجات النهائية.
هل يتمتع Gemini Agentic Video بدقة أعلى من معالجة الفيديو الثابتة؟
تُبلغ Google عن تحسينات في الجودة تصل تقريبًا إلى 7% عبر معايير الاختبار التي أجرتها. وتكون الفائدة مهمة بشكل خاص عندما يحتاج النموذج إلى العثور على أحداث وجيزة أو أدلة محددة داخل تسجيلات طويلة.
ما معدل الإطارات الذي يستخدمه Gemini عادةً للفيديو؟
يستخدم وضع معالجة الفيديو الثابت الافتراضي في Gemini عينات من الإطارات بمعدل إطار واحد في الثانية. ويمكن للمطورين ضبط معدلات مختلفة، بينما تستطيع Agentic Video تغيير كثافة فحص أقسام معينة ديناميكيًا.
هل تُعد Agentic Video أفضل للمقاطع القصيرة؟
ليس دائمًا. تفيد إرشادات Google بأن المعالجة الثابتة قد توفر زمنًا أسرع للوصول إلى أول رمز في مقاطع الفيديو القصيرة الحساسة للزمن، لأن الوضع الوكيلي يضيف خطوات للتنقل والاستدلال قبل الإجابة.
هل تحل Gemini Agentic Video محل Video RAG؟
لا. يمكن لـ Video RAG فهرسة المرشحين واستردادهم من أرشيف دائم كبير. ثم يمكن لـ Agentic Video فحص فيديو أو مقطع محدد بعمق أكبر. يحدد الاسترداد ما ينبغي فحصه، بينما يحدد استدلال الفيديو الوكيلي كيفية فحصه.
هل يمكن تشغيل Gemini Agentic Video مباشرةً على NAS؟
لا. تُعد Gemini Agentic Video حاليًا قدرة مستضافة لدى Google. ويمكن لـ NAS تخزين الوسائط الأصلية وفهرستها، لكن المحتوى المرسل إلى Gemini يجب أن يصبح متاحًا لخدمة Google السحابية.
كم من الوقت يحتفظ Gemini بملفات الفيديو المرفوعة؟
تذكر وثائق Google الحالية لواجهة Files API أن الملفات المرفوعة تُخزَّن لمدة 48 ساعة. وينبغي للمطورين الذين يعملون على لقطات حساسة مراجعة أحدث سياسات الواجهة البرمجية، والسجلات، والاحتفاظ بالبيانات، واستخدامها قبل رفع الوسائط.
ما الذي ينبغي أن يخزنه NAS مخصص للذكاء الاصطناعي إلى جانب مقاطع الفيديو الأصلية؟
قد تتضمن طبقة الوسائط القابلة للبحث نصوصًا مفرغة، وطوابع زمنية، وصورًا مصغرة، ونصوص OCR، وحدود المشاهد، ووسوم الكائنات أو الأحداث، وتضمينات، وبيانات وصفية أخرى تتيح لنظام الذكاء الاصطناعي استرداد المقاطع ذات الصلة دون إعادة معالجة الأرشيف بأكمله مرارًا.
هل تحتاج فهارس فيديو الذكاء الاصطناعي إلى تخزين SSD أم NVMe؟
لا يحتاج كل أرشيف فيديو إلى أقراص NVMe لوسائطه الأصلية. يمكن أن تبقى اللقطات الضخمة على وحدات تخزين موجهة للسعة، بينما تستفيد قواعد البيانات والصور المصغرة والتضمينات والفهارس ومقاطع العمل المؤقتة التي يتم الوصول إليها كثيرًا من طبقة SSD أو NVMe أسرع. ويعتمد التخطيط المناسب للتخزين على حجم المكتبة، ونشاط الفهرسة، وأحمال العمل المتزامنة.
هل ينبغي تحليل لقطات المراقبة محليًا أم في السحابة؟
تُعد اللقطات الحساسة مرشحًا قويًا للتصفية والفهرسة والتحليل الأساسي محليًا. وقد تكون المعالجة السحابية مفيدة للأسئلة الأصعب متعددة الوسائط عندما يوافق المستخدم أو المؤسسة صراحةً على نقل البيانات خارجيًا وعلى سياسات الاحتفاظ المعمول بها.
ما أفضل بنية لمكتبة فيديو ضخمة جدًا للذكاء الاصطناعي؟
يفصل التصميم القابل للتوسع بين الأرشيف الأصلي، وطبقة بيانات وصفية دائمة قابلة للبحث، ومجموعة عمل صغيرة ونشطة من المقاطع المرشحة، ونموذج الاستدلال متعدد الوسائط. ويحوّل ذلك مجموعة مخزنة كبيرة إلى قدر أصغر بكثير من السياق ذي الصلة بالاستعلام.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

أفضل 10 واجهات ويب للذكاء الاصطناعي المحلي لمختبرات المنزل في عام 2026
قارن بين 10 واجهات ويب للذكاء الاصطناعي المحلي المستضاف ذاتيًا لمختبرات المنازل، مع تغطية دعم Ollama، وتقنية RAG، والوكلاء، والوصول متعدد المستخدمين، وسهولة الإعداد،...

كم تبلغ تكلفة GPT-6 Astra بمرور الوقت؟ ومتى يكون الذكاء الاصطناعي السحابي خيارًا منطقيًا مقارنةً بالذكاء الاصطناعي المحلي؟
دليل عملي لتكلفة GPT-6 Astra يغطي استخدام الرموز، وأحمال عمل الذكاء الاصطناعي طويلة الأمد، والمفاضلة بين السحابة والتشغيل المحلي، ولماذا تُعد البنية التحتية الهجينة...

GPT-6 Astra مقابل الذكاء الاصطناعي المحلي: ما الأجزاء من الوكيل التي ينبغي أن تبقى على خادمك المنزلي؟
يمكن لـ GPT-6 Astra أن يبقى في السحابة، بينما يحتفظ خادمك المنزلي بالملفات والذاكرة وRAG والأدوات والأذونات وحالة الوكيل الدائمة محليًا.

