يفصل تمييز المتحدثين الأصوات من خلال تحديد مواضع الكلام، واستخراج خصائص المتحدثين في شكل تمثيلات متجهية، وتجميع المقاطع المتشابهة، ثم إسناد تسميات المتحدثين مجددًا إلى الخط الزمني للتسجيل الصوتي.
قد يضم الأرشيف الخاص مقابلات واجتماعات ومقاطع فيديو منزلية وملاحظات صوتية، حيث لا تكفي الكلمات وحدها. يضيف تمييز المتحدثين بنية توضّح من تحدث ومتى، من دون إرسال التسجيل خارج الخادم المنزلي.
يحدد تمييز المتحدثين أولًا مواضع وجود الكلام
يبدأ تمييز المتحدثين عادةً بفصل الكلام عن الصمت والصوت غير الكلامي. ويمنع ذلك الموسيقى وصوت الغرفة وفترات الصمت الطويلة من التحول إلى أدلة زائفة على هوية المتحدث.
تصف NVIDIA خط أنابيب متسلسلًا لتمييز المتحدثين يبدأ باكتشاف النشاط الصوتي قبل استخراج تمثيلات المتحدثين وتجميعها. وتنتج مرحلة اكتشاف النشاط الصوتي طوابع زمنية لمناطق الكلام. ويفصل NeMo عملية تمييز المتحدثين إلى مراحل لاكتشاف الكلام، وتمثيل المتحدث، والتجميع، وهو ما يوضح سبب حاجة خط الأنابيب أولًا إلى خط زمني للكلام قبل إسناد المتحدثين عبر خط أنابيب NVIDIA NeMo لتمييز المتحدثين.
على الخادم المنزلي، يقلل ذلك أيضًا من العمل غير الضروري ويضع حدًا مبكرًا لاكتشاف الأخطاء. فإذا قُصّ الكلام الهادئ في هذه المرحلة، فلن يتمكن تجميع المتحدثين لاحقًا من استعادة مقطع الصوت المفقود.
تجعل تمثيلات المتحدثين مقاطع الصوت قابلة للمقارنة
يُحوَّل كل نطاق كلام مكتشف إلى تمثيل متجهي للمتحدث: وهو متجه مدمج يحافظ على الخصائص المفيدة للتمييز بين الأصوات.
يوثّق NeMo خط أنابيب تُستخرج فيه تمثيلات المتحدثين قبل التجميع. وتمثل هذه المتجهات تشابه المتحدثين، لا الاسم الحقيقي لأحد أفراد المنزل. وتصف Google Research تمثيلات المتحدثين بأنها جزء أساسي من أنظمة تمييز المتحدثين الحديثة، ما يدعم استخدام التمثيلات المتجهية لمقارنة المتحدث عبر المقاطع في أبحاث Google حول تمييز المتحدثين.
وهذا يعني أن الأرشيف الخاص يمكنه إنتاج «المتحدث 1» و«المتحدث 2» من دون الاحتفاظ بقاعدة بيانات للهويات.
أما ربط مجموعة بأحد الأشخاص الحقيقيين فهو خطوة منفصلة للتسجيل أو وضع التسميات.
يحوّل التجميع التمثيلات المتشابهة إلى تسميات للمتحدثين
بعد إنشاء التمثيلات، يجمع النظام المتجهات المتشابهة في مجموعات. وتصبح كل مجموعة هوية مؤقتة لمتحدث في التسجيل.
تحدد NVIDIA التجميع بوصفه الوحدة التي تجمع تمثيلات المتحدثين. ويعتمد التجميع على التشابه الصوتي، لا على الكلمات التي يجري تفريغها. وقد تعاملت Microsoft Research مع تمثيلات المتحدثين المتعلَّمة وتجميعها بوصفهما مشكلتين مترابطتين في تمييز المتحدثين، ما يدعم مرحلة التجميع الموضحة في أبحاث Microsoft Research حول تجميع المتحدثين.
ولهذا يختلف تمييز المتحدثين عن التعرف على الكلام. فقد يحتوي التفريغ النصي على كلمة خاطئة، بينما يظل الصوت المحيط منسوبًا إلى مجموعة المتحدث الصحيحة.
تحدد حدود الأدوار متى يتغير المتحدث
التسجيل متواصل، لذلك يجب أن يقرر خط الأنابيب ليس فقط المجموعة الملائمة، بل أيضًا الموضع الذي ينتهي عنده دور متحدث ويبدأ دور متحدث آخر.
يدعم NeMo تمييز المتحدثين متعدد المقاييس باستخدام تمثيلات من مقاطع ذات أطوال مختلفة. وتعمل النوافذ الأطول على تثبيت الهوية، بينما تساعد النوافذ الأقصر في تحديد التغييرات السريعة. وتعمل أنظمة تمييز المتحدثين الحديثة على نمذجة أدوار المتحدثين وحدود التقسيم صراحةً، بدل إسناد تسمية متحدث واحد إلى تسجيل كامل، كما يظهر في أبحاث pyannote حول تمييز المتحدثين.
وتكشف المحادثات المنزلية السريعة هذا التوازن. فقد تؤدي النوافذ الطويلة جدًا إلى طمس انتقال سريع بين المتحدثين؛
بينما قد تحتوي النوافذ القصيرة جدًا على معلومات صوتية قليلة لا تكفي لتجميع مستقر.
تُعاد محاذاة تسميات المتحدثين مع النصوص القابلة للبحث
بمجرد تحديد أدوار المتحدثين، يمكن محاذاة طوابعها الزمنية مع مخرجات التعرف التلقائي على الكلام، بحيث يحتفظ الأرشيف بما قيل وبمن يُرجَّح أنه قاله.
تعرّف NVIDIA تمييز المتحدثين بأنه الإجابة عن سؤالَي من تحدث ومتى، بالتزامن مع التعرف على الكلام. ولذلك يمكن إعادة تشغيل الطبقتين بشكل مستقل. وتوضح الأبحاث حول تمييز المتحدثين على الجهاز إمكانية تنفيذ فصل المتحدثين محليًا، ما يجعل تمييز المتحدثين مفيدًا للأرشيفات الصوتية الخاصة من دون الحاجة إلى المعالجة السحابية؛ راجع أبحاث تمييز المتحدثين على الجهاز.
تكمّل هذه الآلية تحليل ZimaSpace بشأن تبدّل هوية المتحدث في التفريغات الصوتية المنزلية الطويلة، الذي يركز على انجراف المجموعات بعد إنشاء خط أنابيب تمييز المتحدثين المعتاد بالفعل.
يضع التداخل والتغير الصوتي حدودًا عملية
يتحدث شخصان في الوقت نفسه، وهو ما يخالف افتراض وجود متحدث واحد في كل مقطع.
وقد ينتج عن المقطع المختلط تمثيل متجهي لا ينتمي بوضوح إلى أي من الصوتين.
يميز NeMo بين خطوط أنابيب التجميع والأساليب العصبية، مثل اكتشاف النشاط الصوتي للمتحدث المستهدف لتقدير تسميات المتحدثين. وتساعد هذه الأساليب في التعامل مع التداخل، لكنها لا تزيل صعوبة الظروف الصوتية. كما تسلط IBM Research الضوء على صعوبة التداخل وتغير الظروف الصوتية، مؤكدةً أن جودة تمييز المتحدثين لها حدود عملية موضحة في أبحاث IBM حول تمييز المتحدثين.
وقد تؤدي المسافة والصدى أيضًا إلى تشويه خصائص الهوية. ويوضح تحليل ZimaSpace للتعرف على الصوت من مسافة بعيدة التغيرات الصوتية الأولية التي يمكن أن تؤثر في كل من التعرف على الكلام وتمييز المتحدثين.
مركز التكنولوجيا والذكاء الاصطناعي
المزيد للقراءة

الحالة أثناء التشغيل مقابل الحالة المستمرة في Home Assistant: ما الذي يجب أن يبقى بعد إعادة التشغيل؟
لا يحتفظ Home Assistant بكل قيمة مباشرة؛ إذ تؤدي الإعدادات والسجلات والحالات المحددة المستعادة وبيانات النشر أدوارًا مختلفة عند إعادة التشغيل.

كيف يُجري Home Assistant مصادقة الجلسات المحلية وعن بُعد؟
تستخدم جلسات Home Assistant المحلية وعن بُعد نموذج الهوية نفسه من جهة الخادم؛ إذ يغيّر الوصول عن بُعد المسار وحدود TLS، وليس تدفق الرموز...

لماذا قد تصبح استعلامات سجل Home Assistant بطيئة مع نمو بيانات المسجّل؟
يمكن أن يؤدي نمو بيانات Recorder إلى زيادة تكلفة استعلامات History عندما يشمل النطاق المطلوب عددًا أكبر من الصفوف، أو تزداد حالات فقدان ذاكرة...

