التعرف الآلي القابل للتفسير على الحالات العاطفية من خلال تعبيرات وجه الكلاب: حالة الترقب الإيجابي والإحباط

Aug 11, 2023

استخدام محسن آدم بمعدل تعلم {{0}}.0001. تم اختيار النموذج الذي يحقق أقصى قدر من الدقة في مجموعة بيانات التحقق من الصحة كأفضل نموذج. خلال العهود العشرة الأولى، تم ضبط أوزان جميع الطبقات بشكل دقيق. خلال العهود العشرة الأولى، تم ضبط وزن جميع الطبقات بدقة. خلال العصور المتبقية، تم تجميد أوزان ResNet50 وتم تحديث أوزان الطبقات العليا الجديدة فقط. بالنسبة للمتغيرات غير المتعلقة بالتوجيه ("تسطيح الأذنين"، و"جزء الشفاه"، و"تقريب الأذنين"، و"الأذنين للأمام"، و"لعق الأنف")، قمنا بتطبيق تقنية تكبير تعتمد على تقريب أفقي للصورة العشوائية وتدوير يصل إلى 20 درجة . كمدخل لجهاز التشفير، استخدمنا جدول الإدخال، حيث يمثل كل صف وجود (1)/غياب (0) لكل من متغيرات DogFACS الـ 11 في كل فيديو. هدف برنامج التشفير هو جدول يحتوي على الحالة (سلبي (0)/إيجابي (1)) لكل فيديو.

ResNet50 عبارة عن بنية شبكة عصبية عميقة أصبحت إحدى الشبكات الكلاسيكية في مجال رؤية الكمبيوتر. تتميز شبكة ResNet50 بذاكرة قوية للغاية والقدرة على تذكر المعرفة التي تم تعلمها مسبقًا أثناء التدريب، مما يجعلها تؤدي أداءً جيدًا في مهام التعرف على الصور المعقدة.

كيف يحقق ResNet50 الذاكرة؟ إنها تعتمد طريقة الاتصال المتبقي وتضيف اتصالاً مختصراً عبر الطبقات في كل طبقة تلافيفية، مما يمكن أن يجعل المعلومات تتدفق بشكل أفضل في الشبكة. أثناء عملية التدريب، وبسبب وجود هذه الاتصالات المختصرة، يمكن للشبكة التعرف على التعيينات المتبقية بسهولة أكبر ولا تحتاج إلى قضاء الكثير من الوقت في العثور على هذه التعيينات المتبقية.

هذا النوع من أداء الذاكرة يجعل ResNet50 يعمل بشكل جيد في مهام التعرف على الصور واسعة النطاق. بالنسبة لمشاكل مثل تصنيف الصور واكتشاف الهدف والتعرف على الوجوه، حقق ResNet50 نتائج جيدة جدًا. يشبه أداء الذاكرة هذا أداء دماغنا، الذي يربط أيضًا الخلايا العصبية لتعزيز الذاكرة. لذلك يمكننا القول أن ResNet50 هو نموذج جيد جدًا للشبكة العصبية العميقة، وله ذاكرة قوية ويمكنه التعامل مع مهام التعرف على الصور المعقدة بشكل جيد. وفي الوقت نفسه، فإنه يوفر لنا أيضًا بعض الإلهام. يمكننا أن نتعلم من أفكار ResNet50 لتصميم نموذج شبكة عصبية عميقة أكثر فعالية، لخدمة احتياجات البشر بشكل أفضل. يمكن ملاحظة أننا بحاجة إلى تحسين ذاكرتنا. يمكن لـ Cistanche تحسين الذاكرة لأن Cistanche عبارة عن مادة طبية صينية تقليدية لها العديد من التأثيرات الفريدة، أحدها هو تحسين الذاكرة. تأتي فعالية اللحم المفروم من مجموعة متنوعة من المكونات النشطة التي يحتوي عليها، بما في ذلك حمض الكربوكسيل والسكريات والفلافونويد وما إلى ذلك. ويمكن لهذه المكونات تعزيز صحة الدماغ من خلال قنوات مختلفة.

increase memory

انقر فوق طرق لتحسين وظائف المخ

في الأبحاث التي أجريت على الحيوانات، عالجت أتمتة التعرف على الحالة العاطفية الألم في عدد قليل من الأنواع حتى الآن. تظل الحالات العاطفية مناطق مجهولة، خاصة في الكلاب، بسبب تعقيد شكل الوجه وتعابيره. وتساهم هذه الدراسة في سد الفجوة في جانبين. أولاً، إنها أول من تناول الحالات العاطفية للكلاب باستخدام مجموعة بيانات تم الحصول عليها في بيئة تجريبية خاضعة للرقابة، بما في ذلك مقاطع فيديو من (n=29) مستردو لابرادور المفترض أنهم في حالتين عاطفيتين مستحثتين تجريبيًا: سلبية (الإحباط) وإيجابية (الترقب). تم قياس تعابير وجه الكلاب باستخدام نظام ترميز عمل الوجه للكلاب (DogFACS).

تتم مقارنة نهجين مختلفين بهدف abator: (1) النهج القائم على DogFACS مع خط أنابيب من خطوتين يتكون من (i) كاشف متغير DogFACS و(ii) مصنف شجرة قرار الحالة الإيجابية/السلبية؛ (2) نهج يستخدم تقنيات التعلم العميق بدون تمثيل وسيط. تصل دقة النهجين إلى ما يزيد عن 71% و89% على التوالي، مع أداء نهج التعلم العميق بشكل أفضل. ثانيًا، هذه الدراسة هي أيضًا الأولى التي تدرس إمكانية تفسير نماذج الذكاء الاصطناعي في سياق العاطفة لدى الحيوانات. يوفر النهج القائم على DogFACS أشجار القرار، وهو تمثيل رياضي يعكس النتائج السابقة التي توصل إليها خبراء بشريون حول تعبيرات وجه معينة (متغيرات DogFACS) ترتبط بحالات عاطفية محددة. يقدم نهج التعلم العميق شكلاً مرئيًا مختلفًا لقابلية الشرح في شكل خرائط حرارية تعكس المناطق التي يركز عليها اهتمام الشبكة، والتي تظهر في بعض الحالات التركيز المرتبط بطبيعة متغيرات DogFACS معينة. قد تحمل خرائط الحرارة هذه مفتاحًا لرؤى جديدة حول حساسية الشبكة لأنماط البكسل الدقيقة التي تعكس معلومات غير مرئية للعين البشرية.

وصف تشارلز داروين بشكل مشهور استخدام تعبيرات الوجه كعرض للحالات العاطفية لدى البشر ومختلف الأنواع غير البشرية (المشار إليها فيما بعد بالحيوانات) في عمله الأساسي "التعبير عن العواطف في الإنسان والحيوان"1. في الوقت الحاضر، من المسلم به على نطاق واسع أن تعبيرات الوجه تعد مصدرًا مهمًا للمعلومات للتعرف على الحالات العاطفية. في البشر، تعمل تعبيرات الوجه كوسيلة غير لفظية أساسية لتنظيم التفاعلات، وقد تم إثبات الارتباط بين تعبيرات الوجه والحالات العاطفية منذ فترة طويلة من خلال الدراسات المنهجية في علم النفس. في الحيوانات، يتم إنتاج تعبيرات الوجه بواسطة معظم أنواع الثدييات، وكما هو الحال في البشر، فمن المفترض أنها تنقل معلومات حول الحالات العاطفية 6،7. ولذلك، يتم دراسة تعبيرات الوجه بشكل متزايد كمؤشرات محتملة للحالات الذاتية في أبحاث العاطفة والرعاية الحيوانية.

المعيار الذهبي للتقييم الموضوعي للتغيرات في تعبيرات الوجه في أبحاث المشاعر البشرية هو نظام ترميز حركة الوجه — FACS8،9. وقد تم مؤخرا تكييف نظام مراقبة الأصول الميدانية لمختلف الأنواع غير البشرية، بما في ذلك العديد من الرئيسيات غير البشرية (مثل إنسان الغاب 10، الشمبانزي 11، قرود المكاك 12، 13)، قرد القشة 14، الكلاب 15، والقطط 16. هذه الأنظمة التي يشار إليها باسم AnimalFACS تستخدم بشكل متزايد، كما هو الحال في البشر، لدراسة الحالات العاطفية للحيوانات (على سبيل المثال 17-19).

يتمثل التحدي الرئيسي في تحديد تعبيرات الوجه الموحدة في الكلاب في التنوع المورفولوجي لرؤوسهم20،21 والهياكل الجلدية المغطاة، مثل إدراج التجاعيد الدائمة في بعض السلالات. لتحديد تعبيرات الوجه العاطفية لدى الكلاب، قام كايرو وآخرون بتطبيق DogFACS لتقييم الاستجابة التلقائية للأفراد من سلالات مختلفة ومزيج في الإعدادات العاطفية الطبيعية باستخدام مقاطع الفيديو عبر الإنترنت. تم التحقيق في العواطف لكل من التكافؤ الإيجابي والسلبي، بما في ذلك توقع المكافأة (عاطفة مكافئة بشكل إيجابي) والإحباط (عاطفة مكافئة سلبا)، وكلاهما يتميز بتوقع التحفيز المطلوب. تم تعريف الترقب الإيجابي على أنه يتم حثه في المواقف التي تنطوي على "[v] تصور الطعام أو سماع وجبة / كلمة (كلمات) ذات صلة بالطعام؛ [v] تصور المقود، وسماع الكلمات (الكلمات) المتعلقة بالمشي" وتم تعريف الإحباط على أنه يتم تحفيزه من خلال "[v] تصور المورد المرغوب (لعبة، طعام، مساحة) الذي يتعذر الوصول إليه أو يصبح غير قابل للوصول"18. في حين وجد كاييرو وآخرون 18 أن الكلاب أظهرت تعبيرات وجه مختلفة بشكل كبير في التمييز بين حالات عاطفية معينة، لم تكن هناك سمات مميزة تم تحديدها في سياق الإحباط. وفقًا لذلك، قام بريمهورست وزملاؤه بالتحقيق في تعبيرات وجه الكلاب التي تعبر عن الترقب الإيجابي والإحباط في بيئة تجريبية خاضعة للرقابة، على عكس تجربة كايرو وآخرين، حيث قاموا أيضًا بتوحيد سلالة الكلاب (لابرادور ريتريفر). علاوة على ذلك، استخدم المؤلفون سياقًا غير اجتماعي للتخلص من خطر التداخل من الاستجابات التي تم تعلمها مسبقًا والتي تجذب الانتباه. لاستنباط كلتا الحالتين العاطفيتين المدروستين تجريبيًا، تم استخدام مكافأة غذائية عالية القيمة كمحفز محفز في حالتين: كان من المتوقع أن تحفز الحالة الإيجابية ترقبًا إيجابيًا (من خلال توقع الطعام المشروط)، والحالة السلبية يجب أن تحفز الإحباط (أي من خلال منع الوصول إلى المكافأة الغذائية المتوقعة). تم قياس تعابير وجه الكلاب في هاتين الولايتين باستخدام DogFACS. وجد الباحثون أن متغير "مقرب الأذنين" كان أكثر شيوعًا في الحالة الإيجابية، في حين كانت متغيرات "الطرفة" و"جزء الشفاه" و"قطرة الفك" و"لعق الأنف" و"تسطيح الأذن" أكثر شيوعًا في الحالة السلبية. condition22. وفي دراسة متابعة، اختبر بريمهورست وزملاؤه19 مجموعة جديدة من الكلاب باستخدام إعداد مماثل. ومع ذلك، في هذه الدراسة، تم استخدام نوعين مختلفين من المكافآت (الطعام والألعاب) لاختبار إمكانية تعميم نتائجهم السابقة على نطاق أوسع من السياقات.

تم تكرار النتائج السابقة19، مع وجود أربعة متغيرات أخرى أكثر شيوعًا في الحالة السلبية: "الأذنان لأسفل"، و"سحب زاوية الشفاه"، و"إظهار اللسان"، و"رفع الشفة العلوية". جميع تعبيرات الوجه التي تم تحديدها باستثناء "Upper Lip Raiser" كانت مستقلة عن نوع المكافأة التي كانت الكلاب تتوقع الحصول عليها. علاوة على ذلك، تم تقييم المقاييس الأساسية لدقة التشخيص لتعبيرات الوجه المحددة كمؤشرات عاطفية محتملة، بما في ذلك حساسيتها وخصوصيتها والقيم التنبؤية الإيجابية والسلبية. أشارت النتائج إلى أن أياً من تعبيرات الوجه هذه لم تكن ستوفر تصنيفات صحيحة ومتسقة للعاطفة المرتبطة بها إذا تم استخدامها بمفردها كمؤشرات عاطفية فردية. وهذا لا يقلل من قيمتها المحتملة كإشارات ولكنه ربما يؤكد على المعالجة الشاملة العادية لتكوينات الوجه، بدلاً من التركيز على عناصر فردية داخلها.

يعد وجود الجمهور في سياق عاطفي عنصرًا مهمًا يجب أخذه في الاعتبار عند التحقق من تعبيرات الوجه (العواطف) لدى الكلاب، كما هو موضح في دراسة حديثة أجراها بيدريتي وآخرون.24. على غرار 19،22، عرّض المؤلفون الكلاب أيضًا لتوقعات إيجابية، وإحباطات غير اجتماعية وغير اجتماعية، مما أثار جلسات اختبار. كما استخدموا DogFACS لتحليل تعبيرات وجه الكلاب في هذه المواقف، بصرف النظر عن السلوكيات الأخرى مثل هز الذيل، وقياس تركيزات الكورتيزول اللعابية قبل وبعد الاختبار. ووجدوا أن "الآذان إلى الأمام" حدثت أكثر في الحالة الإيجابية مقارنة بالظروف السلبية. علاوة على ذلك، تأثر هذا المتغير بشكل إيجابي بوجود الجمهور، وارتبط سلبًا بتركيزات الكورتيزول قبل الاختبار، مما يشير إلى أنه قد يكون مؤشرًا جيدًا لمستوى انتباه الكلاب. ارتبطت أيضًا "Ears Flattener" و"Blink" و"Nose Llick" و"Tail Wagging" و"Whining" (لم يتم تضمين الأخيرين في متغيرات DogFACS) بوجود جمهور ولكن لم تكن مرتبطة بتركيزات الكورتيزول، مما يشير إلى أن عنصر التواصل في هذه السلوكيات.

improve your memory

يوضح هذا أن DogFACS يمكن أن يعمل أيضًا على التحقق من تعبيرات وجه الكلاب ليس فقط كإشارات (أي إنتاج تغييرات سلوكية تصاحب الحالات العاطفية) ولكن أيضًا كإشارات (أي سلوكيات يتم إنتاجها خصيصًا لتوصيل المشاعر إلى شريك التواصل)، انظر أيضًا 25. وبالتالي توفر أنظمة AnimalFACS وسيلة مهمة لتعزيز فهم تعبيرات الوجه الحيوانية. ومع ذلك، فإن استخدام هذه الأنظمة لتحليل تعبيرات الوجه له تحدياته، بما في ذلك اعتماده على التعليقات التوضيحية اليدوية التي تتطلب تدريبًا بشريًا مكثفًا وإصدار الشهادات، وقد يستغرق ذلك وقتًا طويلاً وقد يكون عرضة للخطأ البشري أو التحيز.

تتمتع الأتمتة بالقدرة على توفير تقدم تكميلي مهم لهذه العملية. على وجه الخصوص، يقال إن الأدوات الآلية تتمتع بموضوعية وموثوقية أكبر من الترميز اليدوي، مما يقضي على الذاتية والتحيز27،28، ولكنها أيضًا لا تعتمد على اكتشاف ميزة واحدة لنجاحها. لذلك ليس من المستغرب أن يكون ترميز تعبيرات الوجه الآلي مجالًا نابضًا بالحياة في أبحاث المشاعر البشرية، مع توفر العديد من أدوات البرمجيات التجارية، مثل FaceReader من Noldus29، وAfdex30، وEmoVu31، بالإضافة إلى قواعد بيانات واسعة النطاق مثل CAS(ME)332.

من ناحية أخرى، في الحيوانات، لا يتم بحث أتمتة تحليل تعبيرات الوجه. ويرجع ذلك إلى العديد من التحديات (كما ناقشها 33،34)، بما في ذلك أولاً الحداثة النسبية للنمو أو الاهتمام بأبحاث المشاعر الحيوانية، مما يعني توفر بيانات أقل بكثير مقارنة بالكميات الهائلة من البيانات في المجال البشري. ثانياً، لا سيما في الأنواع المستأنسة، يمثل التباين الكبير في شكل الوجه تحديات تقنية. وأخيرًا، فإن الافتقار إلى التقرير الذاتي اللفظي يجعل من الصعب إثبات الحقيقة الأساسية للحالة العاطفية التي تعيشها الحيوانات، في حين أن الإبلاغ الذاتي عند البشر هو نهج قياسي لهذا الغرض. وبالتالي، تتطلب بروتوكولات جمع البيانات الخاصة بالحيوانات مراقبة وتنظيمًا واسع النطاق، وتعريفات عملية للحالات العاطفية التي تمت دراستها (انظر على سبيل المثال 18)، أو ربما تصنيفًا من قبل خبراء بشريين - على الرغم من أن هذا قد يؤدي إلى التحيز والحكم الشخصي.

قدم بروم وزملاؤه مسحًا شاملاً لعشرين دراسة تقدم أحدث الأساليب للتعرف الآلي على المشاعر والألم في الحيوانات. تركز غالبية هذه الأعمال على حدوث الألم. وتشمل الأنواع التي تم تناولها في هذا السياق القوارض37-39، والأغنام40، والخيول33،41،42، والقطط43. توفر كل هذه الأعمال مصنفًا ثنائيًا للألم/عدم الألم، باستخدام تقنيات التعلم الآلي.

أما العمل على أتمتة التعرف على مشاعر الحيوانات على نطاق أوسع فهو أكثر ندرة بكثير. تركز دراستان على الرئيسيات غير البشرية على وحدة العمل ذات الصلة/التعرف على تعبيرات الوجه، دون معالجة الحالات العاطفية بشكل صريح. Blumrosen et al.44 التعرف الآلي على أربعة تعبيرات وجه للرئيسيات غير البشرية: محايدة، وضرب الشفاه، والمضغ، وفتح الفم بشكل عشوائي مع الحد الأدنى من جهود التعليق التوضيحي، بينما نفذ Morozov et al.45 نموذجًا أوليًا لنظام ترميز MaqFACS التلقائي لقرود المكاك الريسوسي تم تدريبه على تصنيف ستة متغيرات MacFACS.

تم مسح ثلاثة أعمال فقط توفر تصنيفًا شاملاً للحالات العاطفية المختلفة في Broomé et al.36. حدد كورجو وآخرون 46 أربع حالات عاطفية للخيول: "القلق"، و"الانزعاج"، و"الفضول"، و"الاسترخاء"، وحدد كل واحدة منها من حيث سلوك العينين والأذنين والأنف والرقبة. على سبيل المثال، تم تعريف "الاسترخاء" على أنه العيون: مغلقة جزئيًا إلى حد كبير، والأذنان: مسترخية، والفتحة تشير إلى الجانبين، والأنف: الفم والرقبة مسترخيان: متوازيان تقريبًا. تم تدريب نموذج الشبكة العصبية التلافيفية (CNN) على التنبؤ بهذه "الفئات" الأربع من المشاعر. استخدم فيريس وآخرون 47 تقدير الوضع الآلي باستخدام DeepLabCut48 لتصنيف أربع فئات من المشاعر وهي "الغضب" و"الخوف" و"السعادة" و"الاسترخاء" للكلاب. استخدم فرانزوني وآخرون أيضًا نموذج CNN لتصنيف السمات المحدودة المتعلقة بالحالات العاطفية: "الابتسامة" (المرتبطة بـ "الفرح")، و"الهدير" (المتعلق بـ "الغضب")، و"النوم" (المرتبط بحالة محايدة). ولاية).

من بين الأعمال الثلاثة المتعلقة بالكلاب 47، 49، 50 ركز اثنان على الجسد للتعرف على الحالات العاطفية 47 والألم 50، وواحد على تعبيرات الوجه عن العاطفة 49. ومع ذلك، فإن مجموعات البيانات المستخدمة في دراسات Ferres et al.47 وFranzoni et al.49 تحتوي على صور تم جمعها من الإنترنت وشرحها غير الخبراء، وبالتالي من المحتمل أن تكون ذات موثوقية وصلاحية منخفضة. يدرس عمل Zhu50 التعرف على الألم بناءً على لغة الجسد، وليس تعبيرات الوجه.

الدراسة المقدمة هنا هي الأولى التي تستكشف التعرف الآلي على مشاعر الكلاب من تعبيرات الوجه، وذلك باستخدام مجموعة بيانات تم جمعها من بروتوكول تجريبي مصمم بعناية حيث يدافع السياق عن الحالات العاطفية. في هذا البروتوكول، تم تحديد الحالات العاطفية للترقب الإيجابي (العاطفة الإيجابية) والإحباط (العاطفة السلبية) من الناحية العملية (وفقًا لـ 18 وتم تحفيزها تجريبيًا في عينة مكونة من 29 موضوعًا لابرادور ريتريفر، مما يقلل من تباين الاختلافات المورفولوجية بين الكلاب. تم ترميز تعابير الوجه التي أنتجتها الكلاب بشكل موضوعي باستخدام نظام DogFACS الموحد بواسطة مبرمجين معتمدين من DogFACS. تخلق مجموعة البيانات هذه بيئة تجريبية فريدة لاستكشاف طرق مختلفة لأتمتة التعرف على المشاعر مع الحد الأدنى من التحيز في تعريف العاطفة. تستفيد البيانات أيضًا من انخفاض التباين المورفولوجي لوجوه المشاركين بسبب توحيد السلالة.

وفقًا لـ36، هناك طريقتان قياسيتان لتصنيف الحالة العاطفية أو حالة الألم: استخدام ميزات مصنوعة يدويًا، أو استخدام نموذج التعلم العميق استنادًا إلى الميزات المستفادة. يمكن تقسيم الميزات المصنوعة يدويًا تقريبًا إلى ميزات منخفضة المستوى، والتي تعتمد على إحصائيات الصور (مثل الرسوم البيانية للتدرجات الموجهة) شائعة الاستخدام في أدبيات الرؤية الحاسوبية، وميزات عالية المستوى، والتي ترتكز على أسس دلالية، في الأنواع- بنية تشريحية محددة للوجه و/أو الجسم، ومقاييس كشر، ووحدات عمل، وما إلى ذلك. ومن الأمثلة على هذه الأخيرة معالم وجه القطة، أو النقاط الرئيسية لجسم الكلب، أو وحدات عمل ألم الأغنام. تعمل هذه الميزات على تعزيز إمكانية شرح خوارزميات التعلم الآلي من خلال ترسيخ قرارات النموذج في المفاهيم السلوكية. من ناحية أخرى، يعتبر نهج التعلم العميق أكثر مرونة ومن المتوقع أن يؤدي أداء أفضل (خاصة عندما تتوفر مجموعات كبيرة من البيانات)، ولكنه يتطلب موارد حسابية مكلفة ويعتبر بمثابة "صندوق أسود" بمعنى أنه لا يصلح للتفسير. بعبارات مفهومة للإنسان لماذا يتم اتخاذ قرار تصنيف معين.

في هذه الدراسة، نقوم بالتحقيق في كلا الطريقين البديلين للتصنيف الآلي للحالات العاطفية لدى الكلاب. يستخدم المسار الأول متغيرات DogFACS كميزات عالية المستوى قابلة للتفسير. يتكون مسار التصنيف في هذه الحالة من مرحلتين: أولاً، التعرف الآلي على رموز DogFACS، وثانيًا، استخدام التعليقات التوضيحية لتصنيف المشاعر التي تمت دراستها. نوضح فائدة هذا التمثيل القابل للتفسير لفهم كيفية استخدام متغيرات DogFACS في عملية صنع القرار في الجهاز. يأخذ المسار الثاني نهج التعلم العميق (الأبسط، على مرحلة واحدة)، مما يسمح للآلة بالتعلم مباشرة من ميزات البيانات التي ليست بالضرورة مفهومة من قبل الإنسان. نقوم أيضًا بمقارنة جوانب قابلية الشرح بين النهجين ونستخدم تقنيات تصور الخريطة الحرارية لتسليط الضوء على علاقة السمات المستفادة بالكائنات الدلالية المتعلقة بأجزاء وجه الكلب.

نتائج

مجموعة البيانات.

استخدمنا مجموعة البيانات والشروح DogFACS التي تم إنشاؤها كجزء من دراسة سابقة أجراها Bremhorst et al.22. لتقليل تأثيرات التباين المورفولوجي، تم اختبار 29 شخصًا من سلالة واحدة بدون ملامح وجه شديدة (مسترد لابرادور) (19 أنثى - 13 خصيًا، 10 ذكور - 9 خصيًا؛ الفئة العمرية: 2-9.5 سنة، متوسط ​​العمر {{9} }.22 سنة). يوضح الشكل 1 توزيع عمر الشخص وجنسه.

تضمنت مجموعة البيانات إجمالي 248 عينة فيديو بطول 3 ثوانٍ مسجلة بمعدل إطار يبلغ 25.25 إطارًا في الثانية، مع دقة كل إطار تبلغ 1920 × 1080 بكسل. الكاميرا المستخدمة للتسجيل كانت HIKVision، IR Mini Bullet Network Camera؛ المسجل: سلسلة HIKVision، DS-7600. تم تحديد موقع الموضوعات خلف نافذة شفافة باستخدام البروتوكول الموضح بالكامل في Bremhorst et al.22. تم اختبار كل موضوع 3 مرات في الحالة الإيجابية، و 6 مرات في الحالة السلبية. تم تصنيف ثلثي مقاطع الفيديو عمومًا على أنها سلبية، والثلث على أنها إيجابية. من المفترض خلال هذه الدراسة أن الحالة السلبية تحفز الإحباط، والحالة الإيجابية تحفز الترقب الإيجابي، ومن ثم نستخدم التكافؤ الإيجابي/السلبي للإشارة إلى الحالتين العاطفيتين. يوضح الشكل 2 محاصيل وجوه الكلاب المستخرجة من مجموعة البيانات.

boost memory

تمت موازنة مجموعة البيانات باستخدام الاختزال العشوائي، مما أدى إلى ترك 82 مقطع فيديو لظروف إيجابية، و82 مقطع فيديو لظروف سلبية من (ن = 29) من الأفراد، إجمالي 164 مقطع فيديو. تم إجراء الموازنة مع الحفاظ على نفس العدد من العينات الإيجابية والسلبية لكل فرد.

تم ترميز جميع عينات الفيديو باستخدام 39 متغيرًا من متغيرات DogFACS استنادًا إلى دليل DogFACS بواسطة برنامج تشفير DogFACS معتمد، من خلال إضافة تعليق توضيحي إلى إطار واحد لكل 200 مللي ثانية باستخدام Solomon Coder (الإصدار 15.03.15، Andràs Péter). من بين هذه المتغيرات الـ 39، تم استخدام أحد عشر متغيرًا معروضًا في الجدول 1 في دراسة Bremhorst22، استنادًا إلى انتشار لا يقل عن 10% في جميع العينات ذات الحالة الإيجابية أو السلبية وعلى الأقل قوة كبيرة لاتفاق التشفير البيني (انظر 22). لمزيد من التفاصيل).

10 ways to improve memory

نظرة عامة على النهجين.

نقدم هنا مقارنة بين نهجين مختلفين للتصنيف الآلي للظروف الإيجابية والسلبية: القائم على DogFACS مقابل النقي (يحتوي نهج DogFACS أيضًا على وحدة تعلم عميقة لاكتشاف متغيرات DogFACS) نهج التعلم العميق. ويعرض الشكل 3 نظرة عامة رفيعة المستوى على النهجين.

يتيح لنا توفر بيانات الفيديو العمل مع نوعين من المدخلات: الإطارات المفردة، أو تسلسل الإطارات. الأول يعني فقدان المزيد من المعلومات، ولكنه أبسط وأكثر قابلية للتحكم؛ في حين يتضمن الأخير بعدًا زمنيًا، والذي ثبت أن له أهمية لمثل هذه المهام، على سبيل المثال، في سياق الكشف عن الألم في الخيول . ومع ذلك، فإن النهج السائد في سياق التعرف الآلي على الحالات العاطفية والألم في الحيوانات، هو أساس الإطار الفردي (على سبيل المثال، 33،39،41،55). ونظرا للطبيعة الاستكشافية لهذه الدراسة، فقد قررنا هذا الخيار.

وبالتالي فإن كلا الطريقتين تعملان على أساس إطار واحد، أي أن التصنيف يتم على إطارات واحدة مستخرجة من مقاطع الفيديو. ومع ذلك، يتم تنفيذ تجميع المعلومات ذات الإطار الواحد بشكل مختلف في الحالتين. بعد خطوة المعالجة المسبقة لاستخراج وجوه الكلاب المقصوصة من الإطارات (انظر الشكل 2 للحصول على أمثلة)، في النهج العميق، يتم أخذ الوجوه المقطوعة الخام كمدخلات بواسطة شبكة عصبية. نقوم هنا بتجربة معماريات الشبكات العصبية من نوعين: الشبكة العصبية التلافيفية (Resnet5056) وشبكة محولات الرؤية 57 (ViT) التي تم تقديمها مؤخرًا. يتم بعد ذلك تجميع قرارات الشبكة المختارة باستخدام تصويت الأغلبية، ويتم الوصول إلى قرار التصنيف لكل فيديو.

من ناحية أخرى، يستخدم النهج القائم على DogFACS خط أنابيب بخطوتين متتاليتين. الأول هو كاشف المتغيرات DogFACS الآلي، الذي يكتشف مجموعة من متغيرات DogFACS في كل إطار. يتم بعد ذلك تجميع متغيرات DogFACS للفيديو بأكمله. الخطوة الثانية هي شجرة القرار، والتي يكون مدخلها عبارة عن مجموعة متغيرات DogFACS المكتشفة في الفيديو والتي يتم تطبيقها للوصول إلى قرار التصنيف النهائي.

وهكذا، فإن النهج القائم على DogFACS يتخذ قرار التصنيف بناءً على مجموعة متغيرات DogFACS المحددة في الفيديو؛ من ناحية أخرى، يقرر نهج التعلم العميق كل إطار على حدة، ويستخرج الميزات المستفادة من الصور الأولية، ثم يجمع القرار لجميع إطارات الفيديو. لذلك، عند استكشاف إمكانية تفسير النهجين، من المتوقع أن يكون لدينا في الأول "تفسيرات" على غرار بريمورست وآخرين (تحديد المتغيرات السائدة في كل حالة، أو مزيج منها). ومع ذلك، من المتوقع أن يؤدي النهج الأخير إلى مزيد من التوضيحات المرئية لميزات الصورة التي يركز عليها النموذج، كما هو موضح أدناه.

لتقييم أداء نماذجنا، استخدمنا المقاييس القياسية للدقة والإحكام والتذكر، وهي الطريقة القياسية في سياق التعلم الآلي. كطريقة للتحقق من الصحة، استخدمنا التحقق المتبادل لموضوع واحد بدون تداخل في الموضوع، مما يعني استخدام كل موضوع لكلب كمجموعة اختبار منفصلة. يوصى بهذه الطريقة لمجموعات البيانات التي يكون فيها للفرد أكثر من عينة مرتبطة. انظر Broomé et al.36 لمناقشة أهمية اختيار طريقة التحقق المناسبة.

short term memory how to improve

النهج القائم على DogFACS.

مجموعات من متغيرات DogFACS. لقد جربنا مجموعتين مختلفتين من متغيرات DogFACS:

1. تعد مجموعة المتغيرات الأحد عشر الواردة في الجدول 1 والتي تم استخدامها في دراسة Bremhorst et al.22، هي المتغيرات الواعدة أو الأكثر أهمية (استنادًا إلى معدل انتشار لا يقل عن 10٪ في جميع عينات إما حالة إيجابية أو سلبية) ويمكن ترميزها بشكل موثوق (مع قوة كبيرة على الأقل من اتفاق التشفير البيني، انظر 22).

2. مجموعة كاملة من متغيرات DogFACS الـ 39 المشفرة في دراسة Bremhorst et al.22.

Classification results. To explore optimal performance, we used the manual DogFACS annotations from Bremhorst et al.22 to experiment with different machine learning techniques, including Decision Tree, XGBoost, and Random Forest. Table 2 presents a comparison of their performance, with Random Forest performing slightly better for the full set of DogFACS variables (39 variables), reaching accuracy > 71%. In the limited set (11 DogFACS variables), the three models converged to one tree, and thus are presented together, reaching a slightly lower accuracy of > 66%.

تصغير شجرة القرار. بعد ذلك، أجرينا بحثًا منهجيًا عن مجموعة صغيرة من متغيرات DogFACS التي من شأنها أن تسفر عن نفس أداء التصنيف الموضح في الجدول 2. ويبين الجدول 3 أن استخدام متغير DogFACS واحد فقط كميزة يضمن أداءً مشابهًا للأداء المعروض في الجدول 2. يعد المتغير "Ears Flattener" هو الأكثر أهمية للتصنيف باستخدام مجموعة محدودة من 11 متغيرًا DogFACS، حيث يتنبأ وجوده بالحالة السلبية. يوضح الشكل 4 شجرة القرار المبسطة مع ميزة واحدة فقط تتنبأ بالحالة الإيجابية - غياب "مسطح الأذنين"، والحالة السلبية - وجودها (بدقة> 66%).

والجدير بالذكر أنه عند النظر في جميع متغيرات DogFACS الـ 39، يعد "Eyes Up" هو المتغير الأكثر أهمية للتصنيف باستخدام جميع المتغيرات الـ 39، حيث يتنبأ وجوده بالظروف الإيجابية بدقة عالية تصل إلى> 71٪.

الكشف الآلي عن متغيرات DogFACS. استنادا إلى النتائج التي توصلنا إليها، فإن تدريب كاشف لمتغيرات "Ears Flattener" و"Eyes Up" DogFACS يكفي لخط أنابيب تصنيف مؤتمت بالكامل. لقد استكشفنا أيضًا اكتشاف المتغيرات الأخرى، باستخدام شبكة عصبية تلافيفية ResNet50 مدربة مسبقًا على مجموعات بيانات متوازنة (على أعداد متفاوتة من الصور بسبب التباين في تردد متغير DogFACS). يتم عرض أداء أجهزة الكشف التي تم الحصول عليها في الجدول 4.

ways to improve memory

نهج عميق.

في هذا النهج، استخدمنا إعداد "نقل التعلم" الشائع، حيث قمنا بتدريب مسبار خطي أعلى العمود الفقري الثابت المدرب مسبقًا باستخدام التعليقات التوضيحية البشرية. نحن نستكشف مدى ملاءمة الأعمدة الأساسية المختلفة لهذه المهمة من خلال تكرار التجربة مع أربعة أعمدة أساسية مدربة مسبقًا: تم تدريب ResNet وViT إما بطريقة خاضعة للإشراف لتصنيف الصور أو بطريقة خاضعة للإشراف الذاتي باستخدام DINO58.

قمنا بتدريب أربعة نماذج مختلفة (على مجموعة البيانات بأكملها) واختبرنا أدائها باستخدام إطارات من نفس مجموعة البيانات المتوازنة الموصوفة أعلاه (82 مقطع فيديو للحالة السلبية، و82 مقطع فيديو للحالة الإيجابية من (ن = 29) من الأفراد، مما يجعل إجمالي 164 مقطع فيديو).

يعرض الجدول 5 نتائج التصنيف التي تم تحليلها لكل فيديو، أي أننا نقول أن الفيديو يتم تصنيفه بشكل صحيح إذا تم تصنيف غالبية إطاراته بشكل صحيح. يمكن ملاحظة أن النموذج الذي تم تدريبه باستخدام العمود الفقري DINO-ViT يُظهر أفضل أداء بدقة تزيد عن 89٪. يعرض الجدول 6 نتائج التصنيف التي تم تحليلها حسب الإطارات. كما هو متوقع، في هذه الحالة، انخفضت المقاييس إلى حد ما مقارنة بالتحليل الذي تم إجراؤه على تجميع الإطار مما أدى إلى دقة بنسبة 85% للنموذج الذي تم تدريبه باستخدام العمود الفقري DINO-ViT.

memory enhancement

مناقشة

The present study is the first to explore automated recognition of canine emotional states focusing on diverse facial expressions, whilst using a carefully designed controlled experimental setup for dataset creation and annotation. We present classifiers of two different types: deep learning-based and DogFACS-based, both having a performance that is comparable to and in some cases outperforms those presented in previous studies addressing recognition of pain or emotional state from facial expressions, including mice38,39 (> 89% and 93% respectively), cats43 (> 72%), horses42,46 (> 75% and 65% respectively) and sheep55 (> 64%).

The DogFACS-based approach described here reached an accuracy of > 71% using the full set (n =  39) of DogFACS variables, but a lower accuracy of > 66% when using only the eleven DogFACS variables which were utilized in the study of Bremhorst et al.22 ( this accuracy was achieved based on manual DogFACS annotations and is expected to drop even lower in an end-to-end pipeline). Of the full set of 39 DogFACS variables, 'Eyes Up' were of considerable importance for classification, and including them in the Decision Tree leads to higher accuracy (>71%). ومع ذلك، عند تفسير المتغيرات الاتجاهية مثل حركات العين وأهميتها كمؤشرات عاطفية محتملة، يجب دائمًا مراعاة الإعداد التجريبي للدراسة التي تم جمع البيانات فيها. في Bremhorst et al.22، قام المجرب بتسليم مكافأة الطعام بحركة أعلى قليلاً من كحل الكلاب. ربما يكون هذا قد شجع الكلاب على البحث عن الطعام (محفزًا متغير "العيون لأعلى") تحسبًا للطعام. لذلك يجب علينا أن ندرك أن متغير DogFACS هذا يمكن أن يكون قطعة أثرية من الإجراء التجريبي. عند اختيار المتغيرات كجزء من تطوير مؤشرات العاطفة، من المهم تقييم خطر الخطأ من النوع الأول (إيجابي كاذب) مقابل خطأ من النوع الثاني (سلبي كاذب) وهو أمر لا مفر منه تقريبًا. في العمل مع مجموعة مخفضة من أحد عشر متغيرًا لـ DogFACS، أعطينا الأولوية لتجنب السلبيات الكاذبة على الإيجابيات الكاذبة حتى لا نستبعد متغيرًا قبل الأوان من مزيد من التحقيق. يمكننا أن نتوقع استبعاد المتغيرات المقبولة خطأً في الدراسات اللاحقة إذا تم تحديد افتقارها إلى الصلاحية التنبؤية (كما تمت مناقشته في 19).

As a byproduct of these results, we obtained automated detectors for nine DogFACS variables, of which five performed with an accuracy >70%، مما يدل على جدوى التعرف الآلي الدقيق على متغيرات DogFACS. التحدي الرئيسي الذي يواجه تدريب الكاشفات لكل متغير هو توفر البيانات، أي التردد المنخفض لظهور بعض متغيرات DogFACS، مما يتطلب جهودًا مركزة لجمع مجموعات البيانات لمتغيرات محددة. علاوة على ذلك، فإن بعض المتغيرات لها بعد زمني ولا يمكن التعامل معها على أساس إطار واحد (على سبيل المثال، طرفة العين أو اللهاث). ويتطلب تطوير كاشفات لها نماذج تستفيد أيضًا من الديناميكيات الزمنية، مثل نهج Broomé et al.42.

تجدر الإشارة أيضًا إلى أنه نظرًا لأن مجموعة البيانات الخاصة بنا تقتصر على سلالة واحدة، فإن الحاجة البحثية المستقبلية المباشرة هي تقييم إمكانية تعميم النماذج على السلالات الأخرى. إذا انخفض الأداء بشكل ملحوظ عند نقل النتائج إلى سلالات أخرى، تتم الإشارة إلى الأساليب البديلة للنهج العميق المستخدم هنا، على سبيل المثال، في Feighelstein et al.43.

improve your memory

يعد استكشاف إمكانية تعميم النماذج المقدمة هنا أمرًا مهمًا ليس فقط في سياق اكتشاف متغيرات DogFACS ولكن أيضًا لتصنيف المشاعر. لا يتم التحكم في مجموعة البيانات المستخدمة هنا للسلالة فحسب، بل يتم تسجيلها أيضًا في ظروف بيئية خاضعة لرقابة صارمة. يعد التعميم من البيئات الخاضعة للرقابة إلى البيئات الطبيعية تحديًا صعبًا للغاية أيضًا في الحوسبة العاطفية البشرية. يقدم فنغ وآخرون 61 مراجعة للمجال البشري للطرق التي يمكن من خلالها لتقنيات التعلم النقلي التغلب على التحديات المتعلقة بكميات محدودة من عينات البيانات، والعلامات النادرة، والتقلب البيئي، مما يعزز الأنظمة الآلية القوية والقابلة للتعميم للتعرف على المشاعر. يمكن استكشاف طرق مماثلة في الحوسبة العاطفية للكلاب؛ توفر النتائج المقدمة هنا خط الأساس لمزيد من الاستكشاف في هذا الاتجاه.

أسئلة مثل "هل تستطيع الآلات التعرف على الحالات العاطفية للحيوانات؟" مثيرة للاهتمام في حد ذاتها ولها تطبيقات عملية بعيدة المدى لرعاية الحيوان. توفر نتائج دراستنا بعض المؤشرات لإجابة إيجابية، على الأقل في حالة الإحباط والترقب الإيجابي لدى الكلاب. ومع ذلك، فإن بناء نماذج الذكاء الاصطناعي التي تتعرف على مشاعر الكلاب له قيمة مضافة كبيرة في مساعدتنا على فهم كيفية تصنيف الآلات للعواطف، وما إذا كانت حساسة للفروق الدقيقة غير المرئية للخبير البشري، وما هي الآثار المترتبة على فهمنا لمشاعر الحيوانات، والأبحاث المستمرة. مناقشات حول الوعي الحيواني. لهذا السبب، من المهم والواعد استكشاف قابلية التفسير (ما هو الأساس المنطقي وراء قرار الآلة؟)، وقابلية التفسير (كيف يرتبط هيكل النموذج باتخاذ مثل هذا القرار؟)62. تعتبر هذه المواضيع أساسية في الذكاء الاصطناعي ويتم تناولها من خلال مجموعة ضخمة من الأبحاث63-65، مع تركيز غالبية الجهود على مناهج التعلم العميق، التي تكون قابلية تفسيرها محدودة بسبب بنيتها المعقدة66. تعد أساليب التفسير بطبيعتها خاصة بالمجال: يختلف تقديم تفسيرات للتعرف الآلي على سمات الشخصية في مقابلات العمل، على سبيل المثال، عن تقديم مبررات سريرية للقرارات الطبية62.

increase brain power

دراستنا هي الأولى التي تتناول الجوانب التفسيرية لنماذج الذكاء الاصطناعي للتعرف على المشاعر الحيوانية. عندما قمنا بمقارنة نهجين مختلفين لتصنيف العواطف، هناك قيمة مضافة من القدرة على مقارنة الاختلافات في جوانب قابلية التفسير التي يتناولونها. يؤدي النهج القائم على DogFACS إلى نماذج في شكل أشجار قرار بسيطة، والتي تمثل التفكير المنطقي البشري في شكل مجموعة من الشروط المنطقية المتعلقة بوجود/غياب متغيرات DogFACS معينة. تنعكس الطبيعة التوضيحية لأشجار القرار بشكل خاص في نسختها المبسطة التي تحتوي على عقدة واحدة فقط، مثل تلك التي تمت دراستها هنا (مع "Ears Flattener"). ترتبط هذه الأشجار ارتباطًا وثيقًا بالمفاهيم المفيدة للخبراء البشريين، وتحديدًا فيما يتعلق بمؤشرات المشاعر التي درسها بريمهورست وآخرون.19. تهدف مؤشرات العاطفة الصحيحة إلى تحديد حالة عاطفية معينة بدقة، وتكون حاضرة عندما تكون العاطفة موجودة، وتغيب بخلاف ذلك.

يتم وصف هذه الخصائص من خلال الحساسية والنوعية، وهي مقاييس شائعة الاستخدام لتقييم دقة الاختبارات التشخيصية. وجد Bremhorst et al.19 أنه لا يمكن اعتبار أي من متغيرات DogFACS التي تم أخذها في الاعتبار في الدراسة مؤشرًا فرديًا محددًا للتوقع الإيجابي أو الإحباط لدى الكلاب. على وجه التحديد، تبين أن "Ears Flattener" يتمتع بحساسية عالية نسبيًا ولكن بخصوصية منخفضة. وبالتالي ليس من المستغرب أن النموذج الموصوف في دراستنا، وهو عبارة عن شجرة قرار ذات ميزة واحدة "Ears Flattener"، لم يحقق أداءً عاليًا. ومع ذلك، فإن العلاقة بين مقاييس مؤشرات العاطفة كما يستخدمها Bremhorst et al.19، والمقاييس المستخدمة هنا لتقييم أداء نموذجنا ليست واضحة. في حين أن الأول يحسب الحساسية والنوعية والقيمة التنبؤية الإيجابية والسلبية لكامل البيانات غير المتوازنة، فإن الأخير يقيم الأداء في مهمة التنبؤ. وهذا يعني أن البيانات تنقسم إلى جزأين: التدريب الذي يستخدم لتدريب النموذج، والاختبار لتقييم أدائه. وعلى النقيض من Bremhorst et al.19، قمنا أيضًا بموازنة البيانات باستخدام المعاينة الناقص. ومع ذلك، فإن العلاقة البديهية بين الاثنين هي أنه إذا تم العثور على مؤشر مشاعر ممتاز باستخدام النهج السابق، فيمكننا أن نتوقع أن شجرة القرار التي تستخدمه كميزة ستصل أيضًا إلى أداء ممتاز.

بالإضافة إلى إمكانية الشرح، فإن نهج التعلم الآلي المقدم هنا للبحث عن نماذج شجرة القرار المثالية للتنبؤ بمشاعر الكلاب لديه القدرة على أن يؤدي إلى رؤى جديدة في مؤشرات المشاعر. كما نوقش أعلاه، فإن اكتشاف مؤشرات العاطفة الدقيقة من حيث Bremhorst et al.19 يرتبط ارتباطًا وثيقًا بمشكلة العثور على مصنفات شجرة القرار مع متغير DogFACS واحد للتنبؤ بالعاطفة. في حين لم يثبت أن هذه المصنفات تتمتع بدقة عالية في دراستنا (وبالفعل، لم يتم اكتشاف مؤشرات عاطفية دقيقة في 19)، يمكن تحسين أداء التصنيف من خلال النظر في أشكال أكثر تعقيدًا من أشجار القرار، على سبيل المثال من خلال تجميع متغيرات DogFACS في أزواج ، ثلاث مرات، وما إلى ذلك. تُظهر تجاربنا الأولية باستخدام أزواج من متغيرات DogFACS كعقد، كما هو موضح في الشكل 5، أن هذا أدى إلى تحسين أداء النموذج من حيث الاستدعاء. الأهم من ذلك، يمكن إجراء التحقيق في مجموعات متغيرات DogFACS التي قد تحسن التصنيف بطريقة آلية وشاملة ومنهجية، مما قد يؤدي إلى مفاهيم أكثر دقة لمؤشرات المشاعر. وهذا يوفر طريقا واعدا للبحث في المستقبل.

ومن ناحية أخرى، حقق نهج التعلم العميق أداءً أعلى بشكل ملحوظ تجاوز 89%، مما يدل على إمكانات مثل هذه الأساليب لتصنيف العواطف. علاوة على ذلك، يبدو أن العمود الفقري DINO-ViT هو الأكثر ملاءمة لمهمة تصنيف المشاعر من بين جميع الخيارات الأربعة التي تم فحصها. نحن نفترض أن هذا يرجع إلى أن ميزات DINO-ViT حساسة لأجزاء الكائن، كما هو موضح في 67؛ ونظرًا لطبيعة مهمة تصنيف المشاعر، فإنها تتطلب الفهم على مستوى أجزاء الجسم (أجزاء الوجه مثل العينين والأذنين وما إلى ذلك). ومن المثير للاهتمام أن العمود الفقري الذي تم تدريبه مسبقًا باستخدام DINO يحقق نتائج أفضل من العمود الفقري الخاضع للإشراف.

تجدر الإشارة إلى أن مصنف التعلم العميق يعمل بناءً على الصور، ثم يقوم بتجميع النتائج لكل فيديو. وهذا يعني أنه على الرغم من أن العديد من الإطارات لا تظهر وجود متغيرات DogFACS، إلا أن النموذج لا يزال ناجحًا في تصنيفه الصحيح. قد يشير هذا إلى حساسية النموذج للتفاصيل الدقيقة على مستوى البكسل والتي قد تتجاوز قدرة العين البشرية. ومع ذلك، قد يكون أيضًا مرتبطًا بمزالق محتملة في شكل بعض التحيز المتأصل. أيضًا، قد يكون متغير "Eyes Up"، الذي تمت مناقشته أعلاه، مفيدًا للشبكة، ولا يمكن تحييد تأثيره على صنع القرار بسهولة في شبكة التعلم العميق. ويتطلب التحقيق في هذه القضايا المزيد من جمع البيانات في ظروف تجريبية وبيئية مختلفة لاستبعاد مثل هذه المزالق.

من ناحية أخرى، فإن قابلية شرح نهج التعلم العميق الذي تم النظر فيه هنا، ذات طبيعة مختلفة تمامًا وأكثر وضوحًا مقارنة بتلك القائمة على DogFACS. على عكس نماذج شجرة القرار، من الصعب للغاية شرح عملية صنع القرار في الشبكات العصبية بمصطلحات مفهومة للإنسان، نظرًا لطبيعتها "الصندوق الأسود" المعقدة للغاية. يؤدي استخدام طريقة EigenCAM59 إلى إبراز الاختلافات بين النماذج المختلفة التي جربناها (ResNet/ViT، الخاضعة للإشراف/DINO). وكما هو موضح في الشكل 6، هناك بعض الاختلافات بين النماذج. يبدو أن نماذج Te ViT تظهر توطينًا أفضل من نماذج ResNet، حيث أن المناطق شديدة النشاط (المميزة باللون الأحمر) أصغر حجمًا وتقع على مناطق أكثر بروزًا (مثل العينين والأذنين والأنف بدلاً من الجلد). علاوة على ذلك، يبدو أن نموذج DINO-ViT ينشط في مناطق بارزة متعددة بدلاً من منطقة واحدة (على سبيل المثال، يتم التنشيط على الأذنين والعينين والأنف بدلاً من الأذنين فقط في المثال العلوي الأيمن). نعزو نجاح النماذج المستندة إلى ViT إلى قدرة ViTs على توفير إشارة محلية أكثر من نماذج ResNet. وينبع هذا من هندستها المعمارية - حيث تظل دقة ميزات ViT ثابتة في جميع الطبقات، بينما تتضاءل دقة ميزات CNN عندما تصبح الطبقات أعمق.

على الرغم من أن التوصل إلى استنتاجات نهائية يتطلب المزيد من البحث، فقد جربنا طريقة EigenCAM مع تركيز اهتمامنا على الإطارات التي تستوفي الشروط التالية: (1) مشفرة يدويًا باستخدام متغير "Ears Flattener"، و(2) الانتماء إلى فئة عينات الفيديو الخاصة بـ حالة سلبية، و(3) تم تصنيفها بشكل صحيح بواسطة شبكة DINO-ViT كحالة سلبية. في تحليلنا، قمنا بتقسيم الأمثلة إلى ثلاث فئات، كما هو موضح في الشكل 7. ومن أمثلة الفئة (أ) الخرائط الحرارية مع التركيز الواضح على الأذنين فقط. يمكن اعتبار ذلك متسقًا مع تفسير "Ears Flattener" المتعلق بـ DogFACS، أي أنه قد يكون الأمر هو أن النموذج تعلم الأنماط المتعلقة بحركة الأذن. تتوافق الفئة ب أيضًا مع هذا، حيث تعرض خرائط حرارية تركز على الأذنين والمناطق الأخرى، مثل العينين والجبهة والأنف والفم. قد يكون الأخير أيضًا مرتبطًا بشكل غير مباشر بحركة "Ears Flattener"، بالإضافة إلى متغيرات DogFACS الأخرى أو بعض الميزات الوضعية الأخرى التي قد تكون موجودة في الإطار. ومع ذلك، فإن الفئة الأكثر إثارة للاهتمام هي الفئة C: حيث يلتقط النموذج إشارات من أجزاء الوجه بخلاف الأذنين، مع الاستمرار في إجراء التصنيفات الصحيحة. قد تحمل هذه الحالات المفتاح لفهم حساسية الشبكة للفروق الدقيقة غير المرئية للعين البشرية. على أية حال، تجدر الإشارة إلى أن تعليقات DogFACS لا يمكنها أن تغطي بشكل شامل جميع التغييرات المحتملة في سلوك الوجه، والتي قد تنعكس في أنماط البكسل التي تكون الشبكة حساسة لها. قمنا بعد ذلك أيضًا باستخراج خرائط الحرارة من مقاطع الفيديو التي لا تحتوي على متغيرات DogFACS مشروحة. كانت هناك تسعة مقاطع فيديو بدون متغيرات، ثمانية منها "إيجابية" وواحدة "سلبية". ومن اللافت للنظر أن غالبية مقاطع الفيديو هذه (77٪) لا تزال مصنفة بشكل صحيح حسب النموذج. قد يكون هذا مؤشرًا آخر على أن النموذج يلتقط سلوكًا دقيقًا للوجه لم يتم التقاطه بواسطة DogFACS. عند فحص الخرائط الحرارية التي تم إنتاجها لإطارات مقاطع الفيديو هذه، لاحظنا أن منطقة الأنف والفم كانت محور التركيز الرئيسي للنموذج. تُظهر بعض الإطارات الأخرى التركيز على أجزاء أخرى من الوجه، بينما توجد حالات لإطارات مصنفة بشكل صحيح ولكن خرائط حرارية ضبابية وغير واضحة. تظهر أمثلة من هذه الفئات الثلاث في الشكل 8. ومن المثير للاهتمام أن خرائط الحرارة هذه تفتقر إلى التركيز على أجزاء محددة من الوجه، مما يشير إلى أن الإشارات البصرية في هذه الحالات كانت أقل وضوحًا بالنسبة للنموذج.

increase memory power

improve short term memory

هناك مشكلة أخرى ملحوظة تتعلق بكلا النهجين فيما يتعلق بالأداء وهي قصر طول مقاطع الفيديو (3 ثوانٍ) في مجموعة البيانات الحالية. يؤدي استخدام مقاطع فيديو أطول إلى التحدي المتمثل في تحديد نافذة زمنية مثالية يمكن خلالها اعتبار الحالة الداخلية ثابتة. تمت دراسة هذه المشكلة في عام 69 في سياق آلام العظام منخفضة الدرجة لدى الخيول، وهي اتجاه مهم للأبحاث المستقبلية أيضًا فيما يتعلق بالحالات العاطفية للكلاب.

لتلخيص ذلك، أظهرت هذه الدراسة قيمة طريقتين مختلفتين للتصنيف الآلي لحالتين عاطفيتين لدى الكلاب بناءً على تعبيرات الوجه: الحالة الإيجابية مقابل الحالة السلبية. وقد وصل كلاهما إلى دقة جيدة يمكن مقارنتها بالطرق الحديثة الأخرى في التعرف الآلي على التأثيرات الحيوانية. لا توفر هذه النتائج لأول مرة إجابة إيجابية على السؤال "هل تستطيع الآلات التعرف على مشاعر الكلاب الإيجابية والسلبية؟"، ولكنها تفتح أيضًا مسارات بحثية جديدة لاستكشاف كيفية التعرف عليها من قبل الآلات، وكيفية جعل هذا التعرف قابلاً للتفسير للبشر. . إن إجراء المزيد من التجارب باستخدام مجموعات بيانات أكبر ذات خصائص أوسع للمشاركين سيؤدي أيضًا إلى تعزيز فهمنا لكيفية تطوير مؤشرات جيدة للعاطفة الحيوانية. أحد الاتجاهات المحددة التي تبدو واعدة بشكل خاص هو استكشاف إمكانات الأساليب المتعلقة بالكشف عن معالم الوجه، مثل OpenFace70 وGoogle MediaPipe71. لقد بدأ للتو استكشاف طرق مماثلة للحيوانات غير البشرية، انظر على سبيل المثال دراسة Feighelstein et al.43 على وجوه القطط. وكما هو الحال في المجال البشري، فإن تطويرها سيتطلب جهودًا واسعة النطاق ومتعددة التخصصات لجمع مجموعات كبيرة من البيانات لمختلف الأنواع.

طُرق

مجموعة البيانات.

تم جمع مجموعة البيانات المتعلقة بالكلاب المستخدمة في هذه الدراسة مسبقًا بموجب الموافقات الأخلاقية التالية من جامعة لينكولن، (UID: CoSREC252) وفقًا لـ Bremhorst et al.22 مع تعديل لهذا البحث تم الحصول عليه من جامعة لينكولن لـ باستخدام مجموعة البيانات الأصلية في هذه الدراسة. تمت مراجعة البروتوكول الحالي الذي يستخدم هذه البيانات من قبل اللجنة الأخلاقية بجامعة حيفا ولم تكن هناك حاجة إلى موافقة أخرى.

الاقتصاص والمعالجة المسبقة.

هذه الخطوة ذات صلة بكل من DogFACS والنهج العميقة. تحتوي إطارات الفيديو الأصلية على فوضى في الخلفية بما في ذلك الغرفة المحيطة والبشر وأجسام الكلاب وما إلى ذلك. ونحن نهدف إلى التركيز على تعبيرات وجه الكلاب وتجنب تعلم مؤشرات أخرى للحالة العاطفية (مثل أوضاع جسم الكلاب). ومن ثم، قمنا بتدريب Mask-RCNN72 للتعرف على وجوه الكلاب واستخدمناه لاقتصاص المربع المحيط بالوجه من كل صورة. لقد قمنا بتدريب Mask-RCNN على ما يقرب من 200 صورة مشروحة من مجموعة البيانات هذه، مما يجعلها أكثر ملاءمة لهذا الإعداد التجريبي المحدد. يمكن رؤية أمثلة على محاصيل الوجه التي تم الحصول عليها باستخدام مرحلة ما قبل المعالجة في الشكل 2.

النهج القائم على DogFacs.

من مقاطع الفيديو إلى متغيرات DogFACS. يتم وصف خط الأنابيب الكامل في الرسم البياني التالي، انظر الشكل 9. ويتضمن الخطوات التالية:

• قص وجوه الكلاب من الإطارات باستخدام الطريقة الموضحة أعلاه.

• بناء مجموعات بيانات متغيرة DogFACS باستخدام ترميز DogFACS اليدوي لـ Bremhorst et al.22، لكل متغير DogFACS، أنشأنا مجلدين بأمثلة إيجابية وسلبية (وجه الكلب إما يعبر عن متغير DogFACS أو لا يعبر عنه). بالنسبة للعينات الإيجابية (المتغير الموجود)، اخترنا صور جميع الإطارات المشفرة يدويًا بهذا المتغير. بالنسبة للعينات السلبية، قمنا باختيار إطارات في مقاطع فيديو لم يتم وضع علامة على المتغير في ترميزها حتى أول ظهور لذلك المتغير (أو حتى نهاية الفيديو إذا لم يكن موجودًا). تمت بعد ذلك موازنة مجموعات البيانات، مع ترك عدد متساو من الصور للأمثلة الإيجابية والسلبية لكل متغير. يوضح الجدول 4 حجم مجموعات البيانات لجميع متغيرات DogFACS التي تم الحصول على أجهزة الكشف عنها.

من متغيرات DogFACS إلى تصنيف الحالات العاطفية. استخدمنا نقل التعلم استنادًا إلى بنية شبكة ResNet50 المدربة مسبقًا والتي تمت تهيئتها باستخدام أوزان Imagenet. لقد استبدلنا الطبقة العليا بطبقة تجمع متوسطة، وطبقة تسرب بنسبة 20 بالمائة، وطبقة مصنف من فئتين. تم تدريب النموذج خلال حقبتين0 باستخدام مُحسِّن Adam بمعدل تعلم قدره 0.0001. تم اختيار النموذج الذي يحقق أقصى قدر من الدقة في مجموعة بيانات التحقق من الصحة كأفضل نموذج. خلال العهود العشرة الأولى، تم ضبط أوزان جميع الطبقات بشكل دقيق. خلال العهود العشرة الأولى، تم ضبط وزن جميع الطبقات بدقة. خلال العصور المتبقية، تم تجميد أوزان ResNet50 وتم تحديث أوزان الطبقات العليا الجديدة فقط. بالنسبة للمتغيرات غير المتعلقة بالتوجيه ("تسطيح الأذنين"، و"جزء الشفاه"، و"تقريب الأذنين"، و"الأذنين للأمام"، و"لعق الأنف")، قمنا بتطبيق تقنية تكبير تعتمد على تقريب أفقي للصورة العشوائية وتدوير يصل إلى 20 درجة . كمدخل لجهاز التشفير، استخدمنا جدول الإدخال، حيث يمثل كل صف وجود (1)/غياب (0) لكل من متغيرات DogFACS الـ 11 في كل فيديو. هدف برنامج التشفير هو جدول يحتوي على الحالة (سلبي (0)/إيجابي (1)) لكل فيديو.

supplements to boost memory

نهج عميق.

حتى وقت قريب، كانت الشبكات العصبية التلافيفية (CNNs) تعتبر من أحدث التقنيات في مهام رؤية الكمبيوتر. ظهرت مؤخرًا بنية Vision Transformer (ViT)57 كبديل73. تم تقديم طريقة DINO للتدريب فقط في عام 2021 كإطار تعليمي للتقطير الذاتي. تدريب العديد من العمود الفقري لـ DNN (ResNet50، وvisit-small، وvit-base، وما إلى ذلك) في هذا التكوين، تبين أن العمود الفقري ViT المدرب باستخدام نهج DINO يتفوق على نتائج التصنيف السابقة في مجموعة البيانات القياسية ImageNet74.

لقد استخدمنا بنية ResNet50 للأعمدة الأساسية الخاضعة للإشراف والمدربة بواسطة DINO؛ تم تدريب ViT-S/16 بطريقة خاضعة للإشراف وتم تدريب ViT-S/8 مع DINO. نحن نستخدم أوزان ViT المدربة مسبقًا من مكتبة Timm75. نقوم بتدريب جميع النماذج الأربعة لمدة 30 عصور باستخدام Adam Optir76 مع النسخة التجريبية=(0، 0.999) ومعدلات التعلم: 10−4 للعمود الفقري ResNet و5 · 10−6 للعمود الفقري ViT. يتم عرض منحنيات الخسارة للنماذج المدربة في الشكل 10.

تصور الخريطة.

نختار طريقة Eigen-CAM لتصور المكونات الرئيسية لعمليات التنشيط النهائية لكل نموذج. لقد ثبت أن Eigen-CAM يوفر نتائج قابلة للتفسير بسهولة أكبر وبحسابات أقل مقارنة بطرق CAM الأخرى مثل Grad-CAM77 الشهير. علاوة على ذلك، وعلى عكس طرق التصور الأخرى مثل Grad-CAM59 وGrad-CAM++78، فإن Eigen-CAM هي أداة مستقلة عن فئتها. تتيح هذه الخاصية لـ Eigen-CAM تصور الأنماط المستفادة حتى عندما يكون تنبؤ النموذج خاطئًا، على عكس طرق CAM الأقدم التي تنتج خرائط غير ذات صلة عندما يكون تنبؤها غير صحيح. تتيح خاصية EigenCAM هذه تفسير أسباب فشل التنبؤ. إنه أكثر اتساقًا وتمييزًا طبقيًا مقارنةً بأساليب التصور الحديثة الأخرى. بالإضافة إلى ذلك، فإن EigenCAM ليس خاصًا بنموذج معين، بل يمكن استخدامه لكل من ViTs وCNN دون تغيير الطبقات.

توافر البيانات

مجموعة البيانات المستخدمة في هذه الورقة متاحة عند الطلب من المؤلف المقابل.


مراجع

داروين، سي. تي التعبير عن العواطف في الحيوانات والرجل المجلد. 11، 1872 (موراي، 1872).

2. Ekman، P. & Friesen، WV قياس حركة الوجه. البيئة. نفسي. السلوك غير اللفظي. 1، 56-75 (1976).

3. Ekman، P. & Keltner، D. تعبيرات الوجه العالمية عن العاطفة. في التواصل غير اللفظي: حيث تلتقي الطبيعة بالثقافة (eds Segerstrale UP & Molnar, P.) المجلد. 27، 46 (1997).

4. راسل، JA، باشوروفسكي، J.-A. & فرنانديز دولز، ج.-م. التعبيرات الوجهية والصوتية عن المشاعر. آن. القس النفسي. 54، 329-349 (2003).

5. Diogo، R.، Abdala، V.، Lonergan، N. & Wood، B. من fsh إلى التشريح المقارن للإنسان الحديث والتماثلات وتطور عضلات الرأس والرقبة. ج. عنات. 213، 391-424 (2008).

6. ديسكوفيتش، كا وآخرون. تعبيرات الوجه: أداة غير مستغلة لتقييم الرفاهية في الثدييات (Altex، 2017).

7. موتا روخاس، د. وآخرون. التطورات الحالية في تقييم مشاعر الكلاب وتعبيرات الوجه واستخدامها للتعرف السريري على الألم. الحيوانات 11، 3334 (2021).

8. إيكمان، ب. وفريزين، WV نظام ترميز حركة الوجه: دليل (مطبعة علماء النفس الاستشاريين، 1978).

9. Ekman, P. & Friesen, W. نظام ترميز حركة الوجه: تقنية لقياس حركة الوجه (1978).


For more information:1950477648nn@gmail.com




قد يعجبك ايضا