تحليل فعال طويل الأمد قائم على الذاكرة لمراجعات التجارة الإلكترونية، الجزء 2
Jan 18, 2024
محمد وآخرون. [20] قدم نموذجًا لتحليل المشاعر باستخدام word2vec وLSTM لمراجعات الفنادق.
محمد هو النبي ومؤسس الإسلام. ويُعرف بأنه رجل حكيم وحكيم وحكيم. ذاكرته قوية جدًا، مما يجعله فعالًا جدًا في معالجة المعلومات والتعبير عن أفكاره.
لذاكرة محمد علاقة كبيرة بتعليمه وخبرته. وفقًا للسجلات، غالبًا ما كان منغمسًا في التفكير والتأمل في شبابه. وقد ساعده هذا الفضول والتعطش للمعرفة في بناء قاعدة معرفية قوية وقدرة على الذاكرة.
بالإضافة إلى ذلك، لعب ذكاء محمد أيضًا دورًا كبيرًا في قدرات ذاكرته. إنه ذكي وذكي وبصير ويتمتع بقدرة على التفكير المنطقي، وهو أمر مفيد للغاية عند التعامل مع المعلومات المعقدة. وساعدته هذه الميزة على إدارة عملية الذاكرة والتحكم فيها بشكل أفضل، وبالتالي تحسين ذاكرته.
ومع ذلك، فإن ذاكرة محمد لم تكن فطرية، بل تحسنت من خلال العمل الجاد والممارسة. وغالبًا ما يقوم بتدريب الذاكرة، مثل القراءة المتكررة والإملاء والكلام، لمساعدته على فهم المعرفة وإتقانها بشكل أعمق.
لم تكن ذاكرة محمد مجرد موهبة طبيعية، بل تم تحسينها من خلال العمل الجاد والممارسة. وهذا يدل على أنه يمكن لكل واحد منا تحسين ذاكرته وتحسين كفاءة التعلم والعمل من خلال التعلم والممارسة. دعونا، مثل محمد، نعمل بجد لتحسين مهارات ذاكرتنا بشكل مستمر، لتحقيق نجاح أكبر في الحياة والعمل! يمكن ملاحظة أننا بحاجة إلى تحسين الذاكرة، ويمكن لـ Cistanche deserticola أن يحسن الذاكرة بشكل كبير، لأن Cistanche deserticola يمكنه أيضًا تنظيم توازن الناقلات العصبية، مثل زيادة مستويات الأسيتيل كولين وعوامل النمو. هذه المواد مهمة جدًا للذاكرة والتعلم. بالإضافة إلى ذلك، يمكن للحوم أيضًا تحسين تدفق الدم وتعزيز توصيل الأكسجين، مما يضمن حصول الدماغ على ما يكفي من العناصر الغذائية والطاقة، وبالتالي تحسين حيوية الدماغ والقدرة على التحمل.

انقر فوق "معرفة" لتحسين الذاكرة قصيرة المدى
بالنسبة لهذه الدراسة، تم جمع البيانات عن طريق الزحف إلى موقع السفر باستخدام السيلينيوم والخردة. +e كان الغرض الرئيسي من هذه التجربة هو تحليل الدقة عن طريق تغيير معلمات word2vec وLSTM. + أظهرت النتائج أنه يمكن تحقيق متوسط دقة 85.96 باستخدام المعلمات، والتي أظهرت نتائج واعدة.
تشاو وآخرون. [21] قدم تقنية جديدة لتحليل مشاعر العملاء من المراجعات على مواقع التجارة الإلكترونية. +e التقنية المُحسّنة المقترحة "شبكة Elman العصبية المستندة إلى خوارزمية البحث المحلي المرتجلة (LSIBA-ENN)" تتضمن أربع خطوات وتكتشف القطبية وتصنف مشاعر المراجعات. + تم جمع البيانات الإلكترونية لهذا البحث باستخدام أداة إلغاء الويب على مواقع التجارة الإلكترونية لاستخراج مراجعات العملاء.
بالإضافة إلى المعالجة المسبقة للبيانات، تستخدم هذه الدراسة "تردد الطبقة العكسية المعدلة المستندة إلى التردد (LTF-MICF) وخوارزمية الأرض الدافئة المستندة إلى الطفرة الهجينة (HMEWA)" لترجيح المصطلح واختيار الميزات. + تفوقت المنهجية المقترحة على تقنيات خط الأساس الأخرى من حيث دقة التنبؤ.
اقترح جيانغ [22] نموذجًا لتصنيف مشاعر المراجعات التي تم الحصول عليها من منصة التجارة الإلكترونية تاوباو. تستخدم الدراسة الإلكترونية خوارزمية التعلم الآلي بالإضافة إلى آلة ناقل الدعم للتصنيف وتحسين سرب الجسيمات (IPSO) لتحسين المعلمات. تم جمع بيانات +e للدراسة عن طريق الزحف إلى التعليقات من موقع الويب. + أظهرت النتائج التجريبية أن النهج المشترك بين SVM وIPSO كان له دقة أعلى. ومع ذلك، فإن غالبية النماذج الموجودة تعاني من التجهيز الزائد [23-25]، وضعف سرعة التقارب [26-28]، واختفاء مشاكل التدرج [29-31].
3. الدراسة التجريبية
+يقدم القسم نظرة عامة واضحة على المنهجية المستخدمة في المشروع لتصنيف المشاعر. تقنية +e التي تم استخدامها هي شبكة الذاكرة طويلة المدى، والتي تُستخدم لتصنيف عدد كبير من مراجعات قاعدة بيانات أمازون. التضمين +e المستخدم هو word2vec، والذي تم تدريبه خصيصًا وفقًا لقاعدة البيانات.
يؤدي ضبط word2vec وفقًا لمجموعة البيانات إلى تحسين الأداء العام للنموذج. +تتمثل فائدة استخدام LSTM في أنها تعطي نتائج أفضل حتى بالنسبة لبيانات المراجعة غير المنظمة. فهي قادرة على الحصول على وظائف مفيدة للموارد التي تحتوي على تبعيات طويلة المدى.
يتم جمع بيانات +e من مجموعة بيانات مراجعة Amazon، والتي تتم بعد ذلك معالجتها مسبقًا. تشكل تضمينات Word2vec خطوة مهمة في المعالجة المسبقة للبيانات. تم إنشاء بيانات التدريب والاختبار. + يتم تقسيم بيانات التدريب الإلكترونية إلى مجموعات بيانات التدريب والتحقق من الصحة. + يتم تدريب نموذج word2vec المخصص لكل قاعدة بيانات. يتم الحصول على ناقل الميزة +e، والذي يتم استخدامه بعد ذلك كطبقة تضمين لنموذج LSTM.
يتم استخدام Keras لبناء نموذج LSTM المتسلسل بميزات قصوى تساوي 50,000 وحجم التضمين يساوي 16. ثم يتم تدريب النموذج الإلكتروني لمدة 10 حقب. يتم اختبار نموذج +e بناءً على مقاييس أداء sklearn. + تم توضيح عملية الحصول على الميزات في الشكل 2.
3.1. مجموعة البيانات. للحصول على نتائج دقيقة، يجب أن تكون مجموعة البيانات المستخدمة كبيرة ومثرية. تم جمع مجموعة البيانات +e من قسم الهواتف المحمولة والملحقات عبر الإنترنت في مجموعة بيانات Amazon Review (2018). تتكون مجموعة بيانات +e من إجمالي 938,261 تقييمًا، من بينها 47901 منتجًا فريدًا و153124 تقييمًا فريدًا للمستخدمين. تتكون مجموعة البيانات +e في البداية من 7 أعمدة، وهي التصنيف الذي يختلف من 1 إلى 5، ووقت المراجعة، ومعرف المراجع، ومعرف المنتج، وملخص نص المراجعة.
بعد إسقاط التكرارات، تتكون مجموعة البيانات من 938254 سجلاً، ويبين الجدول 2 مقتطفًا من سجلات مجموعة البيانات الأصلية.
3.2. المنهجية. لقد قمنا بتدريب نموذج word2vec الخاص بنا خصيصًا لاستخدامه مع نموذج LSTM للتصنيف. Word2vec عبارة عن تضمين كلمات يُستخدم لتمثيل كلمة من خلال مجموعة من مصطلحات متعددة للمتجه. إنه بعيد عن تعيين كلمة في مساحة متجهة. يتم تحميل مجموعة البيانات +e في إطار بيانات الباندا. لتطوير نموذج Word2vec مخصص، الخطوة الأولى هي المعالجة المسبقة للبيانات.
نحن ننظر فقط إلى نص التقييم والمراجعة ونسقط كل شيء آخر. يتم تنظيف النص +e عن طريق إزالة علامات الترقيم. يتم إنشاء عينة فرعية من النص مما يقرب من 200000 مراجعة ويتم تطبيق طريقة النص النظيف لتحويل كل مراجعة إلى قائمة كلمات. + هي قائمة الكلمات التي تعمل الآن كمدخل لنموذج Word2vec الجيني.
لقد قمنا ببناء نموذج word2vec لتخطي جرام تم تدريبه بشكل مخصص وقمنا بإنشاء نموذج بأبعاد: حجم متجهات الكلمات هو 100، حجم النافذة يساوي 15، الحد الأدنى _عدد 2 للكلمات التي تظهر أقل من مرتين في مجموعتنا، سالب يساوي 5، ومعدل أخذ العينات يساوي 1e−5. لقد استخدمنا كل هذه الأبعاد لبناء مفردات من جمل المراجعة لدينا.

نحن ندرب نموذجنا word2vec لمدة 000 حقبة واحدة. +en نحسب الخسارة في كل عصر. +الخسارة مرتفعة في البداية وتقل في المرحلة الأخيرة. + الخسارة في العصر 0 هي 2239394.0 والخسارة في العصر 1000 هي 11504.0. + يتم بعد ذلك إعادة تحميل النموذج المحفوظ ويتم تنفيذ العمليات عليه.
على سبيل المثال، إذا أردنا العثور على كلمات مشابهة للضوضاء في مجموعة البيانات الخاصة بنا، فسنحصل على الإلغاء وسماعات الرأس.
وبالمثل يمكننا أيضًا أن نجد التشابه بين كلمات معينة مثل سماعات الأذن وسماعات الرأس وهو {{0}}.48756، والتشابه بين كلمتي شاحن وشاحن هو 0.89264.
لتقليل أبعاد بياناتنا، استخدمنا تصور TSNE لرسم البيانات إلى بعدين. الآن، يمكن استخدام متجهات الكلمات هذه لمزيد من التصنيف. + يتم بعد ذلك استخدام هذه التضمينات كميزات لمزيد من التدفق.
3.2.1. إعداد البيانات لLSTM. تتكون مجموعة البيانات الخاصة بنا من 938254 سجلًا، حيث تحتوي معظم المراجعات على توزيع درجات يزيد عن 3. لقد قمنا أولاً بحساب عدد الكلمات لكل مراجعة. يتم استخدام متوسط +e كإحصاءات للعثور على متوسط طول المراجعات. +e متوسط طول المراجعة هو 44.59 والحد الأقصى للطول هو 4303.
لقد أنشأنا مجموعة بيانات تتكون من مراجعات تحتوي على 100 كلمة أو أقل. يتم تصنيف المراجعات التي يزيد طولها عن 20 ولكن أقل من 100 ضمن المراجعات القصيرة ويتم تصنيف المراجعات ضمن المراجعات الطويلة. + عدد المراجعات القصيرة هو 411313 والمراجعات الطويلة هي 100239. يتم وصف المعلمات الفائقة المستخدمة في النموذج في الجدول 3.
بعد ذلك، قمنا بتعريف تصنيف المشاعر على أنه إيجابي إذا كان التصنيف أكبر من أو يساوي 3؛ وإلا فإن التصنيف سلبي. لقد أخذنا في الاعتبار نص المراجعة والمشاعر الخاصة بإنشاء مجموعة بيانات القطار. +تتكون بيانات الاختبار الإلكترونية من المنتجات التي تحتوي على أكثر من 10 مراجعات على الأقل.
بعد التوزيع، تتكون مجموعة بيانات التدريب من إجمالي 203891 سجلًا، من بينها 175910 ينتمي إلى الفئة الإيجابية و27981 إلى الفئة السلبية. تتألف مجموعة بيانات الاختبار +e من إجمالي 686345 سجلًا، من بينها 592118 ينتمي إلى الفئة الإيجابية و94227 تنتمي إلى الفئة السلبية.
في هذه الدراسة، استخدمنا Keras لبناء نموذج LSTM الخاص بنا، والذي يأخذ 50 ميزة كحد أقصى 000 كمدخلات لطبقة التضمين. الذاكرة الطويلة قصيرة المدى (LSTM) هي نوع من الشبكات العصبية المتكررة التي تستخدم آلية داخلية تنظم تدفق المعلومات. + هي آلية داخلية تتكون من بوابات تحتاج إلى تدريب بحيث يمكنها تصفية المعلومات غير ذات الصلة بدقة والاحتفاظ بالمعلومات المفيدة.

يوضح الشكل 3 البنية الأساسية لنموذج LSTM في منهجيتنا المقترحة.
Ht−1 وXt هما المدخلات لوحدة LSTM؛ Ht−1، التي يشار إليها عادة بالذاكرة قصيرة المدى، تأخذ الإخراج من الحالات السابقة كمدخل. تساعد خلية الذاكرة +e أو الذاكرة طويلة المدى، Ct −1، في حمل المعلومات ذات الصلة طوال عملية التسلسل. تجمع بنية +eLSTM بين ثلاث بوابات: بوابة النسيان، وبوابة الإدخال، وبوابة الإخراج. في وحدة LSTM، يتم استخدام وظائف تانه والسينية للحصول على هذه البوابات.
تم بعد ذلك تقسيم بيانات القطار +e إلى بيانات قطار وبيانات تحقق متساوية الطول. + تم حساب طول البيانات ليكون 101945 وكان توزيع الفئة {1: 87955، 0:13990}. لإنشاء اختبار قطار TensorFlow ومجموعات بيانات التحقق من الصحة، نحتاج إلى تحويل بيانات القطار الخاصة بنا إلى تسلسلات. لقد قمنا بتبطينها بحد أقصى يبلغ 100 بحيث تكون جميع التسلسلات بنفس الطول. + تسميات التدريب والاختبار

For more information:1950477648nn@gmail.com






