تحسين استخراج معلمة الميزة من إشارات الكلام باستخدام خوارزمية التعلم الآلي (2)
May 30, 2023
3.7 تم إجراء عمليات تجميع وتوليد مجموعة البيانات على النحو التالي. في هذه الدراسة ، تم استخدام مجموعة البيانات ذات 120 ساعة من الصوت لتدريب النموذج. تتضمن مجموعة البيانات تسجيلات صوتية للكلام تتكون من جمل بحد أقصى 15 كلمة بطول إجمالي يبلغ 120 ساعة تقريبًا.

الجينسنغ الصحراوي
بالإضافة إلى ذلك ، تتضمن مجموعة البيانات قدرًا كبيرًا من النصوص المختلفة لاستخدامها في تطوير نموذج اللغة. تم جمع أكثر من 90،650 نطقًا و 415،780 كلمة و 65،810 كلمة فريدة تم تضمينها في مجموعة النص ، مما أدى إلى حوالي 120 ساعة من بيانات الكلام المنسوخة. قمنا بتقسيم مجموعة البيانات إلى مجموعات تدريب وتحقق واختبار. إحصاءات مجموعة البيانات
تم الإبلاغ عنها في الجدول 3.
الجدول 3. مواصفات مجموعة البيانات.

قمنا بتقسيم مجموعة البيانات إلى ثلاثة مجلدات تتوافق مع مجموعات التدريب والتحقق والاختبار. يحتوي كل مجلد على تسجيلات صوتية ونصوص. أسماء ملفات الصوت والنسخ المطابقة هي نفسها ، باستثناء أنه يتم تخزين التسجيلات الصوتية كملفات WAV ، بينما يتم تخزين النسخ كملفات TXT باستخدام ترميز UTF -8. يتم تمثيل جميع النسخ باستخدام الأبجدية اللاتينية المكونة من 29 حرفًا ورمز الفاصلة العليا. لمنع فرط التخصيص ، قمنا بتطبيق تقنيات زيادة البيانات على أساس اضطراب السرعة وتحسين الطيف.

Cistanche Deserticola
4. الطريقة المقترحة
مهمة مهمة للمبرمجين عند تطوير أنظمة التعرف على الكلام هي إنشاء طريقة مثالية للتعبير البارامترى لإشارات الكلام [45]. تتيح هذه الطريقة فصلًا ممتازًا للأصوات والكلمات المنطوقة مع ضمان عدم حساسية السماعات لأنماط النطق والتغيرات في البيئة الصوتية. معظم الأخطاء في التعرف على الكلمات ناتجة عن تغيير في طبقة الإشارة بسبب تغير في الميكروفون أو اختلاف في درجة النطق [46]. سبب شائع آخر للأخطاء هو التشوهات العشوائية غير الخطية لشكل الطيف ، والتي توجد دائمًا في إشارة الكلام للمتحدث [47 ، 48]. لذلك ، فإن أحد أهم المهام في إنشاء أنظمة فعالة للتعرف على الكلام هو اختيار تمثيل كافٍ لمحتوى الإشارة التي تم تحليلها وكذلك غير حساس لأصوات المتحدثين والبيئات الصوتية المختلفة.

ملحق Cistanche بالقرب مني - تحسين الذاكرة
عادة ما يكون للنظام المستخدم لاستخراج معلمات الميزة المتطلبات التالية. يجب أن يضمن محتوى المعلومات ، أي مجموعة معلمات الميزة ، التحديد الموثوق به لعناصر الكلام التي يمكن التعرف عليها. علاوة على ذلك ، يجب تقليل جهارة الصوت ، أي أقصى ضغط للإشارة الصوتية ، والارتباط غير الإحصائي للمعلمات. يجب أيضًا تحقيق الاستقلال عن المتحدث ، أي الإزالة القصوى للمعلومات المتعلقة بخصائص المتحدث من ناقل الأحرف. أخيرًا ، يجب توفير التجانس ، الذي يشير إلى المعلمات التي لها نفس متوسط التباين والقدرة على استخدام المقاييس البسيطة لتحديد التقارب بين مجموعات الأحرف [49]. ومع ذلك ، ليس من الممكن دائمًا تلبية جميع المتطلبات في وقت واحد لأن هذه المتطلبات متناقضة. يجب أن يكون الوصف البارامترى لعناصر الكلام مفصلاً بشكل كافٍ للتمييز بينها بشكل موثوق ويجب أن يكون مقتضبًا قدر الإمكان.

أعشاب سوبرمان موجودة
في الممارسة العملية ، يتم رقمنة إشارة الكلام التي يتم استقبالها من الميكروفون بمعدل أخذ العينات من 8 إلى 22 كيلو هرتز. تنقسم القيم العددية التسلسلية إلى أجزاء الكلام (الإطارات) لمدة تتراوح من 10 إلى 30 مللي ثانية ، والتي تتوافق مع أجزاء الكلام شبه الثابتة. يتم حساب ناقل الميزات من كل إطار ، والذي يتم استخدامه لاحقًا على المستوى الصوتي للتعرف على الكلام. في الوقت الحاضر ، تتوفر مجموعة واسعة من الطرق للتمثيل البارامترى للإشارات بناءً على تحليل الارتباط التلقائي ، والترشيح الخطي للأجهزة ، والتحليل الطيفي ، و LPC. النهج الأكثر شيوعًا لتحديد معلمات الكلام هو التحليل الطيفي لشظايا الإشارة وحساب معاملاتها cepstral.
تم استخدام MFCCs كميزات إعلامية للإشارة الكلامية [41]. تُستخدم هذه الخصائص على نطاق واسع في التعرف على الكلام وتستند إلى مفهومين رئيسيين: مقياس cepstral و Mel. تتمثل المزايا الرئيسية للخوارزمية في المستوى العالي من الألفة وسهولة الكلام. يتم فصل ميزات MFCC عن إشارات الكلام المسجلة. تستخدم خوارزمية MFCC نتائج خوارزميات التسجيل الصوتي وتبديل الطيف. تم توضيح الخوارزمية الكلاسيكية المستخدمة لحساب MFCCs في الشكل 5.

الشكل 5. مخطط كلاسيكي لحساب MFCCs.
تقدم هذه الدراسة طريقة سريعة لاستخراج معلمات الوظيفة من إشارة الكلام. تظهر الخوارزمية المقترحة للحساب السريع لـ MFCCs في الشكل 6.

الشكل 6. الإطار المقترح لحساب البلدان ذات الغطاء الحرجي المتوسط.
نحن نأخذ في الاعتبار تسلسل تنفيذ الخوارزمية المقترحة للاستخراج السريع لمعلمات الوظيفة من إشارة الكلام
4.1 تقسيم إلى إطارات
بعد الترشيح الأولي ، يتم تقسيم إشارة الكلام إلى أرتال 16 مللي ثانية. يحتوي كل إطار (باستثناء الإطار الأول) على آخر 10 مللي ثانية من الإطار السابق. تستمر هذه العملية حتى نهاية الإشارة. في هذه الدراسة ، نظرًا لأن معدل أخذ العينات للإشارة الكلامية هو 16 كيلو هرتز ، وطول الإطار هو N=256 ، وطول الإزاحة هو M=160. التداخل هو 62.5 بالمائة من طول الإطار. يوصى عمومًا بتغطية من 50 في المائة إلى 75 في المائة من طول الإطار.
4.2 نافذة هانينج والقيم المتناقصة
تم استخدام نافذة Hanning بحجم 1D. تسمى نافذة Hanning أيضًا نافذة جيب التمام المرتفعة. يمكن اعتبار نافذة هانينج مجموع طيف التردد لثلاث نوافذ زمنية مستطيلة الشكل. يمكن أن تستخدم الفصوص الجانبية لإلغاء بعضها البعض ، والقضاء على التداخل عالي التردد وتسرب الطاقة. نوافذ Hanning هي وظائف نافذة مفيدة للغاية.

ملحق Cistanche بالقرب مني - تحسين الذاكرة
انقر هنا لعرض منتجات تحسين الذاكرة والوقاية من مرض الزهايمر
【اطلب المزيد】 البريد الإلكتروني: cindy.xue@wecistanche.com / تطبيق Whats: 0086 18599088692 / Wechat: 18599088692
يستخدم صندوق الوزن لتقليل التشويه وتنعيم الإطارات الفردية. تتكون الإشارة العائمة التي تم فحصها في هذه الدراسة من نغمة كثيفة. يتم تحديد حجم النغمة المسطحة بحجم النغمة النقية عند التردد f ، والتي يتم ترشيحها من خلال نافذة Hanning.
يتمثل أحد الجوانب المهمة لهذه النافذة في أنها تعين حدود الإطارات على الصفر. في هذه الحالة ، يمكن حساب الطاقات القصيرة أثناء المرور عبر النافذة ، ويمكن نقلها من التسلسل المستخدم لحساب طاقات السعة الأدنى. الهدف هو إزالة إشارات الطاقة المنخفضة من الإشارة عن طريق حساب طاقة الإشارة أثناء تجانس الإشارة من هذه النافذة. تتطلب هذه العملية معادلة طاقة الإشارة التالية:

حيث En هي طاقة جزء إشارة الإدخال ، و xi هي قيمة الإشارة.
بالإضافة إلى عملية النافذة باستخدام (11) ، تتم معالجة الإشارة في الخطوة التالية ، مما يقلل بشكل كبير من عدد القيم التي تدخل المعالج. يعرض الشكل 7 خوارزمية المعالجة المتوازية.
يمثل حجم النافذة عددًا من العينات والمدة. إنها المعلمة الرئيسية للتحليل. يعتمد حجم النافذة على التردد الأساسي والشدة والتغيرات في الإشارة.

الشكل 7. خوارزمية نافذة هانينج لإزالة الأجزاء الصامتة. 4.3 مفاتيح تحويل فورييه قصيرة الوقت (STFT) يوجد فهم بديهي لمعنى ارتفاع أو ارتفاع منخفض. STFT عبارة عن تحويل مرتبط بـ Fouri يتم استخدامه لتحديد التردد الجيبي ومحتوى الطور للأقسام المحلية للإشارة أثناء تغيرها بمرور الوقت. في الممارسة العملية ، يتضمن حساب STFT تقسيم إشارة زمنية أطول إلى مقاطع أقصر ذات طول متساوٍ ، متبوعة بحساب منفصل لتحويل فورييه على كل مقطع أقصر ، وهذا يكشف عن طيف فورييه لكل مقطع أقصر. تستخدم في الممارسة. تقارب التردد الزمني المقابل هو تحويل فورييه المنفصل ، والذي يصف طول الإشارة Xn كممثل لمجال تردد القيمة المعقدة للمعاملات N. STFT ، التي تصف تطور مكونات التردد بمرور الوقت ، هي واحدة من أكثر الأدوات استخدامًا لتحليل الكلام ومعالجته [50]. على غرار الطيف نفسه ، تتمثل إحدى مزايا STFT في أن معلماته لها تفسيرات مادية وبديهية. عادةً ما يتم تصور STFT باستخدام أطياف اللوغاريتمات 20log10 (X (h، k)). يمكن بعد ذلك عرض أطياف اللوغاريتمات ثنائية الأبعاد هذه باستخدام خريطة حرارية تُعرف باسم مخطط الطيف. في المرحلة الثالثة من الخوارزمية ، يتم تطبيق إجراء التحويل الطيفي STFT على الإطارات التي يتم تمريرها من خلال نافذة الوزن. يتم الحصول على STFT للإشارة عن طريق فتح النوافذ وتحديد DFT لكل نافذة. على وجه الخصوص ، يتم تحديد تحويل نافذتي Xn و Wn لإشارة الإدخال على النحو التالي:

حيث يتوافق مؤشر k مع قيم التردد ، و wn هي وظيفة النافذة ، والتي تكون عادةً نافذة هانينج أو نافذة غاوسية تتمحور حول الصفر.
4.4 تحويل ميل
في المرحلة الرابعة ، يتم تقسيم الإشارة المنقولة إلى نطاق التردد إلى نطاقات باستخدام الفلاتر الثلاثية. يتم حساب حدود فيفلتر باستخدام تردد الطباشير. يعتمد الانتقال إلى تردد الطباشير فيفيلد على المعادلة التالية:

حيث f هو مدى التردد.
يتم تحديد التبديل العكسي على النحو التالي:

ضع في اعتبارك أن NN هو عدد الفلاتر (26 فلاتر تستخدم عمومًا) وتدفق التدفق ، مثل نطاق التردد قيد الدراسة. يتم نقل هذا النطاق إلى مقياس Mel ويقسم إلى نطاقات متقاطعة موزعة بالتساوي NN. يتم تحديد الحدود المناسبة للتردد الخطي داخل المجال ، بينما يتم الإشارة إلى معاملات الترجيح التي تم الحصول عليها على أساس التصفية بواسطة H.. القيم التي تم الحصول عليها هي لوغاريتمية بسبب التعبير التالي:

يتم تنفيذ خوارزمية تحلل القيمة الفردية في المرحلة الخامسة من حساب MFCCs.
5. النتائج التجريبية
طبقنا واختبرنا الطريقة المقترحة في Visual Studio 2019 C plus plus على جهاز كمبيوتر مزود بوحدة معالجة مركزية 4.90 جيجاهرتز وذاكرة وصول عشوائي 32 جيجابايت واثنين من وحدات معالجة الرسومات Nvidia GeForce 2080Ti ، كما هو موضح في الجدول 4. تم اختبار النظام في بيئات مختلفة للأجهزة تقييم أداء طريقة استخراج ميزة الإشارة. في التجارب ، أثناء تشغيل الخوارزمية (الشكل 8) ، عندما كان تسلسل أسطح الإشارة n=15 ، تم تقليل عدد القيم بنسبة 40-50 بالمائة ، وزاد وقت المعالجة 1. 2- أضعاف. وبالتالي ، أظهرت هذه الخوارزمية كفاءة أعلى بشكل ملحوظ. علاوة على ذلك ، مكنت هذه الخوارزمية من فصل وإزالة مناطق الصمت أثناء المرور عبر نافذة هانينج.
تتوفر العديد من الوسائل الممكنة لتجنب إهدار عرض النطاق الترددي للذاكرة. نقترح حلاً جديدًا يزيد من أداء الحوسبة من خلال مطابقة حجم إطارات الإشارة مع حجم كتلة ذاكرة التخزين المؤقت. يمكن أن يؤثر هذا النوع من التحسين بشكل كبير على أداء المعالجة المتوازية الكلي. ومع ذلك ، يمكن استخدامه في معالجة الإشارات الرقمية عن طريق تقسيم الإشارة إلى إطارات من خلال تطبيقات على معالجات متعددة النواة. ومع ذلك ، من الناحية العملية ، عادةً ما يتم إجراء التحديد على نطاق صغير ، بما يتوافق مع عرض ناقل البيانات الذي يربط ذاكرة التخزين المؤقت بالذاكرة الرئيسية وحجم الكتلة الخاصة بها. تطبق طريقتنا الاستخدام الأمثل لهذه الذكريات في الحوسبة المتوازية. يلعب تنظيم ذاكرة التخزين المؤقت دورًا أساسيًا في خوارزميات المعالجة المتوازية عند تقسيم البيانات إلى تدفقات. على وجه الخصوص ، يجب تعديل وجود تأثيرات المصفوفة المتجهة في معالجة الإشارات الرقمية وحجم تدفقاتها وفقًا لحجم كتل التخزين المؤقت. يمكن تحقيق ذلك باستخدام الطريقة المقترحة ، كما هو موضح في الشكل 9.
الجدول 4. المواصفات التفصيلية للإعداد التجريبي.


الشكل 8. (أ) الإشارة الأولية الواردة و (ب) ظهور الإشارة بعد تطبيق الخوارزمية المقترحة.

الشكل 9. هيكل الحوسبة المتوازية باستخدام معالجات RK3288.
في هذا القسم ، نناقش التحليل الكمي لمقارنة أداء الأنظمة المختلفة. قارنا طريقتنا بإيقاعات خوارزمية معروفة جيدًا في التعرف على الكلام بناءً على مناهج التعلم العميق. تعتبر مقاييس التقييم ضرورية لحساب الاستراتيجيات المختلفة للتعرف على الكلام وتقييم أداء الأساليب المختلفة. على الرغم من أننا استخدمنا نتائج دراسات أخرى للمقارنة ، إلا أننا لسنا متأكدين مما إذا كانت صحيحة لأن أكواد المصدر ومجموعات البيانات الخاصة بهذه الأساليب غير متاحة للجمهور للتحقق من الأداء الفعلي. يوضح الشكل 10 نتيجة إعادة تحريك الأجزاء الصامتة أثناء مرور جزء من إشارة الكلام عبر نافذة هان نينغ بناءً على الخوارزمية السريعة المقترحة. يتم عرض نتائج السرعة التي تم الحصول عليها من التحليل في الجدول 5.

الشكل 10. قيمة k لخوارزمية KNN (مع اختيار الميزة).
الجدول 5. النتائج التجريبية للطريقة المقترحة.

تم تحديد النطاق من أجل تحديد درجة الحي التي تعطي أفضل قيمة دقة في خوارزمية KNN. النطاق المحدد يغطي 1-25. في الشكل 10 ، تم تطبيق الرسم البياني لخوارزمية KNN مع اختيار الميزة. عندما تم فحص الرسم البياني ، عندما كانت قيمة الحي 1 في البداية ، كانت دقة التدريب أعلى بكثير من دقة الاختبار. في خوارزمية KNN التي تم إنشاؤها باستخدام الميزات المحددة عن طريق الارتباط ، تم تحديد دقة النموذج بنسبة 99.15 بالمائة في مجموعة بيانات التدريب و 97.35 بالمائة في مجموعة بيانات الاختبار.
عادةً ما يتم استخدام معدل الخطأ في الكلمات (WER) أو معدل الخطأ في الأحرف لتقييم دقة استخراج الميزات من إشارة الكلام. هذه مصفوفات موضوعية مفيدة لإجراء مقارنة عادلة لتقنيات التعرف. في دراساتنا السابقة [51-56] ، قمنا بحساب المقاييس مثل مقياس F (FM) والدقة والتذكر. FM هو المتوسط المرجح الذي يوازن بين القياسات بين الدقة ومعدلات الاسترجاع. الدقة هي نسبة عدد الملاحظات الإيجابية المتوقعة بشكل صحيح إلى العدد الإجمالي للملاحظات الإيجابية المتوقعة. الاسترجاع هو نسبة عدد الملاحظات الإيجابية المتوقعة بشكل صحيح إلى إجمالي عدد الملاحظات في الفئة الفعلية ، كما هو موضح في (9). يمكن استخدام المعادلات التالية لحساب متوسط الدقة ومعدلات استدعاء طرق استخراج الميزات:

حيث يشير TP إلى عدد الإيجابيات الحقيقية ، يشير FP إلى عدد الإيجابيات الخاطئة ، ويشير FN إلى عدد السلبيات الخاطئة.
يتم حساب FM باستخدام (10) ، مع مراعاة الدقة والاسترجاع.

كان متوسط FM والاستدعاء والدقة للطريقة المقترحة 98.4 بالمائة. حدث اكتشاف كاذب في 1.6 بالمائة من الحالات بسبب الضوضاء غير المرغوب فيها للإشارات في الميكروفون. كان نطاق دقة النموذج بين 0 و 1 ، ووصلت درجات تقدير المقاييس إلى أفضل قيمها عند 1. ويرد في الجدول 6. تقييم لطريقتنا وطرق استخراج ميزات الكلام الأخرى التي تم نشرها مؤخرًا. من الميزات لمقارنة عادلة. تم تحليل ما مجموعه 325 عينة كلام من كل مجموعة من موضوعات ذات خلفيات مميزة متشابهة. تم أيضًا فحص تأثيرات أطوال الإطارات المختلفة وفقًا لعدد بنوك الفلترة في MFCC وأطوال الإطارات المختلفة في ترتيب LPC لتحسين الدقة.
الجدول 6. نتائج الدقة الكمية لاستخراج ميزة الكلام.

كما ذكرنا سابقًا ، يعد WER هو المقياس الأكثر شيوعًا لأداء التعرف على الكلام. يتم حسابه من خلال مقارنة نسخة مرجعية بإخراج أداة التعرف على الكلام. بناءً على هذه المقارنة ، من الممكن حساب عدد الأخطاء ، والتي تنتمي عادةً إلى ثلاث فئات: (1) الإدخالات عندما لا تكون الكلمة موجودة في المرجع في إخراج التعرف التلقائي على الكلام (ASR) ، (2) عمليات الحذف عند عدم وجود كلمة في إخراج ASR ، و (3) الاستبدالات عند الخلط بين كلمة وكلمة أخرى. يمكن حساب WER على النحو التالي.

حيث S هو عدد استبدالات الكلمات التي تم التعرف عليها بشكل غير صحيح ، D هو عدد عمليات الحذف ، I هو عدد الإدخالات ، و N هو عدد الكلمات في النسخ المرجعي. المشكلة الرئيسية في حساب هذه النتيجة هي المحاذاة بين التسلسلات المكونة من كلمتين. يمكن تحديد ذلك من خلال البرمجة الديناميكية باستخدام مسافة ليفينشتاين [67].
استنادًا إلى الجدول 6 ، أجرينا تحليلًا إحصائيًا للإشارة إلى متوسط دقة الطرق المقارنة باستخدام مقياس تقييم WER ، كما هو موضح في الشكل 11. حقق مستخرج الميزة المحسنة دقة تبلغ حوالي 98.4 بالمائة ، بينما أسفرت الأساليب الأخرى عن دقة بين 78 في المئة و 96 في المئة. استخدمنا النتائج الواردة في الأوراق ذات الصلة للمقارنة. ومع ذلك ، لا يمكن التحقق من دقة هذه القيم بسهولة لأن أكواد المصدر ومجموعات البيانات الخاصة بهذه الطرق ليست متاحة للجمهور لتأكيد أدائها الحقيقي. ومع ذلك ، في حالة المشاهد القياسية ، تم إثبات الطريقة المقترحة بشكل تجريبي لتوفير دقة ممتازة في استخراج ميزة الكلام عن طريق تقليل الوقت الحسابي ، حتى عندما تكون بيانات الكلام صاخبة أو منخفضة الجودة.

الشكل 11. النتائج الكمية لنهج استخراج ميزة إشارة الكلام باستخدام الرسوم البيانية العمودية.
علاوة على ذلك ، قمنا بتقييم النتائج الإيجابية الخاطئة للطرق المختارة. كما يمكن ملاحظته من الشكل 12 ، كان للنهج المقترح أقل عدد من الأخطاء. علاوة على ذلك ، قللت طريقة الحساب المتوازي الفعالة للغاية من اختيار ميزة إشارة الصوت وأخطاء الاستخراج. كان فرط التخصيص أحد المشكلات الرئيسية أثناء التدريب ، وتعاني منه جميع نماذج التعلم الآلي تقريبًا. لقد حاولنا تقليل مخاطر التخصيص الزائد باستخدام تقنية اختيار الميزة التي تهدف بدلاً من ذلك إلى تصنيف أهمية الميزات الموجودة في مجموعة البيانات وتجاهل الميزات الأقل أهمية (لم يتم إنشاء ميزات جديدة).

الشكل 12. النتائج المرئية لتجارب استخراج ميزة إشارة الكلام الإيجابية الزائفة.
يعرض الجدول 7 نتائج أداء الطرق المستخدمة في بيئات التعرف على الكلام بناءً على خصائص مختلفة. نهجنا المقترح لا يعاني من ضجيج الخلفية غير المرغوب فيه وغير الضروري ولا يتأثر بالأصوات البشرية منخفضة الجودة مثل الأصوات البحة والأصوات الناتجة عن التهاب الحلق أو حتى أصوات البشر الذين يعانون من فقدان كامل للصوت. تهدف طريقتنا إلى التغلب على مشاكل عدم كفاية معدات التسجيل ، وضوضاء الخلفية ، واللهجات الصعبة ، واللهجات المختلفة ، وطبقات الصوت المختلفة. في البيئة العادية ، تم الحصول على أفضل النتائج للكشف الدقيق عن تحديات ميزة الكلام واستخراجها باستخدام الطريقة المقترحة مع تقليل وقت المعالجة.
الجدول 7. مراجعة أداء الكشف عن ميزة الكلام واستخراجها باستخدام ميزات مختلفة.

تم تصنيف نتائج طرق التعرف على الكلام على أنها قوية أو عادية أو ضعيفة للفئات السبع. يوضح المعيار القوي أن الخوارزمية يمكنها التغلب على جميع أنواع التحديات. في المقابل ، يشير المعيار العادي إلى أن الخوارزمية قد تفشل في حالات معينة لأن حدود الكلمات لم يتم تحديدها مسبقًا. أخيرًا ، يشير المعيار الضعيف إلى أن الخوارزمية لا يمكن الاعتماد عليها في ظل ضوضاء الخلفية أو الاهتزازات.
6. القيود
من الصعب استنتاج أن الأساليب المقترحة حتى الآن لا تظهر أي عيوب. قد تؤدي طريقتنا المقترحة أيضًا إلى حدوث أخطاء بسبب بيئات الضوضاء المختلفة. للتغلب على هذه المشكلة ، نهدف إلى تقليل عدد الميزات في مجموعة البيانات من خلال إنشاء ميزات جديدة من الميزات الموجودة [69]. نظرًا لأن فرط التخصيص كان أحد المشكلات الرئيسية لتدريب النماذج المختلفة أثناء المنافسة ، فإن إثراء بيانات التدريب عن طريق إضافة عينات بيانات من موارد مختلفة يمكن أن يكون حلاً محتملاً لتحسين النتائج. بغض النظر عن المشاكل المذكورة أعلاه ، كشفت النتائج التجريبية أن طريقتنا كانت قوية جدًا وفعالة لمهام استخراج ميزات الكلام ، بمتوسط دقة 98.4 بالمائة و FM 99.5 بالمائة.
7. استنتاجات
تم اقتراح نهج جديد للحوسبة المتوازية عالية الأداء باستخدام طريقة التعلم الآلي لأنظمة التعرف على الكلام. يمكن حل مشكلات التسريع في الأجهزة ذات موارد الحوسبة المحدودة باستخدام الأنظمة الموزعة. يمكن زيادة سرعة الحساب في أنظمة التعرف على الإشارات ، ويمكن تحسين أداء الأنظمة الأساسية متعددة النواة من خلال إنشاء واستخدام إيقاعات خوارزمية فعالة وسريعة. توضح النتائج أن النموذج المقترح يقلل من وقت المعالجة ويحسن دقة استخراج الميزات بنسبة 98.4 في المائة من خلال استخدام MFCCs بشكل فعال. لقد لوحظ أن الميزات ذات قيم الارتباط المنخفضة المستخرجة عن طريق اختيار الميزة فعالة أيضًا في نجاح النموذج. تم إجراء التحليل الإحصائي على البيانات المعالجة مسبقًا ، وتم إنتاج معلومات ذات مغزى من البيانات باستخدام خوارزمية التعلم الآلي لأقرب جيران K (KNN).
ستركز الدراسات المستقبلية على تحسين دقة طريقتنا من خلال استخدام مناهج التعلم العميق وتحسين الذاكرة المؤقتة للمعالجات متعددة النواة لاكتشاف واستخراج إشارات الكلام دون خسارة كبيرة في الجودة. علاوة على ذلك ، نخطط لبناء نموذج تحليل طيفي يعتمد على المعالجة المتوازية مع أداء تحليل قوي سيمكن من إنشاء أجهزة مضمنة ذات موارد حسابية منخفضة باستخدام مجموعات بيانات خطاب Taris [70] في 3D CNN و 3D U-Net Environment [71- 75]
مراجع
1 - منغ ، واي جيه ؛ ليو ، و. تشانغ ، RZ ؛ استخلاص معلمات الكلام والتعرف عليها بناءً على الاستيفاء. تطبيق ميكانيكي. ماتر. 2014 ، 602-605 ، 2118-2123. [CrossRef] 2. Musaev، M .؛ Rakhimov، M. تدريب سريع للشبكات العصبية التلافيفية. في وقائع المؤتمر الدولي لعام 2020 حول علوم المعلومات وتكنولوجيا الاتصالات (ICISCT) ، طشقند ، أوزبكستان ، 4-6 نوفمبر 2020 ؛ ص 1 - 5. [CrossRef] 3. أنتم ، ف. يانغ ، ج. نموذج الشبكة العصبية العميقة لتحديد السماعات. تطبيق علوم. 2021، 11، 3603. [CrossRef] 4. Musaev، M .؛ Rakhimov، M. طريقة لتعيين كتلة من الذاكرة الرئيسية للتخزين المؤقت في المعالجة المتوازية لإشارة الكلام. في وقائع المؤتمر الدولي لعام 2019 حول علوم المعلومات وتكنولوجيا الاتصالات (ICISCT) ، كراتشي ، باكستان ، 9-10 مارس 2019 ؛ ص 1 - 4. [CrossRef] 5. Jiang، N .؛ Liu ، T. تجزئة الكلام المحسّنة وخوارزمية التجميع بناءً على SOM و k-mean. رياضيات. بروبل. م. 2020، 2020، 3608286. [CrossRef] 6. Hu، W .؛ يانغ ، زي. تشين ، سي ؛ الشمس ، ب. Xie ، Q. نهج تجزئة الاهتزاز لنظام برج التحكم العددي متعدد الإجراءات. عملية فيديو صورة الإشارة. 2021 ، 16 ، 489-496. [CrossRef]
7. Popescu، TD؛ Aiordachioaie، D. الكشف عن أعطال محامل العناصر المتدحرجة باستخدام التجزئة المثلى لإشارات الاهتزاز. ميكانيكي. النظام. عملية الإشارة. 2019 ، 116 ، 370-391. [CrossRef] 8. شهاب ، MSH ؛ أديتيا ، إس. سيتو ، JH ؛ امتياز الدين الدين ، كم ؛ Efat ، MIA تقنية استخراج ميزة GRU-CNN الهجينة لتحديد السماعات. في وقائع 2020 23 المؤتمر الدولي الثاني للكمبيوتر وتكنولوجيا المعلومات (ICCIT) ، دكا ، بنغلاديش ، 19-21 ديسمبر 2020 ؛ ص 1 - 6. [CrossRef] 9. Korkmaz، O .؛ Atasoy ، A. التعرف على المشاعر من إشارة الكلام باستخدام معاملات cepstral تردد ميل. في وقائع المؤتمر الدولي التاسع للهندسة الكهربائية والإلكترونية (ELECO) ، بورصة ، تركيا ، 26-28 نوفمبر 2015 ؛ ص 1254 - 1257. 10. أيفاز ، يو. Gürüler، H.؛ خان ، ف. أحمد ، ن. وانجبو ، تي. عبد السلاموف ، أ. التعرف التلقائي على السماعات باستخدام معاملات Cepstral ذات التردد الميل من خلال التعلم الآلي. CMC-Comput. ماتر. تابع. 2022 ، 71 ، 5511-5521. 11. القادري ، محمد. لحمر ، إي. Rad ، A. نظام تحديد مكبرات الصوت من مستويين عبر اندماج المصنفات غير المتجانسة والتعاون التكميلي في الميزات. أجهزة الاستشعار 2021، 21، 5097. [CrossRef] 12. Batur Dinler، Ö .؛ Aydin، N. مجموعة معلمة الميزة المثلى استنادًا إلى الشبكات العصبية المتكررة بوحدة متكررة للكشف عن مقطع الكلام. تطبيق علوم. 2020، 10، 1273. [CrossRef] 13. Kim، H .؛ تحسين الكلام من Shin ، JW ثنائي الميكروفون استنادًا إلى TF-GSC مع قمع التسرب واستعادة الإشارة. تطبيق علوم. 2021، 11، 2816. [CrossRef] 14. Lee، S.-J .؛ كوون ، H.-Y. إستراتيجية معالجة مسبقة لتقليل الضوضاء من بيانات الكلام بناءً على اكتشاف مقطع الكلام. تطبيق علوم. 2020، 10، 7385. [CrossRef] 15. Rusnac، A.-L .؛ Grigore ، O. CNN بنيات وطرق استخراج الميزات للتعرف على الكلام التخيلي لـ EEG. أجهزة الاستشعار 2022 ، 22 ، 4679. [CrossRef] [PubMed] 16. Wafa، R .؛ خان ، MQ ؛ مالك ف. عبد السلاموف ، أ. تشو ، يي ؛ Odarchenko، R. تأثير منهجية Agile على نجاح المشروع ، مع دور معتدل لملاءمة الوظيفة للشخص في صناعة تكنولوجيا المعلومات في باكستان. تطبيق علوم. 2022، 12، 10698. [CrossRef] 17. Aggarwal، A .؛ سريفاستافا ، أ. أغاروال ، أ. شاهال ، ن. سينغ ، د. النعيم ، أ. الهدلق ، أ. لي ، هـ. استخراج ميزة ثنائية الاتجاه للتعرف على عاطفة الكلام باستخدام التعلم العميق. أجهزة الاستشعار 2022 ، 22 ، 2378. [CrossRef] [PubMed] 18. Marini، M .؛ فانيلو ، ن. Fanucci، L. تحسين معلمات استخراج الميزات المعتمدة على السماعة لتحسين أداء التعرف التلقائي على الكلام للأشخاص الذين يعانون من عسر التلفظ. أجهزة الاستشعار 2021، 21، 6460. [CrossRef] 19. Tiwari، S .؛ جاين ، أ. شارما ، أ. المصطفى ، KM نظام دعم القرار التشخيصي القلبي متعدد الفئات القائم على إشارة مخطط صوتي للقلب. IEEE Access 2021، 9، 110710–110722. [CrossRef] 20. محتاج ، س. شميت ، ف. Möller ، S. نموذج قائم على الاستخراج لتحديد الكلام الذي يحض على الكراهية. arXiv 2022 ، arXiv: 2201.04227. 21- كولدوشباي ، أ. عبد السلاموف ، أ. موخيدينوف ، م. باراتوف ، ن. مخمودوف ، ف. Cho ، YI تحسين لطريقة التصنيف التلقائي لصور الموجات فوق الصوتية المستخدمة في CNN. كثافة العمليات J.Wavelets Multiresolution Inf. عملية. 2022، 20، 2150054. 22. Passricha، V .؛ Aggarwal ، RK هجين من CNN العميق و LSTM ثنائي الاتجاه للتعرف التلقائي على الكلام. J. انتل. النظام. 2020 ، 29 ، 1261-1274. 23. Mukhamadiyev، A .؛ خوجياروف ، أنا ؛ دجوريف ، أو. تشو ، ج. طريقة التعرف التلقائي على الكلام بناءً على مناهج التعلم العميق للغة الأوزبكية. أجهزة الاستشعار 2022 ، 22 ، 3683. [CrossRef] [PubMed] 24. Li، F .؛ ليو ، م. تشاو ، واي. كونغ ، إل. دونغ ، إل. ليو ، العاشر ؛ Hui، M. ميزة استخراج وتصنيف صوت القلب باستخدام الشبكات العصبية التلافيفية 1D. EURASIP J. Adv. عملية الإشارة. 2019، 2019، 59. [CrossRef] 25. Chang، L.-C .؛ هونغ ، J.-W. دراسة أولية لاستخراج ميزة الكلام القوي بناءً على تعظيم احتمالية الدول في النماذج الصوتية العميقة. تطبيق النظام. إنوف. 2022 ، 5 ، 71. [CrossRef] 26. راميريز ، ياء ؛ Górriz ، JM ؛ Segura ، اكتشاف نشاط صوت JC. أساسيات ومتانة نظام التعرف على الكلام. في التعرف على الكلام والفهم القوي ؛ Grimm، M.، Kroschel، K.، Eds.؛ I-TECH التعليم والنشر: لندن ، المملكة المتحدة ، 2007 ؛ ص 1 - 22. 27. أوه ، S. DNN القوية لاستخراج ميزة الكلام وطريقة إزالة ضوضاء الإشارة باستخدام مرشح LMS للتنبؤ المحسن للتعرف على الكلام. J. كونفيرج. المشاة. تكنول. 2021 ، 11 ، 1-6. [CrossRef] 28. عباسشيان ، BJ. سييرا سوسا ، د. المغربي ، أ. تقنيات التعلم العميق للتعرف على عاطفة الكلام ، من قواعد البيانات إلى النماذج. أجهزة الاستشعار 2021 ، 21 ، 1249. [CrossRef] 29. Rakhimov، M .؛ مامادجانوف ، د. موخيدينوف ، أ.نهج مواز عالي الأداء لمعالجة الصور في الحوسبة الموزعة. في وقائع المؤتمر الدولي الرابع عشر IEEE لعام 2020 حول تطبيق تكنولوجيا المعلومات والاتصالات (AICT) ، أوزبكستان ، طشقند ، 7-9 أكتوبر 2020 ؛ ص 1 - 5. 30. عبد السلاموف ، أ. موخيدينوف ، م. دجوريف ، أو. خامداموف ، يو. Whangbo ، TK الاستخراج التلقائي للكائنات البارزة استنادًا إلى عتبات التكيف محليًا لإنشاء رسومات باللمس. تطبيق علوم. 2020، 10، 3350. [CrossRef] 31. Abdusalomov، A .؛ Whangbo، TK تحسين لطريقة التعرف على المقدمة باستخدام تقنية إزالة الظل للبيئات الداخلية. كثافة العمليات J.Wavelets Multiresolution Inf. عملية. 2017، 15، 1750039. [CrossRef] 32. Abdusalomov، A .؛ كشف Whangbo و TK عن ظلال الكائنات المتحركة وإزالتها باستخدام معلومات الهندسة واللون لتدفقات الفيديو الداخلية. تطبيق علوم. 2019 ، 9 ، 5165. [CrossRef] 33. ميري ، د. رؤية الكمبيوتر لاختبار الأشعة السينية ؛ دار نشر Springer الدولية: Cham ، سويسرا ، 2015 ؛ ص. 271 ، رقم ISBN 978-3319207469. 34. مارك ، س. صور الكلام تعيد معايرة حدود إدراك الكلام. في كثير من الأحيان. إدراك. سيكوفيس. 2016 ، 78 ، 1496-1511. 35. Mudgal، E .؛ Mukuntharaj ، S. ؛ موداك ، مو ؛ Rao، YS Template التعرف على الكلام في الوقت الفعلي باستخدام المرشحات الرقمية على DSP-TMS320F28335. في وقائع المؤتمر الدولي الرابع لعام 2018 حول التحكم في اتصالات الحوسبة والأتمتة (ICCUBEA) ، بيون ، الهند ، 16-18 أغسطس 2018 ؛ ص 1 - 6. [CrossRef]






