मशीन लर्निंग एल्गोरिदम का उपयोग करके भाषण संकेतों से बेहतर फ़ीचर पैरामीटर निष्कर्षण(1)

May 30, 2023

अमूर्त: वाक् पहचान, वाक् संकेत प्राप्त करने, वाक् संकेत में वक्ता की विशेषताओं की पहचान करने और उसके बाद वक्ता को पहचानने की सॉफ्टवेयर या हार्डवेयर की क्षमता को संदर्भित करती है। सामान्य तौर पर, वाक् पहचान प्रक्रिया में तीन मुख्य चरण शामिल होते हैं: ध्वनिक प्रसंस्करण, फीचर निष्कर्षण, और वर्गीकरण/पहचान। फीचर निष्कर्षण का उद्देश्य सिग्नल घटकों की पूर्व निर्धारित संख्या का उपयोग करके भाषण सिग्नल को चित्रित करना है। ऐसा इसलिए है क्योंकि ध्वनिक सिग्नल में सभी जानकारी को संभालना अत्यधिक बोझिल है, और कुछ जानकारी पहचान कार्य में अप्रासंगिक है। यह अध्ययन एक मशीन लर्निंग-आधारित दृष्टिकोण का प्रस्ताव करता है जो वास्तविक समय के स्मार्ट सिटी वातावरण में भाषण पहचान अनुप्रयोगों के प्रदर्शन को बेहतर बनाने के लिए भाषण संकेतों से फीचर पैरामीटर निष्कर्षण करता है। इसके अलावा, कंप्यूटिंग समय को कम करने के लिए मुख्य मेमोरी के एक ब्लॉक को कैश में मैप करने के सिद्धांत का कुशलतापूर्वक उपयोग किया जाता है। कैश मेमोरी का ब्लॉक आकार एक पैरामीटर है जो कैश प्रदर्शन को दृढ़ता से प्रभावित करता है। विशेष रूप से, वास्तविक समय प्रणालियों में ऐसी प्रक्रियाओं के कार्यान्वयन के लिए उच्च गणना गति की आवश्यकता होती है। रीयल-टाइम सिस्टम में वाक् पहचान में प्रसंस्करण गति एक महत्वपूर्ण भूमिका निभाती है। इसके लिए आधुनिक तकनीकों और तेज़ एल्गोरिदम के उपयोग की आवश्यकता होती है जो वाक् संकेतों से फ़ीचर पैरामीटर निकालने में त्वरण को बढ़ाते हैं। वाक् संकेतों के डिजिटल प्रसंस्करण के दौरान ओवरक्लॉकिंग की समस्याओं का अभी तक पूरी तरह से समाधान नहीं हुआ है। प्रायोगिक परिणाम दर्शाते हैं कि प्रस्तावित विधि सिग्नल सुविधाओं को सफलतापूर्वक निकालती है और अन्य पारंपरिक वाक् पहचान एल्गोरिदम की तुलना में निर्बाध वर्गीकरण प्रदर्शन प्राप्त करती है।

Cistanche deserticola slice (11)

सिस्टैंच डेजर्टिकोला

कीवर्ड: वाक् पहचान; समानांतर कंप्यूटिंग; वितरित अभिकलन; मल्टीकोर प्रोसेसर; सुविधा निकालना; वर्णक्रमीय विश्लेषण

1 परिचय

आधुनिक कृत्रिम बुद्धिमत्ता में मनुष्यों और कंप्यूटर प्रौद्योगिकी के बीच संचार दृष्टिकोण की स्थापना एक महत्वपूर्ण कार्य है। उपयोगकर्ताओं के लिए जानकारी दर्ज करने का सबसे आसान तरीका भाषण संकेतों के माध्यम से है। इसलिए, स्पीच सिग्नल प्रोसेसिंग तकनीक और उसके उपकरण सूचना समाज का एक आवश्यक हिस्सा बन गए हैं। वाक् पहचान वाक् संकेत प्रसंस्करण और एक महत्वपूर्ण मानव-कंप्यूटर संपर्क तकनीक का एक आवश्यक शोध पहलू है। भाषण संकेतों में अर्थ संबंधी, व्यक्तिगत और पर्यावरणीय जानकारी शामिल होती है [1]। स्पीच सिग्नल प्रोसेसिंग के लिए सामान्य दृष्टिकोण अल्पकालिक विश्लेषण का उपयोग करना है, जिसमें सिग्नल को एक निश्चित आकार की समय खिड़कियों में विभाजित किया जाता है, यह मानते हुए कि सिग्नल पैरामीटर नहीं बदलते हैं। अधिक सटीक सिग्नल प्रतिनिधित्व प्राप्त करने के लिए खिड़कियों के बीच एक ओवरलैप लगाया जाता है। वर्णक्रमीय विश्लेषण और रैखिक भविष्यवाणी जैसे फ़ीचर निष्कर्षण एल्गोरिदम प्रत्येक विंडो पर लागू होते हैं। हालाँकि, इन प्रक्रियाओं को गति और समय पर भी विचार करना चाहिए।

Desert living cistanche

रेगिस्तानी जिनसेंग

वास्तविक समय सिग्नल प्रोसेसिंग के कई क्षेत्रों में समय एक महत्वपूर्ण चिंता का विषय है। प्रोसेसर संसाधनों का कुशलतापूर्वक उपयोग करके और डिजिटल प्रोसेसिंग समय को कम करने के लिए नए और तेज़ एल्गोरिदम विकसित करके प्रोसेसिंग गति अनुपात को बढ़ाया जा सकता है। हालाँकि, उच्च-प्रदर्शन कंप्यूटिंग समस्याओं का अभी तक पूरी तरह से समाधान नहीं हुआ है [2]। इसके अलावा, डिजिटल सिग्नल प्रोसेसिंग हार्डवेयर और सॉफ्टवेयर के विकास के साथ स्वचालित वाक् पहचान में पर्याप्त प्रगति हुई है। हालाँकि, इन प्रगतियों के बावजूद, मशीनें सटीकता और गति पहचान के मामले में अपने मानव समकक्षों के प्रदर्शन से मेल नहीं खा सकती हैं, खासकर स्पीकर-स्वतंत्र भाषण मान्यता में। इस प्रकार, वाक् पहचान पर किए गए शोध की एक बड़ी मात्रा में वाक् पहचान समस्याओं पर ध्यान केंद्रित किया गया है जो कि उपलब्ध वाक् पहचान तकनीकों के अनुप्रयोगों और सीमाओं की विस्तृत श्रृंखला के कारण वक्ता से स्वतंत्र हैं [3]।

संक्षेप में, अध्ययन के मुख्य योगदान इस प्रकार हैं:

cistanche tea

सिस्टैंच चाय

सिस्टैंच डेजर्टिकोला चाय उत्पाद देखने के लिए यहां क्लिक करें

【अधिक के लिए पूछें】 ईमेल:cindy.xue@wecistanche.com / व्हाट्स ऐप: 0086 18599088692 / वीचैट: 18599088692

भाषण संकेतों द्वारा किसी व्यक्ति की पहचान करने की प्रक्रिया में कई चरण होते हैं। उनमें से, कुछ चरणों के लिए अधिक गणना समय की आवश्यकता होती है। यह एक वर्णक्रमीय विश्लेषण है. मशीन लर्निंग एल्गोरिदम में विशेष रूप से महत्वपूर्ण मापदंडों में से एक प्रशिक्षण समय है। इस कार्य में, हमने पाया कि भाषण संकेतों की पहचान के लिए सुविधाओं को निकालने की प्रक्रिया महत्वपूर्ण है। साथ ही मशीन लर्निंग में भी काफी समय लगता है। यह स्थापित किया गया है कि वर्णक्रमीय विश्लेषण की प्रक्रिया में स्वतंत्र संचालन शामिल है, और समानांतरीकरण संभव है।

प्रयोगों से पता चला है कि एफएफटी और डीसीटी वर्णक्रमीय परिवर्तन वर्णक्रमीय विश्लेषण में अच्छे परिणाम देते हैं। वर्णक्रमीय विश्लेषण प्रक्रिया वाक् संकेत के प्रत्येक खंड के लिए मान्य है। यह हमें इन विशेषताओं को वाक् संकेत से स्पष्ट रूप से अलग करने की अनुमति देता है। ओपनएमपी और टीबीबी टूल की मदद से, एक समानांतर कंप्यूटिंग एल्गोरिदम विकसित किया गया जिससे गणनाओं को गति देना संभव हो गया।

वाक् संकेत को खंडों में विभाजित करते समय खंड का आकार महत्वपूर्ण होता है। प्रयोगों के दौरान, यह पाया गया कि स्पीच सिग्नल के खंड का आकार केंद्रीय प्रोसेसर की कैश मेमोरी पर निर्भर करता है। विशेष रूप से, मल्टीकोर प्रोसेसर में कैश आकार के मिलान खंड का मशीन सीखने में कम्प्यूटेशनल गति पर सकारात्मक प्रभाव पाया गया है।

टीबीबी और ओपनएमपी का उपयोग करके मल्टीकोर प्रोसेसर पर मशीन लर्निंग एल्गोरिदम का उपयोग करके भाषण संकेतों से फीचर पैरामीटर निष्कर्षण के लिए संकेतों के वर्णक्रमीय परिवर्तनों के लिए एक नई समानांतर कार्यान्वयन विधि प्रस्तावित है।

यह भी पाया गया कि मुख्य मेमोरी ब्लॉक को कैश में मैप करने के सिद्धांत और कैश मेमोरी ब्लॉक के आकार का प्रभावी उपयोग प्रसंस्करण गति को बढ़ा सकता है।

Cistanche supplement near me—Improve memory2

मेरे पास सिस्टैंच अनुपूरक-याददाश्त में सुधार

शेष लेख का आयोजन निम्न रूप में किया गया है। धारा 2 विशिष्ट वाक् संकेत गुणों को निकालने के लिए मौजूदा अध्ययनों की समीक्षा करती है। धारा 3 प्रयोगों के साथ सुविधा निष्कर्षण चरणों का वर्णन करती है। धारा 4 भाषण संकेतों से फीचर पैरामीटर निकालने के लिए प्रस्तावित उच्च-प्रदर्शन कम्प्यूटेशनल एल्गोरिदम को विस्तार से प्रस्तुत करता है। हमारे कार्यान्वयन पर आधारित प्रयोगात्मक परिणामों की चर्चा धारा 5 में की गई है। धारा 6 प्रस्तावित पद्धति की सीमाओं पर प्रकाश डालती है। अंत में, धारा 7 निष्कर्षों को सारांशित करके और भविष्य के अनुसंधान दिशाओं को नोट करके अध्ययन का समापन करती है।

2. संबंधित कार्य

वर्तमान में वाक् संकेतों के विभाजन और चयनित अंशों के पैरामीट्रिक संकेतकों की गणना के लिए नए तरीकों, एल्गोरिदम और अधिक आधुनिक अनुप्रयोगों का विकास और सुधार किया जा रहा है, जिससे वर्णक्रमीय विश्लेषण का उपयोग करके वाक् संकेतों का एक स्पेक्ट्रोग्राम बनाया जा सकता है [4-7]। दुनिया भर में विविध वॉयस क्लिप के साथ स्पीकर की पहचान एक महत्वपूर्ण और चुनौतीपूर्ण कार्य है, विशेष रूप से जोरदार और भेदभावपूर्ण सुविधाओं को निकालने में [8]। कोर्कमाज़ एट अल द्वारा एक नवीन मेल फ़्रीक्वेंसी सेप्स्ट्रल गुणांक (एमएफसीसी) सुविधा निष्कर्षण प्रणाली प्रस्तावित की गई थी जो पारंपरिक एमएफसीसी प्राप्ति की तुलना में तेज़ और अधिक ऊर्जा कुशल है। [9]. उच्च-पास पूर्व-ज़ोर फ़िल्टर का उपयोग करने के बजाय, उन्होंने कम-पास फ़िल्टर का उपयोग किया। उन्होंने हाई-पास फ़िल्टर के साथ एक बैंडपास फ़िल्टर लागू किया क्योंकि उच्च आवृत्तियों में सिग्नल की ऊर्जा को बढ़ावा देने के लिए पूर्व-जोर देना आवश्यक है। हमारे पिछले काम [10] में, हमने स्पीकर की पहचान के लिए एक नवीन एमएफसीसी-आधारित विधि प्रस्तुत की थी। पारंपरिक एमएफसीसी का उपयोग करने के बजाय, हम अपने फीचर सेट के रूप में मेल स्पेक्ट्रोग्राम से पिक्सल का उपयोग करते हैं। एक नया डेटासेट बनाने के लिए स्पेक्ट्रोग्राम को 2-डी सरणी में बदल दिया गया था। वक्ता की पहचान करने के लिए, कई शिक्षण एल्गोरिदम को गुना क्रॉस-सत्यापन तकनीक के साथ अभ्यास में लाया गया था। टैन एक्टिवेशन फ़ंक्शन के साथ मल्टी-लेयर परसेप्ट्रॉन (एमएलपी) की मदद से 90.2 प्रतिशत की सर्वोत्तम सटीकता हासिल की गई।

बाद के प्रसंस्करण और विश्लेषण के लिए अपेक्षाकृत कम डेटा दर पर भाषण तरंग को पैरामीट्रिक प्रतिनिधित्व के रूप में बदलकर फ़ीचर निष्कर्षण पूरा किया जाता है [11-14]। फ़ीचर निष्कर्षण दृष्टिकोण आमतौर पर प्रत्येक भाषण संकेत के लिए एक बहुआयामी फ़ीचर वेक्टर उत्पन्न करते हैं। फ़ीचर निष्कर्षण स्पीकर पहचान का सबसे प्रासंगिक हिस्सा है। किसी वक्ता को दूसरों से अलग करने में भाषण की विशेषताएं महत्वपूर्ण भूमिका निभाती हैं। फ़ीचर निष्कर्षण से वाक् संकेत का परिमाण कम हो जाता है, वाक् संकेत की शक्ति को कोई नुकसान नहीं होता है [15-17]। [18] में, लेखकों ने एक नया दृष्टिकोण पेश किया जो स्पीकर-निर्भर स्वचालित वाक् पहचान के प्रदर्शन को बेहतर बनाने के लिए प्रारंभिक कम समय के फूरियर परिवर्तन की गणना करने के लिए उपयोग की जाने वाली वर्णक्रमीय विश्लेषण विंडो के आकार और बदलाव मापदंडों की बारीक ट्यूनिंग का फायदा उठाता है। (एएसआर) प्रणाली। डॉक्टरों की अनुपस्थिति में, आम लोग निर्णय सहायता प्रणालियों को नियोजित कर सकते हैं जो कृत्रिम बुद्धिमत्ता दृष्टिकोण का उपयोग करके बनाई गई थीं। फोनोकार्डियोग्राम (पीसीजी) संकेतों का उपयोग करके प्रारंभिक और गैर-आक्रामक हृदय स्थिति का पता लगाया जा सकता है [19-21]।

कन्वेन्शनल न्यूरल नेटवर्क (सीएनएन) को फीचर स्पेस में संरचनात्मक इलाके को सफलतापूर्वक अनुकरण करने के साथ-साथ ट्रांसलेशनल भिन्नता को कम करने और फीचर स्पेस में गड़बड़ी और छोटे बदलावों को समायोजित करने के लिए एक पक्षपाती आवृत्ति क्षेत्र के भीतर पूलिंग को नियोजित करने के लिए प्रदर्शित किया गया है [22]। मुखमादियेव एट अल. उज़्बेक भाषा और इसकी बोलियों के लिए एक एंड-टू-एंड डीप न्यूरल नेटवर्क-हिडन मार्कोव मॉडल स्पीच रिकग्निशन मॉडल और एक हाइब्रिड कनेक्शनिस्ट टेम्पोरल क्लासिफिकेशन (सीटीसी)-अटेंशन नेटवर्क का प्रस्ताव रखा। प्रस्तावित दृष्टिकोण प्रशिक्षण के समय को कम करता है और ध्यान मॉडल प्रशिक्षण में सीटीसी उद्देश्य फ़ंक्शन का प्रभावी ढंग से उपयोग करके भाषण पहचान सटीकता में सुधार करता है [23]। एक-आयामी कनवल्शनल न्यूरल नेटवर्क (सीएनएन) मॉडल का उपयोग करके फ़ीचर निष्कर्षण और वर्गीकरण, जो हृदय ध्वनि संकेतों को इलेक्ट्रोकार्डियोग्राम (ईसीजी) से सीधे स्वतंत्र सामान्य और असामान्य में विभाजित करता है, [24] में प्रस्तावित किया गया था। उनका दावा है कि इस अध्ययन में उपयोग किए गए हृदय ध्वनि संकेतों के लिए 2डी सीएनएन की तुलना में 1डी सीएनएन में वर्गीकरण सटीकता अधिक है, जब कनवल्शन कर्नेल 52 से कम है क्योंकि एक बड़े कनवल्शन कर्नेल से कम्प्यूटेशनल जटिलता हो सकती है और इसमें तेजी से समय लगता है। . [25] में, TIMIT डेटाबेस (TIMIT एकॉस्टिक-फोनेटिक कंटीन्यूअस स्पीच कॉर्पस) का उपयोग करके भाषण सुविधा अनुक्रमों से संबंधित ध्वनिक मॉडल के राज्य अनुक्रमों की पिछली सटीकता को अधिकतम करने के लिए एक गहरे तंत्रिका नेटवर्क को प्रशिक्षित किया गया था।

3. पूर्व-प्रसंस्करण: सामग्री अवलोकन

cistanche—Improve memory4

मेरे पास सिस्टैंच अनुपूरक-याददाश्त में सुधार

इस उद्देश्य के लिए, भाषण संकेतों और पैरामीट्रिक अभ्यावेदन से फीचर पैरामीटर निकालने के लिए तेजी से एल्गोरिदम का विकास, प्रसंस्करण के लिए सहायक और सूचनात्मक नमूने निकालना और चयनित ध्वनिक खंडों के स्पेक्ट्रोग्राम के कार्यान्वयन के लिए कार्यक्रमों का विकास अपरिहार्य है।

वाक् पहचान प्रणाली में दो मुख्य उपप्रणालियाँ शामिल हैं:

भाषण संकेतों का प्राथमिक प्रसंस्करण (फोनोग्राम);

एक बुद्धिमान एल्गोरिदम (स्पेक्ट्रोग्राम) का उपयोग करके ध्वनिक प्रतीकों का वर्गीकरण।

पहला सबसिस्टम संकेतों और सिग्नल विशेषताओं के सूचनात्मक ध्वनिक गुणों के एक सेट के रूप में ध्वनिक प्रतीकों को उत्पन्न करता है। दूसरा सबसिस्टम प्राप्त ध्वनिक विशेषताओं के आधार पर भाषण संकेत को पैरामीट्रिक रूप में परिवर्तित करता है। वाक् संकेत प्रसंस्करण में निम्नलिखित चरण होते हैं:

भाषण संकेत की सीमाओं का पृथक्करण;

डिजिटल फ़िल्टरिंग;

विभाजन;

स्मूथिंग विंडो का अनुप्रयोग;

वर्णक्रमीय परिवर्तन, और वर्णक्रमीय आवृत्तियों का सामान्यीकरण।

इन चरणों का उपयोग वाक् संकेतों से फीचर पैरामीटर निकालने के लिए बड़े पैमाने पर किया जाता है, और उनकी मुख्य विशेषताओं पर निम्नलिखित में विचार किया गया है।

3.1. सीमाओं का पृथक्करण

आने वाले सिग्नल से भाषण के केवल कुछ हिस्सों को निकालना या शोर भरे माहौल में किसी वाक्य के शुरुआती और अंतिम क्षणों का निर्धारण करना भाषण प्रसंस्करण में एक आवश्यक कार्य है। इस समस्या को हल करने के लिए स्पीच सिग्नल के निम्नलिखित गुणों का उपयोग किया जाता है: स्पीच सिग्नल की अल्पकालिक ऊर्जा, शून्य पर प्रतिच्छेद करने वाले बिंदुओं की संख्या, सिग्नल के भीतर मौन क्षेत्र के मूल्यों के वितरण का घनत्व, और वर्णक्रमीय एन्ट्रापी. पारंपरिक वाक् पहचान प्रणालियाँ ऐसी तकनीकों का उपयोग करती हैं जो आने वाले वाक् संकेतों से वाक् सीमाओं को निर्धारित करने के लिए सिग्नल की क्षणिक और वर्णक्रमीय ऊर्जा (उदाहरण के लिए, आवाज गतिविधि का पता लगाना) पर आधारित होती हैं [26-28]।

स्पीच सिग्नल के मुख्य पैरामीटर स्पीच सिग्नल की अल्पकालिक ऊर्जा और शून्य से गुजरने वाले बिंदुओं की संख्या हैं। एक नियम के रूप में, भाषण संकेत के पैरामीटर समय के साथ तेजी से बदलते हैं; इसलिए, भाषण संकेत को 10 से 30 एमएस लंबाई के टुकड़ों में संसाधित करने की प्रथा है जो ओवरलैप नहीं होते हैं। इस सीमा के भीतर वाक् संकेत स्थिर है, और वाक् संकेत में मौन के क्षेत्रों को क्षणिक ऊर्जा की गणना करके हटा दिया जाता है। इस समस्या को हल करने के लिए एल्गोरिदम को अगले भाषण संकेत के 256 अल्पकालिक ऊर्जा मूल्यों के एन अनुक्रमों में विभाजित किया गया है।

भाषण संकेत को विभाजित करके प्रत्येक टुकड़े की ऊर्जा की गणना समानांतर और वितरित कंप्यूटिंग के लिए उपयुक्त है। प्रत्येक टुकड़े को स्वतंत्र रूप से संसाधित किया जाता है। यदि प्रसंस्करण को एन-कोर मल्टीप्रोसेसर में लागू किया जाता है, तो एक साथ एन टुकड़ों की ऊर्जा की गणना करना संभव होगा। इसलिए, इस चरण के दौरान समानांतर प्रसंस्करण दक्षता को बढ़ाना संभव है [29-32]।

3.2. शून्य-क्रॉसिंग की संख्या

शून्य-क्रॉसिंग एक बिंदु है जिस पर गणितीय फ़ंक्शन का चिह्न बदलता है (उदाहरण के लिए, सकारात्मक से नकारात्मक तक), जिसे फ़ंक्शन के ग्राफ़ में अक्ष (शून्य मान) के एक अवरोधन द्वारा दर्शाया जाता है [33]। किसी सिग्नल में शून्य-क्रॉसिंग आवृत्ति उसके वर्णक्रमीय गुणों का सबसे सीधा संकेतक हो सकती है। उदाहरण के लिए, भाषण संकेत में शून्य से गुजरने वाले बिंदुओं की संख्या निम्नलिखित समीकरण का उपयोग करके निर्धारित की जा सकती है:

Figure 1. Method of speech separation based on spectral entropy analysis.


चित्र 1. वर्णक्रमीय एन्ट्रापी विश्लेषण के आधार पर वाक् पृथक्करण की विधि।

3.3. डिजिटल फ़िल्टरिंग

एक विशिष्ट, उपयोगी सिग्नल के अलावा, विभिन्न प्रकार के शोर मौजूद हैं। चूंकि शोर वाक् पहचान प्रणालियों की गुणवत्ता को नकारात्मक रूप से प्रभावित करता है, इसलिए शोर से निपटना एक गंभीर मुद्दा है। सिस्टम में शोर के स्तर को कम करने के लिए दो प्रकार के डिजिटल फिल्टर का उपयोग किया जाता है: एक लाइन फिल्टर और एक प्रारंभिक फिल्टर। एक रैखिक फ़िल्टर को निम्न और उच्च-आवृत्ति फ़िल्टर का संयोजन माना जा सकता है क्योंकि यह सभी निम्न और उच्च आवृत्तियों को कैप्चर करता है। बाद की पहचान के लिए उपयोग किए जाने वाले विशिष्ट चिह्नों पर स्थानीय गड़बड़ी के प्रभाव को कम करने के लिए प्रारंभिक फ़िल्टरिंग लागू की जाती है। वर्णक्रमीय संरेखण के लिए एक भाषण संकेत को कम-पास फ़िल्टर के माध्यम से पारित किया जाना चाहिए [35]।

3.4. विभाजन

विभाजन एक भाषण संकेत को अलग-अलग, गैर-अतिव्यापी टुकड़ों में विभाजित करने की प्रक्रिया है। संकेत को आम तौर पर भाषण इकाइयों जैसे वाक्य, शब्द, शब्दांश, स्वर, या यहां तक ​​कि छोटी ध्वन्यात्मक इकाइयों में विभाजित किया जाता है। रिकॉर्डिंग का विभाजन जिसमें कई वक्ताओं के कथन शामिल हैं, उनमें विशेष वक्ताओं के कथनों के टुकड़े शामिल हो सकते हैं। शब्द "सेगमेंट स्टेशन" का उपयोग कभी-कभी इसके मानकीकरण से पहले स्पीच सिग्नल के फ्रेम में विभाजन को संदर्भित करने के लिए किया जाता है [36,37]।

3.5. वर्णक्रमीय परिवर्तन

वाक् पहचान प्रक्रिया के बाद के चरणों में उपयोग किए जाने वाले वाक् संकेतों की मुख्य विशेषताओं में अंतर करना आवश्यक है। प्रारंभिक विशेषताएं भाषण संकेतों के वर्णक्रमीय गुणों का विश्लेषण करके निर्धारित की जाती हैं। फास्ट फूरियर ट्रांसफॉर्म एल्गोरिदम का उपयोग आमतौर पर भाषण सिग्नल की वर्णक्रमीय आवृत्ति प्राप्त करने के लिए किया जाता है [38,39]।

3.6. वर्णक्रमीय आवृत्तियों का सामान्यीकरण

बुद्धिमान एल्गोरिदम में संपूर्ण कम्प्यूटेशनल प्रक्रिया चलती दशमलव संख्याओं पर आधारित है। इसलिए, तंत्रिका नेटवर्क का उपयोग करके वर्गीकृत की गई वस्तुओं के पैरामीटर [{{0}}.0, 1.0] की सीमा तक सीमित हैं। परिणामी स्पेक्ट्रम को तंत्रिका नेटवर्क का उपयोग करके वर्णक्रमीय प्रसंस्करण लागू करने के लिए 0 और 1 के बीच सामान्यीकृत किया जाता है। इसे प्राप्त करने के लिए, प्रत्येक वेक्टर घटक को उसके अधिकतम घटकों में विभाजित किया गया है।

स्पेक्ट्रल प्रसंस्करण विधियाँ वाक् संकेत से प्राप्त सभी डेटा नमूनों के उपयोग को सक्षम बनाती हैं। कई भाषण संकेतों में एक विशिष्ट आवृत्ति संरचना और वर्णक्रमीय गुण होते हैं। स्पेक्ट्रल विधियाँ वाक् संकेतों का उच्च-सटीक प्रसंस्करण प्रदान करती हैं। वर्णक्रमीय प्रसंस्करण के नुकसान में संकेतों की स्थानीय विशेषताओं में कम लचीलापन, वर्णक्रमीय आयामों की कमी और अपेक्षाकृत उच्च कम्प्यूटेशनल लागत शामिल हैं।

फूरियर ट्रांसफॉर्मेशन, वेवलेट विश्लेषण और कई अन्य एल्गोरिदम का उपयोग भाषण संकेतों के वर्णक्रमीय प्रसंस्करण में बड़े पैमाने पर किया जाता है। फूरियर रूपांतरण का उपयोग वाक् प्रसंस्करण सहित विज्ञान के कई क्षेत्रों में किया जाता है। स्पीच सिग्नल प्रोसेसिंग में, फूरियर ट्रांसफॉर्मेशन सिग्नल को समय क्षेत्र से वर्णक्रमीय क्षेत्र में आवृत्ति घटक के रूप में परिवर्तित करता है [40]।

पिछले अध्ययनों में, वर्णक्रमीय विश्लेषण के लिए असतत फूरियर ट्रांसफॉर्म (डीएफटी), असतत कोसाइन ट्रांसफॉर्म (डीसीटी), अल्पकालिक फूरियर ट्रांसफॉर्म और वेवलेट ट्रांसफॉर्म को लागू किया गया था। इन विधियों का उपयोग भाषण संकेत के टुकड़ों को आवृत्ति डोमेन में बदलने और स्पेक्ट्रम की गणना करने के लिए किया गया था। टीबीबी और ओपनएमपी पैकेज का उपयोग वर्णक्रमीय परिवर्तनों के लिए समानांतर एल्गोरिदम बनाने के लिए किया गया था। इन विधियों में, कमांड सिग्नल को फ़्रेम में विभाजित करता है; उदाहरण के लिए, प्रत्येक फ्रेम के लिए एन=16, 32, …, या 4096 [4]। प्रत्येक निर्मित फ़्रेम का आकार कैश मेमोरी के ब्लॉक आकार के बराबर है क्योंकि कैश मेमोरी एक ऐसा कारक है जो समानांतर प्रसंस्करण की दक्षता को प्रभावित करता है। त्वरण परिणाम चित्र 2 में दर्शाए गए हैं।

Figure 2. Acceleration results for (a) four- and (b) eight-core processors.


चित्र 2. (ए) चार- और (बी) आठ-कोर प्रोसेसर के लिए त्वरण परिणाम।

समानांतर प्रसंस्करण एल्गोरिदम के सॉफ़्टवेयर कार्यान्वयन के लिए, सीरियल और समानांतर प्रसंस्करण चार- और आठ-कोर प्रोसेसर पर किया गया था, जिसे व्यक्तिगत कंप्यूटर और सर्वर का उपयोग करके लागू किया गया था, जैसा कि तालिका 1 में सूचीबद्ध है।

तालिका 1. इंटेल प्रोसेसर की विशेषताएं।

Table 1. Characteristics of Intel processors.

DCT एल्गोरिथम की मुख्य विशेषता आवधिकता है। डीसीटी का एक फायदा यह है कि यह अधिकांश सिग्नल ऊर्जा को कम संख्या में कारकों पर केंद्रित करता है। निम्नलिखित समीकरण गुणांक मैट्रिक्स के तत्व प्रदान करते हैं:

imageimage


जहां L(k) DCT का मान है, k गुणांकों का एक सूचकांक है, x(n) डेटा आइटम का प्रतिनिधित्व करता है, और N फ़्रेम आकार है।

फूरियर विश्लेषण पैरामीटर उन विधियों का आधार हैं जिनका उपयोग वर्णक्रमीय डोमेन के भीतर भाषण संकेतों के डिजिटल प्रसंस्करण में अधिकांश भाषण मान्यता प्रणालियों में फीचर वैक्टर उत्पन्न करने के लिए किया जाता है। मेल-फ़्रीक्वेंसी सेप्स्ट्रल गुणांक (एमएफसीसी) [41] और लीनियर प्रेडिक्टिव कोडिंग (एलपीसी) तकनीक [42,43] का उपयोग भाषण संकेतों से स्पेक्ट्रोग्राम छवियां उत्पन्न करने के लिए फूरियर विश्लेषण में किया जाता है। फूरियर विश्लेषण का उपयोग करके प्राप्त किए गए स्पेक्ट्रा भाषण संकेत के संबंध में संक्षिप्त और सटीक जानकारी प्रदान करते हैं, जैसा कि चित्र 3 में दिखाया गया है।

Figure 3. DFT: (a) change in frequency range within time domain and (b) spectrogram.


चित्र 3. डीएफटी: (ए) समय डोमेन के भीतर आवृत्ति रेंज में परिवर्तन और (बी) स्पेक्ट्रोग्राम।

प्रयोगों में वर्णक्रमीय विश्लेषण के लिए द्वि-आयामी (2डी) संकेतों का उपयोग किया गया था। समानांतर छवि-प्रसंस्करण एल्गोरिदम में उपयोग की जाने वाली 2डी वर्णक्रमीय विश्लेषण विशेषताएँ मल्टीकोर प्रोसेसर में समानांतर प्रसंस्करण के लिए उपयुक्त हैं [38]। विशेष रूप से, फॉरवर्ड और व्युत्क्रम परिवर्तन वैक्टर और मैट्रिक्स में द्विआधारी आयाम होते हैं, और इस मल्टीकोर प्रोसेसर आर्किटेक्चर की अनुकूलता कम्प्यूटेशनल गति को प्रभावी ढंग से बढ़ा सकती है। इसलिए, हमने एल्गोरिदम के हार्डवेयर कार्यान्वयन के लिए विभिन्न प्रोसेसर विशेषताओं वाले कंप्यूटर पर अनुक्रमिक और समानांतर प्रसंस्करण लागू किया, जिसका उपयोग 2 डी सिग्नल (तालिका 2) को संसाधित करने के लिए किया गया था।

तालिका 2. इंटेल प्रोसेसर लगाने की विशेषताएं।

Table 2. Characteristics of applying Intel processors.


संपूर्ण 2डी सिग्नल को प्रत्येक चरण में विभिन्न आकारों के समान टुकड़ों में विभाजित किया गया था [44]। चयनित अंशों के मान 16 × 16 और 1024 × 1024 के पिक्सेल रिज़ॉल्यूशन के बीच थे। अनुक्रमिक एल्गोरिदम की तुलना में ओपनएमपी पैकेज का उपयोग करके समानांतर डीसीटी एल्गोरिदम की गति चित्र 4 में प्रस्तुत की गई है। समानांतर 2डी वर्णक्रमीय विश्लेषण का उपयोग मल्टीकोर प्रोसेसर पर एल्गोरिदम एक ओवरक्लॉकिंग परिणाम देता है जो कोर की संख्या के करीब होता है।

Figure 4. Acceleration results for 2D parallel spectral analysis.

चित्र 4. 2डी समानांतर वर्णक्रमीय विश्लेषण के लिए त्वरण परिणाम।

शायद तुम्हे यह भी अच्छा लगे