YOLOv3 एल्गोरिथम भाग 2 पर आधारित ट्रैफ़िक साइन पहचान
Jan 19, 2024
2. एल्गोरिथम की बुनियादी बातें
2.1. YOLOv3 एल्गोरिथम
YOLOv3 [14] YOLOv2 पर आधारित Redmon का बेहतर, एकल-चरण लक्ष्य पहचान एल्गोरिदम है, जिसने पहचान सटीकता और वास्तविक समय के प्रदर्शन में सुधार किया है और गति और सटीकता के मामले में अन्य एल्गोरिदम से बेहतर प्रदर्शन करता है।
हाल के वर्षों में, कृत्रिम बुद्धिमत्ता प्रौद्योगिकी के तेजी से विकास ने विभिन्न बुद्धिमान पहचान प्रणालियों को विभिन्न क्षेत्रों में लागू करने में सक्षम बनाया है। किसी बुद्धिमान प्रणाली की गुणवत्ता का मूल्यांकन करने के लिए पहचान सटीकता एक महत्वपूर्ण संकेतक है, और मेमोरी मुख्य क्षमताओं में से एक है जो एक बुद्धिमान प्रणाली के संचालन का समर्थन करती है। तो, दोनों के बीच क्या संबंध है?
सबसे पहले, हमें यह स्पष्ट करने की आवश्यकता है कि पता लगाने की सटीकता और स्मृति कोई साधारण "सकारात्मक सहसंबंध" या "नकारात्मक सहसंबंध" नहीं हैं। उनके बीच उच्च स्तर की बातचीत और समन्वय है। कई मामलों में, एक बुद्धिमान प्रणाली की पहचान सटीकता उसकी मेमोरी पर निर्भर करती है, यानी नमूना डेटा को समझने और सीखने की क्षमता पर।
उदाहरण के लिए, चेहरे की पहचान के क्षेत्र में, एक अच्छे चेहरे की पहचान प्रणाली को विभिन्न चेहरों की सटीक पहचान करने और ज्ञात चेहरा डेटाबेस में व्यक्ति की जानकारी के साथ उनका मिलान करने में सक्षम होना चाहिए। इसके लिए बुद्धिमान प्रणाली की मजबूत मेमोरी, डेटाबेस में ज्ञात चेहरों की जानकारी संग्रहीत करने में सक्षम होना और बाद के पहचान कार्यों में लचीले ढंग से इसका उपयोग करना आवश्यक है।
इसी तरह, चिकित्सा क्षेत्र में, रोग निदान और उपचार योजना डिजाइन में डॉक्टरों की सहायता के लिए बुद्धिमान प्रणालियों को बड़ी मात्रा में चिकित्सा ज्ञान को समझने और याद रखने की आवश्यकता होती है। इसके लिए बुद्धिमान प्रणाली में मजबूत स्मृति और सीखने की क्षमता, लगातार नए चिकित्सा ज्ञान को अवशोषित करने और मौजूदा ज्ञान आधार के साथ क्रॉस-सत्यापन और उन्नयन की भी आवश्यकता होती है।
बेशक, पता लगाने की सटीकता और मेमोरी के बीच संबंध एकतरफा नहीं है। इसके विपरीत, अच्छी पहचान सटीकता बुद्धिमान प्रणालियों की स्मृति में सुधार को भी बढ़ावा दे सकती है। उदाहरण के लिए, कुछ वर्गीकरण और मान्यता कार्यों में, बुद्धिमान प्रणालियों को अपनी सटीकता और परिशुद्धता में लगातार सुधार करने के लिए लगातार फीडबैक और अनुकूलन प्रदान करने की आवश्यकता होती है, जिससे नमूना डेटा को समझने और याद रखने की क्षमता और मजबूत होती है।
सामान्य तौर पर, बुद्धिमान प्रणालियों के संचालन के लिए पता लगाने की सटीकता और मेमोरी दो अपरिहार्य तत्व हैं। उनके बीच जटिल अंतःक्रियाएं और रिश्ते हैं जिन पर पूरी तरह से विचार करने और समन्वय करने की आवश्यकता है। केवल पहचान सटीकता में लगातार सुधार करने और बुद्धिमान प्रणाली की स्मृति और सीखने की क्षमताओं को लगातार मजबूत करने से ही बुद्धिमान प्रणाली के व्यापक विकास और अनुप्रयोग को वास्तव में साकार किया जा सकता है। यह देखा जा सकता है कि हमें याददाश्त में सुधार करने की आवश्यकता है, और सिस्टैंच डेजर्टिकोला याददाश्त में काफी सुधार कर सकता है, क्योंकि सिस्टैंच डेजर्टिकोला न्यूरोट्रांसमीटर के संतुलन को भी नियंत्रित कर सकता है, जैसे एसिटाइलकोलाइन और विकास कारकों के स्तर को बढ़ाना। ये पदार्थ याददाश्त और सीखने के लिए बहुत महत्वपूर्ण हैं। इसके अलावा, मांस रक्त प्रवाह में भी सुधार कर सकता है और ऑक्सीजन वितरण को बढ़ावा दे सकता है, जो यह सुनिश्चित कर सकता है कि मस्तिष्क को पर्याप्त पोषक तत्व और ऊर्जा प्राप्त हो, जिससे मस्तिष्क की जीवन शक्ति और सहनशक्ति में सुधार हो।

याददाश्त बढ़ाने के लिए सप्लीमेंट्स जानें पर क्लिक करें
YOLOv3 वर्तमान में YOLO परिवार में सबसे लोकप्रिय एल्गोरिदम है और वास्तविक पहचान परिदृश्यों में व्यापक रूप से उपयोग किया जाता है [15]; YOLOv3 नेटवर्क संरचना चित्र 1 में दिखाई गई है।

YOLOv3 द्वारा उपयोग की जाने वाली संपूर्ण संकेंद्रित संरचना छवि इनपुट के आकार से बाधित नहीं है।
पूलिंग और पूरी तरह से जुड़ी परतों को संपूर्ण नेटवर्क संरचना से हटा दिया जाता है, और डाउनसैंपलिंग ऑपरेशन के लिए पूलिंग परत के बजाय 2 के चरण आकार के साथ एक दृढ़ परत का उपयोग किया जाता है, जो पूलिंग के दौरान लक्ष्य जानकारी के नुकसान को रोकता है और छोटे लक्ष्यों का पता लगाने की सुविधा प्रदान करता है [ 16].
इसके अलावा, YOLOv3, YOLOv2 की डार्कनेट-19 नेटवर्क संरचना को डार्कनेट{{3}फीचर एक्सट्रैक्शन लेयर से बदल देता है।
डार्कनेट नेटवर्क, जो सुविधाओं को बेहतर ढंग से निकालने और पहचान और वर्गीकरण में सुधार करने के लिए मल्टी-लेयर कनवल्शनल ऑपरेशन के दौरान डीप नेटवर्क की ग्रेडिएंट समस्या और मूल जानकारी के नुकसान को सफलतापूर्वक हल करता है [17], रेसनेट की अवशिष्ट नेटवर्क संरचना को उधार लेता है। 18] और नेटवर्क की बाद वाली परत में इनपुट के हिस्से के रूप में पिछली परत के मूल आउटपुट का उपयोग करता है।
जैसा कि चित्र 2 में दिखाया गया है, YOLOv3 में अवशिष्ट मॉड्यूल में दो संकेंद्रित परतें और एक शॉर्टकट परत होती है।

इसके अलावा, YOLOv3 एक फ़ीचर पिरामिड नेटवर्क (FPN) (19] की धारणा का उपयोग करता है और 13 x 13, 26 x 26, और 52 x 52 के डिटेक्शन स्केल के साथ तीन पैमानों पर फ़ीचर मानचित्रों का पूर्वानुमान लगाने के लिए फ़ीचर पिरामिड नेटवर्क पेश करता है।
कन्वेन्शनल न्यूरल नेटवर्क द्वारा फ़ीचर निष्कर्षण की विधि FPN नेटवर्क में नीचे से ऊपर है, और कन्वेन्शनल लेयर फ़ीचर मैप्स को अपसैंपलिंग करने की प्रक्रिया ऊपर से नीचे है, जैसा कि चित्र 3 में दिखाया गया है।
2.2. स्थानिक पिरामिड पूलिंग संरचना
स्थानिक पिरामिड पूलिंग (एसपीपी) संरचना (20] संकेंद्रित तंत्रिका नेटवर्क द्वारा छवि सुविधाओं के बार-बार निष्कर्षण की समस्या को हल करती है और पता लगाने की दक्षता में काफी सुधार करती है; एसपीपीनेट नेटवर्क संरचना चित्र 4 में दिखाई गई है।

यह सुनिश्चित करने के लिए कि इनपुट छवि का रिज़ॉल्यूशन एक तंत्रिका नेटवर्क में पूरी तरह से कनेक्टेड परत के फीचर आयाम से मेल खाता है, इनपुट छवि पर क्षेत्र क्रॉपिंग और स्केलिंग ऑपरेशन की आवश्यकता होती है।
स्केलिंग और क्रॉपिंग प्रक्रियाओं के परिणामस्वरूप चित्र सुविधा जानकारी का नुकसान होगा, पता लगाने की सटीकता कम हो जाएगी और पता लगाने के परिणाम प्रभावित होंगे: हालाँकि, स्केलिंग और क्रॉपिंग प्रक्रियाओं के परिणामस्वरूप चित्र सुविधा जानकारी का पता लगाने की सटीकता का नुकसान होगा और पता लगाने के परिणाम प्रभावित होंगे, जबकि SPPNet सीमाओं को पार कर सकता है इनपुट छवि का निश्चित आकार, कम्प्यूटेशनल लागत की बचत 21।

3. बेहतर YOLOv3
3.1. बेहतर YOLOv3 नेटवर्क संरचना
COCO डेटासेट विवरण के अनुसार, बुनियादी सुविधा निष्कर्षण नेटवर्क को आम तौर पर पांच बार डाउनसैंपलिंग किया जाता है, जिसमें डाउनसैंपलिंग दर 2 है, और पांच बार डाउनसैंपलिंग की बहुलता 32 से दो की पांचवीं शक्ति है।
यदि डाउनसैंपलिंग जारी रखी जाती है, तो प्राप्त फीचर मैप एक होगा, और लक्ष्य जानकारी खो जाएगी। छोटे लक्ष्य 32 × 32 पिक्सेल से कम होते हैं, मध्यम लक्ष्य 32 × 32-96 × 96 पिक्सेल होते हैं, और विशाल लक्ष्य 96 × 96 पिक्सेल से बड़े होते हैं [22]।
जैसा कि चित्र 5 में दर्शाया गया है, इस कार्य में प्रयुक्त टीटी100के ट्रैफिक साइन डेटासेट ज्यादातर छोटे और मध्यम लक्ष्यों से बना था, जिसमें बड़े लक्ष्य कुल डेटासेट का केवल 7.4% और छोटे लक्ष्य 42.5% [23] के लिए जिम्मेदार थे।

TT100K डेटासेट में उच्च रिज़ॉल्यूशन है, प्रत्येक छवि का रिज़ॉल्यूशन 2048 × 2048 पिक्सेल है और छोटे लक्ष्यों के बीच सबसे बड़ा ट्रैफ़िक संकेत पूरी छवि के 0.1% से कम है, जो लक्ष्य के लिए एक महत्वपूर्ण चुनौती पेश करता है। पता लगाने का एल्गोरिदम।
छोटे लक्ष्यों में सीमित विशेषताएं होती हैं और बड़ी स्थानीयकरण सटीकता की आवश्यकता होती है।
अलग-अलग फीचर परतों के निष्कर्षों को जोड़कर भविष्यवाणियां उत्पन्न करने के लिए मल्टी-स्केल फीचरफ्यूजन का लाभ उठाने के लिए YOLOv3 में FPN संरचना की शुरुआत के बावजूद, जो छोटे लक्ष्य की पहचान के लिए महत्वपूर्ण है, परिणाम अभी भी असंतोषजनक थे।
YOLOv3 नेटवर्क में, उथली परत में फीचर अर्थ संबंधी जानकारी कम होती है लेकिन एक सटीक लक्ष्य स्थान होता है, जबकि गहरी परत में मोटे लक्ष्य स्थान के अलावा अधिक होता है।
परिणामस्वरूप, छोटे लक्ष्यों की भविष्यवाणी करने के लिए उथली संकेंद्रित परतों का उपयोग किया जाता है और बड़े लक्ष्यों की भविष्यवाणी करने के लिए गहरी संकेंद्रित परतों का उपयोग किया जाता है। छोटे लक्ष्यों का अनुमान लगाने के लिए नेटवर्क में उथली सुविधाओं का पूरी तरह से उपयोग करने के लिए YOLOv3 नेटवर्क संरचना के तीन फीचर भविष्यवाणी स्केल में 152 × 152 आकार का एक चौथा फीचर पूर्वानुमान स्केल जोड़ा गया था।
608 × 608 के इनपुट छवि आकार के साथ, कनवल्शन और इनपुट छवि के दो गुना अपसैंपलिंग के बाद आउटपुट छवि सुविधा का आकार 152 × 152 था, और फीचरलेयर को रूटिंग परत के माध्यम से प्रेरित किया गया था; चौथे फीचर पूर्वानुमान पैमाने को बढ़ाने के लिए इस फीचर निष्कर्षण को 11वीं परत फीचर के साथ जोड़ा गया था।
इसके अलावा, एसपीपीनेट की धारणा को उधार लेकर और इसे YOLOv3 के साथ जोड़कर स्थानीय और वैश्विक सुविधाओं के विलय का एहसास करने के लिए एसपीपी मॉड्यूल जोड़ा गया था।
YOLOdetection लेयर से पहले, SPP मॉड्यूल को पांचवीं और छठी कनवल्शनल लेयर्स के बीच एकीकृत किया गया था, और SPP मॉड्यूल के फीचर मैप्स और पूल किए गए फीचर मैप्स को फिर से कनेक्ट किया गया और अगली डिटेक्शन नेटवर्क लेयर में पास किया गया।

स्थानीय और वैश्विक सुविधाओं के फीचरमैप स्तर के संलयन को पूरा करने के लिए, एसपीपी मॉड्यूल की अधिकतम पूलिंग कर्नेल पूल किए जाने वाले फीचर मैप के आकार के जितना संभव हो उतना करीब होना चाहिए।
एसपीपी मॉड्यूल के कारण होने वाले कम्प्यूटेशनल प्रयास को कम करने, फीचर मैप अभिव्यक्ति क्षमता को समृद्ध करने और पता लगाने के प्रभाव को बढ़ाने के लिए, इस शोध में एसपीपी मॉड्यूल दो समानांतर शाखाओं से बना था, जिनमें से प्रत्येक 19 × 19 अधिकतम पूलिंग परत और एक जंप से बना था। कनेक्शन. चित्र 6 बेहतर YOLOv3 नेटवर्क संरचना को दर्शाता है।

3.2. बेहतर हानि फ़ंक्शन
YOLOv3 का हानि फ़ंक्शन केंद्र समन्वय हानि (हानिकारक), चौड़ाई-ऊंचाई समन्वय हानि (हानि), आत्मविश्वास हानि (हानिकॉन्फ़), और वर्गीकरण हानि (हानि) से बना है। केंद्रीय समन्वय हानि का प्रतिनिधित्व निम्न द्वारा किया जाता है:

जहां λcoord निर्देशांक हानि भार को दर्शाता है; λnoobj किसी वस्तु के बिना आत्मविश्वास हानि वजन को दर्शाता है; Iobjij दर्शाता है कि क्या ith सेल का jth एंकर बॉक्स ऑब्जेक्ट (1 या 0) के लिए जिम्मेदार है; Inobbyij ith ग्रिड के jth एंकर बॉक्स को दर्शाता है जो ऑब्जेक्ट के लिए ज़िम्मेदार नहीं है; (xi,yi,wji,hjI, CjI, Pji) अनुमानित लक्ष्य बॉक्स निर्देशांक, आत्मविश्वास और श्रेणी को दर्शाता है; और (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) वास्तविक लक्ष्य बॉक्स निर्देशांक, आत्मविश्वास और श्रेणी को दर्शाता है
YOLOv3 हानि फ़ंक्शन को समीकरण (5) द्वारा दर्शाया गया है, जहां माध्य वर्ग त्रुटि (MSE) हानि फ़ंक्शन का उपयोग बाउंडिंग बॉक्स रिग्रेशन के लिए किया जाता है और क्रॉस-एन्ट्रॉपी का उपयोग लॉस कॉन्फ़ और स्थानीय में हानि फ़ंक्शन के रूप में किया जाता है।
हानि=हानिxy + हानिwh − हानिcon f − हानिcls (5)
हालाँकि, एमएसई को बाउंडिंग बॉक्स रिग्रेशन के हानि फ़ंक्शन के रूप में उपयोग करना छोटे लक्ष्य का पता लगाने के लिए प्रतिकूल है, ऑब्जेक्ट स्केल के प्रति संवेदनशील है, और छोटे पैमाने की वस्तुओं के प्रति अमित्र होते हुए भी बड़े पैमाने के लक्ष्यों पर ध्यान केंद्रित करता है।
बड़े और छोटे लक्ष्यों के नुकसान को संतुलित करने और चौड़ाई और ऊंचाई हानि फ़ंक्शन पर बाउंडिंग बॉक्स आकार के प्रभाव को कमजोर करके पता लगाने के परिणामों को अधिकतम करने के लिए, इस पेपर में IoU-प्रकार हानि फ़ंक्शन को नियोजित किया गया था, और IoU द्वारा उत्पन्न मीट्रिक हानि का उपयोग किया गया था एक प्रदर्शन समीकरण (6)।
IoU =|ए ∩ बी||ए ∪ बी|(6)
जब बाउंडिंग बॉक्स और लक्ष्य बॉक्स ओवरलैप नहीं होते हैं, तो IoU=0 दो बॉक्स के बीच की दूरी के अंतर को प्रतिबिंबित नहीं करता है; जब पूर्वानुमान बॉक्स और लेबल वाला बॉक्स पूरी तरह से ओवरलैप हो जाता है, IoU=1, तो बाउंडिंग बॉक्स का केंद्र बिंदु निर्धारित नहीं किया जा सकता है, और लक्ष्य बॉक्स के साथ आकार के अंतर को और अधिक अनुकूलित नहीं किया जा सकता है।
DIoU हानि [24] आकार से स्वतंत्र है; इस प्रकार, बड़े आकार के परिणामस्वरूप बड़ा नुकसान नहीं होगा। क्योंकि छोटा आकार थोड़ा नुकसान पैदा करता है, जो समस्या का समाधान कर सकता है, इस कार्य में DIoU नुकसान का उपयोग किया गया, जिसका गणना सूत्र समीकरण (7) में प्रस्तुत किया गया है।
D IoU हानि=1 − IoU +ρ2 b, bgt c2(7)
जहां b और bgt केंद्रीय बिंदुओं को दर्शाते हैं, ρ यूक्लिडियन दूरी है, और c दो बक्से को कवर करने वाले सबसे छोटे संलग्न बॉक्स की विकर्ण लंबाई है।
DIoU हानि सीधे दो लक्ष्य फ़्रेमों के बीच की दूरी को कम करती है, तेज़ी से परिवर्तित होती है, और लक्ष्य फ़्रेम प्रतिगमन तंत्र के अनुरूप होती है, जो लक्ष्य और एंकर, ओवरलैप दर और स्केल के बीच की दूरी को ध्यान में रखती है, जिससे लक्ष्य फ़्रेम प्रतिगमन अधिक हो जाता है स्थिर, जबकि बाउंडिंग बॉक्स के लिए ग्रेडिएंट दिशा तब भी प्रदान करता है जब यह लक्ष्य फ्रेम के साथ ओवरलैप नहीं होता है।

For more information:1950477648nn@gmail.com






