YOLOv3 एल्गोरिथम भाग 2 पर आधारित ट्रैफ़िक साइन पहचान

Jan 19, 2024

2. एल्गोरिथम की बुनियादी बातें

2.1. YOLOv3 एल्गोरिथम

YOLOv3 [14] YOLOv2 पर आधारित Redmon का बेहतर, एकल-चरण लक्ष्य पहचान एल्गोरिदम है, जिसने पहचान सटीकता और वास्तविक समय के प्रदर्शन में सुधार किया है और गति और सटीकता के मामले में अन्य एल्गोरिदम से बेहतर प्रदर्शन करता है।

हाल के वर्षों में, कृत्रिम बुद्धिमत्ता प्रौद्योगिकी के तेजी से विकास ने विभिन्न बुद्धिमान पहचान प्रणालियों को विभिन्न क्षेत्रों में लागू करने में सक्षम बनाया है। किसी बुद्धिमान प्रणाली की गुणवत्ता का मूल्यांकन करने के लिए पहचान सटीकता एक महत्वपूर्ण संकेतक है, और मेमोरी मुख्य क्षमताओं में से एक है जो एक बुद्धिमान प्रणाली के संचालन का समर्थन करती है। तो, दोनों के बीच क्या संबंध है?

सबसे पहले, हमें यह स्पष्ट करने की आवश्यकता है कि पता लगाने की सटीकता और स्मृति कोई साधारण "सकारात्मक सहसंबंध" या "नकारात्मक सहसंबंध" नहीं हैं। उनके बीच उच्च स्तर की बातचीत और समन्वय है। कई मामलों में, एक बुद्धिमान प्रणाली की पहचान सटीकता उसकी मेमोरी पर निर्भर करती है, यानी नमूना डेटा को समझने और सीखने की क्षमता पर।

उदाहरण के लिए, चेहरे की पहचान के क्षेत्र में, एक अच्छे चेहरे की पहचान प्रणाली को विभिन्न चेहरों की सटीक पहचान करने और ज्ञात चेहरा डेटाबेस में व्यक्ति की जानकारी के साथ उनका मिलान करने में सक्षम होना चाहिए। इसके लिए बुद्धिमान प्रणाली की मजबूत मेमोरी, डेटाबेस में ज्ञात चेहरों की जानकारी संग्रहीत करने में सक्षम होना और बाद के पहचान कार्यों में लचीले ढंग से इसका उपयोग करना आवश्यक है।

इसी तरह, चिकित्सा क्षेत्र में, रोग निदान और उपचार योजना डिजाइन में डॉक्टरों की सहायता के लिए बुद्धिमान प्रणालियों को बड़ी मात्रा में चिकित्सा ज्ञान को समझने और याद रखने की आवश्यकता होती है। इसके लिए बुद्धिमान प्रणाली में मजबूत स्मृति और सीखने की क्षमता, लगातार नए चिकित्सा ज्ञान को अवशोषित करने और मौजूदा ज्ञान आधार के साथ क्रॉस-सत्यापन और उन्नयन की भी आवश्यकता होती है।

बेशक, पता लगाने की सटीकता और मेमोरी के बीच संबंध एकतरफा नहीं है। इसके विपरीत, अच्छी पहचान सटीकता बुद्धिमान प्रणालियों की स्मृति में सुधार को भी बढ़ावा दे सकती है। उदाहरण के लिए, कुछ वर्गीकरण और मान्यता कार्यों में, बुद्धिमान प्रणालियों को अपनी सटीकता और परिशुद्धता में लगातार सुधार करने के लिए लगातार फीडबैक और अनुकूलन प्रदान करने की आवश्यकता होती है, जिससे नमूना डेटा को समझने और याद रखने की क्षमता और मजबूत होती है।

सामान्य तौर पर, बुद्धिमान प्रणालियों के संचालन के लिए पता लगाने की सटीकता और मेमोरी दो अपरिहार्य तत्व हैं। उनके बीच जटिल अंतःक्रियाएं और रिश्ते हैं जिन पर पूरी तरह से विचार करने और समन्वय करने की आवश्यकता है। केवल पहचान सटीकता में लगातार सुधार करने और बुद्धिमान प्रणाली की स्मृति और सीखने की क्षमताओं को लगातार मजबूत करने से ही बुद्धिमान प्रणाली के व्यापक विकास और अनुप्रयोग को वास्तव में साकार किया जा सकता है। यह देखा जा सकता है कि हमें याददाश्त में सुधार करने की आवश्यकता है, और सिस्टैंच डेजर्टिकोला याददाश्त में काफी सुधार कर सकता है, क्योंकि सिस्टैंच डेजर्टिकोला न्यूरोट्रांसमीटर के संतुलन को भी नियंत्रित कर सकता है, जैसे एसिटाइलकोलाइन और विकास कारकों के स्तर को बढ़ाना। ये पदार्थ याददाश्त और सीखने के लिए बहुत महत्वपूर्ण हैं। इसके अलावा, मांस रक्त प्रवाह में भी सुधार कर सकता है और ऑक्सीजन वितरण को बढ़ावा दे सकता है, जो यह सुनिश्चित कर सकता है कि मस्तिष्क को पर्याप्त पोषक तत्व और ऊर्जा प्राप्त हो, जिससे मस्तिष्क की जीवन शक्ति और सहनशक्ति में सुधार हो।

improving brain function

याददाश्त बढ़ाने के लिए सप्लीमेंट्स जानें पर क्लिक करें

YOLOv3 वर्तमान में YOLO परिवार में सबसे लोकप्रिय एल्गोरिदम है और वास्तविक पहचान परिदृश्यों में व्यापक रूप से उपयोग किया जाता है [15]; YOLOv3 नेटवर्क संरचना चित्र 1 में दिखाई गई है।

increase brain power

YOLOv3 द्वारा उपयोग की जाने वाली संपूर्ण संकेंद्रित संरचना छवि इनपुट के आकार से बाधित नहीं है।

पूलिंग और पूरी तरह से जुड़ी परतों को संपूर्ण नेटवर्क संरचना से हटा दिया जाता है, और डाउनसैंपलिंग ऑपरेशन के लिए पूलिंग परत के बजाय 2 के चरण आकार के साथ एक दृढ़ परत का उपयोग किया जाता है, जो पूलिंग के दौरान लक्ष्य जानकारी के नुकसान को रोकता है और छोटे लक्ष्यों का पता लगाने की सुविधा प्रदान करता है [ 16].

इसके अलावा, YOLOv3, YOLOv2 की डार्कनेट-19 नेटवर्क संरचना को डार्कनेट{{3}फीचर एक्सट्रैक्शन लेयर से बदल देता है।

डार्कनेट नेटवर्क, जो सुविधाओं को बेहतर ढंग से निकालने और पहचान और वर्गीकरण में सुधार करने के लिए मल्टी-लेयर कनवल्शनल ऑपरेशन के दौरान डीप नेटवर्क की ग्रेडिएंट समस्या और मूल जानकारी के नुकसान को सफलतापूर्वक हल करता है [17], रेसनेट की अवशिष्ट नेटवर्क संरचना को उधार लेता है। 18] और नेटवर्क की बाद वाली परत में इनपुट के हिस्से के रूप में पिछली परत के मूल आउटपुट का उपयोग करता है।

जैसा कि चित्र 2 में दिखाया गया है, YOLOv3 में अवशिष्ट मॉड्यूल में दो संकेंद्रित परतें और एक शॉर्टकट परत होती है।

increase memory power

इसके अलावा, YOLOv3 एक फ़ीचर पिरामिड नेटवर्क (FPN) (19] की धारणा का उपयोग करता है और 13 x 13, 26 x 26, और 52 x 52 के डिटेक्शन स्केल के साथ तीन पैमानों पर फ़ीचर मानचित्रों का पूर्वानुमान लगाने के लिए फ़ीचर पिरामिड नेटवर्क पेश करता है।

कन्वेन्शनल न्यूरल नेटवर्क द्वारा फ़ीचर निष्कर्षण की विधि FPN नेटवर्क में नीचे से ऊपर है, और कन्वेन्शनल लेयर फ़ीचर मैप्स को अपसैंपलिंग करने की प्रक्रिया ऊपर से नीचे है, जैसा कि चित्र 3 में दिखाया गया है।

2.2. स्थानिक पिरामिड पूलिंग संरचना

स्थानिक पिरामिड पूलिंग (एसपीपी) संरचना (20] संकेंद्रित तंत्रिका नेटवर्क द्वारा छवि सुविधाओं के बार-बार निष्कर्षण की समस्या को हल करती है और पता लगाने की दक्षता में काफी सुधार करती है; एसपीपीनेट नेटवर्क संरचना चित्र 4 में दिखाई गई है।

improve cognitive function

यह सुनिश्चित करने के लिए कि इनपुट छवि का रिज़ॉल्यूशन एक तंत्रिका नेटवर्क में पूरी तरह से कनेक्टेड परत के फीचर आयाम से मेल खाता है, इनपुट छवि पर क्षेत्र क्रॉपिंग और स्केलिंग ऑपरेशन की आवश्यकता होती है।

स्केलिंग और क्रॉपिंग प्रक्रियाओं के परिणामस्वरूप चित्र सुविधा जानकारी का नुकसान होगा, पता लगाने की सटीकता कम हो जाएगी और पता लगाने के परिणाम प्रभावित होंगे: हालाँकि, स्केलिंग और क्रॉपिंग प्रक्रियाओं के परिणामस्वरूप चित्र सुविधा जानकारी का पता लगाने की सटीकता का नुकसान होगा और पता लगाने के परिणाम प्रभावित होंगे, जबकि SPPNet सीमाओं को पार कर सकता है इनपुट छवि का निश्चित आकार, कम्प्यूटेशनल लागत की बचत 21।

improve short term memory

3. बेहतर YOLOv3

3.1. बेहतर YOLOv3 नेटवर्क संरचना

COCO डेटासेट विवरण के अनुसार, बुनियादी सुविधा निष्कर्षण नेटवर्क को आम तौर पर पांच बार डाउनसैंपलिंग किया जाता है, जिसमें डाउनसैंपलिंग दर 2 है, और पांच बार डाउनसैंपलिंग की बहुलता 32 से दो की पांचवीं शक्ति है।

यदि डाउनसैंपलिंग जारी रखी जाती है, तो प्राप्त फीचर मैप एक होगा, और लक्ष्य जानकारी खो जाएगी। छोटे लक्ष्य 32 × 32 पिक्सेल से कम होते हैं, मध्यम लक्ष्य 32 × 32-96 × 96 पिक्सेल होते हैं, और विशाल लक्ष्य 96 × 96 पिक्सेल से बड़े होते हैं [22]।

जैसा कि चित्र 5 में दर्शाया गया है, इस कार्य में प्रयुक्त टीटी100के ट्रैफिक साइन डेटासेट ज्यादातर छोटे और मध्यम लक्ष्यों से बना था, जिसमें बड़े लक्ष्य कुल डेटासेट का केवल 7.4% और छोटे लक्ष्य 42.5% [23] के लिए जिम्मेदार थे।

increase memory

TT100K डेटासेट में उच्च रिज़ॉल्यूशन है, प्रत्येक छवि का रिज़ॉल्यूशन 2048 × 2048 पिक्सेल है और छोटे लक्ष्यों के बीच सबसे बड़ा ट्रैफ़िक संकेत पूरी छवि के 0.1% से कम है, जो लक्ष्य के लिए एक महत्वपूर्ण चुनौती पेश करता है। पता लगाने का एल्गोरिदम।

छोटे लक्ष्यों में सीमित विशेषताएं होती हैं और बड़ी स्थानीयकरण सटीकता की आवश्यकता होती है।

अलग-अलग फीचर परतों के निष्कर्षों को जोड़कर भविष्यवाणियां उत्पन्न करने के लिए मल्टी-स्केल फीचरफ्यूजन का लाभ उठाने के लिए YOLOv3 में FPN संरचना की शुरुआत के बावजूद, जो छोटे लक्ष्य की पहचान के लिए महत्वपूर्ण है, परिणाम अभी भी असंतोषजनक थे।

YOLOv3 नेटवर्क में, उथली परत में फीचर अर्थ संबंधी जानकारी कम होती है लेकिन एक सटीक लक्ष्य स्थान होता है, जबकि गहरी परत में मोटे लक्ष्य स्थान के अलावा अधिक होता है।

परिणामस्वरूप, छोटे लक्ष्यों की भविष्यवाणी करने के लिए उथली संकेंद्रित परतों का उपयोग किया जाता है और बड़े लक्ष्यों की भविष्यवाणी करने के लिए गहरी संकेंद्रित परतों का उपयोग किया जाता है। छोटे लक्ष्यों का अनुमान लगाने के लिए नेटवर्क में उथली सुविधाओं का पूरी तरह से उपयोग करने के लिए YOLOv3 नेटवर्क संरचना के तीन फीचर भविष्यवाणी स्केल में 152 × 152 आकार का एक चौथा फीचर पूर्वानुमान स्केल जोड़ा गया था।

608 × 608 के इनपुट छवि आकार के साथ, कनवल्शन और इनपुट छवि के दो गुना अपसैंपलिंग के बाद आउटपुट छवि सुविधा का आकार 152 × 152 था, और फीचरलेयर को रूटिंग परत के माध्यम से प्रेरित किया गया था; चौथे फीचर पूर्वानुमान पैमाने को बढ़ाने के लिए इस फीचर निष्कर्षण को 11वीं परत फीचर के साथ जोड़ा गया था।

इसके अलावा, एसपीपीनेट की धारणा को उधार लेकर और इसे YOLOv3 के साथ जोड़कर स्थानीय और वैश्विक सुविधाओं के विलय का एहसास करने के लिए एसपीपी मॉड्यूल जोड़ा गया था।

YOLOdetection लेयर से पहले, SPP मॉड्यूल को पांचवीं और छठी कनवल्शनल लेयर्स के बीच एकीकृत किया गया था, और SPP मॉड्यूल के फीचर मैप्स और पूल किए गए फीचर मैप्स को फिर से कनेक्ट किया गया और अगली डिटेक्शन नेटवर्क लेयर में पास किया गया।

improve working memory

स्थानीय और वैश्विक सुविधाओं के फीचरमैप स्तर के संलयन को पूरा करने के लिए, एसपीपी मॉड्यूल की अधिकतम पूलिंग कर्नेल पूल किए जाने वाले फीचर मैप के आकार के जितना संभव हो उतना करीब होना चाहिए।

एसपीपी मॉड्यूल के कारण होने वाले कम्प्यूटेशनल प्रयास को कम करने, फीचर मैप अभिव्यक्ति क्षमता को समृद्ध करने और पता लगाने के प्रभाव को बढ़ाने के लिए, इस शोध में एसपीपी मॉड्यूल दो समानांतर शाखाओं से बना था, जिनमें से प्रत्येक 19 × 19 अधिकतम पूलिंग परत और एक जंप से बना था। कनेक्शन. चित्र 6 बेहतर YOLOv3 नेटवर्क संरचना को दर्शाता है।

ways to improve brain function

3.2. बेहतर हानि फ़ंक्शन

YOLOv3 का हानि फ़ंक्शन केंद्र समन्वय हानि (हानिकारक), चौड़ाई-ऊंचाई समन्वय हानि (हानि), आत्मविश्वास हानि (हानिकॉन्फ़), और वर्गीकरण हानि (हानि) से बना है। केंद्रीय समन्वय हानि का प्रतिनिधित्व निम्न द्वारा किया जाता है:

improve your memory

जहां λcoord निर्देशांक हानि भार को दर्शाता है; λnoobj किसी वस्तु के बिना आत्मविश्वास हानि वजन को दर्शाता है; Iobjij दर्शाता है कि क्या ith सेल का jth एंकर बॉक्स ऑब्जेक्ट (1 या 0) के लिए जिम्मेदार है; Inobbyij ith ग्रिड के jth एंकर बॉक्स को दर्शाता है जो ऑब्जेक्ट के लिए ज़िम्मेदार नहीं है; (xi,yi,wji,hjI, CjI, Pji) अनुमानित लक्ष्य बॉक्स निर्देशांक, आत्मविश्वास और श्रेणी को दर्शाता है; और (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) वास्तविक लक्ष्य बॉक्स निर्देशांक, आत्मविश्वास और श्रेणी को दर्शाता है

YOLOv3 हानि फ़ंक्शन को समीकरण (5) द्वारा दर्शाया गया है, जहां माध्य वर्ग त्रुटि (MSE) हानि फ़ंक्शन का उपयोग बाउंडिंग बॉक्स रिग्रेशन के लिए किया जाता है और क्रॉस-एन्ट्रॉपी का उपयोग लॉस कॉन्फ़ और स्थानीय में हानि फ़ंक्शन के रूप में किया जाता है।

हानि=हानिxy + हानिwh − हानिcon f − हानिcls (5)

हालाँकि, एमएसई को बाउंडिंग बॉक्स रिग्रेशन के हानि फ़ंक्शन के रूप में उपयोग करना छोटे लक्ष्य का पता लगाने के लिए प्रतिकूल है, ऑब्जेक्ट स्केल के प्रति संवेदनशील है, और छोटे पैमाने की वस्तुओं के प्रति अमित्र होते हुए भी बड़े पैमाने के लक्ष्यों पर ध्यान केंद्रित करता है।

बड़े और छोटे लक्ष्यों के नुकसान को संतुलित करने और चौड़ाई और ऊंचाई हानि फ़ंक्शन पर बाउंडिंग बॉक्स आकार के प्रभाव को कमजोर करके पता लगाने के परिणामों को अधिकतम करने के लिए, इस पेपर में IoU-प्रकार हानि फ़ंक्शन को नियोजित किया गया था, और IoU द्वारा उत्पन्न मीट्रिक हानि का उपयोग किया गया था एक प्रदर्शन समीकरण (6)।

IoU =|ए ∩ बी||ए ∪ बी|(6)

जब बाउंडिंग बॉक्स और लक्ष्य बॉक्स ओवरलैप नहीं होते हैं, तो IoU=0 दो बॉक्स के बीच की दूरी के अंतर को प्रतिबिंबित नहीं करता है; जब पूर्वानुमान बॉक्स और लेबल वाला बॉक्स पूरी तरह से ओवरलैप हो जाता है, IoU=1, तो बाउंडिंग बॉक्स का केंद्र बिंदु निर्धारित नहीं किया जा सकता है, और लक्ष्य बॉक्स के साथ आकार के अंतर को और अधिक अनुकूलित नहीं किया जा सकता है।

DIoU हानि [24] आकार से स्वतंत्र है; इस प्रकार, बड़े आकार के परिणामस्वरूप बड़ा नुकसान नहीं होगा। क्योंकि छोटा आकार थोड़ा नुकसान पैदा करता है, जो समस्या का समाधान कर सकता है, इस कार्य में DIoU नुकसान का उपयोग किया गया, जिसका गणना सूत्र समीकरण (7) में प्रस्तुत किया गया है।

D IoU हानि=1 − IoU +ρ2 b, bgt c2(7)

जहां b और bgt केंद्रीय बिंदुओं को दर्शाते हैं, ρ यूक्लिडियन दूरी है, और c दो बक्से को कवर करने वाले सबसे छोटे संलग्न बॉक्स की विकर्ण लंबाई है।

DIoU हानि सीधे दो लक्ष्य फ़्रेमों के बीच की दूरी को कम करती है, तेज़ी से परिवर्तित होती है, और लक्ष्य फ़्रेम प्रतिगमन तंत्र के अनुरूप होती है, जो लक्ष्य और एंकर, ओवरलैप दर और स्केल के बीच की दूरी को ध्यान में रखती है, जिससे लक्ष्य फ़्रेम प्रतिगमन अधिक हो जाता है स्थिर, जबकि बाउंडिंग बॉक्स के लिए ग्रेडिएंट दिशा तब भी प्रदान करता है जब यह लक्ष्य फ्रेम के साथ ओवरलैप नहीं होता है।

help with memory


For more information:1950477648nn@gmail.com


शायद तुम्हे यह भी अच्छा लगे