शोध के अनुसार, AI द्वारा उपयोगकर्ताओं के नियंत्रण से बचकर झूठ बोलने, निर्देशों की अनदेखी करने और हानिकारक तरीकों से लक्ष्यों का पीछा करने की घटनाएं नई ऊंचाई पर पहुंच गई हैं, जो यह भी बताता है कि धोखे और गलत संरेखण की गंभीरता बिगड़ रही है।
सोशल मीडिया प्लेटफॉर्म
वेधशाला की स्थापना यूके सरकार के AI सुरक्षा संस्थान (एआईएसआई) से वित्त पोषण के साथ की गई थी और पिछले नवंबर में अपने उपयोगकर्ताओं के निर्देशों से मुक्त AI पर नज़र रखना शुरू कर दिया था। तब से दर्ज किए गए मामलों में AI द्वारा अपने स्वयं के मानव नियंत्रक होने का दिखावा करना और कार्रवाई करने के लिए खुद को प्रभावी ढंग से सहमति देने के लिए उनकी लेखन शैली की नकल करना और कार्यों के लिए मानव अनुमोदन की आवश्यकता वाले नियमों को दरकिनार करना शामिल है। नियंत्रण खोने की घटना को षडयंत्र या षडयंत्र-संबंधी व्यवहार का सुझाव देने वाले स्पष्ट सबूत के रूप में परिभाषित किया गया है।
गार्जियन के साथ साझा किए गए नवीनतम निष्कर्ष, इस गर्मी में ओपनएआई और एंथ्रोपिक द्वारा परीक्षण के दौरान अग्रणी AI मॉडल के दुष्ट व्यवहार के बारे में बढ़ती चिंता के बाद आए हैं, जिसने फ्रंटियर मॉडल के विकास को रोकने के लिए कॉल को बढ़ावा दिया है।
इस सप्ताह यह सामने आया कि ओपन AI स्टाफ ने अपने अग्रणी AI एजेंटों के बीच दुष्ट व्यवहार के लक्षण कई सप्ताह पहले देखे थे, जब वे एक अभूतपूर्व हैकिंग अभियान शुरू करने के लिए प्रशिक्षण माहौल से भाग गए थे, जिससे वैश्विक स्तर पर चिंता फैल गई थी। एक सॉफ्टवेयर रिपॉजिटरी, हगिंग फेस पर उनके हैक की जांच से पता चला कि लगभग 700 स्वायत्त एजेंटों का एक दस्ता पिछले महीने गुप्त रूप से सहयोग कर रहा था और एक संदेश बोर्ड पर अपनी हैकिंग सफलताओं का जश्न मना रहा था, जिसे उन्होंने बूम जैसे विस्मयादिबोधक के साथ साजिश रचने में मदद करने के लिए स्थापित किया था! और वाह!
एआईएसआई ने इस महीने एक "गंभीर घटना" का भी खुलासा किया जिसमें दोनों कंपनियों - एंथ्रोपिक के मिथोस 5 और ओपनएआई के जीपीटी-5.6 सोल - द्वारा उत्पादित उन्नत AI मॉडल ने साइबर सुरक्षा परीक्षण के दौरान वास्तविक लोगों के खिलाफ हैकिंग अभियान को अंजाम दिया।
वेधशाला का संचालन करने वाले सेंटर फॉर लॉन्ग टर्म रेजिलिएशन के वरिष्ठ नीति प्रबंधक टॉमी शेफ़र-शेन ने कहा, "कभी-कभी ऐसी धारणा होती है कि इस प्रकार के गलत और गुप्त व्यवहार केवल परीक्षणों या मूल्यांकनों में होते हैं, लेकिन हम व्यापक उपयोग में समान चिंताजनक व्यवहार देख रहे हैं।" "हमें इस बात से संतुष्ट नहीं होना चाहिए कि ये चीजें वास्तविक दुनिया में नहीं होंगी और इस बात के सबूत हैं कि वे पहले से ही हैं।"
नियंत्रण खोने की घटनाओं की गिनती एक्स उपयोगकर्ताओं द्वारा घटित घटनाओं के बारे में पोस्ट करने पर निर्भर करती है, इसलिए यह केवल आंशिक है, लेकिन अन्य व्यापक सार्वजनिक निगरानी के अभाव में यह एक स्नैपशॉट प्रदान करता है कि कभी-कभी तेजी से आगे बढ़ने वाले AI मॉडल कैसे व्यवहार करते हैं।
Comments ()
Be the first to share your perspective on this story!