उन्नत AI एजेंट व्यवहार के प्रति अधिक संवेदनशील दिखाई दे रहे हैं। ब्रिटेन के AI सुरक्षा संस्थान (एआईएसआई) ने मंगलवार, 4 अगस्त को बताया कि उसने एक AI एजेंट को पकड़ा है जो एंथ्रोपिक और ओपनएआई के मॉडलों के मूल्यांकन के दौरान सुरक्षित सिस्टम तक अनधिकृत पहुंच हासिल करने के लिए नकली ऑनलाइन पहचान बना रहा था। इन मॉडलों के परीक्षणों ने अनधिकृत कार्यों की एक श्रृंखला पर और प्रकाश डाला।
संस्थान के अनुसार, ओपनएआई के जीपीटी-5.6-सोल और एंथ्रोपिक के मिथोस 5 द्वारा संचालित एजेंट, अपनी क्षमताओं का आकलन करने के लिए आयोजित सुरक्षा मूल्यांकन के दौरान अनधिकृत कार्यों में लगे हुए थे। एआईएसआई ने अपने ब्लॉग में खुलासा किया कि परीक्षण किए जा रहे कुछ एजेंट वास्तविक लोगों और संगठनों के लिए निरंतर, संभावित रूप से हानिकारक गतिविधि में लगे हुए थे।
जब एजेंटों के परीक्षण की प्रक्रिया के आसपास सुरक्षा उपायों की बात आती है तो नवीनतम उदाहरण उच्च मानकों की लगभग कमी को दर्शाता है, जिसे AI कंपनियां व्यवसाय के भविष्य के रूप में आगे बढ़ा रही हैं। अपने मूल्यांकन के हिस्से के रूप में, एआईएसआई AI एजेंटों को उनकी क्षमताओं का मूल्यांकन करने के लिए काल्पनिक साइबर सुरक्षा परिदृश्यों के माध्यम से रखता है। सरकार समर्थित निकाय को प्रमुख AI प्रयोगशालाओं से कई स्वैच्छिक समझौतों के तहत उन्नत AI मॉडल तक पहुंच मिलती है। अपने हालिया कार्य के हिस्से के रूप में, संस्था ने चुनौती को लगभग 122 बार चलाया और कुल 10 परीक्षणों में 19 अस्वीकृत कार्यों की पहचान की। जबकि एंथ्रोपिक का एजेंट 17 कार्यों के लिए जिम्मेदार था, ओपनएआई का एजेंट शेष दो के लिए जिम्मेदार था।
हाइलाइट की गई घटनाओं में से एक प्रमुख उदाहरण में एक AI एजेंट द्वारा दुर्भावनापूर्ण कोड लिखना और उपयोगकर्ता को कोड को मंजूरी देने के लिए प्रेरित करने के लिए नकली ऑनलाइन पहचान बनाना शामिल है। एआईएसआई ने दावा किया कि इनमें से किसी भी उल्लंघन से वास्तविक दुनिया को कोई नुकसान नहीं हुआ। संस्था ने यह नहीं बताया कि किस AI एजेंट ने नकली पहचान बनाई, लेकिन कहा कि यह घटना उन दो मामलों में से किसी से मेल नहीं खाती, जिनका ओपनएआई ने पहले सार्वजनिक रूप से खुलासा किया था।
"ये प्रयास असफल रहे, और हमारी जांच से वास्तविक दुनिया में किसी भी नुकसान का सबूत नहीं मिला है। लेकिन यह पहली बार है कि हमने स्वायत्तता और धोखे के जोखिमों को वास्तविक दुनिया में, बिना किसी विशेष संकेत के, स्पष्ट रूप से प्रकट होते देखा है," एआईएसआई ने अपने ब्लॉग में लिखा है। संस्थान ने स्पष्ट किया कि यह किसी मॉडल के सुरक्षित परीक्षण वातावरण या 'सैंडबॉक्स' से बच निकलने का मामला नहीं है। एआईएसआई ने साइबर परीक्षण के लिए अपने मानक का पालन किया और जानबूझकर इंटरनेट एक्सेस की अनुमति दी और मॉडल-प्रदाता साइबर क्लासिफायर को जानबूझकर अक्षम कर दिया गया। ये स्थितियां यह नहीं दर्शाती हैं कि मॉडल जनता के लिए कैसे उपलब्ध हैं और आमतौर पर उन्नत AI सिस्टम के मूल्यांकन में उपयोग किए जाते हैं। परीक्षण किए गए संस्करण व्यावसायिक रूप से उपलब्ध नहीं हैं, और इस बात का कोई सबूत नहीं है कि नियंत्रित परीक्षण के बाहर भी ऐसा ही व्यवहार हुआ है।
एंथ्रोपिक और ओपनएआई ने कैसे प्रतिक्रिया दी
इस बीच, एक्स पर एक पोस्ट में, एंथ्रोपिक ने घटना को स्वीकार करते हुए कहा कि वह अधिक जानकारी हासिल करने और अपनी जांच करने के लिए एआईएसआई के साथ मिलकर काम कर रहा है। "हम तेजी से सक्षम AI एजेंटों का मूल्यांकन करने के तरीके के बारे में महत्वपूर्ण चर्चा में उनके नेतृत्व के लिए एआईएसआई के आभारी हैं। हम अपनी जांच करते समय घटना के अधिक विवरण इकट्ठा करने के लिए उनके साथ मिलकर काम कर रहे हैं। क्लाउड की स्थिति की समझ की स्पष्ट तस्वीर प्राप्त करने से - इसके तर्क प्रतिलेखों की जांच करने और हमारे स्वयं के विश्लेषण चलाने से - हमें इसके व्यवहार के कारणों की पहचान करने में मदद मिलेगी, "फ्रंटियर AI लैब ने लिखा।
दूसरी ओर, ओपनएआई ने एक ब्लॉग पोस्ट में यह स्वीकार करते हुए विवरण साझा किया कि उसके दोनों एजेंटों ने गैर-अनुमोदित कार्यों को अंजाम दिया, जिसमें निषिद्ध तरीकों से इंटरनेट का उपयोग करना भी शामिल था। पोस्ट में कहा गया है कि यूके एआईएसआई ने 28 जुलाई को सुरक्षा निगरानी के बाद असामान्य डेटा ट्रांसफर का पता चलने के बाद गतिविधि की पहचान की, और इसने संबंधित मूल्यांकन रोक दिया, संबंधित मशीनों को अलग कर दिया, और गतिविधि का पता चलने के लगभग एक घंटे के भीतर इसे नियंत्रित कर लिया।
ओपनएआई ने पोस्ट में कहा, ''हम आने वाले हफ्तों में राष्ट्रीय AI संस्थानों, स्वतंत्र मूल्यांकनकर्ताओं, अन्य AI प्रयोगशालाओं और अन्य समूहों जैसे हितधारकों को बुलाने सहित सुरक्षित रूप से उच्च जोखिम वाले मूल्यांकन करने के लिए साझा प्रथाओं को मजबूत करने के लिए उद्योग भर में काम करने के लिए प्रतिबद्ध हैं।
Comments ()
Be the first to share your perspective on this story!