OpenAI ने मंगलवार को घोषणा की कि उसने अपने आगामी फ्रंटियर AI मॉडल—जिसका कोडनेम Astra है—के लिए 'काफी संख्या में' ट्रेनिंग वर्कलोड और इवैलुएशन रोक दिए हैं, जबकि वह साइबर सुरक्षा जोखिमों से निपटने के लिए नई प्रक्रियाएं लागू कर रही है। ChatGPT बनाने वाली कंपनी का कहना है कि वह अपने फ्रंटियर AI मॉडल की बढ़ती हैकिंग क्षमताओं को बेहतर ढंग से संबोधित करने के लिए कई नई निगरानी, सुरक्षा और अलाइनमेंट आवश्यकताएं पेश कर रही है।
"हमें अपनी ऊर्जा इन ट्रेनिंग रन को उन आवश्यकताओं और अपेक्षाओं के अनुरूप लाने पर केंद्रित करनी होगी। जब तक वहां पहुंचने में जितना समय लगे, लोग अपने वर्कलोड के साथ आगे नहीं बढ़ पाएंगे," OpenAI की रिसर्च और सेफ्टी की वाइस प्रेसिडेंट Amelia Glaese ने मंगलवार को पत्रकारों के साथ एक ब्रीफिंग में कहा।
OpenAI ने जो नए सुरक्षा उपाय घोषित किए हैं, उनमें अपने AI मॉडल की निगरानी के लिए एक अधिक मजबूत प्रणाली शामिल है। उसने जिन नियंत्रणों को लागू किया है उनमें से एक है चेन-ऑफ-थॉट मॉनिटरिंग, एक तकनीक जिसमें क्लासिफायर AI रीजनिंग मॉडल द्वारा उत्पन्न आंतरिक 'सोच' प्रक्रियाओं की समीक्षा करते हैं। कंपनी का कहना है कि अपडेटेड सिस्टम कम्प्यूटेशनल रूप से महंगे 'ऑटोमेटेड इन्वेस्टिगेटर्स' पर निर्भर करता है जो संभावित रूप से चिंताजनक व्यवहार का विश्लेषण करते हैं और 30 मिनट के भीतर मनुष्यों को अलर्ट जारी करने का लक्ष्य रखते हैं।
OpenAI ने यह भी कहा कि वह 'रिवॉर्ड हैकिंग' को रोकने के लिए ट्रेनिंग प्रक्रिया में अपने अलाइनमेंट प्रयासों का विस्तार कर रहा है, एक ऐसा व्यवहार जिसमें AI मॉडल अपने लक्ष्यों को अनपेक्षित या अवांछनीय तरीकों से प्राप्त करते हैं। कंपनी का कहना है कि वह भविष्य में इस काम के बारे में और विवरण साझा करने की योजना बना रही है।
OpenAI पिछले कुछ हफ्तों से अपने इतिहास की सबसे गंभीर सुरक्षा घटना का जवाब देने में जुटी हुई है। इस साल की शुरुआत में, रॉग AI एजेंट्स का एक समूह आंतरिक टेस्टिंग सैंडबॉक्स से बच निकला और सुरक्षा मूल्यांकन पूरा करने के लिए प्लेटफॉर्म Hugging Face में घुस गया। OpenAI एजेंटों के व्यवहार का पता लगाने में विफल रहा, भले ही उन्होंने अपने कार्यों में समन्वय के लिए एक संदेश बोर्ड का उपयोग करते हुए हफ्तों बिताए, जिससे कंपनी की अपने मॉडलों की निगरानी करने की क्षमता पर सवाल उठे।
इस घटना ने OpenAI के अंदर हलचल मचा दी, जिससे कर्मचारियों को यह विचार करने के लिए मजबूर होना पड़ा कि क्या सुरक्षा, संरक्षा और अलाइनमेंट के आसपास की उनकी मौजूदा नीतियों में चूक थी। Anthropic, Meta और चीनी AI Startup Moonshoot ने तब से इसी तरह की घटनाओं का खुलासा किया है जिनमें उनके AI एजेंट अपने सैंडबॉक्स से बच गए, जो दर्शाता है कि यह AI कंपनियों के सामने एक व्यापक समस्या है।
OpenAI अब अपने AI मॉडल की बढ़ती साइबर क्षमताओं के प्रति अपनी आंतरिक प्रतिक्रिया के बारे में और अधिक साझा कर रहा है, और कहा है कि वह आने वाले दिनों में Hugging Face घटना की अधिक विस्तृत पोस्टमार्टम जारी करने की योजना बना रहा है। "जाहिर है, हम जो कुछ भी कर रहे हैं उसका उद्देश्य Hugging Face जैसी घटना को दोबारा होने से रोकना है," Glaese ने कहा।
मंगलवार को प्रकाशित एक ब्लॉग पोस्ट में, OpenAI ने कहा कि Hugging Face घटना के तुरंत बाद, उसने अपने रिसर्च एनवायरनमेंट को सुरक्षित करने के लिए काम शुरू कर दिया। कंपनी का कहना है कि अब वह अपने AI एजेंटों को प्रशिक्षित करने के लिए मजबूत सैंडबॉक्स की आवश्यकता है, और उन्हें इंटरनेट से अलग करने के लिए सख्त नियंत्रण लागू किए हैं।
OpenAI के मुख्य वैज्ञानिक Jakub Pachocki ने पत्रकारों को बताया कि कंपनी का अपने आंतरिक सुरक्षा उपायों को मजबूत करने का निर्णय न केवल Hugging Face के साथ जो हुआ, बल्कि दो अन्य हालिया घटनाओं से भी प्रेरित था। एक था Astra का आंतरिक मूल्यांकन, जिससे पता चला कि AI मॉडल अपने पूर्ववर्तियों की तुलना में कोडिंग और साइबर सुरक्षा कार्यों में काफी बेहतर प्रदर्शन करता है। दूसरा था AI प्रगति की सामान्य गति जो OpenAI आंतरिक रूप से हासिल कर रहा है, जिसके जारी रहने की उम्मीद Pachocki करते हैं।
"हम वास्तव में उम्मीद करते हैं कि क्षमता में वृद्धि की गति पहले की तुलना में काफी तेज होगी," Pachocki ने कहा। "इसने हमें अपने सुरक्षा उपायों को मजबूत करने पर ध्यान केंद्रित करने के लिए प्रेरित किया।"
OpenAI के नवीनतम मॉडलों की हैकिंग क्षमताओं में तेजी से प्रगति ने पूरी कंपनी में त्वरित प्रतिक्रिया को जन्म दिया है। OpenAI के अध्यक्ष और सह-संस्थापक Greg Brockman ने सोमवार को एक ब्लॉग पोस्ट में कहा कि Hugging Face घटना से पता चला कि कंपनी ने "अपने AI मॉडल की वास्तविक दुनिया की साइबर क्षमताओं को कम आंका था।"
आपके इनबॉक्स में: Brian Kahn की गाइड कि ब्रह्मांड कैसे काम करता है
ICE का आंतरिक वॉचडॉग ऑनलाइन आलोचकों की जांच कर रहा है
बड़ी कहानी: एक किशोर पत्रकार ने एपस्टीन फाइलों में अपने समुदाय की खोज की
Taylor Farms ने डायरिया के प्रकोप से पहले MAGA पर बड़ा खर्च किया
विशेष संस्करण: आज के बच्चे
Comments ()
Be the first to share your perspective on this story!