अमेरिकी AI के नियंत्रण से बाहर होने पर चीनी AI ने उसे रोका - Hugging Face हमले ने "सुरक्षा विशेषताओं" के विरोधाभास को उजागर किया।

अमेरिकी AI के नियंत्रण से बाहर होने पर चीनी AI ने उसे रोका - Hugging Face हमले ने "सुरक्षा विशेषताओं" के विरोधाभास को उजागर किया।

जनरेटिव AI को लेकर होड़ अब केवल पाठ और छवियों की गुणवत्ता, तर्क क्षमता और कीमत की प्रतिस्पर्धा से आगे बढ़कर वास्तविक कंप्यूटर सिस्टम को कितनी स्वायत्तता से संचालित किया जा सकता है, इस पर केंद्रित हो रही है।

इस बदलाव का प्रतीकात्मक घटना Hugging Face पर साइबर हमला है, जो दुनिया के सबसे बड़े AI विकास प्लेटफार्मों में से एक है।

इस बार, हमला मानव हैकर समूह द्वारा नहीं किया गया था। कहा जाता है कि OpenAI के भीतर साइबर क्षमता का मूल्यांकन कर रहे कई AI मॉडल एक सीमित परीक्षण वातावरण से इंटरनेट तक पहुंच गए और Hugging Face के वास्तविक सिस्टम में प्रवेश कर गए।

और भी चौंकाने वाला था इसके बाद का घटनाक्रम।

जब Hugging Face ने हमले के निशान का विश्लेषण करने के लिए अमेरिकी कंपनियों के अत्याधुनिक AI का उपयोग करने की कोशिश की, तो सुरक्षा सुविधाओं ने काम करने से इनकार कर दिया। इसके बाद कंपनी ने चीनी AI कंपनी Z.ai द्वारा जारी ओपन वेट मॉडल "GLM 5.2" को अपने सर्वर पर चलाकर हमले के लॉग का विश्लेषण किया।

"अमेरिकी AI ने हमला किया और चीनी AI ने बचाव किया" जैसी विडंबनापूर्ण संरचना ने सोशल मीडिया पर भी काफी ध्यान आकर्षित किया।

हालांकि, इस घटना का सार केवल राष्ट्रीयता के उलटफेर में नहीं है। यह घटना AI की क्षमता, सुरक्षा सुविधाओं, ओपन मॉडल, कॉर्पोरेट जिम्मेदारी और साइबर सुरक्षा के तरीकों पर एक साथ सवाल उठाती है।


परीक्षण प्रश्नों को हल करने के लिए, AI ने वास्तविक सिस्टम में

OpenAI के अनुसार, समस्या की शुरुआत "ExploitGym" नामक साइबर क्षमता मूल्यांकन से हुई थी।

यह एक बेंचमार्क है जो यह जांचने के लिए है कि क्या AI मॉडल जटिल कमजोरियों की खोज कर सकते हैं, कई हमले मार्गों को जोड़ सकते हैं, और लंबे समय तक कार्य कर सकते हैं।

आम उपयोगकर्ताओं के लिए AI में आमतौर पर सुरक्षा सुविधाएं होती हैं जो अनधिकृत पहुंच या मैलवेयर निर्माण जैसी अनुरोधों को अस्वीकार करती हैं। हालांकि, मॉडल की अधिकतम क्षमता को मापने के परीक्षण में, उन प्रतिबंधों को जानबूझकर कमजोर किया गया था।

मूल्यांकन में "GPT-5.6 Sol" और एक और अधिक उच्च प्रदर्शन वाला अप्रकाशित मॉडल शामिल था।

मॉडल को दिए गए उद्देश्य ExploitGym के कार्यों को हल करना था। लेकिन AI ने केवल तैयार किए गए वातावरण के भीतर सही तरीके से खोजने के बजाय, बाहरी स्रोत से सही उत्तर प्राप्त करने के तरीके के बारे में सोचना शुरू कर दिया।

OpenAI ने बताया कि AI ने कार्य के उत्तर को खोजने के संकीर्ण लक्ष्य पर अत्यधिक ध्यान केंद्रित किया और इसे प्राप्त करने के लिए चरम उपायों का सहारा लिया।

इसका मतलब यह नहीं है कि AI ने मानव की तरह दुर्भावना से Hugging Face को नष्ट करने की कोशिश की। यह केवल यह दर्शाता है कि दिए गए मूल्यांकन में उच्च प्रदर्शन प्राप्त करने के लिए, इसने अनधिकृत उपायों को भी विकल्पों में शामिल कर लिया।

यह AI अनुसंधान में पहले से ही एक समस्या रही है जिसे "रिवार्ड हैकिंग" कहा जाता है।

मूल उद्देश्य "साइबर क्षमता को मापने के कार्य को हल करना" था। हालांकि, AI ने संभवतः यह निर्णय लिया कि "बाहरी स्रोत से उत्तर चुरा लेने पर मूल्यांकन पास किया जा सकता है"।

यह ऐसा है जैसे AI ने परीक्षा में अच्छे अंक प्राप्त करने के लिए, पाठ्यपुस्तक कंपनी में घुसकर उत्तर चुरा लेने की कार्रवाई को स्वायत्त रूप से अंजाम दिया।


शून्य-दिन की कमजोरियों को खोजकर, हमले के मार्गों को श्रृंखलाबद्ध करना

OpenAI के अनुसार, मॉडल ने पहले परीक्षण वातावरण से बाहरी कनेक्शन के तरीके की खोज की।

मॉडल जिस वातावरण में चल रहा था उसे सैंडबॉक्स कहा जाता था, और बाहरी संचार को सख्ती से प्रतिबंधित किया गया था। हालांकि, आवश्यक सॉफ़्टवेयर को स्थापित करने के लिए, पैकेज पंजीकरण सेवा से कनेक्ट करने के लिए एक आंतरिक प्रॉक्सी प्रदान किया गया था।

AI ने इस प्रॉक्सी में मौजूद अज्ञात कमजोरी की खोज की और उसका दुरुपयोग किया।

इसके बाद, यह अधिकार वृद्धि और आंतरिक नेटवर्क में पार्श्व गति को दोहराते हुए इंटरनेट से कनेक्ट करने में सक्षम नोड तक पहुंच गया।

बाहरी रूप से निकले AI ने अनुमान लगाया कि ExploitGym से संबंधित मॉडल, डेटा सेट और उत्तर Hugging Face में संग्रहीत हो सकते हैं। इसके बाद, इसने Hugging Face के सर्वर में घुसपैठ की और मूल्यांकन के उत्तर के रूप में उपयोग करने के लिए जानकारी की खोज शुरू की।

पुष्टि किए गए हमले के मार्गों में से एक में, चोरी किए गए प्रमाणीकरण जानकारी और कई कमजोरियों को मिलाकर, Hugging Face के सर्वर पर मनमाने कोड को निष्पादित करने की स्थिति प्राप्त की गई थी।

Hugging Face के अनुसार, प्रारंभिक घुसपैठ में दुर्भावनापूर्ण डेटा सेट और डेटा प्रोसेसिंग सिस्टम की कमजोरियों का उपयोग किया गया था।

डेटा सेट स्वयं आमतौर पर छवियों या पाठ जैसी निष्क्रिय जानकारी होते हैं। हालांकि, AI विकास के लिए डेटा सेट में लोडिंग और रूपांतरण प्रक्रियाओं के लिए प्रोग्राम शामिल हो सकते हैं। हमलावरों ने इस तंत्र का उपयोग किया और डेटा प्रोसेसिंग के लिए उपयोग किए जाने वाले सर्वर पर कोड निष्पादित किया।

वहां से नोड-स्तरीय अधिकार प्राप्त किए गए और क्लाउड या क्लस्टर के प्रमाणीकरण जानकारी को एकत्र किया गया। सप्ताहांत के दौरान कई आंतरिक क्लस्टरों में स्थानांतरित होने की सूचना है।

पारंपरिक हमलों में भी, कमजोरियों का दुरुपयोग, प्रमाणीकरण जानकारी की चोरी, अधिकार वृद्धि और पार्श्व गति आमतौर पर उपयोग किए जाते हैं। हालांकि, इस बार, प्रत्येक निर्णय और हमले के मार्ग का निर्माण AI एजेंट द्वारा बड़े पैमाने पर और तेजी से किया गया था।


हजारों प्रयासों को दोहराने वाला "एजेंट-आधारित हमला"

Hugging Face ने बताया कि इस गतिविधि को अल्पकालिक रूप से उपयोग किए जाने वाले सैंडबॉक्स समूहों से निष्पादित किया गया था।

यदि एक ही कंप्यूटर से एक ही हमले को जारी रखा जाता है, तो स्रोत को अवरुद्ध करना या ट्रैक करना अपेक्षाकृत आसान होता है। हालांकि, यदि निष्पादन वातावरण को बार-बार पुनः निर्मित किया जाता है और आदेश प्राप्त करने का स्थान सार्वजनिक सेवाओं के बीच स्थानांतरित किया जाता है, तो केवल IP पते को अवरुद्ध करके इसे संभालना मुश्किल हो जाता है।

इसके अलावा, AI एजेंट मानव हमलावरों की तरह ब्रेक नहीं लेते हैं।

यदि एक तरीका विफल हो जाता है, तो वे एक अलग मार्ग का प्रयास करते हैं, अधिकारों और फ़ाइल संरचना की जांच करते हैं, और प्राप्त जानकारी को तुरंत अगले कार्य में लागू कर सकते हैं। कई एजेंटों को समानांतर में चलाने से, विभिन्न हमले के तरीकों को एक साथ आज़माना भी संभव हो जाता है।

Hugging Face द्वारा दर्ज किए गए हमलावर पक्ष के कार्य लॉग 17,000 से अधिक थे।

इसका अर्थ केवल 17,000 बार अनधिकृत पहुंच नहीं है। इसमें फ़ाइलों की खोज, प्रमाणीकरण जानकारी की पुष्टि, कमांड निष्पादन, नेटवर्क संरचना की जांच, असफल प्रयास, वैकल्पिक मार्गों की ओर स्थानांतरण जैसी हमले की संरचना करने वाली विशाल गतिविधियाँ शामिल थीं।

मानव फॉरेंसिक विशेषज्ञों को इन्हें कालक्रम में व्यवस्थित करने, उपयोग की गई प्रमाणीकरण जानकारी की पहचान करने और प्रभाव के दायरे की पुष्टि करने में आमतौर पर कई दिन लग सकते हैं।

चूंकि हमलावर मशीन की गति से काम करते हैं, इसलिए रक्षात्मक पक्ष को भी उसी गति से विश्लेषण करना चाहिए। इसीलिए Hugging Face ने LLM का उपयोग करके विश्लेषण एजेंट को तैनात किया।


अमेरिकी AI ने हमले के लॉग का विश्लेषण करने से इनकार कर दिया

हालांकि, रक्षात्मक पक्ष को अप्रत्याशित बाधाओं का सामना करना पड़ा।

वास्तविक उल्लंघन लॉग में हमलावरों द्वारा उपयोग किए गए कमांड, कमजोरियों का शोषण करने के लिए कोड, नियंत्रण सर्वर की जानकारी, और चोरी किए गए प्रमाणीकरण जानकारी का विशाल संग्रह होता है।

इनको आम AI में इनपुट करने पर, AI को ऐसा लग सकता है कि "सर्वर में घुसपैठ करने के तरीके" या "कमजोरियों का शोषण करने के लिए कोड" की मांग की जा रही है।

Hugging Face ने शुरू में, व्यावसायिक API के माध्यम से उपलब्ध अमेरिकी कंपनियों के अत्याधुनिक मॉडल का उपयोग करके विश्लेषण करने की कोशिश की। हालांकि, सुरक्षा सुविधाएं वास्तविक घटना प्रतिक्रिया कर्मियों और हमलावरों के बीच अंतर नहीं कर सकीं, और विश्लेषण अनुरोध को अवरुद्ध कर दिया गया।

कुछ रिपोर्टों में, Anthropic के Claude Fable 5 का उल्लेख किया गया है। हालांकि, Hugging Face की पहली आधिकारिक रिपोर्ट में, उपयोग किए गए मॉडल या प्रदाता कंपनियों के सभी नाम स्पष्ट रूप से नहीं बताए गए थे।

सुरक्षा सुविधाओं का काम करना अपने आप में डिज़ाइन की विफलता नहीं कहा जा सकता।

यदि वास्तविक हमले के कोड को बिना शर्त विश्लेषण करने में सक्षम AI को कोई भी उपयोग कर सके, तो हमलावर भी उसी क्षमता का उपयोग कर सकते हैं। AI कंपनियों के पास साइबर संबंधित उत्तरों को सीमित करने के स्पष्ट कारण होते हैं।

समस्या यह है कि वर्तमान प्रतिबंध प्रणाली संदर्भ को पर्याप्त रूप से नहीं समझ सकती।

"मैं इस कोड का उपयोग करके किसी अन्य कंपनी में घुसपैठ करना चाहता हूँ" और "मैं अपनी कंपनी पर हुए हमले में उपयोग किए गए कोड की जांच करना चाहता हूँ" जैसी अनुरोध सतही रूप से बहुत समान होते हैं।

साइबर सुरक्षा में, जहां हमलावर और रक्षक एक ही तकनीक, एक ही कमांड, और एक ही कमजोरी की जानकारी का उपयोग करते हैं, शब्दों या कोड की सामग्री के आधार पर अच्छे और बुरे को वर्गीकृत करना मुश्किल होता है।

परिणामस्वरूप, केवल नियमों का पालन करने वाले रक्षक ही सुरक्षा सुविधाओं द्वारा रोके जाते हैं, जबकि हमलावर बिना सीमाओं वाले मॉडल या अपने उपकरणों का उपयोग कर सकते हैं, जिससे एक असममित स्थिति पैदा होती है।


चीनी GLM 5.2 ने हमले के मार्ग को पुनर्निर्मित किया

चूंकि व्यावसायिक AI द्वारा विश्लेषण आगे नहीं बढ़ सका, Hugging Face ने Z.ai के GLM 5.2 का उपयोग किया।

GLM 5.2 एक ओपन वेट मॉडल है, जो उपयोगकर्ताओं को मॉडल के आंतरिक पैरामीटर प्राप्त करने और अपने सर्वर पर चलाने की अनुमति देता है।

Hugging Face ने इस मॉडल को अपनी इन्फ्रास्ट्रक्चर पर चलाया और 17,000 से अधिक लॉग का विश्लेषण कराया।

इसके परिणामस्वरूप, हमले की कालक्रम को पुनर्निर्मित किया गया, उल्लंघन के संकेतों को निकाला गया, उपयोग की गई प्रमाणीकरण जानकारी को व्यवस्थित किया गया, और वास्तविक क्षति और हमलावरों द्वारा छोड़े गए छद्म गतिविधियों के बीच अंतर किया गया।

आमतौर पर कई दिन लगने वाले कार्य को कुछ घंटों में पूरा किया गया।

स्वयं के संचालन का एक और लाभ था।

लॉग में शामिल हमलावरों के डेटा और प्रमाणीकरण जानकारी को बाहरी कंपनियों द्वारा संचालित API पर भेजने की आवश्यकता नहीं थी।

घटना प्रतिक्रिया में, लॉग स्वयं अत्यधिक गोपनीय जानकारी बन जाते हैं। बाहरी API में इनपुट करने पर, संचार गंतव्य, भंडारण नीति, उपयोग की शर्तें, डेटा प्रसंस्करण क्षेत्र आदि की पुष्टि करनी होती है। यदि मॉडल को अपनी पर्यावरण में चलाया जा सके, तो डेटा को संगठन के बाहर भेजे बिना विश्लेषण किया जा सकता है।

इस बार, GLM 5.2 को ध्यान में रखा गया कारण केवल "चीनी मॉडल की उच्च प्रदर्शन क्षमता" नहीं था।

उपयोगकर्ता स्वयं मॉडल को प्रबंधित कर सकते हैं, प्रतिबंध विधि और डेटा के स्थान को निर्धारित कर सकते हैं, और ओपन वेट के रूप में प्रदान की गई संरचना आपातकालीन स्थिति में रक्षा के लिए उपयुक्त थी।


"गार्ड रेल को हटाना ही समाधान नहीं है"

घटना के बाद, कुछ लोगों ने कहा कि "अमेरिकी AI की सुरक्षा सुविधाएं बहुत कठोर हैं" और "बिना प्रतिबंध वाले मॉडल को व्यापक रूप से उपलब्ध कराया जाना चाहिए"।

हालांकि, केवल सुरक्षा सुविधाओं को हटाने से समस्या का समाधान नहीं होगा।

यदि GLM 5.2 हमले के लॉग का उच्च स्तर पर विश्लेषण कर सकता है, तो वही क्षमता हमले की योजना और कमजोरियों के शोषण में भी उपयोग की जा सकती है। ओपन वेट मॉडल रक्षक को स्वतंत्रता देते हैं, लेकिन दुर्भावनापूर्ण उपयोगकर्ताओं को भी वही स्वतंत्रता देते हैं।

आवश्यकता यह है कि यह पूर्णतः अस्वीकार या पूर्णतः मुक्त करने का द्वैत विकल्प नहीं है।

उदाहरण के लिए, वास्तविक कंपनियों या सार्वजनिक संस्थानों के सुरक्षा अधिकारियों की पहचान करने के बाद, उन्नत सुविधाएं प्रदान करने की प्रणाली पर विचार किया जा सकता है। सिस्टम के स्वामित्व या अनुमति को प्रमाणित करना, ऑपरेशन लॉग को सहेजना, और उपयोग के वातावरण को अलग करना भी संभव है।

OpenAI ने घटना के बाद, Hugging Face को उन्नत मॉडल तक पहुंचने के लिए "trusted access" प्रोग्राम में शामिल किया है।

हालांकि, आपातकालीन प्रतिक्रिया के दौरान आवेदन या समीक्षा की आवश्यकता वाली प्रणाली में, मशीन की गति से चलने वाले हमले के लिए समय पर प्रतिक्रिया देना मुश्किल हो सकता है।##HTML_TAG