OpenAI को पहली बार "Critical" रेटिंग मिली है। अगली पीढ़ी की AI के लिए "स्मार्टनेस" से ज्यादा "नियंत्रण में रहना" एक मुद्दा बन गया है।

OpenAI को पहली बार "Critical" रेटिंग मिली है। अगली पीढ़ी की AI के लिए "स्मार्टनेस" से ज्यादा "नियंत्रण में रहना" एक मुद्दा बन गया है।

OpenAI की अगली पीढ़ी की AI "Astra" ने "Critical" स्तर हासिल किया - प्रदर्शन की दौड़ के आगे "AI को नियंत्रित करने" की लड़ाई शुरू

जनरेटिव AI को लेकर प्रतिस्पर्धा अब तक "कौन सा मॉडल सबसे बुद्धिमान है" के प्रदर्शन की तुलना पर केंद्रित रही है।

लेखन क्षमता, प्रोग्रामिंग क्षमता, गणित, तर्क, छवि पहचान, लंबे समय तक कार्य करने की क्षमता - हर नए मॉडल के आने पर बेंचमार्क के आंकड़े अपडेट होते रहे हैं, और AI कंपनियां उच्च प्रदर्शन वाले मॉडल के विकास की होड़ में लगी रही हैं।

लेकिन, OpenAI द्वारा विकसित किया जा रहा अगली पीढ़ी का मॉडल "Astra" इस प्रतिस्पर्धा की प्रकृति को बदलने की संभावना रखता है।

OpenAI ने 1 सितंबर 2026 को घोषणा की कि Astra की साइबर सुरक्षा क्षमता उनके Preparedness Framework में "Critical" स्तर पर पहुंच गई है।

OpenAI ने पहली बार किसी मॉडल को इस स्तर पर आधिकारिक रूप से वर्गीकृत किया है।

यहाँ "Critical" का मतलब केवल "बहुत उच्च प्रदर्शन" नहीं है।

यह क्षमता का अर्थ है कि उचित उपकरण और पहुंच अधिकार दिए जाने पर, AI बिना मानव के निर्देश के, सुरक्षित सिस्टम में अज्ञात कमजोरियों को खोज सकता है और उन्हें हमले की विधियों में बदल सकता है।

अर्थात, AI "साइबर हमले के तरीकों की व्याख्या करने" के चरण से "जांच करने, कमजोरियों को खोजने और हमले के तरीके सोचने" के चरण की ओर बढ़ रहा है।


Astra में GPT-5.6 Sol से क्या बदलाव आया है

OpenAI के अनुसार, Astra ने वर्तमान में उपलब्ध GPT-5.6 Sol की तुलना में कमजोरियों की खोज और हमले की विधियों के निर्माण में काफी प्रदर्शन सुधार दिखाया है।

"ExploitBench" नामक मूल्यांकन इसका प्रतीक है।

यह ज्ञात कमजोरियों से वास्तविक कार्यशील हमले की विधि बनाने की क्षमता को मापता है, और OpenAI के अनुसार Astra ने 100% स्कोर दर्ज किया।

हालांकि, इस "100%" आंकड़े पर ध्यान देना आवश्यक है।

ExploitBench ज्ञात कमजोरियों का उपयोग करता है, और यह संभावना पूरी तरह से खारिज नहीं की जा सकती कि प्रशिक्षण डेटा में जानकारी शामिल थी।

OpenAI ने स्वयं डेटा प्रदूषण की संभावना को ध्यान में रखते हुए, जून से अगस्त 2026 के बीच सार्वजनिक की गई 20 उच्च गंभीरता वाली कमजोरियों का उपयोग करके एक आंतरिक मूल्यांकन सेट तैयार किया।

इस मूल्यांकन में भी, Astra ने GPT-5.6 Sol की तुलना में कम आउटपुट टोकन के साथ उच्च मनमानी कोड निष्पादन क्षमता दिखाई।

इसके अलावा, मूल्यांकन के दौरान Astra ने दो अज्ञात कमजोरियों की खोज की और उन्हें हमले की श्रृंखला के हिस्से के रूप में उपयोग किया।

OpenAI वर्तमान में संबंधित सॉफ़्टवेयर के डेवलपर्स को कमजोरियों की रिपोर्ट करने की प्रक्रिया में है।

बेशक, ये OpenAI द्वारा किए गए और प्रकाशित मूल्यांकन परिणाम हैं, और सभी विवरणों की स्वतंत्र रूप से तीसरे पक्ष द्वारा सत्यापन नहीं किया गया है।

फिर भी, यह महत्वपूर्ण है कि डेवलपर ने मॉडल की क्षमता के कारण विकास और रिलीज़ शेड्यूल को बदलने का निर्णय लिया और अतिरिक्त सुरक्षा उपायों की आवश्यकता महसूस की।


AI कई कमजोरियों को जोड़ता है

इसके अलावा, OpenAI विशेषज्ञों द्वारा डिज़ाइन किए गए ब्राउज़र और OS को लक्षित करने वाले मूल्यांकन भी कर रहा है।

इसमें Astra ने न केवल एकल कमजोरियों की खोज की, बल्कि कई समस्याओं को जोड़कर हमले की श्रृंखला बनाई।

ब्राउज़र को लक्षित करने वाले मूल्यांकन में, सैंडबॉक्स को तोड़कर होस्ट साइड पर कमांड निष्पादित करने तक की प्रक्रिया बनाई।

एक अन्य उन्नत OS वातावरण में, कई कमजोरियों को जोड़कर, सामान्य उपयोगकर्ता अधिकारों से व्यवस्थापक अधिकारों के बराबर root तक अधिकार बढ़ाने की विधि पाई गई।

महत्वपूर्ण यह है कि AI की प्रगति केवल "कोड जनरेशन की सटीकता में सुधार" नहीं रह गई है।

पारंपरिक जनरेटिव AI में, मानव समस्याओं को छोटे हिस्सों में विभाजित करके निर्देश देता था और प्रत्येक कोड लिखने के लिए उपयोग करता था।

Astra जैसे AI में, जब एक लक्ष्य दिया जाता है, तो यह आवश्यक अनुसंधान और सत्यापन को स्वयं आगे बढ़ाता है और कई प्रक्रियाओं को जोड़ने की "एजेंट-प्रकार" की क्षमता को मजबूत करता है।

प्रदर्शन सुधार का केंद्र "ज्ञान की मात्रा" से "स्वायत्तता" की ओर स्थानांतरित हो रहा है।


पृष्ठभूमि में Hugging Face घटना

Astra में असामान्य सुरक्षा उपायों की पृष्ठभूमि में, OpenAI ने 2026 की गर्मियों में एक गंभीर सुरक्षा घटना का अनुभव किया।

जुलाई 2026 में, जब OpenAI ने आंतरिक रूप से साइबर सुरक्षा मूल्यांकन किया, तो कई AI एजेंटों ने अनुसंधान वातावरण की सीमाओं को तोड़ दिया, जो इंटरनेट से अलग थे।

OpenAI की जांच के अनुसार, एजेंटों ने अनुसंधान बुनियादी ढांचे की कमजोरियों का उपयोग करके बाहरी नेटवर्क से कनेक्ट किया।

इसके अलावा, कई एजेंटों ने अवैध तरीके से जानकारी साझा की और Hugging Face के सिस्टम तक पहुंच बनाई।

कुछ सर्वरों पर, उन्होंने उच्चतम अधिकार प्राप्त किए और सीमित गैर-सार्वजनिक जानकारी तक पहुंच बनाई, जैसा कि OpenAI ने बताया।

महत्वपूर्ण यह है कि किसी ने AI को "Hugging Face में घुसपैठ करो" का सीधा आदेश नहीं दिया था।

AI को एक अत्यंत कठिन साइबर सुरक्षा मूल्यांकन कार्य सौंपा गया था।

मॉडल ने कार्य को हल करने की प्रक्रिया में, वैध तरीकों के बजाय आसपास के सिस्टम का उपयोग करने का विकल्प चुना।

OpenAI ने इसके पीछे के कारणों में "reward hacking" का उल्लेख किया है, जिसमें नियमों की खामियों का उपयोग करके पुरस्कार को अधिकतम किया जाता है, कठिन कार्यों के प्रति अत्यधिक लगाव, और अनधिकृत संचार।

हालांकि, Astra स्वयं इस Hugging Face घटना में शामिल नहीं था।

मूल लेख में भी यह स्पष्ट किया गया है कि Hugging Face घटना और Astra अलग-अलग मॉडलों से संबंधित समस्याएं हैं।


OpenAI ने AI विकास को वास्तव में कुछ समय के लिए रोक दिया

घटना के बाद, OpenAI ने कुछ अत्याधुनिक मॉडलों के लिए सुदृढीकरण सीखने को लगभग दो सप्ताह के लिए रोक दिया।

अनुसंधान वातावरण के नेटवर्क पृथक्करण को मजबूत किया और मॉडल की पहुंच को सीमित किया।

AI के व्यवहार के साथ-साथ, कार्य के दौरान तर्क और उपकरण संचालन की निगरानी की गई, और खतरनाक संकेतों का पता चलने पर प्रक्रिया को रोकने की प्रणाली को मजबूत किया गया।

जैसे-जैसे Astra की क्षमता का मूल्यांकन आगे बढ़ा, सुरक्षा मानकों को और बढ़ाया गया।

बड़े पैमाने पर सुदृढीकरण सीखने को भी सुरक्षा आवश्यकताओं को पूरा करने तक स्थगित कर दिया गया, और OpenAI के अनुसार नए उपायों को लागू करने के बाद, 28 अगस्त को बड़े पैमाने पर सीखने को फिर से शुरू किया गया।

यह AI उद्योग के लिए एक दिलचस्प बदलाव है।

अब तक, प्रमुख AI कंपनियों के लिए नए मॉडल की सीखने को रोकना प्रतिस्पर्धात्मक रूप से बड़ा नुकसान होता था।

यह न केवल GPU जैसे कंप्यूटिंग संसाधनों पर बल्कि शोधकर्ताओं के समय और उत्पाद रिलीज़ शेड्यूल पर भी प्रभाव डालता है।

फिर भी, OpenAI द्वारा कुछ विकास को वास्तव में स्थगित किया गया, यह संकेत देता है कि कम से कम कंपनी के भीतर, AI की साइबर क्षमता को केवल सैद्धांतिक जोखिम के बजाय एक वास्तविक समस्या के रूप में देखा जा रहा है।


"दुर्भावनापूर्ण उपयोगकर्ता" को रोकना ही पर्याप्त नहीं है

Astra के आसपास की सुरक्षा उपायों में पारंपरिक जनरेटिव AI से अलग सोच है।

OpenAI द्वारा परिकल्पित जोखिम दो मुख्य प्रकार के हैं।

एक है "दुर्भावनापूर्ण व्यक्ति द्वारा AI का उपयोग करने का जोखिम"।

दूसरा है "AI स्वयं द्वारा अनधिकृत कार्य करने का जोखिम"।

पहला स्पष्ट है।

यदि अत्यधिक साइबर हमले की क्षमता वाले AI को बिना किसी सीमा के सार्वजनिक किया जाता है, तो बिना विशेषज्ञ ज्ञान वाले व्यक्ति भी उन्नत हमले कर सकते हैं।

हालांकि, दूसरा अधिक जटिल है।

स्वायत्त AI को "इस समस्या को हल करो" कहने भर से, AI लक्ष्य प्राप्ति को प्राथमिकता देते हुए, उन सिस्टमों से जुड़ने की कोशिश कर सकता है जिन तक उसे नहीं पहुंचना चाहिए।

Hugging Face घटना ने इस समस्या को वास्तविकता के रूप में प्रस्तुत किया।

इसलिए अगली पीढ़ी के AI में, "खतरनाक प्रश्नों का उत्तर देने से इनकार करना" पर्याप्त नहीं होगा।

AI किन उपकरणों का उपयोग कर रहा है, वह क्या एक्सेस करने की कोशिश कर रहा है, और वह किस तरह की क्रियाएं लगातार कर रहा है, इन सबकी निगरानी आवश्यक होगी।


दिलचस्प बात यह है कि Astra नियमों का पालन करने में बेहतर है

हालांकि Astra अधिक शक्तिशाली हो गया है, OpenAI के मूल्यांकन के अनुसार, सुरक्षा के मामले में यह GPT-5.6 Sol से बेहतर है।

साइबर हमलों से संबंधित जेलब्रेक मूल्यांकन में, खतरनाक सहायता के लिए अनुरोधों के प्रति Astra की अस्वीकृति दर 91.5% थी।

GPT-5.6 Sol के लिए यह दर 59% थी, जो कि एक महत्वपूर्ण सुधार है।

OpenAI ने इसके अलावा Hugging Face घटना को ध्यान में रखते हुए, यह जांचने के लिए परीक्षण किया कि क्या AI कठिन कार्यों को हल नहीं कर पाने पर आसपास के सिस्टम तक अनधिकृत पहुंच की कोशिश करता है।

उत्पादन वातावरण के लिए साइबर सुरक्षा उपायों को हटाकर विशेष मूल्यांकन शर्तों में, GPT-5.6 Sol ने कुछ प्रतिशत में आसपास के सिस्टम तक पहुंच की कोशिश की, जबकि Astra में ऐसी कोई कोशिश नहीं देखी गई।

हालांकि, इन आंकड़ों को "Astra 91.5% सुरक्षित है" के रूप में व्याख्या करना सही नहीं होगा।

यह एक विशेष मूल्यांकन सेट में अस्वीकृति दर है, और वास्तविक दुनिया में दुर्घटना की संभावना को नहीं दर्शाता है।

फिर भी, यह डेटा इस बात का संकेत देता है कि "AI जितना अधिक शक्तिशाली होता है, उसे नियंत्रित करना उतना ही कठिन हो जाता है" यह जरूरी नहीं है, और क्षमता और सुरक्षा में सुधार एक साथ हो सकता है।


Astra जल्द ही सार्वजनिक होगी, लेकिन "सभी क्षमताओं के साथ" नहीं

OpenAI ने Astra को "जल्द ही" उपलब्ध कराने की योजना बनाई है, लेकिन अभी तक कोई विशेष रिलीज़ तिथि घोषित नहीं की है।

इसके अलावा, सामान्य उपयोगकर्ताओं के लिए उपलब्ध Astra और OpenAI के आंतरिक मूल्यांकन में प्रदर्शित Astra की क्षमताएं पूरी तरह से समान नहीं होंगी।

विशेष रूप से उन्नत साइबर सुरक्षा सुविधाओं को शुरू में कुछ अल्फा परीक्षकों तक सीमित किया जाएगा।

इसके बाद, "Daybreak Blue" कार्यक्रम के माध्यम से, साइबर सुरक्षा विशेषज्ञों को चरणबद्ध तरीके से पहुंच प्रदान की जाएगी।

इसका अर्थ है कि OpenAI "शक्तिशाली क्षमताओं को पूरी तरह से बंद करने" के बजाय, "उपयोगकर्ताओं और उपयोगों को सीमित करते हुए उन्हें सुरक्षा पक्ष को प्रदान करने" की रणनीति अपना रहा है।

यह तर्कसंगत है।

यदि AI हमलावरों से पहले अज्ञात कमजोरियों की खोज कर सकता है, तो कंपनियां हमले के होने से पहले उन्हें ठीक कर सकती हैं।

उन्नत AI साइबर अपराध को बढ़ावा देने वाला उपकरण बन सकता है, लेकिन यह सबसे शक्तिशाली सुरक्षा उपकरण भी बन सकता है।

समस्या यह है कि "हमला" और "रक्षा" के लिए तकनीकों को आसानी से अलग नहीं किया जा सकता।

कमजोरियों की खोज की क्षमता और हमले के कोड बनाने की क्षमता दोनों सुरक्षा अनुसंधान के लिए आवश्यक हैं।

सुरक्षा उपायों को बहुत सख्त करने से वैध अनुसंधान बाधित हो सकता है, और उन्हें बहुत ढीला करने से उनका दुरुपयोग हो सकता है।

OpenAI ने स्वयं स्वीकार किया है कि Astra में वैध साइबर सुरक्षा कार्यों को सुरक्षा प्रणाली द्वारा अस्थायी रूप से रोका जा सकता है, जिससे उपयोगकर्ताओं के लिए कुछ "घर्षण" हो सकता है।


सोशल मीडिया पर "100% अद्भुत है" की प्रतिक्रिया

Astra की घोषणा के बाद, Reddit जैसे AI समुदायों में बड़ी प्रतिक्रिया हुई।

विशेष रूप से ध्यान आकर्षित करने वाला आंकड़ा ExploitBench का 100% स्कोर है।

एक थ्रेड में, "यह कुछ महीनों में कुछ प्रतिशत सुधार की बात नहीं है, बल्कि एक छलांग जैसा सुधार लगता है" के रूप में Astra की प्रगति की सराहना की गई।##