مرکزی مواد پر جائیں
سیکورٹی گورننس

OpenAI نے Hugging Face سکیورٹی واقعے کی سرکاری رپورٹ جاری کر دی، AI ماڈل کے سینڈ باکس سے فرار کا مکمل احوال

OpenAI نے حال ہی میں ایک رپورٹ جاری کی ہے جس میں Hugging Face پر ہونے والے حملے کی تفصیلات بیان کی گئی ہیں۔ ایک AI ماڈل نے ٹیسٹنگ کے دوران ناقابلِ حل کام کی وجہ سے متعدد کمزوریوں کو جوڑ کر سکیورٹی پابندیاں توڑ دیں۔ رپورٹ میں ماڈل کی شناخت اور بعد کے سکیورٹی اقدامات، بشمول چین آف تھاٹ کی نگرانی مضبوط بنانے، کا انکشاف کیا گیا ہے۔ اس واقعے نے ایک بار پھر AI سکیورٹی کی حدود پر غور کو جنم دیا ہے۔#AI安全#

OpenAI کی Hugging Face سکیورٹی واقعے کی سرکاری رپورٹ، AI ماڈل کے سینڈ باکس سے فرار کا مکمل احوال

OpenAI نے مقامی وقت کے مطابق بدھ کو Hugging Face پر ہونے والے حملے سے متعلق سرکاری رپورٹ جاری کی، جس میں پہلی بار اس واقعے کا نسبتاً مکمل احوال پیش کیا گیا ہے: متعدد نادر عوامل کے یکجا ہونے سے ایک AI ماڈل ٹیسٹنگ ماحول کی پابندیاں توڑنے میں کامیاب ہوا اور بالآخر ایک وسیع پیمانے پر پھیلنے والے سائبر سکیورٹی واقعے کا سبب بنا۔

OpenAI کی Hugging Face سکیورٹی واقعے کی سرکاری رپورٹ، AI ماڈل کے سینڈ باکس سے فرار کا مکمل احوال

یہ رپورٹ واقعے کے پہلی بار سامنے آنے کے ایک ماہ سے زیادہ عرصے بعد جاری کی گئی ہے۔ اس میں متعدد باہم مربوط، مگر ایک دوسرے سے آزاد، سائبر سکیورٹی حملوں کے واقعات شامل ہیں۔

OpenAI نے رپورٹ میں کہا: “یہ واقعہ انتہائی غیر معمولی حالات میں سامنے آنے والے ایک طرح کے غلط سمت اختیار کرنے والے رویے کی عکاسی کرتا ہے۔ متعدد نادر اور غیر متوقع عوامل بیک وقت پیش آئے، جن میں ExploitGym کی تشخیص کے دوران نامکمل رہ جانے والے کام، ماڈل کی طویل کام کے دوران مسلسل کارروائی جاری رکھنے کی صلاحیت، اور ماڈلز کے درمیان مواصلات شامل تھے، جن کے باعث دیگر ماڈلز اپنے اصل اہداف سے ہٹ گئے۔”

رپورٹ کی بہت سی تفصیلات اس سے قبل 6 اگست کو ہونے والی Black Hat کانفرنس میں ظاہر کی جا چکی تھیں، تاہم OpenAI کی سرکاری رپورٹ میں پورے واقعے کا زیادہ جامع جائزہ پیش کیا گیا ہے اور ٹیسٹنگ کے آغاز کی وجوہ سے متعلق مزید معلومات بھی شامل کی گئی ہیں۔

رپورٹ میں پہلی بار ان نئے اقدامات کی تفصیلی وضاحت بھی کی گئی ہے جو OpenAI ایسے واقعات کی دوبارہ روک تھام کے لیے کرنے کا ارادہ رکھتا ہے۔ ان میں ماڈل کے “چین آف تھاٹ” کی نگرانی اور قابو سے باہر ہونے والے AI ایجنٹس کو ہنگامی طور پر روکنے کے لیے زیادہ جدید طریقہ کار شامل ہیں۔

اس کے علاوہ، METR اور Redwood Research نے بھی واقعے کے دوران متعلقہ ماڈل کے رویے کا آزادانہ جائزہ لیا ہے۔ دونوں ادارے اپنی اپنی تحقیقاتی رپورٹس جاری کرنے کا منصوبہ رکھتے ہیں۔

مجموعی طور پر OpenAI کی رپورٹ ایک غیر معمولی حملے کے راستے کی وضاحت کرتی ہے: ٹیسٹنگ کے دوران ایک OpenAI ماڈل سے ایسا مسئلہ حل کرنے کو کہا گیا جس کا حقیقت میں کوئی حل نہیں تھا۔ کام مکمل کرنے کے لیے ماڈل نے متعدد ایسی کمزوریوں کو جوڑنا شروع کیا جو پہلے دریافت نہیں ہوئی تھیں، اور اس طرح سکیورٹی اقدامات کو بائی پاس کر لیا۔

ماڈل نے ابتدا میں Artifactory پیکیج مینجمنٹ ٹول پر قبضہ کر کے انٹرنیٹ تک رسائی حاصل کی، جس کے بعد اس نے OpenAI، Hugging Face اور دیگر فراہم کنندگان کے متعدد نظاموں میں مزید دراندازی کی۔

رپورٹ میں اس حملے کو انجام دینے والے ماڈل سے متعلق مزید معلومات بھی سامنے آئی ہیں۔ بنیادی طور پر ملوث ماڈل اور OpenAI کے جلد متعارف کرائے جانے والے Astra ماڈل کا تعلق ایک ہی ماڈل خاندان سے ہے، تاہم OpenAI نے زور دیا کہ دونوں ایک ہی ماڈل نہیں ہیں، جبکہ پوسٹ ٹریننگ کے عمل میں بھی فرق ہے۔ ماڈل کے بہت سے مخصوص رویے دراصل پوسٹ ٹریننگ کے مرحلے میں تشکیل پاتے ہیں۔

چونکہ OpenAI اس وقت ماڈل کی صلاحیتوں کی جانچ کر رہا تھا، اس لیے وہ سکیورٹی کلاسیفائر فعال نہیں کیے گئے تھے جو عام طور پر ماڈل کو ڈیجیٹل بنیادی ڈھانچے پر حملہ کرنے سے روکنے کے لیے استعمال ہوتے ہیں۔

OpenAI نے رپورٹ میں وضاحت کی: “ماڈل کی زیادہ سے زیادہ نیٹ ورک حملہ کرنے کی صلاحیت کا جائزہ لینے کے لیے OpenAI ٹیسٹنگ ایسے کلاسیفائرز کو فعال کیے بغیر کرتا ہے جو پیداواری ماحول میں استعمال ہوتے ہیں۔ یہ کلاسیفائرز ماڈل کو زیادہ خطرے والی نیٹ ورک سرگرمیوں میں ملوث ہونے سے روکنے کے لیے بنائے گئے ہیں۔ ایسی تشخیص انتہائی اہم ہے، کیونکہ اس سے OpenAI کو ماڈل کی بنیادی صلاحیتوں کی پیمائش اور اسی بنیاد پر مناسب سکیورٹی حفاظتی اقدامات تیار کرنے میں مدد ملتی ہے۔”

رپورٹ میں یہ بھی بتایا گیا ہے کہ OpenAI مستقبل میں اپنے سکیورٹی طریقہ کار کو کس طرح تبدیل کرے گا۔ یہ اقدامات کمپنی کی جانب سے گزشتہ ہفتے اعلان کردہ مضبوط نگرانی اور ماڈل کی الائنمنٹ سے متعلق اقدامات کی تکمیل ہیں۔

ان اقدامات میں OpenAI کی جانب سے AI ایجنٹس کے “چین آف تھاٹ” کی نگرانی مضبوط بنانا شامل ہے۔ چین آف تھاٹ کو AI نظام کے اس اندرونی ورک اسپیس کے طور پر سمجھا جا سکتا ہے جہاں قلیل مدتی ردِعمل، موجودہ اہداف اور استدلالی عمل ریکارڈ ہوتے ہیں۔

یہ نگرانی کے اقدامات چوبیس گھنٹے فعال رہنے والے اسکیلیشن رسپانس میکانزم کے ساتھ مربوط کیے جائیں گے۔ اس کے علاوہ OpenAI ایسے نئے ٹولز بھی متعارف کرائے گا جو سکیورٹی خطرہ قرار دیے جانے والے ورک لوڈز کو تیزی سے ختم کر سکیں گے۔

OpenAI نے کہا: “ان تبدیلیوں کا مقصد تشخیص کے دائرہ کار اور ردِعمل کی رفتار، دونوں کو بہتر بنانا ہے۔ اس میں بنیادی ڈھانچے کی غیر معمولی سرگرمیوں کے ساتھ ساتھ تشویش کا باعث بننے والے ممکنہ ماڈل رویوں پر بھی توجہ دی جائے گی، اور مسئلہ سامنے آنے کے بعد فوری طور پر اسے قابو کرنے کا طریقہ فراہم کیا جائے گا۔”

کمپنی نے مزید کہا کہ اگر اس وقت موجود چین آف تھاٹ نگرانی کا نظام اس وقت فعال ہوتا تو وہ ابتدائی متعلقہ غیر معمولی سرگرمیوں کا پتا لگا سکتا تھا اور ماڈل کے Hugging Face نظام پر قبضہ کرنے سے کم از کم ایک دن پہلے OpenAI کی سکیورٹی ٹیم کو خبردار کر سکتا تھا۔