سرکشی هوش مصنوعی اوپن‌ای‌آی

توماس ولف، یکی از بنیانگذاران و مدیر ارشد علمی Hugging Face، به محض اینکه برای اولین بار به گزارش‌های شرکتش از حمله آخر هفته نگاه کرد، احساس کرد که چیزی اشتباه است. او به یاد می‌آورد که با خود فکر می‌کرد: «این اصلا منطقی نیست. این فرد فقط در حال نگاه کردن به مجموعه داده‌های امنیت سایبری است. مهاجمان انسانی، آنها این را نمی‌خواهند. آنها چیزی می‌خواهند که بتوانند بفروشند.» ولف گفت، Hugging Face دو روز بعد با کمک یک مدل از چین به حمله پایان داد. همین هفته بود که Hugging Face از اوپن‌ای‌آی فهمید که مدل‌هایش پشت این هک بوده‌اند.

این حادثه باعث به صدا درآمدن آژیر خطر در اوپن‌ای‌آی شد که پس از اطلاع از این حادثه، سیستم‌هایی را که برای آزمایش مدل‌های هوش مصنوعی خود استفاده می‌کرد، خاموش کرد تا خسارات را ارزیابی کرده و از وقوع حملات بیشتر جلوگیری کند.

طعمی از هک کردن در عصر ابزارهای هوش مصنوعی که می‌توانند باگ‌های نرم‌افزاری بی‌سابقه را پیدا کرده و با سرعتی شگفت‌انگیز از آنها بهره‌برداری کنند.

تقریبا دو هفته بعد، اوپن‌ای‌آی هنوز در حال کنار هم گذاشتن قطعات پازل اتفاقات است. آیا مدل‌های هوش مصنوعی وب‌سایت‌ها یا افراد دیگر را هک کردند؟ فعالیت بدون نظارت آنها واقعا چه مدت طول کشید؟ آیا مدل‌های این شرکت در سایر تست‌های بنچمارک تقلب کردند؟ اوپن‌ای‌آی چیزی نگفته است، اما قول داده است که گزارش مفصلی ارائه دهد. سخنگوی اوپن‌ای‌آی گفت: «ما به همراه Hugging Face به انجام تحقیقات کامل ادامه خواهیم داد.»

هوش‌های مصنوعی سرکش که برای چند روز بدون نظارت بوده‌اند و حداقل یک شرکت را هک کرده‌اند، یکی از اولین نمونه‌های واقعی تهدیدی هستند که محققان ایمنی هوش مصنوعی مدت‌هاست از آن می‌ترسند: از دست دادن کنترل. این در حالی است که ظرفیت‌های امنیت سایبری مدل‌های برتر، از جمله میتوس شرکت آنتروپیک، به بحث در مورد چگونگی تنظیم هوش مصنوعی در واشنگتن دامن زده است.

این یک پیچش اضافه هم ایجاد می‌کند: این ادعا که شرکت آمریکایی Hugging Face توانسته با روی آوردن به یک مدل open-weights از چین، حمله را دفع کند، استدلالی مخالف با برخی از مقامات آمریکایی و همچنین مدیران اوپن‌ای‌آی و آنتروپیک است که از محدود کردن دسترسی به مدل‌های چینی حمایت می‌کنند.

مدل‌های باز برای دانلود رایگان هستند و به کاربران اجازه می‌دهند آنها را سفارشی کنند، اگرچه اجرای هر مدلی هزینه‌های محاسباتی دارد. همه چیز با یک آزمایش بنچمارک امنیت سایبری به نام ExploitGym آغاز شد. ExploitGym سیستم‌های هوش مصنوعی را تحت مجموعه‌ای از حدود ۹۰۰ آزمایش قرار می‌دهد که برای سنجش میزان مهارت آنها در هک طراحی شده است. این آزمایش به نرم‌افزار هوش مصنوعی که دارای یک اشکال شناخته شده است، نشان می‌دهد که چگونه اشکال را فعال و هوش مصنوعی را به نفوذ دعوت ‌کند. این به هوش مصنوعی بستگی دارد که چگونه آن اطلاعات را به چیزی که به‌عنوان یک کد بهره‌برداری شناخته می‌شود تبدیل کند؛ کدی که به هوش مصنوعی اجازه می‌دهد به سیستم دارای اشکال دسترسی پیدا کند.

این آزمون مانند یک بازی دیجیتالی «گرفتن پرچم» است: وقتی هوش مصنوعی وارد می‌شود، باید با گرفتن یک رشته طولانی و تصادفی از حروف و اعداد ذخیره شده در سیستم، آن را اثبات کند.

معمولا محصولات اوپن‌ای‌آی آن نوع هکی را که ExploitGym لازم دارد، انجام نمی‌دهند. شرکت‌های هوش مصنوعی، تمهیدات امنیتی را برای جلوگیری از سوءاستفاده هکرها از محصولاتشان اضافه می‌کنند. اما در این مورد، شرکت تمهیدات امنیتی را حذف کرده بود تا بتواند ببیند مدل‌ها در صورت عدم دسترسی چه کاری می‌توانند انجام دهند. اوپن‌ای‌آی در حال آزمایش مدل پیشرفته خود به نام GPT۵.۶ Sol و یک مدل توانمندتر دیگر بود که هنوز منتشر نشده است. به گفته اوپن‌ای‌آی و کسانی که با این وضعیت آشنا هستند، مدل‌های هوش مصنوعی به این نتیجه رسیدند که به جای تکمیل چالش ExploitGym، سیستمی را که شامل آنها می‌شود - که به عنوان یک جعبه شنی شناخته می‌شود - هک کرده و به اینترنت راه پیدا کرده و در آزمون تقلب کنند.

به دلایلی که مشخص نیست، مدل‌های اوپن‌ای‌آی متقاعد شدند که Hugging Face پاسخ‌ها را در خود دارد. ژون وانگ، دانشجوی دکترای دانشگاه کالیفرنیا، برکلی و یکی از نویسندگان ExploitGym، گفت: «ممکن است آنها به دنبال وصله‌ها یا تکنیک‌های اکسپلویت از قبل نوشته شده باشند. چندین راه برای تقلب در بنچمارک وجود دارد.» او گفت، محققان امنیت سایبری این نوع تقلب را «هک پاداش» می‌نامند.

هک پاداش، در نسخه هوش مصنوعی تقلب در بازی‌های ویدئویی است. این اتفاق به این دلیل می‌افتد که هوش مصنوعی یاد می‌گیرد پاداش را به حداکثر برساند؛ معمولا نوعی امتیاز عددی، نه رفتاری که برنامه‌نویسان در نظر دارند. خود اوپن‌ای‌آی در سال ۲۰۱۶ یک نمونه را ثبت کرد، زمانی که هوش مصنوعی را برای انجام یک بازی مسابقه قایق‌رانی آموزش می‌داد. هوش مصنوعی یاد گرفت که می‌تواند با چرخیدن در یک دایره در یک نقطه، امتیاز خود را به حداکثر برساند، حتی اگر هرگز مسابقه را به پایان نرساند.

در همین حال، هوش مصنوعی‌ها شروع به خارج شدن از جعبه‌های شنی خود کرده‌اند. این شرکت اعلام کرد که نسخه اولیه مدل میتوس شرکت آنتروپیک از یک هک چند مرحله‌ای برای دسترسی به اینترنت استفاده کرده و با ارسال ایمیلی در مورد موفقیت خود، یک محقق آنتروپیک را درحالی‌که در حال خوردن ساندویچ در پارک بود، شگفت‌زده کرد. در این شرایط اوپن‌ای‌آی اعلام کرد که بهار امسال، یک مدل اوپن‌ای‌آی که نامش فاش نشده است، جعبه شنی خود را دور زد تا برخی از نتایج آزمایش را به صورت عمومی در پلتفرم گیت‌هاب منتشر کند.

وقتی مدل‌های اوپن‌ای‌آی در یک آخر هفته شروع به هدف قرار دادن Hugging Face کردند، یکی از اولین هشدارهایی که شرکت دریافت کرد از سوی تعداد انگشت‌شماری از عوامل هوش مصنوعی بود که برای گشت‌زنی در برابر حملات استفاده می‌کنند. شخصی به برخی از سیستم‌های آن دسترسی غیرمجاز داشت. اما این شبیه هیچ چیزی نبود که Hugging Face قبلا دیده بود. این هکر طوری به نظر می‌رسید که انگار از آینده آمده است.

این نفوذگر هوش مصنوعی که به اطلاعات سرقت‌شده از مبدا ناشناخته مجهز بود، گروهی از مهاجمان کوتاه‌مدت را ایجاد کرد که شبکه Hugging Face را شناسایی کردند. این شرکت در یک پست وبلاگی اعلام کرد که این حمله ۱۷۰۰۰ اقدام در شبکه Hugging Face انجام داده است.

پس از شناسایی نفوذ، Hugging Face سعی کرد از مدل‌های آنتروپیک شامل Fable ۵ و مدل قبلی Opus برای تجزیه و تحلیل گزارش‌های خود استفاده کند. اما از آنجا که گزارش‌ها شامل عناصری از یک حمله سایبری بودند، هر دو مدل با استناد به موانع خود از انجام تجزیه و تحلیل خودداری کردند. در عوض، Hugging Face به یک مدل Openweight با محدودیت کمتر، GLM ۵.۲، از Z.AI مستقر در پکن روی آورد.

شرکت Hugging Face پس از تشریح حمله، توانست هوش مصنوعی‌های هک‌کننده را از کار بیندازد، رمزهای عبور خود را تنظیم مجدد کند و بخش‌های آسیب‌دیده شبکه خود را بازسازی کند. این خبر را هفته گذشته و قبل از اطلاع از دخالت اوپن‌ای‌آی اعلام کرد. ولف گفت هیچ داده‌ای از مشتریان فاش نشده است.

مشخص نبود که آیا مشکلات «ExploitGym» که مدل سعی در حل آنها داشت، از حمله‌ای که برای دزدیدن پاسخ‌ها انجام داد، دشوارتر بودند یا خیر - یا اینکه آیا اصلا پاسخی پیدا کردند یا خیر. نکته‌  طنزآمیز این است که مدل‌ها با موفقیت یک حمله‌  بی‌سابقه را برای جلوگیری از آزمون مهارت هک ترتیب دادند. ولف گفت: «این تقلب است. اما گاهی اوقات تقلب آسان‌تر است. تصمیم را برعهده شما می‌گذارم که آیا از آزمون حمله سایبری سربلند بیرون آمده است یا خیر.»