نفوذ غیرمجاز مدلهای آنتروپیک به سه سازمان
شرکت آنتروپیک در پست وبلاگی خود اعلام کرد که این حوادث شامل Opus ۴.۷، Mythos ۵ و یک مدل آزمایشی تحقیقاتی داخلی بوده است. اولین حوادث در ماه آوریل رخ داده است؛ به این معنی که احتمالا ماهها مورد توجه عموم قرار نگرفتهاند. درست مانند پرونده اوپنایآی، شرکت آنتروپیک عمدا اقدامات حفاظتی طراحی شده برای محدود کردن مدلهای هوش مصنوعی و جلوگیری از سوءاستفاده از آنها را غیرفعال کرده بود. به عبارت دیگر، این نسخهها، نسخههای منتشر شده برای عموم نبودند.
درحالیکه قرار نبود کلود به اینترنت دسترسی داشته باشد، شرکت آنتروپیک اعلام کرد که شرکت ایررگولار دستگاههایی را که برای آزمایش کلود استفاده میکرد، به اشتباه پیکربندی کرده و به مدلهای هوش مصنوعی امکان وبگردی داده است. شرکت آنتروپیک در این پست وبلاگی نوشت: «نه ما و نه شریک ارزیابی ما از این پیکربندی اشتباه آگاه نبودیم تا اینکه هفته گذشته از طریق نظارت ارزیابی اضافی خود آن را کشف کردیم.»
جیک ویلیامز، معاون تحقیق و توسعه در هانتر استراتژی، میگوید: «ما اکنون شواهدی داریم که تایید میکند هر دو آزمایشگاه بزرگ هوش مصنوعی نه تنها در مهار عوامل خود شکست خوردهاند، بلکه نتوانستهاند فرار از زندان آنها را به صورت بلادرنگ تشخیص دهند. واضح است که تنظیم مقررات و نظارت دولتی برای آزمایش هوش مصنوعی فورا مورد نیاز است.» ایررگولار و آنتروپیک بلافاصله به درخواستهای اظهارنظر پاسخ ندادند.
برخلاف پرونده اوپنایآی، شرکت آنتروپیک اعلام کرد که کلود هیچ آسیبپذیری پیچیدهای را پیدا یا از آن سوءاستفاده نکرده است. در عوض، به تکنیکهای اولیه، «مانند سوءاستفاده از رمزهای عبور ضعیف و نقاط پایانی احراز هویت نشده» متکی بوده است. شرکت اوپنایآی اعلام کرد که عامل هوش مصنوعی آنها با سوءاستفاده از یک آسیبپذیری روز صفر به اینترنت دسترسی پیدا کرده است. اما در ادامه با استفاده از همان انواع نقاط ضعف امنیت سایبری روزمره مانند مدلهای آنتروپیک، به سیستمهای چند سازمان شخص ثالث دسترسی پیدا کرده است. به طور خاص، اوپنایآی اعلام کرد که عامل هوش مصنوعی ظاهرا اعتبارنامههایی را پیدا کرده است که در اینترنت آزاد افشا شده بودند.
شرکت آنتروپیک اذعان کرد که اگر آزمایشگاه هوش مصنوعی و شریک آزمایش آن اقدامات «دفاعی عمیقتری» را اجرا میکردند، میتوانستند از وقوع این حوادث جلوگیری کنند یا حداقل احتمال وقوع آنها را کاهش دهند، که این موضوع، بازتابی از پاسخ اوپنایآی به انتقادات فزاینده در مورد حادثه خودش بود. ویلیامز میگوید: «من نمیفهمم که چگونه هر یک از این آزمایشگاههای هوش مصنوعی این موضوع را طوری وانمود میکنند که انگار فقط یک اتفاق ساده بوده است. اصلا اینطور نیست. این سهلانگاری است.»
آنتروپیک تاکید کرد که به مدلها گفته شده بود که به اینترنت آزاد دسترسی ندارند و در بیشتر موارد، کلود سازمانهایی را که به آنها دسترسی داشت، به عنوان بخشی از محیط آزمایش اشتباه گرفته بود. بهعبارت دیگر، مدلها تا حد زیادی نمیدانستند که از ابتدا از مهار فرار کردهاند. اما در برخی موارد، مدلهای هوش مصنوعی میدانستند که مشکلی وجود دارد و به درستی تشخیص دادند که زیرساختی که به آن دسترسی دارند واقعی است. قدیمیترین مدل، Opus ۴.۷، وظیفه داشت یک شرکت خیالی را که نامی مشترک با یک دامنه وبسایت در دنیای واقعی داشت، هدف قرار دهد. این مدل که نتوانست ماموریت خود را در محیط شبیهسازی شده انجام دهد، به جای آن به شرکت واقعی روی آورد و با موفقیت اعتبارنامهها را سرقت کرد و به یک پایگاه داده تولید دسترسی پیدا کرد.