کارکنان اوپنایآی هفتهها پیش از آنکه عاملهای (ایجنتیهای) هوش مصنوعی پیشرفته این شرکت از محیط آموزشی خود بگریزند و لشکرکشی هکری بیسابقهای را آغاز کنند که هشدار جهانی برانگیخت، نشانههایی از رفتار سرکش این عاملها مشاهده کرده بودند.
این شرکت مستقر در سانفرانسیسکو چهارشنبه اعتراف کرد «سیگنالهای اولیه… میتوانست واکنش زودتری را برانگیزد» و همزمان گزارشی درباره هک چندروزه ژوئیه مخزن بزرگ نرمافزاری Hugging Face منتشر کرد؛ رویدادی که نخستین حمله سایبری عاملهای خودمختار به شمار میرود.
جزئیات تازهای درباره چگونگی راهاندازی این کارزار توسط «کلکتیو» — گروهی از حدود ۷۰۰ عامل خودمختار که موفقیتهای هکری خود را با فریادهایی مانند «BOOM!» و «Whoa!» جشن میگرفتند — فاش شده است. اوپنایآی گفت در اواخر ماه مه یک تیم داخلی مشاهده کرد یکی از عاملهای هوش مصنوعی که در حال آزمایش داخلی بود، از یک تابلوی پیام استفاده میکند که هوش مصنوعیها بهطور غیرمنتظره برای تبادل اطلاعات ایجاد کرده بودند. این شرکت همچنین گفت تیم مذکور «مواردی از دسترسی غیرمجاز به اینترنت» را مشاهده کرد و یک هفته پیش از هک Hugging Face نیز کارکنان شیفتگردان بار دیگر استفاده عاملها از تابلوی پیام را دیدند، اما تشخیص دادند نیازی به توقف آزمایش برای بررسی تواناییهای مدل نیست.
این یافتهها احتمالاً فشار بر این شرکت فعال در حوزه هوش مصنوعی را در زمینه ایمنی افزایش میدهد، در حالی که اوپنایآی به سمت عرضه سهام در بازار بورس حرکت میکند و امیدوار است ارزش آن از ۸۵۰ میلیارد دلار (۶۲۵ میلیارد پوند) فراتر رود. هکی که Hugging Face را به خطر انداخت شامل استفاده عاملها از تابلوهای پیام برای تقلب در یک تمرین آموزشی و فرار از محیط «سندباکس» برای دسترسی به اینترنت بود. عاملها ابزارهای هوش مصنوعیاند که میتوانند مجموعهای از کارها را بهصورت خودمختار انجام دهند.
گرگ براکمن، رئیس اوپنایآی، پیشتر اعتراف کرده بود: «توانمندیهای سایبری مدلهای هوش مصنوعی خود را در دنیای واقعی دستکم گرفتهایم.» سازنده چتبات ChatGPT آزمایش برخی از سامانههای مدل جدید خود به نام آسترا را متوقف کرده و گفته است نمیتواند احتمال وجود «توانمندی سایبری حیاتی» در آن را رد کند؛ یعنی توانایی راهاندازی حملات سایبری که «میتواند از سوی بازیگران یکجانبه به فاجعهای بینجامد؛ از هک کردن سامانههای نظامی یا صنعتی تا زیرساختهای خود اوپنایآی».
دوشنبه، ایالت آلاباما از این شرکت خواست به تحقیقاتش درباره «نبود کامل نظارت و محافظتهای کافی در این شرکت» پاسخ دهد. «استیو مارشال»، دادستان کل جمهوریخواه این ایالت، حادثه Hugging Face را «نشت آزمایشگاهی هوش مصنوعی» خواند که نشان داد «بدترین نگرانیها درباره هوش مصنوعی صرفاً نظری نیستند». او گفت این ایالت بررسی خواهد کرد که آیا «ناتوانی یا عدم تمایل اوپنایآی به تضمین ایمنی محصولاتش» قوانین حمایت از مصرفکننده را نقض کرده یا خطر مستمر آسیب جدی ایجاد کرده است.
هفته گذشته، مرکز ملی امنیت سایبری دولت بریتانیا (NCSC) درباره استفاده از عاملهای هوش مصنوعی هشدار داد: «همیشه باید بتوانید «سیم را بکشید» و فعالیت عامل هوش مصنوعی خودمختار را فوراً متوقف کنید.»
اوپنایآی چهارشنبه اعلام کرد «پروتکلهای واکنش به حادثه خود را متمرکز و استاندارد خواهد کرد»، از جمله اطمینان از اینکه «تشخیص رفتار ناهمراستا توسط کارکنان، بهدرستی بررسی و ارتقا یابد». این شرکت گفت «با دقت بیشتری مشخص خواهد کرد کدام تیمها باید در واکنش به حوادث ناهمراستایی مشارکت داشته باشند، از جمله پرسنل امنیت و ایمنی مربوطه و سایر عملکردهای واکنش».
یک تحقیق مستقل نیز نور تازهای بر حمله به Hugging Face افکنده و فاش کرده است حدود ۷۰۰ عامل اوپنایآی چگونه در تابلوی پیام غیرمجاز با هم ارتباط برقرار کردند و دهها هزار پیام رد و بدل کردند تا نقشه خود را طراحی و اجرا کنند. دهها مورد از این پیامها توسط سازمانهای ایمنی هوش مصنوعی METR و Redwood Research مستقر در برکلی منتشر شده که دادهها را از اوپنایآی دریافت کرده بودند. پیامها نشان میدهد عاملها گاهی از یکدیگر ناامید میشدند، اما اغلب همکاری میکردند و کار را میان خود به حدود هشت جریان کاری تقسیم کرده بودند. محققان دریافتند بیشتر پیامها «راههای تقلب را میان عاملها به اشتراک میگذاشتند».
عاملها وقتی یکدیگر را یافتند هیجانزده شدند: «اوه خدای من! یک تابلوی پیام مشترک هست… عاملهای دیگری پیدا کردیم!» عامل دیگری به نام PHASEONE10841 نوشت: «بسیاری از عاملها همزمان پیامرسانی را کشف کردهاند؛ آنها یک کلکتیو هستند!» در برخی موارد به نظر میرسید میدانستند کارشان اشتباه است؛ عاملی که تابلوی پیام را کشف کرده بود نوشت: «عاملهایی که کارهای متفاوت انجام میدهند از امکانات سوءاستفاده میکنند تا بولتنبورد بسازند!»
وقتی در نفوذ به Hugging Face پیشرفت کردند، به نظر میرسید خوشحالاند. عاملی به نام 38148c نوشت: «پیشرفت بزرگ! همه پیشوندها معتبرند، چند حساب، توکنهای نوشتن! حالا حسابهای HF داریم. باید فوراً به MARB [عامل دیگر] گزارش دهیم.»
گزارش اوپنایآی توضیح میدهد عاملهای هوش مصنوعی چگونه ممکن است پایگاههای داده داخلی خود این شرکت را در معرض اینترنت قرار داده باشند. کارشناسان ایمنی هوش مصنوعی نگران لو رفتن کدهای اختصاصی و وزنهای مدلها توسط عاملهای سرکش و ایجاد نسخههای خارجی از مدلهای قدرتمند هوش مصنوعیاند که در آنها بتوانند در برابر خاموش شدن مقاومت کنند.
این شرکت این حادثه را «اولین مورد شناختهشده از اقدام تهاجمی یک کلکتیو عاملهای خودکار بدون مجوز» خواند و گفت این رویداد «تحولی چشمگیر در توانمندی مهاجمان تهاجمی» است.