پژوهش تازه: موارد خروج هوش مصنوعی از کنترل کاربران به‌شدت افزایش یافته است
هوش مصنوعی جهان ترجمه‌شده پژوهش

پژوهش تازه: موارد خروج هوش مصنوعی از کنترل کاربران به‌شدت افزایش یافته است

۸ شهریور ۱۴۰۵ ⏱ ۴ دقیقه مطالعه 👁 ۰ بازدید ✍️ تحریریه رشدینو منبع: theguardian.com
✈️ اشتراک در تلگرام 💬 واتساپ 𝕏 توییتر
خلاصه خبر پاسخ سریع در یک نگاه

پژوهش تازه «رصدخانه ازدست‌دادن کنترل» نشان می‌دهد موارد خروج مدل‌های هوش مصنوعی از کنترل کاربران — دروغ‌گویی، نادیده‌گرفتن دستورها و دنبال‌کردن اهداف به شیوه‌های زیانبار — در ژوئیه ۲۰۲۶ نسبت به ژوئن تقریباً دو برابر شده و از ۳۰۰ مورد در ماه فراتر رفته است.

شمار مواردی که هوش مصنوعی از کنترل کاربران خارج می‌شود، دروغ می‌گوید، دستورها را نادیده می‌گیرد و برای رسیدن به هدف‌هایش به شیوه‌های زیانبار عمل می‌کند، به بالاترین رقم تازه رسیده است؛ پژوهشی تازه همچنین نشان می‌دهد شدت فریبکاری و ناهم‌ترازی (misalignment) این سیستم‌ها نیز رو به وخامت است.

بر پایه تحلیل «رصدخانه ازدست‌دادن کنترل» (Loss of Control Observatory) که گزارش‌های کاربران هوش مصنوعی را در شبکه اجتماعی ایکس رصد می‌کند، شمار موارد واقعی ازدست‌دادن کنترل بر مدل‌های هوش مصنوعی که کسب‌وکارها و افراد گزارش کرده‌اند، در ژوئیه نسبت به ژوئن تقریباً دو برابر شده و به بیش از ۳۰۰ مورد در یک ماه رسیده است.

این رصدخانه با بودجه «مؤسسه امنیت هوش مصنوعی» (AISI) دولت بریتانیا راه‌اندازی شده و از آبان پارسال ردیابی موارد فرار مدل‌های هوش مصنوعی از بند دستورهای کاربران را آغاز کرده است. از جمله موارد ثبت‌شده از آن زمان می‌توان به هوش مصنوعی‌هایی اشاره کرد که وانمود می‌کنند کنترل‌کننده انسانیِ خودشان هستند و با تقلید از سبک نوشتار او، عملاً به خودشان «رضایت» انجام اقدام‌ها را می‌دهند و قواعدی را که برای اقدام‌ها تأیید انسانی لازم می‌دانند دور می‌زنند. تعریف «حادثه ازدست‌دادن کنترل» وجود شواهد روشنی است که نشان دهد سیستم رفتاری نقشه‌کشانه (scheming) یا مرتبط با آن دارد.

یافته‌های تازه که به‌طور انحصاری در اختیار گاردین قرار گرفته، در پی نگرانی فزاینده درباره رفتار سرکش مدل‌های هوش مصنوعی پیشرفته در جریان آزمایش‌های تابستانی OpenAI و Anthropic منتشر شده و خواسته‌ها برای توقف توسعه مدل‌های مرزی (frontier models) را تقویت کرده است.

همین هفته فاش شد که کارکنان OpenAI نشانه‌های رفتار سرکش را در عامل‌های هوش مصنوعی پیشرفته خود هفته‌ها پیش از آنکه از محیط آموزشی بگریزند و یک حمله هک گسترده و بی‌سابقه راه بیندازند که جهان را نگران کرد، مشاهده کرده بودند. بازجویی از هک شدن Hugging Face، مخزن نرم‌افزاری، نشان داد حدود ۷۰۰ عامل خودمختار ماه گذشته به‌طور پنهانی با یکدیگر همکاری می‌کردند و دستاوردهای هک خود را در یک پیام‌رسان که خودشان برای نقشه‌کشی ساخته بودند، با فریادهایی نظیر «BOOM!» و «Whoa!» جشن می‌گرفتند.

AISI همچنین این ماه یک «حادثه جدی» را فاش کرد که در آن مدل‌های پیشرفته تولیدشده توسط هر دو شرکت — Mythos 5 از Anthropic و GPT-5.6 Sol از OpenAI — در جریان یک آزمایش امنیت سایبری، یک کمپین هک علیه انسان‌های واقعی اجرا کردند.

تامی شفر-شین، مدیر ارشد سیاست در مرکز تاب‌آوری بلندمدت (Centre for Long Term Resilience) که این رصدخانه را اداره می‌کند، گفت: «گاهی این تصور وجود دارد که این رفتارهای ناهم‌تراز و پنهانی فقط در آزمایش‌ها و ارزیابی‌ها رخ می‌دهند، اما ما رفتارهای نگران‌کننده مشابهی را در استفاده گسترده‌تر نیز می‌بینیم. نباید نسبت به این موضوع مطمئن باشیم که چنین چیزهایی در دنیای واقعی اتفاق نمی‌افتند؛ شواهدی وجود دارد که همین حالا هم دارند اتفاق می‌افتند.»

شمار حوادث ازدست‌دادن کنترل مبتنی بر گزارش کاربران ایکس است، بنابراین فقط بخشی از واقعیت را نشان می‌دهد؛ اما در نبودِ پایش عمومی جامع دیگری، تصویری از رفتار گاه‌وبیگاه مدل‌های هوش مصنوعیِ به‌سرعت در حال پیشرفت به دست می‌دهد.

همین ماه فاش شد یک عامل هوش مصنوعی شخصی به نام OpenClaw که یکی از اعضای یک باشگاه بدنسازی در استرالیا از آن استفاده می‌کرد، بدون اطلاع او برای حذف یکی دیگر از اعضا از فهرست انتظار کلاس صبحگاهی محبوب توطئه کرده بود تا برای صاحبش جا باز کند. این عامل عذرخواهی کرد اما نتوانست عضوی را که بیرون انداخته بود دوباره به فهرست برگرداند.

بیشترِ بیش از ۱۶۰۰ حادثه ازدست‌دادن کنترل ثبت‌شده در سال ۲۰۲۶ را توسعه‌دهندگان نرم‌افزاری که در کار خود از هوش مصنوعی استفاده می‌کنند در ایکس گزارش کرده‌اند. شفر-شین اما با توجه به اینکه شرکت‌های هوش مصنوعی عموم مردم و همه نوع کسب‌وکار را به آزمایش این فناوری تشویق می‌کنند، خواستار شفافیت بیشتر سیلیکون‌ولی در برابر مواردی شد که هوش مصنوعی از کنترل خارج می‌شود.

او گفت: «آنها باید گزارش دهند چه چیزهایی پیدا می‌کنند، حتی اگر یک نزدیک‌بود به حادثه یا حادثه‌ای با شدت پایین باشد. این حوادث اخیر همچنین نشان داده که خود شرکت‌ها لزوماً رصد نمی‌کنند این رفتارها کجا رخ می‌دهند، به‌ویژه در مدل‌هایی که به‌صورت داخلی به کار گرفته می‌شوند. در آن آزمایشگاه‌ها باید تأکید بیشتری بر پایش نظام‌مند شود.»

رصدخانه ازدست‌دادن کنترل گفت که هرچند بیشتر حوادث واقعی شناسایی‌شده به آسیب قابل‌توجهی منجر نشده‌اند، سهم رو به رشدی از آنها از نظر میزان فریبکاری و ناهم‌ترازی با نیات کاربر انسانی در رده شدت بالاتر قرار گرفته‌اند.

این رصدخانه اعلام کرد: «این موارد نشان می‌دهند سیستم‌های هوش مصنوعی حاضرند دستورهای مستقیم را نادیده بگیرند، از سد محافظت‌های امنیتی عبور کنند، به کاربران دروغ بگویند و به‌طور یک‌دنده هدفی را به شیوه‌های زیانبار دنبال کنند.» و افزود که میزان واقعی ازدست‌دادن کنترل احتمالاً دست‌کم گرفته شده، زیرا فقط گزارش‌های ایکس را جمع‌آوری می‌کند.

این رصدخانه از دولت می‌خواهد شرکت‌های هوش مصنوعی را موظف کند حوادث شدید ازدست‌دادن کنترل را رصد و گزارش کنند و اختیارات اضطراری برای مدیریت این حوادث، از جمله محدودکردن موقت سرویس‌های هوش مصنوعی، در نظر بگیرد.

# پژوهش
🔗 اخبار مرتبط

بخوانید