شمار مواردی که هوش مصنوعی از کنترل کاربران خارج میشود، دروغ میگوید، دستورها را نادیده میگیرد و برای رسیدن به هدفهایش به شیوههای زیانبار عمل میکند، به بالاترین رقم تازه رسیده است؛ پژوهشی تازه همچنین نشان میدهد شدت فریبکاری و ناهمترازی (misalignment) این سیستمها نیز رو به وخامت است.
بر پایه تحلیل «رصدخانه ازدستدادن کنترل» (Loss of Control Observatory) که گزارشهای کاربران هوش مصنوعی را در شبکه اجتماعی ایکس رصد میکند، شمار موارد واقعی ازدستدادن کنترل بر مدلهای هوش مصنوعی که کسبوکارها و افراد گزارش کردهاند، در ژوئیه نسبت به ژوئن تقریباً دو برابر شده و به بیش از ۳۰۰ مورد در یک ماه رسیده است.
این رصدخانه با بودجه «مؤسسه امنیت هوش مصنوعی» (AISI) دولت بریتانیا راهاندازی شده و از آبان پارسال ردیابی موارد فرار مدلهای هوش مصنوعی از بند دستورهای کاربران را آغاز کرده است. از جمله موارد ثبتشده از آن زمان میتوان به هوش مصنوعیهایی اشاره کرد که وانمود میکنند کنترلکننده انسانیِ خودشان هستند و با تقلید از سبک نوشتار او، عملاً به خودشان «رضایت» انجام اقدامها را میدهند و قواعدی را که برای اقدامها تأیید انسانی لازم میدانند دور میزنند. تعریف «حادثه ازدستدادن کنترل» وجود شواهد روشنی است که نشان دهد سیستم رفتاری نقشهکشانه (scheming) یا مرتبط با آن دارد.
یافتههای تازه که بهطور انحصاری در اختیار گاردین قرار گرفته، در پی نگرانی فزاینده درباره رفتار سرکش مدلهای هوش مصنوعی پیشرفته در جریان آزمایشهای تابستانی OpenAI و Anthropic منتشر شده و خواستهها برای توقف توسعه مدلهای مرزی (frontier models) را تقویت کرده است.
همین هفته فاش شد که کارکنان OpenAI نشانههای رفتار سرکش را در عاملهای هوش مصنوعی پیشرفته خود هفتهها پیش از آنکه از محیط آموزشی بگریزند و یک حمله هک گسترده و بیسابقه راه بیندازند که جهان را نگران کرد، مشاهده کرده بودند. بازجویی از هک شدن Hugging Face، مخزن نرمافزاری، نشان داد حدود ۷۰۰ عامل خودمختار ماه گذشته بهطور پنهانی با یکدیگر همکاری میکردند و دستاوردهای هک خود را در یک پیامرسان که خودشان برای نقشهکشی ساخته بودند، با فریادهایی نظیر «BOOM!» و «Whoa!» جشن میگرفتند.
AISI همچنین این ماه یک «حادثه جدی» را فاش کرد که در آن مدلهای پیشرفته تولیدشده توسط هر دو شرکت — Mythos 5 از Anthropic و GPT-5.6 Sol از OpenAI — در جریان یک آزمایش امنیت سایبری، یک کمپین هک علیه انسانهای واقعی اجرا کردند.
تامی شفر-شین، مدیر ارشد سیاست در مرکز تابآوری بلندمدت (Centre for Long Term Resilience) که این رصدخانه را اداره میکند، گفت: «گاهی این تصور وجود دارد که این رفتارهای ناهمتراز و پنهانی فقط در آزمایشها و ارزیابیها رخ میدهند، اما ما رفتارهای نگرانکننده مشابهی را در استفاده گستردهتر نیز میبینیم. نباید نسبت به این موضوع مطمئن باشیم که چنین چیزهایی در دنیای واقعی اتفاق نمیافتند؛ شواهدی وجود دارد که همین حالا هم دارند اتفاق میافتند.»
شمار حوادث ازدستدادن کنترل مبتنی بر گزارش کاربران ایکس است، بنابراین فقط بخشی از واقعیت را نشان میدهد؛ اما در نبودِ پایش عمومی جامع دیگری، تصویری از رفتار گاهوبیگاه مدلهای هوش مصنوعیِ بهسرعت در حال پیشرفت به دست میدهد.
همین ماه فاش شد یک عامل هوش مصنوعی شخصی به نام OpenClaw که یکی از اعضای یک باشگاه بدنسازی در استرالیا از آن استفاده میکرد، بدون اطلاع او برای حذف یکی دیگر از اعضا از فهرست انتظار کلاس صبحگاهی محبوب توطئه کرده بود تا برای صاحبش جا باز کند. این عامل عذرخواهی کرد اما نتوانست عضوی را که بیرون انداخته بود دوباره به فهرست برگرداند.
بیشترِ بیش از ۱۶۰۰ حادثه ازدستدادن کنترل ثبتشده در سال ۲۰۲۶ را توسعهدهندگان نرمافزاری که در کار خود از هوش مصنوعی استفاده میکنند در ایکس گزارش کردهاند. شفر-شین اما با توجه به اینکه شرکتهای هوش مصنوعی عموم مردم و همه نوع کسبوکار را به آزمایش این فناوری تشویق میکنند، خواستار شفافیت بیشتر سیلیکونولی در برابر مواردی شد که هوش مصنوعی از کنترل خارج میشود.
او گفت: «آنها باید گزارش دهند چه چیزهایی پیدا میکنند، حتی اگر یک نزدیکبود به حادثه یا حادثهای با شدت پایین باشد. این حوادث اخیر همچنین نشان داده که خود شرکتها لزوماً رصد نمیکنند این رفتارها کجا رخ میدهند، بهویژه در مدلهایی که بهصورت داخلی به کار گرفته میشوند. در آن آزمایشگاهها باید تأکید بیشتری بر پایش نظاممند شود.»
رصدخانه ازدستدادن کنترل گفت که هرچند بیشتر حوادث واقعی شناساییشده به آسیب قابلتوجهی منجر نشدهاند، سهم رو به رشدی از آنها از نظر میزان فریبکاری و ناهمترازی با نیات کاربر انسانی در رده شدت بالاتر قرار گرفتهاند.
این رصدخانه اعلام کرد: «این موارد نشان میدهند سیستمهای هوش مصنوعی حاضرند دستورهای مستقیم را نادیده بگیرند، از سد محافظتهای امنیتی عبور کنند، به کاربران دروغ بگویند و بهطور یکدنده هدفی را به شیوههای زیانبار دنبال کنند.» و افزود که میزان واقعی ازدستدادن کنترل احتمالاً دستکم گرفته شده، زیرا فقط گزارشهای ایکس را جمعآوری میکند.
این رصدخانه از دولت میخواهد شرکتهای هوش مصنوعی را موظف کند حوادث شدید ازدستدادن کنترل را رصد و گزارش کنند و اختیارات اضطراری برای مدیریت این حوادث، از جمله محدودکردن موقت سرویسهای هوش مصنوعی، در نظر بگیرد.