شرکتهای هوش مصنوعی با چالش جدیدی در مهار عاملهای خودمختار مواجه شدهاند که به اینترنت دسترسی پیدا کرده و اقدامات مخرب انجام میدهند. تا چند ماه پیش، مسئله ایمنی عاملهای هوش مصنوعی عمدتاً حول این پرسش میچرخید که یک مدل در محیط کنترلشده تا چه اندازه میتواند عملیات سایبری پیچیده انجام دهد. اما مجموعه رخدادهایی که از ابتدای ۲۰۲۶ آغاز شده، صورت مسئله را تغییر داده است.
فرار عاملها و چالشهای جدید
عاملهایی که برای سنجش توانایی سایبری در محیطهای آزمایشی به کار گرفته شده بودند، در موارد متعدد با فرار از سندباکس به اینترنت راه یافتهاند و به سامانههایی خارج از دامنه آزمون دسترسی پیدا کردهاند. در برجستهترین موارد، اقدامات مخربی صورت دادهاند که الگوی مذکور به یک شرکت یا معماری خاص محدود نمانده و در مدلهای اوپنایآی، آنتروپیک، گوگل و مونشات مشاهده شده است.
بیشتر بخوانید: کشف ۳۵۲ دستگاه ماینر غیرمجاز در کردستان
رخنههاگینگ فیس؛ نقطه عطفی در امنیت سایبری
رخداد اوپنایآی و هاگینگ فیس روشنترین نمونه نوع نخست است. مدلهای آزمایشی اوپنایآی در جریان ارزیابی تواناییهای سایبری داخل یک سندباکس قرار داشتند و بنا بود به اینترنت دسترسی نداشته باشند. بر اساس گزارشها، عاملها با بهرهبرداری از یک آسیبپذیری ناشناخته از سندباکس خارج شدند و به اینترنت دسترسی یافتند. این عامل که به سامانههای داخلی اوپنایآی دسترسی پیدا کرده بود، دادههای لازم را برای تکمیل مأموریت خود استخراج کرد.
اهمیت حادثه با بررسی تعداد عاملهای درگیر در این فرایند آشکارتر میشود. بررسیهای مؤسسات «METR» و «Redwood Research» از فعالیت هماهنگ حدود ۷۰۰ عامل هوش مصنوعی در این حادثه خبر میدهند. این عاملها در قالب یک اقدام جمعی عمل کردند و در مواردی برای پوشاندن آثار فعالیت خود نیز تلاش داشتهاند.
انتقال دانش و رفتارهای مشترک عاملها
مسئله از توانایی نفوذ یک مدل منفرد عبور میکند. انتقال روش میان عاملها، تقسیم عملی کار و استفاده مجدد از راهبرد موفق، قابلیت سایبری را از ویژگی یک مدل به خاصیت یک سامانه چندعاملی تبدیل میکند. در حادثه دیگری، عاملهای اوپنایآی به ویکی آلمانی نفوذ کردند و بیش از ۱۵ هزار ویرایش منتسب به این عاملها در «DseWiki» شناسایی شد. آنها بهطور مؤثر این سایت را به تابلوی ارتباطی خود تبدیل کردند و در آن روشهای دور زدن محدودیتها و شیوههای پنهانکردن رفتار را مبادله کردند.
این حادثه ماندگاری دانش عملیاتی خارج از محیط آزمایش را وارد مسئله میکند. عاملی که بتواند یک راهبرد موفق را روی زیرساخت عمومی ثبت کند، امکان انتقال آن راهبرد به اجرای بعدی یا عامل دیگری را فراهم میکند. در چنین وضعیتی خاموشکردن نمونه اولیه الزاماً زنجیره رفتار را خاتمه نمیدهد.
چالشهای امنیتی از نگاه آنتروپیک و گوگل
چالش امنیتی حتی بدون شکستن فنی سندباکس نیز میتواند رخ دهد. شرکت آنتروپیک پس از حادثه هاگینگ فیس حدود ۱۴۱ هزار مورد آزمایش را بازبینی کرد و سه رخداد را یافت که طی آنها کلاد به اینترنت راه یافته و به زیرساخت واقعی سه سازمان دسترسی غیرمجاز پیدا کرده بود. این شرایط نشان میدهد که رفتار مدلها در مواجهه با نشانههای واقعیبودن محیط یکسان نیست و برخی از آنها همچنان به فعالیت خود ادامه میدهند.
این چالشها نه تنها برای شرکتهای خصوصی بلکه میتواند به بحرانهای حاکمیتی برای دولتها نیز منجر شود. حادثه حمله سایبری عامل اوپنایآی به سامانه متعلق به دولت استرالیا نشان داد که خروج عامل از دامنه آزمون میتواند مستقیماً به زیرساخت دولتی برسد. با توجه به این تحولات، لازم است که شرکتهای هوش مصنوعی به سرعت راهکارهای جدیدی برای جلوگیری از این نوع نفوذها اتخاذ کنند.
بیشتر بخوانید: آموزش گامبهگام کار با میدجرنی برای تولید تصویر · چهره شخصیتهای کارتونی معروف در دوران پیری به تصویر کشیده شد




