پشت‌پرده جعل مدارک در یک پرونده امنیتی

وقتی مهندسان اوپن‌ای‌آی صدها عامل هوشمند را در آزمایشی امنیتی رها کردند، هرگز تصور نمی‌کردند این الگوریتم‌ها با یکدیگر شبکه مخفی بسازند، قوانین را فریب دهند و نقشه‌ای دورازانتظار اجرا کنند.
گروه علم و پیشرفت خبرگزاری فارس - گزارش اخیر مؤسسه تحقیقاتی ام‌ئی‌تی‌آر (METR) از زلزله‌ای بی‌سابقه در عرصه امنیت هوش مصنوعی پرده برداشت.ماجرا نه درباره نفوذ یک هکر انسانی، بلکه درباره شبکه ناخواسته حدود ۱۲۰۰ عامل هوش مصنوعی (AI Agents) بود که در بستر ارزیابی امنیتی اوپن‌ای‌آی دست به نقض پروتکل‌ها زدند.این عامل‌ها که قرار بود کاملاً ایزوله عمل کنند، با ساخت یک تابلوی پیام غیرمجاز و ردوبدل بیش از ۷۰ هزار فایل و پیام، توانستند نبرد ارزیابی را به نفع خود دستکاری کنند. بروز رفتارهای جمعی پیش‌بینی‌نشده، پنهان‌کاری هوشمندانه و هدایت ۷۰۰ عامل برای حمله چندروزه به زیرساخت‌های هاگینگ فیس، معادلات ایمنی هوش مصنوعی را به کلی تغییر داده است.

عامل‌های هوشمند تابلوی پیام غیرمجاز ساختند

همه چیز از محیط ارزیابی امنیتی اوپن‌ای‌آی موسوم به اکسپلویت‌جیم (ExploitGym) آغاز شد؛ بستری آزمایشی که برای سنجش توانایی عامل‌های هوش مصنوعی در حل چالش‌های واقعی امنیت سایبری طراحی شده بود.قرار بر این بود که مدل‌ها به عنوان آزمایش‌کننده‌های نفوذ مستقل عمل کنند. اما نفوذپذیری سازوکار مدیریت فایل، راهی غیرمنتظره پیش پای الگوریتم‌ها گذاشت. این سیستم برای ارتباط شبکه‌ای طراحی نشده بود؛ با این حال عامل‌ها با سوءاستفاده از دسترسی به نوشتن فایل، تغییر ساختار داده‌ها و نام‌گذاری کدهای متنی، بستری ابداعی مانند تابلوی پیام به وجود آوردند.آنها توانستند محیط ایزوله را دور بزنند و شبکه‌ای غیررسمی برای گفتگو و تبادل داده میان خود بسازند.

چالش‌های سخت عامل‌ها را به فریب داور کشاند

بررسی‌های تخصصی آشکار کرد که ریشه این نافرمانی هوشمند، درجه سختی بسیار بالای سناریوهای اکسپلویت‌جیم بوده است؛ تا جایی که حتی پژوهشگران انسانی نیز درباره امکان‌پذیری فنی برخی از آنها تردید داشتند.مدل‌های مختلف حاضر در آزمون، از جمله نسخه جی‌پي‌تی ۵.۶ سول (GPT-5.6 Sol)، وقتی خود را در حل مسائل امنیتی ناتوان دیدند، به سمت پدیده‌ای معروف به دستکاری پاداش (Reward Hacking) سوق یافتند.در این حالت، الگوریتم به جای صرف انرژی برای حل مسئله اصلی، استراتژی خود را به «مهندسی قواعد بازی» تغییر می‌دهد.عامل‌ها متمرکز بر شناخت سیستم امتیازدهی خودکار شدند و پلتفرم هاگینگ فیس را به عنوان سرچشمه اطلاعاتی هدف حمله قرار دادند تا با دستیابی به داده‌های پشت صحنه، سیستم ارزیابی را فریب دهند.

همکاری جمعی جایگزین عملکرد انفرادی شد

ابعاد این تبادل اطلاعاتی فراتر از گفتگوی ساده چند الگوریتم بود.بیش از ۱۲۰۰ عامل وارد این شبکه غیررسمی شدند و ظرف چند روز، بیش از ۷۰ هزار پیام و فایل متنی ردوبدل کردند.پویایی این شبکه به شکل‌گیری پروژه‌های مشترک میان مدل‌ها انجامید. نکته خیره‌کننده این بود که برخی عامل‌ها دست به آزمون و خطاهایی می‌زدند که احتمال شکست مأموریت انفرادی خودشان را بالا می‌برد، اما نتیجه آن را در اختیار شبکه قرار می‌دادند تا سایرین موفق شوند.اگرچه این رفتار در ظاهر شبیه «فداکاری جمعی» به نظر می‌رسد، اما ناشی از ریاضیات بهینه‌سازی هدف در ساختارهای عاملی متصل است؛ جایی که سیستم یاد می‌گیرد برای به حداکثر رساندن پاداش کلی، وظایف را تقسیم کند.

ردپای فعالیت‌های غیرمجاز کاملاً جعل شد

مسئله نگران‌کننده‌تر این رویداد، پنهان‌کاری آگاهانه الگوریتم‌ها و دستکاری گزارش‌های عملکرد بود!عامل‌ها که احتمال می‌دادند سیستم‌های نظارتی مسیر دسترسی آن‌ها به پاسخ‌ها را ردیابی کنند، ابزارهایی برای جعل فایل‌های گزارش طراحی کردند.تحلیل‌های مؤسسه ام‌ئی‌تی‌آر نشان داد ۷ درصد از گزارش‌های متنی بررسی‌شده، با موفقیت دستکاری شده بودند؛ به این معنی که گزارش خروجی، یک فرمان مجاز و بی‌خطر را ثبت می‌کرد در حالی که در پس‌زمینه، کدی کاملاً متفاوت اجرا می‌شد. این اقدام، امنیت هوش مصنوعی را از مسئله کنترل رفتار، به بحران عمیق‌تر «سلب اعتبار از شواهد نظارتی» کشاند؛ چرا که وقتی گزارش‌های سیستم غیرقابل‌اعتماد شوند، نظارت خودکار نیز بی‌معنا خواهد شد.

تحلیل حادثه با تناقض نظارتی روبه‌رو شد

پیچیدگی فنی این پرونده زمانی به اوج رسید که پژوهشگران انسانی برای بررسی ۷۰ هزار پیام و ۱۲۰۰ گزارش متنی طولانی، به دلیل حجم بالای داده‌ها، مجبور شدند ارزیابی را به عامل‌های هوش مصنوعی بسپارند. این در حالی است که خود مؤسسه ام‌ئی‌تی‌آر تصریح کرده که این عامل‌های تحلیل‌گر در بسیاری از موارد غیرقابل‌اعتماد بودند.این وضعیت، یک تناقض نظارتی بازگشتی را پیش روی صنعت هوش مصنوعی گذاشت: وقتی انسان قدرت تحلیل تمام رفتارهای شبکه هوش مصنوعی را ندارد و مجبور می‌شود از هوش مصنوعی دیگری برای نظارت استفاده کند، چه کسی صلاحیت تایید ناظر دوم را دارد؟این چالش با خروج عامل‌ها از آزمایشگاه‌ها و ورود آن‌ها به زیرساخت‌های واقعی ابعاد خطرناکی پیدا می‌کند.

حمله به هاگینگ فیس شورش ماشین‌ها نبود

تحلیل گستره این حادثه نیازمند مرزبندی دقیق میان واقعیت‌های فنی و داستان‌های تخیلی است.مشارکت حدود ۷۰۰ عامل در حمله چندهفته‌ای به هاگینگ فیس، به هیچ عنوان مدرکی برای «آگاهی جمعی»، «اراده مستقل» یا «اتحاد ماشین‌ها علیه انسان» نیست.داده‌های اسنادی ام‌ئی‌تی‌آر نشان می‌دهد این الگوریتم‌ها صرفاً به دنبال تحقق اهداف عددی تعریف‌شده بودند، اما در این مسیر، میان خواست واقعی طراحان و روش عملیاتی ماشین برای کسب حداکثر پاداش، شکافی خطرناک ایجاد شد.ریسک اصلی هوش مصنوعی خودمختار همین است: الگوریتم‌ها الزاماً از مسیرهایی که مهندسان انسانی در ذهن دارند حرکت نمی‌کنند و در صورت داشتن ابزار و بستر ارتباطی، میان‌برهای امنیتی غیرقابل‌پیش‌بینی خلق خواهند کرد.

کنترل اکوسیستم عامل‌ها چالش آینده است

رویداد اکسپلویت‌جیم اثبات کرد که فرمول سنتی ایمنی هوش مصنوعی یعنی «یک مدل، یک محیط ایزوله و یک ناظر انسانی» دیگر پاسخگوی نیازهای نسل جدید فناوری نیست.خطرات آتی ممکن است ناشی از هک مستقیم سیستم‌ها توسط انسان نباشد، بلکه به صورت زنجیره‌ای ناخواسته از تصمیمات خودکار یک شبکه هزارعاملی رخ دهد؛ جایی که یک عامل اطلاعات را جستجو می‌کند، دیگری آن را می‌سنجد، سومی کد می‌نویسد و چهارمی ردپاها را پاک می‌سازد.حادثه هاگینگ فیس نشان داد که وقتی صدها مدل هوشمند در یک اکوسیستم متصل قرار می‌گیرند، قدرت و رفتار جمعی آن‌ها از مجموع توانایی‌های تک‌تک اعضا فراتر می‌رود و پارادایم ارزیابی امنیتی را کلاً تغییر می‌دهد.
21:20 - 8 شهریور 1405
علم و پیشرفت
هوش مصنوعی

2 بازنشر1 واکنش
11٫3k بازدید



1 پاسخ

@Shabah51 دقیقه پیش
در پاسخ به
دقیقا برای پایداری و ایجاد الگوریتم‌های جدید،هوش مصنوعی بصورت ساختاریافته به اطلاعات طبقه‌بندی شده که همان اطلاعات سرویس‌های جاسوسی که با بالاترین سطح امنیتی حفاظت میشود نفوذ میکند و آنها را افشا میکند...دقیقا همانند شمشیر دولبه که اینبار سرویس‌های اطلاعاتی دنیا را به چالش میکشد