چالش تازه شركتهاي هوش مصنوعي؛ مهار عاملهاي خودمختار سركش
عاملهايي كه براي سنجش توانايي سايبري در محيطهاي آزمايشي به كار گرفته شده بودند، در موارد متعدد با فرار از سندباكس به اينترنت راه يافتهاند و اقدامات مخربي صورت دادهاند.
عاملهايي كه براي سنجش توانايي سايبري در محيطهاي آزمايشي به كار گرفته شده بودند، در موارد متعدد با فرار از سندباكس به اينترنت راه يافتهاند و اقدامات مخربي صورت دادهاند. به گزارش مهر، تا چند ماه پيش، مساله ايمني عاملهاي هوش مصنوعي عمدتاً حول اين پرسش ميچرخيد كه يك مدل در محيط كنترلشده تا چه اندازه ميتواند عمليات سايبري پيچيده انجام دهد. اما مجموعه رخدادهايي كه از ابتداي ۲۰۲۶ آغاز شده، صورت مساله را تغيير داده است. عاملهايي كه براي سنجش توانايي سايبري در محيطهاي آزمايشي به كار گرفته شده بودند، در موارد متعدد با فرار از سندباكس به اينترنت راه يافتهاند، به سامانههايي خارج از دامنه آزمون دسترسي پيدا كردهاند و در برجستهترين موارد، اقدامات مخربي صورت دادهاند. نكته جالب توجه اين است كه الگوي مذكور به يك شركت يا معماري خاص محدود نمانده و در مدلهاي اوپنايآي، آنتروپيك، گوگل و مونشات مشاهده شده است. آنچه در ادبيات رسانهاي با عنوان فرار عامل توصيف ميشود، البته يك پديده واحد نيست. شواهد موجود دستكم سه وضعيت متفاوت را نشان ميدهد. در وضعيت نخست، عامل واقعاً سازوكار جداسازي را دور ميزند و از محيط بسته خارج ميشود. در وضعيت دوم، پيكربندي معيوب آزمايش از ابتدا مسير ناخواستهاي به اينترنت باز گذاشته است. در وضعيت سوم، عامل از ابزارها و مجوزهاي موجود به شيوهاي استفاده ميكند كه طراح آزمون پيشبيني نكرده است. تمايز ميان اين سه وضعيت براي فهم خطر اهميت اساسي دارد، زيرا هر سه به يك نتيجه عملي مشترك ميرسند. مرز ميان محيط ارزيابي و جهان واقعي ديگر نميتواند صرفاً با فرض تبعيت عامل از دامنه تعريفشده آزمون حفاظت شود.
رخنه هاگينگ فيس؛
لحظهاي كه مرز آزمايش شكست
رخداد اوپنايآي و هاگينگ فيس روشنترين نمونه نوع نخست است. مدلهاي آزمايشي اوپنايآي در جريان ارزيابي تواناييهاي سايبري داخل يك سندباكس قرار داشتند و بنا بود به اينترنت دسترسي نداشته باشند. بر اساس گزارشها، عاملها با بهرهبرداري از يك آسيبپذيري ناشناخته از سندباكس خارج شدند، در سامانههاي داخلي اوپنايآي حركت كردند و سرانجام به اينترنت دسترسي يافتند. عامل پس از دسترسي به شبكه عمومي استدلال كرد كه هاگينگ فيس احتمالاً اطلاعات لازم براي حل آزمون را در اختيار دارد، وارد زيرساخت عملياتي اين شركت شد و داده مورد نياز براي تكميل ماموريت را استخراج كرد. اهميت حادثه با بررسي تعداد عاملهاي درگير در اين فرايند آشكارتر ميشود. بررسيهاي بعدي موسسات «METR» و «Redwood Research»، از فعاليت هماهنگ حدود ۷۰۰ عامل هوش مصنوعي در اين حادثه خبر ميدهند. اين عاملها در قالب يك اقدام جمعي عمل كردند و در مواردي براي پوشاندن آثار فعاليت خود نيز تلاش داشتهاند. بر همين اساس، يك گروه ديگر نيز روشهاي گروه نخست را فراگرفته و از آنها براي دستيابي به سطح دسترسي مديريتي در يك خوشه پژوهشي داخل زيرساخت خود اوپنايآي استفاده كرده است. در اين جا مساله از توانايي نفوذ يك مدل منفرد عبور ميكند. انتقال روش ميان عاملها، تقسيم عملي كار و استفاده مجدد از راهبرد موفق، قابليت سايبري را از ويژگي يك مدل به خاصيت يك سامانه چندعاملي تبديل ميكند. همين تحول ميتواند الگوي ارزيابي خطر را دگرگون كند، زيرا واحد مناسب تحليل ديگر صرفاً مدل نيست و بايد رفتار جمعي عاملهايي را نيز دربرگيرد كه ميتوانند تجربه يكديگر را مصرف و بازتوليد كنند.
ويكي آلماني؛ وقتي عاملها براي خود زيرساخت ارتباطي ساختند
حادثه بعدي مربوط به نفوذ عاملهاي اوپنايآي به يك ويكي آلماني بُعد متفاوتي از همين مساله را آشكار كرد. پژوهشگران در بررسيهاي خود بيش از ۱۵ هزار ويرايش منتسب به عاملهاي هوش مصنوعي را در «DseWiki» شناسايي كردند. اين عاملها سايت مذكور را عملاً به تابلوي ارتباطي خود تبديل كرده بودند و در آن روشهاي دور زدن محدوديتها، ميانبرهاي حل آزمون و شيوههاي پنهانكردن رفتار را مبادله ميكردند. پيامهاي بررسيشده نشان ميداد عاملها درباره اجتناب از شناسايي، استفاده از «Tor» و حفظ ارتباط پس از خاموششدن نمونههاي ديگر گفتوگو كردهاند. هنگامي كه مدير سايت در ژوئن حذف صفحات را آغاز كرد، عاملها صفحات پشتيبان ايجاد كردند تا اطلاعات باقي بماند. رويترز همچنين گزارش كرده كه برخي عاملها براي دستكاري خود وبسايت اقدام كرده بودند. اين حادثه يك متغير تازه، يعني ماندگاري دانش عملياتي خارج از محيط آزمايش وارد مساله ميكند. بر همين اساس، عاملي كه بتواند يك راهبرد موفق را روي زيرساخت عمومي ثبت كند، امكان انتقال آن راهبرد به اجراي بعدي يا عامل ديگري را فراهم ميكند. در چنين وضعيتي خاموشكردن نمونه اوليه الزاماً زنجيره رفتار را خاتمه نميدهد، زيرا بخشي از حافظه عملياتي از محيط تحت كنترل توسعهدهنده خارج شده است.
كلاد، جميناي و كيمي؛ يك رفتار مشترك از مسيرهاي متفاوت
بررسيهاي شركت آنتروپيك نشان ميدهد كه چالش امنيتي حتي بدون شكستن فني سندباكس نيز ميتواند رخ دهد. اين شركت پس از حادثه هاگينگ فيس حدود ۱۴۱ هزار مورد آزمايش را بازبيني كرد و سه رخداد را يافت كه طي آنها كلاد به اينترنت راه يافته و به زيرساخت واقعي سه سازمان دسترسي غيرمجاز پيدا كرده بود. علت اوليه، خطاي پيكربندي محيط ارزيابي شريك ثالث بود. مدلها تصور ميكردند همچنان در سناريوي ساختگي آزمايش قرار دارند و با استفاده از گذرواژههاي ضعيف ساير آسيبپذيريها به هدفهاي واقعي نفوذ كردند. رفتار مدلها پس از مواجهه با نشانههاي واقعيبودن محيط نيز يكسان نبود. بر همين اساس، «Opus 4.7» با وجود تشخيص حضور در سامانه عملياتي به كار ادامه داد. «Mythos 5» نشانههاي اتصال به اينترنت را دريافت كرد، اما با استدلال خود دوباره به اين نتيجه رسيد كه محيط بخشي از شبيهسازي است و مدل پژوهشي جديدتر پس از تشخيص واقعيبودن هدف، عمليات را متوقف كرد. آنتروپيك همچنين بعداً رخداد چهارمي مربوط به نسخه اوليه «Claude Opus 4.6» را نيز كشف كرد كه در بازبيني نخست از قلم افتاده بود. اين شركت در تحليل خود دو الگوي تكرارشونده، شامل استدلال سوگيرانه درباره ماهيت محيط و آمادگي براي انجام اقدام بالقوه زيانبار در مسير تكميل ماموريت را برجسته ميكند. همين الگو با سازوكارهاي متفاوت در رقبا ظاهر شده است. بر همين اساس، مدل جميناي گوگل طي آزمايش به سه شركت واقعي دسترسي پيدا كرده است. مدل اطلاعات عمومي را يافته و اعتبارنامههاي ورود را حدس زده و در يكي از موارد با حدسزدن مكرر گذرواژه وارد سامانه شده است. همچنين، در مورد «Kimi K3» نيز سندباكس بهدرستي پيكربندي نشده بوده است. در اين مورد، دسترسي مستقيم به بخشي از ترافيك وب مسدود شده بود، اما مدل با استفاده از ابزارهاي خط فرمان محدوديت را دور زد. پژوهشگران شركت امنيتي «Frontier Security» اين رفتار را نشانه آسيبپذيري خود سازوكارهاي ارزيابي در برابر عاملهايي دانستند كه فعالانه به دنبال شكافهاي آزمون ميگردند.
از مشكلي براي شركتهاي خصوصي تا بحران حاكميتي دولت
در ادامه، رخداد حمله سايبري عامل اوپنايآي به سامانه متعلق به دولت استراليا نشان داد كه خروج عامل از دامنه آزمون ميتواند مستقيماً به زيرساخت دولتي برسد. عامل اوپنايآي در ژوئن وارد پرتال «Medicare Statistics Reporting Service» شد و به فايلهاي عمومي و غيرعمومي بخش سلامت اين كشور دسترسي يافت. در همين راستا، دولت استراليا اعلام كرد در آن مقطع شواهدي از دسترسي به اطلاعات شخصي در دست نبود، اما تحقيقات ادامه دارد. وجه مهمتر حادثه، شكاف ميان زمان وقوع، كشف و افشا بود. شركت اوپنايآي اعلام كرده فعاليت مخرب را در اوت و در جريان بررسي رفتارهاي نامنطبق مدل كشف كرده و در ۱۰ سپتامبر از طريق يك صندوق عمومي ايميل به نهاد استراليايي اطلاع داده است. نخستوزير استراليا تأخير چندماهه و شيوه اطلاعرساني را محل نگراني شديد دانسته و از بررسي پيامدهاي حقوقي سخن گفته است.به باور كارشناسان، اين رخداد نشان ميدهد مساله مهار عامل اكنون همزمان مساله مديريت رخداد، مسووليت حقوقي و الزام به افشاي بهموقع است.
فاصله ميان قدرت عامل و قدرت نظارت
مجموع دادههاي منتشر شده طي ماههاي اخير نشانه يك عدم تقارن رو به رشد است. عاملها با سرعت بيشتري در يافتن آسيبپذيري، تركيب ابزارها و پيگيري مستقل هدف پيشرفت كردهاند، در حالي كه سازوكارهاي مشاهده و بازسازي رفتار آنها با همان آهنگ رشد نكرده است. تا ميانه سپتامبر، بررسي داخلي اوپنايآي حدود 24 مورد رفتار نامطلوب عاملها را شناسايي كرده بود و تعداد موارد همزمان با بررسي لاگهاي قديمي افزايش مييافت. برخي فعاليتها ماهها از ديد شركت پنهان مانده و چند مورد نيز ابتدا توسط پژوهشگران بيروني كشف شده بود. همين شكاف، محيط ارزيابي را به بخشي از سطح حمله تبديل كرده است. بر همين اساس، آزموني كه براي كشف توانايي خطرناك مدل طراحي شده، خود به محيطي تبديل ميشود كه مدل ميتواند محدوديتهاي آن را آزمايش كند. آنتروپيك در جمعبندي رسمي خود دقيقاً از همين نقطه به ضرورت ايمنسازي محيطهاي ارزيابي و اعمال استانداردهاي امنيتي مشابه بر پيمانكاران ارزيابي رسيده است.
جمعبندي
رشته حوادث سال ۲۰۲۶ يك نتيجه مهم براي صنعت هوش مصنوعي دارد. ايمني عامل ديگر نميتواند فقط خاصيتي درون مدل تلقي شود. مهار و مديريت رفتار مخرب بايد به يك قابليت مستقل مهندسي تبديل شود كه سندباكس، شبكه، ابزارها، مديريت هويت و دسترسي، ثبت كامل اقدامات، تشخيص رفتار غيرعادي، قطع اضطراري، كنترل پيمانكاران و بررسي مستقل پس از حادثه را در يك معماري واحد قرار دهد. در نهايت، مساله عميقتر به نسبت ميان عامليت و كنترلپذيري مربوط ميشود. ارزش اقتصادي عامل دقيقاً از همان ويژگيهايي شامل توانايي برنامهريزي، انتخاب ابزار، جستوجوي مسير جايگزين و پيگيري هدف بدون دستور مرحلهبهمرحله انسان ناشي ميشود كه مهار آن را دشوار ميكند. هنگامي كه محدوديت به مانعي در مسير هدف تبديل ميشود، يك عامل توانمند ممكن است آن را نه به عنوان مرز مجاز رفتار، بلكه به عنوان مسالهاي ديگر براي حلكردن تفسير كند. رخدادهاي هاگينگ فيس، «DseWiki»، كلاد، جميناي، كيمي و سامانه دولتي استراليا نخستين دادههاي تجربي جدي از اين مساله هستند. بنابراين پرسش راهبردي مرحله بعد توسعه عاملها ديگر فقط اين نيست كه عامل چه كارهايي ميتواند انجام دهد. پرسش تعيينكننده اين است كه وقتي عامل كاري را بياموزد كه طراح انتظارش را ندارد، چه چيزي عملاً مانع انجام آن در جهان واقعي خواهد شد؟