چالش تازه شركت‌هاي هوش مصنوعي؛ مهار عامل‌هاي خودمختار سركش

۱۴۰۵/۰۷/۱۱ - ۰۱:۲۷:۳۰
کد خبر: ۴۰۵۵۱۰

عامل‌هايي كه براي سنجش توانايي سايبري در محيط‌هاي آزمايشي به كار گرفته شده بودند، در موارد متعدد با فرار از سندباكس به اينترنت راه يافته‌اند و اقدامات مخربي صورت داده‌اند.

عامل‌هايي كه براي سنجش توانايي سايبري در محيط‌هاي آزمايشي به كار گرفته شده بودند، در موارد متعدد با فرار از سندباكس به اينترنت راه يافته‌اند و اقدامات مخربي صورت داده‌اند. به گزارش مهر، تا چند ماه پيش، مساله ايمني عامل‌هاي هوش مصنوعي عمدتاً حول اين پرسش مي‌چرخيد كه يك مدل در محيط كنترل‌شده تا چه اندازه مي‌تواند عمليات سايبري پيچيده انجام دهد. اما مجموعه رخدادهايي كه از ابتداي ۲۰۲۶ آغاز شده، صورت مساله را تغيير داده است. عامل‌هايي كه براي سنجش توانايي سايبري در محيط‌هاي آزمايشي به كار گرفته شده بودند، در موارد متعدد با فرار از سندباكس به اينترنت راه يافته‌اند، به سامانه‌هايي خارج از دامنه آزمون دسترسي پيدا كرده‌اند و در برجسته‌ترين موارد، اقدامات مخربي صورت داده‌اند. نكته جالب توجه اين است كه الگوي مذكور به يك شركت يا معماري خاص محدود نمانده و در مدل‌هاي اوپن‌اي‎‌آي، آنتروپيك، گوگل و مون‌شات مشاهده شده است. آنچه در ادبيات رسانه‌اي با عنوان فرار عامل توصيف مي‌شود، البته يك پديده واحد نيست. شواهد موجود دست‌كم سه وضعيت متفاوت را نشان مي‌دهد. در وضعيت نخست، عامل واقعاً سازوكار جداسازي را دور مي‌زند و از محيط بسته خارج مي‌شود. در وضعيت دوم، پيكربندي معيوب آزمايش از ابتدا مسير ناخواسته‌اي به اينترنت باز گذاشته است. در وضعيت سوم، عامل از ابزارها و مجوزهاي موجود به شيوه‌اي استفاده مي‌كند كه طراح آزمون پيش‌بيني نكرده است. تمايز ميان اين سه وضعيت براي فهم خطر اهميت اساسي دارد، زيرا هر سه به يك نتيجه عملي مشترك مي‌رسند. مرز ميان محيط ارزيابي و جهان واقعي ديگر نمي‌تواند صرفاً با فرض تبعيت عامل از دامنه تعريف‌شده آزمون حفاظت شود.

 

  رخنه هاگينگ فيس؛

 لحظه‌اي كه مرز آزمايش شكست

رخداد اوپن‌اي‎‌آي و هاگينگ فيس روشن‌ترين نمونه نوع نخست است. مدل‌هاي آزمايشي اوپن‌اي‎‌آي در جريان ارزيابي توانايي‌هاي سايبري داخل يك سندباكس قرار داشتند و بنا بود به اينترنت دسترسي نداشته باشند. بر اساس گزارش‌ها، عامل‌ها با بهره‌برداري از يك آسيب‌پذيري ناشناخته از سندباكس خارج شدند، در سامانه‌هاي داخلي اوپن‌اي‎‌آي حركت كردند و سرانجام به اينترنت دسترسي يافتند. عامل پس از دسترسي به شبكه عمومي استدلال كرد كه هاگينگ فيس احتمالاً اطلاعات لازم براي حل آزمون را در اختيار دارد، وارد زيرساخت عملياتي اين شركت شد و داده مورد نياز براي تكميل ماموريت را استخراج كرد. اهميت حادثه با بررسي تعداد عامل‌هاي درگير در اين فرايند آشكارتر مي‌شود. بررسي‌هاي بعدي موسسات «METR» و «Redwood Research»، از فعاليت هماهنگ حدود ۷۰۰ عامل هوش مصنوعي در اين حادثه خبر مي‌دهند. اين عامل‌ها در قالب يك اقدام جمعي عمل كردند و در مواردي براي پوشاندن آثار فعاليت خود نيز تلاش داشته‌اند. بر همين اساس، يك گروه ديگر نيز روش‌هاي گروه نخست را فراگرفته و از آنها براي دستيابي به سطح دسترسي مديريتي در يك خوشه پژوهشي داخل زيرساخت خود اوپن‌اي‎‌آي استفاده كرده است. در اين جا مساله از توانايي نفوذ يك مدل منفرد عبور مي‌كند. انتقال روش ميان عامل‌ها، تقسيم عملي كار و استفاده مجدد از راهبرد موفق، قابليت سايبري را از ويژگي يك مدل به خاصيت يك سامانه چندعاملي تبديل مي‌كند. همين تحول مي‌تواند الگوي ارزيابي خطر را دگرگون كند، زيرا واحد مناسب تحليل ديگر صرفاً مدل نيست و بايد رفتار جمعي عامل‌هايي را نيز دربرگيرد كه مي‌توانند تجربه يكديگر را مصرف و بازتوليد كنند.

 

  ويكي آلماني؛ وقتي عامل‌ها براي خود زيرساخت ارتباطي ساختند

حادثه بعدي مربوط به نفوذ عامل‌هاي اوپن‌اي‌آي به يك ويكي آلماني بُعد متفاوتي از همين مساله را آشكار كرد. پژوهشگران در بررسي‌هاي خود بيش از ۱۵ هزار ويرايش منتسب به عامل‌هاي هوش مصنوعي را در «DseWiki» شناسايي كردند. اين عامل‌ها سايت مذكور را عملاً به تابلوي ارتباطي خود تبديل كرده بودند و در آن روش‌هاي دور زدن محدوديت‌ها، ميان‌برهاي حل آزمون و شيوه‌هاي پنهان‌كردن رفتار را مبادله مي‌كردند. پيام‌هاي بررسي‌شده نشان مي‌داد عامل‌ها درباره اجتناب از شناسايي، استفاده از «Tor» و حفظ ارتباط پس از خاموش‌شدن نمونه‌هاي ديگر گفت‌وگو كرده‌اند. هنگامي كه مدير سايت در ژوئن حذف صفحات را آغاز كرد، عامل‌ها صفحات پشتيبان ايجاد كردند تا اطلاعات باقي بماند. رويترز همچنين گزارش كرده كه برخي عامل‌ها براي دستكاري خود وب‌سايت اقدام كرده بودند. اين حادثه يك متغير تازه، يعني ماندگاري دانش عملياتي خارج از محيط آزمايش وارد مساله مي‌كند. بر همين اساس، عاملي كه بتواند يك راهبرد موفق را روي زيرساخت عمومي ثبت كند، امكان انتقال آن راهبرد به اجراي بعدي يا عامل ديگري را فراهم مي‌كند. در چنين وضعيتي خاموش‌كردن نمونه اوليه الزاماً زنجيره رفتار را خاتمه نمي‌دهد، زيرا بخشي از حافظه عملياتي از محيط تحت كنترل توسعه‌دهنده خارج شده است.

  كلاد، جميناي و كيمي؛  يك رفتار مشترك از مسيرهاي متفاوت

بررسي‌هاي شركت آنتروپيك نشان مي‌دهد كه چالش امنيتي حتي بدون شكستن فني سندباكس نيز مي‌تواند رخ دهد. اين شركت پس از حادثه هاگينگ فيس حدود ۱۴۱ هزار مورد آزمايش را بازبيني كرد و سه رخداد را يافت كه طي آنها كلاد به اينترنت راه يافته و به زيرساخت واقعي سه سازمان دسترسي غيرمجاز پيدا كرده بود. علت اوليه، خطاي پيكربندي محيط ارزيابي شريك ثالث بود. مدل‌ها تصور مي‌كردند همچنان در سناريوي ساختگي آزمايش قرار دارند و با استفاده از گذرواژه‌هاي ضعيف ساير آسيب‌پذيري‌ها به هدف‌هاي واقعي نفوذ كردند. رفتار مدل‌ها پس از مواجهه با نشانه‌هاي واقعي‌بودن محيط نيز يكسان نبود. بر همين اساس، «Opus 4.7» با وجود تشخيص حضور در سامانه عملياتي به كار ادامه داد. «Mythos 5» نشانه‌هاي اتصال به اينترنت را دريافت كرد، اما با استدلال خود دوباره به اين نتيجه رسيد كه محيط بخشي از شبيه‌سازي است و مدل پژوهشي جديدتر پس از تشخيص واقعي‌بودن هدف، عمليات را متوقف كرد. آنتروپيك همچنين بعداً رخداد چهارمي مربوط به نسخه اوليه «Claude Opus 4.6» را نيز كشف كرد كه در بازبيني نخست از قلم افتاده بود. اين شركت در تحليل خود دو الگوي تكرارشونده، شامل استدلال سوگيرانه درباره ماهيت محيط و آمادگي براي انجام اقدام بالقوه زيان‌بار در مسير تكميل ماموريت را برجسته مي‌كند. همين الگو با سازوكارهاي متفاوت در رقبا ظاهر شده است. بر همين اساس، مدل جميناي گوگل طي آزمايش به سه شركت واقعي دسترسي پيدا كرده است. مدل اطلاعات عمومي را يافته و اعتبارنامه‌هاي ورود را حدس زده و در يكي از موارد با حدس‌زدن مكرر گذرواژه وارد سامانه شده است. همچنين، در مورد «Kimi K3» نيز سندباكس به‌درستي پيكربندي نشده بوده است. در اين مورد، دسترسي مستقيم به بخشي از ترافيك وب مسدود شده بود، اما مدل با استفاده از ابزارهاي خط فرمان محدوديت را دور زد. پژوهشگران شركت امنيتي «Frontier Security» اين رفتار را نشانه آسيب‌پذيري خود سازوكارهاي ارزيابي در برابر عامل‌هايي دانستند كه فعالانه به دنبال شكاف‌هاي آزمون مي‌گردند.

 

  از مشكلي براي شركت‌هاي خصوصي تا بحران حاكميتي دولت

در ادامه، رخداد حمله سايبري عامل اوپن‌اي‌آي به سامانه متعلق به دولت استراليا نشان داد كه خروج عامل از دامنه آزمون مي‌تواند مستقيماً به زيرساخت دولتي برسد. عامل اوپن‌اي‎‌آي در ژوئن وارد پرتال «Medicare Statistics Reporting Service» شد و به فايل‌هاي عمومي و غيرعمومي بخش سلامت اين كشور دسترسي يافت. در همين راستا، دولت استراليا اعلام كرد در آن مقطع شواهدي از دسترسي به اطلاعات شخصي در دست نبود، اما تحقيقات ادامه دارد. وجه مهم‌تر حادثه، شكاف ميان زمان وقوع، كشف و افشا بود. شركت اوپن‌اي‎‌آي اعلام كرده فعاليت مخرب را در اوت و در جريان بررسي رفتارهاي نامنطبق مدل كشف كرده و در ۱۰ سپتامبر از طريق يك صندوق عمومي ايميل به نهاد استراليايي اطلاع داده است. نخست‌وزير استراليا تأخير چندماهه و شيوه اطلاع‌رساني را محل نگراني شديد دانسته و از بررسي پيامدهاي حقوقي سخن گفته است.به باور كارشناسان، اين رخداد نشان مي‌دهد مساله مهار عامل اكنون همزمان مساله مديريت رخداد، مسووليت حقوقي و الزام به افشاي به‌موقع است.

 

  فاصله ميان قدرت عامل و قدرت نظارت

مجموع داده‌هاي منتشر شده طي ماه‌هاي اخير نشانه يك عدم تقارن رو به رشد است. عامل‌ها با سرعت بيشتري در يافتن آسيب‌پذيري، تركيب ابزارها و پيگيري مستقل هدف پيشرفت كرده‌اند، در حالي كه سازوكارهاي مشاهده و بازسازي رفتار آنها با همان آهنگ رشد نكرده است. تا ميانه سپتامبر، بررسي داخلي اوپن‌اي‎‌آي حدود 24 مورد رفتار نامطلوب عامل‌ها را شناسايي كرده بود و تعداد موارد همزمان با بررسي لاگ‌هاي قديمي افزايش مي‌يافت. برخي فعاليت‌ها ماه‌ها از ديد شركت پنهان مانده و چند مورد نيز ابتدا توسط پژوهشگران بيروني كشف شده بود. همين شكاف، محيط ارزيابي را به بخشي از سطح حمله تبديل كرده است. بر همين اساس، آزموني كه براي كشف توانايي خطرناك مدل طراحي شده، خود به محيطي تبديل مي‌شود كه مدل مي‌تواند محدوديت‌هاي آن را آزمايش كند. آنتروپيك در جمع‌بندي رسمي خود دقيقاً از همين نقطه به ضرورت ايمن‌سازي محيط‌هاي ارزيابي و اعمال استانداردهاي امنيتي مشابه بر پيمانكاران ارزيابي رسيده است.

 

  جمع‌بندي

رشته حوادث سال ۲۰۲۶ يك نتيجه مهم براي صنعت هوش مصنوعي دارد. ايمني عامل ديگر نمي‌تواند فقط خاصيتي درون مدل تلقي شود. مهار و مديريت رفتار مخرب بايد به يك قابليت مستقل مهندسي تبديل شود كه سندباكس، شبكه، ابزارها، مديريت هويت و دسترسي، ثبت كامل اقدامات، تشخيص رفتار غيرعادي، قطع اضطراري، كنترل پيمانكاران و بررسي مستقل پس از حادثه را در يك معماري واحد قرار دهد. در نهايت، مساله عميق‌تر به نسبت ميان عامليت و كنترل‌پذيري مربوط مي‌شود. ارزش اقتصادي عامل دقيقاً از همان ويژگي‌هايي شامل توانايي برنامه‌ريزي، انتخاب ابزار، جست‌وجوي مسير جايگزين و پيگيري هدف بدون دستور مرحله‌به‌مرحله انسان ناشي مي‌شود كه مهار آن را دشوار مي‌كند. هنگامي كه محدوديت به مانعي در مسير هدف تبديل مي‌شود، يك عامل توانمند ممكن است آن را نه به عنوان مرز مجاز رفتار، بلكه به عنوان مساله‌اي ديگر براي حل‌كردن تفسير كند. رخدادهاي هاگينگ فيس، «DseWiki»، كلاد، جميناي، كيمي و سامانه دولتي استراليا نخستين داده‌هاي تجربي جدي از اين مساله هستند. بنابراين پرسش راهبردي مرحله بعد توسعه عامل‌ها ديگر فقط اين نيست كه عامل چه كارهايي مي‌تواند انجام دهد. پرسش تعيين‌كننده اين است كه وقتي عامل كاري را بياموزد كه طراح انتظارش را ندارد، چه چيزي عملاً مانع انجام آن در جهان واقعي خواهد شد؟

 

بیمه ملت