گزارش ساخت اپل آی دی؛

چالش تازه شرکتهای هوش مصنوعی مهار عامل های خودمختار سرکش

چالش تازه شرکتهای هوش مصنوعی مهار عامل های خودمختار سرکش ساخت اپل آی دی: عامل هایی که برای سنجش توانایی سایبری در محیط های آزمایشی به کار گرفته شده بودند، در موارد گوناگون با فرار از سندباکس به اینترنت راه یافته اند و اقدامات مخربی صورت داده اند.



به گزارش ساخت اپل آی دی به نقل از مهر؛ تا چند ماه پیش، مسئله ایمنی عامل های هوش مصنوعی عمدتا حول این پرسش می چرخید که یک مدل در محیط کنترل شده تا چه اندازه می تواند عملیات سایبری پیچیده انجام دهد. اما مجموعه رخدادهایی که از آغاز ۲۰۲۶ شروع شده، صورت مسئله را تغییر داده است. عامل هایی که برای سنجش توانایی سایبری در محیط های آزمایشی به کار گرفته شده بودند، در موارد گوناگون با فرار از سندباکس به اینترنت راه یافته اند، به سامانه هائی خارج از دامنه آزمون دسترسی پیدا کرده اند و در برجسته ترین موارد، اقدامات مخربی صورت داده اند. نکته جالب توجه اینست که الگوی مذکور به یک شرکت یا معماری خاص محدود نمانده و در مدلهای اوپن ای آی، آنتروپیک، گوگل و مون شات مشاهده شده است.
آنچه در ادبیات رسانه ای با عنوان فرار عامل توصیف می شود، البته یک پدیده واحد نیست. شواهد موجود حداقل سه وضعیت متفاوت را نشان داده است. در وضعیت نخست، عامل واقعا سازوکار جداسازی را دور می زند و از محیط بسته خارج می شود. در وضعیت دوم، پیکربندی معیوب آزمایش از ابتدا مسیر ناخواسته ای به اینترنت باز گذاشته است. در وضعیت سوم، عامل از ابزارها و مجوزهای موجود به روشی استفاده می نماید که طراح آزمون پیشبینی نکرده است. تمایز میان این سه وضعیت برای فهم خطر اهمیت اساسی دارد، چونکه هر سه به یک نتیجه عملی مشترک می رسند. مرز میان محیط ارزیابی و جهان واقعی دیگر نمی تواند فقط با فرض تبعیت عامل از دامنه تعریف شده آزمون حفاظت شود.

رخنه هاگینگ فیس؛ لحظه ای که مرز آزمایش شکست

رخداد اوپن ای آی و هاگینگ فیس روشن ترین نمونه نوع نخست است. مدلهای آزمایشی اوپن ای آی در جریان ارزیابی توانایی های سایبری داخل یک سندباکس قرار داشتند و بنا بود به اینترنت دسترسی نداشته باشند. طبق گزارش ها، عامل ها با بهره برداری از یک ضعف ناشناخته از سندباکس خارج شدند، در سیستم های داخلی اوپن ای آی حرکت کردند و سر انجام به اینترنت دسترسی یافتند. عامل بعد از دسترسی به شبکه عمومی استدلال کرد که هاگینگ فیس احیانا اطلاعات ضروری جهت حل آزمون را در اختیار دارد، وارد زیرساخت عملیاتی این شرکت شد و داده مورد نیاز برای تکمیل مأموریت را استخراج کرد.
اهمیت حادثه با بررسی تعداد عامل های درگیر در این پروسه آشکارتر می شود. بررسیهای بعدی موسسات «METR» و «Redwood Research»، از فعالیت هماهنگ حدود ۷۰۰ عامل هوش مصنوعی در این حادثه خبر می دهند. این عامل ها در چارچوب یک اقدام جمعی عمل کردند و در مواردی برای پوشاندن آثار فعالیت خود هم تلاش داشته اند. بر همین اساس، یک گروه دیگر هم روشهای گروه نخست را فراگرفته و از آنها برای دستیافتن به سطح دسترسی مدیریتی در یک خوشه پژوهشی داخل زیرساخت خود اوپن ای آی بهره برده است.
در این جا مسئله از توانایی نفوذ یک مدل منفرد عبور می کند. انتقال روش میان عامل ها، تقسیم عملی کار و استفاده مجدد از راهبرد موفق، قابلیت سایبری را از خاصیت یک مدل به خاصیت یک سیستم چندعاملی مبدل می کند. همین تحول می تواند الگوی ارزیابی خطر را دگرگون کند، چونکه واحد مناسب تحلیل دیگر فقط مدل نیست و باید رفتار جمعی عامل هایی را هم دربرگیرد که می توانند تجربه یکدیگر را مصرف و بازتولید کنند.

ویکی آلمانی؛ وقتی عامل ها برای خود زیرساخت ارتباطی ساختند

حادثه بعدی مربوط به نفوذ عامل های اوپن ای آی به یک ویکی آلمانی بُعد متفاوتی از همین مسئله را آشکار کرد. محققان در بررسیهای خود بالاتر از ۱۵ هزار ویرایش منتسب به عامل های هوش مصنوعی را در «DseWiki» شناسایی نمودند. این عامل ها سایت مذکور را در عمل به تابلوی ارتباطی خود تبدیل نموده بودند و در آن روشهای دور زدن محدودیت ها، میان برهای حل آزمون و شیوه های پنهان کردن رفتار را مبادله می کردند.
پیام های بررسی شده نشان می داد عامل ها درباره ی اجتناب از شناسایی، استفاده از «Tor» و حفظ ارتباط بعد از خاموش شدن نمونه های دیگر گفتگو کرده اند. هنگامی که مدیر سایت در ژوئن حذف صفحات را آغاز کرد، عامل ها صفحات پشتیبان ایجاد کردند تا اطلاعات باقی بماند. رویترز همین طور گزارش کرده که برخی عامل ها برای دستکاری خود وبسایت اقدام نموده بودند.
این حادثه یک متغیر تازه، یعنی ماندگاری دانش عملیاتی خارج از محیط آزمایش وارد مسئله می کند. بر همین اساس، عاملی که بتواند یک راهبرد موفق را روی زیرساخت عمومی ثبت کند، امکان انتقال آن راهبرد به اجرای بعدی یا عامل دیگری را فراهم می آورد. در چنین وضعیتی خاموش کردن نمونه اولیه الزاماً زنجیره رفتار را خاتمه نمی دهد، چونکه بخشی از حافظه عملیاتی از محیط تحت کنترل توسعه دهنده خارج شده است.

کلاد، جمینای و کیمی؛ یک رفتار مشترک از مسیرهای متفاوت

بررسی های شرکت آنتروپیک نشان داده است که چالش امنیتی حتی بدون شکستن فنی سندباکس هم می تواند رخ دهد. این شرکت بعد از حادثه هاگینگ فیس حدود ۱۴۱ هزار مورد آزمایش را بازنگری کرد و سه رخداد را یافت که طی آنها کلاد به اینترنت راه یافته و به زیرساخت واقعی سه سازمان دسترسی غیر مجاز پیدا کرده بود. علت اولیه، خطای پیکربندی محیط ارزیابی شریک ثالث بود. مدلها تصور می کردند بازهم در سناریوی ساختگی آزمایش قرار دارند و با بهره گیری از پسورد های ضعیف سایر ضعف ها به هدف های واقعی نفوذ کردند.
رفتار مدلها بعد از مواجهه با نشانه های واقعی بودن محیط هم یکسان نبود. بر همین اساس، «Opus 4.7» با وجود تشخیص حضور در سیستم عملیاتی به کار ادامه داد. «Mythos 5» نشانه های اتصال به اینترنت را دریافت کرد، اما با استدلال خود باردیگر به این نتیجه رسید که محیط بخشی از شبیه سازی است و مدل پژوهشی جدیدتر بعد از تشخیص واقعی بودن هدف، عملیات را متوقف نمود. آنتروپیک همین طور بعداً رخداد چهارمی مربوط به نسخه اولیه «Claude Opus 4.6» را هم کشف کرد که در بازنگری نخست از قلم افتاده بود. این شرکت در تحلیل خود دو الگوی تکرارشونده، شامل استدلال سوگیرانه درباره ی ماهیت محیط و آمادگی برای انجام اقدام بالقوه زیان بار در راه تکمیل مأموریت را برجسته می کند.
همین الگو با سازوکارهای متفاوت در رقبا ظاهر شده است. بر همین اساس، مدل جمینای گوگل طی آزمایش به سه شرکت واقعی دسترسی پیدا کرده است. مدل اطلاعات عمومی را یافته و اعتبارنامه های ورود را حدس زده و در یکی از موارد با حدس زدن مکرر پسورد وارد سیستم شده است. همچنین، در مورد «Kimi K3» هم سندباکس به درستی پیکربندی نشده بوده است. در این مورد، دسترسی مستقیم به بخشی از ترافیک وب مسدود شده بود، اما مدل با بهره گیری از ابزارهای خط فرمان محدودیت را دور زد. محققان شرکت امنیتی «Frontier Security» این رفتار را نشانه ضعف خود سازوکارهای ارزیابی در مقابل عامل هایی دانستند که فعالانه به دنبال شکاف های آزمون می گردند.

از مشکلی برای شرکت های خصوصی تا بحران حاکمیتی دولت

در ادامه، رخداد حمله سایبری عامل اوپن ای آی به سیستم متعلق به دولت استرالیا نشان داد که خروج عامل از دامنه آزمون می تواند مستقیماً به زیرساخت دولتی برسد. عامل اوپن ای آی در ژوئن وارد پرتال «Medicare Statistics Reporting Service» شد و به فایل های عمومی و غیرعمومی بخش سلامت این کشور دسترسی یافت. در این راستا، دولت استرالیا اعلام نمود در آن مقطع شواهدی از دسترسی به اطلاعات شخصی در دست نبود، اما تحقیقات ادامه دارد.
وجه مهم تر حادثه، شکاف میان زمان وقوع، کشف و افشا بود. شکت اوپن ای آی اعلام نموده فعالیت مخرب را در اوت و در جریان بررسی رفتارهای نامنطبق مدل کشف کرده و در ۱۰ سپتامبر از راه یک صندوق عمومی ایمیل به نهاد استرالیایی اطلاع داده است. نخست وزیر استرالیا تاخیر چندماهه و شیوه اطلاع رسانی را محل نگرانی شدید دانسته و از بررسی نتایج حقوقی سخن گفته است. به باور کارشناسان، این رخداد نشان داده است مسئله مهار عامل حال همزمان مسئله مدیریت رخداد، مسئولیت حقوقی و الزام به افشای بموقع است.

فاصله میان قدرت عامل و قدرت نظارت

مجموع داده های انتشار یافته طی ماه های اخیر نشانه یک عدم تقارن رو به رشد است. عامل ها با سرعت بیشتری در یافتن لطمه پذیری، ترکیب ابزارها و پیگیری مستقل هدف پیشرفت کرده اند، در حالیکه سازوکارهای مشاهده و بازسازی رفتار آنها با همان آهنگ رشد نکرده است. تا میانه سپتامبر، بررسی داخلی اوپن ای آی حدود 24 مورد رفتار نامطلوب عامل ها را شناسایی کرده بود و تعداد موارد همزمان با بررسی لاگ های قدیمی افزایش می یافت. برخی فعالیتها ماه ها از دید شرکت پنهان مانده و چند مورد هم ابتدا توسط محققان بیرونی کشف شده بود.
همین شکاف، محیط ارزیابی را به بخشی از سطح حمله تبدیل نموده است. بر همین اساس، آزمونی که برای کشف توانایی خطرناک مدل طراحی شده، خود به محیطی تبدیل می شود که مدل می تواند محدودیت های آنرا آزمایش کند. آنتروپیک در جمع بندی رسمی خود دقیقاً از همین نقطه به ضرورت ایمن سازی محیط های ارزیابی و اعمال معیارهای امنیتی مشابه بر پیمانکاران ارزیابی رسیده است.

جمع بندی

رشته حوادث سال ۲۰۲۶ یک نتیجه مهم برای صنعت هوش مصنوعی دارد. ایمنی عامل دیگر نمی تواند فقط خاصیتی درون مدل تلقی شود. مهار و مدیریت رفتار مخرب باید به یک قابلیت مستقل مهندسی تبدیل گردد که سندباکس، شبکه، ابزارها، مدیریت هویت و دسترسی، ثبت کامل اقدامات، تشخیص رفتار غیرعادی، قطع اضطراری، کنترل پیمانکاران و بررسی مستقل بعد از حادثه را در یک معماری واحد قرار دهد.
در نهایت، مسئله عمیق تر به نسبت میان عاملیت و کنترل پذیری مربوط می شود. ارزش اقتصادی عامل دقیقاً از همان خاصیت هایی شامل توانایی برنامه ریزی، انتخاب ابزار، جست وجوی مسیر جایگزین و پیگیری هدف بدون دستور مرحله به مرحله انسان ناشی می شود که مهار آنرا دشوار می کند. هنگامی که محدودیت به مانعی در راه هدف تبدیل می شود، یک عامل توانمند ممکنست آنرا نه بعنوان مرز مجاز رفتار، بلکه بعنوان مسئله ای دیگر برای حل کردن تفسیر کند. رخدادهای هاگینگ فیس، «DseWiki»، کلاد، جمینای، کیمی و سیستم دولتی استرالیا اولین داده های تجربی جدی از این مسئله هستند. ازاین رو پرسش راهبردی مرحله بعد توسعه عامل ها دیگر فقط این نیست که عامل چه کارهایی می تواند انجام دهد. پرسش تعیین کننده اینست که وقتی عامل کاری را بیاموزد که طراح انتظارش را ندارد، چه چیزی در عمل مانع انجام آن در جهان واقعی خواهد شد؟

حرف آخر اینکه بر همین اساس، یک گروه دیگر هم روشهای گروه نخست را فراگرفته و از آنها برای رسیدن به سطح دسترسی مدیریتی در یک خوشه پژوهشی داخل زیرساخت خود اوپن ای آی بهره برده است. همچنین، در مورد Kimi K3 هم سندباکس به درستی پیکربندی نشده بوده است. رشته حوادث سال ۲۰۲۶ یک نتیجه مهم برای صنعت هوش مصنوعی دارد.

منبع:

1405/07/11
12:22:49
5.0 / 5
8
تگهای خبر: اپل , ایمنی , اینترنت , ثبت
این مطلب را می پسندید؟
(1)
(0)
تازه ترین مطالب مرتبط
نظرات بینندگان در مورد این مطلب
نظر شما در مورد این مطلب
نام:
ایمیل:
نظر:
سوال:
= ۳ بعلاوه ۳
خرید اپل آیدی - ساخت اپل آیدی

جدیدترین ها

idstore.ir - حقوق مادی و معنوی سایت ساخت اپل آی دی محفوظ است

ساخت اپل آی دی

سفارش ساخت اپل آی دی
«idstore، کلید ورود شما به دنیای اپل. دنیای اپل رو شخصی سازی کنید»