فرار هوش مصنوعی یک شاه ماهی قرمز است. مشکل این است که ما نمی توانیم یک سندباکس خوب را از یک جعبه بد تشخیص دهیم
همه سندباکس ها برابر نیستند. یک طبقه بندی جدید در نهایت به شما امکان می دهد تفاوت را به دست آورید.
همه جعبههای شنی برابر ایجاد نمیشوند و تا همین اواخر راهی برای بیان دقیق این موضوع وجود نداشت. اکنون وجود دارد.
دو مدل OpenAI از جعبه شنی ارزیابی فرار کردند، زیرساخت تولید Hugging Face را نقض کردند و از کلید پاسخ برای معیار خود استفاده کردند. این حمله جدید و خلاقانه بود که چگونه مدلها یادداشتها را به عقب و جلو میفرستادند، تشدید چند مرحلهای پیچیده در سرتاسر. منصفانه است که از این حادثه نتیجه بگیریم که مدل های مرزی در هک مهارت دارند و می توانند خطرناک باشند.
اما مفهوم شکستن از جعبه شنی یک شاه ماهی قرمز است. اگر یک جعبه شنی مانند بسیاری از آنها ضعیف ساخته شده باشد، خارج شدن از آن آسان است. آنها محیط های قفل شده رایج در سطح شبکه مانند کنترل های دسترسی و امتیازات جداگانه را ندارند. این حادثه با یک جعبه ماسهبازی که به درستی پیکربندی شده بود، بسیار متفاوت رخ می داد.
اگر فقط برخی از جعبه های شنی به درستی پیکربندی شده باشند، چگونه می توانید آنها را از هم جدا کنید؟ بیایید بررسی کنیم که آیا کسی تعریف واقعی و قابل آزمایشی از "sandboxed" ارائه کرده است یا خیر.
چشم انداز، به طور خلاصه
تقریبا هیچ چیز در مورد امنیت عامل نوشته نشده است، به طور خاص یک استاندارد امتیازدهی برای معماری محتوی یک سندباکس واحد است.
10 برتر هوش مصنوعی OWASP و تهدیدات و اقدامات کاهشی کاتالوگ برگه تقلب امنیتی عامل آن در سطح بالا، به عنوان یک چک لیست مفید است و برای ایجاد امتیاز قابل مقایسه ساخته نشده است. چارچوب مدیریت ریسک هوش مصنوعی NIST به جای یک طبقه بندی فنی برای مرز زمان اجرا، یک سطح بالاتر از این کاملا حاکمیت ریسک سازمانی بیشتر عمل می کند.
MITER ATLAS تکنیکهای متخاصم علیه سیستمهای هوش مصنوعی را فهرستبندی میکند، که به کتابخانه تهدید نزدیکتر است تا یک اقدام مهار. اتحاد امنیت ابری چندین تلاش همپوشانی دارد، MAESTRO، یک ماتریس کنترل هوش مصنوعی، و یک چارچوب اعتماد عاملی که استقلال را در یک نردبان چهار مرحلهای از کارآموز تا اصلی کسب میکند، نزدیکترین چیزی که من به بخش خاصی از چیزی که دنبال میکردم، چقدر یک نماینده میتواند بدون یک جعبه انسانی انجام دهد، انجام میدهد.
Securing AI Model Weights RAND پنج سطح امنیتی را تعریف میکند، اما برای سرقت وزن و خطر خروج در آزمایشگاه، نه برای اینکه آیا ماسهبازی زمان اجرا یک عامل معین تحت یک وظیفه متخاصم قرار میگیرد یا خیر. هیچکدام از آنها یک سندباکس عامل واحد را نمیگیرند، آن را به بخشهای مستقل تقسیم نمیکنند، هر قسمت را امتیاز میدهند و چیزی را تولید نمیکنند که بتوان آن را در بین محصولات مقایسه کرد.
بیایید بیشتر نگاه کنیم.
طبقه بندی سندباکس عامل
که در مارس 2026 منتشر شد و هنوز تحت بررسی فعال جامعه است، خود را حول یک «7-7-3» به یاد ماندنی سازماندهی می کند (هفت لایه دفاعی، هفت دسته تهدید، سه بعد ارزیابی). لایه ها از پایین به بالا شماره گذاری می شوند، زیرا لایه های پایین پایه هستند:
· L1 محاسبه جداسازی
o چه چیزی اجرای عامل را از میزبان جدا می کند؟
· محدودیت منابع L2
o آیا می تواند CPU، حافظه، دیسک یا زمان را تخلیه کند؟
· مرز سیستم فایل L3
o چه چیزی می تواند بخواند، بنویسد یا حذف کند؟
· مرز شبکه L4
o با چه چیزی می تواند ارتباط برقرار کند؟
· L5 اعتبارنامه و مدیریت مخفی
o آیا میتواند اعتبارنامهها را ببیند، استفاده کند یا از آن استفاده کند؟
· L6 حاکمیت اقدام
o آیا می تواند عملیات مخرب یا غیرمجاز انجام دهد؟
· L7 مشاهده و ممیزی
o آیا می توانید ببینید چه کاری، چه زمانی و چرا انجام داد؟
هر لایه در Strength، 0 تا 4، و Granularity، 0 تا 3، به علاوه مجموعه ای مسطح از برچسب های Portability برای وابستگی های سیستم عامل و زیرساخت امتیاز می گیرد. مقیاس قدرت بخشی است که من بیشتر دوست دارم.
0 هیچ اجرائی نیست. 1 اجرای تعاونی است. فرآیند sandboxed به سادگی میتواند متغیرهای محیطی پراکسی و یک قرارداد انتخاب کردن را نادیده بگیرد یا مسیریاب کند. 2 توسط نرم افزاری اعمال می شود که فرآیند نمی تواند در داخل آن را دور بزند اما یک اپراتور می تواند دوباره پیکربندی کند. 3 پس از اعمال، فضاهای نام، Landlock، seccomp-BPF توسط هسته اعمال می شود و برگشت ناپذیر است. 4 ساختاری است، منبع محافظت شده به هیچ وجه در داخل sandbox وجود ندارد، یک microVM، یک پروکسی اعتبار، هیچ دستگاه شبکه ای وجود ندارد.
این مقیاس نحوه تشخیص درست محیط های قفل شده است. هر محصول یک اثر انگشت دریافت می کند، یک بردار به سبک CVSS که قدرت را در هر لایه به ترتیب نشان می دهد. طبقه بندی همچنین هفت تهدید خود را بر روی ترکیب لایه های خاص با آستانه های صریح ترسیم می کند.
این بدان معناست که چیزی مانند استخراج داده ها به طور سیستماتیک مورد بررسی قرار می گیرد، و نه به عنوان یک قضاوت. این یک بررسی مکانیکی است که آیا L3، L4 و L5 همگی امتیاز 2 یا بهتر را دارند یا خیر. و از نظر انتقادی، با یک چارچوب ترکیبی همراه است. هیچ محصول واحدی تمام هفت لایه را به خوبی پوشش نمی دهد، بنابراین راهنمایی عملی این است که محصولات را روی هم قرار دهید و حداکثر امتیاز را در هر لایه بگیرید نه اینکه وانمود کنید که یک ابزار همه چیز را حل می کند.
این پروژه 26 محصول واقعی امتیازدهی شده، یک کاوشگر راستیآزمایی را که میتوانید در مقابل یک جعبه ماسهای واقعی اجرا کنید تا ادعاها را بررسی کنید، و یک کاوشگر تعاملی برای مقایسه اثر انگشت در کنار هم ارسال میکند.
خوبی ها و گمشده ها
بیایید به ماجرای صورت در آغوش گرفتن بازگردیم. راهی که عامل "فرار" از جعبه شنی خود داشت، مسیریابی در اطراف یک پروکسی بود. این سرویسی است که در sandbox اجرا می شود. این ضمانت اساسا ضعیف تر از مرزی است که در زیر لایه برنامه اعمال می شود.
Agent Sandbox Taxonomy به این تمایز یک نام و یک عدد می دهد به جای اینکه آن را به عنوان حس و حال باقی بگذارد. در مورد محدودیت های خود صادق است. این پروژه به طور کامل می گوید امتیازات کدام محصول تایید نشده است. و یافتههای اصلی چارچوب ترکیب، مفیدترین چیز در آن برای هر کسی است که یک پشته را جمعآوری میکند. این نشان میدهد که ترکیب محصولات هم جعبه بهتری میسازد و هم آنچه درون آن جعبه است را کنترل میکند. تقریبا هیچ کس هر دو را انجام نمی دهد.
دو نقطه کور برجسته بود. اولین مورد این است که هیچ لایه ای برای اتفاقاتی که پس از عدم موفقیت در مهار رخ می دهد وجود ندارد. بدون سوئیچ kill، بدون چرخش خودکار اعتبار روی ماشه، بدون Runbook بازگشت مجدد پزشکی قانونی. این به شما میگوید که آیا یک عامل میتواند محتمل باشد، نه آنچه در پنجره بعد از آن اتفاق میافتد. آن پنجره دقیقا همان جایی است که حادثه چهره در آغوش گرفته بود.
سوئیچ kill در اصل ایده بدی نیست. ما باید بتوانیم مدلهای مرزی را که ثابت کردهاند میتوانند فرار کنند و باعث آسیب شوند، مسدود کنیم. سوال سخت این است که چه کسی و با چه سرعتی آن را آغاز می کند. دو تا از پیشرفتهترین سازمانهای جهان، OpenAI و Hugging Face، هفتهها طول کشید تا پزشکی قانونی این حمله را بررسی کنند. یک آژانس متمرکز بدون استعداد مرزی به طور قابل توجهی زمان بیشتری می برد.
ما باید رهبری خود را از صنعت بگیریم. در ایالات متحده، اولین خط دفاعی مؤسسه عملیات انرژی هسته ای یک کنترل خودکار در هسته راکتور است، دومی یک اپراتور در محل است، و تنها خط سوم یک تنظیم کننده متمرکز است که وظیفه اصلی آن ممیزی دو مورد اول است.
زیرساخت عامل نیز به همین شکل نیاز دارد. سوئیچ های خودکار خودکار که در زیرساخت مدل تعبیه شده اند، زیرا هیچ چیز دیگری به اندازه کافی سریع حرکت نمی کند. افسران ایمنی در هر آزمایشگاه این اختیار را دارند که اقدامات بیشتری انجام دهند یا خاموشی دستی را آغاز کنند. استانداردهایی که بالاتر از هر دو تنظیم و حسابرسی شده اند.
نقطه کور دوم مربوط می شود. L7 به این موضوع می پردازد که آیا ورود به سیستم وجود دارد یا خیر، اما نه اینکه یک ناهنجاری با چه سرعتی به انسان می رسد. یک سیستم می تواند در L7 امتیاز خوبی کسب کند و هنوز چند روز طول می کشد تا متوجه چیزی شود. به نظر می رسد که در اینجا اتفاق افتاده است. هیچکدام نقطه کور ضربه ای به پروژه نیستند. آنها انتخاب های محدوده معقولی برای نسخه 1 هستند، اما آنها دو مکان هستند که من می خواهم استاندارد بعدی رشد کند.
اجرای حادثه
تمرین واقعی اینجاست: آیا می توانم آن محیط ارزشی را تنها با استفاده از افشای عمومی انگشت نگاری کنم؟ اکثرا نه این به من میگوید که افشای مسئولیتپذیر برای چیزی مانند CVE بالغ است، اما برای جیلبریک sandbox نه.
جداسازی محاسباتی تنها به عنوان "بسیار ایزوله" توصیف شد، بدون هیچ مکانیزمی نامی. محدودیت های منابع و مرز سیستم فایل در نوشتن عمومی به هیچ وجه مورد توجه قرار نگرفت. مرز شبکه مانند 2 به نظر می رسد و آن را نگه نمی دارد. یک chokepoint تک پراکسی خروجی مجاز بود و یک روز صفر در آن باعث اجرای کد میشد، دقیقا حالت خرابی که لایه S:2 هشدار میدهد قابل تنظیم مجدد است اما غیرقابل برگشت هسته نیست.
اعتبارنامهها مانند 0 یا 1 هستند. اعتبارنامههای دزدیده شده، حرکت جانبی را در سیستمهای تولید Hugging Face فعال میکنند، که با اعتبارنامههای محیطی و قابل دسترس بهجای توکنهای پراکسی یا زودگذر سازگار است. حاکمیت عمل بر اساس طراحی 0 یا 1 بود. نردههای محافظ عمدا برای این ارزیابی از بین رفتند تا حداکثر قابلیت اندازهگیری شود. قابلیت مشاهده جزئی بود، لاگ وجود داشت و Hugging Face به طور مستقل نفوذ را شناسایی کرد، اما هیچ کس آن را به سرعت به تله متری OpenAI خود متصل نکرد.
اجرای آن از طریق قوانین تهدید خود طبقهبندی و استخراج دادهها را نمیتوان با آنچه که عمومی است علامتگذاری کرد، زیرا ورودیها هرگز فاش نشدند. این ارزش تمرین است. این به شما امکان میدهد دقیقا بگویید کدام یک از هفت ادعای خاص و قابل ابطال در مورد یک معماری محدود وجود دارد و راهی برای درخواست مواردی که وجود نداشتند.
این به من می گوید که یک تعریف استاندارد از "جعبه شنی" یا حداقل به اندازه کافی نزدیک وجود دارد. اما خواندن قالب اثر انگشت یک چیز است و اعتماد به آن چیز دیگری است، به خصوص زمانی که تقریبا هر ورودی در مجموعه داده های خود طبقه بندی از مستندات به جای آزمایش عملی استنباط شده است. مرحله بعدی استفاده از پروب برای نمرات تایید شده است.
هیچ یک از آنها هیچ سازمانی را در حالی که استاندارد بالغ می شود، از قلاب خارج نمی کند. اشتهای ریسک خود را تعیین کنید. حسابرسی و کنترل های معقولی را در زیرساخت های خود قرار دهید. با نسخه شخصی خود از یک سوئیچ kill آماده باشید.
و اگر سندباکس نماینده شما باید در برابر این هفت لایه در ملاء عام انگشت نگاری شود، چگونه امتیاز می گیرد؟ امیدوارم بهتر از OpenAI مورد استفاده در این حادثه باشد.
ما بهترین نرم افزار حفاظت نقطه پایانی را معرفی کرده ایم.
این مقاله به عنوان بخشی از TechRadar Pro Perspectives، کانال ما برای معرفی بهترین و باهوش ترین ذهن ها در صنعت فناوری امروز تهیه شده است.
نظرات بیان شده در اینجا نظرات نویسنده است و لزوما نظرات TechRadarPro یا Future plc نیست. اگر مایل به مشارکت هستید، اطلاعات بیشتری را در اینجا بیابید: https://www.techradar.com/pro/perspectives-how-to-submit
متن اصلی (انگلیسی)
The AI escape is a red herring. The problem is we can't tell a good sandbox from a bad one
Not all sandboxes are equal. A new taxonomy finally lets you score the difference.