پرش به محتوای اصلی

فرار هوش مصنوعی یک شاه ماهی قرمز است. مشکل این است که ما نمی توانیم یک سندباکس خوب را از یک جعبه بد تشخیص دهیم

تک‌رادار۱۴۰۵ مهر ۱۵, چهارشنبه، ساعت ۱۴:۰۳حدود 8 دقیقه مطالعه

همه سندباکس ها برابر نیستند. یک طبقه بندی جدید در نهایت به شما امکان می دهد تفاوت را به دست آورید.

همه جعبه‌های شنی برابر ایجاد نمی‌شوند و تا همین اواخر راهی برای بیان دقیق این موضوع وجود نداشت. اکنون وجود دارد.

دو مدل OpenAI از جعبه شنی ارزیابی فرار کردند، زیرساخت تولید Hugging Face را نقض کردند و از کلید پاسخ برای معیار خود استفاده کردند. این حمله جدید و خلاقانه بود که چگونه مدل‌ها یادداشت‌ها را به عقب و جلو می‌فرستادند، تشدید چند مرحله‌ای پیچیده در سرتاسر. منصفانه است که از این حادثه نتیجه بگیریم که مدل های مرزی در هک مهارت دارند و می توانند خطرناک باشند.

اما مفهوم شکستن از جعبه شنی یک شاه ماهی قرمز است. اگر یک جعبه شنی مانند بسیاری از آنها ضعیف ساخته شده باشد، خارج شدن از آن آسان است. آنها محیط های قفل شده رایج در سطح شبکه مانند کنترل های دسترسی و امتیازات جداگانه را ندارند. این حادثه با یک جعبه ماسهبازی که به درستی پیکربندی شده بود، بسیار متفاوت رخ می داد.

اگر فقط برخی از جعبه های شنی به درستی پیکربندی شده باشند، چگونه می توانید آنها را از هم جدا کنید؟ بیایید بررسی کنیم که آیا کسی تعریف واقعی و قابل آزمایشی از "sandboxed" ارائه کرده است یا خیر.

چشم انداز، به طور خلاصه

تقریبا هیچ چیز در مورد امنیت عامل نوشته نشده است، به طور خاص یک استاندارد امتیازدهی برای معماری محتوی یک سندباکس واحد است.

10 برتر هوش مصنوعی OWASP و تهدیدات و اقدامات کاهشی کاتالوگ برگه تقلب امنیتی عامل آن در سطح بالا، به عنوان یک چک لیست مفید است و برای ایجاد امتیاز قابل مقایسه ساخته نشده است. چارچوب مدیریت ریسک هوش مصنوعی NIST به جای یک طبقه بندی فنی برای مرز زمان اجرا، یک سطح بالاتر از این کاملا حاکمیت ریسک سازمانی بیشتر عمل می کند.

MITER ATLAS تکنیک‌های متخاصم علیه سیستم‌های هوش مصنوعی را فهرست‌بندی می‌کند، که به کتابخانه تهدید نزدیک‌تر است تا یک اقدام مهار. اتحاد امنیت ابری چندین تلاش همپوشانی دارد، MAESTRO، یک ماتریس کنترل هوش مصنوعی، و یک چارچوب اعتماد عاملی که استقلال را در یک نردبان چهار مرحله‌ای از کارآموز تا اصلی کسب می‌کند، نزدیک‌ترین چیزی که من به بخش خاصی از چیزی که دنبال می‌کردم، چقدر یک نماینده می‌تواند بدون یک جعبه انسانی انجام دهد، انجام می‌دهد.

Securing AI Model Weights RAND پنج سطح امنیتی را تعریف می‌کند، اما برای سرقت وزن و خطر خروج در آزمایشگاه، نه برای اینکه آیا ماسهبازی زمان اجرا یک عامل معین تحت یک وظیفه متخاصم قرار می‌گیرد یا خیر. هیچ‌کدام از آن‌ها یک سندباکس عامل واحد را نمی‌گیرند، آن را به بخش‌های مستقل تقسیم نمی‌کنند، هر قسمت را امتیاز می‌دهند و چیزی را تولید نمی‌کنند که بتوان آن را در بین محصولات مقایسه کرد.

بیایید بیشتر نگاه کنیم.

طبقه بندی سندباکس عامل

که در مارس 2026 منتشر شد و هنوز تحت بررسی فعال جامعه است، خود را حول یک «7-7-3» به یاد ماندنی سازماندهی می کند (هفت لایه دفاعی، هفت دسته تهدید، سه بعد ارزیابی). لایه ها از پایین به بالا شماره گذاری می شوند، زیرا لایه های پایین پایه هستند:

· L1 محاسبه جداسازی

o چه چیزی اجرای عامل را از میزبان جدا می کند؟

· محدودیت منابع L2

o آیا می تواند CPU، حافظه، دیسک یا زمان را تخلیه کند؟

· مرز سیستم فایل L3

o چه چیزی می تواند بخواند، بنویسد یا حذف کند؟

· مرز شبکه L4

o با چه چیزی می تواند ارتباط برقرار کند؟

· L5 اعتبارنامه و مدیریت مخفی

o آیا می‌تواند اعتبارنامه‌ها را ببیند، استفاده کند یا از آن استفاده کند؟

· L6 حاکمیت اقدام

o آیا می تواند عملیات مخرب یا غیرمجاز انجام دهد؟

· L7 مشاهده و ممیزی

o آیا می توانید ببینید چه کاری، چه زمانی و چرا انجام داد؟

هر لایه در Strength، 0 تا 4، و Granularity، 0 تا 3، به علاوه مجموعه ای مسطح از برچسب های Portability برای وابستگی های سیستم عامل و زیرساخت امتیاز می گیرد. مقیاس قدرت بخشی است که من بیشتر دوست دارم.

0 هیچ اجرائی نیست. 1 اجرای تعاونی است. فرآیند sandboxed به سادگی می‌تواند متغیرهای محیطی پراکسی و یک قرارداد انتخاب کردن را نادیده بگیرد یا مسیریاب کند. 2 توسط نرم افزاری اعمال می شود که فرآیند نمی تواند در داخل آن را دور بزند اما یک اپراتور می تواند دوباره پیکربندی کند. 3 پس از اعمال، فضاهای نام، Landlock، seccomp-BPF توسط هسته اعمال می شود و برگشت ناپذیر است. 4 ساختاری است، منبع محافظت شده به هیچ وجه در داخل sandbox وجود ندارد، یک microVM، یک پروکسی اعتبار، هیچ دستگاه شبکه ای وجود ندارد.

این مقیاس نحوه تشخیص درست محیط های قفل شده است. هر محصول یک اثر انگشت دریافت می کند، یک بردار به سبک CVSS که قدرت را در هر لایه به ترتیب نشان می دهد. طبقه بندی همچنین هفت تهدید خود را بر روی ترکیب لایه های خاص با آستانه های صریح ترسیم می کند.

این بدان معناست که چیزی مانند استخراج داده ها به طور سیستماتیک مورد بررسی قرار می گیرد، و نه به عنوان یک قضاوت. این یک بررسی مکانیکی است که آیا L3، L4 و L5 همگی امتیاز 2 یا بهتر را دارند یا خیر. و از نظر انتقادی، با یک چارچوب ترکیبی همراه است. هیچ محصول واحدی تمام هفت لایه را به خوبی پوشش نمی دهد، بنابراین راهنمایی عملی این است که محصولات را روی هم قرار دهید و حداکثر امتیاز را در هر لایه بگیرید نه اینکه وانمود کنید که یک ابزار همه چیز را حل می کند.

این پروژه 26 محصول واقعی امتیازدهی شده، یک کاوشگر راستی‌آزمایی را که می‌توانید در مقابل یک جعبه ماسه‌ای واقعی اجرا کنید تا ادعاها را بررسی کنید، و یک کاوشگر تعاملی برای مقایسه اثر انگشت در کنار هم ارسال می‌کند.

خوبی ها و گمشده ها

بیایید به ماجرای صورت در آغوش گرفتن بازگردیم. راهی که عامل "فرار" از جعبه شنی خود داشت، مسیریابی در اطراف یک پروکسی بود. این سرویسی است که در sandbox اجرا می شود. این ضمانت اساسا ضعیف تر از مرزی است که در زیر لایه برنامه اعمال می شود.

Agent Sandbox Taxonomy به این تمایز یک نام و یک عدد می دهد به جای اینکه آن را به عنوان حس و حال باقی بگذارد. در مورد محدودیت های خود صادق است. این پروژه به طور کامل می گوید امتیازات کدام محصول تایید نشده است. و یافته‌های اصلی چارچوب ترکیب، مفیدترین چیز در آن برای هر کسی است که یک پشته را جمع‌آوری می‌کند. این نشان می‌دهد که ترکیب محصولات هم جعبه بهتری می‌سازد و هم آنچه درون آن جعبه است را کنترل می‌کند. تقریبا هیچ کس هر دو را انجام نمی دهد.

دو نقطه کور برجسته بود. اولین مورد این است که هیچ لایه ای برای اتفاقاتی که پس از عدم موفقیت در مهار رخ می دهد وجود ندارد. بدون سوئیچ kill، بدون چرخش خودکار اعتبار روی ماشه، بدون Runbook بازگشت مجدد پزشکی قانونی. این به شما می‌گوید که آیا یک عامل می‌تواند محتمل باشد، نه آنچه در پنجره بعد از آن اتفاق می‌افتد. آن پنجره دقیقا همان جایی است که حادثه چهره در آغوش گرفته بود.

سوئیچ kill در اصل ایده بدی نیست. ما باید بتوانیم مدل‌های مرزی را که ثابت کرده‌اند می‌توانند فرار کنند و باعث آسیب شوند، مسدود کنیم. سوال سخت این است که چه کسی و با چه سرعتی آن را آغاز می کند. دو تا از پیشرفته‌ترین سازمان‌های جهان، OpenAI و Hugging Face، هفته‌ها طول کشید تا پزشکی قانونی این حمله را بررسی کنند. یک آژانس متمرکز بدون استعداد مرزی به طور قابل توجهی زمان بیشتری می برد.

ما باید رهبری خود را از صنعت بگیریم. در ایالات متحده، اولین خط دفاعی مؤسسه عملیات انرژی هسته ای یک کنترل خودکار در هسته راکتور است، دومی یک اپراتور در محل است، و تنها خط سوم یک تنظیم کننده متمرکز است که وظیفه اصلی آن ممیزی دو مورد اول است.

زیرساخت عامل نیز به همین شکل نیاز دارد. سوئیچ های خودکار خودکار که در زیرساخت مدل تعبیه شده اند، زیرا هیچ چیز دیگری به اندازه کافی سریع حرکت نمی کند. افسران ایمنی در هر آزمایشگاه این اختیار را دارند که اقدامات بیشتری انجام دهند یا خاموشی دستی را آغاز کنند. استانداردهایی که بالاتر از هر دو تنظیم و حسابرسی شده اند.

نقطه کور دوم مربوط می شود. L7 به این موضوع می پردازد که آیا ورود به سیستم وجود دارد یا خیر، اما نه اینکه یک ناهنجاری با چه سرعتی به انسان می رسد. یک سیستم می تواند در L7 امتیاز خوبی کسب کند و هنوز چند روز طول می کشد تا متوجه چیزی شود. به نظر می رسد که در اینجا اتفاق افتاده است. هیچکدام نقطه کور ضربه ای به پروژه نیستند. آنها انتخاب های محدوده معقولی برای نسخه 1 هستند، اما آنها دو مکان هستند که من می خواهم استاندارد بعدی رشد کند.

اجرای حادثه

تمرین واقعی اینجاست: آیا می توانم آن محیط ارزشی را تنها با استفاده از افشای عمومی انگشت نگاری کنم؟ اکثرا نه این به من می‌گوید که افشای مسئولیت‌پذیر برای چیزی مانند CVE بالغ است، اما برای جیلبریک sandbox نه.

جداسازی محاسباتی تنها به عنوان "بسیار ایزوله" توصیف شد، بدون هیچ مکانیزمی نامی. محدودیت های منابع و مرز سیستم فایل در نوشتن عمومی به هیچ وجه مورد توجه قرار نگرفت. مرز شبکه مانند 2 به نظر می رسد و آن را نگه نمی دارد. یک chokepoint تک پراکسی خروجی مجاز بود و یک روز صفر در آن باعث اجرای کد می‌شد، دقیقا حالت خرابی که لایه S:2 هشدار می‌دهد قابل تنظیم مجدد است اما غیرقابل برگشت هسته نیست.

اعتبارنامه‌ها مانند 0 یا 1 هستند. اعتبارنامه‌های دزدیده شده، حرکت جانبی را در سیستم‌های تولید Hugging Face فعال می‌کنند، که با اعتبارنامه‌های محیطی و قابل دسترس به‌جای توکن‌های پراکسی یا زودگذر سازگار است. حاکمیت عمل بر اساس طراحی 0 یا 1 بود. نرده‌های محافظ عمدا برای این ارزیابی از بین رفتند تا حداکثر قابلیت اندازه‌گیری شود. قابلیت مشاهده جزئی بود، لاگ وجود داشت و Hugging Face به طور مستقل نفوذ را شناسایی کرد، اما هیچ کس آن را به سرعت به تله متری OpenAI خود متصل نکرد.

اجرای آن از طریق قوانین تهدید خود طبقه‌بندی و استخراج داده‌ها را نمی‌توان با آنچه که عمومی است علامت‌گذاری کرد، زیرا ورودی‌ها هرگز فاش نشدند. این ارزش تمرین است. این به شما امکان می‌دهد دقیقا بگویید کدام یک از هفت ادعای خاص و قابل ابطال در مورد یک معماری محدود وجود دارد و راهی برای درخواست مواردی که وجود نداشتند.

این به من می گوید که یک تعریف استاندارد از "جعبه شنی" یا حداقل به اندازه کافی نزدیک وجود دارد. اما خواندن قالب اثر انگشت یک چیز است و اعتماد به آن چیز دیگری است، به خصوص زمانی که تقریبا هر ورودی در مجموعه داده های خود طبقه بندی از مستندات به جای آزمایش عملی استنباط شده است. مرحله بعدی استفاده از پروب برای نمرات تایید شده است.

هیچ یک از آنها هیچ سازمانی را در حالی که استاندارد بالغ می شود، از قلاب خارج نمی کند. اشتهای ریسک خود را تعیین کنید. حسابرسی و کنترل های معقولی را در زیرساخت های خود قرار دهید. با نسخه شخصی خود از یک سوئیچ kill آماده باشید.

و اگر سندباکس نماینده شما باید در برابر این هفت لایه در ملاء عام انگشت نگاری شود، چگونه امتیاز می گیرد؟ امیدوارم بهتر از OpenAI مورد استفاده در این حادثه باشد.

ما بهترین نرم افزار حفاظت نقطه پایانی را معرفی کرده ایم.

این مقاله به عنوان بخشی از TechRadar Pro Perspectives، کانال ما برای معرفی بهترین و باهوش ترین ذهن ها در صنعت فناوری امروز تهیه شده است.

نظرات بیان شده در اینجا نظرات نویسنده است و لزوما نظرات TechRadarPro یا Future plc نیست. اگر مایل به مشارکت هستید، اطلاعات بیشتری را در اینجا بیابید: https://www.techradar.com/pro/perspectives-how-to-submit

خواندن متن کامل در تک‌راداربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

The AI escape is a red herring. The problem is we can't tell a good sandbox from a bad one

Not all sandboxes are equal. A new taxonomy finally lets you score the difference.

همه‌ی اخبار فناوری