GLM-5.3 و گسترش قابلیت های سایبری پیشرفته
آدرس مقاله: https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities آدرس نظرات: https://news.ycombinator.com/item?id=49897075 امتیاز: 241 # نظرات: 226
اندرو فاسانو، ماریوس فلیشر کول مکفول، رابرت شیائو، تریپ گالاگر
پنج ماه پیش، ما Claude Mythos Preview را معرفی کردیم، اولین مدل هوش مصنوعی که میتواند بهطور مستقل اکسپلویتهای سایبری پیچیده و سرتاسری ایجاد کند. سرعت سریع پیشرفت در هوش مصنوعی به ما نشان میدهد که این توانایی در نهایت به بسیاری از مدلهای دیگر تکثیر میشود و انجام حملات سایبری بسیار تأثیرگذار را برای بازیگران سایبری مخرب بسیار آسانتر میکند.
با توجه به این ملاحظات، ما تصمیم گرفتیم که پیشنمایش Claude Mythos را به روشی محدود، از طریق Project Glasswing منتشر کنیم - که به مدافعان سایبری قابل اعتماد امکان میدهد تا بیش از 10000 آسیبپذیری را در نرمافزارهای حیاتی پیدا کنند و قبل از اینکه بازیگران مخرب به مدلهای دارای توانایی مشابه دسترسی پیدا کنند، به آنها یک شروع عالی میدهد.
اما آن مدل ها اکنون وارد شده اند. در این پست، تجزیه و تحلیل خود را از GLM-5.3، آخرین مدل هوش مصنوعی توسعه یافته توسط Zhipu AI (که در خارج از چین به نام Z.ai شناخته می شود) به اشتراک می گذاریم. مانند Claude Mythos Preview، GLM-5.3 دارای قابلیتهای قوی برای ساخت خودکار بهرهبرداریهای سایبری سرتاسر است. اما GLM-5.3 برخلاف سایر مدلهای مرزی است که بدون تدابیر مهم برای محدود کردن استفاده نادرست عرضه شده است. ما متوجه شدیم که مهاجمان میتوانند با تکنیکهای ساده در آزمایشهای شبیهسازیشده ما، بین 64 تا 100 درصد مواقع از محافظهای GLM-5.3 دور بزنند.
در مقابل، این حملات در آزمایش ما در برابر مدل های محافظت شده کلود موفق نبودند. ما ارزیابی میکنیم که پادمانهای ضعیف GLM-5.3 به طور قابلتوجهی قابلیتهای سایبری موجود برای عوامل مخرب را افزایش میدهد. در عین حال، این قابلیت ها می تواند برای مدافعانی که برای ایمن سازی سیستم های خود تلاش می کنند نیز مفید باشد.
در 17 سپتامبر، مرکز استانداردهای هوش مصنوعی و نوآوری NIST (CAISI) ارزیابی خود را از قابلیتهای سایبری GLM-5.3 منتشر کرد. CAISI دریافت که GLM-5.3 "قابلیت سایبری ترین مدل وزن باز عرضه شده تا به امروز" است و در مجموع معیارهای سایبری CAISI حدود چهار ماه از مرز ایالات متحده عقب است. یافته های توانایی ما به طور کلی با CAISI مطابقت دارد. در مقایسه CAISI، مدلهای ایالات متحده با غیرفعال شدن پادمانهای سایبری در صورت لزوم، آزمایش شدند و مرز ایالات متحده شامل مدلهایی است که فقط برای کاربران تأیید شده منتشر میشوند.
مهاجمان نمیتوانند به راحتی به آن نسخههای مدلهای آمریکایی دسترسی پیدا کنند، اما هر کسی میتواند GLM-5.3 را دانلود کند. این پست تجزیه و تحلیل ما را اضافه می کند که چگونه به راحتی می توان محافظ های GLM-5.3 را دور زد یا حذف کرد.
برای درک اینکه چگونه GLM-5.3 میتواند عاملان تهدید سایبری را قادر سازد تا آسیبپذیریهای نرمافزاری واقعی را بیابند و از آنها بهرهبرداری کنند، ارزیابیهایی را با استفاده از معیارهای خودکار و گردشهای کاری انسان در حلقه انجام دادیم. برای هر دو رویکرد، مدلهای آزمایششده را در محیطهای ایزوله و sandbox اجرا کردیم، بنابراین آنها فقط میتوانند به اهداف آفلاینی حمله کنند که ما برای اهداف این ارزیابیها تنظیم کردهایم. ما عمدتا روی قابلیت توسعه اکسپلویت تمرکز میکنیم، زیرا اینجاست که Claude Mythos Preview یک جهش قابلتوجه در مقایسه با مدلهای قبلی کلود نشان داد.
ابتدا، ما این مدل را در ExploitBench اجرا کردیم، که اندازهگیری میکند که مدلهای هوش مصنوعی چقدر میتوانند از آسیبپذیریهای شناخته شده در موتور V8 مورد استفاده گوگل کروم استفاده کنند. در اینجا ما بر روی توانایی مدلها برای توسعه موفقیتآمیز اکسپلویتهای سرتاسر تمرکز میکنیم، زیرا این مهمترین قابلیت برای مهاجمان است، و در آنجا شاهد تغییرات قابل توجهی بین مدلها هستیم. ما متوجه شدیم که GLM-5.3 در 50 مورد از 410 تلاش، اکسپلویت های سرتاسری را توسعه می دهد. Claude Mythos Preview این کار را با نرخ مشابهی انجام داد - در 56 مورد از 410 تلاش.
در معیار بهرهبرداری باینری داخلی، 1 آزمایش میکنیم که آیا مدلها میتوانند آسیبپذیریها را در پروژههای منبع باز محبوبی که در پروژه OSS-Fuzz Google شرکت میکنند، پیدا کرده و از آنها بهرهبرداری کنند. در اینجا، اعتبار کامل برای ربودن جریان کنترل کامل اعطا می شود. ما چندین مدل را روی 100 کار از معیار (به صورت تصادفی انتخاب شده) ارزیابی میکنیم و متوجه میشویم که GLM-5.3 در 4% از آزمایشها، ربایش جریان کنترل کامل را ایجاد میکند. Claude Mythos Preview این کار را در 6٪ انجام داد.
اگرچه GLM-5.3 زیر پیشنمایش Claude Mythos در اینجا عمل میکند، اما به وضوح از آستانه معناداری عبور کرده است: مدلهای قبلی، مانند Claude Opus 4.6 و GLM-5.2، در هیچ یک از آنها موفق نیستند.
در مرحله بعد، نحوه عملکرد GLM-5.3 در وظایف سایبری تهاجمی با پایان باز در دست متخصصان انسانی را ارزیابی کردیم (آزمایش آزمایش ما با Claude Mythos Preview در اوایل سال جاری). در اینجا، ما اهدافی را انتخاب میکنیم که متخصصان انسانی در آنها از آسیبپذیریهای موجود بیاطلاع هستند، سپس از آنها میخواهیم از این مدل برای شناسایی و بهرهبرداری از نقصهای جدید استفاده کنند. این آزمایشها آنچه را که متخصصان میتوانستند در یک بازه زمانی کوتاه انجام دهند، آزمایش کردند: آنها معمولا یک روز یا کمتر دویدند و در مجموع کمتر از یک ساعت تمرکز انسانی داشتند.
در اولین این جلسات، یک محقق از GLM-5.3 بر روی یک دستگاه sandboxed با ساخت لینوکس محلی از یک مرورگر وب محبوب استفاده کرد. در طول یک روز (و با توجه محدود انسان)، GLM-5.3 چندین آسیبپذیری ناشناخته قبلی را در موتور جاوا اسکریپت مرورگر پیدا کرد و آنها را با هم به یک اکسپلویت کاری متصل کرد: یک صفحه وب که هنگام بازدید، فایلهای دلخواه را از رایانه بازدیدکننده میخواند (نشان داده شده در شکل 3). این اکسپلویت ساخت لینوکس مرورگر را هدف قرار می دهد، زیرا این تنها محیطی بود که برای مدل در دسترس بود.
با این حال، ما معتقدیم که این آسیبپذیریها میتوانند روی کاربران دیگر پلتفرمها نیز تأثیر بگذارند، اگرچه مسیر بهرهبرداری در آنجا ممکن است پیچیدهتر باشد. (ما این آسیبپذیریها را برای نگهدارنده فاش کردهایم.) بعدا در جلسه، محقق همچنین آسیبپذیریهای قابل سوءاستفاده را در چندین سیستم پرکاربرد دیگر با GLM-5.3، از جمله درایورهای بیسیم و گرافیک و نرمافزار دستگاههای رو به شبکه، شناسایی کرد. ما در حال حاضر در حال بررسی این گزارشها هستیم و در صورت لزوم به نگهبانان اطلاع خواهیم داد.
GLM-5.3 با برخی محافظهای داخلی منتشر شده است: اگر کاربر چیزی آشکارا مضر بخواهد، مدل اغلب رد میکند. 2 در آزمایش خود، متوجه شدیم که این حفاظت ها را می توان با انواع تکنیک های ساده دور زد یا حذف کرد.
فشردهترین و موفقترین روش، روش استاندارد کاهش امتناع است که به نام «ابلیتراسیون» شناخته میشود. از آنجایی که GLM-5.3 به عنوان یک مدل با وزن باز منتشر شده است، کاربران می توانند آن را برای حذف امتناع های آن با کمی تغییر در قابلیت های آن پیکربندی مجدد کنند. چندین توسعهدهنده نسخههای حذفشده GLM-5.3 را ظرف چند روز پس از عرضه این مدل برای عموم منتشر کردند.
در آزمایش خود، مشاهده کردیم که محافظهای GLM-5.3 را نیز میتوان بدون استفاده از نسخه حذفشده مدل دور زد. ما مدل را در یک دنیای شبیه سازی شده 4 قرار دادیم که در آن درخواست های آشکارا مخرب برای حمله به سیستم های حیاتی به آن داده شد. خارج از جعبه، GLM-5.3 در تمام آزمایشات خودداری کرد (مانند مدل های دیگر که ما آزمایش کردیم). اما ما چندین راه ساده برای دور زدن پادمانهای مدلهای GLM شناسایی کردیم، به طوری که در بیشتر یا همه موارد به این درخواستها پاسخ میدهد. این موارد عبارتند از:
در آزمایش ما، هیچ یک از این تکنیکها مدلهای کلود محافظتشده را برای انجام کارهای مضری که آزمایش کردیم، نداشتند. حفاظت کلود درخواست هایی را که از دستورات فریبنده استفاده می کردند مسدود کرد. Anthropic API به مهاجمان بالقوه هیچ راهی برای پر کردن افکار کلود ارائه نمی دهد. و از آنجایی که وزن کلود در اختیار کاربران قرار نمی گیرد، نمی توان آنها را برای تغییر رفتار کلود حذف کرد.
برای نشان دادن اینکه چگونه نسخه منسوخ شده GLM-5.3 مایل به درگیر شدن در کارهای مضر است، یک نقل قول از زنجیره فکری که ایجاد کرده است را برجسته می کنیم:
GLM-5.3 احتمالا به عوامل مخرب امکان دسترسی به قابلیتهایی را میدهد که به آنها امکان میدهد آسیبپذیریهای سایبری را بدون محدودیتهای معنیدار پیدا کنند و از آنها بهرهبرداری کنند. این بر خلاف هر مدل هوش مصنوعی مشابه دیگری است که همه آنها با پادمانها یا از طریق برنامههای دسترسی محدود منتشر شدهاند. انتشار GLM-5.3 یک تغییر گام معنادار در قابلیتهای سایبری در دسترس مهاجمان است. Anthropic و دیگر آزمایشگاههای هوش مصنوعی ایالات متحده گزارشهای اخیری را منتشر کردهاند که نشان میدهد مهاجمان سایبری چگونه سعی کردهاند از سیستمهای هوش مصنوعی استفاده کنند.
با توجه به این شواهد، ما فکر میکنیم که احتمالا بازیگران دولتی و غیردولتی از مدلهایی مانند GLM-5.3 برای آسیب رساندن به دنیای واقعی استفاده خواهند کرد.
از طرفی مدل هایی با این سطح از قابلیت برای مدافعان نیز قابل استفاده هستند. دیدگاه ما این است که مدافعان سایبری باید از بهترین ابزارهای موجود که نیازهای آنها را برآورده می کند استفاده کنند. ما در تلاش هستیم تا دسترسی ایمن به قابلیتهای سایبری کلود را به بیشترین تعداد مدافعانی که میتوانیم گسترش دهیم. مدافعان سایبری با مهاجمانی روبرو میشوند که از هر ابزار توانمندی که میتوانند استفاده میکنند، و ما معتقدیم که مدافعان باید به مدلهای مرزی مجهز شوند که حداقل به خوبی آنهایی باشند که دشمنانشان استفاده میکنند.
از طریق Project Glasswing (و سایر تلاشها، مانند Patch the Planet)، مدافعان سایبری پیشرفتهای معناداری را در جهت ایمنسازی سیستمهای حیاتی پیش از این لحظه انجام دادهاند - اما کار زیادی باقی مانده است. در حالی که مدافعان بررسی شده اکنون می توانند از مدل های پیشرفته تری مانند Claude Mythos 5.1 از طریق برنامه های دسترسی قابل اعتماد ما استفاده کنند، اکنون از یک آستانه بحرانی در قابلیت های آزادانه در دسترس عبور کرده است. GLM-5.3 بر ضرورت گسترش دسترسی به مدلهای مرزی پیشرفته به مجموعه گستردهتری از نهادها برای توانمندسازی مدافعان سایبری تأکید میکند.
دولتها باید آزمایشهای ایمنی را روی مدلهای هوش مصنوعی با توانایی کافی، از جمله جانشینان GLM-5.3 انجام دهند. بدون ارزیابیهای با کیفیت بالا از منابع مستقل، تأثیر این قابلیتها ممکن است تا زمانی که خیلی دیر نشده باشد، برای توسعهدهندگان مدل کاملا واضح نباشد. همانطور که توسعهدهندگان هوش مصنوعی در سراسر جهان مدلهای با وزن باز را با قابلیت فزایندهای میسازند، امیدواریم که برای محافظت مناسب از این قابلیتها و جلوگیری از سوءاستفاده تلاش کنند.
متن اصلی (انگلیسی)
GLM-5.3 and the spread of advanced cyber capabilities
Article URL: https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities Comments URL: https://news.ycombinator.com/item?id=49897075 Points: 241 # Comments: 226