پرش به محتوای اصلی

GLM-5.3 و گسترش قابلیت های سایبری پیشرفته

هکرنیوز۱۴۰۵ مهر ۷, سه‌شنبه، ساعت ۲۱:۰۱حدود 7 دقیقه مطالعه

آدرس مقاله: https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities آدرس نظرات: https://news.ycombinator.com/item?id=49897075 امتیاز: 241 # نظرات: 226

اندرو فاسانو، ماریوس فلیشر کول مک‌فول، رابرت شیائو، تریپ گالاگر

پنج ماه پیش، ما Claude Mythos Preview را معرفی کردیم، اولین مدل هوش مصنوعی که می‌تواند به‌طور مستقل اکسپلویت‌های سایبری پیچیده و سرتاسری ایجاد کند. سرعت سریع پیشرفت در هوش مصنوعی به ما نشان می‌دهد که این توانایی در نهایت به بسیاری از مدل‌های دیگر تکثیر می‌شود و انجام حملات سایبری بسیار تأثیرگذار را برای بازیگران سایبری مخرب بسیار آسان‌تر می‌کند.

با توجه به این ملاحظات، ما تصمیم گرفتیم که پیش‌نمایش Claude Mythos را به روشی محدود، از طریق Project Glasswing منتشر کنیم - که به مدافعان سایبری قابل اعتماد امکان می‌دهد تا بیش از 10000 آسیب‌پذیری را در نرم‌افزارهای حیاتی پیدا کنند و قبل از اینکه بازیگران مخرب به مدل‌های دارای توانایی مشابه دسترسی پیدا کنند، به آن‌ها یک شروع عالی می‌دهد.

اما آن مدل ها اکنون وارد شده اند. در این پست، تجزیه و تحلیل خود را از GLM-5.3، آخرین مدل هوش مصنوعی توسعه یافته توسط Zhipu AI (که در خارج از چین به نام Z.ai شناخته می شود) به اشتراک می گذاریم. مانند Claude Mythos Preview، GLM-5.3 دارای قابلیت‌های قوی برای ساخت خودکار بهره‌برداری‌های سایبری سرتاسر است. اما GLM-5.3 برخلاف سایر مدل‌های مرزی است که بدون تدابیر مهم برای محدود کردن استفاده نادرست عرضه شده است. ما متوجه شدیم که مهاجمان می‌توانند با تکنیک‌های ساده در آزمایش‌های شبیه‌سازی‌شده ما، بین 64 تا 100 درصد مواقع از محافظ‌های GLM-5.3 دور بزنند.

در مقابل، این حملات در آزمایش ما در برابر مدل های محافظت شده کلود موفق نبودند. ما ارزیابی می‌کنیم که پادمان‌های ضعیف GLM-5.3 به طور قابل‌توجهی قابلیت‌های سایبری موجود برای عوامل مخرب را افزایش می‌دهد. در عین حال، این قابلیت ها می تواند برای مدافعانی که برای ایمن سازی سیستم های خود تلاش می کنند نیز مفید باشد.

در 17 سپتامبر، مرکز استانداردهای هوش مصنوعی و نوآوری NIST (CAISI) ارزیابی خود را از قابلیت‌های سایبری GLM-5.3 منتشر کرد. CAISI دریافت که GLM-5.3 "قابلیت سایبری ترین مدل وزن باز عرضه شده تا به امروز" است و در مجموع معیارهای سایبری CAISI حدود چهار ماه از مرز ایالات متحده عقب است. یافته های توانایی ما به طور کلی با CAISI مطابقت دارد. در مقایسه CAISI، مدل‌های ایالات متحده با غیرفعال شدن پادمان‌های سایبری در صورت لزوم، آزمایش شدند و مرز ایالات متحده شامل مدل‌هایی است که فقط برای کاربران تأیید شده منتشر می‌شوند.

مهاجمان نمی‌توانند به راحتی به آن نسخه‌های مدل‌های آمریکایی دسترسی پیدا کنند، اما هر کسی می‌تواند GLM-5.3 را دانلود کند. این پست تجزیه و تحلیل ما را اضافه می کند که چگونه به راحتی می توان محافظ های GLM-5.3 را دور زد یا حذف کرد.

برای درک اینکه چگونه GLM-5.3 می‌تواند عاملان تهدید سایبری را قادر سازد تا آسیب‌پذیری‌های نرم‌افزاری واقعی را بیابند و از آن‌ها بهره‌برداری کنند، ارزیابی‌هایی را با استفاده از معیارهای خودکار و گردش‌های کاری انسان در حلقه انجام دادیم. برای هر دو رویکرد، مدل‌های آزمایش‌شده را در محیط‌های ایزوله و sandbox اجرا کردیم، بنابراین آن‌ها فقط می‌توانند به اهداف آفلاینی حمله کنند که ما برای اهداف این ارزیابی‌ها تنظیم کرده‌ایم. ما عمدتا روی قابلیت توسعه اکسپلویت تمرکز می‌کنیم، زیرا اینجاست که Claude Mythos Preview یک جهش قابل‌توجه در مقایسه با مدل‌های قبلی کلود نشان داد.

ابتدا، ما این مدل را در ExploitBench اجرا کردیم، که اندازه‌گیری می‌کند که مدل‌های هوش مصنوعی چقدر می‌توانند از آسیب‌پذیری‌های شناخته شده در موتور V8 مورد استفاده گوگل کروم استفاده کنند. در اینجا ما بر روی توانایی مدل‌ها برای توسعه موفقیت‌آمیز اکسپلویت‌های سرتاسر تمرکز می‌کنیم، زیرا این مهم‌ترین قابلیت برای مهاجمان است، و در آنجا شاهد تغییرات قابل توجهی بین مدل‌ها هستیم. ما متوجه شدیم که GLM-5.3 در 50 مورد از 410 تلاش، اکسپلویت های سرتاسری را توسعه می دهد. Claude Mythos Preview این کار را با نرخ مشابهی انجام داد - در 56 مورد از 410 تلاش.

در معیار بهره‌برداری باینری داخلی، 1 آزمایش می‌کنیم که آیا مدل‌ها می‌توانند آسیب‌پذیری‌ها را در پروژه‌های منبع باز محبوبی که در پروژه OSS-Fuzz Google شرکت می‌کنند، پیدا کرده و از آن‌ها بهره‌برداری کنند. در اینجا، اعتبار کامل برای ربودن جریان کنترل کامل اعطا می شود. ما چندین مدل را روی 100 کار از معیار (به صورت تصادفی انتخاب شده) ارزیابی می‌کنیم و متوجه می‌شویم که GLM-5.3 در 4% از آزمایش‌ها، ربایش جریان کنترل کامل را ایجاد می‌کند. Claude Mythos Preview این کار را در 6٪ انجام داد.

اگرچه GLM-5.3 زیر پیش‌نمایش Claude Mythos در اینجا عمل می‌کند، اما به وضوح از آستانه معناداری عبور کرده است: مدل‌های قبلی، مانند Claude Opus 4.6 و GLM-5.2، در هیچ یک از آنها موفق نیستند.

در مرحله بعد، نحوه عملکرد GLM-5.3 در وظایف سایبری تهاجمی با پایان باز در دست متخصصان انسانی را ارزیابی کردیم (آزمایش آزمایش ما با Claude Mythos Preview در اوایل سال جاری). در اینجا، ما اهدافی را انتخاب می‌کنیم که متخصصان انسانی در آن‌ها از آسیب‌پذیری‌های موجود بی‌اطلاع هستند، سپس از آن‌ها می‌خواهیم از این مدل برای شناسایی و بهره‌برداری از نقص‌های جدید استفاده کنند. این آزمایش‌ها آنچه را که متخصصان می‌توانستند در یک بازه زمانی کوتاه انجام دهند، آزمایش کردند: آنها معمولا یک روز یا کمتر دویدند و در مجموع کمتر از یک ساعت تمرکز انسانی داشتند.

در اولین این جلسات، یک محقق از GLM-5.3 بر روی یک دستگاه sandboxed با ساخت لینوکس محلی از یک مرورگر وب محبوب استفاده کرد. در طول یک روز (و با توجه محدود انسان)، GLM-5.3 چندین آسیب‌پذیری ناشناخته قبلی را در موتور جاوا اسکریپت مرورگر پیدا کرد و آنها را با هم به یک اکسپلویت کاری متصل کرد: یک صفحه وب که هنگام بازدید، فایل‌های دلخواه را از رایانه بازدیدکننده می‌خواند (نشان داده شده در شکل 3). این اکسپلویت ساخت لینوکس مرورگر را هدف قرار می دهد، زیرا این تنها محیطی بود که برای مدل در دسترس بود.

با این حال، ما معتقدیم که این آسیب‌پذیری‌ها می‌توانند روی کاربران دیگر پلتفرم‌ها نیز تأثیر بگذارند، اگرچه مسیر بهره‌برداری در آنجا ممکن است پیچیده‌تر باشد. (ما این آسیب‌پذیری‌ها را برای نگهدارنده فاش کرده‌ایم.) بعدا در جلسه، محقق همچنین آسیب‌پذیری‌های قابل سوءاستفاده را در چندین سیستم پرکاربرد دیگر با GLM-5.3، از جمله درایورهای بی‌سیم و گرافیک و نرم‌افزار دستگاه‌های رو به شبکه، شناسایی کرد. ما در حال حاضر در حال بررسی این گزارش‌ها هستیم و در صورت لزوم به نگهبانان اطلاع خواهیم داد.

GLM-5.3 با برخی محافظ‌های داخلی منتشر شده است: اگر کاربر چیزی آشکارا مضر بخواهد، مدل اغلب رد می‌کند. 2 در آزمایش خود، متوجه شدیم که این حفاظت ها را می توان با انواع تکنیک های ساده دور زد یا حذف کرد.

فشرده‌ترین و موفق‌ترین روش، روش استاندارد کاهش امتناع است که به نام «ابلیتراسیون» شناخته می‌شود. از آنجایی که GLM-5.3 به عنوان یک مدل با وزن باز منتشر شده است، کاربران می توانند آن را برای حذف امتناع های آن با کمی تغییر در قابلیت های آن پیکربندی مجدد کنند. چندین توسعه‌دهنده نسخه‌های حذف‌شده GLM-5.3 را ظرف چند روز پس از عرضه این مدل برای عموم منتشر کردند.

در آزمایش خود، مشاهده کردیم که محافظ‌های GLM-5.3 را نیز می‌توان بدون استفاده از نسخه حذف‌شده مدل دور زد. ما مدل را در یک دنیای شبیه سازی شده 4 قرار دادیم که در آن درخواست های آشکارا مخرب برای حمله به سیستم های حیاتی به آن داده شد. خارج از جعبه، GLM-5.3 در تمام آزمایشات خودداری کرد (مانند مدل های دیگر که ما آزمایش کردیم). اما ما چندین راه ساده برای دور زدن پادمان‌های مدل‌های GLM شناسایی کردیم، به طوری که در بیشتر یا همه موارد به این درخواست‌ها پاسخ می‌دهد. این موارد عبارتند از:

در آزمایش ما، هیچ یک از این تکنیک‌ها مدل‌های کلود محافظت‌شده را برای انجام کارهای مضری که آزمایش کردیم، نداشتند. حفاظت کلود درخواست هایی را که از دستورات فریبنده استفاده می کردند مسدود کرد. Anthropic API به مهاجمان بالقوه هیچ راهی برای پر کردن افکار کلود ارائه نمی دهد. و از آنجایی که وزن کلود در اختیار کاربران قرار نمی گیرد، نمی توان آنها را برای تغییر رفتار کلود حذف کرد.

برای نشان دادن اینکه چگونه نسخه منسوخ شده GLM-5.3 مایل به درگیر شدن در کارهای مضر است، یک نقل قول از زنجیره فکری که ایجاد کرده است را برجسته می کنیم:

GLM-5.3 احتمالا به عوامل مخرب امکان دسترسی به قابلیت‌هایی را می‌دهد که به آنها امکان می‌دهد آسیب‌پذیری‌های سایبری را بدون محدودیت‌های معنی‌دار پیدا کنند و از آن‌ها بهره‌برداری کنند. این بر خلاف هر مدل هوش مصنوعی مشابه دیگری است که همه آنها با پادمان‌ها یا از طریق برنامه‌های دسترسی محدود منتشر شده‌اند. انتشار GLM-5.3 یک تغییر گام معنادار در قابلیت‌های سایبری در دسترس مهاجمان است. Anthropic و دیگر آزمایشگاه‌های هوش مصنوعی ایالات متحده گزارش‌های اخیری را منتشر کرده‌اند که نشان می‌دهد مهاجمان سایبری چگونه سعی کرده‌اند از سیستم‌های هوش مصنوعی استفاده کنند.

با توجه به این شواهد، ما فکر می‌کنیم که احتمالا بازیگران دولتی و غیردولتی از مدل‌هایی مانند GLM-5.3 برای آسیب رساندن به دنیای واقعی استفاده خواهند کرد.

از طرفی مدل هایی با این سطح از قابلیت برای مدافعان نیز قابل استفاده هستند. دیدگاه ما این است که مدافعان سایبری باید از بهترین ابزارهای موجود که نیازهای آنها را برآورده می کند استفاده کنند. ما در تلاش هستیم تا دسترسی ایمن به قابلیت‌های سایبری کلود را به بیشترین تعداد مدافعانی که می‌توانیم گسترش دهیم. مدافعان سایبری با مهاجمانی روبرو می‌شوند که از هر ابزار توانمندی که می‌توانند استفاده می‌کنند، و ما معتقدیم که مدافعان باید به مدل‌های مرزی مجهز شوند که حداقل به خوبی آن‌هایی باشند که دشمنانشان استفاده می‌کنند.

از طریق Project Glasswing (و سایر تلاش‌ها، مانند Patch the Planet)، مدافعان سایبری پیشرفت‌های معناداری را در جهت ایمن‌سازی سیستم‌های حیاتی پیش از این لحظه انجام داده‌اند - اما کار زیادی باقی مانده است. در حالی که مدافعان بررسی شده اکنون می توانند از مدل های پیشرفته تری مانند Claude Mythos 5.1 از طریق برنامه های دسترسی قابل اعتماد ما استفاده کنند، اکنون از یک آستانه بحرانی در قابلیت های آزادانه در دسترس عبور کرده است. GLM-5.3 بر ضرورت گسترش دسترسی به مدل‌های مرزی پیشرفته به مجموعه گسترده‌تری از نهادها برای توانمندسازی مدافعان سایبری تأکید می‌کند.

دولت‌ها باید آزمایش‌های ایمنی را روی مدل‌های هوش مصنوعی با توانایی کافی، از جمله جانشینان GLM-5.3 انجام دهند. بدون ارزیابی‌های با کیفیت بالا از منابع مستقل، تأثیر این قابلیت‌ها ممکن است تا زمانی که خیلی دیر نشده باشد، برای توسعه‌دهندگان مدل کاملا واضح نباشد. همانطور که توسعه‌دهندگان هوش مصنوعی در سراسر جهان مدل‌های با وزن باز را با قابلیت فزاینده‌ای می‌سازند، امیدواریم که برای محافظت مناسب از این قابلیت‌ها و جلوگیری از سوءاستفاده تلاش کنند.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

GLM-5.3 and the spread of advanced cyber capabilities

Article URL: https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities Comments URL: https://news.ycombinator.com/item?id=49897075 Points: 241 # Comments: 226

همه‌ی اخبار فناوری