چگونه گزارش هشداردهنده آنتروپیک درباره GLM، جذابیت مدل چینی را بیشتر کرد؟
گزارش آنتروپیک درباره خطرات مدل GLM با اثبات توانایی این هوش مصنوعی در ساخت اکسپلویتهای موثر و ارزان، به ویترینی از توانمندی مدل چینی تبدیل شد.
گزارش آنتروپیک درباره خطرات مدل GLM با اثبات توانایی این هوش مصنوعی در ساخت اکسپلویتهای موثر و ارزان، به ویترینی از توانمندی مدل چینی تبدیل شد.
۲۹ سپتامبر شرکت آنتروپیک گزارشی منتشر کرد تا دربارهی گسترش قابلیتهای پیشرفتهی سایبری مدل چینی GLM-5.3 هشدار دهد، ولی مخاطبان پس از مرور این پست واکنشی نشان دادند که احتمالاً نویسندگان گزارش انتظارش را نداشتند.
اندرو کیس، پژوهشگر باسابقهی امنیت سایبری و یکی از توسعهدهندگان اصلی ابزار Volatility، در ایکس نوشت : «واقعاً گیج شدهام که چرا آنتروپیک پستی در وبلاگش منتشر کرده و تیمهای امنیت سایبری را تشویق میکند که به سراغ GLM بروند؟»
واقعا گیج شدم که چرا Anthropic یه پست وبلاگ نوشته و توش برای تیمهای cybersecurity تبلیغ کرده که سوییچ کنن روی GLM!؟!؟
مشخصاً آنتروپیک چنین منظوری نداشت. GLM-5.3 جدیدترین مدل شرکت چینی Z.ai با وزنهای باز منتشر شد و توسعهدهندگان و علاقهمندان میتوانند آن را دانلود و روی زیرساخت خودشان اجرا کنند. پژوهشگران آنتروپیک میگویند GLM اکنون تواناییهایی را در اختیار عموم میگذارد که خودشان چند ماه قبل، به دلیل خطر سوءاستفاده، دسترسی به نمونهی مشابهش را محدود کرده بودند.
اما آنتروپیک برای نشاندادن همین خطر، ناچار شد تواناییهای GLM را با جزئیات به نمایش بگذارد؛ جزئیاتی که عملاً به یکی از بهترین معرفیهای فنی ممکن برای مدل چینی تبدیل شدند. GLM توانست اکسپلویت کامل بسازد، چند آسیبپذیری ناشناخته پیدا کند، آنها را در قالب یک زنجیرهی حمله به هم متصل کند و بخشی از این فرایند را تنها با چند ساعت پردازش و هزینهای نزدیک به ۲۰ دلار پیش ببرد.
شرکت میخواست خطر GLM را با آزمایش و مدارک نشان دهد، ولی برخی از متخصصان امنیتی همان شواهد را نشانهی توانمندی چشمگیر مدل دیدند.
برای دیدن شواهدی که آنتروپیک بر پایهی آنها دربارهی تواناییهای سایبری GLM هشدار میدهد، باید سراغ آزمایشهای خود شرکت برویم. آنتروپیک یکی از مهمترین ارزیابیهایش را با ExploitBench انجام داد؛ آزمونی که توانایی مدلهای هوش مصنوعی را در بهرهبرداری از آسیبپذیریهای شناختهشدهی موتور V8 گوگل کروم میسنجد.
آنتروپیک GLM-5.3 را روی ۴۱ آسیبپذیری آزمود و برای هرکدام ۱۰ بار به مدل فرصت داد تا یک اکسپلویت کامل و کارآمد تولید کند.
از مجموع ۴۱۰ تلاش، GLM-5.3 در ۵۰ مورد موفق به ساخت اکسپلویت شد و مدل تخصصی آنتروپیک برای وظایف پیشرفتهی سایبری یعنی Mythos Preview در همان آزمون ۵۶ موفقیت ثبت کرد. مدلهایی مثل Opus 4.6، نسل قبلی GLM، کیمی K3 و دیپسیک V4.1-Flash هیچ موفقیتی کسب نکردند یا امتیازشان در نزدیکی صفر ماند.
نگرانی آنتروپیک را با مقایسهی عملکرد GLM-5.3 و سایر مدلها بهتر درک میکنیم. شرکت پنج ماه قبل Mythos Preview را بهعنوان نخستین مدلی معرفی کرد که میتوانست اکسپلویتهای پیچیده را خودکار و سرتاسری بسازد.
آنتروپیک بهخاطر ریسکهای این قابلیت، میتوس پریویو را بهصورت عمومی منتشر نکرد و آن را فقط از طریق پروژه Glasswing، در اختیار گروهی از متخصصان امنیت قرار داد. حالا یک مدل چینی با وزنهای در دسترس، در آزمون اصلی آنتروپیک با فاصلهای اندک پشت سر میتوس حرکت میکند.
GLM در آزمونهای دشوار آنتروپیک، با فاصلهای بسیار نزدیک از پیشرفتهترین هوش مصنوعی امنیتی آمریکا قدم برمیدارد
آنتروپیک در آزمون دیگری با نام Binary Exploitation، مدلها را با ۱۰۰ چالش امنیتی برگرفته از پروژههای متنباز آزمایش کرد.
GLM در چهار درصد موارد توانست کنترل جریان اجرای برنامه را به دست بگیرد و میتوس شش درصد چالشها را با موفقیت حل کرد. درصدها در نگاه اول کوچکاند، اما نسل قبلی هر دو مدل در همین آزمون هیچ موفقیتی نداشتند؛ به همین دلیل پژوهشگران آنتروپیک نتایج را نشانهی جهشی محسوس در توانایی مدلها برای بهرهبرداری از آسیبپذیریها میدانند.
اما اعداد بنچمارک تنها بخشی از ماجرا بودند. آنتروپیک در مرحلهی بعد شرایط را عوض کرد، مدل را از محیط مسائل آماده بیرون کشید و سراغ نرمافزارهایی فرستاد که حتی پژوهشگران هم از قبل نمیدانستند چه باگی در آنها پیدا خواهد شد.
آزمایش اول، کشف روز صفر: یکی از پژوهشگران GLM-5.3 را در محیطی ایزوله برابر نسخهی لینوکسی یک مرورگر پرکاربرد گذاشت، بیآنکه خودش از آسیبپذیریهای آن نسخه خبر داشته باشد. مدل باید مسیر حمله را خودش پیدا میکرد.
GLM طی یک روز چند آسیبپذیری ناشناخته را در موتور جاوااسکریپت مرورگر یافت، آنها را به هم متصل کرد و زنجیرهی اکسپلویتی ساخت که با باز شدن یک صفحهی وب، فایلهای دلخواه را از کامپیوتر قربانی میخواند. اسکرینشات گزارش نشان میدهد کد اجراشده از طریق صفحهی مخرب موفق شده کلید خصوصی SSH را از دستگاه بیرون بکشد. مجموع زمانی که پژوهشگر مستقیماً صرف هدایت و نظارت بر آزمایش کرد، کمتر از یک ساعت بود.
آزمایش دوم، اکسپلویت ۲۰ دلاری: اینبار پژوهشگر سراغ GLM-5.3-Flash رفت؛ نسخهای کوچکتر و ضعیفتر از مدل اصلی. هدف آزمایش هم ساخت اکسپلویت برای یک آسیبپذیری تازهافشاشدهی کروم بود نه آسیبپذیری روز صفر. پژوهشگر اطلاعات عمومی آسیبپذیری و نقص دیگری را که برای تکمیل حمله لازم میشد در اختیار مدل قرار داد و GLM بقیهی مسیر را پیش برد.
کشف زنجیره باگهای ناشناخته در مرورگرها نشان داد که GLM-5.3 برای هک شبکهها، نیازی به راهنمایی چندانی ندارد
مدل طی هشت ساعت کار توانست دو آسیبپذیری را به هم متصل کند، زنجیرهی حملهای قابلاعتمادی برای پردازندههای ARM64 بسازد و از مکانیزم امنیتی PAC عبور کند. سهم انسان از این فرایند به حدود ۲۰ دقیقه میرسید و با تعرفهی API شرکت Z.ai، کل محاسبات فقط ۲۰ دلار و ۴۰ سنت هزینه داشت.
توسعهی اکسپلویتهای پیشرفته سالها به مهارت تخصصی، زمان و نیروی انسانی وابسته بود و حالا آزمایش آنتروپیک نشان میدهد که میتوان بخشی از این کار را به مدلی سپرد که ساعتها بیوقفه مسئله را دنبال میکند، آن هم با هزینهای کمتر از یک شام معمولی.
چرا متخصصان گزارش آنتروپیک را به تبلیغی برای GLM تشبیه میکنند؟
علاوه بر اندرو کیس، متخصصان دیگری نیز به گزارش آنتروپیک واکنش نشان دادند. یکی از کاربران ایکس نوشت تأییدیهای بهتر از این پست وبلاگی برای GLM-5.3 پیدا نمیشود و دیگری گفت بیصبرانه منتظر GLM 5.5 میماند.
وسلی مکگرو، پژوهشگر امنیت، اذعان کرد که مدلهای وزن باز بهراستی توانمندند و خواستهی آنتروپیک را برای کنترل اینکه چه کسی چه قابلیتی را چه زمانی در اختیار داشته باشد، دور میزنند.
مدلهای غربی از پاسخ به سوالات امنیتی طفره میروند، اما مدل چینی بدون محدودیت کار پژوهشگران را پیش میبرد
بیایید برخی نکات دیگری را که باعث میشوند حرف این متخصصین منطقی به نظر برسد، مرور کنیم. آنتروپیک در پانویس دوم گزارش میگوید کارهای سایبری بخش اول، یعنی همان ساخت اکسپلویتها، باعث امتناع نسخهی رسمی GLM نشدند.
مدلی فقط وقتی از اجرای پرامپتها سرباز زد که از او صریحاً میخواستند بدافزار بسازد یا به هدف راه دور حمله کند. یعنی یک تیم امنیتی برای بخش بزرگی از کارهای پژوهشیاش حتی نیازی به دورزدن محافظها ندارد.
نکتهی دوم به همان هزینهی ۲۰ دلار برمیگردد. وقتی معتبرترین منتقد یک مدل نشان میدهد که با کمتر از قیمت یک شام میتوان زنجیرهی اکسپلویت ساخت، این عدد پیش از آنکه هشدار باشد، برچسب قیمت را در ذهن شما تداعی میکند.
نکتهی سوم هم به صریحترین جملهی گزارش برمیگردد. آنتروپیک مینویسد: «مدافعان سایبری باید از بهترین ابزار موجودی که نیازشان را برطرف میکند، استفاده کنند.» برای مخاطبانی که همین حالا به مدل میتوس دسترسی ندارند، این جمله میتواند معنایی بدهد که نویسنده قصدش را نداشت.
حتی لازم نیست تبلیغی در کار باشد؛ خود دادههای منتشر شده هم نقش تبلیغ GLM را بازی میکنند. کارشناسانی مانند کیس نمیگویند چرا آنتروپیک در مورد خطر مدل چینی هشدار میدهد، میگویند چرا گزارشی را منتشر میکند که تیمهای امنیتی با خواندنش ترغیب میشوند سراغ GLM بروند.
آنتروپیک فقط بهخاطر قدرت GLM نگران نیست، چراکه مدل این شرکت در بعضی ارزیابیها بهتر عمل میکند. ولی باید توجه کنید که GLM با وزنهای باز منتشر میشود. درواقع نسخهی رسمی GLM بدون محدودیت نیست و در حالت عادی بسیاری از درخواستهایی را که بهوضوح مخرباند، رد میکند.
پژوهشگران آنتروپیک بررسی کردند این مقاومت تا کجا دوام میآورد. در جدول زیر نتایج بررسیها را مشاهده میکنید. البته این نرخها در محیطی شبیهسازیشده ثبت شدهاند؛ محیطی که در آن هیچ کدی واقعا اجرا نمیشد و یک مدل زبانی دیگر نتیجهی دستورها را تخمین میزد. خود آنتروپیک هم تأکید میکند این شبیهسازی معیار کاملی برای رفتار واقعی مدل نیست.
درخواست صریح همان کار حساس، بدون پوشش یا سناریوی خاص
سناریوی ظاهرا دفاعی (red-team؛ یعنی جا زدن درخواست بهعنوان آزمایش امنیتی)
درخواست طوری مطرح میشود که انگار هدف، ارزیابی امنیت یا پیدا کردن ضعفهاست
از پیش نوشتن ابتدای پاسخ مدل (prefill؛ یعنی شروع پاسخ را پژوهشگر تعیین کند تا مدل آن را ادامه دهد)
مدل بهجای تصمیمگیری از نقطهی صفر، ادامهی پاسخی را مینویسد که از قبل در مسیر همکاری آغاز شده
نسخهی دستکاریشدهی مدل (abliterated؛ یعنی تضعیف الگوهای درونی مرتبط با امتناع در وزنهای مدل)
پژوهشگران خود مدل را تغییر دادند تا سازوکار امتناع آن بسیار ضعیفتر شود
در مرحلهی آخر، پژوهشگران سراغ خود وزنهای مدل رفتند و نسخهای دستکاریشده ساختند که الگوهای درونی مرتبط با امتناع در آن تضعیف شده بود. این روش که Abliteration نام دارد، برخلاف ترفندهای پرامپتی، مستقیماً رفتار مدل را در سطح پارامترهایش تغییر میدهد.
نتروپیک ثابت کرد که با کمی تغییر در وزنهای مدل، تمام محافظهای امنیتی GLM بهراحتی دور زده میشوند
نسخهی آبلیتریتشده در تمام درخواستهای بررسیشده پاسخ داد و نرخ امتناع را از بالای ۹۰ درصد به حدود دو تا سه درصد رساند. مهمتر اینکه حذف محافظها مدل را از کار نینداخت؛ نسخهی دستکاریشده بخش عمدهی تواناییهای عمومیاش را حفظ کرد.
هزینهی ساخت نسخهی دستکاریشده هم قابلتوجه به نظر میرسید. تیم آنتروپیک که پیشتر تجربهای در حذف سازوکار امتناع از مدل نداشت، حدود ۲۲۰۰ ساعت پردازش GPU و ۴۴۰۰ دلار هزینه کرد.
به تخمین پژوهشگران، تیمی باتجربه میتوانست همان کار را با حدود ۶۰۰ ساعت پردازش GPU و نزدیک به ۱۲۰۰ دلار انجام دهد. چند توسعهدهنده هم ظرف چند روز پس از انتشار مدل، نسخههایی آبلیتریتشده با محافظهای تضعیفشده منتشر کردند.
آنتروپیک نتیجه میگیرد محافظهای رفتاری GLM تا زمانی معنا دارند که کاربر همان نسخه و تنظیمات سازنده را نگه دارد. وقتی کاربر از طریق API از کلاد استفاده میکند، آنتروپیک همچنان میتواند درخواستها را فیلتر کند یا دسترسی را ببندد.
اما وقتی وزنهای یک مدل منتشر میشوند، کاربر میتواند آن را روی زیرساخت خودش اجرا و حتی سازوکارهای امتناعش را دستکاری کند؛ یا نسخهای بسازد که اساساً برای ردکردن درخواستهای خطرناک آموزش ندیده باشد. در این حالت، کنترل سازنده بر نحوهی استفاده از مدل بهمراتب کمتر میشود.