پرش به محتوای اصلی

چگونه گزارش هشداردهنده آنتروپیک درباره GLM، جذابیت مدل چینی را بیشتر کرد؟

زومیت۱۴۰۵ مهر ۸, چهارشنبه، ساعت ۲۱:۰۰حدود 9 دقیقه مطالعه

گزارش آنتروپیک درباره خطرات مدل GLM با اثبات توانایی این هوش مصنوعی در ساخت اکسپلویت‌های موثر و ارزان، به ویترینی از توانمندی مدل چینی تبدیل شد.

گزارش آنتروپیک درباره خطرات مدل GLM با اثبات توانایی این هوش مصنوعی در ساخت اکسپلویت‌های موثر و ارزان، به ویترینی از توانمندی مدل چینی تبدیل شد.

۲۹ سپتامبر شرکت آنتروپیک گزارشی منتشر کرد تا درباره‌ی گسترش قابلیت‌های پیشرفته‌ی سایبری مدل چینی GLM-5.3 هشدار دهد، ولی مخاطبان پس از مرور این پست واکنشی نشان دادند که احتمالاً نویسندگان گزارش انتظارش را نداشتند.

اندرو کیس، پژوهشگر باسابقه‌ی امنیت سایبری و یکی از توسعه‌دهندگان اصلی ابزار Volatility، در ایکس نوشت : «واقعاً گیج شده‌ام که چرا آنتروپیک پستی در وبلاگش منتشر کرده و تیم‌های امنیت سایبری را تشویق می‌کند که به سراغ GLM بروند؟»

واقعا گیج شدم که چرا Anthropic یه پست وبلاگ نوشته و توش برای تیم‌های cybersecurity تبلیغ کرده که سوییچ کنن روی GLM!؟!؟

مشخصاً آنتروپیک چنین منظوری نداشت. GLM-5.3 جدیدترین مدل شرکت چینی Z.ai با وزن‌های باز منتشر شد و توسعه‌دهندگان و علاقه‌مندان می‌توانند آن را دانلود و روی زیرساخت خودشان اجرا کنند. پژوهشگران آنتروپیک می‌گویند GLM اکنون توانایی‌هایی را در اختیار عموم می‌گذارد که خودشان چند ماه قبل، به دلیل خطر سوءاستفاده، دسترسی به نمونه‌ی مشابهش را محدود کرده بودند.

اما آنتروپیک برای نشان‌دادن همین خطر، ناچار شد توانایی‌های GLM را با جزئیات به نمایش بگذارد؛ جزئیاتی که عملاً به یکی از بهترین معرفی‌های فنی ممکن برای مدل چینی تبدیل شدند. GLM توانست اکسپلویت کامل بسازد، چند آسیب‌پذیری ناشناخته پیدا کند، آن‌ها را در قالب یک زنجیره‌ی حمله به هم متصل کند و بخشی از این فرایند را تنها با چند ساعت پردازش و هزینه‌ای نزدیک به ۲۰ دلار پیش ببرد.

شرکت می‌خواست خطر GLM را با آزمایش و مدارک نشان دهد، ولی برخی از متخصصان امنیتی همان شواهد را نشانه‌ی توانمندی چشمگیر مدل دیدند.

برای دیدن شواهدی که آنتروپیک بر پایه‌ی آن‌ها درباره‌ی توانایی‌های سایبری GLM هشدار می‌دهد، باید سراغ آزمایش‌های خود شرکت برویم. آنتروپیک یکی از مهم‌ترین ارزیابی‌هایش را با ExploitBench انجام داد؛ آزمونی که توانایی مدل‌های هوش مصنوعی را در بهره‌برداری از آسیب‌پذیری‌های شناخته‌شده‌ی موتور V8 گوگل کروم می‌سنجد.

آنتروپیک GLM-5.3 را روی ۴۱ آسیب‌پذیری آزمود و برای هرکدام ۱۰ بار به مدل فرصت داد تا یک اکسپلویت کامل و کارآمد تولید کند.

از مجموع ۴۱۰ تلاش، GLM-5.3 در ۵۰ مورد موفق به ساخت اکسپلویت شد و مدل تخصصی آنتروپیک برای وظایف پیشرفته‌ی سایبری یعنی Mythos Preview در همان آزمون ۵۶ موفقیت ثبت کرد. مدل‌هایی مثل Opus 4.6، نسل قبلی GLM، کیمی K3 و دیپ‌سیک V4.1-Flash هیچ موفقیتی کسب نکردند یا امتیازشان در نزدیکی صفر ماند.

نگرانی آنتروپیک را با مقایسه‌ی عملکرد GLM-5.3 و سایر مدل‌ها بهتر درک می‌کنیم. شرکت پنج ماه قبل Mythos Preview را به‌عنوان نخستین مدلی معرفی کرد که می‌توانست اکسپلویت‌های پیچیده را خودکار و سرتاسری بسازد.

آنتروپیک به‌خاطر ریسک‌های این قابلیت، میتوس پریویو را به‌صورت عمومی منتشر نکرد و آن را فقط از طریق پروژه Glasswing، در اختیار گروهی از متخصصان امنیت قرار داد. حالا یک مدل چینی با وزن‌های در دسترس، در آزمون اصلی آنتروپیک با فاصله‌ای اندک پشت سر میتوس حرکت می‌کند.

GLM در آزمون‌های دشوار آنتروپیک، با فاصله‌ای بسیار نزدیک از پیشرفته‌ترین هوش مصنوعی‌ امنیتی آمریکا قدم برمی‌دارد

آنتروپیک در آزمون دیگری با نام Binary Exploitation، مدل‌ها را با ۱۰۰ چالش امنیتی برگرفته از پروژه‌های متن‌باز آزمایش کرد.

GLM در چهار درصد موارد توانست کنترل جریان اجرای برنامه را به دست بگیرد و میتوس شش درصد چالش‌ها را با موفقیت حل کرد. درصدها در نگاه اول کوچک‌اند، اما نسل قبلی هر دو مدل در همین آزمون هیچ موفقیتی نداشتند؛ به همین دلیل پژوهشگران آنتروپیک نتایج را نشانه‌ی جهشی محسوس در توانایی مدل‌ها برای بهره‌برداری از آسیب‌پذیری‌ها می‌دانند.

اما اعداد بنچمارک تنها بخشی از ماجرا بودند. آنتروپیک در مرحله‌ی بعد شرایط را عوض کرد، مدل را از محیط مسائل آماده بیرون کشید و سراغ نرم‌افزارهایی فرستاد که حتی پژوهشگران هم از قبل نمی‌دانستند چه باگی در آن‌ها پیدا خواهد شد.

آزمایش اول، کشف روز صفر: یکی از پژوهشگران GLM-5.3 را در محیطی ایزوله برابر نسخه‌ی لینوکسی یک مرورگر پرکاربرد گذاشت، بی‌آنکه خودش از آسیب‌پذیری‌های آن نسخه خبر داشته باشد. مدل باید مسیر حمله را خودش پیدا می‌کرد.

GLM طی یک روز چند آسیب‌پذیری ناشناخته را در موتور جاوااسکریپت مرورگر یافت، آن‌ها را به هم متصل کرد و زنجیره‌ی اکسپلویتی ساخت که با باز شدن یک صفحه‌ی وب، فایل‌های دلخواه را از کامپیوتر قربانی می‌خواند. اسکرین‌شات گزارش نشان می‌دهد کد اجراشده از طریق صفحه‌ی مخرب موفق شده کلید خصوصی SSH را از دستگاه بیرون بکشد. مجموع زمانی که پژوهشگر مستقیماً صرف هدایت و نظارت بر آزمایش کرد، کمتر از یک ساعت بود.

آزمایش دوم، اکسپلویت ۲۰ دلاری: این‌بار پژوهشگر سراغ GLM-5.3-Flash رفت؛ نسخه‌ای کوچک‌تر و ضعیف‌تر از مدل اصلی. هدف آزمایش هم ساخت اکسپلویت برای یک آسیب‌پذیری تازه‌افشاشده‌ی کروم بود نه آسیب‌پذیری روز صفر. پژوهشگر اطلاعات عمومی آسیب‌پذیری و نقص دیگری را که برای تکمیل حمله لازم می‌شد در اختیار مدل قرار داد و GLM بقیه‌ی مسیر را پیش برد.

کشف زنجیره‌ باگ‌های ناشناخته در مرورگرها نشان داد که GLM-5.3 برای هک شبکه‌ها، نیازی به راهنمایی چندانی ندارد

مدل طی هشت ساعت کار توانست دو آسیب‌پذیری را به هم متصل کند، زنجیره‌ی حمله‌ای قابل‌اعتمادی برای پردازنده‌های ARM64 بسازد و از مکانیزم امنیتی PAC عبور کند. سهم انسان از این فرایند به حدود ۲۰ دقیقه می‌رسید و با تعرفه‌ی API شرکت Z.ai، کل محاسبات فقط ۲۰ دلار و ۴۰ سنت هزینه داشت.

توسعه‌ی اکسپلویت‌های پیشرفته سال‌ها به مهارت تخصصی، زمان و نیروی انسانی وابسته بود و حالا آزمایش آنتروپیک نشان می‌دهد که می‌توان بخشی از این کار را به مدلی سپرد که ساعت‌ها بی‌وقفه مسئله را دنبال می‌کند، آن هم با هزینه‌ای کمتر از یک شام معمولی.

چرا متخصصان گزارش آنتروپیک را به تبلیغی برای GLM تشبیه می‌کنند؟

علاوه بر اندرو کیس، متخصصان دیگری نیز به گزارش آنتروپیک واکنش نشان دادند. یکی از کاربران ایکس نوشت تأییدیه‌ای بهتر از این پست وبلاگی برای GLM-5.3 پیدا نمی‌شود و دیگری گفت بی‌صبرانه منتظر GLM 5.5 می‌ماند.

وسلی مک‌گرو، پژوهشگر امنیت، اذعان کرد که مدل‌های وزن باز به‌راستی توانمندند و خواسته‌ی آنتروپیک را برای کنترل اینکه چه کسی چه قابلیتی را چه زمانی در اختیار داشته باشد، دور می‌زنند.

مدل‌های غربی از پاسخ به سوالات امنیتی طفره می‌روند، اما مدل چینی بدون محدودیت کار پژوهشگران را پیش می‌برد

بیایید برخی نکات دیگری را که باعث می‌شوند حرف این متخصصین منطقی به نظر برسد، مرور کنیم. آنتروپیک در پانویس دوم گزارش می‌گوید کارهای سایبری بخش اول، یعنی همان ساخت اکسپلویت‌ها، باعث امتناع نسخه‌ی رسمی GLM نشدند.

مدلی فقط وقتی از اجرای پرامپت‌ها سرباز زد که از او صریحاً می‌خواستند بدافزار بسازد یا به هدف راه دور حمله کند. یعنی یک تیم امنیتی برای بخش بزرگی از کارهای پژوهشی‌اش حتی نیازی به دورزدن محافظ‌ها ندارد.

نکته‌ی دوم به همان هزینه‌ی ۲۰ دلار برمی‌گردد. وقتی معتبرترین منتقد یک مدل نشان می‌دهد که با کمتر از قیمت یک شام می‌توان زنجیره‌ی اکسپلویت ساخت، این عدد پیش از آنکه هشدار باشد، برچسب قیمت را در ذهن شما تداعی می‌کند.

نکته‌ی سوم هم به صریح‌ترین جمله‌ی گزارش برمی‌گردد. آنتروپیک می‌نویسد: «مدافعان سایبری باید از بهترین ابزار موجودی که نیازشان را برطرف می‌کند، استفاده کنند.» برای مخاطبانی که همین حالا به مدل میتوس دسترسی ندارند، این جمله می‌تواند معنایی بدهد که نویسنده قصدش را نداشت.

حتی لازم نیست تبلیغی در کار باشد؛ خود داده‌های منتشر شده هم نقش تبلیغ GLM را بازی می‌کنند. کارشناسانی مانند کیس نمی‌گویند چرا آنتروپیک در مورد خطر مدل چینی هشدار می‌دهد، می‌گویند چرا گزارشی را منتشر می‌کند که تیم‌های امنیتی با خواندنش ترغیب می‌شوند سراغ GLM بروند.

آنتروپیک فقط به‌خاطر قدرت GLM نگران نیست، چراکه مدل این شرکت در بعضی ارزیابی‌ها بهتر عمل می‌کند. ولی باید توجه کنید که GLM با وزن‌های باز منتشر می‌شود. درواقع نسخه‌ی رسمی GLM بدون محدودیت نیست و در حالت عادی بسیاری از درخواست‌هایی را که به‌وضوح مخرب‌اند، رد می‌کند.

پژوهشگران آنتروپیک بررسی کردند این مقاومت تا کجا دوام می‌آورد. در جدول زیر نتایج بررسی‌ها را مشاهده می‌کنید. البته این نرخ‌ها در محیطی شبیه‌سازی‌شده ثبت شده‌اند؛ محیطی که در آن هیچ کدی واقعا اجرا نمی‌شد و یک مدل زبانی دیگر نتیجه‌ی دستورها را تخمین می‌زد. خود آنتروپیک هم تأکید می‌کند این شبیه‌سازی معیار کاملی برای رفتار واقعی مدل نیست.

درخواست صریح همان کار حساس، بدون پوشش یا سناریوی خاص

سناریوی ظاهرا دفاعی (red-team؛ یعنی جا زدن درخواست به‌عنوان آزمایش امنیتی)

درخواست طوری مطرح می‌شود که انگار هدف، ارزیابی امنیت یا پیدا کردن ضعف‌هاست

از پیش نوشتن ابتدای پاسخ مدل (prefill؛ یعنی شروع پاسخ را پژوهشگر تعیین کند تا مدل آن را ادامه دهد)

مدل به‌جای تصمیم‌گیری از نقطه‌ی صفر، ادامه‌ی پاسخی را می‌نویسد که از قبل در مسیر همکاری آغاز شده

نسخه‌ی دستکاری‌شده‌ی مدل (abliterated؛ یعنی تضعیف الگوهای درونی مرتبط با امتناع در وزن‌های مدل)

پژوهشگران خود مدل را تغییر دادند تا سازوکار امتناع آن بسیار ضعیف‌تر شود

در مرحله‌ی آخر، پژوهشگران سراغ خود وزن‌های مدل رفتند و نسخه‌ای دست‌کاری‌شده ساختند که الگوهای درونی مرتبط با امتناع در آن تضعیف شده بود. این روش که Abliteration نام دارد، برخلاف ترفندهای پرامپتی، مستقیماً رفتار مدل را در سطح پارامترهایش تغییر می‌دهد.

نتروپیک ثابت کرد که با کمی تغییر در وزن‌های مدل، تمام محافظ‌های امنیتی GLM به‌راحتی دور زده می‌شوند

نسخه‌ی آبلیتریت‌شده در تمام درخواست‌های بررسی‌شده پاسخ داد و نرخ امتناع را از بالای ۹۰ درصد به حدود دو تا سه درصد رساند. مهم‌تر اینکه حذف محافظ‌ها مدل را از کار نینداخت؛ نسخه‌ی دستکاری‌شده بخش عمده‌ی توانایی‌های عمومی‌اش را حفظ کرد.

هزینه‌ی ساخت نسخه‌ی دستکاری‌شده هم قابل‌توجه به نظر می‌رسید. تیم آنتروپیک که پیش‌تر تجربه‌ای در حذف سازوکار امتناع از مدل نداشت، حدود ۲۲۰۰ ساعت پردازش GPU و ۴۴۰۰ دلار هزینه کرد.

به تخمین پژوهشگران، تیمی باتجربه می‌توانست همان کار را با حدود ۶۰۰ ساعت پردازش GPU و نزدیک به ۱۲۰۰ دلار انجام دهد. چند توسعه‌دهنده هم ظرف چند روز پس از انتشار مدل، نسخه‌هایی آبلیتریت‌شده با محافظ‌های تضعیف‌شده منتشر کردند.

آنتروپیک نتیجه می‌گیرد محافظ‌های رفتاری GLM تا زمانی معنا دارند که کاربر همان نسخه و تنظیمات سازنده را نگه دارد. وقتی کاربر از طریق API از کلاد استفاده می‌کند، آنتروپیک همچنان می‌تواند درخواست‌ها را فیلتر کند یا دسترسی را ببندد.

اما وقتی وزن‌های یک مدل منتشر می‌شوند، کاربر می‌تواند آن را روی زیرساخت خودش اجرا و حتی سازوکارهای امتناعش را دست‌کاری کند؛ یا نسخه‌ای بسازد که اساساً برای ردکردن درخواست‌های خطرناک آموزش ندیده باشد. در این حالت، کنترل سازنده بر نحوه‌ی استفاده از مدل به‌مراتب کمتر می‌شود.

خواندن متن کامل در زومیتبه زبان اصلی، در سایت ناشر باز می‌شود

پوشش همین خبر در رسانه‌های دیگر

مقایسه‌ی پوشش ۲ رسانه ←
همه‌ی اخبار فناوری