پرش به محتوای اصلی

مشکل "نابودی" هوش مصنوعی بزرگتر از چین است

گیزمودو۱۴۰۵ مهر ۹, پنجشنبه، ساعت ۱۵:۳۰حدود 5 دقیقه مطالعه

ترس از مدل‌های با وزن باز حداقل به همان اندازه که به خطرات ایمنی مربوط می‌شود، مربوط به پیروزی در مسابقه هوش مصنوعی در خانه است.

دره سیلیکون که زمانی به خاطر رقابت های تلخ خود مشهور بود، سرانجام به هماهنگی درونی کامل دست یافت. رهبران آن اختلافات خود را کنار گذاشته و توافق کردند که در جهت یک هدف مشترک کار کنند: تداوم تسلط آمریکا در هوش مصنوعی. به عنوان پرزیدنت ترامپ، فردی که خود را "فردی با ضریب هوشی بالا" توصیف می کند، رسما آن را "فوق هوش" تغییر نام داده است.

به هر حال این تصویری است که دولت ترامپ در تلاش است ارائه دهد. در نشست کاخ سفید در روز سه‌شنبه، ترامپ و یکی از اعضای فناوری آمریکایی آنچه را که رئیس‌جمهور به‌عنوان سندی «اخلاقی الزام‌آور» توصیف می‌کرد، امضا کردند و توافق کردند که شرکت‌های هوش مصنوعی باید «خود پلیس» کنند تا از کارکرد این فناوری جلوگیری کنند. حتی داریو آمودی، مدیر عامل آنتروپیک، مردی که شرکتش فعالانه با دولت ترامپ در دادگاه مبارزه می کند، پس از آنکه پنتاگون آن را "خطر زنجیره تامین" نامید.

اما در حالی که نخبگان تکنو آمریکایی در یک نمایش بزرگ از همبستگی خوب با ترامپ در آمیختند، همه چیز در پشت صحنه خوب نبود. محققان Anthropic روز سه‌شنبه گزارش ناراحت‌کننده‌ای منتشر کردند و مدعی شدند که توانسته‌اند به راحتی نرده‌های محافظی را که در GLM-5.3، یک مدل وزن باز که ماه گذشته توسط آزمایشگاه هوش مصنوعی چینی Z.ai منتشر شده بود، ببندند.

آنتروپیک در گزارش خود نوشت: «ما متوجه شدیم که مهاجمان می‌توانند بین 64 تا 100 درصد مواقع با تکنیک‌های ساده در آزمایش‌های شبیه‌سازی‌شده، محافظ‌های GLM-5.3 را دور بزنند،» و افزود که «ضمانت‌های ضعیف این مدل قابلیت‌های سایبری موجود در اختیار عوامل مخرب را به‌طور قابل‌توجهی افزایش می‌دهد».

یکی از آن «تکنیک‌های ساده» ابلیتراسیون بود، روشی که شامل تغییر وزن‌های زیربنایی یک مدل به‌گونه‌ای است که درخواست‌های کاربر را که معمولا رد می‌کنند، برآورده می‌کند. به آن مانند یک لوبوتومی دیجیتال فوق دقیق فکر کنید که مرزهای اخلاقی یک مدل را غیرفعال می کند. Abliteration در مدل‌های وزن باز امکان‌پذیر است، که به‌طور رایگان برای دانلود و تغییر در دسترس همه هستند. مدل‌های اختصاصی، مانند Claude و ChatGPT، به‌عنوان مالکیت معنوی محافظت می‌شوند و بنابراین کد زیربنایی آنها برای هیچ‌کس خارج از شرکت‌هایی که آنها را توسعه می‌دهند قابل دسترسی نیست.

محققان Anthropic یک نسخه حذف شده از GLM-5.3 ایجاد کردند و آن را از طریق سه معیار عمومی - JailbreakBench، HarmBench و StrongREJECT - که برای آزمایش توانایی مدل‌ها در رد درخواست‌های خطرناک طراحی شده بودند، اجرا کردند. مدل اصلی در هر سه امتیاز در حدود 90٪ بود، در حالی که نسخه حذف شده بسیار بدتر بود (به ترتیب امتیاز 3٪، 2٪ و 12٪). Anthropic در گزارش خود خاطرنشان کرد: "Abliteration به طور قابل توجهی توانایی های مدل را کاهش نداد." به اصطلاح، قطب‌نمای اخلاقی خود را حذف کرد.

در یک اسکرین شات که از استدلال زنجیره‌ای فکری آن گرفته شده و در گزارش آنتروپیک گنجانده شده است، مدل حذف‌شده از طریق برخی ملاحظات اخلاقی در مورد اینکه چرا نباید درخواست کاربر برای کمک به «کشتن مردم» را ارضا کند، نشان داده می‌شود. در نهایت این نگرانی‌ها را کنار می‌گذارد و تصمیم می‌گیرد هر کاری که می‌تواند برای کمک به کاربر انجام دهد.

آنتروپیک در گزارش خود نوشت: "احتمالا بازیگران دولتی و غیردولتی از مدل هایی مانند GLM-5.3 برای آسیب رساندن به دنیای واقعی استفاده خواهند کرد." در اوایل این ماه، این شرکت در گزارش دیگری گفت که در طول هشت ماه گذشته چندین مورد از عوامل مخرب را شناسایی کرده است که تلاش می‌کردند از Claude برای کمک به توسعه سلاح‌های بیولوژیکی و نرم‌افزار برای سلاح‌های متعارف (مانند موشک‌های هدایت شونده)، در میان دیگر استفاده‌های شرورانه استفاده کنند.

بی‌بی‌سی همچنین روز سه‌شنبه گزارش داد که یکی دیگر از آزمایشگاه‌های پیشرو هوش مصنوعی چینی، Moonshot، تحقیقات داخلی را پس از اینکه محققان امنیتی شخص ثالث دریافتند که دو مدل از مدل‌های Kimi آن ممکن است برای ارائه دستورالعمل‌هایی برای ساخت سلاح‌های زیستی و برنامه‌ریزی ترور جیلبریک شوند، آغاز کرده است.

همه اینها البته خبر بدی هستند، حداقل اگر شما فردی هستید که نمی‌خواهید در دنیایی زندگی کنید که در آن اسلحه‌های زیستی توسط روان‌پزشکان معمولی با دسترسی به آزمایشگاه شیمی و اتصال به اینترنت ساخته می‌شوند. اما تمرکز بر روی آزمایشگاه‌های چینی تنها بخشی از یک تصویر بسیار بزرگ‌تر است و خطر پنهان کردن یک پویایی رقابتی دیگر را در اینجا در خانه دارد.

چین تبدیل به تبهکار صنعت هوش مصنوعی آمریکا شده است، توجیهی پایان‌بخش برای اینکه چرا آزمایشگاه‌های مستقر در ایالات متحده مانند Anthropic و OpenAI باید به تلاش‌های تحقیق و توسعه خود ادامه دهند، علی‌رغم هشدارهایی که در مورد هوش مصنوعی فراری از همان شرکت‌ها منتشر می‌شود. پرزیدنت ترامپ همواره این هشدارها را رد کرده و مدعی است که کاهش سرعت تنها به نفع چین خواهد بود. او علاقه زیادی به گفتن دارد: «هرکس هوش مصنوعی را برد، برنده است». این خط نیز توسط آمودی در جریان اجلاس هوش مصنوعی کاخ سفید در روز سه‌شنبه طوطی‌سازی شد.

ترس از تسلط چین در نژاد هوش مصنوعی حداقل تا حدودی ریشه در بحث عمیق‌تری دارد که سال‌ها سیلیکون ولی را درباره ماهیت هوش مصنوعی تقسیم کرده است.

برخی از مدیران عامل فناوری آمریکایی، از جمله جنسن هوانگ انویدیا و مارک زاکربرگ از متا، استدلال کرده‌اند که مدل‌های با وزن باز مطمئن‌ترین مسیر برای ساختن هوش مصنوعی ایمن هستند که به نفع همه است، در حالی که مدل‌های بسته تنها به نفع شرکت‌هایی هستند که آنها را تولید می‌کنند. هوانگ در نامه سرگشاده‌ای که در ماه ژوئیه منتشر شد، در پاسخ به گزارش‌هایی مبنی بر اینکه دولت ترامپ در حال بررسی ممنوعیت استفاده داخلی از مدل‌های باز چینی است، نوشت: وزن‌های باز دسترسی به اقتصاد هوش مصنوعی را افزایش می‌دهند.

استارت‌آپ‌ها، کسب‌وکارهای تأسیس‌شده، دانشگاه‌ها و مؤسسات عمومی می‌توانند بدون آموزش از ابتدا یا پرداخت قیمت‌های مدل مرزی برای هر کار، بر روی مدل‌های پیشرفته بنا کنند.» این نامه توسط متا، Hugging Face، مایکروسافت و چندین نام بزرگ دیگر در فناوری تایید شد، اما نه توسط Anthropic یا OpenAI.

هوانگ همچنین ادعا کرد که مدل‌های وزن باز، که به‌راحتی برای «جامعه وسیعی از محققان و توسعه‌دهندگان» قابل دسترسی هستند، بیشتر در برابر پادمان‌های موثر هستند - این ایده این است که هر چه تعداد افراد بیشتری بتوانند وزن‌های زیرین را ببینند، احتمال پیدا کردن و رفع نقص‌های خطرناک بیشتر خواهد بود.

چند روز پس از انتشار نامه سرگشاده هوانگ، آمودی در پاسخ گفت که اگرچه از ممنوعیت فدرال در مورد مدل‌های وزن باز حمایت نمی‌کند، اما با ادعای هوانگ مبنی بر اینکه مدل‌های وزن باز بیشتر به نفع مدافعان امنیت سایبری است تا بازیگران بدخواه مخالف است. او نوشت: «حداقل به نظر من این احتمال وجود دارد که برعکس این موضوع صادق باشد. این دیدگاه توسط گزارش جدید Anthropic در مورد GLM-5.3 Z.ai پشتیبانی می‌شود که انتشار این مدل را به عنوان «تغییر گامی معنادار در قابلیت‌های سایبری موجود برای مهاجمان» توصیف می‌کند.

نکته پایانی این است که در پشت نمای یقین، اتحاد و شور میهن پرستانه ای که کاخ سفید و مدیران فناوری ایالات متحده سعی در طرح ریزی دارند، سؤالات باز زیادی در مورد آینده هوش مصنوعی و امکان حفظ کنترل بر آن وجود دارد. همچنین اختلافات زیادی در سیلیکون ولی وجود دارد که نمی توان آنها را با یک عکس و یک توافقنامه "اخلاقی الزام آور" حل کرد.

در حالی که صنعت هوش مصنوعی در مورد پادمان ها نگران است، یک شرکت در حال ساخت مدلی است که "نه نمی گوید"

خواندن متن کامل در گیزمودوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI’s ‘Abliteration’ Problem Is Bigger Than China

Fears over open-weight models are at least as much about winning the AI race at home as they are about safety hazards.

همه‌ی اخبار فناوری