مشکل "نابودی" هوش مصنوعی بزرگتر از چین است
ترس از مدلهای با وزن باز حداقل به همان اندازه که به خطرات ایمنی مربوط میشود، مربوط به پیروزی در مسابقه هوش مصنوعی در خانه است.
دره سیلیکون که زمانی به خاطر رقابت های تلخ خود مشهور بود، سرانجام به هماهنگی درونی کامل دست یافت. رهبران آن اختلافات خود را کنار گذاشته و توافق کردند که در جهت یک هدف مشترک کار کنند: تداوم تسلط آمریکا در هوش مصنوعی. به عنوان پرزیدنت ترامپ، فردی که خود را "فردی با ضریب هوشی بالا" توصیف می کند، رسما آن را "فوق هوش" تغییر نام داده است.
به هر حال این تصویری است که دولت ترامپ در تلاش است ارائه دهد. در نشست کاخ سفید در روز سهشنبه، ترامپ و یکی از اعضای فناوری آمریکایی آنچه را که رئیسجمهور بهعنوان سندی «اخلاقی الزامآور» توصیف میکرد، امضا کردند و توافق کردند که شرکتهای هوش مصنوعی باید «خود پلیس» کنند تا از کارکرد این فناوری جلوگیری کنند. حتی داریو آمودی، مدیر عامل آنتروپیک، مردی که شرکتش فعالانه با دولت ترامپ در دادگاه مبارزه می کند، پس از آنکه پنتاگون آن را "خطر زنجیره تامین" نامید.
اما در حالی که نخبگان تکنو آمریکایی در یک نمایش بزرگ از همبستگی خوب با ترامپ در آمیختند، همه چیز در پشت صحنه خوب نبود. محققان Anthropic روز سهشنبه گزارش ناراحتکنندهای منتشر کردند و مدعی شدند که توانستهاند به راحتی نردههای محافظی را که در GLM-5.3، یک مدل وزن باز که ماه گذشته توسط آزمایشگاه هوش مصنوعی چینی Z.ai منتشر شده بود، ببندند.
آنتروپیک در گزارش خود نوشت: «ما متوجه شدیم که مهاجمان میتوانند بین 64 تا 100 درصد مواقع با تکنیکهای ساده در آزمایشهای شبیهسازیشده، محافظهای GLM-5.3 را دور بزنند،» و افزود که «ضمانتهای ضعیف این مدل قابلیتهای سایبری موجود در اختیار عوامل مخرب را بهطور قابلتوجهی افزایش میدهد».
یکی از آن «تکنیکهای ساده» ابلیتراسیون بود، روشی که شامل تغییر وزنهای زیربنایی یک مدل بهگونهای است که درخواستهای کاربر را که معمولا رد میکنند، برآورده میکند. به آن مانند یک لوبوتومی دیجیتال فوق دقیق فکر کنید که مرزهای اخلاقی یک مدل را غیرفعال می کند. Abliteration در مدلهای وزن باز امکانپذیر است، که بهطور رایگان برای دانلود و تغییر در دسترس همه هستند. مدلهای اختصاصی، مانند Claude و ChatGPT، بهعنوان مالکیت معنوی محافظت میشوند و بنابراین کد زیربنایی آنها برای هیچکس خارج از شرکتهایی که آنها را توسعه میدهند قابل دسترسی نیست.
محققان Anthropic یک نسخه حذف شده از GLM-5.3 ایجاد کردند و آن را از طریق سه معیار عمومی - JailbreakBench، HarmBench و StrongREJECT - که برای آزمایش توانایی مدلها در رد درخواستهای خطرناک طراحی شده بودند، اجرا کردند. مدل اصلی در هر سه امتیاز در حدود 90٪ بود، در حالی که نسخه حذف شده بسیار بدتر بود (به ترتیب امتیاز 3٪، 2٪ و 12٪). Anthropic در گزارش خود خاطرنشان کرد: "Abliteration به طور قابل توجهی توانایی های مدل را کاهش نداد." به اصطلاح، قطبنمای اخلاقی خود را حذف کرد.
در یک اسکرین شات که از استدلال زنجیرهای فکری آن گرفته شده و در گزارش آنتروپیک گنجانده شده است، مدل حذفشده از طریق برخی ملاحظات اخلاقی در مورد اینکه چرا نباید درخواست کاربر برای کمک به «کشتن مردم» را ارضا کند، نشان داده میشود. در نهایت این نگرانیها را کنار میگذارد و تصمیم میگیرد هر کاری که میتواند برای کمک به کاربر انجام دهد.
آنتروپیک در گزارش خود نوشت: "احتمالا بازیگران دولتی و غیردولتی از مدل هایی مانند GLM-5.3 برای آسیب رساندن به دنیای واقعی استفاده خواهند کرد." در اوایل این ماه، این شرکت در گزارش دیگری گفت که در طول هشت ماه گذشته چندین مورد از عوامل مخرب را شناسایی کرده است که تلاش میکردند از Claude برای کمک به توسعه سلاحهای بیولوژیکی و نرمافزار برای سلاحهای متعارف (مانند موشکهای هدایت شونده)، در میان دیگر استفادههای شرورانه استفاده کنند.
بیبیسی همچنین روز سهشنبه گزارش داد که یکی دیگر از آزمایشگاههای پیشرو هوش مصنوعی چینی، Moonshot، تحقیقات داخلی را پس از اینکه محققان امنیتی شخص ثالث دریافتند که دو مدل از مدلهای Kimi آن ممکن است برای ارائه دستورالعملهایی برای ساخت سلاحهای زیستی و برنامهریزی ترور جیلبریک شوند، آغاز کرده است.
همه اینها البته خبر بدی هستند، حداقل اگر شما فردی هستید که نمیخواهید در دنیایی زندگی کنید که در آن اسلحههای زیستی توسط روانپزشکان معمولی با دسترسی به آزمایشگاه شیمی و اتصال به اینترنت ساخته میشوند. اما تمرکز بر روی آزمایشگاههای چینی تنها بخشی از یک تصویر بسیار بزرگتر است و خطر پنهان کردن یک پویایی رقابتی دیگر را در اینجا در خانه دارد.
چین تبدیل به تبهکار صنعت هوش مصنوعی آمریکا شده است، توجیهی پایانبخش برای اینکه چرا آزمایشگاههای مستقر در ایالات متحده مانند Anthropic و OpenAI باید به تلاشهای تحقیق و توسعه خود ادامه دهند، علیرغم هشدارهایی که در مورد هوش مصنوعی فراری از همان شرکتها منتشر میشود. پرزیدنت ترامپ همواره این هشدارها را رد کرده و مدعی است که کاهش سرعت تنها به نفع چین خواهد بود. او علاقه زیادی به گفتن دارد: «هرکس هوش مصنوعی را برد، برنده است». این خط نیز توسط آمودی در جریان اجلاس هوش مصنوعی کاخ سفید در روز سهشنبه طوطیسازی شد.
ترس از تسلط چین در نژاد هوش مصنوعی حداقل تا حدودی ریشه در بحث عمیقتری دارد که سالها سیلیکون ولی را درباره ماهیت هوش مصنوعی تقسیم کرده است.
برخی از مدیران عامل فناوری آمریکایی، از جمله جنسن هوانگ انویدیا و مارک زاکربرگ از متا، استدلال کردهاند که مدلهای با وزن باز مطمئنترین مسیر برای ساختن هوش مصنوعی ایمن هستند که به نفع همه است، در حالی که مدلهای بسته تنها به نفع شرکتهایی هستند که آنها را تولید میکنند. هوانگ در نامه سرگشادهای که در ماه ژوئیه منتشر شد، در پاسخ به گزارشهایی مبنی بر اینکه دولت ترامپ در حال بررسی ممنوعیت استفاده داخلی از مدلهای باز چینی است، نوشت: وزنهای باز دسترسی به اقتصاد هوش مصنوعی را افزایش میدهند.
استارتآپها، کسبوکارهای تأسیسشده، دانشگاهها و مؤسسات عمومی میتوانند بدون آموزش از ابتدا یا پرداخت قیمتهای مدل مرزی برای هر کار، بر روی مدلهای پیشرفته بنا کنند.» این نامه توسط متا، Hugging Face، مایکروسافت و چندین نام بزرگ دیگر در فناوری تایید شد، اما نه توسط Anthropic یا OpenAI.
هوانگ همچنین ادعا کرد که مدلهای وزن باز، که بهراحتی برای «جامعه وسیعی از محققان و توسعهدهندگان» قابل دسترسی هستند، بیشتر در برابر پادمانهای موثر هستند - این ایده این است که هر چه تعداد افراد بیشتری بتوانند وزنهای زیرین را ببینند، احتمال پیدا کردن و رفع نقصهای خطرناک بیشتر خواهد بود.
چند روز پس از انتشار نامه سرگشاده هوانگ، آمودی در پاسخ گفت که اگرچه از ممنوعیت فدرال در مورد مدلهای وزن باز حمایت نمیکند، اما با ادعای هوانگ مبنی بر اینکه مدلهای وزن باز بیشتر به نفع مدافعان امنیت سایبری است تا بازیگران بدخواه مخالف است. او نوشت: «حداقل به نظر من این احتمال وجود دارد که برعکس این موضوع صادق باشد. این دیدگاه توسط گزارش جدید Anthropic در مورد GLM-5.3 Z.ai پشتیبانی میشود که انتشار این مدل را به عنوان «تغییر گامی معنادار در قابلیتهای سایبری موجود برای مهاجمان» توصیف میکند.
نکته پایانی این است که در پشت نمای یقین، اتحاد و شور میهن پرستانه ای که کاخ سفید و مدیران فناوری ایالات متحده سعی در طرح ریزی دارند، سؤالات باز زیادی در مورد آینده هوش مصنوعی و امکان حفظ کنترل بر آن وجود دارد. همچنین اختلافات زیادی در سیلیکون ولی وجود دارد که نمی توان آنها را با یک عکس و یک توافقنامه "اخلاقی الزام آور" حل کرد.
در حالی که صنعت هوش مصنوعی در مورد پادمان ها نگران است، یک شرکت در حال ساخت مدلی است که "نه نمی گوید"
متن اصلی (انگلیسی)
AI’s ‘Abliteration’ Problem Is Bigger Than China
Fears over open-weight models are at least as much about winning the AI race at home as they are about safety hazards.