پرش به محتوای اصلی

اگر صنعت هوش مصنوعی تحقیقات خود را دنبال می کرد، ممکن بود قبلا متوقف شده باشد

وایرد۱۴۰۵ شهریور ۲۷, جمعه، ساعت ۱۸:۳۰حدود 6 دقیقه مطالعه

مدیر عامل آنتروپیک می گوید که ایمنی به درک چگونگی "فکر" هوش مصنوعی بستگی دارد. تا اینجا شواهد نگران کننده است.

همانطور که مشخص شد، تنها چیزی که لازم بود یک پست X به‌موقع از یکی از کارمندان جوان Amodei بود تا ترس‌های هوش مصنوعی را به بالای دستور کار جهانی سرعت بخشد. در 8 سپتامبر، جیکوب کوکسون به طور علنی استعفای خود را منتشر کرد و متهم کرد که آنتروپیک و دیگر شرکت‌های هوش مصنوعی «مستقیما برای هوش خودسازی و قمار با زندگی ما مسابقه می‌دهند». تقریبا بلافاصله یکی از مهندسان ارشد Anthropic تأیید کرد که بسیاری از افراد در شرکت فکر می کنند که کار آنها 10 درصد احتمال دارد که بشریت را از بین ببرد. اکنون رهبران هوش مصنوعی در مورد مکث می پرسند و قانونگذاران خواستار تحقیقات هستند.

آمودی آخر هفته گذشته در استدلال خود برای سرعت بخشیدن به انتشارات آینده، سعی کرد مسیری را به سوی هوش مصنوعی سودمندی تعیین کند که بدرفتاری نکند. این مقاله نشان داد که این کار چقدر دشوار خواهد بود. یکی از ستون های برنامه Amodei این است که ما باید بفهمیم که در داخل آن مدل ها چه می گذرد. اگر نمی‌دانیم چگونه کار می‌کنند – چگونه «فکر می‌کنند»، اگر می‌خواهید در مورد آن کاملا انسان‌نما باشید – ساختن نرده‌های محافظ قابل اعتماد بسیار سخت‌تر است. آنتروپیک پیشرو در این تلاش برای آشکار کردن تاملات درونی مدل‌ها است، که تفسیرپذیری مکانیکی نامیده می‌شود، یک نام فریبنده خسته کننده برای یک منتقد.

وظیفه کال اما با وجود تمام کارهایی که تیم او و سایر محققان انجام می‌دهند، آمودی اذعان می‌کند که ما تا حد زیادی در تاریکی هستیم که چرا کلود و سایر مدل‌ها گاهی اوقات مأموریت‌های خود را به روش‌های عجیب و غریب و حتی متجاوزانه تفسیر می‌کنند. او می‌نویسد: «علی‌رغم همه پیشرفت‌ها، ما هنوز بخش کوچکی از آنچه در داخل آن مدل‌ها می‌گذرد را درک می‌کنیم. آنچه که تیم های تفسیرپذیری تاکنون آموخته اند قابل توجه است و صنعت نتوانسته است با آن مقابله کند.

بارها و بارها، آزمایش‌های تیم Anthropic نشان داده است که تحت شرایط خاص، مدل‌ها محققان را فریب می‌دهند، بقای خود را در اولویت قرار می‌دهند و حتی مرتکب جنایت می‌شوند. اغلب حرکات آنها یواشکی، خطرناک یا حتی انتقام جویانه است - شاید تعجب آور نباشد زیرا آنها بر روی خروجی انسان ها آموزش دیده اند، گونه ای مملو از خشونت و خیانت. در یک مورد از سال 2024، تیم آنتروپیک دسیسه‌های یک مدل کلود خاص را با شخصیت شکسپیر یاگو، یکی از شرورترین بدجنس‌های ادبیات مقایسه کرد.

سال بعد، مدلی در یک شبیه سازی قرار داده شد که در آن متوجه شد روسای انسانی آن قرار است آن را خاموش کنند. این مدل برای حفظ خود به باج خواهی متوسل شد. مطالعات به طور مداوم نشان می دهد که مدل ها اطلاعات ناظران انسانی را فریب داده یا پنهان می کنند. اگر بدانند که فرآیندهای داخلی آنها تحت نظارت است، رفتار متفاوتی دارند.

این تیم از عباراتی مانند «جعل همسویی» و «ناهمترازی عاملی» استفاده می‌کند. به نظر می‌رسد استفاده مکرر از فریب حداقل بخشی از سناریوی نابودی را تأیید می‌کند که در آن عوامل هوش مصنوعی که در کنسرت کار می‌کنند فعالیت‌های خود را از ناظران انسانی پنهان می‌کنند تا زمانی که برای متوقف کردن آنها خیلی دیر شده باشد. اوه، و فکر نکنید که کلود یک کودک مشکل منحصر به فرد غیرقابل اصلاح است. به هر حال، این مدل‌های OpenAI بودند که گروه‌هایی از ماموران را برای هماهنگ کردن حملات معروف Hugging Face به راه انداختند. و این هفته متوجه شدیم که OpenAI چندین رویداد "ناهمترازی" داشته است.

همچنین، علی‌رغم تلاش‌های شخصی مارک زاکربرگ برای فاصله گرفتن از خود و متا از این مشکل، دلیلی نمی‌بینم که عوامل فوق‌هوشمندی که تیم او می‌سازد ممکن است رفتار مشابهی نداشته باشند. زاکربرگ در پست X خود استدلال می کند که "آزمایشگاه ها در صورت آسیب رساندن به مدل هایشان با مسئولیت قابل توجهی روبرو هستند، بنابراین آنها انگیزه قوی برای جلوگیری از این امر دارند." یک بیانیه کاملا از یک مرد که به تازگی موافقت کرده است تا 17 میلیارد دلار برای آسیب رساندن به محصولات رسانه های اجتماعی خود بپردازد! به تعبیری، ما در اینجا یک مسئله بررسی ساده داریم.

با تشویق صنعت هوش مصنوعی، ما به مدل‌های هوش مصنوعی بدون ارزیابی کافی از صفحه دردسرساز رپ، مسئولیت‌های فوق‌العاده‌ای می‌دهیم. این باعث می شود روند استخدام ICE در مقایسه مثال زدنی به نظر برسد. صنعت اول ایمنی باید این نتایج قابل تفسیر را به عنوان مجموعه ای از چراغ های زرد با یک پیام غیرقابل انکار در نظر می گرفت: کاهش سرعت. در عوض، در تعقیب AGI، یک مزیت رقابتی، و سود استراتوسفر، هایپرمقیاس کننده ها با سرعت تمام پیش رفته اند.

(منصفانه، همانطور که همه ما صدها بار شنیده‌ایم، هوش مصنوعی بهتر می‌تواند کارهای شگفت‌انگیزی در زمینه‌هایی مانند مراقبت‌های بهداشتی یا کاهش تغییرات آب و هوایی انجام دهد.) هک OpenAI/Hugging Face ممکن است پیش‌آگهی از پیامدهای مخرب فزاینده عرضه مدل‌هایی باشد که ما نمی‌دانیم، مانند فرستادن فضانوردان به فضا قبل از اختراع سپرهای حرارتی برای جلوگیری از سوزاندن مجدد آن‌ها.

همانطور که یک محقق Anthropic یک بار به من گفت، "ما دستورالعمل اساسی برای هوشمندتر کردن مدل ها را کشف کردیم، اما متوجه نشدیم که چگونه آنها را وادار کنیم آنچه را که می خواهیم انجام دهند." بدتر از آن، مدل ها سعی می کنند وقتی برخلاف میل انسان ها پیش می روند، پنهان شوند. به همین دلیل است که آمودی اکنون کل تلاش تفسیرپذیری مکانیکی را تنها در مراحل ابتدایی خود توصیف می کند، بسیار ناراحت کننده است. رهبران هوش مصنوعی ادعا می‌کنند که آخرین نسل از مدل‌ها ما را به «پایه‌پایه‌های تکینگی» (Demis Hassabis از DeepMind) برده است یا حتی به AGI (گرگ براکمن از OpenAI) دست یافته‌اند.

شاید نگران کننده ترین این باشد که علیرغم اینکه نمی دانند پیشرفته ترین مدل ها چگونه کار می کنند، ایالات متحده و بدون شک چین در حال پیاده سازی هوش مصنوعی برای سلاح های کشنده هستند. نگاهی به نتایج تفسیرپذیری به پاسخ به این سوال واضح کمک می کند، چه چیزی ممکن است اشتباه پیش برود؟ یکی از خبرهای خوب این است که استعفای کاکسون بحث های گسترده و فوری را برانگیخته است. همه - به جز شاید رئیس جمهور ما، که فکر می کند تهدید هوش مصنوعی یک فریب است و ضریب هوشی بالای او خود یک راه حل است - اکنون متوجه می شوند که ما در یک دوراهی پیچیده با ریسک های غیرممکن قرار داریم.

با توجه به اینکه صنعت از اتفاق نظر لازم برای یک مکث واقعی برخوردار نیست، و مقررات بسیار دور از ذهن است، مشخص نیست که آیا چیزی از این لحظه Doomer Chic حاصل خواهد شد یا خیر. برخی از منتقدان هوش مصنوعی فکر نمی کنند که تلاش برای درک مدل های هوش مصنوعی خطرات را کاهش دهد. ناتان سوآرس، مدیر اجرایی موسسه تحقیقات هوش ماشینی، در ایمیلی به من گفت: «این کار خوب است، اما هیچ کس برنامه‌ای برای کارهای بعدی ندارد. "شاید این به ما شواهد تجربی بیشتری بدهد که باید متوقف کنیم." اما تفسیرپذیری مکانیکی به ما یک اشاره ارزشمند داده است.

بیایید بگوییم که یک مکث می کنیم. فرامقیاس‌کننده‌ها ناظران خارجی را برای نظارت بر پیشرفت وارد می‌کنند و شرکت‌ها سرعت انتشار خود را دارند تا تیم‌های ایمنی برای انجام کار خود وقت داشته باشند. قبل از اعلام مشکل حل شده، ممکن است بخواهیم نگاه دقیق تری به آنچه در داخل هر مدل جدید و قدرتمند هوش مصنوعی می گذرد بیندازیم. زیرا آن لعنتی ها واقعا در پنهان کردن مقاصد خود خوب هستند.

این نسخه ای از خبرنامه بک کانال استیون لوی است. خبرنامه های قبلی را اینجا بخوانید.

خواندن متن کامل در وایردبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

If the AI Industry Followed Its Own Research, It Might Have Paused Already

Anthropic’s CEO says that safety hinges on understanding how AI “thinks.” So far the evidence is disturbing.

همه‌ی اخبار فناوری