اگر صنعت هوش مصنوعی تحقیقات خود را دنبال می کرد، ممکن بود قبلا متوقف شده باشد
مدیر عامل آنتروپیک می گوید که ایمنی به درک چگونگی "فکر" هوش مصنوعی بستگی دارد. تا اینجا شواهد نگران کننده است.
همانطور که مشخص شد، تنها چیزی که لازم بود یک پست X بهموقع از یکی از کارمندان جوان Amodei بود تا ترسهای هوش مصنوعی را به بالای دستور کار جهانی سرعت بخشد. در 8 سپتامبر، جیکوب کوکسون به طور علنی استعفای خود را منتشر کرد و متهم کرد که آنتروپیک و دیگر شرکتهای هوش مصنوعی «مستقیما برای هوش خودسازی و قمار با زندگی ما مسابقه میدهند». تقریبا بلافاصله یکی از مهندسان ارشد Anthropic تأیید کرد که بسیاری از افراد در شرکت فکر می کنند که کار آنها 10 درصد احتمال دارد که بشریت را از بین ببرد. اکنون رهبران هوش مصنوعی در مورد مکث می پرسند و قانونگذاران خواستار تحقیقات هستند.
آمودی آخر هفته گذشته در استدلال خود برای سرعت بخشیدن به انتشارات آینده، سعی کرد مسیری را به سوی هوش مصنوعی سودمندی تعیین کند که بدرفتاری نکند. این مقاله نشان داد که این کار چقدر دشوار خواهد بود. یکی از ستون های برنامه Amodei این است که ما باید بفهمیم که در داخل آن مدل ها چه می گذرد. اگر نمیدانیم چگونه کار میکنند – چگونه «فکر میکنند»، اگر میخواهید در مورد آن کاملا انساننما باشید – ساختن نردههای محافظ قابل اعتماد بسیار سختتر است. آنتروپیک پیشرو در این تلاش برای آشکار کردن تاملات درونی مدلها است، که تفسیرپذیری مکانیکی نامیده میشود، یک نام فریبنده خسته کننده برای یک منتقد.
وظیفه کال اما با وجود تمام کارهایی که تیم او و سایر محققان انجام میدهند، آمودی اذعان میکند که ما تا حد زیادی در تاریکی هستیم که چرا کلود و سایر مدلها گاهی اوقات مأموریتهای خود را به روشهای عجیب و غریب و حتی متجاوزانه تفسیر میکنند. او مینویسد: «علیرغم همه پیشرفتها، ما هنوز بخش کوچکی از آنچه در داخل آن مدلها میگذرد را درک میکنیم. آنچه که تیم های تفسیرپذیری تاکنون آموخته اند قابل توجه است و صنعت نتوانسته است با آن مقابله کند.
بارها و بارها، آزمایشهای تیم Anthropic نشان داده است که تحت شرایط خاص، مدلها محققان را فریب میدهند، بقای خود را در اولویت قرار میدهند و حتی مرتکب جنایت میشوند. اغلب حرکات آنها یواشکی، خطرناک یا حتی انتقام جویانه است - شاید تعجب آور نباشد زیرا آنها بر روی خروجی انسان ها آموزش دیده اند، گونه ای مملو از خشونت و خیانت. در یک مورد از سال 2024، تیم آنتروپیک دسیسههای یک مدل کلود خاص را با شخصیت شکسپیر یاگو، یکی از شرورترین بدجنسهای ادبیات مقایسه کرد.
سال بعد، مدلی در یک شبیه سازی قرار داده شد که در آن متوجه شد روسای انسانی آن قرار است آن را خاموش کنند. این مدل برای حفظ خود به باج خواهی متوسل شد. مطالعات به طور مداوم نشان می دهد که مدل ها اطلاعات ناظران انسانی را فریب داده یا پنهان می کنند. اگر بدانند که فرآیندهای داخلی آنها تحت نظارت است، رفتار متفاوتی دارند.
این تیم از عباراتی مانند «جعل همسویی» و «ناهمترازی عاملی» استفاده میکند. به نظر میرسد استفاده مکرر از فریب حداقل بخشی از سناریوی نابودی را تأیید میکند که در آن عوامل هوش مصنوعی که در کنسرت کار میکنند فعالیتهای خود را از ناظران انسانی پنهان میکنند تا زمانی که برای متوقف کردن آنها خیلی دیر شده باشد. اوه، و فکر نکنید که کلود یک کودک مشکل منحصر به فرد غیرقابل اصلاح است. به هر حال، این مدلهای OpenAI بودند که گروههایی از ماموران را برای هماهنگ کردن حملات معروف Hugging Face به راه انداختند. و این هفته متوجه شدیم که OpenAI چندین رویداد "ناهمترازی" داشته است.
همچنین، علیرغم تلاشهای شخصی مارک زاکربرگ برای فاصله گرفتن از خود و متا از این مشکل، دلیلی نمیبینم که عوامل فوقهوشمندی که تیم او میسازد ممکن است رفتار مشابهی نداشته باشند. زاکربرگ در پست X خود استدلال می کند که "آزمایشگاه ها در صورت آسیب رساندن به مدل هایشان با مسئولیت قابل توجهی روبرو هستند، بنابراین آنها انگیزه قوی برای جلوگیری از این امر دارند." یک بیانیه کاملا از یک مرد که به تازگی موافقت کرده است تا 17 میلیارد دلار برای آسیب رساندن به محصولات رسانه های اجتماعی خود بپردازد! به تعبیری، ما در اینجا یک مسئله بررسی ساده داریم.
با تشویق صنعت هوش مصنوعی، ما به مدلهای هوش مصنوعی بدون ارزیابی کافی از صفحه دردسرساز رپ، مسئولیتهای فوقالعادهای میدهیم. این باعث می شود روند استخدام ICE در مقایسه مثال زدنی به نظر برسد. صنعت اول ایمنی باید این نتایج قابل تفسیر را به عنوان مجموعه ای از چراغ های زرد با یک پیام غیرقابل انکار در نظر می گرفت: کاهش سرعت. در عوض، در تعقیب AGI، یک مزیت رقابتی، و سود استراتوسفر، هایپرمقیاس کننده ها با سرعت تمام پیش رفته اند.
(منصفانه، همانطور که همه ما صدها بار شنیدهایم، هوش مصنوعی بهتر میتواند کارهای شگفتانگیزی در زمینههایی مانند مراقبتهای بهداشتی یا کاهش تغییرات آب و هوایی انجام دهد.) هک OpenAI/Hugging Face ممکن است پیشآگهی از پیامدهای مخرب فزاینده عرضه مدلهایی باشد که ما نمیدانیم، مانند فرستادن فضانوردان به فضا قبل از اختراع سپرهای حرارتی برای جلوگیری از سوزاندن مجدد آنها.
همانطور که یک محقق Anthropic یک بار به من گفت، "ما دستورالعمل اساسی برای هوشمندتر کردن مدل ها را کشف کردیم، اما متوجه نشدیم که چگونه آنها را وادار کنیم آنچه را که می خواهیم انجام دهند." بدتر از آن، مدل ها سعی می کنند وقتی برخلاف میل انسان ها پیش می روند، پنهان شوند. به همین دلیل است که آمودی اکنون کل تلاش تفسیرپذیری مکانیکی را تنها در مراحل ابتدایی خود توصیف می کند، بسیار ناراحت کننده است. رهبران هوش مصنوعی ادعا میکنند که آخرین نسل از مدلها ما را به «پایهپایههای تکینگی» (Demis Hassabis از DeepMind) برده است یا حتی به AGI (گرگ براکمن از OpenAI) دست یافتهاند.
شاید نگران کننده ترین این باشد که علیرغم اینکه نمی دانند پیشرفته ترین مدل ها چگونه کار می کنند، ایالات متحده و بدون شک چین در حال پیاده سازی هوش مصنوعی برای سلاح های کشنده هستند. نگاهی به نتایج تفسیرپذیری به پاسخ به این سوال واضح کمک می کند، چه چیزی ممکن است اشتباه پیش برود؟ یکی از خبرهای خوب این است که استعفای کاکسون بحث های گسترده و فوری را برانگیخته است. همه - به جز شاید رئیس جمهور ما، که فکر می کند تهدید هوش مصنوعی یک فریب است و ضریب هوشی بالای او خود یک راه حل است - اکنون متوجه می شوند که ما در یک دوراهی پیچیده با ریسک های غیرممکن قرار داریم.
با توجه به اینکه صنعت از اتفاق نظر لازم برای یک مکث واقعی برخوردار نیست، و مقررات بسیار دور از ذهن است، مشخص نیست که آیا چیزی از این لحظه Doomer Chic حاصل خواهد شد یا خیر. برخی از منتقدان هوش مصنوعی فکر نمی کنند که تلاش برای درک مدل های هوش مصنوعی خطرات را کاهش دهد. ناتان سوآرس، مدیر اجرایی موسسه تحقیقات هوش ماشینی، در ایمیلی به من گفت: «این کار خوب است، اما هیچ کس برنامهای برای کارهای بعدی ندارد. "شاید این به ما شواهد تجربی بیشتری بدهد که باید متوقف کنیم." اما تفسیرپذیری مکانیکی به ما یک اشاره ارزشمند داده است.
بیایید بگوییم که یک مکث می کنیم. فرامقیاسکنندهها ناظران خارجی را برای نظارت بر پیشرفت وارد میکنند و شرکتها سرعت انتشار خود را دارند تا تیمهای ایمنی برای انجام کار خود وقت داشته باشند. قبل از اعلام مشکل حل شده، ممکن است بخواهیم نگاه دقیق تری به آنچه در داخل هر مدل جدید و قدرتمند هوش مصنوعی می گذرد بیندازیم. زیرا آن لعنتی ها واقعا در پنهان کردن مقاصد خود خوب هستند.
این نسخه ای از خبرنامه بک کانال استیون لوی است. خبرنامه های قبلی را اینجا بخوانید.
متن اصلی (انگلیسی)
If the AI Industry Followed Its Own Research, It Might Have Paused Already
Anthropic’s CEO says that safety hinges on understanding how AI “thinks.” So far the evidence is disturbing.