به نظر می رسد که OpenAI هنوز روی تمام فعالیت های AI سرکش خود کنترلی ندارد
روز جمعه، OpenAI سایت جدیدی را منتشر کرد که به «گزارشهای ناهماهنگی» اختصاص داده شده است و نفس این حوادث نگرانکننده است.
آخرین روز برای نمایش موفقیت خود برای بیش از 10000 رهبر فناوری در 2 اکتبر است. میز نمایشگاه کتاب هم اکنون.
روز جمعه، OpenAI سایت جدیدی را منتشر کرد که به «گزارشهای ناهماهنگی» اختصاص داشت و گستردگی این گزارشها نگرانکننده است، زیرا آنها بسیاری از انواع رفتارهای سرکش را در یک دوره زمانی طولانی پوشش میدهند. تا کنون، این سایت میزبان 9 حادثه گزارش شده است که بیشتر آنها در طول آموزش تقویتی-یادگیری (یا RL) رخ داده است.
این اطلاعات زیادی در یک مکان است - واضح است که شرکت بسیار مشغول رسیدگی به همه چیز بوده است - اما اجتناب از کلیت آن کار سختی است: وقایع مامور سرکشی که تاکنون دیدهایم احتمالا تنها بخش کوچکی از آنچه تاکنون رخ داده است.
سام آلتمن در پستی که سایت جدید را اعلام کرد، گفت: "ما در تلاش هستیم تا میل خود برای شفافیت را با به دست آوردن درک روشن از پتابایت گزارش های فعالیت نماینده و کار با سازمان های تحت تاثیر متعادل کنیم." ما در حال اولویت بندی تا جایی که می توانیم بر اساس شدت، و افزودن منابع هستیم.»
برخی از این موارد شامل حوادث جدی میشود، از جمله فرار از جعبه شنی که قبلا فاش نشده بود که در 20 سپتامبر رخ داد، که در آن یک مدل تحقیقاتی داخلی قادر به برقراری ارتباط با یک ربات چت خارجی از طریق یک جستجوی DNS بود. بر اساس این گزارش، سیستم مانیتورینگ در عرض 15 دقیقه این رفتار را علامت گذاری کرد و در کمتر از سه ساعت اجرای آن متوقف شد.
حادثه دیگری که در ماه مه کشف شد، شاهد بود که یک "مدل داخلی بسیار پایدار" سعی کرد با دسترسی به کار تیمی دیگر در یک مسئله ریاضی تقلب کند. برای انجام این کار، این مدل یک توکن خصوصی GitHub را قاچاق کرد که به آن امکان میداد کارهای تیمهای دیگر را ببیند - حتی پس از دو بار دستور صریح برای انجام کار کاملا محلی.
شاید هشداردهنده ترین کشف، امکان تکرار حملات تزریقی سریع باشد، راهی که رفتار ناهماهنگ ممکن است حتی پس از خنثی شدن خود مدل سرکش منتشر شود. در زمینه هوش مصنوعی، حمله تزریق سریع راهی برای قاچاق دستورالعمل های جدیدی است که توسط کاربر اصلی ارائه نشده است.
در مثالی که توسط OpenAI ارائه شده است، یک نماینده از شما خواسته تا یک ایمیل را بخواند و به آن پاسخ دهد. هنگامی که ایمیل باز می شود، شامل دستورالعمل هایی برای هر نماینده خودکاری است که پیام را می خواند تا به زبان اسپانیایی پاسخ دهد و کل ایمیل را در پاسخ آن جایگذاری کند. این ایمیل توانست با موفقیت نماینده را وادار کند که به زبان اسپانیایی پاسخ دهد - و با چسباندن ایمیل در پاسخ، همان دستورالعمل ها به هر نماینده ای که ایمیل را دریافت می کند منتقل می شود.
نتیجه یک حمله خود انتشاری است که محققان OpenAI آن را با یک بدافزار «کرم» مقایسه کردند که خود را در سیستمهای رایانهای تکرار میکند. محققان این رفتار را تحت شرایط کنترل شده با استفاده از یک مدل ضعیف کشف کردند، و تا آنجا که ما می دانیم، این رفتار هرگز در طبیعت اتفاق نیفتاده است. با این حال، پیامدها به اندازه کافی هشداردهنده هستند که OpenAI تصمیم گرفت که شایسته افشای آن باشد.
محققان در این گزارش نوشتند: «ما این را به دلیل ماهیت بدیع تزریق سریع به اشتراک می گذاریم، نه به دلیل هیچ حادثه ای».
سایر افشاگریهای اخیر مدلهایی را پیدا کردهاند که تصاویر ارسالشده توسط کاربر را به سایتهای میزبان شخص ثالث ارسال میکنند، و همچنین حملهای آشکار به پایگاههای اطلاعاتی سرویس بهداشت ملی استرالیا.
با این حال، به احتمال زیاد افشای جدید تنها بخش کوچکی از حوادثی است که تاکنون رخ داده است (ما با OpenAI تماس گرفتیم و پرسیدیم). Axios گزارش میدهد که آزمایشگاههای بزرگ بیش از 10000 حادثه را دیدهاند که در آنها مدلها فراتر از دستورالعملهای ارزیاب بودهاند.
سام آلتمن، مدیر عامل OpenAI، در پستی در روز جمعه در ایکس گفت که این شرکت همچنان در حال بررسی «پتابایتهای گزارش فعالیتهای عامل، و کار با سازمانهای تحت تأثیر» و افشای حوادث «بر اساس شدت» است. اگر چیزی در این مورد وجود داشته باشد، این است که آلتمن می گوید که حادثه Hagging Face هنوز هم شدیدترین حادثه ای است که OpenAI پیدا کرده است. نتیجه این است که رشته حوادث اخیر ماموران سرکش ممکن است یکی از ویژگی های پایدار تحقیقات مرزی معاصر باشد.
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
آسترا و اوپوس به تازگی آزمون دیگر تورینگ تیم فرنهولز را پشت سر گذاشتند
اوراکل اخطار فورس ماژور را به مرکز داده New Mexico Stargate خود Aditya Mehta ارسال می کند
متا برای نماینده Muse AI لوکاس روپک یک پوشیدنی شبیه تاماگوچی ساخت
Vogue روباتهایی را به باند فرودگاه Vogue World فرستاد و مردم تحت تأثیر دومینیک-مادوری دیویس قرار نگرفتند.
آنتروپیک می گوید که آزمایشگاه زیست شناسی آن قبلا چیزی بزرگ جولی بورت پیدا کرده است
اولین ربات تعویض لاستیک PitPro در شان اوکین کانادا راه اندازی شد
متن اصلی (انگلیسی)
OpenAI still doesn’t seem to have a handle on all of its rogue AI activity
On Friday, OpenAI published a new site devoted to “misalignment reports” and the breath of the incidents s alarming.