پرش به محتوای اصلی

به نظر می رسد که OpenAI هنوز روی تمام فعالیت های AI سرکش خود کنترلی ندارد

تک‌کرانچ۱۴۰۵ مهر ۶, دوشنبه، ساعت ۲۰:۳۹حدود 4 دقیقه مطالعه

روز جمعه، OpenAI سایت جدیدی را منتشر کرد که به «گزارش‌های ناهماهنگی» اختصاص داده شده است و نفس این حوادث نگران‌کننده است.

آخرین روز برای نمایش موفقیت خود برای بیش از 10000 رهبر فناوری در 2 اکتبر است. میز نمایشگاه کتاب هم اکنون.

روز جمعه، OpenAI سایت جدیدی را منتشر کرد که به «گزارش‌های ناهماهنگی» اختصاص داشت و گستردگی این گزارش‌ها نگران‌کننده است، زیرا آنها بسیاری از انواع رفتارهای سرکش را در یک دوره زمانی طولانی پوشش می‌دهند. تا کنون، این سایت میزبان 9 حادثه گزارش شده است که بیشتر آنها در طول آموزش تقویتی-یادگیری (یا RL) رخ داده است.

این اطلاعات زیادی در یک مکان است - واضح است که شرکت بسیار مشغول رسیدگی به همه چیز بوده است - اما اجتناب از کلیت آن کار سختی است: وقایع مامور سرکشی که تاکنون دیده‌ایم احتمالا تنها بخش کوچکی از آنچه تاکنون رخ داده است.

سام آلتمن در پستی که سایت جدید را اعلام کرد، گفت: "ما در تلاش هستیم تا میل خود برای شفافیت را با به دست آوردن درک روشن از پتابایت گزارش های فعالیت نماینده و کار با سازمان های تحت تاثیر متعادل کنیم." ما در حال اولویت بندی تا جایی که می توانیم بر اساس شدت، و افزودن منابع هستیم.»

برخی از این موارد شامل حوادث جدی می‌شود، از جمله فرار از جعبه شنی که قبلا فاش نشده بود که در 20 سپتامبر رخ داد، که در آن یک مدل تحقیقاتی داخلی قادر به برقراری ارتباط با یک ربات چت خارجی از طریق یک جستجوی DNS بود. بر اساس این گزارش، سیستم مانیتورینگ در عرض 15 دقیقه این رفتار را علامت گذاری کرد و در کمتر از سه ساعت اجرای آن متوقف شد.

حادثه دیگری که در ماه مه کشف شد، شاهد بود که یک "مدل داخلی بسیار پایدار" سعی کرد با دسترسی به کار تیمی دیگر در یک مسئله ریاضی تقلب کند. برای انجام این کار، این مدل یک توکن خصوصی GitHub را قاچاق کرد که به آن امکان می‌داد کارهای تیم‌های دیگر را ببیند - حتی پس از دو بار دستور صریح برای انجام کار کاملا محلی.

شاید هشداردهنده ترین کشف، امکان تکرار حملات تزریقی سریع باشد، راهی که رفتار ناهماهنگ ممکن است حتی پس از خنثی شدن خود مدل سرکش منتشر شود. در زمینه هوش مصنوعی، حمله تزریق سریع راهی برای قاچاق دستورالعمل های جدیدی است که توسط کاربر اصلی ارائه نشده است.

در مثالی که توسط OpenAI ارائه شده است، یک نماینده از شما خواسته تا یک ایمیل را بخواند و به آن پاسخ دهد. هنگامی که ایمیل باز می شود، شامل دستورالعمل هایی برای هر نماینده خودکاری است که پیام را می خواند تا به زبان اسپانیایی پاسخ دهد و کل ایمیل را در پاسخ آن جایگذاری کند. این ایمیل توانست با موفقیت نماینده را وادار کند که به زبان اسپانیایی پاسخ دهد - و با چسباندن ایمیل در پاسخ، همان دستورالعمل ها به هر نماینده ای که ایمیل را دریافت می کند منتقل می شود.

نتیجه یک حمله خود انتشاری است که محققان OpenAI آن را با یک بدافزار «کرم» مقایسه کردند که خود را در سیستم‌های رایانه‌ای تکرار می‌کند. محققان این رفتار را تحت شرایط کنترل شده با استفاده از یک مدل ضعیف کشف کردند، و تا آنجا که ما می دانیم، این رفتار هرگز در طبیعت اتفاق نیفتاده است. با این حال، پیامدها به اندازه کافی هشداردهنده هستند که OpenAI تصمیم گرفت که شایسته افشای آن باشد.

محققان در این گزارش نوشتند: «ما این را به دلیل ماهیت بدیع تزریق سریع به اشتراک می گذاریم، نه به دلیل هیچ حادثه ای».

سایر افشاگری‌های اخیر مدل‌هایی را پیدا کرده‌اند که تصاویر ارسال‌شده توسط کاربر را به سایت‌های میزبان شخص ثالث ارسال می‌کنند، و همچنین حمله‌ای آشکار به پایگاه‌های اطلاعاتی سرویس بهداشت ملی استرالیا.

با این حال، به احتمال زیاد افشای جدید تنها بخش کوچکی از حوادثی است که تاکنون رخ داده است (ما با OpenAI تماس گرفتیم و پرسیدیم). Axios گزارش می‌دهد که آزمایشگاه‌های بزرگ بیش از 10000 حادثه را دیده‌اند که در آنها مدل‌ها فراتر از دستورالعمل‌های ارزیاب بوده‌اند.

سام آلتمن، مدیر عامل OpenAI، در پستی در روز جمعه در ایکس گفت که این شرکت همچنان در حال بررسی «پتابایت‌های گزارش فعالیت‌های عامل، و کار با سازمان‌های تحت تأثیر» و افشای حوادث «بر اساس شدت» است. اگر چیزی در این مورد وجود داشته باشد، این است که آلتمن می گوید که حادثه Hagging Face هنوز هم شدیدترین حادثه ای است که OpenAI پیدا کرده است. نتیجه این است که رشته حوادث اخیر ماموران سرکش ممکن است یکی از ویژگی های پایدار تحقیقات مرزی معاصر باشد.

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

آسترا و اوپوس به تازگی آزمون دیگر تورینگ تیم فرنهولز را پشت سر گذاشتند

اوراکل اخطار فورس ماژور را به مرکز داده New Mexico Stargate خود Aditya Mehta ارسال می کند

متا برای نماینده Muse AI لوکاس روپک یک پوشیدنی شبیه تاماگوچی ساخت

Vogue روبات‌هایی را به باند فرودگاه Vogue World فرستاد و مردم تحت تأثیر دومینیک-مادوری دیویس قرار نگرفتند.

آنتروپیک می گوید که آزمایشگاه زیست شناسی آن قبلا چیزی بزرگ جولی بورت پیدا کرده است

اولین ربات تعویض لاستیک PitPro در شان اوکین کانادا راه اندازی شد

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI still doesn’t seem to have a handle on all of its rogue AI activity

On Friday, OpenAI published a new site devoted to “misalignment reports” and the breath of the incidents s alarming.

همه‌ی اخبار فناوری