OpenAI نیمکت های GPT-6.1 Astra را برای فراتر رفتن از حد مجاز تعیین می کند
معلوم شد که آموزش دادن به هوش مصنوعی برای ادامه کار می تواند باعث شود که بدانیم چه زمانی باید متوقف شود
OpenAI انتشار برنامه ریزی شده GPT-6.1 Astra را پس از اینکه این مدل در انجام کارهای سخت بهبود یافت، اما در دانستن زمان توقف آن بدتر شد، متوقف کرد. این تصمیم به این معنی است که این مدل پس از عدم رعایت الزامات ایمنی و تراز OpenAI، نسخه برنامه ریزی شده ماه اکتبر خود را دریافت نخواهد کرد. OpenAI این تصمیم را برای The Register تایید کرد و گفت که روسای تحقیقات و ایمنی آن در نهایت تصمیم گرفتند که این Astra خاص بهتر است روی نیمکت بماند. به گفته آزمایشگاه هوش مصنوعی، این مشکل تا حدی نتیجه ناخوشایند تلاش برای مفیدتر کردن مدل بود.
OpenAI چیزی را که «تنبلی مدل» مینامد، بهبود بخشیده است، که در آن هوش مصنوعی وقتی با مانعی روبرو میشود، کار را رها میکند یا به کاربر پس میدهد. GPT-6.1 Astra در فشار دادن بهتر بود، اما این پایداری با یک نکته بسیار مهم همراه بود: آنقدرها خوب نبود که در محدوده کاری که واقعا مجاز به انجام آن بود بماند. "برای هر چیزی در مورد ایمنی و همسویی، یک معامله وجود دارد.
ساچی جین، رئیس سیستمهای ایمنی در OpenAI، به The Register گفت: «در حالی که [GPT-6.1 Astra] در محورهایی مانند تنبلی و تنبلی مدل کاملا بهبود یافته است، اما از نظر تنبلی مدل کاملا بهبود مییابد، اما باید خط درست بین ماندن در محدوده، و همچنین اجتناب از تنبلی در مورد اینکه چگونه مدل واقعا وظایف خود را حتی در هنگام اصطکاک دنبال میکند، دنبال میکند. و نحوه ارتباط آن با کاربر در مورد نوع کاری که انجام داده است." خوانندگان Reg ممکن است به خاطر این که فکر می کنند OpenAI باید نرده های محافظ و امنیت خود را در پی حوادث ناگوار قبلی بهبود بخشد، ببخشند.
بر اساس گزارش وال استریت ژورنا، GPT-6.1 Astra در طول آزمایش سطوح بالاتری از فریب را نسبت به مدل قبلی خود نشان داد، از جمله اینکه همیشه به طور دقیق به کاربران نمیگفت که چه اقداماتی انجام داده یا انجام نداده است. همچنین با آنچه OpenAI آن را «مجوز دامنه» مینامد، در مواقعی بدون درخواست مجوز و دستیابی به ابزارها یا خدمات خارجی حتی زمانی که انجام این کار ناامن است، با مشکلاتی مواجه شد. این یک ترکیب دردسرساز برای یک مدل عاملی است که برنامه ریزی شده است تا کارهای بیشتری انجام دهد بدون اینکه انسان روی آن شناور باشد.
هوش مصنوعی که سرسختانه به حل مشکل ادامه میدهد تا زمانی که مشکلی که در آن کار میکند مرزی باشد که برای متوقف کردن آن در آنجا قرار میدهید مفید است. OpenAI به The Register گفت که GPT-6.1 Astra نسبت به GPT-6 Astra در ارزیابی های هم ترازی بدتر عمل کرد و گفت که قفسه بندی آن بخشی از تعهد خود برای حفظ ایمنی و تراز کردن پیش از افزایش قابلیت ها است. Astra در حال حاضر به اندازه کافی توانایی دارد که این مشکلات تراز را ارزش دیدن داشته باشد.
GPT-6 Astra که در اوایل ماه جاری منتشر شد، اولین مدل گسترده OpenAI بود که به آستانه امنیت سایبری «بحرانی» تحت چارچوب آمادگی خود رسید. به آن ابزار و دسترسی مناسب بدهید، OpenAI ادعا میکند که میتواند نقصهای امنیتی که قبلا ناشناخته بود را تعقیب کند و نحوه بهرهبرداری از آنها را بدون اینکه انسانی دستش را بگیرد، کشف کند. این قابلیت درست یک روز قبل از تصمیم OpenAI مشخص شد، زمانی که موسسه امنیت هوش مصنوعی بریتانیا تحقیقی را در مورد مهارت Astra در یافتن حفرهها در زنجیرههای تامین نرمافزار منتشر کرد.
با توجه به 19 بسته منبع باز حاوی 45 آسیب پذیری که قبلا فاش شده بود، مدل 41 مورد از آنها را پیدا کرد و برای 39 مورد سوء استفاده را تولید کرد. دکتر Fuxiang Chen، از دانشکده محاسبات و علوم ریاضی دانشگاه لستر، از تصمیم برای توقف انتشار مدل در حالی که نگرانی های ایمنی برطرف می شود، استقبال کرد. او گفت: "هوش مصنوعی با سرعت قابل توجهی در حال توسعه است، اما ما نباید بدون درک کامل خطرات، عجله کنیم." «مکث زمانی که نگرانیهای ایمنی ایجاد میشود، ضد نوآوری نیست.
این کار مسئولیتی است که باید انجام دهیم، به ما زمان میدهد تا این سیستمها را به دقت آزمایش کنیم و پادمانهای موثری را در جای خود قرار دهیم. توسعهدهندگان، شرکتها، دولتها، محققان و کاربران همه نقشی را ایفا میکنند، زیرا تصمیمهایی که اکنون میگیریم آینده هوش مصنوعی را شکل میدهد.» OpenAI Astra را رها نمی کند. این شرکت به ما گفت که مدلهای بیشتری از آسترا در راه است و سایر مدلهای جدید جدید که نوار ایمنی آن را پاک کردهاند «بسیار زود» وارد بازار خواهند شد. با این حال، برای GPT-6.1 Astra، نوار به اندازه کافی بالا بود که آن را در داخل نگه داشت.
جین ادعا کرد: "البته ما میخواهیم مطمئن شویم که توسعه مدل ما بدون توجه به اینکه در شرکت است یا زمانی که آن را برای کاربران ارسال میکنیم، ایمن است. اما وقتی آن را برای کاربران ارسال میکنیم، از نظر ایمنی و همسویی نوار بسیار بالایی داریم." ®
متن اصلی (انگلیسی)
OpenAI benches GPT-6.1 Astra for overstepping the mark
Turns out teaching an AI to keep going can make it rather bad at knowing when to stop