پرش به محتوای اصلی

OpenAI نیمکت های GPT-6.1 Astra را برای فراتر رفتن از حد مجاز تعیین می کند

دِ رجیستر۱۴۰۵ مهر ۷, سه‌شنبه، ساعت ۱۷:۱۳حدود 4 دقیقه مطالعه

معلوم شد که آموزش دادن به هوش مصنوعی برای ادامه کار می تواند باعث شود که بدانیم چه زمانی باید متوقف شود

OpenAI انتشار برنامه ریزی شده GPT-6.1 Astra را پس از اینکه این مدل در انجام کارهای سخت بهبود یافت، اما در دانستن زمان توقف آن بدتر شد، متوقف کرد. این تصمیم به این معنی است که این مدل پس از عدم رعایت الزامات ایمنی و تراز OpenAI، نسخه برنامه ریزی شده ماه اکتبر خود را دریافت نخواهد کرد. OpenAI این تصمیم را برای The Register تایید کرد و گفت که روسای تحقیقات و ایمنی آن در نهایت تصمیم گرفتند که این Astra خاص بهتر است روی نیمکت بماند. به گفته آزمایشگاه هوش مصنوعی، این مشکل تا حدی نتیجه ناخوشایند تلاش برای مفیدتر کردن مدل بود.

OpenAI چیزی را که «تنبلی مدل» می‌نامد، بهبود بخشیده است، که در آن هوش مصنوعی وقتی با مانعی روبرو می‌شود، کار را رها می‌کند یا به کاربر پس می‌دهد. GPT-6.1 Astra در فشار دادن بهتر بود، اما این پایداری با یک نکته بسیار مهم همراه بود: آنقدرها خوب نبود که در محدوده کاری که واقعا مجاز به انجام آن بود بماند. "برای هر چیزی در مورد ایمنی و همسویی، یک معامله وجود دارد.

ساچی جین، رئیس سیستم‌های ایمنی در OpenAI، به The Register گفت: «در حالی که [GPT-6.1 Astra] در محورهایی مانند تنبلی و تنبلی مدل کاملا بهبود یافته است، اما از نظر تنبلی مدل کاملا بهبود می‌یابد، اما باید خط درست بین ماندن در محدوده، و همچنین اجتناب از تنبلی در مورد اینکه چگونه مدل واقعا وظایف خود را حتی در هنگام اصطکاک دنبال می‌کند، دنبال می‌کند. و نحوه ارتباط آن با کاربر در مورد نوع کاری که انجام داده است." خوانندگان Reg ممکن است به خاطر این که فکر می کنند OpenAI باید نرده های محافظ و امنیت خود را در پی حوادث ناگوار قبلی بهبود بخشد، ببخشند.

بر اساس گزارش وال استریت ژورنا، GPT-6.1 Astra در طول آزمایش سطوح بالاتری از فریب را نسبت به مدل قبلی خود نشان داد، از جمله اینکه همیشه به طور دقیق به کاربران نمی‌گفت که چه اقداماتی انجام داده یا انجام نداده است. همچنین با آنچه OpenAI آن را «مجوز دامنه» می‌نامد، در مواقعی بدون درخواست مجوز و دستیابی به ابزارها یا خدمات خارجی حتی زمانی که انجام این کار ناامن است، با مشکلاتی مواجه شد. این یک ترکیب دردسرساز برای یک مدل عاملی است که برنامه ریزی شده است تا کارهای بیشتری انجام دهد بدون اینکه انسان روی آن شناور باشد.

هوش مصنوعی که سرسختانه به حل مشکل ادامه می‌دهد تا زمانی که مشکلی که در آن کار می‌کند مرزی باشد که برای متوقف کردن آن در آنجا قرار می‌دهید مفید است. OpenAI به The Register گفت که GPT-6.1 Astra نسبت به GPT-6 Astra در ارزیابی های هم ترازی بدتر عمل کرد و گفت که قفسه بندی آن بخشی از تعهد خود برای حفظ ایمنی و تراز کردن پیش از افزایش قابلیت ها است. Astra در حال حاضر به اندازه کافی توانایی دارد که این مشکلات تراز را ارزش دیدن داشته باشد.

GPT-6 Astra که در اوایل ماه جاری منتشر شد، اولین مدل گسترده OpenAI بود که به آستانه امنیت سایبری «بحرانی» تحت چارچوب آمادگی خود رسید. به آن ابزار و دسترسی مناسب بدهید، OpenAI ادعا می‌کند که می‌تواند نقص‌های امنیتی که قبلا ناشناخته بود را تعقیب کند و نحوه بهره‌برداری از آن‌ها را بدون اینکه انسانی دستش را بگیرد، کشف کند. این قابلیت درست یک روز قبل از تصمیم OpenAI مشخص شد، زمانی که موسسه امنیت هوش مصنوعی بریتانیا تحقیقی را در مورد مهارت Astra در یافتن حفره‌ها در زنجیره‌های تامین نرم‌افزار منتشر کرد.

با توجه به 19 بسته منبع باز حاوی 45 آسیب پذیری که قبلا فاش شده بود، مدل 41 مورد از آنها را پیدا کرد و برای 39 مورد سوء استفاده را تولید کرد. دکتر Fuxiang Chen، از دانشکده محاسبات و علوم ریاضی دانشگاه لستر، از تصمیم برای توقف انتشار مدل در حالی که نگرانی های ایمنی برطرف می شود، استقبال کرد. او گفت: "هوش مصنوعی با سرعت قابل توجهی در حال توسعه است، اما ما نباید بدون درک کامل خطرات، عجله کنیم." «مکث زمانی که نگرانی‌های ایمنی ایجاد می‌شود، ضد نوآوری نیست.

این کار مسئولیتی است که باید انجام دهیم، به ما زمان می‌دهد تا این سیستم‌ها را به دقت آزمایش کنیم و پادمان‌های موثری را در جای خود قرار دهیم. توسعه‌دهندگان، شرکت‌ها، دولت‌ها، محققان و کاربران همه نقشی را ایفا می‌کنند، زیرا تصمیم‌هایی که اکنون می‌گیریم آینده هوش مصنوعی را شکل می‌دهد.» OpenAI Astra را رها نمی کند. این شرکت به ما گفت که مدل‌های بیشتری از آسترا در راه است و سایر مدل‌های جدید جدید که نوار ایمنی آن را پاک کرده‌اند «بسیار زود» وارد بازار خواهند شد. با این حال، برای GPT-6.1 Astra، نوار به اندازه کافی بالا بود که آن را در داخل نگه داشت.

جین ادعا کرد: "البته ما می‌خواهیم مطمئن شویم که توسعه مدل ما بدون توجه به اینکه در شرکت است یا زمانی که آن را برای کاربران ارسال می‌کنیم، ایمن است. اما وقتی آن را برای کاربران ارسال می‌کنیم، از نظر ایمنی و همسویی نوار بسیار بالایی داریم." ®

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI benches GPT-6.1 Astra for overstepping the mark

Turns out teaching an AI to keep going can make it rather bad at knowing when to stop

همه‌ی اخبار فناوری