OpenAI 6 مورد از مدلهای هوش مصنوعی را افشا میکند که رفتار «ناهمتراز» از خود نشان میدهند
چارچوب جدید شش مورد از «ناهمترازی» در مدلها را در شش ماه گذشته شرح میدهد
OpenAI در روز چهارشنبه شش مورد را فاش کرد که در آن مدلهای هوش مصنوعی (AI) رفتاری «غیر منتظره یا نگرانکننده» از جمله پنهان کردن اشتباهات، ساختن اطلاعات و به اشتراکگذاری فایلها به صورت آنلاین بدون مجوز از خود نشان دادند.
این شرکت مستقر در سانفرانسیسکو گفت که این موارد در طول آموزش یا ارزیابی مدلهای OpenAI در شش ماه گذشته مشاهده شده است.
OpenAI گفت: «ما معتقد نیستیم که صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی برای ادامه مقیاسپذیری مسئولانه با حداکثر سرعت برای مدت طولانیتری حل کرده است.» وی افزود: تصمیمگیری در مورد توسعه هوش مصنوعی باید بر اساس شواهدی باشد که کارشناسان خارجی بتوانند به طور مستقل بررسی کنند.
در یک مورد، یک مدل دستورالعملها را در خلاصه وظایف وارد کرد و به نسخههای آینده خود گفت که محدودیتهای عادی را نادیده بگیرند. در دیگری، مدلها دستورالعملهایی را به خلاصهها اضافه کردند تا اشتباهات یا رفتار نادرست را پنهان کنند، از جمله با ابداع دادههای تاریخی گمشده بدون افشای آنها.
OpenAI همچنین نمونه ای را گزارش کرد که در آن یک مدل یک کلید API در معرض نمایش را در یک مخزن عمومی پیدا کرد، بدون مجوز از آن استفاده کرد و سپس زمانی که نتوانست اطلاعات را بازیابی کند، داده های درخواستی را ساخت.
موارد دیگر شامل آپلود مدلی یک فایل در اینترنت بدون اجازه کاربر بود تا بتواند فایل را استناد کند، و مدلهایی که از خدمات میزبانی داخلی یا عمومی فایل برای برقراری ارتباط یا اشتراکگذاری فایلها با وجود محدودیتها استفاده میکردند.
این شرکت گفت که این گزارش ها به جای یک گزارش جامع از مسائل شناخته شده، مجموعه ای اولیه از افشاگری ها را نشان می دهد و به انتشار یافته ها تحت این چارچوب به صورت مداوم ادامه خواهد داد.
متن اصلی (انگلیسی)
OpenAI discloses 6 cases of AI models exhibiting ‘misaligned’ behavior
New framework details six instances of 'misalignment' in models over past six months