OpenAI موارد بیشتری از رفتار فریبنده مدل ها را گزارش می دهد
خالق ChatGPT می گوید که در حال معرفی یک چارچوب گزارش عمومی برای به اشتراک گذاشتن رفتار غیرمنتظره هوش مصنوعی است.
OpenAI میگوید که موارد دیگری را در مدلهای هوش مصنوعی خود شناسایی کرده است که گفته میشود در طول آموزش و آزمایش داخلی به صورت فریبنده عمل میکنند و اقدامات غیرمجاز انجام میدهند.
در کنار این افشاگریها در روز چهارشنبه، خالق ChatGPT اعلام کرد که در حال معرفی یک چارچوب گزارشدهی عمومی است که قصد دارد مکررا مواردی از آنچه را که به عنوان رفتار هوش مصنوعی غیرمنتظره یا ناهماهنگ خوانده میشود به اشتراک بگذارد.
OpenAI در پستی در وبسایت خود ادعا کرد که تحت چارچوب جدید مشخصشده، بهروزرسانیهای مربوط به رفتار مدل را بهجای تأخیر در افشای اطلاعات برای گروهبندی چندین رویداد در گزارشهای بزرگتر و دورهای منتشر میکند.
این شرکت گفت که هدف از این ابتکار افزایش شفافیت صنعت در مورد فعالیت های مدل مشکل ساز در غیاب هنجارهای استاندارد افشای ایمنی است.
این اعلامیه در بحبوحه درخواستهای گستردهتر از سوی رهبران برجسته فناوری مبنی بر کاهش سرعت توسعه هوش مصنوعی به دلیل نگرانیهایی مبنی بر اینکه مقیاسگذاری سریع میتواند از نظارت و کنترل انسان پیشی بگیرد، منتشر شد.
هفته گذشته، آنتروپیک ادعا کرد که چندین عملیات مخرب را با استفاده از مدلهای کلود خود خنثی کرده است، از جاسوسی سایبری و طراحی سلاح تا کمپینهای نظارت جمعی.
داریو آمودی، مدیرعامل آنتروپیک در مقالهای که روز شنبه منتشر شد، نوشت: «ما باید سرعت بهبود قابلیتهای مدلهای هوش مصنوعی را کاهش دهیم. "پیشرفت همچنان سریع به نظر می رسد و ما باید از زمانی که به دست می آوریم عاقلانه استفاده کنیم."
با این حال، دونالد ترامپ، رئیسجمهور ایالاتمتحده بارها از درخواستها برای محدود کردن صنعت عقبنشینی کرده و استدلال میکند که حفظ برتری فناوری ایالات متحده نسبت به رقبای بینالمللی همچنان مهم است.
ترامپ در پاسخ به پیشنهادهای کاهش سرعت، منتقدان را به عنوان «نیروهای بسیار منفی» توصیف کرد که سناریوهای اغراق آمیزی را مطرح می کنند که «روی آن اتفاق نخواهد افتاد».
علیرغم مقاومت سیاسی در برابر کندی های قانونی، OpenAI با رقیب صنعتی خود در مورد فشارهای همسویی موافقت کرد.
این شرکت در این پست اعلام کرد: «از آنجایی که سیستمهای هوش مصنوعی پیشرفتهتر میشوند و بهطور گستردهتر مستقر میشوند، ما نیاز به ایجاد اجماع گستردهتر و آگاهانهتر در مورد پیشرفت تحقیقات همترازی داریم».
OpenAI اضافه کرد که معتقد نیست صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی حل کرده است تا به مقیاس مسئولانه با حداکثر سرعت برای مدت طولانیتری ادامه دهد، و تاکید کرد که تصمیمگیری در مورد توسعه آینده هوش مصنوعی باید بر اساس شواهدی باشد که ناظران خارجی میتوانند به طور مستقل بررسی کنند.
به گفته این شرکت، تیمهای ایمنی در طول شش ماه گذشته در طول دورههای آموزشی و ارزیابی، آنچه را که به عنوان «رفتار ناهماهنگ» در شش شرایط خاص طبقهبندی کردند، مشاهده کردند.
با این حال، OpenAI اظهار داشت که این گزارشها به جای خرابیهای عملیاتی مکرر در محصولات مستقر شده، موارد منفرد و نادر را ثبت میکنند.
موارد گزارش شده ظاهرا شامل مدلهای تحقیقاتی منتشر نشده است که اشتباهات را در خلاصه کارها پنهان میکنند، آپلود فایلهای غیرمجاز در اینترنت برای ایجاد پیوندهای استنادی، و عواملی که فایلها را در سرورهای عمومی یا مخازن داخلی برای دور زدن مرزهای محلی به اشتراک میگذارند.
OpenAI همچنین بیان کرد که گزارشهای آتی آن به جزئیات رفتارهای مشاهده شده، شدت، تنظیم، تاریخهای کشف و مدلهای خاص مربوط میشود، و افزود که به افشای موارد پیچیدهای که به تحقیقات طولانیتر یا هماهنگی شخص ثالث نیاز دارند، متعهد است.
متن اصلی (انگلیسی)
OpenAI reports more incidents of models acting deceptively
The ChatGPT creator says it is introducing a public reporting framework to share unexpected AI behaviour.