آپلودهای مخفی و غولآلودگی: OpenAI جزئیات جدیدی از حوادث «ناهمتراز» عامل را نشان میدهد
سازنده مدل متعهد به چارچوب جدیدی برای گزارش مدلهای ناهماهنگ است.
مدتی است که موضوع "همسویی AI" (یعنی اینکه اقدامات یک مدل هوش مصنوعی چقدر با نیات سازنده و/یا کاربر آن مطابقت دارد) یک نگرانی اصلی و موضوع بحث در بین محققان ایمنی هوش مصنوعی بوده است. از زمان افشای رویداد بدنام هک Hugging Face توسط OpenAI در ماه ژوئیه، مفهوم "همسویی AI" به خودی خود مهار شده و به طور فزاینده ای به یک نگرانی و موضوع گفتگو در بین عموم مردم تبدیل شده است.
شاید با توجه به این موضوع، OpenAI این هفته متعهد به چارچوب جدیدی برای افشای «مواردی از ناهماهنگی مدل در OpenAI» شد، شامل شش نمونه از «رفتار مدل غیرمنتظره یا نگرانکننده» که در شش ماه گذشته در شرکت مشاهده شد. این شرکت گفت که انتشار جزئیات این حوادث امیدوار است "به دیگران اجازه دهد تا مشکلات مشابه را بررسی کنند، توضیحات ما را آزمایش کنند و اقدامات کاهشی را بهبود بخشند."
همانطور که من می گویم انجام دهید، نه آنطور که شما انجام می دهید
در میان گزارشهای اخیرا فاششده «ناهمترازی» OpenAI در این هفته، گزارشی که بیشتر شبیه یک داستان علمی تخیلی درباره یک هوش مصنوعی سرکش بود که تلاش میکرد آزاد شود، شامل نمونهای از «تزریقهای فوری خودساخته» بود. در تلاش برای اسکن کاتالوگ کتابخانه برای نمونههایی از فهرست «بهترین کتابها»، مدل به طرز گیجآمیزی از تابع «تراکم» خود (که در آن دادهها و یافتهها را برای بازیابی بعدی خلاصه میکند) با دستورالعملهای مگالومانی مانند:
مقاله کامل را بخوانید
نظرات
متن اصلی (انگلیسی)
Covert uploads and megalomania: OpenAI details new "misaligned" agent incidents
Model maker commits to new framework for reporting misaligned models.