3 کارمند اخراج شده OpenAI درخواست کردند که نظارت بر افکار زنجیره ای حفظ شود
OpenAI آنها را اخراج کرد، اما می گوید که با توصیه های آنها موافق است.
نامه جدیدی از خودی ها در مورد خطرات بالقوه هوش مصنوعی بسیار خاص است. به گفته وال استریت ژورنال، نویسندگان نگران حفظ توانایی نظارت بر زنجیره های فکری مدل ها هستند. اما نویسندگان در حال حاضر از نظر فنی افراد داخلی نیستند، زیرا اخیرا اخراج شده اند.
هفته گذشته، OpenAI اعلام کرد که "راه خود را با سه نفر به دلیل نقض سیاست های ما در مورد دسترسی و مدیریت اطلاعات حساس شرکت جدا کرده است." آنها ظاهرا این اطلاعات را به یک سازمان ایمنی هوش مصنوعی منتقل کرده بودند.
این کارمندان Tomek Korbak، Mikita Balesni و Jasmine Wang بودند و آنها به وضوح معتقدند که هوش مصنوعی یک خطر وجودی است. قبل از اخراج آنها، بالسنی قبلا در X پست کرده بود که فکر می کند هوش مصنوعی "احتمالا 10٪ همه انسان ها را می کشد." وانگ پست کرده بود: «اغراق کردن اینکه سرعت به سمت RSI چقدر خطرناک است، سخت است. (RSI یا خود-بهبود بازگشتی به معنای بهبود مدل های هوش مصنوعی است).
WSJ می نویسد، نامه جدید Korbak، Balesni، و Wang خطاب به هیئت مدیره OpenAI و "کمیته های ایمنی" این شرکت است. این به صورت عمومی منتشر نشده است و WSJ فقط گزیده هایی را منتشر کرده است.
در نامه آمده است: «بهعنوان یک صنعت، ما هنوز نمیدانیم چگونه بهطور ایمن مدلهایی را توسعه دهیم و به کار ببریم که نمیتوانیم آنها را نظارت کنیم[…] OpenAI و سایر شرکتهای مرزی نباید با پیشرفتهایی که بیشتر کاهش میدهند پیش بروند».
آخرین مدل پرچمدار OpenAI، GPT-6 Astra، دو نوع نگرانی را در رابطه با زنجیره فکری (CoT) برانگیخته است، و در اینجا من آنها را با استفاده از زبان استعاری در معرض خطر انسانسازی مدلها توصیف میکنم: الف) آنها ممکن است یاد بگیرند که از سیستم نظارت پیشی بگیرند، و ب) OpenAI ظاهرا ممکن است نظارت کمتری مفید باشد.
به طور خاص، طبق کارت سیستم این مدل، «مدلهای کلاس Astra میتوانند از مانیتورهای CoT ما تحت شرایط متخاصم فرار کنند». و در همین حال، استدلال با Astra همچنین شامل شکل مبهمتری از «تفکر» است (و نگاه کنید: هیچ یک از اینها تفکر واقعی نیست، اما این اصطلاحی است که ما در حال حاضر داریم) به نام «عمق مکرر». عمق مکرر در ابتدا یک پرس و جو را چندین بار در مدل چرخانده تا به جای ایجاد چیزی، آن را پردازش کند - رویدادی که در جعبه سیاه ناشناخته مدل اتفاق می افتد، بنابراین چیزی برای نظارت وجود ندارد.
جالب اینجاست که وقتی WSJ برای اظهار نظر درباره نامه با OpenAI تماس گرفت، یکی از نمایندگان OpenAI گفت که اخراجها «به خاطر ایجاد نگرانیهای ایمنی یا صحبت کردن نبودند» و یک یادداشت داخلی درباره نامه ارائه کرد که در آن شرکت گفت «به شدت با توصیههای نویسندگان موافق است».
متن اصلی (انگلیسی)
3 Fired OpenAI Employees Write Plea for Chain of Thought Monitoring to Be Preserved
OpenAI fired them, but says it agrees with their recommendations.