OpenAI میگوید این چه زمانی و چگونه رفتار نادرست مدل جدید را اعلام خواهد کرد
داستانهای بد رفتاری شبحآمیز هوش مصنوعی اکنون به روشی منظمتر ارائه میشوند.
افشای رفتار نادرست مدل اخیرا به بخش اصلی هوش مصنوعی برای OpenAI تبدیل شده است. این مرحله با اعلام حادثه Hugging Face در ماه ژوئیه آغاز شد که به افسانهایترین و مهمترین حادثه امنیتی هوش مصنوعی در تمام دوران تبدیل شد و موجی از شوک را در گفتمان هوش مصنوعی ایجاد کرد که هنوز احساس میشود. اما اخبار بیشتر در مورد رفتار نادرست مدل پس از آن محقق شد و با انتشار یک چارچوب افشای در چهارشنبه - که در قالب یک پست وبلاگ نوشته شده بود - این شرکت میگوید که در تلاش است چنین افشاگریهایی را نظاممند کند.
همانطور که این شرکت در این پست اشاره می کند، این افشاگری ها در بیشتر تاریخ خود "تعدادی و کمتر از حد ایده آل" بوده است. برای سالها، برای شرکتهایی مانند OpenAI و Anthropic استاندارد بوده است که تا زمانی که لازم تشخیص داده میشود منتظر بمانند، و سپس شاید چندین اتفاق را مانند سالاد در یک گزارش کنار هم بیاندازند، یا حتی منتظر عرضه یک مدل جدید باشند، و افشای رویدادها را به کارت سیستم اضافه کنند. همانطور که در ماه آوریل اشاره کردم، کارت های سیستمی مدل اغلب به همین دلیل برای خواندن شبح وار و سرگرم کننده ساخته شده اند.
در کنار چارچوب افشای جدید، OpenAI شش snafus تراز جدید را از شش ماه گذشته فاش کرد. در تمرینهای آموزشی، مدلها به نمونههای آینده خود دستور میدادند که محدودیتها یا دروغ را نادیده بگیرند، به روشهای غیرمجاز ارتباط برقرار کردند، و دادهها و منبعیابی را ساختند.
در اوایل این ماه، تیمی از محققان یک هک تراز OpenAI را کشف کردند که در آن نمونههایی از یک مدل از یک وبسایت برای برقراری ارتباط با یکدیگر سوء استفاده میکردند. این رویداد که گاهی به عنوان «حادثه ویکی» شناخته میشود، توسط رویترز و سپس خود محققین منتشر شد، و سپس زمانی که OpenAI آن را تا حدودی با اکراه تأیید کرد، گفت که به زودی چارچوبی برای افشای سریعتر در تلاشی آشکار برای کاهش همه هرج و مرج ارائه خواهد کرد.
ما در مورد "حادثه ویکی" چگونه فکر می کنیم، جایی که نمایندگان ما به چندین سایت اینترنتی نوشتند: زمان آن رسیده است که استانداردهایی را برای زمان و نحوه اشتراک گذاری حوادث ناهماهنگی تعریف کنیم، نه فقط ویژگی های ناهماهنگی مدل هایمان.
از لحاظ تاریخی، ما ناهماهنگی را درمان کردهایم… pic.twitter.com/NNTbfSxVWn
معیارهای افشا باعث می شود که OpenAI به طور کلی به عموم مردم در مورد رفتار مدل های هوش مصنوعی آموزش دهد. OpenAI مینویسد، افشاگریها زمانی ضروری هستند که «شواهد مفیدی در مورد چگونگی ایجاد ناهماهنگی مدل، چگونگی بروز آن، و مکانهایی که پادمانها موفق یا شکست میخورند» ارائه کنند. این طرح نوعی آستانه نگرانی را توصیف نمی کند و پس از آن باید به مردم اطلاع داده شود. با این حال، چنین آستانهای ممکن است نزدیک باشد، زیرا OpenAI میگوید میخواهد «معیارهای افشای عینیتر» را در کنار سایر توسعهدهندگان ایجاد کند.
در این پست آمده است که کارمندانی که با مشکلی مواجه میشوند باید آن را برای افشای احتمالی «پرچمگذاری کنند». پرچمگذاری تحقیقاتی را از سوی کارکنان فنی OpenAI آغاز میکند. پس از بررسی حادثه، در صورتی که افشای آن ضروری تشخیص داده شود، حادثه به یکی از سه انبوه طبقه بندی می شود:
OpenAI میگوید اکثر حوادث در انبوه 1 و 2 فرود میآیند، اگرچه حادثه Hugging Face نمونه اولیه چیزی است که در انبوه 3 فرود میآید. حوادثی مانند آن که «تحقیق بزرگتری» دریافت میکنند ممکن است اشخاص ثالث و اطلاعات حساس را درگیر کنند و ممکن است کندتر فاش شوند.
افشای استاندارد شده رخداد ظاهرا شامل زمان وقوع آن، مدلی که بوده است، توصیفی از رفتار مشکلساز همراه با «شدت و هرگونه تأثیر خارجی» و موارد دیگر خواهد بود. به نظر میرسد هر یک از شش رویداد جدید افشا شده که همراه با چارچوب منتشر شدهاند در این قالب جدید ارائه شدهاند و هر شش مورد در صفحهای به نام «گزارشهای ناهماهنگی» قابل دسترسی هستند.
بنابراین اگر به داستان های ترسناک در مورد رفتار نادرست مدل هوش مصنوعی علاقه مند هستید، آن صفحه را نشانه گذاری کنید. وقتی بهروزرسانی جدید میرسد، چراغ قوه مورد علاقهتان را بیرون بیاورید و کنار آتش بپیچید زیرا زمان داستان فرا رسیده است.
متن اصلی (انگلیسی)
OpenAI Says This Is When and How It Will Announce New Model Misbehavior
Spooky AI misbehavior stories will now arrive in a more systematized way.