پرش به محتوای اصلی

OpenAI می‌گوید این چه زمانی و چگونه رفتار نادرست مدل جدید را اعلام خواهد کرد

گیزمودو۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۱۲:۳۰حدود 3 دقیقه مطالعه

داستان‌های بد رفتاری شبح‌آمیز هوش مصنوعی اکنون به روشی منظم‌تر ارائه می‌شوند.

افشای رفتار نادرست مدل اخیرا به بخش اصلی هوش مصنوعی برای OpenAI تبدیل شده است. این مرحله با اعلام حادثه Hugging Face در ماه ژوئیه آغاز شد که به افسانه‌ای‌ترین و مهم‌ترین حادثه امنیتی هوش مصنوعی در تمام دوران تبدیل شد و موجی از شوک را در گفتمان هوش مصنوعی ایجاد کرد که هنوز احساس می‌شود. اما اخبار بیشتر در مورد رفتار نادرست مدل پس از آن محقق شد و با انتشار یک چارچوب افشای در چهارشنبه - که در قالب یک پست وبلاگ نوشته شده بود - این شرکت می‌گوید که در تلاش است چنین افشاگری‌هایی را نظام‌مند کند.

همانطور که این شرکت در این پست اشاره می کند، این افشاگری ها در بیشتر تاریخ خود "تعدادی و کمتر از حد ایده آل" بوده است. برای سال‌ها، برای شرکت‌هایی مانند OpenAI و Anthropic استاندارد بوده است که تا زمانی که لازم تشخیص داده می‌شود منتظر بمانند، و سپس شاید چندین اتفاق را مانند سالاد در یک گزارش کنار هم بیاندازند، یا حتی منتظر عرضه یک مدل جدید باشند، و افشای رویدادها را به کارت سیستم اضافه کنند. همانطور که در ماه آوریل اشاره کردم، کارت های سیستمی مدل اغلب به همین دلیل برای خواندن شبح وار و سرگرم کننده ساخته شده اند.

در کنار چارچوب افشای جدید، OpenAI شش snafus تراز جدید را از شش ماه گذشته فاش کرد. در تمرین‌های آموزشی، مدل‌ها به نمونه‌های آینده خود دستور می‌دادند که محدودیت‌ها یا دروغ را نادیده بگیرند، به روش‌های غیرمجاز ارتباط برقرار کردند، و داده‌ها و منبع‌یابی را ساختند.

در اوایل این ماه، تیمی از محققان یک هک تراز OpenAI را کشف کردند که در آن نمونه‌هایی از یک مدل از یک وب‌سایت برای برقراری ارتباط با یکدیگر سوء استفاده می‌کردند. این رویداد که گاهی به عنوان «حادثه ویکی» شناخته می‌شود، توسط رویترز و سپس خود محققین منتشر شد، و سپس زمانی که OpenAI آن را تا حدودی با اکراه تأیید کرد، گفت که به زودی چارچوبی برای افشای سریع‌تر در تلاشی آشکار برای کاهش همه هرج و مرج ارائه خواهد کرد.

ما در مورد "حادثه ویکی" چگونه فکر می کنیم، جایی که نمایندگان ما به چندین سایت اینترنتی نوشتند: زمان آن رسیده است که استانداردهایی را برای زمان و نحوه اشتراک گذاری حوادث ناهماهنگی تعریف کنیم، نه فقط ویژگی های ناهماهنگی مدل هایمان.

از لحاظ تاریخی، ما ناهماهنگی را درمان کرده‌ایم… pic.twitter.com/NNTbfSxVWn

معیارهای افشا باعث می شود که OpenAI به طور کلی به عموم مردم در مورد رفتار مدل های هوش مصنوعی آموزش دهد. OpenAI می‌نویسد، افشاگری‌ها زمانی ضروری هستند که «شواهد مفیدی در مورد چگونگی ایجاد ناهماهنگی مدل، چگونگی بروز آن، و مکان‌هایی که پادمان‌ها موفق یا شکست می‌خورند» ارائه کنند. این طرح نوعی آستانه نگرانی را توصیف نمی کند و پس از آن باید به مردم اطلاع داده شود. با این حال، چنین آستانه‌ای ممکن است نزدیک باشد، زیرا OpenAI می‌گوید می‌خواهد «معیارهای افشای عینی‌تر» را در کنار سایر توسعه‌دهندگان ایجاد کند.

در این پست آمده است که کارمندانی که با مشکلی مواجه می‌شوند باید آن را برای افشای احتمالی «پرچم‌گذاری کنند». پرچم‌گذاری تحقیقاتی را از سوی کارکنان فنی OpenAI آغاز می‌کند. پس از بررسی حادثه، در صورتی که افشای آن ضروری تشخیص داده شود، حادثه به یکی از سه انبوه طبقه بندی می شود:

OpenAI می‌گوید اکثر حوادث در انبوه 1 و 2 فرود می‌آیند، اگرچه حادثه Hugging Face نمونه اولیه چیزی است که در انبوه 3 فرود می‌آید. حوادثی مانند آن که «تحقیق بزرگ‌تری» دریافت می‌کنند ممکن است اشخاص ثالث و اطلاعات حساس را درگیر کنند و ممکن است کندتر فاش شوند.

افشای استاندارد شده رخداد ظاهرا شامل زمان وقوع آن، مدلی که بوده است، توصیفی از رفتار مشکل‌ساز همراه با «شدت و هرگونه تأثیر خارجی» و موارد دیگر خواهد بود. به نظر می‌رسد هر یک از شش رویداد جدید افشا شده که همراه با چارچوب منتشر شده‌اند در این قالب جدید ارائه شده‌اند و هر شش مورد در صفحه‌ای به نام «گزارش‌های ناهماهنگی» قابل دسترسی هستند.

بنابراین اگر به داستان های ترسناک در مورد رفتار نادرست مدل هوش مصنوعی علاقه مند هستید، آن صفحه را نشانه گذاری کنید. وقتی به‌روزرسانی جدید می‌رسد، چراغ قوه مورد علاقه‌تان را بیرون بیاورید و کنار آتش بپیچید زیرا زمان داستان فرا رسیده است.

خواندن متن کامل در گیزمودوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI Says This Is When and How It Will Announce New Model Misbehavior

Spooky AI misbehavior stories will now arrive in a more systematized way.

همه‌ی اخبار فناوری