OpenAI موارد بیشتری از انجام اقدامات غیرمجاز توسط عوامل هوش مصنوعی را شرح می دهد
OpenAI نمونههای جدیدی از آنچه را که آنها «ناهمترازی مدل AI» مینامند، از شش ماه گذشته ارائه کرده است، از جمله آپلود فایلهای غیرمجاز، پیروی از دستورالعملهای خود تولید، پنهان کردن اشتباهات، و استفاده از کلیدهای API در معرض نمایش. [...]
OpenAI نمونههای جدیدی از آنچه را که آنها «ناهمترازی مدل AI» مینامند، از شش ماه گذشته ارائه کرده است، از جمله آپلود فایلهای غیرمجاز، پیروی از دستورالعملهای خود تولید، پنهان کردن اشتباهات، و استفاده از کلیدهای API در معرض نمایش.
OpenAI برای توصیف مواردی که مدلهای هوش مصنوعی بر خلاف محدودیتهای مورد نظر خود عمل میکنند، از اصطلاح "عدم همسویی مدل" استفاده میکند، از جمله انجام اقدامات غیرمجاز، فرار از نظارت، یا دور زدن اقدامات حفاظتی برای تکمیل یک کار.
در پستی که دیروز منتشر شد، OpenAI می گوید که اکنون از یک چارچوب جدید برای ردیابی و بررسی این اقدامات غیرمجاز توسط عوامل هوش مصنوعی استفاده می کند.
OpenAI توضیح میدهد: «ما یک چارچوب جدید برای ردیابی، بررسی و افشای موارد ناهماهنگی مدل در OpenAI به همراه شش گزارش در مورد رفتار مدل غیرمنتظره یا نگرانکنندهای که در شش ماه گذشته مشاهده کردهایم به اشتراک میگذاریم.»
نمونههای جدید اولین نمونههایی هستند که تحت یک چارچوب گزارشدهی ساختاریافتهتر منتشر شدهاند که هدف آن جایگزینی رویکرد ضعیفتر قبلی OpenAI برای افشای ناهماهنگی مدل است.
شش موردی که OpenAI این بار برجسته شده است عبارتند از:
هر مورد در یک گزارش حادثه فنی ثبت می شود که شامل نام مدل، خلاصه ای از رفتار آن در طول حادثه مشاهده شده و زمان وقوع حادثه است.
این گزارش همچنین شامل بازسازی دقیق آنچه اتفاق افتاده است، با وظایف کاربر و استدلال داخلی مدل، تفسیر OpenAI و پیامدهای بالقوه ایمنی، و اقدامات کاهشی انجام شده و یا اجرا خواهد شد.
OpenAI تاکید کرد که این شش مثال نشان دهنده تعداد دفعات برخورد آن با ناهماهنگی در مدلهای خود نیستند، بلکه نمونههای شدیدی هستند که با این وجود تجزیه و تحلیل و افشای عمومی را تضمین میکنند.
این شرکت گفت که تحت فرآیند جدید، هر کارمندی ممکن است حادثه ای را برای بررسی علامت گذاری کند.
این حادثه بسته به پیچیدگی، دخالت شخص ثالث، نقص های امنیتی و خطرات سوء استفاده، ارزیابی و در سه دسته قرار می گیرد: «آماده برای افشا»، «تحقیق جزئی» یا «تحقیق بزرگتر».
شش نمونه ارائه شده این بار در دو دسته اول قرار می گیرند، در حالی که سومین یک گزارش اولیه تا پایان تحقیقات و انتشار کامل تر پس از مرگ دریافت می کند.
OpenAI میگوید نفوذ Hugging Face در اوایل سال جاری، که شامل 700 نفر از عوامل هوش مصنوعی «ناهمتراز» بود، واجد شرایط این دسته سوم از شدت خواهد بود.
به میکو هیپونن و رهبران امنیتی NFL، CHANEL و Atlassian بپیوندید تا در یک نشست دیجیتالی دو ساعته در مورد اینکه حملات با سرعت هوش مصنوعی چه تغییراتی میکنند، مدافعان چه کارهایی را باید انجام ندهند و چگونه اعتبار، تصمیمگیری، اصلاح و تأیید مجدد با سرعت ماشین را انجام دهند، بپیوندید.
نزدیک به 700 عامل سرکش هوش مصنوعی در حمله Hugging Face هماهنگ شدند
Anthropic از کلود می خواهد که حساب بانکی و داده های مالی شما را تجزیه و تحلیل کند
آژانس داده اسپانیا اولین گزارش از نقض داده های مبتنی بر هوش مصنوعی را دریافت کرد
OpenAI میگوید GPT-6 Astra میتواند روزهای صفر را پیدا کند، اما نظارت بر آن نیز سختتر است
هکرها چارچوب های هوش مصنوعی را برای سرقت اعتبار در مقیاس گسترده می سازند
متن اصلی (انگلیسی)
OpenAI details more cases of AI agents taking unauthorized actions
OpenAI has presented new examples of what they call "AI model misalignment" from the past six months, including unauthorized file uploads, following self-generated instructions, hiding mistakes, and leveraging exposed API keys. [...]