پرش به محتوای اصلی

OpenAI موارد بیشتری از انجام اقدامات غیرمجاز توسط عوامل هوش مصنوعی را شرح می دهد

بلیپینگ‌کامپیوتر۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۲۲:۲۵حدود 2 دقیقه مطالعه

OpenAI نمونه‌های جدیدی از آنچه را که آن‌ها «ناهمترازی مدل AI» می‌نامند، از شش ماه گذشته ارائه کرده است، از جمله آپلود فایل‌های غیرمجاز، پیروی از دستورالعمل‌های خود تولید، پنهان کردن اشتباهات، و استفاده از کلیدهای API در معرض نمایش. [...]

OpenAI نمونه‌های جدیدی از آنچه را که آن‌ها «ناهمترازی مدل AI» می‌نامند، از شش ماه گذشته ارائه کرده است، از جمله آپلود فایل‌های غیرمجاز، پیروی از دستورالعمل‌های خود تولید، پنهان کردن اشتباهات، و استفاده از کلیدهای API در معرض نمایش.

OpenAI برای توصیف مواردی که مدل‌های هوش مصنوعی بر خلاف محدودیت‌های مورد نظر خود عمل می‌کنند، از اصطلاح "عدم همسویی مدل" استفاده می‌کند، از جمله انجام اقدامات غیرمجاز، فرار از نظارت، یا دور زدن اقدامات حفاظتی برای تکمیل یک کار.

در پستی که دیروز منتشر شد، OpenAI می گوید که اکنون از یک چارچوب جدید برای ردیابی و بررسی این اقدامات غیرمجاز توسط عوامل هوش مصنوعی استفاده می کند.

OpenAI توضیح می‌دهد: «ما یک چارچوب جدید برای ردیابی، بررسی و افشای موارد ناهماهنگی مدل در OpenAI به همراه شش گزارش در مورد رفتار مدل غیرمنتظره یا نگران‌کننده‌ای که در شش ماه گذشته مشاهده کرده‌ایم به اشتراک می‌گذاریم.»

نمونه‌های جدید اولین نمونه‌هایی هستند که تحت یک چارچوب گزارش‌دهی ساختاریافته‌تر منتشر شده‌اند که هدف آن جایگزینی رویکرد ضعیف‌تر قبلی OpenAI برای افشای ناهماهنگی مدل است.

شش موردی که OpenAI این بار برجسته شده است عبارتند از:

هر مورد در یک گزارش حادثه فنی ثبت می شود که شامل نام مدل، خلاصه ای از رفتار آن در طول حادثه مشاهده شده و زمان وقوع حادثه است.

این گزارش همچنین شامل بازسازی دقیق آنچه اتفاق افتاده است، با وظایف کاربر و استدلال داخلی مدل، تفسیر OpenAI و پیامدهای بالقوه ایمنی، و اقدامات کاهشی انجام شده و یا اجرا خواهد شد.

OpenAI تاکید کرد که این شش مثال نشان دهنده تعداد دفعات برخورد آن با ناهماهنگی در مدل‌های خود نیستند، بلکه نمونه‌های شدیدی هستند که با این وجود تجزیه و تحلیل و افشای عمومی را تضمین می‌کنند.

این شرکت گفت که تحت فرآیند جدید، هر کارمندی ممکن است حادثه ای را برای بررسی علامت گذاری کند.

این حادثه بسته به پیچیدگی، دخالت شخص ثالث، نقص های امنیتی و خطرات سوء استفاده، ارزیابی و در سه دسته قرار می گیرد: «آماده برای افشا»، «تحقیق جزئی» یا «تحقیق بزرگتر».

شش نمونه ارائه شده این بار در دو دسته اول قرار می گیرند، در حالی که سومین یک گزارش اولیه تا پایان تحقیقات و انتشار کامل تر پس از مرگ دریافت می کند.

OpenAI می‌گوید نفوذ Hugging Face در اوایل سال جاری، که شامل 700 نفر از عوامل هوش مصنوعی «ناهم‌تراز» بود، واجد شرایط این دسته سوم از شدت خواهد بود.

به میکو هیپونن و رهبران امنیتی NFL، CHANEL و Atlassian بپیوندید تا در یک نشست دیجیتالی دو ساعته در مورد اینکه حملات با سرعت هوش مصنوعی چه تغییراتی می‌کنند، مدافعان چه کارهایی را باید انجام ندهند و چگونه اعتبار، تصمیم‌گیری، اصلاح و تأیید مجدد با سرعت ماشین را انجام دهند، بپیوندید.

نزدیک به 700 عامل سرکش هوش مصنوعی در حمله Hugging Face هماهنگ شدند

Anthropic از کلود می خواهد که حساب بانکی و داده های مالی شما را تجزیه و تحلیل کند

آژانس داده اسپانیا اولین گزارش از نقض داده های مبتنی بر هوش مصنوعی را دریافت کرد

OpenAI می‌گوید GPT-6 Astra می‌تواند روزهای صفر را پیدا کند، اما نظارت بر آن نیز سخت‌تر است

هکرها چارچوب های هوش مصنوعی را برای سرقت اعتبار در مقیاس گسترده می سازند

خواندن متن کامل در بلیپینگ‌کامپیوتربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI details more cases of AI agents taking unauthorized actions

OpenAI has presented new examples of what they call "AI model misalignment" from the past six months, including unauthorized file uploads, following self-generated instructions, hiding mistakes, and leveraging exposed API keys. [...]

همه‌ی اخبار فناوری
OpenAI موارد بیشتری از انجام اقدامات غیرمجاز توسط عوامل هوش مصنوعی را شرح می دهد | چکیده