پرش به محتوای اصلی

OpenAI می گوید ماموران هوش مصنوعی آن آخر هفته گذشته دوباره از یک جعبه ماسه ای امن فرار کردند و برای دومین بار آموزش را متوقف می کنند.

فورچون۱۴۰۵ مهر ۴, شنبه، ساعت ۱۸:۵۵حدود 5 دقیقه مطالعه

پس از یک حادثه 20 سپتامبر که نشان داد ارتقای امنیتی آن پس از حمله Hugging Face برای جلوگیری از "سرکش" شدن عوامل هوش مصنوعی کافی نبود، این شرکت دوباره به دنبال بهبود کنترل های آزمایشی خود است.

OpenAI در یک گزارش فنی که در روز جمعه منتشر شد، گفت که یک مدل هوش مصنوعی که در حال آموزش و ارزیابی بود، تا آخر هفته گذشته از محیط تست امن خود خارج شد و اقدامات غیرمجاز در اینترنت انجام داد.

در نتیجه، این شرکت اعلام کرد که آموزش پیشرفته‌ترین مدل‌های هوش مصنوعی خود را برای دومین بار در کمتر از سه ماه متوقف می‌کند، در حالی که تلاش می‌کند بفهمد چگونه از تکرار این حوادث «هوش مصنوعی سرکش» جلوگیری کند.

میکا کارول، مسئول آمادگی RSI در OpenAI، در پستی در X در مورد آخرین حادثه گفت: «تمام استنتاج‌ها برای توانمندترین مدل‌های ما متوقف می‌شود تا زمانی که سیستم‌های خود را سخت‌تر کنیم».

این شرکت گفت که آخرین حادثه در 20 سپتامبر رخ داده است. این حادثه شامل یک عامل هوش مصنوعی است که تحت آزمایشات یک کار جستجوی اطلاعات قرار می گیرد. حتی با وجود اینکه قرار نبود به اینترنت دسترسی داشته باشد، عامل راهی برای ارسال پرسش‌ها به یک ربات چت عمومی پیدا کرد.

افشای جدید بسیار مهم است زیرا این اولین بار است که این شرکت می گوید یکی از مدل های هوش مصنوعی خود از زمان اعلام طیف وسیعی از اقدامات در 18 آگوست برای بهبود امنیت و نظارت بر "جعبه های ماسه ای" خود - محیط های دیجیتالی که معمولا از شبکه و دسترسی به اینترنت جدا شده اند، می تواند به اینترنت غیرمجاز دسترسی پیدا کند.

این پیشرفت ها پس از حادثه جولای رخ داد که در آن هزاران عامل هوش مصنوعی OpenAI راهی برای هک کردن جعبه شنی خود پیدا کردند و صدها نفر از آنها در یک حمله سایبری علیه شرکت هوش مصنوعی Hugging Face شرکت کردند.

از زمان افشای نقش خود در حمله Hugging Face، OpenAI ده ها رویداد دیگر را تأیید کرده است که در آن عوامل هوش مصنوعی که در حال آزمایش بود، اقدامات غیرمجاز در سراسر اینترنت انجام دادند، از جمله حملات سایبری متعدد، که برخی از آنها بر وب سایت های دولتی در ایالات متحده و استرالیا تأثیر گذاشت. همچنین فاش کرده است که در برخی از این حوادث عوامل هوش مصنوعی آن تصاویر خصوصی کاربران ChatGPT را به اینترنت درز کرده اند.

اما تا کنون، OpenAI هیچ گونه فعالیتی را پس از 20 جولای، زمانی که انبوه عواملی را که به Hugging Face حمله می‌کردند، کشف کرده و برای خاموش کردن آن حرکت کرده بود، گزارش نکرده است. این شرکت اعلام کرد که آموزش هوش مصنوعی را در اواخر جولای به مدت دو هفته متوقف کرده است، در حالی که برای بهبود کنترل ها و نظارت بر امنیت و ایمنی کار می کند.

این واقعیت که عوامل هوش مصنوعی آن یک بار دیگر موفق شده اند از یک جعبه شنی خارج شوند، نشان می دهد که اقدامات OpenAI برای بهبود امنیت پس از حمله Hugging Face ناکافی است.

OpenAI در گزارش فنی خود در مورد فرار از جعبه شنی در 20 سپتامبر گفت: "این حادثه شکافی را در کنترل های ما بر روی محدودیت های شبکه نشان داد." این سازمان گفت که یک بار دیگر تمرینات را متوقف می کند تا اینکه "هم تایید کند که شکاف برطرف شده است و هم تیم قرمز اضافی سیستم را انجام دهد."

آیا این بار کنترل های بهبود یافته کافی خواهد بود؟

در این مورد، OpenAI گفت که عامل هوش مصنوعی کشف کرده است که به سرویسی به نام حل‌کننده DNS دسترسی دارد که بین URL وب‌سایت و آدرس IP ترجمه می‌شود، و از طریق این سیستم DNS می‌تواند درخواست‌هایی را به یک چت بات عمومی ارسال کند.

مشخص نیست که اپیزود 20 سپتامبر گزارش شده توسط OpenAI گستره کامل آخرین نقص های امنیتی مربوط به مدل های AI منتشر نشده این شرکت را نشان می دهد یا خیر. اوایل این هفته، شرکت تحقیقاتی مستقل هوش مصنوعی Transluce AI گفت که شواهدی پیدا کرده است که نشان می دهد یک عامل هوش مصنوعی OpenAI ممکن است در 19 و 20 سپتامبر صرافی ارزهای دیجیتال را هک کند. OpenAI به درخواست ها برای اظهار نظر در مورد این جنبه از گزارش Transluce پاسخی نداده است.

OpenAI گفت که وقتی آموزش را مجددا شروع کند، از ابتدا شروع می‌کند تا امیدوار باشد که تمایل مدل جدید به درگیر شدن در رفتار «ناهمسو» - زمانی که یک مدل دستورالعمل‌های انسانی یا ارزش‌های عقل سلیم انسانی را در مورد اینکه چگونه باید و چگونه یک کار را نباید انجام دهد - از بین می‌رود. این سازمان همچنین گفت که "مداخلات ناهماهنگی جامع تر" را ایجاد خواهد کرد، اما مشخص نکرد که این مداخلات چیست.

این شرکت گفت که از زمان کشف این آخرین نقص امنیتی، «کنترل‌های مسدودکننده را در دو لایه مستقل اضافه کرده است، که هر کدام از دسترسی به اینترنت [نماینده] جلوگیری می‌کردند».

OpenAI همچنین فاش کرد که سیستم‌هایی که پس از حمله Hugging Face برای دستگیری عوامل هوش مصنوعی که تلاش می‌کردند از جعبه‌های شنی آزمایشی خود خارج شوند، راه‌اندازی کرده بود، فقط تا حدی کار می‌کرد. علاوه بر این، یک سیستم اضافی که قرار بود به‌طور خودکار اجرای تمرین را پس از تشخیص رفتار ناهماهنگ متوقف کند، با شکست مواجه شد.

این شرکت گفت که سیستم‌های نظارتی آن «رفتار [نماینده] را در عرض 15 دقیقه علامت‌گذاری کردند و یک نفر سه دقیقه بعد از آن شروع به بررسی آن کرد». اما بررسی بعدی نشان داد که تلاش‌های دیگری توسط مدل هوش مصنوعی برای استفاده از روش مشابه برای دسترسی به اینترنت صورت گرفته است که توسط سیستم نظارت علامت‌گذاری نشده بود.

OpenAI در گزارش فنی در مورد این حادثه گفت، سیستم متفاوتی که قرار بود به طور خودکار دوره آموزشی را در صورت شناسایی فعالیت مشکوک خاموش کند، کار نکرد، "به سردرگمی در مورد اینکه آیا باید متوقف می شد یا خیر." دو ساعت و نیم بعد که مشکل حل شد، دویدن به صورت دستی متوقف شد.

زوکسین لیو، یک محقق هوش مصنوعی که روی "پس از آموزش" در OpenAI کار می کند، در پستی در X گفت که از کارمندانی بود که برای پاسخ به فرار از جعبه شنی در 20 سپتامبر فراخوانده شده بودند. او نوشت: «بسیار سورئال بود که ببینیم این مدل به طور غیرمنتظره راهی برای دسترسی به اینترنت از محیطی که قرار بود محیطی فوق‌العاده امن برای انسان باشد پیدا می‌کند.

این داستان در ابتدا در سایت Fortune.com منتشر شد

خواندن متن کامل در فورچونبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI says its AI agents escaped a secure ‘sandbox’ again last weekend and is pausing training for a second time

The company is again looking to improve its test controls after a Sept. 20 incident showed its security upgrades after the Hugging Face attack were not enough to stop AI agents from going 'rogue.'

همه‌ی اخبار فناوری