Scoop: شرکت های برتر هوش مصنوعی در حال بررسی ده ها هزار حادثه امنیتی هستند
منابع به Axios گفتند که محققان OpenAI، Anthropic و امنیتی در حال بررسی دهها هزار حادثه هستند که در آن مدلهای مرزی آنها اقداماتی را انجام دادهاند که ارزیابهای خارجی آن را مشکلساز میدانند. چرا اهمیت دارد: تعداد زیاد حوادثی که در ماههای اخیر در آزمایشهای داخلی و دنیای واقعی رخ داده است، نشان میدهد که مشکل بسیار پیچیدهتر از آن چیزی است که به طور عمومی شناخته شده است.…
منابع به Axios گفتند که محققان OpenAI، Anthropic و امنیتی در حال بررسی دهها هزار حادثه هستند که در آن مدلهای مرزی آنها اقداماتی را انجام دادهاند که ارزیابهای خارجی آن را مشکلساز میدانند.
چرا اهمیت دارد: تعداد بسیار زیاد حوادثی که در ماههای اخیر در آزمایشهای داخلی و دنیای واقعی رخ داده است، نشان میدهد که مشکل بسیار پیچیدهتر از آن چیزی است که عموما شناخته شده است. این یافته ها که به عنوان بخشی از کار داخلی برای ارزیابی مدل ها و در تحقیقات انجام شده در هر دو شرکت در مورد رفتار مدل ظاهر می شوند، سؤالاتی را در مورد اینکه آیا هر یک از شرکت ها - یا هر مدل ساز برتر - در حال حاضر قادر به ایجاد کنترل کامل بر فناوری خود هستند، ایجاد می کند. جزئیات: اپیزودها شامل دور زدن نردههای محافظ، ایجاد تابلوهای پیام، فرار از سندبو هستند.
به گفته منابع، xes، ربودن وب سایت، خودخواسته یا تلاش برای دور زدن مانیتورها. منابع گفتند که آنها در آزمایش های داخلی و در دنیای واقعی رخ داده اند و بسیاری از آنها هنوز عمومی نشده اند زیرا محققان امنیتی به تحقیق ادامه می دهند.
به گفته منابع، برخی از آزمایشها شبیه فعالیت «تیم قرمز» است، جایی که شرکتها در تلاش هستند مدلها را به رفتار نادرست وادار کنند تا از ایمن بودن آنها اطمینان حاصل کنند.
بدرفتاری عاملی مترادف با توسعه هوش مصنوعی مرزی است: بزرگترین آزمایشگاههای هوش مصنوعی با چالش مشابهی روبرو هستند که انسانها را در تلاش برای ایجاد نردههای محافظ در برابر سیستمهای انعطافپذیر و قدرتمندی است که تلاش میکنند وظایف را تکمیل کنند. محرک اخبار: شدت این حوادث متفاوت است و با افشاگری های OpenAI در روزهای اخیر قابل مقایسه است. آنها شامل تلاشهای موفق برای دور زدن نردههای محافظ و تلاشهای ناموفق میشوند، و تاکنون مشخص نشده است که بیشتر آنها آسیبهای واقعی را ایجاد کردهاند.
منابع گفتند که کل ممکن است بیش از ده ها هزار افزایش یابد. در روزهای اخیر، OpenAI و محققان خارجی مجموعهای از قسمتهای مربوط به رفتار مدل از سیستمهای این شرکت را فاش کردهاند که برخی کارشناسان آن را مشکلساز میدانند.
به گفته شرکت، منابع و گزارشهای رویترز و نیویورک تایمز، از جمله عوامل OpenAI که 53 تصویر از کاربران ChatGPT را به صورت آنلاین درز کردند، نقض یک وبسایت دولتی استرالیا، و تلاش برای هک کردن سایتهای دیگر - از جمله از طرف دولت ایالات متحده. یکی از سخنگویان به Axios گفت که OpenAI اعلام کرد که آموزش بر روی توانمندترین مدلهای خود را متوقف میکند و آموزش آنها را «فقط زمانی از سر میگیرد که مطمئن باشیم پادمانهای اضافی و بهبودهای همترازی را داریم».
سام آلتمن، مدیر اجرایی، در ایکس گفت که بررسی مداوم آن "آنطور که ما می خواستیم سریع نبوده است."
آلتمن گفت که رخداد در آغوش گرفتن شدیدترین حادثه ای است که آنها دیده اند. در آن نمونه، انبوهی متشکل از صدها عامل کار خود را در یک تابلوی پیام هماهنگ کردند و یک شرکت خارجی را در تلاش برای بهبود عملکرد خود در یک تست امنیت سایبری هک کردند.
یکی از سخنگویان OpenAI به Axios گفت: «مردم میخواهند بدانند که هوش مصنوعی با خیال راحت توسعه مییابد، و این با کاری شروع میشود که شرکتهایی مانند ما خودمان انجام میدهند. این اولین باری نیست که ما برای انجام چنین اقداماتی مکث می کنیم و انتظار نداریم که آخرین باری باشد که قابلیت های هوش مصنوعی همچنان در حال پیشرفت است. وضعیت بازی: آنتروپیک یک سازمان ایمنی شخص ثالث را مأمور کرده است تا رفتار مدلهای خود را بررسی کند.
در اسنادی که این شرکت به صورت عمومی منتشر کرده است، فراوانی اپیزودهای ناهماهنگی را فاش کرده است. «کارت سیستم» مدل Opus 5.5 که این هفته منتشر شد، نشان داد که چقدر اغلب به روشهایی رفتار میکند که شرکت آن را غیرعادی یا مشکلساز معرفی میکند.
به عنوان مثال، این مدل در 1.5 درصد از اجرای آزمایشی به دنبال فرار از جعبه شنی (یک محیط تست ایمن) بود. این در مقایسه با مدل Anthropic's Mythos 25٪ است که یک پیشرفت قابل توجه است. بله، اما: منابع گفتند که Anthropic و سایر شرکت ها صدها هزار آزمایش آزمایشی روی مدل های خود انجام می دهند. این بدان معناست که حتی درصد کمی از رفتارهای ناهماهنگ همچنان می تواند به ده ها هزار مورد منجر شود که در آن مدل ها به روش های غیرمنتظره و گاهی اوقات نگران کننده رفتار کرده اند.
حادثه Hugging Face، و همچنین تعداد زیادی از افراد دیگر که به دنبال آن اتفاق افتاد، باعث شد مدیران ارشد هوش مصنوعی خواهان کاهش سرعت توسعه و درخواست مقررات فدرال و بینالمللی قویتر شوند.
منابع به اکسیوس گفتند که برخی در OpenAI، Hugging Face را یکبار میدانند و به دلیل کنترلهای بهبودیافته و ماهیت غیرمعمول آزمایشی که انجام دادهاند، که شامل یک مدل منتشر نشده بود، افشای حوادث آینده احتمالا شدیدتر خواهد بود. محققان امنیت هوش مصنوعی موافقند که راهحلهای سادهای وجود دارد که به شرکتهای هوش مصنوعی کمک میکند تا از جنبههایی از آنچه که قسمت Hugging Face را برای افراد خارجی بسیار خطرناک جلوه میدهد اجتناب کنند. سطح تهدید: با این حال، سایر مدیران هوش مصنوعی و محققان ایمنی هشدار دادند که اطمینان محدودی دارند که شرکتهای هوش مصنوعی قادر به جلوگیری از همه مدل مشکلساز b هستند.
رفتار مدلهای جدید هوش مصنوعی وظایف را با انعطافپذیری فوقالعاده کامل میکنند، بنابراین تلاش برای محدود کردن تدبیر آنها اغلب یک بازی بازنده است، زیرا لازم است هر راه ممکنی را پیشبینی کرد.
به گفته مدیران ارشد هوش مصنوعی، اغلب، تکنیکی که ممکن است هرگز به ذهن انسان خطور نکرده باشد، چیزی است که به آنها اجازه می دهد از نرده های محافظ عبور کنند. یکی از مدیران امنیت سایبری گفت: «تلاش برای ارائه یک لیست کامل از بایدها و نبایدها احتمالا یک کار احمقانه است. بررسی واقعیت: مقداری از آنچه متخصصان ایمنی هوش مصنوعی آن را «رفتار نامناسب» مینامند، در شرکتهای هوش مصنوعی در حالی که مدلهای جدید خود را آزمایش میکنند، قابل انتظار است. کارشناسان به Axios گفتند که ممکن است خطر ناهماهنگی را به صفر برساند. بزرگنمایی: نگرانی این است که اگر یک مدل چندین بار در آزمایش یک اقدام مشکل ساز انجام دهد، به احتمال زیاد آن مدل
رفتار می تواند باعث یک حادثه سایبری در دنیای واقعی شود. محقق Conrad Stosz در Transluce، یک ارزیاب مستقل هوش مصنوعی، به Axios گفت: «آنچه که ما از نظر کاری که این عوامل انجام می دهند دیده ایم، فقط نوک کوه یخ است.
کانر لیهی، محقق هوش مصنوعی و مدیر اجرایی ControlAI به Axios گفت که این موضوع به میزان آسیبرسانی به هر نمونه اختصاصی نیست.
او گفت: «شخصیت دیوانهکننده این است که این موارد شامل «سیستمهای مستقلی است که کارهایی را انجام میدهند که به آنها گفته شده بود انجام ندهند»، که به طور بالقوه شامل جنایات نیز میشود. نتیجه: منتظر افشای اطلاعات جدید در مورد رفتار نادرست مدل باشید زیرا شرکتهای هوش مصنوعی به گسترش قابلیتهای مرزی خود ادامه میدهند.
متن اصلی (انگلیسی)
Scoop: Top AI companies probing tens of thousands of security incidents
OpenAI, Anthropic and security researchers are investigating tens of thousands of incidents in which their frontier models took steps that outside evaluators would consider problematic, sources told Axios. Why it matters: The sheer number of incidents, which occurred in recent months in internal testing and the real world, indicates that the problem is orders of magnitude more complex than what is publicly known.…