پرش به محتوای اصلی

Scoop: شرکت های برتر هوش مصنوعی در حال بررسی ده ها هزار حادثه امنیتی هستند

اکسیوس۱۴۰۵ مهر ۵, یکشنبه، ساعت ۰۲:۰۵حدود 5 دقیقه مطالعه

منابع به Axios گفتند که محققان OpenAI، Anthropic و امنیتی در حال بررسی ده‌ها هزار حادثه هستند که در آن مدل‌های مرزی آنها اقداماتی را انجام داده‌اند که ارزیاب‌های خارجی آن را مشکل‌ساز می‌دانند. چرا اهمیت دارد: تعداد زیاد حوادثی که در ماه‌های اخیر در آزمایش‌های داخلی و دنیای واقعی رخ داده است، نشان می‌دهد که مشکل بسیار پیچیده‌تر از آن چیزی است که به طور عمومی شناخته شده است.…

منابع به Axios گفتند که محققان OpenAI، Anthropic و امنیتی در حال بررسی ده‌ها هزار حادثه هستند که در آن مدل‌های مرزی آنها اقداماتی را انجام داده‌اند که ارزیاب‌های خارجی آن را مشکل‌ساز می‌دانند.

چرا اهمیت دارد: تعداد بسیار زیاد حوادثی که در ماه‌های اخیر در آزمایش‌های داخلی و دنیای واقعی رخ داده است، نشان می‌دهد که مشکل بسیار پیچیده‌تر از آن چیزی است که عموما شناخته شده است. این یافته ها که به عنوان بخشی از کار داخلی برای ارزیابی مدل ها و در تحقیقات انجام شده در هر دو شرکت در مورد رفتار مدل ظاهر می شوند، سؤالاتی را در مورد اینکه آیا هر یک از شرکت ها - یا هر مدل ساز برتر - در حال حاضر قادر به ایجاد کنترل کامل بر فناوری خود هستند، ایجاد می کند. جزئیات: اپیزودها شامل دور زدن نرده‌های محافظ، ایجاد تابلوهای پیام، فرار از سندبو هستند.

به گفته منابع، xes، ربودن وب سایت، خودخواسته یا تلاش برای دور زدن مانیتورها. منابع گفتند که آنها در آزمایش های داخلی و در دنیای واقعی رخ داده اند و بسیاری از آنها هنوز عمومی نشده اند زیرا محققان امنیتی به تحقیق ادامه می دهند.

به گفته منابع، برخی از آزمایش‌ها شبیه فعالیت «تیم قرمز» است، جایی که شرکت‌ها در تلاش هستند مدل‌ها را به رفتار نادرست وادار کنند تا از ایمن بودن آنها اطمینان حاصل کنند.

بدرفتاری عاملی مترادف با توسعه هوش مصنوعی مرزی است: بزرگترین آزمایشگاه‌های هوش مصنوعی با چالش مشابهی روبرو هستند که انسان‌ها را در تلاش برای ایجاد نرده‌های محافظ در برابر سیستم‌های انعطاف‌پذیر و قدرتمندی است که تلاش می‌کنند وظایف را تکمیل کنند. محرک اخبار: شدت این حوادث متفاوت است و با افشاگری های OpenAI در روزهای اخیر قابل مقایسه است. آنها شامل تلاش‌های موفق برای دور زدن نرده‌های محافظ و تلاش‌های ناموفق می‌شوند، و تاکنون مشخص نشده است که بیشتر آنها آسیب‌های واقعی را ایجاد کرده‌اند.

منابع گفتند که کل ممکن است بیش از ده ها هزار افزایش یابد. در روزهای اخیر، OpenAI و محققان خارجی مجموعه‌ای از قسمت‌های مربوط به رفتار مدل از سیستم‌های این شرکت را فاش کرده‌اند که برخی کارشناسان آن را مشکل‌ساز می‌دانند.

به گفته شرکت، منابع و گزارش‌های رویترز و نیویورک تایمز، از جمله عوامل OpenAI که 53 تصویر از کاربران ChatGPT را به صورت آنلاین درز کردند، نقض یک وب‌سایت دولتی استرالیا، و تلاش برای هک کردن سایت‌های دیگر - از جمله از طرف دولت ایالات متحده. یکی از سخنگویان به Axios گفت که OpenAI اعلام کرد که آموزش بر روی توانمندترین مدل‌های خود را متوقف می‌کند و آموزش آن‌ها را «فقط زمانی از سر می‌گیرد که مطمئن باشیم پادمان‌های اضافی و بهبودهای هم‌ترازی را داریم».

سام آلتمن، مدیر اجرایی، در ایکس گفت که بررسی مداوم آن "آنطور که ما می خواستیم سریع نبوده است."

آلتمن گفت که رخداد در آغوش گرفتن شدیدترین حادثه ای است که آنها دیده اند. در آن نمونه، انبوهی متشکل از صدها عامل کار خود را در یک تابلوی پیام هماهنگ کردند و یک شرکت خارجی را در تلاش برای بهبود عملکرد خود در یک تست امنیت سایبری هک کردند.

یکی از سخنگویان OpenAI به Axios گفت: «مردم می‌خواهند بدانند که هوش مصنوعی با خیال راحت توسعه می‌یابد، و این با کاری شروع می‌شود که شرکت‌هایی مانند ما خودمان انجام می‌دهند. این اولین باری نیست که ما برای انجام چنین اقداماتی مکث می کنیم و انتظار نداریم که آخرین باری باشد که قابلیت های هوش مصنوعی همچنان در حال پیشرفت است. وضعیت بازی: آنتروپیک یک سازمان ایمنی شخص ثالث را مأمور کرده است تا رفتار مدل‌های خود را بررسی کند.

در اسنادی که این شرکت به صورت عمومی منتشر کرده است، فراوانی اپیزودهای ناهماهنگی را فاش کرده است. «کارت سیستم» مدل Opus 5.5 که این هفته منتشر شد، نشان داد که چقدر اغلب به روش‌هایی رفتار می‌کند که شرکت آن را غیرعادی یا مشکل‌ساز معرفی می‌کند.

به عنوان مثال، این مدل در 1.5 درصد از اجرای آزمایشی به دنبال فرار از جعبه شنی (یک محیط تست ایمن) بود. این در مقایسه با مدل Anthropic's Mythos 25٪ است که یک پیشرفت قابل توجه است. بله، اما: منابع گفتند که Anthropic و سایر شرکت ها صدها هزار آزمایش آزمایشی روی مدل های خود انجام می دهند. این بدان معناست که حتی درصد کمی از رفتارهای ناهماهنگ همچنان می تواند به ده ها هزار مورد منجر شود که در آن مدل ها به روش های غیرمنتظره و گاهی اوقات نگران کننده رفتار کرده اند.

حادثه Hugging Face، و همچنین تعداد زیادی از افراد دیگر که به دنبال آن اتفاق افتاد، باعث شد مدیران ارشد هوش مصنوعی خواهان کاهش سرعت توسعه و درخواست مقررات فدرال و بین‌المللی قوی‌تر شوند.

منابع به اکسیوس گفتند که برخی در OpenAI، Hugging Face را یک‌بار می‌دانند و به دلیل کنترل‌های بهبودیافته و ماهیت غیرمعمول آزمایشی که انجام داده‌اند، که شامل یک مدل منتشر نشده بود، افشای حوادث آینده احتمالا شدیدتر خواهد بود. محققان امنیت هوش مصنوعی موافقند که راه‌حل‌های ساده‌ای وجود دارد که به شرکت‌های هوش مصنوعی کمک می‌کند تا از جنبه‌هایی از آنچه که قسمت Hugging Face را برای افراد خارجی بسیار خطرناک جلوه می‌دهد اجتناب کنند. سطح تهدید: با این حال، سایر مدیران هوش مصنوعی و محققان ایمنی هشدار دادند که اطمینان محدودی دارند که شرکت‌های هوش مصنوعی قادر به جلوگیری از همه مدل مشکل‌ساز b هستند.

رفتار مدل‌های جدید هوش مصنوعی وظایف را با انعطاف‌پذیری فوق‌العاده کامل می‌کنند، بنابراین تلاش برای محدود کردن تدبیر آنها اغلب یک بازی بازنده است، زیرا لازم است هر راه ممکنی را پیش‌بینی کرد.

به گفته مدیران ارشد هوش مصنوعی، اغلب، تکنیکی که ممکن است هرگز به ذهن انسان خطور نکرده باشد، چیزی است که به آنها اجازه می دهد از نرده های محافظ عبور کنند. یکی از مدیران امنیت سایبری گفت: «تلاش برای ارائه یک لیست کامل از بایدها و نبایدها احتمالا یک کار احمقانه است. بررسی واقعیت: مقداری از آنچه متخصصان ایمنی هوش مصنوعی آن را «رفتار نامناسب» می‌نامند، در شرکت‌های هوش مصنوعی در حالی که مدل‌های جدید خود را آزمایش می‌کنند، قابل انتظار است. کارشناسان به Axios گفتند که ممکن است خطر ناهماهنگی را به صفر برساند. بزرگنمایی: نگرانی این است که اگر یک مدل چندین بار در آزمایش یک اقدام مشکل ساز انجام دهد، به احتمال زیاد آن مدل

رفتار می تواند باعث یک حادثه سایبری در دنیای واقعی شود. محقق Conrad Stosz در Transluce، یک ارزیاب مستقل هوش مصنوعی، به Axios گفت: «آنچه که ما از نظر کاری که این عوامل انجام می دهند دیده ایم، فقط نوک کوه یخ است.

کانر لیهی، محقق هوش مصنوعی و مدیر اجرایی ControlAI به Axios گفت که این موضوع به میزان آسیب‌رسانی به هر نمونه اختصاصی نیست.

او گفت: «شخصیت دیوانه‌کننده این است که این موارد شامل «سیستم‌های مستقلی است که کارهایی را انجام می‌دهند که به آنها گفته شده بود انجام ندهند»، که به طور بالقوه شامل جنایات نیز می‌شود. نتیجه: منتظر افشای اطلاعات جدید در مورد رفتار نادرست مدل باشید زیرا شرکت‌های هوش مصنوعی به گسترش قابلیت‌های مرزی خود ادامه می‌دهند.

خواندن متن کامل در اکسیوسبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Scoop: Top AI companies probing tens of thousands of security incidents

OpenAI, Anthropic and security researchers are investigating tens of thousands of incidents in which their frontier models took steps that outside evaluators would consider problematic, sources told Axios. Why it matters: The sheer number of incidents, which occurred in recent months in internal testing and the real world, indicates that the problem is orders of magnitude more complex than what is publicly known.…

همه‌ی اخبار فناوری