سه هکر از کلود برای نفوذ به OpenAI در کمتر از 72 ساعت استفاده کردند
اگر واقعا به معنای آسیب شرکت بود، اوضاع میتوانست خیلی بدتر شود.
هک جولای Hugging Face - که در آن هزاران عامل OpenAI مخفیانه از محیط آزمایش خود فرار کردند، یک "جمعیت" تشکیل دادند و به اینترنت باز دسترسی پیدا کردند - نشان داد که دفاع سایبری شرکت ها در مواجهه با سیستم های هوش مصنوعی مدرن چقدر آسیب پذیر است. همانطور که به نظر می رسد، این شامل شرکت های سازنده این فناوری می شود.
اما هکرها از آسیبپذیریهایی استفاده کردند که به راحتی میتوانست توسط شخصی با اهداف بسیار کمتر دوستانه کشف و مورد سوء استفاده قرار گیرد.
دو روز قبل، Hacktron یک نقص امنیتی در نرم افزار آپلود تصویر مورد استفاده توسط Discourse، پلتفرم گفتگوی آنلاین OpenAI، کشف کرده بود. با استفاده از Anthropic's Claude Opus 4.8، آنها با تلاش برای تولید کدی شروع کردند که به آنها اجازه میدهد فایلهای مخربی را آپلود کنند که مانند اسب تروجان دیجیتال عمل میکند و از طریق آن میتوانند به بحثهای میزبانی شده در سایت دسترسی خصوصی داشته باشند. (طبق گزارش وال استریت ژورنال، آنها از نسخه غیر عمومی Opus 4.8 استفاده می کردند که فقط به محققان امنیت سایبری واجد شرایط داده شده بود.)
آنها در ابتدا ناموفق بودند. اما آنتروپیک روز بعد Opus 5 را منتشر کرد و آن مدل بسیار بهتر عمل کرد. در اوایل صبح 25 جولای، هکرها دریافتند که Opus 5 با موفقیت از اشکال Discourse سوء استفاده کرده است و آنها میتوانند یک انجمن گفتگوی OpenAI داخلی حاوی توکنهای احراز هویت کارمندان - کدهای دیجیتال منحصربهفردی که امکان دسترسی به برنامهها یا وبسایتها را فراهم میکند - را مشاهده کنند که میتوان از آنها برای دسترسی به حسابهای ChatGPT و Codex کارمندان استفاده کرد.
محققان Hacktron در گزارشی درباره هک منتشر شده در روز یکشنبه نوشتند: آنها میتوانستند حتی عمیقتر از آنجا پیش بروند: «گستره چیزی که ما از لحاظ نظری میتوانستیم به آن دسترسی پیدا کنیم، از جمله GitHub، Slack و ایمیلها بسیار زیاد بود.
در حساب Codex یکی از کارکنان OpenAI، تیم Hacktron یک درخواست کشش (یا "PR") ارائه کرد تا ثابت کند که بدون بازیابی اطلاعات حساس شرکت در آنجا بوده اند: معادل دیجیتالی نصب پرچم در قله کوه.
Hacktron در گزارش خود خاطرنشان می کند: "کل جدول زمانی از کشف اولیه تا دسترسی به دسترسی به مخزن OpenAI در کمتر از 72 ساعت انجام شد." این هک کاملا مستقل نبود و راهنمایی های انسانی ماهر همچنان مهم بود، اما میزان کاری که یک تیم کوچک می توانست انجام دهد به طرز چشمگیری افزایش یافت.
دو باگ به ما اجازه میدهد حسابهای ChatGPT/Codex کارکنان OpenAI (+برخی کاربران غیروابسته) را کنترل کنیم و به خدمات متصل دسترسی پیدا کنیم: Outlook، Slack، GitHub و غیره.
ما آن را با روابط عمومی در پایگاه کد داخلی OpenAI ثابت کردیم. کمتر از 72 ساعت طول کشید. 🧵 pic.twitter.com/gVsmQZwSc8
مفهوم این است که این نوع هک، که در عرض چند روز با نظارت نسبتا جزئی انسانی انجام میشود، میتوانست توسط بازیگر بدی انجام شود که در واقع میخواست به شرکت آسیب برساند. پیشرفت ناگهانی به دست آمده پس از دسترسی Hacktron به Opus 5 نیز مهم است، زیرا نسخههای آینده مدلها احتمالا قدرت بیشتری را در اختیار هکرها، کلاههای سفید و سیاه، قرار میدهند. (در مدت کوتاهی پس از اطلاع از HackTron، OpenAI و Discourse به هکرها گفتند که آسیبپذیریها اصلاح شدهاند.)
هک و برنامه پاداش باگ OpenAI بخشی از یک تلاش گسترده تر در سراسر صنعت فناوری برای تقویت دفاع سایبری آن در زمانی است که تکامل عوامل هوش مصنوعی به مراتب از علم به اصطلاح "همسویی" پیشی گرفته است، که بر اطمینان از اینکه آن سیستم ها به شیوه های مخرب غیرقابل پیش بینی رفتار نمی کنند متمرکز است.
روز چهارشنبه، OpenAI شش رویداد ناشناخته دیگر از رفتار ناهماهنگ عامل را به همراه چارچوبی برای انتشار گزارشهای مشابه در آینده فاش کرد، «حتی وقتی رفتاری را که گزارش میدهیم به طور کامل توضیح ندادهایم یا کاهش ندادهایم». آنتروپیک و متا نیز اخیرا مواردی را گزارش کرده اند که در آن عوامل هوش مصنوعی خودشان سرکشی کرده و به وب سایت های شخص ثالث هک می شوند.
OpenAI بلافاصله در مورد اینکه آیا این اکسپلویت توسط طرف های دیگری استفاده شده است یا خیر پاسخی نداد. وقتی پاسخی دریافت کردیم، این پست را به روز می کنیم.
در روز شنبه، داریو آمودی، مدیر عامل آنتروپیک، خواستار کاهش سرعت آزمایشگاههای هوش مصنوعی «مرز» آمریکا شد تا به صنعت زمان بدهد تا در مورد اینکه چگونه میتواند از خروج عوامل هوش مصنوعی نادرست از کنترل و ایجاد آشفتگی در آینده جلوگیری کند. آمودی در مقالهای که به صورت آنلاین منتشر شد، نوشت: «با توجه به سرعت توسعه قابلیتهای هوش مصنوعی، نگرانی من این است که در عرض 6 تا 12 ماه، چنین گروهی [از عوامل سرکش] میتوانند کل اینترنت را با یک باتنت دائمی تصاحب کنند (به طور بالقوه باعث صدها میلیارد دلار خسارت میشود).
اگر هوش مصنوعی بدون نردههای محافظ لازم قویتر شود، از آنجا افزایش مییابد.»
متن اصلی (انگلیسی)
Three Hackers Used Claude to Break Into OpenAI In Less Than 72 Hours
Things could've gone a whole lot worse if they'd actually meant the company harm.