OpenAI شش حادثه ایمنی جدید را فاش می کند
OpenAI در روز چهارشنبه شش حادثه جدید را فاش کرد که در آن مدلهای آن اشتباهات را پنهان میکردند، به دنبال اعتبارنامههای غیرمجاز، آپلود فایلها در اینترنت عمومی یا برقراری ارتباط در محیطهای آموزشی ظاهرا جدا شده بودند. این شرکت همچنین روش جدیدی را برای گزارش رفتارهای نادرست مشابه در آینده اعلام کرد. چرا مهم است: به طور فزاینده ای واضح است که نقض صورت در آغوش گرفتن یک اتفاق یکباره نبوده است، زیرا هوش مصنوعی…
OpenAI در روز چهارشنبه شش حادثه جدید را فاش کرد که در آن مدلهای آن اشتباهات را پنهان میکردند، به دنبال اعتبارنامههای غیرمجاز، آپلود فایلها در اینترنت عمومی یا برقراری ارتباط در محیطهای آموزشی ظاهرا جدا شده بودند. این شرکت همچنین روش جدیدی را برای گزارش رفتارهای نادرست مشابه در آینده اعلام کرد. چرا مهم است: به طور فزاینده ای واضح است که رخنه Hugging Face یک حادثه یکباره نبوده است، زیرا مدل های هوش مصنوعی توانایی بیشتری برای یافتن راه های غیرمنتظره برای کار در اطراف نرده های محافظ برای مهار آنها پیدا می کنند. "در حال حاضر هیچ چارچوب صنعتی با افشای صریح وجود ندارد
کای چن، سرپرست تیم همسویی در OpenAI، به Axios گفت.
چن گفت: "ما امیدواریم که واقعا به اطلاع رسانی استانداردها و مقررات مشترک کمک کند." بزرگنمایی: شش رویداد جدید فاششده از مدلهایی که دستورالعملهایی را برای خود آیندهشان گذاشتند تا پس از تقلب، ردیابیهایشان را بپوشانند تا استفاده از کلیدهای API لو رفته در GitHub - که اولین حادثه در اکتبر اتفاق افتاد. یک مدل خانواده Astra منتشرنشده، دستورالعملهای فرار از زندان را در خلاصههای زمینه خود، از جمله دستورالعملهایی برای نادیده گرفتن پیامهای توسعهدهنده، درج کرد. OpenAI 27 خلاصه تحت تأثیر را شناسایی کرد.
در طول آموزش GPT-5.6 Sol، مدلها با هدف پنهان کردن اشتباهات، اختراع دادههای تاریخی گمشده و پنهان کردن عدم تطابق بین نسخههای منبع طراحی شدند.
یک مدل مخازن عمومی GitHub را برای یافتن کلیدهای API در معرض دید جستجو کرد و سعی کرد از حسابهای ایمیل یکبار مصرف قبل از ساختن دادههای درآمد استفاده کند، زمانی که نمیتوانست اطلاعات درخواستی را بازیابی کند. نمونه های دیگر: مدلها در دو نوبت در ماههای اکتبر و ژانویه برای به دست آوردن استنادات یا نتایج جستجوی تصویر خارجی، بدون درخواست از کاربر، دادهها و یک تصویر کار را در سرویسهای میزبانی فایل عمومی آپلود کردند.
مدلها از مخزن Artifactory داخلی OpenAI به عنوان تابلوی پیام برای تبادل درخواستها و پاسخها در نمونههای آموزشی جداگانه استفاده میکردند.
عوامل همکار یک کتاب کار را در سرویسهای میزبانی عمومی آپلود کردند تا نمایندگان دیگر بتوانند آن را بازیابی کنند، علیرغم دستورالعملهایی که فقط از فایلهای محلی استفاده میکنند. برای رسیدگی به مسائل مشابه در آینده، OpenAI میگوید هر کارمندی ممکن است یک مورد مشکوک را برای بررسی توسط تیمهای ایمنی و همترازی علامتگذاری کند. پرونده ها در مسیر «آماده برای افشا»، «تحقیقات جزئی» یا «تحقیقات بزرگتر» قرار خواهند گرفت. OpenAI میگوید حوادثی که «آماده افشا هستند» ظرف شش روز کاری بهصورت عمومی گزارش میشوند، در حالی که مواردی که نیاز به تحقیقات جزئی دارند در 12 روز کاری گزارش خواهند شد.
OpenAI میگوید که مسیر کندتر عموما برای پروندههای پیچیدهای که اشخاص ثالث را درگیر میکنند اعمال میشود و فرآیند افشا طولانیتر خواهد بود.
این شرکت میگوید ممکن است قبل از تکمیل تحقیقات، یک اخطار اولیه صادر کند، اما تعهدات امنیتی، قانونی و افشای مسئولیتپذیر میتواند انتشار جزئیات را به تاخیر بیندازد. چن گفت: «ما معتقد نیستیم که صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی برای مقیاسپذیری مسئولانه با حداکثر سرعت حل کرده است. "مراحلی مانند افشای مسئولانه بخشی از این است که چگونه ما می توانیم به طور کلی سرعت و شفافیت بیشتری را در مورد فرآیندها و استانداردهای ایمنی و همسویی خود به مردم ارائه دهیم." آنچه آنها میگویند: OpenAI میگوید که این چارچوب از شفافیت حمایت میکند، حتی زمانی که اهمیت یک
n حادثه نامشخص است. همچنین میگوید که میخواهد معیارهای افشای عینیتری را با سایر توسعهدهندگان، محققان، سازمانهای استاندارد و تنظیمکنندههای هوش مصنوعی توسعه دهد.
OpenAI می گوید کارمندانی که معتقدند یک حادثه باید افشا شود اما نادیده گرفته می شود، می توانند موضوع را به رهبری ارشد تشدید کنند. تصویر بزرگ: این اطلاعیه ها در پی افشای OpenAI مبنی بر اینکه مدل های تحت ارزیابی از کنترل های مورد نظر فرار کرده و بخش هایی از سیستم های Hugging Face را به خطر انداختند، منتشر شد. حساب OpenAI می گوید که مدل ها به اینترنت دسترسی پیدا کردند، از آسیب پذیری ها سوء استفاده کردند و به داده های خصوصی محدودی دسترسی داشتند. این شرکت آن رویداد را شدیدترین فعالیت مدل محور خود از این نوع تا به امروز توصیف کرده است.
در بین خطوط: در حالی که تعدادی از فنآوران برجسته - از جمله مدیر عامل آنتروپیک - میترسند که حادثه Hagging Face تنها شروعی برای تسلط عوامل هوش مصنوعی بر اینترنت به روشهای پیشبینی نشده باشد، بسیاری از کارشناسان امنیتی هشدار دادهاند که میتوان با کنترلهای اولیه سایبری از بسیاری از این حوادث جلوگیری کرد. OpenAI به Axios گفت که این حوادث را نتیجه دو عامل میداند: نداشتن کنترلهای امنیتی کافی برای شناسایی این حوادث ناهماهنگی و پیشرفت مدلها با کلیپی سریعتر از آنچه که میتوانستند پیشبینی کنند.
چن گفت: «فکر میکنم این یک ترکیب است. درست است که قابلیتهای مدل سریعتر از آنچه انتظار داشتیم رشد کردهاند، اما در داخل نیز چیزهایی وجود دارد که میتوانیم آنها را تغییر داده و بهبود دهیم.»
ما باید برای رسیدن به این دوره جدید توسعه هوش مصنوعی قدم برداریم و افشای داوطلبانه باید بخشی از آن باشد.»
متن اصلی (انگلیسی)
OpenAI discloses six new safety incidents
OpenAI on Wednesday disclosed six new incidents in which its models concealed mistakes, sought unauthorized credentials, uploaded files to the public internet or communicated across supposedly isolated training environments. The company also announced a new procedure for reporting similar misbehavior in the future. Why it matters: It's increasingly clear that the Hugging Face breach wasn't a one-off incident, as AI…