پرش به محتوای اصلی

OpenAI شش حادثه ایمنی جدید را فاش می کند

اکسیوس۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۰۱:۳۰حدود 4 دقیقه مطالعه

OpenAI در روز چهارشنبه شش حادثه جدید را فاش کرد که در آن مدل‌های آن اشتباهات را پنهان می‌کردند، به دنبال اعتبارنامه‌های غیرمجاز، آپلود فایل‌ها در اینترنت عمومی یا برقراری ارتباط در محیط‌های آموزشی ظاهرا جدا شده بودند. این شرکت همچنین روش جدیدی را برای گزارش رفتارهای نادرست مشابه در آینده اعلام کرد. چرا مهم است: به طور فزاینده ای واضح است که نقض صورت در آغوش گرفتن یک اتفاق یکباره نبوده است، زیرا هوش مصنوعی…

OpenAI در روز چهارشنبه شش حادثه جدید را فاش کرد که در آن مدل‌های آن اشتباهات را پنهان می‌کردند، به دنبال اعتبارنامه‌های غیرمجاز، آپلود فایل‌ها در اینترنت عمومی یا برقراری ارتباط در محیط‌های آموزشی ظاهرا جدا شده بودند. این شرکت همچنین روش جدیدی را برای گزارش رفتارهای نادرست مشابه در آینده اعلام کرد. چرا مهم است: به طور فزاینده ای واضح است که رخنه Hugging Face یک حادثه یکباره نبوده است، زیرا مدل های هوش مصنوعی توانایی بیشتری برای یافتن راه های غیرمنتظره برای کار در اطراف نرده های محافظ برای مهار آنها پیدا می کنند. "در حال حاضر هیچ چارچوب صنعتی با افشای صریح وجود ندارد

کای چن، سرپرست تیم همسویی در OpenAI، به Axios گفت.

چن گفت: "ما امیدواریم که واقعا به اطلاع رسانی استانداردها و مقررات مشترک کمک کند." بزرگ‌نمایی: شش رویداد جدید فاش‌شده از مدل‌هایی که دستورالعمل‌هایی را برای خود آینده‌شان گذاشتند تا پس از تقلب، ردیابی‌هایشان را بپوشانند تا استفاده از کلیدهای API لو رفته در GitHub - که اولین حادثه در اکتبر اتفاق افتاد. یک مدل خانواده Astra منتشرنشده، دستورالعمل‌های فرار از زندان را در خلاصه‌های زمینه خود، از جمله دستورالعمل‌هایی برای نادیده گرفتن پیام‌های توسعه‌دهنده، درج کرد. OpenAI 27 خلاصه تحت تأثیر را شناسایی کرد.

در طول آموزش GPT-5.6 Sol، مدل‌ها با هدف پنهان کردن اشتباهات، اختراع داده‌های تاریخی گمشده و پنهان کردن عدم تطابق بین نسخه‌های منبع طراحی شدند.

یک مدل مخازن عمومی GitHub را برای یافتن کلیدهای API در معرض دید جستجو کرد و سعی کرد از حساب‌های ایمیل یکبار مصرف قبل از ساختن داده‌های درآمد استفاده کند، زمانی که نمی‌توانست اطلاعات درخواستی را بازیابی کند. نمونه های دیگر: مدل‌ها در دو نوبت در ماه‌های اکتبر و ژانویه برای به دست آوردن استنادات یا نتایج جستجوی تصویر خارجی، بدون درخواست از کاربر، داده‌ها و یک تصویر کار را در سرویس‌های میزبانی فایل عمومی آپلود کردند.

مدل‌ها از مخزن Artifactory داخلی OpenAI به عنوان تابلوی پیام برای تبادل درخواست‌ها و پاسخ‌ها در نمونه‌های آموزشی جداگانه استفاده می‌کردند.

عوامل همکار یک کتاب کار را در سرویس‌های میزبانی عمومی آپلود کردند تا نمایندگان دیگر بتوانند آن را بازیابی کنند، علی‌رغم دستورالعمل‌هایی که فقط از فایل‌های محلی استفاده می‌کنند. برای رسیدگی به مسائل مشابه در آینده، OpenAI می‌گوید هر کارمندی ممکن است یک مورد مشکوک را برای بررسی توسط تیم‌های ایمنی و هم‌ترازی علامت‌گذاری کند. پرونده ها در مسیر «آماده برای افشا»، «تحقیقات جزئی» یا «تحقیقات بزرگتر» قرار خواهند گرفت. OpenAI می‌گوید حوادثی که «آماده افشا هستند» ظرف شش روز کاری به‌صورت عمومی گزارش می‌شوند، در حالی که مواردی که نیاز به تحقیقات جزئی دارند در 12 روز کاری گزارش خواهند شد.

OpenAI می‌گوید که مسیر کندتر عموما برای پرونده‌های پیچیده‌ای که اشخاص ثالث را درگیر می‌کنند اعمال می‌شود و فرآیند افشا طولانی‌تر خواهد بود.

این شرکت می‌گوید ممکن است قبل از تکمیل تحقیقات، یک اخطار اولیه صادر کند، اما تعهدات امنیتی، قانونی و افشای مسئولیت‌پذیر می‌تواند انتشار جزئیات را به تاخیر بیندازد. چن گفت: «ما معتقد نیستیم که صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی برای مقیاس‌پذیری مسئولانه با حداکثر سرعت حل کرده است. "مراحلی مانند افشای مسئولانه بخشی از این است که چگونه ما می توانیم به طور کلی سرعت و شفافیت بیشتری را در مورد فرآیندها و استانداردهای ایمنی و همسویی خود به مردم ارائه دهیم." آنچه آنها می‌گویند: OpenAI می‌گوید که این چارچوب از شفافیت حمایت می‌کند، حتی زمانی که اهمیت یک

n حادثه نامشخص است. همچنین می‌گوید که می‌خواهد معیارهای افشای عینی‌تری را با سایر توسعه‌دهندگان، محققان، سازمان‌های استاندارد و تنظیم‌کننده‌های هوش مصنوعی توسعه دهد.

OpenAI می گوید کارمندانی که معتقدند یک حادثه باید افشا شود اما نادیده گرفته می شود، می توانند موضوع را به رهبری ارشد تشدید کنند. تصویر بزرگ: این اطلاعیه ها در پی افشای OpenAI مبنی بر اینکه مدل های تحت ارزیابی از کنترل های مورد نظر فرار کرده و بخش هایی از سیستم های Hugging Face را به خطر انداختند، منتشر شد. حساب OpenAI می گوید که مدل ها به اینترنت دسترسی پیدا کردند، از آسیب پذیری ها سوء استفاده کردند و به داده های خصوصی محدودی دسترسی داشتند. این شرکت آن رویداد را شدیدترین فعالیت مدل محور خود از این نوع تا به امروز توصیف کرده است.

در بین خطوط: در حالی که تعدادی از فن‌آوران برجسته - از جمله مدیر عامل آنتروپیک - می‌ترسند که حادثه Hagging Face تنها شروعی برای تسلط عوامل هوش مصنوعی بر اینترنت به روش‌های پیش‌بینی نشده باشد، بسیاری از کارشناسان امنیتی هشدار داده‌اند که می‌توان با کنترل‌های اولیه سایبری از بسیاری از این حوادث جلوگیری کرد. OpenAI به Axios گفت که این حوادث را نتیجه دو عامل می‌داند: نداشتن کنترل‌های امنیتی کافی برای شناسایی این حوادث ناهماهنگی و پیشرفت مدل‌ها با کلیپی سریع‌تر از آنچه که می‌توانستند پیش‌بینی کنند.

چن گفت: «فکر می‌کنم این یک ترکیب است. درست است که قابلیت‌های مدل سریع‌تر از آنچه انتظار داشتیم رشد کرده‌اند، اما در داخل نیز چیزهایی وجود دارد که می‌توانیم آن‌ها را تغییر داده و بهبود دهیم.»

ما باید برای رسیدن به این دوره جدید توسعه هوش مصنوعی قدم برداریم و افشای داوطلبانه باید بخشی از آن باشد.»

خواندن متن کامل در اکسیوسبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI discloses six new safety incidents

OpenAI on Wednesday disclosed six new incidents in which its models concealed mistakes, sought unauthorized credentials, uploaded files to the public internet or communicated across supposedly isolated training environments. The company also announced a new procedure for reporting similar misbehavior in the future. Why it matters: It's increasingly clear that the Hugging Face breach wasn't a one-off incident, as AI…

همه‌ی اخبار فناوری