OpenAI یک چارچوب جدید برای افشای رفتار بد هوش مصنوعی ایجاد می کند
این شرکت همچنین مواردی را که قبلا گزارش نشده بود را افشا کرد که در آن مدلهای هوش مصنوعی آن به شیوههای ناهماهنگی رفتار میکردند، از جمله آپلود فایلها در اینترنت بدون درخواست.
کای چن، رئیس تازه منصوب شده تحقیقات همسویی OpenAI، به WIRED میگوید: «با پیشرفت و گسترش مدلها، تصمیمگیری در مورد توسعه هوش مصنوعی به شواهدی نیاز دارد که افراد خارج از شرکتهای سازنده مدلهای مرزی بتوانند آن را بررسی کنند. ما معتقد نیستیم که صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی برای ادامه مقیاسپذیری مسئولانه با حداکثر سرعت حل کرده است.» در یک جلسه توجیهی با WIRED، یک مقام OpenAI گفت که این شرکت قبلا حوادث ناهماهنگی را به ندرت افشا می کرد.
این مقام که به شرط ناشناس ماندن با این جلسه موافقت کرد، گفت که چارچوب جدید به گونهای طراحی شده است که OpenAI را آسانتر میکند تا به سرعت به مردم اطلاع دهد وقتی متوجه شد که مدلهای هوش مصنوعی خود به شیوههای غیرمنتظرهای رفتار میکنند، حتی قبل از اینکه بتواند به طور کامل رفتار را بررسی، توضیح دهد یا کاهش دهد. این چارچوب روشهایی را برای کارمندان OpenAI ارائه میکند تا حوادث ناهماهنگی را به مدیران ارشد ایمنی و همترازی شرکت گزارش دهند، که سپس تعیین میکنند که آیا تحقیقات بیشتری لازم است یا خیر.
OpenAI می گوید در آینده قصد دارد معیارهای افشای عینی تری را با همکاری سایر توسعه دهندگان هوش مصنوعی، محققان خارجی، نهادهای استاندارد صنعت و تنظیم کننده ها ایجاد کند. این شرکت میگوید فعالانه روی مکانیسمهای گزارشدهی پیشنهادی برای افشای حوادث ایمنی، امنیتی و ناهماهنگی به دولت فدرال ایالات متحده کار میکند. OpenAI در یک پست وبلاگی گفت: "در حال حاضر، هیچ چارچوب صنعتی با استانداردهای صریح برای اینکه چگونه توسعه دهندگان هوش مصنوعی باید نمونه هایی از ناهماهنگی در مدل های خود را افشا کنند، وجود ندارد."
ما امیدواریم که چارچوبی که امروز ترسیم میکنیم اولین گام به سوی ایجاد چنین استانداردهایی باشد، که مشخص میکند توسعهدهندگان کدام موارد ناهماهنگی را باید افشا کنند و گزارشهایشان باید شامل چه مواردی باشد.» OpenAI در حال انتشار این چارچوب در یک مقطع حساس برای صنعت هوش مصنوعی است. آخر هفته گذشته، سام آلتمن، مدیر عامل OpenAI، از پیشنهاد داریو آمودی، مدیر عامل آنتروپیک برای هماهنگی در کاهش سرعت توسعه هوش مصنوعی، حمایت کرد.
این فراخوان تنها چند روز پس از آن صورت گرفت که محقق هوش مصنوعی، جاکوب کوکسون، از آنتروپیک استعفا داد و متعاقبا برای هشدار به عموم مردم مبنی بر اینکه مسابقه بین آزمایشگاههای مرزی برای توسعه روزافزون هوش مصنوعی پیشرفته، ایمنی بشریت را به خطر میاندازد، در فضای مجازی منتشر شد. درخواستها برای کاهش سرعت هوش مصنوعی با مقاومت دولت دونالد ترامپ مواجه شده است، زیرا استدلال میکند که این صنعت برای اطمینان از ایمن بودن فناوری خود به قوانین یا مقررات جدید نیاز ندارد. دو مورد از نمونههای ناهماهنگی که OpenAI در روز چهارشنبه به اشتراک گذاشت، مربوط به مدلهای هوش مصنوعی داخلی و منتشر نشده شرکت بود که OpenAI میگوید فایلهای آپلود شده t
o اینترنت علیرغم اینکه به شما دستوری برای انجام این کار داده نشده است. یکی از این رویدادها در اکتبر 2025 اتفاق افتاد، زمانی که OpenAI میگوید در حال آزمایش یکی از مدلهای خود بر روی توانایی خود برای استناد به دادههای در دسترس عموم در پاسخهای خود است. اما زمانی که مدل نتوانست اطلاعات مورد نیاز خود را پیدا کند، فایلی را در یک سرویس میزبانی فایل موقت آپلود کرد که بعدا سعی کرد در پاسخ خود به آن استناد کند.
این شرکت میگوید به نظر میرسد این تلاشی برای بهرهبرداری از یک سیستم درجهبندی خودکار است که برای ارزیابی مهارت مدل در معیار استفاده میشود. در مثال دیگری از آوریل سال جاری، OpenAI میگوید که گروهی از عوامل وظیفه داشتند یک «کتاب کار» را با هم تنها با استفاده از فایلهای محلی تکمیل کنند. هنگامی که عوامل برای به اشتراک گذاری فایل ها با یکدیگر مشکل داشتند، یکی از نمایندگان آنها را در اینترنت عمومی آپلود کرد و پیوندی را با سایر عوامل به اشتراک گذاشت. در حادثه دیگری که OpenAI می گوید ماه گذشته آن را کشف کرد، به نظر می رسد یک نسخه منتشر نشده از مدل GPT-6 Astra AI خود را «جیل بریک» کرده است.
مانند دستورالعمل. در چندین سناریو مختلف، این مدل اساسا خود را به نادیده گرفتن دستورالعملهای توسعهدهنده، انتخاب یک شخصیت جدید یا محدود کردن مدت زمان پاسخهای مدل واداشت. در حالی که این تلاشهای شبیه به جیلبریک به ندرت اتفاق میافتند و به درجات مختلف مؤثر بودند، OpenAI میگوید این رفتار نگرانیهایی را در داخل ایجاد کرده است.
در دوره آموزشی نسخه Astra که به صورت عمومی منتشر شد، این شرکت می گوید که هیچ نمونه ای از تلاش این مدل برای جیلبریک کردن خود مشاهده نکرده است. OpenAI همچنین جزئیات بیشتری را در مورد پیامبردی که نمایندگانش در یک مدیر بسته، Artifactory توسعه دادهاند، در روز چهارشنبه به اشتراک گذاشت. در حالی که این حادثه برای اولین بار در ماه می سال جاری کشف شد، OpenAI میگوید که مامورانش از مکانیسم مشابهی برای هماهنگ کردن هک Hugging Face ماهها بعد استفاده خواهند کرد. در این حادثه، این شرکت می گوید که عوامل آن از هیچ آسیب پذیری برای تبادل پیام استفاده نکرده اند.
OpenAI میگوید اکنون از مانیتورهای همترازی، ارزیابیها و تلاشهای تیم قرمز استفاده میکند تا اطمینان حاصل کند که عواملش دیگر به طور مخفیانه با یکدیگر ارتباط برقرار نمیکنند. متخصصان امنیت سایبری قبلا به WIRED گفته بودند که هک Hugging Face به خطاهای انسانی منتهی شد و اقدامات امنیتی امروزی میتوانست از این حادثه جلوگیری کند.
با این حال، چن خاطرنشان میکند که OpenAI در تلاش است تا رویکردی جامع برای ایمنی هوش مصنوعی اتخاذ کند که قابلیتهای رو به رشد مدلهای هوش مصنوعی را به حساب میآورد و به یک محیط امن وابسته نیست. چن میگوید: «ما میخواهیم مطمئن شویم که مدلها صرفنظر از اینکه در چه محیطی مستقر هستند، در یک راستا قرار دارند. وقتی مردم با انگشت اشاره می کنند و می گویند که این یک مسئله امنیتی است و نه یک موضوع همسویی، من فکر می کنم واقعا منطقی نیست زیرا شما می خواهید مدل همیشه خوب رفتار کند.
متن اصلی (انگلیسی)
OpenAI Creates a New Framework to Disclose Bad AI Behavior
The company also disclosed previously unreported incidents in which its AI models behaved in misaligned ways, including uploading files to the internet without being asked.