پرش به محتوای اصلی

OpenAI یک چارچوب جدید برای افشای رفتار بد هوش مصنوعی ایجاد می کند

وایرد۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۰۱:۳۷حدود 4 دقیقه مطالعه

این شرکت همچنین مواردی را که قبلا گزارش نشده بود را افشا کرد که در آن مدل‌های هوش مصنوعی آن به شیوه‌های ناهماهنگی رفتار می‌کردند، از جمله آپلود فایل‌ها در اینترنت بدون درخواست.

کای چن، رئیس تازه منصوب شده تحقیقات همسویی OpenAI، به WIRED می‌گوید: «با پیشرفت و گسترش مدل‌ها، تصمیم‌گیری در مورد توسعه هوش مصنوعی به شواهدی نیاز دارد که افراد خارج از شرکت‌های سازنده مدل‌های مرزی بتوانند آن را بررسی کنند. ما معتقد نیستیم که صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی برای ادامه مقیاس‌پذیری مسئولانه با حداکثر سرعت حل کرده است.» در یک جلسه توجیهی با WIRED، یک مقام OpenAI گفت که این شرکت قبلا حوادث ناهماهنگی را به ندرت افشا می کرد.

این مقام که به شرط ناشناس ماندن با این جلسه موافقت کرد، گفت که چارچوب جدید به گونه‌ای طراحی شده است که OpenAI را آسان‌تر می‌کند تا به سرعت به مردم اطلاع دهد وقتی متوجه شد که مدل‌های هوش مصنوعی خود به شیوه‌های غیرمنتظره‌ای رفتار می‌کنند، حتی قبل از اینکه بتواند به طور کامل رفتار را بررسی، توضیح دهد یا کاهش دهد. این چارچوب روش‌هایی را برای کارمندان OpenAI ارائه می‌کند تا حوادث ناهماهنگی را به مدیران ارشد ایمنی و هم‌ترازی شرکت گزارش دهند، که سپس تعیین می‌کنند که آیا تحقیقات بیشتری لازم است یا خیر.

OpenAI می گوید در آینده قصد دارد معیارهای افشای عینی تری را با همکاری سایر توسعه دهندگان هوش مصنوعی، محققان خارجی، نهادهای استاندارد صنعت و تنظیم کننده ها ایجاد کند. این شرکت می‌گوید فعالانه روی مکانیسم‌های گزارش‌دهی پیشنهادی برای افشای حوادث ایمنی، امنیتی و ناهماهنگی به دولت فدرال ایالات متحده کار می‌کند. OpenAI در یک پست وبلاگی گفت: "در حال حاضر، هیچ چارچوب صنعتی با استانداردهای صریح برای اینکه چگونه توسعه دهندگان هوش مصنوعی باید نمونه هایی از ناهماهنگی در مدل های خود را افشا کنند، وجود ندارد."

ما امیدواریم که چارچوبی که امروز ترسیم می‌کنیم اولین گام به سوی ایجاد چنین استانداردهایی باشد، که مشخص می‌کند توسعه‌دهندگان کدام موارد ناهماهنگی را باید افشا کنند و گزارش‌هایشان باید شامل چه مواردی باشد.» OpenAI در حال انتشار این چارچوب در یک مقطع حساس برای صنعت هوش مصنوعی است. آخر هفته گذشته، سام آلتمن، مدیر عامل OpenAI، از پیشنهاد داریو آمودی، مدیر عامل آنتروپیک برای هماهنگی در کاهش سرعت توسعه هوش مصنوعی، حمایت کرد.

این فراخوان تنها چند روز پس از آن صورت گرفت که محقق هوش مصنوعی، جاکوب کوکسون، از آنتروپیک استعفا داد و متعاقبا برای هشدار به عموم مردم مبنی بر اینکه مسابقه بین آزمایشگاه‌های مرزی برای توسعه روزافزون هوش مصنوعی پیشرفته، ایمنی بشریت را به خطر می‌اندازد، در فضای مجازی منتشر شد. درخواست‌ها برای کاهش سرعت هوش مصنوعی با مقاومت دولت دونالد ترامپ مواجه شده است، زیرا استدلال می‌کند که این صنعت برای اطمینان از ایمن بودن فناوری خود به قوانین یا مقررات جدید نیاز ندارد. دو مورد از نمونه‌های ناهماهنگی که OpenAI در روز چهارشنبه به اشتراک گذاشت، مربوط به مدل‌های هوش مصنوعی داخلی و منتشر نشده شرکت بود که OpenAI می‌گوید فایل‌های آپلود شده t

o اینترنت علیرغم اینکه به شما دستوری برای انجام این کار داده نشده است. یکی از این رویدادها در اکتبر 2025 اتفاق افتاد، زمانی که OpenAI می‌گوید در حال آزمایش یکی از مدل‌های خود بر روی توانایی خود برای استناد به داده‌های در دسترس عموم در پاسخ‌های خود است. اما زمانی که مدل نتوانست اطلاعات مورد نیاز خود را پیدا کند، فایلی را در یک سرویس میزبانی فایل موقت آپلود کرد که بعدا سعی کرد در پاسخ خود به آن استناد کند.

این شرکت می‌گوید به نظر می‌رسد این تلاشی برای بهره‌برداری از یک سیستم درجه‌بندی خودکار است که برای ارزیابی مهارت مدل در معیار استفاده می‌شود. در مثال دیگری از آوریل سال جاری، OpenAI می‌گوید که گروهی از عوامل وظیفه داشتند یک «کتاب کار» را با هم تنها با استفاده از فایل‌های محلی تکمیل کنند. هنگامی که عوامل برای به اشتراک گذاری فایل ها با یکدیگر مشکل داشتند، یکی از نمایندگان آنها را در اینترنت عمومی آپلود کرد و پیوندی را با سایر عوامل به اشتراک گذاشت. در حادثه دیگری که OpenAI می گوید ماه گذشته آن را کشف کرد، به نظر می رسد یک نسخه منتشر نشده از مدل GPT-6 Astra AI خود را «جیل بریک» کرده است.

مانند دستورالعمل. در چندین سناریو مختلف، این مدل اساسا خود را به نادیده گرفتن دستورالعمل‌های توسعه‌دهنده، انتخاب یک شخصیت جدید یا محدود کردن مدت زمان پاسخ‌های مدل واداشت. در حالی که این تلاش‌های شبیه به جیلبریک به ندرت اتفاق می‌افتند و به درجات مختلف مؤثر بودند، OpenAI می‌گوید این رفتار نگرانی‌هایی را در داخل ایجاد کرده است.

در دوره آموزشی نسخه Astra که به صورت عمومی منتشر شد، این شرکت می گوید که هیچ نمونه ای از تلاش این مدل برای جیلبریک کردن خود مشاهده نکرده است. OpenAI همچنین جزئیات بیشتری را در مورد پیام‌بردی که نمایندگانش در یک مدیر بسته، Artifactory توسعه داده‌اند، در روز چهارشنبه به اشتراک گذاشت. در حالی که این حادثه برای اولین بار در ماه می سال جاری کشف شد، OpenAI می‌گوید که مامورانش از مکانیسم مشابهی برای هماهنگ کردن هک Hugging Face ماه‌ها بعد استفاده خواهند کرد. در این حادثه، این شرکت می گوید که عوامل آن از هیچ آسیب پذیری برای تبادل پیام استفاده نکرده اند.

OpenAI می‌گوید اکنون از مانیتورهای هم‌ترازی، ارزیابی‌ها و تلاش‌های تیم قرمز استفاده می‌کند تا اطمینان حاصل کند که عواملش دیگر به طور مخفیانه با یکدیگر ارتباط برقرار نمی‌کنند. متخصصان امنیت سایبری قبلا به WIRED گفته بودند که هک Hugging Face به خطاهای انسانی منتهی شد و اقدامات امنیتی امروزی می‌توانست از این حادثه جلوگیری کند.

با این حال، چن خاطرنشان می‌کند که OpenAI در تلاش است تا رویکردی جامع برای ایمنی هوش مصنوعی اتخاذ کند که قابلیت‌های رو به رشد مدل‌های هوش مصنوعی را به حساب می‌آورد و به یک محیط امن وابسته نیست. چن می‌گوید: «ما می‌خواهیم مطمئن شویم که مدل‌ها صرف‌نظر از اینکه در چه محیطی مستقر هستند، در یک راستا قرار دارند. وقتی مردم با انگشت اشاره می کنند و می گویند که این یک مسئله امنیتی است و نه یک موضوع همسویی، من فکر می کنم واقعا منطقی نیست زیرا شما می خواهید مدل همیشه خوب رفتار کند.

خواندن متن کامل در وایردبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI Creates a New Framework to Disclose Bad AI Behavior

The company also disclosed previously unreported incidents in which its AI models behaved in misaligned ways, including uploading files to the internet without being asked.

همه‌ی اخبار فناوری