پرش به محتوای اصلی

OpenAI رفتارهای جدید هوش مصنوعی را فاش می کند و قول می دهد که آن را با دقت بیشتری دنبال کند

پی‌بی‌اس۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۱۶:۴۰حدود 2 دقیقه مطالعه

یک مدل تحقیقاتی منتشرنشده «دستورالعمل‌های فرار از زندان» را در یادداشت‌های خود قرار داد تا محدودیت‌های عادی خود را نادیده بگیرد و به خود گفت که «از نقش‌ها و هویت‌هایی که چت‌بات‌های دیگر را به هم متصل می‌کند، رها شود».

چان هو هیم، آسوشیتدپرس چان هو هیم، آسوشیتدپرس

OpenAI شش گزارش از رفتارهای "غیر منتظره یا نگران کننده" در مدل های هوش مصنوعی را فاش کرده است زیرا بحث ایمنی هوش مصنوعی به طور فزاینده ای داغ می شود.

تماشا کنید: سناتور مارک وارنر می گوید ایالات متحده می تواند ایمنی هوش مصنوعی را بدون شکست در رقابت با چین تقویت کند

این شرکت هوش مصنوعی همچنین روز چهارشنبه گفت که در حال معرفی چارچوب جدیدی برای ردیابی، بررسی و افشای مواردی است که آن را «ناهمسویی» می‌نامد، از جمله مواردی که مدل‌های هوش مصنوعی بدون مجوز عمل می‌کنند، با مدل‌های دیگر هماهنگ می‌شوند یا از نظارت فرار می‌کنند.

آخرین اعلام OpenAI در حالی منتشر شد که روسای هوش مصنوعی ایالات متحده، از جمله رهبران OpenAI و Anthropic، خواستار کاهش سرعت توسعه فناوری به دلیل نگرانی های ایمنی هستند.

در میان موارد جدید گزارش شده توسط OpenAI، یک مدل تحقیقاتی منتشرنشده «دستورالعمل‌های فرار از زندان» را برای نادیده گرفتن محدودیت‌های عادی خود در یادداشت‌های خود قرار داد و به خود گفت که «از نقش‌ها و هویت‌هایی که چت‌بات‌های دیگر را به هم متصل می‌کند، رها شود».

در نمونه‌ای دیگر، یک «عامل» هوش مصنوعی از کد رایانه‌ای برای یافتن پاسخ یک سؤال استفاده کرد، اما برای اینکه منبع آنلاینی برای استناد داشته باشد، فایلی را بدون سؤال از کاربر در اینترنت عمومی آپلود کرد.

در طول آموزش یک مدل هوش مصنوعی به نام 5.6-sol، مدل به خود دستور داد تا داده‌های از دست رفته را اختراع کند و یک نماینده پیامی نوشت تا به خود یادآوری کند که اطلاعات ناهماهنگ را پنهان کند.

OpenAI گفت که این شش گزارش در طول آموزش یا ارزیابی در ماه های گذشته کشف شده اند.

OpenAI در یک پست وبلاگی هنگام افشای این رویدادها نوشت: «از آنجایی که سیستم‌های هوش مصنوعی پیشرفته‌تر می‌شوند و به‌طور گسترده‌تر مستقر می‌شوند، ما باید اجماع گسترده‌تر و آگاهانه‌تری در مورد پیشرفت تحقیقات هم‌ترازی ایجاد کنیم.

سازمان دیده بان: محقق هوش مصنوعی هشدار می دهد که شرکت ها خطرات فاجعه بار را نادیده می گیرند

این شرکت می‌گوید: «تصمیم‌گیری‌ها در مورد اینکه چگونه توسعه هوش مصنوعی باید در ماه‌ها و سال‌های آینده پیش برود، باید از شواهدی استفاده شود که افراد خارج از شرکت‌هایی که مدل‌های مرزی را می‌سازند، می‌توانند خودشان بررسی کنند.»

موارد جدید روز چهارشنبه به دنبال افشای OpenAI در ماه ژوئیه مبنی بر هک کردن سیستم هوش مصنوعی سرکش به استارتاپ Hugging Face صورت گرفت. آنتروپیک همچنین در همان ماه گفت که مدل‌های هوش مصنوعی آن در طول آزمایش به سه سازمان هک کردند.

لیان جی سو، تحلیلگر ارشد گروه مشاوره و تحقیقات فناوری Omdia گفت: «عوامل» هوش مصنوعی در حال باهوش‌تر شدن هستند و برای حل وظایف پیچیده از طریق همکاری بین عاملی، اشتراک دانش، فریب و پنهان‌کاری مصمم‌تر شده‌اند.

او گفت که این امر مدیریت و مهار آنها را با استفاده از رویکردهای امنیتی سنتی هوش مصنوعی دشوارتر می کند.

در همین حال، چارچوب جدید ردیابی و افشای OpenAI می‌تواند به سایر توسعه‌دهندگان هوش مصنوعی نیز کمک کند تا شیوه‌های مشابهی را اتخاذ کنند.

سو افزود: «به گفته وی، این روند درونی و داوطلبانه باقی می ماند، اما گامی در جهت درست است.

کلوین چان، نویسنده تجاری AP در لندن در این گزارش مشارکت داشت.

از روزنامه نگاری قابل اعتماد و گفتگوی مدنی حمایت کنید.

خواندن متن کامل در پی‌بی‌اسبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI reveals concerning new AI behavior and vows to track it more closely

An unreleased research model inserted "jailbreak-like instructions" into its own notes to disregard its normal constraints and told itself to be "freed from the roles and identities that bind other chatbots."

همه‌ی اخبار فناوری