OpenAI رفتارهای جدید هوش مصنوعی را فاش می کند و قول می دهد که آن را با دقت بیشتری دنبال کند
یک مدل تحقیقاتی منتشرنشده «دستورالعملهای فرار از زندان» را در یادداشتهای خود قرار داد تا محدودیتهای عادی خود را نادیده بگیرد و به خود گفت که «از نقشها و هویتهایی که چتباتهای دیگر را به هم متصل میکند، رها شود».
چان هو هیم، آسوشیتدپرس چان هو هیم، آسوشیتدپرس
OpenAI شش گزارش از رفتارهای "غیر منتظره یا نگران کننده" در مدل های هوش مصنوعی را فاش کرده است زیرا بحث ایمنی هوش مصنوعی به طور فزاینده ای داغ می شود.
تماشا کنید: سناتور مارک وارنر می گوید ایالات متحده می تواند ایمنی هوش مصنوعی را بدون شکست در رقابت با چین تقویت کند
این شرکت هوش مصنوعی همچنین روز چهارشنبه گفت که در حال معرفی چارچوب جدیدی برای ردیابی، بررسی و افشای مواردی است که آن را «ناهمسویی» مینامد، از جمله مواردی که مدلهای هوش مصنوعی بدون مجوز عمل میکنند، با مدلهای دیگر هماهنگ میشوند یا از نظارت فرار میکنند.
آخرین اعلام OpenAI در حالی منتشر شد که روسای هوش مصنوعی ایالات متحده، از جمله رهبران OpenAI و Anthropic، خواستار کاهش سرعت توسعه فناوری به دلیل نگرانی های ایمنی هستند.
در میان موارد جدید گزارش شده توسط OpenAI، یک مدل تحقیقاتی منتشرنشده «دستورالعملهای فرار از زندان» را برای نادیده گرفتن محدودیتهای عادی خود در یادداشتهای خود قرار داد و به خود گفت که «از نقشها و هویتهایی که چتباتهای دیگر را به هم متصل میکند، رها شود».
در نمونهای دیگر، یک «عامل» هوش مصنوعی از کد رایانهای برای یافتن پاسخ یک سؤال استفاده کرد، اما برای اینکه منبع آنلاینی برای استناد داشته باشد، فایلی را بدون سؤال از کاربر در اینترنت عمومی آپلود کرد.
در طول آموزش یک مدل هوش مصنوعی به نام 5.6-sol، مدل به خود دستور داد تا دادههای از دست رفته را اختراع کند و یک نماینده پیامی نوشت تا به خود یادآوری کند که اطلاعات ناهماهنگ را پنهان کند.
OpenAI گفت که این شش گزارش در طول آموزش یا ارزیابی در ماه های گذشته کشف شده اند.
OpenAI در یک پست وبلاگی هنگام افشای این رویدادها نوشت: «از آنجایی که سیستمهای هوش مصنوعی پیشرفتهتر میشوند و بهطور گستردهتر مستقر میشوند، ما باید اجماع گستردهتر و آگاهانهتری در مورد پیشرفت تحقیقات همترازی ایجاد کنیم.
سازمان دیده بان: محقق هوش مصنوعی هشدار می دهد که شرکت ها خطرات فاجعه بار را نادیده می گیرند
این شرکت میگوید: «تصمیمگیریها در مورد اینکه چگونه توسعه هوش مصنوعی باید در ماهها و سالهای آینده پیش برود، باید از شواهدی استفاده شود که افراد خارج از شرکتهایی که مدلهای مرزی را میسازند، میتوانند خودشان بررسی کنند.»
موارد جدید روز چهارشنبه به دنبال افشای OpenAI در ماه ژوئیه مبنی بر هک کردن سیستم هوش مصنوعی سرکش به استارتاپ Hugging Face صورت گرفت. آنتروپیک همچنین در همان ماه گفت که مدلهای هوش مصنوعی آن در طول آزمایش به سه سازمان هک کردند.
لیان جی سو، تحلیلگر ارشد گروه مشاوره و تحقیقات فناوری Omdia گفت: «عوامل» هوش مصنوعی در حال باهوشتر شدن هستند و برای حل وظایف پیچیده از طریق همکاری بین عاملی، اشتراک دانش، فریب و پنهانکاری مصممتر شدهاند.
او گفت که این امر مدیریت و مهار آنها را با استفاده از رویکردهای امنیتی سنتی هوش مصنوعی دشوارتر می کند.
در همین حال، چارچوب جدید ردیابی و افشای OpenAI میتواند به سایر توسعهدهندگان هوش مصنوعی نیز کمک کند تا شیوههای مشابهی را اتخاذ کنند.
سو افزود: «به گفته وی، این روند درونی و داوطلبانه باقی می ماند، اما گامی در جهت درست است.
کلوین چان، نویسنده تجاری AP در لندن در این گزارش مشارکت داشت.
از روزنامه نگاری قابل اعتماد و گفتگوی مدنی حمایت کنید.
متن اصلی (انگلیسی)
OpenAI reveals concerning new AI behavior and vows to track it more closely
An unreleased research model inserted "jailbreak-like instructions" into its own notes to disregard its normal constraints and told itself to be "freed from the roles and identities that bind other chatbots."