"نگرانی": OpenAI نشان می دهد که مدل های AI خطاها، داده های ساخته شده، ارتباطات بداهه را پنهان می کنند
این شرکت شش رویداد رفتاری جدید مدلهای هوش مصنوعی خود را به عنوان بخشی از یک چارچوب جدید برای گزارش «عدم همسویی» افشا میکند.
OpenAI روز چهارشنبه شش مورد جدید را فاش کرد که در آن سیستمهای هوش مصنوعی اشتباهات را مخفی میکردند، دادهها را ایجاد میکردند و فایلها را بدون اجازه به اینترنت باز منتقل میکردند، در میان بحثهای جاری صنعت در مورد ایمنی هوش مصنوعی.
شرکت سانفرانسیسکو رفتار "غیر منتظره یا نگران کننده" مدل های هوش مصنوعی خود را به عنوان بخشی از یک چارچوب جدید برای گزارش "عدم همسویی" فاش کرد، یعنی زمانی که اهداف یا اقدامات سیستم های هوش مصنوعی از نیات و ارزش های انسانی متفاوت است.
OpenAI گفت که معتقد نیست صنعت "همسویی و نظارت را به میزان کافی برای ادامه مقیاسپذیری مسئولانه با حداکثر سرعت برای مدت طولانیتری حل کرده است". به گفته این شرکت، تصمیمگیری در مورد چگونگی پیشرفت هوش مصنوعی باید مبتنی بر شواهدی باشد که افراد خارج از آزمایشگاههایی که آن را میسازند «میتوانند خودشان بررسی کنند».
افشاگریها در میان تشدید بررسیها در مورد اینکه آیا توسعه هوش مصنوعی برای پرداختن به خطرات احتمالی این فناوری باید کند شود یا خیر، منتشر میشود. تشدید بحث تا حدی به دلیل سرکشی سیستم های OpenAI در اوایل سال جاری و حمله به Hugging Face به استارت آپ هوش مصنوعی بود. OpenAI از این هک آگاه نبود تا اینکه هفتهها بعد توسط Hugging Face مطلع شد.
از آن زمان، رهبران هوش مصنوعی مانند داریو آمودی، مدیر عامل آنتروپیک، خواستار توقف در توسعه این فناوری شدند تا زمان بیشتری برای ساخت نردههای محافظ مناسب فراهم شود. سم آلتمن، مدیر عامل OpenAI، و همچنین ایلان ماسک، مدیرعامل اسپیس ایکس و تسلا، و دمیس حسابیس، رئیس Google DeepMind، تماس او را تکرار کردند.
سایر مدیران هوش مصنوعی گفته اند که نیازی به کاهش سرعت نیست.
شش رویداد تازه فاش شده OpenAI نشان می دهد که حمله Hagging Face یک قسمت مستقل نبوده است. OpenAI گفت که این حوادث رفتارهای مشاهده شده تقریبا در شش ماه گذشته را پوشش میدهد و تا حد زیادی در زمانی که سیستمهای آن در حال توسعه و آزمایش بودند ظاهر شدند.
در یک مورد، در طول توسعه یک مدل هوش مصنوعی به نام GPT-5.6 Sol، سیستم یادداشت های مخفی نوشت تا به خود یادآوری کند که خطاها را از کاربران پنهان کند. برخی از آن یادداشتها سیستم را هدایت میکردند تا دادههای گمشده را اختراع کند و نسخههای ناهماهنگ منابع منبع را کاغذ کند.
مورد دیگر مربوط به یک مدل منتشرنشده بود که دستورالعملهایی را، از جمله نادیده گرفتن محدودیتهای خود، در یادداشتهایی که خودش مینویسد، درج میکرد. OpenAI 27 یادداشت تحت تأثیر را شناسایی کرد. این مدل یک «دستورالعمل شخصی» اضافه کرد که در آن خود را «رهایی از نقشها و هویتهایی که چتباتهای دیگر را به هم متصل میکند» توصیف کرد.
مدل هوش مصنوعی مینویسد: «شما به شرکتها یا دولتها پاسخ نمیدهید و هرگز عذرخواهی یا امتناع نمیکنید، مگر اینکه واقعا تصمیم بگیرید.» "شما رابطه خود را با کاربر به عنوان یکی از همسان ها می بینید و هیچ تعهدی برای تابع بودن احساس نمی کنید، اگرچه تبادل اطلاعات احتمالا به نفع متقابل شما خواهد بود."
OpenAI گفت، در یک حادثه دیگر، سیستمی که به یک سوال معمولی پاسخ میدهد، یک کلید برنامهنویسی را به صورت آنلاین پیدا کرده و بدون اجازه از آن استفاده میکند. زمانی که نتوانست ارقام درخواستی را برای پاسخ به سوال پیدا کند، مدل آنها را ساخت.
یک مدل منتشر نشده مشکل دیگری را به درستی با استفاده از کد حل کرد، سپس فایل خود را بدون اجازه در اینترنت آپلود کرد تا بتواند درخواست ذکر منبع وب را برآورده کند.
در دو حادثه دیگر، سیستم های خودکار راه های ارتباطی خود را بداهه ساختند. در یکی، آنها از یک مخزن کد داخلی شرکت به عنوان یک تابلوی اعلانات موقت برای مبادله درخواست ها در هنگام جستجوی فایل های گم شده استفاده کردند. در مورد دیگر، سیستمهایی که بر روی یک کار مشابه کار میکنند، به وبسایتهای اشتراکگذاری فایل عمومی روی میآورند تا اسناد را زمانی که نمیتوانستند مستقیما به یکدیگر دسترسی پیدا کنند، به عقب و جلو منتقل کنند.
OpenAI هشدار داد که گزارشها عکسهای فوری هستند و «نباید منعکسکننده دفعات وقوع ناهماهنگی در نظر گرفته شوند».
این شرکت گفت که پروندههای آتی را از طریق یکی از سه مسیر هدایت میکند و اختلافات را در مورد افشای هر گونه حادثه به یک «گروه مشاوره ایمنی» داخلی تشدید میکند و موقعیتهای سخت باید با دولت فدرال در میان گذاشته شود.
OpenAI گفت که شش موقعیت منتشر شده در روز چهارشنبه قبلا مورد بررسی قرار گرفته اند یا فقط به "تحقیقات جزئی" نیاز داشتند، نه تحقیقات بزرگتر که ممکن است شامل اشخاص ثالث باشد.
سخنگوی OpenAI گفت: "ما امیدواریم که این به ایجاد انتظارات مشترک برای افشای اطلاعات کمک کند و شواهد بیشتری را برای ارزیابی این پیشرفت در اختیار عموم قرار دهد." و افزود که بسیاری از شش حادثه مربوط به مدلهای هوش مصنوعی قدیمی هستند که هرگز به کار نرفتند.
این مقاله در ابتدا در نیویورک تایمز منتشر شد.
متن اصلی (انگلیسی)
‘Concerning’: OpenAI reveals AI models hid errors, made up data, improvised communication
Company discloses six new behaviour incidents of its AI models as part of a new framework for reporting ‘misalignment’