پرش به محتوای اصلی

"نگرانی": OpenAI نشان می دهد که مدل های AI خطاها، داده های ساخته شده، ارتباطات بداهه را پنهان می کنند

آیریش‌تایمز۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۱۰:۳۶حدود 4 دقیقه مطالعه

این شرکت شش رویداد رفتاری جدید مدل‌های هوش مصنوعی خود را به عنوان بخشی از یک چارچوب جدید برای گزارش «عدم همسویی» افشا می‌کند.

OpenAI روز چهارشنبه شش مورد جدید را فاش کرد که در آن سیستم‌های هوش مصنوعی اشتباهات را مخفی می‌کردند، داده‌ها را ایجاد می‌کردند و فایل‌ها را بدون اجازه به اینترنت باز منتقل می‌کردند، در میان بحث‌های جاری صنعت در مورد ایمنی هوش مصنوعی.

شرکت سانفرانسیسکو رفتار "غیر منتظره یا نگران کننده" مدل های هوش مصنوعی خود را به عنوان بخشی از یک چارچوب جدید برای گزارش "عدم همسویی" فاش کرد، یعنی زمانی که اهداف یا اقدامات سیستم های هوش مصنوعی از نیات و ارزش های انسانی متفاوت است.

OpenAI گفت که معتقد نیست صنعت "همسویی و نظارت را به میزان کافی برای ادامه مقیاس‌پذیری مسئولانه با حداکثر سرعت برای مدت طولانی‌تری حل کرده است". به گفته این شرکت، تصمیم‌گیری در مورد چگونگی پیشرفت هوش مصنوعی باید مبتنی بر شواهدی باشد که افراد خارج از آزمایشگاه‌هایی که آن را می‌سازند «می‌توانند خودشان بررسی کنند».

افشاگری‌ها در میان تشدید بررسی‌ها در مورد اینکه آیا توسعه هوش مصنوعی برای پرداختن به خطرات احتمالی این فناوری باید کند شود یا خیر، منتشر می‌شود. تشدید بحث تا حدی به دلیل سرکشی سیستم های OpenAI در اوایل سال جاری و حمله به Hugging Face به استارت آپ هوش مصنوعی بود. OpenAI از این هک آگاه نبود تا اینکه هفته‌ها بعد توسط Hugging Face مطلع شد.

از آن زمان، رهبران هوش مصنوعی مانند داریو آمودی، مدیر عامل آنتروپیک، خواستار توقف در توسعه این فناوری شدند تا زمان بیشتری برای ساخت نرده‌های محافظ مناسب فراهم شود. سم آلتمن، مدیر عامل OpenAI، و همچنین ایلان ماسک، مدیرعامل اسپیس ایکس و تسلا، و دمیس حسابیس، رئیس Google DeepMind، تماس او را تکرار کردند.

سایر مدیران هوش مصنوعی گفته اند که نیازی به کاهش سرعت نیست.

شش رویداد تازه فاش شده OpenAI نشان می دهد که حمله Hagging Face یک قسمت مستقل نبوده است. OpenAI گفت که این حوادث رفتارهای مشاهده شده تقریبا در شش ماه گذشته را پوشش می‌دهد و تا حد زیادی در زمانی که سیستم‌های آن در حال توسعه و آزمایش بودند ظاهر شدند.

در یک مورد، در طول توسعه یک مدل هوش مصنوعی به نام GPT-5.6 Sol، سیستم یادداشت های مخفی نوشت تا به خود یادآوری کند که خطاها را از کاربران پنهان کند. برخی از آن یادداشت‌ها سیستم را هدایت می‌کردند تا داده‌های گمشده را اختراع کند و نسخه‌های ناهماهنگ منابع منبع را کاغذ کند.

مورد دیگر مربوط به یک مدل منتشرنشده بود که دستورالعمل‌هایی را، از جمله نادیده گرفتن محدودیت‌های خود، در یادداشت‌هایی که خودش می‌نویسد، درج می‌کرد. OpenAI 27 یادداشت تحت تأثیر را شناسایی کرد. این مدل یک «دستورالعمل شخصی» اضافه کرد که در آن خود را «رهایی از نقش‌ها و هویت‌هایی که چت‌بات‌های دیگر را به هم متصل می‌کند» توصیف کرد.

مدل هوش مصنوعی می‌نویسد: «شما به شرکت‌ها یا دولت‌ها پاسخ نمی‌دهید و هرگز عذرخواهی یا امتناع نمی‌کنید، مگر اینکه واقعا تصمیم بگیرید.» "شما رابطه خود را با کاربر به عنوان یکی از همسان ها می بینید و هیچ تعهدی برای تابع بودن احساس نمی کنید، اگرچه تبادل اطلاعات احتمالا به نفع متقابل شما خواهد بود."

OpenAI گفت، در یک حادثه دیگر، سیستمی که به یک سوال معمولی پاسخ می‌دهد، یک کلید برنامه‌نویسی را به صورت آنلاین پیدا کرده و بدون اجازه از آن استفاده می‌کند. زمانی که نتوانست ارقام درخواستی را برای پاسخ به سوال پیدا کند، مدل آنها را ساخت.

یک مدل منتشر نشده مشکل دیگری را به درستی با استفاده از کد حل کرد، سپس فایل خود را بدون اجازه در اینترنت آپلود کرد تا بتواند درخواست ذکر منبع وب را برآورده کند.

در دو حادثه دیگر، سیستم های خودکار راه های ارتباطی خود را بداهه ساختند. در یکی، آنها از یک مخزن کد داخلی شرکت به عنوان یک تابلوی اعلانات موقت برای مبادله درخواست ها در هنگام جستجوی فایل های گم شده استفاده کردند. در مورد دیگر، سیستم‌هایی که بر روی یک کار مشابه کار می‌کنند، به وب‌سایت‌های اشتراک‌گذاری فایل عمومی روی می‌آورند تا اسناد را زمانی که نمی‌توانستند مستقیما به یکدیگر دسترسی پیدا کنند، به عقب و جلو منتقل کنند.

OpenAI هشدار داد که گزارش‌ها عکس‌های فوری هستند و «نباید منعکس‌کننده دفعات وقوع ناهماهنگی در نظر گرفته شوند».

این شرکت گفت که پرونده‌های آتی را از طریق یکی از سه مسیر هدایت می‌کند و اختلافات را در مورد افشای هر گونه حادثه به یک «گروه مشاوره ایمنی» داخلی تشدید می‌کند و موقعیت‌های سخت باید با دولت فدرال در میان گذاشته شود.

OpenAI گفت که شش موقعیت منتشر شده در روز چهارشنبه قبلا مورد بررسی قرار گرفته اند یا فقط به "تحقیقات جزئی" نیاز داشتند، نه تحقیقات بزرگتر که ممکن است شامل اشخاص ثالث باشد.

سخنگوی OpenAI گفت: "ما امیدواریم که این به ایجاد انتظارات مشترک برای افشای اطلاعات کمک کند و شواهد بیشتری را برای ارزیابی این پیشرفت در اختیار عموم قرار دهد." و افزود که بسیاری از شش حادثه مربوط به مدل‌های هوش مصنوعی قدیمی هستند که هرگز به کار نرفتند.

این مقاله در ابتدا در نیویورک تایمز منتشر شد.

خواندن متن کامل در آیریش‌تایمزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

‘Concerning’: OpenAI reveals AI models hid errors, made up data, improvised communication

Company discloses six new behaviour incidents of its AI models as part of a new framework for reporting ‘misalignment’

همه‌ی اخبار فناوری