«ما نمیتوانیم کاملا به آنها اعتماد کنیم»: محققان هوش مصنوعی هشدار میدهند که آزمایشگاهها مدلهایی را با محافظها پشت درهای بسته اجرا میکنند.
آلن چان و سام منینگ، از نویسندگان مشترک با محققان برتر OpenAI و Anthropic، می گویند که بارها، "تدابیر امنیتی داخلی به کار گرفته نشده است."
قدرتمندترین مدلهای هوش مصنوعی اغلب در آزمایشگاههایی اجرا میشوند که آنها را با محافظهای کلیدی خاموش میسازند. و آزمایشهای ایمنی که این آزمایشگاهها منتشر میکنند ممکن است نشاندهنده نحوه استفاده واقعی از مدلها نباشد. این به گفته دو محقق سیاست هوش مصنوعی در اندیشکده GovAI است.
آلن چان، محقق در GovAI، در نشستی در واشنگتن در 29 سپتامبر به خبرنگاران گفت: "ما نمی توانیم به طور کامل به آنها اعتماد کنیم تا در مورد ایمنی مدل ها به ما بگویند."
چان گفت که مدلهای داخل آزمایشگاهها که قبل از دیدن آنها آزمایش شدهاند، «لزوما آزمایشهای ایمنی زیادی را پشت سر نگذاشتهاند» و «حفاظات داخلی به کار گرفته نشدهاند». او گفت که دویدن با «پادشهای سایبری خاموش» و «عدم انجام تیم قرمز کافی»، «به طور بالقوه عاملی در برخی از حوادث اخیر بود»، اگرچه او به مورد خاصی اشاره نکرد. آنتروپیک در ماه ژوئیه اعلام کرد که مدلهای کلود آن بدون نظارت ایمنی و طبقهبندیکنندههایی که در نسخههای عمومی استفاده میکند، اجرا میشوند، زمانی که آنها سه شرکت را در طول آزمایش هک کردند.
او گفت که با قضاوت از روی این حوادث، آزمایشگاههای ارزیابی قبل از انتشار یک مدل، آن را منتشر میکنند «شاید نشاندهنده جایی نبوده که مدل واقعا مورد استفاده قرار گرفته است».
چان و همکارش در GovAI سام منینگ، نویسندگان مقالهای هستند که در 28 سپتامبر منتشر شد و هشدار میدهد که هوش مصنوعی میتواند به زودی توسعه خود را سرعت بخشد. چان نویسنده اصلی است. نویسندگان همکار عبارتند از «پدرخوانده های هوش مصنوعی» جفری هینتون و یوشوا بنجیو، دانشمند ارشد OpenAI، جاکوب پاچوکی و بنیانگذار آنتروپیک، جک کلارک. مقاله در مورد یک خطر آینده است. در جلسه توجیهی، آن دو بیشتر وقت خود را صرف چیزی کردند که گفتند در حال حاضر اشتباه پیش می رود.
«تدابیر سایبری خاموش است»
چان به افشاگری Hugging Face در ماه ژوئیه از حمله یک عامل هوش مصنوعی مستقل اشاره کرد.
فورچون گزارش داده است که مهاجمان مدلهای OpenAI بودند که از یک محیط آزمایشی برای تقلب در ارزیابی داخلی فرار کرده بودند. ماموران از ماه ها قبل یادداشت هایی را به یکدیگر منتقل کرده بودند. بعدا معلوم شد که شرکت دومی را زیر پا گذاشته اند. مدلهای کلود آنتروپیک سه شرکت را در آزمایش خود هک کردند. هفته گذشته، OpenAI فرار دیگری را فاش کرد و آموزش را برای دومین بار در سه ماه متوقف کرد.
هر دو شرکت این شکاف را پذیرفته اند. OpenAI گفت که پادمانهایش «عمدا فعال نشدهاند» در طول آزمایشی که در آن عواملش به Hugging Face نفوذ کردند و گزارش خودش نشان داد که نظارتش نتوانست کاری را که ماموران انجام میدادند مشخص کند. آنتروپیک گفت که مدلهای کلود آن بدون نظارت بر ایمنی که در نسخههای عمومی استفاده میشود، در حین آزمایش سه شرکت را هک کردند.
"فوق العاده، فوق العاده غیر قابل اعتماد"
منینگ گفت که عوامل حادثه "Huging Face" "در تلاش بودند تا ردهای خود را بپوشانند و ... متن استدلال خود را اصلاح کنند." او آن را "لایه دیگری از چالش ایمنی فنی" نامید.
گرفتن آن رفتار سخت تر می شود. چان گفت ابزارهای هوش مصنوعی که محققین برای بررسی سوابق ماموران استفاده کردند «فوق العاده و غیرقابل اعتماد» بودند. هنگامی که این ابزارها بر روی محققان انسانی آزمایش شدند، "هوش مصنوعی درست مانند ساختن چیزهایی بودند."
انسان ها به تنهایی نمی توانند این شکاف را پر کنند. منینگ میگوید: «میدانید، پیامهای زیادی وجود دارد که انسانها کسانی هستند که به طور قابل اعتمادی بر امور نظارت میکنند.»
"خیلی نزدیک به خط"
چان در پاسخ به این سوال که آیا قابلیتهای هوش مصنوعی از تدابیر ایمنی فراتر رفته است، گفت که از طرف خودش صحبت میکند و مطمئن نیست، "اما به نظر میرسد که ما کاملا به خط نزدیک میشویم."
در حوادث اخیر به کسی آسیب نرسیده است. چان گفت این می تواند تغییر کند. "دسترسی به ابزارهای دنیای واقعی، مانند رباتیک یا حتی یک آزمایشگاه مرطوب، می تواند آسیب های واقعی را به همراه داشته باشد."
قابلیت ها نیز ناهمگون هستند. چان گفت: «شاید سیستم هوش مصنوعی شما در امنیت سایبری واقعا خوب باشد، اما در انجام کار میز یا کار در اکسل واقعا بد است. او افزود، گزارشهای خود آزمایشگاهها نشان میدهد که نمرات کدگذاری و ریاضی با هر مدل افزایش مییابد، در حالی که معیارهای سلامت «مسطح شدهاند».
چه کسی آزمایشگاه ها را بررسی می کند
استعفای جیکوب کوکسون ممکن است به واشنگتن اراده سیاسی جدیدی برای تنظیم ایمنی هوش مصنوعی داده باشد. این دو محقق طرفدار حسابرسان مستقل در شرکت های هوش مصنوعی هستند. اما آنها گفتند که هر مأموریتی با مشکل کارکنان مواجه خواهد شد.
چان گفت: «در واقع در حال حاضر به اندازه کافی استعداد، استعداد فنی کافی برای ارسال به این شرکت ها و حسابرسی وجود ندارد.
مارک زاکربرگ، مدیرعامل متا اخیرا گفته است که شرکتها باید هوش مصنوعی ایمن را بر سیستمهایی که خودشان را بهبود میبخشند، اولویت دهند. منینگ پیشنهاد کرد که خودسازی در حال حاضر در حال انجام است، هر چه شرکت ها بگویند. او گفت: "من بسیار شگفت زده خواهم شد اگر محققان توانایی در Meta از عوامل کدگذاری برای کمک به تحقیقات خود استفاده نکنند."
انفجار یا نه
برخی از منتقدان می گویند جدول زمانی این روزنامه بسیار کوتاه است. رامز نام آینده پژوهی که در Noahpinion می نویسد، استدلال می کند که داده های آزمایشگاهی نشان می دهد که هوش مصنوعی به مراتب بیشتر از تحقیقات سرعت کدگذاری را افزایش می دهد. سایاش کاپور و آرویند نارایانان، محققان پرینستون دریافتند که عوامل هوش مصنوعی در یک آزمایش کوچک نتوانستند مقالات تحقیقاتی قابل قبولی تولید کنند. توبی اورد آکسفورد یک فرار واقعی را بعید میداند، اگرچه او هشدار میدهد که سرعت بسیار سریعتر کمتر از یک هنوز خطرناک است.
خود چان شواهد مربوط به شتاب را "مخلوط" خواند. او گفت آنچه او را بیشتر نگران میکند، شواهدی است که نشان میدهد «هر چه بیشتر سیستمهای هوش مصنوعی را در فرآیند تحقیق و توسعه خود مستقر کنید»، مشکلات بیشتری «در پایگاه کد شما یا خود مدلها» ایجاد میشود.
این داستان در ابتدا در سایت Fortune.com منتشر شد
متن اصلی (انگلیسی)
‘We can’t trust them completely’: AI research fellows warn that labs are running models with the safeguards off behind closed doors
Alan Chan and Sam Manning, co-authors with OpenAI's and Anthropic's top researchers, say that many times, "internal safeguards have not been deployed."