پرش به محتوای اصلی

«ما نمی‌توانیم کاملا به آنها اعتماد کنیم»: محققان هوش مصنوعی هشدار می‌دهند که آزمایشگاه‌ها مدل‌هایی را با محافظ‌ها پشت درهای بسته اجرا می‌کنند.

فورچون۱۴۰۵ مهر ۱۱, شنبه، ساعت ۰۱:۳۵حدود 5 دقیقه مطالعه

آلن چان و سام منینگ، از نویسندگان مشترک با محققان برتر OpenAI و Anthropic، می گویند که بارها، "تدابیر امنیتی داخلی به کار گرفته نشده است."

قدرتمندترین مدل‌های هوش مصنوعی اغلب در آزمایشگاه‌هایی اجرا می‌شوند که آنها را با محافظ‌های کلیدی خاموش می‌سازند. و آزمایش‌های ایمنی که این آزمایشگاه‌ها منتشر می‌کنند ممکن است نشان‌دهنده نحوه استفاده واقعی از مدل‌ها نباشد. این به گفته دو محقق سیاست هوش مصنوعی در اندیشکده GovAI است.

آلن چان، محقق در GovAI، در نشستی در واشنگتن در 29 سپتامبر به خبرنگاران گفت: "ما نمی توانیم به طور کامل به آنها اعتماد کنیم تا در مورد ایمنی مدل ها به ما بگویند."

چان گفت که مدل‌های داخل آزمایشگاه‌ها که قبل از دیدن آن‌ها آزمایش شده‌اند، «لزوما آزمایش‌های ایمنی زیادی را پشت سر نگذاشته‌اند» و «حفاظات داخلی به کار گرفته نشده‌اند». او گفت که دویدن با «پادش‌های سایبری خاموش» و «عدم انجام تیم قرمز کافی»، «به طور بالقوه عاملی در برخی از حوادث اخیر بود»، اگرچه او به مورد خاصی اشاره نکرد. آنتروپیک در ماه ژوئیه اعلام کرد که مدل‌های کلود آن بدون نظارت ایمنی و طبقه‌بندی‌کننده‌هایی که در نسخه‌های عمومی استفاده می‌کند، اجرا می‌شوند، زمانی که آنها سه شرکت را در طول آزمایش هک کردند.

او گفت که با قضاوت از روی این حوادث، آزمایشگاه‌های ارزیابی قبل از انتشار یک مدل، آن را منتشر می‌کنند «شاید نشان‌دهنده جایی نبوده که مدل واقعا مورد استفاده قرار گرفته است».

چان و همکارش در GovAI سام منینگ، نویسندگان مقاله‌ای هستند که در 28 سپتامبر منتشر شد و هشدار می‌دهد که هوش مصنوعی می‌تواند به زودی توسعه خود را سرعت بخشد. چان نویسنده اصلی است. نویسندگان همکار عبارتند از «پدرخوانده های هوش مصنوعی» جفری هینتون و یوشوا بنجیو، دانشمند ارشد OpenAI، جاکوب پاچوکی و بنیانگذار آنتروپیک، جک کلارک. مقاله در مورد یک خطر آینده است. در جلسه توجیهی، آن دو بیشتر وقت خود را صرف چیزی کردند که گفتند در حال حاضر اشتباه پیش می رود.

«تدابیر سایبری خاموش است»

چان به افشاگری Hugging Face در ماه ژوئیه از حمله یک عامل هوش مصنوعی مستقل اشاره کرد.

فورچون گزارش داده است که مهاجمان مدل‌های OpenAI بودند که از یک محیط آزمایشی برای تقلب در ارزیابی داخلی فرار کرده بودند. ماموران از ماه ها قبل یادداشت هایی را به یکدیگر منتقل کرده بودند. بعدا معلوم شد که شرکت دومی را زیر پا گذاشته اند. مدل‌های کلود آنتروپیک سه شرکت را در آزمایش خود هک کردند. هفته گذشته، OpenAI فرار دیگری را فاش کرد و آموزش را برای دومین بار در سه ماه متوقف کرد.

هر دو شرکت این شکاف را پذیرفته اند. OpenAI گفت که پادمان‌هایش «عمدا فعال نشده‌اند» در طول آزمایشی که در آن عواملش به Hugging Face نفوذ کردند و گزارش خودش نشان داد که نظارتش نتوانست کاری را که ماموران انجام می‌دادند مشخص کند. آنتروپیک گفت که مدل‌های کلود آن بدون نظارت بر ایمنی که در نسخه‌های عمومی استفاده می‌شود، در حین آزمایش سه شرکت را هک کردند.

"فوق العاده، فوق العاده غیر قابل اعتماد"

منینگ گفت که عوامل حادثه "Huging Face" "در تلاش بودند تا ردهای خود را بپوشانند و ... متن استدلال خود را اصلاح کنند." او آن را "لایه دیگری از چالش ایمنی فنی" نامید.

گرفتن آن رفتار سخت تر می شود. چان گفت ابزارهای هوش مصنوعی که محققین برای بررسی سوابق ماموران استفاده کردند «فوق العاده و غیرقابل اعتماد» بودند. هنگامی که این ابزارها بر روی محققان انسانی آزمایش شدند، "هوش مصنوعی درست مانند ساختن چیزهایی بودند."

انسان ها به تنهایی نمی توانند این شکاف را پر کنند. منینگ می‌گوید: «می‌دانید، پیام‌های زیادی وجود دارد که انسان‌ها کسانی هستند که به طور قابل اعتمادی بر امور نظارت می‌کنند.»

"خیلی نزدیک به خط"

چان در پاسخ به این سوال که آیا قابلیت‌های هوش مصنوعی از تدابیر ایمنی فراتر رفته است، گفت که از طرف خودش صحبت می‌کند و مطمئن نیست، "اما به نظر می‌رسد که ما کاملا به خط نزدیک می‌شویم."

در حوادث اخیر به کسی آسیب نرسیده است. چان گفت این می تواند تغییر کند. "دسترسی به ابزارهای دنیای واقعی، مانند رباتیک یا حتی یک آزمایشگاه مرطوب، می تواند آسیب های واقعی را به همراه داشته باشد."

قابلیت ها نیز ناهمگون هستند. چان گفت: «شاید سیستم هوش مصنوعی شما در امنیت سایبری واقعا خوب باشد، اما در انجام کار میز یا کار در اکسل واقعا بد است. او افزود، گزارش‌های خود آزمایشگاه‌ها نشان می‌دهد که نمرات کدگذاری و ریاضی با هر مدل افزایش می‌یابد، در حالی که معیارهای سلامت «مسطح شده‌اند».

چه کسی آزمایشگاه ها را بررسی می کند

استعفای جیکوب کوکسون ممکن است به واشنگتن اراده سیاسی جدیدی برای تنظیم ایمنی هوش مصنوعی داده باشد. این دو محقق طرفدار حسابرسان مستقل در شرکت های هوش مصنوعی هستند. اما آنها گفتند که هر مأموریتی با مشکل کارکنان مواجه خواهد شد.

چان گفت: «در واقع در حال حاضر به اندازه کافی استعداد، استعداد فنی کافی برای ارسال به این شرکت ها و حسابرسی وجود ندارد.

مارک زاکربرگ، مدیرعامل متا اخیرا گفته است که شرکت‌ها باید هوش مصنوعی ایمن را بر سیستم‌هایی که خودشان را بهبود می‌بخشند، اولویت دهند. منینگ پیشنهاد کرد که خودسازی در حال حاضر در حال انجام است، هر چه شرکت ها بگویند. او گفت: "من بسیار شگفت زده خواهم شد اگر محققان توانایی در Meta از عوامل کدگذاری برای کمک به تحقیقات خود استفاده نکنند."

انفجار یا نه

برخی از منتقدان می گویند جدول زمانی این روزنامه بسیار کوتاه است. رامز نام آینده پژوهی که در Noahpinion می نویسد، استدلال می کند که داده های آزمایشگاهی نشان می دهد که هوش مصنوعی به مراتب بیشتر از تحقیقات سرعت کدگذاری را افزایش می دهد. سایاش کاپور و آرویند نارایانان، محققان پرینستون دریافتند که عوامل هوش مصنوعی در یک آزمایش کوچک نتوانستند مقالات تحقیقاتی قابل قبولی تولید کنند. توبی اورد آکسفورد یک فرار واقعی را بعید می‌داند، اگرچه او هشدار می‌دهد که سرعت بسیار سریع‌تر کمتر از یک هنوز خطرناک است.

خود چان شواهد مربوط به شتاب را "مخلوط" خواند. او گفت آنچه او را بیشتر نگران می‌کند، شواهدی است که نشان می‌دهد «هر چه بیشتر سیستم‌های هوش مصنوعی را در فرآیند تحقیق و توسعه خود مستقر کنید»، مشکلات بیشتری «در پایگاه کد شما یا خود مدل‌ها» ایجاد می‌شود.

این داستان در ابتدا در سایت Fortune.com منتشر شد

خواندن متن کامل در فورچونبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

‘We can’t trust them completely’: AI research fellows warn that labs are running models with the safeguards off behind closed doors

Alan Chan and Sam Manning, co-authors with OpenAI's and Anthropic's top researchers, say that many times, "internal safeguards have not been deployed."

همه‌ی اخبار فناوری