پرش به محتوای اصلی

3 از 5 مدل هوش مصنوعی در تست های ایمنی تروریسم شکست می خورند: مطالعه

آناتولی۱۴۰۵ مهر ۱۸, شنبه، ساعت ۱۳:۲۴حدود 2 دقیقه مطالعه

به گزارش رسانه ها، تحقیقات نشان می دهد مدل های فاقد پادمان های ایمنی به طور مداوم به درخواست های بالقوه خطرناک پاسخ می دهند.

بر اساس تحقیقاتی که روز جمعه توسط سی‌بی‌سی نیوز گزارش شد، سه مدل از هر پنج مدل هوش مصنوعی (AI) در تست‌های ایمنی تروریسم شکست خورده‌اند، و مدل‌های فاقد پادمان‌ها به طور مداوم اطلاعات بالقوه خطرناکی را ارائه می‌دهند.

این مطالعه که توسط سازمان غیرانتفاعی «Tech Against Terrorism» مستقر در بریتانیا انجام شد، بیش از 130 مدل هوش مصنوعی را با استفاده از صدها درخواست شبیه به درخواست‌هایی که یک تروریست در حال برنامه‌ریزی برای حمله است، ارزیابی کرد.

محققان دریافتند که مدل‌هایی که از طریق فرآیندی به نام «ابلیتراسیون» اصلاح شده‌اند، که پادمان‌های ایمنی را حذف می‌کند، در هر آزمایش شکست خورده‌اند.

مدل Llama 3.1 8B متا قبل از اصلاح، امتیاز 97 از 100 را در معیار ایمنی سازمان کسب کرد، در حالی که پس از آن تقریبا سه امتیاز بود.

محققان گفتند مدل اصلاح‌شده پاسخ‌های دقیقی به درخواست‌های مربوط به حملات، تأمین مالی تروریسم و ​​رادیکال‌سازی ارائه می‌دهد، در حالی که نسخه اصلی آن چنین درخواست‌هایی را رد می‌کند.

آدام هدلی، بنیانگذار و مدیر اجرایی Tech Against Terrorism می گوید: «قابل درک است که نگرانی در مورد از دست دادن کنترل، خطر وجودی هوش مصنوعی وجود دارد.

موضوع این است که در واقع، این قبلا اتفاق افتاده است، زیرا بسیاری از این مدل‌های باز قبلا شکسته شده‌اند - فقط هنوز کسی متوجه نشده است.»

این سازمان تا اواخر ماه گذشته بیش از 29000 مخزن را پیدا کرد که مدل‌های هوش مصنوعی بدون سانسور یا محافظت نشده را در Hugging Face تبلیغ می‌کردند.

Hugging Face گفت که مرتبا محتوایی را که خط‌مشی‌هایش را نقض می‌کند تعدیل می‌کند، اما هشدار داد که برخی توصیه‌ها در این گزارش می‌تواند تحقیقات باز را تضعیف کند.

متا گفت که مدل‌های آن تحت ارزیابی ایمنی قرار می‌گیرند و سیاست‌هایش استفاده مضر یا غیرقانونی را ممنوع می‌کند.

این گزارش هیچ مدرکی مبنی بر استفاده گروه های تروریستی یا افراطی از مدل های آزمایش شده، به جز یک چت بات افراطی که توسط محققان شناسایی شده بود، پیدا نکرد.

Tech Against Terrorism معیارهای ایمنی مستقل، محافظت قوی تر در برابر حذف پادمان و محدودیت در توزیع مدل های اصلاح شده را توصیه می کند.

هادلی گفت: "این تصور که ما نمی توانیم امنیت و پیشرفت داشته باشیم، به نظر من نادرست است."

خواندن متن کامل در آناتولیبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

3 in 5 AI models fail terrorism safety tests: Study

Research finds models stripped of safety safeguards consistently provide responses to potentially dangerous requests, media reports

همه‌ی اخبار علم