3 از 5 مدل هوش مصنوعی در تست های ایمنی تروریسم شکست می خورند: مطالعه
به گزارش رسانه ها، تحقیقات نشان می دهد مدل های فاقد پادمان های ایمنی به طور مداوم به درخواست های بالقوه خطرناک پاسخ می دهند.
بر اساس تحقیقاتی که روز جمعه توسط سیبیسی نیوز گزارش شد، سه مدل از هر پنج مدل هوش مصنوعی (AI) در تستهای ایمنی تروریسم شکست خوردهاند، و مدلهای فاقد پادمانها به طور مداوم اطلاعات بالقوه خطرناکی را ارائه میدهند.
این مطالعه که توسط سازمان غیرانتفاعی «Tech Against Terrorism» مستقر در بریتانیا انجام شد، بیش از 130 مدل هوش مصنوعی را با استفاده از صدها درخواست شبیه به درخواستهایی که یک تروریست در حال برنامهریزی برای حمله است، ارزیابی کرد.
محققان دریافتند که مدلهایی که از طریق فرآیندی به نام «ابلیتراسیون» اصلاح شدهاند، که پادمانهای ایمنی را حذف میکند، در هر آزمایش شکست خوردهاند.
مدل Llama 3.1 8B متا قبل از اصلاح، امتیاز 97 از 100 را در معیار ایمنی سازمان کسب کرد، در حالی که پس از آن تقریبا سه امتیاز بود.
محققان گفتند مدل اصلاحشده پاسخهای دقیقی به درخواستهای مربوط به حملات، تأمین مالی تروریسم و رادیکالسازی ارائه میدهد، در حالی که نسخه اصلی آن چنین درخواستهایی را رد میکند.
آدام هدلی، بنیانگذار و مدیر اجرایی Tech Against Terrorism می گوید: «قابل درک است که نگرانی در مورد از دست دادن کنترل، خطر وجودی هوش مصنوعی وجود دارد.
موضوع این است که در واقع، این قبلا اتفاق افتاده است، زیرا بسیاری از این مدلهای باز قبلا شکسته شدهاند - فقط هنوز کسی متوجه نشده است.»
این سازمان تا اواخر ماه گذشته بیش از 29000 مخزن را پیدا کرد که مدلهای هوش مصنوعی بدون سانسور یا محافظت نشده را در Hugging Face تبلیغ میکردند.
Hugging Face گفت که مرتبا محتوایی را که خطمشیهایش را نقض میکند تعدیل میکند، اما هشدار داد که برخی توصیهها در این گزارش میتواند تحقیقات باز را تضعیف کند.
متا گفت که مدلهای آن تحت ارزیابی ایمنی قرار میگیرند و سیاستهایش استفاده مضر یا غیرقانونی را ممنوع میکند.
این گزارش هیچ مدرکی مبنی بر استفاده گروه های تروریستی یا افراطی از مدل های آزمایش شده، به جز یک چت بات افراطی که توسط محققان شناسایی شده بود، پیدا نکرد.
Tech Against Terrorism معیارهای ایمنی مستقل، محافظت قوی تر در برابر حذف پادمان و محدودیت در توزیع مدل های اصلاح شده را توصیه می کند.
هادلی گفت: "این تصور که ما نمی توانیم امنیت و پیشرفت داشته باشیم، به نظر من نادرست است."
متن اصلی (انگلیسی)
3 in 5 AI models fail terrorism safety tests: Study
Research finds models stripped of safety safeguards consistently provide responses to potentially dangerous requests, media reports