پرش به محتوای اصلی

LLM ها در هنگام استفاده از واترمارکینگ هوش مصنوعی به درخواست های مضر پاسخ متفاوتی می دهند

آرس‌تکنیکا۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۲۲:۰۳حدود 2 دقیقه مطالعه

SynthID می‌تواند باعث شود مدل‌ها دستورالعمل‌های مضری را دنبال کنند که در غیر این صورت از آن امتناع می‌کردند.

در پاسخ به قانون جدید اتحادیه اروپا، پلتفرم‌های هوش مصنوعی در حال اجرای طرح‌های جدیدی برای واترمارک کردن محتوایی هستند که تولید می‌کنند. Anthropic اخیرا فاش کرده است که مدل‌های Claude آینده‌اش از SynthID-Text استفاده خواهند کرد، رویکردی که گوگل ایجاد و به‌عنوان منبع باز منتشر کرد. از یک کلید مخفی استفاده می کند که فرآیندی را که یک مدل برای انتخاب کلمه بعدی در یک جمله استفاده می کند، تغییر می دهد. در حالی که انتخاب کلمه بعدی ممکن است «ابری» باشد، کلید ممکن است آن را به «ابری» تغییر دهد. هر کسی که کلید را بداند می تواند تشخیص دهد که آیا این کلید توسط پلتفرم با استفاده از آن ایجاد شده است یا خیر.

تحقیقات جدید نشان می‌دهد که SynthID-Text می‌تواند نه تنها انتخاب کلمه، بلکه ابزارهایی را که یک مدل فرا می‌خواند و احتمال پایبندی یا نادیده گرفتن حفاظ‌های ایمنی که آموزش دیده است را تغییر دهد. تهدید می تواند در مواجهه با یک اعلان خصمانه، که در آن مهاجم تلاش می کند تا یک مدل را وادار به انجام یک عمل مضر، مانند افشای رمز عبور یا سایر اطلاعات حساس، کند، بیشتر شود. دستورالعمل‌هایی که معمولا رعایت نمی‌شوند، در برخی موارد، پس از اجرای واترمارک اجرا می‌شوند.

این یافته بر نیاز توسعه دهندگان تأکید می کند که به طور کامل نحوه رفتار LLM ها و نمایندگان آنها را در هنگام انجام واترمارکینگ آزمایش کنند.

تغییر رفتار ایمنی

آندریا سیپوسووا، محقق امنیت هوش مصنوعی در Lasso Security، به Ars گفت: «در مقایسه با مدل‌های مشابه بدون واترمارک، قطعا رفتار آن‌ها را تغییر می‌دهد، به‌ویژه زمانی که آن‌ها را تحت شرایط متخاصم قرار می‌دهیم، یا زمانی که این مدل‌ها ابزارها را به کار می‌برند، ابزارها را صدا می‌کنند.» واترمارکینگ به گونه ای ساخته شده است که برای خواننده قابل درک نباشد، اما ما می دانیم که وقتی چیزی را در مورد آنچه مدل تولید می کند تغییر می دهیم، باعث ایجاد برخی معاوضه ها می شود، در جایی ظاهر می شود.

مقاله کامل را بخوانید

نظرات

خواندن متن کامل در آرس‌تکنیکابه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

LLMs respond differently to harmful prompts when AI watermarking is used

SynthID can cause models to follow harmful instructions they would otherwise refuse.

همه‌ی اخبار فناوری