واترمارکینگ هوش مصنوعی می تواند پایبندی به نرده محافظ LLM را غیرقابل پیش بینی کند - و این می تواند مشکل بزرگی برای قانون هوش مصنوعی اتحادیه اروپا باشد.
محققان نشان دادهاند که چگونه واترمارکینگ هوش مصنوعی میتواند نحوه رفتار یک LLM را تغییر دهد و امنیت آن را کمتر کند.
هدف واترمارکینگ هوش مصنوعی اثبات صحت هر متنی است
مطالعه جدید نشان میدهد که رفتار LLM را نیز تغییر میدهد - و به طرز بدی
قانون هوش مصنوعی اتحادیه اروپا می تواند به این معنا باشد که مدل های بیشتری علی رغم عوارض جانبی دارای واترمارک هستند تحقیقات جدید Lasso نشان داده است که واترمارکینگ AI در واقع می تواند به طور ناخواسته نحوه رفتار LLM ها را پس از آزمایش SynthID-Text Google DeepMind تغییر دهد.
محققان این شرکت دریافتند که SynthID-Text میتواند رد درخواستهای مضر توسط مدلها، حساسیت آنها به تزریق سریع، ابزار انتخاب عامل هوش مصنوعی و موارد دیگر را تغییر دهد.
با این حال، در هسته خود، SynthID-Text و سایر واترمارک های مشابه تنها برای پنهان کردن یک نشانگر قابل خواندن توسط ماشین در مورد اینکه آیا متن توسط هوش مصنوعی تولید شده یا توسط انسان نوشته شده است، طراحی شده است.
محققان دریافتند که واترمارکینگ AI می تواند ناخواسته رفتار هوش مصنوعی را تغییر دهد
لاسو نتیجهگیری میکند که «رویه واترمارکینگ میتواند هم بر آنچه مدل میگوید و هم بر کاری که یک نماینده انجام میدهد تأثیر بگذارد.
یکی از بزرگترین نگرانیهایی که در این مقاله برجسته شده است این است که حتی بدون حمله، واترمارکینگ برخی از تصمیمهای امتناع مدلها را تغییر داده و آنها را تمایل بیشتری برای پاسخ به درخواستهای بالقوه مضر نشان میدهد. همراه با تزریق سریع، کمند عواقب را تشدید کرد.
علیرغم پیامدهای ناخواسته، آنتروپیک اخیرا اعلام کرد که نسلهای آینده کلود از واترمارکینگ هوش مصنوعی مشابه Google DeepMind استفاده خواهند کرد و تاکید کرد که یکی از محرکهای کلیدی پایبندی به قانون هوش مصنوعی اتحادیه اروپا است. با در نظر گرفتن این موضوع، واترمارکینگ AI قرار است در سایر ارائه دهندگان مدل به جریان اصلی تبدیل شود و این اتفاقات ناگوار بسیار رایج تر شود و منجر به نگرانی های امنیتی بیشتر شود.
در نهایت، Lasso از توسعهدهندگان میخواهد تا به جای اعمال کورکورانه آن بر پیکربندیهای موجود، معیارها، ارزیابیهای ایمنی و سایر آزمایشها را برای بررسی هرگونه عواقب ناخواسته مجددا اجرا کنند.
لاسو در پایان میگوید: «این یافتهها ارزیابی مجدد را هر زمان که واترمارکینگ معرفی شود یا پیکربندی یا کلید آن تغییر کند، مهم میسازد.
علاوه بر این، این تحقیق زاویه جدیدی را در مورد واترمارک کردن هوش مصنوعی ارائه میکند، زیرا تا کنون محققان تا حد زیادی بر روی این موضوع تمرکز کردهاند که آیا واترمارکها میتوانند هم بهطور موثر اعمال شوند و هم شناسایی شوند. تعداد کمی مانند این پیامدهای امنیتی را کشف کرده اند.
متن اصلی (انگلیسی)
AI watermarking could make LLM guardrail adherence unpredictable — and that could be a big problem for the EU AI Act
Researchers have revealed how AI watermarking could actually change how an LLM behaves, making it less secure.