پرش به محتوای اصلی

واترمارکینگ هوش مصنوعی می تواند پایبندی به نرده محافظ LLM را غیرقابل پیش بینی کند - و این می تواند مشکل بزرگی برای قانون هوش مصنوعی اتحادیه اروپا باشد.

تک‌رادار۱۴۰۵ شهریور ۲۷, جمعه، ساعت ۱۵:۳۹حدود 2 دقیقه مطالعه

محققان نشان داده‌اند که چگونه واترمارکینگ هوش مصنوعی می‌تواند نحوه رفتار یک LLM را تغییر دهد و امنیت آن را کمتر کند.

هدف واترمارکینگ هوش مصنوعی اثبات صحت هر متنی است

مطالعه جدید نشان می‌دهد که رفتار LLM را نیز تغییر می‌دهد - و به طرز بدی

قانون هوش مصنوعی اتحادیه اروپا می تواند به این معنا باشد که مدل های بیشتری علی رغم عوارض جانبی دارای واترمارک هستند تحقیقات جدید Lasso نشان داده است که واترمارکینگ AI در واقع می تواند به طور ناخواسته نحوه رفتار LLM ها را پس از آزمایش SynthID-Text Google DeepMind تغییر دهد.

محققان این شرکت دریافتند که SynthID-Text می‌تواند رد درخواست‌های مضر توسط مدل‌ها، حساسیت آن‌ها به تزریق سریع، ابزار انتخاب عامل هوش مصنوعی و موارد دیگر را تغییر دهد.

با این حال، در هسته خود، SynthID-Text و سایر واترمارک های مشابه تنها برای پنهان کردن یک نشانگر قابل خواندن توسط ماشین در مورد اینکه آیا متن توسط هوش مصنوعی تولید شده یا توسط انسان نوشته شده است، طراحی شده است.

محققان دریافتند که واترمارکینگ AI می تواند ناخواسته رفتار هوش مصنوعی را تغییر دهد

لاسو نتیجه‌گیری می‌کند که «رویه واترمارکینگ می‌تواند هم بر آنچه مدل می‌گوید و هم بر کاری که یک نماینده انجام می‌دهد تأثیر بگذارد.

یکی از بزرگ‌ترین نگرانی‌هایی که در این مقاله برجسته شده است این است که حتی بدون حمله، واترمارکینگ برخی از تصمیم‌های امتناع مدل‌ها را تغییر داده و آن‌ها را تمایل بیشتری برای پاسخ به درخواست‌های بالقوه مضر نشان می‌دهد. همراه با تزریق سریع، کمند عواقب را تشدید کرد.

علیرغم پیامدهای ناخواسته، آنتروپیک اخیرا اعلام کرد که نسل‌های آینده کلود از واترمارکینگ هوش مصنوعی مشابه Google DeepMind استفاده خواهند کرد و تاکید کرد که یکی از محرک‌های کلیدی پایبندی به قانون هوش مصنوعی اتحادیه اروپا است. با در نظر گرفتن این موضوع، واترمارکینگ AI قرار است در سایر ارائه دهندگان مدل به جریان اصلی تبدیل شود و این اتفاقات ناگوار بسیار رایج تر شود و منجر به نگرانی های امنیتی بیشتر شود.

در نهایت، Lasso از توسعه‌دهندگان می‌خواهد تا به جای اعمال کورکورانه آن بر پیکربندی‌های موجود، معیارها، ارزیابی‌های ایمنی و سایر آزمایش‌ها را برای بررسی هرگونه عواقب ناخواسته مجددا اجرا کنند.

لاسو در پایان می‌گوید: «این یافته‌ها ارزیابی مجدد را هر زمان که واترمارکینگ معرفی شود یا پیکربندی یا کلید آن تغییر کند، مهم می‌سازد.

علاوه بر این، این تحقیق زاویه جدیدی را در مورد واترمارک کردن هوش مصنوعی ارائه می‌کند، زیرا تا کنون محققان تا حد زیادی بر روی این موضوع تمرکز کرده‌اند که آیا واترمارک‌ها می‌توانند هم به‌طور موثر اعمال شوند و هم شناسایی شوند. تعداد کمی مانند این پیامدهای امنیتی را کشف کرده اند.

خواندن متن کامل در تک‌راداربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI watermarking could make LLM guardrail adherence unpredictable — and that could be a big problem for the EU AI Act

Researchers have revealed how AI watermarking could actually change how an LLM behaves, making it less secure.

همه‌ی اخبار فناوری