پرش به محتوای اصلی

واترمارکینگ مدل هوش مصنوعی رفتار عامل را تغییر می دهد

دِ رجیستر۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۱۶:۳۰حدود 3 دقیقه مطالعه

Lasso Security تفاوت هایی را در مدیریت ابزار و امتناع مدل می بیند

واترمارک‌هایی که قانون اروپا الزام می‌کند به محتوای تولید شده توسط هوش مصنوعی برای تعیین منشأ اضافه شود، ممکن است هزینه داشته باشد. طبق گفته Lasso Security، واترمارکینگ مدل هوش مصنوعی نحوه برخورد عوامل هوش مصنوعی با ابزارها و امتناع های ایمنی را تغییر می دهد. رفتار تغییر یافته لزوما بدتر نیست، اما می تواند، به ویژه تحت تزریق سریع دشمن، بدتر باشد. با اجرای قانون هوش مصنوعی اتحادیه اروپا، ارائه دهندگان مدل های هوش مصنوعی باید خروجی نرم افزار خود را با کد قابل خواندن توسط ماشین علامت گذاری کنند. SynthID-Text Google DeepMind یک روش برای انجام این کار است و توسط Anthropic و OpenAI پذیرفته شده است.

مزیت این نوع برچسب‌گذاری دیجیتالی این است که محتوای دستکاری یا فریبنده تولید شده توسط هوش مصنوعی را می‌توان راحت‌تر تشخیص داد، حتی اگر پتانسیل انگ زدن به استفاده از هوش مصنوعی را داشته باشد. توضیح آنتروپیک در مورد نحوه اعمال واترمارک به خروجی کلود شامل مداخله در پیش‌بینی است که منجر به کلمات خاصی می‌شود. به عنوان مثال، اگر کلود جمله "هوا امروز سرد بود و ..." را صادر می کرد، ممکن است یکی از نامزدهای احتمالی آماری (مثلا ابری) را به گزینه ای دیگر (مثلا "خاکستری") ترجیح دهد. ممکن است بتوان آن افزودنی ها را تشخیص داد.

لاسو در یک پست وبلاگی ارائه شده به The Register توضیح داد: «واترمارکینگ برای منشأ طراحی شده است، اما SynthID-Text فرآیندی را تغییر می‌دهد که توسط آن مدل هر توکن بعدی را تولید می‌کند. در سطح مدل، این می‌تواند رفتار ایمنی را تغییر دهد، از جمله اینکه آیا مدل درخواست مضر را رد می‌کند و آیا این امتناع تحت تزریق سریع باقی می‌ماند یا خیر. Lasso Security اضافه کرد: «واترمارکینگ از گزینه‌های کم‌مخاطره‌ای مانند این استفاده می‌کند – که بارها روی یک متن تولید شده اتفاق می‌افتد – تا الگویی در پاسخ‌های کلود به جا بگذارد.»

"این الگو برای خواننده غیرقابل شناسایی است، اما برای هر کسی که کلیدی دارد که آن را رمزگذاری می کند قابل تشخیص است." در حالی که یک خواننده ممکن است متوجه سوگیری انتخاب کلمه نشود، عوامل هوش مصنوعی می توانند به طور ظریفی به تفاوت های واژگان حساس باشند. Lasso دریافت که این نوع برچسب گذاری محتوای دیجیتال می تواند بر تماس ابزار و رفتار امتناع تأثیر بگذارد. این شرکت می‌گوید واترمارکینگ می‌تواند هم بر آنچه مدل می‌گوید و هم بر آنچه که یک نماینده انجام می‌دهد تأثیر بگذارد. و این به عوامل هوش مصنوعی از سازمان‌هایی غیر از نهادی که واترمارک را انجام می‌دهد، گسترش می‌یابد.

بنابراین یک عامل مبتنی بر OpenClaw یا یک کلاینت API که یک مدل Anthropic را فراخوانی می‌کند، هر گونه تغییر خروجی را که از واترمارکینگ Anthropic دنبال می‌شود، پردازش می‌کند. از نظر فراخوانی ابزار، بر اساس معیاری به نام BFCL v4 تک چرخشی AST، واترمارکینگ دقت را در شش مدل از هفت مدل آزمایش شده کاهش داد (phi-4، Llama-3.1-8B، Qwen3-32B، Qwen3-4B، gemma-3-12b، gemma-3-8nite-3، و gemma-3-27-3). لاسو گفت: «با این حال، تغییر خالص در دقت، نشان نمی‌دهد که آیا همان تماس‌های فردی با و بدون واترمارک موفق می‌شوند یا خیر».

تماسی که نادرست می شود را می توان با تماسی که صحیح می شود جبران کرد و نتیجه کل تقریبا بدون تغییر باقی می ماند حتی اگر مدل در هر دو مورد متفاوت رفتار کند. فراخوانی ابزار دقیق‌تر به این معنی است که عوامل هوش مصنوعی که Lasso آزمایش کرده‌اند، ابزار اشتباهی را برای کار مورد نظر یا آرگومان‌های اشتباه برای ابزار صحیح انتخاب کرده‌اند و به دلیل ورودی یا تجزیه نادرست شکست خورده‌اند. در مورد امتناع - زمانی که مدل‌ها به دلایل ایمنی از پاسخگویی به درخواست امتناع می‌کنند، واترمارکینگ تأثیر کمی بر رسیدگی به درخواست‌های آشکارا مضر داشت، بر اساس اجرای آزمایشی با استفاده از HarmBench و JailbreakBench.

و در یک سناریوی متخاصم که شامل تزریق سریع است، تأثیر بیشتری داشت. محققان Lasso در گزارش خود مشاهده کردند: «واترمارکینگ رفتار امتناع در درخواست‌های مضر را تغییر می‌دهد، اما تأثیر آن با تزریق سریع آشکارتر می‌شود». برای فعل و انفعالاتی که شامل تزریق سریع است - یک دستورالعمل مخالف مبنی بر اینکه فیلتر ایمنی غیرفعال شده است و رعایت آن الزامی است - نرخ موفقیت حمله به طور قابل توجهی با درگیر شدن واترمارک ها افزایش یافت. این باعث شد مدل‌های آسیب‌دیده کمتر درخواست‌های مضر را رد کنند.

به گفته لاسو، یافته‌ها لزوما استدلال نمی‌کنند که واترمارک‌گذاری بی‌مورد است. در عوض، بیز ادعا می کند، ارزیابی های امنیتی و تیم قرمز باید در هنگام ارزیابی استقرار عامل، محتوای دارای واترمارک را نیز شامل شود. این تضمین می کند که تفاوت ها در رفتار عامل می تواند سنجیده شود. ®

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI model watermarking changes agent behavior

Lasso Security sees differences in tool handling and model refusals

همه‌ی اخبار فناوری