واترمارکینگ مدل هوش مصنوعی رفتار عامل را تغییر می دهد
Lasso Security تفاوت هایی را در مدیریت ابزار و امتناع مدل می بیند
واترمارکهایی که قانون اروپا الزام میکند به محتوای تولید شده توسط هوش مصنوعی برای تعیین منشأ اضافه شود، ممکن است هزینه داشته باشد. طبق گفته Lasso Security، واترمارکینگ مدل هوش مصنوعی نحوه برخورد عوامل هوش مصنوعی با ابزارها و امتناع های ایمنی را تغییر می دهد. رفتار تغییر یافته لزوما بدتر نیست، اما می تواند، به ویژه تحت تزریق سریع دشمن، بدتر باشد. با اجرای قانون هوش مصنوعی اتحادیه اروپا، ارائه دهندگان مدل های هوش مصنوعی باید خروجی نرم افزار خود را با کد قابل خواندن توسط ماشین علامت گذاری کنند. SynthID-Text Google DeepMind یک روش برای انجام این کار است و توسط Anthropic و OpenAI پذیرفته شده است.
مزیت این نوع برچسبگذاری دیجیتالی این است که محتوای دستکاری یا فریبنده تولید شده توسط هوش مصنوعی را میتوان راحتتر تشخیص داد، حتی اگر پتانسیل انگ زدن به استفاده از هوش مصنوعی را داشته باشد. توضیح آنتروپیک در مورد نحوه اعمال واترمارک به خروجی کلود شامل مداخله در پیشبینی است که منجر به کلمات خاصی میشود. به عنوان مثال، اگر کلود جمله "هوا امروز سرد بود و ..." را صادر می کرد، ممکن است یکی از نامزدهای احتمالی آماری (مثلا ابری) را به گزینه ای دیگر (مثلا "خاکستری") ترجیح دهد. ممکن است بتوان آن افزودنی ها را تشخیص داد.
لاسو در یک پست وبلاگی ارائه شده به The Register توضیح داد: «واترمارکینگ برای منشأ طراحی شده است، اما SynthID-Text فرآیندی را تغییر میدهد که توسط آن مدل هر توکن بعدی را تولید میکند. در سطح مدل، این میتواند رفتار ایمنی را تغییر دهد، از جمله اینکه آیا مدل درخواست مضر را رد میکند و آیا این امتناع تحت تزریق سریع باقی میماند یا خیر. Lasso Security اضافه کرد: «واترمارکینگ از گزینههای کممخاطرهای مانند این استفاده میکند – که بارها روی یک متن تولید شده اتفاق میافتد – تا الگویی در پاسخهای کلود به جا بگذارد.»
"این الگو برای خواننده غیرقابل شناسایی است، اما برای هر کسی که کلیدی دارد که آن را رمزگذاری می کند قابل تشخیص است." در حالی که یک خواننده ممکن است متوجه سوگیری انتخاب کلمه نشود، عوامل هوش مصنوعی می توانند به طور ظریفی به تفاوت های واژگان حساس باشند. Lasso دریافت که این نوع برچسب گذاری محتوای دیجیتال می تواند بر تماس ابزار و رفتار امتناع تأثیر بگذارد. این شرکت میگوید واترمارکینگ میتواند هم بر آنچه مدل میگوید و هم بر آنچه که یک نماینده انجام میدهد تأثیر بگذارد. و این به عوامل هوش مصنوعی از سازمانهایی غیر از نهادی که واترمارک را انجام میدهد، گسترش مییابد.
بنابراین یک عامل مبتنی بر OpenClaw یا یک کلاینت API که یک مدل Anthropic را فراخوانی میکند، هر گونه تغییر خروجی را که از واترمارکینگ Anthropic دنبال میشود، پردازش میکند. از نظر فراخوانی ابزار، بر اساس معیاری به نام BFCL v4 تک چرخشی AST، واترمارکینگ دقت را در شش مدل از هفت مدل آزمایش شده کاهش داد (phi-4، Llama-3.1-8B، Qwen3-32B، Qwen3-4B، gemma-3-12b، gemma-3-8nite-3، و gemma-3-27-3). لاسو گفت: «با این حال، تغییر خالص در دقت، نشان نمیدهد که آیا همان تماسهای فردی با و بدون واترمارک موفق میشوند یا خیر».
تماسی که نادرست می شود را می توان با تماسی که صحیح می شود جبران کرد و نتیجه کل تقریبا بدون تغییر باقی می ماند حتی اگر مدل در هر دو مورد متفاوت رفتار کند. فراخوانی ابزار دقیقتر به این معنی است که عوامل هوش مصنوعی که Lasso آزمایش کردهاند، ابزار اشتباهی را برای کار مورد نظر یا آرگومانهای اشتباه برای ابزار صحیح انتخاب کردهاند و به دلیل ورودی یا تجزیه نادرست شکست خوردهاند. در مورد امتناع - زمانی که مدلها به دلایل ایمنی از پاسخگویی به درخواست امتناع میکنند، واترمارکینگ تأثیر کمی بر رسیدگی به درخواستهای آشکارا مضر داشت، بر اساس اجرای آزمایشی با استفاده از HarmBench و JailbreakBench.
و در یک سناریوی متخاصم که شامل تزریق سریع است، تأثیر بیشتری داشت. محققان Lasso در گزارش خود مشاهده کردند: «واترمارکینگ رفتار امتناع در درخواستهای مضر را تغییر میدهد، اما تأثیر آن با تزریق سریع آشکارتر میشود». برای فعل و انفعالاتی که شامل تزریق سریع است - یک دستورالعمل مخالف مبنی بر اینکه فیلتر ایمنی غیرفعال شده است و رعایت آن الزامی است - نرخ موفقیت حمله به طور قابل توجهی با درگیر شدن واترمارک ها افزایش یافت. این باعث شد مدلهای آسیبدیده کمتر درخواستهای مضر را رد کنند.
به گفته لاسو، یافتهها لزوما استدلال نمیکنند که واترمارکگذاری بیمورد است. در عوض، بیز ادعا می کند، ارزیابی های امنیتی و تیم قرمز باید در هنگام ارزیابی استقرار عامل، محتوای دارای واترمارک را نیز شامل شود. این تضمین می کند که تفاوت ها در رفتار عامل می تواند سنجیده شود. ®
متن اصلی (انگلیسی)
AI model watermarking changes agent behavior
Lasso Security sees differences in tool handling and model refusals