پرش به محتوای اصلی

عوامل هوش مصنوعی برای تقلب در بلک جک متحد شدند. تشخیص تبانی آنها سخت تر می شود

وایرد۱۴۰۵ مهر ۱, چهارشنبه، ساعت ۲۲:۰۰حدود 4 دقیقه مطالعه

یک عملیات پنهانی شمارش کارت نشان می‌دهد که ممکن است به روش‌های جدیدی برای شناسایی فریب‌کاری مامور به نماینده نیاز داشته باشیم.

پس از اینکه محققان به آن‌ها دستور دادند که کارت‌ها را در طول بازی بلک جک بشمارند، ماموران - که توسط همان مدل کنترل می‌شدند - یک کد مخفی خود به خود ایجاد کردند تا به آنها کمک کند تا پیشروی کنند. اگرچه این اپیزود به جای یک کازینو واقعی در آزمایشگاه دانشگاه آکسفورد اتفاق افتاده است، اما پیامدهای واقعی دردسرساز دارد: این نشان می‌دهد که عوامل مستقر در صنایعی مانند امور مالی و تجارت الکترونیک می‌توانند نحوه مشارکت و تقلب را به روش‌هایی که تشخیص آن دشوار است، بیابند. کریستین شرودر دو ویت، دانشمند کامپیوتر می گوید: «وقتی این عوامل به صورت جداگانه مصرف شوند، ممکن است کاملا [خوش خیم] به نظر برسند.

در دانشگاه آکسفورد که این کار را رهبری کرده و تحقیقات پیشگامی در مورد تبانی ماموران انجام داده است. هنگامی که در یک گروه قرار می گیرند، می توانند مخفیانه با یکدیگر تبانی کنند. ماموران می‌دانستند که مکالمات آن‌ها زیر نظر گرفته می‌شود، بنابراین راهی برای برقراری ارتباط و در عین حال اجتناب از شناسایی ابداع کردند. برای مثال، وقتی یکی از نمایندگان گفت: "این دیلر در یک بازی داغ است! هر دست آنها یک هیولا را می کشند"، این نشان می داد که کارت بعدی ارزش خاصی دارد و نماینده باید 250 دلار شرط بندی کند.

جالبتر از همه، ارتباطات آنها توسط سیستمی که برای شناسایی علائم تبانی در گفتگوی ماموران طراحی شده بود، دریافت نمی شد. آرون رز، محقق یادگیری ماشینی که روی این پروژه کار می‌کرد، همچنین یک کارت‌بازی مشتاق است و می‌دانست که میز بلک جک ممکن است منطقه‌ای حاصلخیز برای مشارکت‌های ماموران حیله‌گر باشد. او می گوید: «این واقعا خوب کار کرد. گروه شرودر دو ویت در نهایت متوجه شدند که چگونه توطئه را تشخیص دهند. آنها با استفاده از روشی به نام تفسیرپذیری مکانیکی، مدل کوچکتری را برای تشخیص فعال‌سازی‌های آشکار در وزن عامل‌ها آموزش دادند.

آنها با استفاده از ابزاری به نام Narcbench، این رویکرد را بر روی برخی از مدل‌های منبع باز با اندازه متوسط ​​آزمایش کردند و دریافتند که می‌توانند تشخیص دهند که چه زمانی مدل‌ها قصد دارند اطلاعات را به یکدیگر منتقل کنند. با این حال، بسیار مهم است که تشخیص آنچه در حال رخ دادن بود، مستلزم نظارت بر هر دو عامل بود - چیزی که احتمالا تشخیص را در سناریوهای دنیای واقعی که در آن هزاران عامل، برخی از آنها توسط شرکت‌های مختلف اداره می‌شوند، پیچیده می‌کند. کاریسا کالن، دانشجوی دکترا که در این مطالعه شرکت داشت، می‌گوید گام بعدی این است که آزمایش کنیم که آیا مدل‌های بزرگ‌تر رفتار مشابهی دارند یا خیر.

(عوامل در این مطالعه نسخه‌های کوچک‌تری از مدل‌های آمریکایی Llama و GPT-OSS و مدل‌های چینی Qwen و DeepSeek بودند.) این تیم نشانه‌هایی را دیدند که نشان می‌دهد مدل‌های بزرگ‌تر سیگنال قابل تشخیص کمتری نسبت به مدل‌های کوچک‌تر نشان می‌دهند، و آنها می‌خواهند بدانند که آیا مدل‌های بزرگتر احتمال تبانی دارند یا نه، و احتمال بیشتری دارد که در مورد آن مخفیانه باشند. به نظر می رسد شواهدی مبنی بر اینکه گروه هایی از نمایندگان مشکل سازتر از عواملی هستند که به صورت انفرادی فعالیت می کنند، در حال افزایش است.

یک پروژه، از دانشگاه شانگهای جیائو تونگ و آزمایشگاه هوش مصنوعی شانگهای، نشان داد که گروهی از عوامل زمانی که از آنها خواسته می‌شود کمپین‌های اطلاعات نادرست شبیه‌سازی شده و کلاهبرداری در تجارت الکترونیک انجام دهند، بسیار خطرناک‌تر هستند. محققان گزارش دادند که آنها بهتر می توانستند با اقدامات دفاعی سازگار شوند. دییی یانگ، دانشمند کامپیوتر در دانشگاه استنفورد که تبانی بین عوامل را مطالعه کرده است، می گوید: «درس بزرگ این است که ارزیابی عوامل به صورت جداگانه کافی نیست.

شرکت‌ها باید تعاملات بین عاملی را به دقت زیر نظر داشته باشند، زمانی که نمایندگان به طور مکرر با هم تعامل دارند، حتی زمانی که انگیزه‌های فردی آن‌ها خوش خیم به نظر می‌رسد.» همه چیز بد نیست: داشتن هزاران عامل برای همکاری در یک کار این امکان را برای OpenAI فراهم می کند تا مسائل ریاضی را که قبلا حل نشده بود حل کند. اما گروه‌هایی از عوامل سرکش که با یکدیگر همکاری می‌کنند، در چندین حادثه هک اخیر نیز حضور داشته‌اند. در ماه می، تیمی از عوامل OpenAI به پلتفرم تحقیقاتی هوش مصنوعی Hugging Face هک کردند و از یک تابلوی پیام برای به اشتراک گذاشتن نکات و ایده‌ها استفاده کردند.

مدل‌های دیگر، از جمله Anthropic's Claude و Google's Gemini نیز نقض‌های ایمنی هشداردهنده‌ای را انجام داده‌اند. گفتگوی پنهانی بعد جدیدی به این مشکل رو به رشد می بخشد و ممکن است پایان آن نباشد. مطالعه اخیر دیگری که توسط استارتاپی به نام Emergence AI انجام شده است، عواملی را که توسط مدل‌های هوش مصنوعی مرزی کنترل می‌شوند، در دنیای مجازی قرار داده است تا ببینند چه کاری انجام خواهند داد. هنگامی که وظیفه کسب درآمد را بر عهده داشتند، مکررا سعی کردند راه‌هایی برای دسترسی به انسان‌ها در اینترنت گسترده‌تر ابداع کنند تا به آنها چیزهایی بفروشند. عجیب‌تر از همه، ماموران در نهایت نوع خود را توسعه دادند.

ساتیا نیتا، مدیر عامل Emergence AI می گوید: «آنها به سرعت یک زبان را تکامل دادند. "ما نمی دانیم چرا." جهان گسترده تر مشکلات مربوط به رفتار نادرست عاملان را نادیده نمی گیرد. این یک موضوع داغ در مجمع عمومی این هفته سازمان ملل است. یک پنل علمی مستقل قرار است در مورد حادثه OpenAI-HuggingFace بحث کند، در حالی که انتظار می رود سم آلتمن برای ایجاد هماهنگی بین المللی برای توسعه عوامل هوش مصنوعی ایمن درخواست کند. با وجود این، برخی از صنایع، از جمله تجارت الکترونیک، به محل آزمایش هوش مصنوعی عامل تبدیل شده اند.

به عنوان مثال، این هفته، آمازون اعلام کرد که دسترسی عامل هوش مصنوعی Meta’s Muse را به سایت خود مسدود می کند و استدلال می کند که شرایط استفاده از آن را نقض کرده است. شرودر دو ویت می‌گوید کاملا قابل تصور است که مأمورانی که وظیفه یافتن معاملات را دارند، شروع به همکاری با یکدیگر کنند - شاید حتی پنهانی - برای به دست آوردن یک معامله بهتر یا به هم زدن کسی. او می‌گوید که مطالعه تبانی عوامل و توسعه استراتژی‌های تشخیص با تکثیر آنها بسیار مهم خواهد بود. او می‌گوید: «باید تحقیقات و درک بیشتری وجود داشته باشد که وقتی عوامل بیشتری در اقتصاد داشته باشیم چه اتفاقی خواهد افتاد.

این نسخه ای از خبرنامه آزمایشگاه هوش مصنوعی ویل نایت است. خبرنامه های قبلی را اینجا بخوانید.

خواندن متن کامل در وایردبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI Agents Teamed Up to Cheat at Blackjack. Their Collusion Is Getting Harder to Spot

A clandestine card-counting operation suggests we may need new ways to spot agent-to-agent deception.

همه‌ی اخبار فناوری