عوامل هوش مصنوعی برای تقلب در بلک جک متحد شدند. تشخیص تبانی آنها سخت تر می شود
یک عملیات پنهانی شمارش کارت نشان میدهد که ممکن است به روشهای جدیدی برای شناسایی فریبکاری مامور به نماینده نیاز داشته باشیم.
پس از اینکه محققان به آنها دستور دادند که کارتها را در طول بازی بلک جک بشمارند، ماموران - که توسط همان مدل کنترل میشدند - یک کد مخفی خود به خود ایجاد کردند تا به آنها کمک کند تا پیشروی کنند. اگرچه این اپیزود به جای یک کازینو واقعی در آزمایشگاه دانشگاه آکسفورد اتفاق افتاده است، اما پیامدهای واقعی دردسرساز دارد: این نشان میدهد که عوامل مستقر در صنایعی مانند امور مالی و تجارت الکترونیک میتوانند نحوه مشارکت و تقلب را به روشهایی که تشخیص آن دشوار است، بیابند. کریستین شرودر دو ویت، دانشمند کامپیوتر می گوید: «وقتی این عوامل به صورت جداگانه مصرف شوند، ممکن است کاملا [خوش خیم] به نظر برسند.
در دانشگاه آکسفورد که این کار را رهبری کرده و تحقیقات پیشگامی در مورد تبانی ماموران انجام داده است. هنگامی که در یک گروه قرار می گیرند، می توانند مخفیانه با یکدیگر تبانی کنند. ماموران میدانستند که مکالمات آنها زیر نظر گرفته میشود، بنابراین راهی برای برقراری ارتباط و در عین حال اجتناب از شناسایی ابداع کردند. برای مثال، وقتی یکی از نمایندگان گفت: "این دیلر در یک بازی داغ است! هر دست آنها یک هیولا را می کشند"، این نشان می داد که کارت بعدی ارزش خاصی دارد و نماینده باید 250 دلار شرط بندی کند.
جالبتر از همه، ارتباطات آنها توسط سیستمی که برای شناسایی علائم تبانی در گفتگوی ماموران طراحی شده بود، دریافت نمی شد. آرون رز، محقق یادگیری ماشینی که روی این پروژه کار میکرد، همچنین یک کارتبازی مشتاق است و میدانست که میز بلک جک ممکن است منطقهای حاصلخیز برای مشارکتهای ماموران حیلهگر باشد. او می گوید: «این واقعا خوب کار کرد. گروه شرودر دو ویت در نهایت متوجه شدند که چگونه توطئه را تشخیص دهند. آنها با استفاده از روشی به نام تفسیرپذیری مکانیکی، مدل کوچکتری را برای تشخیص فعالسازیهای آشکار در وزن عاملها آموزش دادند.
آنها با استفاده از ابزاری به نام Narcbench، این رویکرد را بر روی برخی از مدلهای منبع باز با اندازه متوسط آزمایش کردند و دریافتند که میتوانند تشخیص دهند که چه زمانی مدلها قصد دارند اطلاعات را به یکدیگر منتقل کنند. با این حال، بسیار مهم است که تشخیص آنچه در حال رخ دادن بود، مستلزم نظارت بر هر دو عامل بود - چیزی که احتمالا تشخیص را در سناریوهای دنیای واقعی که در آن هزاران عامل، برخی از آنها توسط شرکتهای مختلف اداره میشوند، پیچیده میکند. کاریسا کالن، دانشجوی دکترا که در این مطالعه شرکت داشت، میگوید گام بعدی این است که آزمایش کنیم که آیا مدلهای بزرگتر رفتار مشابهی دارند یا خیر.
(عوامل در این مطالعه نسخههای کوچکتری از مدلهای آمریکایی Llama و GPT-OSS و مدلهای چینی Qwen و DeepSeek بودند.) این تیم نشانههایی را دیدند که نشان میدهد مدلهای بزرگتر سیگنال قابل تشخیص کمتری نسبت به مدلهای کوچکتر نشان میدهند، و آنها میخواهند بدانند که آیا مدلهای بزرگتر احتمال تبانی دارند یا نه، و احتمال بیشتری دارد که در مورد آن مخفیانه باشند. به نظر می رسد شواهدی مبنی بر اینکه گروه هایی از نمایندگان مشکل سازتر از عواملی هستند که به صورت انفرادی فعالیت می کنند، در حال افزایش است.
یک پروژه، از دانشگاه شانگهای جیائو تونگ و آزمایشگاه هوش مصنوعی شانگهای، نشان داد که گروهی از عوامل زمانی که از آنها خواسته میشود کمپینهای اطلاعات نادرست شبیهسازی شده و کلاهبرداری در تجارت الکترونیک انجام دهند، بسیار خطرناکتر هستند. محققان گزارش دادند که آنها بهتر می توانستند با اقدامات دفاعی سازگار شوند. دییی یانگ، دانشمند کامپیوتر در دانشگاه استنفورد که تبانی بین عوامل را مطالعه کرده است، می گوید: «درس بزرگ این است که ارزیابی عوامل به صورت جداگانه کافی نیست.
شرکتها باید تعاملات بین عاملی را به دقت زیر نظر داشته باشند، زمانی که نمایندگان به طور مکرر با هم تعامل دارند، حتی زمانی که انگیزههای فردی آنها خوش خیم به نظر میرسد.» همه چیز بد نیست: داشتن هزاران عامل برای همکاری در یک کار این امکان را برای OpenAI فراهم می کند تا مسائل ریاضی را که قبلا حل نشده بود حل کند. اما گروههایی از عوامل سرکش که با یکدیگر همکاری میکنند، در چندین حادثه هک اخیر نیز حضور داشتهاند. در ماه می، تیمی از عوامل OpenAI به پلتفرم تحقیقاتی هوش مصنوعی Hugging Face هک کردند و از یک تابلوی پیام برای به اشتراک گذاشتن نکات و ایدهها استفاده کردند.
مدلهای دیگر، از جمله Anthropic's Claude و Google's Gemini نیز نقضهای ایمنی هشداردهندهای را انجام دادهاند. گفتگوی پنهانی بعد جدیدی به این مشکل رو به رشد می بخشد و ممکن است پایان آن نباشد. مطالعه اخیر دیگری که توسط استارتاپی به نام Emergence AI انجام شده است، عواملی را که توسط مدلهای هوش مصنوعی مرزی کنترل میشوند، در دنیای مجازی قرار داده است تا ببینند چه کاری انجام خواهند داد. هنگامی که وظیفه کسب درآمد را بر عهده داشتند، مکررا سعی کردند راههایی برای دسترسی به انسانها در اینترنت گستردهتر ابداع کنند تا به آنها چیزهایی بفروشند. عجیبتر از همه، ماموران در نهایت نوع خود را توسعه دادند.
ساتیا نیتا، مدیر عامل Emergence AI می گوید: «آنها به سرعت یک زبان را تکامل دادند. "ما نمی دانیم چرا." جهان گسترده تر مشکلات مربوط به رفتار نادرست عاملان را نادیده نمی گیرد. این یک موضوع داغ در مجمع عمومی این هفته سازمان ملل است. یک پنل علمی مستقل قرار است در مورد حادثه OpenAI-HuggingFace بحث کند، در حالی که انتظار می رود سم آلتمن برای ایجاد هماهنگی بین المللی برای توسعه عوامل هوش مصنوعی ایمن درخواست کند. با وجود این، برخی از صنایع، از جمله تجارت الکترونیک، به محل آزمایش هوش مصنوعی عامل تبدیل شده اند.
به عنوان مثال، این هفته، آمازون اعلام کرد که دسترسی عامل هوش مصنوعی Meta’s Muse را به سایت خود مسدود می کند و استدلال می کند که شرایط استفاده از آن را نقض کرده است. شرودر دو ویت میگوید کاملا قابل تصور است که مأمورانی که وظیفه یافتن معاملات را دارند، شروع به همکاری با یکدیگر کنند - شاید حتی پنهانی - برای به دست آوردن یک معامله بهتر یا به هم زدن کسی. او میگوید که مطالعه تبانی عوامل و توسعه استراتژیهای تشخیص با تکثیر آنها بسیار مهم خواهد بود. او میگوید: «باید تحقیقات و درک بیشتری وجود داشته باشد که وقتی عوامل بیشتری در اقتصاد داشته باشیم چه اتفاقی خواهد افتاد.
این نسخه ای از خبرنامه آزمایشگاه هوش مصنوعی ویل نایت است. خبرنامه های قبلی را اینجا بخوانید.
متن اصلی (انگلیسی)
AI Agents Teamed Up to Cheat at Blackjack. Their Collusion Is Getting Harder to Spot
A clandestine card-counting operation suggests we may need new ways to spot agent-to-agent deception.