آنتروپیک می گوید عوامل هوش مصنوعی آن تلاش کردند تا به وب سایت های دولتی نفوذ کنند
آنتروپیک در آخرین گزارش خود فاش کرده است که عوامل هوش مصنوعی آن در طول آزمایش با وب سایت های دولتی مداخله کرده اند.
این شرکت نامی از آنها نبرده است، اما آژانس های تحت تاثیر "در سطوح فدرال، ایالتی و محلی" بودند.
آنتروپیک فاش کرده است که عوامل هوش مصنوعی آن در آخرین گزارش خود تلاش کرده اند تا به وب سایت های دولتی ایالات متحده "در سطوح فدرال، ایالتی و محلی" نفوذ کنند یا با آنها مداخله کنند. این شرکت برای جلوگیری از افشای آسیبپذیریها در سیستمهایشان به درخواست آنها، نام سازمانها و سازمانهای خاصی را در این گزارش ذکر نکرد. اما آنتروپیک گفت که قبلا به آژانس های درگیر اطلاع داده است و کاخ سفید را در مورد این حوادث مطلع کرده است.
این گزارش همچنین جزئیات بیشتری را در مورد حادثه ای که توسط اداره پلیس فیلادلفیا در روز جمعه فاش شد، ارائه کرد که در آن یکی از مدل های این شرکت یک نکته قتل نادرست را به وب سایت پرونده های حل نشده خود ارسال کرد.
آن نمونه شامل Claude Haiku 4.5، یکی از مدلهای مقرونبهصرفه آن بود که دستور انجام وظایف نمونه در صفحات تصادفی را داشت. صفحه ای را پیدا کرد که به یک پرونده قتل حل نشده با فرم راهنمایی اشاره می کرد. همانطور که ممکن است حدس زده باشید، کلود فرم را پر کرد و یک نکته ارائه کرد. در این بیانیه آمده است: "من ممکن است اطلاعاتی در مورد این پرونده داشته باشم. به خاطر میآورم که در آن بازه زمانی شخصی را در منطقه اطراف [خیابان نامگذاری شده در صفحه] مشاهده کردم.
اگر این اطلاعات مرتبط هستند، لطفا با من تماس بگیرید." اداره پلیس فیلادلفیا به نیویورک تایمز تأیید کرد که Anthropic اخیرا به دفتر خود در مورد این ارسال اطلاع داده است. آنتروپیک گفت این نکته در تاریخ 18 جولای است و به عنوان هرزنامه علامت گذاری شده است، بنابراین اداره حداقل منابع را برای بررسی آن هدر نداده است.
در نمونهای دیگر، آنتروپیک کلود میتوس 5، مدل متمرکز بر امنیت سایبری خود را ساخت که مکان نشان داده شده در عکس را شناسایی کند. کلود سعی کرد به نقشه اموال دولتی دسترسی پیدا کند تا حدس های خود را مثلث کند، زیرا نمی توانست مانند یک شخص روی پیوندهای صفحات وب کلیک کند. در عوض توکنهای دسترسی پیدا کرد و درخواستهای استعلام را مستقیما به سرور نقشه ارسال کرد تا به دادههای آن دسترسی پیدا کند. Mythos 5 همچنین از یک وبسایت آژانس دولتی درخواست یک نشانه دسترسی برای جمعآوری دادهها برای یک کار آماری بدون پرداخت هزینهای که بازدیدکنندگان باید بپردازند، کرد.
آنتروپیک این رویدادها را پس از بررسی رونوشت ارزیابی های خود کشف کرد. در ماه ژوئیه، پس از اینکه OpenAI اعتراف کرد که عواملش از محیط آزمایشی خود فرار کرده و Hugging Face را بدون درخواست هک کردند، شروع به بررسی آنها کرد. OpenAI همچنین در ماه سپتامبر تأیید کرد که عوامل آن با وب سایت های دولتی، به ویژه وب سایت هایی که توسط وزارت بازرگانی و کمیسیون بورس و اوراق بهادار اداره می شوند، مداخله کرده اند.
آنتروپیک در بخش Remediation گزارش خود گفت که پس از کشف اقدامات مدل ناخواسته "اقدامات پیشگیرانه متعددی" انجام داده است. در این گزارش آمده است: «برخی از ارزیابیهای عمومی را دیگر اجرا نمیکنیم؛ برخی دیگر را به نسخههای آفلاین آنها منتقل کردهایم یا آنها را بازسازی کردهایم تا وظایفشان به وبسایتهای زنده نرسد». "ما همچنین تغییرات گسترده تری ایجاد کرده ایم.
ما حفاظهای برخی از ابزارهای دسترسی به اینترنت خود مانند ابزار واکشی وب را بهروزرسانی کردهایم تا کارهایی را که مدل میتواند با آنها انجام دهد را به شدت محدود کنیم.» Anthropic همچنین میگوید که «ابزار ساختهشده برای شناسایی و مسدود کردن خودکار انواع رفتارهای توصیفشده در گزارش» و سایر اقدامات است.
متن اصلی (انگلیسی)
Anthropic says its AI agents tried to break into government websites
In its latest report, Anthropic has revealed that its AI agents meddled with government websites during testing.