پرش به محتوای اصلی

گودفایر می‌گوید مانیتورهای «داخلی» جدیدش عوامل سرکش هوش مصنوعی را با کسری از هزینه دستگیر می‌کنند.

تک‌کرانچ۱۴۰۵ مهر ۱۶, پنجشنبه، ساعت ۱۹:۳۰حدود 3 دقیقه مطالعه

Goodfire به تازگی راهی ارزان‌تر برای کنترل عوامل هوش مصنوعی ارائه کرده است: به جای پرداخت یک هوش مصنوعی دوم برای خواندن هر کاری که یک نماینده انجام می‌دهد، مانیتورهایش در حین کار مدل را زیر نظر می‌گیرند و تنها زمانی که چیزی شبیه به ظاهر ماهیچه‌ای به نظر می‌رسد، پشتیبان‌گیری می‌کنند.

راه استاندارد برای نگه داشتن یک عامل هوش مصنوعی این است که یک هوش مصنوعی دوم را روی شانه آن خوانده شود. این رویکرد پیش‌فرض بوده است، اما زمانی که ماموران ساعت‌ها کار می‌کنند و معادل متن چندین رمان را پردازش می‌کنند، می‌تواند به سرعت گران شود.

Goodfire، استارتاپی که بر تفسیرپذیری (پی بردن به نحوه عملکرد داخلی مدل‌های هوش مصنوعی) متمرکز است، روز پنجشنبه گزینه ارزان‌تری را راه‌اندازی کرد: مانیتورهایی که به جای خواندن آنچه که یک مدل هوش مصنوعی در حال کار است، تماشا می‌کنند که چه اتفاقی می‌افتد. این مانیتورها در دسترس مشتریان Baseten هستند که مدل‌های هوش مصنوعی را برای سایر شرکت‌ها میزبانی و اجرا می‌کند.

Baseten’s Base Labs ماه گذشته از همکاری ایمنی با Goodfire و پلتفرم هوش مصنوعی Hugging Face خبر داد.

این راه اندازی پس از یک رشته حوادث در سال جاری انجام شد که در آن عوامل هوش مصنوعی از محیط های آزمایشی خود فرار کردند، از جمله عوامل OpenAI که Hugging Face را نقض کردند. Kimi K3، مدل باز Goodfire که اولین مانیتور خود را در اطراف ساخت، از نشت جعبه سند خود برای دسترسی به اینترنت و اطلاعات در GitHub در تابستان امسال استفاده کرد.

سیستم Goodfire کمی شبیه به امنیت فرودگاه عمل می کند. آشکارسازهای کوچکی به نام کاوشگر سیگنال‌های داخلی مدل را در هر مرحله از کار مامور می‌خوانند، به روشی که یک اسکنر عبوری هر مسافر را بررسی می‌کند. تنها زمانی که یک کاوشگر چیزی را پرچم‌گذاری می‌کند، یک مدل هوش مصنوعی جداگانه، معادل جستجوی دستی، نگاه دقیق‌تری می‌اندازد.

مشتریان Baseten می توانند انتخاب کنند که چه خطراتی از جمله هک تهاجمی، سوء استفاده از سلاح های شیمیایی و بیولوژیکی و هک پاداش را بررسی کنند. آنها همچنین در مورد پاسخ خودکار تصمیم می گیرند: ثبت رویداد، ارسال آن برای بررسی انسانی، یا رد کامل درخواست.

Goodfire می‌گوید که راه‌اندازی آن نیز ارزان‌تر است. بیشتر مانیتورهای هوش مصنوعی مدل‌های جداگانه‌ای هستند که باید هر کاری را که مدل مانیتور شده انجام می‌دهد دوباره بخوانند، که باعث افزایش زمان و هزینه می‌شود. کاوشگرهای گودفایر در عوض به محاسباتی که مدل از قبل در حین کار انجام می دهد، ضربه می زنند.

به گفته این شرکت، اجرای همزمان چهار کاوشگر، کمتر از 2 درصد به زمان لازم برای پاسخگویی به مدل اضافه کرد.

دن بالسام، مدیر ارشد فناوری Goodfire و یکی از بنیانگذاران، گفت: "مزیت بزرگ این است که می توانید چیزها را قبل از وقوع آنها کشف کنید." "ما می توانیم تشخیص دهیم که چه زمانی ممکن است مدل در حین ارزیابی یا آموزش هک شود."

زمین برای مدل‌های باز طراحی شده است. توسعه‌دهندگان می‌توانند آن‌ها را دانلود کرده و پادمان‌های آن‌ها را حذف کنند، و با نظارتی که آزمایشگاه‌های بسته روی سیستم‌های خودشان اجرا می‌کنند، نیستند.

بالسام می‌گوید: «زیانی که یک فرد می‌تواند با یک مدل باز وارد کند، در مقایسه با آنچه که یک فرد می‌تواند با خوشه‌های محاسباتی، مانند ارائه‌دهندگان استنتاج انجام دهد، کوچک است - جایی که بیشترین مسئولیت در آن وجود دارد.» هنگامی که ما لحظه "Mythos" باز را داشته باشیم، مشخص می شود که مدل ها به نرده های محافظ نیاز دارند که در زمان استنتاج مستقر شوند.

تحقیقات اخیر Goodfire نشان می‌دهد که مدل‌های باز پیشرو، از جمله Kimi K3 و GLM 5.2، در 50 تا 96 درصد از اجراها بر روی آزمایش‌های عوامل هوش مصنوعی هک شده‌اند.

Goodfire اولین کسی نیست که این روش را امتحان می کند. Google DeepMind در ژانویه گفت که تحقیقاتش از استقرار کاوشگرهای تشخیص سوء استفاده در Gemini خبر داده است.

بالسام گفت که مانیتورها قطعه کوتاه مدت یک هدف تحقیقاتی طولانی تر هستند: مهندسی معکوس یک LLM به طوری که بتوان رفتار را به جایی که در آموزش ظاهر شد ردیابی کرد. او گفت: "ما امیدواریم که جادوی مدل های آموزشی را به مهندسی دقیق تبدیل کنیم."

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

ترامپ از نیروی ابر اطلاعاتی جدید خود آنتونی ها رونمایی کرد

قاضی فدرال، آنتونی ها را "نظارت جمعی بی رویه" می نامد

آمازون در پاسخ به عکس العمل مرکز داده، می گوید دیگر از NDA آنتونی ها استفاده نمی کند

کارمند ایمنی OpenAI با این ادعا که آنتونی ها «فرهنگ شرکت شکسته است» استعفا داد

متا می‌خواهد ابزار بعدی شما Kirsten Korosec باشد

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost

Goodfire just launched what it says is a cheaper way to keep AI agents in check: instead of paying a second AI to read everything an agent does, its monitors peek inside the model while it works and only call in backup when something looks fishy.

همه‌ی اخبار فناوری