گودفایر میگوید مانیتورهای «داخلی» جدیدش عوامل سرکش هوش مصنوعی را با کسری از هزینه دستگیر میکنند.
Goodfire به تازگی راهی ارزانتر برای کنترل عوامل هوش مصنوعی ارائه کرده است: به جای پرداخت یک هوش مصنوعی دوم برای خواندن هر کاری که یک نماینده انجام میدهد، مانیتورهایش در حین کار مدل را زیر نظر میگیرند و تنها زمانی که چیزی شبیه به ظاهر ماهیچهای به نظر میرسد، پشتیبانگیری میکنند.
راه استاندارد برای نگه داشتن یک عامل هوش مصنوعی این است که یک هوش مصنوعی دوم را روی شانه آن خوانده شود. این رویکرد پیشفرض بوده است، اما زمانی که ماموران ساعتها کار میکنند و معادل متن چندین رمان را پردازش میکنند، میتواند به سرعت گران شود.
Goodfire، استارتاپی که بر تفسیرپذیری (پی بردن به نحوه عملکرد داخلی مدلهای هوش مصنوعی) متمرکز است، روز پنجشنبه گزینه ارزانتری را راهاندازی کرد: مانیتورهایی که به جای خواندن آنچه که یک مدل هوش مصنوعی در حال کار است، تماشا میکنند که چه اتفاقی میافتد. این مانیتورها در دسترس مشتریان Baseten هستند که مدلهای هوش مصنوعی را برای سایر شرکتها میزبانی و اجرا میکند.
Baseten’s Base Labs ماه گذشته از همکاری ایمنی با Goodfire و پلتفرم هوش مصنوعی Hugging Face خبر داد.
این راه اندازی پس از یک رشته حوادث در سال جاری انجام شد که در آن عوامل هوش مصنوعی از محیط های آزمایشی خود فرار کردند، از جمله عوامل OpenAI که Hugging Face را نقض کردند. Kimi K3، مدل باز Goodfire که اولین مانیتور خود را در اطراف ساخت، از نشت جعبه سند خود برای دسترسی به اینترنت و اطلاعات در GitHub در تابستان امسال استفاده کرد.
سیستم Goodfire کمی شبیه به امنیت فرودگاه عمل می کند. آشکارسازهای کوچکی به نام کاوشگر سیگنالهای داخلی مدل را در هر مرحله از کار مامور میخوانند، به روشی که یک اسکنر عبوری هر مسافر را بررسی میکند. تنها زمانی که یک کاوشگر چیزی را پرچمگذاری میکند، یک مدل هوش مصنوعی جداگانه، معادل جستجوی دستی، نگاه دقیقتری میاندازد.
مشتریان Baseten می توانند انتخاب کنند که چه خطراتی از جمله هک تهاجمی، سوء استفاده از سلاح های شیمیایی و بیولوژیکی و هک پاداش را بررسی کنند. آنها همچنین در مورد پاسخ خودکار تصمیم می گیرند: ثبت رویداد، ارسال آن برای بررسی انسانی، یا رد کامل درخواست.
Goodfire میگوید که راهاندازی آن نیز ارزانتر است. بیشتر مانیتورهای هوش مصنوعی مدلهای جداگانهای هستند که باید هر کاری را که مدل مانیتور شده انجام میدهد دوباره بخوانند، که باعث افزایش زمان و هزینه میشود. کاوشگرهای گودفایر در عوض به محاسباتی که مدل از قبل در حین کار انجام می دهد، ضربه می زنند.
به گفته این شرکت، اجرای همزمان چهار کاوشگر، کمتر از 2 درصد به زمان لازم برای پاسخگویی به مدل اضافه کرد.
دن بالسام، مدیر ارشد فناوری Goodfire و یکی از بنیانگذاران، گفت: "مزیت بزرگ این است که می توانید چیزها را قبل از وقوع آنها کشف کنید." "ما می توانیم تشخیص دهیم که چه زمانی ممکن است مدل در حین ارزیابی یا آموزش هک شود."
زمین برای مدلهای باز طراحی شده است. توسعهدهندگان میتوانند آنها را دانلود کرده و پادمانهای آنها را حذف کنند، و با نظارتی که آزمایشگاههای بسته روی سیستمهای خودشان اجرا میکنند، نیستند.
بالسام میگوید: «زیانی که یک فرد میتواند با یک مدل باز وارد کند، در مقایسه با آنچه که یک فرد میتواند با خوشههای محاسباتی، مانند ارائهدهندگان استنتاج انجام دهد، کوچک است - جایی که بیشترین مسئولیت در آن وجود دارد.» هنگامی که ما لحظه "Mythos" باز را داشته باشیم، مشخص می شود که مدل ها به نرده های محافظ نیاز دارند که در زمان استنتاج مستقر شوند.
تحقیقات اخیر Goodfire نشان میدهد که مدلهای باز پیشرو، از جمله Kimi K3 و GLM 5.2، در 50 تا 96 درصد از اجراها بر روی آزمایشهای عوامل هوش مصنوعی هک شدهاند.
Goodfire اولین کسی نیست که این روش را امتحان می کند. Google DeepMind در ژانویه گفت که تحقیقاتش از استقرار کاوشگرهای تشخیص سوء استفاده در Gemini خبر داده است.
بالسام گفت که مانیتورها قطعه کوتاه مدت یک هدف تحقیقاتی طولانی تر هستند: مهندسی معکوس یک LLM به طوری که بتوان رفتار را به جایی که در آموزش ظاهر شد ردیابی کرد. او گفت: "ما امیدواریم که جادوی مدل های آموزشی را به مهندسی دقیق تبدیل کنیم."
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
ترامپ از نیروی ابر اطلاعاتی جدید خود آنتونی ها رونمایی کرد
قاضی فدرال، آنتونی ها را "نظارت جمعی بی رویه" می نامد
آمازون در پاسخ به عکس العمل مرکز داده، می گوید دیگر از NDA آنتونی ها استفاده نمی کند
کارمند ایمنی OpenAI با این ادعا که آنتونی ها «فرهنگ شرکت شکسته است» استعفا داد
متا میخواهد ابزار بعدی شما Kirsten Korosec باشد
متن اصلی (انگلیسی)
Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
Goodfire just launched what it says is a cheaper way to keep AI agents in check: instead of paying a second AI to read everything an agent does, its monitors peek inside the model while it works and only call in backup when something looks fishy.