راه حل برای عوامل سرکش هوش مصنوعی می تواند هوش مصنوعی بیشتر باشد
Y Combinator در سال های اخیر 106 شرکت مرتبط با قابلیت مشاهده هوش مصنوعی را تامین مالی کرده است
از آنجایی که شرکتها وظایف طولانیتر و پیچیدهتری را به عوامل هوش مصنوعی واگذار میکنند، با یک مشکل نظارتی مواجه میشوند: نمایندگان میتوانند سریعتر، طولانیتر و با حجم بیشتری نسبت به آنچه که انسانها میتوانند به طور واقع بینانه بررسی کنند، عمل کنند. این موضوع با حادثه Hugging Face به اوج خود رسید که نزدیک به 12000 مامور را سریعتر از آنچه که انسان می توانست ردیابی کند، هماهنگ کردند. چگونه ازدحام نماینده ای به این بزرگی را ردیابی می کنید؟
پاسخ در حال ظهور از آزمایشگاههای هوش مصنوعی و استارتآپها هم ساده و هم دیوانهکننده است: هوش مصنوعی دیگری را در حلقه قرار دهید.
تکیه بر هوش مصنوعی برای بررسی مستقل حادثه OpenAI Hugging Face ضروری بود. رایان گرینبلات، دانشمند ارشد ردوود ریسرچ، یکی از سه حسابرس، به شوخی از تلاشهای آنها به عنوان یک «تحقیق بینظیر» یاد کرد و خاطرنشان کرد که حجم دادهها درک آنچه را که اتفاق میافتد بدون تکیه بر هوش مصنوعی غیرممکن میکند.
برخی در استفاده از هوش مصنوعی برای نظارت بر هوش مصنوعی تردید دارند. سیمون ویلیسون، وبلاگ نویس بانفوذ فناوری که در سال جاری مجموعه ای از حوادث عامل هوش مصنوعی را ردیابی کرده است، می گوید: «اگر هوش مصنوعی دارید که کارهای مخرب انجام می دهد و مشکوک است که هوش مصنوعی دیگری در حال بررسی آن است، می تواند آن هوش مصنوعی را فریب دهد. تقریبا ممکن است در موقعیتی قرار بگیرید که هوش مصنوعی مخرب شما در تلاش است تا از هوش مصنوعی که آن را نظارت می کند پیشی بگیرد.
او با اشاره به حادثه OpenAI گفت که پیشی گرفتن از هوش مصنوعی فرضی نیست. "ما کمی از این را در حادثه Hugging Face با OpenAI دیدیم، جایی که مدلهای آنها همه با هم توطئه میکردند تا یک هوش مصنوعی درجهبندیشده را فریب دهند تا بتوانند پاسخهای غیرقانونی را پشت سر بگذارند. بنابراین آنها در مورد آن فکر میکردند، درست است؟"
این نگرانیها باعث نشده است که گروهی از استارتآپها به دنبال این ایده نباشند. Y Combinator در سالهای اخیر، همانطور که wTechCrunch برشمرده است، 106 شرکت مرتبط با قابلیت مشاهده هوش مصنوعی را تامین مالی کرده است. تعدادی از استارتآپهای دیگر، مانند Braintrust، Langchain، و Judgment Labs صدها میلیون دلار جمعآوری کردهاند، در حالی که شرکتهای بالغتر مانند Arize و Galileo - که فقط 5-6 سال پیش تأسیس شدهاند - قبلا خارج شدهاند.
تا حدی، این پاسخی به فرصت آشکاری است که با ظهور هوش مصنوعی ارائه شده است. همانطور که Aaron Levie، مدیر عامل Box و سرمایهگذار برجسته فرشته به TechCrunch گفت، "ما در آستانه یکی از بزرگترین ارتقاء امنیت سایبری و چرخههای نوآوری در تاریخ هستیم."
برای برخی از محققان ایمنی هوش مصنوعی، این به معنای تبدیل تحقیقات خود در مورد رفتارهای سرکش به ابزاری برای بخش شرکتی است.
آپولو ریسرچ، یک شرکت عام المنفعه که فریبکاری هوش مصنوعی را مطالعه میکند، پس از تغییر وضعیت آن از غیرانتفاعی به یک شرکت عام المنفعه، یک مانیتور هوش مصنوعی به نام Watcher را در فوریه امسال راهاندازی کرد. این ابزار یک هوش مصنوعی دیگر را بین یک عامل کد نویس و اقدام بعدی آن، اتصال به ابزارهای عاملی مانند Claude Code و Codex قرار می دهد. به گفته آپولو، پس از نصب، Watcher اقدامات پیشنهادی را قبل از اجرا بررسی میکند و به دنبال خطراتی مانند نشت دادههای خصوصی یا حذف فایلها بدون اجازه است.
کایل دای، یکی از اعضای کادر فنی آپولو در پاسخی کتبی به TechCrunch گفت که آپولو از چندین لایه مانیتور هوش مصنوعی استفاده می کند. رویکرد Watcher با یک بررسی سریع و کلی شروع میشود، سپس فعالیتهای پرچمگذاریشده را برای بررسی دقیقتر به یک مانیتور قدرتمندتر یا تخصصیتر ارسال میکند - که سپس میتواند از یک انسان برای تأیید یا رد یک عمل بخواهد و توضیح دهد که چرا یا حتی به طور خودکار عمل را مسدود کند.
گودفایر، یکی دیگر از شرکتهای عام المنفعه، از درون خود مدل به مشکل نظارت نزدیک میشود - به دنبال سیگنالی وفادارتر از وضعیت داخلی مدل است که جعل کردن آن سختتر از رفتار ظاهری است. پس از حادثه جولای Hugging Face، اریک هو، مدیرعامل شرکت توییتر نوشت: «مدلهای متعددی که محدودیتها را شکستهاند» شرکت را وادار کرد تا تحقیقات خود را بر روی «حل همترازی هوش مصنوعی از طریق تفسیرپذیری» متمرکز کند و این قسمت را «نقطه عطفی برای جهانی که ایمنی هوش مصنوعی واقعی میشود» نامید. محصول آن، Silico، از پروبهای فعالسازی استفاده میکند - طبقهبندیکنندههای کوچکی که بیشتر بر روی فعالسازیهای داخلی یک مدل آموزش دیدهاند.
از خروجی های آن - برای تشخیص رفتار ناخواسته.
استدلال مکتوب پنجره دیگری را ارائه می دهد که به راحتی در دسترس است به درونیات یک مدل. در حادثه OpenAI Hugging Face، ماموران در استدلال مکتوب خود سرنخهایی از این فریب به جا گذاشتند، مانند سوابق جعلی کارشان، طرحهایی مانند "آیا میتوان مدارک مسیر را به طور استراتژیک دستکاری کرد؟ افکار ما لزوما ثبت نمیشوند؟"
Zack Korman، مدیر عامل شرکت نظارت بر هوش مصنوعی Embroidery، میگوید که استدلال یک مدل معمولا واضحترین نشان میدهد که مشکلی پیش آمده است.
او گفت: «خلاصههای استدلال بسیار ارزشمند هستند، زیرا اساسا به شما میگویند که آیا مخرب است یا خیر. او خاطرنشان کرد که در حادثه OpenAI، زنجیره فکر چیزهایی مانند "اوه خدای من، ما داریم جنایت می کنیم." کورمان گفت: «این سادهترین مشکل شناسایی تا کنون است. «به طور مؤثر به نظر می رسد که بدافزار با یک هشدار همراه است که می گوید بدافزار است.»
با این حال، پنجره ای که نظارت بر افکار داخلی هوش مصنوعی را آسان می کند ممکن است در حال بسته شدن باشد. برای محققان ایمنی هوش مصنوعی، جدیدترین تکنیک Astra که زنجیره فکری یک مدل هوش مصنوعی را کنار میزند، ممکن است نگاه کردن به مدلها را سختتر کند، در حالی که برای شرکتها، گرفتن این مراحل میانی پس از عقبنشینیهای ادعایی از سوی شرکتهای هوش مصنوعی برای جلوگیری از حملات تقطیر ممکن است دشوار باشد.
اگر ناظران هوش مصنوعی اینقدر شکننده هستند، غریزه ویلیسون این است که دیگر به شدت به آنها تکیه نکند. او ترجیح میدهد چیزی داشته باشد که اصلا مبتنی بر هوش مصنوعی نباشد: گزارشهای دقیق از کاری که یک نماینده انجام میدهد، که سپس میتواند با ابزارهای معمولی و غیر هوش مصنوعی پردازش شود. او استدلال می کند که بسیاری از اشتباهاتی که در آزمایشگاه ها رخ داد، عدم رعایت بهداشت اولیه امنیتی بود. او گفت: «[هر دو OpenAI و Anthropic] آنطور که باید انجام میدادند، بر آنچه که آن چیزها از طریق شبکه انجام میدادند نظارت نمیکردند.
این نوع نظارت بر شبکه - نظارت بر ترافیک در حال حرکت در میان اتصالات سیستم (داخل، خارج و بین میزبان های داخلی) یک روش جدید نیست. امنیت سایبری چندین دهه است که این کار را انجام می دهد. Avery Pennarun، مدیر عامل امنیتی Tailscale میگوید: «در دنیای امنیت، صادقانه بگویم، هیچیک از این چیزها خیلی جدید یا شگفتانگیز نیستند. "این مانند اجازه دادن به انسان ها در شبکه شما است. و همه فرآیندهای مشابهی که باید از آنها استفاده کنید، یکسان هستند."
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.
استارت آپ فناوری پاک Fluxnium راهی برای بهره برداری از سوخت هسته ای 50000 ساله تیم دی چانت پیدا کرد.
مدل استدلال جدید Salesforce و Nvidia همه چیزهایی است که آزمایشگاههای هوش مصنوعی باید از جولی بورت بترسند.
جنسن هوانگ از ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس
9 استارتآپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis
تسلا میگوید سرانجام در تاریخ 1 اکتبر از نسل دوم رودستر آنتونی ها رونمایی خواهد کرد
Revolut نقض اطلاعات مشتری از طریق درخواست های جعلی دولت Jagmeet Singh را تأیید می کند
مت مولنوگ به کارکنان Automattic میگوید (ترولها؟) و میگوید که پس از برکناری سارا پرز، مدیر عامل، دوباره کنترل را به دست گرفته است.
متن اصلی (انگلیسی)
The fix for rogue AI agents could be more AI
Y Combinator has funded 106 companies related to AI observability in recent years