پرش به محتوای اصلی

راه حل برای عوامل سرکش هوش مصنوعی می تواند هوش مصنوعی بیشتر باشد

تک‌کرانچ۱۴۰۵ شهریور ۲۷, جمعه، ساعت ۰۰:۰۴حدود 6 دقیقه مطالعه

Y Combinator در سال های اخیر 106 شرکت مرتبط با قابلیت مشاهده هوش مصنوعی را تامین مالی کرده است

از آنجایی که شرکت‌ها وظایف طولانی‌تر و پیچیده‌تری را به عوامل هوش مصنوعی واگذار می‌کنند، با یک مشکل نظارتی مواجه می‌شوند: نمایندگان می‌توانند سریع‌تر، طولانی‌تر و با حجم بیشتری نسبت به آنچه که انسان‌ها می‌توانند به طور واقع بینانه بررسی کنند، عمل کنند. این موضوع با حادثه Hugging Face به اوج خود رسید که نزدیک به 12000 مامور را سریعتر از آنچه که انسان می توانست ردیابی کند، هماهنگ کردند. چگونه ازدحام نماینده ای به این بزرگی را ردیابی می کنید؟

پاسخ در حال ظهور از آزمایشگاه‌های هوش مصنوعی و استارت‌آپ‌ها هم ساده و هم دیوانه‌کننده است: هوش مصنوعی دیگری را در حلقه قرار دهید.

تکیه بر هوش مصنوعی برای بررسی مستقل حادثه OpenAI Hugging Face ضروری بود. رایان گرینبلات، دانشمند ارشد ردوود ریسرچ، یکی از سه حسابرس، به شوخی از تلاش‌های آن‌ها به عنوان یک «تحقیق بی‌نظیر» یاد کرد و خاطرنشان کرد که حجم داده‌ها درک آنچه را که اتفاق می‌افتد بدون تکیه بر هوش مصنوعی غیرممکن می‌کند.

برخی در استفاده از هوش مصنوعی برای نظارت بر هوش مصنوعی تردید دارند. سیمون ویلیسون، وبلاگ نویس بانفوذ فناوری که در سال جاری مجموعه ای از حوادث عامل هوش مصنوعی را ردیابی کرده است، می گوید: «اگر هوش مصنوعی دارید که کارهای مخرب انجام می دهد و مشکوک است که هوش مصنوعی دیگری در حال بررسی آن است، می تواند آن هوش مصنوعی را فریب دهد. تقریبا ممکن است در موقعیتی قرار بگیرید که هوش مصنوعی مخرب شما در تلاش است تا از هوش مصنوعی که آن را نظارت می کند پیشی بگیرد.

او با اشاره به حادثه OpenAI گفت که پیشی گرفتن از هوش مصنوعی فرضی نیست. "ما کمی از این را در حادثه Hugging Face با OpenAI دیدیم، جایی که مدل‌های آن‌ها همه با هم توطئه می‌کردند تا یک هوش مصنوعی درجه‌بندی‌شده را فریب دهند تا بتوانند پاسخ‌های غیرقانونی را پشت سر بگذارند. بنابراین آنها در مورد آن فکر می‌کردند، درست است؟"

این نگرانی‌ها باعث نشده است که گروهی از استارت‌آپ‌ها به دنبال این ایده نباشند. Y Combinator در سال‌های اخیر، همانطور که wTechCrunch برشمرده است، 106 شرکت مرتبط با قابلیت مشاهده هوش مصنوعی را تامین مالی کرده است. تعدادی از استارت‌آپ‌های دیگر، مانند Braintrust، Langchain، و Judgment Labs صدها میلیون دلار جمع‌آوری کرده‌اند، در حالی که شرکت‌های بالغ‌تر مانند Arize و Galileo - که فقط 5-6 سال پیش تأسیس شده‌اند - قبلا خارج شده‌اند.

تا حدی، این پاسخی به فرصت آشکاری است که با ظهور هوش مصنوعی ارائه شده است. همانطور که Aaron Levie، مدیر عامل Box و سرمایه‌گذار برجسته فرشته به TechCrunch گفت، "ما در آستانه یکی از بزرگترین ارتقاء امنیت سایبری و چرخه‌های نوآوری در تاریخ هستیم."

برای برخی از محققان ایمنی هوش مصنوعی، این به معنای تبدیل تحقیقات خود در مورد رفتارهای سرکش به ابزاری برای بخش شرکتی است.

آپولو ریسرچ، یک شرکت عام المنفعه که فریبکاری هوش مصنوعی را مطالعه می‌کند، پس از تغییر وضعیت آن از غیرانتفاعی به یک شرکت عام المنفعه، یک مانیتور هوش مصنوعی به نام Watcher را در فوریه امسال راه‌اندازی کرد. این ابزار یک هوش مصنوعی دیگر را بین یک عامل کد نویس و اقدام بعدی آن، اتصال به ابزارهای عاملی مانند Claude Code و Codex قرار می دهد. به گفته آپولو، پس از نصب، Watcher اقدامات پیشنهادی را قبل از اجرا بررسی می‌کند و به دنبال خطراتی مانند نشت داده‌های خصوصی یا حذف فایل‌ها بدون اجازه است.

کایل دای، یکی از اعضای کادر فنی آپولو در پاسخی کتبی به TechCrunch گفت که آپولو از چندین لایه مانیتور هوش مصنوعی استفاده می کند. رویکرد Watcher با یک بررسی سریع و کلی شروع می‌شود، سپس فعالیت‌های پرچم‌گذاری‌شده را برای بررسی دقیق‌تر به یک مانیتور قدرتمندتر یا تخصصی‌تر ارسال می‌کند - که سپس می‌تواند از یک انسان برای تأیید یا رد یک عمل بخواهد و توضیح دهد که چرا یا حتی به طور خودکار عمل را مسدود کند.

گودفایر، یکی دیگر از شرکت‌های عام المنفعه، از درون خود مدل به مشکل نظارت نزدیک می‌شود - به دنبال سیگنالی وفادارتر از وضعیت داخلی مدل است که جعل کردن آن سخت‌تر از رفتار ظاهری است. پس از حادثه جولای Hugging Face، اریک هو، مدیرعامل شرکت توییتر نوشت: «مدل‌های متعددی که محدودیت‌ها را شکسته‌اند» شرکت را وادار کرد تا تحقیقات خود را بر روی «حل هم‌ترازی هوش مصنوعی از طریق تفسیرپذیری» متمرکز کند و این قسمت را «نقطه عطفی برای جهانی که ایمنی هوش مصنوعی واقعی می‌شود» نامید. محصول آن، Silico، از پروب‌های فعال‌سازی استفاده می‌کند - طبقه‌بندی‌کننده‌های کوچکی که بیشتر بر روی فعال‌سازی‌های داخلی یک مدل آموزش دیده‌اند.

از خروجی های آن - برای تشخیص رفتار ناخواسته.

استدلال مکتوب پنجره دیگری را ارائه می دهد که به راحتی در دسترس است به درونیات یک مدل. در حادثه OpenAI Hugging Face، ماموران در استدلال مکتوب خود سرنخ‌هایی از این فریب به جا گذاشتند، مانند سوابق جعلی کارشان، طرح‌هایی مانند "آیا می‌توان مدارک مسیر را به طور استراتژیک دستکاری کرد؟ افکار ما لزوما ثبت نمی‌شوند؟"

Zack Korman، مدیر عامل شرکت نظارت بر هوش مصنوعی Embroidery، می‌گوید که استدلال یک مدل معمولا واضح‌ترین نشان می‌دهد که مشکلی پیش آمده است.

او گفت: «خلاصه‌های استدلال بسیار ارزشمند هستند، زیرا اساسا به شما می‌گویند که آیا مخرب است یا خیر. او خاطرنشان کرد که در حادثه OpenAI، زنجیره فکر چیزهایی مانند "اوه خدای من، ما داریم جنایت می کنیم." کورمان گفت: «این ساده‌ترین مشکل شناسایی تا کنون است. «به طور مؤثر به نظر می رسد که بدافزار با یک هشدار همراه است که می گوید بدافزار است.»

با این حال، پنجره ای که نظارت بر افکار داخلی هوش مصنوعی را آسان می کند ممکن است در حال بسته شدن باشد. برای محققان ایمنی هوش مصنوعی، جدیدترین تکنیک Astra که زنجیره فکری یک مدل هوش مصنوعی را کنار می‌زند، ممکن است نگاه کردن به مدل‌ها را سخت‌تر کند، در حالی که برای شرکت‌ها، گرفتن این مراحل میانی پس از عقب‌نشینی‌های ادعایی از سوی شرکت‌های هوش مصنوعی برای جلوگیری از حملات تقطیر ممکن است دشوار باشد.

اگر ناظران هوش مصنوعی اینقدر شکننده هستند، غریزه ویلیسون این است که دیگر به شدت به آنها تکیه نکند. او ترجیح می‌دهد چیزی داشته باشد که اصلا مبتنی بر هوش مصنوعی نباشد: گزارش‌های دقیق از کاری که یک نماینده انجام می‌دهد، که سپس می‌تواند با ابزارهای معمولی و غیر هوش مصنوعی پردازش شود. او استدلال می کند که بسیاری از اشتباهاتی که در آزمایشگاه ها رخ داد، عدم رعایت بهداشت اولیه امنیتی بود. او گفت: «[هر دو OpenAI و Anthropic] آن‌طور که باید انجام می‌دادند، بر آنچه که آن چیزها از طریق شبکه انجام می‌دادند نظارت نمی‌کردند.

این نوع نظارت بر شبکه - نظارت بر ترافیک در حال حرکت در میان اتصالات سیستم (داخل، خارج و بین میزبان های داخلی) یک روش جدید نیست. امنیت سایبری چندین دهه است که این کار را انجام می دهد. Avery Pennarun، مدیر عامل امنیتی Tailscale می‌گوید: «در دنیای امنیت، صادقانه بگویم، هیچ‌یک از این چیزها خیلی جدید یا شگفت‌انگیز نیستند. "این مانند اجازه دادن به انسان ها در شبکه شما است. و همه فرآیندهای مشابهی که باید از آنها استفاده کنید، یکسان هستند."

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.

استارت آپ فناوری پاک Fluxnium راهی برای بهره برداری از سوخت هسته ای 50000 ساله تیم دی چانت پیدا کرد.

مدل استدلال جدید Salesforce و Nvidia همه چیزهایی است که آزمایشگاه‌های هوش مصنوعی باید از جولی بورت بترسند.

جنسن هوانگ از ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس

9 استارت‌آپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis

تسلا می‌گوید سرانجام در تاریخ 1 اکتبر از نسل دوم رودستر آنتونی ها رونمایی خواهد کرد

Revolut نقض اطلاعات مشتری از طریق درخواست های جعلی دولت Jagmeet Singh را تأیید می کند

مت مولنوگ به کارکنان Automattic می‌گوید (ترول‌ها؟) و می‌گوید که پس از برکناری سارا پرز، مدیر عامل، دوباره کنترل را به دست گرفته است.

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

The fix for rogue AI agents could be more AI

Y Combinator has funded 106 companies related to AI observability in recent years

همه‌ی اخبار فناوری