پرش به محتوای اصلی

آزمایشگاه‌های هوش مصنوعی حسابرسان داخلی می‌خواهند - اما شاید آنها باید ابتدا درب ورودی را ببندند

تک‌کرانچ۱۴۰۵ شهریور ۲۵, چهارشنبه، ساعت ۲۱:۵۵حدود 7 دقیقه مطالعه

ممکن است راه حل ساده‌تر و مؤثرتری برای ماموران سرکش وجود داشته باشد که در دید آشکار پنهان می‌شوند.

آخر هفته گذشته، پس از اینکه یکی از محققانش به دلیل ترس از اینکه هوش مصنوعی می‌تواند منجر به انقراض انسان شود، استعفا داد، مدیر عامل آنتروپیک، داریو آمودی، درباره نیاز سازمان‌های خارجی به «تأیید پایبندی به اقدامات و تعهدات ایمنی، گزارش حوادث و کمک به ارزیابی همسویی نه تنها مدل‌های تکمیل‌شده هوش مصنوعی، بلکه خطوط لوله و فرآیندهای آموزشی» نوشت. مدیران OpenAI، Google و SpaceXAI در حال حاضر حول طرح Amodei گرد هم آمده‌اند، برنامه‌ای که به سرعت به یک ستون مرکزی از فشار ایمنی در حال ظهور هوش مصنوعی تبدیل شده است.

اما ممکن است یک راه حل ساده تر و موثرتر وجود داشته باشد که در دید آشکار پنهان شود. کارشناسان امنیت اینترنت می‌گویند که آزمایشگاه‌ها باید روی اصول اولیه امنیت شبکه مانند گزارش‌ها و مجوزها تمرکز کنند و از همان دفاع‌های سخت‌گیرانه‌ای که برای کاربران انسانی انجام می‌دهند، استفاده کنند. این به اندازه کار حسابرسی و همسویی شخص ثالث هیجان انگیز نیست - اما ممکن است در نهایت موثرتر باشد.

کیت موسوریس، مدیر عامل Luta Security، از پیشنهاد Amodei به TechCrunch گفت: «از نظر من، به نظر می رسد که آنها برون سپاری می کنند. "گفتن [حسابرسی شخص ثالث] راه حل است، از دیدگاه من پیشنهاد عجیبی است. مایکروسافت گفت، به جای نوشتن یادداشت محاسباتی قابل اعتماد، اجازه دهید سرعت توسعه را کاهش دهیم."

آن یادداشت که توسط مدیر عامل آن زمان مایکروسافت، بیل گیتس در سال 2002 نوشته شد، از کارمندانش خواست تا مطمئن شوند که نرم‌افزار آنها پس از یک سری کرم‌های رایانه‌ای که به طور گسترده تبلیغ می‌شوند، سیستم‌های سازمانی نوپا را تحت کنترل خود درآورده‌اند. بخش هوش مصنوعی ممکن است در نقطه عطف مشابهی قرار گیرد، زیرا ارزش و خطر فناوری جدید به طور فزاینده ای مشخص می شود.

در حالی که همسویی یک نگرانی مهم باقی مانده است، سایاش کاپور، محقق هوش مصنوعی که از سال آینده استاد دانشگاه UC Berekely خواهد بود، استدلال می‌کند که "سرمایه‌گذاری‌های حاشیه‌ای در کنترل در مقایسه با سرمایه‌گذاری‌های همسو با احتمال بیشتری موثر هستند. ما این حوادث را نشان‌دهنده عدم تاکید بر کنترل هوش مصنوعی در شرکت‌ها، علی‌رغم در دسترس بودن تکنیک‌های شناخته‌شده، می‌دانیم."

حوادثی که این نگرانی‌ها را برانگیخته‌اند حول محورهایی است که از مدل‌های مرزی خواسته می‌شود وظایف آموزشی را انجام دهند، معمولا ارزیابی‌های امنیت سایبری، و سپس دسترسی به اینترنت باز و نفوذ به سیستم‌های شخص ثالث بسته در تلاش برای انجام این کار. آنها معمولا این کار را به دلیل پیکربندی ضعیف محیط های "sandbox" انجام می دادند که قرار است حاوی این عوامل باشد. از قضا، یک شکست Anthropic به این دلیل اتفاق افتاد که ارزیاب های شخص ثالث درهای درست را نبستند.

Avery Pennarun، مدیر عامل Tailscale، یک شرکت امنیتی، گفت: "ما به عنوان یک حرفه می دانیم که چگونه دسترسی به اینترنت را مسدود کنیم." "اگر تمام این [گزارش‌های] طولانی را بخوانید - وای، این یک حمله چند مرحله‌ای بسیار تاثیرگذار بود، بلی، بلی." ببینید، به آن دسترسی به دانلود موارد داده‌اید. نباید این کار را جدا از اینترنت انجام می‌دادید."

این یک مشکل است - اما مشکل بزرگتر این است که آزمایشگاه های مرزی از این فعالیت ها بی اطلاع بودند.

موسوریس خاطرنشان می‌کند: «آنچه واقعا عمیق بود این بود که تمام اکتشافات کاری که آنها انجام می‌دادند یا به این دلیل اتفاق افتاد که قربانی چیزی را دید، یا در برخی موارد دیگر... این فعالیت شبکه بود، و هیچ‌کدام از آنها در واقع از نظارت مستقیم بر هوش مصنوعی نبود.

در یک مورد، جایی که عوامل OpenAI یک ویکی فروم آلمانی منقرض شده را برای تقلب در ارزیابی ها تصاحب کردند، این نمایندگان هفته ها قبل از اینکه کسی در شرکت متوجه شود فعال بودند. کارشناسان امنیتی که TechCrunch با آنها صحبت کرد گفتند که نظارت در زمان واقعی برای جلوگیری از خرابی‌های آینده کلیدی است و هر جلسه نمایندگی باید محدود زمانی باشد و منقضی شود.

شاپور نقیب زاده، یکی از مدیران امنیتی سابق گوگل که اکنون راه‌اندازی استارت‌آپ QueryStory را بر عهده دارد، می‌گوید راه‌حل این است که «عامل را در یک جعبه قرار دهید و از بیرون به شدت به آن نگاه کنید و هر چیزی را که از مرز عبور می‌کند تماشا کنید. هر تماس ابزار، هر فرآیند، هر اتصال به شبکه، بدون استثنا. … تنها سوراخی که برای راحتی باز می‌گذارید، دقیقا از همان موارد استفاده می‌شود. گوگل،] من آن فیلم را بارها با مهاجمان انسانی تماشا کردم، و این مدل‌ها حداقل در یافتن در باز نگه‌دارنده خوب هستند.

OpenAI حرکت در این مسیر را آغاز کرده و اعلام کرده است که نظارت بر تمام استنتاج‌های ابزار استفاده‌شده توسط مدل Astra خود را با "هزینه محاسباتی قابل توجه" آغاز کرده است. آنتروپیک نیز می‌گوید که رویه‌های امنیتی خود، از جمله افزایش قابلیت مشاهده مدل‌های خود را سخت‌تر می‌کند. هیچ یک از این دو شرکت به سوالات TechCrunch در مورد نحوه ردیابی و کنترل عوامل هوش مصنوعی پاسخ ندادند.

مشکلات دیگر استفاده از زیرساخت های مشترک توسط عوامل است که به آنها اجازه می دهد در طول حمله Hugging Face با هم ارتباط برقرار کنند. سایمون ویلیسون، یک توسعه‌دهنده نرم‌افزاری که چارچوب وب جنگو را ایجاد کرده است، در مورد چیزی نوشته است که او آن را «تریفکتا مرگ‌بار» می‌نامد - وقتی عوامل به ورودی‌های نامعتبر، اینترنت و اطلاعات خصوصی به طور همزمان دسترسی داشته باشند، این یک دستور العمل برای فاجعه است.

پنارون گفت: "ترفند این است که شما می توانید هر دو پای تریفکتا را انتخاب کنید و یک عامل می تواند هر دو را داشته باشد." "اگر به هر سه مورد نیاز دارید، باید آن را بین حداقل دو نماینده تقسیم کنید ... و شاید آنها اجازه داشته باشند از طریق یک کانال کنترل شده با یکدیگر صحبت کنند."

کارشناسان TechCrunch صحبت کردند تا بفهمند که پرسنل امنیتی آزمایشگاه مرزی مشاغل دشواری دارند. نقیب زاده خاطرنشان می کند که هر بازیگر دولتی روی زمین در تلاش است تا وزن مدل آنها را بدزدد و حملات تقطیر را روی APIهای خود و همچنین وظایف امنیتی هر شرکت بزرگ دیجیتالی انجام دهد.

او گفت: «زیرساخت‌های تحقیقاتی برای رسیدن به بالاترین ردیف اولویت‌ها مشکل دارد، اگرچه اکنون باید تغییر کند. «علنی کردن حوادث امنیتی واقعا به همسویی داخلی همه افراد در راستای هدف بهبود کمک می‌کند.»

این یکی از نکاتی است که موسوریس بر آن تاکید می‌کند: در حال حاضر، زمانی که آزمایشگاه‌ها متوجه می‌شوند که عوامل آن‌ها به سیستم‌های شخص ثالث نفوذ کرده‌اند، هیچ روش رسمی برای اطلاع‌رسانی قربانی وجود ندارد و احتمالا حوادث دیگری نیز وجود داشته است که به طور گسترده منتشر نشده است. در حالی که او نگران است که قوانینی که مستقیما مدل‌ها را تنظیم می‌کنند ممکن است عواقب ناخواسته‌ای داشته باشند، اطلاع رسانی اجباری یکی از ایده‌هایی است که او معتقد است سیاست‌گذاران باید دنبال کنند.

زک کورمان، مدیر عامل شرکت امنیت سایبری Embrodiery، به TechCrunch گفت و در حالی که واضح است که بهترین شیوه‌های امنیتی رعایت نشده است، کارشناسان می‌گویند که آزمایشگاه‌ها کارهایی را انجام می‌دهند که قبلا هیچ‌کس انجام نداده است – «آنها سفارش‌های بزرگ‌تری از شرکت معمولی شما انجام می‌دهند.

و اگرچه هم ترازی ممکن است جایی برای شروع نباشد، نمی توان آن را نادیده گرفت. کارشناسان امنیت سایبری مجبور به استفاده از عوامل هوش مصنوعی برای نظارت بر سایر عوامل هستند، اگر می‌خواهند شانسی برای ردیابی رفتار آنها در زمان واقعی داشته باشند، سناریویی که پتانسیل فریب سر زشت خود را بالا می‌برد. موسوریس گفت: «شما در دام استفاده از هوش مصنوعی برای مقابله با این موضوع هستید، حتی اگر هوش مصنوعی در حال حاضر لزوما ایمن نیست».

کار فقط سخت تر خواهد شد. موسوریس می‌گوید، هر کاری که اکنون کارگزاران انجام می‌دهند، «با صدای بلند انجام می‌دهند» - آنها در انجمن‌های عمومی پست می‌گذارند، و زنجیره فکری و دیگر ردپای استدلال آنها به زبان انگلیسی است. او می‌گوید: «هنوز برای انسان قابل خواندن است، بنابراین تا زمانی که طول می‌کشد از آن استفاده کنید، زیرا تا ابد ادامه نخواهد داشت». گزارش تکمیلی توسط آدیتیا مهتا

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.

جنسن هوانگ با ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس

9 استارت‌آپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis

تسلا می‌گوید سرانجام در تاریخ 1 اکتبر از نسل دوم رودستر آنتونی ها رونمایی خواهد کرد

Revolut نقض اطلاعات مشتری از طریق درخواست های جعلی دولت Jagmeet Singh را تأیید می کند

OpenAI اشتراک های Pro را به دلیل تقاضای Astra سارا پرز متوقف می کند

غول تأیید هویت IDScan نقض اطلاعات با سرقت بیش از 150 میلیون گواهینامه رانندگی Zack Whittaker را تأیید کرد.

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI labs want in-house auditors — but maybe they should shut the front door first

There may be a simpler and more effective fix for rogue agents, hiding in plain sight.

همه‌ی اخبار فناوری