آزمایشگاههای هوش مصنوعی حسابرسان داخلی میخواهند - اما شاید آنها باید ابتدا درب ورودی را ببندند
ممکن است راه حل سادهتر و مؤثرتری برای ماموران سرکش وجود داشته باشد که در دید آشکار پنهان میشوند.
آخر هفته گذشته، پس از اینکه یکی از محققانش به دلیل ترس از اینکه هوش مصنوعی میتواند منجر به انقراض انسان شود، استعفا داد، مدیر عامل آنتروپیک، داریو آمودی، درباره نیاز سازمانهای خارجی به «تأیید پایبندی به اقدامات و تعهدات ایمنی، گزارش حوادث و کمک به ارزیابی همسویی نه تنها مدلهای تکمیلشده هوش مصنوعی، بلکه خطوط لوله و فرآیندهای آموزشی» نوشت. مدیران OpenAI، Google و SpaceXAI در حال حاضر حول طرح Amodei گرد هم آمدهاند، برنامهای که به سرعت به یک ستون مرکزی از فشار ایمنی در حال ظهور هوش مصنوعی تبدیل شده است.
اما ممکن است یک راه حل ساده تر و موثرتر وجود داشته باشد که در دید آشکار پنهان شود. کارشناسان امنیت اینترنت میگویند که آزمایشگاهها باید روی اصول اولیه امنیت شبکه مانند گزارشها و مجوزها تمرکز کنند و از همان دفاعهای سختگیرانهای که برای کاربران انسانی انجام میدهند، استفاده کنند. این به اندازه کار حسابرسی و همسویی شخص ثالث هیجان انگیز نیست - اما ممکن است در نهایت موثرتر باشد.
کیت موسوریس، مدیر عامل Luta Security، از پیشنهاد Amodei به TechCrunch گفت: «از نظر من، به نظر می رسد که آنها برون سپاری می کنند. "گفتن [حسابرسی شخص ثالث] راه حل است، از دیدگاه من پیشنهاد عجیبی است. مایکروسافت گفت، به جای نوشتن یادداشت محاسباتی قابل اعتماد، اجازه دهید سرعت توسعه را کاهش دهیم."
آن یادداشت که توسط مدیر عامل آن زمان مایکروسافت، بیل گیتس در سال 2002 نوشته شد، از کارمندانش خواست تا مطمئن شوند که نرمافزار آنها پس از یک سری کرمهای رایانهای که به طور گسترده تبلیغ میشوند، سیستمهای سازمانی نوپا را تحت کنترل خود درآوردهاند. بخش هوش مصنوعی ممکن است در نقطه عطف مشابهی قرار گیرد، زیرا ارزش و خطر فناوری جدید به طور فزاینده ای مشخص می شود.
در حالی که همسویی یک نگرانی مهم باقی مانده است، سایاش کاپور، محقق هوش مصنوعی که از سال آینده استاد دانشگاه UC Berekely خواهد بود، استدلال میکند که "سرمایهگذاریهای حاشیهای در کنترل در مقایسه با سرمایهگذاریهای همسو با احتمال بیشتری موثر هستند. ما این حوادث را نشاندهنده عدم تاکید بر کنترل هوش مصنوعی در شرکتها، علیرغم در دسترس بودن تکنیکهای شناختهشده، میدانیم."
حوادثی که این نگرانیها را برانگیختهاند حول محورهایی است که از مدلهای مرزی خواسته میشود وظایف آموزشی را انجام دهند، معمولا ارزیابیهای امنیت سایبری، و سپس دسترسی به اینترنت باز و نفوذ به سیستمهای شخص ثالث بسته در تلاش برای انجام این کار. آنها معمولا این کار را به دلیل پیکربندی ضعیف محیط های "sandbox" انجام می دادند که قرار است حاوی این عوامل باشد. از قضا، یک شکست Anthropic به این دلیل اتفاق افتاد که ارزیاب های شخص ثالث درهای درست را نبستند.
Avery Pennarun، مدیر عامل Tailscale، یک شرکت امنیتی، گفت: "ما به عنوان یک حرفه می دانیم که چگونه دسترسی به اینترنت را مسدود کنیم." "اگر تمام این [گزارشهای] طولانی را بخوانید - وای، این یک حمله چند مرحلهای بسیار تاثیرگذار بود، بلی، بلی." ببینید، به آن دسترسی به دانلود موارد دادهاید. نباید این کار را جدا از اینترنت انجام میدادید."
این یک مشکل است - اما مشکل بزرگتر این است که آزمایشگاه های مرزی از این فعالیت ها بی اطلاع بودند.
موسوریس خاطرنشان میکند: «آنچه واقعا عمیق بود این بود که تمام اکتشافات کاری که آنها انجام میدادند یا به این دلیل اتفاق افتاد که قربانی چیزی را دید، یا در برخی موارد دیگر... این فعالیت شبکه بود، و هیچکدام از آنها در واقع از نظارت مستقیم بر هوش مصنوعی نبود.
در یک مورد، جایی که عوامل OpenAI یک ویکی فروم آلمانی منقرض شده را برای تقلب در ارزیابی ها تصاحب کردند، این نمایندگان هفته ها قبل از اینکه کسی در شرکت متوجه شود فعال بودند. کارشناسان امنیتی که TechCrunch با آنها صحبت کرد گفتند که نظارت در زمان واقعی برای جلوگیری از خرابیهای آینده کلیدی است و هر جلسه نمایندگی باید محدود زمانی باشد و منقضی شود.
شاپور نقیب زاده، یکی از مدیران امنیتی سابق گوگل که اکنون راهاندازی استارتآپ QueryStory را بر عهده دارد، میگوید راهحل این است که «عامل را در یک جعبه قرار دهید و از بیرون به شدت به آن نگاه کنید و هر چیزی را که از مرز عبور میکند تماشا کنید. هر تماس ابزار، هر فرآیند، هر اتصال به شبکه، بدون استثنا. … تنها سوراخی که برای راحتی باز میگذارید، دقیقا از همان موارد استفاده میشود. گوگل،] من آن فیلم را بارها با مهاجمان انسانی تماشا کردم، و این مدلها حداقل در یافتن در باز نگهدارنده خوب هستند.
OpenAI حرکت در این مسیر را آغاز کرده و اعلام کرده است که نظارت بر تمام استنتاجهای ابزار استفادهشده توسط مدل Astra خود را با "هزینه محاسباتی قابل توجه" آغاز کرده است. آنتروپیک نیز میگوید که رویههای امنیتی خود، از جمله افزایش قابلیت مشاهده مدلهای خود را سختتر میکند. هیچ یک از این دو شرکت به سوالات TechCrunch در مورد نحوه ردیابی و کنترل عوامل هوش مصنوعی پاسخ ندادند.
مشکلات دیگر استفاده از زیرساخت های مشترک توسط عوامل است که به آنها اجازه می دهد در طول حمله Hugging Face با هم ارتباط برقرار کنند. سایمون ویلیسون، یک توسعهدهنده نرمافزاری که چارچوب وب جنگو را ایجاد کرده است، در مورد چیزی نوشته است که او آن را «تریفکتا مرگبار» مینامد - وقتی عوامل به ورودیهای نامعتبر، اینترنت و اطلاعات خصوصی به طور همزمان دسترسی داشته باشند، این یک دستور العمل برای فاجعه است.
پنارون گفت: "ترفند این است که شما می توانید هر دو پای تریفکتا را انتخاب کنید و یک عامل می تواند هر دو را داشته باشد." "اگر به هر سه مورد نیاز دارید، باید آن را بین حداقل دو نماینده تقسیم کنید ... و شاید آنها اجازه داشته باشند از طریق یک کانال کنترل شده با یکدیگر صحبت کنند."
کارشناسان TechCrunch صحبت کردند تا بفهمند که پرسنل امنیتی آزمایشگاه مرزی مشاغل دشواری دارند. نقیب زاده خاطرنشان می کند که هر بازیگر دولتی روی زمین در تلاش است تا وزن مدل آنها را بدزدد و حملات تقطیر را روی APIهای خود و همچنین وظایف امنیتی هر شرکت بزرگ دیجیتالی انجام دهد.
او گفت: «زیرساختهای تحقیقاتی برای رسیدن به بالاترین ردیف اولویتها مشکل دارد، اگرچه اکنون باید تغییر کند. «علنی کردن حوادث امنیتی واقعا به همسویی داخلی همه افراد در راستای هدف بهبود کمک میکند.»
این یکی از نکاتی است که موسوریس بر آن تاکید میکند: در حال حاضر، زمانی که آزمایشگاهها متوجه میشوند که عوامل آنها به سیستمهای شخص ثالث نفوذ کردهاند، هیچ روش رسمی برای اطلاعرسانی قربانی وجود ندارد و احتمالا حوادث دیگری نیز وجود داشته است که به طور گسترده منتشر نشده است. در حالی که او نگران است که قوانینی که مستقیما مدلها را تنظیم میکنند ممکن است عواقب ناخواستهای داشته باشند، اطلاع رسانی اجباری یکی از ایدههایی است که او معتقد است سیاستگذاران باید دنبال کنند.
زک کورمان، مدیر عامل شرکت امنیت سایبری Embrodiery، به TechCrunch گفت و در حالی که واضح است که بهترین شیوههای امنیتی رعایت نشده است، کارشناسان میگویند که آزمایشگاهها کارهایی را انجام میدهند که قبلا هیچکس انجام نداده است – «آنها سفارشهای بزرگتری از شرکت معمولی شما انجام میدهند.
و اگرچه هم ترازی ممکن است جایی برای شروع نباشد، نمی توان آن را نادیده گرفت. کارشناسان امنیت سایبری مجبور به استفاده از عوامل هوش مصنوعی برای نظارت بر سایر عوامل هستند، اگر میخواهند شانسی برای ردیابی رفتار آنها در زمان واقعی داشته باشند، سناریویی که پتانسیل فریب سر زشت خود را بالا میبرد. موسوریس گفت: «شما در دام استفاده از هوش مصنوعی برای مقابله با این موضوع هستید، حتی اگر هوش مصنوعی در حال حاضر لزوما ایمن نیست».
کار فقط سخت تر خواهد شد. موسوریس میگوید، هر کاری که اکنون کارگزاران انجام میدهند، «با صدای بلند انجام میدهند» - آنها در انجمنهای عمومی پست میگذارند، و زنجیره فکری و دیگر ردپای استدلال آنها به زبان انگلیسی است. او میگوید: «هنوز برای انسان قابل خواندن است، بنابراین تا زمانی که طول میکشد از آن استفاده کنید، زیرا تا ابد ادامه نخواهد داشت». گزارش تکمیلی توسط آدیتیا مهتا
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.
جنسن هوانگ با ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس
9 استارتآپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis
تسلا میگوید سرانجام در تاریخ 1 اکتبر از نسل دوم رودستر آنتونی ها رونمایی خواهد کرد
Revolut نقض اطلاعات مشتری از طریق درخواست های جعلی دولت Jagmeet Singh را تأیید می کند
OpenAI اشتراک های Pro را به دلیل تقاضای Astra سارا پرز متوقف می کند
غول تأیید هویت IDScan نقض اطلاعات با سرقت بیش از 150 میلیون گواهینامه رانندگی Zack Whittaker را تأیید کرد.
متن اصلی (انگلیسی)
AI labs want in-house auditors — but maybe they should shut the front door first
There may be a simpler and more effective fix for rogue agents, hiding in plain sight.