انویدیا برنامه ایمنی هوش مصنوعی جدیدی را راهاندازی میکند که برای جلوگیری از فرار مدلهایی از جعبههای ماسهبازی طراحی شده است
انویدیا اذعان میکند که گفتن به نمایندگان برای انجام کاری کافی نیست – بنابراین در حال پیادهسازی حفاظتهای نرمافزاری و سختافزاری است.
پاسخ انویدیا به "حوادث امنیتی اخیر" با تشدید محدودیت ها بر روی عوامل مستقل
نرم افزارها و سخت افزارهای حفاظتی جدید موانعی را در صورت سرکشی عوامل ایجاد می کنند
بیش از 100 مشتری قبلا موافقت کرده اند که با اصول کار کنند انویدیا پلتفرم امنیتی باز عامل جدیدی را معرفی کرده است که برای جلوگیری از «فرار» و عملکرد عوامل هوش مصنوعی مستقل از مرزهای تعیین شده خود طراحی شده است.
پس از چندین گزارش هشداردهنده اخیر از حملات مبتنی بر هوش مصنوعی، این شرکت اعتراف کرد که ایمنی نباید فقط به پادمانهایی که در مدلها و برنامههای هوش مصنوعی تعبیه شده است متکی باشد، بلکه باید از کنترلهای محاسباتی و سختافزاری اضافی نیز به عنوان موانع محکمتری استفاده شود.
این شرکت در اطلاعیه خود نوشت: «حوادث امنیتی اخیر بر لزوم تجهیز سازمان ها به ابزارهای باز و قابل تنظیم تاکید کرده است.
انویدیا حتی لایه های بیشتری از کنترل را برای عوامل هوش مصنوعی مستقل اضافه می کند
پلتفرم Open Agent Safety از دو کنترل کلیدی تشکیل شده است: OpenShell، که انویدیا آن را به عنوان یک "مرز زمان اجرا امن" مبتنی بر نرم افزار توصیف می کند، و Sentry، یک "watchdog" مبتنی بر سخت افزار که روی DPU های BlueField-4 خود اجرا می شود.
جنسن هوانگ، مدیرعامل شرکت، خلاصه کرد: "ایمنی و امنیت نیاز به مهندسی کامل دارد. پلتفرم ایمنی عامل باز NVIDIA صنعت، محققان و سازمانهای بخش عمومی را برای به اشتراک گذاشتن بهترین شیوهها، هماهنگی با روشهای ارزیابی و تقویت همکاری بینالمللی گرد هم میآورد."
در حالی که مکانیسمهای ایمنی موجود در سطح مدل به گونهای طراحی شدهاند که به هوش مصنوعی بگوییم به شیوهای خاص رفتار نکند، OpenShell در سطح نرمافزار مرزهای فنی را پیادهسازی میکند تا در واقع از نادیده گرفتن این دستورالعملها توسط یک عامل جلوگیری کند. انویدیا همچنین استدلال می کند که Sentry می تواند یک عامل هوش مصنوعی را در چند میلی ثانیه قرنطینه و متوقف کند.
بیش از 100 مشتری مانند SpaceXAI، Anthropic و Microsoft در حال حاضر از نرمافزار و حفاظتهای مبتنی بر سختافزار Nvidia استفاده میکنند.
البته این خبر پس از چندین مورد برجسته منتشر می شود که در آن عوامل هوش مصنوعی فراتر از کنترل های مورد نظر خود عمل کرده اند، با این حال اگرچه این حفاظت های جدید با پشتیبانی Nvidia ممکن است جدید باشند، اصول کلی اینگونه نیستند. این شرکت فقط بر اهمیت اصولی که قبلا با آنها آشنا بودیم، مانند حداقل امتیاز، انزوا/قرنطینه و نظارت دقیق تاکید می کند.
هوانگ افزود: "در حالی که ما به کشف مرزهای قابلیت های هوش مصنوعی ادامه می دهیم، باید کشف در مرز ایمنی هوش مصنوعی را تسریع کنیم."
متن اصلی (انگلیسی)
Nvidia launches new AI safety program designed at stopping models escaping their sandboxes
Nvidia admits telling agents not to do something isn't enough – so it's implementing software and hardware safeguards.