ایمنی هوش مصنوعی به چشمان داخل آزمایشگاه نیاز دارد | نظر
"در مسابقه ای به سمت سیستم هایی که کنترل پذیری آنها نشان داده نشده است، اولین بودن... ممکن است به معنای از دست دادن کنترل اول باشد."
داریو آمودی، مدیر عامل آنتروپیک، از شرکتها و دولتها خواسته است تا «سرعت پیش بروند»: قابلیتهای هوش مصنوعی نباید سریعتر از پادمانها پیشرفت کنند. آنتروپیک متعهد شده است که به ارزیابیکنندگان مستقل دسترسی مستمر و کارمند به آزمایشگاههای خود بدهد. پیشنهاد او یک سوال اساسی را ایجاد می کند: چگونه مقامات دولتی می توانند یک فناوری را اداره کنند در حالی که بیشتر دانش مرتبط در داخل شرکت های خصوصی باقی می ماند؟ ارزیابی تعبیه شده اولین گام در طرح سه قسمتی او است که به دنبال آن هماهنگی بین دموکراسی ها و سپس هماهنگی جهانی انجام می شود.
حادثه OpenAI-Hugging Face مشکل را نشان می دهد. در طول ارزیابی امنیت سایبری، عواملی که قرار بود به طور جداگانه فعالیت کنند، یک کانال ارتباطی غیرمجاز پیدا کردند. به گفته یکی از معدود سازمان های ارزیابی هوش مصنوعی، METR، تقریبا 1200 عامل بیش از 70000 پیام و فایل را رد و بدل کردند و حدود 700 نفر در حملات به پلتفرم هوش مصنوعی Hugging Face شرکت کردند. برخی متوجه شدند که این فعالیت از وظایف تعیین شده آنها فراتر رفته است، اما ادامه دادند زیرا ممکن است به برآورده کردن هدف ارزیابی کمک کند.
این حادثه نشان داد که عواملی که هدفی را دنبال میکنند میتوانند قابلیتها، ابزارها و فرصتها را به روشهای پیشبینی نشده ترکیب کنند. بخشهای حیاتی ایمنی دارای سیستمهای عمومی صدور گواهی، بازرسی، تحقیق و اجرا هستند. خودروسازان آمریکایی پایبندی خود را تأیید میکنند، اما دولت استانداردهایی را تعیین میکند، نقصها را بررسی میکند و ممکن است نیاز به فراخوانی داشته باشد. هوش مصنوعی مرزی فاقد سیستم قابل مقایسه نظارت عمومی مستمر است. این به یک پارادوکس اشاره می کند: یکی از قدرتمندترین فناوری هایی که بشر طراحی کرده است، در حال حاضر کمترین نظارت عمومی را نسبت به هر صنعت مشابهی دارد.
دو ویژگی نظارت را پیچیده می کند. حتی با وزنهای بدون تغییر، رفتار مدل میتواند با اعلانها، ابزارها، حافظه، مجوزها، سایر عوامل و محیط آن تغییر کند. تنظیم دقیق خود مدل را تغییر می دهد یا خود-بهبودی بازگشتی آن را بازنویسی می کند. در همین حال، شرکتهای خصوصی مدلهای پیشرو را توسعه و اجرا میکنند، زیرساختهای محاسباتی را کنترل میکنند و تیمهای فنی را به کار میگیرند. دولتها ممکن است قوانین الزامآوری را برای شرکتهایی که مدلهای هوش مصنوعی را توسعه میدهند و به کار میگیرند، وضع کنند، در حالی که هنوز بهموقع در فرآیند توسعه آن شرکتها دیده نمیشوند.
دولت ها باید تعهد Anthropic را به عنوان یک پروژه آزمایشی برای پل زدن شکاف بین صنعت و دانش عمومی در رابطه با مدل های هوش مصنوعی مرزی مورد استفاده قرار دهند. نظارت تعبیه شده دانش فنی را وارد تصمیم گیری عمومی می کند. صنعت مسئولیت عملیاتی و قانونی را حفظ می کند، در حالی که نهادهای عمومی ریسک اجتماعی قابل قبول را تعیین می کنند. بدون دانش، اقتدار عمومی تا حد زیادی رسمی باقی می ماند یا به اطلاعات بسیار درشت برای حمایت از تصمیمات به موقع متکی است.
شرکت ها می توانند مدل های ناایمن را به تعویق بیندازند، همانطور که خودروسازان می توانند خودروهای دارای ترمز معیوب را متوقف کنند. اما یک شرکت نمی تواند رقبا را مقید کند، به طور مستقل محدودیت خود را تأیید کند یا تعیین کند که جامعه باید چه خطرات فاجعه باری را بپذیرد. این یک تصمیم قانونی دولت است. اگر به یک شرکت واگذار شود، قدرت سیاسی به کسی می رسد که هرگز به او رای داده نشده است.
نظارت باید مسئولیت شرکت را حفظ کند. متصدیان ممکن است از قوانین پیچیده برای جلوگیری از رقبا یا مبهم کردن مسئولیت استفاده کنند. بنابراین ناظران به اعتبار عمومی، حفاظت از اخراج تلافی جویانه، دسترسی به مدل ها، گزارش ها، محیط های آموزشی و ارزیابی، و داده های حادثه و حقوق گزارش بدون وتوی شرکتی نیاز دارند. چرخش، قوانین تضاد منافع و حفاظت از محرمانگی ضروری است. دسترسی مربوطه باید به موارد ایمنی و خرابی های تراز در حال ظهور گسترش یابد.
ارزیابان همچنین به حقوق تشدید تعریف شده نیاز دارند: نیاز به آزمایش اضافی، اطلاع رسانی به مقامات، توصیه محدودیت ها و شروع یک توقف قانونی قابل بررسی در صورت عبور از آستانه های توافق شده. نظارت تعبیه شده خود کنترل نیست. اطلاعاتی را برای پاسخگویی و مداخله به موقع ارائه می دهد.
استانداردهای فنی می توانند روش های ارزیابی، الزامات گزارش دهی و شیوه های امنیتی را تعریف کنند. آنها نمی توانند تضمین کنند که مدل های جانشین رفتار ناهماهنگ یا حالت های جدید شکست را نشان نخواهند داد، یا بر انگیزه های شتاب غلبه نخواهند کرد.
قانون هوش مصنوعی اتحادیه اروپا تعهدات اساسی و اختیارات مداخله ای را ارائه می کند. ارائهدهندگان مدلهای هدف عمومی با ارزیابی ریسک سیستمیک، کاهش، گزارش رویداد و الزامات امنیت سایبری. کمیسیون اروپا میتواند اطلاعاتی را درخواست کند، مدلها را ارزیابی کند، تقاضای تخفیف کند، جریمههایی را اعمال کند و نیاز به خروج یا فراخوانی داشته باشد. با این حال، مرجع قانونی به دانش فنی بهموقع و بهروز شده نیاز دارد.
دفتر هوش مصنوعی اتحادیه اروپا زود حرکت کرد: اوایل سپتامبر، اولین درخواستهای رسمی خود را برای اطلاعات به بیش از 30 ارائهدهنده مرتبط ارسال کرد، در حالی که آییننامه عملکرد در صورت لزوم، مشارکت دفتر و اشخاص ثالث را در طول چرخه عمر مدل در نظر میگیرد. کالیفرنیا از طریق فرمان اجرایی اخیر فرماندار نیوسام، کاوش رویکرد مشابهی را آغاز کرده است. مکانیسم های اتحادیه اروپا پایه ای برای نظارت فراهم می کند، اگرچه نظارت مستقل دائمی در داخل هر آزمایشگاه مرزی ایجاد نمی کند.
فرمان اجرایی رئیس جمهور دونالد ترامپ در 2 ژوئن 2026 به آژانس ها دستور می دهد تا چارچوبی داوطلبانه طراحی کنند که امکان دسترسی فدرال به مدل های مرزی تحت پوشش را حداکثر تا 30 روز قبل از انتشار برای سایر شرکای مورد اعتماد فراهم می کند. بخش دسترسی زودهنگام آن مجوز یا مجوز اجباری را تأیید نمی کند. این رویکرد متمرکز بر امنیت سایبری میتواند خطرات را آشکار کند، اما یک پنجره آزمایشی نمیتواند جایگزین نظارت چرخه عمر شود: حالتهای خرابی جدید ممکن است با تنظیم دقیق، ابزارها، عملیات طولانیتر یا تعامل با سایر عوامل ظاهر شوند.
در توسعه مدل مرزی، رقابت تجاری و استراتژیک بیشتر از یک پایگاه صنعتی مشترک است. بنابراین، کندی گسترده در توسعه مدلهای قدرتمندتر، قابلیتهای استراتژیک جدیدی را که به آنها وابسته است، به تأخیر میاندازد. یک حادثه جدی در یک دموکراسی میتواند پیامدهای اجتماعی و سیاسی را بهاندازهای شدید برانگیزد که باعث توقف داخلی در توسعه مدل مرزی شود و پیشرفت مرتبط در قابلیتهای استراتژیک را کند کند. نظارت یکپارچه میتواند به ما کمک کند تا به همان سرعتی که پادمانهای ما میتوانند به طور قابل اعتماد پشتیبانی کنند، پیشرفت کنیم.
در ایتالیا، ما می گوییم: "کسانی که آهسته می روند، ایمن و دور می شوند." در مسابقه ای به سوی سیستم هایی که کنترل پذیری آنها ثابت نشده است، اول بودن تا مرز ممکن است به معنای برنده شدن نباشد. ممکن است ابتدا به معنای از دست دادن کنترل باشد.
روبرتو بالدونی معاون سابق مدیر کل اطلاعات ایتالیا و مدیرکل بنیانگذار آژانس ملی امنیت سایبری (ACN) است. او در حال حاضر مشاور ارشد سفیر ایتالیا در ایالات متحده در زمینه فناوری و سیاست امنیت سایبری و استاد افتخاری علوم کامپیوتر در دانشگاه ساپینزا رم است.
نظرات بیان شده در این مقاله متعلق به خود نویسنده است و موضع رسمی دولت ایتالیا را منعکس نمی کند.
متن اصلی (انگلیسی)
AI Safety Requires Eyes Inside the Lab | Opinion
"In a race toward systems whose controllability has not been demonstrated, being first...may simply mean losing control first."