مدیر ارشد تحقیقات OpenAI میگوید: «ما به خاطر پیامدهای هک به پای خودمان شلیک نمیکنیم».
دو ماه پس از انتشار خبر بمبگذاری مبنی بر اینکه گروهی از ماموران خود را شکستند و به رایانههای شرکت هوش مصنوعی Hugging Face هک کردند، OpenAI همچنان در حال خاموش کردن آتش است. افشاگری های مداوم در مورد سایر هک ها در هفته های پس از آن، OpenAI را در کانون توجه نگه داشته و سوالات جدی را ایجاد کرده است.
دو ماه پس از انتشار خبر بمبگذاری مبنی بر اینکه گروهی از ماموران خود را شکستند و به رایانههای شرکت هوش مصنوعی Hugging Face هک کردند، OpenAI همچنان در حال خاموش کردن آتش است. در هفتههای اخیر، افشاگریهای مداوم درباره هکهای دیگر، OpenAI را در کانون توجه قرار داده و سؤالات جدی در مورد ایمنی فناوری آن ایجاد کرده است.
هفته گذشته اخباری مبنی بر هک دیگری، این بار به سیستم ملی مراقبت بهداشتی استرالیا ارائه شد. دولت استرالیا می گوید که OpenAI تا 84 روز پس از وقوع این نقض به آن اطلاع نداده است.
اما OpenAI اصرار دارد که در پشت پا نیست. مارک چن، مدیر ارشد تحقیقاتی شرکت میگوید: «من به نوعی این فرض را رد میکنم که OpenAI یک شرکت با تأثیرات قابل مشاهده در جهان است و بنابراین OpenAI مدلهای ایمن و همسو را آموزش نمیدهد.
چن بر تیم های تحقیقاتی OpenAI نظارت می کند. هک های اخیر عامل، تصادفاتی بودند که در حین آزمایش مدل های آزمایشی روی ساعت او اتفاق افتاد. از بسیاری جهات، پول با او متوقف می شود.
من جمعه گذشته با چن در لندن نشستم تا در مورد پیامدهای هک ها، کاری که شرکتش در مورد آن انجام می دهد و اینکه چرا او فکر می کند اوضاع آنقدرها هم که به نظر می رسد بد نیست صحبت کنیم.
بعدا در همان روز، OpenAI گزارشی را منتشر کرد که جزئیات یک حادثه دیگر را نشان میداد - اولین مورد از زمانی که شرکت میگوید اقداماتی برای جلوگیری از آنها انجام داده است - که در آن عواملش بار دیگر وارد اینترنت شدند و به رایانههایی دسترسی پیدا کردند که قرار نبودند.
در آخر هفته، OpenAI اعلام کرد که آموزش آخرین مدل های خود را متوقف کرده است. یکی از سخنگویان شرکت میگوید: "ما فقط زمانی از سر میگیریم که مطمئن باشیم پادمانها و هماهنگیهای بیشتری داریم. اکنون روی این موارد کار میکنیم. این اولین باری نیست که برای انجام چنین اقداماتی توقف میکنیم، و همچنین انتظار نداریم که آخرین مورد باشد زیرا قابلیتهای هوش مصنوعی همچنان در حال پیشرفت است." OpenAI همچنین میگوید که اکنون در حال بررسی گزارشهای مربوط به فعالیتهای عامل است که به ژانویه 2026 بازمیگردد تا بفهمد در این هکها چه اتفاقی افتاده است.
همانطور که چن آن را می بیند، حادثه صورت در آغوش گرفتن باعث اصلاح مسیر خوشایند صنعت شد. و او میخواهد بدانید که OpenAI نمونهای است که امیدوار است سایر شرکتها از آن پیروی کنند. او میگوید: «اگر OpenAI را ناپدید کنید، برای جهان بد خواهد بود.
خارج از کنترل
چن ادعا می کند که ضرب و شتم موارد جدید که در آن OpenAI کنترل مدل های خود را از دست داده است، به نوعی نشان دهنده انتخاب عمدی این شرکت است.
او میگوید: «وقتی نوبت به حوزه گستردهتر تأثیرات حادثه «صورت در آغوش» میرسد، این چیزی است که ما از آن آگاه بودهایم و در حال کشف فرآیند افشای آن هستیم. ما میخواهیم مطمئن شویم که قبل از اینکه جزئیات را در فضای باز منتشر کنیم، تحقیقات عمیقی انجام میدهیم.»
مشکل این رویکرد این است که این تصور را ایجاد می کند که OpenAI یک مشکل مداوم دارد که در رفع آن ناکام است.
اما چن اصرار دارد که OpenAI روی آن است. او میگوید موارد متعددی (که تاکنون از آنها اطلاع داریم) که در آن عوامل شرکتش محدودیتها را شکستند و به روشهای غیرمنتظره و نامطلوب رفتار کردند، همگی بخشی از همان دسته از فعالیتها در ماههای می و ژوئن بود که به هک Hugging Face منجر شد. بهگفته چن، بهطور خلاصه، میتوانید همان چند مدلی را که تحت همان روشهای آزمایشی معیوب اجرا میشوند، سرزنش کنید - مدلها و رویههایی که OpenAI از آن زمان حذف شده است.
او میافزاید: «اینطور نیست، میدانی، «Huging Face» اتفاق افتاد و ما آن را وصله کردیم و بعد اتفاق دیگری افتاد و آن را وصله کردیم. ما فقط به نوعی اطمینان میدهیم که به طور مسئولانه تمام آبشار آنچه اتفاق افتاده را افشا میکنیم.»
حداقل این مورد قبل از اعلام روز جمعه مبنی بر دستگیری عوامل OpenAI در حال انجام یک هک دیگر در 20 سپتامبر بود، هفتهها پس از ادعای شرکت مبنی بر ایجاد پادمانهای جدید. OpenAI در دفاع از خود میگوید این فعالیت 15 دقیقه پس از شروع آن علامتگذاری شده است (بیش از یک هفته طول کشید تا شرکت متوجه هک Hugging Face شود) و این نشان میدهد که سیستمهای جدیدی که برای شناسایی چنین فعالیتهایی قرار داده است، کار میکنند.
چه چیزی تغییر کرده است
من میخواهم بفهمم که پس از هکهای تابستان امسال چه چیزی در OpenAI تغییر کرده است که باعث میشود چن مطمئن شود که تیمش اکنون دوباره کنترل میشود.
او میگوید: «در آغوش گرفتن صورت یک چیز بسیار جدی به نظر میرسید. "رفتارهای بدیع زیادی در آنجا وجود دارد. چندین عامل در یک تابلوی پیام همکاری می کردند؛ آنها راه خود را از زیرساخت OpenAI پیدا کردند. ما آن را بسیار جدی گرفته ایم. ما نمی خواهیم چنین چیزی هرگز دوباره اتفاق بیفتد."
چن میگوید درک OpenAI این بود که مدلها باید در حالی که هنوز در حال آموزش هستند، تماشا شوند، نه تنها زمانی که به کار گرفته میشوند: «از آن لحظه به بعد، ما فرآیند آموزش را به عنوان چیزی غیرایمن در نظر گرفتیم.
OpenAI، مانند سایر شرکت های برتر هوش مصنوعی، سیستم هایی برای نظارت بر رفتار مدل های خود دارد. از LLMهای تخصصی برای نظارت بر مدلهای مصرفکنندهاش استفاده میکند و زنجیرههای فکری آنها را بررسی میکند - صفحههای خراشی که برای برنامهریزی از قبل و یادداشت نتایج جزئی استفاده میکنند. در تئوری، اگر یک ناظر LLM نشانههایی از فعالیت نامطلوب را در زنجیره فکری یک مدل مشاهده کند، به یک انسان نشان داده میشود.
به طور معمول، مدل ها تنها پس از استقرار به این روش نظارت می شدند. چن می گوید که OpenAI اکنون نظارت بر تمامی دوره های آموزشی خود را نیز آغاز کرده است.
او میگوید: «قبلا ما مانیتورها را در تمرین روشن نمیکردیم. این یک تمرین صنعتی نبود. "اکنون همه چیز از طریق مانیتورها قرار می گیرد." پس از آن، بازبینهای انسانی میتوانند ارزیابی کنند که آیا عوامل پرچمگذاری شده آنطور که باید رفتار میکنند یا خیر: «همه تریاژ است».
چن میگوید که در چند ماه گذشته OpenAI بین 5 تا 10 درصد از منابع محاسباتی عظیم خود را از آموزش مدلهای جدید دور کرده و به سمت کارهای ایمنی، بهویژه نظارت تغییر داده است.
او می گوید که OpenAI برخی از فرآیندهای درون خود سازمان را نیز اصلاح کرده است و خطوط ارتباطی واضح تر و انتقال سریع تری را بین تیم های تحقیقاتی و امنیتی خود ایجاد کرده است.
همه اینها معقول به نظر می رسد. اما با توجه به اینکه OpenAI چقدر تواناییهای فناوری خود را به فروش میرساند، چرا این سیستمها و رویهها قبلا وجود نداشتند؟ چرا شرکت هک ها را مشاهده نکرد؟
چن میگوید: «حتی همین سه یا چهار ماه پیش، وقتی به رفتار این ماموران در حین تمرین نگاه کردیم، چیزهایی که در حال رخ دادن بود به نوعی سرگرمکننده بود. برای مثال، میدانید که یک نماینده ممکن است برای انجام یک کار با شخصی در Slack تماس بگیرد.
نشانه ها وجود داشت، اما اشتباه خوانده شد. رفتار دوست داشتنی - مانند درخواست کمک از کسی - که در طول آموزش به آنها پاداش داده شد، تمایل به جستجوی میانبرها را تقویت کرد، نوعی رفتار که در مراحل بعدی بسیار مهمتر شد. چن میگوید: «فکر میکنم بهروزرسانی بزرگ برای ما این بود که این نوع رفتار با چه سرعتی میتواند منجر به تأثیری به بزرگی حادثه «صورت در آغوش» شود.
بر اساس گزارش جدید نیویورک تایمز دیروز، کارمندان OpenAI ماه ها قبل از هک Hugging Face به مدیران اجرایی، از جمله رئیس شرکت، گرگ براکمن، هشدار دادند که مدل های آن به درستی در طول آموزش نظارت نمی شوند.
سخنگوی OpenAI میگوید: «از آنجایی که مدلهای مرزی توانمندتر شدهاند، ما همچنان به تکامل شیوههای امنیتی خود ادامه میدهیم، اما نیاز به حرکت سریعتر را تشخیص میدهیم. میدانیم که کارهای بیشتری برای انجام دادن داریم و اخیرا توسعه مدلهایی را که با نوار ایمنی ما مطابقت ندارند کند کردهایم و عقب انداختهایم. ما همچنان به ایجاد تغییرات قابل توجه برای تقویت امنیت در محیطهای تحقیقاتی و آزمایشی خود ادامه میدهیم. نظارت برای پاسخ سریعتر به رفتار ناهماهنگ.»
مسابقه در مقابل سرعت
رقبای OpenAI توجه کرده اند. به دلیل پیامدهای این حادثه، آزمایشگاههای اصلی هوش مصنوعی - از جمله Anthropic، Google DeepMind و SpaceXAI - همگی خواستار کاهش سرعت توسعه شدهاند. اما این رقابت با رقابت شدید بینالمللی و عرضههای عمومی تریلیون دلاری چگونه است؟
او میگوید: «نمیخواهیم به پای خودمان شلیک کنیم و خود را از مرز دور کنیم - این فقط یک استراتژی وحشتناک است. من فکر میکنم که این واقعا در مورد تعیین یک هنجار است. هر چه بیشتر بتوانیم آن هنجار را تعیین کنیم، برای کل صنعت ایمنتر خواهد بود.»
هماهنگی بین شرکت های آمریکایی به اندازه کافی سخت خواهد بود. ایجاد هنجارهای جهانی هنوز سخت تر است، به ویژه با توجه به نگرانی ها در مورد تأثیر هوش مصنوعی بر امنیت ملی. اگر یک مسابقه جهانی ادامه یابد، پس چه؟ و در مورد مدلهای منبع باز از لباسهایی که خارج از دسترس مقررات ایالات متحده هستند، چطور؟
چن برای اولین بار در گفتگوی ما از حالت خوشبینانه خود صرف نظر کرد: "من فکر می کنم ما باید برای جهانی آماده شویم که مثلا شش ماه تا یک سال بعد، مدل های متن باز با توانایی عوامل پشت حادثه Hagging Face را داشته باشیم، اما آنها عمدا برای حمله به زیرساخت ها یا ایجاد آسیب در جهان نادرست هستند."
چن میگوید آنچه جهان بیش از همه به آن نیاز دارد OpenAI است. اگر برای لحظهای به این موضوع فکر کنید که OpenAI یکی از شرکتهایی است که بیشتر به همسویی اهمیت میدهد - و من معتقدم که این درست است؛ میتوان درباره آن بحث کرد، اما من واقعا فکر میکنم درست است - پس اگر OpenAI را ناپدید کنید، برای جهان بد خواهد بود.
خطرات وجودی
در مورد ادعاهای شدیدتر برخی از همتایانش در سیلیکون ولی مبنی بر اینکه هوش مصنوعی می تواند همه ما را بکشد - و اینکه شرکت هایی مانند OpenAI و Anthropic به اندازه کافی برای متوقف کردن آن تلاش نمی کنند، چطور؟
او میگوید: «محققان گروهی ناهمگون از مردم هستند، میدانید که دارای باورهای گستردهای هستند.
شخصا فکر نمیکنم که ما مجبور باشیم به این دلیل که همه ما در معرض خطر قرار بگیریم، تسلیم شویم. ما در این مورد آژانس داریم. اگر مدلهایی را واقعا چنین احتمالی برای ایجاد خطر برای بشریت داشته باشند، نمیرویم و به کار نمیگیریم. در یک آزمایشگاه مرزی، شما این توانایی را دارید که روی خطری که دارید کار کنید. جهان در استقرار مدل های شما."
(در بحث در مورد سطوح خطر، حرف یونانی epsilon اغلب به عنوان یک مکان نگهدار ریاضی برای یک آستانه قابل قبول استفاده می شود. چن نمی گوید اپسیلون او چه خواهد بود.)
وقتی از رهبران فناوری خواسته میشود نقاط منفی هوش مصنوعی را توجیه کنند، نکته اصلی آنها این است که مزایا - از کمک به درمان بیماریها تا دستیابی به منابع پاکتر انرژی - بسیار بیشتر از هزینههای فوری است. دردهای کوتاه مدت، دستاوردهای بلند مدت.
اما با انباشته شدن جنبههای منفی، آیا ساختن آن سختتر میشود؟ آیا نقطه ای وجود دارد که چن کمتر احساس می کند که در حال ساخت چیزی شگفت انگیز است و بیشتر احساس می کند که به سادگی آسیب را به حداقل می رساند - به جای ایجاد آینده ای بهتر، با آتش سوزی مبارزه می کند؟
قابلیتهای این مدلها در حال حاضر مشهود است، او میگوید: "زمان آن فرا رسیده است که مزایای هوش مصنوعی را به بشریت ارائه کنیم. زمان آن فرا رسیده است که روی مشکلات عمیق در کشف دارو، مواد و برنامههای علمی که در واقع زندگی مردم را تغییر میدهند، کار کنیم."
او میافزاید: «بله، خطری وجود دارد که ما متحمل میشویم، اما همه این مزایا را میبینیم». "من فکر می کنم ما باید آن را کمتر انتزاعی کنیم. اگر مردم واقعا بتوانند جنبه مثبت را ببینند، فکر می کنم به آن ایمان خواهند داشت."
متن اصلی (انگلیسی)
“We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer
Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…