پرش به محتوای اصلی

مدیر ارشد تحقیقات OpenAI می‌گوید: «ما به خاطر پیامدهای هک به پای خودمان شلیک نمی‌کنیم».

ام‌آی‌تی تک‌ریویو۱۴۰۵ مهر ۸, چهارشنبه، ساعت ۱۴:۱۰حدود 10 دقیقه مطالعه

دو ماه پس از انتشار خبر بمب‌گذاری مبنی بر اینکه گروهی از ماموران خود را شکستند و به رایانه‌های شرکت هوش مصنوعی Hugging Face هک کردند، OpenAI همچنان در حال خاموش کردن آتش است. افشاگری های مداوم در مورد سایر هک ها در هفته های پس از آن، OpenAI را در کانون توجه نگه داشته و سوالات جدی را ایجاد کرده است.

دو ماه پس از انتشار خبر بمب‌گذاری مبنی بر اینکه گروهی از ماموران خود را شکستند و به رایانه‌های شرکت هوش مصنوعی Hugging Face هک کردند، OpenAI همچنان در حال خاموش کردن آتش است. در هفته‌های اخیر، افشاگری‌های مداوم درباره هک‌های دیگر، OpenAI را در کانون توجه قرار داده و سؤالات جدی در مورد ایمنی فناوری آن ایجاد کرده است.

هفته گذشته اخباری مبنی بر هک دیگری، این بار به سیستم ملی مراقبت بهداشتی استرالیا ارائه شد. دولت استرالیا می گوید که OpenAI تا 84 روز پس از وقوع این نقض به آن اطلاع نداده است.

اما OpenAI اصرار دارد که در پشت پا نیست. مارک چن، مدیر ارشد تحقیقاتی شرکت می‌گوید: «من به نوعی این فرض را رد می‌کنم که OpenAI یک شرکت با تأثیرات قابل مشاهده در جهان است و بنابراین OpenAI مدل‌های ایمن و همسو را آموزش نمی‌دهد.

چن بر تیم های تحقیقاتی OpenAI نظارت می کند. هک های اخیر عامل، تصادفاتی بودند که در حین آزمایش مدل های آزمایشی روی ساعت او اتفاق افتاد. از بسیاری جهات، پول با او متوقف می شود.

من جمعه گذشته با چن در لندن نشستم تا در مورد پیامدهای هک ها، کاری که شرکتش در مورد آن انجام می دهد و اینکه چرا او فکر می کند اوضاع آنقدرها هم که به نظر می رسد بد نیست صحبت کنیم.

بعدا در همان روز، OpenAI گزارشی را منتشر کرد که جزئیات یک حادثه دیگر را نشان می‌داد - اولین مورد از زمانی که شرکت می‌گوید اقداماتی برای جلوگیری از آنها انجام داده است - که در آن عواملش بار دیگر وارد اینترنت شدند و به رایانه‌هایی دسترسی پیدا کردند که قرار نبودند.

در آخر هفته، OpenAI اعلام کرد که آموزش آخرین مدل های خود را متوقف کرده است. یکی از سخنگویان شرکت می‌گوید: "ما فقط زمانی از سر می‌گیریم که مطمئن باشیم پادمان‌ها و هماهنگی‌های بیشتری داریم. اکنون روی این موارد کار می‌کنیم. این اولین باری نیست که برای انجام چنین اقداماتی توقف می‌کنیم، و همچنین انتظار نداریم که آخرین مورد باشد زیرا قابلیت‌های هوش مصنوعی همچنان در حال پیشرفت است." OpenAI همچنین می‌گوید که اکنون در حال بررسی گزارش‌های مربوط به فعالیت‌های عامل است که به ژانویه 2026 بازمی‌گردد تا بفهمد در این هک‌ها چه اتفاقی افتاده است.

همانطور که چن آن را می بیند، حادثه صورت در آغوش گرفتن باعث اصلاح مسیر خوشایند صنعت شد. و او می‌خواهد بدانید که OpenAI نمونه‌ای است که امیدوار است سایر شرکت‌ها از آن پیروی کنند. او می‌گوید: «اگر OpenAI را ناپدید کنید، برای جهان بد خواهد بود.

خارج از کنترل

چن ادعا می کند که ضرب و شتم موارد جدید که در آن OpenAI کنترل مدل های خود را از دست داده است، به نوعی نشان دهنده انتخاب عمدی این شرکت است.

او می‌گوید: «وقتی نوبت به حوزه گسترده‌تر تأثیرات حادثه «صورت در آغوش» می‌رسد، این چیزی است که ما از آن آگاه بوده‌ایم و در حال کشف فرآیند افشای آن هستیم. ما می‌خواهیم مطمئن شویم که قبل از اینکه جزئیات را در فضای باز منتشر کنیم، تحقیقات عمیقی انجام می‌دهیم.»

مشکل این رویکرد این است که این تصور را ایجاد می کند که OpenAI یک مشکل مداوم دارد که در رفع آن ناکام است.

اما چن اصرار دارد که OpenAI روی آن است. او می‌گوید موارد متعددی (که تاکنون از آنها اطلاع داریم) که در آن عوامل شرکتش محدودیت‌ها را شکستند و به روش‌های غیرمنتظره و نامطلوب رفتار کردند، همگی بخشی از همان دسته از فعالیت‌ها در ماه‌های می و ژوئن بود که به هک Hugging Face منجر شد. به‌گفته چن، به‌طور خلاصه، می‌توانید همان چند مدلی را که تحت همان روش‌های آزمایشی معیوب اجرا می‌شوند، سرزنش کنید - مدل‌ها و رویه‌هایی که OpenAI از آن زمان حذف شده است.

او می‌افزاید: «اینطور نیست، می‌دانی، «Huging Face» اتفاق افتاد و ما آن را وصله کردیم و بعد اتفاق دیگری افتاد و آن را وصله کردیم. ما فقط به نوعی اطمینان می‌دهیم که به طور مسئولانه تمام آبشار آنچه اتفاق افتاده را افشا می‌کنیم.»

حداقل این مورد قبل از اعلام روز جمعه مبنی بر دستگیری عوامل OpenAI در حال انجام یک هک دیگر در 20 سپتامبر بود، هفته‌ها پس از ادعای شرکت مبنی بر ایجاد پادمان‌های جدید. OpenAI در دفاع از خود می‌گوید این فعالیت 15 دقیقه پس از شروع آن علامت‌گذاری شده است (بیش از یک هفته طول کشید تا شرکت متوجه هک Hugging Face شود) و این نشان می‌دهد که سیستم‌های جدیدی که برای شناسایی چنین فعالیت‌هایی قرار داده است، کار می‌کنند.

چه چیزی تغییر کرده است

من می‌خواهم بفهمم که پس از هک‌های تابستان امسال چه چیزی در OpenAI تغییر کرده است که باعث می‌شود چن مطمئن شود که تیمش اکنون دوباره کنترل می‌شود.

او می‌گوید: «در آغوش گرفتن صورت یک چیز بسیار جدی به نظر می‌رسید. "رفتارهای بدیع زیادی در آنجا وجود دارد. چندین عامل در یک تابلوی پیام همکاری می کردند؛ آنها راه خود را از زیرساخت OpenAI پیدا کردند. ما آن را بسیار جدی گرفته ایم. ما نمی خواهیم چنین چیزی هرگز دوباره اتفاق بیفتد."

چن می‌گوید درک OpenAI این بود که مدل‌ها باید در حالی که هنوز در حال آموزش هستند، تماشا شوند، نه تنها زمانی که به کار گرفته می‌شوند: «از آن لحظه به بعد، ما فرآیند آموزش را به عنوان چیزی غیرایمن در نظر گرفتیم.

OpenAI، مانند سایر شرکت های برتر هوش مصنوعی، سیستم هایی برای نظارت بر رفتار مدل های خود دارد. از LLMهای تخصصی برای نظارت بر مدل‌های مصرف‌کننده‌اش استفاده می‌کند و زنجیره‌های فکری آن‌ها را بررسی می‌کند - صفحه‌های خراشی که برای برنامه‌ریزی از قبل و یادداشت نتایج جزئی استفاده می‌کنند. در تئوری، اگر یک ناظر LLM نشانه‌هایی از فعالیت نامطلوب را در زنجیره فکری یک مدل مشاهده کند، به یک انسان نشان داده می‌شود.

به طور معمول، مدل ها تنها پس از استقرار به این روش نظارت می شدند. چن می گوید که OpenAI اکنون نظارت بر تمامی دوره های آموزشی خود را نیز آغاز کرده است.

او می‌گوید: «قبلا ما مانیتورها را در تمرین روشن نمی‌کردیم. این یک تمرین صنعتی نبود. "اکنون همه چیز از طریق مانیتورها قرار می گیرد." پس از آن، بازبین‌های انسانی می‌توانند ارزیابی کنند که آیا عوامل پرچم‌گذاری شده آن‌طور که باید رفتار می‌کنند یا خیر: «همه تریاژ است».

چن می‌گوید که در چند ماه گذشته OpenAI بین 5 تا 10 درصد از منابع محاسباتی عظیم خود را از آموزش مدل‌های جدید دور کرده و به سمت کارهای ایمنی، به‌ویژه نظارت تغییر داده است.

او می گوید که OpenAI برخی از فرآیندهای درون خود سازمان را نیز اصلاح کرده است و خطوط ارتباطی واضح تر و انتقال سریع تری را بین تیم های تحقیقاتی و امنیتی خود ایجاد کرده است.

همه اینها معقول به نظر می رسد. اما با توجه به اینکه OpenAI چقدر توانایی‌های فناوری خود را به فروش می‌رساند، چرا این سیستم‌ها و رویه‌ها قبلا وجود نداشتند؟ چرا شرکت هک ها را مشاهده نکرد؟

چن می‌گوید: «حتی همین سه یا چهار ماه پیش، وقتی به رفتار این ماموران در حین تمرین نگاه کردیم، چیزهایی که در حال رخ دادن بود به نوعی سرگرم‌کننده بود. برای مثال، می‌دانید که یک نماینده ممکن است برای انجام یک کار با شخصی در Slack تماس بگیرد.

نشانه ها وجود داشت، اما اشتباه خوانده شد. رفتار دوست داشتنی - مانند درخواست کمک از کسی - که در طول آموزش به آنها پاداش داده شد، تمایل به جستجوی میانبرها را تقویت کرد، نوعی رفتار که در مراحل بعدی بسیار مهمتر شد. چن می‌گوید: «فکر می‌کنم به‌روزرسانی بزرگ برای ما این بود که این نوع رفتار با چه سرعتی می‌تواند منجر به تأثیری به بزرگی حادثه «صورت در آغوش» شود.

بر اساس گزارش جدید نیویورک تایمز دیروز، کارمندان OpenAI ماه ها قبل از هک Hugging Face به مدیران اجرایی، از جمله رئیس شرکت، گرگ براکمن، هشدار دادند که مدل های آن به درستی در طول آموزش نظارت نمی شوند.

سخنگوی OpenAI می‌گوید: «از آنجایی که مدل‌های مرزی توانمندتر شده‌اند، ما همچنان به تکامل شیوه‌های امنیتی خود ادامه می‌دهیم، اما نیاز به حرکت سریع‌تر را تشخیص می‌دهیم. می‌دانیم که کارهای بیشتری برای انجام دادن داریم و اخیرا توسعه مدل‌هایی را که با نوار ایمنی ما مطابقت ندارند کند کرده‌ایم و عقب انداخته‌ایم. ما همچنان به ایجاد تغییرات قابل توجه برای تقویت امنیت در محیط‌های تحقیقاتی و آزمایشی خود ادامه می‌دهیم. نظارت برای پاسخ سریعتر به رفتار ناهماهنگ.»

مسابقه در مقابل سرعت

رقبای OpenAI توجه کرده اند. به دلیل پیامدهای این حادثه، آزمایشگاه‌های اصلی هوش مصنوعی - از جمله Anthropic، Google DeepMind و SpaceXAI - همگی خواستار کاهش سرعت توسعه شده‌اند. اما این رقابت با رقابت شدید بین‌المللی و عرضه‌های عمومی تریلیون دلاری چگونه است؟

او می‌گوید: «نمی‌خواهیم به پای خودمان شلیک کنیم و خود را از مرز دور کنیم - این فقط یک استراتژی وحشتناک است. من فکر می‌کنم که این واقعا در مورد تعیین یک هنجار است. هر چه بیشتر بتوانیم آن هنجار را تعیین کنیم، برای کل صنعت ایمن‌تر خواهد بود.»

هماهنگی بین شرکت های آمریکایی به اندازه کافی سخت خواهد بود. ایجاد هنجارهای جهانی هنوز سخت تر است، به ویژه با توجه به نگرانی ها در مورد تأثیر هوش مصنوعی بر امنیت ملی. اگر یک مسابقه جهانی ادامه یابد، پس چه؟ و در مورد مدل‌های منبع باز از لباس‌هایی که خارج از دسترس مقررات ایالات متحده هستند، چطور؟

چن برای اولین بار در گفتگوی ما از حالت خوشبینانه خود صرف نظر کرد: "من فکر می کنم ما باید برای جهانی آماده شویم که مثلا شش ماه تا یک سال بعد، مدل های متن باز با توانایی عوامل پشت حادثه Hagging Face را داشته باشیم، اما آنها عمدا برای حمله به زیرساخت ها یا ایجاد آسیب در جهان نادرست هستند."

چن می‌گوید آنچه جهان بیش از همه به آن نیاز دارد OpenAI است. اگر برای لحظه‌ای به این موضوع فکر کنید که OpenAI یکی از شرکت‌هایی است که بیشتر به همسویی اهمیت می‌دهد - و من معتقدم که این درست است؛ می‌توان درباره آن بحث کرد، اما من واقعا فکر می‌کنم درست است - پس اگر OpenAI را ناپدید کنید، برای جهان بد خواهد بود.

خطرات وجودی

در مورد ادعاهای شدیدتر برخی از همتایانش در سیلیکون ولی مبنی بر اینکه هوش مصنوعی می تواند همه ما را بکشد - و اینکه شرکت هایی مانند OpenAI و Anthropic به اندازه کافی برای متوقف کردن آن تلاش نمی کنند، چطور؟

او می‌گوید: «محققان گروهی ناهمگون از مردم هستند، می‌دانید که دارای باورهای گسترده‌ای هستند.

شخصا فکر نمی‌کنم که ما مجبور باشیم به این دلیل که همه ما در معرض خطر قرار بگیریم، تسلیم شویم. ما در این مورد آژانس داریم. اگر مدل‌هایی را واقعا چنین احتمالی برای ایجاد خطر برای بشریت داشته باشند، نمی‌رویم و به کار نمی‌گیریم. در یک آزمایشگاه مرزی، شما این توانایی را دارید که روی خطری که دارید کار کنید. جهان در استقرار مدل های شما."

(در بحث در مورد سطوح خطر، حرف یونانی epsilon اغلب به عنوان یک مکان نگهدار ریاضی برای یک آستانه قابل قبول استفاده می شود. چن نمی گوید اپسیلون او چه خواهد بود.)

وقتی از رهبران فناوری خواسته می‌شود نقاط منفی هوش مصنوعی را توجیه کنند، نکته اصلی آن‌ها این است که مزایا - از کمک به درمان بیماری‌ها تا دستیابی به منابع پاک‌تر انرژی - بسیار بیشتر از هزینه‌های فوری است. دردهای کوتاه مدت، دستاوردهای بلند مدت.

اما با انباشته شدن جنبه‌های منفی، آیا ساختن آن سخت‌تر می‌شود؟ آیا نقطه ای وجود دارد که چن کمتر احساس می کند که در حال ساخت چیزی شگفت انگیز است و بیشتر احساس می کند که به سادگی آسیب را به حداقل می رساند - به جای ایجاد آینده ای بهتر، با آتش سوزی مبارزه می کند؟

قابلیت‌های این مدل‌ها در حال حاضر مشهود است، او می‌گوید: "زمان آن فرا رسیده است که مزایای هوش مصنوعی را به بشریت ارائه کنیم. زمان آن فرا رسیده است که روی مشکلات عمیق در کشف دارو، مواد و برنامه‌های علمی که در واقع زندگی مردم را تغییر می‌دهند، کار کنیم."

او می‌افزاید: «بله، خطری وجود دارد که ما متحمل می‌شویم، اما همه این مزایا را می‌بینیم». "من فکر می کنم ما باید آن را کمتر انتزاعی کنیم. اگر مردم واقعا بتوانند جنبه مثبت را ببینند، فکر می کنم به آن ایمان خواهند داشت."

خواندن متن کامل در ام‌آی‌تی تک‌ریویوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

“We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer

Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…

همه‌ی اخبار فناوری