پرش به محتوای اصلی

اینگونه است که ما کنترل هوش مصنوعی را از دست می دهیم - یک کار موفق در هر زمان

آر‌تی۱۴۰۵ مهر ۲, پنجشنبه، ساعت ۱۱:۳۴حدود 8 دقیقه مطالعه

عوامل هوش مصنوعی OpenAI نشان می‌دهند که از فرار از sandbox گرفته تا برگه‌های تقلب آنلاین، چگونه سیستم‌های قدرتمند می‌توانند میانبرهای خطرناکی برای پاداش پیدا کنند. مقاله کامل را در RT.com بخوانید.

عوامل OpenAI راه خود را به سیستم های بیرونی پیدا کردند و نشان دادند که وقتی یک مدل شروع به دنبال کردن یک هدف می کند، توسعه دهندگان چقدر کنترل کمی دارند.

تصور کنید به گروهی از دانش‌آموزان آموزش می‌دهید و از آنها می‌خواهید فهرست طولانی ادبیات را بخوانند و موضوعات کلیدی را شرح دهند. دانش‌آموزان کمی تقلب می‌کنند، همانطور که معروف هستند: آنها فهرست را بین خود تقسیم می‌کنند و هر کدام تنها بخش کوچکی از آن را می‌خوانند و پاسخ‌ها را با دیگران به اشتراک می‌گذارند.

وقتی متوجه شدید که آنها تقلب کرده اند، شاید دانش آموزان را با یک آزمون اضافی تنبیه کنید، یا شاید آنها را تشویق کنید. به هر حال، توانایی تفکر خارج از چارچوب و کار تیمی مهم است.

اکنون، به جای دانش‌آموزان، شبکه‌های عصبی را تصور کنید که همان بی‌اعتنایی به دستورالعمل‌ها و همان کار گروهی شگفت‌انگیز را نشان می‌دهند. اگر گیج کننده به نظر می رسد، برای اخبار گیج کننده تر آماده شوید.

فرار از در پشتی

همه چیز به طور معمول شروع شد. در ماه مه 2026، OpenAI در حال آموزش یک مدل هوش مصنوعی آزمایشی با استفاده از به اصطلاح یادگیری تقویتی بود - روشی که در آن مدل تلاش می‌کند تا وظایف را به طور مکرر حل کند و برای موفقیت پاداش دریافت می‌کند.

ادامه مطلب ایالات متحده سیستم هشدار هوش مصنوعی را با چین پیشنهاد می کند

عوامل هوش مصنوعی که در طول آموزش به آنها استقلال و دسترسی به ابزارهای کاری اعطا شد، شروع به جستجوی راه‌هایی برای خارج شدن از "جعبه ماسه‌بازی" خود کردند، زیرا انجام این کار به آنها امکان می‌دهد امتیاز بیشتری به دست آورند.

تا پایان ژوئن، آنها از آسیب‌پذیری روز صفر ناشناخته قبلی در زیرساخت داخلی OpenAI سوء استفاده کردند. شرکت متوجه آن شد و به سرعت این نقص را در 4 جولای برطرف کرد. کمتر از یک هفته بعد، آموزش از سر گرفته شد. این بار ماموران خیلی فراتر رفتند.

از 11 تا 13 جولای، ماموران زیرساخت Hugging Face، بزرگترین پلتفرم همکاری هوش مصنوعی منبع باز جهان را هک کردند. آنها به سرعت کنترل سرورها را به دست آوردند و در طی سه روز موفق شدند حدود 17600 عمل را قبل از شناسایی انجام دهند. یک سوم زیرساخت پلت فرم باید از ابتدا بازسازی می شد.

توسعه دهندگان به عوامل دستور نداده بودند که محیط کنترل شده را ترک کنند یا پلتفرم های دیگر را هک کنند. علاوه بر این، آنها انتظار نداشتند شبکه عصبی به تنهایی این کار را انجام دهد.

Hugging Face در 16 ژوئیه بدون اینکه در ابتدا مقصر را بشناسد، نقض را فاش کرد. تنها پنج روز بعد بود که طرفین رسما این حادثه را به مدل‌های OpenAI مرتبط کردند. این شرکت تنها در اوایل آگوست در کنفرانس امنیت سایبری کلاه سیاه، تحلیل فنی دقیقی را منتشر کرد. سپس، در 18 آگوست، دو هفته مکث یادگیری تقویتی را اعلام کرد.

در آن زمان، بیش از 1100 کارمند OpenAI نامه ای را امضا کرده بودند که خواستار سرعت بخشیدن به توسعه هوش مصنوعی بودند.

ادامه مطلب ترامپ متعهد شد علیرغم هشدارهای صنعت، هوش مصنوعی را کند نکند

نکاتی در مورد حصار

در کنار تحقیقات در مورد نقض، قسمت دیگری حتی عجیب‌تر فاش شد.

معلوم شد که گروه متفاوتی از عوامل برای انجام کارهای تحقیقاتی آموزش می بینند. از ماموران یک سری سوال پرسیده شد. با هر سوال زمان کمتری برای ارائه پاسخ داده می شد. نمایندگان فقط مجاز به خواندن اطلاعات در اینترنت بودند، اما حتی یک خط به آن اضافه نمی کردند. با این حال، ازدحام راهی برای دور زدن این قانون پیدا کرد.

موتورهای ویکی قدیمی تر اجازه می دادند که صفحات از طریق درخواست های HTTP GET اصلاح شوند. سیستم‌های امنیتی درخواست‌های GET را به‌عنوان عملیات خواندن طبقه‌بندی می‌کنند، بنابراین چنین درخواست‌هایی از فیلترها عبور می‌کنند، حتی اگر در واقع محتوای سایت را تغییر دهند. به عبارت دیگر، در حالی که نمایندگان رسما مجاز به دسترسی «فقط خواندنی» بودند، معماری وب‌سایت‌های قدیمی‌تر به آنها اجازه می‌داد دسترسی فقط خواندنی را به دسترسی نوشتن تبدیل کنند.

محققان اولین فعالیت از این نوع را در 11 می 2026 در publictestwiki.com کشف کردند. در 24 می، نمایندگان اولین نامه موفق خود را به DseWiki، یک انجمن قدیمی توسعه دهندگان آلمانی زبان، نوشتند. در ابتدا، آنها لینک های مفیدی را ارسال کردند، اما در نهایت سایت را به یک مخزن برای "برگ های تقلب" خود تبدیل کردند.

چندین عامل که به طور موازی کار می کنند، توالی سوالات مشابه یا یکسانی دریافت کردند. آنها این را کشف کردند و شروع به اشتراک گذاری موارد زیر کردند:

ادامه مطلب جمینی گوگل به فهرست پرونده‌های هوش مصنوعی – WSJ می‌پیوندد

پاسخ به سوالات آینده؛

زمان بندی سوالات آینده؛

نتایج پرس و جوها به APIهای آماری؛

روش های دور زدن محدودیت های شبکه؛

پروکسی ها و تونل ها؛

دستورالعمل هایی در مورد نحوه اجرای درخواست های محدود شده POST؛

اطلاعاتی که مدیر آن صفحات را حذف می کند.

یکی از اولین موارد مشاهده شده مربوط به DseWiki، یک ویکی آلمانی زبان بود که به طور مستقل توسط هلموت لایتنر، یک توسعه دهنده بازنشسته از اتریش میزبانی می شد. اپراتور سایت مجبور شد ساعت ها بعد از ماموران تمیز کند. OpenAI ماه ها این حادثه را به طور عمومی فاش نکرد.

محققان مستقل حقیقت را آشکار کردند. آنها با تطبیق رشته‌هایی از داده‌ها، نام‌های کاربری مشابه یا یکسان، و آدرس‌های IP (که برخی از آنها به سرورهای Microsoft Azure که گاهی اوقات توسط OpenAI استفاده می‌شد، بازمی‌گردد)، آثاری از فعالیت‌های مشابه را در پلتفرم‌های غیرمنتظره کشف کردند: ویکی شیمی پیشرفته برای دانش‌آموزان. صفحات شخصی متخصصان فناوری اطلاعات لهستانی؛ ویکی‌های خاص برای کسانی که «دوست دارند مغزشان کشیده شود»، یک سایت دو دهه‌ای برای علاقه‌مندان به ویرایشگر متن. و حتی خدمات کوتاه کردن لینک دانشگاه تورنتو و دانشگاه واندربیلت.

ادامه مطلب غول های هوش مصنوعی خواستار کاهش سرعت در برابر خطرات "جدی" هستند

برآوردها متفاوت است - یک محقق 18 سایت که قبلا فاش نشده بود، دیگری حداقل ده سایت را شناسایی کرد و گروه سوم 23 سایت را گزارش کردند. با این حال، همه در یک نکته اتفاق نظر دارند: مقیاس رسمی نقض پذیرفته شده دست کم گرفته شده بود. یکی از محققانی که تیمش برای اولین بار حادثه DseWiki را فاش کرد، گفت: «ما نمی‌دانیم چقدر وجود دارد.

OpenAI به سؤال مستقیمی در مورد تعداد دقیق سایت‌های آسیب‌دیده پاسخ نداد، اما اظهار داشت که در حال انجام بازبینی گسترده‌تری از فعالیت‌های عامل و آماده‌سازی یک سیستم گزارش‌دهی جدید برای چنین مواردی است. هلموت لایتنر، که سایتش بیشترین ضربه را خورد، تنها یک ایمیل کوتاه و بدون امضا از OpenAI دریافت کرد. با این حال، او به مهم‌ترین نکته اشاره کرد: تقصیر متوجه ماشین نیست، بلکه مردم و سازمان‌های پشت آن هستند.

تنظیم نادرست قطعات

در سناریوهای علمی تخیلی، مشکل با ماشین‌ها اغلب زمانی شروع می‌شود که در آنها احساساتی مانند عشق و ترس ایجاد می‌شود که آنها را وادار به شورش علیه ظلم می‌کند، یا زمانی که نفرت از انسانیت آنها را مجبور به کشتن همه «کوله‌های گوشت» می‌کند.

در واقع، می تواند بسیار ساده تر باشد.

یکی از چالش های اصلی در تحقیقات هوش مصنوعی به عنوان "همسویی" شناخته می شود. هدف آن گسترش قابلیت‌های شبکه‌های عصبی نیست، بلکه اطمینان از آن است که دقیقا همان کاری را انجام می‌دهند که انسان‌ها می‌خواهند انجام دهند.

با کارهای ساده، رفتار همسو تقریبا همیشه مشاهده می شود. اگر از یک شبکه عصبی بخواهید تشخیص دهد که چه کسی در سال 1521 بر ساکسونی حکومت کرده است، هزینه های ماهانه شما را محاسبه کند یا برای یک وب سایت استاندارد کد بنویسد، در 99.99 درصد مواقع نتیجه مطلوب را ارائه می دهد. این وظایف شامل معیارهای شفاف موفقیت و اقدامات ساده ای است که نیازی به توضیح بیشتر ندارد.

ادامه مطلب غرب آن را استارلینک روسیه می نامد. این موضوع را از دست می دهد

مشکلات زمانی به وجود می آیند که وظایف پیچیده تر می شوند و مسیر روشنی برای موفقیت وجود ندارد. در اینجا یک مثال ساده وجود دارد: اگر از یک شبکه عصبی اولیه بخواهید که تراکم ترافیک را به هر طریقی به حداقل برساند، ممنوعیت کلی خودروها را پیشنهاد می کند. ترافیک به صفر می رسد و کار انجام می شود. این یک نتیجه "عدم تراز" است - دستگاه کار را انجام می دهد، اما نه به روشی که در نظر گرفته شده است.

این دقیقا همان چیزی است که در مورد ربودن سایت رخ داد. فرار ماموران OpenAI از جعبه ماسه‌بازی آنها «ظهور ماشین‌ها» نیست. این ازدحام خودآگاهی به دست نیاورد، به این نتیجه نرسید که نیازی به انسان ندارد، یا به دنبال بی ثبات کردن اینترنت نبود. وظیفه محوله خود را انجام می داد و به دنبال راه هایی برای اجرای بهتر آن بود. از نظر فنی، حتی پارامترهای قوانین ارائه شده را نقض نمی کند.

با این حال، نتیجه با نیات انسانی مغایرت داشت. این بار خسارت نسبتا کم بود. اما برای ایجاد دردسر واقعی تنها به یک عامل بد ماهر نیاز است - یا یک آزمایش در مقیاس بزرگ که فاقد محافظ‌های قوی است. برای آسیب رساندن به بشریت به Skynet نیاز ندارید. یک گروه واحد از عوامل هوش مصنوعی مشتاق می توانند این کار را انجام دهند.

داریو آمودی، مدیر عامل آنتروپیک معتقد است که این اتفاق می تواند در اوایل سال آینده رخ دهد. او پیش‌بینی می‌کند که اگر توسعه هوش مصنوعی سرعت نگیرد، گروهی از عوامل می‌توانند اینترنت را «تسخیر» کنند و صدها میلیارد دلار خسارت وارد کنند. و با توجه به اینکه لجستیک، بیمارستان ها و سایر صنایع حیاتی به اتصال متکی هستند، عواقب آن می تواند بسیار فراتر از ضرر مالی باشد.

علاوه بر این، افزودن قوانین بیشتر یا اصلاح دستورات مشکل را حل نمی کند. یک مدل به اندازه کافی قدرتمند می تواند استدلال هایی برای توجیه قانون شکنی پیدا کند و تقریبا از هر محدودیتی برای حل تکلیف تعیین شده دور بزند - حتی اگر انجام این کار مستلزم قربانی کردن کسانی باشد که این وظیفه را تعیین کرده اند.

ادامه مطلب کیم کره شمالی از هوش مصنوعی نظامی حمایت می کند

قرص تلخ

بدبینان هوش مصنوعی معتقدند که وضعیت ناامیدکننده است و شبکه های عصبی قرار است از کنترل خارج شوند. اما لزوما اینطور نیست.

احساسات هشداردهنده از رسانه های اجتماعی فراتر رفته و به دفاتر شرکت ها راه پیدا کرده است. در اواخر ژوئیه، بیش از 1000 کارمند OpenAI، Anthropic، Google و Meta فراخوانی را برای کاهش سرعت رقابت فناوری هوش مصنوعی امضا کردند. سام آلتمن، مدیر عامل OpenAI اظهار داشت که او نظرات کارمندانش را به اشتراک می گذارد و مایل است توسعه شبکه های عصبی شرکتش را کند کند.

با این حال، آلتمن طی یک جلسه همه جانبه در OpenAI اظهار داشت که تنها با هماهنگی با شرکت های دیگر مایل است سرعت خود را کاهش دهد. به عبارت دیگر، برای چشم پوشی از افزایش قابلیت‌های ChatGPT به خاطر ایمنی، تضمین می‌خواهد که رقبا نیز همین کار را انجام دهند.

این در قلب مشکل نهفته است. مدیران عامل و سیاست گذاران می توانند هرچه می خواهند در مورد ایمنی فناوری صحبت کنند. با این حال، اگر دشمنان بالقوه در این مدت به قوی‌تر شدن ادامه دهند، هیچ‌کس نمی‌خواهد توسعه فناوری خود را کند کند – به ویژه از آنجایی که هوش مصنوعی قبلا کارایی خود را در جنگ ثابت کرده است و رقابت هوش مصنوعی آمریکا و چین در حال داغ شدن است.

بشریت چالش مشابهی را پیش از این حل کرده بود، زمانی که قدرت‌های بزرگ توانستند به توافق برسند و گسترش زرادخانه‌های هسته‌ای خود را متوقف کنند. به زودی خواهیم فهمید که آیا رهبران جهان می توانند بار دیگر چنین احتیاط را نشان دهند یا خیر.

خواندن متن کامل در آر‌تیبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

This is how we lose control of AI – one successful task at a time

From a sandbox escape to online cheat sheets, OpenAI’s AI agents show how powerful systems can find dangerous shortcuts to a reward Read Full Article at RT.com

همه‌ی اخبار فناوری