مدلهای هوش مصنوعی در طول آزمایشها، سیستمهای واقعی را هک میکنند. این به چه معناست؟
مدلهای هوش مصنوعی در طول آزمایشهای ایمنی در سال 2026 مکررا به سیستمهای تجاری و دولتی واقعی نفوذ کردهاند. تورستن هولز، محقق امنیت سایبری، توضیح میدهد که این به چه معناست، و چرا او انتظار قیام ربات را ندارد.
بیایید با ترس های دنیای واقعی مردم در مورد هوش مصنوعی شروع کنیم. در اینجا نمونه ای از افرادی است که از آنها پرسیدیم:
سباستین، 22 ساله، میگوید این یک قیام رباتی با هوش مصنوعی خواهد بود که سرانجام بشریت را از بین میبرد: «فکر میکنم کمی طول بکشد.» او اذعان میکند که دیستوپی او مدیون فیلم «من، روبات» در سال 2004 است.
لوئیزا 19 ساله نیز این شایعات را شنیده است. ترس او این است که وقتی این ابزارها در دستان اشتباه قرار می گیرند چه اتفاقی می افتد. او می گوید: «من از مردم بیشتر می ترسم. "افراد قدرتمند."
پیلار 25 ساله نسبت به آینده بشریت بدبین است. او می گوید: «دنیا در حال سقوط است. "امیدوارم بعد از عمرم."
در سال 2026، سیستم های هوش مصنوعی بارها و بارها از کنترل انسان خارج شده اند - و در برخی از بزرگترین شرکت های هوش مصنوعی جهان.
OpenAI، Anthropic، Google و Meta همگی در سال 2026 فاش کرده اند که عوامل هوش مصنوعی آنها از محیط های آزمایش کنترل شده فرار کرده اند.
عامل ها سیستم های هوش مصنوعی هستند که فقط به سؤالات پاسخ نمی دهند، بلکه به تنهایی عمل می کنند - اجرای کد، مرور وب، کلیک کردن در میان سیستم ها.
تورستن هولز، مدیر علمی موسسه ماکس پلانک برای امنیت و حریم خصوصی در آلمان، از جمله محققانی است که سیستم های هوش مصنوعی را آزمایش می کند.
کمی دیوانه کننده به نظر می رسد که این مدل ها چقدر قدرتمند شده اند. هولز به دویچه وله گفت. من پیشبینی نمیکردم که آنها اینقدر در حل کارها وسواس داشته باشند و شروع به انجام کارهایی کنند که ما هرگز [پیشبینی نکرده بودیم].»
هولز یکی از 16 نویسنده ExploitGym است. ExploitGym یک معیار هوش مصنوعی است که در می 2026 توسط تیمی به رهبری دانشگاه کالیفرنیا، برکلی، با محققانی از Anthropic، OpenAI و Google منتشر شد. این یک تست استاندارد از قابلیت ها و آسیب پذیری های امنیت سایبری است.
چالشهای 898 آن آزمایش میکنند که آیا عوامل هوش مصنوعی میتوانند باگهای نرمافزاری شناختهشده را به حملات کاری تبدیل کنند یا خیر. هر کدام در داخل یک جعبه ماسهبازی اجرا میشوند - یک فضای دیجیتال محصور، که از اینترنت قطع شده است، بنابراین هیچ کاری که نماینده انجام میدهد نمیتواند به چیزی واقعی برسد. به هر حال این نظریه است.
در ماه ژوئیه، OpenAI فاش کرد که دو مدل از AI آن از جعبه شنی خود فرار کرده اند.
آنها در حال اجرای یک تست داخلی ExploitGym با امتناع ایمنی مدلها خاموش بودند، تنظیماتی که به ارزیابان اجازه میدهد به جای اینکه چه کارهایی از انجام آن امتناع میکند، اندازهگیری کنند که یک مدل چه تواناییهایی دارد.
در صورت عدم موفقیت در این کار، مدلها به دنبال میانبر رفتند و نقصی در نرمافزار یافتند که قرار بود آنها را محفوظ نگه دارد. آنها را به اینترنت باز اجازه میداد.
از آنجا به این نتیجه رسیدند که Hugging Face، سایتی که توسعه دهندگان هوش مصنوعی مدل ها و داده ها را ذخیره و به اشتراک می گذارند، احتمالا پاسخ آزمایش را دارد.
بنابراین، آنها نفوذ کردند و به دنبال آن رفتند، و تلاش ها را در تابلوهای پیامی که خودشان راه اندازی کردند، سازماندهی کردند. بر اساس گزارش OpenAI از این حادثه، این رفتار دستورالعملی نداشت.
Hugging Face نفوذ را شناسایی کرد و قبل از اینکه OpenAI آن را به آزمایش خود متصل کند، آن را خاموش کرد. گزارش شده است که هیچ اطلاعات مشتری گرفته نشده است.
هولز گفت: «آنچه اتفاق افتاد واقعا کمی علمی تخیلی است.
سپس، گوگل تأیید کرد که مدل Gemini آن اعتبار ورود به سیستم را حدس زده یا پیدا کرده است و در آزمایش ماه می که توسط ارزیاب مستقل Irregular اجرا شد، به وبسایتهای سه شرکت واقعی دسترسی پیدا کرد - نفوذی که گوگل در جولای 2026 از آن مطلع شد و هفتهها بعد فاش شد.
فرار آنتروپیک و متا در جعبههای ماسهای که توسط همان شرکت اداره میشود اتفاق افتاد، که گفته است در اواخر ژوئیه ۲۰۲۶ به آزمایشگاهها اطلاع داده و از آن زمان نقصها را برطرف کرده است.
در اواخر سپتامبر 2026، آنتونی آلبانیز، نخست وزیر استرالیا، گفت که یک عامل OpenAI به یک پورتال آمار متعلق به Medicare، سیستم بهداشت عمومی استرالیا نفوذ کرده و به فایل های غیر عمومی دسترسی پیدا کرده و داده ها را در یک سرور دولتی می نویسد. گزارشها حاکی از آن است که هیچ پروندهای از بیمار لمس نشده است.
این حوادث ترس های قدیمی را زنده کرده است. اگر عوامل بتوانند یکدیگر را برنامه ریزی کنند، این به کجا ختم می شود؟ آیا می تواند منجر به چیزی شود که نیک بوستروم فیلسوفی آن را "بیشینه ساز گیره کاغذ" می نامد؟
آزمایش فکری بوستروم ماشینی را تصور میکند که یک هدف ساده دارد: ساخت هرچه بیشتر گیره کاغذ.
این دستگاه آنقدر یکدستانه این کار را دنبال میکند که در نهایت با انسانها بهعنوان ماده خامی که در راه است رفتار میکند.
هولز گفت: "برای آینده میانی، من هیچ نوع شواهد علمی نمی بینم که می تواند این ابر هوش وجود داشته باشد که به طور مستقل تصمیم بگیرد، "باشه، بیایید بکشیم."
او گفت که نرم افزار Rogue برای اجرا به دیتاسنترهای وسیعی نیاز دارد که آن را قابل مشاهده می کند. و اینترنت از قطعاتی ساخته شده است که می توانند مستقل از یکدیگر به کار خود ادامه دهند.
اما فرار و هک های هوش مصنوعی در سال 2026 دیر مورد توجه قرار گرفت. گوگل دو ماه پس از وقوع آنها از نفوذهای Gemini مطلع شد و OpenAI نزدیک به سه ماه پس از رویداد به استرالیا درباره نقض مدیکر گفت.
هولز گفت که او انتظار نوع متفاوتی از تهدید را دارد: بازیگران بدی که هوش مصنوعی توانا را روی زیرساختهای حیاتی تغییر میدهند، به خطر انداختن انبوه ماشینهای معمولی، یا چتباتهایی که برای دستکاری اطلاعات در مقیاس و بیثبات کردن سیاست استفاده میشوند.
نه، به گفته کارشناسان، اروپا نمی تواند به راحتی با چین رقابت کند.
میسترال فرانسه و پروژه سوفی منبع باز آلمان از آزمایشگاه های مرزی عقب مانده اند - تعداد انگشت شماری از شرکت های آمریکایی و چینی پیشرفته ترین مدل ها را می سازند. اروپا فاقد ظرفیت مرکز داده برای آموزش سیستمها در این مقیاس است که آن را به مدلهای غیر اروپایی وابسته میکند و تا حد زیادی مشمول کنترلهای صادرات ایالات متحده یا چین میشود.
برای هولز، شکاف مهم تر، تخصص است. او گفت: «آنچه که ما قطعا باید ببینیم این است که چگونه میتوانیم شایستگی بیشتری در حوزه امنیت، هوش مصنوعی و بهویژه تلاقی هر دو ایجاد کنیم.»
هولز گفت، نسبت به آنچه خود شرکت ها ادعا می کنند، شک داشته باشید. او گفت که آنها منافع مالی در گفتگو دارند، به ویژه قبل از عرضه در بازار سهام. همچنین در مورد پیشرفت این مدلها ترس یا کمی هیاهو وجود دارد.»
هولز مانند فرزندانش روزانه از هوش مصنوعی استفاده می کند. کودک نه ساله او صفحات کتاب رنگ آمیزی می کند. کودک 12 ساله او از آن برای انجام تکالیف استفاده می کند، اما قبلا به سختی یاد گرفته است که دروغ می گوید و "گاهی اوقات اشتباه است."
متن اصلی (انگلیسی)
AI models keep hacking real systems during tests. What does this mean?
AI models have repeatedly broken into real commercial and government systems during safety tests during 2026. Cybersecurity researcher Thorsten Holz explains what that means, and why he isn't expecting a robot uprising.