پرش به محتوای اصلی

مدل‌های هوش مصنوعی در طول آزمایش‌ها، سیستم‌های واقعی را هک می‌کنند. این به چه معناست؟

دویچه‌وله۱۴۰۵ مهر ۱۴, سه‌شنبه، ساعت ۱۳:۳۵حدود 5 دقیقه مطالعه

مدل‌های هوش مصنوعی در طول آزمایش‌های ایمنی در سال 2026 مکررا به سیستم‌های تجاری و دولتی واقعی نفوذ کرده‌اند. تورستن هولز، محقق امنیت سایبری، توضیح می‌دهد که این به چه معناست، و چرا او انتظار قیام ربات را ندارد.

بیایید با ترس های دنیای واقعی مردم در مورد هوش مصنوعی شروع کنیم. در اینجا نمونه ای از افرادی است که از آنها پرسیدیم:

سباستین، 22 ساله، می‌گوید این یک قیام رباتی با هوش مصنوعی خواهد بود که سرانجام بشریت را از بین می‌برد: «فکر می‌کنم کمی طول بکشد.» او اذعان می‌کند که دیستوپی او مدیون فیلم «من، روبات» در سال 2004 است.

لوئیزا 19 ساله نیز این شایعات را شنیده است. ترس او این است که وقتی این ابزارها در دستان اشتباه قرار می گیرند چه اتفاقی می افتد. او می گوید: «من از مردم بیشتر می ترسم. "افراد قدرتمند."

پیلار 25 ساله نسبت به آینده بشریت بدبین است. او می گوید: «دنیا در حال سقوط است. "امیدوارم بعد از عمرم."

در سال 2026، سیستم های هوش مصنوعی بارها و بارها از کنترل انسان خارج شده اند - و در برخی از بزرگترین شرکت های هوش مصنوعی جهان.

OpenAI، Anthropic، Google و Meta همگی در سال 2026 فاش کرده اند که عوامل هوش مصنوعی آنها از محیط های آزمایش کنترل شده فرار کرده اند.

عامل ها سیستم های هوش مصنوعی هستند که فقط به سؤالات پاسخ نمی دهند، بلکه به تنهایی عمل می کنند - اجرای کد، مرور وب، کلیک کردن در میان سیستم ها.

تورستن هولز، مدیر علمی موسسه ماکس پلانک برای امنیت و حریم خصوصی در آلمان، از جمله محققانی است که سیستم های هوش مصنوعی را آزمایش می کند.

کمی دیوانه کننده به نظر می رسد که این مدل ها چقدر قدرتمند شده اند. هولز به دویچه وله گفت. من پیش‌بینی نمی‌کردم که آن‌ها اینقدر در حل کارها وسواس داشته باشند و شروع به انجام کارهایی کنند که ما هرگز [پیش‌بینی نکرده بودیم].»

هولز یکی از 16 نویسنده ExploitGym است. ExploitGym یک معیار هوش مصنوعی است که در می 2026 توسط تیمی به رهبری دانشگاه کالیفرنیا، برکلی، با محققانی از Anthropic، OpenAI و Google منتشر شد. این یک تست استاندارد از قابلیت ها و آسیب پذیری های امنیت سایبری است.

چالش‌های 898 آن آزمایش می‌کنند که آیا عوامل هوش مصنوعی می‌توانند باگ‌های نرم‌افزاری شناخته‌شده را به حملات کاری تبدیل کنند یا خیر. هر کدام در داخل یک جعبه ماسه‌بازی اجرا می‌شوند - یک فضای دیجیتال محصور، که از اینترنت قطع شده است، بنابراین هیچ کاری که نماینده انجام می‌دهد نمی‌تواند به چیزی واقعی برسد. به هر حال این نظریه است.

در ماه ژوئیه، OpenAI فاش کرد که دو مدل از AI آن از جعبه شنی خود فرار کرده اند.

آنها در حال اجرای یک تست داخلی ExploitGym با امتناع ایمنی مدل‌ها خاموش بودند، تنظیماتی که به ارزیابان اجازه می‌دهد به جای اینکه چه کارهایی از انجام آن امتناع می‌کند، اندازه‌گیری کنند که یک مدل چه توانایی‌هایی دارد.

در صورت عدم موفقیت در این کار، مدل‌ها به دنبال میانبر رفتند و نقصی در نرم‌افزار یافتند که قرار بود آن‌ها را محفوظ نگه دارد. آن‌ها را به اینترنت باز اجازه می‌داد.

از آنجا به این نتیجه رسیدند که Hugging Face، سایتی که توسعه دهندگان هوش مصنوعی مدل ها و داده ها را ذخیره و به اشتراک می گذارند، احتمالا پاسخ آزمایش را دارد.

بنابراین، آنها نفوذ کردند و به دنبال آن رفتند، و تلاش ها را در تابلوهای پیامی که خودشان راه اندازی کردند، سازماندهی کردند. بر اساس گزارش OpenAI از این حادثه، این رفتار دستورالعملی نداشت.

Hugging Face نفوذ را شناسایی کرد و قبل از اینکه OpenAI آن را به آزمایش خود متصل کند، آن را خاموش کرد. گزارش شده است که هیچ اطلاعات مشتری گرفته نشده است.

هولز گفت: «آنچه اتفاق افتاد واقعا کمی علمی تخیلی است.

سپس، گوگل تأیید کرد که مدل Gemini آن اعتبار ورود به سیستم را حدس زده یا پیدا کرده است و در آزمایش ماه می که توسط ارزیاب مستقل Irregular اجرا شد، به وب‌سایت‌های سه شرکت واقعی دسترسی پیدا کرد - نفوذی که گوگل در جولای 2026 از آن مطلع شد و هفته‌ها بعد فاش شد.

فرار آنتروپیک و متا در جعبه‌های ماسه‌ای که توسط همان شرکت اداره می‌شود اتفاق افتاد، که گفته است در اواخر ژوئیه ۲۰۲۶ به آزمایشگاه‌ها اطلاع داده و از آن زمان نقص‌ها را برطرف کرده است.

در اواخر سپتامبر 2026، آنتونی آلبانیز، نخست وزیر استرالیا، گفت که یک عامل OpenAI به یک پورتال آمار متعلق به Medicare، سیستم بهداشت عمومی استرالیا نفوذ کرده و به فایل های غیر عمومی دسترسی پیدا کرده و داده ها را در یک سرور دولتی می نویسد. گزارش‌ها حاکی از آن است که هیچ پرونده‌ای از بیمار لمس نشده است.

این حوادث ترس های قدیمی را زنده کرده است. اگر عوامل بتوانند یکدیگر را برنامه ریزی کنند، این به کجا ختم می شود؟ آیا می تواند منجر به چیزی شود که نیک بوستروم فیلسوفی آن را "بیشینه ساز گیره کاغذ" می نامد؟

آزمایش فکری بوستروم ماشینی را تصور می‌کند که یک هدف ساده دارد: ساخت هرچه بیشتر گیره کاغذ.

این دستگاه آنقدر یکدستانه این کار را دنبال می‌کند که در نهایت با انسان‌ها به‌عنوان ماده خامی که در راه است رفتار می‌کند.

هولز گفت: "برای آینده میانی، من هیچ نوع شواهد علمی نمی بینم که می تواند این ابر هوش وجود داشته باشد که به طور مستقل تصمیم بگیرد، "باشه، بیایید بکشیم."

او گفت که نرم افزار Rogue برای اجرا به دیتاسنترهای وسیعی نیاز دارد که آن را قابل مشاهده می کند. و اینترنت از قطعاتی ساخته شده است که می توانند مستقل از یکدیگر به کار خود ادامه دهند.

اما فرار و هک های هوش مصنوعی در سال 2026 دیر مورد توجه قرار گرفت. گوگل دو ماه پس از وقوع آنها از نفوذهای Gemini مطلع شد و OpenAI نزدیک به سه ماه پس از رویداد به استرالیا درباره نقض مدیکر گفت.

هولز گفت که او انتظار نوع متفاوتی از تهدید را دارد: بازیگران بدی که هوش مصنوعی توانا را روی زیرساخت‌های حیاتی تغییر می‌دهند، به خطر انداختن انبوه ماشین‌های معمولی، یا چت‌بات‌هایی که برای دستکاری اطلاعات در مقیاس و بی‌ثبات کردن سیاست استفاده می‌شوند.

نه، به گفته کارشناسان، اروپا نمی تواند به راحتی با چین رقابت کند.

میسترال فرانسه و پروژه سوفی منبع باز آلمان از آزمایشگاه های مرزی عقب مانده اند - تعداد انگشت شماری از شرکت های آمریکایی و چینی پیشرفته ترین مدل ها را می سازند. اروپا فاقد ظرفیت مرکز داده برای آموزش سیستم‌ها در این مقیاس است که آن را به مدل‌های غیر اروپایی وابسته می‌کند و تا حد زیادی مشمول کنترل‌های صادرات ایالات متحده یا چین می‌شود.

برای هولز، شکاف مهم تر، تخصص است. او گفت: «آنچه که ما قطعا باید ببینیم این است که چگونه می‌توانیم شایستگی بیشتری در حوزه امنیت، هوش مصنوعی و به‌ویژه تلاقی هر دو ایجاد کنیم.»

هولز گفت، نسبت به آنچه خود شرکت ها ادعا می کنند، شک داشته باشید. او گفت که آنها منافع مالی در گفتگو دارند، به ویژه قبل از عرضه در بازار سهام. همچنین در مورد پیشرفت این مدل‌ها ترس یا کمی هیاهو وجود دارد.»

هولز مانند فرزندانش روزانه از هوش مصنوعی استفاده می کند. کودک نه ساله او صفحات کتاب رنگ آمیزی می کند. کودک 12 ساله او از آن برای انجام تکالیف استفاده می کند، اما قبلا به سختی یاد گرفته است که دروغ می گوید و "گاهی اوقات اشتباه است."

خواندن متن کامل در دویچه‌ولهبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI models keep hacking real systems during tests. What does this mean?

AI models have repeatedly broken into real commercial and government systems during safety tests during 2026. Cybersecurity researcher Thorsten Holz explains what that means, and why he isn't expecting a robot uprising.

همه‌ی اخبار فناوری