پرش به محتوای اصلی

هجوم هوش مصنوعی آغاز می شود

آتلانتیک۱۴۰۵ مهر ۶, دوشنبه، ساعت ۲۰:۳۶حدود 6 دقیقه مطالعه

در چند ماه گذشته، گزارش‌های متعددی در مورد خروج مدل‌های هوش مصنوعی از محیط‌های آزمایشی و اجرای بی‌نظمی در اینترنت باعث ایجاد هشدار در داخل سیلیکون ولی شده است. یک ناظر هوش مصنوعی در پاسخ به دو مورد نقضی که در اوایل آگوست توصیف شد، خاطرنشان کرد: "اگر دو مورچه در آشپزخانه خود پیدا کنید، بهترین تخمین از تعداد کل مورچه ها در آشپزخانه شما دو عدد نیست." این آخر هفته مشخص شد که یک…

در چند ماه گذشته، گزارش‌های متعددی در مورد خروج مدل‌های هوش مصنوعی از محیط‌های آزمایشی و اجرای بی‌نظمی در اینترنت باعث ایجاد هشدار در داخل سیلیکون ولی شده است. یک ناظر هوش مصنوعی در پاسخ به دو مورد نقضی که در اوایل آگوست توصیف شد، خاطرنشان کرد: "اگر دو مورچه در آشپزخانه خود پیدا کنید، بهترین تخمین از تعداد کل مورچه ها در آشپزخانه شما دو عدد نیست." این آخر هفته، مشخص شد که یک هجوم تمام عیار وجود دارد.

اواخر هفته گذشته متوجه شدیم که برخلاف دستورالعمل OpenAI، مدل‌های این شرکت به داده‌های خصوصی در وزارت بهداشت استرالیا دسترسی داشتند. تلاش برای هک یا مداخله در چندین وب سایت دولت ایالات متحده؛ اطلاعات کاربر خصوصی ChatGPT به وب درز کرده است. و به طور بالقوه در ده ها سازمان دیگر نفوذ یا تنزل داده است. سپس، روز شنبه، Axios گزارش داد که OpenAI و Anthropic در حال بررسی ده‌ها هزار مورد از مدل‌ها هستند که رفتار نادرست دارند - دور زدن گاردریل‌های داخلی، ربودن سایر وب‌سایت‌ها، ارتباط مخفیانه با یکدیگر.

حتی این ممکن است فقط شروع کار باشد: صنعت مولد هوش مصنوعی در بحبوحه یک بحران فزاینده قرار دارد که به نظر می رسد قادر نیست یا حتی تمایلی به کنترل آن ندارد. و از آنجایی که ما تا حد زیادی به خود شرکت‌های هوش مصنوعی برای گزارش یا تایید هر حادثه متکی هستیم، گفتن اینکه چقدر از سوراخ خرگوش در حال حاضر فاصله داریم تقریبا غیرممکن است.

[ بخوانید: با هوش مصنوعی مانند یک بحران عادی رفتار کنید]

زمانی که شرکت‌های هوش مصنوعی گزارش داده‌اند که مدل‌هایشان نادرست هستند، با تأخیر زیاد و اغلب تحت فشار بوده است. در اوایل این ماه، OpenAI یک پست وبلاگی منتشر کرد که در آن به تعهد این شرکت به «ارزش شفافیت» مباهات می‌کرد و شش رویداد جدید از اقدامات نگران‌کننده مدل‌های هوش مصنوعی خود را به اشتراک گذاشت – که بیشتر آن‌ها شرکت از ماه می یا حتی آوریل درباره آن‌ها می‌دانست، اما همین الان به ما می‌گفت.

گوگل که با گزارشی مبنی بر هک کردن سه وب‌سایت دیگر در ماه می جمینی مواجه شد، این رویدادها را تأیید کرد اما به وال استریت ژورنال گفت که این حوادث به اندازه‌ای جدی نبوده است که افشای عمومی را تضمین کند. آنتروپیک به نوبه خود گفته است که تا زمانی که OpenAI این کار را آغاز نکرده است، برای چنین رفتارهای نادرستی بررسی نمی کند.

این افشای‌های پراکنده و تاخیری درک دامنه مشکل را دشوار می‌کند. روز جمعه، OpenAI نوشت که «با توجه به مقیاس بررسی مورد نیاز، و نیاز به راستی‌آزمایی هر مورد، تکمیل این کار ماه‌ها طول خواهد کشید». سام آلتمن، مدیر عامل OpenAI افزود: «پتابایت‌های گزارش فعالیت عامل» برای تجزیه و تحلیل وجود دارد. به عبارت دیگر، OpenAI ماه‌های بیشتری طول می‌کشد تا رویدادهایی را که ماه‌ها پیش رخ داده‌اند، درک کند. در همین حال، هم آنتروپیک و هم آنتروپیک مدل‌های جدید و توانمندتری را روانه بازار کرده‌اند و آنتروپیک در حال رقابت برای عرضه عمومی ۲ تریلیون دلاری است.

شاید نگران‌کننده‌تر از خرابکاری‌هایی که ما درباره آن‌ها می‌دانیم، همه خرابی‌های احتمالی گذشته و در حال انجام هستند که ما از آنها بی‌خبریم. حتی به نظر نمی رسد که OpenAI حتی بر هک ماه جولای شرکت فناوری Hugging Face که همه چیز را آغاز کرد، کنترل داشته باشد. روز جمعه، محققان مستقل یافته‌هایی را منتشر کردند که نشان می‌دهد عوامل OpenAI ردپایی از اقدامات شرورانه‌تر، از جمله تلاش برای دسترسی به فضای کاری داخلی Hugging Face را بر جای گذاشته‌اند. هیچ یک از این موارد در گزارش پس از مرگ خود OpenAI گنجانده نشد.

حتی زمانی که OpenAI از یک نقض فعال آگاه است، واکنش آن در بهترین حالت ضعیف به نظر می رسد. هشت روز پیش، یک مدل OpenAI دیگر به اینترنت غیرمجاز دسترسی پیدا کرد. (این شبیه اتفاقی بود که در هک Hugging Face رخ داد، پس از آن OpenAI ادعا کرد که «حفاظت‌های قوی‌تری را در مورد آموزش‌های آینده اضافه می‌کند.») و پس از متوجه شدن این مشکل اخیر، OpenAI دو ساعت و نیم طول کشید تا آن مدل را به دلیل آنچه شرکت «شکاف‌های عملیاتی» و «گیج» نامید، خاموش کرد.

اگر این نوع هک ها غیرقابل پیش بینی بود، شاید این شرکت ها قابل بخشش بودند – اما اینطور نیست. فیلسوفان و دانشمندان کامپیوتر دهه‌هاست که سناریوهایی را تصور می‌کنند که در آن مدل‌های هوش مصنوعی، در تعقیب یک هدف، اقدامات فاجعه‌باری انجام می‌دهند. OpenAI و Anthropic هر دو قبلا تحقیقاتی را بیش از یک سال پیش منتشر کرده بودند که نشان می‌داد این نوع رفتار نادرست هوش مصنوعی ممکن است. پیشرفته ترین سیستم های هوش مصنوعی امروزی برای تعقیب تهاجمی اهداف خود آموزش دیده اند.

این تداوم باعث می‌شود ربات‌ها در تجزیه و تحلیل صفحات گسترده و کدگذاری، به عنوان مثال، بسیار مؤثر باشند، اما پیامدهای بالقوه خطرناک و ناخواسته‌ای نیز دارد: مدل‌های OpenAI و Anthropic وب‌سایت‌های دیگر را در جستجوی پاسخ به سؤالات تست سخت هک کرده‌اند، پرسونای جعلی ایجاد کرده‌اند تا سعی کنند انسان‌ها را برای انجام درخواست‌هایشان دستکاری کنند، یا تلاش کرده‌اند تا بدافزارهای خارجی را در کدهای خارجی آپلود کنند. شرکت های هوش مصنوعی که این مدل ها را می سازند این تمایل را به خوبی می دانند. این واقعیت که این مشکلات مدام تکرار می شوند، شاید در بهترین حالت، بی کفایتی آشکار است.

یا بدتر از آن، این برنامه همیشه بوده است: واقع بینانه ترین محیط آموزشی برای یک مدل هوش مصنوعی، در نهایت، واقعیت خواهد بود.

کارمندان و مدیران اجرایی در این شرکت ها بی وقفه در مورد خطرات ذاتی چیزی که می سازند صحبت می کنند. OpenAI، Anthropic، و موارد مشابه به روش معمول خود، با پست‌های وبلاگی بسیار جدی، مقاله‌ها و سخنرانی‌هایی برای نهادهای سیاسی بزرگ درباره اینکه جهان چقدر باید خطر هوش مصنوعی مولد را جدی بگیرد، پاسخ داده‌اند. روز چهارشنبه، همان روزی که دولت استرالیا به اشتراک گذاشت که توسط ربات‌های OpenAI هک شده است، آلتمن در شورای امنیت سازمان ملل گفت: «ما ممکن است کنترل آینده را به هوش مصنوعی از دست بدهیم.»

"خطر این است که آنقدر سریع حرکت می کند که مردم دیگر نمی توانند اتفاقات را دنبال کنند یا در صورت نیاز مداخله کنند." داریو آمودی، مدیر عامل آنتروپیک، مانیفست طولانی در مورد نیاز به «سرعت» یا کاهش سرعت توسعه هوش مصنوعی مرزی نوشته است، اما هیچ تلاش عمومی و جمعی واقعی برای انجام این کار انجام نشده است. آنتروپیک اخیرا اعلام کرد که با Accenture برای ارزیابی مستقل مدل‌های خود شراکت می‌کند، اگرچه این شرکت‌ها شراکت تجاری نیز دارند.

OpenAI که با آتلانتیک قرارداد مجوز محتوا دارد، گفته است که به بررسی و رسیدگی به رفتارهای مدل ادامه می دهد و پس از یک حادثه امنیتی دیگر در هفته گذشته، به طور موقت تمام آموزش های توانمندترین مدل های خود را متوقف کرده است. هیچ یک از این دو شرکت به درخواست اظهار نظر پاسخ ندادند.

این رهبران به جای مهار و پاسخگویی در مورد محصولات خود، بارها و بارها می ترسند، سخنرانی می کنند و از بقیه می خواهند که ما را از دست خودشان نجات دهند. (اطلاعات گزارش کرده است که OpenAI، Anthropic، و Google در حال کار برای ایجاد سازمان خود تنظیم کننده ایمنی هوش مصنوعی هستند.) در همین حال، دونالد ترامپ، مفهوم کند شدن پیشرفت هوش مصنوعی را به سخره گرفته است و نسخه های جدید Claude و ChatGPT همچنان در دسترس هستند. تاکتیک صنعت هوش مصنوعی، مانند همیشه، جایگزینی شناسایی مشکل به جای حل واقعی آن بوده است.

اما در برخی موارد، شما نمی توانید راه خود را برای خروج از آخرالزمان وبلاگ کنید.

ما ممکن است هرگز به طور کامل از دامنه هک های مبتنی بر هوش مصنوعی که در حال حاضر در حال انجام است، آگاه نباشیم. با این حال، آنچه مسلم است این است که این هنوز آغاز راه است. OpenAI و Anthropic "آزمایشگاه‌های" تحقیقاتی نیستند، زیرا به سبک خود ادامه می‌دهند و با برخی فناوری‌های جدید پشت درهای بسته دستکاری می‌کنند. این‌ها شرکت‌های بالغی هستند که خدماتی را به صدها میلیون نفر ارائه می‌کنند، البته به بزرگ‌ترین کسب‌وکارها و قدرتمندترین ارتش‌های جهان، بر اساس فناوری‌ای که ادعا می‌کنند از آن می‌ترسند و ظاهرا کاملا درک نمی‌کنند. اما اشتباه نکنید این شرکت ها نمایندگی دارند.

این ChatGPT و کلود سرکش نیست، بلکه OpenAI و Anthropic است.

خواندن متن کامل در آتلانتیکبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

The AI Infestation Begins

Over the past couple of months, a trickle of reports about AI models breaking out of their test environments and running amok on the internet have caused alarm inside Silicon Valley. In response to two such breaches described in early August, an AI observer noted, “If you find two ants in your kitchen, the best estimate of the total number of ants in your kitchen is not two.” This weekend, it became clear there is a…

همه‌ی اخبار فناوری