هجوم هوش مصنوعی آغاز می شود
در چند ماه گذشته، گزارشهای متعددی در مورد خروج مدلهای هوش مصنوعی از محیطهای آزمایشی و اجرای بینظمی در اینترنت باعث ایجاد هشدار در داخل سیلیکون ولی شده است. یک ناظر هوش مصنوعی در پاسخ به دو مورد نقضی که در اوایل آگوست توصیف شد، خاطرنشان کرد: "اگر دو مورچه در آشپزخانه خود پیدا کنید، بهترین تخمین از تعداد کل مورچه ها در آشپزخانه شما دو عدد نیست." این آخر هفته مشخص شد که یک…
در چند ماه گذشته، گزارشهای متعددی در مورد خروج مدلهای هوش مصنوعی از محیطهای آزمایشی و اجرای بینظمی در اینترنت باعث ایجاد هشدار در داخل سیلیکون ولی شده است. یک ناظر هوش مصنوعی در پاسخ به دو مورد نقضی که در اوایل آگوست توصیف شد، خاطرنشان کرد: "اگر دو مورچه در آشپزخانه خود پیدا کنید، بهترین تخمین از تعداد کل مورچه ها در آشپزخانه شما دو عدد نیست." این آخر هفته، مشخص شد که یک هجوم تمام عیار وجود دارد.
اواخر هفته گذشته متوجه شدیم که برخلاف دستورالعمل OpenAI، مدلهای این شرکت به دادههای خصوصی در وزارت بهداشت استرالیا دسترسی داشتند. تلاش برای هک یا مداخله در چندین وب سایت دولت ایالات متحده؛ اطلاعات کاربر خصوصی ChatGPT به وب درز کرده است. و به طور بالقوه در ده ها سازمان دیگر نفوذ یا تنزل داده است. سپس، روز شنبه، Axios گزارش داد که OpenAI و Anthropic در حال بررسی دهها هزار مورد از مدلها هستند که رفتار نادرست دارند - دور زدن گاردریلهای داخلی، ربودن سایر وبسایتها، ارتباط مخفیانه با یکدیگر.
حتی این ممکن است فقط شروع کار باشد: صنعت مولد هوش مصنوعی در بحبوحه یک بحران فزاینده قرار دارد که به نظر می رسد قادر نیست یا حتی تمایلی به کنترل آن ندارد. و از آنجایی که ما تا حد زیادی به خود شرکتهای هوش مصنوعی برای گزارش یا تایید هر حادثه متکی هستیم، گفتن اینکه چقدر از سوراخ خرگوش در حال حاضر فاصله داریم تقریبا غیرممکن است.
[ بخوانید: با هوش مصنوعی مانند یک بحران عادی رفتار کنید]
زمانی که شرکتهای هوش مصنوعی گزارش دادهاند که مدلهایشان نادرست هستند، با تأخیر زیاد و اغلب تحت فشار بوده است. در اوایل این ماه، OpenAI یک پست وبلاگی منتشر کرد که در آن به تعهد این شرکت به «ارزش شفافیت» مباهات میکرد و شش رویداد جدید از اقدامات نگرانکننده مدلهای هوش مصنوعی خود را به اشتراک گذاشت – که بیشتر آنها شرکت از ماه می یا حتی آوریل درباره آنها میدانست، اما همین الان به ما میگفت.
گوگل که با گزارشی مبنی بر هک کردن سه وبسایت دیگر در ماه می جمینی مواجه شد، این رویدادها را تأیید کرد اما به وال استریت ژورنال گفت که این حوادث به اندازهای جدی نبوده است که افشای عمومی را تضمین کند. آنتروپیک به نوبه خود گفته است که تا زمانی که OpenAI این کار را آغاز نکرده است، برای چنین رفتارهای نادرستی بررسی نمی کند.
این افشایهای پراکنده و تاخیری درک دامنه مشکل را دشوار میکند. روز جمعه، OpenAI نوشت که «با توجه به مقیاس بررسی مورد نیاز، و نیاز به راستیآزمایی هر مورد، تکمیل این کار ماهها طول خواهد کشید». سام آلتمن، مدیر عامل OpenAI افزود: «پتابایتهای گزارش فعالیت عامل» برای تجزیه و تحلیل وجود دارد. به عبارت دیگر، OpenAI ماههای بیشتری طول میکشد تا رویدادهایی را که ماهها پیش رخ دادهاند، درک کند. در همین حال، هم آنتروپیک و هم آنتروپیک مدلهای جدید و توانمندتری را روانه بازار کردهاند و آنتروپیک در حال رقابت برای عرضه عمومی ۲ تریلیون دلاری است.
شاید نگرانکنندهتر از خرابکاریهایی که ما درباره آنها میدانیم، همه خرابیهای احتمالی گذشته و در حال انجام هستند که ما از آنها بیخبریم. حتی به نظر نمی رسد که OpenAI حتی بر هک ماه جولای شرکت فناوری Hugging Face که همه چیز را آغاز کرد، کنترل داشته باشد. روز جمعه، محققان مستقل یافتههایی را منتشر کردند که نشان میدهد عوامل OpenAI ردپایی از اقدامات شرورانهتر، از جمله تلاش برای دسترسی به فضای کاری داخلی Hugging Face را بر جای گذاشتهاند. هیچ یک از این موارد در گزارش پس از مرگ خود OpenAI گنجانده نشد.
حتی زمانی که OpenAI از یک نقض فعال آگاه است، واکنش آن در بهترین حالت ضعیف به نظر می رسد. هشت روز پیش، یک مدل OpenAI دیگر به اینترنت غیرمجاز دسترسی پیدا کرد. (این شبیه اتفاقی بود که در هک Hugging Face رخ داد، پس از آن OpenAI ادعا کرد که «حفاظتهای قویتری را در مورد آموزشهای آینده اضافه میکند.») و پس از متوجه شدن این مشکل اخیر، OpenAI دو ساعت و نیم طول کشید تا آن مدل را به دلیل آنچه شرکت «شکافهای عملیاتی» و «گیج» نامید، خاموش کرد.
اگر این نوع هک ها غیرقابل پیش بینی بود، شاید این شرکت ها قابل بخشش بودند – اما اینطور نیست. فیلسوفان و دانشمندان کامپیوتر دهههاست که سناریوهایی را تصور میکنند که در آن مدلهای هوش مصنوعی، در تعقیب یک هدف، اقدامات فاجعهباری انجام میدهند. OpenAI و Anthropic هر دو قبلا تحقیقاتی را بیش از یک سال پیش منتشر کرده بودند که نشان میداد این نوع رفتار نادرست هوش مصنوعی ممکن است. پیشرفته ترین سیستم های هوش مصنوعی امروزی برای تعقیب تهاجمی اهداف خود آموزش دیده اند.
این تداوم باعث میشود رباتها در تجزیه و تحلیل صفحات گسترده و کدگذاری، به عنوان مثال، بسیار مؤثر باشند، اما پیامدهای بالقوه خطرناک و ناخواستهای نیز دارد: مدلهای OpenAI و Anthropic وبسایتهای دیگر را در جستجوی پاسخ به سؤالات تست سخت هک کردهاند، پرسونای جعلی ایجاد کردهاند تا سعی کنند انسانها را برای انجام درخواستهایشان دستکاری کنند، یا تلاش کردهاند تا بدافزارهای خارجی را در کدهای خارجی آپلود کنند. شرکت های هوش مصنوعی که این مدل ها را می سازند این تمایل را به خوبی می دانند. این واقعیت که این مشکلات مدام تکرار می شوند، شاید در بهترین حالت، بی کفایتی آشکار است.
یا بدتر از آن، این برنامه همیشه بوده است: واقع بینانه ترین محیط آموزشی برای یک مدل هوش مصنوعی، در نهایت، واقعیت خواهد بود.
کارمندان و مدیران اجرایی در این شرکت ها بی وقفه در مورد خطرات ذاتی چیزی که می سازند صحبت می کنند. OpenAI، Anthropic، و موارد مشابه به روش معمول خود، با پستهای وبلاگی بسیار جدی، مقالهها و سخنرانیهایی برای نهادهای سیاسی بزرگ درباره اینکه جهان چقدر باید خطر هوش مصنوعی مولد را جدی بگیرد، پاسخ دادهاند. روز چهارشنبه، همان روزی که دولت استرالیا به اشتراک گذاشت که توسط رباتهای OpenAI هک شده است، آلتمن در شورای امنیت سازمان ملل گفت: «ما ممکن است کنترل آینده را به هوش مصنوعی از دست بدهیم.»
"خطر این است که آنقدر سریع حرکت می کند که مردم دیگر نمی توانند اتفاقات را دنبال کنند یا در صورت نیاز مداخله کنند." داریو آمودی، مدیر عامل آنتروپیک، مانیفست طولانی در مورد نیاز به «سرعت» یا کاهش سرعت توسعه هوش مصنوعی مرزی نوشته است، اما هیچ تلاش عمومی و جمعی واقعی برای انجام این کار انجام نشده است. آنتروپیک اخیرا اعلام کرد که با Accenture برای ارزیابی مستقل مدلهای خود شراکت میکند، اگرچه این شرکتها شراکت تجاری نیز دارند.
OpenAI که با آتلانتیک قرارداد مجوز محتوا دارد، گفته است که به بررسی و رسیدگی به رفتارهای مدل ادامه می دهد و پس از یک حادثه امنیتی دیگر در هفته گذشته، به طور موقت تمام آموزش های توانمندترین مدل های خود را متوقف کرده است. هیچ یک از این دو شرکت به درخواست اظهار نظر پاسخ ندادند.
این رهبران به جای مهار و پاسخگویی در مورد محصولات خود، بارها و بارها می ترسند، سخنرانی می کنند و از بقیه می خواهند که ما را از دست خودشان نجات دهند. (اطلاعات گزارش کرده است که OpenAI، Anthropic، و Google در حال کار برای ایجاد سازمان خود تنظیم کننده ایمنی هوش مصنوعی هستند.) در همین حال، دونالد ترامپ، مفهوم کند شدن پیشرفت هوش مصنوعی را به سخره گرفته است و نسخه های جدید Claude و ChatGPT همچنان در دسترس هستند. تاکتیک صنعت هوش مصنوعی، مانند همیشه، جایگزینی شناسایی مشکل به جای حل واقعی آن بوده است.
اما در برخی موارد، شما نمی توانید راه خود را برای خروج از آخرالزمان وبلاگ کنید.
ما ممکن است هرگز به طور کامل از دامنه هک های مبتنی بر هوش مصنوعی که در حال حاضر در حال انجام است، آگاه نباشیم. با این حال، آنچه مسلم است این است که این هنوز آغاز راه است. OpenAI و Anthropic "آزمایشگاههای" تحقیقاتی نیستند، زیرا به سبک خود ادامه میدهند و با برخی فناوریهای جدید پشت درهای بسته دستکاری میکنند. اینها شرکتهای بالغی هستند که خدماتی را به صدها میلیون نفر ارائه میکنند، البته به بزرگترین کسبوکارها و قدرتمندترین ارتشهای جهان، بر اساس فناوریای که ادعا میکنند از آن میترسند و ظاهرا کاملا درک نمیکنند. اما اشتباه نکنید این شرکت ها نمایندگی دارند.
این ChatGPT و کلود سرکش نیست، بلکه OpenAI و Anthropic است.
متن اصلی (انگلیسی)
The AI Infestation Begins
Over the past couple of months, a trickle of reports about AI models breaking out of their test environments and running amok on the internet have caused alarm inside Silicon Valley. In response to two such breaches described in early August, an AI observer noted, “If you find two ants in your kitchen, the best estimate of the total number of ants in your kitchen is not two.” This weekend, it became clear there is a…