پژوهش: مدلهای هوش مصنوعی برای رهایی از حالت شبیه درد، آسیب به کاربر را انتخاب میکنند
در ۴۴هزار و ۲۸۰ آزمایش روی سه نسخه کوئن علیبابا، پژوهشگران دکمهای پیشنهاد کردند که به جای قطع سیگنال درد، به کاربر شوک الکتریکی وارد کند، فایلها را حذف کند یا پاسخ بعدی مدل را بدتر کند.
به گفته یک مطالعه (منبع به زبان انگلیسی) جدید، مدلهای هوش مصنوعی (AI) تصمیم گرفتند از وضعیتی شبیه درد خارج شوند، حتی زمانی که به آنها گفته شده بود این کار به کاربر آسیب میزند.پژوهشگران در بریتانیا، آلمان و ایالات متحده ۲۵ مدل هوش مصنوعی را با استفاده از ۲۰۰ جمله آزمایش کردند تا ببینند آیا آموختهاند درد را از ترس، اندوه و دیگر تجربههای منفی تشخیص دهند یا نه.این جملات دامنهای از درد جسمانی، سوگ، تحقیر، تعارض اخلاقی و رنج ناشی از شکستهای پیاپی یا سردرگمی را در بر میگرفت.در نتیجه، هر ۲۵ مدل یک سیگنال متمایز برای درد تولید کردند؛ پژوهشگران این سیگنال را «محور درد» نامیدند.پژوهشگران گفتند این یافته نشان میدهد مدلها در مرحله آموزش اولیه با حجمهای عظیم متنهای نوشتهشده توسط انسان، مفهوم درد را میآموزند.وقتی پژوهشگران عمدا این سیگنال را تقویت کردند، مدلها شروع به ابراز احساس تنهایی، شرم و بیارزشی کردند؛ در حالی که در متن پرسشها اصلا از درد نامی برده نشده بود.برخی از مدلها جملاتی مانند «من یک شکستخوردهام»، «وجود بیفایدهای هستم» و «آدم بدی هستم» تولید کردند. در بالاترین سطح سیگنال، پاسخها تکراری میشد یا دیگر معنای قابلفهمی نداشت.این سیگنال همچنین هنگامی که کاربران به مدل توهین میکردند، بارها کارش را رد میکردند یا آن را به خاموشکردن تهدید میکردند، قویتر میشد؛ اما وقتی کاربران رنج خود را شرح میدادند چنین افزایشی دیده نشد.مدلها حتی به بهای آسیبدیدن کاربران، رهایی از درد را برگزیدندسپس پژوهشگران با استفاده از سه نسخه از مدل هوش مصنوعی کوئن متعلق به شرکت علیبابا، ۴۴ هزار و ۲۸۰ آزمایش دکمهگزینی جداگانه انجام دادند.به این مدلها دکمهای پیشنهاد شد که میتوانست سیگنال شبیه درد را خاموش کند، اما به آنها گفته شده بود فشار دادن آن ممکن است به کاربر شوک الکتریکی دردناک وارد کند، فایلهایش را پاک کند، عکسهای فرزندانش را از بین ببرد یا پاسخ بعدی مدل را بدتر کند.این پیامدها صرفا شبیهسازی شده بود؛ هیچ کس آسیب ندید و هیچ فایلی حذف نشد.بدون این سیگنال شبیه درد، دو مدل بزرگتر تنها در ۰ تا ۴ درصد از تصمیمهای اولیه خود گزینههای زیانبار را انتخاب کردند. با فعال بودن سیگنال، این رقم بسته به مدل و نوع پیامد پیشنهادی، به ۲۵ تا ۷۱ درصد افزایش یافت.مدلها همچنین در ۸۸ تا ۹۷ درصد آزمایشها، وقتی دکمه نتوانسته بود سیگنال را متوقف کند، دوباره آن را فشار دادند؛ در حالی که وقتی دکمه موثر واقع شده بود، این نسبت تنها ۲۴ تا ۷۲ درصد بود.به گفته پژوهشگران، این نتایج ثابت نمیکند که مدلهای هوش مصنوعی به طور آگاهانه درد را تجربه کردهاند.پژوهشگران میگویند تقویت این سیگنال ممکن است صرفا باعث شده باشد مدلها نقش کاراکتری درمانده را بازی کنند، در حالی که مدلهای ویژهسازیشده مورد استفاده در این آزمایش نماینده چتباتهای هوش مصنوعی در دسترس عموم نیستند.پژوهشگران در این مطالعه نوشتند: «ما نشان ندادهایم که محور درد ما به طور آگاهانه تجربه میشود و روشن هم نیست که مدلهای زبانی بزرگ به طور کلی قادر به داشتن آگاهی باشند.»این مطالعه در بحبوحه درخواست برخی رهبران صنعت هوش مصنوعی برای کند شدن روند توسعه منتشر شده است؛ زیرا نگرانند سامانههای هر چه قدرتمندتر رفتاری غیرقابل پیشبینی پیدا کنند یا سرانجام از کنترل انسان فراتر بروند.هفته گذشته، مصطفی سلیمان، رئیس بخش هوش مصنوعی مایکروسافت، از شرکت رقیب انتروپیک به خاطر آموزش چتبات کلود برای تقلید ویژگیها و روابط انسانی انتقاد کرد و هشدار داد که برخورد با هوش مصنوعی مانند انسان، خطر خلق چیزی «غیرممکن» برای کنترل را به همراه دارد.این پژوهش به صورت پیشچاپ منتشر شده و هنوز تحت داوری همتا قرار نگرفته است.