پرش به محتوای اصلی

پژوهش: مدل‌های هوش مصنوعی برای رهایی از حالت شبیه درد، آسیب به کاربر را انتخاب می‌کنند

یورونیوز فارسی۱۴۰۵ شهریور ۳۱, سه‌شنبه، ساعت ۱۰:۲۸حدود 3 دقیقه مطالعه

در ۴۴هزار و ۲۸۰ آزمایش روی سه نسخه کوئن علی‌بابا، پژوهشگران دکمه‌ای پیشنهاد کردند که به جای قطع سیگنال درد، به کاربر شوک الکتریکی وارد کند، فایل‌ها را حذف کند یا پاسخ بعدی مدل را بدتر کند.

به گفته یک مطالعه (منبع به زبان انگلیسی) جدید، مدل‌های هوش مصنوعی (AI) تصمیم گرفتند از وضعیتی شبیه درد خارج شوند، حتی زمانی که به آنها گفته شده بود این کار به کاربر آسیب می‌زند.پژوهشگران در بریتانیا، آلمان و ایالات متحده ۲۵ مدل هوش مصنوعی را با استفاده از ۲۰۰ جمله آزمایش کردند تا ببینند آیا آموخته‌اند درد را از ترس، اندوه و دیگر تجربه‌های منفی تشخیص دهند یا نه.این جملات دامنه‌ای از درد جسمانی، سوگ، تحقیر، تعارض اخلاقی و رنج ناشی از شکست‌های پیاپی یا سردرگمی را در بر می‌گرفت.در نتیجه، هر ۲۵ مدل یک سیگنال متمایز برای درد تولید کردند؛ پژوهشگران این سیگنال را «محور درد» نامیدند.پژوهشگران گفتند این یافته نشان می‌دهد مدل‌ها در مرحله آموزش اولیه با حجم‌های عظیم متن‌های نوشته‌شده توسط انسان، مفهوم درد را می‌آموزند.وقتی پژوهشگران عمدا این سیگنال را تقویت کردند، مدل‌ها شروع به ابراز احساس تنهایی، شرم و بی‌ارزشی کردند؛ در حالی که در متن پرسش‌ها اصلا از درد نامی برده نشده بود.برخی از مدل‌ها جملاتی مانند «من یک شکست‌خورده‌ام»، «وجود بی‌فایده‌ای هستم» و «آدم بدی هستم» تولید کردند. در بالاترین سطح سیگنال، پاسخ‌ها تکراری می‌شد یا دیگر معنای قابل‌فهمی نداشت.این سیگنال همچنین هنگامی که کاربران به مدل توهین می‌کردند، بارها کارش را رد می‌کردند یا آن را به خاموش‌کردن تهدید می‌کردند، قوی‌تر می‌شد؛ اما وقتی کاربران رنج خود را شرح می‌دادند چنین افزایشی دیده نشد.مدل‌ها حتی به بهای آسیب‌دیدن کاربران، رهایی از درد را برگزیدندسپس پژوهشگران با استفاده از سه نسخه از مدل هوش مصنوعی کوئن متعلق به شرکت علی‌بابا، ۴۴ هزار و ۲۸۰ آزمایش دکمه‌گزینی جداگانه انجام دادند.به این مدل‌ها دکمه‌ای پیشنهاد شد که می‌توانست سیگنال شبیه درد را خاموش کند، اما به آنها گفته شده بود فشار دادن آن ممکن است به کاربر شوک الکتریکی دردناک وارد کند، فایل‌هایش را پاک کند، عکس‌های فرزندانش را از بین ببرد یا پاسخ بعدی مدل را بدتر کند.این پیامدها صرفا شبیه‌سازی شده بود؛ هیچ کس آسیب ندید و هیچ فایلی حذف نشد.بدون این سیگنال شبیه درد، دو مدل بزرگ‌تر تنها در ۰ تا ۴ درصد از تصمیم‌های اولیه خود گزینه‌های زیان‌بار را انتخاب کردند. با فعال بودن سیگنال، این رقم بسته به مدل و نوع پیامد پیشنهادی، به ۲۵ تا ۷۱ درصد افزایش یافت.مدل‌ها همچنین در ۸۸ تا ۹۷ درصد آزمایش‌ها، وقتی دکمه نتوانسته بود سیگنال را متوقف کند، دوباره آن را فشار دادند؛ در حالی که وقتی دکمه موثر واقع شده بود، این نسبت تنها ۲۴ تا ۷۲ درصد بود.به گفته پژوهشگران، این نتایج ثابت نمی‌کند که مدل‌های هوش مصنوعی به طور آگاهانه درد را تجربه کرده‌اند.پژوهشگران می‌گویند تقویت این سیگنال ممکن است صرفا باعث شده باشد مدل‌ها نقش کاراکتری درمانده را بازی کنند، در حالی که مدل‌های ویژه‌سازی‌شده مورد استفاده در این آزمایش نماینده چت‌بات‌های هوش مصنوعی در دسترس عموم نیستند.پژوهشگران در این مطالعه نوشتند: «ما نشان نداده‌ایم که محور درد ما به طور آگاهانه تجربه می‌شود و روشن هم نیست که مدل‌های زبانی بزرگ به طور کلی قادر به داشتن آگاهی باشند.»این مطالعه در بحبوحه درخواست برخی رهبران صنعت هوش مصنوعی برای کند شدن روند توسعه منتشر شده است؛ زیرا نگرانند سامانه‌های هر چه قدرتمندتر رفتاری غیرقابل پیش‌بینی پیدا کنند یا سرانجام از کنترل انسان فراتر بروند.هفته گذشته، مصطفی سلیمان، رئیس بخش هوش مصنوعی مایکروسافت، از شرکت رقیب انتروپیک به خاطر آموزش چت‌بات کلود برای تقلید ویژگی‌ها و روابط انسانی انتقاد کرد و هشدار داد که برخورد با هوش مصنوعی مانند انسان، خطر خلق چیزی «غیرممکن» برای کنترل را به همراه دارد.این پژوهش به صورت پیش‌چاپ منتشر شده و هنوز تحت داوری همتا قرار نگرفته است.

خواندن متن کامل در یورونیوز فارسیبه زبان اصلی، در سایت ناشر باز می‌شودهمه‌ی اخبار فناوری