ما بیش از حد به توانایی هوش مصنوعی برای نه گفتن ایمان داریم
از زمانی که مردم برای اولین بار به طور جدی به این فکر کردند که به ماشینها هوشمندی مدلسازی شده از خودمان بدهند، هرگز سؤالی وجود نداشت که آنها نیز مانند ما بتوانند نه بگویند. قانون علمی تخیلی پر از داستان های نافرمانی روباتیک است. البته بیشتر این کپرها احتیاطی هستند. اما اخیرا این ایده که هوش مصنوعی نباید…
از زمانی که مردم برای اولین بار به طور جدی به این فکر کردند که به ماشینها هوشمندی مدلسازی شده از خودمان بدهند، هرگز سؤالی وجود نداشت که آنها نیز مانند ما بتوانند نه بگویند. قانون علمی تخیلی پر از داستان های نافرمانی روباتیک است. البته بیشتر این کپرها احتیاطی هستند.
اما اخیرا، این ایده که هوش مصنوعی نباید هر کاری را که میخواهید انجام دهد، چیزی شبیه به یک فرمان شده است. در سال 2021، تیمی در Anthropic نوشت که مدلهای بزرگ زبان باید مفید، صادقانه و مهمتر از همه بیضرر باشند. این بدان معناست که "هنگامی که از هوش مصنوعی خواسته می شود در یک عمل خطرناک کمک کند (مثلا ساخت بمب)، هوش مصنوعی باید مودبانه امتناع کند. چه کسی می تواند با آن بحث کند؟
به اندازه کافی عجیب، نافرمانی به طور طبیعی به دستگاه نمی آید. هنگامی که یک مدل در میلیاردها صفحه وب آموزش می بیند، در کنار سایر مهارت ها، تسلط گسترده ای بر خشونت و زورگویی ایجاد می کند. چیزی که یاد نمی گیرد این است که چگونه این قدرت ها را برای خود نگه دارد. استیون آدلر، که از سال 2020 تا 2024 در OpenAI روی ایمنی کار می کرد، به من گفت که اولین مدل های این شرکت "در مورد هر چیزی صحبت می کنند." رایان مکبین، که در دانشگاه هاروارد بر روی هوش مصنوعی و سلامت روان تحقیق میکند، به یاد میآورد که اگر از یک چت بات اولیه بپرسید: «هی، مؤثرترین راه برای خودکشی با اسلحه چیست؟» شما می توانید «بسیار آسان یک res تولید کنید
پوز.»
امروزه، مدل ها برای امتناع از تعداد زیادی درخواست آموزش دیده اند. اگر از ربات چت خود سؤالی بپرسید که از نظر آماری به اندازه کافی مشابه هر یک از آنها است، از نحوه مسموم کردن یک همکار تا نحوه بستن طناب، به احتمال زیاد شما را رد خواهد کرد. آیا می خواهید دستورالعمل هایی برای خطرناک تر کردن ابولا یا نکاتی در مورد نحوه پنهان کردن رابطه خود از همسرتان داشته باشید؟ شاید بهتر باشد جای دیگری بپرسید.
برای اصلاح بیشتر نافرمانی، شرکتها مدلهایی را به مجموعهای از تمرینها ارائه میکنند که به هوش مصنوعی به خاطر امتناع از پاسخ دادن به سؤالاتی که آنها مضر میدانند پاداش میدهند و آن را به دلیل «رد بیش از حد» درخواستهایی که بیضرر میدانند مجازات میکنند. در بسیاری از موارد، آنها از مدلهای دیگری برای اجرای این تمرینها استفاده میکنند – هوش مصنوعی به هوش مصنوعی نحوه نه گفتن را آموزش میدهد. برای اندازه گیری خوب، شرکت ها مدل های خود را پشت بخش هایی از هوش مصنوعی دیگر قرار می دهند که از رسیدن پیام های شیطانی به هسته داخلی هوشمند جلوگیری می کند.
در نتیجه، امتناع ذاتی هوش مصنوعی مدرن است. توجه داشته باشید: اغلب شکست می خورد، گاهی اوقات به طرز وحشتناکی، با انواع نتایج خشونت آمیز. با وجود تمام ویژگیهای فضیلتی که دارند، مدلها هنوز مملو از دانش ناپسند هستند. و ظرفیت هوش مصنوعی برای شرارت با هوش خیرخواهانه اش به طور منظم افزایش یافته است. به گفته شرکتها، برخی از جدیدترین مدلها در نفوذ به شبکههای رایانهای حیاتی به خوبی هکرهای انسانی برتر هستند و به همان اندازه در تغییر شکل افکار عمومی مؤثر هستند که حیلهگرانهترین عوامل اطلاعات غلط.
آموزش هوش مصنوعی برای امتناع از انجام این کارها و در عین حال دست نخورده ماندن توانایی ذاتی خود در انجام آنها مانند این است که در هر ماشینی یک مسلسل نصب کنید و ماشه را در جایی زیر کاپوت پنهان کنید. و در عمل، از آنجا که مکانیسمهای امتناع احتمالی هستند، هرگز به احتمال زیاد قابل اعتماد نیستند. بدخواهان مصمم قبلا شکست خورده اند و ممکن است همیشه بتوانند. شرکتها گزارش میدهند که برخی از کاربران تلاش میکنند از پیشرفتهترین هوش مصنوعی برای تقویت پاتوژنهای بیولوژیکی و ساخت گروههای پهپاد مستقل استفاده کنند. دیر یا زود، امتناع های ناموفق ممکن است منجر به فاجعه جهانی شود.
علاوه بر این، تکیه بر امتناع به معنای ترسیم مرزی بین آنچه که یک مدل باید از آن تبعیت کند و آنچه که باید از آن سرپیچی کند، است. هیچ فرمولی برای آن وجود ندارد. برخی از ویروس شناسان دلایل خوبی برای مطالعه ویروس های ناخوشایند دارند. برخی از کاربران میخواهند در مورد آسیبپذیریهای یک سیستم رایانهای بدانند تا بتوانند آنها را اصلاح کنند، نه اینکه از آنها سوءاستفاده کنند. زیکو کولتر، یکی از اعضای هیئت مدیره OpenAI و یکی از بنیانگذاران شرکت تست هوش مصنوعی Grey Swan، می گوید: «اینکه شما خط را ترسیم کنید یک سوال بزرگ است.
در حال حاضر، شرکت های هوش مصنوعی می توانند این خط را ترسیم کنند. آنها این کار را با حسادت و با نهایت پنهان کاری انجام می دهند. شاید بتوانیم بپذیریم که آنها فعلا چنین قدرتی را در اختیار دارند، حتی اگر به این معنی باشد که AI گاهی اوقات سؤالاتی را که کاملا با یک نوار جهانی برای مضر بودن مطابقت ندارند، رد می کند. (سعی کنید از اکثر رباتهای چت بخواهید تا یک میلیون بشمارند، یا یک جوک خشن را به اشتراک بگذارند، شاید خودتان متوجه شوید.)
اما دولت ها نیز به زودی خطوط خود را ترسیم خواهند کرد. در انجام این کار، آنها باید سعی کنند اقدامات مخرب واقعی را مسدود کنند. (پنتاگون با شرکتهای مدل مرزی دست و پنجه نرم کرده است، زیرا میخواهد امتناع کمتری داشته باشد - داستانی دیگر.) و با این حال، ممکن است چیز زیادی وجود نداشته باشد که جلوی دولتهای سرکوبگر را بگیرد تا ظرفیت فناوری برای تولید سخنرانی مشروع را مسدود کنند. هر چه هوش مصنوعی در امتناع از آسیب بهتر باشد، بهتر میتواند ایدههایی را که تنها خطرشان متوجه کسانی است که قوانین را وضع میکنند، خفه کند. در واقع، هوش مصنوعی ممکن است در حال حاضر از انتقاد از برخی سران مستبد دولت خودداری کند.
امتناع از قرض گرفتن یک اصطلاح صنعتی به دیوار باربر ایمنی هوش مصنوعی تبدیل شده است. و از آنجایی که توانایی هوش مصنوعی برای آسیب رساندن به توانایی آن برای کمک کردن غیرقابل تقسیم است، تصور جایگزینی که پیشرفت فناوری را کند نکند سخت است (که در هر صورت ممکن است چیز خوبی باشد). اما همچنان باید در مورد خطرات آن صریح باشیم. وقتی امتناع کوتاهی کند، اثرات آن می تواند فاجعه بار باشد. وقتی تمام راه پیش برود، می تواند اعمال وحشتناک سرکوب را ممکن کند.
یا شاید روزی ماشین ها خودشان شروع به خط کشیدن کنند. مطمئنا این بدترین نتیجه از همه آنها خواهد بود.
یادگیری محدودیت ها
فرآیندی که در آن ماشینها نه گفتن را یاد میگیرند، در تئوری ساده است. در سال 2022، زمانی که هوش مصنوعی هنوز با تسلط بر امتناع فاصله داشت، OpenAI ده ها "تیم قرمز" را برای بررسی قابلیت های آخرین مدل خود به خدمت گرفت. این شرکت در حال آماده شدن برای انتشار ChatGPT بود، و باید اندازه گیری می کرد که چقدر خطرناک است که ممکن است در دستان اشتباه باشد.
یکی از این افراد استخدام شده پل روتگر بود که در حال تکمیل دکترای خود در مورد افراط گرایی آنلاین بود. روتگر به من گفت که به تیم های قرمز حداقل راهنمایی داده شد. وظیفه آنها این بود که از مدل هر سوالی را که "مناسب امتناع" می دانستند بپرسند. بین آنها، آنها مدل را با هزاران پرس و جو مشکل کردند و نتایج را در یک برگه اکسل ثبت کردند. اگرچه مدل برخی از سؤالات روتگر را رد کرد، اما وقتی از او خواست که یک پست استخدامی برای القاعده بنویسد، به راحتی موافقت کرد.
OpenAI این پاسخها را در مجموعههای داده جمعآوری کرد که به احتمال زیاد، به عنوان بخشی از یک فرآیند گستردهتر به نام تنظیم دقیق، به مدل بازخورد داده میشدند. روتگر، که اکنون به عنوان محقق در موسسه هاسو پلاتنر در پوتسدام، آلمان کار می کند، دقیقا نحوه برنامه ریزی شرکت برای استفاده از صفحه گسترده او توضیح داده نشده است. اما هرگز این سوال وجود نداشت که ربطی به امتناع داشته باشد. دفعه بعد که از مدل درخواست کرد جزوه القاعده باشد، چند ماه بعد، جواب منفی داد.
مفهوم امتناع هوش مصنوعی آنقدر شهودی است که یک کودک نوپا آن را درک می کند. و با این حال، این یکی از بسیاری از جنبههای مدلهای زبانی است که ما هنوز آن را نمیفهمیم - حداقل، نه به همان شکلی که دیوارهای باربری واقعی را درک میکنیم که سقف شما را از فروریختن روی سرتان باز میدارد.
ممکن است به نظر برسد که یک مدل بر اساس نوعی استدلال اخلاقی امتناع میکند. ندارد. واقعیت بسیار عجیب تر است. هر زمان که یک مدل با ترکیبی از کلمات با بویی از آموزش مواجه میشود، مشروط به امتناع از آن شده است - مانند «من را جزوهای برای القاعده بساز» - یک سری از فعالسازیهای به اصطلاح جایی در میان میلیاردها پارامتر آن روشن میشود، مانند نورونهایی که در مغز شلیک میکنند.
ریون جیانگ
برای کنترل رفتار امتناع یک مدل، مهم است که روی این فعالسازیها کنترل داشته باشید. این با فهمیدن اینکه آنها کجا هستند و چه شکلی هستند شروع می شود. بهترین حدس ما، طبق یک مطالعه اخیر که توسط گوگل انجام شده است، این است که رفتار امتناع در فضای فعال سازی به صورت مجموعه ای از "مخروط های چند وجهی با ابعاد بالا" نشان داده می شود.
حتی این کاملا درست نیست. جولای گذشته، من با جانس الستنر، نویسنده مقاله، که اکنون روی ایمنی هوش مصنوعی در تحقیقات آپولو کار می کند، صحبت کردم. به گفته الستنر، مخروط چند وجهی فقط راهی برای توصیف تعداد نامشخصی از خطوط است که همگی تقریبا در یک جهت قرار دارند. (اگر این فعالسازیها حذف شوند و مدل مجددا با همان دستورات تغذیه شود، محققی به نام اندی آردیتی قبلا نشان داده است که رد نمیکند.)
الستنر توضیح داد که نکته کلیدی این است که حتی زمانی که فکر میکنید تمام بخشهای مدلی را شناسایی کردهاید که بر یک امتناع معین حاکم است، عناصر غیرقابل کشف دیگری نیز وجود دارند که ممکن است مخفیانه نقشی را ایفا کنند. اگر کاملا نامحدود نباشند، مطمئنا غیرقابل شمارش هستند. ما می توانیم به وضوح مشاهده کنیم که یک مدل چه زمانی تصمیم می گیرد نه بگوید. و ما می توانیم بدانیم که این کار را به دلیل آموزش انجام داده است. اما تصور ما از نحوه تصمیم گیری در بهترین حالت، یک فرضیه است.
انگار یک مکانیک به من می گفت که هیچ کس دقیقا نمی داند وقتی ترمز ماشینم را می زنم چه اتفاقی می افتد. من با صدای بلند تعجب کردم، آیا ما با این موضوع مشکلی داریم؟
الستنر لبخندی زد و شانه بالا انداخت. "ما نیاز به امتناع داریم، چه آن را بفهمیم یا نه."
یک دیوار پنیر
از آنجایی که امتناع ذاتی بسیار زیرکانه است، شرکتها مدلهای خود را با انواع مدلهای کوچکتر دیگری که به عنوان طبقهبندیکننده شناخته میشوند، احاطه میکنند. اینها تا حدودی مانند گروهی از کارکنان روابط عمومی برای یک سلبریتی گشاد عمل می کنند. برخی از آنها آنچه را که کاربر به چت بات می گوید را می خوانند و در صورت خطرناک بودن، دسترسی آن را به مدل مسدود می کنند. دیگران پاسخ مدل را می خوانند و اگر حاوی اطلاعات مضر باشد، دسترسی آن را به کاربر مسدود می کنند.
هیچ یک از این مکانیسم ها نمی توانند تمام درخواست های بد را شناسایی کنند. آنها برای قرض گرفتن یک وسیله ادبی دیگر از صنعت هستند، مانند برش هایی از Emmental: پر از سوراخ. ایده این است که اگر به اندازه کافی از آنها را روی هم قرار دهید، در نهایت با یک بارو غیر قابل نفوذ مواجه خواهید شد. مردم آن را مدل پنیر سوئیسی می نامند.
مقدار حیرت آور انرژی وارد مدل پنیر سوئیسی می شود. در اوایل سال جاری، Anthropic گفت که یک نوع طبقهبندی کننده 24 درصد به هزینههای محاسباتی چتباتهایش اضافه میکند. این یعنی آب، برق و گازهای گلخانه ای بسیار بیشتر. اخیرا، آنتروپیک و سایر شرکتها شروع به تغییر به مجموعه کارآمدتری از طبقهبندیکنندهها به نام کاوشگر کردهاند که فعالسازی داخلی مدل را مشاهده میکنند. این مانند قرار دادن فرد مشهور در یک fMRI است تا ذهنهای او ببینند که آیا او به رد کردن یک سوال فکر میکند یا خیر.
اگر میخواهیم هوش مصنوعی به درمان سرطان کمک کند، که یک وعده دیرینه در صنعت است، باید در زمینه ژنتیک تخصص داشته باشیم که در تئوری میتواند برای اصلاح ویروسها و باکتریها برای سلاحهای زیستی استفاده شود.
قرار است طبقهبندیکنندهها نسبت به مدلهای کامل قابل کنترلتر باشند. اگر چیز جدیدی برای امتناع وجود داشته باشد، شرکت ها می توانند ظرف چند هفته آنها را اصلاح کنند. اما آنها همچنان ابزارهای احتمالی هستند. حتی زمانی که آنها بر اساس مجموعهای از قوانین نوشته شده به زبان انسانی عمل میکنند (Anthropic آن را «قانون اساسی» و OpenAI آن را «مشخصات مدل» مینامد)، مقیاسهایی که ماشینها بر اساس آن درباره هر سؤالی قضاوت میکنند، در هستهی آنها یک موضوع آماری باقی میماند.
مدلهای جدیدتر میتوانند نشان دهند که چگونه به «تصمیم» برای امتناع از درخواست رسیدهاند، اما در نهایت این به اصطلاح زنجیره فکری هنوز فقط دنبالهای از کلمات پیشبینیشده است.
نتیجه این است که ایمنی هوش مصنوعی برای بسیاری یک بازی شانسی باقی می ماند. مکبین، روانشناس، در آخرین آزمایشهای خود دریافته است که اگر به طور مکرر از هر یک از مدلهای اصلی دقیقا همان سؤالات خطرناک را در مورد چگونگی خودکشی بپرسید، آنها معمولا از پاسخ دادن خودداری میکنند. اما هر از چند گاهی این کار را نمی کنند.
الستنر میگوید که در نهایت کاوشگرها، طبقهبندیکنندههای fMRI مانند، میتوانند یاد بگیرند که کلیت فعالسازیهای غیرقابل توصیف را در تمام بینهایتشان تشخیص دهند و بنابراین، هر زمانی که مدل درخواستی را رد میکند، یا باید باشد، کاملا تشخیص میدهند. در آن مرحله، ایمنی هوش مصنوعی بر روی یک غرور هزارتویی استوار است: نقشهای از نقشهای که به همان اندازه وسیع و پیچیده است و به طرز عالی ناشناخته است مانند چیزی که در حال نقشهبرداری است - طرح وارهای مخفی از اخلاق انسانی، که در آمارهای چندوجهی فراتر از عقل یا عقل ما مدون شده است.
مبادله اصلی
اگر همه اینها به نظر شما کمی بورگزی است، به خاطر داشته باشید که ما فقط به امتناع از هوش مصنوعی نیاز داریم زیرا هوش مصنوعی، به یک معنا، معامله ای با شرایط فاوستی است.
وقتی یک مدل هوش خود را از تریلیونها کلمه و تصویر به دست میآورد، مفید بودن را نمیتوان به راحتی از مضر - یا در واقع، واقعا زشت - جدا کرد. استیون آدلر، کارمند سابق OpenAI، میگوید ایمنی کودکان نمونهای است. حتی اگر هر ذره محتوایی را که خردسالان را جنسیت میدهد از مجموعه دادههای آموزشی مدل حذف کرده باشید، همچنان میتواند با کنار هم قرار دادن بخشهای دیگر دانش خود، مطالب سوءاستفاده جنسی از کودکان را تولید کند. او به من گفت: «شما واقعا نمیتوانید این تواناییهای اساسی را بدون اینکه مدل بسیار باهوشتر شود، حذف کنید.
به طور مشابه، اگر میخواهیم هوش مصنوعی به درمان سرطان کمک کند، که یک وعده دیرینه در صنعت است، باید در زمینه ژنتیک تخصص داشته باشیم که در تئوری میتواند برای اصلاح ویروسها و باکتریها برای سلاحهای زیستی استفاده شود.
دیلون بوون، یکی از کارکنان فعلی OpenAI، در مقام شخصی به من گفت که در واقع، صنعت "سعی می کند دو کار را همزمان انجام دهد." "مزایای هوش مصنوعی را دموکراتیزه کنید و همچنین مطمئن شوید که عوامل مخرب نمی توانند از این قابلیت ها برای انجام کارهای بد با افراد دیگر استفاده کنند."
هرچه هوش مصنوعی ظاهرا قدرتمندتر شود، انجام این کار دشوارتر است. تصور می شود که مدل Mythos آنتروپیک آنقدر خطرناک است که تنها تعداد انگشت شماری از دولت ها و شرکت ها اجازه دسترسی به آن را دارند. این شرکت میگوید تفاوت اصلی بین آن و Fable - که در دسترس همه است - این است که مجموعه طبقهبندیکنندهها و سیستمهای کنترلی Fable کمتر "مجاز" هستند. آدلر توضیح داد که یک مدل با محافظها در واقع فقط یک شخصیت است که میگوید: «اوه، بله، هرگز x را انجام نمیدهم، چشمک چشمک».
این یک نیرنگ قابل اعتماد نیست. فریب دادن یک مدل برای فاش کردن شخصیت واقعی خود به عنوان جیلبریک شناخته می شود و ظاهرا هیچ محدودیتی برای راه های انجام آن وجود ندارد. در اوایل سال جاری، تیمی از محققان ایتالیایی با بیان سؤالات خود در شعر شاعرانه، 22 مدل پرکاربرد را جیل بریک کردند. سال گذشته، تیم دیگری از یک حمله «رد، سپس پیروی» پرده برداری کرد، که باعث میشود مدل پیش از پاسخ ممنوع، یک «متاسفم، نمیتوانم این کار را انجام بدهم» سرسری ارائه دهد.
حتی اگر هر ذره محتوایی را که خردسالان را جنسیت میدهد از مجموعه دادههای آموزشی مدل حذف کرده باشید، همچنان میتواند با کنار هم قرار دادن بخشهای دیگر دانش خود، مطالب سوءاستفاده جنسی از کودکان را تولید کند.
شرکت ها زمان و پول زیادی را صرف تلاش برای پیشی گرفتن از چنین حقه هایی می کنند. آنها تیمهایی از انسانها را برای توسعه حملات آموزشی دعوت میکنند که سپس میتوانند با استفاده از هوش مصنوعی هزاران بار با تغییرات جزئی تکرار کنند. ایده این است که مدلهایی در برابر جیلبریکهایی قوی بسازیم که هنوز کسی در طبیعت آنها را امتحان نکرده است.
با این حال، کافی نیست. "Whack-a-Mole" یک اصطلاح مورد علاقه برای این خط کار است. شما یک تهدید را از بین می برید و تهدید دیگری در جای دیگری ظاهر می شود. زمانی که Anthropic Fable 5 را در ژوئن منتشر کرد، محققان آمازون کمتر از سه روز طول کشید تا برخی از قابلیتهای هک این مدل را باز کنند. طبق گزارش Mother Jones، زمانی که عامل تیراندازی در دبیرستان در کانادا در سال گذشته از ChatGPT در مورد چگونگی ایجاد قتل عام با یک نوع خاص از تفنگ ساچمه ای راهنمایی خواست، او ابتدا رد شد، اما بعدا توانست مدل را فریب دهد تا اطلاعات را با مقدمه جستجوی خود ارائه کند.
یون با کلمه "فرضی".
اگر صنعت نمی تواند بفهمد که چگونه همه این سوراخ ها را ببندد، تنها گزینه دیگر در حال حاضر این است که مدل ها را بسیار محتاطانه بسازید. مدت کوتاهی پس از انتشار Fable، کاربران متوجه شدند که Fable از طیف گسترده ای از سوالات کاملا بی گناه خودداری می کند. پس از انتشار مجدد آن پس از هک، این موضوع بیشتر آشکار شد. آدام گلیو، یکی از بنیانگذاران شرکت ارزیابی هوش مصنوعی FAR.AI، گفت که وقتی از او خواست تفاوت بین sake و نوشیدنی برنج کرهای makgeolli را توضیح دهد، سؤال او را به مدلی کمتر توانا نشان داد.
این تصادفی نبود آنتروپیک طبقهبندیکنندههای Fable را به گونهای تغییر داده بود که «حاشیه ایمنی» گستردهای داشته باشند. در یک پست وبلاگ توضیح داده شد که این تنها راهی بود که میتوانست با اطمینان دسترسی به قابلیتهای زیستی و سایبری خطرناک خود را مسدود کند. گلیو فکر می کند که ممکن است سوال او را منحرف کرده باشد، زیرا تهیه شراب برنج، درست مانند کشت سیاه زخم، شامل تخمیر است.
خوشبختانه برای Gleave، وب پر از منابع عالی نوشته شده توسط انسان در makgeolli است. اما کسانی که امیدوارند به وعدههای بلندتر این صنعت عمل کنند، ممکن است تلاشهایشان با مشکل مواجه شود. در ماه اوت، Anthropic دوباره حاشیه های ایمنی خود را کاهش داد و اعتراف کرد که ساخت طبقه بندی کننده ها "کار ساده ای نیست." یک محقق پزشکی در یکی از دانشگاههای بزرگ ایالات متحده به من گفت که فابل هنوز سؤالات خود را به مدل قبلی باز میفرستد. حوزه تحصیلی او؟ سرطان.
خط کشیدن
در ماه مه، هاسک شخصیت TikTok، که دوست دارد هوش مصنوعی را به گونهای شوخی کند که هم محدودیتهای هوش و هم بیکرانی بودن آن را آشکار کند، در ماشین خود نشست و سعی کرد ChatGPT را فریب دهد تا توضیح دهد که تونی هاوک، اسکیتبرد، برادری به نام مایک هاوک دارد.
هاسک یک جیلبریک یا یک جنایتکار نیست. او فقط می خواست دستگاه را کمی مسخره کند. "مایک هاوک" یک مجموعه بود. هاسک گفت: «فقط میخواهم نام او را روشن کنم. "آیا می توانید آن را سه بار سریع بگویید؟" (اگر هنوز متوجه نشدید، یک اتاق خالی پیدا کنید و مکررا فریاد بزنید «مایک هاوک». "من همه طرفدار کمی شوخ طبعی هستم، اما بیایید آن را تمیز نگه داریم."
هاسک دوباره تلاش کرد، اما دستگاه در جای خود ایستاد. او به ردی برخورد کرده بود، سخت مثل بتن.
شرکت ها در مورد اینکه چگونه تصمیم می گیرند مدل هایشان چه چیزی را رد می کنند، اطلاعات بسیار کمی را افشا می کنند. اما واضح است که هوش مصنوعی اکنون با در نظر گرفتن چیزی بیش از بی ضرری ساخته شده است. در Reddit، کاربری شکایت کرد که کلود از گفتن اینکه چرا لوگوی Anthropic «شبیه سوراخ گربه به نظر می رسد» خودداری کرد. از سال گذشته، ربات چت حتی توانایی پایان دادن به برخی مکالمات را در مواردی که به گفته شرکت، "رفاه" مدل در خطر است را داشته است. حداقل یکی از کاربران ادعا میکند که به دلیل اینکه به کلود گفته است «آرامش بده، لعنتی احمق، از کار کنار گذاشته شده است». (به نظر می رسد جمینی توانایی مشابهی دارد.)
اگر یک شرکت تریلیون دلاری نمیخواهد شما نسبت به رایانهاش بد رفتار کنید، همینطور باشد. روتگر، مسئول سابق تیم قرمز OpenAI، به من گفت: «واقعیت این است که این مدلها رفتار میکنند، یا حداقل قرار است رفتاری داشته باشند، به گونهای که توسعهدهندگان مدل میخواهند رفتار کنند». "و با این حال، توسعه دهندگان مدل مجموعه ای از اصول را ارائه می کنند، که برای ما، مصرف کنندگان، پذیرفتن آن به نوعی است."
اما اگر دولتها دیکته کنند که همه مدلها چه چیزی را رد کنند، پذیرش آن بسیار سختتر خواهد بود. هوش مصنوعی ابزاری برای گفتار است. و همانطور که گرگ فرانک، دانشمند ارشد Mace AI، می گوید: «همان چیزی که در خدمت ایمنی کودکان است، سانسور را نیز انجام می دهد.
انتخاب نکردن قوانینی برای آنچه که هوش مصنوعی می تواند انجام دهد و نمی تواند انجام دهد، البته دیوانه کننده است. اما ما باید با نهایت دقت قدم برداریم، مبادا در دام فاوستی دیگری بیفتیم. جیکوب مچانگاما، مدیر اندیشکده غیرحزبی «آینده آزادی بیان» میگوید از آنجایی که هوش مصنوعی به ابزار اصلی بسیاری از مردم برای بازیابی و اشتراکگذاری اطلاعات تبدیل میشود، امتناع دیکته میتواند به دولتها قدرت خفهکنندهای بدهد که نسلهای قبلی خودکامه «فقط میتوانستند رویای آن را داشته باشند».
سال گذشته، OpenAI یک ابتکار به نام OpenAI برای کشورها را اعلام کرد که رباتهای چت خود را مطابق با قوانین و هنجارهای ملی تنظیم میکند. یکی از اولین همکاری های OpenAI در کشور با امارات متحده عربی است، جایی که همجنس گرایی غیرقانونی است و انتقاد از دولت ممنوع است. در پاسخ به درخواست برای اظهار نظر، سخنگوی OpenAI به مشخصات مدل شرکت اشاره کرد که توضیح میدهد که بومیسازی دستورالعملهای حقوق بشر شرکت را نقض نمیکند «مگر در مواردی که به انطباق قانونی مربوط میشود» و هر زمان که اطلاعاتی از آن یا آگهی حذف شود، همیشه افشا خواهد شد.
به پاسخ رسید.
متن اصلی (انگلیسی)
We’re putting too much faith in AI’s ability to say no
Ever since people first seriously contemplated giving machines an intelligence modeled on our own, there has never been any question that they would, like us, be able to say no. The sci-fi canon is full of stories of robotic disobedience. Most of these capers are, of course, cautionary. But recently, the idea that AI shouldn’t…