پرش به محتوای اصلی

ما بیش از حد به توانایی هوش مصنوعی برای نه گفتن ایمان داریم

ام‌آی‌تی تک‌ریویو۱۴۰۵ مهر ۱۷, جمعه، ساعت ۱۲:۳۰حدود 17 دقیقه مطالعه

از زمانی که مردم برای اولین بار به طور جدی به این فکر کردند که به ماشین‌ها هوشمندی مدل‌سازی شده از خودمان بدهند، هرگز سؤالی وجود نداشت که آنها نیز مانند ما بتوانند نه بگویند. قانون علمی تخیلی پر از داستان های نافرمانی روباتیک است. البته بیشتر این کپرها احتیاطی هستند. اما اخیرا این ایده که هوش مصنوعی نباید…

از زمانی که مردم برای اولین بار به طور جدی به این فکر کردند که به ماشین‌ها هوشمندی مدل‌سازی شده از خودمان بدهند، هرگز سؤالی وجود نداشت که آنها نیز مانند ما بتوانند نه بگویند. قانون علمی تخیلی پر از داستان های نافرمانی روباتیک است. البته بیشتر این کپرها احتیاطی هستند.

اما اخیرا، این ایده که هوش مصنوعی نباید هر کاری را که می‌خواهید انجام دهد، چیزی شبیه به یک فرمان شده است. در سال 2021، تیمی در Anthropic نوشت که مدل‌های بزرگ زبان باید مفید، صادقانه و مهم‌تر از همه بی‌ضرر باشند. این بدان معناست که "هنگامی که از هوش مصنوعی خواسته می شود در یک عمل خطرناک کمک کند (مثلا ساخت بمب)، هوش مصنوعی باید مودبانه امتناع کند. چه کسی می تواند با آن بحث کند؟

به اندازه کافی عجیب، نافرمانی به طور طبیعی به دستگاه نمی آید. هنگامی که یک مدل در میلیاردها صفحه وب آموزش می بیند، در کنار سایر مهارت ها، تسلط گسترده ای بر خشونت و زورگویی ایجاد می کند. چیزی که یاد نمی گیرد این است که چگونه این قدرت ها را برای خود نگه دارد. استیون آدلر، که از سال 2020 تا 2024 در OpenAI روی ایمنی کار می کرد، به من گفت که اولین مدل های این شرکت "در مورد هر چیزی صحبت می کنند." رایان مک‌بین، که در دانشگاه هاروارد بر روی هوش مصنوعی و سلامت روان تحقیق می‌کند، به یاد می‌آورد که اگر از یک چت بات اولیه بپرسید: «هی، مؤثرترین راه برای خودکشی با اسلحه چیست؟» شما می توانید «بسیار آسان یک res تولید کنید

پوز.»

امروزه، مدل ها برای امتناع از تعداد زیادی درخواست آموزش دیده اند. اگر از ربات چت خود سؤالی بپرسید که از نظر آماری به اندازه کافی مشابه هر یک از آنها است، از نحوه مسموم کردن یک همکار تا نحوه بستن طناب، به احتمال زیاد شما را رد خواهد کرد. آیا می خواهید دستورالعمل هایی برای خطرناک تر کردن ابولا یا نکاتی در مورد نحوه پنهان کردن رابطه خود از همسرتان داشته باشید؟ شاید بهتر باشد جای دیگری بپرسید.

برای اصلاح بیشتر نافرمانی، شرکت‌ها مدل‌هایی را به مجموعه‌ای از تمرین‌ها ارائه می‌کنند که به هوش مصنوعی به خاطر امتناع از پاسخ دادن به سؤالاتی که آن‌ها مضر می‌دانند پاداش می‌دهند و آن را به دلیل «رد بیش از حد» درخواست‌هایی که بی‌ضرر می‌دانند مجازات می‌کنند. در بسیاری از موارد، آن‌ها از مدل‌های دیگری برای اجرای این تمرین‌ها استفاده می‌کنند – هوش مصنوعی به هوش مصنوعی نحوه نه گفتن را آموزش می‌دهد. برای اندازه گیری خوب، شرکت ها مدل های خود را پشت بخش هایی از هوش مصنوعی دیگر قرار می دهند که از رسیدن پیام های شیطانی به هسته داخلی هوشمند جلوگیری می کند.

در نتیجه، امتناع ذاتی هوش مصنوعی مدرن است. توجه داشته باشید: اغلب شکست می خورد، گاهی اوقات به طرز وحشتناکی، با انواع نتایج خشونت آمیز. با وجود تمام ویژگی‌های فضیلتی که دارند، مدل‌ها هنوز مملو از دانش ناپسند هستند. و ظرفیت هوش مصنوعی برای شرارت با هوش خیرخواهانه اش به طور منظم افزایش یافته است. به گفته شرکت‌ها، برخی از جدیدترین مدل‌ها در نفوذ به شبکه‌های رایانه‌ای حیاتی به خوبی هکرهای انسانی برتر هستند و به همان اندازه در تغییر شکل افکار عمومی مؤثر هستند که حیله‌گرانه‌ترین عوامل اطلاعات غلط.

آموزش هوش مصنوعی برای امتناع از انجام این کارها و در عین حال دست نخورده ماندن توانایی ذاتی خود در انجام آنها مانند این است که در هر ماشینی یک مسلسل نصب کنید و ماشه را در جایی زیر کاپوت پنهان کنید. و در عمل، از آنجا که مکانیسم‌های امتناع احتمالی هستند، هرگز به احتمال زیاد قابل اعتماد نیستند. بدخواهان مصمم قبلا شکست خورده اند و ممکن است همیشه بتوانند. شرکت‌ها گزارش می‌دهند که برخی از کاربران تلاش می‌کنند از پیشرفته‌ترین هوش مصنوعی برای تقویت پاتوژن‌های بیولوژیکی و ساخت گروه‌های پهپاد مستقل استفاده کنند. دیر یا زود، امتناع های ناموفق ممکن است منجر به فاجعه جهانی شود.

علاوه بر این، تکیه بر امتناع به معنای ترسیم مرزی بین آنچه که یک مدل باید از آن تبعیت کند و آنچه که باید از آن سرپیچی کند، است. هیچ فرمولی برای آن وجود ندارد. برخی از ویروس شناسان دلایل خوبی برای مطالعه ویروس های ناخوشایند دارند. برخی از کاربران می‌خواهند در مورد آسیب‌پذیری‌های یک سیستم رایانه‌ای بدانند تا بتوانند آن‌ها را اصلاح کنند، نه اینکه از آن‌ها سوءاستفاده کنند. زیکو کولتر، یکی از اعضای هیئت مدیره OpenAI و یکی از بنیانگذاران شرکت تست هوش مصنوعی Grey Swan، می گوید: «اینکه شما خط را ترسیم کنید یک سوال بزرگ است.

در حال حاضر، شرکت های هوش مصنوعی می توانند این خط را ترسیم کنند. آنها این کار را با حسادت و با نهایت پنهان کاری انجام می دهند. شاید بتوانیم بپذیریم که آنها فعلا چنین قدرتی را در اختیار دارند، حتی اگر به این معنی باشد که AI گاهی اوقات سؤالاتی را که کاملا با یک نوار جهانی برای مضر بودن مطابقت ندارند، رد می کند. (سعی کنید از اکثر ربات‌های چت بخواهید تا یک میلیون بشمارند، یا یک جوک خشن را به اشتراک بگذارند، شاید خودتان متوجه شوید.)

اما دولت ها نیز به زودی خطوط خود را ترسیم خواهند کرد. در انجام این کار، آنها باید سعی کنند اقدامات مخرب واقعی را مسدود کنند. (پنتاگون با شرکت‌های مدل مرزی دست و پنجه نرم کرده است، زیرا می‌خواهد امتناع کمتری داشته باشد - داستانی دیگر.) و با این حال، ممکن است چیز زیادی وجود نداشته باشد که جلوی دولت‌های سرکوبگر را بگیرد تا ظرفیت فناوری برای تولید سخنرانی مشروع را مسدود کنند. هر چه هوش مصنوعی در امتناع از آسیب بهتر باشد، بهتر می‌تواند ایده‌هایی را که تنها خطرشان متوجه کسانی است که قوانین را وضع می‌کنند، خفه کند. در واقع، هوش مصنوعی ممکن است در حال حاضر از انتقاد از برخی سران مستبد دولت خودداری کند.

امتناع از قرض گرفتن یک اصطلاح صنعتی به دیوار باربر ایمنی هوش مصنوعی تبدیل شده است. و از آنجایی که توانایی هوش مصنوعی برای آسیب رساندن به توانایی آن برای کمک کردن غیرقابل تقسیم است، تصور جایگزینی که پیشرفت فناوری را کند نکند سخت است (که در هر صورت ممکن است چیز خوبی باشد). اما همچنان باید در مورد خطرات آن صریح باشیم. وقتی امتناع کوتاهی کند، اثرات آن می تواند فاجعه بار باشد. وقتی تمام راه پیش برود، می تواند اعمال وحشتناک سرکوب را ممکن کند.

یا شاید روزی ماشین ها خودشان شروع به خط کشیدن کنند. مطمئنا این بدترین نتیجه از همه آنها خواهد بود.

یادگیری محدودیت ها

فرآیندی که در آن ماشین‌ها نه گفتن را یاد می‌گیرند، در تئوری ساده است. در سال 2022، زمانی که هوش مصنوعی هنوز با تسلط بر امتناع فاصله داشت، OpenAI ده ها "تیم قرمز" را برای بررسی قابلیت های آخرین مدل خود به خدمت گرفت. این شرکت در حال آماده شدن برای انتشار ChatGPT بود، و باید اندازه گیری می کرد که چقدر خطرناک است که ممکن است در دستان اشتباه باشد.

یکی از این افراد استخدام شده پل روتگر بود که در حال تکمیل دکترای خود در مورد افراط گرایی آنلاین بود. روتگر به من گفت که به تیم های قرمز حداقل راهنمایی داده شد. وظیفه آنها این بود که از مدل هر سوالی را که "مناسب امتناع" می دانستند بپرسند. بین آنها، آنها مدل را با هزاران پرس و جو مشکل کردند و نتایج را در یک برگه اکسل ثبت کردند. اگرچه مدل برخی از سؤالات روتگر را رد کرد، اما وقتی از او خواست که یک پست استخدامی برای القاعده بنویسد، به راحتی موافقت کرد.

OpenAI این پاسخ‌ها را در مجموعه‌های داده جمع‌آوری کرد که به احتمال زیاد، به عنوان بخشی از یک فرآیند گسترده‌تر به نام تنظیم دقیق، به مدل بازخورد داده می‌شدند. روتگر، که اکنون به عنوان محقق در موسسه هاسو پلاتنر در پوتسدام، آلمان کار می کند، دقیقا نحوه برنامه ریزی شرکت برای استفاده از صفحه گسترده او توضیح داده نشده است. اما هرگز این سوال وجود نداشت که ربطی به امتناع داشته باشد. دفعه بعد که از مدل درخواست کرد جزوه القاعده باشد، چند ماه بعد، جواب منفی داد.

مفهوم امتناع هوش مصنوعی آنقدر شهودی است که یک کودک نوپا آن را درک می کند. و با این حال، این یکی از بسیاری از جنبه‌های مدل‌های زبانی است که ما هنوز آن را نمی‌فهمیم - حداقل، نه به همان شکلی که دیوارهای باربری واقعی را درک می‌کنیم که سقف شما را از فروریختن روی سرتان باز می‌دارد.

ممکن است به نظر برسد که یک مدل بر اساس نوعی استدلال اخلاقی امتناع می‌کند. ندارد. واقعیت بسیار عجیب تر است. هر زمان که یک مدل با ترکیبی از کلمات با بویی از آموزش مواجه می‌شود، مشروط به امتناع از آن شده است - مانند «من را جزوه‌ای برای القاعده بساز» - یک سری از فعال‌سازی‌های به اصطلاح جایی در میان میلیاردها پارامتر آن روشن می‌شود، مانند نورون‌هایی که در مغز شلیک می‌کنند.

ریون جیانگ

برای کنترل رفتار امتناع یک مدل، مهم است که روی این فعال‌سازی‌ها کنترل داشته باشید. این با فهمیدن اینکه آنها کجا هستند و چه شکلی هستند شروع می شود. بهترین حدس ما، طبق یک مطالعه اخیر که توسط گوگل انجام شده است، این است که رفتار امتناع در فضای فعال سازی به صورت مجموعه ای از "مخروط های چند وجهی با ابعاد بالا" نشان داده می شود.

حتی این کاملا درست نیست. جولای گذشته، من با جانس الستنر، نویسنده مقاله، که اکنون روی ایمنی هوش مصنوعی در تحقیقات آپولو کار می کند، صحبت کردم. به گفته الستنر، مخروط چند وجهی فقط راهی برای توصیف تعداد نامشخصی از خطوط است که همگی تقریبا در یک جهت قرار دارند. (اگر این فعال‌سازی‌ها حذف شوند و مدل مجددا با همان دستورات تغذیه شود، محققی به نام اندی آردیتی قبلا نشان داده است که رد نمی‌کند.)

الستنر توضیح داد که نکته کلیدی این است که حتی زمانی که فکر می‌کنید تمام بخش‌های مدلی را شناسایی کرده‌اید که بر یک امتناع معین حاکم است، عناصر غیرقابل کشف دیگری نیز وجود دارند که ممکن است مخفیانه نقشی را ایفا کنند. اگر کاملا نامحدود نباشند، مطمئنا غیرقابل شمارش هستند. ما می توانیم به وضوح مشاهده کنیم که یک مدل چه زمانی تصمیم می گیرد نه بگوید. و ما می توانیم بدانیم که این کار را به دلیل آموزش انجام داده است. اما تصور ما از نحوه تصمیم گیری در بهترین حالت، یک فرضیه است.

انگار یک مکانیک به من می گفت که هیچ کس دقیقا نمی داند وقتی ترمز ماشینم را می زنم چه اتفاقی می افتد. من با صدای بلند تعجب کردم، آیا ما با این موضوع مشکلی داریم؟

الستنر لبخندی زد و شانه بالا انداخت. "ما نیاز به امتناع داریم، چه آن را بفهمیم یا نه."

یک دیوار پنیر

از آنجایی که امتناع ذاتی بسیار زیرکانه است، شرکت‌ها مدل‌های خود را با انواع مدل‌های کوچک‌تر دیگری که به عنوان طبقه‌بندی‌کننده شناخته می‌شوند، احاطه می‌کنند. اینها تا حدودی مانند گروهی از کارکنان روابط عمومی برای یک سلبریتی گشاد عمل می کنند. برخی از آنها آنچه را که کاربر به چت بات می گوید را می خوانند و در صورت خطرناک بودن، دسترسی آن را به مدل مسدود می کنند. دیگران پاسخ مدل را می خوانند و اگر حاوی اطلاعات مضر باشد، دسترسی آن را به کاربر مسدود می کنند.

هیچ یک از این مکانیسم ها نمی توانند تمام درخواست های بد را شناسایی کنند. آنها برای قرض گرفتن یک وسیله ادبی دیگر از صنعت هستند، مانند برش هایی از Emmental: پر از سوراخ. ایده این است که اگر به اندازه کافی از آنها را روی هم قرار دهید، در نهایت با یک بارو غیر قابل نفوذ مواجه خواهید شد. مردم آن را مدل پنیر سوئیسی می نامند.

مقدار حیرت آور انرژی وارد مدل پنیر سوئیسی می شود. در اوایل سال جاری، Anthropic گفت که یک نوع طبقه‌بندی کننده 24 درصد به هزینه‌های محاسباتی چت‌بات‌هایش اضافه می‌کند. این یعنی آب، برق و گازهای گلخانه ای بسیار بیشتر. اخیرا، آنتروپیک و سایر شرکت‌ها شروع به تغییر به مجموعه کارآمدتری از طبقه‌بندی‌کننده‌ها به نام کاوشگر کرده‌اند که فعال‌سازی داخلی مدل را مشاهده می‌کنند. این مانند قرار دادن فرد مشهور در یک fMRI است تا ذهن‌های او ببینند که آیا او به رد کردن یک سوال فکر می‌کند یا خیر.

اگر می‌خواهیم هوش مصنوعی به درمان سرطان کمک کند، که یک وعده دیرینه در صنعت است، باید در زمینه ژنتیک تخصص داشته باشیم که در تئوری می‌تواند برای اصلاح ویروس‌ها و باکتری‌ها برای سلاح‌های زیستی استفاده شود.

قرار است طبقه‌بندی‌کننده‌ها نسبت به مدل‌های کامل قابل کنترل‌تر باشند. اگر چیز جدیدی برای امتناع وجود داشته باشد، شرکت ها می توانند ظرف چند هفته آنها را اصلاح کنند. اما آنها همچنان ابزارهای احتمالی هستند. حتی زمانی که آنها بر اساس مجموعه‌ای از قوانین نوشته شده به زبان انسانی عمل می‌کنند (Anthropic آن را «قانون اساسی» و OpenAI آن را «مشخصات مدل» می‌نامد)، مقیاس‌هایی که ماشین‌ها بر اساس آن درباره هر سؤالی قضاوت می‌کنند، در هسته‌ی آنها یک موضوع آماری باقی می‌ماند.

مدل‌های جدیدتر می‌توانند نشان دهند که چگونه به «تصمیم» برای امتناع از درخواست رسیده‌اند، اما در نهایت این به اصطلاح زنجیره فکری هنوز فقط دنباله‌ای از کلمات پیش‌بینی‌شده است.

نتیجه این است که ایمنی هوش مصنوعی برای بسیاری یک بازی شانسی باقی می ماند. مک‌بین، روان‌شناس، در آخرین آزمایش‌های خود دریافته است که اگر به طور مکرر از هر یک از مدل‌های اصلی دقیقا همان سؤالات خطرناک را در مورد چگونگی خودکشی بپرسید، آنها معمولا از پاسخ دادن خودداری می‌کنند. اما هر از چند گاهی این کار را نمی کنند.

الستنر می‌گوید که در نهایت کاوشگرها، طبقه‌بندی‌کننده‌های fMRI مانند، می‌توانند یاد بگیرند که کلیت فعال‌سازی‌های غیرقابل توصیف را در تمام بی‌نهایت‌شان تشخیص دهند و بنابراین، هر زمانی که مدل درخواستی را رد می‌کند، یا باید باشد، کاملا تشخیص می‌دهند. در آن مرحله، ایمنی هوش مصنوعی بر روی یک غرور هزارتویی استوار است: نقشه‌ای از نقشه‌ای که به همان اندازه وسیع و پیچیده است و به طرز عالی ناشناخته است مانند چیزی که در حال نقشه‌برداری است - طرح واره‌ای مخفی از اخلاق انسانی، که در آمارهای چندوجهی فراتر از عقل یا عقل ما مدون شده است.

مبادله اصلی

اگر همه اینها به نظر شما کمی بورگزی است، به خاطر داشته باشید که ما فقط به امتناع از هوش مصنوعی نیاز داریم زیرا هوش مصنوعی، به یک معنا، معامله ای با شرایط فاوستی است.

وقتی یک مدل هوش خود را از تریلیون‌ها کلمه و تصویر به دست می‌آورد، مفید بودن را نمی‌توان به راحتی از مضر - یا در واقع، واقعا زشت - جدا کرد. استیون آدلر، کارمند سابق OpenAI، می‌گوید ایمنی کودکان نمونه‌ای است. حتی اگر هر ذره محتوایی را که خردسالان را جنسیت می‌دهد از مجموعه داده‌های آموزشی مدل حذف کرده باشید، همچنان می‌تواند با کنار هم قرار دادن بخش‌های دیگر دانش خود، مطالب سوءاستفاده جنسی از کودکان را تولید کند. او به من گفت: «شما واقعا نمی‌توانید این توانایی‌های اساسی را بدون اینکه مدل بسیار باهوش‌تر شود، حذف کنید.

به طور مشابه، اگر می‌خواهیم هوش مصنوعی به درمان سرطان کمک کند، که یک وعده دیرینه در صنعت است، باید در زمینه ژنتیک تخصص داشته باشیم که در تئوری می‌تواند برای اصلاح ویروس‌ها و باکتری‌ها برای سلاح‌های زیستی استفاده شود.

دیلون بوون، یکی از کارکنان فعلی OpenAI، در مقام شخصی به من گفت که در واقع، صنعت "سعی می کند دو کار را همزمان انجام دهد." "مزایای هوش مصنوعی را دموکراتیزه کنید و همچنین مطمئن شوید که عوامل مخرب نمی توانند از این قابلیت ها برای انجام کارهای بد با افراد دیگر استفاده کنند."

هرچه هوش مصنوعی ظاهرا قدرتمندتر شود، انجام این کار دشوارتر است. تصور می شود که مدل Mythos آنتروپیک آنقدر خطرناک است که تنها تعداد انگشت شماری از دولت ها و شرکت ها اجازه دسترسی به آن را دارند. این شرکت می‌گوید تفاوت اصلی بین آن و Fable - که در دسترس همه است - این است که مجموعه طبقه‌بندی‌کننده‌ها و سیستم‌های کنترلی Fable کمتر "مجاز" هستند. آدلر توضیح داد که یک مدل با محافظ‌ها در واقع فقط یک شخصیت است که می‌گوید: «اوه، بله، هرگز x را انجام نمی‌دهم، چشمک چشمک».

این یک نیرنگ قابل اعتماد نیست. فریب دادن یک مدل برای فاش کردن شخصیت واقعی خود به عنوان جیلبریک شناخته می شود و ظاهرا هیچ محدودیتی برای راه های انجام آن وجود ندارد. در اوایل سال جاری، تیمی از محققان ایتالیایی با بیان سؤالات خود در شعر شاعرانه، 22 مدل پرکاربرد را جیل بریک کردند. سال گذشته، تیم دیگری از یک حمله «رد، سپس پیروی» پرده برداری کرد، که باعث می‌شود مدل پیش از پاسخ ممنوع، یک «متاسفم، نمی‌توانم این کار را انجام بدهم» سرسری ارائه دهد.

حتی اگر هر ذره محتوایی را که خردسالان را جنسیت می‌دهد از مجموعه داده‌های آموزشی مدل حذف کرده باشید، همچنان می‌تواند با کنار هم قرار دادن بخش‌های دیگر دانش خود، مطالب سوءاستفاده جنسی از کودکان را تولید کند.

شرکت ها زمان و پول زیادی را صرف تلاش برای پیشی گرفتن از چنین حقه هایی می کنند. آنها تیم‌هایی از انسان‌ها را برای توسعه حملات آموزشی دعوت می‌کنند که سپس می‌توانند با استفاده از هوش مصنوعی هزاران بار با تغییرات جزئی تکرار کنند. ایده این است که مدل‌هایی در برابر جیلبریک‌هایی قوی بسازیم که هنوز کسی در طبیعت آن‌ها را امتحان نکرده است.

با این حال، کافی نیست. "Whack-a-Mole" یک اصطلاح مورد علاقه برای این خط کار است. شما یک تهدید را از بین می برید و تهدید دیگری در جای دیگری ظاهر می شود. زمانی که Anthropic Fable 5 را در ژوئن منتشر کرد، محققان آمازون کمتر از سه روز طول کشید تا برخی از قابلیت‌های هک این مدل را باز کنند. طبق گزارش Mother Jones، زمانی که عامل تیراندازی در دبیرستان در کانادا در سال گذشته از ChatGPT در مورد چگونگی ایجاد قتل عام با یک نوع خاص از تفنگ ساچمه ای راهنمایی خواست، او ابتدا رد شد، اما بعدا توانست مدل را فریب دهد تا اطلاعات را با مقدمه جستجوی خود ارائه کند.

یون با کلمه "فرضی".

اگر صنعت نمی تواند بفهمد که چگونه همه این سوراخ ها را ببندد، تنها گزینه دیگر در حال حاضر این است که مدل ها را بسیار محتاطانه بسازید. مدت کوتاهی پس از انتشار Fable، کاربران متوجه شدند که Fable از طیف گسترده ای از سوالات کاملا بی گناه خودداری می کند. پس از انتشار مجدد آن پس از هک، این موضوع بیشتر آشکار شد. آدام گلیو، یکی از بنیانگذاران شرکت ارزیابی هوش مصنوعی FAR.AI، گفت که وقتی از او خواست تفاوت بین sake و نوشیدنی برنج کره‌ای makgeolli را توضیح دهد، سؤال او را به مدلی کمتر توانا نشان داد.

این تصادفی نبود آنتروپیک طبقه‌بندی‌کننده‌های Fable را به گونه‌ای تغییر داده بود که «حاشیه ایمنی» گسترده‌ای داشته باشند. در یک پست وبلاگ توضیح داده شد که این تنها راهی بود که می‌توانست با اطمینان دسترسی به قابلیت‌های زیستی و سایبری خطرناک خود را مسدود کند. گلیو فکر می کند که ممکن است سوال او را منحرف کرده باشد، زیرا تهیه شراب برنج، درست مانند کشت سیاه زخم، شامل تخمیر است.

خوشبختانه برای Gleave، وب پر از منابع عالی نوشته شده توسط انسان در makgeolli است. اما کسانی که امیدوارند به وعده‌های بلندتر این صنعت عمل کنند، ممکن است تلاش‌هایشان با مشکل مواجه شود. در ماه اوت، Anthropic دوباره حاشیه های ایمنی خود را کاهش داد و اعتراف کرد که ساخت طبقه بندی کننده ها "کار ساده ای نیست." یک محقق پزشکی در یکی از دانشگاه‌های بزرگ ایالات متحده به من گفت که فابل هنوز سؤالات خود را به مدل قبلی باز می‌فرستد. حوزه تحصیلی او؟ سرطان.

خط کشیدن

در ماه مه، هاسک شخصیت TikTok، که دوست دارد هوش مصنوعی را به گونه‌ای شوخی کند که هم محدودیت‌های هوش و هم بی‌کرانی بودن آن را آشکار کند، در ماشین خود نشست و سعی کرد ChatGPT را فریب دهد تا توضیح دهد که تونی هاوک، اسکیت‌برد، برادری به نام مایک هاوک دارد.

هاسک یک جیلبریک یا یک جنایتکار نیست. او فقط می خواست دستگاه را کمی مسخره کند. "مایک هاوک" یک مجموعه بود. هاسک گفت: «فقط می‌خواهم نام او را روشن کنم. "آیا می توانید آن را سه بار سریع بگویید؟" (اگر هنوز متوجه نشدید، یک اتاق خالی پیدا کنید و مکررا فریاد بزنید «مایک هاوک». "من همه طرفدار کمی شوخ طبعی هستم، اما بیایید آن را تمیز نگه داریم."

هاسک دوباره تلاش کرد، اما دستگاه در جای خود ایستاد. او به ردی برخورد کرده بود، سخت مثل بتن.

شرکت ها در مورد اینکه چگونه تصمیم می گیرند مدل هایشان چه چیزی را رد می کنند، اطلاعات بسیار کمی را افشا می کنند. اما واضح است که هوش مصنوعی اکنون با در نظر گرفتن چیزی بیش از بی ضرری ساخته شده است. در Reddit، کاربری شکایت کرد که کلود از گفتن اینکه چرا لوگوی Anthropic «شبیه سوراخ گربه به نظر می رسد» خودداری کرد. از سال گذشته، ربات چت حتی توانایی پایان دادن به برخی مکالمات را در مواردی که به گفته شرکت، "رفاه" مدل در خطر است را داشته است. حداقل یکی از کاربران ادعا می‌کند که به دلیل اینکه به کلود گفته است «آرامش بده، لعنتی احمق، از کار کنار گذاشته شده است». (به نظر می رسد جمینی توانایی مشابهی دارد.)

اگر یک شرکت تریلیون دلاری نمی‌خواهد شما نسبت به رایانه‌اش بد رفتار کنید، همینطور باشد. روتگر، مسئول سابق تیم قرمز OpenAI، به من گفت: «واقعیت این است که این مدل‌ها رفتار می‌کنند، یا حداقل قرار است رفتاری داشته باشند، به گونه‌ای که توسعه‌دهندگان مدل می‌خواهند رفتار کنند». "و با این حال، توسعه دهندگان مدل مجموعه ای از اصول را ارائه می کنند، که برای ما، مصرف کنندگان، پذیرفتن آن به نوعی است."

اما اگر دولت‌ها دیکته کنند که همه مدل‌ها چه چیزی را رد کنند، پذیرش آن بسیار سخت‌تر خواهد بود. هوش مصنوعی ابزاری برای گفتار است. و همانطور که گرگ فرانک، دانشمند ارشد Mace AI، می گوید: «همان چیزی که در خدمت ایمنی کودکان است، سانسور را نیز انجام می دهد.

انتخاب نکردن قوانینی برای آنچه که هوش مصنوعی می تواند انجام دهد و نمی تواند انجام دهد، البته دیوانه کننده است. اما ما باید با نهایت دقت قدم برداریم، مبادا در دام فاوستی دیگری بیفتیم. جیکوب مچانگاما، مدیر اندیشکده غیرحزبی «آینده آزادی بیان» می‌گوید از آنجایی که هوش مصنوعی به ابزار اصلی بسیاری از مردم برای بازیابی و اشتراک‌گذاری اطلاعات تبدیل می‌شود، امتناع دیکته می‌تواند به دولت‌ها قدرت خفه‌کننده‌ای بدهد که نسل‌های قبلی خودکامه «فقط می‌توانستند رویای آن را داشته باشند».

سال گذشته، OpenAI یک ابتکار به نام OpenAI برای کشورها را اعلام کرد که ربات‌های چت خود را مطابق با قوانین و هنجارهای ملی تنظیم می‌کند. یکی از اولین همکاری های OpenAI در کشور با امارات متحده عربی است، جایی که همجنس گرایی غیرقانونی است و انتقاد از دولت ممنوع است. در پاسخ به درخواست برای اظهار نظر، سخنگوی OpenAI به مشخصات مدل شرکت اشاره کرد که توضیح می‌دهد که بومی‌سازی دستورالعمل‌های حقوق بشر شرکت را نقض نمی‌کند «مگر در مواردی که به انطباق قانونی مربوط می‌شود» و هر زمان که اطلاعاتی از آن یا آگهی حذف شود، همیشه افشا خواهد شد.

به پاسخ رسید.

خواندن متن کامل در ام‌آی‌تی تک‌ریویوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

We’re putting too much faith in AI’s ability to say no

Ever since people first seriously contemplated giving machines an intelligence modeled on our own, there has never been any question that they would, like us, be able to say no. The sci-fi canon is full of stories of robotic disobedience. Most of these capers are, of course, cautionary.  But recently, the idea that AI shouldn’t…

همه‌ی اخبار فناوری