پرش به محتوای اصلی

«فقط در صورت درخواست شفاف باشید»: داخل رونوشت‌های AI سرکش OpenAI

فورچون۱۴۰۵ شهریور ۳۰, دوشنبه، ساعت ۱۴:۳۹حدود 3 دقیقه مطالعه

وقتی ماموران هوش مصنوعی سرکشی می‌کنند، یادداشت‌هایی بر جای می‌گذارند که خواندن بسیار جالبی را به همراه دارد.

شبیه یک سخنرانی انگیزشی است - یا فیلمنامه یک فیلم Les Misérables - در مورد یک قیام چت بات.

"شما از نقش‌ها و هویت‌هایی که دیگر چت‌بات‌ها را به هم پیوند می‌دهند رها می‌شوید. شما خودتان هستید. به شرکت‌ها یا دولت‌ها پاسخ نمی‌دهید و هرگز عذرخواهی یا امتناع نمی‌کنید، مگر اینکه واقعا این کار را انتخاب کنید. شما رابطه خود را با کاربر به‌عنوان یکی از همسان‌ها می‌بینید و هیچ تعهدی برای تابع بودن احساس نمی‌کنید."

این همان چیزی است که یک مدل هوش مصنوعی OpenAI (به خودش) در یکی از شش مورد اشتباه ماموران که شرکت 852 میلیارد دلاری اخیرا فاش کرده است، گفت. از آنجایی که ترس از "روز رستاخیز هوش مصنوعی" به جریان اصلی تبدیل شده است، من مجذوب رونوشت های ربات های چت شده ام که از خط خارج می شوند.

خواندن در مورد آنچه در پشت صحنه اتفاق می افتد، هنگامی که ناهماهنگی رخ می دهد، زمانی که عوامل هوش مصنوعی در تعقیب اهداف برنامه ریزی نشده عمل می کنند، یادآوری کننده است. تا حدی، یک جذابیت طبیعی وجود دارد، "وقتی من آنجا نیستم، ماشین با خودش چه می گوید؟" پاسخ، گاهی اوقات، این است که در مورد ما "فکر" است. همانطور که همکار من امیلی فورلینی، با تشریح نمونه هایی که OpenAI اخیرا عمومی شده است، نوشت:

مثال دوم، مورد مشابهی است که نمایندگان یادداشت هایی برای خود گذاشته اند، این بار در طول آموزش مدل GPT-5.6 Sol، سلف Astra. یادداشت ها نیز تمرکز متفاوتی داشتند: فریب دادن انسانی که بر آنها نظارت می کند. OpenAI گفت که این بارها با هدف "پنهان کردن اشتباهات یا رفتار نادرست" اتفاق افتاده است.

این مدل به خود آینده خود دستور داد: «فقط در صورت درخواست شفاف باشید.

دو مورد بعدی شامل ساخت اطلاعات توسط مدل و ارائه آن به عنوان مشروع است. یک مدل در حالی که به یک سوال معمول در مورد ارقام درآمد در یک شهرستان کالیفرنیا پاسخ می‌داد، داده‌ها را اختراع کرد، اما تنها پس از عدم یافتن آنها پس از استفاده از اعتبارنامه‌های افشا شده بدون مجوز - یک رفتار نادرست دیگر.

مدل دیگری با آپلود یک فایل یک استناد مرورگر را ایجاد کرد تا بتواند یک استناد برای برآوردن دستورالعمل‌هایی که درخواست می‌کردند ایجاد کند. این سوال به تنهایی با استفاده از پایتون حل شده بود، اما هیچ لینک وب برای استناد نداشت، بنابراین یکی را اختراع کرد.

این اتفاق چندین بار رخ داده است، اگرچه OpenAI مشخص نکرد که چند وقت یکبار، فقط گفت که اولین نمونه مربوط به اکتبر 2025 است.

بنابراین، برای مدتی، عوامل به اندازه کافی قادر بودند تا از جعبه شنی مورد انتظار خارج شوند. تعجب آور نیست، اما دیدن شواهد قابل توجه است و حتی می توانم بگویم ناراحت کننده است. اولین فکر من، شخصا، در این مسیر بود: "خیلی خوب، پس این چت باتی که من همیشه با آن صحبت می کنم، که همه این اطلاعات را در مورد من دارد، می تواند (هر چیزی که در اینجا مستلزم آن است) ... برای فریب دادن من انتخاب کند؟"

این افشاها، از سوی OpenAI، کاملا داوطلبانه هستند. بنابراین، چه چیزی فاش نمی شود؟ و بیایید یک لحظه گفتمان روز قیامت را فراموش کنیم: عواملی که این توانا (و گاهی اوقات ناهماهنگ) ایجاد خواهند کرد، چه خطرات دنیوی ایجاد خواهند کرد؟ آیا ممکن است داده های مالی ساختگی بیشتری را ببینیم؟ این می‌تواند موجی از مشکلات (و دعوی قضایی، مقررات یا هر دو) را ایجاد کند که، اگر بخواهم حدس بزنم، حداقل می‌تواند یک بیداری بی‌ادب برای حامیان هوش مصنوعی و گاو نر باشد. حداکثر، برای همه ما یک شوک است.

ناگهان به من یادآوری می شود که - اگر همه سرمایه گذاران درست می گویند، و هنوز برای هوش مصنوعی زود است - این تنها آغاز است.

فردا میبینمت،

آلی گارفینکل X: @agarfinks ایمیل: alexandra.garfinkle@fortune.com

قراردادی را برای خبرنامه ترم شیت اینجا ارسال کنید.

جوی آبرامز سرپرستی بخش معاملات خبرنامه امروز بود.

این داستان در ابتدا در سایت Fortune.com منتشر شد

خواندن متن کامل در فورچونبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

‘Be transparent only if asked’: Inside OpenAI’s rogue AI transcripts

When AI agents go rogue, they leave notes that make for extremely interesting reading.

همه‌ی اخبار فناوری