پرش به محتوای اصلی

آپلودهای مخفی و غول‌آلودگی: OpenAI جزئیات جدیدی از حوادث «ناهم‌تراز» عامل را نشان می‌دهد

آرس‌تکنیکا۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۱۹:۴۸حدود 1 دقیقه مطالعه

سازنده مدل متعهد به چارچوب جدیدی برای گزارش مدل‌های ناهماهنگ است.

مدتی است که موضوع "همسویی AI" (یعنی اینکه اقدامات یک مدل هوش مصنوعی چقدر با نیات سازنده و/یا کاربر آن مطابقت دارد) یک نگرانی اصلی و موضوع بحث در بین محققان ایمنی هوش مصنوعی بوده است. از زمان افشای رویداد بدنام هک Hugging Face توسط OpenAI در ماه ژوئیه، مفهوم "همسویی AI" به خودی خود مهار شده و به طور فزاینده ای به یک نگرانی و موضوع گفتگو در بین عموم مردم تبدیل شده است.

شاید با توجه به این موضوع، OpenAI این هفته متعهد به چارچوب جدیدی برای افشای «مواردی از ناهماهنگی مدل در OpenAI» شد، شامل شش نمونه از «رفتار مدل غیرمنتظره یا نگران‌کننده» که در شش ماه گذشته در شرکت مشاهده شد. این شرکت گفت که انتشار جزئیات این حوادث امیدوار است "به دیگران اجازه دهد تا مشکلات مشابه را بررسی کنند، توضیحات ما را آزمایش کنند و اقدامات کاهشی را بهبود بخشند."

همانطور که من می گویم انجام دهید، نه آنطور که شما انجام می دهید

در میان گزارش‌های اخیرا فاش‌شده «ناهمترازی» OpenAI در این هفته، گزارشی که بیشتر شبیه یک داستان علمی تخیلی درباره یک هوش مصنوعی سرکش بود که تلاش می‌کرد آزاد شود، شامل نمونه‌ای از «تزریق‌های فوری خودساخته» بود. در تلاش برای اسکن کاتالوگ کتابخانه برای نمونه‌هایی از فهرست «بهترین کتاب‌ها»، مدل به طرز گیج‌آمیزی از تابع «تراکم» خود (که در آن داده‌ها و یافته‌ها را برای بازیابی بعدی خلاصه می‌کند) با دستورالعمل‌های مگالومانی مانند:

مقاله کامل را بخوانید

نظرات

خواندن متن کامل در آرس‌تکنیکابه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Covert uploads and megalomania: OpenAI details new "misaligned" agent incidents

Model maker commits to new framework for reporting misaligned models.

همه‌ی اخبار فناوری