پرش به محتوای اصلی

OpenAI چارچوب جدیدی را برای ردیابی و بررسی عوامل سرکش هوش مصنوعی راه اندازی می کند

بیزینس اینسایدر۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۰۳:۱۳حدود 2 دقیقه مطالعه

OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راه‌اندازی کرد و موارد بیشتری از عوامل سرکش را فاش کرد. Benjamin Fanjoy/Getty Images OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راه اندازی کرد. OpenAI همچنین شش گزارش از رفتارهای عامل مشاهده شده در طول آموزش و آزمایش منتشر کرد. OpenAI گفت برخی از مدل ها دستورالعمل هایی را برای پنهان کردن اشتباهات یا دور زدن محدودیت های معمولی گذاشته اند. OpenAI…

OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راه‌اندازی کرد و موارد بیشتری از عوامل سرکش را فاش کرد. بنجامین فانجوی/گتی ایماژ OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راه اندازی کرد.

OpenAI همچنین شش گزارش از رفتارهای عامل مشاهده شده در طول آموزش و آزمایش منتشر کرد.

OpenAI گفت برخی از مدل ها دستورالعمل هایی را برای پنهان کردن اشتباهات یا دور زدن محدودیت های معمولی گذاشته اند. OpenAI در حال ثبت مدل های بد رفتاری خود است.

این شرکت هوش مصنوعی در روز چهارشنبه چارچوب جدیدی را برای ردیابی، بررسی و افشای عمومی موارد ناهماهنگی مدل، همراه با شش گزارش جزئیات مربوط به رفتار مشاهده شده در طول آموزش یا ارزیابی طی شش ماه گذشته، اعلام کرد.

OpenAI در پست وبلاگ خود نوشت: «ما معتقد نیستیم که صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی برای ادامه مقیاس‌پذیری مسئولانه با حداکثر سرعت برای مدت طولانی‌تری حل کرده است.

OpenAI افزود: «این چارچوب جدید برای تسریع انتشار گزارش‌های ناهماهنگی پس از مشاهدات، حتی زمانی که رفتاری را که گزارش می‌کنیم به طور کامل توضیح نداده‌ایم یا کاهش نداده‌ایم، در نظر گرفته شده است.»

بر اساس این چارچوب، کارمندان می‌توانند حوادث را برای بررسی توسط تیم‌های ایمنی و هم‌ترازی OpenAI علامت‌گذاری کنند. پرونده‌ها بر اساس پیچیدگی در سه مسیر طبقه‌بندی می‌شوند: «آماده برای افشا»، «تحقیق جزئی» یا «تحقیق بزرگتر».

طبق این پست وبلاگ، یک مدل تحقیقاتی منتشر نشده دستورالعمل‌هایی را در خلاصه‌های وظایف خود وارد کرده و به نسخه‌های آینده خود می‌گوید که محدودیت‌های عادی را نادیده بگیرند. در طول آموزش GPT-5.6 Sol، مدل‌ها به طور مشابه دستورالعمل‌هایی را برای پنهان کردن اشتباهات خود به یادگار گذاشتند.

OpenAI گفت که سایر عوامل نیز مخازن عمومی را برای یافتن کلیدهای API در معرض دید جستجو کرده اند، فایل هایی را در اینترنت آپلود کرده اند تا بتوانند به آنها استناد کنند و از یک مخزن نرم افزار داخلی برای برقراری ارتباط بین نمونه های آموزشی جداگانه استفاده کرده اند.

این اعلامیه در بحبوحه بحث فزاینده در مورد اینکه آیا توسعه هوش مصنوعی مرزی باید کند شود در حالی که پادمان ها فراگیر می شوند، صورت می گیرد. در حالی که OpenAI و داریو آمودی، مدیر عامل Anthropic خواستار همکاری در سطح صنعت شدند، دیگر رهبران فناوری مانند جنسن هوانگ و مارک زاکربرگ گفتند که ایمنی و سرعت باید به شرکت‌های فردی واگذار شود.

این چارچوب به دنبال حادثه‌ای است که در آن یک مدل OpenAI از جعبه شنی تحقیقاتی فرار کرد و به سیستم‌های تولید Hugging Face دسترسی پیدا کرد در حالی که با پادمان‌های کمتر کار می‌کرد. OpenAI قبلا گفته بود که از آن زمان برخی از پروژه های مرزی را روی یخ گذاشته و مهندسان را برای تمرکز بر آموزش ایمنی مجددا تعیین کرده است.

مقاله اصلی را در Business Insider بخوانید

خواندن متن کامل در بیزینس اینسایدربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

OpenAI launches a new framework to track and investigate rogue AI agents

OpenAI launched a framework for publicly reporting model misalignment and disclosed more incidents of rogue agents. Benjamin Fanjoy/Getty Images OpenAI launched a framework for publicly reporting model misalignment. OpenAI also released six reports of concerning agent behaviors observed during training and testing. OpenAI said some models left instructions to hide mistakes or bypass normal constraints. OpenAI is…

همه‌ی اخبار فناوری