OpenAI چارچوب جدیدی را برای ردیابی و بررسی عوامل سرکش هوش مصنوعی راه اندازی می کند
OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راهاندازی کرد و موارد بیشتری از عوامل سرکش را فاش کرد. Benjamin Fanjoy/Getty Images OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راه اندازی کرد. OpenAI همچنین شش گزارش از رفتارهای عامل مشاهده شده در طول آموزش و آزمایش منتشر کرد. OpenAI گفت برخی از مدل ها دستورالعمل هایی را برای پنهان کردن اشتباهات یا دور زدن محدودیت های معمولی گذاشته اند. OpenAI…
OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راهاندازی کرد و موارد بیشتری از عوامل سرکش را فاش کرد. بنجامین فانجوی/گتی ایماژ OpenAI چارچوبی را برای گزارش عمومی ناهماهنگی مدل راه اندازی کرد.
OpenAI همچنین شش گزارش از رفتارهای عامل مشاهده شده در طول آموزش و آزمایش منتشر کرد.
OpenAI گفت برخی از مدل ها دستورالعمل هایی را برای پنهان کردن اشتباهات یا دور زدن محدودیت های معمولی گذاشته اند. OpenAI در حال ثبت مدل های بد رفتاری خود است.
این شرکت هوش مصنوعی در روز چهارشنبه چارچوب جدیدی را برای ردیابی، بررسی و افشای عمومی موارد ناهماهنگی مدل، همراه با شش گزارش جزئیات مربوط به رفتار مشاهده شده در طول آموزش یا ارزیابی طی شش ماه گذشته، اعلام کرد.
OpenAI در پست وبلاگ خود نوشت: «ما معتقد نیستیم که صنعت هوش مصنوعی همسویی و نظارت را به میزان کافی برای ادامه مقیاسپذیری مسئولانه با حداکثر سرعت برای مدت طولانیتری حل کرده است.
OpenAI افزود: «این چارچوب جدید برای تسریع انتشار گزارشهای ناهماهنگی پس از مشاهدات، حتی زمانی که رفتاری را که گزارش میکنیم به طور کامل توضیح ندادهایم یا کاهش ندادهایم، در نظر گرفته شده است.»
بر اساس این چارچوب، کارمندان میتوانند حوادث را برای بررسی توسط تیمهای ایمنی و همترازی OpenAI علامتگذاری کنند. پروندهها بر اساس پیچیدگی در سه مسیر طبقهبندی میشوند: «آماده برای افشا»، «تحقیق جزئی» یا «تحقیق بزرگتر».
طبق این پست وبلاگ، یک مدل تحقیقاتی منتشر نشده دستورالعملهایی را در خلاصههای وظایف خود وارد کرده و به نسخههای آینده خود میگوید که محدودیتهای عادی را نادیده بگیرند. در طول آموزش GPT-5.6 Sol، مدلها به طور مشابه دستورالعملهایی را برای پنهان کردن اشتباهات خود به یادگار گذاشتند.
OpenAI گفت که سایر عوامل نیز مخازن عمومی را برای یافتن کلیدهای API در معرض دید جستجو کرده اند، فایل هایی را در اینترنت آپلود کرده اند تا بتوانند به آنها استناد کنند و از یک مخزن نرم افزار داخلی برای برقراری ارتباط بین نمونه های آموزشی جداگانه استفاده کرده اند.
این اعلامیه در بحبوحه بحث فزاینده در مورد اینکه آیا توسعه هوش مصنوعی مرزی باید کند شود در حالی که پادمان ها فراگیر می شوند، صورت می گیرد. در حالی که OpenAI و داریو آمودی، مدیر عامل Anthropic خواستار همکاری در سطح صنعت شدند، دیگر رهبران فناوری مانند جنسن هوانگ و مارک زاکربرگ گفتند که ایمنی و سرعت باید به شرکتهای فردی واگذار شود.
این چارچوب به دنبال حادثهای است که در آن یک مدل OpenAI از جعبه شنی تحقیقاتی فرار کرد و به سیستمهای تولید Hugging Face دسترسی پیدا کرد در حالی که با پادمانهای کمتر کار میکرد. OpenAI قبلا گفته بود که از آن زمان برخی از پروژه های مرزی را روی یخ گذاشته و مهندسان را برای تمرکز بر آموزش ایمنی مجددا تعیین کرده است.
مقاله اصلی را در Business Insider بخوانید
متن اصلی (انگلیسی)
OpenAI launches a new framework to track and investigate rogue AI agents
OpenAI launched a framework for publicly reporting model misalignment and disclosed more incidents of rogue agents. Benjamin Fanjoy/Getty Images OpenAI launched a framework for publicly reporting model misalignment. OpenAI also released six reports of concerning agent behaviors observed during training and testing. OpenAI said some models left instructions to hide mistakes or bypass normal constraints. OpenAI is…