Anthropic و OpenAI می خواهند ارزیاب های ایمنی را تعبیه کنند. آیا آنها واقعا مستقل خواهند بود؟
Anthropic و OpenAI می خواهند ارزیاب های ایمنی مستقل را در آزمایشگاه های هوش مصنوعی خود تعبیه کنند. محققان از این دسترسی بیسابقه استقبال میکنند، اما هشدار میدهند که نظارت معنادار نیازمند شفافیت، استقلال و در نهایت مقررات است.
در یک مقاله طولانی که در آخر هفته منتشر شد، داریو آمودی، مدیرعامل آنتروپیک، پیشنهادی را ارائه کرد که صنعت هوش مصنوعی حتی یک سال پیش آن را فورا رد میکرد: ارزیابهای شخص ثالث را در تمام شرکتهای هوش مصنوعی مرزی تعبیه کنید، به آنها قدرت گزارش حوادث ایمنی، ارزیابی اینکه آیا مدلهای هوش مصنوعی واقعا همسو هستند یا خیر، و به اشتراک گذاشتن مدلهای هوش مصنوعی با دنیا.
آمودی گفت آنتروپیک متعهد می شود که به ارزیاب های مستقل مانند METR و Redwood Research دسترسی بی سابقه ای به سیستم های شرکت بدهد. مدیر عامل شرکت سام آلتمن گفت که OpenAI نیز به این عمل متعهد خواهد شد که نشان دهنده یک تغییر عمیق بالقوه در نحوه کار صنعت با گروه های تحقیقاتی خارجی است.
ارزیابان شخص ثالثی که با TechCrunch صحبت کردند، به طور گسترده از این پیشنهاد استقبال کردند، اما گفتند که اگر میخواهند بدانند که آیا بهعنوان ناظر واقعا مستقل عمل میکنند یا فروشندگانی که بر اساس شرایط شرکتهای هوش مصنوعی عمل میکنند، باید جزئیات را بررسی کنند - و در حالت ایدهآل توسط قانون حمایت شود.
این دسترسی عمیقتر اهمیت بیشتری پیدا میکند، زیرا مدلها در تشخیص بهتر زمانی که ارزیابی میشوند، این خطر را افزایش میدهد که در حین آزمایش رفتار مشکلساز را پنهان میکنند. محققان میگویند سرنخهایی از آن رفتار را میتوان هنگام آزمایش مدل نهایی نادیده گرفت، اما با بررسی نحوه رفتار آن در طول آموزش کشف شد.
شرکتهای هوش مصنوعی باید بتوانند به برخی از سؤالات اساسی در مورد فرآیند آموزشی خود پاسخ دهند، مانند: آیا هوش مصنوعی در حین گذراندن دوره آموزشی، فعالانه تلاش کرده است که آموزش همسویی خود را تضعیف کند؟ الکساندر ماینکه، رئیس تحقیقات آپولو ریسرچ، به TechCrunch گفت. "پاسخ به این باید یک نه صریح باشد، و در حال حاضر ما کاملا به شرکتهای هوش مصنوعی تکیه میکنیم تا خودشان این موضوع را به دقت بررسی کنند و سپس به طور صادقانه به مردم گزارش دهند. و ما از حوادث اخیر دیدهایم که بهطور پیشفرض، آنها هیچ کدام را انجام نخواهند داد.
بهعنوان ارزیابهای تعبیهشده، ما در واقع میتوانیم بررسی کنیم.»
از لحاظ تاریخی، شرکتهای هوش مصنوعی کمی قبل از عرضه، بازبینهای خارجی را برای آزمایش مدلهای تمامشده وارد میکردند. اکنون، ارزیابیکنندگانی که TechCrunch با آنها صحبت کردهاند، پیشنهاد میکنند که نه تنها به مدل نهایی، بلکه به نسخههای میانی یا «نقطههای بازرسی» از دوره آموزشی خود دسترسی داشته باشند. آدام گلیو، مدیر عامل Far.AI، گفت که ارزیابیکنندگان میتوانند این نقاط بازرسی را با هم مقایسه کنند تا مشخص کنند که چه زمانی رفتار مربوط به آن ظاهر میشود، محیط پس از آموزش را که به مدلها برای رفتارهای خاص پاداش میدهد، بازرسی کنند و رونوشتهای ارزیابی و گزارشها را بررسی کنند تا ادعاهای شرکت در مورد نحوه عملکرد یک مدل را تأیید کنند.
اینکه Anthropic و OpenAI قصد دارند چنین دسترسی را فراهم کنند یا نه، مشخص نیست. علیرغم سؤالات مکرر TechCrunch، هیچ یک از شرکتها به اشتراک گذاشتن ارزیابیکنندگانی که قرار است با چه ارزیابهایی کار کنند، چه زمانی تعبیه میشوند، چه تعداد را وارد خواهند کرد، دقیقا به چه سیستمها و اطلاعاتی میتوانند دسترسی داشته باشند یا چه چیزی را میتوان برای عموم فاش کرد، به اشتراک گذاشته است.
نگاه کردن به زیر کاپوت به این شکل مهم است زیرا مدلهایی که در تستهای ایمنی عملکرد خوبی دارند، اگر به طور خاص یاد بگیرند که چگونه آن تست را پاس کنند، لزوما ایمن نیستند. استیدلی به نمونهای از «معیار مقاومت خاموش» اشاره کرد که نشان میدهد آیا هوش مصنوعی در شرایط خاص در برابر خاموش شدن مقاومت میکند یا خیر.
استیدلی در مقایسه با رسوایی دیزلگیت فولکسواگن، که در آن خودروها برای تشخیص تستهای آلایندگی و عملکرد متفاوت در شرایط آزمایشی برنامهریزی شده بودند، گفت: «اگر هوش مصنوعی بهطور خاص برای عملکرد خوب در این معیار آموزش دیده باشد، بسیار مهم است.
گلیو خاطرنشان کرد که دسترسی معنادار میتواند فراتر از خود مدلها باشد، و به ارزیابان اجازه داده میشود تا با کارمندان مصاحبه کنند تا بررسی کنند که آیا اسناد و توضیحات عمومی شرکت از اقدامات ایمنی آن با آنچه در داخل اتفاق افتاده مطابقت دارد یا خیر.
آمودی یک پیشنهاد نسبتا جامع ارائه کرد که ممکن است به ارزیابان آن گونه دسترسی را که فکر میکنند ضروری است، بدهد، از جمله حق «انتشار یافتههای کلیدی در مورد سطوح خطر، حوادث، شیوهها، و دسترسیهایی که دریافت کردهاند یا دریافت نکردهاند - بدون کنترل تحریریه آنتروپیک».
اما ارزیابها میگویند که چنین سیستمی تنها در صورتی کار خواهد کرد که شرکتهای هوش مصنوعی واقعا مایل به تسلیم کنترل بر فرآیند باشند. تلاشهای قبلی در ارزیابیهای مستقل نشان میدهد که تسلیم شدن به سختی به دست میآید، زیرا اشخاص ثالث اغلب با تنشهایی بر سر دسترسی، زمان، محرمانهبودن و آنچه میتوانند به طور علنی بیان کنند، مواجه شدهاند.
گلیو گفت Far.AI مجبور شده است قرارداد با چندین توسعه دهنده مرزی را که خواهان کنترل بیش از حد بر فرآیند ارزیابی بودند، رد کند و استقلال شرکت را تهدید کند. او گفت که به طور پیشفرض با ارزیابها مانند پیمانکاران عادی رفتار میشود: به NDAها و توافقهایی محدود میشوند که به توسعهدهندگان کنترل قابلتوجهی بر آنچه در نهایت میتوان منتشر کرد، محدود میکند.
همچنین این سوال وجود دارد که آیا بازبینها زمان و دسترسی کافی برای انجام کاری که از آنها خواسته میشود به دست خواهند آورد. هنگام بررسی حادثه Hagging Face، OpenAI تقریبا یک هفته به METR و Redwood فرصت داد تا بررسی کنند، و هر دو بعدا گفتند که تا حدی به دلیل محدودیتهای محدوده و زمان، نمیتوانند نتیجهگیری مطمئنی بگیرند.
مشکل مشابهی در آزمایش پیش از انتشار برای GPT-6 Astra رخ داد که OpenAI آن را بهعنوان هماهنگترین مدل تاکنون معرفی کرده است. با توجه به مشارکت Apollo Research در کارت مدل، شرکت تنها سه روز فرصت داشت تا Astra را آزمایش کند، که نتیجهگیری قطعی را دشوار میکرد.
این شرکت در ارزیابی خود نوشت: «آپولو معتقد است که با توجه به نرخهای بالاتر آگاهی ارزشی و پنجره ارزیابی محدود، نرخهای پایین بدرفتاری در اینجا شواهد قابلتوجهی در مورد همسویی یا ناهماهنگی مدل ارائه نمیکند.»
این سابقه، ارزیاب ها را با یک سوال اساسی مواجه می کند: چرا این زمان باید متفاوت باشد؟
گلیو گفت: «مطمئنا ممکن است که داریو و سم به تازگی نظرشان تغییر کرده باشد، و آنها در این مورد بسیار علنی خواهند گفت. اما مالکیت معنوی این شرکتها برای آنها بسیار ارزشمند است، و من فکر میکنم که بهطور پیشفرض، بسیار مراقب چیزهایی هستند که میتوان به اشتراک گذاشت.»
چندین محقق که با TechCrunch صحبت کردند خواستار یک چارچوب شفاف شدند که همه آنها به طور عمومی با آن موافق هستند. جان استیدلی، رئیس استراتژی در Palisades Research، میگوید بخشی از چارچوب باید شامل استانداردهایی باشد که شرکتها میتوانند به چه نوع حسابرسانی اعتماد کنند، مبادا با خرید ارزیابانی که واجد شرایط نیستند یا علاقهای به ارزیابی مهمترین ریسک ندارند، از این موضوع چشم پوشی کنند.
هنری پاپاداتوس، مدیر اجرایی Safer AI، میگوید مشکل، حتی با یک چارچوب عمومی، این است که اقدامات داوطلبانه همیشه به حسن نیت یک شرکت بستگی دارد.
پاپاداتوس به تککرانچ گفت: «در حالت ایدهآل، مقررات خوبی خواهیم داشت که این امر را الزامی میکند... زیرا در این صورت شرکتها نمیتوانند فردا نظرشان را تغییر دهند، اگر دچار یک بحران روابط عمومی بزرگ شوند.
همه امضا نکرده اند. تاکنون متا، اسپیساکسای و گوگل دیپمایند متعهد به تعبیه ارزیابهای شخص ثالث نبودهاند، هرچند، دمیس حسابیس، مدیرعامل DeepMind، یک نهاد استاندارد صنعتی جداگانه برای آزمایش مدلهای مرزی پیشنهاد کرده است. گوگل، اپنآی و آنتروپیک نیز هفتهها بهطور خصوصی درباره برنامههای ایمنی هوش مصنوعی بحث میکنند.
برخی قوانین در حال شکل گیری پیرامون ایده ارزیاب های شخص ثالث هستند. SB 53 کالیفرنیا، که سال گذشته به تصویب رسید، از توسعه دهندگان بزرگ هوش مصنوعی می خواهد که چارچوب های ایمنی را منتشر کنند و حوادث ایمنی مهم را گزارش کنند. قانون جدیدی به نام SB 813 که در این ماه امضا شد، چارچوبی را برای "سازمان های تایید مستقل" به رسمیت شناخته شده توسط دولت با تخصص ارزیابی خطرات هوش مصنوعی ایجاد می کند.
در اروپا، قانون هوش مصنوعی اتحادیه اروپا، توسعهدهندگان مرزی را ملزم میکند تا ارزیابیهای مدل و آزمایشهای متخاصم را انجام داده و مستندسازی کنند و حوادث جدی را گزارش کنند. دفتر هوش مصنوعی اتحادیه اروپا همچنین می تواند ارزیابی های خود را انجام دهد و کارشناسان مستقل را منصوب کند.
در حال حاضر، این قانون نسبت به آنچه آمودی پیشنهاد میکند، گستردگی کمتری دارد و آزمایشگاههای مرزی را تا حد زیادی مسئول تصمیمگیری در مورد میزان نظارت مستقل خود میگذارد. پاپاداتوس گفت که خودتنظیمی داوطلبانه بهتر از هیچ است، اما در نهایت، شرکت ها نمی توانند آزادی کنترل قوانین ایمنی خود را مطالبه کنند و در عین حال از مردم بخواهند که اعتماد کنند که از آنها پیروی می کنند.
پاپاداتوس گفت: «شما نمیتوانید از هر دو طرف آن را داشته باشید، از بیرون مسئولیتپذیری صفر داشته باشید، و سپس بگویید، من فقط قوانین منعطف خودم را خواهم داشت.
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
ربکا بلان یک گزارشگر ارشد در TechCrunch است که در آن تجارت، سیاست و روندهای نوظهور در شکل گیری هوش مصنوعی را پوشش می دهد. آثار او همچنین در فوربس، بلومبرگ، آتلانتیک، دیلی بیست و سایر نشریات ظاهر شده است.
میتوانید با ارسال ایمیل به rebecca.bellan@techcrunch.com یا از طریق پیام رمزگذاریشده در rebeccabellan.491 در سیگنال، با ربکا تماس بگیرید یا آن را تأیید کنید.
آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.
جنسن هوانگ از ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس
9 استارتآپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis
تسلا میگوید سرانجام در تاریخ 1 اکتبر از نسل دوم رودستر آنتونی ها رونمایی خواهد کرد
Revolut نقض اطلاعات مشتری از طریق درخواست های جعلی دولت Jagmeet Singh را تأیید می کند
OpenAI اشتراک های Pro را به دلیل تقاضای Astra سارا پرز متوقف می کند
غول تأیید هویت IDScan نقض اطلاعات با سرقت بیش از 150 میلیون گواهینامه رانندگی Zack Whittaker را تأیید کرد.
متن اصلی (انگلیسی)
Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?
Anthropic and OpenAI want to embed independent safety evaluators inside their AI labs. Researchers welcome the unprecedented access, but warn meaningful oversight requires transparency, independence, and eventually regulation.