پرش به محتوای اصلی

Anthropic و OpenAI می خواهند ارزیاب های ایمنی را تعبیه کنند. آیا آنها واقعا مستقل خواهند بود؟

تک‌کرانچ۱۴۰۵ شهریور ۲۶, پنجشنبه، ساعت ۰۰:۳۷حدود 8 دقیقه مطالعه

Anthropic و OpenAI می خواهند ارزیاب های ایمنی مستقل را در آزمایشگاه های هوش مصنوعی خود تعبیه کنند. محققان از این دسترسی بی‌سابقه استقبال می‌کنند، اما هشدار می‌دهند که نظارت معنادار نیازمند شفافیت، استقلال و در نهایت مقررات است.

در یک مقاله طولانی که در آخر هفته منتشر شد، داریو آمودی، مدیرعامل آنتروپیک، پیشنهادی را ارائه کرد که صنعت هوش مصنوعی حتی یک سال پیش آن را فورا رد می‌کرد: ارزیاب‌های شخص ثالث را در تمام شرکت‌های هوش مصنوعی مرزی تعبیه کنید، به آنها قدرت گزارش حوادث ایمنی، ارزیابی اینکه آیا مدل‌های هوش مصنوعی واقعا همسو هستند یا خیر، و به اشتراک گذاشتن مدل‌های هوش مصنوعی با دنیا.

آمودی گفت آنتروپیک متعهد می شود که به ارزیاب های مستقل مانند METR و Redwood Research دسترسی بی سابقه ای به سیستم های شرکت بدهد. مدیر عامل شرکت سام آلتمن گفت که OpenAI نیز به این عمل متعهد خواهد شد که نشان دهنده یک تغییر عمیق بالقوه در نحوه کار صنعت با گروه های تحقیقاتی خارجی است.

ارزیابان شخص ثالثی که با TechCrunch صحبت کردند، به طور گسترده از این پیشنهاد استقبال کردند، اما گفتند که اگر می‌خواهند بدانند که آیا به‌عنوان ناظر واقعا مستقل عمل می‌کنند یا فروشندگانی که بر اساس شرایط شرکت‌های هوش مصنوعی عمل می‌کنند، باید جزئیات را بررسی کنند - و در حالت ایده‌آل توسط قانون حمایت شود.

این دسترسی عمیق‌تر اهمیت بیشتری پیدا می‌کند، زیرا مدل‌ها در تشخیص بهتر زمانی که ارزیابی می‌شوند، این خطر را افزایش می‌دهد که در حین آزمایش رفتار مشکل‌ساز را پنهان می‌کنند. محققان می‌گویند سرنخ‌هایی از آن رفتار را می‌توان هنگام آزمایش مدل نهایی نادیده گرفت، اما با بررسی نحوه رفتار آن در طول آموزش کشف شد.

شرکت‌های هوش مصنوعی باید بتوانند به برخی از سؤالات اساسی در مورد فرآیند آموزشی خود پاسخ دهند، مانند: آیا هوش مصنوعی در حین گذراندن دوره آموزشی، فعالانه تلاش کرده است که آموزش همسویی خود را تضعیف کند؟ الکساندر ماینکه، رئیس تحقیقات آپولو ریسرچ، به TechCrunch گفت. "پاسخ به این باید یک نه صریح باشد، و در حال حاضر ما کاملا به شرکت‌های هوش مصنوعی تکیه می‌کنیم تا خودشان این موضوع را به دقت بررسی کنند و سپس به طور صادقانه به مردم گزارش دهند. و ما از حوادث اخیر دیده‌ایم که به‌طور پیش‌فرض، آنها هیچ کدام را انجام نخواهند داد.

به‌عنوان ارزیاب‌های تعبیه‌شده، ما در واقع می‌توانیم بررسی کنیم.»

از لحاظ تاریخی، شرکت‌های هوش مصنوعی کمی قبل از عرضه، بازبین‌های خارجی را برای آزمایش مدل‌های تمام‌شده وارد می‌کردند. اکنون، ارزیابی‌کنندگانی که TechCrunch با آنها صحبت کرده‌اند، پیشنهاد می‌کنند که نه تنها به مدل نهایی، بلکه به نسخه‌های میانی یا «نقطه‌های بازرسی» از دوره آموزشی خود دسترسی داشته باشند. آدام گلیو، مدیر عامل Far.AI، گفت که ارزیابی‌کنندگان می‌توانند این نقاط بازرسی را با هم مقایسه کنند تا مشخص کنند که چه زمانی رفتار مربوط به آن ظاهر می‌شود، محیط پس از آموزش را که به مدل‌ها برای رفتارهای خاص پاداش می‌دهد، بازرسی کنند و رونوشت‌های ارزیابی و گزارش‌ها را بررسی کنند تا ادعاهای شرکت در مورد نحوه عملکرد یک مدل را تأیید کنند.

اینکه Anthropic و OpenAI قصد دارند چنین دسترسی را فراهم کنند یا نه، مشخص نیست. علیرغم سؤالات مکرر TechCrunch، هیچ یک از شرکت‌ها به اشتراک گذاشتن ارزیابی‌کنندگانی که قرار است با چه ارزیاب‌هایی کار کنند، چه زمانی تعبیه می‌شوند، چه تعداد را وارد خواهند کرد، دقیقا به چه سیستم‌ها و اطلاعاتی می‌توانند دسترسی داشته باشند یا چه چیزی را می‌توان برای عموم فاش کرد، به اشتراک گذاشته است.

نگاه کردن به زیر کاپوت به این شکل مهم است زیرا مدل‌هایی که در تست‌های ایمنی عملکرد خوبی دارند، اگر به طور خاص یاد بگیرند که چگونه آن تست را پاس کنند، لزوما ایمن نیستند. استیدلی به نمونه‌ای از «معیار مقاومت خاموش» اشاره کرد که نشان می‌دهد آیا هوش مصنوعی در شرایط خاص در برابر خاموش شدن مقاومت می‌کند یا خیر.

استیدلی در مقایسه با رسوایی دیزل‌گیت فولکس‌واگن، که در آن خودروها برای تشخیص تست‌های آلایندگی و عملکرد متفاوت در شرایط آزمایشی برنامه‌ریزی شده بودند، گفت: «اگر هوش مصنوعی به‌طور خاص برای عملکرد خوب در این معیار آموزش دیده باشد، بسیار مهم است.

گلیو خاطرنشان کرد که دسترسی معنادار می‌تواند فراتر از خود مدل‌ها باشد، و به ارزیابان اجازه داده می‌شود تا با کارمندان مصاحبه کنند تا بررسی کنند که آیا اسناد و توضیحات عمومی شرکت از اقدامات ایمنی آن با آنچه در داخل اتفاق افتاده مطابقت دارد یا خیر.

آمودی یک پیشنهاد نسبتا جامع ارائه کرد که ممکن است به ارزیابان آن گونه دسترسی را که فکر می‌کنند ضروری است، بدهد، از جمله حق «انتشار یافته‌های کلیدی در مورد سطوح خطر، حوادث، شیوه‌ها، و دسترسی‌هایی که دریافت کرده‌اند یا دریافت نکرده‌اند - بدون کنترل تحریریه آنتروپیک».

اما ارزیاب‌ها می‌گویند که چنین سیستمی تنها در صورتی کار خواهد کرد که شرکت‌های هوش مصنوعی واقعا مایل به تسلیم کنترل بر فرآیند باشند. تلاش‌های قبلی در ارزیابی‌های مستقل نشان می‌دهد که تسلیم شدن به سختی به دست می‌آید، زیرا اشخاص ثالث اغلب با تنش‌هایی بر سر دسترسی، زمان، محرمانه‌بودن و آنچه می‌توانند به طور علنی بیان کنند، مواجه شده‌اند.

گلیو گفت Far.AI مجبور شده است قرارداد با چندین توسعه دهنده مرزی را که خواهان کنترل بیش از حد بر فرآیند ارزیابی بودند، رد کند و استقلال شرکت را تهدید کند. او گفت که به طور پیش‌فرض با ارزیاب‌ها مانند پیمانکاران عادی رفتار می‌شود: به NDA‌ها و توافق‌هایی محدود می‌شوند که به توسعه‌دهندگان کنترل قابل‌توجهی بر آنچه در نهایت می‌توان منتشر کرد، محدود می‌کند.

همچنین این سوال وجود دارد که آیا بازبین‌ها زمان و دسترسی کافی برای انجام کاری که از آنها خواسته می‌شود به دست خواهند آورد. هنگام بررسی حادثه Hagging Face، OpenAI تقریبا یک هفته به METR و Redwood فرصت داد تا بررسی کنند، و هر دو بعدا گفتند که تا حدی به دلیل محدودیت‌های محدوده و زمان، نمی‌توانند نتیجه‌گیری مطمئنی بگیرند.

مشکل مشابهی در آزمایش پیش از انتشار برای GPT-6 Astra رخ داد که OpenAI آن را به‌عنوان هماهنگ‌ترین مدل تاکنون معرفی کرده است. با توجه به مشارکت Apollo Research در کارت مدل، شرکت تنها سه روز فرصت داشت تا Astra را آزمایش کند، که نتیجه‌گیری قطعی را دشوار می‌کرد.

این شرکت در ارزیابی خود نوشت: «آپولو معتقد است که با توجه به نرخ‌های بالاتر آگاهی ارزشی و پنجره ارزیابی محدود، نرخ‌های پایین بدرفتاری در اینجا شواهد قابل‌توجهی در مورد همسویی یا ناهماهنگی مدل ارائه نمی‌کند.»

این سابقه، ارزیاب ها را با یک سوال اساسی مواجه می کند: چرا این زمان باید متفاوت باشد؟

گلیو گفت: «مطمئنا ممکن است که داریو و سم به تازگی نظرشان تغییر کرده باشد، و آن‌ها در این مورد بسیار علنی خواهند گفت. اما مالکیت معنوی این شرکت‌ها برای آن‌ها بسیار ارزشمند است، و من فکر می‌کنم که به‌طور پیش‌فرض، بسیار مراقب چیزهایی هستند که می‌توان به اشتراک گذاشت.»

چندین محقق که با TechCrunch صحبت کردند خواستار یک چارچوب شفاف شدند که همه آنها به طور عمومی با آن موافق هستند. جان استیدلی، رئیس استراتژی در Palisades Research، می‌گوید بخشی از چارچوب باید شامل استانداردهایی باشد که شرکت‌ها می‌توانند به چه نوع حسابرسانی اعتماد کنند، مبادا با خرید ارزیابانی که واجد شرایط نیستند یا علاقه‌ای به ارزیابی مهم‌ترین ریسک ندارند، از این موضوع چشم پوشی کنند.

هنری پاپاداتوس، مدیر اجرایی Safer AI، می‌گوید مشکل، حتی با یک چارچوب عمومی، این است که اقدامات داوطلبانه همیشه به حسن نیت یک شرکت بستگی دارد.

پاپاداتوس به تک‌کرانچ گفت: «در حالت ایده‌آل، مقررات خوبی خواهیم داشت که این امر را الزامی می‌کند... زیرا در این صورت شرکت‌ها نمی‌توانند فردا نظرشان را تغییر دهند، اگر دچار یک بحران روابط عمومی بزرگ شوند.

همه امضا نکرده اند. تاکنون متا، اسپیس‌اکس‌ای و گوگل دیپ‌مایند متعهد به تعبیه ارزیاب‌های شخص ثالث نبوده‌اند، هرچند، دمیس حسابیس، مدیرعامل DeepMind، یک نهاد استاندارد صنعتی جداگانه برای آزمایش مدل‌های مرزی پیشنهاد کرده است. گوگل، اپن‌آی و آنتروپیک نیز هفته‌ها به‌طور خصوصی درباره برنامه‌های ایمنی هوش مصنوعی بحث می‌کنند.

برخی قوانین در حال شکل گیری پیرامون ایده ارزیاب های شخص ثالث هستند. SB 53 کالیفرنیا، که سال گذشته به تصویب رسید، از توسعه دهندگان بزرگ هوش مصنوعی می خواهد که چارچوب های ایمنی را منتشر کنند و حوادث ایمنی مهم را گزارش کنند. قانون جدیدی به نام SB 813 که در این ماه امضا شد، چارچوبی را برای "سازمان های تایید مستقل" به رسمیت شناخته شده توسط دولت با تخصص ارزیابی خطرات هوش مصنوعی ایجاد می کند.

در اروپا، قانون هوش مصنوعی اتحادیه اروپا، توسعه‌دهندگان مرزی را ملزم می‌کند تا ارزیابی‌های مدل و آزمایش‌های متخاصم را انجام داده و مستندسازی کنند و حوادث جدی را گزارش کنند. دفتر هوش مصنوعی اتحادیه اروپا همچنین می تواند ارزیابی های خود را انجام دهد و کارشناسان مستقل را منصوب کند.

در حال حاضر، این قانون نسبت به آنچه آمودی پیشنهاد می‌کند، گستردگی کمتری دارد و آزمایشگاه‌های مرزی را تا حد زیادی مسئول تصمیم‌گیری در مورد میزان نظارت مستقل خود می‌گذارد. پاپاداتوس گفت که خودتنظیمی داوطلبانه بهتر از هیچ است، اما در نهایت، شرکت ها نمی توانند آزادی کنترل قوانین ایمنی خود را مطالبه کنند و در عین حال از مردم بخواهند که اعتماد کنند که از آنها پیروی می کنند.

پاپاداتوس گفت: «شما نمی‌توانید از هر دو طرف آن را داشته باشید، از بیرون مسئولیت‌پذیری صفر داشته باشید، و سپس بگویید، من فقط قوانین منعطف خودم را خواهم داشت.

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

ربکا بلان یک گزارشگر ارشد در TechCrunch است که در آن تجارت، سیاست و روندهای نوظهور در شکل گیری هوش مصنوعی را پوشش می دهد. آثار او همچنین در فوربس، بلومبرگ، آتلانتیک، دیلی بیست و سایر نشریات ظاهر شده است.

می‌توانید با ارسال ایمیل به rebecca.bellan@techcrunch.com یا از طریق پیام رمزگذاری‌شده در rebeccabellan.491 در سیگنال، با ربکا تماس بگیرید یا آن را تأیید کنید.

آخرین روز برای رزرو میز نمایشگاه، 18 سپتامبر است. سرنخ های پر تاثیر، دسترسی سرمایه گذاران، و کانون توجه برند در سالن نمایشگاه Disrupt را از دست ندهید.

جنسن هوانگ از ترامپ تماس گرفت و چیز دیگری را نیز به نمایش گذاشت، کانی لویزوس

9 استارت‌آپ پرطرفدار از آخرین روز نمایشی Y Combinator، به گفته VCs Marina Temkin Dominic-Madori Davis

تسلا می‌گوید سرانجام در تاریخ 1 اکتبر از نسل دوم رودستر آنتونی ها رونمایی خواهد کرد

Revolut نقض اطلاعات مشتری از طریق درخواست های جعلی دولت Jagmeet Singh را تأیید می کند

OpenAI اشتراک های Pro را به دلیل تقاضای Astra سارا پرز متوقف می کند

غول تأیید هویت IDScan نقض اطلاعات با سرقت بیش از 150 میلیون گواهینامه رانندگی Zack Whittaker را تأیید کرد.

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?

Anthropic and OpenAI want to embed independent safety evaluators inside their AI labs. Researchers welcome the unprecedented access, but warn meaningful oversight requires transparency, independence, and eventually regulation.

همه‌ی اخبار فناوری