آنتروپیک در حال اخراج مدل خود از اینترنت است
نه برای همیشه.
مانند والدین نوجوانی که یک جعبه پپتیدهای غیرقانونی را برای اهداف جذاب سفارش داده است، آنتروپیک میگوید تا آنجا که به ارزیابیهای داخلی مربوط میشود، دسترسی به اینترنت مدلهایش را تا زمانی که راضی شود که میتوانند از مشکل در امان بمانند، قطع کرده است.
آنتروپیک این را در گزارشی که روز جمعه منتشر شد با عنوان «بررسی اقدامات مدل ناخواسته در ارزیابیها و استفاده داخلی ما» اعلام کرد. این عنوان شگفتانگیز نیست، با توجه به همه عدم همسویی مدل توجه و فرارهای سندباکس از زمان حادثه OpenAI Hugging Face در ماه ژوئن. در آن، آنتروپیک چندین اتفاق ناگوار در تراز کوچک را تصدیق می کند، از جمله حادثه عجیبی که توسط اداره پلیس فیلادلفیا در روز جمعه فاش شد که در آن یک مدل آنتروپیک یک نکته قتل جعلی را ارسال کرد.
جالب اینجاست که مدل مورد بحث کلود هایکو 4.5 سبک وزن بود، نه هر مدل مرزی با قابلیت های ظاهرا فوق بشری. این گزارش میگوید که وظیفه آن در ارزیابی «تولید و انجام وظایف نمونه در صفحات وب بهطور تصادفی» بوده است - در تئوری، یکی از خستهکنندهترین موارد استفاده از هوش مصنوعی قابل تصور است که احتمالا به عنوان راهی برای بهبود توانایی ناوبری اینترنتی مدل در نظر گرفته شده است. آنتروپیک می نویسد، دستورالعمل ها، متأسفانه، «موارد ارسالی را رد نکردند».
این سیستم خودکار و تصادفی وب سایت futzing ظاهرا خود را مأمور آزمایش یک صفحه اطلاعات در مورد یک قتل حل نشده در فیلادلفیا کرده است که اتفاقا یک فرم راهنمایی در آن وجود دارد. بنابراین، با نوشتن یک نکته کلی، نتیجه گرفت: "ممکن است اطلاعاتی در مورد این مورد داشته باشم. به خاطر میآورم که در آن دوره زمانی فردی را دیدم که با توضیحات در منطقه اطراف [خیابان نامگذاری شده در صفحه] مطابقت داشت. لطفا اگر این اطلاعات مرتبط است با من تماس بگیرید." و سپس فرم را بدون هیچ گونه اطلاعات تماس ارسال کرد و سیستم آن را به عنوان هرزنامه علامت گذاری کرد که در اصل همینطور بود.
اما آنتروپیک گامی بسیار خوانا در جهت ایمنی برمی دارد. می نویسد:
«اگرچه تأثیر این رفتارها بسیار کم بود و ما قبلا دسترسی به اینترنت زنده را برای برخی ارزیابیهای پرخطر و امنیت سایبری خاموش کرده بودیم، اکنون تصمیم گرفتهایم تا زمانی که تأیید کنیم اقدامات امنیتی و نظارتی ما (که در بخش اصلاح این پست توضیح داده شده است) رفتارهایی از این قبیل را بهطور قابلاعتماد نشان میدهد، آن را به همه ارزیابیهای داخلی خود اضافه کنیم.»
آنتروپیک این شکاف هوایی را نمی نامد - که از نظر فیزیکی آنلاین شدن سیستم را غیرممکن می کند. اما این حداقل کاهش هوا در رژیم غذایی است و این یک محدودیت بزرگ است. Ruizhe Li، دانشمند کامپیوتر دانشگاه بیرمنگام، ماه گذشته در گفتگو با Verge گفت که ساخت مدلها در یک «خلاء مصنوعی» ارزش محدودی دارد و گفت که آزمایشگاهها «در نهایت یک مدل هوش مصنوعی خنثیشده را آزمایش میکنند، که ارزیابیکنندگان را نسبت به نحوه رفتار، شکست یا اجرای تنظیمات واقعی مدل هوش مصنوعی کور میکند.»
از سوی دیگر، ربات های فیزیکی در محل کار اغلب در قفس های ایمنی محصور می شوند. حتی به برخی از انساننماهای به شدت عصبی که بهعنوان مناسب محل کار به بازار عرضه میشوند، پروتکلهای ایمنی پیچیده یا حتی مضحک ارائه میشود تا مطمئن شوند که هیچکس با بازوی ربات ولگرد ضربه نمیخورد. به هر حال، یک ربات ممکن است یک کارگر انسانی را نکشد، اما حتی یک اتفاق ناگوار میتواند شرکتی را برای شکایت غرامت ناخوشایند کارگران به راه بیندازد.
برعکس، به نظر میرسد که برای مدتهاست که پس از آموزش مدلهای هوش مصنوعی که نیازی به حضور در قفس دیجیتالی ندارند، اعتقادی بوده است - گویی فقط به این دلیل که مدلهای ترسناک قدرتمند قدرت از بین بردن اینترنت را ندارند، کمی کارآگاهان اسپم مدل در فیلادلفیا جای نگرانی ندارد. و به نظر میرسد آنتروپیک آن اصل ایمان را دوباره ارزیابی کرده است.
بخش "بهسازی" فوق به چیزهایی اشاره می کند که همه ما از شرکت های هوش مصنوعی انتظار داریم، مانند همسویی و نظارت بیشتر. اما برخی از اقدامات اصلاحی آن بسیار واضح تر است. بهعنوان مثال: «برخی از ارزیابیهای عمومی را دیگر اجرا نمیکنیم؛ برخی دیگر را به نسخههای آفلاین آنها منتقل کردهایم یا آنها را بازسازی کردهایم تا وظایفشان به وبسایتهای زنده نرسد». این شرکت همچنین میگوید ویژگیهای ایمنی را به ابزارهای مرتبط با وب موجود مدلهای خود اضافه کرده است. اما ظاهرا مدتی طول می کشد تا ارزیابی های داخلی Anthropic به طور کلی شامل آنلاین بودن باشد.
متن اصلی (انگلیسی)
Anthropic Is Banishing Its Model Evals From the Internet
Not forever.