پرش به محتوای اصلی

آنتروپیک در حال اخراج مدل خود از اینترنت است

گیزمودو۱۴۰۵ مهر ۱۹, یکشنبه، ساعت ۰۲:۲۲حدود 3 دقیقه مطالعه

نه برای همیشه.

مانند والدین نوجوانی که یک جعبه پپتیدهای غیرقانونی را برای اهداف جذاب سفارش داده است، آنتروپیک می‌گوید تا آنجا که به ارزیابی‌های داخلی مربوط می‌شود، دسترسی به اینترنت مدل‌هایش را تا زمانی که راضی شود که می‌توانند از مشکل در امان بمانند، قطع کرده است.

آنتروپیک این را در گزارشی که روز جمعه منتشر شد با عنوان «بررسی اقدامات مدل ناخواسته در ارزیابی‌ها و استفاده داخلی ما» اعلام کرد. این عنوان شگفت‌انگیز نیست، با توجه به همه عدم همسویی مدل توجه و فرارهای سندباکس از زمان حادثه OpenAI Hugging Face در ماه ژوئن. در آن، آنتروپیک چندین اتفاق ناگوار در تراز کوچک را تصدیق می کند، از جمله حادثه عجیبی که توسط اداره پلیس فیلادلفیا در روز جمعه فاش شد که در آن یک مدل آنتروپیک یک نکته قتل جعلی را ارسال کرد.

جالب اینجاست که مدل مورد بحث کلود هایکو 4.5 سبک وزن بود، نه هر مدل مرزی با قابلیت های ظاهرا فوق بشری. این گزارش می‌گوید که وظیفه آن در ارزیابی «تولید و انجام وظایف نمونه در صفحات وب به‌طور تصادفی» بوده است - در تئوری، یکی از خسته‌کننده‌ترین موارد استفاده از هوش مصنوعی قابل تصور است که احتمالا به عنوان راهی برای بهبود توانایی ناوبری اینترنتی مدل در نظر گرفته شده است. آنتروپیک می نویسد، دستورالعمل ها، متأسفانه، «موارد ارسالی را رد نکردند».

این سیستم خودکار و تصادفی وب سایت futzing ظاهرا خود را مأمور آزمایش یک صفحه اطلاعات در مورد یک قتل حل نشده در فیلادلفیا کرده است که اتفاقا یک فرم راهنمایی در آن وجود دارد. بنابراین، با نوشتن یک نکته کلی، نتیجه گرفت: "ممکن است اطلاعاتی در مورد این مورد داشته باشم. به خاطر می‌آورم که در آن دوره زمانی فردی را دیدم که با توضیحات در منطقه اطراف [خیابان نام‌گذاری شده در صفحه] مطابقت داشت. لطفا اگر این اطلاعات مرتبط است با من تماس بگیرید." و سپس فرم را بدون هیچ گونه اطلاعات تماس ارسال کرد و سیستم آن را به عنوان هرزنامه علامت گذاری کرد که در اصل همینطور بود.

اما آنتروپیک گامی بسیار خوانا در جهت ایمنی برمی دارد. می نویسد:

«اگرچه تأثیر این رفتارها بسیار کم بود و ما قبلا دسترسی به اینترنت زنده را برای برخی ارزیابی‌های پرخطر و امنیت سایبری خاموش کرده بودیم، اکنون تصمیم گرفته‌ایم تا زمانی که تأیید کنیم اقدامات امنیتی و نظارتی ما (که در بخش اصلاح این پست توضیح داده شده است) رفتارهایی از این قبیل را به‌طور قابل‌اعتماد نشان می‌دهد، آن را به همه ارزیابی‌های داخلی خود اضافه کنیم.»

آنتروپیک این شکاف هوایی را نمی نامد - که از نظر فیزیکی آنلاین شدن سیستم را غیرممکن می کند. اما این حداقل کاهش هوا در رژیم غذایی است و این یک محدودیت بزرگ است. Ruizhe Li، دانشمند کامپیوتر دانشگاه بیرمنگام، ماه گذشته در گفتگو با Verge گفت که ساخت مدل‌ها در یک «خلاء مصنوعی» ارزش محدودی دارد و گفت که آزمایشگاه‌ها «در نهایت یک مدل هوش مصنوعی خنثی‌شده را آزمایش می‌کنند، که ارزیابی‌کنندگان را نسبت به نحوه رفتار، شکست یا اجرای تنظیمات واقعی مدل هوش مصنوعی کور می‌کند.»

از سوی دیگر، ربات های فیزیکی در محل کار اغلب در قفس های ایمنی محصور می شوند. حتی به برخی از انسان‌نماهای به شدت عصبی که به‌عنوان مناسب محل کار به بازار عرضه می‌شوند، پروتکل‌های ایمنی پیچیده یا حتی مضحک ارائه می‌شود تا مطمئن شوند که هیچ‌کس با بازوی ربات ولگرد ضربه نمی‌خورد. به هر حال، یک ربات ممکن است یک کارگر انسانی را نکشد، اما حتی یک اتفاق ناگوار می‌تواند شرکتی را برای شکایت غرامت ناخوشایند کارگران به راه بیندازد.

برعکس، به نظر می‌رسد که برای مدت‌هاست که پس از آموزش مدل‌های هوش مصنوعی که نیازی به حضور در قفس دیجیتالی ندارند، اعتقادی بوده است - گویی فقط به این دلیل که مدل‌های ترسناک قدرتمند قدرت از بین بردن اینترنت را ندارند، کمی کارآگاهان اسپم مدل در فیلادلفیا جای نگرانی ندارد. و به نظر می‌رسد آنتروپیک آن اصل ایمان را دوباره ارزیابی کرده است.

بخش "بهسازی" فوق به چیزهایی اشاره می کند که همه ما از شرکت های هوش مصنوعی انتظار داریم، مانند همسویی و نظارت بیشتر. اما برخی از اقدامات اصلاحی آن بسیار واضح تر است. به‌عنوان مثال: «برخی از ارزیابی‌های عمومی را دیگر اجرا نمی‌کنیم؛ برخی دیگر را به نسخه‌های آفلاین آن‌ها منتقل کرده‌ایم یا آن‌ها را بازسازی کرده‌ایم تا وظایفشان به وب‌سایت‌های زنده نرسد». این شرکت همچنین می‌گوید ویژگی‌های ایمنی را به ابزارهای مرتبط با وب موجود مدل‌های خود اضافه کرده است. اما ظاهرا مدتی طول می کشد تا ارزیابی های داخلی Anthropic به طور کلی شامل آنلاین بودن باشد.

خواندن متن کامل در گیزمودوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Anthropic Is Banishing Its Model Evals From the Internet

Not forever.

همه‌ی اخبار فناوری