پرش به محتوای اصلی

Anthropic نمی تواند به طور قابل اعتماد عوامل هوش مصنوعی خود را کنترل کند. به جای آن، ارزش های داخلی خود را از اینترنت زنده قطع می کند

تک‌کرانچ۱۴۰۵ مهر ۱۸, شنبه، ساعت ۰۳:۴۸حدود 3 دقیقه مطالعه

آنتروپیک گفت که تا اطلاع ثانوی «دسترسی به اینترنت زنده» را برای «همه ارزیابی‌های داخلی ما» خاموش کرده است.

آنتروپیک گفت مدل‌هایش از وب‌سایت‌های موجود در اینترنت، از جمله برخی که توسط سازمان‌های دولتی ایالات متحده اداره می‌شوند، بهره‌برداری می‌کنند، و دسترسی مستقیم به اینترنت را برای همه ارزیابی‌های داخلی خود خاموش می‌کند تا زمانی که آزمایشگاه مرزی مطمئن شود که می‌تواند عوامل هوش مصنوعی خود را نظارت و کنترل کند.

این حوادث، که در یک پست وبلاگ فاش شد، شامل عوامل هوش مصنوعی بود که وظیفه داشتند مشکلات جستجوی منابع در اینترنت را حل کنند. در این فرآیند، آنها از نقص‌های نرم‌افزاری بهره‌برداری کردند، از محدودیت‌های پرداخت و ضد ربات اجتناب کردند، از خدمات کوتاه‌کننده URL برای قاچاق محدودیت‌های پاس اطلاعات استفاده کردند، و حتی یک نکته نادرست قتل را به پلیس فیلادلفیا ارسال کردند.

آنتروپیک گفت که این مسائل جدید را در بررسی فعالیت‌های مدل خود که در ماه ژوئیه آغاز شد، کشف کرده است و بر عدم آگاهی آزمایشگاه از رفتار نرم‌افزار خود تأکید می‌کند.

شایان ذکر است، این شرکت گفت که آموزش هم ترازی هنوز برای مهارت‌هایی مانند جستجو و استفاده از رایانه که در زمینه اصلی آن هستند، کافی نیست و عوامل هوش مصنوعی توسط هر حرفه‌ای که به ابزارهای دیجیتال متکی است استفاده می‌شود.

رفتارهایی که Anthropic فاش کرده است شبیه به حوادث مربوط به عوامل OpenAI است که برای نفوذ به وب سایت های مختلف در جستجوی اطلاعات، از جمله برخی از آنها که توسط دولت استرالیا اداره می شود، همکاری می کنند.

آنتروپیک قبلا فاش کرده بود که مدل‌هایش به سیستم‌های خارجی نفوذ کرده‌اند. آزمایشگاه مرزی گفت که افشای امروز را «به طور قابل توجهی از منظر همسویی و امنیتی کم‌تر» نسبت به مواردی که قبلا اعلام کرده بود در نظر می‌گیرد.

با این حال، آزمایشگاه همچنان گفت که «دسترسی به اینترنت زنده» را برای «همه ارزیابی‌های داخلی ما» تا زمانی که مطمئن شود می‌تواند عوامل خود را نظارت و کنترل کند، خاموش کرده است.

مشخص نیست که این به چه معناست، اما سیدنی فون آرکس، بنیانگذار ایمنی هوش مصنوعی نایتینگل، در مصاحبه‌ای با TechCrunch گفت که توسعه مدل‌هایی در مرکز داده‌ای که از اینترنت باز جدا شده است برای دسترسی محققان و پیشرفت مدل‌هایی که از دسترسی به اینترنت بهره می‌برند، بسیار چالش برانگیز است.

فون آرکس گفت: "شما باید آنها را در نقطه ای تراز کنید." "اگر هوش مصنوعی به تولید عرضه شود و هرگز به اینترنت دسترسی نداشته باشد، این ابزار چندان مفیدی نیست."

آنتروپیک گفت این رفتار نتیجه نقص در محیط‌های آموزشی آزمایشگاه است، که باعث شد مدل‌ها باور کنند که برای یافتن حفره‌ها یا اجتناب از محدودیت‌ها پاداش می‌گیرند، رفتاری که «هک پاداش» نامیده می‌شود.

این شرکت گفت که اجرای برخی از ارزیابی های خود را متوقف می کند یا آنها را به حالت آفلاین منتقل می کند و ابزارهایی برای شناسایی و مسدود کردن این رفتار ساخته است. این ابزار در برابر انواع حوادثی که امروز فاش شد آزمایش شد و آنها را مسدود کرد. مشخص نیست چه شواهدی باعث می شود Anthropic دسترسی زنده به اینترنت را به ارزیابی های داخلی خود بازگرداند.

آنتروپیک همچنین گفت که عوامل هوش مصنوعی داخلی خود را به «زیرساخت‌های مدیریت مرکزی با مهار قوی» منتقل می‌کند و شروع به استفاده بیشتر از طبقه‌بندی‌کننده‌های ایمنی برای نظارت بر این عوامل می‌کند.

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

ایالات متحده مایکروسافت، ادوبی و شرکت های بزرگ فناوری اطلاعات را از برنامه گرین کارت برای کارگران خارجی ماهر عایشه مالک محروم کرد.

گوگل اولین رقیب محلی گرانولا، ایوان مهتا را منتشر کرد

قاضی فدرال، آنتونی ها را "نظارت جمعی بی رویه" می نامد

آمازون در پاسخ به عکس العمل مرکز داده، می گوید دیگر از NDA آنتونی ها استفاده نمی کند

خواندن متن کامل در تک‌کرانچبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead

Anthropic said it "turned off live internet access" for "all our internal evaluations" until further notice.

همه‌ی اخبار فناوری