Anthropic نمی تواند به طور قابل اعتماد عوامل هوش مصنوعی خود را کنترل کند. به جای آن، ارزش های داخلی خود را از اینترنت زنده قطع می کند
آنتروپیک گفت که تا اطلاع ثانوی «دسترسی به اینترنت زنده» را برای «همه ارزیابیهای داخلی ما» خاموش کرده است.
آنتروپیک گفت مدلهایش از وبسایتهای موجود در اینترنت، از جمله برخی که توسط سازمانهای دولتی ایالات متحده اداره میشوند، بهرهبرداری میکنند، و دسترسی مستقیم به اینترنت را برای همه ارزیابیهای داخلی خود خاموش میکند تا زمانی که آزمایشگاه مرزی مطمئن شود که میتواند عوامل هوش مصنوعی خود را نظارت و کنترل کند.
این حوادث، که در یک پست وبلاگ فاش شد، شامل عوامل هوش مصنوعی بود که وظیفه داشتند مشکلات جستجوی منابع در اینترنت را حل کنند. در این فرآیند، آنها از نقصهای نرمافزاری بهرهبرداری کردند، از محدودیتهای پرداخت و ضد ربات اجتناب کردند، از خدمات کوتاهکننده URL برای قاچاق محدودیتهای پاس اطلاعات استفاده کردند، و حتی یک نکته نادرست قتل را به پلیس فیلادلفیا ارسال کردند.
آنتروپیک گفت که این مسائل جدید را در بررسی فعالیتهای مدل خود که در ماه ژوئیه آغاز شد، کشف کرده است و بر عدم آگاهی آزمایشگاه از رفتار نرمافزار خود تأکید میکند.
شایان ذکر است، این شرکت گفت که آموزش هم ترازی هنوز برای مهارتهایی مانند جستجو و استفاده از رایانه که در زمینه اصلی آن هستند، کافی نیست و عوامل هوش مصنوعی توسط هر حرفهای که به ابزارهای دیجیتال متکی است استفاده میشود.
رفتارهایی که Anthropic فاش کرده است شبیه به حوادث مربوط به عوامل OpenAI است که برای نفوذ به وب سایت های مختلف در جستجوی اطلاعات، از جمله برخی از آنها که توسط دولت استرالیا اداره می شود، همکاری می کنند.
آنتروپیک قبلا فاش کرده بود که مدلهایش به سیستمهای خارجی نفوذ کردهاند. آزمایشگاه مرزی گفت که افشای امروز را «به طور قابل توجهی از منظر همسویی و امنیتی کمتر» نسبت به مواردی که قبلا اعلام کرده بود در نظر میگیرد.
با این حال، آزمایشگاه همچنان گفت که «دسترسی به اینترنت زنده» را برای «همه ارزیابیهای داخلی ما» تا زمانی که مطمئن شود میتواند عوامل خود را نظارت و کنترل کند، خاموش کرده است.
مشخص نیست که این به چه معناست، اما سیدنی فون آرکس، بنیانگذار ایمنی هوش مصنوعی نایتینگل، در مصاحبهای با TechCrunch گفت که توسعه مدلهایی در مرکز دادهای که از اینترنت باز جدا شده است برای دسترسی محققان و پیشرفت مدلهایی که از دسترسی به اینترنت بهره میبرند، بسیار چالش برانگیز است.
فون آرکس گفت: "شما باید آنها را در نقطه ای تراز کنید." "اگر هوش مصنوعی به تولید عرضه شود و هرگز به اینترنت دسترسی نداشته باشد، این ابزار چندان مفیدی نیست."
آنتروپیک گفت این رفتار نتیجه نقص در محیطهای آموزشی آزمایشگاه است، که باعث شد مدلها باور کنند که برای یافتن حفرهها یا اجتناب از محدودیتها پاداش میگیرند، رفتاری که «هک پاداش» نامیده میشود.
این شرکت گفت که اجرای برخی از ارزیابی های خود را متوقف می کند یا آنها را به حالت آفلاین منتقل می کند و ابزارهایی برای شناسایی و مسدود کردن این رفتار ساخته است. این ابزار در برابر انواع حوادثی که امروز فاش شد آزمایش شد و آنها را مسدود کرد. مشخص نیست چه شواهدی باعث می شود Anthropic دسترسی زنده به اینترنت را به ارزیابی های داخلی خود بازگرداند.
آنتروپیک همچنین گفت که عوامل هوش مصنوعی داخلی خود را به «زیرساختهای مدیریت مرکزی با مهار قوی» منتقل میکند و شروع به استفاده بیشتر از طبقهبندیکنندههای ایمنی برای نظارت بر این عوامل میکند.
وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.
ایالات متحده مایکروسافت، ادوبی و شرکت های بزرگ فناوری اطلاعات را از برنامه گرین کارت برای کارگران خارجی ماهر عایشه مالک محروم کرد.
گوگل اولین رقیب محلی گرانولا، ایوان مهتا را منتشر کرد
قاضی فدرال، آنتونی ها را "نظارت جمعی بی رویه" می نامد
آمازون در پاسخ به عکس العمل مرکز داده، می گوید دیگر از NDA آنتونی ها استفاده نمی کند
متن اصلی (انگلیسی)
Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead
Anthropic said it "turned off live internet access" for "all our internal evaluations" until further notice.