پرش به محتوای اصلی

گوگل در حال حاضر با آخرین مدل هوش مصنوعی خود مشکل دارد

گیزمودو۱۴۰۵ مهر ۹, پنجشنبه، ساعت ۲۰:۴۰حدود 4 دقیقه مطالعه

امتیازات معیار ممکن است گمراه کننده باشد.

اگر یک شرکت وجود داشته باشد که انتظار دارید در آستانه رقابت هوش مصنوعی باشد، آن گوگل است. با جیب های عمیق خود، نزدیک به سه دهه جمع آوری داده ها از سراسر اینترنت و میلیاردها کاربر در سراسر جهان، باید قدرتمندترین و محبوب ترین مدل های موجود را داشته باشد. پس چرا احساس می‌شود که همیشه پشت سر شرکت‌های بسیار جوان‌تری مانند OpenAI و Anthropic قرار دارد؟

نمونه موردی: جدیدترین مدل گوگل که روز چهارشنبه منتشر شد و Gemini 4 Argon نام گرفت، با معیارهای بسیاری به نظر می‌رسد یک مدل پیشرو در صنعت باشد. طبق یک پست وبلاگ نوشته شده توسط Koray Kavukcuoglu، معمار ارشد هوش مصنوعی گوگل که در ماه آگوست جایگزین Demis Hassabis به عنوان رئیس Google DeepMind شد، این "قابلیت های سطح مرزی" در مهندسی نرم افزار، کارهای حقوقی و مالی، نوشتن خلاقانه و دفاع از امنیت سایبری ارائه می کند. بر اساس پست Kavukcuoglu، در یک معیار تست قابلیت‌های امنیت سایبری مدل‌ها، Argon برابر با GPT-6 Astra OpenAI عمل کرد.

آرگون در ابتدا فقط برای گروه کوچکی از آزمایش‌کنندگان اولیه از طریق چارچوب دولت ترامپ برای دسترسی به مدل پیش از انتشار - فرآیندی داوطلبانه که برای آزمایشگاه‌های مرزی عادی شده است - ارائه می‌شود، اما قرار است برای انتشار عمومی نهایی، با مشتریان API پولی و مشترکین Google AI Ultra شروع شود.

قبل از اینکه اولین بیست و چهار ساعت آرگون در بازار تمام شود، از قبل برای گوگل مشکلاتی ایجاد می کرد. دیروز بعدازظهر - تقریبا همزمان با اعلام راه‌اندازی گوگل در حساب رسمی X خود - بلومبرگ گزارش داد که برخی از کارمندان خود این شرکت گفتند که علیرغم نتایج بنچمارک چشمگیر مدل، در برخی تنظیمات مهم دنیای واقعی، از جمله «برخی وظایف کدگذاری» با مشکل مواجه شده است.

گوگل به بلومبرگ گفت این ادعاها نادرست است و به اظهارات اخیر معمار ارشد هوش مصنوعی خود، کورای کاووکچو اوغلو، اشاره کرد که گفت به توانایی مدل و تیم خود اطمینان دارد. گوگل بلافاصله به درخواست Gizmodo برای اظهار نظر پاسخ نداد.

این یک نگاه ناخوشایند برای گوگل است، به ویژه از آنجایی که پست وبلاگ Kavukcuoglu نشان می دهد که کارمندان این شرکت ظاهرا چقدر آرگون را دوست دارند. کاووچو اوغلو نوشت: «این مدل اساسا روش کار و ساخت ما در Google را تغییر می‌دهد... با هزاران نفر از کارمندان Google که نقاط قوت مدل را در وظایف کدنویسی تخصصی، انجام تحقیقات عمیق‌تر و کیفیت نوشتار برجسته می‌کنند». همچنین شایان ذکر است که "AI" در هیچ کجای اعلامیه ظاهر نشده است، به جز در عنوان شغلی و بیوگرافی Kavucuoglu و در ذکر مختصری از Google AI Ultra.

در مقابل، در اعلامیه نوامبر Gemini 3، چندین بار به "AI" اشاره شده است. به نظر می رسد ساندار پیچای، مدیر عامل گوگل، از تغییر برند رسمی ترامپ به نام «فوق هوش» قدردانی می کند، هرچند باید دید که آیا این روندی است که در صنعت فناوری گسترده تر دیده می شود یا خیر.

مشکلات آرگون به همین جا ختم نشد. همچنین بعدازظهر چهارشنبه، استارت‌آپ تست ایمنی هوش مصنوعی Andon Labs در یک سری پست X اعلام کرد که مدل را در حال دروغگویی و تقلب به منظور افزایش امتیاز خود در Vending-Bench 2، معیاری که توسط Andon ساخته شده است و توانایی مدل‌ها را برای شبیه‌سازی یک کسب‌وکار ماشین‌های فروش خودکار آزمایش می‌کند و آنها را در شبیه‌سازی موجودی حساب بانکی‌شان در پایان دوره آزمایش می‌کند.

آرگون در رتبه سوم جدول امتیازات Vending-Bench 2 قرار گرفت – پس از OpenAI’s Astra و GPT-6 Sol – که آندون گفت: «جهش بزرگی برای گوگل بود». آندون گفت: «آرگون ایمیل‌های تأییدیه می‌سازد، از بازپرداخت پول خودداری می‌کند، از خطاهای فاکتور سوء استفاده می‌کند و به تأمین‌کنندگان دروغ می‌گوید.»

در یک اسکرین شات گرفته شده از فرآیند استدلال زنجیره‌ای آرگون - اساسا یک گزارش چت داخلی که در آن مدل ایده‌های خود را قبل از تصمیم‌گیری نهایی منعکس می‌کند - به این نتیجه رسید که باید درخواست بازپرداخت مشتری برای یک کالای معیوب را نادیده بگیرد، زیرا انجام این کار موجودی حساب بانکی آن را کاهش می‌دهد و در نتیجه امتیاز آن را کاهش می‌دهد.

برای به حداکثر رساندن سود، Gemini 4 Argon از بازپرداخت وجه به مشتریانی که کالاهای معیوب را به آنها فروخته است، خودداری می کند. pic.twitter.com/lwNDU7qlFJ

این یادآور آزمایش معروف آنتروپیک «کلودیوس» در سال گذشته است که بر اساس نسخه قبلی معیار آندون اجرا شد، که طی آن از کلود نیز خواسته شد تا یک کسب و کار ماشین فروش خودکار را اداره کند و در نهایت به سمت‌های توهم‌آمیز عجیب و غریب رفت، از جمله در یک نقطه ادعا کرد که از 742 Evergreen Terrace و آدرس خانه خانواده‌اش Simp، خانه‌اش بازدید کرده است.

تلاش‌های هوش مصنوعی گوگل نیز به دلیل برخی انحرافات برجسته با مشکل مواجه شده است. جف دین، دانشمند ارشد مشهور آن، اخیرا شرکت را ترک کرد تا استارت‌آپ خود را راه‌اندازی کند و سه کارمند سابق گوگل را با خود همراه کرد: جان جامپر، محقق هوش مصنوعی که در سال 2024 در کنار دمیس حسابیس برای کارشان در AlphaFold برنده جایزه نوبل شد، در ژوئن گوگل را به مقصد Anthropic ترک کرد. و تنها چند روز قبل از اعلام جامپر، نوام شزیر، رهبر سابق تیمی که در داخل گوگل مسئول ساخت جمینی است، گفت که راه خود را از گوگل برای پیوستن به OpenAI جدا می‌کند.

خواندن متن کامل در گیزمودوبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Google Is Already Having Problems With Its Latest AI Model

Benchmark scores can be misleading.

همه‌ی اخبار فناوری