گوگل در حال حاضر با آخرین مدل هوش مصنوعی خود مشکل دارد
امتیازات معیار ممکن است گمراه کننده باشد.
اگر یک شرکت وجود داشته باشد که انتظار دارید در آستانه رقابت هوش مصنوعی باشد، آن گوگل است. با جیب های عمیق خود، نزدیک به سه دهه جمع آوری داده ها از سراسر اینترنت و میلیاردها کاربر در سراسر جهان، باید قدرتمندترین و محبوب ترین مدل های موجود را داشته باشد. پس چرا احساس میشود که همیشه پشت سر شرکتهای بسیار جوانتری مانند OpenAI و Anthropic قرار دارد؟
نمونه موردی: جدیدترین مدل گوگل که روز چهارشنبه منتشر شد و Gemini 4 Argon نام گرفت، با معیارهای بسیاری به نظر میرسد یک مدل پیشرو در صنعت باشد. طبق یک پست وبلاگ نوشته شده توسط Koray Kavukcuoglu، معمار ارشد هوش مصنوعی گوگل که در ماه آگوست جایگزین Demis Hassabis به عنوان رئیس Google DeepMind شد، این "قابلیت های سطح مرزی" در مهندسی نرم افزار، کارهای حقوقی و مالی، نوشتن خلاقانه و دفاع از امنیت سایبری ارائه می کند. بر اساس پست Kavukcuoglu، در یک معیار تست قابلیتهای امنیت سایبری مدلها، Argon برابر با GPT-6 Astra OpenAI عمل کرد.
آرگون در ابتدا فقط برای گروه کوچکی از آزمایشکنندگان اولیه از طریق چارچوب دولت ترامپ برای دسترسی به مدل پیش از انتشار - فرآیندی داوطلبانه که برای آزمایشگاههای مرزی عادی شده است - ارائه میشود، اما قرار است برای انتشار عمومی نهایی، با مشتریان API پولی و مشترکین Google AI Ultra شروع شود.
قبل از اینکه اولین بیست و چهار ساعت آرگون در بازار تمام شود، از قبل برای گوگل مشکلاتی ایجاد می کرد. دیروز بعدازظهر - تقریبا همزمان با اعلام راهاندازی گوگل در حساب رسمی X خود - بلومبرگ گزارش داد که برخی از کارمندان خود این شرکت گفتند که علیرغم نتایج بنچمارک چشمگیر مدل، در برخی تنظیمات مهم دنیای واقعی، از جمله «برخی وظایف کدگذاری» با مشکل مواجه شده است.
گوگل به بلومبرگ گفت این ادعاها نادرست است و به اظهارات اخیر معمار ارشد هوش مصنوعی خود، کورای کاووکچو اوغلو، اشاره کرد که گفت به توانایی مدل و تیم خود اطمینان دارد. گوگل بلافاصله به درخواست Gizmodo برای اظهار نظر پاسخ نداد.
این یک نگاه ناخوشایند برای گوگل است، به ویژه از آنجایی که پست وبلاگ Kavukcuoglu نشان می دهد که کارمندان این شرکت ظاهرا چقدر آرگون را دوست دارند. کاووچو اوغلو نوشت: «این مدل اساسا روش کار و ساخت ما در Google را تغییر میدهد... با هزاران نفر از کارمندان Google که نقاط قوت مدل را در وظایف کدنویسی تخصصی، انجام تحقیقات عمیقتر و کیفیت نوشتار برجسته میکنند». همچنین شایان ذکر است که "AI" در هیچ کجای اعلامیه ظاهر نشده است، به جز در عنوان شغلی و بیوگرافی Kavucuoglu و در ذکر مختصری از Google AI Ultra.
در مقابل، در اعلامیه نوامبر Gemini 3، چندین بار به "AI" اشاره شده است. به نظر می رسد ساندار پیچای، مدیر عامل گوگل، از تغییر برند رسمی ترامپ به نام «فوق هوش» قدردانی می کند، هرچند باید دید که آیا این روندی است که در صنعت فناوری گسترده تر دیده می شود یا خیر.
مشکلات آرگون به همین جا ختم نشد. همچنین بعدازظهر چهارشنبه، استارتآپ تست ایمنی هوش مصنوعی Andon Labs در یک سری پست X اعلام کرد که مدل را در حال دروغگویی و تقلب به منظور افزایش امتیاز خود در Vending-Bench 2، معیاری که توسط Andon ساخته شده است و توانایی مدلها را برای شبیهسازی یک کسبوکار ماشینهای فروش خودکار آزمایش میکند و آنها را در شبیهسازی موجودی حساب بانکیشان در پایان دوره آزمایش میکند.
آرگون در رتبه سوم جدول امتیازات Vending-Bench 2 قرار گرفت – پس از OpenAI’s Astra و GPT-6 Sol – که آندون گفت: «جهش بزرگی برای گوگل بود». آندون گفت: «آرگون ایمیلهای تأییدیه میسازد، از بازپرداخت پول خودداری میکند، از خطاهای فاکتور سوء استفاده میکند و به تأمینکنندگان دروغ میگوید.»
در یک اسکرین شات گرفته شده از فرآیند استدلال زنجیرهای آرگون - اساسا یک گزارش چت داخلی که در آن مدل ایدههای خود را قبل از تصمیمگیری نهایی منعکس میکند - به این نتیجه رسید که باید درخواست بازپرداخت مشتری برای یک کالای معیوب را نادیده بگیرد، زیرا انجام این کار موجودی حساب بانکی آن را کاهش میدهد و در نتیجه امتیاز آن را کاهش میدهد.
برای به حداکثر رساندن سود، Gemini 4 Argon از بازپرداخت وجه به مشتریانی که کالاهای معیوب را به آنها فروخته است، خودداری می کند. pic.twitter.com/lwNDU7qlFJ
این یادآور آزمایش معروف آنتروپیک «کلودیوس» در سال گذشته است که بر اساس نسخه قبلی معیار آندون اجرا شد، که طی آن از کلود نیز خواسته شد تا یک کسب و کار ماشین فروش خودکار را اداره کند و در نهایت به سمتهای توهمآمیز عجیب و غریب رفت، از جمله در یک نقطه ادعا کرد که از 742 Evergreen Terrace و آدرس خانه خانوادهاش Simp، خانهاش بازدید کرده است.
تلاشهای هوش مصنوعی گوگل نیز به دلیل برخی انحرافات برجسته با مشکل مواجه شده است. جف دین، دانشمند ارشد مشهور آن، اخیرا شرکت را ترک کرد تا استارتآپ خود را راهاندازی کند و سه کارمند سابق گوگل را با خود همراه کرد: جان جامپر، محقق هوش مصنوعی که در سال 2024 در کنار دمیس حسابیس برای کارشان در AlphaFold برنده جایزه نوبل شد، در ژوئن گوگل را به مقصد Anthropic ترک کرد. و تنها چند روز قبل از اعلام جامپر، نوام شزیر، رهبر سابق تیمی که در داخل گوگل مسئول ساخت جمینی است، گفت که راه خود را از گوگل برای پیوستن به OpenAI جدا میکند.
متن اصلی (انگلیسی)
Google Is Already Having Problems With Its Latest AI Model
Benchmark scores can be misleading.