پرش به محتوای اصلی

جمینی 4 آرگون

هکرنیوز۱۴۰۵ مهر ۸, چهارشنبه، ساعت ۲۳:۳۴حدود 5 دقیقه مطالعه

آدرس مقاله: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/ آدرس نظرات: https://news.ycombinator.com/item?id=49913571 امتیاز: 453 # نظر: 232

Gemini 4 Argon عملکرد مرزی را در گردش‌های کاری پیچیده در مهندسی نرم‌افزار دنیای واقعی، کارهای دانش سازمانی مانند حقوقی و مالی، و دفاع از امنیت سایبری ارائه می‌کند.

SVP، Google DeepMind و Chief AI Architect، Google

مرورگر شما از عنصر صوتی پشتیبانی نمی کند.

امروز، مدل مرزی جدید خود، Gemini 4 Argon را معرفی می‌کنیم، که از طریق برنامه Fairwind ما در اختیار مجموعه‌ای از مدافعان سایبری قابل اعتماد است. آرگون که برای حفظ استدلال عمیق در جریان های کاری پیچیده و طولانی مدت ساخته شده است، اساسا نحوه کار و ساخت ما در Google را تغییر می دهد. این عملکرد مرزی را در جریان های کاری پیچیده در مهندسی نرم افزار دنیای واقعی، کار دانش سازمانی مانند حقوقی و مالی و دفاع از امنیت سایبری ارائه می دهد.

آزادسازی ایمن قابلیت های مرزی در این سطح نیازمند رویکرد مرحله ای است. ما فعالانه درگیر فرآیند داوطلبانه دولت ایالات متحده برای دسترسی به مدل پیش از انتشار هستیم در حالی که به تدریج دسترسی را گسترش می دهیم. ما همچنان به جمع‌آوری بازخورد از آزمایش‌کنندگان اولیه ادامه می‌دهیم، همانطور که روی نرده‌های محافظ پیش از در دسترس قرار دادن آرگون در اسرع وقت برای توسعه‌دهندگان، شرکت‌ها و مصرف‌کنندگان ادامه می‌دهیم.

Gemini 4 Argon در حال حاضر جریان‌های کاری داخلی ما را تقویت می‌کند، با هزاران نفر از کارمندان Google که نقاط قوت مدل را در کارهای کدنویسی تخصصی، انجام تحقیقات عمیق‌تر و کیفیت نوشتن برجسته می‌کنند. این به تیم‌ها کمک می‌کند سریع‌تر بسازند و مرزهای بهره‌وری مهندسی را پشت سر بگذارند و پیشرفت‌ها را تسریع کنند:

برای پشتیبانی از قابلیت‌های Gemini 4 Argon در موارد استفاده طولانی‌تر و پیچیده‌تر، ما به طور قابل توجهی محدودیت توکن خروجی مدل را به توکن‌های 1 میلیونی پیشرو در صنعت افزایش می‌دهیم، از 64 هزار توکن قبلی. وقتی مدل فضای اصلی برای تفکر عمیق و تولید صدها هزار نشانه در یک مسیر واحد را داشته باشد، سطح جدیدی از عمق استدلال را برای حل مشکلات سخت در یک حرکت اضافه می کند.

قابلیت‌های Gemini 4 Argon در زمینه کدنویسی، استدلال، و چندوجهی بودن و توانایی آن در حفظ وظایف طولانی و چند مرحله‌ای، آن را قادر می‌سازد تا در طیف وسیعی از جریان‌های کاری سازمانی برتر باشد.

مهندسان گوگل از آرگون برای کارهای روزانه خود، از اشکال زدایی روزمره گرفته تا انتقال پایگاه کد در مقیاس بزرگ و طراحی الگوریتم، استفاده می کنند. این یک وضعیت جدید از هنر در DeepSWE نسخه 1.1 (77.9٪) است که عملکرد یک مدل را در کارهای مهندسی نرم افزار افق طولانی در دنیای واقعی اندازه گیری می کند.

فراتر از کدگذاری، آرگون مدل پیشرو در شاخص Vals است که تأثیر اقتصادی را در امور مالی، کدگذاری، حقوقی و مالیاتی اندازه‌گیری می‌کند و هر بخش با سهم آن در تولید ناخالص داخلی ایالات متحده وزن می‌گیرد. ما عملکرد مشابهی را در سایر ارزیابی‌های خاص دامنه مشاهده می‌کنیم، مانند Vals Finance Agent v2 (تحقیق مالی چند مرحله‌ای) و معیار نماینده قانونی هاروی (تحقیق و تهیه پیش‌نویس). در AutomationBench، معیار Zapier که اجرای سرتاسر کارکردهای اصلی کسب‌وکار را اندازه‌گیری می‌کند، آرگون با امتیاز 51.3 در رتبه اول قرار دارد.

زمانی که کار دانشی نیاز به درک بصری دارد، آرگون نیز به طور منحصر به فردی قوی است. این می تواند تجزیه و تحلیل نمودار حرفه ای را انجام دهد، جزئیات را از ویدیوهای طولانی شناسایی کند و بر اساس یک سری اسناد اقدام کند. به عنوان مثال، در LVBench، که درک طولانی ویدیو را اندازه گیری می کند، آرگون با امتیاز 91.7 درصد از بهترین ها است.

برای تجهیز بهتر مدافعان سایبری برای دوران جدید حملات سایبری، Gemini 4 Argon را آموزش دادیم تا در دفاع از امنیت سایبری بسیار توانمند باشد. آرگون می‌تواند به‌طور مستقل آسیب‌پذیری‌های نرم‌افزاری حیاتی را پیدا، تأیید و وصله کند. برای مدافعان مورد اعتماد و تیم‌های داخلی خودمان در Google، ما آرگون را بدون حفاظ سایبری عرضه می‌کنیم تا بتوانند از قابلیت‌های دفاعی امنیت سایبری کامل در سطح مرزی آن استفاده کنند.

Wiz در حال حاضر از طریق ابتکار Scan for Good خود از آرگون برای دفاع از امنیت سایبری استفاده می‌کند - برنامه‌ای که به محافظت از زیرساخت‌های عمومی حیاتی به صورت رایگان با یافتن و اصلاح مواجهه‌های پرخطر اختصاص دارد. در نمایش اولیه تأثیر خود، این مدل یک آسیب‌پذیری حیاتی را کشف کرد که اطلاعات شخصی حساس را در سراسر نرم‌افزار مراقبت‌های بهداشتی مورد استفاده بیمارستان‌ها در سراسر جهان در معرض دید قرار می‌دهد و خطر جدی را شناسایی می‌کند که مدل‌های مرزی قبلی از دست داده بودند.

در CWE-bench v1، که توانایی مدل را برای اصلاح آسیب‌پذیری‌های امنیتی ارزیابی می‌کند، آرگون با امتیاز بالای 68 درصد، بر اساس عملکرد مرزی Flash Cyber ​​3.8 بر روی CWE-bench v0، رتبه اول را کسب کرد.

Gemini 4 Argon جهش های چشمگیری در کشف آسیب پذیری بیش از 3.8 Flash Cyber ​​نشان می دهد. به عنوان مثال:

قبل از اینکه Gemini 4 Argon را به طور گسترده عرضه کنیم، ما همچنان به تقویت حفاظت از مرزهای حیاتی در چهار حوزه اصلی ادامه می دهیم:

دفاع در برابر سوء استفاده: برای جلوگیری از استفاده عوامل بد از آرگون برای حملات سایبری یا شیمیایی، بیولوژیکی، رادیولوژیکی و هسته‌ای (CBRN)، این مدل برای رد درخواست‌های مضر و در عین حال حفظ تحقیقات علمی مشروع و با کاربرد دوگانه، طبق چارچوب ایمنی مرزی ما طراحی شده است. ما در حال تقویت استحکام پادمان‌های خود برای این پرتاب هستیم، از جمله بهبود تکنیک‌هایمان برای نظارت بر فعال‌سازی‌های داخلی مدل برای شناسایی سوءاستفاده. این پادمان‌ها با استفاده از ترکیبی از روش‌های حمله دستی و خودکار توسط تیم‌های قرمز داخلی و خارجی تحت آزمایش استحکام قرار گرفتند.

دفاع در برابر حملات تزریق سریع: آرگون همچنین انعطاف‌پذیرترین مدل ما در برابر تزریق‌های سریع غیرمستقیم است که در آن دستورالعمل‌ها یا زمینه‌های مخرب برای ربودن رفتار یک مدل استفاده می‌شود. اینها حملات پیچیده ای هستند که نیاز به هوشیاری مداوم و چندین لایه دفاعی دارند. از طریق تیم‌سازی خودکار قرمز و آموزش خصمانه، Gemini 4 Argon در استحکام تزریق سریع در معیار تزریق سریع غیر مستقیم (IPI) Grey Swan پیشرو است.

نظارت بر عدم تراز: به منظور جلوگیری از خارج شدن آرگون از محدوده و تلاش برای انجام یک کار به روشی که فراتر از اهداف کاربر است، ما در حال استفاده از روش‌های کاهش ناهماهنگی هستیم که زنجیره افکار و اقدامات آرگون را نظارت می‌کند و در صورت لزوم اجرا را متوقف می‌کند.

ما از یک سیستم مشابه برای نظارت بر دوره‌های آموزشی خود استفاده کردیم و هشدارها را به یک تیم اختصاصی واکنش به حادثه ارسال کردیم، و اقدامات احتیاطی را در مورد بازگرداندن یافته‌ها به تمرین انجام دادیم تا خطر شکل‌دهی به استدلال آرگون برای فرار از نظارت ما را نداشته باشیم. ما قویا بقیه صنعت را تشویق می‌کنیم که شفافیت استدلال را در این لحظات محوری افزایش قابلیت‌ها حفظ کنند و در عین حال ریسک‌های همسویی را بررسی کنند، به طوری که افکار مدل در شناسایی و تشخیص ناهماهنگی مفید باشند.

سیستم‌های سخت‌سازی: همانطور که مدل‌های مرزی به طور فزاینده‌ای توانمند می‌شوند، آزمایش ایمن آن‌ها نیازمند محیط‌های امنی است که بتواند با خود سیستم‌ها همگام شود. در راستای نقشه راه کنترل عامل خود، ما در حال سخت‌تر کردن محیط‌های جعبه‌شنی خود با جداسازی و مهر و موم کردن آن‌ها قبل از شروع آموزش یا ارزیابی‌های پرخطر هستیم. ما متعهد هستیم که این بهترین شیوه های امنیتی عامل را با شرکای خود برای بهبود امنیت در سراسر اکوسیستم به اشتراک بگذاریم.

ما Gemini 4 Argon را با قابلیت‌های سطح مرزی در زمینه کدنویسی، کار دانش، دفاع از امنیت سایبری و نوشتن خلاقانه ساختیم تا شریکی برای توسعه‌دهندگان، متخصصان و شرکت‌ها باشیم در حالی که آنها سخت‌ترین مشکلات را حل می‌کنند. ما از گروه اولیه مدافعان سایبری و آزمایش‌کنندگان مورد اعتماد که ارزیابی‌ها و بازخوردهای واقعی آنها به ما کمک می‌کند سیستم‌هایمان را قبل از عرضه برای توسعه‌دهندگان، شرکت‌ها و مصرف‌کنندگان تقویت کنیم، از مشتریان API پولی و مشترکین Google AI Ultra شروع می‌کنیم.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Gemini 4 Argon

Article URL: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/ Comments URL: https://news.ycombinator.com/item?id=49913571 Points: 453 # Comments: 232

پوشش همین خبر در رسانه‌های دیگر

مقایسه‌ی پوشش ۲ رسانه ←
همه‌ی اخبار فناوری