جمینی 4 آرگون
آدرس مقاله: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/ آدرس نظرات: https://news.ycombinator.com/item?id=49913571 امتیاز: 453 # نظر: 232
Gemini 4 Argon عملکرد مرزی را در گردشهای کاری پیچیده در مهندسی نرمافزار دنیای واقعی، کارهای دانش سازمانی مانند حقوقی و مالی، و دفاع از امنیت سایبری ارائه میکند.
SVP، Google DeepMind و Chief AI Architect، Google
مرورگر شما از عنصر صوتی پشتیبانی نمی کند.
امروز، مدل مرزی جدید خود، Gemini 4 Argon را معرفی میکنیم، که از طریق برنامه Fairwind ما در اختیار مجموعهای از مدافعان سایبری قابل اعتماد است. آرگون که برای حفظ استدلال عمیق در جریان های کاری پیچیده و طولانی مدت ساخته شده است، اساسا نحوه کار و ساخت ما در Google را تغییر می دهد. این عملکرد مرزی را در جریان های کاری پیچیده در مهندسی نرم افزار دنیای واقعی، کار دانش سازمانی مانند حقوقی و مالی و دفاع از امنیت سایبری ارائه می دهد.
آزادسازی ایمن قابلیت های مرزی در این سطح نیازمند رویکرد مرحله ای است. ما فعالانه درگیر فرآیند داوطلبانه دولت ایالات متحده برای دسترسی به مدل پیش از انتشار هستیم در حالی که به تدریج دسترسی را گسترش می دهیم. ما همچنان به جمعآوری بازخورد از آزمایشکنندگان اولیه ادامه میدهیم، همانطور که روی نردههای محافظ پیش از در دسترس قرار دادن آرگون در اسرع وقت برای توسعهدهندگان، شرکتها و مصرفکنندگان ادامه میدهیم.
Gemini 4 Argon در حال حاضر جریانهای کاری داخلی ما را تقویت میکند، با هزاران نفر از کارمندان Google که نقاط قوت مدل را در کارهای کدنویسی تخصصی، انجام تحقیقات عمیقتر و کیفیت نوشتن برجسته میکنند. این به تیمها کمک میکند سریعتر بسازند و مرزهای بهرهوری مهندسی را پشت سر بگذارند و پیشرفتها را تسریع کنند:
برای پشتیبانی از قابلیتهای Gemini 4 Argon در موارد استفاده طولانیتر و پیچیدهتر، ما به طور قابل توجهی محدودیت توکن خروجی مدل را به توکنهای 1 میلیونی پیشرو در صنعت افزایش میدهیم، از 64 هزار توکن قبلی. وقتی مدل فضای اصلی برای تفکر عمیق و تولید صدها هزار نشانه در یک مسیر واحد را داشته باشد، سطح جدیدی از عمق استدلال را برای حل مشکلات سخت در یک حرکت اضافه می کند.
قابلیتهای Gemini 4 Argon در زمینه کدنویسی، استدلال، و چندوجهی بودن و توانایی آن در حفظ وظایف طولانی و چند مرحلهای، آن را قادر میسازد تا در طیف وسیعی از جریانهای کاری سازمانی برتر باشد.
مهندسان گوگل از آرگون برای کارهای روزانه خود، از اشکال زدایی روزمره گرفته تا انتقال پایگاه کد در مقیاس بزرگ و طراحی الگوریتم، استفاده می کنند. این یک وضعیت جدید از هنر در DeepSWE نسخه 1.1 (77.9٪) است که عملکرد یک مدل را در کارهای مهندسی نرم افزار افق طولانی در دنیای واقعی اندازه گیری می کند.
فراتر از کدگذاری، آرگون مدل پیشرو در شاخص Vals است که تأثیر اقتصادی را در امور مالی، کدگذاری، حقوقی و مالیاتی اندازهگیری میکند و هر بخش با سهم آن در تولید ناخالص داخلی ایالات متحده وزن میگیرد. ما عملکرد مشابهی را در سایر ارزیابیهای خاص دامنه مشاهده میکنیم، مانند Vals Finance Agent v2 (تحقیق مالی چند مرحلهای) و معیار نماینده قانونی هاروی (تحقیق و تهیه پیشنویس). در AutomationBench، معیار Zapier که اجرای سرتاسر کارکردهای اصلی کسبوکار را اندازهگیری میکند، آرگون با امتیاز 51.3 در رتبه اول قرار دارد.
زمانی که کار دانشی نیاز به درک بصری دارد، آرگون نیز به طور منحصر به فردی قوی است. این می تواند تجزیه و تحلیل نمودار حرفه ای را انجام دهد، جزئیات را از ویدیوهای طولانی شناسایی کند و بر اساس یک سری اسناد اقدام کند. به عنوان مثال، در LVBench، که درک طولانی ویدیو را اندازه گیری می کند، آرگون با امتیاز 91.7 درصد از بهترین ها است.
برای تجهیز بهتر مدافعان سایبری برای دوران جدید حملات سایبری، Gemini 4 Argon را آموزش دادیم تا در دفاع از امنیت سایبری بسیار توانمند باشد. آرگون میتواند بهطور مستقل آسیبپذیریهای نرمافزاری حیاتی را پیدا، تأیید و وصله کند. برای مدافعان مورد اعتماد و تیمهای داخلی خودمان در Google، ما آرگون را بدون حفاظ سایبری عرضه میکنیم تا بتوانند از قابلیتهای دفاعی امنیت سایبری کامل در سطح مرزی آن استفاده کنند.
Wiz در حال حاضر از طریق ابتکار Scan for Good خود از آرگون برای دفاع از امنیت سایبری استفاده میکند - برنامهای که به محافظت از زیرساختهای عمومی حیاتی به صورت رایگان با یافتن و اصلاح مواجهههای پرخطر اختصاص دارد. در نمایش اولیه تأثیر خود، این مدل یک آسیبپذیری حیاتی را کشف کرد که اطلاعات شخصی حساس را در سراسر نرمافزار مراقبتهای بهداشتی مورد استفاده بیمارستانها در سراسر جهان در معرض دید قرار میدهد و خطر جدی را شناسایی میکند که مدلهای مرزی قبلی از دست داده بودند.
در CWE-bench v1، که توانایی مدل را برای اصلاح آسیبپذیریهای امنیتی ارزیابی میکند، آرگون با امتیاز بالای 68 درصد، بر اساس عملکرد مرزی Flash Cyber 3.8 بر روی CWE-bench v0، رتبه اول را کسب کرد.
Gemini 4 Argon جهش های چشمگیری در کشف آسیب پذیری بیش از 3.8 Flash Cyber نشان می دهد. به عنوان مثال:
قبل از اینکه Gemini 4 Argon را به طور گسترده عرضه کنیم، ما همچنان به تقویت حفاظت از مرزهای حیاتی در چهار حوزه اصلی ادامه می دهیم:
دفاع در برابر سوء استفاده: برای جلوگیری از استفاده عوامل بد از آرگون برای حملات سایبری یا شیمیایی، بیولوژیکی، رادیولوژیکی و هستهای (CBRN)، این مدل برای رد درخواستهای مضر و در عین حال حفظ تحقیقات علمی مشروع و با کاربرد دوگانه، طبق چارچوب ایمنی مرزی ما طراحی شده است. ما در حال تقویت استحکام پادمانهای خود برای این پرتاب هستیم، از جمله بهبود تکنیکهایمان برای نظارت بر فعالسازیهای داخلی مدل برای شناسایی سوءاستفاده. این پادمانها با استفاده از ترکیبی از روشهای حمله دستی و خودکار توسط تیمهای قرمز داخلی و خارجی تحت آزمایش استحکام قرار گرفتند.
دفاع در برابر حملات تزریق سریع: آرگون همچنین انعطافپذیرترین مدل ما در برابر تزریقهای سریع غیرمستقیم است که در آن دستورالعملها یا زمینههای مخرب برای ربودن رفتار یک مدل استفاده میشود. اینها حملات پیچیده ای هستند که نیاز به هوشیاری مداوم و چندین لایه دفاعی دارند. از طریق تیمسازی خودکار قرمز و آموزش خصمانه، Gemini 4 Argon در استحکام تزریق سریع در معیار تزریق سریع غیر مستقیم (IPI) Grey Swan پیشرو است.
نظارت بر عدم تراز: به منظور جلوگیری از خارج شدن آرگون از محدوده و تلاش برای انجام یک کار به روشی که فراتر از اهداف کاربر است، ما در حال استفاده از روشهای کاهش ناهماهنگی هستیم که زنجیره افکار و اقدامات آرگون را نظارت میکند و در صورت لزوم اجرا را متوقف میکند.
ما از یک سیستم مشابه برای نظارت بر دورههای آموزشی خود استفاده کردیم و هشدارها را به یک تیم اختصاصی واکنش به حادثه ارسال کردیم، و اقدامات احتیاطی را در مورد بازگرداندن یافتهها به تمرین انجام دادیم تا خطر شکلدهی به استدلال آرگون برای فرار از نظارت ما را نداشته باشیم. ما قویا بقیه صنعت را تشویق میکنیم که شفافیت استدلال را در این لحظات محوری افزایش قابلیتها حفظ کنند و در عین حال ریسکهای همسویی را بررسی کنند، به طوری که افکار مدل در شناسایی و تشخیص ناهماهنگی مفید باشند.
سیستمهای سختسازی: همانطور که مدلهای مرزی به طور فزایندهای توانمند میشوند، آزمایش ایمن آنها نیازمند محیطهای امنی است که بتواند با خود سیستمها همگام شود. در راستای نقشه راه کنترل عامل خود، ما در حال سختتر کردن محیطهای جعبهشنی خود با جداسازی و مهر و موم کردن آنها قبل از شروع آموزش یا ارزیابیهای پرخطر هستیم. ما متعهد هستیم که این بهترین شیوه های امنیتی عامل را با شرکای خود برای بهبود امنیت در سراسر اکوسیستم به اشتراک بگذاریم.
ما Gemini 4 Argon را با قابلیتهای سطح مرزی در زمینه کدنویسی، کار دانش، دفاع از امنیت سایبری و نوشتن خلاقانه ساختیم تا شریکی برای توسعهدهندگان، متخصصان و شرکتها باشیم در حالی که آنها سختترین مشکلات را حل میکنند. ما از گروه اولیه مدافعان سایبری و آزمایشکنندگان مورد اعتماد که ارزیابیها و بازخوردهای واقعی آنها به ما کمک میکند سیستمهایمان را قبل از عرضه برای توسعهدهندگان، شرکتها و مصرفکنندگان تقویت کنیم، از مشتریان API پولی و مشترکین Google AI Ultra شروع میکنیم.
متن اصلی (انگلیسی)
Gemini 4 Argon
Article URL: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/ Comments URL: https://news.ycombinator.com/item?id=49913571 Points: 453 # Comments: 232