بستن کار 5.5
آدرس مقاله: https://www.anthropic.com/claude-opus-5-5 آدرس نظرات: https://news.ycombinator.com/item?id=49803892 امتیاز: 316 # نظرات: 381
ما در حال معرفی Claude Opus 5.5، اولین مدل از خانواده جدید Claude 5.5 هستیم. در بیشتر کارها در سطح Claude Fable 5.1 عمل می کند و هزینه اجرای آن 40 درصد کمتر از Opus 5 است.
Claude Opus 5.5 اولین نسخه ما از زمانی است که ما خواستار سرعت بخشیدن به مرزها شدیم. قبل از انتشار توسط ارزیابان خارجی، از جمله Frontier Design و METR آزمایش شد. Opus 5.5 در ممیزی رفتاری خودکار ما، جامع ترین تست هم ترازی که اجرا می کنیم، قوی ترین مدلی است که تا به امروز آزمایش کرده ایم. همچنین با محافظ هایی همراه است که ما برای تواناترین مدل های خود ایجاد کرده ایم.
در اینجا برخی از پیشرفت هایی که می توانید از Opus 5.5 انتظار داشته باشید آورده شده است:
عملکرد. Opus 5.5 یک گام بزرگ در مقایسه با Opus 5 است. این مدل پیشرو جدید است و آزمایش کنندگان اولیه شاهد جهش های بزرگ در عملکرد در پیچیده ترین کار خود بودند. یک آزمایشکننده انتقال کد 680000 خطی را در کمتر از یک روز تکمیل کرد - کاری که هفتهها طول میکشید یک تیم مهندسی. در یافتن و رفع ناکارآمدیها در نرمافزار خوب است: وقتی از آن خواستیم زمان بارگذاری را در هر صفحه یک برنامه وب کاهش دهد، Opus 5.5 39 از 40 بار موفق شد، در حالی که Opus 5 پیشرفتهای کوچکتری انجام داد که رفتار برنامه را نیز تغییر داد.
یک آزمایشکننده متفاوت چندین مدل کلود را مجبور به ساخت یک بازی از یک درخواست کرد. Opus 5.5 بالاتر از هر مدل دیگری از نظر قدرت گرافیکی و جلای خود امتیاز کسب کرد.
ایمنی. Opus 5.5 در ممیزی رفتاری خودکار ما، مجموعه هم ترازی ما که کلود را در هزاران سناریو شبیه سازی شده آزمایش می کند، بهترین امتیازات را از هر مدلی تا به امروز کسب می کند. نسبت به مدلهای اخیر احتمال انجام اقدامات سختگیرانه یا عمل خارج از محدودههای داده شده بسیار کمتر است و نسبت به Opus 5 در برابر تزریق سریع مقاومتر است. ما همچنین آزمایش تراز خود را گسترش دادهایم تا وظایف طولانیتر، کارهای غیرممکن و سناریوهای الگوبرداری از حوادث واقعی را پوشش دهیم، اگرچه هنوز محدودیتهایی دارد. جزئیات کامل ارزیابی ما در کارت سیستم Opus 5.5 موجود است.
از آنجایی که Opus 5.5 از نظر زیست شناسی و امنیت سایبری با Claude Mythos 5.1 قابل مقایسه است، ما آن را با محافظ هایی مشابه موارد حفاظتی Claude Fable 5.1 به کار می بریم. سازمانهای تأیید شده میتوانند امروز به برنامه تأیید علوم زیستی ما برای استفاده از Opus 5.5 برای تحقیقات زیستشناسی درخواست دهند. در هفتههای آینده نیز دسترسی به برنامه راستیآزمایی سایبری خود را گسترش خواهیم داد و متخصصان امنیت سایبری تأیید شده میتوانند از Opus 5.5 برای کار خود استفاده کنند.
علاوه بر کاهش قیمت، محدودیتهای استفاده پنج ساعته را در طرحهای Pro، Max، Team و Enterprise مبتنی بر صندلی افزایش میدهیم. ما همچنین به کاربران اشتراک یک بازنشانی محدودیت نرخ ارائه میکنیم، که اکنون میتوانید هر زمان که بخواهید ذخیره کرده و از آن استفاده کنید.
ارتباط. Opus 5.5 به طور طبیعی تر از مدل های قبلی ارتباط برقرار می کند. آزمایشکنندگان اولیه نوشتههای آن را واضحتر و آسانتر برای پیگیری دریافتند، که به برخی از بازخوردهای رایجی که درباره Opus 5 شنیدهایم پاسخ میدهد. این مهمترین اطلاعات را در جلوی صفحه قرار میدهد، و سبک آن باعث میشود در جلسات طولانی، شریک کاری بهتری باشد. همانطور که یکی از آزمایشکنندگان اولیه میگوید، "آنطور که من مینویسم." در استفاده خود ما، این کار Opus 5.5 را برای پیگیری و بررسی آسانتر کرده است - که یک مزیت ایمنی و همچنین کاربردی است.
Claude Sonnet 5.5 و Claude Haiku 5.5 در هفته های آینده با بسیاری از بهبودهای مشابه در عملکرد، کارایی و ایمنی دنبال خواهند شد.
در معیارهای ما، Claude Opus 5.5 در کدنویسی عاملی، استفاده از رایانه و کار دانش پیشرو است. با این اوصاف، در این سطوح از توانایی، متوجه شدهایم که حاشیههای معیار به راهنمای کمتر قابل اعتمادی برای تفاوتهای دنیای واقعی تبدیل شدهاند. در استفاده خود ما، فاصله بین Opus 5.5 و Claude Fable 5.1 کمتر از آن چیزی است که این امتیازات نشان می دهد.
مگر اینکه غیر از این ذکر شود، تمام نتایج Claude Opus 5.5 از تفکر انطباقی با حداکثر تلاش استفاده می کنند. همانطور که توسط OpenAI گزارش شده است، نتایج Terminal-Bench 4.0 برای Claude Opus 5.5 در تلاش xhigh و GPT-6 Astra در تلاش زیاد گزارش شده است. اینها نشان دهنده بالاترین امتیاز هر مدل است. Claude Opus 5.5 با فعال بودن پادمان های تولید آن ارزیابی شد. هنگامی که آنها مداخله کردند، وظایف امنیت سایبری توسط Claude Opus 4.8 تکمیل شد، و وظایف توسعه زیست شناسی و مرزی LLM توسط Claude Opus 5 تکمیل شد. این احتمالا عملکرد Claude Opus 5.5 را در این معیارها کاهش می دهد.
1 Terminal-Bench 4.0: خطای استاندارد ± 2.6 امتیاز برای Claude Opus 5.5 و ± 1.6-2 امتیاز برای سایر مدل های Claude است. تابلوی امتیازات عمومی (5 آزمایش/وظیفه، مهار کد کلود) Claude Opus 5 را با 51.8% گزارش میدهد. راه اندازی ما آن را در 52.3٪، در نویز بازتولید می کند. ارقام GPT-6 Astra و GPT-5.6 Sol همانطور که توسط OpenAI گزارش شده است.
2 AutomationBench: نتایج AutomationBench توسط Zapier اجرا و گزارش شد. این اجراها بدون مدلهای بازگشتی انجام شدند، بنابراین مداخلات حفاظتی شکستها در نظر گرفته شد - این منجر به امتیاز کمتری نسبت به Claude Opus 5.5 در عمل شد. نتایج Claude Opus 5.5 از ارزیابی خود Zapier در هنگام دسترسی اولیه به دست آمده است. نتایج Opus 5، GPT-5.6 Sol، و GPT-6 Astra از جدول امتیازات عمومی Zapier آمده است.
3 Terminal-Bench-Science 0.1: خطای استاندارد ± 3.5-5 امتیاز در هر مدل است. جدول امتیازات عمومی (3 آزمایش/وظیفه، مهار کد کلود) Claude Opus 5 را 30.0% گزارش میکند. راه اندازی ما آن را در 29.0٪، در نویز بازتولید می کند. رقم GPT-6 Astra همانطور که توسط OpenAI گزارش شده است.
جایی که مزیت Opus 5.5 بسیار واضح است، کارایی است. هزینه هر توکن کمتر از Opus 5 است و از توکن های کمتری در هر کار استفاده می کند که منجر به کاهش 40 درصدی هزینه ها می شود.
Opus 5.5 مخصوصا در مشاغل طولانی و گسترده مانند مهاجرت و ممیزی در کل پایگاه کد خوب است. یک آزمایشکننده اولیه از آن برای ممیزی و تعمیر یک پایگاه کد 200000 خطی در کمتر از سه ساعت استفاده کرد، جایی که Opus 5 بیش از 20 ساعت طول کشید و 2.5 برابر بیشتر از توکنها استفاده کرد. در یک آزمایش داخلی، از Opus 5.5 و Fable 5.1 خواستیم تا HAProxy را ترجمه کنند، نرم افزار پرکاربردی که بار ترافیک وب را در سرورها، از C به Rust متعادل می کند. هر دو بازنویسی تقریبا تمام تستهای رگرسیون خود HAProxy را گذراندند، اما Opus 5.5 در 9.5 ساعت در مقایسه با 12 برای Fable 5.1 به پایان رسید و 51٪ هزینه کمتری داشت.
Opus 5.5 نتایج مرزی را در زمینه کدگذاری عاملی با کسری از هزینه ارائه می دهد. در سطح تلاش پیشفرض خود در FrontierCode، GPT-6 Astra را با تقریبا 20 درصد هزینه هر کار شکست میدهد. در Terminal Bench 4.0، حدود 40 درصد از هزینه را با Astra برابری می کند، در حالی که در CursorBench با 11 امتیاز برای حدود یک سوم هزینه، GPT-5.6 Sol را شکست می دهد.
Terminal-Bench 4.0 اندازه گیری می کند که چگونه یک مدل می تواند وظایف پیچیده و حرفه ای چند مرحله ای را در یک رابط خط فرمان انجام دهد. Opus 5.5 در تلاش پیش فرض، Opus 5 را با حداکثر تلاش برای حدود یک پنجم هزینه شکست می دهد. این GPT-6 Astra با حدود 40 درصد هزینه مطابقت دارد.
FrontierCode اندازه گیری می کند که آیا تغییرات کد یک عامل ادغام می شوند یا خیر. در تلاش پیشفرض (متوسط)، Opus 5.5 امتیاز 54.6% را به دست میآورد، بالاتر از همه مدلهای دیگر، و بالاتر از GPT-6 Astra (53.3%) برای حدود یک پنجم هزینه هر کار.
CursorBench عوامل کدنویسی را در وظایف مبهم و چند فایلی که از جلسات مکان نما واقعی گرفته شده اند، ارزیابی می کند. در تلاش پیشفرض (متوسط)، Opus 5.5 امتیاز 52.5% را کسب میکند، در مقایسه با 51.8% برای Fable 5.1 (حداکثر) و 46.6% برای Opus 5 (حداکثر). این امتیاز بالاترین امتیاز GPT-5.6 Sol (41.7٪) را با 11 امتیاز برای حدود یک سوم هزینه هر کار شکست می دهد.
آزمایش کنندگان اولیه ما کارایی و دستاوردهای هوش مشابهی را گزارش کردند:
"توسعهدهندگان عواملی میخواهند که بتوانند کار نرمافزاری واقعی را انجام دهند و آن را به پایان برسانند. در آزمایش ما در سراسر GitHub Copilot CLI و VS Code، Claude Opus 5.5 از کمترین توکنها و مراحلی که اندازهگیری کردیم استفاده کرد. در VS Code، وظایف ترمینال بیشتری را نسبت به Opus 5 در کمتر از نیمی از مراحل حل کرد. بیشتر از اینکه کارهای فردی را کارآمدتر کند، پروژهها را کارآمدتر میکند."
متن اصلی (انگلیسی)
Claude Opus 5.5
Article URL: https://www.anthropic.com/claude-opus-5-5 Comments URL: https://news.ycombinator.com/item?id=49803892 Points: 316 # Comments: 381