پرش به محتوای اصلی

بستن کار 5.5

هکرنیوز۱۴۰۵ شهریور ۳۱, سه‌شنبه، ساعت ۱۹:۵۹حدود 6 دقیقه مطالعه

آدرس مقاله: https://www.anthropic.com/claude-opus-5-5 آدرس نظرات: https://news.ycombinator.com/item?id=49803892 امتیاز: 316 # نظرات: 381

ما در حال معرفی Claude Opus 5.5، اولین مدل از خانواده جدید Claude 5.5 هستیم. در بیشتر کارها در سطح Claude Fable 5.1 عمل می کند و هزینه اجرای آن 40 درصد کمتر از Opus 5 است.

Claude Opus 5.5 اولین نسخه ما از زمانی است که ما خواستار سرعت بخشیدن به مرزها شدیم. قبل از انتشار توسط ارزیابان خارجی، از جمله Frontier Design و METR آزمایش شد. Opus 5.5 در ممیزی رفتاری خودکار ما، جامع ترین تست هم ترازی که اجرا می کنیم، قوی ترین مدلی است که تا به امروز آزمایش کرده ایم. همچنین با محافظ هایی همراه است که ما برای تواناترین مدل های خود ایجاد کرده ایم.

در اینجا برخی از پیشرفت هایی که می توانید از Opus 5.5 انتظار داشته باشید آورده شده است:

عملکرد. Opus 5.5 یک گام بزرگ در مقایسه با Opus 5 است. این مدل پیشرو جدید است و آزمایش کنندگان اولیه شاهد جهش های بزرگ در عملکرد در پیچیده ترین کار خود بودند. یک آزمایش‌کننده انتقال کد 680000 خطی را در کمتر از یک روز تکمیل کرد - کاری که هفته‌ها طول می‌کشید یک تیم مهندسی. در یافتن و رفع ناکارآمدی‌ها در نرم‌افزار خوب است: وقتی از آن خواستیم زمان بارگذاری را در هر صفحه یک برنامه وب کاهش دهد، Opus 5.5 39 از 40 بار موفق شد، در حالی که Opus 5 پیشرفت‌های کوچک‌تری انجام داد که رفتار برنامه را نیز تغییر داد.

یک آزمایش‌کننده متفاوت چندین مدل کلود را مجبور به ساخت یک بازی از یک درخواست کرد. Opus 5.5 بالاتر از هر مدل دیگری از نظر قدرت گرافیکی و جلای خود امتیاز کسب کرد.

ایمنی. Opus 5.5 در ممیزی رفتاری خودکار ما، مجموعه هم ترازی ما که کلود را در هزاران سناریو شبیه سازی شده آزمایش می کند، بهترین امتیازات را از هر مدلی تا به امروز کسب می کند. نسبت به مدل‌های اخیر احتمال انجام اقدامات سخت‌گیرانه یا عمل خارج از محدوده‌های داده شده بسیار کمتر است و نسبت به Opus 5 در برابر تزریق سریع مقاوم‌تر است. ما همچنین آزمایش تراز خود را گسترش داده‌ایم تا وظایف طولانی‌تر، کارهای غیرممکن و سناریوهای الگوبرداری از حوادث واقعی را پوشش دهیم، اگرچه هنوز محدودیت‌هایی دارد. جزئیات کامل ارزیابی ما در کارت سیستم Opus 5.5 موجود است.

از آنجایی که Opus 5.5 از نظر زیست شناسی و امنیت سایبری با Claude Mythos 5.1 قابل مقایسه است، ما آن را با محافظ هایی مشابه موارد حفاظتی Claude Fable 5.1 به کار می بریم. سازمان‌های تأیید شده می‌توانند امروز به برنامه تأیید علوم زیستی ما برای استفاده از Opus 5.5 برای تحقیقات زیست‌شناسی درخواست دهند. در هفته‌های آینده نیز دسترسی به برنامه راستی‌آزمایی سایبری خود را گسترش خواهیم داد و متخصصان امنیت سایبری تأیید شده می‌توانند از Opus 5.5 برای کار خود استفاده کنند.

علاوه بر کاهش قیمت، محدودیت‌های استفاده پنج ساعته را در طرح‌های Pro، Max، Team و Enterprise مبتنی بر صندلی افزایش می‌دهیم. ما همچنین به کاربران اشتراک یک بازنشانی محدودیت نرخ ارائه می‌کنیم، که اکنون می‌توانید هر زمان که بخواهید ذخیره کرده و از آن استفاده کنید.

ارتباط. Opus 5.5 به طور طبیعی تر از مدل های قبلی ارتباط برقرار می کند. آزمایش‌کنندگان اولیه نوشته‌های آن را واضح‌تر و آسان‌تر برای پیگیری دریافتند، که به برخی از بازخوردهای رایجی که درباره Opus 5 شنیده‌ایم پاسخ می‌دهد. این مهم‌ترین اطلاعات را در جلوی صفحه قرار می‌دهد، و سبک آن باعث می‌شود در جلسات طولانی، شریک کاری بهتری باشد. همانطور که یکی از آزمایش‌کنندگان اولیه می‌گوید، "آنطور که من می‌نویسم." در استفاده خود ما، این کار Opus 5.5 را برای پیگیری و بررسی آسان‌تر کرده است - که یک مزیت ایمنی و همچنین کاربردی است.

Claude Sonnet 5.5 و Claude Haiku 5.5 در هفته های آینده با بسیاری از بهبودهای مشابه در عملکرد، کارایی و ایمنی دنبال خواهند شد.

در معیارهای ما، Claude Opus 5.5 در کدنویسی عاملی، استفاده از رایانه و کار دانش پیشرو است. با این اوصاف، در این سطوح از توانایی، متوجه شده‌ایم که حاشیه‌های معیار به راهنمای کمتر قابل اعتمادی برای تفاوت‌های دنیای واقعی تبدیل شده‌اند. در استفاده خود ما، فاصله بین Opus 5.5 و Claude Fable 5.1 کمتر از آن چیزی است که این امتیازات نشان می دهد.

مگر اینکه غیر از این ذکر شود، تمام نتایج Claude Opus 5.5 از تفکر انطباقی با حداکثر تلاش استفاده می کنند. همانطور که توسط OpenAI گزارش شده است، نتایج Terminal-Bench 4.0 برای Claude Opus 5.5 در تلاش xhigh و GPT-6 Astra در تلاش زیاد گزارش شده است. اینها نشان دهنده بالاترین امتیاز هر مدل است. Claude Opus 5.5 با فعال بودن پادمان های تولید آن ارزیابی شد. هنگامی که آنها مداخله کردند، وظایف امنیت سایبری توسط Claude Opus 4.8 تکمیل شد، و وظایف توسعه زیست شناسی و مرزی LLM توسط Claude Opus 5 تکمیل شد. این احتمالا عملکرد Claude Opus 5.5 را در این معیارها کاهش می دهد.

1 Terminal-Bench 4.0: خطای استاندارد ± 2.6 امتیاز برای Claude Opus 5.5 و ± 1.6-2 امتیاز برای سایر مدل های Claude است. تابلوی امتیازات عمومی (5 آزمایش/وظیفه، مهار کد کلود) Claude Opus 5 را با 51.8% گزارش می‌دهد. راه اندازی ما آن را در 52.3٪، در نویز بازتولید می کند. ارقام GPT-6 Astra و GPT-5.6 Sol همانطور که توسط OpenAI گزارش شده است.

2 AutomationBench: نتایج AutomationBench توسط Zapier اجرا و گزارش شد. این اجراها بدون مدل‌های بازگشتی انجام شدند، بنابراین مداخلات حفاظتی شکست‌ها در نظر گرفته شد - این منجر به امتیاز کمتری نسبت به Claude Opus 5.5 در عمل شد. نتایج Claude Opus 5.5 از ارزیابی خود Zapier در هنگام دسترسی اولیه به دست آمده است. نتایج Opus 5، GPT-5.6 Sol، و GPT-6 Astra از جدول امتیازات عمومی Zapier آمده است.

3 Terminal-Bench-Science 0.1: خطای استاندارد ± 3.5-5 امتیاز در هر مدل است. جدول امتیازات عمومی (3 آزمایش/وظیفه، مهار کد کلود) Claude Opus 5 را 30.0% گزارش می‌کند. راه اندازی ما آن را در 29.0٪، در نویز بازتولید می کند. رقم GPT-6 Astra همانطور که توسط OpenAI گزارش شده است.

جایی که مزیت Opus 5.5 بسیار واضح است، کارایی است. هزینه هر توکن کمتر از Opus 5 است و از توکن های کمتری در هر کار استفاده می کند که منجر به کاهش 40 درصدی هزینه ها می شود.

Opus 5.5 مخصوصا در مشاغل طولانی و گسترده مانند مهاجرت و ممیزی در کل پایگاه کد خوب است. یک آزمایش‌کننده اولیه از آن برای ممیزی و تعمیر یک پایگاه کد 200000 خطی در کمتر از سه ساعت استفاده کرد، جایی که Opus 5 بیش از 20 ساعت طول کشید و 2.5 برابر بیشتر از توکن‌ها استفاده کرد. در یک آزمایش داخلی، از Opus 5.5 و Fable 5.1 خواستیم تا HAProxy را ترجمه کنند، نرم افزار پرکاربردی که بار ترافیک وب را در سرورها، از C به Rust متعادل می کند. هر دو بازنویسی تقریبا تمام تست‌های رگرسیون خود HAProxy را گذراندند، اما Opus 5.5 در 9.5 ساعت در مقایسه با 12 برای Fable 5.1 به پایان رسید و 51٪ هزینه کمتری داشت.

Opus 5.5 نتایج مرزی را در زمینه کدگذاری عاملی با کسری از هزینه ارائه می دهد. در سطح تلاش پیش‌فرض خود در FrontierCode، GPT-6 Astra را با تقریبا 20 درصد هزینه هر کار شکست می‌دهد. در Terminal Bench 4.0، حدود 40 درصد از هزینه را با Astra برابری می کند، در حالی که در CursorBench با 11 امتیاز برای حدود یک سوم هزینه، GPT-5.6 Sol را شکست می دهد.

Terminal-Bench 4.0 اندازه گیری می کند که چگونه یک مدل می تواند وظایف پیچیده و حرفه ای چند مرحله ای را در یک رابط خط فرمان انجام دهد. Opus 5.5 در تلاش پیش فرض، Opus 5 را با حداکثر تلاش برای حدود یک پنجم هزینه شکست می دهد. این GPT-6 Astra با حدود 40 درصد هزینه مطابقت دارد.

FrontierCode اندازه گیری می کند که آیا تغییرات کد یک عامل ادغام می شوند یا خیر. در تلاش پیش‌فرض (متوسط)، Opus 5.5 امتیاز 54.6% را به دست می‌آورد، بالاتر از همه مدل‌های دیگر، و بالاتر از GPT-6 Astra (53.3%) برای حدود یک پنجم هزینه هر کار.

CursorBench عوامل کدنویسی را در وظایف مبهم و چند فایلی که از جلسات مکان نما واقعی گرفته شده اند، ارزیابی می کند. در تلاش پیش‌فرض (متوسط)، Opus 5.5 امتیاز 52.5% را کسب می‌کند، در مقایسه با 51.8% برای Fable 5.1 (حداکثر) و 46.6% برای Opus 5 (حداکثر). این امتیاز بالاترین امتیاز GPT-5.6 Sol (41.7٪) را با 11 امتیاز برای حدود یک سوم هزینه هر کار شکست می دهد.

آزمایش کنندگان اولیه ما کارایی و دستاوردهای هوش مشابهی را گزارش کردند:

"توسعه‌دهندگان عواملی می‌خواهند که بتوانند کار نرم‌افزاری واقعی را انجام دهند و آن را به پایان برسانند. در آزمایش ما در سراسر GitHub Copilot CLI و VS Code، Claude Opus 5.5 از کمترین توکن‌ها و مراحلی که اندازه‌گیری کردیم استفاده کرد. در VS Code، وظایف ترمینال بیشتری را نسبت به Opus 5 در کمتر از نیمی از مراحل حل کرد. بیشتر از اینکه کارهای فردی را کارآمدتر کند، پروژه‌ها را کارآمدتر می‌کند."

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Claude Opus 5.5

Article URL: https://www.anthropic.com/claude-opus-5-5 Comments URL: https://news.ycombinator.com/item?id=49803892 Points: 316 # Comments: 381

پوشش همین خبر در رسانه‌های دیگر

مقایسه‌ی پوشش ۳ رسانه ←
همه‌ی اخبار فناوری