پرش به محتوای اصلی

کلود سونت 5.5

هکرنیوز۱۴۰۵ مهر ۶, دوشنبه، ساعت ۲۱:۲۸حدود 4 دقیقه مطالعه

آدرس مقاله: https://www.anthropic.com/claude-sonnet-5-5 آدرس نظرات: https://news.ycombinator.com/item?id=49881850 امتیاز: 177 # نظرات: 130

معرفی کلود سونت 5.5، دومین مدل از خانواده کلود 5.5. این یک ارتقا واضح نسبت به Claude Sonnet 5 است، 30٪+ سریعتر اجرا می شود و برای اکثر کارها تا 30٪ هزینه کمتری دارد.

Sonnet 5.5 یک مکمل سریعتر و کم هزینه برای Claude Opus 5.5 است. در جایی که Opus 5.5 برای کارهای پیچیده ای که نیاز به قضاوت دقیق دارند ساخته شده است، Sonnet 5.5 در کارهای روزمره، رفع اشکالات، و ایجاد اسناد صیقلی، اسلایدها و صفحات گسترده قوی ترین است. همچنین چشم تیزبینی برای طراحی دارد. Claude Haiku 5.5 که برای کاربردهای پرحجم و حساس به هزینه ساخته شده است، در هفته های آینده به خانواده Claude 5.5 خواهد پیوست.

عملکرد. Sonnet 5.5 امتیاز 70.6% را در Terminal-Bench 4.0، ارزیابی کدگذاری عاملی، در مقایسه با Sonnet 5 10.3% به دست آورد. دو امتیاز کمتر از Opus 5.5 در GDPval-AA، آزمایشی از کار در دنیای واقعی در مشاغل مختلف کسب می کند. و در کار با افق طولانی و درک تصویر قوی است - این اولین مدل Sonnet است که Pokémon Red را شکست می دهد و فقط از روی اسکرین شات کار می کند.

همکاری. مانند Opus 5.5، Sonnet 5.5 واضح تر از نسل قبلی مدل های ما می نویسد. آزمایش‌کنندگان اولیه آن را به‌عنوان شریک بهتری برای همکاری نسبت به Sonnet 5 توصیف کردند. سرعت آن همچنین آن را برای تکرار سریع در کارهای کمتر پیچیده مناسب می‌کند.

سرعت. Sonnet 5.5 خروجی ها را 30% + سریعتر از Sonnet 5 تولید می کند که آن را سریع ترین مدل Sonnet ما تا به امروز می کند.

تراز و ایمنی. در ممیزی رفتاری خودکار ما، Sonnet 5.5 در بیشتر معیارهای همسویی، Sonnet 5 را بهبود می بخشد یا مطابقت دارد. از آنجایی که قابلیت‌های امنیت سایبری آن با Opus 5 قابل مقایسه است، این اولین مدل Sonnet است که با پادمان‌های سایبری و مواردی مانند مواردی که برای توانمندترین مدل‌های خود توسعه داده‌ایم، عرضه می‌شود. حفاظت های زیست شناسی آن مانند Sonnet 5 است. هر دو پادمان مجموعه محدودی از درخواست‌های پرخطر را هدف قرار می‌دهند. توسعه معمول نرم افزار و بسیاری از کارهای علوم زیستی تحت تأثیر قرار نمی گیرند.

Sonnet 5.5 نسبت به Sonnet 5 در دامنه ها بهبود می یابد - در برخی موارد به طور چشمگیری. در چندین ارزیابی، Sonnet 5.5 at Max حتی عملکردی مشابه با Opus 5.5 دارد. با این حال، امتیازات معیار تنها یک جنبه از قابلیت های یک مدل را نشان می دهد. در آزمایش‌های خود ما و آزمایش‌کننده‌های خارجی، Opus 5.5 در کارهای پیچیده و باز که نیاز به قضاوت مداوم دارد، به وضوح قوی‌تر است.

برای جزئیات در مورد نحوه اجرای ارزیابی های خود، به کارت سیستم Sonnet 5.5 مراجعه کنید.

نمودارهای زیر امتیاز هر مدل را در برابر هزینه هر کار در هر سطح تلاش ترسیم می کنند. با افزایش تلاش، مدل‌ها معمولا برای مدت طولانی‌تری کار می‌کنند که منجر به هزینه بالاتر برای هر کار می‌شود، اما معمولا امتیاز بالاتری نیز به همراه دارد. هر چه یک نقطه به سمت چپ بالای نمودار نزدیک‌تر باشد، توانایی بیشتری در هر دلار ارائه می‌کند.

در چندین معیار، Sonnet 5.5 در تلاش کم یا متوسط، بهترین امتیاز Sonnet 5 را برای حدود یک دهم هزینه هر کار شکست می دهد. هنگامی که در تنظیمات تلاش کمتر اجرا می شود، جایی که هزینه هر کار کمتری دارد، Opus 5.5 را به بهترین وجه تکمیل می کند. در تنظیمات بالاتر، می تواند با هزینه مشابهی عملکرد قابل مقایسه ای داشته باشد.

Terminal-Bench 4.0 اندازه گیری می کند که چگونه یک مدل می تواند وظایف پیچیده و حرفه ای چند مرحله ای را در یک رابط خط فرمان انجام دهد. در تلاش متوسط، پیش‌فرض در برنامه‌های کلود، Sonnet 5.5 بسیار بیشتر از بهترین امتیاز Sonnet 5 برای کمتر از یک دهم هزینه هر کار است.

Terminal-Bench و OpenAI عملکرد GPT-6 Sol را به صورت عمومی گزارش نکردند، بنابراین ما GPT-5.6 Sol را در اینجا گزارش می کنیم.

FrontierCode اندازه گیری می کند که آیا تغییرات کد یک عامل ادغام می شوند یا خیر. در تلاش زیاد، پیش‌فرض در پلتفرم کلود، Sonnet 5.5 با بهترین امتیاز GPT-6 Sol برای حدود یک پنجم هزینه هر کار مطابقت دارد.²

CursorBench عوامل کدنویسی را روی وظایف مبهم و چند فایلی که از جلسات مکان‌نما واقعی گرفته شده‌اند، ارزیابی می‌کند. Sonnet 5.5 at Low Work از بهترین امتیاز Sonnet 5 برای کمتر از یک دهم هزینه هر کار بیشتر است.

CursorBench 4.0 عملکرد GPT-6 Sol را به صورت عمومی گزارش نمی کند، بنابراین ما GPT-5.6 Sol را در اینجا گزارش می کنیم.

در AA-Briefcase، یک معیار جدید از کار دانش افق بلند، Sonnet 5.5 at Medium تلاش بهترین امتیاز Sonnet 5 را برای حدود یک نهم هزینه هر کار به دست آورد.³

جهش عملکرد Sonnet 5.5 به ویژه در کدنویسی قابل توجه است. در High effort در FrontierCode، در همان تنظیمات، 10 امتیاز بالاتر از Sonnet 5 کسب می‌کند، در حدود یک پانزدهم هزینه هر کار. در CursorBench، که مدل‌ها را بر روی وظایف جلسات کدگذاری واقعی مکان‌نما آزمایش می‌کند، بهترین امتیاز آن در حدود دو امتیاز از Opus 5.5 است.

آزمایش‌کنندگان اولیه متوجه شدند که Sonnet 5.5 چقدر سریع می‌تواند یک پایگاه کد را درک کند. آنها همچنین از کارایی آن شگفت زده شدند: در اجراهای سر به سر، فراخوانی ابزار را بیشتر از Sonnet 5 جمع آوری می کرد که منجر به مراحل کمتر و هزینه کمتر می شد.

"در آزمایش اولیه Epic، Claude Sonnet 5.5 همان نوار کیفیتی را که از یک مدل سطح بالاتر انتظار می‌رفت، پاک کرد، و بازرسی طراحی سیستم و بررسی جریان داده را متوقف کرد. مدل جدید ده‌ها هزار خط کد را برای معماری سیستم بازی مدیریت کرد، پاسخ‌ها را سریع نگه داشت، وظایف چند ساعته را انجام داد، و با دستورات اولیه کمتر ارائه شد."

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Claude Sonnet 5.5

Article URL: https://www.anthropic.com/claude-sonnet-5-5 Comments URL: https://news.ycombinator.com/item?id=49881850 Points: 177 # Comments: 130

پوشش همین خبر در رسانه‌های دیگر

مقایسه‌ی پوشش ۲ رسانه ←
همه‌ی اخبار فناوری