کلود سونت 5.5
آدرس مقاله: https://www.anthropic.com/claude-sonnet-5-5 آدرس نظرات: https://news.ycombinator.com/item?id=49881850 امتیاز: 177 # نظرات: 130
معرفی کلود سونت 5.5، دومین مدل از خانواده کلود 5.5. این یک ارتقا واضح نسبت به Claude Sonnet 5 است، 30٪+ سریعتر اجرا می شود و برای اکثر کارها تا 30٪ هزینه کمتری دارد.
Sonnet 5.5 یک مکمل سریعتر و کم هزینه برای Claude Opus 5.5 است. در جایی که Opus 5.5 برای کارهای پیچیده ای که نیاز به قضاوت دقیق دارند ساخته شده است، Sonnet 5.5 در کارهای روزمره، رفع اشکالات، و ایجاد اسناد صیقلی، اسلایدها و صفحات گسترده قوی ترین است. همچنین چشم تیزبینی برای طراحی دارد. Claude Haiku 5.5 که برای کاربردهای پرحجم و حساس به هزینه ساخته شده است، در هفته های آینده به خانواده Claude 5.5 خواهد پیوست.
عملکرد. Sonnet 5.5 امتیاز 70.6% را در Terminal-Bench 4.0، ارزیابی کدگذاری عاملی، در مقایسه با Sonnet 5 10.3% به دست آورد. دو امتیاز کمتر از Opus 5.5 در GDPval-AA، آزمایشی از کار در دنیای واقعی در مشاغل مختلف کسب می کند. و در کار با افق طولانی و درک تصویر قوی است - این اولین مدل Sonnet است که Pokémon Red را شکست می دهد و فقط از روی اسکرین شات کار می کند.
همکاری. مانند Opus 5.5، Sonnet 5.5 واضح تر از نسل قبلی مدل های ما می نویسد. آزمایشکنندگان اولیه آن را بهعنوان شریک بهتری برای همکاری نسبت به Sonnet 5 توصیف کردند. سرعت آن همچنین آن را برای تکرار سریع در کارهای کمتر پیچیده مناسب میکند.
سرعت. Sonnet 5.5 خروجی ها را 30% + سریعتر از Sonnet 5 تولید می کند که آن را سریع ترین مدل Sonnet ما تا به امروز می کند.
تراز و ایمنی. در ممیزی رفتاری خودکار ما، Sonnet 5.5 در بیشتر معیارهای همسویی، Sonnet 5 را بهبود می بخشد یا مطابقت دارد. از آنجایی که قابلیتهای امنیت سایبری آن با Opus 5 قابل مقایسه است، این اولین مدل Sonnet است که با پادمانهای سایبری و مواردی مانند مواردی که برای توانمندترین مدلهای خود توسعه دادهایم، عرضه میشود. حفاظت های زیست شناسی آن مانند Sonnet 5 است. هر دو پادمان مجموعه محدودی از درخواستهای پرخطر را هدف قرار میدهند. توسعه معمول نرم افزار و بسیاری از کارهای علوم زیستی تحت تأثیر قرار نمی گیرند.
Sonnet 5.5 نسبت به Sonnet 5 در دامنه ها بهبود می یابد - در برخی موارد به طور چشمگیری. در چندین ارزیابی، Sonnet 5.5 at Max حتی عملکردی مشابه با Opus 5.5 دارد. با این حال، امتیازات معیار تنها یک جنبه از قابلیت های یک مدل را نشان می دهد. در آزمایشهای خود ما و آزمایشکنندههای خارجی، Opus 5.5 در کارهای پیچیده و باز که نیاز به قضاوت مداوم دارد، به وضوح قویتر است.
برای جزئیات در مورد نحوه اجرای ارزیابی های خود، به کارت سیستم Sonnet 5.5 مراجعه کنید.
نمودارهای زیر امتیاز هر مدل را در برابر هزینه هر کار در هر سطح تلاش ترسیم می کنند. با افزایش تلاش، مدلها معمولا برای مدت طولانیتری کار میکنند که منجر به هزینه بالاتر برای هر کار میشود، اما معمولا امتیاز بالاتری نیز به همراه دارد. هر چه یک نقطه به سمت چپ بالای نمودار نزدیکتر باشد، توانایی بیشتری در هر دلار ارائه میکند.
در چندین معیار، Sonnet 5.5 در تلاش کم یا متوسط، بهترین امتیاز Sonnet 5 را برای حدود یک دهم هزینه هر کار شکست می دهد. هنگامی که در تنظیمات تلاش کمتر اجرا می شود، جایی که هزینه هر کار کمتری دارد، Opus 5.5 را به بهترین وجه تکمیل می کند. در تنظیمات بالاتر، می تواند با هزینه مشابهی عملکرد قابل مقایسه ای داشته باشد.
Terminal-Bench 4.0 اندازه گیری می کند که چگونه یک مدل می تواند وظایف پیچیده و حرفه ای چند مرحله ای را در یک رابط خط فرمان انجام دهد. در تلاش متوسط، پیشفرض در برنامههای کلود، Sonnet 5.5 بسیار بیشتر از بهترین امتیاز Sonnet 5 برای کمتر از یک دهم هزینه هر کار است.
Terminal-Bench و OpenAI عملکرد GPT-6 Sol را به صورت عمومی گزارش نکردند، بنابراین ما GPT-5.6 Sol را در اینجا گزارش می کنیم.
FrontierCode اندازه گیری می کند که آیا تغییرات کد یک عامل ادغام می شوند یا خیر. در تلاش زیاد، پیشفرض در پلتفرم کلود، Sonnet 5.5 با بهترین امتیاز GPT-6 Sol برای حدود یک پنجم هزینه هر کار مطابقت دارد.²
CursorBench عوامل کدنویسی را روی وظایف مبهم و چند فایلی که از جلسات مکاننما واقعی گرفته شدهاند، ارزیابی میکند. Sonnet 5.5 at Low Work از بهترین امتیاز Sonnet 5 برای کمتر از یک دهم هزینه هر کار بیشتر است.
CursorBench 4.0 عملکرد GPT-6 Sol را به صورت عمومی گزارش نمی کند، بنابراین ما GPT-5.6 Sol را در اینجا گزارش می کنیم.
در AA-Briefcase، یک معیار جدید از کار دانش افق بلند، Sonnet 5.5 at Medium تلاش بهترین امتیاز Sonnet 5 را برای حدود یک نهم هزینه هر کار به دست آورد.³
جهش عملکرد Sonnet 5.5 به ویژه در کدنویسی قابل توجه است. در High effort در FrontierCode، در همان تنظیمات، 10 امتیاز بالاتر از Sonnet 5 کسب میکند، در حدود یک پانزدهم هزینه هر کار. در CursorBench، که مدلها را بر روی وظایف جلسات کدگذاری واقعی مکاننما آزمایش میکند، بهترین امتیاز آن در حدود دو امتیاز از Opus 5.5 است.
آزمایشکنندگان اولیه متوجه شدند که Sonnet 5.5 چقدر سریع میتواند یک پایگاه کد را درک کند. آنها همچنین از کارایی آن شگفت زده شدند: در اجراهای سر به سر، فراخوانی ابزار را بیشتر از Sonnet 5 جمع آوری می کرد که منجر به مراحل کمتر و هزینه کمتر می شد.
"در آزمایش اولیه Epic، Claude Sonnet 5.5 همان نوار کیفیتی را که از یک مدل سطح بالاتر انتظار میرفت، پاک کرد، و بازرسی طراحی سیستم و بررسی جریان داده را متوقف کرد. مدل جدید دهها هزار خط کد را برای معماری سیستم بازی مدیریت کرد، پاسخها را سریع نگه داشت، وظایف چند ساعته را انجام داد، و با دستورات اولیه کمتر ارائه شد."
متن اصلی (انگلیسی)
Claude Sonnet 5.5
Article URL: https://www.anthropic.com/claude-sonnet-5-5 Comments URL: https://news.ycombinator.com/item?id=49881850 Points: 177 # Comments: 130