هوش، عملکرد و قیمت کلود اپوس 5.5 (حداکثر)
آدرس مقاله: https://artificialanalysis.ai/models/claude-opus-5-5 آدرس نظرات: https://news.ycombinator.com/item?id=49804316 امتیاز: 266 # نظرات: 77
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیشفرض بازگشت) در میان مدلهای پیشرو در هوشمندی است، اما در مقایسه با مدلهای دیگر با قیمت مشابه، تا حدودی گران است. این مدل از ورودی متن و تصویر پشتیبانی می کند، متن را خروجی می دهد و دارای یک پنجره زمینه 1M توکن است.
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیشفرض) امتیاز 58 را در شاخص هوش مصنوعی تحلیل میکند و آن را بسیار بالاتر از میانگین در بین مدلهای قابل مقایسه قرار میدهد (میانگین: 25). هنگام ارزیابی شاخص هوش، 260 میلیون توکن تولید کرد که در مقایسه با میانگین 88 میلیون بسیار پرمخاطب است.
این صفحه نسخه استدلالی این مدل را نشان می دهد.
معیارها با مدل های هم کلاس مقایسه می شوند:
نمایه هوش تحلیل مصنوعی نسخه 4.3.2 شامل: AA-Briefcase v1.1، GDPval-AA v2.1، AutomationBench-AA، Terminal-Bench 4.0، SciCode، Humanity's Last Exam، GDP.pdf، CritPt، AA-Omnisciencer، AA-Omniscience برای جزئیات بیشتر، از جمله تجزیه و تحلیل هر ارزیابی و نحوه اجرای آنها، به روششناسی شاخص هوش مراجعه کنید.
نشان می دهد که آیا وزن مدل موجود است یا خیر. اگر استفاده تجاری توسط شرایط محدود شود، مدلها با عنوان «محدودیت استفاده تجاری» و اگر مجوز استفاده تجاری را ممنوع کند، به عنوان «غیر تجاری» برچسبگذاری میشوند.
عملکرد مدل ها را بر روی قابلیت ها و صنایع خاص اندازه گیری می کند
وظایف کاری در دنیای واقعی نماینده، (Elo-500)/2000
تجزیه و تحلیل کمی در صفحات گسترده و اسناد
در حالی که هوش مدل به طور کلی در موارد استفاده ترجمه می شود، ارزیابی های خاص ممکن است برای موارد استفاده خاص مرتبط تر باشد.
AA-Briefcase Elo یک معیار ترکیبی است که Elo با کیفیت تحلیلی، Elo ارائه، و نرخ پاس روبریک را جمعآوری میکند، با عملکرد روبریک که از طریق تطبیقهای سر به سر مصنوعی به Elo تبدیل میشود. کرانهای Elo و فاصله اطمینان 95% در 0 بسته می شوند.
شاخص AA-Omniscience (بالاتر بهتر است) قابلیت اطمینان دانش و توهم را اندازه گیری می کند. به پاسخ های صحیح پاداش می دهد، توهمات را جریمه می کند و برای امتناع از پاسخ هیچ مجازاتی ندارد. نمرات از 100- تا 100 متغیر است، که در آن 0 به معنای تعداد پاسخ های صحیح به اندازه پاسخ های نادرست است، و نمرات منفی به معنای بیشتر نادرست از صحیح است.
میانگین وزنی هزینه هر کار شاخص هوش. هزینه هر ارزیابی از قیمت ورودی، ضربه حافظه پنهان، نوشتن حافظه پنهان، استدلال و قیمت نشانه پاسخ، تقسیم بر تعداد کار، و وزن آن بر وزن شاخص هوش محاسبه می شود.
تعداد نشانه های مورد نیاز برای هر کار شاخص هوش. این با ضرب نشانههای خروجی در هر ارزش در وزنهای نسبی هر معیار در شاخص هوش، و سپس تقسیم بر تعداد کار (به استثنای تکرارها) محاسبه میشود.
هزینه اجرای ارزیابیها در شاخص هوش مصنوعی، با استفاده از ورودی مدل، ضربه حافظه پنهان، نوشتن در حافظه پنهان، استدلال و قیمت نشانههای پاسخ و تعداد نشانههای استفاده شده در ارزیابیها (به استثنای تکرارها) محاسبه میشود.
قیمت هر توکن برای درخواستهای ذخیرهشده (که قبلا پردازش شدهاند)، معمولا تخفیف قابلتوجهی را در مقایسه با قیمت ورودی معمولی ارائه میدهند که به صورت USD در هر میلیون توکن نشان داده میشود. مقادیری که در اینجا نشان داده شده است، قیمت ضربه در حافظه پنهان است. نوشتن در حافظه پنهان و ذخیره سازی حافظه پنهان به طور جداگانه صورتحساب می شوند و بر اساس ارائه دهنده متفاوت است - برای جزئیات بیشتر به "قیمت کش توسط ارائه دهنده" مراجعه کنید.
پنجرههای زمینه بزرگتر مربوط به RAG (Retrieval Augmented Generation) LLM هستند که معمولا شامل استدلال و بازیابی اطلاعات مقادیر زیادی داده میشود.
حداکثر تعداد توکن های ورودی و خروجی ترکیبی. نشانههای خروجی معمولا دارای حد قابل توجهی پایینتر هستند (بر اساس مدل متفاوت است).
سوالات متداول در مورد Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض)
Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) در 22 سپتامبر 2026 منتشر شد.
Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) توسط Anthropic ساخته شده است.
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیشفرض بازگشت) امتیاز 58 را در شاخص هوش مصنوعی تحلیل میکند و آن را بسیار بالاتر از میانگین در بین مدلهای استدلالی دیگر در سطح قیمتی مشابه (میانگین: 25) قرار میدهد.
وقتی کلود اوپوس 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیشفرض) بر روی شاخص هوش ارزیابی شد، 260 میلیون توکن خروجی تولید کرد که در مقایسه با سایر مدلهای استدلال در سطح قیمتی مشابه (متوسط: 88 میلیون) در بالاترین سطح قرار دارد.
بله، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیش فرض بازگشت) یک مدل استدلال است. از تفکر گسترده یا استدلال زنجیرهای از فکر برای حل مشکلات پیچیده قبل از ارائه پاسخ استفاده میکند.
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از ورودی متن و تصویر پشتیبانی می کند.
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از خروجی متن پشتیبانی می کند.
بله، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از ورودی تصویر پشتیبانی می کند و می تواند تصاویر را تجزیه و تحلیل، توصیف و پاسخ دهد.
بله، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) چند وجهی است. این می تواند ورودی متن و تصویر را پردازش کند و خروجی متن تولید کند.
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) دارای یک پنجره زمینه از 1.0 میلیون توکن است. این تعیین میکند که مدل چقدر میتواند در یک درخواست پردازش کند.
خیر، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیشفرض بازگشت) اختصاصی است. وزن مدل به صورت عمومی در دسترس نیست.
Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) یک مدل اختصاصی است و Anthropic اندازه مدل یا تعداد پارامترها را فاش نکرده است.
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیشفرض عقبنشینی) امتیاز 58 را در شاخص هوش تحلیل مصنوعی کسب میکند. این معیار ترکیبی مدلها را در استدلال، دانش، ریاضیات و کدگذاری ارزیابی میکند.
بله، Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) از طریق API از طریق 6 ارائه دهنده در دسترس است. ارائه دهندگان API را مقایسه کنید
Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از طریق 6 ارائه دهنده API در دسترس است. ارائه دهندگان را مقایسه کنید
متن اصلی (انگلیسی)
Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)
Article URL: https://artificialanalysis.ai/models/claude-opus-5-5 Comments URL: https://news.ycombinator.com/item?id=49804316 Points: 266 # Comments: 77