پرش به محتوای اصلی

هوش، عملکرد و قیمت کلود اپوس 5.5 (حداکثر)

هکرنیوز۱۴۰۵ شهریور ۳۱, سه‌شنبه، ساعت ۲۰:۲۱حدود 4 دقیقه مطالعه

آدرس مقاله: https://artificialanalysis.ai/models/claude-opus-5-5 آدرس نظرات: https://news.ycombinator.com/item?id=49804316 امتیاز: 266 # نظرات: 77

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیش‌فرض بازگشت) در میان مدل‌های پیشرو در هوشمندی است، اما در مقایسه با مدل‌های دیگر با قیمت مشابه، تا حدودی گران است. این مدل از ورودی متن و تصویر پشتیبانی می کند، متن را خروجی می دهد و دارای یک پنجره زمینه 1M توکن است.

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش‌فرض) امتیاز 58 را در شاخص هوش مصنوعی تحلیل می‌کند و آن را بسیار بالاتر از میانگین در بین مدل‌های قابل مقایسه قرار می‌دهد (میانگین: 25). هنگام ارزیابی شاخص هوش، 260 میلیون توکن تولید کرد که در مقایسه با میانگین 88 میلیون بسیار پرمخاطب است.

این صفحه نسخه استدلالی این مدل را نشان می دهد.

معیارها با مدل های هم کلاس مقایسه می شوند:

نمایه هوش تحلیل مصنوعی نسخه 4.3.2 شامل: AA-Briefcase v1.1، GDPval-AA v2.1، AutomationBench-AA، Terminal-Bench 4.0، SciCode، Humanity's Last Exam، GDP.pdf، CritPt، AA-Omnisciencer، AA-Omniscience برای جزئیات بیشتر، از جمله تجزیه و تحلیل هر ارزیابی و نحوه اجرای آنها، به روش‌شناسی شاخص هوش مراجعه کنید.

نشان می دهد که آیا وزن مدل موجود است یا خیر. اگر استفاده تجاری توسط شرایط محدود شود، مدل‌ها با عنوان «محدودیت استفاده تجاری» و اگر مجوز استفاده تجاری را ممنوع کند، به عنوان «غیر تجاری» برچسب‌گذاری می‌شوند.

عملکرد مدل ها را بر روی قابلیت ها و صنایع خاص اندازه گیری می کند

وظایف کاری در دنیای واقعی نماینده، (Elo-500)/2000

تجزیه و تحلیل کمی در صفحات گسترده و اسناد

در حالی که هوش مدل به طور کلی در موارد استفاده ترجمه می شود، ارزیابی های خاص ممکن است برای موارد استفاده خاص مرتبط تر باشد.

AA-Briefcase Elo یک معیار ترکیبی است که Elo با کیفیت تحلیلی، Elo ارائه، و نرخ پاس روبریک را جمع‌آوری می‌کند، با عملکرد روبریک که از طریق تطبیق‌های سر به سر مصنوعی به Elo تبدیل می‌شود. کرانهای Elo و فاصله اطمینان 95% در 0 بسته می شوند.

شاخص AA-Omniscience (بالاتر بهتر است) قابلیت اطمینان دانش و توهم را اندازه گیری می کند. به پاسخ های صحیح پاداش می دهد، توهمات را جریمه می کند و برای امتناع از پاسخ هیچ مجازاتی ندارد. نمرات از 100- تا 100 متغیر است، که در آن 0 به معنای تعداد پاسخ های صحیح به اندازه پاسخ های نادرست است، و نمرات منفی به معنای بیشتر نادرست از صحیح است.

میانگین وزنی هزینه هر کار شاخص هوش. هزینه هر ارزیابی از قیمت ورودی، ضربه حافظه پنهان، نوشتن حافظه پنهان، استدلال و قیمت نشانه پاسخ، تقسیم بر تعداد کار، و وزن آن بر وزن شاخص هوش محاسبه می شود.

تعداد نشانه های مورد نیاز برای هر کار شاخص هوش. این با ضرب نشانه‌های خروجی در هر ارزش در وزن‌های نسبی هر معیار در شاخص هوش، و سپس تقسیم بر تعداد کار (به استثنای تکرارها) محاسبه می‌شود.

هزینه اجرای ارزیابی‌ها در شاخص هوش مصنوعی، با استفاده از ورودی مدل، ضربه حافظه پنهان، نوشتن در حافظه پنهان، استدلال و قیمت نشانه‌های پاسخ و تعداد نشانه‌های استفاده شده در ارزیابی‌ها (به استثنای تکرارها) محاسبه می‌شود.

قیمت هر توکن برای درخواست‌های ذخیره‌شده (که قبلا پردازش شده‌اند)، معمولا تخفیف قابل‌توجهی را در مقایسه با قیمت ورودی معمولی ارائه می‌دهند که به صورت USD در هر میلیون توکن نشان داده می‌شود. مقادیری که در اینجا نشان داده شده است، قیمت ضربه در حافظه پنهان است. نوشتن در حافظه پنهان و ذخیره سازی حافظه پنهان به طور جداگانه صورتحساب می شوند و بر اساس ارائه دهنده متفاوت است - برای جزئیات بیشتر به "قیمت کش توسط ارائه دهنده" مراجعه کنید.

پنجره‌های زمینه بزرگ‌تر مربوط به RAG (Retrieval Augmented Generation) LLM هستند که معمولا شامل استدلال و بازیابی اطلاعات مقادیر زیادی داده می‌شود.

حداکثر تعداد توکن های ورودی و خروجی ترکیبی. نشانه‌های خروجی معمولا دارای حد قابل توجهی پایین‌تر هستند (بر اساس مدل متفاوت است).

سوالات متداول در مورد Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض)

Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) در 22 سپتامبر 2026 منتشر شد.

Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) توسط Anthropic ساخته شده است.

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیش‌فرض بازگشت) امتیاز 58 را در شاخص هوش مصنوعی تحلیل می‌کند و آن را بسیار بالاتر از میانگین در بین مدل‌های استدلالی دیگر در سطح قیمتی مشابه (میانگین: 25) قرار می‌دهد.

وقتی کلود اوپوس 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش‌فرض) بر روی شاخص هوش ارزیابی شد، 260 میلیون توکن خروجی تولید کرد که در مقایسه با سایر مدل‌های استدلال در سطح قیمتی مشابه (متوسط: 88 میلیون) در بالاترین سطح قرار دارد.

بله، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیش فرض بازگشت) یک مدل استدلال است. از تفکر گسترده یا استدلال زنجیره‌ای از فکر برای حل مشکلات پیچیده قبل از ارائه پاسخ استفاده می‌کند.

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از ورودی متن و تصویر پشتیبانی می کند.

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از خروجی متن پشتیبانی می کند.

بله، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از ورودی تصویر پشتیبانی می کند و می تواند تصاویر را تجزیه و تحلیل، توصیف و پاسخ دهد.

بله، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) چند وجهی است. این می تواند ورودی متن و تصویر را پردازش کند و خروجی متن تولید کند.

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) دارای یک پنجره زمینه از 1.0 میلیون توکن است. این تعیین می‌کند که مدل چقدر می‌تواند در یک درخواست پردازش کند.

خیر، Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیش‌فرض بازگشت) اختصاصی است. وزن مدل به صورت عمومی در دسترس نیست.

Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) یک مدل اختصاصی است و Anthropic اندازه مدل یا تعداد پارامترها را فاش نکرده است.

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، پیش‌فرض عقب‌نشینی) امتیاز 58 را در شاخص هوش تحلیل مصنوعی کسب می‌کند. این معیار ترکیبی مدل‌ها را در استدلال، دانش، ریاضیات و کدگذاری ارزیابی می‌کند.

بله، Claude Opus 5.5 (Adaptive Reasoning، Max Effort، Default Fallback) از طریق API از طریق 6 ارائه دهنده در دسترس است. ارائه دهندگان API را مقایسه کنید

Claude Opus 5.5 (استدلال تطبیقی، حداکثر تلاش، بازگشت پیش فرض) از طریق 6 ارائه دهنده API در دسترس است. ارائه دهندگان را مقایسه کنید

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)

Article URL: https://artificialanalysis.ai/models/claude-opus-5-5 Comments URL: https://news.ycombinator.com/item?id=49804316 Points: 266 # Comments: 77

همه‌ی اخبار فناوری