مدل Opus 5.2 در راه است؛ اولین کاربران از پیشرفت چشمگیر مدل جدید انتروپیک میگویند
گزارشهای اولیه از آزمایش محدود نسخهی جدید Opus 5.2 حکایت دارد و کاربران از بهبود چشمگیر آن در استدلال و انجام وظایف طولانی خبر میدهند.
گزارشهای اولیه از آزمایش محدود نسخهی جدید Opus 5.2 حکایت دارد و کاربران از بهبود چشمگیر آن در استدلال و انجام وظایف طولانی خبر میدهند.
هنوز مدت زیادی از عرضه Claude Opus 5 نگذشته است، اما ظاهراً انتروپیک خود را برای معرفی نسخه جدیدی از این مدل آماده میکند. گزارشهای چند روز اخیر از آزمایش محدود مدلی با نام Claude Opus 5.2 حکایت دارند؛ مدلی که برخی از افرادی که به آن دسترسی پیدا کردهاند، از پیشرفت محسوسش در استدلال، انجام وظایف طولانی، کار با ابزارها مخصوصا Computer Use خبر میدهند.
انتروپیک هنوز Opus 5.2 را رسما تأیید نکرده و جزئیاتی از قیمت، API یا تاریخ عرضه آن ارائه نداده است؛ مستندات رسمی این شرکت همچنان Opus 5 (معرفیشده در ۲ مرداد ۱۴۰۵) را جدیدترین مدل فعال نشان میدهند. بااینحال، گزارش برخی کاربران Claude Code مبنی بر هدایت درخواستهای Opus 5 به نسخهای جدیدتر، از احتمال آزمایش محدود یا عرضه تدریجی Opus 5.2 حکایت دارد.
یکی از کاربرانی که میگوید حدود دو روز با Opus 5.2 کار کرده، مهمترین پیشرفت مدل را درک بهتر منظور واقعی کاربر توصیف میکند. براساس تجربه او، مدل برای فهمیدن هدف نهایی صرفاً به دستور صریح وابسته نیست و میتواند از جزئیات و نشانههای غیرمستقیم موجود در درخواست نیز برای تشخیص نتیجه مورد انتظار استفاده کند.
این موضوع در انجام وظایف پیچیده و چندمرحلهای اهمیت بیشتری پیدا میکند. به گفته این کاربر، Opus 5.2 جزئیات درخواست را با دقت دنبال میکند، اما برخلاف برخی مدلهای استدلالی، درگیر کارهای جانبی و غیرضروری نمیشود و بهتر میتواند روی هدف اصلی باقی بماند.
یکی دیگر از تغییرات قابل توجه به استقامت مدل در انجام پروژههای طولانی مربوط میشود. یکی از تسترها میگوید مجموعهای شامل هشت وظیفه بزرگ را به مدل سپرده و Opus 5.2 بدون توقفهای مکرر برای پرسیدن سؤالهای غیرضروری، کارها را تا رسیدن به وضعیت قابل استفاده پیش برده و سپس خروجی خود را نیز بررسی کرده است.
گزارش دیگری نیز Opus 5.2 را نسبت به Opus 5 سریعتر توصیف میکند و میگوید مدل تمایل بیشتری به ادامهدادن وظایف طولانی دارد؛ رفتاری که در صورت تأیید میتواند برای استفاده از Claude Code در پروژههای نرمافزاری بزرگ اهمیت زیادی داشته باشد.
یکی از بخشهایی که بیشترین تحسین را در تجربه اولیه کاربران دریافت کرده، نحوه استفاده Opus 5.2 از ابزارها است.
مدلهای ایجنتیک برای انجام پروژههای واقعی معمولاً به مجموعهای از ابزارها، Skills، پلاگینها و سرورهای MCP دسترسی دارند. یکی از مشکلات رایج این است که مدل در ابتدای کار زمان و توکن زیادی را صرف بررسی تمام ابزارهای در دسترس میکند، حتی زمانی که بخش بزرگی از آنها ارتباطی با وظیفه ندارد.
یکی از تسترهای Opus 5.2 میگوید مدل جدید رفتار متفاوتی دارد و ظاهراً بهتر تشخیص میدهد چه ابزاری را در چه زمانی باید فراخوانی کند . در برخی وظایف حتی ممکن است تا مراحل پایانی کار نیازی به MCP یا پلاگین نبیند و تنها زمانی سراغ آن برود که استفاده از ابزار واقعاً برای تکمیل وظیفه ضروری باشد.
اگر این رفتار در نسخه نهایی نیز حفظ شود، میتواند علاوهبر افزایش سرعت، مصرف توکن و هزینه اجرای Agentها را هم کاهش دهد.
ابزار Computer Use و کنترل مرورگر نیز ظاهراً یکی دیگر از حوزههایی است که در Opus 5.2 پیشرفت زیادی داشته است.
یکی از افرادی که نسخه جدید را آزمایش کرده، عملکرد اولیه آن در کار با کامپیوتر و مرورگر را حتی بهتر از Astra توصیف میکند. البته این مقایسه فعلاً صرفاً بر اساس تجربه شخصی است و هیچ بنچمارک مستقلی برای تأیید آن وجود ندارد.
Opus 5 فعلی نیز از زمان عرضه یکی از نقاط تمرکز اصلی انتروپیک در وظایف Agentic و Computer Use بوده است. خود انتروپیک هنگام رونمایی از این مدل اعلام کرد Opus 5 در آزمایش OSWorld 2.0 عملکرد قدرتمندی داشته و برای انجام وظایف چندمرحلهای و بررسی و اصلاح نتیجه کار طراحی شده است.
گزارشهای اولیه درباره Opus 5.2 نشان میدهند انتروپیک احتمالاً این قابلیتها را در نسخه جدید بیش از پیش تقویت کرده است.
یکی از انتقادهایی که برخی کاربران نسبت به مدلهای Agentic دارند، انجام تغییراتی است که مستقیماً از مدل خواسته نشده است؛ خصوصاً هنگام توسعه رابط کاربری که مدل ممکن است علاوهبر اجرای درخواست، طراحی صفحه یا کامپوننتها را نیز براساس سلیقه خودش تغییر دهد.
یکی از تسترها میگوید Opus 5.2 در این زمینه رفتار محافظهکارانهتر و دقیقتری دارد. به گفته او، مدل در پروژههای UI بیشتر به Design System، کامپوننتهای موجود و سبک کلی پروژه وفادار میماند و کمتر تلاش میکند بخشهایی را که نیازی به تغییر ندارند از نو طراحی کند.
این ویژگی برای توسعهدهندگانی که از AI روی کدبیسهای بزرگ و موجود استفاده میکنند، میتواند بهاندازه افزایش توانایی برنامهنویسی اهمیت داشته باشد.
بهبود بهرهوری Context یکی دیگر از مواردی است که کاربران اولیه به آن اشاره کردهاند.
یکی از تسترها میگوید Opus 5.2 پس از انجام حجم بزرگی از وظایف، تنها حدود ۶۰ درصد Context موجود در Session را مصرف کرده است. او عملکرد مدل در این زمینه را بهمراتب بهتر از Fable 5.1 توصیف میکند که برای حجم مشابهی از کار ممکن بود چند مرتبه نیازمند فشردهسازی Context باشد.
مدیریت زیرعاملها نیز ظاهراً پیشرفت کرده است. براساس تجربه همین کاربر، Opus 5.2 بهتر تشخیص میدهد چه زمانی یک وظیفه باید به Agent دیگری واگذار شود تا چند بخش کار بهصورت موازی پیش بروند و چه زمانی انجام مستقیم کار انتخاب بهتری است.
در یکی از تجربههای جالب گزارششده، Opus 5.2 بهعنوان زیرعامل زیر نظر Fable 5.1 فعالیت میکرد؛ اما پس از دریافت وظیفه متوجه مشکلات موجود در دستور Agent اصلی شد، ایرادها را مشخص کرد و پیش از شروع اجرای کار خواستار اصلاح آنها شد.
چنین رفتاری در صورت تکرارپذیر بودن میتواند نشانه مهمی از پیشرفت مدلها در تقسیم کار، کنترل کیفیت و همکاری میان چند Agent باشد.
فعلاً باید منتظر معرفی رسمی انتروپیک و انتشار بنچمارکها بمانیم تا مشخص شود تجربه مثبت کاربران اولیه تا چه اندازه در نسخه عمومی Opus 5.2 نیز تکرار خواهد شد.