پرش به محتوای اصلی

Livenerf: آیا Opus 5.5 هنوز عصب کشی شده است؟

هکرنیوز۱۴۰۵ مهر ۸, چهارشنبه، ساعت ۰۲:۰۶حدود 6 دقیقه مطالعه

آدرس مقاله: https://github.com/ninjahawk/livenerf آدرس نظرات: https://news.ycombinator.com/item?id=49901736 امتیاز: 315 # نظرات: 136

یک معیار بلندمدت و قطعی در حد امکان برای تشخیص اینکه آیا یک مدل مرزی پس از راه اندازی بی سر و صدا بدتر می شود یا خیر.

📋 طرح · 📊 نتایج · 🔬 نحوه کار · 🧪 پیش ثبت نام

linerf یک معیار کوچک، خسته کننده و تنها برای یک سوال است: آیا یک مدل پس از ارسال بدتر می شود؟ برای ماه‌ها گزارش‌هایی مبنی بر مدل‌های «نرفس» آنتروپیک چند روز یا چند هفته پس از عرضه وجود دارد. این می تواند به معنای کوانتیزاسیون، یک مدل کوچکتر در پشت همان نام، تلاش کمتر یا تغییرات مسیریابی باشد. همچنین می‌تواند به این معنی باشد که هیچ اتفاقی نیفتاده است و مردم در حال تطبیق الگوی نویز هستند. هیچ کس یک خط پایه روز صفر تمیز برای بررسی نداشته است، بنابراین هر بحثی به عنوان vibes در مقابل vibes ختم می شود.

Claude Opus 5.5 در 22/09/2026 منتشر شد، بنابراین این فرصتی است برای شروع ساعت در روز راه اندازی و ادامه آن. در حال حاضر v0 با اشتراک Claude Max از طریق Claude Code بدون هد (claude -p)، بدون کلید API اجرا می‌شود. شما نمی توانید این مدل ها را قطعی کنید: پارامترهای نمونه برداری از بین رفته اند و تفکر نمی تواند خاموش شود. بنابراین لینرف هر چیز دیگری را قطعی می‌کند: درخواست‌های منجمد، CLI سنجاق‌شده، گریدکننده‌های دقیق، سیاهه‌های نگاری خام برای همیشه. سپس حرکت آماری هزاران نمونه را اندازه گیری می کند. این بر اساس Inspect، چارچوب ارزیابی منبع باز موسسه امنیت هوش مصنوعی بریتانیا ساخته شده است.

این آمار به دنبال افزودن نوارهای خطای خود Anthropic به Evals است، بنابراین چیزی برای بحث وجود ندارد.

برای سؤالات مربوط به مخزن، یک موضوع در برگه بحث یا مشکل باز کنید.

سریال در حال اجراست روز اول 2026-09-24 ساعت 22:10 UTC بود، حدود 2.5 روز پس از راه اندازی. یک بار در روز به مدت 30 روز اجرا می شود: روزهای 1 تا 10 خط پایه است، سپس دو پنجره 10 روزه وجود دارد، بنابراین اولین تماس ممکن حدود 24-10-2026 است. اولین ردیف نتایج پس از روز 20 فرود می‌آید. پانل تحت یک پروتکل از پیش ثبت‌شده (v2) انتخاب، تأیید، قفل و اعتبارسنجی شد. هر عدد زیر از گزارش‌های موجود در docs/CALIBRATION.md ایجاد می‌شود.

پیشرفت (29-09-2026): 6 روز از 30 روز جمع آوری شد (خط پایه 6 از 10)، هیچ کدام از دست نرفته اند. در تمام 6 روز، 90 نمونه کامل روی همان هش مهار (461391b6fce64167) اجرا شد و CLI (2.1.280) پین شد. روز 5 در حالی اجرا شد که محافظ بودجه یک بار لغو شد (به گزارش انحرافات مراجعه کنید).

اصلی‌ترین چیزی که این مخزن حفظ خواهد کرد، یک جدول 10 روزه در حال اجرا از عملکرد Opus 5.5 در پنل معیار کالیبره شده نسبت به پایه هفته راه‌اندازی آن است. دلتای منفی به معنای بدتر از هفته پرتاب است. جدول بهبودها را با صدای بلندی مانند رگرسیون گزارش می کند.

معیار اولیه، تفاوت امتیاز زوجی در هر مورد در برابر خط پایه در پانل کالیبره شده است، با خطاهای استاندارد خوشه‌ای، بنابراین دشواری مورد کاهش می‌یابد. PRREEGISTRATION.md را ببینید. سیگنال ثانویه ای که من بیشتر به آن اهمیت می دهم، تعداد توکن های خروجی در هر نمونه است. اگر یک مدل بی سر و صدا شروع به کمتر فکر کردن کند، این جایی است که ابتدا ظاهر می شود، اغلب قبل از اینکه دقت حرکت کند.

شما به Python 3.11+، uv و نصب Claude Code نیاز دارید. v0 بر اساس اشتراک Max ساخته شده است، اما هر چیزی که بتواند کلود -p را اجرا کند کار می کند. لینوکس، macOS و ویندوز همگی پشتیبانی می شوند.

این یک Inspect پین شده را نصب می کند و ارائه دهنده مدل claudecode را ثبت می کند. ارائه دهنده یک تماس هرمتیک claude -p را انجام می دهد، بنابراین Inspect با اشتراک Max شما مانند هر API مدل دیگری رفتار می کند.

CLI را پین کنید. این اختیاری نیست: به‌روزرسانی کد Claude، هارنس را تغییر می‌دهد و مهار تغییر یافته دقیقا شبیه مدل تغییر یافته به نظر می‌رسد. به روز رسانی خودکار را خاموش کنید و نسخه ای را که پین ​​می کنید یادداشت کنید:

در صورتی که کلود --نسخه تطبیق با آن فایل را متوقف کند، رانر از اجرا خودداری می کند. Claude Code می‌تواند خود را به‌هرحال به‌روزرسانی کند، بنابراین یک کپی از باینری پین‌شده را در جایی نگه دارید که به‌روزرسانی‌کننده به آن دسترسی نداشته باشد. linerf به طور خودکار از آن استفاده می کند (یا LIVENERF_CLAUDE_CLI را روی هر مسیری تنظیم کنید):

طرح‌های Max محدودیت‌های خود را در توکن‌ها منتشر نمی‌کنند. linerf با استفاده از ورود به سیستم Claude Code محلی شما، همان درصد مترهایی را می خواند که /usage نشان می دهد (یک درخواست فقط خواندنی):

هر بودجه زیر بر حسب نقاط اندازه گیری هفتگی بیان می شود، بنابراین معیار سهم ثابتی از برنامه شما را می گیرد و هرگز با استفاده معمولی رقابت نمی کند.

طراحی و پیش ثبت نام را انجام دهید و قبل از اجرای اولین سری فشار دهید. مهر زمانی git عمومی چیزی است که به پیش ثبت نام معنای آن را می دهد. سپس تأیید کنید که همه چیز در جای خود قرار دارد: پین CLI، متر، پانل قفل شده، یک اعتبارسنجی عبوری، یک درخت فشار داده شده تمیز، و یک کاوشگر هرمسیتی زنده:

سپس ساعت را شروع کنید. کل پانل یک بار در روز به مدت 30 روز اجرا می شود، به علاوه بازوی کنترل. اگر متر هفتگی شما بالای 75٪ یا بالاتر از 60٪ باشد یا متر 5 ساعته شما بالای 60٪ باشد، از تلاش صرفنظر می شود و تا زمانی که دویدن روز به پایان برسد، هر ساعت دوباره تلاش می کند:

شما نمی‌توانید یک پاسخ را دو بار از Opus 5.5 دریافت کنید، بنابراین کل طراحی مربوط به دریافت توزیعی است که می‌توانید به آن اعتماد کنید، متوجه حرکت آن شوید و تا حد امکان محاسبات کمتری برای انجام آن صرف کنید.

نمودار هر بنچمارک، هر بازو و خانواده را بر اساس خط پایه خود، به علاوه تغییر در توکن‌های خروجی نشان می‌دهد. اگر یک مدل بی سر و صدا شروع به کمتر فکر کردن کند، تعداد نشانه ها اغلب همان جایی است که ابتدا نشان داده می شود:

نکته مهمی که باید به آن توجه داشت این است که لینرف Opus 5.5 را اندازه گیری می کند که از طریق Claude Code در یک اشتراک ارائه می شود. این چیزی است که اکثر گزارش‌های nerf در واقع به آن می‌پردازند، و با مدل خام API یکسان نیست. خط پایه هفته پرتاب نیز یک نقطه مرجع است، نه حقیقت زمینی. هفته راه‌اندازی به راحتی می‌تواند بدترین هفته باشد: پشته سرویس جدید، فشار ظرفیت، اشکالات راه‌اندازی. مشخص شد که حوادث کیفی 2025 دارای اشکالات زیرساختی هستند، نه کاهش عمدی. بنابراین لینرف تغییرات را در هر دو جهت آزمایش می کند و مکانیسمی را در نظر نمی گیرد.

قبل از هر داده سری، PRREEGISTRATION.md متعهد است. رویه انتخاب آیتم، بررسی های اعتبارسنجی، معیارهای اولیه، قانون تصمیم گیری و فهرست معیارهای ثانویه را پوشش می دهد، بنابراین مهر زمانی git عمومی است. تغییر تنها در صورتی تغییر نامیده می‌شود که بازه 99% صفر را در دو پنجره 10 روزه متوالی حذف کند و اثر حداقل 3 نقطه باشد و بازوی کنترل حرکت یکسانی را نشان ندهد. نتایج تهی منتشر می شود. پس اصلاحات را انجام دهید.

هدف لینرف از روی عمد محدود است: یک مدل، یک مهار، یک سری زمانی تمیز که وقتی کسی متخاصم آن را می‌خواند، پابرجا می‌ماند. این یک تابلوی امتیازات و یک چارچوب ارزیابی نیست. یک کار فقط زمانی متعلق به اینجاست که دقیقا قابل درجه بندی باشد، در باند 30 تا 70 درصد قرار گیرد و به اندازه کافی ارزان باشد که بتوان هر روز اجرا کرد. هر تغییری در یک کار، درخواست یا درجه بندی، یک نسخه جدید ایجاد می کند و هرگز بی سر و صدا جایگزین نسخه قبلی نمی شود.

موارد پنل ثابت خصوصی می‌مانند (فقط هش‌های آنها منتشر می‌شود)، بنابراین لطفا مواردی را که مواردی را به آن اضافه می‌کنند باز نکنید. روابط عمومی که مولدهای رویه‌ای، درجه‌بندی یا تحلیل اضافه می‌کنند بسیار استقبال می‌شوند.

سیاست فعلی هوش مصنوعی: افشاگری هنگام ارسال یک PR، لطفا هر قسمتی را که سهم قابل توجهی در LLM داشته است، اعلام کنید. ارزش گفتن با صدای بلند: بسیاری از این مخزن با کمک کلود نوشته شده است که مدلی است که اندازه گیری می شود. دقیقا به همین دلیل است که درجه‌بندی‌ها توابع خالص هستند، آستانه‌ها از قبل ثبت‌شده هستند و داده‌های خام عمومی هستند. شما نباید به نویسنده اعتماد کنید، انسان یا غیره.

اگر لینرف را در تحقیقات خود مفید می‌دانید، به سادگی به این موارد اشاره کنید:

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Livenerf: Has Opus 5.5 been nerfed yet?

Article URL: https://github.com/ninjahawk/livenerf Comments URL: https://news.ycombinator.com/item?id=49901736 Points: 315 # Comments: 136

همه‌ی اخبار اقتصاد