جیوز. استدلال مدلهای تصمیمگیری شبیه Jev را بهبود میبخشد
آدرس مقاله: https://github.com/PostHog/jeeves آدرس نظرات: https://news.ycombinator.com/item?id=49891290 امتیاز: 239 # نظرات: 93
یک طبقهبندیکننده استدلالی به سبک Jev با پیشنویس انتشار، آموزشدیده با SFT و CISPO.
مدلهای Jev مانند احتمالات تصمیم کالیبره شده را ارائه میدهند، اما با دقت پایین. بنابراین، بسیاری از خطوط لوله بر یک مدل استدلال به عنوان یک بازگشت متکی هستند. Jeeves یک Qwen3.5-9B شبیه Jev (LoRA و یک سر اشاره گر) را با استفاده از CISPO برای استدلال قبل از تصمیم گیری آموزش می دهد.
این منجر به عملکرد بهتر در کارهای خارج از دامنه می شود و بهتر از Jev در JevBench سخت (عمومی) عمل می کند.
دقت با تفکر، حریص، سرپوش 2560 توکن. ستونهای Kev-9B و Jev اعدادی هستند که Kev منتشر میکند.
* هیچ نتیجه ای از Kev-9B JevBench منتشر نشده است. اینها Kev-8B (Qwen3) هستند.
همه شمارههای JevBench در سطوح آسان، استاندارد و سخت عمومی (231 مورد) قرار دارند. ردیف داور مهر و موم شده شامل نمی شود، و اعداد Jev و Kev به همان موارد عمومی محدود می شوند.
بدون فکر کردن، همان ایست بازرسی در تقسیم تست ما (2962 مورد) 0.804 در مقابل 0.840 با آن امتیاز می گیرد.
مورد نیاز: Python 3.12 و CUDA GPU. Inference همچنین بر روی Apple Silicon Mac با 48 گیگابایت یا بیشتر اجرا می شود.
وزن های منتشر شده را دانلود و سرو کنید:
در مک، موتور روی MPS کار می کند. وزن ها از 21 گیگابایت در bf16 استفاده می کنند. کش های پیش فرض (-max-rows 8 --max-len 8192) از 28 گیگابایت دیگر استفاده می کنند، بنابراین یک مک 48 گیگابایتی شروع به تعویض می کند. از کش های کوچکتر استفاده کنید:
در M4 Pro، یک سوال در حدود 20 توکن در ثانیه فکر می کند و یک درخواست بدون فکر 0.3 تا 0.5 ثانیه طول می کشد.
--precision fp8 لایه های خطی را مانند CUDA کوانتیزه می کند و آنها را با یک هسته Metal w8a16 اجرا می کند. فعالسازیها در هر اندازهای bf16 باقی میمانند، در حالی که CUDA آنها را بالای 256 ردیف کوانتیزه میکند. سپس وزن ها از 11.5 گیگابایت استفاده می کنند و یک سوال حدود 31 توکن در ثانیه را در نظر می گیرد. خروجی ها کمی تغییر می کنند. در سوالات برنامه نویس، دقت و NLL به طور قابل اندازه گیری تغییر نکرد.
python -m model.metal_test هسته های فلزی را در برابر float64 و مراجع مشتاق بررسی می کند. python speed.py --model jeeves-weights --data data/dev.jsonl بار مجموعه ای ثابت از درخواست های توسعه دهنده. python -m prep.prep داده ها را می سازد/ .
یا پست بازرسی آموزش دیده خود را در یک مدل مستقل ترکیب کنید و آن را با پیش نویس سرو کنید:
پاسخ به یک H100 با --precision fp8، با سه سوال به صورت موازی:
sdk/ جایگزینی برای Jev's Python SDK (typesafe-sdk) است:
کلاینت به طور پیش فرض به http://127.0.0.1:8009 (یا JEEVES_BASE_URL ) متصل می شود، به کلید API نیاز ندارد و تا 120 ثانیه منتظر می ماند.
گزینه ها اختیاری است و توسط مشتریان Jev که آن را ارسال نمی کنند نادیده گرفته می شوند. پیشفرضهای سرتاسر سرور با پرچمهای سرویس منطبق تنظیم میشوند.
در 325 سؤال برنامه نویس، در یک H100 با --precision fp8:
سوالات، وضعیت ها و پاسخ ها در قالب چت Qwen بارگذاری می شوند
سپس مدل زنجیره استدلال خود را باز می کند و پس از نشانه </think> ما اضافه می کنیم
یک سر اشاره گر هر گزینه را با یک محصول نقطه مقیاس شده بین یک طرح پرس و جو از حالت پنهان در <decide> و یک طرح کلیدی از حالت پنهان در آن گزینه امتیاز می دهد، که در آن </opt>
اینها توکنهای کمیاب و عمدتا بدون استفاده در توکنایزر Qwen هستند. Ablations دریافت که استفاده از متن ساده مانند "State" در اعلان به جای آن عملکرد را بدتر می کند. به همین ترتیب، تکرار نکردن سوالات بعد از بلوک استدلال نیز باعث کاهش عملکرد می شود. احتمالات نهایی یک softmax بر امتیاز گزینه است که بر دمایی که در مجموعه توسعه داده شده تقسیم می شود.
توقف در مرحله 402 بهترین کالیبراسیون و امتیاز توسعه دهنده را حفظ می کند. از کنار آن، سر روی حوضچه RL اشباع شده بیش از حد تیز می شود.
نمای انتشاری مدل منجمد (طراح/)، الهام گرفته از Orthrus.
برخلاف Orthrus که از مدلهای فقط توجه پشتیبانی میکند، از لایههای Gated DeltaNet Qwen3.5 با اجازه دادن به توکنهای ماسک به کلیدها و مقادیر پس از پیچیدگی آن لایهها پشتیبانی میکند.
بلوک 4 پیشفرض است زیرا وقتی چندین سؤال دستهبندی میشوند ارزان میماند.
شما می توانید مجموعه داده ها را به صورت محلی با استفاده از اسکریپت های آماده سازی بسازید. این مجموعه دادههای عمومی را از Hugging Face در ویرایشهای پینشده در prep/public.py دانلود میکند:
هر مجموعه داده عمومی تحت مجوز خود باقی می ماند.
در 8 پردازنده گرافیکی، با داده ها در داده/، bash run.sh کل خط لوله را اجرا می کند:
اگر از Jeeves، دستور العمل آموزشی یا پیش نویس آن استفاده می کنید، لطفا ذکر کنید:
متن اصلی (انگلیسی)
Jeeves. Reasoning improves Jev-like decision models
Article URL: https://github.com/PostHog/jeeves Comments URL: https://news.ycombinator.com/item?id=49891290 Points: 239 # Comments: 93