پرش به محتوای اصلی

جیوز. استدلال مدل‌های تصمیم‌گیری شبیه Jev را بهبود می‌بخشد

هکرنیوز۱۴۰۵ مهر ۷, سه‌شنبه، ساعت ۱۴:۴۳حدود 3 دقیقه مطالعه

آدرس مقاله: https://github.com/PostHog/jeeves آدرس نظرات: https://news.ycombinator.com/item?id=49891290 امتیاز: 239 # نظرات: 93

یک طبقه‌بندی‌کننده استدلالی به سبک Jev با پیش‌نویس انتشار، آموزش‌دیده با SFT و CISPO.

مدل‌های Jev مانند احتمالات تصمیم کالیبره شده را ارائه می‌دهند، اما با دقت پایین. بنابراین، بسیاری از خطوط لوله بر یک مدل استدلال به عنوان یک بازگشت متکی هستند. Jeeves یک Qwen3.5-9B شبیه Jev (LoRA و یک سر اشاره گر) را با استفاده از CISPO برای استدلال قبل از تصمیم گیری آموزش می دهد.

این منجر به عملکرد بهتر در کارهای خارج از دامنه می شود و بهتر از Jev در JevBench سخت (عمومی) عمل می کند.

دقت با تفکر، حریص، سرپوش 2560 توکن. ستون‌های Kev-9B و Jev اعدادی هستند که Kev منتشر می‌کند.

* هیچ نتیجه ای از Kev-9B JevBench منتشر نشده است. اینها Kev-8B (Qwen3) هستند.

همه شماره‌های JevBench در سطوح آسان، استاندارد و سخت عمومی (231 مورد) قرار دارند. ردیف داور مهر و موم شده شامل نمی شود، و اعداد Jev و Kev به همان موارد عمومی محدود می شوند.

بدون فکر کردن، همان ایست بازرسی در تقسیم تست ما (2962 مورد) 0.804 در مقابل 0.840 با آن امتیاز می گیرد.

مورد نیاز: Python 3.12 و CUDA GPU. Inference همچنین بر روی Apple Silicon Mac با 48 گیگابایت یا بیشتر اجرا می شود.

وزن های منتشر شده را دانلود و سرو کنید:

در مک، موتور روی MPS کار می کند. وزن ها از 21 گیگابایت در bf16 استفاده می کنند. کش های پیش فرض (-max-rows 8 --max-len 8192) از 28 گیگابایت دیگر استفاده می کنند، بنابراین یک مک 48 گیگابایتی شروع به تعویض می کند. از کش های کوچکتر استفاده کنید:

در M4 Pro، یک سوال در حدود 20 توکن در ثانیه فکر می کند و یک درخواست بدون فکر 0.3 تا 0.5 ثانیه طول می کشد.

--precision fp8 لایه های خطی را مانند CUDA کوانتیزه می کند و آنها را با یک هسته Metal w8a16 اجرا می کند. فعال‌سازی‌ها در هر اندازه‌ای bf16 باقی می‌مانند، در حالی که CUDA آنها را بالای 256 ردیف کوانتیزه می‌کند. سپس وزن ها از 11.5 گیگابایت استفاده می کنند و یک سوال حدود 31 توکن در ثانیه را در نظر می گیرد. خروجی ها کمی تغییر می کنند. در سوالات برنامه نویس، دقت و NLL به طور قابل اندازه گیری تغییر نکرد.

python -m model.metal_test هسته های فلزی را در برابر float64 و مراجع مشتاق بررسی می کند. python speed.py --model jeeves-weights --data data/dev.jsonl بار مجموعه ای ثابت از درخواست های توسعه دهنده. python -m prep.prep داده ها را می سازد/ .

یا پست بازرسی آموزش دیده خود را در یک مدل مستقل ترکیب کنید و آن را با پیش نویس سرو کنید:

پاسخ به یک H100 با --precision fp8، با سه سوال به صورت موازی:

sdk/ جایگزینی برای Jev's Python SDK (typesafe-sdk) است:

کلاینت به طور پیش فرض به http://127.0.0.1:8009 (یا JEEVES_BASE_URL ) متصل می شود، به کلید API نیاز ندارد و تا 120 ثانیه منتظر می ماند.

گزینه ها اختیاری است و توسط مشتریان Jev که آن را ارسال نمی کنند نادیده گرفته می شوند. پیش‌فرض‌های سرتاسر سرور با پرچم‌های سرویس منطبق تنظیم می‌شوند.

در 325 سؤال برنامه نویس، در یک H100 با --precision fp8:

سوالات، وضعیت ها و پاسخ ها در قالب چت Qwen بارگذاری می شوند

سپس مدل زنجیره استدلال خود را باز می کند و پس از نشانه </think> ما اضافه می کنیم

یک سر اشاره گر هر گزینه را با یک محصول نقطه مقیاس شده بین یک طرح پرس و جو از حالت پنهان در <decide> و یک طرح کلیدی از حالت پنهان در آن گزینه امتیاز می دهد، که در آن </opt>

اینها توکن‌های کمیاب و عمدتا بدون استفاده در توکنایزر Qwen هستند. Ablations دریافت که استفاده از متن ساده مانند "State" در اعلان به جای آن عملکرد را بدتر می کند. به همین ترتیب، تکرار نکردن سوالات بعد از بلوک استدلال نیز باعث کاهش عملکرد می شود. احتمالات نهایی یک softmax بر امتیاز گزینه است که بر دمایی که در مجموعه توسعه داده شده تقسیم می شود.

توقف در مرحله 402 بهترین کالیبراسیون و امتیاز توسعه دهنده را حفظ می کند. از کنار آن، سر روی حوضچه RL اشباع شده بیش از حد تیز می شود.

نمای انتشاری مدل منجمد (طراح/)، الهام گرفته از Orthrus.

برخلاف Orthrus که از مدل‌های فقط توجه پشتیبانی می‌کند، از لایه‌های Gated DeltaNet Qwen3.5 با اجازه دادن به توکن‌های ماسک به کلیدها و مقادیر پس از پیچیدگی آن لایه‌ها پشتیبانی می‌کند.

بلوک 4 پیش‌فرض است زیرا وقتی چندین سؤال دسته‌بندی می‌شوند ارزان می‌ماند.

شما می توانید مجموعه داده ها را به صورت محلی با استفاده از اسکریپت های آماده سازی بسازید. این مجموعه داده‌های عمومی را از Hugging Face در ویرایش‌های پین‌شده در prep/public.py دانلود می‌کند:

هر مجموعه داده عمومی تحت مجوز خود باقی می ماند.

در 8 پردازنده گرافیکی، با داده ها در داده/، bash run.sh کل خط لوله را اجرا می کند:

اگر از Jeeves، دستور العمل آموزشی یا پیش نویس آن استفاده می کنید، لطفا ذکر کنید:

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Jeeves. Reasoning improves Jev-like decision models

Article URL: https://github.com/PostHog/jeeves Comments URL: https://news.ycombinator.com/item?id=49891290 Points: 239 # Comments: 93

همه‌ی اخبار فناوری