جف – مدلهای تصمیمگیری 0.8B سازگار با Jev، آموزشدیده در خانه، ~30 میلیثانیه
آدرس مقاله: https://github.com/firelex/jeff آدرس نظرات: https://news.ycombinator.com/item?id=49883844 امتیاز: 222 # نظرات: 71
تنظیم دقیق Qwen3.5 و Gemma 4 برای طبقه بندی صفر شات: مدل های تصمیم گیری کوچک و سریعی که در کد خود جای می دهید، با همان فرمت درخواستی Jev. شما یک موقعیت را توصیف می کنید و گزینه ها را با کلمات ساده فهرست می کنید. جف یک احتمال کالیبره شده را برای هر گزینه از یک پاس رو به جلو برمی گرداند. بدون متن تولید شده، بدون تجزیه: حدود 22 میلیثانیه در هر تصمیم در RTX PRO 6000 و 28 میلیثانیه در Apple M4 Max (MLX).
شات صفر به این معنی است که گزینهها میتوانند هر چیزی باشند: صفهای پشتیبانی، اهداف کاربر، برچسبهای تعدیل، دستورات صوتی، حرکات بازی. لازم نیست دسته های شما در داده های آموزشی ظاهر شوند. شما آنها را توصیف می کنید و جف انتخاب می کند.
چه هست و چه نیست. اینها مدلهای بسیار کوچکی هستند. آنها تماس های قضاوت بسیار سریع و خوب کالیبره شده بین گزینه ها برقرار می کنند و به راحتی در کد محلی شما قرار می گیرند. در معیارها آنها به Jev نزدیک می شوند و گاهی اوقات آنها را شکست می دهند. اما در این اندازه استدلال آنها با Jev's مطابقت نخواهد داشت، که در مدلی بسیار بزرگتر اجرا می شود. اگر دقت عکس صفر به اندازه کافی برای اهداف شما خوب نیست، تنظیم دقیق نمونههای خود شما را بسیار فراتر میبرد: تنظیم دقیق ناوبری صوتی ما در کمتر از نیم ساعت در یک GPU، دقت ثابت را از 31.7% به 95.8% منتقل کرد.
به طور کامل بر روی سخت افزار محلی ساخته شده است. آموزش روی یک GPU ایستگاه کاری RTX PRO 6000 (0.8B در حدود 2 ساعت، 2B در حدود 3.5)، تمام داده های آموزشی مصنوعی نوشته شده توسط یک مدل باز (Qwen3.8-Flash-Next) روی دو DGX Sparks، تست روی مک بوک. بدون پردازنده گرافیکی ابری و بدون خروجی مدل بسته در داده های آموزشی. یک مدل بسته تنها برای بررسی نقطهای کیفیت نمونهای از دادههای مصنوعی استفاده شد.
پروژه مستقل جف از همان فرمت درخواستی Jev استفاده میکند، اما به TypeSafe، سازندگان Jev، وابسته یا تایید نشده است. کد آموزشی ما از دستور منبع باز AutoJev شروع می شود.
مدل های روی صورت در آغوش گرفته: Jeff-Qwen3.5-0.8B · Jeff-Qwen3.5-2B · Jeff-Gemma4-E2B
هر پاسخ دارای یک احتمال برای هر گزینه، گزینه انتخاب شده و یک اطمینان است. سه نوع سوال: انتخابی (یکی از حداکثر 255 گزینه را انتخاب کنید)، منفی (بله/خیر، به صورت احتمال برگردانده شده است) و امتیاز (یک امتیاز در مقیاسی که شما توضیح می دهید). چندین سوال مستقل در یک درخواست با هم پاسخ داده می شود.
4599 سؤال از پنج معیار عمومی، بهعلاوه ردیف سخت عمومی JevBench (105 مورد، امتیازدهی جداگانه):
پررنگ: برنده جف در مقابل جیو در هر ردیف. مورب پررنگ: AutoJev-27B که در آن بهترین مدل در ردیف است (در RAGTruth، با Jeff-Qwen3.5-2B گره خورده است). برای مرجع نشان داده شده است، زیرا مقایسه سر به سر با Jev است. ارقام منتشر شده Jev و AutoJev بر روی نمونه متفاوتی از معیارهای مشابه اندازه گیری شدند. امتیاز کلی جف از طبقهبندی و زمینگیری به دست میآید، جایی که با مدلهای بزرگ مطابقت میکند یا میبیند. در معیارهای استدلال سنگین (BBH، JudgeBench، JevBench) بسیار پایین تر از آنها باقی می ماند، همانطور که در این اندازه انتظار دارید.
برای آزمایش عملکرد ضربه صفر در وظایف بر خلاف هر چیزی در بنچمارک ها، جف را سه بازی انجام دادیم. بازیها آزمون صفر شات ایدهآل نیستند، زیرا وضعیت یک بازی دادههای بدون ساختار معمولی نیست. اما آنها یک روش معمول و سرگرم کننده برای آزمایش مدل سیستم 1 هستند. در هر نوبت، کد وضعیت و حرکات قانونی را با کلمات توصیف می کند و مدل یکی را انتخاب می کند. گزینهها بیان میکنند که هر حرکت به چه چیزی منتهی میشود (Frogger: "شما با یک ماشین برخورد میکنید و یک زندگی را از دست میدهید"؛ Doom: "نزدیکترین هیولا کمی به سمت چپ شما است")، اما هرگز کدام حرکت درست نیست.
هر نتیجه 20 قسمت است، 1234; ▶ ویدیویی از قسمت اول اجرا را باز می کند.
Jeff-Qwen3.5-0.8B در حال پخش، شات صفر (ردیف پررنگ در جدول زیر؛ برای ویدیوی کامل روی یک کلیپ کلیک کنید):
Jeff-0.8B در 29-49 ms در هر حرکت در M4 Max تصمیم می گیرد. اجرای Doom منتشر شده توسط Jev 212 میلی ثانیه در هر تماس از طریق API آن طول کشید. دو زمان بر روی یک سخت افزار اندازه گیری نشد. برای اینکه خودتان آنها را بازی کنید:
میانه زمان هر تصمیم بر روی 200 سوال معیار (هر کدام حدود 200 نشانه ورودی)، هر بار یک سوال، از متن خام تا احتمالات:
خط لوله کامل (دادههای مصنوعی از یک معلم محلی، فیلتر نشت، جابجاییهای نرخ یادگیری، داشبورد) در scripts/train_all.sh و هر منبع آموزشی با مجوز آن در docs/data-sources.md توضیح داده شده است. دستور تمرین: تنظیم دقیق تمام وزن، یک دوره، دسته های 256، آنتروپی متقاطع بر روی حروف گزینه، سپس یک دمای مناسب برای کالیبراسیون. نقاط بازرسی در یک مجموعه توسعه انتخاب می شوند، نه در پانل معیار. حداقل نیمی از هر خانواده آموزشی از قراردادهای چیدمان پانل پیروی می کنند (فقط فرمت ها، هیچ مورد پانلی هرگز روی آن آموزش داده نمی شود).
جف به عنوان یک فورک AutoJev توسط Denis Yarats (مجوز MIT) شروع شد، یک دستور العمل باز که Qwen3.8-27B را به خوبی تنظیم می کند تا تصمیمات سبک Jev را بازگرداند. ما طراحی اصلی آن (یک پاس به جلو در هر تصمیم، یک بازخوانی پاسخ آموزشدیده، دمای مناسب برای کالیبراسیون) را حفظ کردیم و بر روی آن ساختیم: دانشآموزان کوچک (0.8B و 2B Qwen، Gemma 4 E2B)، خط لوله دادههای مصنوعی محلی با فیلتر نشت، طرحبندیهای سریع برای تنظیم دقیق دامنه، سرویس MLX آموزشی در صفحه آزمایشی Apple. اعلامیه حق چاپ اصلی در LICENSE نگهداری می شود.
کد: MIT (از جمله AutoJev). وزن مدل: آپاچی 2.0. مهار عذاب اقتباس شده از jev-plays-doom (MIT). داده های آموزشی: کارت داده را ببینید. هر منبع مجوز خود را حفظ می کند و در docs/data-sources.md فهرست شده است. ما وزن ها و کدها را منتشر می کنیم، نه داده های آموزشی. برخی از منابع مشابه هستند (CC BY-SA).
متن اصلی (انگلیسی)
Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms
Article URL: https://github.com/firelex/jeff Comments URL: https://news.ycombinator.com/item?id=49883844 Points: 222 # Comments: 71