پرش به محتوای اصلی

جف – مدل‌های تصمیم‌گیری 0.8B سازگار با Jev، آموزش‌دیده در خانه، ~30 میلی‌ثانیه

هکرنیوز۱۴۰۵ مهر ۶, دوشنبه، ساعت ۲۳:۵۳حدود 4 دقیقه مطالعه

آدرس مقاله: https://github.com/firelex/jeff آدرس نظرات: https://news.ycombinator.com/item?id=49883844 امتیاز: 222 # نظرات: 71

تنظیم دقیق Qwen3.5 و Gemma 4 برای طبقه بندی صفر شات: مدل های تصمیم گیری کوچک و سریعی که در کد خود جای می دهید، با همان فرمت درخواستی Jev. شما یک موقعیت را توصیف می کنید و گزینه ها را با کلمات ساده فهرست می کنید. جف یک احتمال کالیبره شده را برای هر گزینه از یک پاس رو به جلو برمی گرداند. بدون متن تولید شده، بدون تجزیه: حدود 22 میلی‌ثانیه در هر تصمیم در RTX PRO 6000 و 28 میلی‌ثانیه در Apple M4 Max (MLX).

شات صفر به این معنی است که گزینه‌ها می‌توانند هر چیزی باشند: صف‌های پشتیبانی، اهداف کاربر، برچسب‌های تعدیل، دستورات صوتی، حرکات بازی. لازم نیست دسته های شما در داده های آموزشی ظاهر شوند. شما آنها را توصیف می کنید و جف انتخاب می کند.

چه هست و چه نیست. اینها مدلهای بسیار کوچکی هستند. آنها تماس های قضاوت بسیار سریع و خوب کالیبره شده بین گزینه ها برقرار می کنند و به راحتی در کد محلی شما قرار می گیرند. در معیارها آنها به Jev نزدیک می شوند و گاهی اوقات آنها را شکست می دهند. اما در این اندازه استدلال آنها با Jev's مطابقت نخواهد داشت، که در مدلی بسیار بزرگتر اجرا می شود. اگر دقت عکس صفر به اندازه کافی برای اهداف شما خوب نیست، تنظیم دقیق نمونه‌های خود شما را بسیار فراتر می‌برد: تنظیم دقیق ناوبری صوتی ما در کمتر از نیم ساعت در یک GPU، دقت ثابت را از 31.7% به 95.8% منتقل کرد.

به طور کامل بر روی سخت افزار محلی ساخته شده است. آموزش روی یک GPU ایستگاه کاری RTX PRO 6000 (0.8B در حدود 2 ساعت، 2B در حدود 3.5)، تمام داده های آموزشی مصنوعی نوشته شده توسط یک مدل باز (Qwen3.8-Flash-Next) روی دو DGX Sparks، تست روی مک بوک. بدون پردازنده گرافیکی ابری و بدون خروجی مدل بسته در داده های آموزشی. یک مدل بسته تنها برای بررسی نقطه‌ای کیفیت نمونه‌ای از داده‌های مصنوعی استفاده شد.

پروژه مستقل جف از همان فرمت درخواستی Jev استفاده می‌کند، اما به TypeSafe، سازندگان Jev، وابسته یا تایید نشده است. کد آموزشی ما از دستور منبع باز AutoJev شروع می شود.

مدل های روی صورت در آغوش گرفته: Jeff-Qwen3.5-0.8B · Jeff-Qwen3.5-2B · Jeff-Gemma4-E2B

هر پاسخ دارای یک احتمال برای هر گزینه، گزینه انتخاب شده و یک اطمینان است. سه نوع سوال: انتخابی (یکی از حداکثر 255 گزینه را انتخاب کنید)، منفی (بله/خیر، به صورت احتمال برگردانده شده است) و امتیاز (یک امتیاز در مقیاسی که شما توضیح می دهید). چندین سوال مستقل در یک درخواست با هم پاسخ داده می شود.

4599 سؤال از پنج معیار عمومی، به‌علاوه ردیف سخت عمومی JevBench (105 مورد، امتیازدهی جداگانه):

پررنگ: برنده جف در مقابل جیو در هر ردیف. مورب پررنگ: AutoJev-27B که در آن بهترین مدل در ردیف است (در RAGTruth، با Jeff-Qwen3.5-2B گره خورده است). برای مرجع نشان داده شده است، زیرا مقایسه سر به سر با Jev است. ارقام منتشر شده Jev و AutoJev بر روی نمونه متفاوتی از معیارهای مشابه اندازه گیری شدند. امتیاز کلی جف از طبقه‌بندی و زمین‌گیری به دست می‌آید، جایی که با مدل‌های بزرگ مطابقت می‌کند یا می‌بیند. در معیارهای استدلال سنگین (BBH، JudgeBench، JevBench) بسیار پایین تر از آنها باقی می ماند، همانطور که در این اندازه انتظار دارید.

برای آزمایش عملکرد ضربه صفر در وظایف بر خلاف هر چیزی در بنچمارک ها، جف را سه بازی انجام دادیم. بازی‌ها آزمون صفر شات ایده‌آل نیستند، زیرا وضعیت یک بازی داده‌های بدون ساختار معمولی نیست. اما آنها یک روش معمول و سرگرم کننده برای آزمایش مدل سیستم 1 هستند. در هر نوبت، کد وضعیت و حرکات قانونی را با کلمات توصیف می کند و مدل یکی را انتخاب می کند. گزینه‌ها بیان می‌کنند که هر حرکت به چه چیزی منتهی می‌شود (Frogger: "شما با یک ماشین برخورد می‌کنید و یک زندگی را از دست می‌دهید"؛ Doom: "نزدیک‌ترین هیولا کمی به سمت چپ شما است")، اما هرگز کدام حرکت درست نیست.

هر نتیجه 20 قسمت است، 1234; ▶ ویدیویی از قسمت اول اجرا را باز می کند.

Jeff-Qwen3.5-0.8B در حال پخش، شات صفر (ردیف پررنگ در جدول زیر؛ برای ویدیوی کامل روی یک کلیپ کلیک کنید):

Jeff-0.8B در 29-49 ms در هر حرکت در M4 Max تصمیم می گیرد. اجرای Doom منتشر شده توسط Jev 212 میلی ثانیه در هر تماس از طریق API آن طول کشید. دو زمان بر روی یک سخت افزار اندازه گیری نشد. برای اینکه خودتان آنها را بازی کنید:

میانه زمان هر تصمیم بر روی 200 سوال معیار (هر کدام حدود 200 نشانه ورودی)، هر بار یک سوال، از متن خام تا احتمالات:

خط لوله کامل (داده‌های مصنوعی از یک معلم محلی، فیلتر نشت، جابجایی‌های نرخ یادگیری، داشبورد) در scripts/train_all.sh و هر منبع آموزشی با مجوز آن در docs/data-sources.md توضیح داده شده است. دستور تمرین: تنظیم دقیق تمام وزن، یک دوره، دسته های 256، آنتروپی متقاطع بر روی حروف گزینه، سپس یک دمای مناسب برای کالیبراسیون. نقاط بازرسی در یک مجموعه توسعه انتخاب می شوند، نه در پانل معیار. حداقل نیمی از هر خانواده آموزشی از قراردادهای چیدمان پانل پیروی می کنند (فقط فرمت ها، هیچ مورد پانلی هرگز روی آن آموزش داده نمی شود).

جف به عنوان یک فورک AutoJev توسط Denis Yarats (مجوز MIT) شروع شد، یک دستور العمل باز که Qwen3.8-27B را به خوبی تنظیم می کند تا تصمیمات سبک Jev را بازگرداند. ما طراحی اصلی آن (یک پاس به جلو در هر تصمیم، یک بازخوانی پاسخ آموزش‌دیده، دمای مناسب برای کالیبراسیون) را حفظ کردیم و بر روی آن ساختیم: دانش‌آموزان کوچک (0.8B و 2B Qwen، Gemma 4 E2B)، خط لوله داده‌های مصنوعی محلی با فیلتر نشت، طرح‌بندی‌های سریع برای تنظیم دقیق دامنه، سرویس MLX آموزشی در صفحه آزمایشی Apple. اعلامیه حق چاپ اصلی در LICENSE نگهداری می شود.

کد: MIT (از جمله AutoJev). وزن مدل: آپاچی 2.0. مهار عذاب اقتباس شده از jev-plays-doom (MIT). داده های آموزشی: کارت داده را ببینید. هر منبع مجوز خود را حفظ می کند و در docs/data-sources.md فهرست شده است. ما وزن ها و کدها را منتشر می کنیم، نه داده های آموزشی. برخی از منابع مشابه هستند (CC BY-SA).

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

Article URL: https://github.com/firelex/jeff Comments URL: https://news.ycombinator.com/item?id=49883844 Points: 222 # Comments: 71

همه‌ی اخبار فناوری