پرش به محتوای اصلی

Bonsai 2 27B: فشرده سازی تقریبا بدون تلفات در ردپایی 9 برابر کوچکتر

هکرنیوز۱۴۰۵ شهریور ۲۷, جمعه، ساعت ۰۰:۴۳حدود 4 دقیقه مطالعه

آدرس مقاله: https://prisml.com/news/bonsai-2-27b آدرس نظرات: https://news.ycombinator.com/item?id=49746618 امتیاز: 254 # نظرات: 81

دو ماه پیش، ما اولین مدل‌های Bonsai 27B خود را منتشر کردیم و نشان دادیم که یک مدل چندوجهی کلاس 27B می‌تواند به اندازه کافی فشرده شود تا به طور موثر روی یک دستگاه محلی اجرا شود. امروز، ما Trinary Bonsai 2 27B را منتشر می‌کنیم، که قوی‌ترین مدل ماست.

بر اساس Qwen3.8 27B، Trinary Bonsai 2 27B استدلال، کدنویسی، دید و قابلیت عاملی قوی‌تری را برای سری Bonsai به ارمغان می‌آورد و در عین حال نمایه استقرار را که آن را تعریف می‌کند حفظ می‌کند: ردپای حافظه به‌طور چشمگیری کوچک‌تر، توان عملیاتی محلی بالا، و بهره‌وری انرژی بهتر.

سه‌گانه Bonsai 2 27B از وزن‌های سه‌گانه {−1، 0، +1} با مقیاس‌بندی گروهی FP16، برای 1.76 بیت موثر در هر وزن و مجموع ردپای مدل 5.9 گیگابایت استفاده می‌کند. نمایش کم بیت از پایان به انتها در سراسر مدل زبان اعمال می شود. این پنجره زمینه 262K توکن، ورودی متن و تصویر چند وجهی را پشتیبانی می کند و تحت مجوز آپاچی 2.0 منتشر شده است.

ترناری بونسای 2 27B در مقایسه با همتای با دقت کامل خود، بیش از 9 برابر کوچکتر است و در عین حال 98.2 درصد از عملکرد معیار کل را حفظ می کند. در این سطح حفظ، فشرده‌سازی تبدیل به یک قفل استقرار می‌شود: تقریبا همان قابلیت، در ردپایی که می‌تواند در مکان‌های بسیار بیشتری اجرا شود.

اولین نسخه Bonsai 27B ما یک نقطه عطف مهم بود و راهی عملی برای اجرای هوشمندی کلاس 27B در دستگاه‌های محلی ارائه کرد. Bonsai 2 27B بر مرحله بعدی تمرکز دارد: بهبود کیفیت مدل و عملکرد زمان اجرا مورد نیاز برای برنامه های محلی در دنیای واقعی. در مقایسه با نسل قبلی Bonsai 27B، Bonsai 2 27B به ارمغان می آورد:

در یک مجموعه معیار شامل استدلال، ریاضی، کدگذاری، دنبال کردن دستورالعمل، دید و استفاده از ابزار عاملی، Trinary Bonsai 2 27B امتیاز 83.9 را به خود اختصاص داده و 98.2 درصد از عملکرد کلی Qwen3.8 27B را حفظ می کند.

نتیجه کلیدی نه تنها امتیاز کل نیست، بلکه جایی است که قابلیت حفظ می شود. عوامل کدگذاری، سیستم‌های استفاده از ابزار، گردش‌های کاری چندوجهی، و وظایف افق طولانی به‌خصوص به تخریب مدل حساس هستند، زیرا خطاهای کوچک می‌توانند در بسیاری از مراحل ترکیب شوند. Bonsai 2 27B عملکرد مدل با دقت کامل را دقیقا در این مناطق حفظ می کند در حالی که در کسری از حافظه کار می کند.

در مقایسه با مدل با دقت کامل و سایر گزینه‌های کم‌بیت، Bonsai 2 27B از نظر چگالی هوشمندی برجسته است. بسیاری از جایگزین‌های کم بیت تنها با کنار گذاشتن قابلیت معنادار در کدنویسی، دید یا استفاده از ابزار عامل، قابل استقرار می‌شوند. Bonsai 2 27B مرز را به سمت قابلیت بالاتر و استفاده کمتر از حافظه سوق می دهد.

با Bonsai 2 27B، مدل‌های محلی می‌توانند کار دانش واقعی را شروع کنند: حلقه‌های عامل کدنویسی، گردش‌های کاری با استفاده از رایانه، تجزیه و تحلیل اسناد خصوصی، اشکال‌زدایی چندوجهی، و هماهنگ‌سازی ترکیبی که در آن مدل‌های محلی وظایف حساس یا با فرکانس بالا را انجام می‌دهند در حالی که به طور انتخابی به سمت ابر افزایش می‌یابند.

Trinary Bonsai 2 27B در NVIDIA GeForce RTX 5090 به 143 توکن در ثانیه و در M5 Max به 46.8 توکن در ثانیه می رسد. در RTX 4090، Trinary Bonsai 2 27B فقط 0.714 میلی‌وات ساعت در توکن مصرف می‌کند که باعث می‌شود آن را 40 درصد از یک مدل 8B با دقت کامل کارآمدتر انرژی مصرف کند.

برای دستیاران کدنویسی، توان عملیاتی بالاتر به معنای حلقه‌های ویرایش-اشکال‌زدایی سریع‌تر است. برای عوامل چند وجهی، این به معنای تکرار سریع‌تر از اسکرین‌شات، اسناد و تماس‌های ابزار است. برای گردش‌های کاری محلی خصوصی، بهره‌وری انرژی بهتر به معنای استنتاج مفیدتر در همان دستگاه، عمر باتری طولانی‌تر و مسیری واقعی‌تر برای دستیارانی است که می‌توانند بدون تماس مداوم با ابر در پس‌زمینه در دسترس باشند.

در مقایسه با ترنری بونسای 27B، ترنری بونسای 2 27B جدید فاصله نگهداری بین مدل با دقت کامل را از 95% به بیش از 98% کاهش داده است. این یک پیشرفت قابل توجه است که نسخه فعلی را عملا "بدون ضرر" می کند. این بیشتر این تصور را تقویت می کند که مدل های کم بیت می توانند بهترین راه برای استقرار هوش مصنوعی باشند.

این پیامدهایی فراتر از استنباط محلی دارد. مدل‌های کم‌بیت می‌توانند اقتصاد و معماری سیستم‌های هوش مصنوعی را در سراسر دستگاه‌ها، ایستگاه‌های کاری و مراکز داده تغییر دهند: قرار دادن مدل‌های بزرگ‌تر در یک پوشش حافظه، خدمت‌رسانی به کاربران بیشتر در سخت‌افزار یکسان، کاهش انرژی در هر استنتاج، و فعال کردن سیستم‌های ترکیبی که به‌طور پویا تصمیم می‌گیرند چه چیزی باید به صورت محلی اجرا شود و چه چیزی باید در فضای ابری اجرا شود.

این سؤال به طور فزاینده‌ای نه تنها این است که یک مدل چقدر توانمند است، بلکه این است که چقدر هوشمندی مفید می‌تواند در یک حافظه، محاسبات و بودجه معین ارائه شود. اگر توانایی ادامه یابد در حالی که این نیازها به طور چشمگیری کاهش می یابد، پوشش استقرار مدل های آینده در سراسر پشته گسترش می یابد: از دستگاه های شخصی گرفته تا مراکز داده در مقیاس بزرگ.

Bonsai 2 27B روی پردازنده‌های گرافیکی NVIDIA از طریق CUDA و روی دستگاه‌های اپل (Mac، iPhone، iPad) از طریق MLX، از طریق هسته‌های کم بیت سفارشی اجرا می‌شود. وزن های مدل امروز تحت مجوز آپاچی 2.0 در دسترس هستند.

جزئیات فنی کامل فرآیندهای فشرده سازی، ارزیابی و محک گذاری ما در وایت پیپر ما موجود است.

ما با تیم‌هایی کار می‌کنیم تا مدل‌های Bonsai را برای برنامه‌هایشان، از آموزش پس از آموزش در مورد داده‌های خاص دامنه گرفته تا بهینه‌سازی استنتاج برای سخت‌افزار هدف، تنظیم کنیم. اگر در حال ساخت محصولات هوش مصنوعی با حافظه فشرده، تأخیر یا نیازهای انرژی هستید، مایلیم کشف کنیم که Bonsai چگونه می تواند کمک کند. با آدرس contact@prisml.com تماس بگیرید.

Prism ML از تیمی از محققان Caltech پدید آمد و با پشتیبانی Khosla Ventures، Cerberus، و Google و با پشتیبانی مداوم سامسونگ تأسیس شد. ما سال‌ها را صرف مقابله با یکی از سخت‌ترین مشکلات این حوزه کرده‌ایم: فشرده‌سازی شبکه‌های عصبی بدون قربانی کردن توانایی استدلال آنها.

اگر می‌خواهید به ساخت نسل بعدی هوش مصنوعی پیشرفته کمک کنید، خوشحال می‌شویم نظر شما را بشنویم. صفحه مشاغل ما را بررسی کنید.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint

Article URL: https://prismml.com/news/bonsai-2-27b Comments URL: https://news.ycombinator.com/item?id=49746618 Points: 254 # Comments: 81

همه‌ی اخبار فناوری