Bonsai 2 27B: فشرده سازی تقریبا بدون تلفات در ردپایی 9 برابر کوچکتر
آدرس مقاله: https://prisml.com/news/bonsai-2-27b آدرس نظرات: https://news.ycombinator.com/item?id=49746618 امتیاز: 254 # نظرات: 81
دو ماه پیش، ما اولین مدلهای Bonsai 27B خود را منتشر کردیم و نشان دادیم که یک مدل چندوجهی کلاس 27B میتواند به اندازه کافی فشرده شود تا به طور موثر روی یک دستگاه محلی اجرا شود. امروز، ما Trinary Bonsai 2 27B را منتشر میکنیم، که قویترین مدل ماست.
بر اساس Qwen3.8 27B، Trinary Bonsai 2 27B استدلال، کدنویسی، دید و قابلیت عاملی قویتری را برای سری Bonsai به ارمغان میآورد و در عین حال نمایه استقرار را که آن را تعریف میکند حفظ میکند: ردپای حافظه بهطور چشمگیری کوچکتر، توان عملیاتی محلی بالا، و بهرهوری انرژی بهتر.
سهگانه Bonsai 2 27B از وزنهای سهگانه {−1، 0، +1} با مقیاسبندی گروهی FP16، برای 1.76 بیت موثر در هر وزن و مجموع ردپای مدل 5.9 گیگابایت استفاده میکند. نمایش کم بیت از پایان به انتها در سراسر مدل زبان اعمال می شود. این پنجره زمینه 262K توکن، ورودی متن و تصویر چند وجهی را پشتیبانی می کند و تحت مجوز آپاچی 2.0 منتشر شده است.
ترناری بونسای 2 27B در مقایسه با همتای با دقت کامل خود، بیش از 9 برابر کوچکتر است و در عین حال 98.2 درصد از عملکرد معیار کل را حفظ می کند. در این سطح حفظ، فشردهسازی تبدیل به یک قفل استقرار میشود: تقریبا همان قابلیت، در ردپایی که میتواند در مکانهای بسیار بیشتری اجرا شود.
اولین نسخه Bonsai 27B ما یک نقطه عطف مهم بود و راهی عملی برای اجرای هوشمندی کلاس 27B در دستگاههای محلی ارائه کرد. Bonsai 2 27B بر مرحله بعدی تمرکز دارد: بهبود کیفیت مدل و عملکرد زمان اجرا مورد نیاز برای برنامه های محلی در دنیای واقعی. در مقایسه با نسل قبلی Bonsai 27B، Bonsai 2 27B به ارمغان می آورد:
در یک مجموعه معیار شامل استدلال، ریاضی، کدگذاری، دنبال کردن دستورالعمل، دید و استفاده از ابزار عاملی، Trinary Bonsai 2 27B امتیاز 83.9 را به خود اختصاص داده و 98.2 درصد از عملکرد کلی Qwen3.8 27B را حفظ می کند.
نتیجه کلیدی نه تنها امتیاز کل نیست، بلکه جایی است که قابلیت حفظ می شود. عوامل کدگذاری، سیستمهای استفاده از ابزار، گردشهای کاری چندوجهی، و وظایف افق طولانی بهخصوص به تخریب مدل حساس هستند، زیرا خطاهای کوچک میتوانند در بسیاری از مراحل ترکیب شوند. Bonsai 2 27B عملکرد مدل با دقت کامل را دقیقا در این مناطق حفظ می کند در حالی که در کسری از حافظه کار می کند.
در مقایسه با مدل با دقت کامل و سایر گزینههای کمبیت، Bonsai 2 27B از نظر چگالی هوشمندی برجسته است. بسیاری از جایگزینهای کم بیت تنها با کنار گذاشتن قابلیت معنادار در کدنویسی، دید یا استفاده از ابزار عامل، قابل استقرار میشوند. Bonsai 2 27B مرز را به سمت قابلیت بالاتر و استفاده کمتر از حافظه سوق می دهد.
با Bonsai 2 27B، مدلهای محلی میتوانند کار دانش واقعی را شروع کنند: حلقههای عامل کدنویسی، گردشهای کاری با استفاده از رایانه، تجزیه و تحلیل اسناد خصوصی، اشکالزدایی چندوجهی، و هماهنگسازی ترکیبی که در آن مدلهای محلی وظایف حساس یا با فرکانس بالا را انجام میدهند در حالی که به طور انتخابی به سمت ابر افزایش مییابند.
Trinary Bonsai 2 27B در NVIDIA GeForce RTX 5090 به 143 توکن در ثانیه و در M5 Max به 46.8 توکن در ثانیه می رسد. در RTX 4090، Trinary Bonsai 2 27B فقط 0.714 میلیوات ساعت در توکن مصرف میکند که باعث میشود آن را 40 درصد از یک مدل 8B با دقت کامل کارآمدتر انرژی مصرف کند.
برای دستیاران کدنویسی، توان عملیاتی بالاتر به معنای حلقههای ویرایش-اشکالزدایی سریعتر است. برای عوامل چند وجهی، این به معنای تکرار سریعتر از اسکرینشات، اسناد و تماسهای ابزار است. برای گردشهای کاری محلی خصوصی، بهرهوری انرژی بهتر به معنای استنتاج مفیدتر در همان دستگاه، عمر باتری طولانیتر و مسیری واقعیتر برای دستیارانی است که میتوانند بدون تماس مداوم با ابر در پسزمینه در دسترس باشند.
در مقایسه با ترنری بونسای 27B، ترنری بونسای 2 27B جدید فاصله نگهداری بین مدل با دقت کامل را از 95% به بیش از 98% کاهش داده است. این یک پیشرفت قابل توجه است که نسخه فعلی را عملا "بدون ضرر" می کند. این بیشتر این تصور را تقویت می کند که مدل های کم بیت می توانند بهترین راه برای استقرار هوش مصنوعی باشند.
این پیامدهایی فراتر از استنباط محلی دارد. مدلهای کمبیت میتوانند اقتصاد و معماری سیستمهای هوش مصنوعی را در سراسر دستگاهها، ایستگاههای کاری و مراکز داده تغییر دهند: قرار دادن مدلهای بزرگتر در یک پوشش حافظه، خدمترسانی به کاربران بیشتر در سختافزار یکسان، کاهش انرژی در هر استنتاج، و فعال کردن سیستمهای ترکیبی که بهطور پویا تصمیم میگیرند چه چیزی باید به صورت محلی اجرا شود و چه چیزی باید در فضای ابری اجرا شود.
این سؤال به طور فزایندهای نه تنها این است که یک مدل چقدر توانمند است، بلکه این است که چقدر هوشمندی مفید میتواند در یک حافظه، محاسبات و بودجه معین ارائه شود. اگر توانایی ادامه یابد در حالی که این نیازها به طور چشمگیری کاهش می یابد، پوشش استقرار مدل های آینده در سراسر پشته گسترش می یابد: از دستگاه های شخصی گرفته تا مراکز داده در مقیاس بزرگ.
Bonsai 2 27B روی پردازندههای گرافیکی NVIDIA از طریق CUDA و روی دستگاههای اپل (Mac، iPhone، iPad) از طریق MLX، از طریق هستههای کم بیت سفارشی اجرا میشود. وزن های مدل امروز تحت مجوز آپاچی 2.0 در دسترس هستند.
جزئیات فنی کامل فرآیندهای فشرده سازی، ارزیابی و محک گذاری ما در وایت پیپر ما موجود است.
ما با تیمهایی کار میکنیم تا مدلهای Bonsai را برای برنامههایشان، از آموزش پس از آموزش در مورد دادههای خاص دامنه گرفته تا بهینهسازی استنتاج برای سختافزار هدف، تنظیم کنیم. اگر در حال ساخت محصولات هوش مصنوعی با حافظه فشرده، تأخیر یا نیازهای انرژی هستید، مایلیم کشف کنیم که Bonsai چگونه می تواند کمک کند. با آدرس contact@prisml.com تماس بگیرید.
Prism ML از تیمی از محققان Caltech پدید آمد و با پشتیبانی Khosla Ventures، Cerberus، و Google و با پشتیبانی مداوم سامسونگ تأسیس شد. ما سالها را صرف مقابله با یکی از سختترین مشکلات این حوزه کردهایم: فشردهسازی شبکههای عصبی بدون قربانی کردن توانایی استدلال آنها.
اگر میخواهید به ساخت نسل بعدی هوش مصنوعی پیشرفته کمک کنید، خوشحال میشویم نظر شما را بشنویم. صفحه مشاغل ما را بررسی کنید.
متن اصلی (انگلیسی)
Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint
Article URL: https://prismml.com/news/bonsai-2-27b Comments URL: https://news.ycombinator.com/item?id=49746618 Points: 254 # Comments: 81