Show HN: Cactus Needle 3: مدل های اتوماسیون 8-29 مگابایتی می توانند با DeepSeek V4 Flash مطابقت داشته باشند.
هی HN، هنری از کاکتوس اینجاست. ما چند هفته پیش Needle 2 را اینجا ارسال کردیم، و بازخورد در موضوع بحث فوق العاده ارزشمند بود، با تشکر! به لطف همه آن بازخوردها، ما توانستیم به سرعت برای انتشار Needle 3 حرکت کنیم و من دوست دارم دوباره نظر شما را بشنوم. ویژگی های کلیدی: 1) اتوماسیون (تماس با ابزار و خروجی JSON ساختاریافته): Needle هنوز بر اساس طراحی چت نمی کند، بسته بندی آن بسیار چالش برانگیز است…
هی HN، هنری از کاکتوس اینجاست. ما چند هفته پیش Needle 2 را اینجا ارسال کردیم، و بازخورد در موضوع بحث فوق العاده ارزشمند بود، با تشکر! به لطف همه آن بازخوردها، ما توانستیم به سرعت برای انتشار Needle 3 حرکت کنیم و من دوست دارم دوباره نظر شما را بشنوم. ویژگی های کلیدی: 1) اتوماسیون (تماس با ابزار و خروجی JSON ساختاریافته): Needle هنوز بر اساس طراحی چت نمی کند، بسته بندی ظرفیت کلی در چنین مدل های کوچک بسیار چالش برانگیز است، بنابراین ما روی فراخوانی ابزار و JSON ساختار یافته تمرکز می کنیم.
اگر هیچ ابزاری که اعلام کرده اید با درخواست مطابقت نداشته باشد، یک لیست خالی دریافت می کنید (به هنگام بازی با نسخه نمایشی توجه داشته باشید). 2) نردبان هوشمند: هر لایه (2 تا 20) یک زیرشبکه قابل استقرار است، بنابراین یک مجموعه وزن، 25 تا 121 میلیون پارامتر در 2 بیت، به صورت باینری های 8 تا 29 مگابایت ارسال می شود. در Raspberry Pi 5 تا 4k توکن در ثانیه رمزگشایی می شود و تا 10k از قبل پر می شود. 3) Monarch Hadamard MLP: FFN متراکم را با سه جفت فاکتور Kronecker (Monarch) راهاندازی شده با Walsh-Hadamard جایگزین میکند که با مقیاسهای مورب در هر کانال، جایگشتهای ثابت، غیرخطی SiLU و شرایط ورودی رتبه 8 در هم قرار گرفتهاند.
ned gate، بنابراین هر توکن یک تبدیل غیرخطی کاملا ترکیبی از کانالهای d_model خود را در پارامترهای O(d√d) دریافت میکند و به جای O(d²) یک MLP متراکم با گسترش 4x را محاسبه میکند. 4) عملکرد: در Mobile Actions (فرمانهای تلفن، امتیازدهی شده در تماس دقیق) مدل 20 لایه از طریق باینری 2 بیتی ارسال شده 86.0 میگیرد. LFM2.5 1.2B در 82.4، Qwen3.5 0.8B در 76.0، مدل روی دستگاه اپل در 57.6، همه در f16 است.
نتایج بیشتر در پیوند، ما در همه جا برنده نمی شویم. 5) چند زبانه: Needle 3 اکنون از زبان های انگلیسی، فرانسوی، اسپانیایی، آلمانی، هلندی، ایتالیایی، لهستانی پشتیبانی می کند. 6) تنظیم دقیق: شما می توانید عملکرد درجه فلش DeepSeek v4 را در یک کار باریک تنها با 4 لیتر، تاکید بر "کار باریک" به دست آورید، ما دریافتیم که کاربران تولید اغلب تنظیم را قبل از تولید ترجیح می دهند. 7) محرک ها: زمین کردن یک چالش رایج برای فراخوانی ابزار است، حداقل برای Needle 2، بنابراین ما عبارات منظم غیرحساس به حروف کوچک و بزرگ را که با هر درخواست مطابقت دارند، اضافه کردیم تا نگاتیوهای کاذب را وارد کنیم. 8) اعتماد به نفس: هر پاسخ ال
بنابراین دارای یک امتیاز اطمینان کالیبره شده، حداقل قضاوت در مورد تماس تمام شده و احتمال رمزگشایی آن است. بالاتر از آستانه خود عمل کنید، تماس را نشان دهید و زیر آن را بپرسید، یا به یک مدل بزرگتر تبدیل شوید. 9) پلتفرم های پشتیبانی شده: macOS، Linux در x86-64، ARM64، ARMv7، RISC-V و MIPS32، Windows x64 و ARM، Android، iOS، watchOS، tvOS، مرورگر به عنوان WebAssembly و یک جزء WASI. با تشکر از خواندن و مانند همیشه، افکار قدردانی!
آدرس نظرات: https://news.ycombinator.com/item?id=49748553
امتیاز: 225
# نظرات: 90
متن اصلی (انگلیسی)
Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash
Hey HN, Henry from Cactus here. We submitted Needle 2 here a few weeks ago, and the feedback in the discussion thread was incredibly valuable, thanks! Thanks to all that feedback, we’ve been able to move quickly to release Needle 3 and I'd love to hear what you think again. The key features: 1) Automation (tool calls & structured JSON output): Needle still doesn't chat by design, its quite challenging to pack…