Microsoft-Decision-1، مدل ما برای تصمیم گیری سریع
آدرس مقاله: https://commandline.microsoft.com/microsoft-decision-1-model-foundry/ آدرس نظرات: https://news.ycombinator.com/item?id=50024913 امتیاز: 197 # نظرات: 66
مدل جدید امتیازدهی تصمیم ما، عملکرد برتر را در تأخیر و کیفیت در وظایف تصمیمگیری ساختاریافته ارائه میکند تا از هر دو مدل LLM و سایر مدلهای تصمیم بهتر عمل کند.
مدل های تصمیم گیری به سرعت به عنوان یک مقوله مهم جدید در هوش مصنوعی ظهور می کنند. بر خلاف LLMها که برای تولید متن یا دلیل از طریق مسائل پیچیده طراحی شدهاند، مدلهای تصمیمگیری برای ارائه خروجیهای ساختاریافته ساخته شدهاند که نرمافزار میتواند فورا روی آنها عمل کند. و هنگامی که این توانایی را درک کردید - تصمیم گیری و طبقه بندی چیزها با هزینه بسیار کم با عملکرد بالا - قفل همه انواع وظایف مفید باز می شود.
امروز ما Microsoft-Decision-1 را معرفی می کنیم، مدل جدید خود برای امتیازدهی سریع، که در Microsoft Foundry و از طریق OpenRouter موجود است. این مدل برای مسیریابی، طبقهبندی، اولویتبندی، تأیید و کنترل گردش کار طراحی شده است و ترکیب اطلاعات تصمیمگیری را در برنامههای کاربردی، عوامل و گردشهای کاری موجود در یک محیط امن و قابل اعتماد آسانتر میکند. Microsoft-Decision-1 عملکرد بالایی را در تأخیر و کیفیت در وظایف تصمیم گیری ساختاریافته ارائه می دهد تا از هر دو مدل LLM و سایر مدل های تصمیم بهتر عمل کند.
Microsoft-Decision-1 بالاترین دقت را در مقایسه 36 معیاری ما به دست آورد و تقریبا 150000 سؤال را در بین معیارهایی که از آموزش نابینا نگه داشته شده بودند، در بر گرفت. و در بنچمارک ما، سریعترین اندازهگیری شده بود: 2.5 برابر سریعتر از H2O-Lightning-4B v1.1، رتبه دوم، و 35 برابر سریعتر از GPT-6 Sol.
یادداشت ویرایشگر: این پست از نسخه اصلی به روز شد تا معیارهایی برای Jev در مورد دقت و کالیبراسیون اضافه شود.
برای ساخت Microsoft-Decision-1، Qwen3.5-9B آموزش دیده را برای امتیازدهی سریع و تک پاسی در تصمیم گیری پست می کنیم و به زودی آن را بر روی مدل های دیگر، از جمله Microsoft AI (MAI) و OpenAI تغییر می دهیم. هنگامی که مجموعه ای ثابت از گزینه های پاسخ داده می شود، Microsoft-Decision-1 یک امتیاز احتمال کالیبره شده برای هر گزینه ارائه می دهد. این مدل از گزینههای بله/خیر، چند گزینهای و رتبهبندی، و همچنین درجهبندی مبتنی بر روبریک پاسخهای هوش مصنوعی و اقدامات عامل، همه از طریق یک فراخوانی ساده API ساختاریافته، پشتیبانی میکند.
برای ایجاد یک مدل تصمیم گیری قابل اعتماد، ما مجبور شدیم به چندین چالش بپردازیم:
هر تصمیمی به تاخیر می افزاید، به خصوص زمانی که یک مرحله به مرحله دیگر بستگی دارد. به عنوان مثال، اضافه کردن تنها 100 میلی ثانیه به هر یک از 20 تصمیم متوالی، دو ثانیه به گردش کار کلی اضافه می کند.
تأخیر Microsoft-Decision-1 P50 35 برابر سریعتر از GPT-6 Sol است.
تطبیق بیش از حد یک مدل برای یک معیار یا یک نوع کار تصمیم گیری آسان است. ما باید بدانیم که آیا این کیفیت به وظایف مختلفی که مدل در آن آموزش ندیده است میرسد یا خیر. به همین دلیل است که ما Microsoft-Decision-1 را در دهها معیار مورد ارزیابی قرار دادیم که از آموزش، مسیریابی، رتبهبندی، زمینه طولانی، وظایف چند زبانه و خارج از توزیع، استدلال و ایمنی دور مانده بودند. ما همچنین چندین مدل عمومی برتر را در جدول امتیازات باز محبوب JevBench انتخاب کردیم و آنها را در 36 معیار عمومی و خصوصی دیگر آزمایش کردیم.
Microsoft-Decision-1 بهترین عملکرد را در این مجموعه وسیعتر از معیارها داشت که نشاندهنده تعمیم قوی است.
ورودی های معادل باید تصمیمات معادل را ایجاد کنند. در تولید، حالتها و دستورالعملها بازنویسی میشوند، توضیحات گزینهها تغییر میکنند، انتخابها دوباره مرتب میشوند، کلیدها تغییر میکنند و نویز قالببندی بیضرر ظاهر میشود. هیچ یک از این تغییرات نباید تصمیم را تغییر دهد.
ما همان درخواست را به هشت روش برهم می زنیم و اندازه گیری می کنیم که تصمیم چقدر تغییر می کند. Microsoft-Decision-1 تصمیم خود را در مورد 1.3٪ از اغتشاشات به طور متوسط با صفر تلنگر زمانی که توضیحات گزینه بازنویسی می شود یا زمانی که گزینه ها معکوس یا به هم ریخته می شوند، تغییر می دهد.
خود احتمال بخشی از API است، نه فقط یک امتیاز رتبه بندی. برنامه ها از اعتماد به نفس استفاده می کنند تا تصمیم بگیرند چه زمانی اقدام کنند، چه زمانی به تعویق بیفتند، یا درخواست بازبینی کنند، بنابراین پیش بینی 90 درصدی باید در مورد موارد نماینده، 9 بار از 10 مورد درست باشد.
یک مدل تصمیم باید درخواست های مضر را بدون مسدود کردن بی مورد درخواست های بی ضرر تشخیص دهد. ما Microsoft-Decision-1 را روی 5250 درخواست در 11 معیار آزمایش کردیم که محتوای مضر، تلاشهای فرار از زندان و تزریق سریع را پوشش میداد و متوجه شدیم که این مدل با موفقیت رفتار مضر را رد کرد و در عین حال درجه بالایی از کاربرد را حفظ کرد.
طبقه بندی یک مورد استفاده کلیدی برای مدل های تصمیم گیری است. بررسی کنید که Microsoft-Decision-1 با چه دقت و سرعتی میتواند انواع جستجوها را در مقایسه با GPT-6 Sol دستهبندی کند:
مدلهای تصمیمگیری میتوانند برای سناریوهای استفاده از رایانه نیز کارآمد باشند. این نسخه نمایشی نشان می دهد که Microsoft-Decision-1 با چه سرعتی می تواند کار خرید یک کوله پشتی را در مقایسه با GPT-6 Sol انجام دهد:
در اینجا برخی از روشهایی است که ما Microsoft-Decision-1 را به صورت داخلی آزمایش کردهایم، و راههای بسیار بیشتری در راه است.
XBOX Research از Microsoft-Decision-1 برای پردازش بیش از 10000 بازخورد و بررسی بازخورد از نظرسنجیها، STEAM و Twitter/X استفاده کرد و آنها را در مجموعهای ثابت از تمهای ایجاد شده توسط محققان برای درک آنچه مردم درباره بازیها، راهاندازیها، استریمها و موارد دیگر میگویند، مرتب کرد. آنها دریافتند که Microsoft-Decision-1 از نظر کیفیت با GPT-6 Sol رقابتی است در حالی که بیش از 14 برابر سریعتر و 200 برابر ارزانتر کار می کند.
تیم Copilot کیفیت چت و پاسخ های نمایندگی را اندازه گیری می کند. آزمایش آنها نشان داد که Microsoft-Decision-1 با GPT5.6 Luna قابل رقابت است و 100 برابر سریعتر است.
مهندسان در حال تماس ما از هوش مصنوعی برای بازیابی دانش مربوطه برای پاسخگویی به حوادث زنده در لاگها، سیستمهای فروش بلیط، تماسها، پیامها و سایر منابع داده استفاده میکنند. Microsoft-Decision-1 بهتر و سریعتر از یک LLM برای بازیابی دانش عمل کرد.
مایکروسافت دیسکاوری یک ویژگی برنامهریزی مجدد تطبیقی را پیادهسازی میکند که در آن یک نماینده آزمایش قبلی را ارزیابی میکند، رویکرد آن را بر اساس درجههای روبریک اصلاح میکند و تا زمانی که اهداف خود را تکمیل کند تکرار میکند. Microsoft-Decision-1 46 برابر بیشتر از امتیاز مبتنی بر LLM در سه برابر سرعت امتیاز کسب کرد و تقریبا چهار برابر سرعت در برنامه ریزی مجدد تطبیقی داشت.
برنامه ریزی سریعتر و قابل اطمینان تر می تواند به طور قابل توجهی بر نتایج آزمایش های علمی طولانی مدت تأثیر بگذارد.
اینها فقط تعداد انگشت شماری از نمونه ها هستند. موارد استفاده بالقوه بیشتری برای Microsoft-Decision-1 وجود دارد. موارد زیر را امتحان کنید:
توسعه دهندگان می توانند با Microsoft-Decision-1 امروز در Microsoft Foundry از اینجا شروع کنند: https://ai.azure.com/catalog/models/Microsoft-Decision-1. همچنین میتوانید از طریق OpenRouter در اینجا شروع کنید: https://openrouter.ai/microsoft/microsoft-decision-1.
اسناد در اینجا موجود است: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/use-foundry-models-microsoft-decision.
اکنون که هوش مصنوعی عاملی یک واقعیت است، دیدیم که هزینه نقش مهمی در نحوه تصمیم گیری افراد برای استفاده از هوش مصنوعی دارد. و انتخاب مدل مناسب برای شغل مناسب بسیار مهم است. با اقداماتی که عاملان انجام می دهند و در دنیای واقعی تأثیر می گذارند، مدل های تصمیم گیری این پتانسیل را دارند که به مردم کمک کنند آن عوامل را از طریق محیط های پیچیده هدایت و کنترل کنند.
ما مشتاقانه منتظریم تا ببینیم توسعه دهندگان با Microsoft-Decision-1 چه چیزی می سازند و بازخورد آنها را بشنویم. ما به انتشار بهروزرسانیهای مدل، از جمله با ترکیب ارزیابیها و دادهها برای بهینهسازی بیشتر کیفیت، اطمینان و هزینه ادامه خواهیم داد.
Quyet-1.0-Large — https://huggingface.co/chinhnc/Quyet-1.0-Large Surogate Rune 26B-A4B — https://huggingface.co/surogate/rune-26b-a4b-GGUF GPT-6 Luna Decisions — https://developers.openai.com/api/docs/guides/decisions deck-31B — https://github.com/krishna-gogineni-765/deck31b H2O-Lightning-4B — https://huggingface.co/h2oai/h2o-lightning-4b Strand https://github.com/strands-labs/strands-decider
به زودی، GitHub Copilot تعیین خواهد کرد که چه زمانی یک کار به بهترین شکل توسط هوشمندی روی دستگاه انجام می شود و چه زمانی باید از مدل های در مقیاس ابری استفاده کند.
طراحی ارزیابی ساختاریافته میتواند هم گستردگی رفتارهای آزمایششده و هم تفسیرپذیری شکستهای حاصل را بهبود بخشد و به مزایای عملی برای ایجاد ارزیابیهای متنوع، قابل ردیابی و عملی منجر شود.
متن اصلی (انگلیسی)
Microsoft-Decision-1, our model for fast decision-making
Article URL: https://commandline.microsoft.com/microsoft-decision-1-model-foundry/ Comments URL: https://news.ycombinator.com/item?id=50024913 Points: 197 # Comments: 66