پرش به محتوای اصلی

Microsoft-Decision-1، مدل ما برای تصمیم گیری سریع

هکرنیوز۱۴۰۵ مهر ۱۷, جمعه، ساعت ۲۲:۰۸حدود 5 دقیقه مطالعه

آدرس مقاله: https://commandline.microsoft.com/microsoft-decision-1-model-foundry/ آدرس نظرات: https://news.ycombinator.com/item?id=50024913 امتیاز: 197 # نظرات: 66

مدل جدید امتیازدهی تصمیم ما، عملکرد برتر را در تأخیر و کیفیت در وظایف تصمیم‌گیری ساختاریافته ارائه می‌کند تا از هر دو مدل LLM و سایر مدل‌های تصمیم بهتر عمل کند.

مدل های تصمیم گیری به سرعت به عنوان یک مقوله مهم جدید در هوش مصنوعی ظهور می کنند. بر خلاف LLMها که برای تولید متن یا دلیل از طریق مسائل پیچیده طراحی شده‌اند، مدل‌های تصمیم‌گیری برای ارائه خروجی‌های ساختاریافته ساخته شده‌اند که نرم‌افزار می‌تواند فورا روی آنها عمل کند. و هنگامی که این توانایی را درک کردید - تصمیم گیری و طبقه بندی چیزها با هزینه بسیار کم با عملکرد بالا - قفل همه انواع وظایف مفید باز می شود.

امروز ما Microsoft-Decision-1 را معرفی می کنیم، مدل جدید خود برای امتیازدهی سریع، که در Microsoft Foundry و از طریق OpenRouter موجود است. این مدل برای مسیریابی، طبقه‌بندی، اولویت‌بندی، تأیید و کنترل گردش کار طراحی شده است و ترکیب اطلاعات تصمیم‌گیری را در برنامه‌های کاربردی، عوامل و گردش‌های کاری موجود در یک محیط امن و قابل اعتماد آسان‌تر می‌کند. Microsoft-Decision-1 عملکرد بالایی را در تأخیر و کیفیت در وظایف تصمیم گیری ساختاریافته ارائه می دهد تا از هر دو مدل LLM و سایر مدل های تصمیم بهتر عمل کند.

Microsoft-Decision-1 بالاترین دقت را در مقایسه 36 معیاری ما به دست آورد و تقریبا 150000 سؤال را در بین معیارهایی که از آموزش نابینا نگه داشته شده بودند، در بر گرفت. و در بنچمارک ما، سریع‌ترین اندازه‌گیری شده بود: 2.5 برابر سریع‌تر از H2O-Lightning-4B v1.1، رتبه دوم، و 35 برابر سریع‌تر از GPT-6 Sol.

یادداشت ویرایشگر: این پست از نسخه اصلی به روز شد تا معیارهایی برای Jev در مورد دقت و کالیبراسیون اضافه شود.

برای ساخت Microsoft-Decision-1، Qwen3.5-9B آموزش دیده را برای امتیازدهی سریع و تک پاسی در تصمیم گیری پست می کنیم و به زودی آن را بر روی مدل های دیگر، از جمله Microsoft AI (MAI) و OpenAI تغییر می دهیم. هنگامی که مجموعه ای ثابت از گزینه های پاسخ داده می شود، Microsoft-Decision-1 یک امتیاز احتمال کالیبره شده برای هر گزینه ارائه می دهد. این مدل از گزینه‌های بله/خیر، چند گزینه‌ای و رتبه‌بندی، و همچنین درجه‌بندی مبتنی بر روبریک پاسخ‌های هوش مصنوعی و اقدامات عامل، همه از طریق یک فراخوانی ساده API ساختاریافته، پشتیبانی می‌کند.

برای ایجاد یک مدل تصمیم گیری قابل اعتماد، ما مجبور شدیم به چندین چالش بپردازیم:

هر تصمیمی به تاخیر می افزاید، به خصوص زمانی که یک مرحله به مرحله دیگر بستگی دارد. به عنوان مثال، اضافه کردن تنها 100 میلی ثانیه به هر یک از 20 تصمیم متوالی، دو ثانیه به گردش کار کلی اضافه می کند.

تأخیر Microsoft-Decision-1 P50 35 برابر سریعتر از GPT-6 Sol است.

تطبیق بیش از حد یک مدل برای یک معیار یا یک نوع کار تصمیم گیری آسان است. ما باید بدانیم که آیا این کیفیت به وظایف مختلفی که مدل در آن آموزش ندیده است می‌رسد یا خیر. به همین دلیل است که ما Microsoft-Decision-1 را در ده‌ها معیار مورد ارزیابی قرار دادیم که از آموزش، مسیریابی، رتبه‌بندی، زمینه طولانی، وظایف چند زبانه و خارج از توزیع، استدلال و ایمنی دور مانده بودند. ما همچنین چندین مدل عمومی برتر را در جدول امتیازات باز محبوب JevBench انتخاب کردیم و آنها را در 36 معیار عمومی و خصوصی دیگر آزمایش کردیم.

Microsoft-Decision-1 بهترین عملکرد را در این مجموعه وسیع‌تر از معیارها داشت که نشان‌دهنده تعمیم قوی است.

ورودی های معادل باید تصمیمات معادل را ایجاد کنند. در تولید، حالت‌ها و دستورالعمل‌ها بازنویسی می‌شوند، توضیحات گزینه‌ها تغییر می‌کنند، انتخاب‌ها دوباره مرتب می‌شوند، کلیدها تغییر می‌کنند و نویز قالب‌بندی بی‌ضرر ظاهر می‌شود. هیچ یک از این تغییرات نباید تصمیم را تغییر دهد.

ما همان درخواست را به هشت روش برهم می زنیم و اندازه گیری می کنیم که تصمیم چقدر تغییر می کند. Microsoft-Decision-1 تصمیم خود را در مورد 1.3٪ از اغتشاشات به طور متوسط ​​با صفر تلنگر زمانی که توضیحات گزینه بازنویسی می شود یا زمانی که گزینه ها معکوس یا به هم ریخته می شوند، تغییر می دهد.

خود احتمال بخشی از API است، نه فقط یک امتیاز رتبه بندی. برنامه ها از اعتماد به نفس استفاده می کنند تا تصمیم بگیرند چه زمانی اقدام کنند، چه زمانی به تعویق بیفتند، یا درخواست بازبینی کنند، بنابراین پیش بینی 90 درصدی باید در مورد موارد نماینده، 9 بار از 10 مورد درست باشد.

یک مدل تصمیم باید درخواست های مضر را بدون مسدود کردن بی مورد درخواست های بی ضرر تشخیص دهد. ما Microsoft-Decision-1 را روی 5250 درخواست در 11 معیار آزمایش کردیم که محتوای مضر، تلاش‌های فرار از زندان و تزریق سریع را پوشش می‌داد و متوجه شدیم که این مدل با موفقیت رفتار مضر را رد کرد و در عین حال درجه بالایی از کاربرد را حفظ کرد.

طبقه بندی یک مورد استفاده کلیدی برای مدل های تصمیم گیری است. بررسی کنید که Microsoft-Decision-1 با چه دقت و سرعتی می‌تواند انواع جستجوها را در مقایسه با GPT-6 Sol دسته‌بندی کند:

مدل‌های تصمیم‌گیری می‌توانند برای سناریوهای استفاده از رایانه نیز کارآمد باشند. این نسخه نمایشی نشان می دهد که Microsoft-Decision-1 با چه سرعتی می تواند کار خرید یک کوله پشتی را در مقایسه با GPT-6 Sol انجام دهد:

در اینجا برخی از روش‌هایی است که ما Microsoft-Decision-1 را به صورت داخلی آزمایش کرده‌ایم، و راه‌های بسیار بیشتری در راه است.

XBOX Research از Microsoft-Decision-1 برای پردازش بیش از 10000 بازخورد و بررسی بازخورد از نظرسنجی‌ها، STEAM و Twitter/X استفاده کرد و آنها را در مجموعه‌ای ثابت از تم‌های ایجاد شده توسط محققان برای درک آنچه مردم درباره بازی‌ها، راه‌اندازی‌ها، استریم‌ها و موارد دیگر می‌گویند، مرتب کرد. آنها دریافتند که Microsoft-Decision-1 از نظر کیفیت با GPT-6 Sol رقابتی است در حالی که بیش از 14 برابر سریعتر و 200 برابر ارزانتر کار می کند.

تیم Copilot کیفیت چت و پاسخ های نمایندگی را اندازه گیری می کند. آزمایش آنها نشان داد که Microsoft-Decision-1 با GPT5.6 Luna قابل رقابت است و 100 برابر سریعتر است.

مهندسان در حال تماس ما از هوش مصنوعی برای بازیابی دانش مربوطه برای پاسخگویی به حوادث زنده در لاگ‌ها، سیستم‌های فروش بلیط، تماس‌ها، پیام‌ها و سایر منابع داده استفاده می‌کنند. Microsoft-Decision-1 بهتر و سریعتر از یک LLM برای بازیابی دانش عمل کرد.

مایکروسافت دیسکاوری یک ویژگی برنامه‌ریزی مجدد تطبیقی ​​را پیاده‌سازی می‌کند که در آن یک نماینده آزمایش قبلی را ارزیابی می‌کند، رویکرد آن را بر اساس درجه‌های روبریک اصلاح می‌کند و تا زمانی که اهداف خود را تکمیل کند تکرار می‌کند. Microsoft-Decision-1 46 برابر بیشتر از امتیاز مبتنی بر LLM در سه برابر سرعت امتیاز کسب کرد و تقریبا چهار برابر سرعت در برنامه ریزی مجدد تطبیقی داشت.

برنامه ریزی سریعتر و قابل اطمینان تر می تواند به طور قابل توجهی بر نتایج آزمایش های علمی طولانی مدت تأثیر بگذارد.

اینها فقط تعداد انگشت شماری از نمونه ها هستند. موارد استفاده بالقوه بیشتری برای Microsoft-Decision-1 وجود دارد. موارد زیر را امتحان کنید:

توسعه دهندگان می توانند با Microsoft-Decision-1 امروز در Microsoft Foundry از اینجا شروع کنند: https://ai.azure.com/catalog/models/Microsoft-Decision-1. همچنین می‌توانید از طریق OpenRouter در اینجا شروع کنید: https://openrouter.ai/microsoft/microsoft-decision-1.

اسناد در اینجا موجود است: https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/use-foundry-models-microsoft-decision.

اکنون که هوش مصنوعی عاملی یک واقعیت است، دیدیم که هزینه نقش مهمی در نحوه تصمیم گیری افراد برای استفاده از هوش مصنوعی دارد. و انتخاب مدل مناسب برای شغل مناسب بسیار مهم است. با اقداماتی که عاملان انجام می دهند و در دنیای واقعی تأثیر می گذارند، مدل های تصمیم گیری این پتانسیل را دارند که به مردم کمک کنند آن عوامل را از طریق محیط های پیچیده هدایت و کنترل کنند.

ما مشتاقانه منتظریم تا ببینیم توسعه دهندگان با Microsoft-Decision-1 چه چیزی می سازند و بازخورد آنها را بشنویم. ما به انتشار به‌روزرسانی‌های مدل، از جمله با ترکیب ارزیابی‌ها و داده‌ها برای بهینه‌سازی بیشتر کیفیت، اطمینان و هزینه ادامه خواهیم داد.

Quyet-1.0-Large — https://huggingface.co/chinhnc/Quyet-1.0-Large Surogate Rune 26B-A4B — https://huggingface.co/surogate/rune-26b-a4b-GGUF GPT-6 Luna Decisions — https://developers.openai.com/api/docs/guides/decisions deck-31B — https://github.com/krishna-gogineni-765/deck31b H2O-Lightning-4B — https://huggingface.co/h2oai/h2o-lightning-4b Strand https://github.com/strands-labs/strands-decider

به زودی، GitHub Copilot تعیین خواهد کرد که چه زمانی یک کار به بهترین شکل توسط هوشمندی روی دستگاه انجام می شود و چه زمانی باید از مدل های در مقیاس ابری استفاده کند.

طراحی ارزیابی ساختاریافته می‌تواند هم گستردگی رفتارهای آزمایش‌شده و هم تفسیرپذیری شکست‌های حاصل را بهبود بخشد و به مزایای عملی برای ایجاد ارزیابی‌های متنوع، قابل ردیابی و عملی منجر شود.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Microsoft-Decision-1, our model for fast decision-making

Article URL: https://commandline.microsoft.com/microsoft-decision-1-model-foundry/ Comments URL: https://news.ycombinator.com/item?id=50024913 Points: 197 # Comments: 66

همه‌ی اخبار فناوری