Clef: مدل های تصمیم گیری منبع باز و پلت فرم جدید تنظیم دقیق RL
آدرس مقاله: https://blog.cloudflare.com/clef-decision-models/ آدرس نظرات: https://news.ycombinator.com/item?id=49923692 امتیاز: 263 # نظر: 100
در چند هفته گذشته، سر و صدای زیادی در مورد مدل های تصمیم گیری مانند مدل Jev System One Typesafe AI وجود داشته است. در حالی که مدلهای طبقهبندیکننده برای مدتی وجود داشتهاند، Jev مفهوم مدل تصمیمگیری جدیدی را به دنیای هوش مصنوعی معرفی میکند – مدلی که خروجیهای ساختاری محدود را ارزان، سریع و پیوسته تولید میکند که در صورت نیاز به تصمیم میتواند به یک گردش کار اضافه شود. این مدلها به اندازه کافی توانایی کار روی هر مجموعه ای از ورودیها را دارند، بدون اینکه مدل را به طور مداوم بازآموزی کنند تا دستههای طبقهبندی جدید را در خود بگنجانند.
این در تضاد با دنیای مدلهای زبان بزرگ (LLM) است، که عمدتا غیر قطعی هستند، اما به اندازهای باز هستند که بتوانند استدلال کنند و متن و ابزار را برای بارهای کاری عامل ایجاد کنند.
امروز، ما دو مدل تصمیم گیری آموزش دیده با Cloudflare را منتشر می کنیم، Clef و Clef-flash که در Workers AI میزبانی می شوند. در حال حاضر Clef در مقایسه با شاخص تصمیم گیری Jev پیشتاز است، می توانید نتایج کامل را در سایت آزمایشی معیار زنده مشاهده کنید. این مدلها هوشمندتر، سریعتر و کاملا سازگار با Jev-API هستند، بنابراین میتوانید به راحتی با این مدلهای میزبانی شده آزمایش کنید. ما این مدلها را در Hugging Face تحت مجوز Apache 2.0 کاملا منبع باز میکنیم تا بتوانید به صورت محلی اجرا کنید و با خودتان آزمایش کنید.
در نهایت، ما هیجان زده هستیم که محصول جدید یادگیری تقویتی (RL) خود را معرفی کنیم، که به مشتریان اجازه می دهد تا Clef را متناسب با موارد استفاده خود تنظیم کنند.
یک مدل تصمیمگیری، طبقهبندیهایی را برای کمک به عوامل تصمیمگیری بر اساس احتمالات خاص انجام میدهد. به عنوان مثال، میتوانید پیام پشتیبانی مشتری (ورودیها) را ارسال کنید و بپرسید که آیا فوری است و کدام تیم باید آن را مدیریت کند. یک مدل تصمیم، پاسخهای تایپشده را با احتمالات (خروجیها) برمیگرداند، که کد شما میتواند از آنها برای مسیریابی بلیط، ایجاد تشدید یا موکول کردن به یک انسان استفاده کند.
این بدان معنی است که یک انسان لزوما دیگر نیازی ندارد که در حلقه تصمیمات عامل باشد - عوامل می توانند به صورت برنامه نویسی زمینه را جمع آوری کنند، تصمیم بگیرند و در مورد وظایف خود اقداماتی انجام دهند یا در صورت نیاز به یک انسان موکول شوند.
به طور خاص در Cloudflare، ما مدل جدید Clef خود را در تیم Threat Intelligence آزمایش کردهایم تا به ما در طبقهبندی دامنههای وبسایت کمک کند. با دادن دامنه به Clef (با مرورگر اجرا) میتواند به سرعت دستههایی را شناسایی کند که دامنه تحت آن قرار میگیرد - برای مثال، ممکن است دامنهای را با احتمال 95 درصد یک وبسایت مد، 85 درصد تجارت الکترونیک، <1 درصد فیشینگ، و غیره طبقهبندی کند. در مقابل، سریعترین LLM عمومی gpt-oss-120b ما در همان گردش کار 4.7 ثانیه طول کشید و تنها دو طبقهبندی را برگرداند.
بهعنوان یک کاربر، میتوانید تصور کنید که چگونه دو برابر صرفهجویی در تأخیر و نتایج میتواند به ما کمک کند تا گردشهای کاری اطلاعات تهدید را بهبود بخشیم و در شناسایی دامنههای مخرب یا قانونی سریعتر عمل کنیم. این را به هر موردی تعمیم دهید که در آن نیاز به تصمیمگیری سریع برنامهنویسی دارید، و جریانهای کاری قدرتمند عاملی را باز میکنید که قادر به تصمیمگیری، استدلال و اجرای مستقل هستند.
در تئوری موسیقی، کلید نمادی است که در ابتدای چوب موسیقی قرار میگیرد که نامهای زیر و بم خاصی را به خطوط و فضاها اختصاص میدهد. یک مدل تصمیم مشابه یک کلید موسیقی است زیرا به تعریف دامنه زمینه و نتهای (عملکرد) بعدی که به دنبال آن هستند کمک میکند. ما Clef را به عنوان نام خانواده مدلهای تصمیم خود انتخاب کردیم، زیرا اهداف مشابهی را دنبال میکند، و CF به Cloudflare گوش میدهد.
اگرچه بازار به طور فزاینده ای با مدل های تصمیم اشباع می شود، Clef دارای ویژگی های منحصر به فردی است که ما را برای انتشار آن برای عموم هیجان زده می کند. اول، دارای یک رمزگذار بینایی است، بنابراین می تواند تصاویر را بگیرد و محتوای بصری را طبقه بندی کند. این با Jev که امروزه فقط طبقه بندی متن را انجام می دهد متفاوت است. ثانیا، مدل ما دارای یک پنجره زمینه 64k (در مقایسه با 32k Jev) است که به کاربران اجازه میدهد تا وضعیت ورودی بیشتری را برای طبقهبندی مدل فشار دهند.
سوم، مدل ما دقیق و قدرتمند است و در مقایسه با سایر مدلهای تصمیمگیری موجود در بازار در معیارهای مختلف کیفیت، امتیاز رقابتی دارد. ما در زیر فهرست کوتاهی از ارزیابیهایی که برای تصمیمگیری مهم هستند، همانطور که توسط Jev Decision Index تعریف شدهاند انتخاب کردیم و برخی از مدلهای محبوبتر موجود در بازار را برای آن امتیاز دادیم. جدول زیر را برای معیارها بررسی کنید، یا نمرات را در سایت نمایشی نمایه تصمیم زنده ما مشاهده کنید:
ما همچنین معیارهایی را در مجموعه eval خود Typesafe اجرا کردیم و مدلهای Clef ما عملکرد خوبی داشتند و Jev را در 3 مورد از 4 زمینه شکست دادند. قابل ذکر است که Clef-flash ما با توجه به سرعت بالای آن فوق العاده خوب عمل می کند.
در بین 43 معیار ارزشی که اجرا کردیم، مدلهای Clef ما بر مدلهای تصمیمگیری در تأخیر غلبه کردند (به جز Laya که بسیار سریع است اما کیفیت را در معیارهای بالا کاهش میدهد):
علاوه بر مزایای تأخیر از خود مدل، مدلهای Clef ما بر روی Workers AI میزبانی میشوند. از آنجایی که آنها در زیرساخت های Cloudflare میزبانی می شوند، ما می توانیم از مزایای پردازنده های گرافیکی خود در لبه استفاده کنیم که منجر به تأخیر شبکه کم و تصمیم گیری سریع تر می شود. این بدان معنی است که شما می توانید Clef را در مسیری داغ برای تصمیم گیری نمایندگان قرار دهید و آن را با یکی از LLM های ما در Workers AI ترکیب کنید تا اقدامی انجام دهند.
Clef همچنین خروجی های کاملا تایپ شده مشابه Jev را تولید می کند و کاملا با API سازگار است، بنابراین می توانید مبادله را بسیار آسان انجام دهید. مدل Clef بزرگتر، مدل دقیق قدرتمندتر شماست، در حالی که مدل Clef-Flash برای تصمیم گیری های بحرانی تأخیر عالی است. این مدلها برای شرکتها آماده هستند و تضمین میکنیم که درخواستها یا پاسخهای شما را مطالعه، ذخیره یا آموزش نمیدهیم (مگر اینکه بخواهید از محصول تنظیم دقیق ما استفاده کنید که در زیر به آن میپردازیم).
میتوانید امروز با مدلهای Clef شروع کنید، با مستندات توسعهدهنده ما شروع کنید یا با مدل منبع باز موجود در مخزن Hugging Face بازی کنید.
اگر میخواهید به تنظیم Clef برای یک حجم کاری خاص کمک کنید، ما همچنین خدمات تنظیم دقیق را ارائه میدهیم - ابتدا به عنوان یک شریک عملی با تیم مهندس پیشرو مستقر (FDE) و سپس به عنوان یک پلت فرم تنظیم دقیق برای مشتریان برای آموزش و استقرار مجدد مدل در Cloudflare.
در همان هفته ای که Jev منتشر شد، ما در مورد آزمایش هایی که با مدل تصمیم گیری داخلی خود داشتیم پست کردیم. نسخه آزمایشی ما به این موضوع میپردازد که چگونه مدل DiffusionGemma را برای خروجی احتمالات قطعی با افشای logprobs که توسط یک مدل زبان بزرگ ایجاد میشوند، تطبیق دادیم. رویکرد اولیه ما بر اساس تحقیقات مستقل مت ماستراکی است که در جامعه یادگیری ماشینی (ML) با به اشتراک گذاشتن ایدههای جدید و درخواستها به موتور استنتاج vLLM فعال بوده است تا پشتیبانی DiffusionGemma را قویتر کند.
Clef بر اساس این مفهوم ساخته شده است، اما از یک مدل پایه متفاوت به عنوان ستون فقرات استفاده می کند. ما در حال حاضر از Qwen بهعنوان مدل پایه استفاده میکنیم و آن را پس از آموزش متناسب با موارد استفاده از مدل تصمیمگیری میکنیم. در طول استنتاج، Clef از Qwen برای یک پاس فقط از پیش تکمیل استفاده می کند، سپس گزینه های طرحواره معتبر را به صورت موازی امتیاز می دهد. مرحله تصمیم گیری غیرخودرگرسیون است، بنابراین هیچ متن میانی برای تولید توکن با توکن وجود ندارد، که باعث می شود Clef به طور قابل توجهی سریعتر از LLM های خودرگرسیون باشد.
Clef و Clef-flash به جای تولید متن میانی برای تولید پاسخ های ساختاریافته، انتخاب های طرحواره را مستقیما از بازنمایی های ستون فقرات داخلی استخراج می کنند. این رویکرد متکی بر یک فرآیند تخصصی مسیریابی توجه دو مرحلهای است: هر انتخاب معتبر زمینه مربوط به درخواست را استخراج میکند و به پارامترهای فیلد جداگانه اجازه میدهد تا با سایر زمینهها ارتباط داشته باشند و قبل از امتیازدهی به بار اصلی بازگردند. با استفاده از یک پیشین واژگانی، مدل قصد معنایی را در بین گزینه ها حفظ می کند.
در نهایت، معماری مسیریابی شواهد خاص، توجه میدانی مشترک و امتیازدهی با طرحواره را متحد می کند.
با فریز کردن Qwen3.8-27B برای Clef و Qwen3.5-9B برای Clef-flash، ما به طور مشترک هد مسیریابی را در کنار آداپتورهای رتبه پایین-256 بهینه کردیم. پس از آموزش ما از آنتروپی متقابل هموار برچسب برای خروجی های طرحواره معتبر جفت شده با از دست دادن Brier برای اصلاح کالیبراسیون احتمال استفاده می کند. این آموزش از مجموعه دادههای مصنوعی داخلی خودمان استفاده میکند که نظمهای فیلد، درخواستها و ساختارهای طرحواره را تغییر میدهد.
ما همچنین یادگیری تقویتی برای تصمیمات کالیبره شده (RLCD) را توسعه دادیم تا به عنوان یک هدف بهینه سازی ثانویه، اعطای اعتبار جزئی به انتخاب های ترتیبی مجاور، پاداش دادن به خروجی های رکورد کاملا دقیق، و اعمال جریمه مرجع برای جلوگیری از تغییر توزیع، به ما دقت و تعمیم بهتر عمل کند.
این بدان معناست که ما توانستیم به چند چیز جدید با Clef دست یابیم: دقت مدل را در طبقه بندی بهبود بخشیم، آن را به خروجی فقط احتمالات به جای تولید متن محدود کردیم و آن را سریعتر از Jev و مدل های پایه Qwen کردیم.
ما موارد استفاده داخلی زیادی را شنیدیم که نیاز به تنظیم دقیق مدل Clef ما برای ایجاد در گردش کار نمایندگی ما در Cloudflare داشت. برای مثال، تیمهای داخلی یک مدل طبقهبندیکننده میخواهند تا بتواند موارد ارسالی Trust & Safety را ارزیابی کند، به ما کمک کند درخواستهای پشتیبانی Cloudflare را تریاژ کنیم، یا حتی در محصولات Bot ما تعبیه شود تا تصمیم بگیریم که یک خزنده ربات خوبی است یا بد.
این موارد استفاده فوقالعاده خاص هستند و ما سالها تصمیمات برچسبگذاری شدهای داشتهایم که میتوانیم از آنها برای آموزش یک طبقهبندی خاص استفاده کنیم. وقتی یک مدل را تنظیم دقیق میکنید، ممکن است در ازای دقت بالاتر در یک دامنه خاص، از برخی عملکردهای عمومی صرف نظر کنید. از آنجایی که Cloudflare بیش از 15 سال داده شبکه در دامنههای مختلف دارد، ما میتوانیم مدلی را متناسب با این موارد استفاده خاص تنظیم کنیم که دقیقتر و سریعتر از مدل کلی Clef ما است.
ما از قبل با تیمهای داخلی کار میکنیم تا بفهمیم چگونه میتوانیم Clef را پس از آموزش برای ایجاد مدلهای قدرتمند ML ایجاد کنیم که تأثیر ما را افزایش داده و گردشهای کاری را در سراسر Cloudflare بهبود بخشد. این تیمهای داخلی و موارد استفاده، وظیفه بعدی تیم تنظیم دقیق FDE و مبنایی برای محصول یادگیری تقویتی (RL) ما هستند.
ما خدماتی را ارائه می دهیم که به مشتریان کمک می کند تا Clef را متناسب با حجم کاری خود با تیم عملی FDE خود تنظیم کنند. پس از آن، ما از تجربیات عملی خود یاد خواهیم گرفت که یک پلتفرم خود سرویس بسازیم که مشتریان می توانند از آن برای ضبط داده ها، تنظیم دقیق و استقرار مجدد مدل، همه در Cloudflare استفاده کنند.
این در واقع مدت زیادی بوده است - ما پلتفرم هوش مصنوعی خود را به گونهای ساختهایم که اصول اولیه درستی داشته باشیم تا بتوانیم یک محصول RL سفارشی بسازیم. علاقه به Jev نیاز به یک مدل طبقهبندیکننده سریع، کوچک، خاص را نشان میدهد، و ما این مورد را برای شروع آزمایش با محیطهای RL انتخاب کردیم.
برای انجام این کار، از اهرمهای اولیهای که قبلا روی پلتفرم Cloudflare خود ساختهایم، استفاده میکنیم:
این ترکیبی از چند قطعه در حال پیشرفت از پلتفرم هوش مصنوعی است که ما روی آن کار کردهایم، از جمله دروازه هوش مصنوعی که ترافیک هوش مصنوعی شما را ضبط میکند تا بتوانید از دادههای درخواست/پاسخ خود، Containers برای جعبههای RL و کارهای Workers AI Bring Your Own Model (Cog) که از زمان دریافت Replicate ما در حال پیشرفت بوده است، استفاده کنید.
ما مشتاقیم که امروز اولین مدل ML آموزش دیده با Cloudflare را از تیم Workers AI راه اندازی کنیم. ما هنوز در اینجا زود هستیم و پیشرفتهای بیشتری در انتظار داریم، اما این اولین نمایش فوقالعاده از کار سختی است که ما در تیم پلتفرم هوش مصنوعی انجام دادهایم. ما معتقدیم که Clef این توانایی را دارد که روش استفاده ما از عوامل را مختل کند، که به طور طبیعی با ماموریت Cloudflare برای ابر عامل بودن مطابقت دارد.
اگر موارد استفاده خاصی دارید و از قبل مشتری این محصولات هستید - مایلیم در حین آزمایش در این فضا با شما گپ بزنیم و شرکای طراحی باشیم.
مدلهای Clef میزبانشده در Workers AI را امتحان کنید، اگر میخواهید خودتان کاوش کنید وزنهها را در Hugging Face دانلود کنید، و اگر موارد استفاده دقیقی دارید که میخواهید به ما کمک کنیم، با آنها تماس بگیرید.
تیم ML ما از بهینه سازی مدل گرفته تا تحقیقات آموزش مدل در حال افزایش بوده است. اگر علاقه مند به پیوستن به ماموریت ما هستید، نقش های باز ما را بررسی کنید.
متن اصلی (انگلیسی)
Clef: Open-source decision models, and new RL fine-tuning platform
Article URL: https://blog.cloudflare.com/clef-decision-models/ Comments URL: https://news.ycombinator.com/item?id=49923692 Points: 263 # Comments: 100