پرش به محتوای اصلی

Clef: مدل های تصمیم گیری منبع باز و پلت فرم جدید تنظیم دقیق RL

هکرنیوز۱۴۰۵ مهر ۹, پنجشنبه، ساعت ۱۹:۴۸حدود 10 دقیقه مطالعه

آدرس مقاله: https://blog.cloudflare.com/clef-decision-models/ آدرس نظرات: https://news.ycombinator.com/item?id=49923692 امتیاز: 263 # نظر: 100

در چند هفته گذشته، سر و صدای زیادی در مورد مدل های تصمیم گیری مانند مدل Jev System One Typesafe AI وجود داشته است. در حالی که مدل‌های طبقه‌بندی‌کننده برای مدتی وجود داشته‌اند، Jev مفهوم مدل تصمیم‌گیری جدیدی را به دنیای هوش مصنوعی معرفی می‌کند – مدلی که خروجی‌های ساختاری محدود را ارزان، سریع و پیوسته تولید می‌کند که در صورت نیاز به تصمیم می‌تواند به یک گردش کار اضافه شود. این مدل‌ها به اندازه کافی توانایی کار روی هر مجموعه ای از ورودی‌ها را دارند، بدون اینکه مدل را به طور مداوم بازآموزی کنند تا دسته‌های طبقه‌بندی جدید را در خود بگنجانند.

این در تضاد با دنیای مدل‌های زبان بزرگ (LLM) است، که عمدتا غیر قطعی هستند، اما به اندازه‌ای باز هستند که بتوانند استدلال کنند و متن و ابزار را برای بارهای کاری عامل ایجاد کنند.

امروز، ما دو مدل تصمیم گیری آموزش دیده با Cloudflare را منتشر می کنیم، Clef و Clef-flash که در Workers AI میزبانی می شوند. در حال حاضر Clef در مقایسه با شاخص تصمیم گیری Jev پیشتاز است، می توانید نتایج کامل را در سایت آزمایشی معیار زنده مشاهده کنید. این مدل‌ها هوشمندتر، سریع‌تر و کاملا سازگار با Jev-API هستند، بنابراین می‌توانید به راحتی با این مدل‌های میزبانی شده آزمایش کنید. ما این مدل‌ها را در Hugging Face تحت مجوز Apache 2.0 کاملا منبع باز می‌کنیم تا بتوانید به صورت محلی اجرا کنید و با خودتان آزمایش کنید.

در نهایت، ما هیجان زده هستیم که محصول جدید یادگیری تقویتی (RL) خود را معرفی کنیم، که به مشتریان اجازه می دهد تا Clef را متناسب با موارد استفاده خود تنظیم کنند.

یک مدل تصمیم‌گیری، طبقه‌بندی‌هایی را برای کمک به عوامل تصمیم‌گیری بر اساس احتمالات خاص انجام می‌دهد. به عنوان مثال، می‌توانید پیام پشتیبانی مشتری (ورودی‌ها) را ارسال کنید و بپرسید که آیا فوری است و کدام تیم باید آن را مدیریت کند. یک مدل تصمیم، پاسخ‌های تایپ‌شده را با احتمالات (خروجی‌ها) برمی‌گرداند، که کد شما می‌تواند از آنها برای مسیریابی بلیط، ایجاد تشدید یا موکول کردن به یک انسان استفاده کند.

این بدان معنی است که یک انسان لزوما دیگر نیازی ندارد که در حلقه تصمیمات عامل باشد - عوامل می توانند به صورت برنامه نویسی زمینه را جمع آوری کنند، تصمیم بگیرند و در مورد وظایف خود اقداماتی انجام دهند یا در صورت نیاز به یک انسان موکول شوند.

به طور خاص در Cloudflare، ما مدل جدید Clef خود را در تیم Threat Intelligence آزمایش کرده‌ایم تا به ما در طبقه‌بندی دامنه‌های وب‌سایت کمک کند. با دادن دامنه به Clef (با مرورگر اجرا) می‌تواند به سرعت دسته‌هایی را شناسایی کند که دامنه تحت آن قرار می‌گیرد - برای مثال، ممکن است دامنه‌ای را با احتمال 95 درصد یک وب‌سایت مد، 85 درصد تجارت الکترونیک، <1 درصد فیشینگ، و غیره طبقه‌بندی کند. در مقابل، سریع‌ترین LLM عمومی gpt-oss-120b ما در همان گردش کار 4.7 ثانیه طول کشید و تنها دو طبقه‌بندی را برگرداند.

به‌عنوان یک کاربر، می‌توانید تصور کنید که چگونه دو برابر صرفه‌جویی در تأخیر و نتایج می‌تواند به ما کمک کند تا گردش‌های کاری اطلاعات تهدید را بهبود بخشیم و در شناسایی دامنه‌های مخرب یا قانونی سریع‌تر عمل کنیم. این را به هر موردی تعمیم دهید که در آن نیاز به تصمیم‌گیری سریع برنامه‌نویسی دارید، و جریان‌های کاری قدرتمند عاملی را باز می‌کنید که قادر به تصمیم‌گیری، استدلال و اجرای مستقل هستند.

در تئوری موسیقی، کلید نمادی است که در ابتدای چوب موسیقی قرار می‌گیرد که نام‌های زیر و بم خاصی را به خطوط و فضاها اختصاص می‌دهد. یک مدل تصمیم مشابه یک کلید موسیقی است زیرا به تعریف دامنه زمینه و نت‌های (عملکرد) بعدی که به دنبال آن هستند کمک می‌کند. ما Clef را به عنوان نام خانواده مدل‌های تصمیم خود انتخاب کردیم، زیرا اهداف مشابهی را دنبال می‌کند، و CF به Cloudflare گوش می‌دهد.

اگرچه بازار به طور فزاینده ای با مدل های تصمیم اشباع می شود، Clef دارای ویژگی های منحصر به فردی است که ما را برای انتشار آن برای عموم هیجان زده می کند. اول، دارای یک رمزگذار بینایی است، بنابراین می تواند تصاویر را بگیرد و محتوای بصری را طبقه بندی کند. این با Jev که امروزه فقط طبقه بندی متن را انجام می دهد متفاوت است. ثانیا، مدل ما دارای یک پنجره زمینه 64k (در مقایسه با 32k Jev) است که به کاربران اجازه می‌دهد تا وضعیت ورودی بیشتری را برای طبقه‌بندی مدل فشار دهند.

سوم، مدل ما دقیق و قدرتمند است و در مقایسه با سایر مدل‌های تصمیم‌گیری موجود در بازار در معیارهای مختلف کیفیت، امتیاز رقابتی دارد. ما در زیر فهرست کوتاهی از ارزیابی‌هایی که برای تصمیم‌گیری مهم هستند، همانطور که توسط Jev Decision Index تعریف شده‌اند انتخاب کردیم و برخی از مدل‌های محبوب‌تر موجود در بازار را برای آن امتیاز دادیم. جدول زیر را برای معیارها بررسی کنید، یا نمرات را در سایت نمایشی نمایه تصمیم زنده ما مشاهده کنید:

ما همچنین معیارهایی را در مجموعه eval خود Typesafe اجرا کردیم و مدل‌های Clef ما عملکرد خوبی داشتند و Jev را در 3 مورد از 4 زمینه شکست دادند. قابل ذکر است که Clef-flash ما با توجه به سرعت بالای آن فوق العاده خوب عمل می کند.

در بین 43 معیار ارزشی که اجرا کردیم، مدل‌های Clef ما بر مدل‌های تصمیم‌گیری در تأخیر غلبه کردند (به جز Laya که بسیار سریع است اما کیفیت را در معیارهای بالا کاهش می‌دهد):

علاوه بر مزایای تأخیر از خود مدل، مدل‌های Clef ما بر روی Workers AI میزبانی می‌شوند. از آنجایی که آنها در زیرساخت های Cloudflare میزبانی می شوند، ما می توانیم از مزایای پردازنده های گرافیکی خود در لبه استفاده کنیم که منجر به تأخیر شبکه کم و تصمیم گیری سریع تر می شود. این بدان معنی است که شما می توانید Clef را در مسیری داغ برای تصمیم گیری نمایندگان قرار دهید و آن را با یکی از LLM های ما در Workers AI ترکیب کنید تا اقدامی انجام دهند.

Clef همچنین خروجی های کاملا تایپ شده مشابه Jev را تولید می کند و کاملا با API سازگار است، بنابراین می توانید مبادله را بسیار آسان انجام دهید. مدل Clef بزرگتر، مدل دقیق قدرتمندتر شماست، در حالی که مدل Clef-Flash برای تصمیم گیری های بحرانی تأخیر عالی است. این مدل‌ها برای شرکت‌ها آماده هستند و تضمین می‌کنیم که درخواست‌ها یا پاسخ‌های شما را مطالعه، ذخیره یا آموزش نمی‌دهیم (مگر اینکه بخواهید از محصول تنظیم دقیق ما استفاده کنید که در زیر به آن می‌پردازیم).

می‌توانید امروز با مدل‌های Clef شروع کنید، با مستندات توسعه‌دهنده ما شروع کنید یا با مدل منبع باز موجود در مخزن Hugging Face بازی کنید.

اگر می‌خواهید به تنظیم Clef برای یک حجم کاری خاص کمک کنید، ما همچنین خدمات تنظیم دقیق را ارائه می‌دهیم - ابتدا به عنوان یک شریک عملی با تیم مهندس پیشرو مستقر (FDE) و سپس به عنوان یک پلت فرم تنظیم دقیق برای مشتریان برای آموزش و استقرار مجدد مدل در Cloudflare.

در همان هفته ای که Jev منتشر شد، ما در مورد آزمایش هایی که با مدل تصمیم گیری داخلی خود داشتیم پست کردیم. نسخه آزمایشی ما به این موضوع می‌پردازد که چگونه مدل DiffusionGemma را برای خروجی احتمالات قطعی با افشای logprobs که توسط یک مدل زبان بزرگ ایجاد می‌شوند، تطبیق دادیم. رویکرد اولیه ما بر اساس تحقیقات مستقل مت ماستراکی است که در جامعه یادگیری ماشینی (ML) با به اشتراک گذاشتن ایده‌های جدید و درخواست‌ها به موتور استنتاج vLLM فعال بوده است تا پشتیبانی DiffusionGemma را قوی‌تر کند.

Clef بر اساس این مفهوم ساخته شده است، اما از یک مدل پایه متفاوت به عنوان ستون فقرات استفاده می کند. ما در حال حاضر از Qwen به‌عنوان مدل پایه استفاده می‌کنیم و آن را پس از آموزش متناسب با موارد استفاده از مدل تصمیم‌گیری می‌کنیم. در طول استنتاج، Clef از Qwen برای یک پاس فقط از پیش تکمیل استفاده می کند، سپس گزینه های طرحواره معتبر را به صورت موازی امتیاز می دهد. مرحله تصمیم گیری غیرخودرگرسیون است، بنابراین هیچ متن میانی برای تولید توکن با توکن وجود ندارد، که باعث می شود Clef به طور قابل توجهی سریعتر از LLM های خودرگرسیون باشد.

Clef و Clef-flash به جای تولید متن میانی برای تولید پاسخ های ساختاریافته، انتخاب های طرحواره را مستقیما از بازنمایی های ستون فقرات داخلی استخراج می کنند. این رویکرد متکی بر یک فرآیند تخصصی مسیریابی توجه دو مرحله‌ای است: هر انتخاب معتبر زمینه مربوط به درخواست را استخراج می‌کند و به پارامترهای فیلد جداگانه اجازه می‌دهد تا با سایر زمینه‌ها ارتباط داشته باشند و قبل از امتیازدهی به بار اصلی بازگردند. با استفاده از یک پیشین واژگانی، مدل قصد معنایی را در بین گزینه ها حفظ می کند.

در نهایت، معماری مسیریابی شواهد خاص، توجه میدانی مشترک و امتیازدهی با طرحواره را متحد می کند.

با فریز کردن Qwen3.8-27B برای Clef و Qwen3.5-9B برای Clef-flash، ما به طور مشترک هد مسیریابی را در کنار آداپتورهای رتبه پایین-256 بهینه کردیم. پس از آموزش ما از آنتروپی متقابل هموار برچسب برای خروجی های طرحواره معتبر جفت شده با از دست دادن Brier برای اصلاح کالیبراسیون احتمال استفاده می کند. این آموزش از مجموعه داده‌های مصنوعی داخلی خودمان استفاده می‌کند که نظم‌های فیلد، درخواست‌ها و ساختارهای طرحواره را تغییر می‌دهد.

ما همچنین یادگیری تقویتی برای تصمیمات کالیبره شده (RLCD) را توسعه دادیم تا به عنوان یک هدف بهینه سازی ثانویه، اعطای اعتبار جزئی به انتخاب های ترتیبی مجاور، پاداش دادن به خروجی های رکورد کاملا دقیق، و اعمال جریمه مرجع برای جلوگیری از تغییر توزیع، به ما دقت و تعمیم بهتر عمل کند.

این بدان معناست که ما توانستیم به چند چیز جدید با Clef دست یابیم: دقت مدل را در طبقه بندی بهبود بخشیم، آن را به خروجی فقط احتمالات به جای تولید متن محدود کردیم و آن را سریعتر از Jev و مدل های پایه Qwen کردیم.

ما موارد استفاده داخلی زیادی را شنیدیم که نیاز به تنظیم دقیق مدل Clef ما برای ایجاد در گردش کار نمایندگی ما در Cloudflare داشت. برای مثال، تیم‌های داخلی یک مدل طبقه‌بندی‌کننده می‌خواهند تا بتواند موارد ارسالی Trust & Safety را ارزیابی کند، به ما کمک کند درخواست‌های پشتیبانی Cloudflare را تریاژ کنیم، یا حتی در محصولات Bot ما تعبیه شود تا تصمیم بگیریم که یک خزنده ربات خوبی است یا بد.

این موارد استفاده فوق‌العاده خاص هستند و ما سال‌ها تصمیمات برچسب‌گذاری شده‌ای داشته‌ایم که می‌توانیم از آنها برای آموزش یک طبقه‌بندی خاص استفاده کنیم. وقتی یک مدل را تنظیم دقیق می‌کنید، ممکن است در ازای دقت بالاتر در یک دامنه خاص، از برخی عملکردهای عمومی صرف نظر کنید. از آنجایی که Cloudflare بیش از 15 سال داده شبکه در دامنه‌های مختلف دارد، ما می‌توانیم مدلی را متناسب با این موارد استفاده خاص تنظیم کنیم که دقیق‌تر و سریع‌تر از مدل کلی Clef ما است.

ما از قبل با تیم‌های داخلی کار می‌کنیم تا بفهمیم چگونه می‌توانیم Clef را پس از آموزش برای ایجاد مدل‌های قدرتمند ML ایجاد کنیم که تأثیر ما را افزایش داده و گردش‌های کاری را در سراسر Cloudflare بهبود بخشد. این تیم‌های داخلی و موارد استفاده، وظیفه بعدی تیم تنظیم دقیق FDE و مبنایی برای محصول یادگیری تقویتی (RL) ما هستند.

ما خدماتی را ارائه می دهیم که به مشتریان کمک می کند تا Clef را متناسب با حجم کاری خود با تیم عملی FDE خود تنظیم کنند. پس از آن، ما از تجربیات عملی خود یاد خواهیم گرفت که یک پلتفرم خود سرویس بسازیم که مشتریان می توانند از آن برای ضبط داده ها، تنظیم دقیق و استقرار مجدد مدل، همه در Cloudflare استفاده کنند.

این در واقع مدت زیادی بوده است - ما پلتفرم هوش مصنوعی خود را به گونه‌ای ساخته‌ایم که اصول اولیه درستی داشته باشیم تا بتوانیم یک محصول RL سفارشی بسازیم. علاقه به Jev نیاز به یک مدل طبقه‌بندی‌کننده سریع، کوچک، خاص را نشان می‌دهد، و ما این مورد را برای شروع آزمایش با محیط‌های RL انتخاب کردیم.

برای انجام این کار، از اهرم‌های اولیه‌ای که قبلا روی پلتفرم Cloudflare خود ساخته‌ایم، استفاده می‌کنیم:

این ترکیبی از چند قطعه در حال پیشرفت از پلتفرم هوش مصنوعی است که ما روی آن کار کرده‌ایم، از جمله دروازه هوش مصنوعی که ترافیک هوش مصنوعی شما را ضبط می‌کند تا بتوانید از داده‌های درخواست/پاسخ خود، Containers برای جعبه‌های RL و کارهای Workers AI Bring Your Own Model (Cog) که از زمان دریافت Replicate ما در حال پیشرفت بوده است، استفاده کنید.

ما مشتاقیم که امروز اولین مدل ML آموزش دیده با Cloudflare را از تیم Workers AI راه اندازی کنیم. ما هنوز در اینجا زود هستیم و پیشرفت‌های بیشتری در انتظار داریم، اما این اولین نمایش فوق‌العاده از کار سختی است که ما در تیم پلتفرم هوش مصنوعی انجام داده‌ایم. ما معتقدیم که Clef این توانایی را دارد که روش استفاده ما از عوامل را مختل کند، که به طور طبیعی با ماموریت Cloudflare برای ابر عامل بودن مطابقت دارد.

اگر موارد استفاده خاصی دارید و از قبل مشتری این محصولات هستید - مایلیم در حین آزمایش در این فضا با شما گپ بزنیم و شرکای طراحی باشیم.

مدل‌های Clef میزبان‌شده در Workers AI را امتحان کنید، اگر می‌خواهید خودتان کاوش کنید وزنه‌ها را در Hugging Face دانلود کنید، و اگر موارد استفاده دقیقی دارید که می‌خواهید به ما کمک کنیم، با آنها تماس بگیرید.

تیم ML ما از بهینه سازی مدل گرفته تا تحقیقات آموزش مدل در حال افزایش بوده است. اگر علاقه مند به پیوستن به ماموریت ما هستید، نقش های باز ما را بررسی کنید.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Clef: Open-source decision models, and new RL fine-tuning platform

Article URL: https://blog.cloudflare.com/clef-decision-models/ Comments URL: https://news.ycombinator.com/item?id=49923692 Points: 263 # Comments: 100

همه‌ی اخبار فناوری