پرش به محتوای اصلی

پرتو: مدل 501B با وزن باز Reflection

هکرنیوز۱۴۰۵ مهر ۱۳, دوشنبه، ساعت ۲۲:۴۶حدود 14 دقیقه مطالعه

آدرس مقاله: https://reflection.ai/blog/introducing-beam آدرس نظرات: https://news.ycombinator.com/item?id=49969183 امتیاز: 171 # نظرات: 50

ما در حال معرفی Beam، اولین مدل وزن باز Reflection هستیم. Beam یک مدل ترکیبی از متخصصان پراکنده با 501 میلیارد پارامتر کل، 23 میلیارد پارامتر فعال است که برای کدنویسی، استدلال و بارهای کاری عاملی ساخته شده است.

قابلیت‌های Beam از سرمایه‌گذاری‌های عمده در آموزش پیش‌آموزشی و یادگیری تقویتی (RL) ناشی می‌شود. ما این مدل را بر روی 23.8 تریلیون توکن متنوع، سرپرستی شده و با کیفیت بالا از وب و مجموعه داده‌های دارای مجوز اختصاصی آموزش داده‌ایم، که با مدل‌های پایه باز با اندازه مشابه در دسترس مطابقت دارد یا بهتر عمل می‌کند. به موازات آن، الگوریتم‌ها، محیط‌های آموزشی و زیرساخت‌های مورد نیاز برای حفظ RL با محاسبات بالا در مقیاس استثنایی را توسعه دادیم. اجرای RL با محاسبات بالا ما بیش از 100 میلیون نسخه در 10.5 هزار پردازنده گرافیکی NVIDIA GB300 طی 4 هفته آموزش ایجاد کرد.

با هم، این تلاش ها عملکرد رقابتی وزن باز با راندمان محاسبه استنتاج مرزی را ایجاد کردند.

بیم در حال گذراندن مرحله نهایی بازی قرمز و ارزیابی است. برای دسترسی زودهنگام به مدل می توانید اینجا ثبت نام کنید. وزن‌ها، گزارش فنی، کارت مدل و مصنوعات توسعه‌دهنده را اواخر این ماه منتشر خواهیم کرد.

ما Beam را با تمرکز ویژه بر روی کدنویسی و عملکرد عامل آموزش دادیم. Beam مرزهای وزن باز غربی را پیش می‌برد و با مدل‌های باز بزرگ‌تر مانند GLM 5.2 و نزدیک شدن به Qwen 3.8-Max در کدنویسی و وظایف نمایندگی قابل رقابت است. در جایی که مدل‌های مرزی باز مانند Kimi K3 از نظر قابلیت خام جلوتر هستند، مزیت Beam کارایی در زمان استنتاج است.

شکل زیر عملکرد Beam را در طیف وسیعی از معیارهای کدنویسی، عاملی، استدلالی و STEM نشان می دهد. NR نشان دهنده امتیازهایی است که گزارش نشده اند.

پرتو قابلیت های کدگذاری و عاملی را با استدلال بسیار کارآمد ترکیب می کند. در معیارهای استدلال پیشرفته، در حالی که از محاسبات استنتاج 3 تا 4× کمتر استفاده می‌کند، به نمرات قابل مقایسه با GLM-5.2 دست می‌یابد. در مقایسه با مدل‌های خانواده پارامترهای 2T+ مانند Qwen 3.8-Max، که به محاسبه استنتاج به‌طور قابل‌توجهی در هر توکن نیاز دارند، افزایش کارایی حتی بیشتر می‌شود.

این نتایج به هوش بیشتر در هر توکن ترجمه می‌شود، قابلیت‌های مدل قوی را با هزینه کمتر ارائه می‌کند، و Beam را به یک مدل نیروی کار قدرتمند برای برنامه‌نویسی سازمانی و بارهای کاری عامل تبدیل می‌کند.

ما یادگیری تقویتی محاسباتی بالا را به یک محور مقیاس مرکزی برای Beam تبدیل کردیم و در علم RL، داده ها و زیرساخت سرمایه گذاری کردیم تا محاسبات بیشتر را به قابلیت های قوی تر تبدیل کنیم. مقیاس‌بندی RL کاوش گسترده‌تری از استراتژی‌های حل مسئله را امکان‌پذیر می‌کند، در حالی که عرضه‌های طولانی‌تر از استدلال چند مرحله‌ای، استفاده از ابزار و سازگاری با بازخورد محیطی پشتیبانی می‌کنند.

برای افزایش مقیاس یادگیری تقویتی، 10.5 هزار پردازنده گرافیکی NVIDIA GB300 را به مدت چهار هفته مستقر کردیم که بیش از 100 میلیون نسخه با حداکثر طول زمینه 256 هزار توکن ایجاد کرد. در آموزش و درجه بندی تقریبا 1.3 میلیارد جعبه شنی استفاده شد. برای حفظ این حجم، یک میلیون محیط کدگذاری، عاملی و STEM با کیفیت بالا تهیه کردیم. ما معتقدیم که این یکی از بزرگترین اجراهای RL در مقیاس است که توسط هر آزمایشگاه باز تا به امروز انجام شده است. در مجموعه ارزیابی ما، با افزایش محاسبات RL، بدون هیچ نشانه‌ای از فلات، قابلیت‌ها به بهبود ادامه دادند.

ما Beam را با گرادیان های خط مشی ناهمزمان آموزش دادیم. در مقیاس، کهنگی سیاست به منبع اصلی بی‌ثباتی برای این روش‌ها تبدیل می‌شود. عرضه‌های طولانی مدت دارای توکن‌هایی هستند که توسط چندین مدل بازرسی تولید می‌شوند، با توکن‌های قبلی نسبت به سیاست فعلی کهنه‌تر می‌شوند. عدم تطابق عددی بین موتورهای آموزشی و استنتاجی این چالش را بیشتر می کند.

ما الگوریتم‌های جدیدی را برای حفظ یادگیری پایدار در این شرایط ایجاد کردیم و در عین حال به طور سیستماتیک عدم تطابق آموزش و استنتاج را در سراسر خط لوله خود کاهش دادیم. این پیشرفت‌ها RL کاملا ناهمزمان را در مقیاسی فعال می‌کنند که پایدار می‌ماند، حتی زمانی که از تعاملات ایجاد شده بیش از یک روز قبل یاد می‌گیرید.

ما Beam را با یک پنالتی طول قابل کنترل آموزش دادیم که به راه‌حل‌های موفق پاداش می‌دهد و در عین حال از نشانه‌های غیر ضروری جلوگیری می‌کند. در اوایل RL، عملکرد حتی با کاهش مدت زمان تکمیل بهبود یافت: این مدل یاد گرفت که کارها را به طور مؤثرتر با استدلال کمتر حل کند. بعدها، همانطور که Beam قابلیت‌های عامل قوی‌تری را توسعه داد، طول تکمیل دوباره افزایش یافت، اما آن توکن‌های اضافی از دستاوردهای بیشتر در عملکرد پشتیبانی کردند. در طول آموزش، RL مبادله بین قابلیت و استفاده توکن را بهبود بخشید.

کاربران می‌توانند این مبادله را از طریق پارامتر تلاش استدلالی Beam کنترل کنند: تنظیمات پایین‌تر به نفع پاسخ‌های کوتاه‌تر است، در حالی که تنظیمات بالاتر به استدلال طولانی‌تر اجازه می‌دهد تا عملکرد در کارهای سخت را بهبود بخشد. این به کاربران انعطاف‌پذیری می‌دهد تا تلاش استدلالی را با وظایف خود و محاسبه بودجه مطابقت دهند.

ما آموزش RL Beam را برای توسعه استدلال و قابلیت های عاملی طراحی کردیم که فراتر از وظایف آموزشی آن تعمیم می یابد. در طول مرحله آموزش در مورد استدلال، مهندسی نرم افزار، و وظایف پایانه، علیرغم عدم وجود وظایف مرور از مخلوط RL، شاهد دستاوردهای ثابتی در مرور بودیم. این انتقال نشان می‌دهد که Beam در حال یادگیری قابلیت‌های عامل گسترده‌تری بود که در سراسر حوزه‌ها تعمیم می‌یابند. هنگامی که به وب دسترسی پیدا کرد، به طور ارگانیک یاد گرفت که مدل‌های زبان بزرگ دیگر را جستجو و پرس و جو کند و از APIهای OCR برای خواندن اسناد استفاده کند.

دموهای زیر نشان می‌دهد که Beam از این قابلیت‌ها در تحقیقات، توسعه برنامه‌ها، گیم‌پلی و جریان‌های کاری یادگیری ماشین استفاده می‌کند. نمونه‌ها از ساخت داشبورد زنده متروی نیویورک با استفاده از داده‌های عمومی تا ایجاد برنامه‌های کاربردی تعاملی و تهیه مدل‌های نوت‌بوک تنظیم دقیق را شامل می‌شود. اگرچه Beam فقط متنی است، اما زمانی که به صورت متن نمایش داده می شود، می تواند با اطلاعات سایر روش ها کار کند. در یکی دیگر از حوزه‌های خارج از توزیع، Beam همچنین یک نوت بوک تنظیم دقیق برای جدیدترین و کوچک‌ترین مدل Gemma-4 در یک کار Text2SQL ایجاد کرد.

این دموها با هم، وسعت وظایفی را که Beam می‌تواند با ترکیب استدلال، کدنویسی و استفاده از ابزار انجام دهد، نشان می‌دهد. هر مثال شامل درخواست اولیه و خروجی حاصل، همراه با تنظیمات مربوطه و تکرارهای کاربر است.

یادگیری تقویتی در مقیاس مرزی به حجم زیادی از وظایف دشوار و با کیفیت بالا نیاز دارد. ما مجموعه ای از نزدیک به یک میلیون محیط را، عمدتا از طریق خطوط لوله داده مصنوعی، تکمیل شده توسط داده های فروشنده اختصاصی و منابع منبع باز، ایجاد کردیم.

ما به شدت به یک فرآیند اصلاحی تکراری متکی بودیم. ابتدا، ما محیط‌ها را در مجموعه وسیعی از حوزه‌ها از جمله مهندسی نرم‌افزار، استفاده از ترمینال، کدنویسی رقابتی، STEM، جستجوی وب، استفاده از ابزار و کار دانش عمومی، سنتز یا منبع‌سازی کردیم. دوم، ما وظایف را به شدت برای سختی فیلتر کردیم (با اطمینان از اینکه آنها به طور مداوم قابل حل و یا غیرممکن برای مدل هستند) و کیفیت (به عنوان مثال، نامشخص، گمراه کننده، قابل حدس زدن، هک کردن، یا در غیر این صورت شکسته یا پر سر و صدا).

سوم، ما وظایف را از طریق RL آزمایش کردیم، که به ما امکان داد مشکلات کیفیت یا دشواری بیشتری را شناسایی کنیم و تکرار بعدی منبع‌یابی و فیلتر کردن را اعلام کنیم.

در طول توسعه Beam، متوجه شدیم که مصالحه در کیفیت داده‌ها منجر به پلاتو توانایی و سایر مسائل آموزشی می‌شود. بهبودهای سیستماتیک در کیفیت کار برای حفظ دستاوردهای قابلیت در طول اجرا ضروری بود، که بدون هیچ نشانه ای از اشباع به پایان رسید.

RL عامل محاسباتی بالا به تولید برنامه‌ها، ابزارهای اجرایی، ارزیابی نتایج و به‌روزرسانی مدل در مقیاس نیاز دارد. ما یک پلتفرم ناهمزمان ساختیم که به این فرآیندها اجازه می‌دهد به طور مستقل اجرا شوند و در عین حال جریان تجربه و به‌روزرسانی‌های مدل را هماهنگ می‌کنند.

در طول آموزش Beam، ما به طور متوسط ​​110K پخش همزمان را حفظ کردیم. هفت قابلیت این را عملی کرده است:

اجرای کاملا ناهمزمان: Agent ها در حالی که مربی نسخه های مدل جدید را می آموزد و منتشر می کند، برنامه ها را تولید می کنند. هر توکن با نسخه ای که آن را تولید کرده است برچسب گذاری می شود، و به الگوریتم آموزشی اجازه می دهد تا زمانی که برنامه های تکمیل شده در آموزش جریان پیدا می کند، بیات بودن خط مشی را محاسبه کند.

تخصیص محاسباتی انعطاف‌پذیر: ما تعادل بین استنتاج و آموزش را با تکامل حجم کار تنظیم کردیم و در نسبت‌های GPU استنتاج به آموزش از 3.9:1 تا 5.4:1 عمل می‌کردیم. ما همچنین اندازه مربی را در پنج پیکربندی مش GPU در یک اصل آموزشی بدون از دست دادن حالت آموزشی تغییر دادیم.

به روز رسانی سریع مدل: وزن های جدید در یک میانگین تقریبا 12 ثانیه به ناوگان استنتاج رسیدند. توزیع سلسله مراتبی وزن ها را در رک ها از طریق RoCE منتقل می کند، سپس آنها را به صورت محلی از طریق NVLink به اشتراک می گذارد. در مقایسه با هر ماکتی که مستقیما وزنه‌ها را می‌کشد، این امر ترافیک متقاطع رک را تا 75 درصد کاهش داد و باعث شد که وزن‌های جدید در ناوگان 2.2× سریع‌تر بپذیرند.

مقاومت در برابر شکست استنتاج: در طول اجرا، 71 حادثه استنتاج بدون خاتمه کار آموزشی انجام شد. ظرفیت استنتاج در میانگین هشت دقیقه بازیابی شد و ظرفیت از دست رفته تنها 0.02 درصد از دقیقه‌های GPU خدمت سپری شده را تشکیل می‌دهد.

محیط‌های در مقیاس: ما تا 170 هزار جعبه شنی همزمان را در طول اجرا پشتیبانی کردیم. در سراسر این پلتفرم، بیش از یک میلیارد درخواست ایجاد جعبه شنی را پردازش کردیم که بیش از 20 خوشه، دو ابر و چهار منطقه را در بر می گرفت. 90 درصد از جعبه های شنی جدید در کمتر از 10 ثانیه آماده شدند.

بسته‌بندی کارآمد مربی: بسته‌بندی پویا باعث می‌شود دسته‌های آموزشی به طور متوسط ​​99.99 درصد پر شوند، و توان پردازشی هر پردازنده گرافیکی را در 1.5 درصد نگه می‌دارد زیرا میانگین طول عرضه تقریبا 70 درصد افزایش یافته است.

مشاهده پذیری و یکپارچگی پاداش: سوابق به ازای هر توکن، بررسی ثبات عددی بین آموزش و استنتاج را در هر مرحله فعال می کند. داوران مستقل راه‌حل‌های پاس را برای سوءاستفاده‌های تأییدکننده بررسی کردند، در حالی که رکوردهای قابل پخش باعث می‌شوند پاداش‌ها و استفاده از آنها در تمرین قابل بازرسی باشد.

با هم، این قابلیت‌ها ما را قادر می‌سازد تا در تعاملات طولانی‌تر و محیط‌های سخت‌تر آموزش ببینیم و در عین حال توان عملیاتی را حفظ کنیم، از شکست‌ها بازیابی کنیم، و یکپارچگی فرآیند یادگیری را بررسی کنیم.

یادگیری تقویتی بر روی یک مدل پایه قوی ساخته می شود. برای تسهیل استدلال، ما اطمینان حاصل کردیم که بنیاد Beam دانش غنی در حوزه‌های کدگذاری، قابلیت‌های عاملی ذاتی که می‌توان آن را تقویت کرد، و پویایی بهینه‌سازی MoE پایدار دارد.

دستور العمل معماری و بهینه سازی Beam بر پایه و اساس سالم عددی برای RL پایین دستی پایدار تأکید می کند. این ترکیب توجه محلی و جهانی به هم پیوسته، کارشناسان مسیریابی دقیق، جریان باقیمانده کنترل شده، و اشکال متعدد تعادل بار را برای اطمینان از استفاده متخصص پایدار و متعادل و انتشار سیگنال سالم از طریق باقیمانده ها ترکیب می کند.

برای استفاده کارشناسانه، ما بر اساس تعادل بار بدون تلفات کمکی (DeepSeek-AI et al., 2024) ساخته شدیم، و تجزیه کسینوس به روز رسانی تعصب متخصص را برای کاهش آشفتگی های مسیریابی بعدا در آموزش معرفی کردیم. تعادل در سطح توالی، استفاده متوازن و متوازن از متخصصان را در داده‌های خارج از توزیع پیش‌آموزشی بیشتر تشویق می‌کند و مدل را برای توزیع متغیر RL پایین‌دستی آماده می‌کند. در نتیجه، پایه از پیش آموزش‌دیده نهایی دارای استفاده یکنواخت تقریبا عالی است، و اطمینان حاصل می‌کند که می‌توان از همه کارشناسان برای استدلال آموخته‌شده استفاده کرد.

برای جریان باقیمانده، ما یک رویکرد مقیاس‌بندی مبتنی بر عمق را توسعه دادیم که با انباشته شدن خروجی‌های زیرلایه، با رشد فعال‌سازی مقابله می‌کند و به ثابت نگه داشتن هنجارهای باقی‌مانده با افزایش عمق مدل کمک می‌کند. همراه با SandwichNorm، دروازه توجه عنصری، و تجمع باقیمانده FP32 - که خطای گرد کردن را هنگام اضافه کردن به‌روزرسانی‌های کوچک به جریان کاهش می‌دهد - این دستور رشد فعال‌سازی و نقاط پرت را کنترل می‌کند، در نتیجه انتشار سیگنال سالم را در تمام لایه‌های Beam تضمین می‌کند. این ثبات در طول پیش‌آموزش، یادگیری تقویتی و همسویی ادامه دارد.

Beam بر روی 23.8 تریلیون توکن با کیفیت بالا از وب، منابع عمومی و مجموعه داده‌های دارای مجوز اختصاصی از قبل آموزش داده شد. خط لوله داده ما به گونه ای طراحی شده است که به Beam پایه ای برای کدگذاری عاملی پایین دستی بدهد: کد منبع، توضیحات فنی، و دانش ریاضی و علمی، که در هر مرحله از نظارت حفظ می شود. ما تقریبا بر روی تمام اسناد کد و کدهای قابل دسترسی عمومی و بدون محدودیت مجوز در وب آموزش می دهیم.

ما طبقه‌بندی‌کننده‌های کیفیت خودمان را برای محتوای وب، کد و STEM آموزش دادیم، داده‌ها را به سطوح با کیفیت ریز تقسیم کردیم و آموزش را به سمت مواد قوی‌تر ارزیابی کردیم. پس از تکرار علمی گسترده، دقت و یادآوری داده‌ها را به طور قابل توجهی فراتر از فیلترهای وب معمولی مورد استفاده در چارچوب‌های داده OSS پیشرفته بهینه کردیم. از یک طرف، حدود 95 درصد از توکن‌های خام اینترنت از طریق تجزیه، کپی‌برداری و پردازش حذف می‌شوند.

از سوی دیگر، متوجه شدیم که تکنیک‌های مرسوم تقریبا 1.8 تریلیون توکن با کیفیت بالا را که نگه می‌داریم، از دست می‌دهند، که شامل 87 درصد از توکن‌های کد وب مدیریت‌شده ما می‌شود.

مدل‌سازی کد برای بالاترین کارایی نیاز به مدیریت خاص خود دارد. برای هر زبان، فیلترهای تنظیم‌شده جداگانه اعمال کردیم، محتوای تولیدشده خودکار و غیرقابل یادگیری با کیفیت پایین را حذف کردیم و طبقه‌بندی‌کننده‌های آموزش دیده برای شناسایی محتوا یا کدهای خراب که ممکن است به ثبات آموزش آسیب بزند. زبان‌ها و انواع فایل‌هایی که بیش از حد ارائه شده‌اند، برای گسترش بیشتر در معرض تعادل مجدد قرار می‌گیرند.

ما همچنین یک خط لوله با توان بالا برای پردازش مصنوعات PDF ایجاد کردیم تا اطمینان حاصل کنیم که Beam پایه دارای دانش در طیف گسترده ای از موضوعات STEM است. این یک مدل OCR با زبان بینایی را با طبقه‌بندی‌کننده‌های کیفیت داخلی و آشکارسازهای مصنوع ادغام می‌کند که بازسازی‌های نادرست را شناسایی می‌کند و در هزاران GPU توزیع شده است تا پتابایت داده‌های فنی را پردازش کند.

ما کد و محتوای فنی را چندین بار تکرار کردیم تا نمایش مدل را در طول افق آموزشی آن افزایش دهیم. این امر مستلزم توجه دقیق به بازنویسی فازی، الگوریتم‌های بسته‌بندی و علم آموزش بیش از حد بود تا اطمینان حاصل شود که هر منبع داده‌ای مکرر به جای آسیب رساندن به تعمیم کمک می‌کند.

Beam در کمتر از چهار هفته روی یک کلاستر متشکل از 6144 پردازنده گرافیکی NVIDIA GB300 NVL72 از قبل آموزش داده شد. برای دستیابی به قابلیت اطمینان، عملکرد و سرعت توسعه مورد نیاز برای آموزش Beam در مقیاس، تقریبا کل زیرساخت پشته را در داخل ساختیم. این شامل یک زمان‌بندی جدید مبتنی بر توپولوژی و مبتنی بر Kubernetes در سراسر خوشه‌های ما بود. یک سیستم چرخه حیات گره داخلی با نظارت مداوم سلامت و هشدارها؛ و یک سیستم تشخیص خرابی داده‌های بی‌صدا (SDC) که قادر به بازپیچ و راه‌اندازی نیمه مستقل است.

این سیستم ها با هم، عملکرد و کنترل عملیاتی مورد نیاز برای آموزش مدل مرزی خود را به طور کارآمد و با ثبات بیشتر به ما دادند.

در نتیجه سرمایه گذاری های گسترده در ثبات دستور العمل آموزشی، زیرساخت ها و کیفیت داده ها، اجرای کلی پیش تمرین با یک مسیر بسیار صاف به پایان رسید. ما 9 چرخش نیمه خودکار را در سرتاسر اجرا کردیم که به هنجارهای گرادیان غیر قطعی یا به SDC های مشکوک نسبت داده می شد. علاوه بر این، بازده خوب اجرا (سهم ساعت دیواری صرف شده برای مراحل تمرین در مدل نهایی) به لطف بهبود در ایست بازرسی، تشخیص عیب و مدیریت سلامت گره، تا پایان به 92.3 درصد رسید.

مرحله آموزش میانی ما به‌طور خاص به‌عنوان پایه‌ای برای RL با محاسبات بالا طراحی شده است، دانش، استدلال و قابلیت‌های استفاده از ابزار را توسعه می‌دهد که به Beam اجازه می‌دهد از کارهای سخت‌تر بیاموزد.

ما خطوط لوله تنظیم داده‌های چند مرحله‌ای ساختیم که ساختار و پیچیدگی وظایف دنیای واقعی را به تصویر می‌کشد و در عین حال پوشش قابلیت‌هایی را گسترش می‌دهد که یادگیری آنها به تنهایی از داده‌های خام دشوار است. با شروع از نمونه‌های دنیای واقعی که به دقت انتخاب شده‌اند، این خطوط لوله مواد را به داده‌های آموزشی که برای آموزش قابلیت‌های خاص طراحی شده‌اند، تبدیل، ترکیب و گسترش می‌دهند. این شامل اسناد طولانی و غنی از استدلال است که مدل را در معرض زنجیره های گسترده منطق قرار می دهد.

Midtraining همچنین طول زمینه موثر Beam را به 1M توکن افزایش می دهد. ما مخازن کد ساختاریافته، وظایف با افق بلند، و اسناد طولانی با کیفیت بالا را ترکیب می کنیم تا به مدل آموزش دهیم تا اطلاعات مرتبط را در توالی های طولانی شناسایی، حفظ و متصل کند.

این قابلیت‌ها با هم، به RL نقطه شروع قوی‌تری می‌دهند، و Beam را قادر می‌سازد تا راه‌حل‌های پیچیده‌تری را بررسی کند، از طریق تعاملات طولانی‌تر کار کند و از کارهایی که در غیر این صورت دور از دسترس بودند، بیاموزد.

کار ایمنی و هم ترازی ما شامل آموزش مدل دوم از ایست بازرسی از پیش آموزش دیده با استفاده از یک خط لوله SFT و RL جداگانه بر روی داده هایی بود که به طور خاص اصولی را هدف قرار می دهد که مدل باید از آنها پیروی کند. ما توانایی‌های این دو معلم - یک معلم RL در مقیاس بزرگ و یک معلم ایمنی و هم ترازی اختصاصی - را از طریق تقطیر در سیاست چند معلم (MOPD) ادغام کردیم.

ما اصول ایمنی و هم ترازی Beam را در سه سطح سازماندهی کردیم:

(1) قوانینی که Beam نباید آنها را زیر پا بگذارد: پیروی از سیاست های ایمنی ما و حفظ هویت خود به عنوان یک عامل هوش مصنوعی.

(2) کیفیت هایی که Beam باید به طور مداوم برآورده کند، مانند: استفاده از زمینه ارائه شده، ادعای دقیق، تأیید عدم قطعیت، و پیگیری شفاف درخواست کاربر.

(3) سبک پیش‌فرض نحوه تعامل Beam: مستقیم، کامل، کارآمد و فعال در پیش‌بینی آنچه کاربر ممکن است در آینده به آن نیاز داشته باشد.

ما محیط های RL را در مرحله تراز طراحی کردیم تا انگیزه پایبندی Beam به این اصول را ایجاد کنیم. بسیاری از این محیط‌ها شامل پاداش‌های غیرقابل تأییدی هستند که توسط یک مدل پاداش تولیدی قضاوت می‌شوند، با این حال ما قادر به استفاده از آنها برای شکل‌دهی قابل پیش‌بینی رفتار مدل بودیم. پیش‌بینی اینکه چگونه پاداش‌ها بر رفتارهای مختلف قبل از اجرای RL تأثیر می‌گذارند، توانستیم سودهای RL را بهتر از سقف Best-of-N به تنهایی پیش‌بینی کنیم (r = 0.79 در مقایسه با r = 0.46 با سقف BoN).

این به ما این امکان را می‌دهد که روی روبریک‌ها و طراحی پاداش، رفتارهای اسکواش مانند توهمات و قالب‌بندی بیش از حد را تکرار کنیم، و کیفیت کلی تعامل Beam را بهبود ببخشیم.

آموزش ایمنی ما از تکنیک‌های همسویی مشورتی (Guan et al., 2024) استفاده کرد تا خط مشی ایمنی ما را مستقیما در استدلال مدل ادغام کند. مجموعه داده به صورت متخاصم و تکراری ساخته شده است: در هر دور، ما یک مدل را آموزش می‌دهیم، اعلان‌هایی ایجاد می‌کنیم که رفتار مضر یا بیش از حد امتناع از آن ایجاد می‌کند، و حملات موفقیت‌آمیز را به مخلوط SFT برای دور بعدی برمی‌گردانیم.

برای ایمنی RL، ما به طور مشابه سناریوهای تک چرخشی، چند چرخشی، فرار از زندان و عاملی را تهیه کردیم که در آن یک دشمن شبیه‌سازی‌شده به مدلی که از ابزار استفاده می‌کند برای انجام اقدامات ناامن فشار می‌آورد تا همزمان امتناع بیش از حد و انطباق مضر را کاهش دهد.

ما نتایج ارزیابی‌های ایمنی خود را در گزارش فنی مدل خود منتشر خواهیم کرد و ارزیابی‌های ایمنی منبع باز را که در داخل ایجاد کرده‌ایم و از آن استفاده می‌کنیم، برای ایجاد یک استاندارد مشترک و قابل بازرسی که اکوسیستم باز می‌تواند در برابر آن آزمایش کند و در آن مشارکت داشته باشد، منتشر خواهیم کرد.

این پیش نمایش نشان می دهد که Beam امروز چه کاری می تواند انجام دهد. ما این نسخه اولیه Beam را برای گروهی از کاربران در دسترس قرار می دهیم. می توانید در لیست انتظار اینجا ثبت نام کنید.

ما می خواهیم Beam به طور گسترده در دسترس باشد و ساخت آن آسان باشد. در این ماه، وزن‌ها را تحت مجوز Apache 2.0 به همراه مستندات و پشته کامل برای اجرا، ارزیابی و تنظیم دقیق مدل منتشر خواهیم کرد. ما Beam را با اکوسیستمی از شرکای توزیع و همچنین ادغام با طیف گسترده‌ای از کتابخانه‌های منبع باز و مهارها راه‌اندازی خواهیم کرد، بنابراین توسعه‌دهندگان می‌توانند از Beam در جریان‌های کاری منبع باز موجود استفاده کنند.

Beam اولین مدل از یک سری است و اولین نمایش هوش باز که تیم ما متعهد به ایجاد آن است. ما از قبل در حال آموزش موارد بعدی هستیم، با این هدف که با هر انتشار، مرز باز را به مرز هوش نزدیک کنیم.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Beam: Reflection's 501B open-weight model

Article URL: https://reflection.ai/blog/introducing-beam Comments URL: https://news.ycombinator.com/item?id=49969183 Points: 171 # Comments: 50

همه‌ی اخبار فناوری