پرتو: مدل 501B با وزن باز Reflection
آدرس مقاله: https://reflection.ai/blog/introducing-beam آدرس نظرات: https://news.ycombinator.com/item?id=49969183 امتیاز: 171 # نظرات: 50
ما در حال معرفی Beam، اولین مدل وزن باز Reflection هستیم. Beam یک مدل ترکیبی از متخصصان پراکنده با 501 میلیارد پارامتر کل، 23 میلیارد پارامتر فعال است که برای کدنویسی، استدلال و بارهای کاری عاملی ساخته شده است.
قابلیتهای Beam از سرمایهگذاریهای عمده در آموزش پیشآموزشی و یادگیری تقویتی (RL) ناشی میشود. ما این مدل را بر روی 23.8 تریلیون توکن متنوع، سرپرستی شده و با کیفیت بالا از وب و مجموعه دادههای دارای مجوز اختصاصی آموزش دادهایم، که با مدلهای پایه باز با اندازه مشابه در دسترس مطابقت دارد یا بهتر عمل میکند. به موازات آن، الگوریتمها، محیطهای آموزشی و زیرساختهای مورد نیاز برای حفظ RL با محاسبات بالا در مقیاس استثنایی را توسعه دادیم. اجرای RL با محاسبات بالا ما بیش از 100 میلیون نسخه در 10.5 هزار پردازنده گرافیکی NVIDIA GB300 طی 4 هفته آموزش ایجاد کرد.
با هم، این تلاش ها عملکرد رقابتی وزن باز با راندمان محاسبه استنتاج مرزی را ایجاد کردند.
بیم در حال گذراندن مرحله نهایی بازی قرمز و ارزیابی است. برای دسترسی زودهنگام به مدل می توانید اینجا ثبت نام کنید. وزنها، گزارش فنی، کارت مدل و مصنوعات توسعهدهنده را اواخر این ماه منتشر خواهیم کرد.
ما Beam را با تمرکز ویژه بر روی کدنویسی و عملکرد عامل آموزش دادیم. Beam مرزهای وزن باز غربی را پیش میبرد و با مدلهای باز بزرگتر مانند GLM 5.2 و نزدیک شدن به Qwen 3.8-Max در کدنویسی و وظایف نمایندگی قابل رقابت است. در جایی که مدلهای مرزی باز مانند Kimi K3 از نظر قابلیت خام جلوتر هستند، مزیت Beam کارایی در زمان استنتاج است.
شکل زیر عملکرد Beam را در طیف وسیعی از معیارهای کدنویسی، عاملی، استدلالی و STEM نشان می دهد. NR نشان دهنده امتیازهایی است که گزارش نشده اند.
پرتو قابلیت های کدگذاری و عاملی را با استدلال بسیار کارآمد ترکیب می کند. در معیارهای استدلال پیشرفته، در حالی که از محاسبات استنتاج 3 تا 4× کمتر استفاده میکند، به نمرات قابل مقایسه با GLM-5.2 دست مییابد. در مقایسه با مدلهای خانواده پارامترهای 2T+ مانند Qwen 3.8-Max، که به محاسبه استنتاج بهطور قابلتوجهی در هر توکن نیاز دارند، افزایش کارایی حتی بیشتر میشود.
این نتایج به هوش بیشتر در هر توکن ترجمه میشود، قابلیتهای مدل قوی را با هزینه کمتر ارائه میکند، و Beam را به یک مدل نیروی کار قدرتمند برای برنامهنویسی سازمانی و بارهای کاری عامل تبدیل میکند.
ما یادگیری تقویتی محاسباتی بالا را به یک محور مقیاس مرکزی برای Beam تبدیل کردیم و در علم RL، داده ها و زیرساخت سرمایه گذاری کردیم تا محاسبات بیشتر را به قابلیت های قوی تر تبدیل کنیم. مقیاسبندی RL کاوش گستردهتری از استراتژیهای حل مسئله را امکانپذیر میکند، در حالی که عرضههای طولانیتر از استدلال چند مرحلهای، استفاده از ابزار و سازگاری با بازخورد محیطی پشتیبانی میکنند.
برای افزایش مقیاس یادگیری تقویتی، 10.5 هزار پردازنده گرافیکی NVIDIA GB300 را به مدت چهار هفته مستقر کردیم که بیش از 100 میلیون نسخه با حداکثر طول زمینه 256 هزار توکن ایجاد کرد. در آموزش و درجه بندی تقریبا 1.3 میلیارد جعبه شنی استفاده شد. برای حفظ این حجم، یک میلیون محیط کدگذاری، عاملی و STEM با کیفیت بالا تهیه کردیم. ما معتقدیم که این یکی از بزرگترین اجراهای RL در مقیاس است که توسط هر آزمایشگاه باز تا به امروز انجام شده است. در مجموعه ارزیابی ما، با افزایش محاسبات RL، بدون هیچ نشانهای از فلات، قابلیتها به بهبود ادامه دادند.
ما Beam را با گرادیان های خط مشی ناهمزمان آموزش دادیم. در مقیاس، کهنگی سیاست به منبع اصلی بیثباتی برای این روشها تبدیل میشود. عرضههای طولانی مدت دارای توکنهایی هستند که توسط چندین مدل بازرسی تولید میشوند، با توکنهای قبلی نسبت به سیاست فعلی کهنهتر میشوند. عدم تطابق عددی بین موتورهای آموزشی و استنتاجی این چالش را بیشتر می کند.
ما الگوریتمهای جدیدی را برای حفظ یادگیری پایدار در این شرایط ایجاد کردیم و در عین حال به طور سیستماتیک عدم تطابق آموزش و استنتاج را در سراسر خط لوله خود کاهش دادیم. این پیشرفتها RL کاملا ناهمزمان را در مقیاسی فعال میکنند که پایدار میماند، حتی زمانی که از تعاملات ایجاد شده بیش از یک روز قبل یاد میگیرید.
ما Beam را با یک پنالتی طول قابل کنترل آموزش دادیم که به راهحلهای موفق پاداش میدهد و در عین حال از نشانههای غیر ضروری جلوگیری میکند. در اوایل RL، عملکرد حتی با کاهش مدت زمان تکمیل بهبود یافت: این مدل یاد گرفت که کارها را به طور مؤثرتر با استدلال کمتر حل کند. بعدها، همانطور که Beam قابلیتهای عامل قویتری را توسعه داد، طول تکمیل دوباره افزایش یافت، اما آن توکنهای اضافی از دستاوردهای بیشتر در عملکرد پشتیبانی کردند. در طول آموزش، RL مبادله بین قابلیت و استفاده توکن را بهبود بخشید.
کاربران میتوانند این مبادله را از طریق پارامتر تلاش استدلالی Beam کنترل کنند: تنظیمات پایینتر به نفع پاسخهای کوتاهتر است، در حالی که تنظیمات بالاتر به استدلال طولانیتر اجازه میدهد تا عملکرد در کارهای سخت را بهبود بخشد. این به کاربران انعطافپذیری میدهد تا تلاش استدلالی را با وظایف خود و محاسبه بودجه مطابقت دهند.
ما آموزش RL Beam را برای توسعه استدلال و قابلیت های عاملی طراحی کردیم که فراتر از وظایف آموزشی آن تعمیم می یابد. در طول مرحله آموزش در مورد استدلال، مهندسی نرم افزار، و وظایف پایانه، علیرغم عدم وجود وظایف مرور از مخلوط RL، شاهد دستاوردهای ثابتی در مرور بودیم. این انتقال نشان میدهد که Beam در حال یادگیری قابلیتهای عامل گستردهتری بود که در سراسر حوزهها تعمیم مییابند. هنگامی که به وب دسترسی پیدا کرد، به طور ارگانیک یاد گرفت که مدلهای زبان بزرگ دیگر را جستجو و پرس و جو کند و از APIهای OCR برای خواندن اسناد استفاده کند.
دموهای زیر نشان میدهد که Beam از این قابلیتها در تحقیقات، توسعه برنامهها، گیمپلی و جریانهای کاری یادگیری ماشین استفاده میکند. نمونهها از ساخت داشبورد زنده متروی نیویورک با استفاده از دادههای عمومی تا ایجاد برنامههای کاربردی تعاملی و تهیه مدلهای نوتبوک تنظیم دقیق را شامل میشود. اگرچه Beam فقط متنی است، اما زمانی که به صورت متن نمایش داده می شود، می تواند با اطلاعات سایر روش ها کار کند. در یکی دیگر از حوزههای خارج از توزیع، Beam همچنین یک نوت بوک تنظیم دقیق برای جدیدترین و کوچکترین مدل Gemma-4 در یک کار Text2SQL ایجاد کرد.
این دموها با هم، وسعت وظایفی را که Beam میتواند با ترکیب استدلال، کدنویسی و استفاده از ابزار انجام دهد، نشان میدهد. هر مثال شامل درخواست اولیه و خروجی حاصل، همراه با تنظیمات مربوطه و تکرارهای کاربر است.
یادگیری تقویتی در مقیاس مرزی به حجم زیادی از وظایف دشوار و با کیفیت بالا نیاز دارد. ما مجموعه ای از نزدیک به یک میلیون محیط را، عمدتا از طریق خطوط لوله داده مصنوعی، تکمیل شده توسط داده های فروشنده اختصاصی و منابع منبع باز، ایجاد کردیم.
ما به شدت به یک فرآیند اصلاحی تکراری متکی بودیم. ابتدا، ما محیطها را در مجموعه وسیعی از حوزهها از جمله مهندسی نرمافزار، استفاده از ترمینال، کدنویسی رقابتی، STEM، جستجوی وب، استفاده از ابزار و کار دانش عمومی، سنتز یا منبعسازی کردیم. دوم، ما وظایف را به شدت برای سختی فیلتر کردیم (با اطمینان از اینکه آنها به طور مداوم قابل حل و یا غیرممکن برای مدل هستند) و کیفیت (به عنوان مثال، نامشخص، گمراه کننده، قابل حدس زدن، هک کردن، یا در غیر این صورت شکسته یا پر سر و صدا).
سوم، ما وظایف را از طریق RL آزمایش کردیم، که به ما امکان داد مشکلات کیفیت یا دشواری بیشتری را شناسایی کنیم و تکرار بعدی منبعیابی و فیلتر کردن را اعلام کنیم.
در طول توسعه Beam، متوجه شدیم که مصالحه در کیفیت دادهها منجر به پلاتو توانایی و سایر مسائل آموزشی میشود. بهبودهای سیستماتیک در کیفیت کار برای حفظ دستاوردهای قابلیت در طول اجرا ضروری بود، که بدون هیچ نشانه ای از اشباع به پایان رسید.
RL عامل محاسباتی بالا به تولید برنامهها، ابزارهای اجرایی، ارزیابی نتایج و بهروزرسانی مدل در مقیاس نیاز دارد. ما یک پلتفرم ناهمزمان ساختیم که به این فرآیندها اجازه میدهد به طور مستقل اجرا شوند و در عین حال جریان تجربه و بهروزرسانیهای مدل را هماهنگ میکنند.
در طول آموزش Beam، ما به طور متوسط 110K پخش همزمان را حفظ کردیم. هفت قابلیت این را عملی کرده است:
اجرای کاملا ناهمزمان: Agent ها در حالی که مربی نسخه های مدل جدید را می آموزد و منتشر می کند، برنامه ها را تولید می کنند. هر توکن با نسخه ای که آن را تولید کرده است برچسب گذاری می شود، و به الگوریتم آموزشی اجازه می دهد تا زمانی که برنامه های تکمیل شده در آموزش جریان پیدا می کند، بیات بودن خط مشی را محاسبه کند.
تخصیص محاسباتی انعطافپذیر: ما تعادل بین استنتاج و آموزش را با تکامل حجم کار تنظیم کردیم و در نسبتهای GPU استنتاج به آموزش از 3.9:1 تا 5.4:1 عمل میکردیم. ما همچنین اندازه مربی را در پنج پیکربندی مش GPU در یک اصل آموزشی بدون از دست دادن حالت آموزشی تغییر دادیم.
به روز رسانی سریع مدل: وزن های جدید در یک میانگین تقریبا 12 ثانیه به ناوگان استنتاج رسیدند. توزیع سلسله مراتبی وزن ها را در رک ها از طریق RoCE منتقل می کند، سپس آنها را به صورت محلی از طریق NVLink به اشتراک می گذارد. در مقایسه با هر ماکتی که مستقیما وزنهها را میکشد، این امر ترافیک متقاطع رک را تا 75 درصد کاهش داد و باعث شد که وزنهای جدید در ناوگان 2.2× سریعتر بپذیرند.
مقاومت در برابر شکست استنتاج: در طول اجرا، 71 حادثه استنتاج بدون خاتمه کار آموزشی انجام شد. ظرفیت استنتاج در میانگین هشت دقیقه بازیابی شد و ظرفیت از دست رفته تنها 0.02 درصد از دقیقههای GPU خدمت سپری شده را تشکیل میدهد.
محیطهای در مقیاس: ما تا 170 هزار جعبه شنی همزمان را در طول اجرا پشتیبانی کردیم. در سراسر این پلتفرم، بیش از یک میلیارد درخواست ایجاد جعبه شنی را پردازش کردیم که بیش از 20 خوشه، دو ابر و چهار منطقه را در بر می گرفت. 90 درصد از جعبه های شنی جدید در کمتر از 10 ثانیه آماده شدند.
بستهبندی کارآمد مربی: بستهبندی پویا باعث میشود دستههای آموزشی به طور متوسط 99.99 درصد پر شوند، و توان پردازشی هر پردازنده گرافیکی را در 1.5 درصد نگه میدارد زیرا میانگین طول عرضه تقریبا 70 درصد افزایش یافته است.
مشاهده پذیری و یکپارچگی پاداش: سوابق به ازای هر توکن، بررسی ثبات عددی بین آموزش و استنتاج را در هر مرحله فعال می کند. داوران مستقل راهحلهای پاس را برای سوءاستفادههای تأییدکننده بررسی کردند، در حالی که رکوردهای قابل پخش باعث میشوند پاداشها و استفاده از آنها در تمرین قابل بازرسی باشد.
با هم، این قابلیتها ما را قادر میسازد تا در تعاملات طولانیتر و محیطهای سختتر آموزش ببینیم و در عین حال توان عملیاتی را حفظ کنیم، از شکستها بازیابی کنیم، و یکپارچگی فرآیند یادگیری را بررسی کنیم.
یادگیری تقویتی بر روی یک مدل پایه قوی ساخته می شود. برای تسهیل استدلال، ما اطمینان حاصل کردیم که بنیاد Beam دانش غنی در حوزههای کدگذاری، قابلیتهای عاملی ذاتی که میتوان آن را تقویت کرد، و پویایی بهینهسازی MoE پایدار دارد.
دستور العمل معماری و بهینه سازی Beam بر پایه و اساس سالم عددی برای RL پایین دستی پایدار تأکید می کند. این ترکیب توجه محلی و جهانی به هم پیوسته، کارشناسان مسیریابی دقیق، جریان باقیمانده کنترل شده، و اشکال متعدد تعادل بار را برای اطمینان از استفاده متخصص پایدار و متعادل و انتشار سیگنال سالم از طریق باقیمانده ها ترکیب می کند.
برای استفاده کارشناسانه، ما بر اساس تعادل بار بدون تلفات کمکی (DeepSeek-AI et al., 2024) ساخته شدیم، و تجزیه کسینوس به روز رسانی تعصب متخصص را برای کاهش آشفتگی های مسیریابی بعدا در آموزش معرفی کردیم. تعادل در سطح توالی، استفاده متوازن و متوازن از متخصصان را در دادههای خارج از توزیع پیشآموزشی بیشتر تشویق میکند و مدل را برای توزیع متغیر RL پاییندستی آماده میکند. در نتیجه، پایه از پیش آموزشدیده نهایی دارای استفاده یکنواخت تقریبا عالی است، و اطمینان حاصل میکند که میتوان از همه کارشناسان برای استدلال آموختهشده استفاده کرد.
برای جریان باقیمانده، ما یک رویکرد مقیاسبندی مبتنی بر عمق را توسعه دادیم که با انباشته شدن خروجیهای زیرلایه، با رشد فعالسازی مقابله میکند و به ثابت نگه داشتن هنجارهای باقیمانده با افزایش عمق مدل کمک میکند. همراه با SandwichNorm، دروازه توجه عنصری، و تجمع باقیمانده FP32 - که خطای گرد کردن را هنگام اضافه کردن بهروزرسانیهای کوچک به جریان کاهش میدهد - این دستور رشد فعالسازی و نقاط پرت را کنترل میکند، در نتیجه انتشار سیگنال سالم را در تمام لایههای Beam تضمین میکند. این ثبات در طول پیشآموزش، یادگیری تقویتی و همسویی ادامه دارد.
Beam بر روی 23.8 تریلیون توکن با کیفیت بالا از وب، منابع عمومی و مجموعه دادههای دارای مجوز اختصاصی از قبل آموزش داده شد. خط لوله داده ما به گونه ای طراحی شده است که به Beam پایه ای برای کدگذاری عاملی پایین دستی بدهد: کد منبع، توضیحات فنی، و دانش ریاضی و علمی، که در هر مرحله از نظارت حفظ می شود. ما تقریبا بر روی تمام اسناد کد و کدهای قابل دسترسی عمومی و بدون محدودیت مجوز در وب آموزش می دهیم.
ما طبقهبندیکنندههای کیفیت خودمان را برای محتوای وب، کد و STEM آموزش دادیم، دادهها را به سطوح با کیفیت ریز تقسیم کردیم و آموزش را به سمت مواد قویتر ارزیابی کردیم. پس از تکرار علمی گسترده، دقت و یادآوری دادهها را به طور قابل توجهی فراتر از فیلترهای وب معمولی مورد استفاده در چارچوبهای داده OSS پیشرفته بهینه کردیم. از یک طرف، حدود 95 درصد از توکنهای خام اینترنت از طریق تجزیه، کپیبرداری و پردازش حذف میشوند.
از سوی دیگر، متوجه شدیم که تکنیکهای مرسوم تقریبا 1.8 تریلیون توکن با کیفیت بالا را که نگه میداریم، از دست میدهند، که شامل 87 درصد از توکنهای کد وب مدیریتشده ما میشود.
مدلسازی کد برای بالاترین کارایی نیاز به مدیریت خاص خود دارد. برای هر زبان، فیلترهای تنظیمشده جداگانه اعمال کردیم، محتوای تولیدشده خودکار و غیرقابل یادگیری با کیفیت پایین را حذف کردیم و طبقهبندیکنندههای آموزش دیده برای شناسایی محتوا یا کدهای خراب که ممکن است به ثبات آموزش آسیب بزند. زبانها و انواع فایلهایی که بیش از حد ارائه شدهاند، برای گسترش بیشتر در معرض تعادل مجدد قرار میگیرند.
ما همچنین یک خط لوله با توان بالا برای پردازش مصنوعات PDF ایجاد کردیم تا اطمینان حاصل کنیم که Beam پایه دارای دانش در طیف گسترده ای از موضوعات STEM است. این یک مدل OCR با زبان بینایی را با طبقهبندیکنندههای کیفیت داخلی و آشکارسازهای مصنوع ادغام میکند که بازسازیهای نادرست را شناسایی میکند و در هزاران GPU توزیع شده است تا پتابایت دادههای فنی را پردازش کند.
ما کد و محتوای فنی را چندین بار تکرار کردیم تا نمایش مدل را در طول افق آموزشی آن افزایش دهیم. این امر مستلزم توجه دقیق به بازنویسی فازی، الگوریتمهای بستهبندی و علم آموزش بیش از حد بود تا اطمینان حاصل شود که هر منبع دادهای مکرر به جای آسیب رساندن به تعمیم کمک میکند.
Beam در کمتر از چهار هفته روی یک کلاستر متشکل از 6144 پردازنده گرافیکی NVIDIA GB300 NVL72 از قبل آموزش داده شد. برای دستیابی به قابلیت اطمینان، عملکرد و سرعت توسعه مورد نیاز برای آموزش Beam در مقیاس، تقریبا کل زیرساخت پشته را در داخل ساختیم. این شامل یک زمانبندی جدید مبتنی بر توپولوژی و مبتنی بر Kubernetes در سراسر خوشههای ما بود. یک سیستم چرخه حیات گره داخلی با نظارت مداوم سلامت و هشدارها؛ و یک سیستم تشخیص خرابی دادههای بیصدا (SDC) که قادر به بازپیچ و راهاندازی نیمه مستقل است.
این سیستم ها با هم، عملکرد و کنترل عملیاتی مورد نیاز برای آموزش مدل مرزی خود را به طور کارآمد و با ثبات بیشتر به ما دادند.
در نتیجه سرمایه گذاری های گسترده در ثبات دستور العمل آموزشی، زیرساخت ها و کیفیت داده ها، اجرای کلی پیش تمرین با یک مسیر بسیار صاف به پایان رسید. ما 9 چرخش نیمه خودکار را در سرتاسر اجرا کردیم که به هنجارهای گرادیان غیر قطعی یا به SDC های مشکوک نسبت داده می شد. علاوه بر این، بازده خوب اجرا (سهم ساعت دیواری صرف شده برای مراحل تمرین در مدل نهایی) به لطف بهبود در ایست بازرسی، تشخیص عیب و مدیریت سلامت گره، تا پایان به 92.3 درصد رسید.
مرحله آموزش میانی ما بهطور خاص بهعنوان پایهای برای RL با محاسبات بالا طراحی شده است، دانش، استدلال و قابلیتهای استفاده از ابزار را توسعه میدهد که به Beam اجازه میدهد از کارهای سختتر بیاموزد.
ما خطوط لوله تنظیم دادههای چند مرحلهای ساختیم که ساختار و پیچیدگی وظایف دنیای واقعی را به تصویر میکشد و در عین حال پوشش قابلیتهایی را گسترش میدهد که یادگیری آنها به تنهایی از دادههای خام دشوار است. با شروع از نمونههای دنیای واقعی که به دقت انتخاب شدهاند، این خطوط لوله مواد را به دادههای آموزشی که برای آموزش قابلیتهای خاص طراحی شدهاند، تبدیل، ترکیب و گسترش میدهند. این شامل اسناد طولانی و غنی از استدلال است که مدل را در معرض زنجیره های گسترده منطق قرار می دهد.
Midtraining همچنین طول زمینه موثر Beam را به 1M توکن افزایش می دهد. ما مخازن کد ساختاریافته، وظایف با افق بلند، و اسناد طولانی با کیفیت بالا را ترکیب می کنیم تا به مدل آموزش دهیم تا اطلاعات مرتبط را در توالی های طولانی شناسایی، حفظ و متصل کند.
این قابلیتها با هم، به RL نقطه شروع قویتری میدهند، و Beam را قادر میسازد تا راهحلهای پیچیدهتری را بررسی کند، از طریق تعاملات طولانیتر کار کند و از کارهایی که در غیر این صورت دور از دسترس بودند، بیاموزد.
کار ایمنی و هم ترازی ما شامل آموزش مدل دوم از ایست بازرسی از پیش آموزش دیده با استفاده از یک خط لوله SFT و RL جداگانه بر روی داده هایی بود که به طور خاص اصولی را هدف قرار می دهد که مدل باید از آنها پیروی کند. ما تواناییهای این دو معلم - یک معلم RL در مقیاس بزرگ و یک معلم ایمنی و هم ترازی اختصاصی - را از طریق تقطیر در سیاست چند معلم (MOPD) ادغام کردیم.
ما اصول ایمنی و هم ترازی Beam را در سه سطح سازماندهی کردیم:
(1) قوانینی که Beam نباید آنها را زیر پا بگذارد: پیروی از سیاست های ایمنی ما و حفظ هویت خود به عنوان یک عامل هوش مصنوعی.
(2) کیفیت هایی که Beam باید به طور مداوم برآورده کند، مانند: استفاده از زمینه ارائه شده، ادعای دقیق، تأیید عدم قطعیت، و پیگیری شفاف درخواست کاربر.
(3) سبک پیشفرض نحوه تعامل Beam: مستقیم، کامل، کارآمد و فعال در پیشبینی آنچه کاربر ممکن است در آینده به آن نیاز داشته باشد.
ما محیط های RL را در مرحله تراز طراحی کردیم تا انگیزه پایبندی Beam به این اصول را ایجاد کنیم. بسیاری از این محیطها شامل پاداشهای غیرقابل تأییدی هستند که توسط یک مدل پاداش تولیدی قضاوت میشوند، با این حال ما قادر به استفاده از آنها برای شکلدهی قابل پیشبینی رفتار مدل بودیم. پیشبینی اینکه چگونه پاداشها بر رفتارهای مختلف قبل از اجرای RL تأثیر میگذارند، توانستیم سودهای RL را بهتر از سقف Best-of-N به تنهایی پیشبینی کنیم (r = 0.79 در مقایسه با r = 0.46 با سقف BoN).
این به ما این امکان را میدهد که روی روبریکها و طراحی پاداش، رفتارهای اسکواش مانند توهمات و قالببندی بیش از حد را تکرار کنیم، و کیفیت کلی تعامل Beam را بهبود ببخشیم.
آموزش ایمنی ما از تکنیکهای همسویی مشورتی (Guan et al., 2024) استفاده کرد تا خط مشی ایمنی ما را مستقیما در استدلال مدل ادغام کند. مجموعه داده به صورت متخاصم و تکراری ساخته شده است: در هر دور، ما یک مدل را آموزش میدهیم، اعلانهایی ایجاد میکنیم که رفتار مضر یا بیش از حد امتناع از آن ایجاد میکند، و حملات موفقیتآمیز را به مخلوط SFT برای دور بعدی برمیگردانیم.
برای ایمنی RL، ما به طور مشابه سناریوهای تک چرخشی، چند چرخشی، فرار از زندان و عاملی را تهیه کردیم که در آن یک دشمن شبیهسازیشده به مدلی که از ابزار استفاده میکند برای انجام اقدامات ناامن فشار میآورد تا همزمان امتناع بیش از حد و انطباق مضر را کاهش دهد.
ما نتایج ارزیابیهای ایمنی خود را در گزارش فنی مدل خود منتشر خواهیم کرد و ارزیابیهای ایمنی منبع باز را که در داخل ایجاد کردهایم و از آن استفاده میکنیم، برای ایجاد یک استاندارد مشترک و قابل بازرسی که اکوسیستم باز میتواند در برابر آن آزمایش کند و در آن مشارکت داشته باشد، منتشر خواهیم کرد.
این پیش نمایش نشان می دهد که Beam امروز چه کاری می تواند انجام دهد. ما این نسخه اولیه Beam را برای گروهی از کاربران در دسترس قرار می دهیم. می توانید در لیست انتظار اینجا ثبت نام کنید.
ما می خواهیم Beam به طور گسترده در دسترس باشد و ساخت آن آسان باشد. در این ماه، وزنها را تحت مجوز Apache 2.0 به همراه مستندات و پشته کامل برای اجرا، ارزیابی و تنظیم دقیق مدل منتشر خواهیم کرد. ما Beam را با اکوسیستمی از شرکای توزیع و همچنین ادغام با طیف گستردهای از کتابخانههای منبع باز و مهارها راهاندازی خواهیم کرد، بنابراین توسعهدهندگان میتوانند از Beam در جریانهای کاری منبع باز موجود استفاده کنند.
Beam اولین مدل از یک سری است و اولین نمایش هوش باز که تیم ما متعهد به ایجاد آن است. ما از قبل در حال آموزش موارد بعدی هستیم، با این هدف که با هر انتشار، مرز باز را به مرز هوش نزدیک کنیم.
متن اصلی (انگلیسی)
Beam: Reflection's 501B open-weight model
Article URL: https://reflection.ai/blog/introducing-beam Comments URL: https://news.ycombinator.com/item?id=49969183 Points: 171 # Comments: 50