پرش به محتوای اصلی

به روز رسانی مدل های زبان برای کار بر روی بایت

نیچر۱۴۰۵ مهر ۱۵, چهارشنبه، ساعت ۰۳:۳۰حدود 15 دقیقه مطالعه

طبیعت، انتشار آنلاین: 07 اکتبر 2026; doi:10.1038/s41586-026-11111-4 Byteification یک روش عمومی برای مقاوم سازی مدل های زبانی بزرگ است تا روی بایت ها کار کنند به گونه ای که به قابلیت های سیستم های مبتنی بر زیرکلمه نزدیک می شوند و ممکن است برای داده های علمی بهتر باشند.

پیشرفت‌های اخیر در هوش مصنوعی (AI) عمدتا توسط مدل‌های زبانی بزرگ، شبکه‌های عصبی عمیق که بر روی واحدهای مجزا به نام توکن‌ها کار می‌کنند، انجام شده است. برای نمایش متن، اکثر مدل های زبان بزرگ از کلمات یا قطعات کلمه به عنوان نشانه استفاده می کنند که به عنوان نشانه گذاری زیرکلمه 1 شناخته می شود. توکن‌سازی زیرکلمه‌ها اطلاعات ریزدانه را پنهان می‌کند، که مشکل‌ساز است، به‌ویژه برای داده‌های علمی - مانند کد رایانه یا توالی‌های بیولوژیکی - که در آن معنا به شخصیت‌ها یا بایت‌ها بستگی دارد.

مدل‌هایی که در عوض مستقیما بر روی رمزگذاری بایت متن کار می‌کنند از این محدودیت‌ها اجتناب می‌کنند، اما تاکنون از نظر عملکرد از مدل‌های مبتنی بر زیرکلمه عقب مانده‌اند. در اینجا یک روش کلی برای ایجاد مدل‌های زبان بزرگ در سطح بایت از طریق بایت‌سازی که به قابلیت‌های سیستم‌های مبتنی بر زیرکلمه نزدیک می‌شوند، معرفی می‌کنیم. ما از یک روش تبدیل دو مرحله‌ای برای بازسازی مدل‌های مبتنی بر زیرکلمه موجود به مدل‌های سطح بایت با حداقل آموزش اضافی استفاده می‌کنیم.

مدل‌های به‌دست‌آمده از رویکردهای سطح بایت قبلی بهتر عمل می‌کنند و در وظایف استدلال در سطح کاراکتر برتری دارند، با پردازش کارآمد اطلاعات سطح بایت و سازگاری با استفاده مجدد از اکوسیستم موجود در اطراف مدل زبان بزرگ منبع، به سرعت استنتاج عملی دست می‌یابند. نتایج ما مانع عملکرد طولانی‌مدت برای مدل‌سازی زبان سطح بایت انتها به انتها را حذف می‌کند و نشان می‌دهد که مدل‌هایی که بر روی رمزگذاری‌های متن خام کار می‌کنند می‌توانند به صورت رقابتی مقیاس شوند و در عین حال مزایایی را در حوزه‌هایی که نیاز به درک متنی دقیق دارند ارائه دهند.

پیشرفت‌های اخیر در هوش مصنوعی توسط سیستم‌های یادگیری عمیق سرتاسر انجام شده است که نمایش‌ها را مستقیما از داده‌ها یاد می‌گیرند. مدل‌های زبان بزرگ (LLM) نمونه‌ای از این روند هستند و با آموزش مجموعه‌های عظیم متن 3، 4 به قابلیت‌های قوی دست می‌یابند. با این حال، علیرغم عمومیت ظاهری آنها، LLMهای معاصر کاملا سرتاسر نیستند: قبل از شروع یادگیری، ابتدا متن باید به دنباله ای از واحدهای مجزا به نام توکن ها نگاشت شود.

انتخاب نشانه‌ها، اگرچه گاهی نادیده گرفته می‌شود، اما اساسا بازنمایی‌هایی را که LLMها یاد می‌گیرند و رفتارهایی که از خود نشان می‌دهند شکل می‌دهد. 5، 6، 7، 8، 9.

اکثریت قریب به اتفاق LLM های معاصر از کلمات یا بخش هایی از کلمات به عنوان نشانه در فرآیندی به نام زیرکلمه سازی 1 و 10 استفاده می کنند. این منجر به مشکلات زیادی می شود. LLM هایی که از نشانه گذاری زیرکلمه استفاده می کنند از درک محدودی در سطح کاراکتر رنج می برند 11، 12، 13، که به ویژه عملکرد با داده های علمی، مانند کد و دنباله های بیولوژیکی 2، 14، 15، 16، 17 را مختل می کند. آنها همچنین به طور ضمنی نسبت به ایجاد پاسخ‌های خاص بر اساس نحوه نشانه‌گذاری اعلان تمایل دارند 18، 19، 20، آنها در تعداد کلماتی که می‌توانند در واژگان خود بگنجانند، محدود هستند، که در

تمرین به انگلیسی محوری 6، 21 منجر می شود، و آنها به طور بالقوه محاسبات خود را به صورت غیربهینه تخصیص می دهند 2، 22. این مشکلات انگیزه تحقیقات گسترده‌ای را در مورد جایگزین‌هایی برای توکن‌سازی زیرکلمه‌ها فراهم کرده است، معمولا با استفاده از بایت‌های UTF-8 زیربنایی که متن به‌عنوان 23 به عنوان واحدهای گسسته کدگذاری می‌شود. بسیاری از LLM های سطح بایت قبلی ادعا می کنند که از LLM های سطح زیر کلمه در مرز پارتو 2، 22، 24، 25، 26، 27 برتری دارند. با این حال، در عمل، LLM های سطح بایت تاکنون مورد پذیرش گسترده ای قرار نگرفته اند، و همه LLM های پیشرو هنوز به طور انحصاری بر توکن سازی زیرکلمه ها متکی هستند.

ما فرض می‌کنیم که دلیل اصلی این عدم تطابق بین تئوری و عمل این است که رویکردهای موجود برای مدل‌سازی زبان سطح بایت عمدتا بر آموزش یک مدل جدید در سطح بایت از یک مقداردهی اولیه تصادفی و مقایسه آن با یک LLM در سطح زیرکلمه‌ای که از یک مقداردهی اولیه تصادفی نیز آموزش داده شده است، متمرکز است. در مقابل، آموزش پیشرفته‌ترین LLM‌های زیرکلمه به سرعت در حال تکامل است و نوآوری‌ها را در مدیریت داده‌های آموزشی، معماری مدل و آموزش پس از آموزش ترکیب می‌کند. همگام شدن با این سرعت برای توسعه LLM در سطح بایت بدون سرمایه گذاری گسترده غیرممکن است.

برای رفع این عدم تطابق، ما یک روش کلی برای ایجاد LLM در سطح بایت معرفی می‌کنیم که عملکردی نزدیک به LLM‌های پیشرفته در سطح زیرکلمه‌ها در کارهای مختلف دارند، در حالی که از LLM‌های سطح بایت قبلی با تعداد پارامترهای قابل مقایسه بسیار پیشی می‌گیرند. برخلاف LLMهای سطح بایت قبلی که عمدتا بر روی آموزش از راه‌اندازی اولیه تصادفی تمرکز می‌کنند، ما یک LLM موجود در سطح بایت را با استفاده از کمتر از 1٪ از بودجه پیش‌آموزشی معمولی (در مجموع 49.1 میلیارد توکن، که در آن B نشان‌دهنده یک میلیارد یا 109 است) به سطح بایت ارتقا دادیم. ما به این فرآیند به عنوان byteification اشاره می کنیم.

Byteification ارتباطی بین LLM های موجود در سطح زیرکلمه و LLM های سطح بایت برقرار می کند. این به ما اجازه می دهد تا مدل های بایت شده Bolmo 7B و Bolmo 1B را با شروع از LLM های کاملا باز موجود Olmo 3 7B 28 و OLMo 2 1B 29 , Bwen 8B با بایت کردن Qwen3 8B Base 30 و Blama 8B با بایت کردن LB333 .

معماری ما ابتدا جریان بایت را در دنباله ای از وصله ها جمع می کند، جایی که هر وصله خود از یک یا چند بایت تشکیل شده است. وصله ها سپس توسط یک مدل بزرگ ترانسفورماتور 32 زبان پردازش شده و در نهایت به بایت تبدیل می شوند. به دلیل توکن‌سازی پنهان آن به وصله‌های بایتی، ما از این سبک معماری به عنوان یک مدل زبان نشانه‌ساز پنهان (LTLM) یاد می‌کنیم. نمونه هایی از LTLM ها شامل مدل های DTP 24، BLT 22 و H-Net 2 است.

با این حال، برخلاف کارهای قبلی، ما به‌طور خاص معماری خود را طوری طراحی کردیم که برای بایت‌سازی مناسب باشد (بخش «معماری مدل زبان Byteified»). به طور خاص، ما عدم تطابق بین بیان نشانه‌سازی زیرکلمه و نشانه‌سازی پنهان LTLM را حل کردیم. در کنار یک روش آموزشی کارآمد دو مرحله‌ای (بخش «رویه آموزشی Byteification»)، این به ما امکان می‌دهد به سرعت بازیابی کنیم و در برخی موارد، از عملکرد LLM در سطح زیرکلمه منبع پیشی بگیریم.

ما بر این باوریم که byteifying با ایجاد امکان ایجاد LLM های پیشرفته در سطح بایت بدون سرمایه گذاری گسترده، یک جهت تحقیقاتی کلیدی گمشده را فراهم می کند. این رویکرد مکمل آموزش از مقداردهی اولیه تصادفی است. ارزان‌تر کردن بایت‌سازی هر مدل زیرکلمه‌ای می‌تواند به سرعت معماری‌های با کارایی بالا را آشکار کند که کاندیدهای امیدوارکننده‌ای برای آموزش از مقداردهی اولیه تصادفی به عنوان LLM‌های سطح بایت هستند.

مدل‌های بایت‌شده ما به‌طور میانگین عملکرد بهتری نسبت به همه LLM‌های قبلی در سطح بایت در دسترس عموم با اندازه‌های مشابه داشتند. به عنوان مثال، Bolmo 7B به بهبود مطلق +16.5% در وظایف STEM نسبت به BLT 7B، که از مقداردهی اولیه تصادفی آموزش داده شده بود، دست یافت. Bolmo 7B همچنین در درک کاراکترها نسبت به منبع Olmo 3 بسیار بهتر عمل کرد و در تنظیمات کدنویسی خاص بهتر بود. Bwen 8B بهتر از Bolmo 7B عمل کرد و روندهای مشابهی را نشان داد و عملکردی نزدیک به مدل Qwen منبع و گاهی اوقات فراتر از آن داشت.

علاوه بر این، ما دریافتیم که مدل‌های بایت‌شده می‌توانند به‌طور دلخواه با آموزش با نسبت‌های بالاتر بایت در هر پچ، سرعت بیشتری ببخشند، که این امر تنها تا حد محدودی در LLM‌های سطح زیرکلمه امکان‌پذیر است. در نهایت، ما نشان می‌دهیم که اجزای موجود در اکوسیستم منبع LLM می‌توانند برای تطبیق یک مدل بایت‌شده بدون هیچ هزینه آموزشی اضافی استفاده شوند. این می تواند تحقیقات در مورد LLM های سطح بایت را تسریع کند.

در مجموع، نتایج ما نشان می‌دهد که LLM‌های سطح بایت به عنوان پایه‌ای برای مدل‌های زبان آینده، با مزایای بالقوه برای کارایی محاسباتی با کاهش انرژی و هزینه‌های استقرار، برای کاهش سوگیری‌های معرفی‌شده توسط توکن‌سازی زیرکلمه‌ای با محوریت انگلیسی و برای فعال کردن برنامه‌هایی که نیاز به مفاهیم دقیق علمی در حوزه‌های علمی و فنی دارند، ارائه می‌دهند.

با پیروی از ساختار کلی مشابه LTLM های قبلی ("کار مرتبط" در روش ها)، مدل های بایت شده را می توان همانطور که در شکل 1 نشان داده شده است، رسمی کرد. به طور خلاصه، یک مدل رمزگذار محلی که روی بایت ها کار می کند، ابتدا بازنمایی بایت های متنی ایجاد می کند. سپس یک ماژول پیش‌بینی‌کننده مرز عصبی، بر اساس این نمایش‌ها، موقعیت‌های بایت را پیش‌بینی می‌کند که در آن یک مرز قرار می‌گیرد. اطلاعات مرزی برای استخراج دنباله‌ای از وصله‌ها استفاده می‌شود: پچ دنباله‌ای از بایت‌ها بین مرزهای متوالی است (از جمله بایتی که مرز انتهایی قرار می‌گیرد).

سپس یک ماژول ادغام، بازنمایی بایت های متنی را به یک نمایش در هر پچ کاهش می دهد، که از طریق یک مدل جهانی عمیق منتقل می شود. نمایش‌های وصله‌ای که از طریق مدل سراسری زمینه‌سازی شده‌اند، به سطح بایت بازگردانده می‌شوند و بیشتر از طریق یک مدل رمزگشای محلی متنی می‌شوند. در نهایت، نمایش‌های رمزگشای محلی برای پیش‌بینی بایت بعدی و هرگونه اطلاعات احتمالی دیگر استفاده می‌شوند. ما مدل‌های محلی را کم‌عمق اما گسترده انتخاب کردیم زیرا متوجه شدیم که جاسازی‌های مدل اصلی معمولا دارای رتبه مؤثر بالایی هستند (داده‌های توسعه‌یافته شکل 1).

1)، و ما لایه‌های حافظه کوتاه‌مدت بلند مدت ماتریس (mLSTM) 33 را برای متنی کردن اطلاعات محلی انتخاب کردیم زیرا در آزمایش‌های ما عملکرد بالایی در توان عملیاتی بالا داشتند (داده‌های توسعه‌یافته شکل 3). برای توضیح دقیق معماری، «جزئیات معماری مدل Byteified» را در Methods ببینید. انحراف اولیه ما از معماری‌های قبلی در پیش‌بینی مرز وصله غیرعلتی نهفته است. پیش‌بینی‌کننده مرزی LTLM‌های قبلی تنها از بافت گذشته برای تصمیم‌گیری در مورد قرار دادن یک مرز استفاده می‌کند (علت است، که توسط Pagnoni و همکارانش به عنوان افزایشی نامیده می‌شود. 22).

در یک نگاه، این ضروری به نظر می رسد: ما قصد داریم بایت بعدی را پیش بینی کنیم، بنابراین نباید هیچ اطلاعاتی در مورد آن درز کنیم. با این حال، اگرچه LLMهای سطح زیرکلمه از یک محدودیت علیت بر روی نشانه‌های زیرکلمه استفاده می‌کنند، نشانه‌های زیرکلمه به‌طور انحصاری به بافت گذشته وابسته نیستند: توکن سازهای زیرکلمه از اطلاعات مربوط به بایت‌های آینده برای قرار دادن مرزهای نشانه استفاده می‌کنند.

برای مشاهده این موضوع، اجازه دهید زیرکلمه خود را به عنوان تابعی تفسیر کنیم که تصمیم می‌گیرد مرز نشانه را بعد از هر بایت قرار دهیم یا نه: بایت. اجازه دهید (1) واژگانی از کلمات و زیرکلمات انگلیسی، (2) متن مثال « _Hello_Wor!» را فرض کنیم که معمولا به صورت {' _Hello' , ' _Wor' , ' !' } و (3) موقعیت i = ∣‘ _Hello_Wor' ∣ −\} ==9. _Hello_Wor!' ) i = 1، زیرا بعد از 'r' یک مرز وجود دارد.

با این حال، در متن ' _Hello_World!'، که به صورت {' _Hello' , ' _World' , ' !' } علامت گذاری می شود، \({\mathcal{B}}\) (' _Hello_World!' ) i = 0، با وجود ' _Hello_Wor!' =__I +1 =W]_ داریم '_سلام_ور' . به عبارت دیگر، اگرچه LLM در سطح زیرکلمه تنها از نشانه‌های زیرکلمه گذشته برای پیش‌بینی نشانه زیرکلمه بعدی استفاده می‌کند، خود نشانه‌های زیرکلمه با در نظر گرفتن زمینه آینده ایجاد می‌شوند. در این مورد، این بدان معنی است که تصمیم بگیرید که «_Wor» باید در یک مورد نشانه باشد اما در مورد دیگر نه، اگرچه متن تا آن نقطه معادل است.

در مقابل، LTLM های فعلی نمی توانند زمینه آینده را در نظر بگیرند. این یک عدم تطابق بین بیان پیش‌بینی‌کننده‌های مرزی LTLM و نشانه‌کننده‌های زیرکلمه ایجاد می‌کند. ما پیش‌بینی‌کننده مرز را برای رفع این عدم تطابق اصلاح کردیم. به طور خاص، اگرچه پیش‌بینی‌کننده‌های مرزی قبلی را می‌توان به صورت نوشتاری نوشت

با f تابعی که نمایش‌های بایت \(\hat{e}\) را به امتیازهای مرزی با استفاده از زمینه تا نمایش بایت فعلی \({\hat{e}}_{t}\) نگاشت می‌کند (که t شاخص بایت فعلی است)، پیش‌بینی‌کننده مرزی خود را بر روی

a، معماری Bolmo: \({\mathcal{T}}\)، عملیات توکن سازی و جاسازی، متن ورودی را به یک نمایش در هر بایت تبدیل می کند. نمایش‌ها با رمزگذار محلی \({\mathcal{E}}\) متشکل از بلوک‌های mLSTM 33 متنی می‌شوند. پیش‌بینی‌کننده مرز \({\mathcal{B}}\) تصمیم می‌گیرد با استفاده از 1 بایت زمینه آینده، مرزهای پچ را کجا قرار دهد. سپس نمایش‌ها ادغام می‌شوند، از مدل ترانسفورماتور جهانی \({\mathcal{M}}\) عبور می‌کنند و دپوول می‌شوند.

در نهایت، رمزگشای محلی \({\mathcal{D}}\) که از پشته mLSTM دیگری تشکیل شده است، نمایش‌های بایت‌های دپوول‌شده را متن‌بندی می‌کند و سر مدل‌سازی زبان آن‌ها را به پیش‌بینی‌های بایت بعدی تبدیل می‌کند و تصمیم می‌گیرد که مرز پچ بعدی را کجا قرار دهد. ب، LLMهای سطح زیرکلمه با استفاده از نشانه‌ساز زیرکلمه خارجی مرزها را بدون علت بر روی پیش‌پر تعیین می‌کنند و سپس به طور ضمنی مرزها و محتوای متن را در طول رمزگشایی پیش‌بینی می‌کنند. c، LTLMهای سطح بایت قبلی به طور علی با یک پیش‌بینی‌کننده مرزی سبک وزن در طول پر کردن و رمزگشایی، مرزها را تعیین می‌کنند.

d، معماری بایت‌سازی ما بیان‌پذیری مرزهای LLM در سطح زیرکلمه را با پیش‌بینی غیرعلی مرزهای پیش‌پر و سپس پیش‌بینی در طول رمزگشایی پیش‌بینی اینکه آیا یک مرز و بایت بعدی رخ می‌دهد یا خیر، بازیابی می‌کند.

یعنی تا 1 بایت از زمینه آینده استفاده می کنیم. به طور مشخص، ما پیش بینی کننده مرزی خود را به عنوان پارامتر می کنیم

که در آن W q و W k ماتریس‌های پیش‌بینی آموخته شده‌اند، همانطور که در هوانگ و همکارانش. 2، اگرچه فاصله کسینوس بین نمایش نمایش بایت فعلی و موقعیت بایت یک در آینده را محاسبه می کنیم. حتی اگر توکن سازهای زیرکلمه اصولا دسترسی نامحدودی به آینده دارند، در عمل، 1 بایت پیش بینی برای مطابقت با رفتار توکن سازی زیرکلمه کافی است. همانطور که در شکل 1 نشان داده شده است، در نظر گرفتن زمینه آینده نیز می تواند وصله ها را از نظر معنایی منسجم تر کند.

به عنوان مثال، در متون حاوی ترکیبات، مانند «تخت گل»، یک پیش‌بینی‌کننده مرز سه گزینه شهودی دارد: (1) کل ترکیب را به یک تکه «تخت گل» تبدیل کنید، (2) یک مرز وصله بعد از «r» قرار دهید تا وصله «گل» ایجاد شود یا (3) یک مرز وصله بعد از «b» قرار دهید (زمانی که این یک کلمه مرکب ایجاد شود).

گزینه (2) مسلما از نظر معنایی منسجم ترین است 34 ; با این حال، برای یک پیش‌بینی‌کننده مرز علی، این بدان معناست که باید برای هر متنی که با «گل» شروع می‌شود، یک مرز وصله بعد از «r» قرار دهید، از جمله، برای مثال، «گل‌ها»، در حالی که یک غیرعلتی می‌تواند بر اساس زمینه آینده تنظیم شود. استراتژی byteification هوانگ و همکاران. 2 نظارت را بر اساس گزینه (3) اعمال می‌کند، یعنی شروع زیرکلمه بعدی را به جای پایان زیرکلمه قبلی پیش‌بینی می‌کند، که همانطور که در شکل 1 نشان داده شده است، یک پچ "flowerb" ایجاد می‌کند.

اگرچه استفاده از زمینه آینده برای از پیش پر کردن مناسب است، اما باید بدانیم که آیا مرزی را بدون مشاهده بایت بعدی برای رمزگشایی قرار دهیم یا خیر. بنابراین، یک نماد خاص <b> را به واژگان اضافه می‌کنیم و به رمزگشای محلی اجازه می‌دهیم تا در پایان هر پچ، <b> را منتشر کند (برعکس، رمزگذار محلی هرگز <b> را نمی‌بیند). این مشابه با پیش‌بینی مرز خروجی در Fleshman و Van Durme 35 است.

در واقع، ما با دو پیش‌بینی‌کننده مرزی مواجه می‌شویم: پیش‌بینی‌کننده مرز \({\mathcal{B}}\) که بازنمایی‌های بافتی کم‌عمق را از رمزگذار محلی با بافت آینده (استفاده شده در مرحله پیش‌پر کردن) دریافت می‌کند و یک پیش‌بینی‌کننده مرزی به عنوان بخشی از سر مدل‌سازی زبان که بازنمایی‌های عمیقا متن‌سازی‌شده را بدون متن‌زدایی از آینده محلی decoder می‌گیرد.

قابل‌توجه، این دقیقا معادل رفتار LLM‌های سطح زیرکلمه است: پیش‌پرداخت با استفاده از نشانه‌ساز زیرکلمه خارجی (مشابه با پیش‌بینی‌کننده مرز \({\mathcal{B}}\)) نشانه‌گذاری می‌شود، و مرزهای خروجی <b> به طور ضمنی همراه با محتوای متنی پیش‌نویسی از پیش‌کلمه‌های فرعی پیش‌بینی می‌شوند. همانطور که در شکل 1 نشان داده شده است. این به مدل بایت‌شده ما اجازه می‌دهد به مرزهای دقیق و بازنمایی‌های وفادار به مدل اصلی دست یابد، در حالی که رویکردهای قبلی باید یکی یا دیگری را انتخاب می‌کردند (جدول داده‌های توسعه‌یافته 6).

از آنجایی که می‌خواهیم نماد <b> را بعد از هر وصله پیش‌بینی کنیم، رمزگشای محلی ما به مدلی از \({{\mathbb{R}}}^{n\times d}\to {{\mathbb{R}}}^{(n+k)\times d}\) تبدیل می‌شود، یعنی رمزگشای محلی نیاز به پردازش k موقعیت دیگر دارد. اگرچه این سربار در اصل منع کننده نیست، اما مقایسه مدل هایی که از پیش بینی مرز خروجی استفاده می کنند با مدل هایی که این کار را نمی کنند دشوار می کند. بنابراین، ما با دو برابر کردن اندازه واژگان بایت خود از 256 به 512 برای هر بایت، با افزودن نسخه ای از همان بایت و به دنبال آن یک مرز، آن را به طور موثری به قیمت صفر می کنیم.

سپس الگوریتم‌های نمونه‌برداری مانند top_p 36 بر روی واژگان ترکیبی با اندازه 512 عمل می‌کنند. پس هدف رمزگشای محلی پیش‌بینی بایت فعلی و اینکه آیا در هر مرحله با یک مرز دنبال می‌شود یا خیر، است. ترکیب نماد مرزی رمزگشای محلی را به یک مدل همسانگرد تبدیل می کند. تنها سربار باقی مانده به دلیل softmax بیش از مجموعه ای از 512 به جای 256 توکن خروجی است که ناچیز است.

Byteification تعداد کل پارامترها را نزدیک به تعداد پارامترهای LLM در سطح زیرکلمه منبع نگه می‌دارد، زیرا ماتریس جاسازی خروجی حذف می‌شود اما پارامترهای جدیدی از مدل‌های محلی اضافه می‌شوند («جزئیات معماری مدل Byteified» در روش‌ها و جدول داده‌های توسعه‌یافته 5).

روش بایت‌سازی ما شامل دو مرحله است. در مرحله اول، هدف ما یادگیری سریع وزن برای رمزگذار محلی، رمزگشای محلی، پیش بینی مرز و سر مدل سازی زبان است. برای انجام این کار، ما یک هدف جدید برای بهینه‌سازی دقیق رفتار زیرکلمه منبع LLM معرفی می‌کنیم («روش Byteifying» در روش‌ها). پارامترهای مدل جهانی در این مرحله ثابت می ماند. در مرحله دوم، کل مدل را آموزش می‌دهیم تا یاد بگیرد که از اطلاعات سطح بایت استفاده کند، در حالی که به صورت اختیاری نسبت فشرده‌سازی هدف بایت‌ها در هر پچ را افزایش می‌دهیم.

ما از یک مجموعه آزمایشی ثابت در همه آزمایش‌ها استفاده کردیم ("تنظیم تجربی" در روش‌ها). برای فهرست کامل مقادیر فراپارامترهای آموزشی به جدول 4 گسترش یافته مراجعه کنید.

ما مدل‌های Qwen3 8B 30، Llama 3 8B 31 و Olmo 3 7B 28 را بایت کردیم و انواع بایت‌شده آن‌ها را به ترتیب Bwen 8B، Blama 8B و Bolmo 7B می‌دانیم. جدول 1 این مدل‌ها را با مدل‌های سطح زیرکلمه منبع و همچنین با Olmo 3 با آموزش مداوم در مورد ترکیب داده‌های ما تحت تنظیمات آموزشی Bolmo مقایسه می‌کند. ما همچنین با LLM های موجود در سطح بایت با اندازه قابل مقایسه مقایسه می کنیم: EvaByte 6.5B 27، TFree-HAT 7B 37 و BLT 7B 22.

Bwen 8B از نظر آماری به طور قابل توجهی از همه مدل‌های سطح بایت قبلی بهتر عمل کرد و از نظر عددی در هر دسته به جز GenQA بهبود یافت (در اینجا، کمی از TFree-HAT 7B عقب‌تر بود). Bwen 8B، Blama 8B و Bolmo 7B نیز نزدیک به مطابقت با مدل های منبع مربوطه خود بودند. Bwen 8B به دلیل داشتن ستون فقرات توانمندتر از Bolmo 7B بهتر عمل کرد. ما روندهای مشابهی را برای مدل 1B بایت شده (جدول داده های توسعه یافته 3) در مجموعه ارزیابی 1B خود (جدول داده های توسعه یافته 2) مشاهده کردیم.

برای کد دسته، مدل‌های بایت‌بندی شده نرخ pass@16 بالاتری را در pass@1 پایین‌تر به دست آوردند، که نشان می‌دهد آن‌ها ادامه‌های متنوع‌تری نسبت به مدل‌های سطح زیرکلمه منبع تحت تنظیمات نمونه‌گیری داده‌شده، که برای همه مدل‌ها معادل بود (دما = 0.6 و top_p = 0.6؛ جدول داده‌های توسعه‌یافته 1) ایجاد کردند.

با این حال، نتیجه‌گیری اینکه مدل‌های سطح بایت در واقع برای تولید نسل‌های متنوع‌تر مناسب‌تر هستند، نیاز به نقشه‌برداری از مرز پارتو با تنوع کیفیت دارد، زیرا افزایش مشاهده‌شده در تنوع را می‌توان با تأثیرات متفاوت تنظیمات نمونه‌گیری یا موتورها بر روی مدل‌های سطح بایت در مقایسه با مدل‌های سطح زیرکلمه اصلی توضیح داد. بررسی این جنبه در کارهای آینده می تواند مفید باشد ("جهت های آینده" در اطلاعات تکمیلی).

خواندن متن کامل در نیچربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Retrofitting language models to operate over bytes

Nature, Published online: 07 October 2026; doi:10.1038/s41586-026-11111-4 Byteification is a general method for retrofitting large language models to operate over bytes such that they approach the capabilities of subword-based systems and may be better for scientific data.

همه‌ی اخبار علم