به روز رسانی مدل های زبان برای کار بر روی بایت
طبیعت، انتشار آنلاین: 07 اکتبر 2026; doi:10.1038/s41586-026-11111-4 Byteification یک روش عمومی برای مقاوم سازی مدل های زبانی بزرگ است تا روی بایت ها کار کنند به گونه ای که به قابلیت های سیستم های مبتنی بر زیرکلمه نزدیک می شوند و ممکن است برای داده های علمی بهتر باشند.
پیشرفتهای اخیر در هوش مصنوعی (AI) عمدتا توسط مدلهای زبانی بزرگ، شبکههای عصبی عمیق که بر روی واحدهای مجزا به نام توکنها کار میکنند، انجام شده است. برای نمایش متن، اکثر مدل های زبان بزرگ از کلمات یا قطعات کلمه به عنوان نشانه استفاده می کنند که به عنوان نشانه گذاری زیرکلمه 1 شناخته می شود. توکنسازی زیرکلمهها اطلاعات ریزدانه را پنهان میکند، که مشکلساز است، بهویژه برای دادههای علمی - مانند کد رایانه یا توالیهای بیولوژیکی - که در آن معنا به شخصیتها یا بایتها بستگی دارد.
مدلهایی که در عوض مستقیما بر روی رمزگذاری بایت متن کار میکنند از این محدودیتها اجتناب میکنند، اما تاکنون از نظر عملکرد از مدلهای مبتنی بر زیرکلمه عقب ماندهاند. در اینجا یک روش کلی برای ایجاد مدلهای زبان بزرگ در سطح بایت از طریق بایتسازی که به قابلیتهای سیستمهای مبتنی بر زیرکلمه نزدیک میشوند، معرفی میکنیم. ما از یک روش تبدیل دو مرحلهای برای بازسازی مدلهای مبتنی بر زیرکلمه موجود به مدلهای سطح بایت با حداقل آموزش اضافی استفاده میکنیم.
مدلهای بهدستآمده از رویکردهای سطح بایت قبلی بهتر عمل میکنند و در وظایف استدلال در سطح کاراکتر برتری دارند، با پردازش کارآمد اطلاعات سطح بایت و سازگاری با استفاده مجدد از اکوسیستم موجود در اطراف مدل زبان بزرگ منبع، به سرعت استنتاج عملی دست مییابند. نتایج ما مانع عملکرد طولانیمدت برای مدلسازی زبان سطح بایت انتها به انتها را حذف میکند و نشان میدهد که مدلهایی که بر روی رمزگذاریهای متن خام کار میکنند میتوانند به صورت رقابتی مقیاس شوند و در عین حال مزایایی را در حوزههایی که نیاز به درک متنی دقیق دارند ارائه دهند.
پیشرفتهای اخیر در هوش مصنوعی توسط سیستمهای یادگیری عمیق سرتاسر انجام شده است که نمایشها را مستقیما از دادهها یاد میگیرند. مدلهای زبان بزرگ (LLM) نمونهای از این روند هستند و با آموزش مجموعههای عظیم متن 3، 4 به قابلیتهای قوی دست مییابند. با این حال، علیرغم عمومیت ظاهری آنها، LLMهای معاصر کاملا سرتاسر نیستند: قبل از شروع یادگیری، ابتدا متن باید به دنباله ای از واحدهای مجزا به نام توکن ها نگاشت شود.
انتخاب نشانهها، اگرچه گاهی نادیده گرفته میشود، اما اساسا بازنماییهایی را که LLMها یاد میگیرند و رفتارهایی که از خود نشان میدهند شکل میدهد. 5، 6، 7، 8، 9.
اکثریت قریب به اتفاق LLM های معاصر از کلمات یا بخش هایی از کلمات به عنوان نشانه در فرآیندی به نام زیرکلمه سازی 1 و 10 استفاده می کنند. این منجر به مشکلات زیادی می شود. LLM هایی که از نشانه گذاری زیرکلمه استفاده می کنند از درک محدودی در سطح کاراکتر رنج می برند 11، 12، 13، که به ویژه عملکرد با داده های علمی، مانند کد و دنباله های بیولوژیکی 2، 14، 15، 16، 17 را مختل می کند. آنها همچنین به طور ضمنی نسبت به ایجاد پاسخهای خاص بر اساس نحوه نشانهگذاری اعلان تمایل دارند 18، 19، 20، آنها در تعداد کلماتی که میتوانند در واژگان خود بگنجانند، محدود هستند، که در
تمرین به انگلیسی محوری 6، 21 منجر می شود، و آنها به طور بالقوه محاسبات خود را به صورت غیربهینه تخصیص می دهند 2، 22. این مشکلات انگیزه تحقیقات گستردهای را در مورد جایگزینهایی برای توکنسازی زیرکلمهها فراهم کرده است، معمولا با استفاده از بایتهای UTF-8 زیربنایی که متن بهعنوان 23 به عنوان واحدهای گسسته کدگذاری میشود. بسیاری از LLM های سطح بایت قبلی ادعا می کنند که از LLM های سطح زیر کلمه در مرز پارتو 2، 22، 24، 25، 26، 27 برتری دارند. با این حال، در عمل، LLM های سطح بایت تاکنون مورد پذیرش گسترده ای قرار نگرفته اند، و همه LLM های پیشرو هنوز به طور انحصاری بر توکن سازی زیرکلمه ها متکی هستند.
ما فرض میکنیم که دلیل اصلی این عدم تطابق بین تئوری و عمل این است که رویکردهای موجود برای مدلسازی زبان سطح بایت عمدتا بر آموزش یک مدل جدید در سطح بایت از یک مقداردهی اولیه تصادفی و مقایسه آن با یک LLM در سطح زیرکلمهای که از یک مقداردهی اولیه تصادفی نیز آموزش داده شده است، متمرکز است. در مقابل، آموزش پیشرفتهترین LLMهای زیرکلمه به سرعت در حال تکامل است و نوآوریها را در مدیریت دادههای آموزشی، معماری مدل و آموزش پس از آموزش ترکیب میکند. همگام شدن با این سرعت برای توسعه LLM در سطح بایت بدون سرمایه گذاری گسترده غیرممکن است.
برای رفع این عدم تطابق، ما یک روش کلی برای ایجاد LLM در سطح بایت معرفی میکنیم که عملکردی نزدیک به LLMهای پیشرفته در سطح زیرکلمهها در کارهای مختلف دارند، در حالی که از LLMهای سطح بایت قبلی با تعداد پارامترهای قابل مقایسه بسیار پیشی میگیرند. برخلاف LLMهای سطح بایت قبلی که عمدتا بر روی آموزش از راهاندازی اولیه تصادفی تمرکز میکنند، ما یک LLM موجود در سطح بایت را با استفاده از کمتر از 1٪ از بودجه پیشآموزشی معمولی (در مجموع 49.1 میلیارد توکن، که در آن B نشاندهنده یک میلیارد یا 109 است) به سطح بایت ارتقا دادیم. ما به این فرآیند به عنوان byteification اشاره می کنیم.
Byteification ارتباطی بین LLM های موجود در سطح زیرکلمه و LLM های سطح بایت برقرار می کند. این به ما اجازه می دهد تا مدل های بایت شده Bolmo 7B و Bolmo 1B را با شروع از LLM های کاملا باز موجود Olmo 3 7B 28 و OLMo 2 1B 29 , Bwen 8B با بایت کردن Qwen3 8B Base 30 و Blama 8B با بایت کردن LB333 .
معماری ما ابتدا جریان بایت را در دنباله ای از وصله ها جمع می کند، جایی که هر وصله خود از یک یا چند بایت تشکیل شده است. وصله ها سپس توسط یک مدل بزرگ ترانسفورماتور 32 زبان پردازش شده و در نهایت به بایت تبدیل می شوند. به دلیل توکنسازی پنهان آن به وصلههای بایتی، ما از این سبک معماری به عنوان یک مدل زبان نشانهساز پنهان (LTLM) یاد میکنیم. نمونه هایی از LTLM ها شامل مدل های DTP 24، BLT 22 و H-Net 2 است.
با این حال، برخلاف کارهای قبلی، ما بهطور خاص معماری خود را طوری طراحی کردیم که برای بایتسازی مناسب باشد (بخش «معماری مدل زبان Byteified»). به طور خاص، ما عدم تطابق بین بیان نشانهسازی زیرکلمه و نشانهسازی پنهان LTLM را حل کردیم. در کنار یک روش آموزشی کارآمد دو مرحلهای (بخش «رویه آموزشی Byteification»)، این به ما امکان میدهد به سرعت بازیابی کنیم و در برخی موارد، از عملکرد LLM در سطح زیرکلمه منبع پیشی بگیریم.
ما بر این باوریم که byteifying با ایجاد امکان ایجاد LLM های پیشرفته در سطح بایت بدون سرمایه گذاری گسترده، یک جهت تحقیقاتی کلیدی گمشده را فراهم می کند. این رویکرد مکمل آموزش از مقداردهی اولیه تصادفی است. ارزانتر کردن بایتسازی هر مدل زیرکلمهای میتواند به سرعت معماریهای با کارایی بالا را آشکار کند که کاندیدهای امیدوارکنندهای برای آموزش از مقداردهی اولیه تصادفی به عنوان LLMهای سطح بایت هستند.
مدلهای بایتشده ما بهطور میانگین عملکرد بهتری نسبت به همه LLMهای قبلی در سطح بایت در دسترس عموم با اندازههای مشابه داشتند. به عنوان مثال، Bolmo 7B به بهبود مطلق +16.5% در وظایف STEM نسبت به BLT 7B، که از مقداردهی اولیه تصادفی آموزش داده شده بود، دست یافت. Bolmo 7B همچنین در درک کاراکترها نسبت به منبع Olmo 3 بسیار بهتر عمل کرد و در تنظیمات کدنویسی خاص بهتر بود. Bwen 8B بهتر از Bolmo 7B عمل کرد و روندهای مشابهی را نشان داد و عملکردی نزدیک به مدل Qwen منبع و گاهی اوقات فراتر از آن داشت.
علاوه بر این، ما دریافتیم که مدلهای بایتشده میتوانند بهطور دلخواه با آموزش با نسبتهای بالاتر بایت در هر پچ، سرعت بیشتری ببخشند، که این امر تنها تا حد محدودی در LLMهای سطح زیرکلمه امکانپذیر است. در نهایت، ما نشان میدهیم که اجزای موجود در اکوسیستم منبع LLM میتوانند برای تطبیق یک مدل بایتشده بدون هیچ هزینه آموزشی اضافی استفاده شوند. این می تواند تحقیقات در مورد LLM های سطح بایت را تسریع کند.
در مجموع، نتایج ما نشان میدهد که LLMهای سطح بایت به عنوان پایهای برای مدلهای زبان آینده، با مزایای بالقوه برای کارایی محاسباتی با کاهش انرژی و هزینههای استقرار، برای کاهش سوگیریهای معرفیشده توسط توکنسازی زیرکلمهای با محوریت انگلیسی و برای فعال کردن برنامههایی که نیاز به مفاهیم دقیق علمی در حوزههای علمی و فنی دارند، ارائه میدهند.
با پیروی از ساختار کلی مشابه LTLM های قبلی ("کار مرتبط" در روش ها)، مدل های بایت شده را می توان همانطور که در شکل 1 نشان داده شده است، رسمی کرد. به طور خلاصه، یک مدل رمزگذار محلی که روی بایت ها کار می کند، ابتدا بازنمایی بایت های متنی ایجاد می کند. سپس یک ماژول پیشبینیکننده مرز عصبی، بر اساس این نمایشها، موقعیتهای بایت را پیشبینی میکند که در آن یک مرز قرار میگیرد. اطلاعات مرزی برای استخراج دنبالهای از وصلهها استفاده میشود: پچ دنبالهای از بایتها بین مرزهای متوالی است (از جمله بایتی که مرز انتهایی قرار میگیرد).
سپس یک ماژول ادغام، بازنمایی بایت های متنی را به یک نمایش در هر پچ کاهش می دهد، که از طریق یک مدل جهانی عمیق منتقل می شود. نمایشهای وصلهای که از طریق مدل سراسری زمینهسازی شدهاند، به سطح بایت بازگردانده میشوند و بیشتر از طریق یک مدل رمزگشای محلی متنی میشوند. در نهایت، نمایشهای رمزگشای محلی برای پیشبینی بایت بعدی و هرگونه اطلاعات احتمالی دیگر استفاده میشوند. ما مدلهای محلی را کمعمق اما گسترده انتخاب کردیم زیرا متوجه شدیم که جاسازیهای مدل اصلی معمولا دارای رتبه مؤثر بالایی هستند (دادههای توسعهیافته شکل 1).
1)، و ما لایههای حافظه کوتاهمدت بلند مدت ماتریس (mLSTM) 33 را برای متنی کردن اطلاعات محلی انتخاب کردیم زیرا در آزمایشهای ما عملکرد بالایی در توان عملیاتی بالا داشتند (دادههای توسعهیافته شکل 3). برای توضیح دقیق معماری، «جزئیات معماری مدل Byteified» را در Methods ببینید. انحراف اولیه ما از معماریهای قبلی در پیشبینی مرز وصله غیرعلتی نهفته است. پیشبینیکننده مرزی LTLMهای قبلی تنها از بافت گذشته برای تصمیمگیری در مورد قرار دادن یک مرز استفاده میکند (علت است، که توسط Pagnoni و همکارانش به عنوان افزایشی نامیده میشود. 22).
در یک نگاه، این ضروری به نظر می رسد: ما قصد داریم بایت بعدی را پیش بینی کنیم، بنابراین نباید هیچ اطلاعاتی در مورد آن درز کنیم. با این حال، اگرچه LLMهای سطح زیرکلمه از یک محدودیت علیت بر روی نشانههای زیرکلمه استفاده میکنند، نشانههای زیرکلمه بهطور انحصاری به بافت گذشته وابسته نیستند: توکن سازهای زیرکلمه از اطلاعات مربوط به بایتهای آینده برای قرار دادن مرزهای نشانه استفاده میکنند.
برای مشاهده این موضوع، اجازه دهید زیرکلمه خود را به عنوان تابعی تفسیر کنیم که تصمیم میگیرد مرز نشانه را بعد از هر بایت قرار دهیم یا نه: بایت. اجازه دهید (1) واژگانی از کلمات و زیرکلمات انگلیسی، (2) متن مثال « _Hello_Wor!» را فرض کنیم که معمولا به صورت {' _Hello' , ' _Wor' , ' !' } و (3) موقعیت i = ∣‘ _Hello_Wor' ∣ −\} ==9. _Hello_Wor!' ) i = 1، زیرا بعد از 'r' یک مرز وجود دارد.
با این حال، در متن ' _Hello_World!'، که به صورت {' _Hello' , ' _World' , ' !' } علامت گذاری می شود، \({\mathcal{B}}\) (' _Hello_World!' ) i = 0، با وجود ' _Hello_Wor!' =__I +1 =W]_ داریم '_سلام_ور' . به عبارت دیگر، اگرچه LLM در سطح زیرکلمه تنها از نشانههای زیرکلمه گذشته برای پیشبینی نشانه زیرکلمه بعدی استفاده میکند، خود نشانههای زیرکلمه با در نظر گرفتن زمینه آینده ایجاد میشوند. در این مورد، این بدان معنی است که تصمیم بگیرید که «_Wor» باید در یک مورد نشانه باشد اما در مورد دیگر نه، اگرچه متن تا آن نقطه معادل است.
در مقابل، LTLM های فعلی نمی توانند زمینه آینده را در نظر بگیرند. این یک عدم تطابق بین بیان پیشبینیکنندههای مرزی LTLM و نشانهکنندههای زیرکلمه ایجاد میکند. ما پیشبینیکننده مرز را برای رفع این عدم تطابق اصلاح کردیم. به طور خاص، اگرچه پیشبینیکنندههای مرزی قبلی را میتوان به صورت نوشتاری نوشت
با f تابعی که نمایشهای بایت \(\hat{e}\) را به امتیازهای مرزی با استفاده از زمینه تا نمایش بایت فعلی \({\hat{e}}_{t}\) نگاشت میکند (که t شاخص بایت فعلی است)، پیشبینیکننده مرزی خود را بر روی
a، معماری Bolmo: \({\mathcal{T}}\)، عملیات توکن سازی و جاسازی، متن ورودی را به یک نمایش در هر بایت تبدیل می کند. نمایشها با رمزگذار محلی \({\mathcal{E}}\) متشکل از بلوکهای mLSTM 33 متنی میشوند. پیشبینیکننده مرز \({\mathcal{B}}\) تصمیم میگیرد با استفاده از 1 بایت زمینه آینده، مرزهای پچ را کجا قرار دهد. سپس نمایشها ادغام میشوند، از مدل ترانسفورماتور جهانی \({\mathcal{M}}\) عبور میکنند و دپوول میشوند.
در نهایت، رمزگشای محلی \({\mathcal{D}}\) که از پشته mLSTM دیگری تشکیل شده است، نمایشهای بایتهای دپوولشده را متنبندی میکند و سر مدلسازی زبان آنها را به پیشبینیهای بایت بعدی تبدیل میکند و تصمیم میگیرد که مرز پچ بعدی را کجا قرار دهد. ب، LLMهای سطح زیرکلمه با استفاده از نشانهساز زیرکلمه خارجی مرزها را بدون علت بر روی پیشپر تعیین میکنند و سپس به طور ضمنی مرزها و محتوای متن را در طول رمزگشایی پیشبینی میکنند. c، LTLMهای سطح بایت قبلی به طور علی با یک پیشبینیکننده مرزی سبک وزن در طول پر کردن و رمزگشایی، مرزها را تعیین میکنند.
d، معماری بایتسازی ما بیانپذیری مرزهای LLM در سطح زیرکلمه را با پیشبینی غیرعلی مرزهای پیشپر و سپس پیشبینی در طول رمزگشایی پیشبینی اینکه آیا یک مرز و بایت بعدی رخ میدهد یا خیر، بازیابی میکند.
یعنی تا 1 بایت از زمینه آینده استفاده می کنیم. به طور مشخص، ما پیش بینی کننده مرزی خود را به عنوان پارامتر می کنیم
که در آن W q و W k ماتریسهای پیشبینی آموخته شدهاند، همانطور که در هوانگ و همکارانش. 2، اگرچه فاصله کسینوس بین نمایش نمایش بایت فعلی و موقعیت بایت یک در آینده را محاسبه می کنیم. حتی اگر توکن سازهای زیرکلمه اصولا دسترسی نامحدودی به آینده دارند، در عمل، 1 بایت پیش بینی برای مطابقت با رفتار توکن سازی زیرکلمه کافی است. همانطور که در شکل 1 نشان داده شده است، در نظر گرفتن زمینه آینده نیز می تواند وصله ها را از نظر معنایی منسجم تر کند.
به عنوان مثال، در متون حاوی ترکیبات، مانند «تخت گل»، یک پیشبینیکننده مرز سه گزینه شهودی دارد: (1) کل ترکیب را به یک تکه «تخت گل» تبدیل کنید، (2) یک مرز وصله بعد از «r» قرار دهید تا وصله «گل» ایجاد شود یا (3) یک مرز وصله بعد از «b» قرار دهید (زمانی که این یک کلمه مرکب ایجاد شود).
گزینه (2) مسلما از نظر معنایی منسجم ترین است 34 ; با این حال، برای یک پیشبینیکننده مرز علی، این بدان معناست که باید برای هر متنی که با «گل» شروع میشود، یک مرز وصله بعد از «r» قرار دهید، از جمله، برای مثال، «گلها»، در حالی که یک غیرعلتی میتواند بر اساس زمینه آینده تنظیم شود. استراتژی byteification هوانگ و همکاران. 2 نظارت را بر اساس گزینه (3) اعمال میکند، یعنی شروع زیرکلمه بعدی را به جای پایان زیرکلمه قبلی پیشبینی میکند، که همانطور که در شکل 1 نشان داده شده است، یک پچ "flowerb" ایجاد میکند.
اگرچه استفاده از زمینه آینده برای از پیش پر کردن مناسب است، اما باید بدانیم که آیا مرزی را بدون مشاهده بایت بعدی برای رمزگشایی قرار دهیم یا خیر. بنابراین، یک نماد خاص <b> را به واژگان اضافه میکنیم و به رمزگشای محلی اجازه میدهیم تا در پایان هر پچ، <b> را منتشر کند (برعکس، رمزگذار محلی هرگز <b> را نمیبیند). این مشابه با پیشبینی مرز خروجی در Fleshman و Van Durme 35 است.
در واقع، ما با دو پیشبینیکننده مرزی مواجه میشویم: پیشبینیکننده مرز \({\mathcal{B}}\) که بازنماییهای بافتی کمعمق را از رمزگذار محلی با بافت آینده (استفاده شده در مرحله پیشپر کردن) دریافت میکند و یک پیشبینیکننده مرزی به عنوان بخشی از سر مدلسازی زبان که بازنماییهای عمیقا متنسازیشده را بدون متنزدایی از آینده محلی decoder میگیرد.
قابلتوجه، این دقیقا معادل رفتار LLMهای سطح زیرکلمه است: پیشپرداخت با استفاده از نشانهساز زیرکلمه خارجی (مشابه با پیشبینیکننده مرز \({\mathcal{B}}\)) نشانهگذاری میشود، و مرزهای خروجی <b> به طور ضمنی همراه با محتوای متنی پیشنویسی از پیشکلمههای فرعی پیشبینی میشوند. همانطور که در شکل 1 نشان داده شده است. این به مدل بایتشده ما اجازه میدهد به مرزهای دقیق و بازنماییهای وفادار به مدل اصلی دست یابد، در حالی که رویکردهای قبلی باید یکی یا دیگری را انتخاب میکردند (جدول دادههای توسعهیافته 6).
از آنجایی که میخواهیم نماد <b> را بعد از هر وصله پیشبینی کنیم، رمزگشای محلی ما به مدلی از \({{\mathbb{R}}}^{n\times d}\to {{\mathbb{R}}}^{(n+k)\times d}\) تبدیل میشود، یعنی رمزگشای محلی نیاز به پردازش k موقعیت دیگر دارد. اگرچه این سربار در اصل منع کننده نیست، اما مقایسه مدل هایی که از پیش بینی مرز خروجی استفاده می کنند با مدل هایی که این کار را نمی کنند دشوار می کند. بنابراین، ما با دو برابر کردن اندازه واژگان بایت خود از 256 به 512 برای هر بایت، با افزودن نسخه ای از همان بایت و به دنبال آن یک مرز، آن را به طور موثری به قیمت صفر می کنیم.
سپس الگوریتمهای نمونهبرداری مانند top_p 36 بر روی واژگان ترکیبی با اندازه 512 عمل میکنند. پس هدف رمزگشای محلی پیشبینی بایت فعلی و اینکه آیا در هر مرحله با یک مرز دنبال میشود یا خیر، است. ترکیب نماد مرزی رمزگشای محلی را به یک مدل همسانگرد تبدیل می کند. تنها سربار باقی مانده به دلیل softmax بیش از مجموعه ای از 512 به جای 256 توکن خروجی است که ناچیز است.
Byteification تعداد کل پارامترها را نزدیک به تعداد پارامترهای LLM در سطح زیرکلمه منبع نگه میدارد، زیرا ماتریس جاسازی خروجی حذف میشود اما پارامترهای جدیدی از مدلهای محلی اضافه میشوند («جزئیات معماری مدل Byteified» در روشها و جدول دادههای توسعهیافته 5).
روش بایتسازی ما شامل دو مرحله است. در مرحله اول، هدف ما یادگیری سریع وزن برای رمزگذار محلی، رمزگشای محلی، پیش بینی مرز و سر مدل سازی زبان است. برای انجام این کار، ما یک هدف جدید برای بهینهسازی دقیق رفتار زیرکلمه منبع LLM معرفی میکنیم («روش Byteifying» در روشها). پارامترهای مدل جهانی در این مرحله ثابت می ماند. در مرحله دوم، کل مدل را آموزش میدهیم تا یاد بگیرد که از اطلاعات سطح بایت استفاده کند، در حالی که به صورت اختیاری نسبت فشردهسازی هدف بایتها در هر پچ را افزایش میدهیم.
ما از یک مجموعه آزمایشی ثابت در همه آزمایشها استفاده کردیم ("تنظیم تجربی" در روشها). برای فهرست کامل مقادیر فراپارامترهای آموزشی به جدول 4 گسترش یافته مراجعه کنید.
ما مدلهای Qwen3 8B 30، Llama 3 8B 31 و Olmo 3 7B 28 را بایت کردیم و انواع بایتشده آنها را به ترتیب Bwen 8B، Blama 8B و Bolmo 7B میدانیم. جدول 1 این مدلها را با مدلهای سطح زیرکلمه منبع و همچنین با Olmo 3 با آموزش مداوم در مورد ترکیب دادههای ما تحت تنظیمات آموزشی Bolmo مقایسه میکند. ما همچنین با LLM های موجود در سطح بایت با اندازه قابل مقایسه مقایسه می کنیم: EvaByte 6.5B 27، TFree-HAT 7B 37 و BLT 7B 22.
Bwen 8B از نظر آماری به طور قابل توجهی از همه مدلهای سطح بایت قبلی بهتر عمل کرد و از نظر عددی در هر دسته به جز GenQA بهبود یافت (در اینجا، کمی از TFree-HAT 7B عقبتر بود). Bwen 8B، Blama 8B و Bolmo 7B نیز نزدیک به مطابقت با مدل های منبع مربوطه خود بودند. Bwen 8B به دلیل داشتن ستون فقرات توانمندتر از Bolmo 7B بهتر عمل کرد. ما روندهای مشابهی را برای مدل 1B بایت شده (جدول داده های توسعه یافته 3) در مجموعه ارزیابی 1B خود (جدول داده های توسعه یافته 2) مشاهده کردیم.
برای کد دسته، مدلهای بایتبندی شده نرخ pass@16 بالاتری را در pass@1 پایینتر به دست آوردند، که نشان میدهد آنها ادامههای متنوعتری نسبت به مدلهای سطح زیرکلمه منبع تحت تنظیمات نمونهگیری دادهشده، که برای همه مدلها معادل بود (دما = 0.6 و top_p = 0.6؛ جدول دادههای توسعهیافته 1) ایجاد کردند.
با این حال، نتیجهگیری اینکه مدلهای سطح بایت در واقع برای تولید نسلهای متنوعتر مناسبتر هستند، نیاز به نقشهبرداری از مرز پارتو با تنوع کیفیت دارد، زیرا افزایش مشاهدهشده در تنوع را میتوان با تأثیرات متفاوت تنظیمات نمونهگیری یا موتورها بر روی مدلهای سطح بایت در مقایسه با مدلهای سطح زیرکلمه اصلی توضیح داد. بررسی این جنبه در کارهای آینده می تواند مفید باشد ("جهت های آینده" در اطلاعات تکمیلی).
متن اصلی (انگلیسی)
Retrofitting language models to operate over bytes
Nature, Published online: 07 October 2026; doi:10.1038/s41586-026-11111-4 Byteification is a general method for retrofitting large language models to operate over bytes such that they approach the capabilities of subword-based systems and may be better for scientific data.