Kolibri Has Landed: یک مدل مستقل با وزن باز
آدرس مقاله: https://aleph-alpha.com/fa/blog/kolibri-has-landed-a-sovereign-open-weight-model/ آدرس نظرات: https://news.ycombinator.com/item?id=49942706 امتیاز: 234 # نظر: 39
در روز اتحاد مجدد آلمان، ما مدل جدید خود را منتشر می کنیم: Kolibri.
Kolibri یک ترانسفورماتور ترکیبی از متخصصین انگلیسی-آلمانی با 78B کل پارامتر، 3B فعال است. از طول زمینه تا 1 میلیون توکن پشتیبانی می کند. این مدل را میتوان با وزنهای کامل در Hugging Face بارگیری کرد و تحت شرایط مجوز آپاچی 2.0 استفاده کرد.
کولیبری نتیجه تکرار مداوم تلاش های آموزشی مدل ما است. ما ابتدا یک خط لوله آموزشی مدل ساختیم و با ساخت Kolibri Origin، یک مدل فعال 30 بایتی و 3 بایتی با پنجره زمینه 65 هزار توکن بسیار کوتاهتر، اعتبار آن را تأیید کردیم. کولیبری از همان خط لوله عبور کرد: از مصرف داده و درمان، از طریق ابلیشن، قبل از تمرین، و پس از آموزش، تا ارزیابی نهایی. اجرای صدها آزمایش ابلیشن و پیشآموزشی پایدار را امکانپذیر میکرد که بدون نیاز به وارد کردن شخص در هنگام خرابی سختافزار یا قطع شدن اتصال داده، اجرا میشد.
ما به طور مداوم معیارهای آموزشی و نظارت استاندارد برای معیارهای سفارشی را زیر نظر داشتیم. زمانی که ما برای ساخت و تکرار این خط لوله گذاشتیم یک سرمایه گذاری ارزشمند بود. ما می بینیم که Kolibri چقدر بهتر از Kolibri Origin است و زمان کمی انتشار آنها را از هم جدا می کند.
Kolibri یک مدل زبان تخصصی است که برای کارهای مهم ماموریتی مستقل در مناطق تحت نظارت از جمله مدیریت دولتی، صنایع و هوافضا ساخته شده است. ما Kolibri را برای آلمانی، استدلال، ریاضی، رفتار عاملی و قابلیتهای بیشتری که مشتریانمان در تولید نیاز دارند، تخصصی کردیم. هدف از این تخصص، بهینه سازی عملکرد در موارد استفاده خاص مشتریان ما بود. از طریق تخصص، مشتریان به عملکرد زمینهای در عملیات هوش مصنوعی خود دست مییابند و میتوانند تأثیر اقتصادی آن را نظارت کنند، به طوری که ROI قابل اندازهگیری باقی میماند و در طول زمان رشد میکند.
تخصص به تنهایی کافی نیست. حاکمیت به همان اندازه مهم است. برای ما، حاکمیت دو بعد را با هم ترکیب میکند: نحوه ساخت مدل و نحوه انتقال آن به مشتریان. ما یکپارچگی کامل زنجیره تامین را ارائه میدهیم و هر تصمیمی، از دریافت دادهها، قبل و بعد از آموزش، تا ارزیابیهای نهایی را در نظر میگیریم. ما شفافیت را ارائه می کنیم. مشتریان آزادی کامل در استقرار و ایمنی مالکیت معنوی دارند، بنابراین انطباق به عنوان یک ویژگی ارثی مدل است.
ما Kolibri را برای عملکرد در طیف گستردهای از بخشها با توجه به زبان خاص حوزه، واقعیتهای نظارتی و رویهای آنها بهینه کردیم. اندازه کوچک و کارآمد آن به مشتریان ما انعطافپذیری میدهد تا آن را بدون ارسال دادههای داخلی به سرویسهای استنتاج شخص ثالث به طور کارآمد در محل اجرا کنند. نورافکن در این بخش، قابلیتهای مدل را معرفی میکند، قبل از اینکه آنها را در بخش نحوه ساخت Kolibri در سرعت بالا توضیح دهیم.
با Kolibri، ما با استفاده از 3B پارامتر فعال از مجموع 78B، مبادله بین قابلیت مدل و هزینه های استقرار را بهینه می کنیم. Kolibri برای کیفیت در مقابل هزینه خدمات، هم برای انگلیسی و هم برای آلمانی، در مرز پارتو قرار دارد. مرز پارتو مفهومی از علم اقتصاد است که بهترین ترکیب قابل دستیابی از دو هدف را نشان می دهد، جایی که بهبود در یکی به معنای کنار گذاشتن برخی از اهداف دیگر است. هیچ یک از مدل های مقایسه شده کیفیت بیشتری را با هزینه سرویس یکسان یا همان کیفیت را با هزینه کمتر ارائه نمی دهد.
کولیبری در کارهای ریاضی، کدنویسی، زمینسازی و کارهای طولانی، مدلهایی را با چهار برابر تعداد پارامترهای فعال خود، مانند Nemotron 3 Super، مطابقت میدهد.
معیارهای عمومی نمی توانند نیازهای بخش تخصصی را برآورده کنند، بنابراین ما مجموعه های ارزیابی داخلی خود را برای موارد عمودی که برای مشتریان ما مهم است، مانند بخش عمومی آلمان، هوانوردی، تولید و صنعت خودرو توسعه دادیم. هر مجموعه مهارتها، گردش کار و موارد لبه مورد نیاز در این بخشها را منعکس میکند، و محیطهای آموزشی مصنوعی جفتی به ما اجازه میدهد تا Kolibri را در برابر این ارزیابیها بدون آموزش در مورد دادههای مشتری بهبود دهیم. در بخش عملکرد متنی بیشتر بخوانید.
پاسخ هایی که در اسناد شما مستقر هستند. ما کولیبری را با داده های ممتنع و با پروتکل مرلین-آرتور خود آموزش دادیم. در نتیجه، زمانی که پاسخ در متن نیست، آموزش داده میشود که بگوید «نمیدانم». مشتریان ما برای این ویژگی ارزش قائل هستند و درخواست می کنند، بنابراین ما به طور مداوم دقت پرهیز را پیگیری و تأیید می کنیم. ما جزئیات بیشتری را در بخش Grounding ارائه می دهیم.
مدل بومی آلمانی و انگلیسی. ما یک توکنایزر آلمانی/انگلیسی دوزبانه ایجاد کردیم و بر روی گنجاندن دادههای آلی آلمانی در طول فرآیند آموزش مدل تمرکز کردیم، به طوری که 21.3٪ از نشانههای پیشآموزشی آلمانی هستند. ما از ترجمه کم استفاده کردیم (6٪ در کل)، زیرا متن ترجمه شده اثر انگشت فرهنگی زبان مبدأ خود را دارد. نتیجه مدلی است که از نظر طراحی دو زبانه است، نه یک مدل انگلیسی که مقداری آلمانی خوانده باشد. در بخش دادههای پیشآموزشی آلمانی و توکنسازهای تخصصی بیشتر بخوانید.
ما Kolibri را با قانون هوش مصنوعی اتحادیه اروپا، آییننامه عملکرد هوش مصنوعی همهمنظوره و GDPR از ابتدا در ذهن ساختیم، و قانون کپی رایت تمرکز کار ما بر فناوری قابل اعتماد است.
ما در مورد وزن مدل خود و در مورد تنظیم داده های آموزشی خود شفاف هستیم، به طوری که تصمیمات پشت توسعه قابل مشاهده است. از طریق ردیابی های استدلالی آن، توضیح می شود که چگونه مدل به یک پاسخ خاص رسیده است. با پروتکل مرلین-آرتور ما، مدل قابل اعتماد است: کولیبری از پاسخ دادن خودداری می کند زمانی که زمینه پاسخی را پشتیبانی نمی کند.
تیمهای ما این مدل را در آلمان ساختند، آن را در زیرساختها در آلمان و فنلاند، تحت قوانین اروپا و آلمان، بدون کنترل خارجی، آموزش دادند. ما مالک کل خط لوله، از مدیریت داده، قبل و بعد از آموزش، تا بهینه سازی در کارخانه مدل خود هستیم. این کنترل خط لوله پایان به انتها ما زیربنای حاکمیت مدل است. کنترل همچنین به مشتریان ما منتقل میشود و اندازه کوچک Kolibri به آنها آزادی کامل در استقرار میدهد و از تلاشهای استدلال قابل کنترل برای مبادله هزینه و تأخیر در برابر کیفیت پاسخ پشتیبانی میکند.
کارخانه مدل ما پاسخ ما به سرعت تکرار است، که زمان لازم را از دانستن خطای یک مدل به آموزش مدلی که بهتر انجام می دهد به حداقل می رساند. ما خط لوله آموزشی را به صورت کد پیادهسازی کردیم، به طوری که آموختههای تیم ما به جای اسکریپتها و یادداشتهای پراکنده، در یک دستور آموزشی نسخهسازی شده قرار گرفت. در اینجا چیزی است که بین Kolibri Origin و Kolibri به نظر می رسد.
کار روی خط لوله در ژانویه آغاز شد. پنج ماه و صدها دور ابلیشن بعد، کولیبری اوریجین پیش تمرینی را در مقیاس هدف در 11 ژوئن به پایان رساند. کولیبری در 11 سپتامبر به پایان رسید. در سه ماه بین این دو تاریخ، ما از پارامترهای 30B به 78B، از یک پنجره زمینه 65k-token به حداکثر 1M و از 7.5T توکن آموزشی به 20T رسیدیم. برای به دست آوردن آن 20T، خط لوله بیش از 200T توکن داده خام را پردازش کرد، فیلتر کرد، کپی برداری کرد و آن را به چیزی که در واقع آموزش داده بودیم تنظیم کرد.
ما طراحی توجه را تغییر دادیم، تعداد کارشناسان را سه برابر کردیم، پراکندگی را افزایش دادیم، الگوریتم مسیریابی را جایگزین کردیم، دادههای پس از آموزش خود را بهبود دادیم، تعداد وظایف محیطی را بیش از دو برابر کردیم و به مدل آموزش دادیم تا در چهار سطح تلاش مختلف استدلال کند. هر دو مدل تعداد مشابهی از پارامترها را در هر توکن فعال نگه داشته اند، با این حال Kolibri به لطف کار تیم کارایی ما، سریعتر از Kolibri Origin تمرین می کند.
چیزی که این امکان را فراهم کرد خط لوله آموزشی ما است، تلاشی برای تبدیل توسعه مدل در سطح تحقیق به یک زیرساخت کاملا خودکار آماده تولید برای طراحی و آموزش مدلهای زبان بزرگ. پایگاه کد خط لوله ما توسط همه به اشتراک گذاشته شد. هر تغییر کد پیشنهادی باعث اجرای یک مدل کوچک سرتاسری می شود. آموزش، ارزیابی، برای پیدا کردن اینکه آیا چیزی در عرض چند دقیقه شکسته است. اجراهای ما گردشهای کاری GitHub Actions هستند و بازتولید آن به معنای بررسی یک commit است. ما از خط لوله برای آموزش اصلی و صدها ابلیشن استفاده کردیم تا معماریها و تصمیمات ترکیبی دادههایمان را بگیریم.
پستهای بازرسی آموزشی تقریبا هر ساعت فرود میآیند و خط لوله به طور خودکار آنها را بر اساس دانش انگلیسی و آلمانی، ریاضیات، کد، دستورالعملها، استفاده از ابزار، زمینه طولانی، ایمنی، پرهیز از توهم و زمینگیری ارزیابی میکند. ما میتوانیم به جای اینکه بفهمیم مدل در پایان چگونه ظاهر میشود، قابلیتها را هر روز تماشا کنیم. خود اجرا بهتر از چیزی که انتظار داشتیم دوام آورد. در طی 21 روز پیشآموزش کولیبری، 38 وقفه برنامهریزی نشده، تقریبا یک مورد در هر 10000 ساعت GPU، به دلیل نقص سختافزار یا قطع شدن زمان اتصال ایجاد شد.
آنها به طور خودکار توسط خط لوله بدون مداخله دستی اداره می شدند. این خوشه به طور خودکار کار(های) آموزشی را در مجموعه متفاوتی از گره ها مجددا راه اندازی کرد و آموزش از یک ایست بازرسی حداکثر 250 قدم به عقب برداشته شد.
دسترسی به کل خط لوله، با پست های بازرسی در دسترس همه، به این معنی است که هر تیمی می تواند به جای یک مرحله از یک خط مونتاژ، دارای یک قابلیت پایان به انتها باشد. یک تیم توانایی زمینسازی Kolibri را به عنوان یک قطعه کار آموزش داده و ارزیابی کردند که به طور یکپارچه در مدل کلی ادغام میشود.
با این حال، رسیدن به اینجا یک پیاده روی خطی نبود. تلو تلو خوردیم. ما قبل از آموزش Kolibri Origin را پس از چند تریلیون توکن متوقف کردیم و آن را از ابتدا مجددا راه اندازی کردیم، زیرا یک باگ درهم ریختگی داده را شناسایی کردیم که از آزمایش ما فرار کرد. ما ابلیشنها را اجرا کردیم، تصمیمهایی گرفتیم، فقط برای یافتن یک اشکال یا خطا در پیکربندی پس از آن، و ما را مجبور به اجرای مجدد برخی از آزمایشها کردیم. در کنار تجربه خودمان، معماریهای پیشرفته، بهترین شیوهها و آخرین پیشرفتهای تحقیقاتی در LLM را دنبال کردیم. این آموختههای انباشته منجر به بهبود در فرآیندها و نردههای محافظ در خط لوله ما شد.
با نگاهی به دلتای بین Kolibri Origin و Kolibri، بهبود قابل توجه است، اما این مسیر آسان نیز است: پارامترهای بیشتر، دادههای بیشتر، خانواده معماری به خوبی درک شده، و همچنان در مقیاس کوچک. همانطور که در حال فکر کردن به افزایش مقیاس هستیم، خوشحالیم که با چالش هایی در پایه خود روبرو می شویم. اما بادوام ترین چیزی که امسال ساختیم خط لوله نیست، تیمی با توانایی اثبات شده برای ساخت، آموزش پس از آموزش و ارسال LLM از داده های خام با سرعت بالا است.
Kolibri دارای 78B پارامتر کل است که 2.5 برابر بیشتر از Kolibri Origin با ~3B پارامتر فعال است. در آزمایشهای ما، افزایش اندازه مدل ما از 32B به 123B منجر به بهبود عملکرد همیشه شد. با این حال، اندازه بزرگتر با هزینه های آموزشی و سرویس دهی بیشتر همراه بود. دومی باعث تصمیم گیری شد: 123B می تواند تنها 3 پرس و جوی کاربر 256k توکن با زمینه طولانی را در دو H100 انجام دهد، در حالی که 78B 18 درخواست همزمان را مدیریت می کند و 28٪ سریعتر رمزگشایی می کند. ما از 384 متخصص کوچکتر به جای متخصصان عریض کمتر استفاده کردیم، زیرا آنها در آزمایشات ما عملکرد بهتری داشتند.
ما همان استدلال اول کارایی را برای توجه به کار بردیم. از مجموع 50 لایه، تنها 10 لایه زمینه کامل را پردازش می کنند، در حالی که 40 لایه باقی مانده از یک پنجره متمرکز با 512 توکن استفاده می کنند. این امر محاسبات رمزگشایی و حافظه را بدون توجه به طول زمینه در آن لایهها محدود نگه میدارد. افزایش بهره وری هم برای خدمت به مدل آموزش دیده و هم آموزش در طول RL پس از آموزش، که بر مقادیر عظیمی از استنتاج متکی است، سود می برد.
ما Kolibri را بر روی 768 GPU B200 در سه مرحله آموزش دادیم: 20T توکن پیشآموزشی با طول توالی 16k در 21 روز، 3.44T توکن در اواسط آموزش در 64k و 200B توکن انطباق با زمینه طولانی در 256k. این تقریبا 24T توکن در مجموع است، تقریبا سه برابر آنچه Kolibri Origin مصرف کرده است. آلمانی بیش از یک پنجم ترکیب قبل از تمرین، حدود 4.3T توکن، در مقابل تقریبا 62% انگلیسی و 14% کد را به خود اختصاص داده است. در مقایسه با قبل از آموزش، دادههای میانی آموزش مجموعهای بسیار انتخابیتر از مجموعه دادههای انتخابشده است که به سمت استدلال، حل مسئله، کد و دادههای عاملی وزن میشوند.
برای زمینه طولانی، به جای آموزش به اسناد طولانی به تنهایی، که تمایل به فرسایش مهارتهای کسبشده قبل از آن را دارد، ما اسناد طولانی را با دادههای آموزشی با کیفیت بالا در مرحله قبل در هم آمیختیم. برای ترکیب با زمینه طولانی، اسناد طولانی مصنوعی را حذف کردیم تا از افزایش مصنوعی معیارهایی مانند RULER جلوگیری کنیم.
ما با Muon بهینه سازی کردیم، همانطور که برای Kolibri Origin انجام دادیم. ما تمرکز ویژهای بر پایداری تمرین کردیم و در نتیجه یک تمرین تمرینی قوی و بدون هیچ گونه تلفات برای هر یک از مدلها انجام شد. با کولیبری برای مسیریابی بین متخصصین در حین آموزش، متعادل سازی کمیت دقیق را معرفی می کنیم. متعادلسازی چندک در Kimi K3 معرفی شد، جایی که کمیک جهانی از روی هیستوگرام تخمین زده میشود، زیرا یک محاسبه دقیق برای برقراری ارتباط بسیار گران در نظر گرفته میشود. ما نشان میدهیم که میتوان آن را دقیقا با هزینه ثابت مستقل از اندازه دسته محاسبه کرد، و اینکه دقت هم تعادل بار و هم کیفیت مدل را بهبود میبخشد.
پس از آموزش در دو مرحله انجام شد. مرحله اول تنظیم دقیق نظارت شده برای آموزش توانایی استدلال اصلی مدل و نحوه تعامل در یک چت است، و به دنبال آن یادگیری تقویتی در مقیاس بزرگ برای آموزش مدل برای استدلال در مجموعه متنوعی از وظایف افق طولانی است. ما یک خط لوله برای هر دوی این مراحل ساختیم که به ما اجازه داد کنترل دقیقی بر رفتار مدل اعمال کنیم.
برای SFT مجموعا ۱۷۴ میلیارد توکن داده مصنوعی تولید کردیم که برای کیفیت فیلتر کردیم و با نسخههای فیلترشده مجموعه دادههای منبع باز دارای مجوز مجاز ترکیب کردیم تا ترکیب آموزشی با کیفیت بالا از ۲۶۸ میلیارد توکن به دست آوریم. برای یادگیری تقویتی، ما در مجموعه وسیعی از محیطها آموزش دیدیم که شامل بیش از 1.2 میلیون وظیفه تنظیمشده در حوزههای متنوعی مانند استدلال کد و ریاضی، وظایف عاملی، دنبال کردن دستورالعمل، پاسخ به سؤال، فراخوانی ابزار و موارد دیگر بود.
ما پایگاه کد آموزشی داخلی خود را برای کارایی بالا و استفاده از آموزش ناهمزمان بهینه کردیم، که در آن دادههای آموزشی را در محیطهای خود با استفاده از مدل فعلی به موازات آموزش مدل بر روی دادههای از قبل تولید شده تولید میکنیم.
در هر دو مرحله، ما به مدل آموزش دادیم که در سطوح مختلف تلاش (هیچ، کم، متوسط، زیاد) استدلال کند، به این معنی که کاربر میتواند روی مقدار محاسباتی که مدل باید برای یافتن راهحلی برای کار در دست سرمایهگذاری کند، کنترل کند. این به مشتریان ما اجازه می دهد تا هزینه و سرعت استنباط را با کیفیت پاسخ نهایی مقایسه کنند.
از آزمایشهایمان بر روی مدلهای پراکسی کوچک، متوجه شدیم که آموزش با حدود 20 درصد دادههای آلمانی منجر به نتایج بهینه میشود، به این معنی که ما باید توکنهای آلمانی 4T را پیدا کنیم تا مدل خود را در افق 20T آموزش دهیم. مجموعه دادههای آلمانی باز کمک میکنند، اما به اندازه کافی فاصله دارند: پس از حذف مجدد و فیلتر کردن، ما با 390B توکن آلمانی باقی ماندیم که خیلی از هدفمان فاصله داشت.
همانطور که در Sauerkraut، Not Burgers بحث کردیم، توانایی آلمانی باید از متون آلمانی با کیفیت بالا باشد. اتکای شدید به ترجمه های ماشینی به دلیل اشتباهات ظریف ترجمه و فقدان زمینه فرهنگی معتبر آلمانی به نتایج ضعیف منجر می شود. شکاف توکن را به سه روش مختلف بسته ایم.
اولین مورد این بود که خودمان آلمانی را از Common Crawl انتخاب کنیم. ما یک خط لوله تخصصی برای داده های آلمانی ساختیم. آلمانی انگلیسی نیست و داده های آلمانی را نمی توان مانند داده های انگلیسی فیلتر کرد: ما مجبور شدیم پارامترهای فیلتر را برای زبان آلمانی دوباره تنظیم کنیم. یک فیلتر معمولی در خط لوله داده زبان، حذف اسناد با کلمات طولانی بسیار زیاد است، اما نثر اداری آلمانی معمولا از حد انگلیسی در طول میانگین کلمه فراتر می رود، بنابراین تنظیمات استاندارد بی سر و صدا ثبتی را که مدیریت دولتی در آن می نویسد حذف می کند.
پس از تنظیم مجدد، خط لوله آلمانی ما 1.3T توکن منحصر به فرد از وب آلی آلمانی را به ما داد.
دوم این بود که اسناد آلمانی را که قبلا داشتیم، بازنویسی کنیم. یک LLM یک سند آلمانی ارگانیک را به سبک مدخل دایره المعارف، گفتگوی پرسش و پاسخ یا متنی بازنویسی می کند و محتوای آن را حفظ می کند. این واقعیتهای یکسان را در چندین شکل سطحی به مدل میآموزد و اطلاعات موجود در دادههای کمیاب را چند برابر میکند، و عملیاتی متفاوت از ترجمه است: منبع آلمانی است، بنابراین موضوع و پیوند فرهنگی آلمانی میماند: صدراعظم، نه رئیسجمهور. دانش جدید زیادی اضافه نمی کند، بلکه عبارات جدیدی از دانش که قبلا در مجموعه وجود داشت، اضافه نمی کند.
بازنویسی حدود 1T توکن منحصربهفرد به ما داد و آن را به بزرگترین منبع آلمانی در مدل تبدیل کرد.
سومی ترجمه بود و ما فقط در اصل کلیبری از آن استفاده کردیم. ترجمه انگلیسی به آلمانی زمانی کار می کند که مدل، اعلان ها و تکه تکه ها با دقت انتخاب شوند، اما دو مشکل دارد. خروجی همچنان میتواند ترجمهای، ترجمه تحت اللفظی اصطلاحات را نشان دهد: "ایمن رانندگی کن!" می شود "Fahre sicher!" به جای "Komm gut an!". مهمتر از آن، بافت فرهنگی ترجمه نمی شود. مجموعهای که از انگلیسی ترجمه شده است، توزیع جغرافیایی، جمعیتی و سازمانی وب انگلیسی را به ارث میبرد، بنابراین مدلی که بر روی آن آموزش داده شده است درباره جهانی که آمریکایی به نظر میرسد آلمانی صحبت میکند.
در پایان آلمانی به عنوان یک استخر منحصر به فرد با توکن 2.4T وارد کولیبری شد، 80 درصد آن توسط ما و 20 درصد از مجموعه داده های باز تولید شده است، و مدل آن را در 21.3 درصد از توکن های قبل از آموزش، تقریبا 4.3T در طول نمونه برداری 20T مشاهده کرد. هر توکن آلمانی به طور متوسط 1.8 بار دیده شد، در محدوده چهار دوره گذشته که تکرار آن نتیجه نمی دهد. حدود 85 درصد از مدل آلمانی خوانده شده متن وب است، یا ارگانیک یا بازنویسی شده از ارگانیک. مابقی اسناد نظارتی - رویههای پارلمانی، متون قانونی و سایر دادههای موجود در حوزه عمومی - و آن سهم کوچک ترجمه شده است.
ما یک توکنایزر دوزبانه انگلیسی-آلمانی ساختیم که بر روی مجموعه داده های قبل از آموزش هر مدل آموزش دیده و تخصصی کردیم. به دلیل سهم آلمانی 21 درصدی در دادههای ما، زبان آلمانی را بهتر از سایر مدلهای SOTA فشرده میکند. این منجر به استنتاج کارآمدتر (توکن های کمتر) به حداقل رساندن هزینه ها و کوتاه شدن زمان پاسخ شد. ما یک روش جدید برای آموزش توکن سازها، UniBPE، معرفی می کنیم که مورفولوژی زبان ها را بهتر از رویکردهای موجود، به ویژه ساختار ترکیبی آلمانی، بدون به خطر انداختن کارایی توکن انگلیسی، رعایت می کند.
دو رویکرد پیشرو برای آموزش توکن سازها BPE و Unigram هستند. ما این دو را با هم ترکیب می کنیم، رویکرد BPE از پایین به بالا را حفظ می کنیم و از هدف آموزشی Unigram برای انتخاب ادغام برای افزودن به واژگان استفاده می کنیم. با واژگان 128k آموزش داده شده در مجموعه داده های انگلیسی/آلمانی ما، این به طور قابل ملاحظه ای توکن سازی را بهبود می بخشد.
دادگاه اجتماعی فدرال Bundessozialgerichtes (جنسی)
حدس زدن پاداش های ارزیابی و آموزش متداول LLM: یک حدس شانسی برای رسیدن به پاسخ صحیح دارد، در حالی که ممتنع هیچ شانسی ندارد. بنابراین، مدلها یاد میگیرند که با هر آنچه که دارند، پاسخ دهند، حتی اگر ورودی آنها اطلاعات کافی برای پاسخگویی را ارائه نکند. درخواست از یک مدل برای ارائه نقلقولها اغلب به همین دلیل نتیجه معکوس میدهد: مدلها به سادگی میتوانند برای توجیه پاسخی بیاساس، منابعی را که به نظر میآیند قابل قبول هستند، توهم ایجاد کنند.
برای یک مشتری تنظیمشده، مدلی که میداند خودداری کند، تفاوت بین خلبان و استقرار است. ما گفتن «نمیدانم» را بهعنوان یک قابلیت مدل مهم در نظر میگیریم و (1) اقدامات اختصاصی زمین و ضد توهم را توسعه و پیگیری میکنیم و (2) از روشهای آموزشی اختصاصی برای بهبود این قابلیت پرهیز استفاده و توسعه میدهیم.
در طول آموزش، از نمونه داده های آموزشی استفاده می کنیم که پاسخ صحیح «نمی دانم» است. در حالی که تنظیم دقیق برای پرهیز در صنعت در حال افزایش است، نمونههای منفی با کیفیت بالا به سختی یافت میشوند، به خصوص در جایی که مشتریان ما به آنها نیاز دارند، در مناطق عمودی باریک که همه دادهها کمیاب است. بنابراین، ما همچنین با روش مرلین-آرتور خود آموزش میدهیم، که در داخل توسعه داده شده و به تفصیل در پست وبلاگ ما توضیح داده شده است، که با استفاده خودکار از نقاط ضعف مدل در هر مرحله آموزشی، کمبود داده را حل میکند و نمونههای منفی مصنوعی را از اسناد موجود تولید میکند.
این تمرین به بازی با سه بازیکن تبدیل می شود. آرتور مدلی است که ما آموزش می دهیم و می فرستیم. مرلین یک زمینه سند موجود را می گیرد، یک متن جدید ایجاد می کند که احتمال پاسخ صحیح آرتور را افزایش می دهد. مورگانا با حذف شواهد مربوطه از سند، نقطه داده جدیدی ایجاد می کند و سعی می کند آرتور را به یک توهم بکشاند.
آرتور نمی داند با کدام یک روبرو است، بنابراین استراتژی معتبر او این است که سؤال و زمینه را با دقت بخواند تا بتواند در زمینه مرلین پاسخ دهد، در حالی که تشخیص می دهد که خودداری پاسخ کاملا لازم برای بافت ویرایش شده مورگانا است - نادرست کردن هر حدس، حتی یک حدس خوش شانس.
متن اصلی (انگلیسی)
Kolibri Has Landed: A Sovereign Open-Weight Model
Article URL: https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model/ Comments URL: https://news.ycombinator.com/item?id=49942706 Points: 234 # Comments: 39