پرش به محتوای اصلی

Kolibri Has Landed: یک مدل مستقل با وزن باز

هکرنیوز۱۴۰۵ مهر ۱۱, شنبه، ساعت ۱۳:۰۶حدود 16 دقیقه مطالعه

آدرس مقاله: https://aleph-alpha.com/fa/blog/kolibri-has-landed-a-sovereign-open-weight-model/ آدرس نظرات: https://news.ycombinator.com/item?id=49942706 امتیاز: 234 # نظر: 39

در روز اتحاد مجدد آلمان، ما مدل جدید خود را منتشر می کنیم: Kolibri.

Kolibri یک ترانسفورماتور ترکیبی از متخصصین انگلیسی-آلمانی با 78B کل پارامتر، 3B فعال است. از طول زمینه تا 1 میلیون توکن پشتیبانی می کند. این مدل را می‌توان با وزن‌های کامل در Hugging Face بارگیری کرد و تحت شرایط مجوز آپاچی 2.0 استفاده کرد.

کولیبری نتیجه تکرار مداوم تلاش های آموزشی مدل ما است. ما ابتدا یک خط لوله آموزشی مدل ساختیم و با ساخت Kolibri Origin، یک مدل فعال 30 بایتی و 3 بایتی با پنجره زمینه 65 هزار توکن بسیار کوتاه‌تر، اعتبار آن را تأیید کردیم. کولیبری از همان خط لوله عبور کرد: از مصرف داده و درمان، از طریق ابلیشن، قبل از تمرین، و پس از آموزش، تا ارزیابی نهایی. اجرای صدها آزمایش ابلیشن و پیش‌آموزشی پایدار را امکان‌پذیر می‌کرد که بدون نیاز به وارد کردن شخص در هنگام خرابی سخت‌افزار یا قطع شدن اتصال داده، اجرا می‌شد.

ما به طور مداوم معیارهای آموزشی و نظارت استاندارد برای معیارهای سفارشی را زیر نظر داشتیم. زمانی که ما برای ساخت و تکرار این خط لوله گذاشتیم یک سرمایه گذاری ارزشمند بود. ما می بینیم که Kolibri چقدر بهتر از Kolibri Origin است و زمان کمی انتشار آنها را از هم جدا می کند.

Kolibri یک مدل زبان تخصصی است که برای کارهای مهم ماموریتی مستقل در مناطق تحت نظارت از جمله مدیریت دولتی، صنایع و هوافضا ساخته شده است. ما Kolibri را برای آلمانی، استدلال، ریاضی، رفتار عاملی و قابلیت‌های بیشتری که مشتریانمان در تولید نیاز دارند، تخصصی کردیم. هدف از این تخصص، بهینه سازی عملکرد در موارد استفاده خاص مشتریان ما بود. از طریق تخصص، مشتریان به عملکرد زمینه‌ای در عملیات هوش مصنوعی خود دست می‌یابند و می‌توانند تأثیر اقتصادی آن را نظارت کنند، به طوری که ROI قابل اندازه‌گیری باقی می‌ماند و در طول زمان رشد می‌کند.

تخصص به تنهایی کافی نیست. حاکمیت به همان اندازه مهم است. برای ما، حاکمیت دو بعد را با هم ترکیب می‌کند: نحوه ساخت مدل و نحوه انتقال آن به مشتریان. ما یکپارچگی کامل زنجیره تامین را ارائه می‌دهیم و هر تصمیمی، از دریافت داده‌ها، قبل و بعد از آموزش، تا ارزیابی‌های نهایی را در نظر می‌گیریم. ما شفافیت را ارائه می کنیم. مشتریان آزادی کامل در استقرار و ایمنی مالکیت معنوی دارند، بنابراین انطباق به عنوان یک ویژگی ارثی مدل است.

ما Kolibri را برای عملکرد در طیف گسترده‌ای از بخش‌ها با توجه به زبان خاص حوزه، واقعیت‌های نظارتی و رویه‌ای آن‌ها بهینه کردیم. اندازه کوچک و کارآمد آن به مشتریان ما انعطاف‌پذیری می‌دهد تا آن را بدون ارسال داده‌های داخلی به سرویس‌های استنتاج شخص ثالث به طور کارآمد در محل اجرا کنند. نورافکن در این بخش، قابلیت‌های مدل را معرفی می‌کند، قبل از اینکه آنها را در بخش نحوه ساخت Kolibri در سرعت بالا توضیح دهیم.

با Kolibri، ما با استفاده از 3B پارامتر فعال از مجموع 78B، مبادله بین قابلیت مدل و هزینه های استقرار را بهینه می کنیم. Kolibri برای کیفیت در مقابل هزینه خدمات، هم برای انگلیسی و هم برای آلمانی، در مرز پارتو قرار دارد. مرز پارتو مفهومی از علم اقتصاد است که بهترین ترکیب قابل دستیابی از دو هدف را نشان می دهد، جایی که بهبود در یکی به معنای کنار گذاشتن برخی از اهداف دیگر است. هیچ یک از مدل های مقایسه شده کیفیت بیشتری را با هزینه سرویس یکسان یا همان کیفیت را با هزینه کمتر ارائه نمی دهد.

کولیبری در کارهای ریاضی، کدنویسی، زمین‌سازی و کارهای طولانی، مدل‌هایی را با چهار برابر تعداد پارامترهای فعال خود، مانند Nemotron 3 Super، مطابقت می‌دهد.

معیارهای عمومی نمی توانند نیازهای بخش تخصصی را برآورده کنند، بنابراین ما مجموعه های ارزیابی داخلی خود را برای موارد عمودی که برای مشتریان ما مهم است، مانند بخش عمومی آلمان، هوانوردی، تولید و صنعت خودرو توسعه دادیم. هر مجموعه مهارت‌ها، گردش کار و موارد لبه مورد نیاز در این بخش‌ها را منعکس می‌کند، و محیط‌های آموزشی مصنوعی جفتی به ما اجازه می‌دهد تا Kolibri را در برابر این ارزیابی‌ها بدون آموزش در مورد داده‌های مشتری بهبود دهیم. در بخش عملکرد متنی بیشتر بخوانید.

پاسخ هایی که در اسناد شما مستقر هستند. ما کولیبری را با داده های ممتنع و با پروتکل مرلین-آرتور خود آموزش دادیم. در نتیجه، زمانی که پاسخ در متن نیست، آموزش داده می‌شود که بگوید «نمی‌دانم». مشتریان ما برای این ویژگی ارزش قائل هستند و درخواست می کنند، بنابراین ما به طور مداوم دقت پرهیز را پیگیری و تأیید می کنیم. ما جزئیات بیشتری را در بخش Grounding ارائه می دهیم.

مدل بومی آلمانی و انگلیسی. ما یک توکنایزر آلمانی/انگلیسی دوزبانه ایجاد کردیم و بر روی گنجاندن داده‌های آلی آلمانی در طول فرآیند آموزش مدل تمرکز کردیم، به طوری که 21.3٪ از نشانه‌های پیش‌آموزشی آلمانی هستند. ما از ترجمه کم استفاده کردیم (6٪ در کل)، زیرا متن ترجمه شده اثر انگشت فرهنگی زبان مبدأ خود را دارد. نتیجه مدلی است که از نظر طراحی دو زبانه است، نه یک مدل انگلیسی که مقداری آلمانی خوانده باشد. در بخش داده‌های پیش‌آموزشی آلمانی و توکن‌سازهای تخصصی بیشتر بخوانید.

ما Kolibri را با قانون هوش مصنوعی اتحادیه اروپا، آیین‌نامه عملکرد هوش مصنوعی همه‌منظوره و GDPR از ابتدا در ذهن ساختیم، و قانون کپی رایت تمرکز کار ما بر فناوری قابل اعتماد است.

ما در مورد وزن مدل خود و در مورد تنظیم داده های آموزشی خود شفاف هستیم، به طوری که تصمیمات پشت توسعه قابل مشاهده است. از طریق ردیابی های استدلالی آن، توضیح می شود که چگونه مدل به یک پاسخ خاص رسیده است. با پروتکل مرلین-آرتور ما، مدل قابل اعتماد است: کولیبری از پاسخ دادن خودداری می کند زمانی که زمینه پاسخی را پشتیبانی نمی کند.

تیم‌های ما این مدل را در آلمان ساختند، آن را در زیرساخت‌ها در آلمان و فنلاند، تحت قوانین اروپا و آلمان، بدون کنترل خارجی، آموزش دادند. ما مالک کل خط لوله، از مدیریت داده، قبل و بعد از آموزش، تا بهینه سازی در کارخانه مدل خود هستیم. این کنترل خط لوله پایان به انتها ما زیربنای حاکمیت مدل است. کنترل همچنین به مشتریان ما منتقل می‌شود و اندازه کوچک Kolibri به آنها آزادی کامل در استقرار می‌دهد و از تلاش‌های استدلال قابل کنترل برای مبادله هزینه و تأخیر در برابر کیفیت پاسخ پشتیبانی می‌کند.

کارخانه مدل ما پاسخ ما به سرعت تکرار است، که زمان لازم را از دانستن خطای یک مدل به آموزش مدلی که بهتر انجام می دهد به حداقل می رساند. ما خط لوله آموزشی را به صورت کد پیاده‌سازی کردیم، به طوری که آموخته‌های تیم ما به جای اسکریپت‌ها و یادداشت‌های پراکنده، در یک دستور آموزشی نسخه‌سازی شده قرار گرفت. در اینجا چیزی است که بین Kolibri Origin و Kolibri به نظر می رسد.

کار روی خط لوله در ژانویه آغاز شد. پنج ماه و صدها دور ابلیشن بعد، کولیبری اوریجین پیش تمرینی را در مقیاس هدف در 11 ژوئن به پایان رساند. کولیبری در 11 سپتامبر به پایان رسید. در سه ماه بین این دو تاریخ، ما از پارامترهای 30B به 78B، از یک پنجره زمینه 65k-token به حداکثر 1M و از 7.5T توکن آموزشی به 20T رسیدیم. برای به دست آوردن آن 20T، خط لوله بیش از 200T توکن داده خام را پردازش کرد، فیلتر کرد، کپی برداری کرد و آن را به چیزی که در واقع آموزش داده بودیم تنظیم کرد.

ما طراحی توجه را تغییر دادیم، تعداد کارشناسان را سه برابر کردیم، پراکندگی را افزایش دادیم، الگوریتم مسیریابی را جایگزین کردیم، داده‌های پس از آموزش خود را بهبود دادیم، تعداد وظایف محیطی را بیش از دو برابر کردیم و به مدل آموزش دادیم تا در چهار سطح تلاش مختلف استدلال کند. هر دو مدل تعداد مشابهی از پارامترها را در هر توکن فعال نگه داشته اند، با این حال Kolibri به لطف کار تیم کارایی ما، سریعتر از Kolibri Origin تمرین می کند.

چیزی که این امکان را فراهم کرد خط لوله آموزشی ما است، تلاشی برای تبدیل توسعه مدل در سطح تحقیق به یک زیرساخت کاملا خودکار آماده تولید برای طراحی و آموزش مدل‌های زبان بزرگ. پایگاه کد خط لوله ما توسط همه به اشتراک گذاشته شد. هر تغییر کد پیشنهادی باعث اجرای یک مدل کوچک سرتاسری می شود. آموزش، ارزیابی، برای پیدا کردن اینکه آیا چیزی در عرض چند دقیقه شکسته است. اجراهای ما گردش‌های کاری GitHub Actions هستند و بازتولید آن به معنای بررسی یک commit است. ما از خط لوله برای آموزش اصلی و صدها ابلیشن استفاده کردیم تا معماری‌ها و تصمیمات ترکیبی داده‌هایمان را بگیریم.

پست‌های بازرسی آموزشی تقریبا هر ساعت فرود می‌آیند و خط لوله به طور خودکار آنها را بر اساس دانش انگلیسی و آلمانی، ریاضیات، کد، دستورالعمل‌ها، استفاده از ابزار، زمینه طولانی، ایمنی، پرهیز از توهم و زمین‌گیری ارزیابی می‌کند. ما می‌توانیم به جای اینکه بفهمیم مدل در پایان چگونه ظاهر می‌شود، قابلیت‌ها را هر روز تماشا کنیم. خود اجرا بهتر از چیزی که انتظار داشتیم دوام آورد. در طی 21 روز پیش‌آموزش کولیبری، 38 وقفه برنامه‌ریزی نشده، تقریبا یک مورد در هر 10000 ساعت GPU، به دلیل نقص سخت‌افزار یا قطع شدن زمان اتصال ایجاد شد.

آنها به طور خودکار توسط خط لوله بدون مداخله دستی اداره می شدند. این خوشه به طور خودکار کار(های) آموزشی را در مجموعه متفاوتی از گره ها مجددا راه اندازی کرد و آموزش از یک ایست بازرسی حداکثر 250 قدم به عقب برداشته شد.

دسترسی به کل خط لوله، با پست های بازرسی در دسترس همه، به این معنی است که هر تیمی می تواند به جای یک مرحله از یک خط مونتاژ، دارای یک قابلیت پایان به انتها باشد. یک تیم توانایی زمین‌سازی Kolibri را به عنوان یک قطعه کار آموزش داده و ارزیابی کردند که به طور یکپارچه در مدل کلی ادغام می‌شود.

با این حال، رسیدن به اینجا یک پیاده روی خطی نبود. تلو تلو خوردیم. ما قبل از آموزش Kolibri Origin را پس از چند تریلیون توکن متوقف کردیم و آن را از ابتدا مجددا راه اندازی کردیم، زیرا یک باگ درهم ریختگی داده را شناسایی کردیم که از آزمایش ما فرار کرد. ما ابلیشن‌ها را اجرا کردیم، تصمیم‌هایی گرفتیم، فقط برای یافتن یک اشکال یا خطا در پیکربندی پس از آن، و ما را مجبور به اجرای مجدد برخی از آزمایش‌ها کردیم. در کنار تجربه خودمان، معماری‌های پیشرفته، بهترین شیوه‌ها و آخرین پیشرفت‌های تحقیقاتی در LLM را دنبال کردیم. این آموخته‌های انباشته منجر به بهبود در فرآیندها و نرده‌های محافظ در خط لوله ما شد.

با نگاهی به دلتای بین Kolibri Origin و Kolibri، بهبود قابل توجه است، اما این مسیر آسان نیز است: پارامترهای بیشتر، داده‌های بیشتر، خانواده معماری به خوبی درک شده، و همچنان در مقیاس کوچک. همانطور که در حال فکر کردن به افزایش مقیاس هستیم، خوشحالیم که با چالش هایی در پایه خود روبرو می شویم. اما بادوام ترین چیزی که امسال ساختیم خط لوله نیست، تیمی با توانایی اثبات شده برای ساخت، آموزش پس از آموزش و ارسال LLM از داده های خام با سرعت بالا است.

Kolibri دارای 78B پارامتر کل است که 2.5 برابر بیشتر از Kolibri Origin با ~3B پارامتر فعال است. در آزمایش‌های ما، افزایش اندازه مدل ما از 32B به 123B منجر به بهبود عملکرد همیشه شد. با این حال، اندازه بزرگتر با هزینه های آموزشی و سرویس دهی بیشتر همراه بود. دومی باعث تصمیم گیری شد: 123B می تواند تنها 3 پرس و جوی کاربر 256k توکن با زمینه طولانی را در دو H100 انجام دهد، در حالی که 78B 18 درخواست همزمان را مدیریت می کند و 28٪ سریعتر رمزگشایی می کند. ما از 384 متخصص کوچکتر به جای متخصصان عریض کمتر استفاده کردیم، زیرا آنها در آزمایشات ما عملکرد بهتری داشتند.

ما همان استدلال اول کارایی را برای توجه به کار بردیم. از مجموع 50 لایه، تنها 10 لایه زمینه کامل را پردازش می کنند، در حالی که 40 لایه باقی مانده از یک پنجره متمرکز با 512 توکن استفاده می کنند. این امر محاسبات رمزگشایی و حافظه را بدون توجه به طول زمینه در آن لایه‌ها محدود نگه می‌دارد. افزایش بهره وری هم برای خدمت به مدل آموزش دیده و هم آموزش در طول RL پس از آموزش، که بر مقادیر عظیمی از استنتاج متکی است، سود می برد.

ما Kolibri را بر روی 768 GPU B200 در سه مرحله آموزش دادیم: 20T توکن پیش‌آموزشی با طول توالی 16k در 21 روز، 3.44T توکن در اواسط آموزش در 64k و 200B توکن انطباق با زمینه طولانی در 256k. این تقریبا 24T توکن در مجموع است، تقریبا سه برابر آنچه Kolibri Origin مصرف کرده است. آلمانی بیش از یک پنجم ترکیب قبل از تمرین، حدود 4.3T توکن، در مقابل تقریبا 62% انگلیسی و 14% کد را به خود اختصاص داده است. در مقایسه با قبل از آموزش، داده‌های میانی آموزش مجموعه‌ای بسیار انتخابی‌تر از مجموعه داده‌های انتخاب‌شده است که به سمت استدلال، حل مسئله، کد و داده‌های عاملی وزن می‌شوند.

برای زمینه طولانی، به جای آموزش به اسناد طولانی به تنهایی، که تمایل به فرسایش مهارت‌های کسب‌شده قبل از آن را دارد، ما اسناد طولانی را با داده‌های آموزشی با کیفیت بالا در مرحله قبل در هم آمیختیم. برای ترکیب با زمینه طولانی، اسناد طولانی مصنوعی را حذف کردیم تا از افزایش مصنوعی معیارهایی مانند RULER جلوگیری کنیم.

ما با Muon بهینه سازی کردیم، همانطور که برای Kolibri Origin انجام دادیم. ما تمرکز ویژه‌ای بر پایداری تمرین کردیم و در نتیجه یک تمرین تمرینی قوی و بدون هیچ گونه تلفات برای هر یک از مدل‌ها انجام شد. با کولیبری برای مسیریابی بین متخصصین در حین آموزش، متعادل سازی کمیت دقیق را معرفی می کنیم. متعادل‌سازی چندک در Kimi K3 معرفی شد، جایی که کمیک جهانی از روی هیستوگرام تخمین زده می‌شود، زیرا یک محاسبه دقیق برای برقراری ارتباط بسیار گران در نظر گرفته می‌شود. ما نشان می‌دهیم که می‌توان آن را دقیقا با هزینه ثابت مستقل از اندازه دسته محاسبه کرد، و اینکه دقت هم تعادل بار و هم کیفیت مدل را بهبود می‌بخشد.

پس از آموزش در دو مرحله انجام شد. مرحله اول تنظیم دقیق نظارت شده برای آموزش توانایی استدلال اصلی مدل و نحوه تعامل در یک چت است، و به دنبال آن یادگیری تقویتی در مقیاس بزرگ برای آموزش مدل برای استدلال در مجموعه متنوعی از وظایف افق طولانی است. ما یک خط لوله برای هر دوی این مراحل ساختیم که به ما اجازه داد کنترل دقیقی بر رفتار مدل اعمال کنیم.

برای SFT مجموعا ۱۷۴ میلیارد توکن داده مصنوعی تولید کردیم که برای کیفیت فیلتر کردیم و با نسخه‌های فیلترشده مجموعه داده‌های منبع باز دارای مجوز مجاز ترکیب کردیم تا ترکیب آموزشی با کیفیت بالا از ۲۶۸ میلیارد توکن به دست آوریم. برای یادگیری تقویتی، ما در مجموعه وسیعی از محیط‌ها آموزش دیدیم که شامل بیش از 1.2 میلیون وظیفه تنظیم‌شده در حوزه‌های متنوعی مانند استدلال کد و ریاضی، وظایف عاملی، دنبال کردن دستورالعمل، پاسخ به سؤال، فراخوانی ابزار و موارد دیگر بود.

ما پایگاه کد آموزشی داخلی خود را برای کارایی بالا و استفاده از آموزش ناهمزمان بهینه کردیم، که در آن داده‌های آموزشی را در محیط‌های خود با استفاده از مدل فعلی به موازات آموزش مدل بر روی داده‌های از قبل تولید شده تولید می‌کنیم.

در هر دو مرحله، ما به مدل آموزش دادیم که در سطوح مختلف تلاش (هیچ، کم، متوسط، زیاد) استدلال کند، به این معنی که کاربر می‌تواند روی مقدار محاسباتی که مدل باید برای یافتن راه‌حلی برای کار در دست سرمایه‌گذاری کند، کنترل کند. این به مشتریان ما اجازه می دهد تا هزینه و سرعت استنباط را با کیفیت پاسخ نهایی مقایسه کنند.

از آزمایش‌هایمان بر روی مدل‌های پراکسی کوچک، متوجه شدیم که آموزش با حدود 20 درصد داده‌های آلمانی منجر به نتایج بهینه می‌شود، به این معنی که ما باید توکن‌های آلمانی 4T را پیدا کنیم تا مدل خود را در افق 20T آموزش دهیم. مجموعه داده‌های آلمانی باز کمک می‌کنند، اما به اندازه کافی فاصله دارند: پس از حذف مجدد و فیلتر کردن، ما با 390B توکن آلمانی باقی ماندیم که خیلی از هدفمان فاصله داشت.

همانطور که در Sauerkraut، Not Burgers بحث کردیم، توانایی آلمانی باید از متون آلمانی با کیفیت بالا باشد. اتکای شدید به ترجمه های ماشینی به دلیل اشتباهات ظریف ترجمه و فقدان زمینه فرهنگی معتبر آلمانی به نتایج ضعیف منجر می شود. شکاف توکن را به سه روش مختلف بسته ایم.

اولین مورد این بود که خودمان آلمانی را از Common Crawl انتخاب کنیم. ما یک خط لوله تخصصی برای داده های آلمانی ساختیم. آلمانی انگلیسی نیست و داده های آلمانی را نمی توان مانند داده های انگلیسی فیلتر کرد: ما مجبور شدیم پارامترهای فیلتر را برای زبان آلمانی دوباره تنظیم کنیم. یک فیلتر معمولی در خط لوله داده زبان، حذف اسناد با کلمات طولانی بسیار زیاد است، اما نثر اداری آلمانی معمولا از حد انگلیسی در طول میانگین کلمه فراتر می رود، بنابراین تنظیمات استاندارد بی سر و صدا ثبتی را که مدیریت دولتی در آن می نویسد حذف می کند.

پس از تنظیم مجدد، خط لوله آلمانی ما 1.3T توکن منحصر به فرد از وب آلی آلمانی را به ما داد.

دوم این بود که اسناد آلمانی را که قبلا داشتیم، بازنویسی کنیم. یک LLM یک سند آلمانی ارگانیک را به سبک مدخل دایره المعارف، گفتگوی پرسش و پاسخ یا متنی بازنویسی می کند و محتوای آن را حفظ می کند. این واقعیت‌های یکسان را در چندین شکل سطحی به مدل می‌آموزد و اطلاعات موجود در داده‌های کمیاب را چند برابر می‌کند، و عملیاتی متفاوت از ترجمه است: منبع آلمانی است، بنابراین موضوع و پیوند فرهنگی آلمانی می‌ماند: صدراعظم، نه رئیس‌جمهور. دانش جدید زیادی اضافه نمی کند، بلکه عبارات جدیدی از دانش که قبلا در مجموعه وجود داشت، اضافه نمی کند.

بازنویسی حدود 1T توکن منحصربه‌فرد به ما داد و آن را به بزرگترین منبع آلمانی در مدل تبدیل کرد.

سومی ترجمه بود و ما فقط در اصل کلیبری از آن استفاده کردیم. ترجمه انگلیسی به آلمانی زمانی کار می کند که مدل، اعلان ها و تکه تکه ها با دقت انتخاب شوند، اما دو مشکل دارد. خروجی همچنان می‌تواند ترجمه‌ای، ترجمه تحت اللفظی اصطلاحات را نشان دهد: "ایمن رانندگی کن!" می شود "Fahre sicher!" به جای "Komm gut an!". مهمتر از آن، بافت فرهنگی ترجمه نمی شود. مجموعه‌ای که از انگلیسی ترجمه شده است، توزیع جغرافیایی، جمعیتی و سازمانی وب انگلیسی را به ارث می‌برد، بنابراین مدلی که بر روی آن آموزش داده شده است درباره جهانی که آمریکایی به نظر می‌رسد آلمانی صحبت می‌کند.

در پایان آلمانی به عنوان یک استخر منحصر به فرد با توکن 2.4T وارد کولیبری شد، 80 درصد آن توسط ما و 20 درصد از مجموعه داده های باز تولید شده است، و مدل آن را در 21.3 درصد از توکن های قبل از آموزش، تقریبا 4.3T در طول نمونه برداری 20T مشاهده کرد. هر توکن آلمانی به طور متوسط ​​1.8 بار دیده شد، در محدوده چهار دوره گذشته که تکرار آن نتیجه نمی دهد. حدود 85 درصد از مدل آلمانی خوانده شده متن وب است، یا ارگانیک یا بازنویسی شده از ارگانیک. مابقی اسناد نظارتی - رویه‌های پارلمانی، متون قانونی و سایر داده‌های موجود در حوزه عمومی - و آن سهم کوچک ترجمه شده است.

ما یک توکنایزر دوزبانه انگلیسی-آلمانی ساختیم که بر روی مجموعه داده های قبل از آموزش هر مدل آموزش دیده و تخصصی کردیم. به دلیل سهم آلمانی 21 درصدی در داده‌های ما، زبان آلمانی را بهتر از سایر مدل‌های SOTA فشرده می‌کند. این منجر به استنتاج کارآمدتر (توکن های کمتر) به حداقل رساندن هزینه ها و کوتاه شدن زمان پاسخ شد. ما یک روش جدید برای آموزش توکن سازها، UniBPE، معرفی می کنیم که مورفولوژی زبان ها را بهتر از رویکردهای موجود، به ویژه ساختار ترکیبی آلمانی، بدون به خطر انداختن کارایی توکن انگلیسی، رعایت می کند.

دو رویکرد پیشرو برای آموزش توکن سازها BPE و Unigram هستند. ما این دو را با هم ترکیب می کنیم، رویکرد BPE از پایین به بالا را حفظ می کنیم و از هدف آموزشی Unigram برای انتخاب ادغام برای افزودن به واژگان استفاده می کنیم. با واژگان 128k آموزش داده شده در مجموعه داده های انگلیسی/آلمانی ما، این به طور قابل ملاحظه ای توکن سازی را بهبود می بخشد.

دادگاه اجتماعی فدرال Bundessozialgerichtes (جنسی)

حدس زدن پاداش های ارزیابی و آموزش متداول LLM: یک حدس شانسی برای رسیدن به پاسخ صحیح دارد، در حالی که ممتنع هیچ شانسی ندارد. بنابراین، مدل‌ها یاد می‌گیرند که با هر آنچه که دارند، پاسخ دهند، حتی اگر ورودی آنها اطلاعات کافی برای پاسخگویی را ارائه نکند. درخواست از یک مدل برای ارائه نقل‌قول‌ها اغلب به همین دلیل نتیجه معکوس می‌دهد: مدل‌ها به سادگی می‌توانند برای توجیه پاسخی بی‌اساس، منابعی را که به نظر می‌آیند قابل قبول هستند، توهم ایجاد کنند.

برای یک مشتری تنظیم‌شده، مدلی که می‌داند خودداری کند، تفاوت بین خلبان و استقرار است. ما گفتن «نمی‌دانم» را به‌عنوان یک قابلیت مدل مهم در نظر می‌گیریم و (1) اقدامات اختصاصی زمین و ضد توهم را توسعه و پیگیری می‌کنیم و (2) از روش‌های آموزشی اختصاصی برای بهبود این قابلیت پرهیز استفاده و توسعه می‌دهیم.

در طول آموزش، از نمونه داده های آموزشی استفاده می کنیم که پاسخ صحیح «نمی دانم» است. در حالی که تنظیم دقیق برای پرهیز در صنعت در حال افزایش است، نمونه‌های منفی با کیفیت بالا به سختی یافت می‌شوند، به خصوص در جایی که مشتریان ما به آن‌ها نیاز دارند، در مناطق عمودی باریک که همه داده‌ها کمیاب است. بنابراین، ما همچنین با روش مرلین-آرتور خود آموزش می‌دهیم، که در داخل توسعه داده شده و به تفصیل در پست وبلاگ ما توضیح داده شده است، که با استفاده خودکار از نقاط ضعف مدل در هر مرحله آموزشی، کمبود داده را حل می‌کند و نمونه‌های منفی مصنوعی را از اسناد موجود تولید می‌کند.

این تمرین به بازی با سه بازیکن تبدیل می شود. آرتور مدلی است که ما آموزش می دهیم و می فرستیم. مرلین یک زمینه سند موجود را می گیرد، یک متن جدید ایجاد می کند که احتمال پاسخ صحیح آرتور را افزایش می دهد. مورگانا با حذف شواهد مربوطه از سند، نقطه داده جدیدی ایجاد می کند و سعی می کند آرتور را به یک توهم بکشاند.

آرتور نمی داند با کدام یک روبرو است، بنابراین استراتژی معتبر او این است که سؤال و زمینه را با دقت بخواند تا بتواند در زمینه مرلین پاسخ دهد، در حالی که تشخیص می دهد که خودداری پاسخ کاملا لازم برای بافت ویرایش شده مورگانا است - نادرست کردن هر حدس، حتی یک حدس خوش شانس.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Kolibri Has Landed: A Sovereign Open-Weight Model

Article URL: https://aleph-alpha.com/en/blog/kolibri-has-landed-a-sovereign-open-weight-model/ Comments URL: https://news.ycombinator.com/item?id=49942706 Points: 234 # Comments: 39

همه‌ی اخبار فناوری