لحظه هوش مصنوعی آفریقا فرا رسیده است - این مدل 1.5B که از ابتدا برای 12 زبان آفریقایی ساخته شده است، گوگل، متا و علی بابا را شکست می دهد در حالی که 8 برابر کوچکتر است.
MORENA یک مدل زبان آفریقایی 1.5B است که رقبای بزرگتر را در معیارها شکست می دهد در حالی که به قدرت محاسباتی کمتری نیاز دارد.
MORENA با وجود داشتن تنها 1.5 میلیارد پارامتر، 26 مدل آزمایش شده را شکست داد
مدل Vambo AI به طور خاص در اطراف زبان های آفریقایی از ابتدا ساخته شده است
MORENA نسبت به رقبای اصلی از نشانه های کمتری برای نمایش متن آفریقایی استفاده می کند Vambo AI MORENA را منتشر کرده است، یک مدل زبان پارامتر 1.5B که شامل 12 زبان رایج در سراسر آفریقا، به علاوه انگلیسی، فرانسوی و کد است.
توسعه دهندگان می گویند که در مدل سازی و ترجمه زبان آفریقایی از مدل های Google، Meta، Alibaba و HuggingFace پیشی می گیرد در حالی که تا 8 برابر کوچکتر است.
در یک معیار کلیدی، این LLM امتیاز 1.408 bpb را به دست آورد - بهترین مدل از 26 مدل آزمایش شده - که نزدیکترین رقیب خود را که پنج برابر پارامترهای بیشتری را حمل می کرد، در عین حال فقط 1.423 bpb کسب کرد، شکست داد.
آموزش بدون پایه وام گرفته شده
این مدل شامل Pidgin، Igbo، Yoruba، Hausa، Kiswahili، ChiShona، isiZulu، isiXhosa، Kinyarwanda، Setswana، آفریقایی، و isiNdebele نیجریه است.
اکثر پروژههایی که به این زبانها خدمت میکنند، به آموزش یک نوع لاما ادامه میدهند، که آنها را مجبور میکند واژگانی را برای زبان انگلیسی و متن برنامهنویسی حفظ کنند.
Vambo AI در عوض توکنایزر، مخلوط دادهها و فهرست زبان را قبل از شروع آموزش، پس از مقایسه چندین اندازه واژگان برای هزینه و کارایی، اصلاح کرد.
واژگان MORENA متن آفریقایی را با 1.39 برابر کمتر از Gemma 3 و 1.53 برابر کمتر از Llama 3.2 در متن های یکسان رمزگذاری می کند.
متن آفریقایی همچنان 0.249 توکن برای هر بایت در مقابل 0.234 برای انگلیسی، تقریبا 6 درصد بیشتر است، و تیم نمی تواند تفاوت را به طور کامل توضیح دهد.
نزدیکترین رقیب، Lugha-Llama-8B، یک نوع Llama 3.1 سازگار با آفریقا، امتیاز 1.423 bpb را کسب می کند و به MORENA در هشت زبان از 12 زبان شکست می خورد.
در مقایسه، سیستم 12B Gemma تقریبا 11 برابر محاسبه MORENA مصرف می کند در حالی که امتیاز ضعیف تری را در همان متن ایجاد می کند.
نسخه دستورالعمل چت تنظیم شده امتیاز 1.441 bpb را به دست می آورد که در مجموع از Lugha-Llama-8B عقب است، اما در پنج زبان مشترک در حالی که از حدود 20 درصد پارامترهای خود استفاده می کند، پیشرو است.
مدل دستورالعمل، پس از مشاهده سه ترجمه نمونه، انگلیسی را به پنج زبان از آفریقا با 45.8 chrF++، از نظر آماری با یک سیستم ترجمه اختصاصی، ارائه میکند.
یک مدل ترجمه بزرگتر را حدود 1.4 امتیاز دنبال می کند، در حالی که مدل های عمومی با اندازه مشابه معمولا در محدوده 9 تا 14 قرار می گیرند.
خانواده ای که بر اساس 22000 ساعت پردازنده گرافیکی ساخته شده است
MORENA از 251.7B توکن در حین پیش تمرین استفاده کرد و پس از آن 63B توکن دیگر در مرحله اواسط آموزش استفاده کرد.
طبق گزارشها، بیش از 22000 ساعت GPU A100 در طول توسعه مورد نیاز بود که منابع محاسباتی مرتبط با آن تقریبا 40000 دلار ارزش داشت.
به گفته توسعه دهندگان، این پروژه توسط UNDP، AIHub4SD و CINECA پشتیبانی می شود و منابع محاسباتی و سایر کمک ها را در طول توسعه ارائه می دهد.
این پروژه همچنین شامل نسخههای کوچکتر است، با نسخههای حاوی پارامترهای 0.5B و 0.2B در کنار مدل اصلی 1.5 میلیاردی.
بر اساس گزارش ها، انواع 0.5B بیش از هر سیستم خارجی تست شده در 11 زبان از 12 زبان تحت پوشش پروژه است.
نسخه 0.2B نانو برای بازیابی تشخیص گفتار، برنامه های کاربردی صفحه کلید و کارهای عادی سازی متن در نظر گرفته شده است.
این نسخه نانو همچنین برای هر بایت پردازش شده 58 برابر کمتر از Lugha-Llama-8B هزینه دارد و در هر ثانیه 104 توکن در یک پردازنده گرافیکی A100 تولید می کند.
ساختار سازگار با CPU این مدل نیز به صورت آفلاین بر روی لپتاپ اجرا میشود، که مناسب تنظیماتی است که دسترسی مطمئن به GPU تضمین نشده است.
این به توسعه دهندگان چندین اندازه مدل برای نیازهای محاسباتی مختلف می دهد، نه اینکه منحصرا به بزرگترین نسخه تکیه کنند.
MORENA همچنین از برنامههای مکالمه، ترجمه و اتصال به سایر ابزارهای هوش مصنوعی از طریق انتشار متمرکز بر دستورالعمل پشتیبانی میکند.
از طریق Glitch Front
متن اصلی (انگلیسی)
Africa's AI moment has arrived — this 1.5B model built from scratch for 12 African languages beats Google, Meta, and Alibaba while being 8x smaller
MORENA is a 1.5B African language model that beats larger rivals on benchmarks while requiring substantially less computing power.