Kolibri یک LLM با وزن باز از Aleph Alpha برای آلمانی و انگلیسی است
آدرس مقاله: https://tej.as/blog/aleph-alpha-kolibri آدرس نظرات: https://news.ycombinator.com/item?id=49943034 امتیاز: 312 # نظرات: 128
Kolibri یک مدل زبان بزرگ با وزن باز (LLM) از Aleph Alpha برای آلمانی و انگلیسی است: ترکیبی از متخصصان با 78 میلیارد پارامتر که فقط از 3.5 میلیارد از آنها برای هر نشانه ای که می خواند یا می نویسد استفاده می کند. در 3 اکتبر 2026 تحت مجوز Apache 2.0 منتشر شد، وزنه ها روی Hugging Face هستند و از ابتدا در زیرساخت های آلمان و فنلاند آموزش دیدند. (کلیبری به معنای مرغ مگس خوار آلمانی است، که برای مدلی که کل ترفندش سبک بودن است، زیبا است.)
من در آلمان زندگی میکنم، و در SmashingConf نیویورک در سال 2024، آنچه را که در ایالات متحده شنیده بودم، وقتی گفتم در کجا مستقر هستم، به اتاق گفتم: «شما تنظیم میکنید، شما نوآوری نمیکنید». شنیدن آن دردناک بود، و چیزی که در آن صحنه آرزو میکردم، «تعادل درست بین نوآوری و مقررات پیرامون حریم خصوصی دادهها، نظارت بر دادهها، محدودیتهای زیستمحیطی و نیازهای انرژی» بود. Kolibri یک پاسخ کاملا مستقیم به آن است: یک تیم آلمانی آن را با در نظر گرفتن قانون هوش مصنوعی اتحادیه اروپا "از پایه" ساخته است، و در ارزیابی خود Aleph Alpha بالاتر از هر مدل مقایسه شده در اندازه خود در هر دو زبان امتیاز می گیرد.
تبریک بزرگ به همه کسانی که در الف آلفا آن را ساختند، دوست خوبم مایکل هافمن در میان آنها!
این پست در مورد چگونگی کارکرد Kolibri، کجا قوی است، کجا نیست، چگونه آن را اجرا کند، و چه زمانی انتخاب مناسب است. همه چیز در اینجا از گزارش فنی 189 صفحهای الف آلفا، کارت مدل و پست راهاندازی آنها، بهعلاوه یک آزمایش که روی توکنایزر آن انجام دادم، میآید.
الف آلفا کولیبری را حاکم می نامد و در پست راه اندازی آنها این به معنای 2 چیز است. اولین مورد نحوه ساخت آن است: "تیم ها این مدل را در آلمان ساختند، آن را در زیرساخت ها در آلمان و فنلاند، تحت قوانین اروپا و آلمان، بدون کنترل خارجی، آموزش دادند." دوم چیزی است که مشتریان دریافت میکنند: «آزادی کامل در استقرار و ایمنی مالکیت معنوی، بنابراین انطباق به عنوان یک دارایی ارثی است». به عبارت ساده، یک وزارتخانه یا یک تامینکننده خودرو میتواند آن را روی سرورهای خود اجرا کند، در حالی که دادههای آن هرگز از ساختمان خارج نمیشوند، و هیچکس نمیتواند مدل زیر آن را تغییر داده یا خاموش کند.
الف آلفا همچنین آئین نامه عملکرد عمومی هوش مصنوعی (GPAI) اتحادیه اروپا را امضا کرده است.
Sovereign به این معنا نیست که چیزی از خارج از اروپا وارد نشده است، و کارت مدل خودش این را می گوید: متن وب انگلیسی با Gemma 4 Google، آلمانی با Mistral-NeMo و داده های برچسب Qwen3-32B برای فیلترهای کیفیت، بازنویسی شد. آنها سپس دادههای آموزشی را برای سوگیری سیاسی که چنین مدلهایی میتوانند داشته باشند، فیلتر کردند، که در خود مدلهای باز چینی اندازهگیری شدهاند.
Kolibri 6 ایده است که روی هم چیده شده اند و هر کدام برای ارزان تر، طولانی تر یا صادق تر کردن آلمانی وجود دارد.
در یک مدل معمولی (متراکم)، هر نشانه از هر پارامتر عبور می کند. در ترکیبی از متخصصان (MoE)، هر لایه دارای انبوهی از زیرشبکه های کوچک به نام متخصصان و یک مسیریاب است که برای هر توکن تعدادی از آنها را انتخاب می کند. Kolibri دارای 50 لایه است که هر کدام دارای 384 متخصص به اضافه 1 کارشناس مشترک است که هر توکن از آن عبور می کند، و روتر آن هر توکن را به 6 مورد از 384 می فرستد. به این ترتیب 78.1 میلیارد پارامتر به 3.46 میلیارد کار واقعی در هر توکن تبدیل می شود.
در سال 2024 یک سخنرانی به نام چرا مدلهای زبانی کوچک آینده هستند، ارائه دادم و برای «مدلهای زبان کوچکتر با پارامترهای کمتر و مکانهای کمتری که ممکن است مشکلاتی پیش بیاید که نیاز به محاسبه کمتری دارند» بحث کردم. قیاس من دکتری بود که همه کتابهای پزشکی دنیا را علیه یک متخصص هماتولوژی خوانده است: به سراغ اولی مبتلا به عارضه خونی بروید و «ممکن است درست متوجه نشوند چون زیاد میدانند». ترکیبی از متخصصان، بیمارستانی پر از متخصص را در یک مدل قرار می دهد و روتر، مسئول پذیرش است که هر توکن را به سمت راست 6 می فرستد.
اگرچه قیاس در 2 جا شکسته می شود. کارشناسان موضوعات منظمی مانند «قانون آلمان» نیستند: وقتی محققان به مدلهای وزارت معارف نگاه میکنند، بیشتر متخصصانی را برای الگوهای نشانهها، مانند علائم نقطهگذاری یا اسمهای خاص، پیدا میکنند، نه موضوعاتی که شخص انتخاب میکند. و بیمارستان باید تمام 384 متخصص را روی کارمندان نگه دارد، حتی اگر شما فقط 6 نفر را ببینید، بنابراین کولیبری مانند یک مدل پارامتر 3.5 میلیارد محاسبه می کند اما به حافظه یک پارامتر 78 میلیاردی نیاز دارد. کارت مدل به وضوح می گوید: "مدل کامل باید در حافظه نگه داشته شود، حتی اگر تنها بخشی از آن در هر زمان فعال باشد."
یک مدل حروف یا کلمات را نمیخواند، نشانهها را میخواند: تکههایی از متن از یک واژگان ثابت، که زمانی انتخاب میشود که توکنایزر آموزش داده شود. آلمانی کلمات را به هم چسبانده و کلمات مرکب طولانی را به هم میچسباند و یک توکنایزر که بیشتر از زبان انگلیسی یاد میگیرد، آنها را تکه تکه میکند. در اینجا نام آلمانی دادگاه قانون اساسی فدرال است که با استفاده از توکنایزر GPT-4o و GPT-5 (o200k_base، از طریق tiktoken OpenAI) و توسط Kolibri's تقسیم شده است:
توکنایزر Kolibri دارای 128000 توکن است که با الگوریتم جدیدی آموزش داده شده Aleph Alpha به نام UniBPE: ادغام از پایین به بالا رمزگذاری جفت بایت (BPE) را حفظ می کند و هر ادغام را با یک قانون امتیازدهی متفاوت (هدف Unigram) انتخاب می کند که به نحوه ساخت آلمانی کلمات احترام می گذارد. این گزارش میگوید که نسبت به توکنایزر GPT-5 به 11.2 درصد کمتر توکنهای کمتری برای متن آلمانی نیاز دارد، که بهترین مورد از 9 مورد دیگری است که آنها اندازهگیری کردند.
من میخواستم آن را برای خودم ببینم، بنابراین 6 توکنایزر را بر روی تمام قانون اساسی جمهوری فدرال آلمان، قانون اساسی آلمان (185 کیلوبایت متن قانونی بسیار آلمانی) و ترجمه رسمی انگلیسی آن اجرا کردم:
در آلمانی قانونی، کولیبری به 15 درصد توکن کمتری نسبت به توکنایزر GPT-5، حتی بیشتر از 11.2 درصد خود الف آلفا نیاز داشت و در انگلیسی هم با آن گره خورد. وحشی. نشانههای کمتر به معنای گامهای کمتری برای خواندن یا نوشتن همان متن آلمانی است و تعداد بیشتر آلمانی در پنجره زمینه یکسان قرار میگیرد. (من هر کدام را با tokenizer.json خود از طریق کتابخانه توکنیزرهای Hugging Face شمردم، به جز o200k_base که با tiktoken شمارش کردم.)
40 لایه از 50 لایه Kolibri از توجه پنجره کشویی استفاده می کنند: هر توکن فقط به 512 توکن قبل از خود نگاه می کند. هر لایه 5 به همه چیز قبل از خود نگاه می کند. این مانند خواندن یک قرارداد طولانی است در حالی که بیشتر به جمله ای که در آن هستید توجه می کنید، و هر چند صفحه یکبار به همه آن فکر می کنید، و این چیزی است که زمینه 1 میلیون رمزی را مقرون به صرفه نگه می دارد.
یک جزئیات هوشمندانه نیز در آن وجود دارد. فقط لایههای پنجره کشویی میدانند که یک توکن کجا مینشیند (از طریق جاسازیهای موقعیت چرخشی)، و لایههای توجه کامل نمیدانند، بنابراین زمینه از 262144 توکنی که روی آنها آموزش داده شده بود، بدون هیچ گونه ترفند موقعیت اضافی، امتداد مییابد. Aleph Alpha آن را تا 1,048,576 تأیید کرد.
در سخنرانی خود باز کردن قفل ارزش با هوش مصنوعی امروز، بافت محدود را یکی از «سه مشکل بزرگ» هوش مصنوعی مولد، در کنار توهم و قطع دانش نامیدم، و کولیبری همه 3 مورد را دنبال میکند. در آزمون 1 میلیون توکن، در آزمون زمینه طولانی RULER، مدل پایه کولیبری در مقابل 57.5 Q57.5 مدل پایه QB3.
مدلهای استدلالی قبل از پاسخ دادن فکر میکنند و حتی در صورت درخواست آلمانی بیشتر به زبان انگلیسی فکر میکنند. الف آلفا در این مورد در 24 سپتامبر پست کرد و آن را با عنوان Through the Valley of Tears نوشت: آنها حدود 800000 مثال استدلال آلمانی تولید کردند و دریافتند که داده های استدلال آلمانی کمی بدتر از هیچ است. نمره ریاضی مدل آلمانی آنها از 70.2 به 48.3 کاهش یافت، زیرا افکار آلمانی آن مدام در دایره می چرخید و هرگز تمام نمی شد، و تنها با داده های آلمانی بسیار بیشتر (به 67.3) برگشت.
کولیبری چیزهای بیشتری بدست آورد. به زبان آلمانی در دستورات آلمانی استدلال می کند، و نمرات ریاضی آلمانی آن بهترین مدل با حدود 3 میلیارد پارامتر فعال است: 87.5 در آزمون ریاضی دعوتی آمریکا (AIME) 2025 در آلمان، در مقابل 84.4 برای بهترین بعدی، NVIDIA's Nemotron 3 Nano.
توهم شماره 1 از سه مورد بزرگ من بود، و راه حل در آن سخنرانی بازیابی نسل افزوده (RAG) بود: شما اطلاعات خوب و معتبر را جستجو می کنید و آن را در اعلان قرار می دهید. RAG تنها در صورتی کار میکند که مدل بپذیرد که اسناد پاسخی نداشته باشند، و این همان چیزی است که Aleph Alpha با روش خود، پروتکل Merlin-Arthur برای آن آموزش داده است.
مانند یک بازی با 3 بازیکن عمل می کند. آرتور مدل است و با پنهان کردن بخشهایی از سند پشتیبان، سؤالی برای او مطرح میشود. مرلین بخشهایی را پنهان میکند تا پاسخ صحیح راحتتر پیدا شود و آرتور برای پاسخ دادن به آنها آموزش دیده است. مورگانا شواهدی را که پاسخ به آنها بستگی دارد پنهان می کند و آرتور آموزش می بیند که بگوید نمی داند. آرتور هرگز نمیداند با کدام یک از این دو روبروست، بنابراین تنها راه برای برنده شدن این است که واقعا بررسی کنید که آیا شواهدی که در مقابل او قرار دارد، پاسخی را تأیید میکند یا خیر.
نشان می دهد. در آزمون علم همهجانبه تحلیل مصنوعی، زمانی که کولیبری پاسخی نمیدانست، 44 درصد از مواقع بهجای اینکه پاسخی را بسازد، پاسخی نمیدانست (یا پاسخی جزئی میدهد). Qwen3.5 35B-A3B در 11.1% مواقع و GPT-OSS 120B 23.7% این کار را انجام دادند. از بین تمام مدلهای ترکیبی از متخصصان Aleph Alpha که مقایسه شدند، تنها Qwen3.6 35B-A3B با 56.7% بهتر عمل کرد.
هر درخواستی میتواند reasoning_efort را روی none، low، medium یا high قرار دهد، بنابراین یک جستجوی سریع بلافاصله پاسخ میدهد و یک سؤال سخت از همان مدل در همان سرور، فکر طولانی میکند.
اینها ردیفهایی هستند که Kolibri مدلهای باز با اندازه خود را در ارزیابی الف آلفا رهبری میکند، که هر مدل را از طریق تنظیمات مشابه با تنظیمات نمونهگیری که سازندگانش توصیه میکنند اجرا میکند:
ریاضی برجسته است: در AIME 2025 و 2026 به زبان انگلیسی، هر مدل MoE را در مقایسه، از جمله مدلهایی با 12 میلیارد پارامتر فعال، شکست میدهد، و تنها Qwen3.8 27B متراکم امتیاز بیشتری کسب میکند. ردیف اسناد شرکت شامل 5 تست Aleph Alpha است که از کارهای مشتری مانند در نیمه هادی ها، بخش عمومی آلمان، هوافضا، تامین کننده خودرو و درایوهای صنعتی ساخته شده است، اسناد و مدارک مورد بررسی قرار گرفته و سوالاتی که مدل هرگز در آموزش ندیده است.
Aleph Alpha ضعیفترین ردیفهای خود را درست در کنار بهترینهایش در کارت مدل منتشر میکند، بنابراین آنها در اینجا هستند:
شما به 78 گیگابایت حافظه گرافیکی نیاز دارید: 2 دستگاه NVIDIA A100 یا H100 با حداقل 80 گیگابایت، یا یک H200، B200 یا B300. من هنوز خود مدل را اجرا نکردهام، زیرا به یک GPU مرکز داده نیاز دارد و تا کنون کسی آن را میزبانی نکرده است، بنابراین این مستقیما از کارت مدل است. ابتدا افزونه ای که نسخه vLLM را که پشتیبانی می کند نصب می کند:
این به شما یک سرور سازگار با OpenAI می دهد، بنابراین هر مشتری OpenAI با آن صحبت می کند، و تلاش استدلال از طریق قالب چت انجام می شود:
کارت مدل دما=1.0، top_p=0.97 و top_k=128، و زمینههای حداکثر 262144 توکن را برای هر چیزی که به تأخیر حساس است توصیه میکند. برای یک میلیون کامل، آن را با 2 پرچم دیگر سرو کنید:
Kolibri زمانی انتخاب میشود که متن آلمانی و سختافزار شما هر دو مهم باشند: یک مقام دولتی، یک بانک، یک سازنده یا یک تامینکننده هوافضا که باید اسناد خود را در خانه نگه دارد، میخواهد پاسخهایی را به زبان آلمانی که دلیل آن به زبان آلمانی است، بشنود و ترجیح میدهد «نمیدانم» را بشنود تا یک پاسخ اشتباه مطمئن. RAG در اسناد طولانی آلمانی (قوانین، قراردادها، دستورالعملها) به تمام نقاط قوت عمل میکند: توکنایزر، زمینه 1 میلیون توکن و ممتنع.
این همان پروژهای است که من در حال حاضر روی آن کار میکنم، با پروفسور دکتر هاینریش اودبرت، که سرپرستی نورولوژی در پردیس بنجامین فرانکلین، یکی از بیمارستانهای Charité در برلین است. امروزه یک بیمار با شکایت عصبی نزد پزشک عمومی خود (GP) می رود و پزشک عمومی باید آنها را ببیند که برای یک مطب پرمشغله بسیار سخت است. در چیزی که ما می سازیم، بیمار در مطب پزشک عمومی پشت کامپیوتر می نشیند، یک آواتار هوش مصنوعی او را از طریق یک باتری آزمایش می برد و میزان فوریت علائم آنها را ارزیابی می کند: فورا به یک متخصص ارجاع شود، یا می توانند کمی صبر کنند.
مکالمات به زبان آلمانی است، آنها در مورد سلامت مردم هستند، و مدل باید در جایی اجرا شود که ما آن را کنترل می کنیم، بنابراین ما به استفاده از Kolibri برای آن فکر می کنیم.
کدام یک برای مدارک شما بهتر است، بیمارستان متخصصانی مانند کولیبری یا یک مدل کوچک آموزش دیده برای یک کار، تنها زمانی نشان می دهد که هر دو را روی داده های خود امتحان کنید. جابجایی مدل تحت یک عامل بدون شکستن آن چیزی است که کارگاه من در مورد عوامل هوش مصنوعی قابل اعتماد پوشش می دهد: نرده های محافظ و هر مدلی که زیر آن قرار دارد، دوباره کار می کند.
Kolibri یک مدل زبان بزرگ وزن باز از Aleph Alpha برای آلمانی و انگلیسی است که در 3 اکتبر 2026 تحت مجوز Apache 2.0 منتشر شد. این ترکیبی از متخصصان با 78 میلیارد پارامتر است که حدود 3.5 میلیارد از آن روی هر توکن کار میکنند، تا 1 میلیون توکن زمینه را میخواند، و از ابتدا در زیرساختهای آلمان و فنلاند آموزش دیده است.
یک مدل هوش مصنوعی مستقل، مدلی است که یک سازمان می تواند به طور کامل بر اساس زیرساختی که کنترل می کند، اجرا کند، طبق قوانینی که باید از آن پیروی کند، بنابراین داده های آن در دستانش باقی می ماند و هیچ کس دیگری نمی تواند مدل را تغییر دهد یا خاموش کند. Aleph Alpha این کلمه را به دو معنا برای Kolibri به کار میبرد: اینکه مدل چگونه ساخته شده است (توسط تیمهایی در آلمان، در زیرساختها در آلمان و فنلاند، بر اساس قوانین اروپا و آلمان) و چگونه به دست مشتریان میرسد (وزنهای باز که میتوانند در هر جایی اجرا کنند).
وزنه های Kolibri تحت مجوز Apache 2.0 در Hugging Face باز هستند، بنابراین هر کسی می تواند آنها را دانلود کند، اجرا کند، آنها را تنظیم کند و محصولاتی بر روی آنها بسازد. مجوز شامل وزن ها و فایل های پیکربندی می شود و Aleph Alpha حقوق کد و روش های آموزشی خود را حفظ می کند.
Kolibri برای وزن خود به حدود 78 گیگابایت حافظه گرافیکی نیاز دارد، بنابراین حداقل 2 پردازنده گرافیکی NVIDIA A100 یا H100 با هر کدام 80 گیگابایت یا 1 H200، B200 یا B300 است. فقط حدود 3.5 میلیارد پارامتر روی هر توکن کار می کند، اما همه 78 میلیارد باید در حافظه بنشینند.
در میان مدلهای ترکیبی باز که از چند میلیارد پارامتر در هر توکن استفاده میکنند، Kolibri بالاترین امتیاز آلمانی را در ارزیابی خود Aleph Alpha دارد: 70.8، در مقابل 69.8 برای Qwen3.5 35B-A3B، که دارای 35 میلیارد پارامتر با 3 میلیارد فعال (A3B) در هر توکن است. Qwen3.8 27B متراکم با 79.9 امتیاز بالاتری کسب می کند، اما برای هر توکن تقریبا 8 برابر پارامترها استفاده می کند.
متن اصلی (انگلیسی)
Kolibri is an open-weight LLM from Aleph Alpha for German and English
Article URL: https://tej.as/blog/aleph-alpha-kolibri Comments URL: https://news.ycombinator.com/item?id=49943034 Points: 312 # Comments: 128