پرش به محتوای اصلی

Kolibri یک LLM با وزن باز از Aleph Alpha برای آلمانی و انگلیسی است

هکرنیوز۱۴۰۵ مهر ۱۱, شنبه، ساعت ۱۴:۱۳حدود 12 دقیقه مطالعه

آدرس مقاله: https://tej.as/blog/aleph-alpha-kolibri آدرس نظرات: https://news.ycombinator.com/item?id=49943034 امتیاز: 312 # نظرات: 128

Kolibri یک مدل زبان بزرگ با وزن باز (LLM) از Aleph Alpha برای آلمانی و انگلیسی است: ترکیبی از متخصصان با 78 میلیارد پارامتر که فقط از 3.5 میلیارد از آنها برای هر نشانه ای که می خواند یا می نویسد استفاده می کند. در 3 اکتبر 2026 تحت مجوز Apache 2.0 منتشر شد، وزنه ها روی Hugging Face هستند و از ابتدا در زیرساخت های آلمان و فنلاند آموزش دیدند. (کلیبری به معنای مرغ مگس خوار آلمانی است، که برای مدلی که کل ترفندش سبک بودن است، زیبا است.)

من در آلمان زندگی می‌کنم، و در SmashingConf نیویورک در سال 2024، آنچه را که در ایالات متحده شنیده بودم، وقتی گفتم در کجا مستقر هستم، به اتاق گفتم: «شما تنظیم می‌کنید، شما نوآوری نمی‌کنید». شنیدن آن دردناک بود، و چیزی که در آن صحنه آرزو می‌کردم، «تعادل درست بین نوآوری و مقررات پیرامون حریم خصوصی داده‌ها، نظارت بر داده‌ها، محدودیت‌های زیست‌محیطی و نیازهای انرژی» بود. Kolibri یک پاسخ کاملا مستقیم به آن است: یک تیم آلمانی آن را با در نظر گرفتن قانون هوش مصنوعی اتحادیه اروپا "از پایه" ساخته است، و در ارزیابی خود Aleph Alpha بالاتر از هر مدل مقایسه شده در اندازه خود در هر دو زبان امتیاز می گیرد.

تبریک بزرگ به همه کسانی که در الف آلفا آن را ساختند، دوست خوبم مایکل هافمن در میان آنها!

این پست در مورد چگونگی کارکرد Kolibri، کجا قوی است، کجا نیست، چگونه آن را اجرا کند، و چه زمانی انتخاب مناسب است. همه چیز در اینجا از گزارش فنی 189 صفحه‌ای الف آلفا، کارت مدل و پست راه‌اندازی آن‌ها، به‌علاوه یک آزمایش که روی توکنایزر آن انجام دادم، می‌آید.

الف آلفا کولیبری را حاکم می نامد و در پست راه اندازی آنها این به معنای 2 چیز است. اولین مورد نحوه ساخت آن است: "تیم ها این مدل را در آلمان ساختند، آن را در زیرساخت ها در آلمان و فنلاند، تحت قوانین اروپا و آلمان، بدون کنترل خارجی، آموزش دادند." دوم چیزی است که مشتریان دریافت می‌کنند: «آزادی کامل در استقرار و ایمنی مالکیت معنوی، بنابراین انطباق به عنوان یک دارایی ارثی است». به عبارت ساده، یک وزارتخانه یا یک تامین‌کننده خودرو می‌تواند آن را روی سرورهای خود اجرا کند، در حالی که داده‌های آن هرگز از ساختمان خارج نمی‌شوند، و هیچ‌کس نمی‌تواند مدل زیر آن را تغییر داده یا خاموش کند.

الف آلفا همچنین آئین نامه عملکرد عمومی هوش مصنوعی (GPAI) اتحادیه اروپا را امضا کرده است.

Sovereign به این معنا نیست که چیزی از خارج از اروپا وارد نشده است، و کارت مدل خودش این را می گوید: متن وب انگلیسی با Gemma 4 Google، آلمانی با Mistral-NeMo و داده های برچسب Qwen3-32B برای فیلترهای کیفیت، بازنویسی شد. آنها سپس داده‌های آموزشی را برای سوگیری سیاسی که چنین مدل‌هایی می‌توانند داشته باشند، فیلتر کردند، که در خود مدل‌های باز چینی اندازه‌گیری شده‌اند.

Kolibri 6 ایده است که روی هم چیده شده اند و هر کدام برای ارزان تر، طولانی تر یا صادق تر کردن آلمانی وجود دارد.

در یک مدل معمولی (متراکم)، هر نشانه از هر پارامتر عبور می کند. در ترکیبی از متخصصان (MoE)، هر لایه دارای انبوهی از زیرشبکه های کوچک به نام متخصصان و یک مسیریاب است که برای هر توکن تعدادی از آنها را انتخاب می کند. Kolibri دارای 50 لایه است که هر کدام دارای 384 متخصص به اضافه 1 کارشناس مشترک است که هر توکن از آن عبور می کند، و روتر آن هر توکن را به 6 مورد از 384 می فرستد. به این ترتیب 78.1 میلیارد پارامتر به 3.46 میلیارد کار واقعی در هر توکن تبدیل می شود.

در سال 2024 یک سخنرانی به نام چرا مدل‌های زبانی کوچک آینده هستند، ارائه دادم و برای «مدل‌های زبان کوچک‌تر با پارامترهای کمتر و مکان‌های کمتری که ممکن است مشکلاتی پیش بیاید که نیاز به محاسبه کمتری دارند» بحث کردم. قیاس من دکتری بود که همه کتاب‌های پزشکی دنیا را علیه یک متخصص هماتولوژی خوانده است: به سراغ اولی مبتلا به عارضه خونی بروید و «ممکن است درست متوجه نشوند چون زیاد می‌دانند». ترکیبی از متخصصان، بیمارستانی پر از متخصص را در یک مدل قرار می دهد و روتر، مسئول پذیرش است که هر توکن را به سمت راست 6 می فرستد.

اگرچه قیاس در 2 جا شکسته می شود. کارشناسان موضوعات منظمی مانند «قانون آلمان» نیستند: وقتی محققان به مدل‌های وزارت معارف نگاه می‌کنند، بیشتر متخصصانی را برای الگوهای نشانه‌ها، مانند علائم نقطه‌گذاری یا اسم‌های خاص، پیدا می‌کنند، نه موضوعاتی که شخص انتخاب می‌کند. و بیمارستان باید تمام 384 متخصص را روی کارمندان نگه دارد، حتی اگر شما فقط 6 نفر را ببینید، بنابراین کولیبری مانند یک مدل پارامتر 3.5 میلیارد محاسبه می کند اما به حافظه یک پارامتر 78 میلیاردی نیاز دارد. کارت مدل به وضوح می گوید: "مدل کامل باید در حافظه نگه داشته شود، حتی اگر تنها بخشی از آن در هر زمان فعال باشد."

یک مدل حروف یا کلمات را نمی‌خواند، نشانه‌ها را می‌خواند: تکه‌هایی از متن از یک واژگان ثابت، که زمانی انتخاب می‌شود که توکنایزر آموزش داده شود. آلمانی کلمات را به هم چسبانده و کلمات مرکب طولانی را به هم می‌چسباند و یک توکنایزر که بیشتر از زبان انگلیسی یاد می‌گیرد، آنها را تکه تکه می‌کند. در اینجا نام آلمانی دادگاه قانون اساسی فدرال است که با استفاده از توکنایزر GPT-4o و GPT-5 (o200k_base، از طریق tiktoken OpenAI) و توسط Kolibri's تقسیم شده است:

توکنایزر Kolibri دارای 128000 توکن است که با الگوریتم جدیدی آموزش داده شده Aleph Alpha به نام UniBPE: ادغام از پایین به بالا رمزگذاری جفت بایت (BPE) را حفظ می کند و هر ادغام را با یک قانون امتیازدهی متفاوت (هدف Unigram) انتخاب می کند که به نحوه ساخت آلمانی کلمات احترام می گذارد. این گزارش می‌گوید که نسبت به توکنایزر GPT-5 به 11.2 درصد کمتر توکن‌های کمتری برای متن آلمانی نیاز دارد، که بهترین مورد از 9 مورد دیگری است که آنها اندازه‌گیری کردند.

من می‌خواستم آن را برای خودم ببینم، بنابراین 6 توکنایزر را بر روی تمام قانون اساسی جمهوری فدرال آلمان، قانون اساسی آلمان (185 کیلوبایت متن قانونی بسیار آلمانی) و ترجمه رسمی انگلیسی آن اجرا کردم:

در آلمانی قانونی، کولیبری به 15 درصد توکن کمتری نسبت به توکنایزر GPT-5، حتی بیشتر از 11.2 درصد خود الف آلفا نیاز داشت و در انگلیسی هم با آن گره خورد. وحشی. نشانه‌های کمتر به معنای گام‌های کمتری برای خواندن یا نوشتن همان متن آلمانی است و تعداد بیشتر آلمانی در پنجره زمینه یکسان قرار می‌گیرد. (من هر کدام را با tokenizer.json خود از طریق کتابخانه توکنیزرهای Hugging Face شمردم، به جز o200k_base که با tiktoken شمارش کردم.)

40 لایه از 50 لایه Kolibri از توجه پنجره کشویی استفاده می کنند: هر توکن فقط به 512 توکن قبل از خود نگاه می کند. هر لایه 5 به همه چیز قبل از خود نگاه می کند. این مانند خواندن یک قرارداد طولانی است در حالی که بیشتر به جمله ای که در آن هستید توجه می کنید، و هر چند صفحه یکبار به همه آن فکر می کنید، و این چیزی است که زمینه 1 میلیون رمزی را مقرون به صرفه نگه می دارد.

یک جزئیات هوشمندانه نیز در آن وجود دارد. فقط لایه‌های پنجره کشویی می‌دانند که یک توکن کجا می‌نشیند (از طریق جاسازی‌های موقعیت چرخشی)، و لایه‌های توجه کامل نمی‌دانند، بنابراین زمینه از 262144 توکنی که روی آن‌ها آموزش داده شده بود، بدون هیچ گونه ترفند موقعیت اضافی، امتداد می‌یابد. Aleph Alpha آن را تا 1,048,576 تأیید کرد.

در سخنرانی خود باز کردن قفل ارزش با هوش مصنوعی امروز، بافت محدود را یکی از «سه مشکل بزرگ» هوش مصنوعی مولد، در کنار توهم و قطع دانش نامیدم، و کولیبری همه 3 مورد را دنبال می‌کند. در آزمون 1 میلیون توکن، در آزمون زمینه طولانی RULER، مدل پایه کولیبری در مقابل 57.5 Q57.5 مدل پایه QB3.

مدل‌های استدلالی قبل از پاسخ دادن فکر می‌کنند و حتی در صورت درخواست آلمانی بیشتر به زبان انگلیسی فکر می‌کنند. الف آلفا در این مورد در 24 سپتامبر پست کرد و آن را با عنوان Through the Valley of Tears نوشت: آنها حدود 800000 مثال استدلال آلمانی تولید کردند و دریافتند که داده های استدلال آلمانی کمی بدتر از هیچ است. نمره ریاضی مدل آلمانی آنها از 70.2 به 48.3 کاهش یافت، زیرا افکار آلمانی آن مدام در دایره می چرخید و هرگز تمام نمی شد، و تنها با داده های آلمانی بسیار بیشتر (به 67.3) برگشت.

کولیبری چیزهای بیشتری بدست آورد. به زبان آلمانی در دستورات آلمانی استدلال می کند، و نمرات ریاضی آلمانی آن بهترین مدل با حدود 3 میلیارد پارامتر فعال است: 87.5 در آزمون ریاضی دعوتی آمریکا (AIME) 2025 در آلمان، در مقابل 84.4 برای بهترین بعدی، NVIDIA's Nemotron 3 Nano.

توهم شماره 1 از سه مورد بزرگ من بود، و راه حل در آن سخنرانی بازیابی نسل افزوده (RAG) بود: شما اطلاعات خوب و معتبر را جستجو می کنید و آن را در اعلان قرار می دهید. RAG تنها در صورتی کار می‌کند که مدل بپذیرد که اسناد پاسخی نداشته باشند، و این همان چیزی است که Aleph Alpha با روش خود، پروتکل Merlin-Arthur برای آن آموزش داده است.

مانند یک بازی با 3 بازیکن عمل می کند. آرتور مدل است و با پنهان کردن بخش‌هایی از سند پشتیبان، سؤالی برای او مطرح می‌شود. مرلین بخش‌هایی را پنهان می‌کند تا پاسخ صحیح راحت‌تر پیدا شود و آرتور برای پاسخ دادن به آن‌ها آموزش دیده است. مورگانا شواهدی را که پاسخ به آنها بستگی دارد پنهان می کند و آرتور آموزش می بیند که بگوید نمی داند. آرتور هرگز نمی‌داند با کدام یک از این دو روبروست، بنابراین تنها راه برای برنده شدن این است که واقعا بررسی کنید که آیا شواهدی که در مقابل او قرار دارد، پاسخی را تأیید می‌کند یا خیر.

نشان می دهد. در آزمون علم همه‌جانبه تحلیل مصنوعی، زمانی که کولیبری پاسخی نمی‌دانست، 44 درصد از مواقع به‌جای اینکه پاسخی را بسازد، پاسخی نمی‌دانست (یا پاسخی جزئی می‌دهد). Qwen3.5 35B-A3B در 11.1% مواقع و GPT-OSS 120B 23.7% این کار را انجام دادند. از بین تمام مدل‌های ترکیبی از متخصصان Aleph Alpha که مقایسه شدند، تنها Qwen3.6 35B-A3B با 56.7% بهتر عمل کرد.

هر درخواستی می‌تواند reasoning_efort را روی none، low، medium یا high قرار دهد، بنابراین یک جستجوی سریع بلافاصله پاسخ می‌دهد و یک سؤال سخت از همان مدل در همان سرور، فکر طولانی می‌کند.

اینها ردیف‌هایی هستند که Kolibri مدل‌های باز با اندازه خود را در ارزیابی الف آلفا رهبری می‌کند، که هر مدل را از طریق تنظیمات مشابه با تنظیمات نمونه‌گیری که سازندگانش توصیه می‌کنند اجرا می‌کند:

ریاضی برجسته است: در AIME 2025 و 2026 به زبان انگلیسی، هر مدل MoE را در مقایسه، از جمله مدل‌هایی با 12 میلیارد پارامتر فعال، شکست می‌دهد، و تنها Qwen3.8 27B متراکم امتیاز بیشتری کسب می‌کند. ردیف اسناد شرکت شامل 5 تست Aleph Alpha است که از کارهای مشتری مانند در نیمه هادی ها، بخش عمومی آلمان، هوافضا، تامین کننده خودرو و درایوهای صنعتی ساخته شده است، اسناد و مدارک مورد بررسی قرار گرفته و سوالاتی که مدل هرگز در آموزش ندیده است.

Aleph Alpha ضعیف‌ترین ردیف‌های خود را درست در کنار بهترین‌هایش در کارت مدل منتشر می‌کند، بنابراین آنها در اینجا هستند:

شما به 78 گیگابایت حافظه گرافیکی نیاز دارید: 2 دستگاه NVIDIA A100 یا H100 با حداقل 80 گیگابایت، یا یک H200، B200 یا B300. من هنوز خود مدل را اجرا نکرده‌ام، زیرا به یک GPU مرکز داده نیاز دارد و تا کنون کسی آن را میزبانی نکرده است، بنابراین این مستقیما از کارت مدل است. ابتدا افزونه ای که نسخه vLLM را که پشتیبانی می کند نصب می کند:

این به شما یک سرور سازگار با OpenAI می دهد، بنابراین هر مشتری OpenAI با آن صحبت می کند، و تلاش استدلال از طریق قالب چت انجام می شود:

کارت مدل دما=1.0، top_p=0.97 و top_k=128، و زمینه‌های حداکثر 262144 توکن را برای هر چیزی که به تأخیر حساس است توصیه می‌کند. برای یک میلیون کامل، آن را با 2 پرچم دیگر سرو کنید:

Kolibri زمانی انتخاب می‌شود که متن آلمانی و سخت‌افزار شما هر دو مهم باشند: یک مقام دولتی، یک بانک، یک سازنده یا یک تامین‌کننده هوافضا که باید اسناد خود را در خانه نگه دارد، می‌خواهد پاسخ‌هایی را به زبان آلمانی که دلیل آن به زبان آلمانی است، بشنود و ترجیح می‌دهد «نمی‌دانم» را بشنود تا یک پاسخ اشتباه مطمئن. RAG در اسناد طولانی آلمانی (قوانین، قراردادها، دستورالعمل‌ها) به تمام نقاط قوت عمل می‌کند: توکنایزر، زمینه 1 میلیون توکن و ممتنع.

این همان پروژه‌ای است که من در حال حاضر روی آن کار می‌کنم، با پروفسور دکتر هاینریش اودبرت، که سرپرستی نورولوژی در پردیس بنجامین فرانکلین، یکی از بیمارستان‌های Charité در برلین است. امروزه یک بیمار با شکایت عصبی نزد پزشک عمومی خود (GP) می رود و پزشک عمومی باید آنها را ببیند که برای یک مطب پرمشغله بسیار سخت است. در چیزی که ما می سازیم، بیمار در مطب پزشک عمومی پشت کامپیوتر می نشیند، یک آواتار هوش مصنوعی او را از طریق یک باتری آزمایش می برد و میزان فوریت علائم آنها را ارزیابی می کند: فورا به یک متخصص ارجاع شود، یا می توانند کمی صبر کنند.

مکالمات به زبان آلمانی است، آنها در مورد سلامت مردم هستند، و مدل باید در جایی اجرا شود که ما آن را کنترل می کنیم، بنابراین ما به استفاده از Kolibri برای آن فکر می کنیم.

کدام یک برای مدارک شما بهتر است، بیمارستان متخصصانی مانند کولیبری یا یک مدل کوچک آموزش دیده برای یک کار، تنها زمانی نشان می دهد که هر دو را روی داده های خود امتحان کنید. جابجایی مدل تحت یک عامل بدون شکستن آن چیزی است که کارگاه من در مورد عوامل هوش مصنوعی قابل اعتماد پوشش می دهد: نرده های محافظ و هر مدلی که زیر آن قرار دارد، دوباره کار می کند.

Kolibri یک مدل زبان بزرگ وزن باز از Aleph Alpha برای آلمانی و انگلیسی است که در 3 اکتبر 2026 تحت مجوز Apache 2.0 منتشر شد. این ترکیبی از متخصصان با 78 میلیارد پارامتر است که حدود 3.5 میلیارد از آن روی هر توکن کار می‌کنند، تا 1 میلیون توکن زمینه را می‌خواند، و از ابتدا در زیرساخت‌های آلمان و فنلاند آموزش دیده است.

یک مدل هوش مصنوعی مستقل، مدلی است که یک سازمان می تواند به طور کامل بر اساس زیرساختی که کنترل می کند، اجرا کند، طبق قوانینی که باید از آن پیروی کند، بنابراین داده های آن در دستانش باقی می ماند و هیچ کس دیگری نمی تواند مدل را تغییر دهد یا خاموش کند. Aleph Alpha این کلمه را به دو معنا برای Kolibri به کار می‌برد: اینکه مدل چگونه ساخته شده است (توسط تیم‌هایی در آلمان، در زیرساخت‌ها در آلمان و فنلاند، بر اساس قوانین اروپا و آلمان) و چگونه به دست مشتریان می‌رسد (وزن‌های باز که می‌توانند در هر جایی اجرا کنند).

وزنه های Kolibri تحت مجوز Apache 2.0 در Hugging Face باز هستند، بنابراین هر کسی می تواند آنها را دانلود کند، اجرا کند، آنها را تنظیم کند و محصولاتی بر روی آنها بسازد. مجوز شامل وزن ها و فایل های پیکربندی می شود و Aleph Alpha حقوق کد و روش های آموزشی خود را حفظ می کند.

Kolibri برای وزن خود به حدود 78 گیگابایت حافظه گرافیکی نیاز دارد، بنابراین حداقل 2 پردازنده گرافیکی NVIDIA A100 یا H100 با هر کدام 80 گیگابایت یا 1 H200، B200 یا B300 است. فقط حدود 3.5 میلیارد پارامتر روی هر توکن کار می کند، اما همه 78 میلیارد باید در حافظه بنشینند.

در میان مدل‌های ترکیبی باز که از چند میلیارد پارامتر در هر توکن استفاده می‌کنند، Kolibri بالاترین امتیاز آلمانی را در ارزیابی خود Aleph Alpha دارد: 70.8، در مقابل 69.8 برای Qwen3.5 35B-A3B، که دارای 35 میلیارد پارامتر با 3 میلیارد فعال (A3B) در هر توکن است. Qwen3.8 27B متراکم با 79.9 امتیاز بالاتری کسب می کند، اما برای هر توکن تقریبا 8 برابر پارامترها استفاده می کند.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Kolibri is an open-weight LLM from Aleph Alpha for German and English

Article URL: https://tej.as/blog/aleph-alpha-kolibri Comments URL: https://news.ycombinator.com/item?id=49943034 Points: 312 # Comments: 128

همه‌ی اخبار فناوری