پرش به محتوای اصلی

Laya نسخه منبع باز Jev

هکرنیوز۱۴۰۵ شهریور ۲۸, شنبه، ساعت ۱۴:۱۶حدود 4 دقیقه مطالعه

آدرس مقاله: https://laya.convaiinnovations.com/ آدرس نظرات: https://news.ycombinator.com/item?id=49765348 امتیاز: 316 # نظرات: 62

همه در هوش مصنوعی در حال حاضر در مورد نوع جدیدی از مدل صحبت می‌کنند: معماری که خود رگرسیون نیست، متن تولید نمی‌کند و پیش‌بینی‌های احتمالی سریع بر روی طرحواره‌های ساخت‌یافته را ارائه می‌دهد.

دیدن تبلیغات آنلاین هم اعتباربخش و هم عمیقا ناامیدکننده است.

من به معنای واقعی کلمه یک سال قبل در مارس 2025 روی آن کار کردم. ماه‌ها کار سخت، عرق ریختن و شب‌های بی‌خوابی را صرف ساختن آن کردم، یک مقاله arXiv منتشر کردم (arXiv:2503.23303)، وزن‌های مدل را در Hugging Face منتشر کردم ( sales-conversion-model-reinf-learning)، و بسته داده‌های Pyetsations-Reinf-Learning را منتشر کردم. کل رویکرد را در Reddit ارسال کرد (بحث r/LocalLLaMA).

سپس در سپتامبر 2025، مقاله دومی را منتشر کردم (arXiv:2510.01237)، که چارچوب تصمیمات مبتنی بر طرحواره را با هدایت یادگیری تقویتی رسمی کرد. مغز راهنما در سیستم من همیشه یادگیری تقویتی بود، نه فقط یک مدل تعبیه شده یا یک LLM خودبازگشت.

و سپس در سپتامبر 2026، یک آزمایشگاه مرزی با بودجه خوب به نام TypeSafe AI (که توسط Diogo Almeida، یکی از مخترعان ChatGPT در OpenAI تأسیس شد) Jev را راه اندازی کرد. آنها دقیقا همان مفهوم تصمیم گیری غیرخودپسندانه را پیشنهاد کردند که گویی یک پیشرفت علمی کاملا جدید است. به جز اینکه بدون مقالات فنی، بدون وزنه باز و با مجموعه داده های آموزشی باز صفر راه اندازی شدند.

به جای تلخ ماندن، تصمیم گرفتم همه چیزهایی را که یاد گرفتم بردارم، تمام محدودیت های معماری رویکرد قدیمی را برطرف کنم و یک خانواده مدل تصمیم گیری سیستم 1 کاملا باز و افقی بسازم: Laya.

و از آنجایی که ما آن را به درستی بر روی رمزگذارهای دوطرفه ساخته‌ایم، مدل‌های ما در 32.8 میلی‌ثانیه بر روی یک GPU واحد (7.2 میلی‌ثانیه/سوال دسته‌ای) اجرا می‌شوند، که 6 تا 8 برابر سریع‌تر از Jev است، با پشتیبانی کامل از بیش از 100 زبان، هزینه اشتراک API صفر، و وزن 100% Apache.2 open-source.

هر خط لوله مدرن هوش مصنوعی یک گلوگاه بزرگ دارد: ما از LLM های مولد برای تصمیم گیری های انعکاسی ساده استفاده می کنیم.

هنگامی که یک بلیط پشتیبانی مشتری می رسد، یا ایمیلی به صندوق ورودی شما می رسد، یا کاربر درخواستی را به API شما ارسال می کند، معمولا فقط باید به سؤالات ساده و ساختاریافته پاسخ دهید:

فراخوانی LLM مولد 8B، 70B یا مرزی برای این کار بیش از حد است. شما بین 500 میلی‌ثانیه تا 2000 میلی‌ثانیه صبر می‌کنید تا توکن‌ها پخش شوند، پول واقعی را صرف استنتاج می‌کنید و سپس باید تجزیه‌کننده‌های regex یا JSON بنویسید تا یک برچسب تمیز از متن آزاد استخراج کنید. بدتر از همه، LLM ها عاشق توهم زدن و ایجاد اعتماد به نفس کاذب هستند. هنگامی که یک LLM "اطمینان: 0.95" را خروجی می دهد، فقط نشانه هایی را پیش بینی می کند که مطمئن به نظر می رسند. در پشت آن کالیبراسیون ریاضی صفر وجود دارد.

ما به مدلی نیاز داشتیم که مانند سیستم 1 مغز انسان کار کند: تصمیم‌های بازتابی فوری با احتمالات درست و کالیبره‌شده، تنها 30 تا 35 میلی‌ثانیه بر روی سخت‌افزار کالای استاندارد.

لایا سوالات تایپ شده را در هر حالت (متن خام، ایمیل، بلیط یا سند JSON) در یک پاس رو به جلو ارزیابی می کند. بر سه اصل اولیه تکیه دارد:

از آنجا که فضای خروجی صرفا از احتمالات و اعداد تشکیل شده است، مدل هرگز متن تولید نمی کند، نمی تواند توهم ایجاد کند، و نقض طرحواره یا JSON ناقص از نظر فیزیکی غیرممکن است.

یک مدل نمی تواند برای هر کار و زبانی بهینه باشد. ما سه ایست بازرسی تخصصی را منتشر کردیم که اکنون تحت یک مرکز مخزن در Hugging Face ادغام شده‌اند:

به جای اینکه کاربران را مجبور به مدیریت سه مخزن جداگانه یا دانلود 2.5 گیگابایت وزن ترکیبی کنند، مخزن اصلی convaiinnovations/laya هر سه را باندل می کند. با استفاده از Hugging Face's allow_patterns، SDK Laya فقط زیرپوشه خاص درخواستی را دانلود می کند:

یکی از جالب‌ترین یافته‌های جستجوی 51 زبانی ما در معیار MASSIVE (20 گزینه، پایه تصادفی = 0.050) این بود که چگونه مدل‌های انگلیسی خارج از خط لاتین شکست می‌خورند.

واژگان 50000 توکن انگلیسی ModernBERT-large BPE به سادگی الفبای غیر لاتین را خرد می کند:

این درس مهم است: وقتی مدل نمی تواند اسکریپت ورودی را بخواند، اعتماد به نفس خود هیچ هشداری نمی دهد. در 51 زبان، میانگین اطمینان نقطه بازرسی انگلیسی هرگز به زیر 0.885 نمی رسد، صرف نظر از اینکه دقت آن 82٪ یا 0٪ باشد.

بنابراین، راه‌اندازی اعتماد نمی‌تواند از شما محافظت کند. تصمیم در مورد استفاده از مدل باید قبل از پاس رو به جلو گرفته شود.

لایا شامل یک روتر داخلی است که اسکریپت های یونیکد متن ورودی را در 22 الفبا (دواناگاری، CJK هان، سیریلیک، عربی، عبری، تامیل، تایلندی و غیره) بررسی می کند و توزیع کلمات توقف لاتین را تجزیه و تحلیل می کند:

در مقایسه با یک پاس رو به جلو 33 میلی ثانیه، سربار مسیریابی ناچیز است (<2٪). و با روتر (preload=True)، همه مدل‌های مورد نیاز در VRAM/RAM ساکن می‌مانند، و جریمه تعویض سرد 7 تا 10 ثانیه زمانی که ترافیک بین زبان‌ها تغییر می‌کند کاملا حذف می‌شود.

ما Laya را مستقیما در برابر TypeSafe Jev در مجموعه داده‌های عمومی و معیارهای استاندارد محک زدیم. هر عدد لایا اندازه گیری می شود. اعداد Jev توسط مطالعات مستقل شخص ثالث (AbdelStark، nibzard) و TypeSafe AI منتشر می شوند.

در 9 گردش کار سازمانی ارزیابی شده، Laya کیفیت تصمیم گیری آماده تولید را نشان می دهد:

بسیاری از اعلامیه های هوش مصنوعی نقاط ضعف خود را پنهان می کنند. ما به صداقت مهندسی اعتقاد داریم:

در اینجا یک مثال کامل از اجرای تصمیمات چند طرحواره با مسیریابی خودکار زبان آورده شده است:

از مقاله مارس 2025 arXiv تا امروز، یک سال تحقیق طول کشید، اما درک اصلی همچنان باقی است: هر مشکل هوش مصنوعی به یک ربات چت خود رگرسیون نیاز ندارد.

برای طبقه‌بندی با حجم بالا، نرده‌های محافظ، مسیریابی و تریاژ، یک مدل تصمیم‌گیری دو جهته زیر 35 میلی‌ثانیه آموزش‌دیده با RLCD، 7.8 برابر سریع‌تر از جایگزین‌های اختصاصی، توهمات صفر، مسیریابی زبان جهانی و امتیازهای اطمینان صادقانه‌ای را ارائه می‌دهد که در واقع می‌توانید در کد تولید منشعب شوید.

و بهتر از همه این است که 100٪ منبع باز برای کل جامعه است.

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Laya the open source version of Jev

Article URL: https://laya.convaiinnovations.com/ Comments URL: https://news.ycombinator.com/item?id=49765348 Points: 316 # Comments: 62

همه‌ی اخبار فناوری