Laya نسخه منبع باز Jev
آدرس مقاله: https://laya.convaiinnovations.com/ آدرس نظرات: https://news.ycombinator.com/item?id=49765348 امتیاز: 316 # نظرات: 62
همه در هوش مصنوعی در حال حاضر در مورد نوع جدیدی از مدل صحبت میکنند: معماری که خود رگرسیون نیست، متن تولید نمیکند و پیشبینیهای احتمالی سریع بر روی طرحوارههای ساختیافته را ارائه میدهد.
دیدن تبلیغات آنلاین هم اعتباربخش و هم عمیقا ناامیدکننده است.
من به معنای واقعی کلمه یک سال قبل در مارس 2025 روی آن کار کردم. ماهها کار سخت، عرق ریختن و شبهای بیخوابی را صرف ساختن آن کردم، یک مقاله arXiv منتشر کردم (arXiv:2503.23303)، وزنهای مدل را در Hugging Face منتشر کردم ( sales-conversion-model-reinf-learning)، و بسته دادههای Pyetsations-Reinf-Learning را منتشر کردم. کل رویکرد را در Reddit ارسال کرد (بحث r/LocalLLaMA).
سپس در سپتامبر 2025، مقاله دومی را منتشر کردم (arXiv:2510.01237)، که چارچوب تصمیمات مبتنی بر طرحواره را با هدایت یادگیری تقویتی رسمی کرد. مغز راهنما در سیستم من همیشه یادگیری تقویتی بود، نه فقط یک مدل تعبیه شده یا یک LLM خودبازگشت.
و سپس در سپتامبر 2026، یک آزمایشگاه مرزی با بودجه خوب به نام TypeSafe AI (که توسط Diogo Almeida، یکی از مخترعان ChatGPT در OpenAI تأسیس شد) Jev را راه اندازی کرد. آنها دقیقا همان مفهوم تصمیم گیری غیرخودپسندانه را پیشنهاد کردند که گویی یک پیشرفت علمی کاملا جدید است. به جز اینکه بدون مقالات فنی، بدون وزنه باز و با مجموعه داده های آموزشی باز صفر راه اندازی شدند.
به جای تلخ ماندن، تصمیم گرفتم همه چیزهایی را که یاد گرفتم بردارم، تمام محدودیت های معماری رویکرد قدیمی را برطرف کنم و یک خانواده مدل تصمیم گیری سیستم 1 کاملا باز و افقی بسازم: Laya.
و از آنجایی که ما آن را به درستی بر روی رمزگذارهای دوطرفه ساختهایم، مدلهای ما در 32.8 میلیثانیه بر روی یک GPU واحد (7.2 میلیثانیه/سوال دستهای) اجرا میشوند، که 6 تا 8 برابر سریعتر از Jev است، با پشتیبانی کامل از بیش از 100 زبان، هزینه اشتراک API صفر، و وزن 100% Apache.2 open-source.
هر خط لوله مدرن هوش مصنوعی یک گلوگاه بزرگ دارد: ما از LLM های مولد برای تصمیم گیری های انعکاسی ساده استفاده می کنیم.
هنگامی که یک بلیط پشتیبانی مشتری می رسد، یا ایمیلی به صندوق ورودی شما می رسد، یا کاربر درخواستی را به API شما ارسال می کند، معمولا فقط باید به سؤالات ساده و ساختاریافته پاسخ دهید:
فراخوانی LLM مولد 8B، 70B یا مرزی برای این کار بیش از حد است. شما بین 500 میلیثانیه تا 2000 میلیثانیه صبر میکنید تا توکنها پخش شوند، پول واقعی را صرف استنتاج میکنید و سپس باید تجزیهکنندههای regex یا JSON بنویسید تا یک برچسب تمیز از متن آزاد استخراج کنید. بدتر از همه، LLM ها عاشق توهم زدن و ایجاد اعتماد به نفس کاذب هستند. هنگامی که یک LLM "اطمینان: 0.95" را خروجی می دهد، فقط نشانه هایی را پیش بینی می کند که مطمئن به نظر می رسند. در پشت آن کالیبراسیون ریاضی صفر وجود دارد.
ما به مدلی نیاز داشتیم که مانند سیستم 1 مغز انسان کار کند: تصمیمهای بازتابی فوری با احتمالات درست و کالیبرهشده، تنها 30 تا 35 میلیثانیه بر روی سختافزار کالای استاندارد.
لایا سوالات تایپ شده را در هر حالت (متن خام، ایمیل، بلیط یا سند JSON) در یک پاس رو به جلو ارزیابی می کند. بر سه اصل اولیه تکیه دارد:
از آنجا که فضای خروجی صرفا از احتمالات و اعداد تشکیل شده است، مدل هرگز متن تولید نمی کند، نمی تواند توهم ایجاد کند، و نقض طرحواره یا JSON ناقص از نظر فیزیکی غیرممکن است.
یک مدل نمی تواند برای هر کار و زبانی بهینه باشد. ما سه ایست بازرسی تخصصی را منتشر کردیم که اکنون تحت یک مرکز مخزن در Hugging Face ادغام شدهاند:
به جای اینکه کاربران را مجبور به مدیریت سه مخزن جداگانه یا دانلود 2.5 گیگابایت وزن ترکیبی کنند، مخزن اصلی convaiinnovations/laya هر سه را باندل می کند. با استفاده از Hugging Face's allow_patterns، SDK Laya فقط زیرپوشه خاص درخواستی را دانلود می کند:
یکی از جالبترین یافتههای جستجوی 51 زبانی ما در معیار MASSIVE (20 گزینه، پایه تصادفی = 0.050) این بود که چگونه مدلهای انگلیسی خارج از خط لاتین شکست میخورند.
واژگان 50000 توکن انگلیسی ModernBERT-large BPE به سادگی الفبای غیر لاتین را خرد می کند:
این درس مهم است: وقتی مدل نمی تواند اسکریپت ورودی را بخواند، اعتماد به نفس خود هیچ هشداری نمی دهد. در 51 زبان، میانگین اطمینان نقطه بازرسی انگلیسی هرگز به زیر 0.885 نمی رسد، صرف نظر از اینکه دقت آن 82٪ یا 0٪ باشد.
بنابراین، راهاندازی اعتماد نمیتواند از شما محافظت کند. تصمیم در مورد استفاده از مدل باید قبل از پاس رو به جلو گرفته شود.
لایا شامل یک روتر داخلی است که اسکریپت های یونیکد متن ورودی را در 22 الفبا (دواناگاری، CJK هان، سیریلیک، عربی، عبری، تامیل، تایلندی و غیره) بررسی می کند و توزیع کلمات توقف لاتین را تجزیه و تحلیل می کند:
در مقایسه با یک پاس رو به جلو 33 میلی ثانیه، سربار مسیریابی ناچیز است (<2٪). و با روتر (preload=True)، همه مدلهای مورد نیاز در VRAM/RAM ساکن میمانند، و جریمه تعویض سرد 7 تا 10 ثانیه زمانی که ترافیک بین زبانها تغییر میکند کاملا حذف میشود.
ما Laya را مستقیما در برابر TypeSafe Jev در مجموعه دادههای عمومی و معیارهای استاندارد محک زدیم. هر عدد لایا اندازه گیری می شود. اعداد Jev توسط مطالعات مستقل شخص ثالث (AbdelStark، nibzard) و TypeSafe AI منتشر می شوند.
در 9 گردش کار سازمانی ارزیابی شده، Laya کیفیت تصمیم گیری آماده تولید را نشان می دهد:
بسیاری از اعلامیه های هوش مصنوعی نقاط ضعف خود را پنهان می کنند. ما به صداقت مهندسی اعتقاد داریم:
در اینجا یک مثال کامل از اجرای تصمیمات چند طرحواره با مسیریابی خودکار زبان آورده شده است:
از مقاله مارس 2025 arXiv تا امروز، یک سال تحقیق طول کشید، اما درک اصلی همچنان باقی است: هر مشکل هوش مصنوعی به یک ربات چت خود رگرسیون نیاز ندارد.
برای طبقهبندی با حجم بالا، نردههای محافظ، مسیریابی و تریاژ، یک مدل تصمیمگیری دو جهته زیر 35 میلیثانیه آموزشدیده با RLCD، 7.8 برابر سریعتر از جایگزینهای اختصاصی، توهمات صفر، مسیریابی زبان جهانی و امتیازهای اطمینان صادقانهای را ارائه میدهد که در واقع میتوانید در کد تولید منشعب شوید.
و بهتر از همه این است که 100٪ منبع باز برای کل جامعه است.
متن اصلی (انگلیسی)
Laya the open source version of Jev
Article URL: https://laya.convaiinnovations.com/ Comments URL: https://news.ycombinator.com/item?id=49765348 Points: 316 # Comments: 62