پرش به محتوای اصلی

نمایش HN: Mini-AGI – مدل یادگیری مستمر پویا که روی 8 گیگابایت VRAM آموزش دیده است

هکرنیوز۱۴۰۵ شهریور ۳۰, دوشنبه، ساعت ۰۸:۱۲حدود 3 دقیقه مطالعه

متاسفم برای نام پرمدعا، می دانم، می دانم.. فقط شامل تمام قطعاتی است که می خواهم یک مدل AGI داشته باشم، و نمی توانم وسوسه را تحمل کنم. قبل از پرتاب سنگ به سمت من، لطفا یک نگاه به Readme بیندازید و امیدوارم کمی روحیه شما را پوشش دهد. بنابراین، اول از همه کار می کند و شما می توانید نمونه کل آموزش را در اینجا ببینید:…

متاسفم برای نام پرمدعا، می دانم، می دانم.. فقط شامل تمام قطعاتی است که می خواهم یک مدل AGI داشته باشم، و نمی توانم وسوسه را تحمل کنم. قبل از پرتاب سنگ به سمت من، لطفا یک نگاه به Readme بیندازید و امیدوارم کمی روحیه شما را پوشش دهد. بنابراین، اول از همه کار می کند و شما می توانید نمونه کل آموزش را در اینجا ببینید: https://raw.githubusercontent.com/volotat/mini-AGI/refs/head... این نمودار قانون مقیاس بندی است که من تا کنون دارم، و بسیار امیدوارکننده به نظر می رسد: https://github.com/volotat/mini-AGI/blob/main/assets/scaling...

این مدل با نارضایتی عمیق من ساخته شد، بنابراین ما واقعا نمی‌توانیم حتی مدل‌های نسبتا بزرگ (مقیاس 1B+) را روی سخت‌افزار مصرف‌کننده آموزش دهیم. ما می‌توانیم آنها را به طور قطع استنباط و تنظیم کنیم، اما من می‌خواهم بر آنچه که مدل در طول دوره آموزشی می‌بیند، کنترل کامل داشته باشم، بنابراین کاملا با علایق من و نه برخی از شرکت‌ها هماهنگ است. مدتی در حال فکر کردن به آن بودم و به دو ایده جالب رسیدم که فکر می‌کردم ارزش دنبال کردن را دارد: وزارت دفاع با متخصصان زیادی که در حین آموزش مدل به آن اضافه می‌شود و از آن حذف می‌شود، که در آن تنها زیرمجموعه کوچکی از متخصصان در واقع در هر بخش مورد استفاده قرار می‌گیرند.

آموزش لحظه ar + دسته 1 بر روی یک جریان پیوسته از داده ها. اول به ما اجازه می دهد که از نظر تعداد پارامترها فقط با فضای دیسک محدود شویم و کارشناسان بارگذاری و بارگیری را فقط در صورت نیاز به آنها محدود کنیم. دومی (اگر مشخص شود و مشخص شود که قابل انجام است) به ما امکان می دهد با ظرفیت VRAM کوچک از دور خارج شویم زیرا نیازی به ذخیره دسته های تصادفی بزرگ و گرادیان های مربوط به آنها نداریم. من با کلود شروع به طوفان فکری کردم و بعد از مدتی رویکردی را پیدا کردیم که به نظر امیدوارکننده بود، و کم کم، چند هفته می گذرد و شما می توانید نتایج را خودتان ببینید. بدیهی است که انجام دادم

از هوش مصنوعی در فرآیند ساخت این پروژه استفاده کنید و مطمئن هستم که انجام چنین کاری بدون آن برای من کاملا غیرممکن است، بنابراین امیدوارم بیش از حد قابل توجیه باشد. این مدل هنوز روی اولین مجموعه کاراکتری 7.8B که من برای آموزش انتخاب کرده‌ام اجرا می‌کند، بنابراین وزن‌ها هنوز تمام نشده‌اند، و حدود دو هفته صبر می‌کنیم تا با سرعت خواندن فعلی پخته شوند. و بله، این مدل فقط قسمت‌های پیوسته درهم از مجموعه داده را می‌خواند، که هر کدام با 32 هزار کاراکتر طول هر کدام به عنوان یک جریان واحد است.

همانطور که من یا شما انجام می دهیم. به نظر می رسد راه اندازی بسیار ساده است، بنابراین می توانید پروژه را شبیه سازی کنید، آن را اجرا کنید و همه چیز را برای خودتان مشاهده کنید. با تشکر از توجه شما

آدرس نظرات: https://news.ycombinator.com/item?id=49783133

امتیاز: 210

# نظرات: 43

خواندن متن کامل در هکرنیوزبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Show HN: Mini-AGI – Dynamic continual learning model trained on 8GB VRAM

Sorry for the pretentious name, I know, I know.. It just contains all the pieces I would like to see a AGI model to have, and I can't stand the temptation. Before throwing rocks at me, please take a glance at the Readme, and I hope it will cover your mood a little bit. So, first of all it does work and you can see the sample from the whole training run here:…

همه‌ی اخبار فناوری