نمایش HN: Mini-AGI – مدل یادگیری مستمر پویا که روی 8 گیگابایت VRAM آموزش دیده است
متاسفم برای نام پرمدعا، می دانم، می دانم.. فقط شامل تمام قطعاتی است که می خواهم یک مدل AGI داشته باشم، و نمی توانم وسوسه را تحمل کنم. قبل از پرتاب سنگ به سمت من، لطفا یک نگاه به Readme بیندازید و امیدوارم کمی روحیه شما را پوشش دهد. بنابراین، اول از همه کار می کند و شما می توانید نمونه کل آموزش را در اینجا ببینید:…
متاسفم برای نام پرمدعا، می دانم، می دانم.. فقط شامل تمام قطعاتی است که می خواهم یک مدل AGI داشته باشم، و نمی توانم وسوسه را تحمل کنم. قبل از پرتاب سنگ به سمت من، لطفا یک نگاه به Readme بیندازید و امیدوارم کمی روحیه شما را پوشش دهد. بنابراین، اول از همه کار می کند و شما می توانید نمونه کل آموزش را در اینجا ببینید: https://raw.githubusercontent.com/volotat/mini-AGI/refs/head... این نمودار قانون مقیاس بندی است که من تا کنون دارم، و بسیار امیدوارکننده به نظر می رسد: https://github.com/volotat/mini-AGI/blob/main/assets/scaling...
این مدل با نارضایتی عمیق من ساخته شد، بنابراین ما واقعا نمیتوانیم حتی مدلهای نسبتا بزرگ (مقیاس 1B+) را روی سختافزار مصرفکننده آموزش دهیم. ما میتوانیم آنها را به طور قطع استنباط و تنظیم کنیم، اما من میخواهم بر آنچه که مدل در طول دوره آموزشی میبیند، کنترل کامل داشته باشم، بنابراین کاملا با علایق من و نه برخی از شرکتها هماهنگ است. مدتی در حال فکر کردن به آن بودم و به دو ایده جالب رسیدم که فکر میکردم ارزش دنبال کردن را دارد: وزارت دفاع با متخصصان زیادی که در حین آموزش مدل به آن اضافه میشود و از آن حذف میشود، که در آن تنها زیرمجموعه کوچکی از متخصصان در واقع در هر بخش مورد استفاده قرار میگیرند.
آموزش لحظه ar + دسته 1 بر روی یک جریان پیوسته از داده ها. اول به ما اجازه می دهد که از نظر تعداد پارامترها فقط با فضای دیسک محدود شویم و کارشناسان بارگذاری و بارگیری را فقط در صورت نیاز به آنها محدود کنیم. دومی (اگر مشخص شود و مشخص شود که قابل انجام است) به ما امکان می دهد با ظرفیت VRAM کوچک از دور خارج شویم زیرا نیازی به ذخیره دسته های تصادفی بزرگ و گرادیان های مربوط به آنها نداریم. من با کلود شروع به طوفان فکری کردم و بعد از مدتی رویکردی را پیدا کردیم که به نظر امیدوارکننده بود، و کم کم، چند هفته می گذرد و شما می توانید نتایج را خودتان ببینید. بدیهی است که انجام دادم
از هوش مصنوعی در فرآیند ساخت این پروژه استفاده کنید و مطمئن هستم که انجام چنین کاری بدون آن برای من کاملا غیرممکن است، بنابراین امیدوارم بیش از حد قابل توجیه باشد. این مدل هنوز روی اولین مجموعه کاراکتری 7.8B که من برای آموزش انتخاب کردهام اجرا میکند، بنابراین وزنها هنوز تمام نشدهاند، و حدود دو هفته صبر میکنیم تا با سرعت خواندن فعلی پخته شوند. و بله، این مدل فقط قسمتهای پیوسته درهم از مجموعه داده را میخواند، که هر کدام با 32 هزار کاراکتر طول هر کدام به عنوان یک جریان واحد است.
همانطور که من یا شما انجام می دهیم. به نظر می رسد راه اندازی بسیار ساده است، بنابراین می توانید پروژه را شبیه سازی کنید، آن را اجرا کنید و همه چیز را برای خودتان مشاهده کنید. با تشکر از توجه شما
آدرس نظرات: https://news.ycombinator.com/item?id=49783133
امتیاز: 210
# نظرات: 43
متن اصلی (انگلیسی)
Show HN: Mini-AGI – Dynamic continual learning model trained on 8GB VRAM
Sorry for the pretentious name, I know, I know.. It just contains all the pieces I would like to see a AGI model to have, and I can't stand the temptation. Before throwing rocks at me, please take a glance at the Readme, and I hope it will cover your mood a little bit. So, first of all it does work and you can see the sample from the whole training run here:…