گرد و غبار: ترانسفورماتورهای پیشآموزشی بدون انتشار مجدد
آدرس مقاله: https://qlabs.sh/research/dust آدرس نظرات: https://news.ycombinator.com/item?id=49970871 امتیاز: 172 # نظرات: 42
یادگیری عمیق حول محور پشتیبان ساخته شده است، تنها الگوریتم تخصیص اعتبار که قادر به آموزش شبکه های عصبی مدرن، از جمله مدل های زبان مبتنی بر ترانسفورماتور است. Backprop نیاز به تمایز دارد و گرادیان های مرتبه اول را تولید می کند و معماری ها، بهینه سازها و سخت افزارهای یادگیری عمیق حول این محدودیت تکامل یافته اند.
با این حال، با افزایش مقدار محاسبات موجود در جهان، ممکن است الگوریتمهای یادگیری عمومی و brute-force مبتنی بر جستجو را به سوگیریهای استقرایی مانند تمایزپذیری، پشتیبان و تقریب گرادیانهای مرتبه بالاتر ترجیح دهیم. درس تلخ ( ساتن، 2019 ریچارد اس. ساتون. درس تلخ. http://www.incompleteideas.net/IncIdeas/BitterLesson.html، 2019. پست وبلاگ.
) این است که روشهای کلی که با محاسبه مقیاس میشوند در نهایت برنده میشوند و AlphaGo Zero (سیلور و همکاران، 2017 دیوید سیلور، جولیان شریتویزر، کارن سیمونیان، یوانیس آنتونوگلو، آجا هوانگ، آرتور گوئز، توماس هوبرت، لوکاس بیکر، متیو لایمو، آدریان چیتون، متیو لایمو، آدریان بولیک، آدریان بولیک، یونیس لایمو، آدریان بولیک، 2017 Hui, Laurent Sifre, George van den Driessche, Thore Graepel, and Demis Hassabis تسلط بر بازی Go بدون دانش انسانی , 550 (7676): 354–359, 2017. doi: 10.1038/nature24270.
بوت استرپ AlphaGo بر روی داده های انسانی به شبکه کمک کرد تا در ابتدا سریعتر یاد بگیرد، اما با محاسبات زیاد، شبکه کاملا خودبازی از آن پیشی گرفت. به طور مشابه، تمایز پذیری و پشتیبان ممکن است سوگیری های استقرایی خوبی در رژیم کم محاسبه باشد، جایی که یادگیری را کارآمد می کنند، اما در رژیم محاسباتی بالا، فضای معماری هایی را که کار می کنند محدود می کنند. حتی در یک معماری، روشهای مبتنی بر گرادیان در کاوش بهینه چشمانداز تلفات شکست میخورند (لیو و همکاران، 2020 Shengchao Liu، Dimitris Papailiopoulos و Dimitris Achlioptas. حداقلهای جهانی بد وجود دارند و SGD میتواند به آنها برسد.
در پیشرفتها در سیستمهای پردازش اطلاعات عصبی، جلد 33، 2020. ). این همچنین میتواند توضیح دهد که چرا شبکههای عصبی کنونی برای تعمیم به مقادیر زیادی داده نیاز دارند. یک الگوریتم تخصیص اعتبار انعطافپذیرتر بر اساس جستجو احتمالا گام مهمی به سوی تعمیم بسیار بهتر است.
در این مقاله، هدف ما جایگزینی backprop با یک الگوریتم یادگیری است که بسیار بیشتر بر اساس محاسبات brute-force و بسیار کمتر بر اساس ساختار تحلیلی است. ما آن را گرد و غبار می نامیم. Dust یک الگوریتم بهینهسازی مرتبه صفر است که فعالسازیها را مختل میکند، به هر اغتشاش تا چه اندازه ضرر را کاهش میدهد، پاداش میدهد و اغتشاشات وزندار پاداش را در یک جمعیت برای تخمین گرادیان میانگین میدهد. روشهای سنتی ES که وزنها را برهم میزنند (سالیمانز و همکاران، 2017 تیم سلیمانس، جاناتان هو، شی چن، شیمون سیدور، و ایلیا سوتسکور. استراتژیهای تکامل به عنوان جایگزینی مقیاسپذیر برای یادگیری تقویتی.
arXiv preprint arXiv:1703.03864، 2017. ) مانند EGGROLL (Sarkar و همکاران، 2025 Bidipta Sarkar، Mattie Fellows، Juan Agustin Duque، Alistair Letcher، Antonio León Villares، Anya Sims، Clarisse Dyrek Samepeult، Clarisse Dyreqe Wibault. استراتژی های کانگ لی، لوکاس سییر، تئو ولف، اولجاد بردیکا، والنتین موهل، الکساندر دیوید گلدی، آرون کورویل، کارین سوگنانی، شیمون وایتسون و یاکوب نیکولاس فورستر در مقیاس پیش چاپ arXiv: 2511.16652.
) ، مقیاس با جمعیت است، اما مقیاس بندی جمعیت پرهزینه است زیرا هر عضو باید تحقق و ارزیابی شود. ما هر دو هزینه را با مفهوم جمعیت مجازی حذف میکنیم، که در آن از تحقق هر عضو با دور زدن فضای وزنی به طور کامل اجتناب میکنیم و در عوض فعالسازیها را مزاحم میکنیم، مانند اغتشاش گره (Werfel et al., 2003 Justin Werfel, Xiaohui Xie, and H. Sebastian Seung. منحنیهای یادگیری برای شبکههای تصادفی گرادیان خطی. سیستم های پردازش، جلد 16، 2003. Widrow and Lehr، 1990 Bernard Widrow and Michael A.
لهر. 30 سال شبکه های عصبی تطبیقی: پرسپترون، مدالین، و پس انتشار. Proceedings of the IEEE , 78 (9): 1415–1442, 1990. doi: 10.1109/5.58323. ) . ما این کار را به طور مستقل در هر نشانه انجام می دهیم، بنابراین هر نشانه یک عضو است و یک پاس رو به جلو همه آنها را به صورت موازی ارزیابی می کند.
فعالسازیها فضای جالبتری برای جستجو نسبت به وزنها هستند. تفسیرپذیری مکانیکی نشان داده است که استدلال، چه قابل بیان یا غیرقابل بیان، در فعالسازیها زندگی میکند (Gurnee و همکاران، 2026 Wes Gurnee، Nicholas Sofroniew، Adam Pearce، Mateusz Piotrowski، Isaac Kauvar، Runjin Chen، Anna Soligo، Paul Bogdan، Robrampson O David Euang. Subhash Kantamneni، Emmanuel Ameisen، Joshua Batson و Jack Lindsey یک فضای کاری جهانی را در مدل های زبانی arXiv:2607.15495، 2026 تشکیل می دهند.
; لیندزی و همکاران، 2025 جک لیندزی، وس گورنی، امانوئل آمیزن، برایان چن، آدام پیرس، نیکلاس ال ترنر، کریگ سیترو، و همکاران. در مورد بیولوژی یک مدل زبان بزرگ. Transformer Circuits Thread, 2025. ) که به این معنی است که این رویکرد می تواند آموزش را به جستجویی بر استدلال نهفته تبدیل کند ( Vegesna and Dahal, 2025 Akshay Vegesna and Samip Dahal. جداسازی جستجو و یادگیری در آموزش شبکه عصبی. arXiv preprint arXiv:2509.109.)
سپس آشفتگی فضای فعالسازی را با یک قانون تخصیص اعتبار بسیار عمومی جفت میکنیم که پاداشهای سطح توکن مختلف را به انواع لایههای مختلف در یک بلوک ترانسفورماتور اختصاص میدهد. این دو سوگیری، همراه با چند جزئیات پیاده سازی و اقدامات کارایی، مانند اجتناب از تداخل بین ماژول های آشفته، کل الگوریتم هستند.
هدف این مقاله پی ریزی پایه های یک الگوریتم تخصیص اعتبار مبتنی بر جستجو است که در سخت ترین کاری که می توانیم به آن فکر کنیم: پیش آموزش ترانسفورماتورها با backprop رقابت می کند. ما سعی نمی کنیم آن را به اندازه کافی محاسباتی برای جایگزینی backprop امروزی کنیم. ما همچنین انواع جدیدی از شبکههای عصبی را که در دسترس میسازد، آموزش نمیدهیم، مانند شبکههایی با یک برنامه خارجی در حلقه یا ترانسفورماتورهای حلقهشده در بسیاری از مراحل که انتشار پسپشتی در طول زمان برای آموزش آنها تلاش میکند. هر دو موکول به کارهای آینده هستند.
گرد و غبار به شرح زیر عمل می کند. نویز گاوسی را به خروجی هر لایه خطی، به طور مستقل در هر نشانه اضافه می کنیم، یک پاس رو به جلو اجرا می کنیم، و نویز هر توکن را با تغییر در ضرر در آن توکن پاداش می دهیم. نویز وزندار پاداش، بهطور میانگین در طول کشش، خطای تخمینی در خروجی لایه است و محصول بیرونی آن با ورودی لایه، گرادیان وزن است. داخلیهای توجه یک نوع از آن را دریافت میکنند: آنها از طریق خطای تخمینی در خروجی توجه بیش از توکنهای فعلی و آینده بهجای از دست دادن توکنها به طور مستقیم اعتبار داده میشوند.
شهود اصلی این است که در حالی که ES فضای وزنی یک عضو جمعیت را در هر پاس رو به جلو ارزیابی می کند، ما یک عضو را در هر توکن به صورت موازی ارزیابی می کنیم، و یک عضو با افزودن نویز به حالت پنهان، که ارزان است، تحقق می یابد. در یک ترانسفورماتور مدرن، یک گذر به جلو، جمعیتی را حداقل سه مرتبه بزرگتر از فضای وزنی ES ارزیابی می کند. در زیر هر جزء را به تفصیل توضیح می دهیم.
افزودن نویز به فعالسازیها بهجای وزنها، اغتشاش گره است (Widrow and Lehr, 1990 Bernard Widrow and Michael A. Lehr. 30 سال شبکههای عصبی تطبیقی: Perceptron، Madaline و backpropagation. مجموعه مقالات IEEE , 78 (9): 14215-194. 10.1109/5.58323، و استدلال معمول برای آن ابعاد است (رن و همکاران، 2023 Mengye Ren، Simon Kornblith، Renjie Liao، و Geoffrey Hinton. مقیاس بندی گرادیان رو به جلو با تلفات محلی. در کنفرانس بین المللی یادگیری، We20. 2003 جاستین ورفل، شیائوهوی زی و اچ. سباستین سونگ.
منحنی های یادگیری برای نزول گرادیان تصادفی در شبکه های پیشخور خطی در پیشرفتها در سیستمهای پردازش اطلاعات عصبی، جلد 16، 2003. ). خروجی یک لایه دارای ورودیهای $d_{\mathrm{out}}$ و وزنهای آن $d_{\mathrm{out}} \times d_{\mathrm{in}}$ است، بنابراین نویز فعالسازی در فضای بسیار کوچکتری زندگی میکند. سادهلوحانه، استدلال ابعاد برای ترانسفورماتورهایی با فعالسازیهای زیاد در بسیاری از توکنها صادق نیست. نویز در یک دنباله یک تانسور $T \times d_{\mathrm{out}}$ است که حداقل به اندازه ماتریس وزن یک بار $T \ge d_{\mathrm{in}}$ ورودی دارد.
با این حال، با اغتشاشها و پاداشهای مستقل به ازای هر توکن، آنچه که فعالسازی مزاحم ایجاد میکند، یک جمعیت جدید و کارآمد در امتداد محور توکن است که متعامد به محور دستهای است که EGGROLL از قبل به آن متکی است.
برای یک لایه خطی $y_t = W x_t$، خروجی آن را در تمام نشانهها، $y_t \ به y_t + \sigma a_t$ با مقیاس نویز $a_t \sim \sim \mathcal{N}(0, I)$ و $\sigma$ تکان میدهیم و پاس رو به جلو را اجرا میکنیم. در هر توکن $s$، کاهش مرکزی زیان $c_s = \tilde{\ell}_s - \ell_s$ را محاسبه میکنیم، که $\ell_s$ ضرر آشفته و $\tilde{\ell}_s$ میانگین زیان آشفته در آن نشانه در طول قرعهکشیها با هم در یک دسته به جلو ارزیابی میشود.
پاداش جیتر در توکن $t$ کاهش ضرر در $t$ و با کاهش $\gamma$، کاهش ضرر در توکن های بعد از آن است، که جیتر نیز از طریق توجه به آن می رسد.
با $\gamma = 0$، یک جیتر تنها با توکن خود پاداش می گیرد. ما آن را به تنظیم بخش 2.3 واگذار می کنیم تا تصمیم بگیریم کدام لایه ها توکن های آینده را ببینند. یک جیتر مستقل از همه توکن ها یک قرعه کشی است و یک جمعیت تساوی $K$ است. به طور متوسط بیش از تساوی، سر و صدا وزن پاداش
خطای تخمین زده شده در خروجی لایه است، و حاصلضرب بیرونی آن با ورودی لایه، که گذر رو به جلو از قبل محاسبه شده و بر روی توکن ها جمع شده است، گرادیان وزن است.
Backprop همان محصول بیرونی را با همان ورودی تشکیل می دهد. تنها تفاوت این است که خطای خروجی را از قانون زنجیره دریافت می کند و ما آن را از جمعیت دریافت می کنیم. برای یک لایه جاسازی $x_t$ یک داغ است، بنابراین محصول بیرونی یک جمع پراکنده $\hat g_t$ در ردیف توکن است.
با جمعیت نامحدود، برآوردگر بالا کل روش است، و هر اغتشاش می تواند به یک پاس رو به جلو برود. نویز وزنی هر قرعه کشی یک گرادیان به اضافه یک خطا بدون جهت ترجیحی است. بیش از ترسیم گرادیان به صورت خطی جمع می شود در حالی که خطاها به صورت جذر جمع می شوند، بنابراین نسبت آنها با افزایش جمعیت کاهش می یابد و تداخل در حد ناپدید می شود.
در جمعیتی که ما توان پرداخت آن را داریم، هزینه اصلی تداخل است، یعنی لایههای زیادی را در بسیاری از نشانهها در همان پاس رو به جلو تکان میدهیم، بنابراین تغییر ضرری که به نویز یک توکن پاداش میدهد، تأثیر هر اختلال دیگر در آن پاس را نیز برمیانگیزد. ما از سه طریق چنین تداخلی را کاهش می دهیم. ابتدا، انواع لایه های مختلف در گذرهای رو به جلو جداگانه، هر کدام دارای مقیاس نویز خاص خود هستند، و هر بلوک پاس های خود را دریافت می کند. این پاسها ارزانتر از فورواردهای کامل هستند، زیرا فوروارد تمیز در حافظه پنهان ذخیره میشود و قرعهکشی برای بلوک $l$ فقط بلوکهای $l$ را به بعد تکرار میکند.
دوم، بخشهای داخلی توجه (پرس و جو، کلید، مقدار، دروازه، جاسازی ارزش) به طور جداگانه تکان میخورند. از دست دادن توکن به سختی لرزش خود را ثبت می کند، بنابراین از طریق خروجی توجه پاداش دریافت می کند، همانطور که در زیر توضیح داده شده است. سوم، هد مدلسازی زبان مستقیما روی لاجیتهای ذخیرهشده تکان میخورد، و فقط آنتروپی متقاطع و فقط یک صفحه از واژگان را در هر قرعهکشی مجدد ارزیابی میکند، که هزینه کمی از یک پاس رو به جلو دارد و به هد اجازه میدهد جمعیت بسیار بیشتری را اجرا کند.
برای بخشهای داخلی توجه، تنها خروجی توجه بلوک آنها را با جیتر، از فعالسازیهای پاک ذخیرهشده در حافظه پنهان، دوباره محاسبه میکنیم. ما لرزش ها را با استفاده از هم ترازی با گرادیان های خروجی توجه تخمین زده نمره می دهیم.
که در آن $\Delta o_s$ تغییری است که لرزش در خروجی توجه در نشانه $s$ ایجاد میکند و $\hat g_s$ خطای تخمینی خروجی از معادله 2 است. پاداش معادله 1 با این امتیازات است که به ازای هر سر محاسبه می شود، به جای کاهش ضرر.
فراپارامترها، مقیاس نویز هر نوع لایه، کاهش اعتبار داخلی توجه و سهم جمعیتی که هر لایه میگیرد، به دو صورت قابل تنظیم است. یکی از آنها جستجوی شبکه ای است که با هر تنظیمی با بودجه نشانه ای کوچک تمرین می کند و تنظیماتی را حفظ می کند که بیشترین ضرر را کاهش می دهد. قابل اعتماد است اما گران است. دیگری جستجوی شبکه ای است که کسینوس بین تخمین ما و گرادیان پشتی را در یک دسته به حداکثر می رساند، که اصلا نیازی به آموزش ندارد.
کسینوس بزرگتر در یک دسته همیشه تلفات را پس از تمرین کاهش نمی دهد، بنابراین کسینوس نامزدها را انتخاب می کند و آموزش تصمیم می گیرد. در هر صورت، تنظیم بیشتر یک هزینه یکباره است، زیرا تنظیماتی که پیدا میکند تا حد زیادی در بودجههای رمزی و اندازه جمعیت، به استثنای یک استثنا، تعمیم مییابد. در بزرگترین جمعیت با توکن های 10 و 20 میلیونی، کاهش اعتبار کندتر و جابجایی جذب ها به سمت حواس پراکنده است (پیوست F). از این رو، این جستجو به جای تنظیمات برای یک اجرا، اصول کلی روش را بازیابی می کند.
همانطور که انتظار میرود، همه لایهها به هیچ اعتباری از توکنهای آینده نیاز ندارند، به جز کلیدها، مقادیر، دروازهها و جاسازیهای ارزش، که توسط توکنهای بعدی که به آنها توجه میکنند خوانده میشوند و $\gamma$ نزدیک به یک میگیرند.
ما ترانسفورماتورهای سبک GPT را در FineWeb با توکنایزر BPE با 4096 توکن، دسته ای از 16 هزار توکن (8 دنباله از 2048 توکن)، یک دوره، و SGD با تکانه با نرخ یادگیری ثابت آموزش می دهیم. مدل پایه دارای 8 لایه و عرض 512 است. هر روش پروتکل یکسان و سه دانه در هر سلول را دریافت می کند و به طور جداگانه در هر بودجه و جمعیت توکن تنظیم می شود. گرد و غبار و پشتی یک شبکه حرکتی و نرخ یادگیری مشترک دارند. ما EGGROLL را با همان معماری ترانسفورماتور (به نام EGGROLL-Transformer) پیادهسازی میکنیم و روی شبکهای از اندازه گام، تکانه، مقیاس نویز و شکلدهی تناسب اندام تنظیم میشود.
اعتبار سنجی و آزمایش مجموعههای 544 دنبالهای هستند. ما ضرر تست را در بهترین نقطه بازرسی اعتبار سنجی گزارش می کنیم.
ما جمعیت را در قرعه کشی ها برای Dust و در پاس های رو به جلو دسته برای EGGROLL می شماریم (سرکار و همکاران، 2025 Bidipta Sarkar، Mattie Fellows، Juan Agustin Duque، Alistair Letcher، Antonio León Villares، Anya Sims، Clarisse Wibault، Dmitry Samsonov Se, Like Theme, Dylanoenpe راهبردهای Wolf، Uljad Berdica، Valentin Mohl، Alexander David Goldie، Aaron Courville، Karin Sevegnani، Shimon Whiteson، و Jakob Nicolaus Foerster در مقیاس اولیه arXiv: 2511.16652، وزن پایه ما.
قرعهکشی یک تلنگر از فعالسازی در تمام نشانههای لایههای انتخابی است که با از دست دادن توکن پاداش داده میشود، و جمعیت $K$ تعداد قرعهکشیها در هر بهروزرسانی است. یک قرعه کشی کمی ارزان تر از یک پاس رو به جلو است، زیرا فوروارد تمیز در حافظه پنهان ذخیره می شود و قرعه ای که با لرزش $l$ را مسدود می کند، فقط بلوک ها را از $l$ به بعد اجرا می کند. $K$ ترسهای هد و بخشهای داخلی توجه را که بخش کوچکی از FLOPهای بهروزرسانی هستند حذف میکند (پیوست E). در مجموع، از یک جمعیت 256 نفری به بالا، Dust از محاسبات کمتری نسبت به EGGROLL در همان جمعیت استفاده می کند، بنابراین مقایسه با EGGROLL ملایم است.
ما بودجه توکن را از 100 هزار به 20 میلیون در برابر جمعیت های 64 تا 16 هزار نفری با پشتیبان تنظیم شده بر روی یک شبکه در هر بودجه (جدول 1، شکل 2) جارو می کنیم. در 100k و 1M توکن، گرد و غبار به زیر پشتیبان ختم می شود، از چند صد تساوی در 100k و از هزار در 1M. در توکن های 10 و 20 میلیونی، شکاف با پشتیبان با جمعیت کاهش می یابد. در 10 متری نردبان مسطح شده و حد نصب شده آن درست بالای پشتی قرار می گیرد. در 20 متری، نردبان همچنان در 16 هزار تساوی در حال سقوط است.
برازش قانون توان آن حد را روی 4.431 (فاصله 95 درصدی 3.89 تا 4.58) قرار میدهد، کمتر از 4.633 پشتیبان، اما با پایین آمدن نردبان، تناسب محدود میشود، بنابراین ما آن را به عنوان شاهدی میخوانیم که شکاف با جمعیت بسته میشود و نه به عنوان یک حد اندازهگیری شده.
در حالی که ما در بقیه مقاله عمدتا روی SGD تمرکز می کنیم، نردبان توکن 1M را با آدام در هر سه روش تکرار می کنیم (شکل 3)، تنظیم مجدد نرخ یادگیری backprop، فراپارامترهای خود Dust و اندازه گام، تکانه و شکل گیری تناسب EGGROLL در هر جمعیت. جالب توجه است که EGGROLL تقریبا چیزی از Adam به دست نمی آورد و نردبان Adam تنظیم شده آن در 0.01 نردبان SGD خود در جدول 1 در هر جمعیت قرار می گیرد. با این حال، آدام هم Dust و هم پشتی را بهبود می بخشد و شکل نردبان را شبیه به قبل می کند.
گرد و غبار روی پشتی با جمعیت زیاد بسته میشود و فاصلهای که در محدوده آن قرار دارد زیر پایه پشتی قرار میگیرد (شکل 3). بنابراین برآورد Dust در حال حاضر با بهینهسازهای مدرن کار میکند، حتی اگر بهینهسازهای مدرن برای شیبهای پشتی بهینه شده باشند. ما گمان میکنیم که تکامل همزمان بهینهسازها با Dust میتواند منجر به دستاوردهای بیشتر شود و این امر را به کارهای آینده واگذار کند.
بنابراین راه درست برای فکر کردن به اندازه مدل، اندازه و هندسه فضای جستجو است. یک مدل بزرگتر فضای بیشتری برای جستجو دارد، که به آن اجازه میدهد از جمعیت زیادی استفاده کند، و به طور بالقوه هندسه منظره از دست دادن شرایط بهتری دارد، به همین دلیل است که جستجو حتی در جمعیتهای کوچک مؤثرتر است.
ما کسینوس بین تخمین Dust و گرادیان پشتی را در یک دسته، در هر نوع لایه و در هر لایه، در نقاط بازرسی آموزشدیده پشتیبان اندازهگیری میکنیم که شامل دو مرتبه بزرگی در توکنها میشود، یعنی از 10M تا 1B توکن، با افزایش جمعیت از 64 به 1280 گام رو به جلو (شکل 5 گام به جلو). کسینوس با جمعیت برای هر نوع لایه در هر مرحله از آموزش و یک قانون دو پارامتری افزایش می یابد
نکته مهم این است که کسینوس ها در اکثر لایه ها با افزایش تعداد توکن ها حفظ می شوند، که برای مقیاس بندی دلگرم کننده است. بخش 3 جمعیت مورد نیاز برای تطبیق و فراتر رفتن از رشد پشتیبان با توکن ها را نشان می دهد. با این حال، کسینوس در دو مرتبه قدر در توکنها در جمعیتهای بزرگ صاف میماند، به این معنی که در یک جمعیت به اندازه کافی بزرگ، این امکان وجود دارد که این نیاز دیگر با توکنهای بیشتر رشد نکند. علاوه بر این، این واقعیت که گرادیان های Dust به backprop نزدیک می شوند اما دقیقا به آنها همگرا نمی شوند در واقع ویژگی خوبی است.
تخمین در جهت مشابهی بدون گرادیان backprop اشاره می کند که منجر به یک مسیر بهینه سازی متفاوت می شود، و در آزمایشات ما این مسیر حتی می تواند بهتر از backprop باشد (بخش 3.2).
از آنجایی که روملهارت و همکاران. (1986) دیوید ای. روملهارت، جفری ای. هینتون و رونالد جی ویلیامز. یادگیری بازنمایی با خطاهای پس انتشار. Nature، 323: 533-536، 1986. backprop الگوریتمی بوده است که شبکه های عصبی را آموزش می دهد، و معماری ها، بهینه سازها و سخت افزارهای ما همگی حول آن ساخته شده اند. همانطور که محاسبات فراوان تر می شود، ما فکر می کنیم جایگزین های بسیار بهتری ممکن است. ما Dust را معرفی کردیم، الگوریتمی که الگوریتمهای ES موجود را بهشدت بهبود میبخشد و پشتیبان را در ترانسفورماتورهای پیشآموزشی تقریبی میکند، حتی با مقادیر زیاد محاسبات از آن فراتر میرود.
سوالات باز و جالب بسیاری وجود دارد. اولین مورد این است که آیا و چگونه Dust میتواند جهتهای بهتری نسبت به گرادیان مرتبه اول backprop با کاوش ضمنی چشمانداز از دست دادن، انتخاب انحنای مرتبه بالاتر که جستجو را به سمت مناطق مسطح میکشد، پیدا کند. ما اشارههایی داریم که میتواند، زیرا در جمعیتهای بزرگ گاهی اوقات به زیر پشتی ختم میشود، اما مکانیسم آن مشخص نیست.
مورد دوم این است که Dust فضای جستجو را روی معماریها باز میکند، زیرا نیازی به متمایز شدن سرتاسر شبکه ندارد، و ممکن است در جایی که backprop با مشکل مواجه است، مانند محاسبات تکراری یا حلقهای که با انتشار پسپشتی در طول زمان آموزش داده میشود، بهتر عمل کند. سومین بازده محاسباتی است که تمرکز این مقاله نبود. قبل از اینکه Dust به یک جایگزین عملی برای backprop در سطوح فعلی محاسبات تبدیل شود، باید کارایی محاسباتی بالاتری داشته باشیم.
متن اصلی (انگلیسی)
Dust: Pretraining Transformers Without Backpropagation
Article URL: https://qlabs.sh/research/dust Comments URL: https://news.ycombinator.com/item?id=49970871 Points: 172 # Comments: 42