دردهای رشد: چگونه آموزش هوش مصنوعی توزیع شده شبکه بین دیتاسنترها را تغییر می دهد
ویژگی حمایت شده: در حالی که اتصال GPU ها در یک مرکز داده یک چالش است، هماهنگ کردن هزاران نفر از آنها برای کار موثر در طول صدها کیلومتر مجموعه جدیدی از مشکلات را به همراه دارد.
آموزش هوش مصنوعی در مقیاس بزرگ قبلا از محدوده یک مرکز داده واحد فرار کرده است. گوگل گفت Gemini به طور همزمان در سراسر خوشه ها در مکان های مختلف آموزش دیده است. مایکروسافت مراکز داده هوش مصنوعی در ویسکانسین و جورجیا را به آنچه که به عنوان یک ابررایانه هوش مصنوعی توزیع شده توصیف می کند، متصل کرده است. AWS خوشههای محاسباتی هوش مصنوعی را در مناطق وسیعی به هم متصل کرده است تا به آنتروپیک امکان ساخت مدلهای کلود را بدهد. متا برای پشتیبانی از آموزش مدل، اتصالات مرکز داده با ظرفیت بالا ایجاد کرده است. و CoreWeave و Google Cloud اخیرا آموزش بین ابری را با یک اتصال خصوصی اعلام کردند که احتمالا Azure لا را دنبال خواهد کرد.
تر در سال این گسترش جغرافیایی فزاینده آموزش مدل تا حدی به دلیل محدودیتهای مراکز داده یا خوشههای دانشگاهی است که میتوانند با تلاش آنها برای برآورده کردن نیازهای محاسباتی و توان مدلهای جدید، تحت فشار قرار گیرند. سیسکو تخمین می زند که امروزه مدل های آموزشی می توانند به خوشه هایی با ده ها هزار GPU نیاز داشته باشند. به گفته محققان Epoch AI، تا سال 2030، بزرگترین دوره های آموزشی مرزی می تواند بین 4 تا 16 گیگاوات انرژی مصرف کند. توزیع محاسبات به ابرمقیاسها و اپراتورهای مرکز داده اجازه میدهد تا در مکانهایی با قدرت یا فضای موجود بیشتر و محدودیتهای برنامهریزی کمتری بسازند.
چگونه یک LLM را آموزش دهیم در هسته یک LLM یک شبکه عصبی با میلیاردها پارامتر عددی یا وزن وجود دارد که در طول تمرین تنظیم می شوند. دسته ای از داده های آموزشی از مدل عبور می کند که پیش بینی می کند. سیستم خطا را اندازه گیری می کند و محاسبه می کند که وزن ها چگونه باید تغییر کنند. وزن ها به روز می شوند و روند دوباره شروع می شود. در مقیاس مدلهای مدرن، این کار در هزاران GPU و دیگر شتابدهندهها، مانند AWS Trainium و Google TPU توزیع شده است. GPU های مختلف می توانند دسته های جداگانه ای از داده ها یا بخش های مختلف مدل را پردازش کنند.
اما آنها نمی توانند کاملا مستقل کار کنند: در نقاط مختلف آنها باید نتایج را مبادله کنند و قبل از شروع مرحله بعدی آموزش هماهنگ شوند. آنچه شبکهها بین شتابدهندهها حمل میکنند عموما متن یا تصاویر مورد استفاده برای آموزش مدل نیست، بلکه آرایههای بزرگی از دادههای عددی مانند گرادیانها و نتایج میانی است. هزاران شتاب دهنده ممکن است نیاز به تبادل و ترکیب آن داده ها تقریبا در یک زمان داشته باشند. رامش سیواکولوندو از تیم معماری سیلیکون وان سیسکو توضیح می دهد: «اگر به هر شغل آموزشی نگاه کنید، اساسا تکرار محاسبات و هماهنگ سازی است.
شما وزنها را محاسبه میکنید، آن وزنها را برای همگامسازی هر GPU در خوشه ارتباط میدهید و سپس محاسبات را دوباره راهاندازی میکنید. هزاران شتاب دهنده می توانند یک مرحله محاسباتی را به پایان برسانند و همزمان شروع به برقراری ارتباط کنند. این می تواند منجر به مشکلات "incast" شود که در آن بسیاری از فرستنده ها در یک مقصد همگرا می شوند و ترافیک سریعتر از توانایی پیوند بعدی می رسد. مسئله اساسی در همگام سازی نهفته است.
در یک کار آموزشی همزمان، یک گروه از GPU ها نمی توانند به سادگی گروه کندتر را نادیده بگیرند و به طور مستقل ادامه دهند. قبل از اینکه پردازندههای گرافیکی شرکتکننده بتوانند به مرحله بعدی بروند، تبادل در سراسر شبکه باید کامل شود. بنابراین تاخیر شبکه به تاخیر محاسباتی تبدیل می شود. سیواکولوندو می گوید: «شما نمی خواهید شبکه گلوگاهی در روند آموزش باشد.
ایده این است که GPU ها به طور کامل اشغال شوند و شبکه تاخیر اضافی را در برنامه آموزشی کلی ایجاد نکند. این بدان معنا نیست که هر نمونه از تراکم شبکه یا از دست دادن بسته، کل آموزش مدل را به طور کامل متوقف می کند. با این حال، تاخیر یا کاهش جریان ممکن است نیاز به ارسال مجدد داشته باشد، عملیات ارتباط جمعی را طولانی کند و سایر شتاب دهنده ها را منتظر بگذارد. شکستهای جدیتر میتواند نیازمند آموزش برای بازگشت به یک ایست بازرسی ذخیرهشده باشد.
ایتامار گلد، مدیر مدیریت محصول در سیسکو میگوید: «در یک مرکز داده، میتوانید فرض کنید که یک شبکه کامل ایجاد کردهاید که رکهای GPU را با پهنای باندی که برای آن برنامهریزی کردهاید، به هم متصل کردهاید. نکته گلد این است که با مقیاس در سراسر، بارهای کاری هماهنگ هوش مصنوعی ممکن است مجبور شوند از یک بافت بین سایتی محدودتر از شبکه در هر مرکز عبور کنند. در عوض، او میگوید، ترافیکی که مقصد آن تأسیسات دیگر است، ممکن است از طریق لولهای باریکتر هدایت شود. یک ترکیدگی همزمان می تواند آن لوله را به یک نقطه خفه موقت تبدیل کند.
DCI سنتی به محیطهای مرکز داده مستقل متصل میشود و معمولا برای توزیع افزونگی، دسترسی و حجم کاری ساخته میشود. ترافیکی که روی آنها انجام میشود اغلب ترافیک تکراری یا دادههای برنامه است و جریانها ناهمزمان هستند، به این معنی که لازم نیست یک جریان همگام با جریانهای دیگر تمام شود. در آموزش هوش مصنوعی در مقیاس، شبکه بین سایتی به جای انتقال داده ها بین سیستم های مستقل، بخشی از یک محاسبات توزیع شده هماهنگ می شود. بنابراین داشتن پهنای باند کافی و تحویل قابل پیش بینی ضروری است.
از رک به منطقه دیگر در یک رک، پهنای باند مورد نیاز می تواند بسیار زیاد باشد - تا 800Gbps-1.6Tbps - اما فواصل کوتاه هستند. خطوط سریال پرسرعت با هم ترکیب می شوند تا یک خوشه GPU به عنوان یک واحد محاسباتی به نظر برسد. هنگامی که پارچه هوش مصنوعی در کل یک مرکز گسترش می یابد، رک ها همچنان به اتصالات تا 1.6T نیاز دارند. در این نرخ های داده، مس به طور کلی محدود به دسترسی های کوتاه است. اتصالات در ردیفهای قفسهها و طبقات دیتاسنتر در عوض از اپتیکهای قابل اتصال استفاده میکنند، با پیوندهای کاهشیافته از صدها متر تا حدود ۲ کیلومتر.
"Scale-cross" یک بافت هوش مصنوعی هماهنگ را در چندین امکانات گسترش می دهد و رفتار شبکه بین سایت را بخشی از عملکرد بار کاری می کند. بسته به معماری، این پیوندها ممکن است از فواصل مترو یا منطقه ای و بسته به معماری دورتر باشند. با توجه به مدلسازی سیسکو از استقرارهای هوش مصنوعی توزیعشده بزرگ، کل نیازهای پهنای باند میتواند تقریبا ۱۴ برابر خط پایه DCI معمولی باشد. برای شروع، اپتیک های مرکز داده کوتاه برد برای حمل سیگنال های 400-800 گیگابیت بر ثانیه در طول صدها کیلومتر طراحی نشده اند.
برای این فواصل، اپراتورها به اپتیک منسجمی نیاز دارند که از مدولاسیون پیچیده و پردازش سیگنال دیجیتال با کارایی بالا استفاده میکند تا سیگنالهای نوری با نرخ بالا را در دهانههای فیبر مترو و منطقهای قابل استفاده نگه دارد و آسیبهای فیزیکی را که با فاصله مشخصتر میشوند جبران کند. تعداد پورت ها نیز مهم است. سیسکو تخمین میزند که اتصال دو سایت 100 مگاواتی هوش مصنوعی میتواند به 12000 تا 32000 پورت نوری منسجم در لایه مقیاس نیاز داشته باشد، در مقایسه با تقریبا 1000 تا 2000 برای DCI معمولی بین امکانات قابل مقایسه.
با 400G یا 800G در هر پورت، که به ظرفیت کل چند پتابیت میافزاید. جابجایی این مقدار داده نیز یک مشکل قدرت و فضا است. پلاگینهای منسجم، عملکرد فرستنده منسجم را مستقیما در پورتهای روتر یا سوئیچ قرار میدهند و از یک بانک جداگانه از فرستندههای مستقل DWDM اجتناب میکنند. سیسکو میگوید که این امر فضای رک اضافی، قدرت و خنککننده مورد نیاز برای لایه نوری بینسایتی را کاهش میدهد، که زمانی که کارخانههای هوش مصنوعی از قبل با محدودیت انرژی مواجه هستند، توجه مهمی است. مشکل تأخیر حتی با پهنای باند کافی و اپتیک مناسب، فاصله باعث تأخیر می شود.
اگر تراکم ایجاد شود، شبکه به زمان نیاز دارد تا به فرستنده سیگنال دهد تا سرعت خود را کاهش دهد. از طریق یک پارچه هوش مصنوعی محلی، بازخورد می تواند به سرعت برسد. با این حال، اگر اتصال در طول 100 کیلومتر فیبر کشیده شود، قبل از اینکه فرستنده متوجه شود که مشکلی وجود دارد، می توان داده های بیشتری را منتقل کرد. سیسکو محاسبه می کند که در یک اتصال 800 گیگابیت بر ثانیه که 100 کیلومتر را در بر می گیرد، حدود 100 مگابایت داده می تواند در این بازه بازخورد در حال انتقال باشد. سیسکو استدلال می کند که این حلقه های بازخورد طولانی تر ارزش سیلیکون شبکه طراحی شده با بافر عمیق تر را افزایش می دهد.
معماریهای سوئیچینگ بافر کم عمق که برای تأخیر بسیار کم در داخل یک دیتاسنتر طراحی شدهاند، ظرفیت کمتری برای جذب ترافیک دارند در حالی که بازخورد ازدحام از یک پیوند طولانی عبور میکند. Sivakolundu میگوید: «دلیل اینکه با طولانیتر شدن فاصلهها به بافرهای عمیقتری نیاز دارید این است که بازخوردی در مورد انتقال بستهها برای مدت زمان طولانیتری دریافت نمیکنید».
"اگر به اندازه کافی عمیق بافر نکنید، می توانید بسته ها را رها کنید و مجددا ارسال کنید و تاخیر را افزایش دهید." بافر عمیق یک انفجار یا اختلال موقت را جذب می کند در حالی که مدیریت ترافیک و سیگنالینگ تراکم مشکل اساسی را برطرف می کند. ازدحام پایدار همچنان به ظرفیت بیشتر یا تغییر در نحوه توزیع ترافیک نیاز دارد. همین بافر به اشتراک بیش از حد نیز کمک می کند. اگر ظرفیت ترکیبی تغذیه به یک اتصال بین سایتی بیشتر از ظرفیت خود پیوند باشد، انفجار همگامسازی شده میتواند سریعتر از اتصال آن را تخلیه کند.
بافر کردن باعث میشود تا ترافیک اضافی جایی منتظر بماند بدون اینکه از بین برود، در حالی که کنترلهای تراکم پاسخ میدهند. به جای تقسیم بافر موجود به مقادیر ثابت برای هر پورت، یک بافر مشترک یک مخزن مشترک از حافظه بسته است که می تواند در هر جایی که ازدحام ظاهر می شود تخصیص داده شود. این به یک لینک شلوغ اجازه میدهد بدون رها کردن بستهها، انفجار بزرگتری را جذب کند. گلد میگوید: «هر چه مدت طولانیتر به تماسها بپردازید، ممکن است نیاز به بافر بیشتری داشته باشید.
"شما همچنین به انعطافپذیری نیاز دارید تا تا آنجا که ممکن است بافر را در جایی که مورد نیاز است قرار دهید، شاید در یک پورت یا چند پورت که جریان مشکلساز را شناسایی کردهاید. رویکرد ما یک بافر واحد و کاملا مشترک است." آموزش هوش مصنوعی یک ویژگی مفید را ارائه می دهد: بسیاری از ارتباطات جمعی آن تکراری است و بنابراین قابل پیش بینی تر از ترافیک DCI است.
رویکرد سیسکو استفاده از مدیریت ازدحام پیشگیرانه برای هدایت یا برنامه ریزی ترافیک قبل از ایجاد یک انفجار قابل پیش بینی است، در حالی که بافر عمیق را به عنوان شبکه ایمن برای تراکم گذرا و رویدادهای غیرقابل پیش بینی مانند خرابی پیوند حفظ می کند. این دو رویکرد مکمل یکدیگر هستند: یکی سعی میکند از صف اجتناب کند، در حالی که دیگری به شبکه جایی میدهد تا هنگام تشکیل صف، ترافیک را قرار دهد.
شرط بندی سیسکو در طراحی مشترک معماری مقیاسی سیسکو از Silicon One P200 استفاده می کند، یک پردازنده مسیریابی بافر عمیق و قابل برنامه ریزی با سرعت 51.2 ترابیت بر ثانیه که در پلتفرم های Cisco 8223 و Cisco N9000 موجود است. این سیستمها را میتوان با اپتیکهای قابل اتصال منسجم 400G و 800G سیسکو برای پیوندهای مسافت طولانی جفت کرد، در حالی که سیستمهای خط باز مانند Cisco Open Transport 3000 و Cisco NCS 1014 لایه انتقال نوری را در صورت لزوم مدیریت میکنند.
پلاگین های منسجم طول موج های DWDM را مستقیما از سیستم مسیریابی تولید می کنند، در حالی که سیستم خط آن طول موج ها را در سراسر کارخانه فیبر تقویت می کند و حمل می کند. برای پیوندهایی که به چندین جفت فیبر موازی نیاز دارند، سیسکو Open Transport 3000 از طراحی چند ریلی استفاده می کند که اجزای نوری را برای چندین ریل در یک کارت خط ترکیب می کند. سیسکو ادعا می کند که این امر باعث کاهش 75 درصدی برق در هر ریل و 80 درصدی فضای رک می شود. در مواردی که یک سیستم حمل و نقل جداگانه مورد نیاز است، NCS 1014 می تواند 12.8 ترابیت بر ثانیه ظرفیت را از کارت خط 1RU ارائه دهد.
P200 دارای یک پردازنده شبکه قابل برنامه ریزی و ابزار P4 است که سیسکو می گوید به جای اینکه هر تغییری را به نسل جدید سیلیکونی وابسته کند، به پشتیبانی از پروتکل، تله متری و سایر ویژگی های پردازش بسته اجازه می دهد تا در نرم افزار توسعه داده شوند. Sivakolundu میگوید: برای مقیاس گسترده، جایی که اپراتورها هنوز توپولوژیهای مختلف و روشهای مدیریت ترافیک را آزمایش میکنند، «انعطافپذیری قابل برنامهریزی یکسان میتواند به عملکردهای شبکه اجازه دهد بدون هر نیاز جدیدی که مجبور به جایگزینی تراشه شود، تکامل یابد.
سیسکو همچنین شامل حفاظت مبتنی بر سخت افزار برای ترافیک بین سایتی در آن طراحی است، استدلال آن این است که رمزگذاری نباید گلوگاه پردازش دیگری را برای بافت آموزشی ایجاد کند. یکی از بخش های کلیدی سیسکو طراحی مشترک است. یک ASIC شبکه ای سال ها قبل از رسیدن روتر نهایی به مرکز داده تعریف می شود.
سیسکو استدلال میکند که چون تیمهای سیلیکون، سیستم و اپتیک آن در یک شرکت قرار دارند، الزامات مربوط به چگالی پورت، بافر، قدرت، تله متری و رابطهای نوری میتوانند به طراحی تراشه بازخورد دهند تا اینکه تیم سیستم یک ASIC تجاری را دریافت کند و آنچه را که میتواند پیرامون آن بسازد، بررسی کند. این بدان معنا نیست که مقیاس در یک معماری تایید شده است. سیسکو خود این مشکل را به پردیس، مترو و استقرار منطقهای تقسیم میکند و اپراتورهای مختلف در حال آزمایش ترکیبهای مختلفی از شبکهها و تکنیکهای آموزشی هستند.
پیاده سازی ها برحسب اپراتور به طور قابل توجهی متفاوت است، از جمله فاصله، توپولوژی و طراحی حجم کار، در حالی که مشکل رایج حفظ عملکرد هماهنگ هوش مصنوعی در بین سایت ها است. با این حال، این فناوری هنوز در مرحله اولیه است. گلد میگوید: «اکنون شاهد استقرار اولیه هستیم، اما این یک فرآیند است و فکر میکنم چند سال طول بکشد. طراحی شبکه ای برای آموزش توزیع شده، تأخیر فاصله را از بین نمی برد، اما می تواند از تبدیل شدن به گلوگاه این اتصال متقابل جلوگیری کند.
این به اپراتورهای هایپرمقیاس و اپراتورهای دیتاسنتر انعطاف پذیری می دهد تا محاسبات را در جایی که قدرت و فضا در دسترس است اضافه کنند، در حالی که همچنان چندین سایت را به عنوان بخشی از یک زیرساخت آموزشی در نظر می گیرند. با حمایت سیسکو
متن اصلی (انگلیسی)
Growing pains: how distributed AI training changes the network between datacenters
SPONSORED FEATURE: While linking the GPUs in a datacenter is a challenge, coordinating thousands of them to work efficiently over hundreds of kilometers presents a new set of difficulties.