پرش به محتوای اصلی

دردهای رشد: چگونه آموزش هوش مصنوعی توزیع شده شبکه بین دیتاسنترها را تغییر می دهد

دِ رجیستر۱۴۰۵ مهر ۱۷, جمعه، ساعت ۱۸:۳۰حدود 10 دقیقه مطالعه

ویژگی حمایت شده: در حالی که اتصال GPU ها در یک مرکز داده یک چالش است، هماهنگ کردن هزاران نفر از آنها برای کار موثر در طول صدها کیلومتر مجموعه جدیدی از مشکلات را به همراه دارد.

آموزش هوش مصنوعی در مقیاس بزرگ قبلا از محدوده یک مرکز داده واحد فرار کرده است. گوگل گفت Gemini به طور همزمان در سراسر خوشه ها در مکان های مختلف آموزش دیده است. مایکروسافت مراکز داده هوش مصنوعی در ویسکانسین و جورجیا را به آنچه که به عنوان یک ابررایانه هوش مصنوعی توزیع شده توصیف می کند، متصل کرده است. AWS خوشه‌های محاسباتی هوش مصنوعی را در مناطق وسیعی به هم متصل کرده است تا به آنتروپیک امکان ساخت مدل‌های کلود را بدهد. متا برای پشتیبانی از آموزش مدل، اتصالات مرکز داده با ظرفیت بالا ایجاد کرده است. و CoreWeave و Google Cloud اخیرا آموزش بین ابری را با یک اتصال خصوصی اعلام کردند که احتمالا Azure لا را دنبال خواهد کرد.

تر در سال این گسترش جغرافیایی فزاینده آموزش مدل تا حدی به دلیل محدودیت‌های مراکز داده یا خوشه‌های دانشگاهی است که می‌توانند با تلاش آنها برای برآورده کردن نیازهای محاسباتی و توان مدل‌های جدید، تحت فشار قرار گیرند. سیسکو تخمین می زند که امروزه مدل های آموزشی می توانند به خوشه هایی با ده ها هزار GPU نیاز داشته باشند. به گفته محققان Epoch AI، تا سال 2030، بزرگترین دوره های آموزشی مرزی می تواند بین 4 تا 16 گیگاوات انرژی مصرف کند. توزیع محاسبات به ابرمقیاس‌ها و اپراتورهای مرکز داده اجازه می‌دهد تا در مکان‌هایی با قدرت یا فضای موجود بیشتر و محدودیت‌های برنامه‌ریزی کمتری بسازند.

چگونه یک LLM را آموزش دهیم در هسته یک LLM یک شبکه عصبی با میلیاردها پارامتر عددی یا وزن وجود دارد که در طول تمرین تنظیم می شوند. دسته ای از داده های آموزشی از مدل عبور می کند که پیش بینی می کند. سیستم خطا را اندازه گیری می کند و محاسبه می کند که وزن ها چگونه باید تغییر کنند. وزن ها به روز می شوند و روند دوباره شروع می شود. در مقیاس مدل‌های مدرن، این کار در هزاران GPU و دیگر شتاب‌دهنده‌ها، مانند AWS Trainium و Google TPU توزیع شده است. GPU های مختلف می توانند دسته های جداگانه ای از داده ها یا بخش های مختلف مدل را پردازش کنند.

اما آنها نمی توانند کاملا مستقل کار کنند: در نقاط مختلف آنها باید نتایج را مبادله کنند و قبل از شروع مرحله بعدی آموزش هماهنگ شوند. آنچه شبکه‌ها بین شتاب‌دهنده‌ها حمل می‌کنند عموما متن یا تصاویر مورد استفاده برای آموزش مدل نیست، بلکه آرایه‌های بزرگی از داده‌های عددی مانند گرادیان‌ها و نتایج میانی است. هزاران شتاب دهنده ممکن است نیاز به تبادل و ترکیب آن داده ها تقریبا در یک زمان داشته باشند. رامش سیواکولوندو از تیم معماری سیلیکون وان سیسکو توضیح می دهد: «اگر به هر شغل آموزشی نگاه کنید، اساسا تکرار محاسبات و هماهنگ سازی است.

شما وزن‌ها را محاسبه می‌کنید، آن وزن‌ها را برای همگام‌سازی هر GPU در خوشه ارتباط می‌دهید و سپس محاسبات را دوباره راه‌اندازی می‌کنید. هزاران شتاب دهنده می توانند یک مرحله محاسباتی را به پایان برسانند و همزمان شروع به برقراری ارتباط کنند. این می تواند منجر به مشکلات "incast" شود که در آن بسیاری از فرستنده ها در یک مقصد همگرا می شوند و ترافیک سریعتر از توانایی پیوند بعدی می رسد. مسئله اساسی در همگام سازی نهفته است.

در یک کار آموزشی همزمان، یک گروه از GPU ها نمی توانند به سادگی گروه کندتر را نادیده بگیرند و به طور مستقل ادامه دهند. قبل از اینکه پردازنده‌های گرافیکی شرکت‌کننده بتوانند به مرحله بعدی بروند، تبادل در سراسر شبکه باید کامل شود. بنابراین تاخیر شبکه به تاخیر محاسباتی تبدیل می شود. سیواکولوندو می گوید: «شما نمی خواهید شبکه گلوگاهی در روند آموزش باشد.

ایده این است که GPU ها به طور کامل اشغال شوند و شبکه تاخیر اضافی را در برنامه آموزشی کلی ایجاد نکند. این بدان معنا نیست که هر نمونه از تراکم شبکه یا از دست دادن بسته، کل آموزش مدل را به طور کامل متوقف می کند. با این حال، تاخیر یا کاهش جریان ممکن است نیاز به ارسال مجدد داشته باشد، عملیات ارتباط جمعی را طولانی کند و سایر شتاب دهنده ها را منتظر بگذارد. شکست‌های جدی‌تر می‌تواند نیازمند آموزش برای بازگشت به یک ایست بازرسی ذخیره‌شده باشد.

ایتامار گلد، مدیر مدیریت محصول در سیسکو می‌گوید: «در یک مرکز داده، می‌توانید فرض کنید که یک شبکه کامل ایجاد کرده‌اید که رک‌های GPU را با پهنای باندی که برای آن برنامه‌ریزی کرده‌اید، به هم متصل کرده‌اید. نکته گلد این است که با مقیاس در سراسر، بارهای کاری هماهنگ هوش مصنوعی ممکن است مجبور شوند از یک بافت بین سایتی محدودتر از شبکه در هر مرکز عبور کنند. در عوض، او می‌گوید، ترافیکی که مقصد آن تأسیسات دیگر است، ممکن است از طریق لوله‌ای باریکتر هدایت شود. یک ترکیدگی همزمان می تواند آن لوله را به یک نقطه خفه موقت تبدیل کند.

DCI سنتی به محیط‌های مرکز داده مستقل متصل می‌شود و معمولا برای توزیع افزونگی، دسترسی و حجم کاری ساخته می‌شود. ترافیکی که روی آن‌ها انجام می‌شود اغلب ترافیک تکراری یا داده‌های برنامه است و جریان‌ها ناهمزمان هستند، به این معنی که لازم نیست یک جریان همگام با جریان‌های دیگر تمام شود. در آموزش هوش مصنوعی در مقیاس، شبکه بین سایتی به جای انتقال داده ها بین سیستم های مستقل، بخشی از یک محاسبات توزیع شده هماهنگ می شود. بنابراین داشتن پهنای باند کافی و تحویل قابل پیش بینی ضروری است.

از رک به منطقه دیگر در یک رک، پهنای باند مورد نیاز می تواند بسیار زیاد باشد - تا 800Gbps-1.6Tbps - اما فواصل کوتاه هستند. خطوط سریال پرسرعت با هم ترکیب می شوند تا یک خوشه GPU به عنوان یک واحد محاسباتی به نظر برسد. هنگامی که پارچه هوش مصنوعی در کل یک مرکز گسترش می یابد، رک ها همچنان به اتصالات تا 1.6T نیاز دارند. در این نرخ های داده، مس به طور کلی محدود به دسترسی های کوتاه است. اتصالات در ردیف‌های قفسه‌ها و طبقات دیتاسنتر در عوض از اپتیک‌های قابل اتصال استفاده می‌کنند، با پیوندهای کاهش‌یافته از صدها متر تا حدود ۲ کیلومتر.

"Scale-cross" یک بافت هوش مصنوعی هماهنگ را در چندین امکانات گسترش می دهد و رفتار شبکه بین سایت را بخشی از عملکرد بار کاری می کند. بسته به معماری، این پیوندها ممکن است از فواصل مترو یا منطقه ای و بسته به معماری دورتر باشند. با توجه به مدل‌سازی سیسکو از استقرارهای هوش مصنوعی توزیع‌شده بزرگ، کل نیازهای پهنای باند می‌تواند تقریبا ۱۴ برابر خط پایه DCI معمولی باشد. برای شروع، اپتیک های مرکز داده کوتاه برد برای حمل سیگنال های 400-800 گیگابیت بر ثانیه در طول صدها کیلومتر طراحی نشده اند.

برای این فواصل، اپراتورها به اپتیک منسجمی نیاز دارند که از مدولاسیون پیچیده و پردازش سیگنال دیجیتال با کارایی بالا استفاده می‌کند تا سیگنال‌های نوری با نرخ بالا را در دهانه‌های فیبر مترو و منطقه‌ای قابل استفاده نگه دارد و آسیب‌های فیزیکی را که با فاصله مشخص‌تر می‌شوند جبران کند. تعداد پورت ها نیز مهم است. سیسکو تخمین می‌زند که اتصال دو سایت 100 مگاواتی هوش مصنوعی می‌تواند به 12000 تا 32000 پورت نوری منسجم در لایه مقیاس نیاز داشته باشد، در مقایسه با تقریبا 1000 تا 2000 برای DCI معمولی بین امکانات قابل مقایسه.

با 400G یا 800G در هر پورت، که به ظرفیت کل چند پتابیت می‌افزاید. جابجایی این مقدار داده نیز یک مشکل قدرت و فضا است. پلاگین‌های منسجم، عملکرد فرستنده منسجم را مستقیما در پورت‌های روتر یا سوئیچ قرار می‌دهند و از یک بانک جداگانه از فرستنده‌های مستقل DWDM اجتناب می‌کنند. سیسکو می‌گوید که این امر فضای رک اضافی، قدرت و خنک‌کننده مورد نیاز برای لایه نوری بین‌سایتی را کاهش می‌دهد، که زمانی که کارخانه‌های هوش مصنوعی از قبل با محدودیت انرژی مواجه هستند، توجه مهمی است. مشکل تأخیر حتی با پهنای باند کافی و اپتیک مناسب، فاصله باعث تأخیر می شود.

اگر تراکم ایجاد شود، شبکه به زمان نیاز دارد تا به فرستنده سیگنال دهد تا سرعت خود را کاهش دهد. از طریق یک پارچه هوش مصنوعی محلی، بازخورد می تواند به سرعت برسد. با این حال، اگر اتصال در طول 100 کیلومتر فیبر کشیده شود، قبل از اینکه فرستنده متوجه شود که مشکلی وجود دارد، می توان داده های بیشتری را منتقل کرد. سیسکو محاسبه می کند که در یک اتصال 800 گیگابیت بر ثانیه که 100 کیلومتر را در بر می گیرد، حدود 100 مگابایت داده می تواند در این بازه بازخورد در حال انتقال باشد. سیسکو استدلال می کند که این حلقه های بازخورد طولانی تر ارزش سیلیکون شبکه طراحی شده با بافر عمیق تر را افزایش می دهد.

معماری‌های سوئیچینگ بافر کم عمق که برای تأخیر بسیار کم در داخل یک دیتاسنتر طراحی شده‌اند، ظرفیت کمتری برای جذب ترافیک دارند در حالی که بازخورد ازدحام از یک پیوند طولانی عبور می‌کند. Sivakolundu می‌گوید: «دلیل اینکه با طولانی‌تر شدن فاصله‌ها به بافرهای عمیق‌تری نیاز دارید این است که بازخوردی در مورد انتقال بسته‌ها برای مدت زمان طولانی‌تری دریافت نمی‌کنید».

"اگر به اندازه کافی عمیق بافر نکنید، می توانید بسته ها را رها کنید و مجددا ارسال کنید و تاخیر را افزایش دهید." بافر عمیق یک انفجار یا اختلال موقت را جذب می کند در حالی که مدیریت ترافیک و سیگنالینگ تراکم مشکل اساسی را برطرف می کند. ازدحام پایدار همچنان به ظرفیت بیشتر یا تغییر در نحوه توزیع ترافیک نیاز دارد. همین بافر به اشتراک بیش از حد نیز کمک می کند. اگر ظرفیت ترکیبی تغذیه به یک اتصال بین سایتی بیشتر از ظرفیت خود پیوند باشد، انفجار همگام‌سازی شده می‌تواند سریع‌تر از اتصال آن را تخلیه کند.

بافر کردن باعث می‌شود تا ترافیک اضافی جایی منتظر بماند بدون اینکه از بین برود، در حالی که کنترل‌های تراکم پاسخ می‌دهند. به جای تقسیم بافر موجود به مقادیر ثابت برای هر پورت، یک بافر مشترک یک مخزن مشترک از حافظه بسته است که می تواند در هر جایی که ازدحام ظاهر می شود تخصیص داده شود. این به یک لینک شلوغ اجازه می‌دهد بدون رها کردن بسته‌ها، انفجار بزرگ‌تری را جذب کند. گلد می‌گوید: «هر چه مدت طولانی‌تر به تماس‌ها بپردازید، ممکن است نیاز به بافر بیشتری داشته باشید.

"شما همچنین به انعطاف‌پذیری نیاز دارید تا تا آنجا که ممکن است بافر را در جایی که مورد نیاز است قرار دهید، شاید در یک پورت یا چند پورت که جریان مشکل‌ساز را شناسایی کرده‌اید. رویکرد ما یک بافر واحد و کاملا مشترک است." آموزش هوش مصنوعی یک ویژگی مفید را ارائه می دهد: بسیاری از ارتباطات جمعی آن تکراری است و بنابراین قابل پیش بینی تر از ترافیک DCI است.

رویکرد سیسکو استفاده از مدیریت ازدحام پیشگیرانه برای هدایت یا برنامه ریزی ترافیک قبل از ایجاد یک انفجار قابل پیش بینی است، در حالی که بافر عمیق را به عنوان شبکه ایمن برای تراکم گذرا و رویدادهای غیرقابل پیش بینی مانند خرابی پیوند حفظ می کند. این دو رویکرد مکمل یکدیگر هستند: یکی سعی می‌کند از صف اجتناب کند، در حالی که دیگری به شبکه جایی می‌دهد تا هنگام تشکیل صف، ترافیک را قرار دهد.

شرط بندی سیسکو در طراحی مشترک معماری مقیاسی سیسکو از Silicon One P200 استفاده می کند، یک پردازنده مسیریابی بافر عمیق و قابل برنامه ریزی با سرعت 51.2 ترابیت بر ثانیه که در پلتفرم های Cisco 8223 و Cisco N9000 موجود است. این سیستم‌ها را می‌توان با اپتیک‌های قابل اتصال منسجم 400G و 800G سیسکو برای پیوندهای مسافت طولانی جفت کرد، در حالی که سیستم‌های خط باز مانند Cisco Open Transport 3000 و Cisco NCS 1014 لایه انتقال نوری را در صورت لزوم مدیریت می‌کنند.

پلاگین های منسجم طول موج های DWDM را مستقیما از سیستم مسیریابی تولید می کنند، در حالی که سیستم خط آن طول موج ها را در سراسر کارخانه فیبر تقویت می کند و حمل می کند. برای پیوندهایی که به چندین جفت فیبر موازی نیاز دارند، سیسکو Open Transport 3000 از طراحی چند ریلی استفاده می کند که اجزای نوری را برای چندین ریل در یک کارت خط ترکیب می کند. سیسکو ادعا می کند که این امر باعث کاهش 75 درصدی برق در هر ریل و 80 درصدی فضای رک می شود. در مواردی که یک سیستم حمل و نقل جداگانه مورد نیاز است، NCS 1014 می تواند 12.8 ترابیت بر ثانیه ظرفیت را از کارت خط 1RU ارائه دهد.

P200 دارای یک پردازنده شبکه قابل برنامه ریزی و ابزار P4 است که سیسکو می گوید به جای اینکه هر تغییری را به نسل جدید سیلیکونی وابسته کند، به پشتیبانی از پروتکل، تله متری و سایر ویژگی های پردازش بسته اجازه می دهد تا در نرم افزار توسعه داده شوند. Sivakolundu می‌گوید: برای مقیاس گسترده، جایی که اپراتورها هنوز توپولوژی‌های مختلف و روش‌های مدیریت ترافیک را آزمایش می‌کنند، «انعطاف‌پذیری قابل برنامه‌ریزی یکسان می‌تواند به عملکردهای شبکه اجازه دهد بدون هر نیاز جدیدی که مجبور به جایگزینی تراشه شود، تکامل یابد.

سیسکو همچنین شامل حفاظت مبتنی بر سخت افزار برای ترافیک بین سایتی در آن طراحی است، استدلال آن این است که رمزگذاری نباید گلوگاه پردازش دیگری را برای بافت آموزشی ایجاد کند. یکی از بخش های کلیدی سیسکو طراحی مشترک است. یک ASIC شبکه ای سال ها قبل از رسیدن روتر نهایی به مرکز داده تعریف می شود.

سیسکو استدلال می‌کند که چون تیم‌های سیلیکون، سیستم و اپتیک آن در یک شرکت قرار دارند، الزامات مربوط به چگالی پورت، بافر، قدرت، تله متری و رابط‌های نوری می‌توانند به طراحی تراشه بازخورد دهند تا اینکه تیم سیستم یک ASIC تجاری را دریافت کند و آنچه را که می‌تواند پیرامون آن بسازد، بررسی کند. این بدان معنا نیست که مقیاس در یک معماری تایید شده است. سیسکو خود این مشکل را به پردیس، مترو و استقرار منطقه‌ای تقسیم می‌کند و اپراتورهای مختلف در حال آزمایش ترکیب‌های مختلفی از شبکه‌ها و تکنیک‌های آموزشی هستند.

پیاده سازی ها برحسب اپراتور به طور قابل توجهی متفاوت است، از جمله فاصله، توپولوژی و طراحی حجم کار، در حالی که مشکل رایج حفظ عملکرد هماهنگ هوش مصنوعی در بین سایت ها است. با این حال، این فناوری هنوز در مرحله اولیه است. گلد می‌گوید: «اکنون شاهد استقرار اولیه هستیم، اما این یک فرآیند است و فکر می‌کنم چند سال طول بکشد. طراحی شبکه ای برای آموزش توزیع شده، تأخیر فاصله را از بین نمی برد، اما می تواند از تبدیل شدن به گلوگاه این اتصال متقابل جلوگیری کند.

این به اپراتورهای هایپرمقیاس و اپراتورهای دیتاسنتر انعطاف پذیری می دهد تا محاسبات را در جایی که قدرت و فضا در دسترس است اضافه کنند، در حالی که همچنان چندین سایت را به عنوان بخشی از یک زیرساخت آموزشی در نظر می گیرند. با حمایت سیسکو

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Growing pains: how distributed AI training changes the network between datacenters

SPONSORED FEATURE: While linking the GPUs in a datacenter is a challenge, coordinating thousands of them to work efficiently over hundreds of kilometers presents a new set of difficulties.

همه‌ی اخبار فناوری