استارت آپ های شبکه هوش مصنوعی برای جایگزینی NVLink انویدیا رقابت می کنند
Cornelis اسپین آف اینتل و Delos Data که تازه وارد است، جایگزین هایی را برای مقیاس بندی هوش مصنوعی فراتر از رک ارائه می کنند.
همانطور که Nvidia نفوذ خود را از طریق فناوری NVLink Fusion خود گسترش می دهد، فروشندگان شبکه های رقیب در تلاش هستند تا اتصالات و سوئیچ های جایگزین را به بازار بیاورند. در اجلاس AI Infra Summit این هفته، Delos Data و Cornelis Networks رسما وارد رقابت شبکههای افزایش مقیاس شدند. پارچههای افزایشیافته، مانند NVLink، چیزی هستند که به انویدیا اجازه میدهند تا هشت، ۷۲ و اکنون ۵۷۶ GPU را بهعنوان یک شتابدهنده هوش مصنوعی عظیم رفتار کنند. برای عقب افتادن، رقبایی مانند AMD از پروتکل های نوظهوری مانند Ultra Accelerator Link استقبال کرده اند. امروزه، این پروتکل ها عمدتا روی سوئیچ های اترنت استاندارد تونل می شوند.
به عنوان مثال، AMD از سوئیچ های برادکام 102.4 ترابیت بر ثانیه مبتنی بر Tomahawk 6 استفاده می کند که به ورودی/خروجی سفارشی در MI455X متصل می شوند. سوئیچهای UALink و اتصالات فیزیکی هدفگذاری شده همچنان مبهم باقی میمانند، اما اگر Cornelis و Delos راه خود را داشته باشند، این موضوع برای مدت طولانی صادق نخواهد بود. این دو شرکت از چند زوایای مختلف از جمله استانداردسازی، بهینه سازی نرم افزار و سخت افزار فیزیکی به این چالش نزدیک می شوند.
تنظیم استاندارد برای شبکه Never-Nvidia در AI Infra در روز دوشنبه، فروشنده شبکه HPC محور Cornelis، Active Compute Fabric (ACF) را معرفی کرد که به دنبال ایجاد یک معماری باز برای بزرگکردن و بزرگتر کردن شبکه است که محاسبات قابل برنامهریزی را در پارچه ادغام میکند. این استاندارد ورود کورنلیس به عرصه شبکههای بزرگ را نشان میدهد. فناوری Omni-Path Cornelis که در سال 2020 از اینتل خارج شد، در ابتدا به عنوان یک اتصال متقابل مقیاسپذیر برای برنامههای محاسباتی با کارایی بالا، از جمله ابررایانههایی مانند Trinity و Lynx طراحی شد.
با رونمایی قریبالوقوع سوئیچها و NICهای سری CN6000 با قابلیت 800 گیگابیت بر ثانیه، این شرکت نهتنها هدف خود را برای ارائه فناوری خود به مخاطبان گستردهتر از طریق پروتکل اولترا اترنت باز، بلکه به شبکههای بزرگتر نیز در نظر دارد. ACF ماموریت فناوریهایی مانند UALink و اترنت برای شبکهسازی مقیاسپذیر را گسترش میدهد، پروتکل دیگری که مقیاس شبکه را افزایش میدهد، تا پایهای برای قابلیتهای محاسباتی درون شبکه در طیف گستردهای از سختافزار، نه فقط قطعات سری CN خود کورنلیس، تعیین کند.
یکی از فناوریهای کلیدی پشت ASICهای NVSwitch Nvidia، پشتیبانی از SHARP است که به مواردی مانند مجموعههای درون شبکه اجازه میدهد تا در ASIC سوئیچ بارگذاری شوند، محاسبات GPU را آزاد میکند و هزینههای ارتباطی را کاهش میدهد. شتاب جمعی به هیچ وجه چیز جدیدی نیست، زیرا فروشندگان اصلی شبکه از Broadcom تا Cisco آن را در برخی ظرفیت ها پیاده سازی کرده اند. بهعنوان یک معماری باز، به نظر میرسد ACF کمترین مخرج مشترک را تعیین میکند تا مشتریانی که این سیستمها را به کار میگیرند دقیقا بدانند که چه چیزی دریافت میکنند. با این حال، به همین جا ختم نمی شود.
کورنلیس فرصت هایی را برای سرعت بخشیدن به انواع عملکردهای دیگر می بیند. ما چند مورد را در زیر توضیح دادهایم: بارگذاری حافظه پنهان KV برای ذخیره و بازیابی وضعیت مدل در چندین جلسه استفاده میشود. اعزام متخصص وزارت دفاع برای کاهش نقل و انتقالات تکراری و هزینه های ارتباطی برای مدل های ترکیبی از متخصصان در طول استنتاج و آموزش. بارگذاری رابط ارسال پیام برای برنامه های کاربردی HPC محور. در بازرسی پارچه برای بازیابی شکست در حین تمرین و سایر بارهای کاری بزرگ. این شرکت توضیح داد: «سربار ارتباطات و همگامسازی میتواند شتابدهندههای گران قیمت را کم استفاده کند.
این شتابدهندههای درونشبکه «به شبکه اجازه میدهند تا هنگام حرکت در سیستم، روی دادهها کار کند». به گفته کورنلیس، پتانسیل صرفه جویی ناشی از بازیابی آن محاسبات بیکار قابل توجه است. در یک سیستم 100000 GPU، مدلسازی کورنلیس از دادههای عمومی نشان میدهد که تقریبا نیمی از کل ساعتهای GPU در انتظار داده صرف میشود، ارزشی معادل 1.68 میلیارد دلار در سال در ظرفیت تلف شده و 500 گیگاوات ساعت نیرو. طبق معمول، این ادعاها را با کمی نمک بپذیرید. با این حال، بازیابی زمان بیکاری GPU با صرفه جویی قابل توجهی برابری می کند.
از بین بردن تمام تنگناهایی که به آنها کمک می کند گفتن از انجام آن آسان تر است. نوع جدیدی از NIC برای عصر هوش مصنوعی در حالی که کورنلیس از معماری ACF خود دفاع میکند، Delos Data، استارتآپی که توسط شبکههای پابرهنه و مدیران سابق اینتل تأسیس شده است، قصد دارد لایه فیزیکی را با مجموعهای از طرحهای مرجع شبکه جدید مقابله کند. این رابطهای شبکه که تحت مجموعهای از هوش مصنوعی بدون توقف آن به بازار عرضه میشوند، طیف کاملی از اتصال را از اتصالات مشترک بستهبندی شده تا NICهای سنتیتر را در بر میگیرد.
این شرکت توضیح میدهد که ایده این است که به مشتریان طرحی در سطح سیستم برای سرعت بخشیدن به حرکت دادهها بین نقاط پایانی و امکان مقیاسبندی دامنههای محاسباتی بزرگتر از یک رک واحد ارائه دهد. رابط داده Delos به سه شکل ارائه خواهد شد. اولی یک دای ورودی/خروجی است که قادر است بیش از 30 ترابایت در ثانیه پهنای باند کل یا حدود 8 ترابایت بر ثانیه را در هر جهت داشته باشد. این بیش از دو برابر پهنای باند اتصال بین آخرین شتاب دهنده های انویدیا یا AMD است که به 3.6 ترابایت بر ثانیه محدود می شود.
اینکه در نهایت چقدر رقابتی شود بستگی به این دارد که چیپلت های I/O Delos واقعا چه زمانی استقرار را ببینند. این جدول زمانی به شدت به یکپارچهسازی بستگی دارد، زیرا آنهای ورودی/خروجی باید مستقیما در بسته شتابدهنده ادغام شوند، که به درجه بالایی از طراحی مشترک نیاز دارد. به طور بحرانی، Delos سعی نمی کند مشتریان خود را به همان اندازه ای که انویدیا با ورودی یا IP NVLink Fusion I/O خود انجام می دهد، در یک باغ دیواری به دام بیاندازد. حداقل در زمان نگارش، NVLink Fusion همچنان مشتریان را ملزم به خرید NVSwitches برای شبکههای بزرگ میکند. چیپلت های Delos دارای پروتکل آگنوستیک هستند.
برای آنها مهم نیست که از ESUN، UALink یا چیز دیگری استفاده می کنید. طراحان تراشه که ترجیح میدهند تلاشها و سرمایهشان را بر روی بیتهای هوش مصنوعی شتابدهندههایشان متمرکز کنند - که به نظر میرسد، برای اکثر مقیاسکنندههای بزرگ اعمال میشود - میتوانند به سادگی به طراحی چیپلت Delos مجوز دهند. این آگنوستیک پروتکل همچنین به فناوری اپتیک نزدیک بستهبندی شده (NPO) Delos نیز تعمیم مییابد که یک رابط داده 10 ترابایتی در ثانیه - که پهنای باند دو طرفه 2.5 ترابایت بر ثانیه در Nvidia speak است - با موتورهای اپتیک از تامینکنندگان پیشرو اپتیک ادغام میکند.
سیستمهای مقیاس رک، مانند NVL72 انویدیا، تا این لحظه به دلیل محدودیتهای برق، تا حد زیادی به اتصالات مسی متکی بودهاند. همانطور که سیستم ها از 72 سیستم رک GPU به کلاسترهای در مقیاس ردیفی با 576 و در نهایت 1152 GPU رشد می کنند، اپتیک اجتناب ناپذیر می شود. در حالی که ادغام اپتیک به طور مستقیم در شتاب دهنده ها با استفاده از فناوری موجود امروزی امکان پذیر است، شعاع انفجار یک ماژول نوری شکست خورده قابل توجه است. NPO یک جایگزین ارائه می دهد. اتصالات مسی در داخل قفسه استفاده می شود و اپتیک از طریق ماژول های NPO قابل سرویس دهی بین رک ها ارائه می شود.
در نهایت، Delos در حال کار بر روی یک NIC با سرعت 400 گیگابیت بر ثانیه است، که مانند بقیه رابطهای دادهای که ارائه میکند، پروتکلهای آگنوستیک هستند. مسلما این کمترین تعجب آور در کل ترکیب است. شبکههای کوچکتر همچنان برای خوشههای آموزشی بزرگ و همچنین برای شبکههای دسترسی و ذخیرهسازی front-end مورد نیاز هستند.
این رابطها بر اساس طراحی مرجع محاسباتی موجود Delos، که در طول Computex به آن نگاه کردیم، و همچنین پلتفرم نرمافزار هوش مصنوعی بدون توقف آن، که برای تسهیل پیکربندی و نظارت بر این پارچهها یا مشهای سوئیچشده به منظور فعال کردن مسیریابی مجدد دینامیک ترافیک در صورت خرابی پیوند، طراحی شده است. تله متری جمع آوری شده توسط رابط داده های ارائه شده آن امکان دید حتی بیشتر در شبکه را فراهم می کند و امکان مسیریابی و بازیابی سریع تر را فراهم می کند. تقویت رقابت سرمایه گذاران بیش از حد مشتاق رقابت بیشتر در عرصه افزایش مقیاس هستند.
کورنلیس در کنار اعلامیههای محصول خود، حدود 205 میلیون دلار بودجه برای ارتقاء نسل بعدی مقیاس خود و عرضه محصولات شبکه به بازار اعلام کرد. در همین حال، Delos Data روز سه شنبه اعلام کرد که اکنون بیش از 100 میلیون دلار بودجه با حمایت شرکت های سرمایه گذاری خطرپذیر Matrix، Playground و Socratic Partners جمع آوری کرده است. ®
متن اصلی (انگلیسی)
AI networking startups race to replace Nvidia's NVLink
Intel spin-off Cornelis and newcomer Delos Data pitch open alternatives for scaling AI beyond the rack