پرش به محتوای اصلی

استارت آپ های شبکه هوش مصنوعی برای جایگزینی NVLink انویدیا رقابت می کنند

دِ رجیستر۱۴۰۵ شهریور ۲۵, چهارشنبه، ساعت ۰۰:۲۶حدود 6 دقیقه مطالعه

Cornelis اسپین آف اینتل و Delos Data که تازه وارد است، جایگزین هایی را برای مقیاس بندی هوش مصنوعی فراتر از رک ارائه می کنند.

همانطور که Nvidia نفوذ خود را از طریق فناوری NVLink Fusion خود گسترش می دهد، فروشندگان شبکه های رقیب در تلاش هستند تا اتصالات و سوئیچ های جایگزین را به بازار بیاورند. در اجلاس AI Infra Summit این هفته، Delos Data و Cornelis Networks رسما وارد رقابت شبکه‌های افزایش مقیاس شدند. پارچه‌های افزایش‌یافته، مانند NVLink، چیزی هستند که به انویدیا اجازه می‌دهند تا هشت، ۷۲ و اکنون ۵۷۶ GPU را به‌عنوان یک شتاب‌دهنده هوش مصنوعی عظیم رفتار کنند. برای عقب افتادن، رقبایی مانند AMD از پروتکل های نوظهوری مانند Ultra Accelerator Link استقبال کرده اند. امروزه، این پروتکل ها عمدتا روی سوئیچ های اترنت استاندارد تونل می شوند.

به عنوان مثال، AMD از سوئیچ های برادکام 102.4 ترابیت بر ثانیه مبتنی بر Tomahawk 6 استفاده می کند که به ورودی/خروجی سفارشی در MI455X متصل می شوند. سوئیچ‌های UALink و اتصالات فیزیکی هدف‌گذاری شده همچنان مبهم باقی می‌مانند، اما اگر Cornelis و Delos راه خود را داشته باشند، این موضوع برای مدت طولانی صادق نخواهد بود. این دو شرکت از چند زوایای مختلف از جمله استانداردسازی، بهینه سازی نرم افزار و سخت افزار فیزیکی به این چالش نزدیک می شوند.

تنظیم استاندارد برای شبکه Never-Nvidia در AI Infra در روز دوشنبه، فروشنده شبکه HPC محور Cornelis، Active Compute Fabric (ACF) را معرفی کرد که به دنبال ایجاد یک معماری باز برای بزرگ‌کردن و بزرگ‌تر کردن شبکه است که محاسبات قابل برنامه‌ریزی را در پارچه ادغام می‌کند. این استاندارد ورود کورنلیس به عرصه شبکه‌های بزرگ را نشان می‌دهد. فناوری Omni-Path Cornelis که در سال 2020 از اینتل خارج شد، در ابتدا به عنوان یک اتصال متقابل مقیاس‌پذیر برای برنامه‌های محاسباتی با کارایی بالا، از جمله ابررایانه‌هایی مانند Trinity و Lynx طراحی شد.

با رونمایی قریب‌الوقوع سوئیچ‌ها و NIC‌های سری CN6000 با قابلیت 800 گیگابیت بر ثانیه، این شرکت نه‌تنها هدف خود را برای ارائه فناوری خود به مخاطبان گسترده‌تر از طریق پروتکل اولترا اترنت باز، بلکه به شبکه‌های بزرگ‌تر نیز در نظر دارد. ACF ماموریت فناوری‌هایی مانند UALink و اترنت برای شبکه‌سازی مقیاس‌پذیر را گسترش می‌دهد، پروتکل دیگری که مقیاس شبکه را افزایش می‌دهد، تا پایه‌ای برای قابلیت‌های محاسباتی درون شبکه در طیف گسترده‌ای از سخت‌افزار، نه فقط قطعات سری CN خود کورنلیس، تعیین کند.

یکی از فناوری‌های کلیدی پشت ASIC‌های NVSwitch Nvidia، پشتیبانی از SHARP است که به مواردی مانند مجموعه‌های درون شبکه اجازه می‌دهد تا در ASIC سوئیچ بارگذاری شوند، محاسبات GPU را آزاد می‌کند و هزینه‌های ارتباطی را کاهش می‌دهد. شتاب جمعی به هیچ وجه چیز جدیدی نیست، زیرا فروشندگان اصلی شبکه از Broadcom تا Cisco آن را در برخی ظرفیت ها پیاده سازی کرده اند. به‌عنوان یک معماری باز، به نظر می‌رسد ACF کمترین مخرج مشترک را تعیین می‌کند تا مشتریانی که این سیستم‌ها را به کار می‌گیرند دقیقا بدانند که چه چیزی دریافت می‌کنند. با این حال، به همین جا ختم نمی شود.

کورنلیس فرصت هایی را برای سرعت بخشیدن به انواع عملکردهای دیگر می بیند. ما چند مورد را در زیر توضیح داده‌ایم: بارگذاری حافظه پنهان KV برای ذخیره و بازیابی وضعیت مدل در چندین جلسه استفاده می‌شود. اعزام متخصص وزارت دفاع برای کاهش نقل و انتقالات تکراری و هزینه های ارتباطی برای مدل های ترکیبی از متخصصان در طول استنتاج و آموزش. بارگذاری رابط ارسال پیام برای برنامه های کاربردی HPC محور. در بازرسی پارچه برای بازیابی شکست در حین تمرین و سایر بارهای کاری بزرگ. این شرکت توضیح داد: «سربار ارتباطات و همگام‌سازی می‌تواند شتاب‌دهنده‌های گران قیمت را کم استفاده کند.

این شتاب‌دهنده‌های درون‌شبکه «به شبکه اجازه می‌دهند تا هنگام حرکت در سیستم، روی داده‌ها کار کند». به گفته کورنلیس، پتانسیل صرفه جویی ناشی از بازیابی آن محاسبات بیکار قابل توجه است. در یک سیستم 100000 GPU، مدل‌سازی کورنلیس از داده‌های عمومی نشان می‌دهد که تقریبا نیمی از کل ساعت‌های GPU در انتظار داده صرف می‌شود، ارزشی معادل 1.68 میلیارد دلار در سال در ظرفیت تلف شده و 500 گیگاوات ساعت نیرو. طبق معمول، این ادعاها را با کمی نمک بپذیرید. با این حال، بازیابی زمان بیکاری GPU با صرفه جویی قابل توجهی برابری می کند.

از بین بردن تمام تنگناهایی که به آنها کمک می کند گفتن از انجام آن آسان تر است. نوع جدیدی از NIC برای عصر هوش مصنوعی در حالی که کورنلیس از معماری ACF خود دفاع می‌کند، Delos Data، استارت‌آپی که توسط شبکه‌های پابرهنه و مدیران سابق اینتل تأسیس شده است، قصد دارد لایه فیزیکی را با مجموعه‌ای از طرح‌های مرجع شبکه جدید مقابله کند. این رابط‌های شبکه که تحت مجموعه‌ای از هوش مصنوعی بدون توقف آن به بازار عرضه می‌شوند، طیف کاملی از اتصال را از اتصالات مشترک بسته‌بندی شده تا NIC‌های سنتی‌تر را در بر می‌گیرد.

این شرکت توضیح می‌دهد که ایده این است که به مشتریان طرحی در سطح سیستم برای سرعت بخشیدن به حرکت داده‌ها بین نقاط پایانی و امکان مقیاس‌بندی دامنه‌های محاسباتی بزرگ‌تر از یک رک واحد ارائه دهد. رابط داده Delos به سه شکل ارائه خواهد شد. اولی یک دای ورودی/خروجی است که قادر است بیش از 30 ترابایت در ثانیه پهنای باند کل یا حدود 8 ترابایت بر ثانیه را در هر جهت داشته باشد. این بیش از دو برابر پهنای باند اتصال بین آخرین شتاب دهنده های انویدیا یا AMD است که به 3.6 ترابایت بر ثانیه محدود می شود.

اینکه در نهایت چقدر رقابتی شود بستگی به این دارد که چیپلت های I/O Delos واقعا چه زمانی استقرار را ببینند. این جدول زمانی به شدت به یکپارچه‌سازی بستگی دارد، زیرا آن‌های ورودی/خروجی باید مستقیما در بسته شتاب‌دهنده ادغام شوند، که به درجه بالایی از طراحی مشترک نیاز دارد. به طور بحرانی، Delos سعی نمی کند مشتریان خود را به همان اندازه ای که انویدیا با ورودی یا IP NVLink Fusion I/O خود انجام می دهد، در یک باغ دیواری به دام بیاندازد. حداقل در زمان نگارش، NVLink Fusion همچنان مشتریان را ملزم به خرید NVSwitches برای شبکه‌های بزرگ می‌کند. چیپلت های Delos دارای پروتکل آگنوستیک هستند.

برای آنها مهم نیست که از ESUN، UALink یا چیز دیگری استفاده می کنید. طراحان تراشه که ترجیح می‌دهند تلاش‌ها و سرمایه‌شان را بر روی بیت‌های هوش مصنوعی شتاب‌دهنده‌هایشان متمرکز کنند - که به نظر می‌رسد، برای اکثر مقیاس‌کننده‌های بزرگ اعمال می‌شود - می‌توانند به سادگی به طراحی چیپلت Delos مجوز دهند. این آگنوستیک پروتکل همچنین به فناوری اپتیک نزدیک بسته‌بندی شده (NPO) Delos نیز تعمیم می‌یابد که یک رابط داده 10 ترابایتی در ثانیه - که پهنای باند دو طرفه 2.5 ترابایت بر ثانیه در Nvidia speak است - با موتورهای اپتیک از تامین‌کنندگان پیشرو اپتیک ادغام می‌کند.

سیستم‌های مقیاس رک، مانند NVL72 انویدیا، تا این لحظه به دلیل محدودیت‌های برق، تا حد زیادی به اتصالات مسی متکی بوده‌اند. همانطور که سیستم ها از 72 سیستم رک GPU به کلاسترهای در مقیاس ردیفی با 576 و در نهایت 1152 GPU رشد می کنند، اپتیک اجتناب ناپذیر می شود. در حالی که ادغام اپتیک به طور مستقیم در شتاب دهنده ها با استفاده از فناوری موجود امروزی امکان پذیر است، شعاع انفجار یک ماژول نوری شکست خورده قابل توجه است. NPO یک جایگزین ارائه می دهد. اتصالات مسی در داخل قفسه استفاده می شود و اپتیک از طریق ماژول های NPO قابل سرویس دهی بین رک ها ارائه می شود.

در نهایت، Delos در حال کار بر روی یک NIC با سرعت 400 گیگابیت بر ثانیه است، که مانند بقیه رابط‌های داده‌ای که ارائه می‌کند، پروتکل‌های آگنوستیک هستند. مسلما این کمترین تعجب آور در کل ترکیب است. شبکه‌های کوچک‌تر همچنان برای خوشه‌های آموزشی بزرگ و همچنین برای شبکه‌های دسترسی و ذخیره‌سازی front-end مورد نیاز هستند.

این رابط‌ها بر اساس طراحی مرجع محاسباتی موجود Delos، که در طول Computex به آن نگاه کردیم، و همچنین پلتفرم نرم‌افزار هوش مصنوعی بدون توقف آن، که برای تسهیل پیکربندی و نظارت بر این پارچه‌ها یا مش‌های سوئیچ‌شده به منظور فعال کردن مسیریابی مجدد دینامیک ترافیک در صورت خرابی پیوند، طراحی شده است. تله متری جمع آوری شده توسط رابط داده های ارائه شده آن امکان دید حتی بیشتر در شبکه را فراهم می کند و امکان مسیریابی و بازیابی سریع تر را فراهم می کند. تقویت رقابت سرمایه گذاران بیش از حد مشتاق رقابت بیشتر در عرصه افزایش مقیاس هستند.

کورنلیس در کنار اعلامیه‌های محصول خود، حدود 205 میلیون دلار بودجه برای ارتقاء نسل بعدی مقیاس خود و عرضه محصولات شبکه به بازار اعلام کرد. در همین حال، Delos Data روز سه شنبه اعلام کرد که اکنون بیش از 100 میلیون دلار بودجه با حمایت شرکت های سرمایه گذاری خطرپذیر Matrix، Playground و Socratic Partners جمع آوری کرده است. ®

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

AI networking startups race to replace Nvidia's NVLink

Intel spin-off Cornelis and newcomer Delos Data pitch open alternatives for scaling AI beyond the rack

همه‌ی اخبار فناوری