وقتی یک دیتاسنتر دیگر کافی نیست
پست اسپانسر شده: چرا آموزش هوش مصنوعی در چندین سایت باعث ایجاد یک چالش شبکه جدید شده است
آموزش بزرگترین مدلهای هوش مصنوعی دیگر صرفا با اضافه کردن پردازندههای گرافیکی بیشتر نیست. همانطور که خوشه ها رشد می کنند، در دسترس بودن نیرو در حال تبدیل شدن به یک محدودیت فیزیکی سخت است و تیم های زیرساخت را مجبور می کند تا در نظر بگیرند که چگونه یک بار آموزشی واحد می تواند در چندین مرکز داده عمل کند. این یک مشکل شبکه بسیار متفاوت ایجاد می کند. اتصال سنتی مرکز داده برای جابجایی ترافیک بین سایت ها طراحی شده است. آموزش هوش مصنوعی به چیز دقیقتری نیاز دارد: جریانهای عظیم و همزمان، حداقل از دست دادن بستهها و ارتباط کاملا هماهنگ بین GPU.
اگر یک قسمت از خوشه متوقف شود، ضربه می تواند در کل کار موج بزند. در این مصاحبه، تیم فیلیپس از The Register با Rakesh Chopra، SVP، Silicon and Systems Architecture، Sisco Fellow، در مورد آنچه که سیسکو «Scale-Across» می نامد و چرا معتقد است زیرساخت هوش مصنوعی توزیع شده نیازمند رویکرد جدیدی برای مسیریابی است صحبت می کند. راکش توضیح می دهد که چگونه خواسته های هوش مصنوعی نقش شبکه را تغییر می دهد، از حمل و نقل ساده به بخشی جدایی ناپذیر از سیستم محاسباتی.
او در مورد چالش ایجاد امکانات جدا از هم جغرافیایی بیشتر شبیه به یک ماشین قطعی واحد و اینکه چرا بافر، اپتیک منسجم با سرعت بالا و ماده سیلیکونی کاملا یکپارچه زمانی که حجم کاری پیوندهای فیبر مسافت طولانی را در بر می گیرد، بحث می کند. گفتگو همچنین به درون خود خوشه نگاه می کند. Rakesh توضیح می دهد که چگونه معماری Silicon One و شبکه هوشمند جمعی سیسکو برای مدیریت انفجارهای همگام ترافیک GPU، کاهش تنگناها و بهبود زمان تکمیل کار طراحی شده است.
بهره وری انرژی یکی دیگر از موضوعات اصلی است، از جمله مبادله بین مصرف شبکه و انرژی در دسترس GPUها. امنیت و طول عمر نیز مورد توجه قرار می گیرد. این مصاحبه MACsec و IPsec با شتاب سختافزاری را پوشش میدهد و همچنین نقش برنامهپذیری را در کمک به زیرساختها برای انطباق با ادامه تکامل بارهای کاری هوش مصنوعی پوشش میدهد. برای رهبران زیرساختها و مراکز داده که برای محیطهای هوش مصنوعی بزرگتر و توزیعشدهتر برنامهریزی میکنند، این بحث دیدگاهی عملی از چالشهای شبکهای را ارائه میدهد که وقتی یک سایت دیگر کافی نیست، ظاهر میشوند. مصاحبه کامل را در ادامه مشاهده کنید.
متن اصلی (انگلیسی)
When one datacenter is no longer enough
SPONSORED POST: Why training AI across multiple sites is creating a new networking challenge