تقویت انقلاب هوش مصنوعی: در داخل شبکه، چالشهای حرارتی و اتصالات داخلی رشد مرکز داده را محدود میکند
ما به بررسی تنگناهای الکتریکی، حرارتی و زیرساختی که بر انقلاب محاسباتی نسل بعدی تأثیر میگذارند، میپردازیم.
رونق هوش مصنوعی به سرعت به محدودیت های فیزیکی ظرفیت شبکه و اتلاف حرارتی می رسد. شبکه برق مثل همیشه کشیده شده است و باعث می شود تا مراکز داده هوش مصنوعی منتظر اتصال طولانی تری باشند و سیستم های خنک کننده هوا و مایع معمولی برای برآورده کردن نیازهای تسهیلات به سرعت در حال رشد تلاش می کنند.
از آنجایی که مراکز داده هوش مصنوعی با سرعتی سریع به رشد خود ادامه میدهند، اکنون با ترکیبی از چالشها، از توان محاسباتی پیشیگرفتن از تواناییهای انتقال داده در اتصالات GPU گرفته تا نوسانات بار فرار، سیستمهای تصحیح ضریب توان شبکه (PFC) و چگالی توان رک که بیش از حد بارگذاری سیستمهای خنککننده سنتی را ادامه میدهند، مواجه هستند.
بیایید گلوگاههای اصلی حرارتی و الکتریکی را که رونق هوش مصنوعی را کند میکنند و اینکه چگونه شرکتها در حال نوآوری در راه خود هستند را بشکنیم.
دیوار حرارتی (اصطکاک در سطح قفسه)
رکهای سرور استاندارد گرمای زیادی تولید میکنند و خوشههای GPU با کارایی بالا حتی بیشتر تولید میکنند و محدودیتهای حرارتی را بیش از همیشه افزایش میدهند. رکهای GPU مدرن بیش از 50 تا 100 کیلووات مصرف انرژی در هر کابینت دارند که روشهای خنککننده سنتی هوا و مایع را ناکافی میسازد.
سیستم های خنک کننده استاندارد، خوشه ها را بین 65 تا 85 درجه کار می کنند، اما 90 تا 100 درجه باعث کاهش عملکرد برای جلوگیری از آسیب دائمی GPU می شود. با استفاده از قفسههای GPU که انرژی الکتریکی عظیمی را جذب میکنند و به گرما تبدیل میشوند، جلوگیری از رسیدن به محدودیتهای دریچه گاز سختتر از همیشه شده است.
سیستمهای خنککننده هوای سنتی برای تراکم قفسههای بیش از 30 تا 40 کیلووات ساخته نشدهاند، که خوشههای هوش مصنوعی به راحتی از آن فراتر میروند و 100 کیلووات یا بیشتر به یک استاندارد تبدیل میشوند. حفظ جریان هوا در تراکم های بالا برای خنک کردن قفسه های برق 100 کیلووات به بالا مستلزم کارکردن فن های پرقدرت با سرعت های فوق العاده است. این باعث کاهش انرژی الکتریکی و بدتر شدن کارایی مصرف انرژی (PUE) برای مراکز داده می شود. برای خنک کردن کلسترهای هوش مصنوعی تنها با هوا، اپراتورها به جریان هوای "درجه طوفان" نیاز دارند که غیرعملی است. پس خنک کننده مایع چطور؟
خنککننده مایع به مکانیک سیالات متکی است، جایی که صفحات سرد از میکروکانالها استفاده میکنند تا جریانهای آشفته را مستقیما روی تراشهها تحمیل کنند تا خنک نگه دارند. نگه داشتن حجم کافی از سیال در جریان این میکروکانال ها به قدرت پمپاژ عظیمی نیاز دارد که یک محدودیت فزاینده برای اپراتورهای مرکز داده است. برای کاهش این چالش، اپراتورها از صفحات سرد مستقیم به تراشه استفاده میکنند که مستقیما روی پردازنده نصب میشوند، نه روی آن، تا خنک نگهدارند و در عین حال توان پمپاژ کمتری مصرف میکنند.
(اعتبار تصویر: مایکروسافت) مکانیک تغییر فاز همچنین به خوشههای GPU کمک میکند تا کارآمدتر خنک شوند. در اینجا، خوشهها از گرمای نهان تبخیر مایع یا انتقال جامد به مایع برای جذب گرمای عظیم از رکهای GPU با چگالی بالا استفاده میکنند. مایع دی الکتریک تخصصی مستقیما با پردازندههای گرافیکی داغ در تماس است و سپس به بخار میجوشد تا فورا گرما را از بین ببرد. سپس بخار بالا میآید، به کندانسور میرسد و از طریق گرانش دوباره به قطرات مایع تبدیل میشود، سپس دوباره به استخر میریزد تا این فرآیند تکرار شود.
این فرآیند به عنوان خنک کننده غوطه وری دو فاز شناخته می شود و انرژی خنک کننده را تا 40 درصد کاهش می دهد.
برخی از اپراتورهای مرکز داده به سمت سیستمهای خنککننده مایع حلقه بسته حرکت میکنند، جایی که سیال چرخشی، GPUها را بدون افت تبخیر خنک میکند و نیاز به شارژ مکرر را از بین میبرد.
به عنوان مثال، مایکروسافت، یکی از اپراتورهای برتر مرکز داده از نظر ظرفیت، یک سیستم حلقه بسته را برای مراکز داده جدیدتر پیاده سازی کرده است، که در آن آب یک بار پر می شود و برای جذب گرما به سرورها می چرخد، برای خنک شدن به خنک کننده های با هوا منتقل می شود، سپس برای جذب گرما بدون نیاز به منابع تازه، گردش می کند. این سیستم پرهزینه است و مدتی طول می کشد تا در مقیاس بزرگ راه اندازی شود، اما نشان می دهد که چگونه شرکت ها در برابر تنگناهای حرارتی نوآوری می کنند.
اتصالات و محدودیت های سطح برد
خوشههای GPU برای به اشتراک گذاشتن دادهها، حافظه و بارهای کاری به اتصالات برقی مسی یا نوری متکی هستند. اتصالات مسی الکتریکی برای مدت طولانی استاندارد بوده است، اما بار کاری بالای GPU آنها را به حد مجاز رسانده است.
سیگنالهای الکتریکی در فواصل طولانی (بیشتر از دو متر) قدرت خود را از دست میدهند، با هر بار که نیاز به پهنای باند دو برابر میشود، دسترسی قابل استفاده به نصف کاهش مییابد، و خوشههای عظیم GPU فاصلههای ارتباطی را طولانیتر از همیشه کردهاند. اتصالات مسی نزدیک به هم، تداخل الکترومغناطیسی ایجاد میکنند که سیگنالهای دیگر را مختل میکند و به سیستمهای یکسان سازی پیچیدهای نیاز دارد که انرژی بیشتری را تخلیه میکنند.
همچنین مشکل از دست دادن توان در صفحات مسی روی بردهای مدار GPU (به دلیل مقاومت) وجود دارد. هرچه جریان بیشتری از صفحات مسی منتقل شود، گرمای بیشتری تولید میشود و به انرژی خنککننده بیشتری نیاز دارد که خود در حال حاضر یک گلوگاه است.
با رسیدن اتصالات الکتریکی به محدودیتهای مطلق خود، صاحبان مراکز داده چارهای جز چرخش به اتصالات نوری ندارند، که دادهها را به پالسهای نوری تبدیل میکنند که از طریق کابلهای فیبر نوری با حداقل تلفات در مسافتهای طولانی عبور میکنند. این کابلها بسیار نازکتر از بستههای مسی هستند و مسیرهای جریان هوای بیشتری را در رکهای GPU متراکم و مولد گرما ایجاد میکنند.
شرکتها حتی از کابلهای فیبر نوری قابل اتصال به فوتونیک سیلیکونی یا اپتیک همبسته (CPO) در حال حرکت هستند که در آن مدارهای نوری مستقیما روی پردازندههای گرافیکی تعبیه شدهاند تا نور را در فواصل طولانی منتقل کنند. در حال حاضر، اتصالات نوری بسیار گرانتر از مس الکتریکی هستند و در برخی از تنظیمات GPU تا 7 برابر بیشتر هزینه دارند، اما چارهای جز جذب این هزینه در کوتاهمدت وجود ندارد، زیرا دومی به محدودیتهای فیزیکی رسیده است. از طرف دیگر، با پذیرش بیشتر شرکتها از اتصالات نوری و سرمایهگذاری در تولید انبوه، هزینهها احتمالا کاهش مییابد.
بحران شبکه و پست
در نهایت، اتصال به شبکه برق چالش اصلی بر مراکز داده هوش مصنوعی است. شبکه های الکتریکی مدرن برای مدیریت بارهای به سرعت در حال افزایش مراکز داده هوش مصنوعی طراحی نشده اند، تنها از سال 2021 تا 2025 30 گیگاوات ظرفیت جدید در سراسر جهان اضافه شده است. اضافه شدن سریع در حال رشد زنجیره تامین قطعات شبکه برق را گسترش داده و چالش های مهندسی را معرفی کرده است که اپراتورهای شبکه باید در اطراف آنها کار کنند.
به عنوان مثال، ترانسفورماتورهای ولتاژ بالا که از تحویل ایمن ولتاژ به کلاسترهای GPU اطمینان حاصل می کنند، کمبود دارند. زمان انتظار از 6 تا 12 ماه از سال 2020 به دو تا چهار سال در حال حاضر افزایش یافته است، بسیار بیشتر از زمانی که کلاسترهای GPU گران قیمت می توانند منتظر بمانند تا عملیات خود را تامین کنند.
سیستمهای تصحیح ضریب توان موجود در شبکههای شبکه به دلیل بارگیری گسترده از مراکز داده جدید هوش مصنوعی تحت فشار قرار گرفتهاند. خوشههای GPU تقاضای برق را در عرض چند ثانیه تغییر میدهند، به طوری که یک ثانیه تقاضای استنتاج کم، برق پایدار را از شبکه میگیرد و ثانیه بعد انرژی بیش از حد را به دلیل افزایش مصرف میگیرد. این نوسانات هارمونیک های پیچیده ای را ایجاد می کند که ترانسفورماتورها را بیش از حد گرم می کند و شبکه را تحت تأثیر قرار می دهد و به اپراتورهای شبکه برای سرمایه گذاری هنگفت در سیستم های کاهش نیاز دارد.
خوشههای هوش مصنوعی به سطوح گیگاوات افزایش مییابند، و تابلوهای ولتاژ پایینآمده را تا حد قابل تحملترین حد خود میبرند. ترانسفورماتورهای بزرگتر، مورد نیاز برای خدمت رسانی به این خوشه های سطح گیگاوات، امپدانس الکتریکی پایین تر، جریان های خطای اتصال کوتاه بالقوه بالا را مجبور به پایین آوردن یک خط می کنند. اگر یک اتصال کوتاه اتفاق بیفتد، میدانهای مغناطیسی نیروهای مکانیکی سختی را بر روی شینهای تابلو برق وارد میکنند و باعث خم شدن یا جدا شدن آنها از تکیهگاه مکانیکی خود میشوند. چیزی که بعدا می آید یک شکست ساختاری است که اپراتورهای شبکه یا شبکه های برق مرکز داده ایزوله نمی توانند اجازه دهند که اتفاق بیفتد.
شرکت ها برای مقابله با این تنگناهای الکتریکی به راه حل های مختلفی روی آورده اند. برای نمونه، چرخش عمده ای به ترانسفورماتورهای حالت جامد صورت گرفته است که از الکترونیک قدرت و نیمه هادی های فرکانس بالا برای کاهش ولتاژ استفاده می کنند، نه از میدان های مغناطیسی مانند ترانسفورماتورهای معمولی.
(اعتبار تصویر: Docan Power) الکترونیک فرکانس بالا ترانسفورماتورهای حالت جامد را قادر می سازد تا هارمونیک های ولتاژ و فیلتر را به طور فعال تنظیم کنند و منجر به نوسانات کمتری شود. آنها 97 تا 99 درصد کارایی دارند، در مقایسه با 95 تا 97 درصد برای ترانسفورماتورهای معمولی، و این تفاوت 1 تا 2 درصدی در مراکز داده در سطح گیگاوات بسیار زیاد است. بهتر از آن، آنها بسیار کوچکتر و سبکتر از ترانسفورماتورهای معمولی هستند و لجستیک و استقرار سریعتر را امکان پذیر می کنند.
با این حال، SST ها چالش های خود را معرفی می کنند. قطعات داخلی با فرکانس بالا و تراشههایی که به آنها انرژی میدهند گران هستند، اغلب پنج برابر یا بیشتر در هر کیلوولت آمپر نسبت به جایگزینهای فرکانس پایین. آنها همچنین به چندین مرحله تبدیل توان (AC-DC و DC-AC/DC-DC) و تلفات کوچک در طول این تبدیل ها نیاز دارند که رسیدن به اوج راندمان را دشوار می کند. اجزای داخلی گرما تولید می کنند و سریعتر پیر می شوند و نسبت به ترانسفورماتورهای معمولی به تعمیر و نگهداری فعال بیشتری نیاز دارند.
هزینه نیز یک مسئله است، زیرا ساخت و نگهداری SSTها در حال حاضر بسیار گرانتر از ترانسفورماتورهای مبتنی بر آهنربا هستند. با این حال، با سرمایهگذاری بیشتر در تولید انبوه، هزینهها احتمالا در طول زمان کاهش مییابد و به خوشههای گرافیکی هوش مصنوعی این امکان را میدهد تا آنها را سریعتر بپذیرند. زیمنس، دومین تولید کننده بزرگ ترانسفورماتور در جهان، اخیرا با شرکت فناوری آلمانی Reinhausen برای تولید انبوه ترانسفورماتور حالت جامد مدولار برای مراکز داده هوش مصنوعی شریک شد و این تنها یک نمونه است.
از آنجایی که SST ها را نمی توان فورا در مقیاس پذیرفت و کمبود ترانسفورماتورهای معمولی به زمان انتظار طولانی برای صاحبان شبکه برق کمک کرده است، صاحبان مراکز داده هوش مصنوعی مجبور شده اند امور را به دست خود بگیرند. برخی از آنها سیستمهای تولید برق پشت متری و پستهای خود را برای تامین انرژی خوشههای GPU در حالی که منتظر هستند تا به شبکههای محلی متصل شوند، ساختهاند. xAI، شرکت هوش مصنوعی به رهبری ایلان ماسک، 59 توربین گاز طبیعی قابل حمل با ظرفیت ترکیبی بیش از 400 مگاوات را برای تامین انرژی مرکز داده Colossus خود در ممفیس، تنسی، در حالی که منتظر اتصال به شبکه است، اضافه کرد.
برخی از صاحبان مراکز داده همچنین به راکتورهای کوچک مدولار (SMR) نگاه می کنند، جایی که راکتورهای شکافت هسته ای فشرده در محل نیرو تولید می کنند، اما در این مرحله هنوز در مرحله مفهومی است. SMR ها با محدودیت های مختلفی مواجه هستند، به ویژه هزینه های بسیار بالا در مقایسه با توربین های گازی یا انرژی های تجدید پذیر.
با این حال، بسیاری از مراکز داده دیگر، چه در مراحل اولیه و چه در مراحل پایانی ساخت و ساز یا تکمیل شده، در صف های طولانی برای اتصالات شبکه برق باقی می مانند. به عنوان مثال، در ویرجینیای شمالی، که میزبان بزرگترین مرکز داده جهان است (570 مرکز داده و به تدریج افزایش مییابد)، امکانات جدید برای اتصال به شبکه زمان انتظار تا 14 سال را دارند.
اپراتورهای شبکه برق مستقر در ایالات متحده مبالغ هنگفتی را برای ارتقاء سرمایه گذاری کرده اند (208 میلیارد دلار تنها در سال 2025 و 1.1 تریلیون دلار سرمایه گذاری برنامه ریزی شده از سال 2025 تا 2030، به ازای هر ادیسون الکتریک)، اما همچنان برای پاسخگویی به تقاضای در حال انفجار مرکز داده تلاش می کنند. سرمایهگذاریهای بیشتری برای رفع تنگناهای شبکه الکتریکی مورد نیاز است، و همچنین فناوریهای جدیدی که میتوانند مصرف انرژی مرکز داده را برای کمک به شبکههای توزیع کاهش دهند، مورد نیاز است.
واقعیت استقرار محاسباتی نسل بعدی
با جزئیات فنی، گلوگاههای اتصال به شبکه، حرارتی و GPU را توضیح دادهایم که رونق استقرار محاسبات هوش مصنوعی نسل بعدی را تا حد خود افزایش میدهد. اینها چالشهای فیزیکی و فنی جدی هستند که برای رسیدگی به آنها نیاز به رویکردهای نوآورانه دارد و خوشبختانه هیچ کمبودی در این رویکردها وجود ندارد.
ما مثالهایی مانند روی آوردن اپراتورهای شبکه الکتریکی به ترانسفورماتورهای حالت جامد که به تنظیم ولتاژ فعال و فیلترهای هارمونیک برای پایدار نگه داشتن سیستمهای قدرت اجازه میدهند، یا برخی از اپراتورهای کلاستر GPU که سیستمهای تولید برق خود را میسازند در حالی که منتظر اتصالات شبکه محلی هستند، میسازند، بیان کردهایم.
برای تنگناهای حرارتی، اپراتورهای کلاستر GPU از صفحات سرد مستقیم به تراشه که مستقیما روی GPU ها نصب شده اند، به جای روی آنها استفاده می کنند تا در عین مصرف انرژی کمتر، خنک بمانند. مکانیک تغییر فاز نیز کمک میکند، جایی که بخار مایع گرما را از قفسههای GPU جذب میکند، گرما را از بین میبرد و دوباره به مایع تبدیل میشود تا فرآیند تکرار شود و نیاز انرژی را تا 40 درصد کاهش میدهد.
مایکروسافت سعی کرده است با پیادهسازی یک سیستم خنککننده مایع حلقه بسته، با استفاده از خنککنندههای مایع که به طور مداوم در یک شبکه لولههای مهر و موم شده با حداقل شارژ مجدد چرخش میکنند، چرخ را دوباره اختراع کند.
با این حال، گسترش سیستم های خنک کننده حلقه بسته دشوارتر از سیستم های حلقه باز است، زیرا نیاز به GPU افزایش می یابد، و می توانند تحت بارهای سنگین با کارکرد همزمان موتورهای پمپ و فن های رادیاتور بلندتر باشند. در زمان افزایش واکنش عمومی علیه مراکز داده جدید، نویز محیطی نیز مهم است، نه فقط محدودیت های فنی. سیستمهای حلقه بسته نیز گرانتر هستند، اما هزینهها میتواند به مرور زمان کاهش یابد، زیرا شرکتهای بیشتری از آنها استفاده میکنند.
برای محدودیتهای اتصال در سطح برد مدار، شرکتها از کابلهای مسی الکتریکی به کابلهای فیبر نوری سوئیچ میکنند، زیرا آنها دادهها را سریعتر و قابل اطمینانتر در فواصل طولانی انتقال میدهند، حتی اگر هزینه بیشتری داشته باشند. سازندگان GPU در حال کار بر روی تعبیه مدارهای نوری به طور مستقیم بر روی تراشه ها هستند تا نور را حتی بهتر از کابل ها انتقال دهند.
با وجود این چالشها، مراکز داده هوش مصنوعی با سرعت 66 گیگاوات ظرفیت جدید در حال ساخت تنها در آمریکای شمالی در حال ساخت هستند.
با نگاهی به آینده، واضح است که اتفاقات زیادی در این زمینه میافتد و تماشای رویکردهای مختلفی که شرکتها برای غلبه بر تنگناهای الکتریکی، حرارتی و اتصال اتخاذ کردهاند، هیجانانگیز است.
متن اصلی (انگلیسی)
Powering the AI revolution: Inside the grid, thermal, and interconnect challenges limiting data center growth
We take a deep dive into the electrical, thermal, and infrastructural bottlenecks affecting the next-generation computing revolution.