پرش به محتوای اصلی

تقویت انقلاب هوش مصنوعی: در داخل شبکه، چالش‌های حرارتی و اتصالات داخلی رشد مرکز داده را محدود می‌کند

تک‌رادار۱۴۰۵ مهر ۱۹, یکشنبه، ساعت ۲۰:۵۰حدود 10 دقیقه مطالعه

ما به بررسی تنگناهای الکتریکی، حرارتی و زیرساختی که بر انقلاب محاسباتی نسل بعدی تأثیر می‌گذارند، می‌پردازیم.

رونق هوش مصنوعی به سرعت به محدودیت های فیزیکی ظرفیت شبکه و اتلاف حرارتی می رسد. شبکه برق مثل همیشه کشیده شده است و باعث می شود تا مراکز داده هوش مصنوعی منتظر اتصال طولانی تری باشند و سیستم های خنک کننده هوا و مایع معمولی برای برآورده کردن نیازهای تسهیلات به سرعت در حال رشد تلاش می کنند.

از آنجایی که مراکز داده هوش مصنوعی با سرعتی سریع به رشد خود ادامه می‌دهند، اکنون با ترکیبی از چالش‌ها، از توان محاسباتی پیشی‌گرفتن از توانایی‌های انتقال داده در اتصالات GPU گرفته تا نوسانات بار فرار، سیستم‌های تصحیح ضریب توان شبکه (PFC) و چگالی توان رک که بیش از حد بارگذاری سیستم‌های خنک‌کننده سنتی را ادامه می‌دهند، مواجه هستند.

بیایید گلوگاه‌های اصلی حرارتی و الکتریکی را که رونق هوش مصنوعی را کند می‌کنند و اینکه چگونه شرکت‌ها در حال نوآوری در راه خود هستند را بشکنیم.

دیوار حرارتی (اصطکاک در سطح قفسه)

رک‌های سرور استاندارد گرمای زیادی تولید می‌کنند و خوشه‌های GPU با کارایی بالا حتی بیشتر تولید می‌کنند و محدودیت‌های حرارتی را بیش از همیشه افزایش می‌دهند. رک‌های GPU مدرن بیش از 50 تا 100 کیلووات مصرف انرژی در هر کابینت دارند که روش‌های خنک‌کننده سنتی هوا و مایع را ناکافی می‌سازد.

سیستم های خنک کننده استاندارد، خوشه ها را بین 65 تا 85 درجه کار می کنند، اما 90 تا 100 درجه باعث کاهش عملکرد برای جلوگیری از آسیب دائمی GPU می شود. با استفاده از قفسه‌های GPU که انرژی الکتریکی عظیمی را جذب می‌کنند و به گرما تبدیل می‌شوند، جلوگیری از رسیدن به محدودیت‌های دریچه گاز سخت‌تر از همیشه شده است.

سیستم‌های خنک‌کننده هوای سنتی برای تراکم قفسه‌های بیش از 30 تا 40 کیلووات ساخته نشده‌اند، که خوشه‌های هوش مصنوعی به راحتی از آن فراتر می‌روند و 100 کیلووات یا بیشتر به یک استاندارد تبدیل می‌شوند. حفظ جریان هوا در تراکم های بالا برای خنک کردن قفسه های برق 100 کیلووات به بالا مستلزم کارکردن فن های پرقدرت با سرعت های فوق العاده است. این باعث کاهش انرژی الکتریکی و بدتر شدن کارایی مصرف انرژی (PUE) برای مراکز داده می شود. برای خنک کردن کلسترهای هوش مصنوعی تنها با هوا، اپراتورها به جریان هوای "درجه طوفان" نیاز دارند که غیرعملی است. پس خنک کننده مایع چطور؟

خنک‌کننده مایع به مکانیک سیالات متکی است، جایی که صفحات سرد از میکروکانال‌ها استفاده می‌کنند تا جریان‌های آشفته را مستقیما روی تراشه‌ها تحمیل کنند تا خنک نگه دارند. نگه داشتن حجم کافی از سیال در جریان این میکروکانال ها به قدرت پمپاژ عظیمی نیاز دارد که یک محدودیت فزاینده برای اپراتورهای مرکز داده است. برای کاهش این چالش، اپراتورها از صفحات سرد مستقیم به تراشه استفاده می‌کنند که مستقیما روی پردازنده نصب می‌شوند، نه روی آن، تا خنک نگه‌دارند و در عین حال توان پمپاژ کمتری مصرف می‌کنند.

(اعتبار تصویر: مایکروسافت) مکانیک تغییر فاز همچنین به خوشه‌های GPU کمک می‌کند تا کارآمدتر خنک شوند. در اینجا، خوشه‌ها از گرمای نهان تبخیر مایع یا انتقال جامد به مایع برای جذب گرمای عظیم از رک‌های GPU با چگالی بالا استفاده می‌کنند. مایع دی الکتریک تخصصی مستقیما با پردازنده‌های گرافیکی داغ در تماس است و سپس به بخار می‌جوشد تا فورا گرما را از بین ببرد. سپس بخار بالا می‌آید، به کندانسور می‌رسد و از طریق گرانش دوباره به قطرات مایع تبدیل می‌شود، سپس دوباره به استخر می‌ریزد تا این فرآیند تکرار شود.

این فرآیند به عنوان خنک کننده غوطه وری دو فاز شناخته می شود و انرژی خنک کننده را تا 40 درصد کاهش می دهد.

برخی از اپراتورهای مرکز داده به سمت سیستم‌های خنک‌کننده مایع حلقه بسته حرکت می‌کنند، جایی که سیال چرخشی، GPUها را بدون افت تبخیر خنک می‌کند و نیاز به شارژ مکرر را از بین می‌برد.

به عنوان مثال، مایکروسافت، یکی از اپراتورهای برتر مرکز داده از نظر ظرفیت، یک سیستم حلقه بسته را برای مراکز داده جدیدتر پیاده سازی کرده است، که در آن آب یک بار پر می شود و برای جذب گرما به سرورها می چرخد، برای خنک شدن به خنک کننده های با هوا منتقل می شود، سپس برای جذب گرما بدون نیاز به منابع تازه، گردش می کند. این سیستم پرهزینه است و مدتی طول می کشد تا در مقیاس بزرگ راه اندازی شود، اما نشان می دهد که چگونه شرکت ها در برابر تنگناهای حرارتی نوآوری می کنند.

اتصالات و محدودیت های سطح برد

خوشه‌های GPU برای به اشتراک گذاشتن داده‌ها، حافظه و بارهای کاری به اتصالات برقی مسی یا نوری متکی هستند. اتصالات مسی الکتریکی برای مدت طولانی استاندارد بوده است، اما بار کاری بالای GPU آنها را به حد مجاز رسانده است.

سیگنال‌های الکتریکی در فواصل طولانی (بیشتر از دو متر) قدرت خود را از دست می‌دهند، با هر بار که نیاز به پهنای باند دو برابر می‌شود، دسترسی قابل استفاده به نصف کاهش می‌یابد، و خوشه‌های عظیم GPU فاصله‌های ارتباطی را طولانی‌تر از همیشه کرده‌اند. اتصالات مسی نزدیک به هم، تداخل الکترومغناطیسی ایجاد می‌کنند که سیگنال‌های دیگر را مختل می‌کند و به سیستم‌های یکسان سازی پیچیده‌ای نیاز دارد که انرژی بیشتری را تخلیه می‌کنند.

همچنین مشکل از دست دادن توان در صفحات مسی روی بردهای مدار GPU (به دلیل مقاومت) وجود دارد. هرچه جریان بیشتری از صفحات مسی منتقل شود، گرمای بیشتری تولید می‌شود و به انرژی خنک‌کننده بیشتری نیاز دارد که خود در حال حاضر یک گلوگاه است.

با رسیدن اتصالات الکتریکی به محدودیت‌های مطلق خود، صاحبان مراکز داده چاره‌ای جز چرخش به اتصالات نوری ندارند، که داده‌ها را به پالس‌های نوری تبدیل می‌کنند که از طریق کابل‌های فیبر نوری با حداقل تلفات در مسافت‌های طولانی عبور می‌کنند. این کابل‌ها بسیار نازک‌تر از بسته‌های مسی هستند و مسیرهای جریان هوای بیشتری را در رک‌های GPU متراکم و مولد گرما ایجاد می‌کنند.

شرکت‌ها حتی از کابل‌های فیبر نوری قابل اتصال به فوتونیک سیلیکونی یا اپتیک همبسته (CPO) در حال حرکت هستند که در آن مدارهای نوری مستقیما روی پردازنده‌های گرافیکی تعبیه شده‌اند تا نور را در فواصل طولانی منتقل کنند. در حال حاضر، اتصالات نوری بسیار گران‌تر از مس الکتریکی هستند و در برخی از تنظیمات GPU تا 7 برابر بیشتر هزینه دارند، اما چاره‌ای جز جذب این هزینه در کوتاه‌مدت وجود ندارد، زیرا دومی به محدودیت‌های فیزیکی رسیده است. از طرف دیگر، با پذیرش بیشتر شرکت‌ها از اتصالات نوری و سرمایه‌گذاری در تولید انبوه، هزینه‌ها احتمالا کاهش می‌یابد.

بحران شبکه و پست

در نهایت، اتصال به شبکه برق چالش اصلی بر مراکز داده هوش مصنوعی است. شبکه های الکتریکی مدرن برای مدیریت بارهای به سرعت در حال افزایش مراکز داده هوش مصنوعی طراحی نشده اند، تنها از سال 2021 تا 2025 30 گیگاوات ظرفیت جدید در سراسر جهان اضافه شده است. اضافه شدن سریع در حال رشد زنجیره تامین قطعات شبکه برق را گسترش داده و چالش های مهندسی را معرفی کرده است که اپراتورهای شبکه باید در اطراف آنها کار کنند.

به عنوان مثال، ترانسفورماتورهای ولتاژ بالا که از تحویل ایمن ولتاژ به کلاسترهای GPU اطمینان حاصل می کنند، کمبود دارند. زمان انتظار از 6 تا 12 ماه از سال 2020 به دو تا چهار سال در حال حاضر افزایش یافته است، بسیار بیشتر از زمانی که کلاسترهای GPU گران قیمت می توانند منتظر بمانند تا عملیات خود را تامین کنند.

سیستم‌های تصحیح ضریب توان موجود در شبکه‌های شبکه به دلیل بارگیری گسترده از مراکز داده جدید هوش مصنوعی تحت فشار قرار گرفته‌اند. خوشه‌های GPU تقاضای برق را در عرض چند ثانیه تغییر می‌دهند، به طوری که یک ثانیه تقاضای استنتاج کم، برق پایدار را از شبکه می‌گیرد و ثانیه بعد انرژی بیش از حد را به دلیل افزایش مصرف می‌گیرد. این نوسانات هارمونیک های پیچیده ای را ایجاد می کند که ترانسفورماتورها را بیش از حد گرم می کند و شبکه را تحت تأثیر قرار می دهد و به اپراتورهای شبکه برای سرمایه گذاری هنگفت در سیستم های کاهش نیاز دارد.

خوشه‌های هوش مصنوعی به سطوح گیگاوات افزایش می‌یابند، و تابلوهای ولتاژ پایین‌آمده را تا حد قابل تحمل‌ترین حد خود می‌برند. ترانسفورماتورهای بزرگتر، مورد نیاز برای خدمت رسانی به این خوشه های سطح گیگاوات، امپدانس الکتریکی پایین تر، جریان های خطای اتصال کوتاه بالقوه بالا را مجبور به پایین آوردن یک خط می کنند. اگر یک اتصال کوتاه اتفاق بیفتد، میدان‌های مغناطیسی نیروهای مکانیکی سختی را بر روی شین‌های تابلو برق وارد می‌کنند و باعث خم شدن یا جدا شدن آن‌ها از تکیه‌گاه مکانیکی خود می‌شوند. چیزی که بعدا می آید یک شکست ساختاری است که اپراتورهای شبکه یا شبکه های برق مرکز داده ایزوله نمی توانند اجازه دهند که اتفاق بیفتد.

شرکت ها برای مقابله با این تنگناهای الکتریکی به راه حل های مختلفی روی آورده اند. برای نمونه، چرخش عمده ای به ترانسفورماتورهای حالت جامد صورت گرفته است که از الکترونیک قدرت و نیمه هادی های فرکانس بالا برای کاهش ولتاژ استفاده می کنند، نه از میدان های مغناطیسی مانند ترانسفورماتورهای معمولی.

(اعتبار تصویر: Docan Power) الکترونیک فرکانس بالا ترانسفورماتورهای حالت جامد را قادر می سازد تا هارمونیک های ولتاژ و فیلتر را به طور فعال تنظیم کنند و منجر به نوسانات کمتری شود. آنها 97 تا 99 درصد کارایی دارند، در مقایسه با 95 تا 97 درصد برای ترانسفورماتورهای معمولی، و این تفاوت 1 تا 2 درصدی در مراکز داده در سطح گیگاوات بسیار زیاد است. بهتر از آن، آنها بسیار کوچکتر و سبکتر از ترانسفورماتورهای معمولی هستند و لجستیک و استقرار سریعتر را امکان پذیر می کنند.

با این حال، SST ها چالش های خود را معرفی می کنند. قطعات داخلی با فرکانس بالا و تراشه‌هایی که به آنها انرژی می‌دهند گران هستند، اغلب پنج برابر یا بیشتر در هر کیلوولت آمپر نسبت به جایگزین‌های فرکانس پایین. آنها همچنین به چندین مرحله تبدیل توان (AC-DC و DC-AC/DC-DC) و تلفات کوچک در طول این تبدیل ها نیاز دارند که رسیدن به اوج راندمان را دشوار می کند. اجزای داخلی گرما تولید می کنند و سریعتر پیر می شوند و نسبت به ترانسفورماتورهای معمولی به تعمیر و نگهداری فعال بیشتری نیاز دارند.

هزینه نیز یک مسئله است، زیرا ساخت و نگهداری SSTها در حال حاضر بسیار گرانتر از ترانسفورماتورهای مبتنی بر آهنربا هستند. با این حال، با سرمایه‌گذاری بیشتر در تولید انبوه، هزینه‌ها احتمالا در طول زمان کاهش می‌یابد و به خوشه‌های گرافیکی هوش مصنوعی این امکان را می‌دهد تا آنها را سریع‌تر بپذیرند. زیمنس، دومین تولید کننده بزرگ ترانسفورماتور در جهان، اخیرا با شرکت فناوری آلمانی Reinhausen برای تولید انبوه ترانسفورماتور حالت جامد مدولار برای مراکز داده هوش مصنوعی شریک شد و این تنها یک نمونه است.

از آنجایی که SST ها را نمی توان فورا در مقیاس پذیرفت و کمبود ترانسفورماتورهای معمولی به زمان انتظار طولانی برای صاحبان شبکه برق کمک کرده است، صاحبان مراکز داده هوش مصنوعی مجبور شده اند امور را به دست خود بگیرند. برخی از آن‌ها سیستم‌های تولید برق پشت متری و پست‌های خود را برای تامین انرژی خوشه‌های GPU در حالی که منتظر هستند تا به شبکه‌های محلی متصل شوند، ساخته‌اند. xAI، شرکت هوش مصنوعی به رهبری ایلان ماسک، 59 توربین گاز طبیعی قابل حمل با ظرفیت ترکیبی بیش از 400 مگاوات را برای تامین انرژی مرکز داده Colossus خود در ممفیس، تنسی، در حالی که منتظر اتصال به شبکه است، اضافه کرد.

برخی از صاحبان مراکز داده همچنین به راکتورهای کوچک مدولار (SMR) نگاه می کنند، جایی که راکتورهای شکافت هسته ای فشرده در محل نیرو تولید می کنند، اما در این مرحله هنوز در مرحله مفهومی است. SMR ها با محدودیت های مختلفی مواجه هستند، به ویژه هزینه های بسیار بالا در مقایسه با توربین های گازی یا انرژی های تجدید پذیر.

با این حال، بسیاری از مراکز داده دیگر، چه در مراحل اولیه و چه در مراحل پایانی ساخت و ساز یا تکمیل شده، در صف های طولانی برای اتصالات شبکه برق باقی می مانند. به عنوان مثال، در ویرجینیای شمالی، که میزبان بزرگ‌ترین مرکز داده جهان است (570 مرکز داده و به تدریج افزایش می‌یابد)، امکانات جدید برای اتصال به شبکه زمان انتظار تا 14 سال را دارند.

اپراتورهای شبکه برق مستقر در ایالات متحده مبالغ هنگفتی را برای ارتقاء سرمایه گذاری کرده اند (208 میلیارد دلار تنها در سال 2025 و 1.1 تریلیون دلار سرمایه گذاری برنامه ریزی شده از سال 2025 تا 2030، به ازای هر ادیسون الکتریک)، اما همچنان برای پاسخگویی به تقاضای در حال انفجار مرکز داده تلاش می کنند. سرمایه‌گذاری‌های بیشتری برای رفع تنگناهای شبکه الکتریکی مورد نیاز است، و همچنین فناوری‌های جدیدی که می‌توانند مصرف انرژی مرکز داده را برای کمک به شبکه‌های توزیع کاهش دهند، مورد نیاز است.

واقعیت استقرار محاسباتی نسل بعدی

با جزئیات فنی، گلوگاه‌های اتصال به شبکه، حرارتی و GPU را توضیح داده‌ایم که رونق استقرار محاسبات هوش مصنوعی نسل بعدی را تا حد خود افزایش می‌دهد. اینها چالش‌های فیزیکی و فنی جدی هستند که برای رسیدگی به آنها نیاز به رویکردهای نوآورانه دارد و خوشبختانه هیچ کمبودی در این رویکردها وجود ندارد.

ما مثال‌هایی مانند روی آوردن اپراتورهای شبکه الکتریکی به ترانسفورماتورهای حالت جامد که به تنظیم ولتاژ فعال و فیلترهای هارمونیک برای پایدار نگه داشتن سیستم‌های قدرت اجازه می‌دهند، یا برخی از اپراتورهای کلاستر GPU که سیستم‌های تولید برق خود را می‌سازند در حالی که منتظر اتصالات شبکه محلی هستند، می‌سازند، بیان کرده‌ایم.

برای تنگناهای حرارتی، اپراتورهای کلاستر GPU از صفحات سرد مستقیم به تراشه که مستقیما روی GPU ها نصب شده اند، به جای روی آنها استفاده می کنند تا در عین مصرف انرژی کمتر، خنک بمانند. مکانیک تغییر فاز نیز کمک می‌کند، جایی که بخار مایع گرما را از قفسه‌های GPU جذب می‌کند، گرما را از بین می‌برد و دوباره به مایع تبدیل می‌شود تا فرآیند تکرار شود و نیاز انرژی را تا 40 درصد کاهش می‌دهد.

مایکروسافت سعی کرده است با پیاده‌سازی یک سیستم خنک‌کننده مایع حلقه بسته، با استفاده از خنک‌کننده‌های مایع که به طور مداوم در یک شبکه لوله‌های مهر و موم شده با حداقل شارژ مجدد چرخش می‌کنند، چرخ را دوباره اختراع کند.

با این حال، گسترش سیستم های خنک کننده حلقه بسته دشوارتر از سیستم های حلقه باز است، زیرا نیاز به GPU افزایش می یابد، و می توانند تحت بارهای سنگین با کارکرد همزمان موتورهای پمپ و فن های رادیاتور بلندتر باشند. در زمان افزایش واکنش عمومی علیه مراکز داده جدید، نویز محیطی نیز مهم است، نه فقط محدودیت های فنی. سیستم‌های حلقه بسته نیز گران‌تر هستند، اما هزینه‌ها می‌تواند به مرور زمان کاهش یابد، زیرا شرکت‌های بیشتری از آنها استفاده می‌کنند.

برای محدودیت‌های اتصال در سطح برد مدار، شرکت‌ها از کابل‌های مسی الکتریکی به کابل‌های فیبر نوری سوئیچ می‌کنند، زیرا آنها داده‌ها را سریع‌تر و قابل اطمینان‌تر در فواصل طولانی انتقال می‌دهند، حتی اگر هزینه بیشتری داشته باشند. سازندگان GPU در حال کار بر روی تعبیه مدارهای نوری به طور مستقیم بر روی تراشه ها هستند تا نور را حتی بهتر از کابل ها انتقال دهند.

با وجود این چالش‌ها، مراکز داده هوش مصنوعی با سرعت 66 گیگاوات ظرفیت جدید در حال ساخت تنها در آمریکای شمالی در حال ساخت هستند.

با نگاهی به آینده، واضح است که اتفاقات زیادی در این زمینه می‌افتد و تماشای رویکردهای مختلفی که شرکت‌ها برای غلبه بر تنگناهای الکتریکی، حرارتی و اتصال اتخاذ کرده‌اند، هیجان‌انگیز است.

خواندن متن کامل در تک‌راداربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Powering the AI revolution: Inside the grid, thermal, and interconnect challenges limiting data center growth

We take a deep dive into the electrical, thermal, and infrastructural bottlenecks affecting the next-generation computing revolution.

همه‌ی اخبار فناوری