نسل بعدی NPU های Ascend هوآوی می تواند بهترین گزینه چین باشد
960DT قرار است زود وارد شود و عملکردی بسیار فراتر از هر چیزی که غرب می تواند به پادشاهی میانه ارائه دهد دارد.
در کنفرانس سالانه Connect، هواوی از نسل جدیدی از شتابدهندههای هوش مصنوعی رونمایی کرد که عملکردی بسیار فراتر از هر چیزی که انویدیا میتواند در حال حاضر در پادشاهی میانه بفروشد، نوید میدهد. این میتواند برای توسعهدهندگان چینی که سلاحهای کمتری را از فروشنده سلاحهای هوش مصنوعی مورد علاقه همه خریداری میکنند، یک موهبت باشد. اگر این کافی نبود، تراشه با اسم رمز Ascend 960DT - DT که در اینجا ظاهرا مخفف رمزگشایی/آموزش است - قرار است سه چهارم کامل زودتر از زمان برنامه ریزی شده وارد بازار شود و در سه ماهه اول سال 2027 راه اندازی شود.
با حداکثر 288 گیگابایت از آنچه که ما فناوری حافظه سفارشی HiZQ هوآوی را فرض میکنیم، جایگزینی بومی برای حافظه با پهنای باند بالا مورد استفاده در سایر نقاط جهان، و حداکثر چهار پتافلاپ عملکرد FP4 (نصف آن در FP8)، این شتابدهنده دو برابر عملکرد و ظرفیت حافظهی قطعات سری 950 این شرکت را ارائه میدهد. در مقایسه با پردازندههای گرافیکی آمریکایی، 960DT حافظه و پهنای باند مشابهی با تراشههای خانواده B300 انویدیا ارائه میکند که سال گذشته عرضه شد، اما تنها حدود نیمی از FP8 و یک سوم FP4 را محاسبه میکنند.
اگرچه یک گام بزرگ برای طراح تراشه چینی است، اما هنوز راه درازی برای رسیدن به روبین انویدیا و MI455X اخیرا راهاندازی شده از سوی AMD که نوید محاسبات و پهنای باند بسیار بالاتری را میدهند، در پیش دارد. Rubin دارای عملکرد FP4 بین 35 تا 50 پتافلاپ، 288 گیگابایت حافظه HBM4 و 22 ترابایت بر ثانیه پهنای باند است که آن را در یک لیگ کاملا متفاوت قرار می دهد. با این حال، هیچ یک از این تراشه ها برای فروش در پادشاهی میانه در دسترس نیستند، بنابراین اینطور نیست که توسعه دهندگان مدل چینی گزینه های بهتری داشته باشند.
بهترین پردازنده گرافیکی که Nvidia می تواند در چین بفروشد، عملکرد ممیز شناور متراکم تقریبا یکسان، دو برابر حافظه، دو برابر پهنای باند حافظه و پشتیبانی از دامنه های بسیار بزرگتر را ارائه می دهد. افزایش شکاف عملکرد ممکن است آنقدرها هم که به نظر می رسد افتضاح نباشد. مدلهای هوش مصنوعی آموزشدیده نیستند و در بیشتر موارد دیگر روی یک GPU یا NPU اجرا نمیشوند. عامل مهم تر اغلب میزان کارآمدی پلت فرم است.
جدیدترین سیستمهای انویدیا و AMD 72 پردازنده گرافیکی را در یک پلتفرم محاسباتی در مقیاس رک بستهبندی میکنند که میتوان با استفاده از اتصالات نوری برای بزرگکردن و کوچکتر کردن شبکه، آن را تا 576 افزایش داد. برای شتابدهندههای سری 960 آیندهاش، هواوی مسیر مشابهی را با استفاده از اپتیکهای بستهبندی شده نزدیک (NPO) طی میکند تا دامنه محاسباتی خود را به 4096 تراشه که قادر به ارائه حداکثر 16 exaFLOPS محاسبات FP4 هستند، تغییر دهد. چیزی که هوآوی در چگالی محاسباتی فاقد آن است، در مقیاس آن را جبران میکند، تاکتیکی که قبلا با پادهای TPU گوگل دیدهایم.
این نباید کسی را متعجب کند که با توجه به اینکه شبکه های پرسرعت نان و کره هواوی است. ما در اوایل این هفته به فناوری NPO هوآوی با جزئیات بیشتری نگاه کردیم، اما به طور خلاصه، به یک چالش بزرگ مقیاس و نقطه شکست ذاتی طراحیهای قبلی هوآوی میپردازد – اپتیکهای قابل اتصال انرژیزا هستند، مستعد خرابی هستند و فضای زیادی را اشغال میکنند. هواوی میگوید NPO به آن اجازه داده است تا 48000 پلاگین نوری 800 گیگابیت بر ثانیه را در 5500 واحد NPO Hi-One خود ادغام کند و مصرف برق را تا 550 کیلووات کاهش دهد و میزان خرابی را به نصف کاهش دهد.
با استفاده از فناوری جدید، ادعا میکند که اکنون میتواند به ۹۹.۸ درصد آپتایم دست یابد. این احتمالا خبری خوشایند برای سازندگان مدل چینی است که تحت فشار هستند تا جایگزینهای داخلی برای کیت غربی را اتخاذ کنند. گزارش شده است که DeepSeek در استفاده از NPUهای قبلی هواوی برای آموزش با مشکل مواجه شده بود و در نهایت مجبور شد به GPUهای Nvidia برگردد. Ascend 960PR در کنار پهنای باند بالای 960DT هوآوی، این شرکت همچنین در حال آماده سازی نسخه بهینه سازی شده محاسباتی تراشه به نام 960PR برای آینده (Q3) در سال 2027 است.
از بسیاری جهات، این تراشه نقشی شبیه به نقشی را که شتابدهندههای Rubin CPX انویدیا قبل از اینکه در اوایل سال جاری تولید شوند، ایفا میکند. PR در 960PR ظاهرا به پیشپر کردن و توصیهکنندگان اشاره دارد و ظرفیت حافظه و پهنای باند هواوی را برای افزایش قابل توجهی در عملکرد محاسباتی با دقت پایین مشاهده میکند. به طور خاص، نوع PR دارای حداکثر 8 پتافلاپ از عملکرد FP4، 192 گیگابایت از آنچه ما معتقدیم حافظه سفارشی HiBL آن است، برای پهنای باند 2.4 ترابایت بر ثانیه خوب است.
همانطور که میدانیم، این تراشه به گونهای طراحی شده است که با تراشههای DT هوآوی کار کند تا عملکرد استنتاج LLM را افزایش دهد. فاز پیش پر محاسباتی خط لوله استنتاج، جایی که درخواست ها پردازش می شوند، به 960PR واگذار می شود، در حالی که فاز رمزگشایی فشرده حافظه، جایی که توکن های خروجی در واقع تولید می شوند، روی 960DT اجرا می شود. این نوع معماری ناهمگون ثابت کرده است که در افزایش عملکرد کاملا مؤثر است و بی شباهت به آرایش مورد استفاده در پیکربندیهای Vera Rubin و Groq LPX انویدیا نیست که در بهار امسال در GTC بررسی کردیم.
تفاوت اصلی این است که هواوی هنوز یک شتاب دهنده رمزگشایی سنگین SRAM ندارد. هوآوی به میلیونها خوشه NPU نگاه میکند، هوش مصنوعی سریعتر در اتصال، هوآوی قصد خود را برای مقیاسبندی خوشههای محاسباتی خود به نیم میلیون یا بیشتر NPU نشان داد. و در یک اثبات مفهومی، اعلام کرد که با موفقیت سوپرپاد TaiShan مبتنی بر Ascend 950 خود را به 4096 شتاب دهنده افزایش داده است.
با استفاده از توپولوژی شبکه دو سطحی و چهار صفحه ای Clos، این شرکت انتظار دارد که به زودی بتواند از خوشه هایی با حداکثر 512000 NPU پشتیبانی کند و با حرکت به توپولوژی چند ریلی، معتقد است ابرخوشه های میلیون NPU در قلمرو امکان هستند. از آنچه ما می توانیم بگوییم، این فقط یک پیکربندی تئوری است، چیزی نیست که شرکت در واقع در طبیعت ثابت کرده است. هوآوی همچنین دو نسل بعدی شتابدهندههای Ascend خود را به نمایش گذاشت، که همانطور که انتظار دارید، نوید افزایش عملکرد ثابت، حافظه بیشتر و اتصالات سریعتر به یکدیگر را میدهند.
قطعات سری Ascend 970 که برای مدتی در سال 2028 برنامه ریزی شده است، تا 3.6 پتافلاپ FP8 یا 14 پتافلاپ در FP4 را وعده می دهند - به نظر می رسد هواوی فضای بیشتری را به انواع داده های با دقت پایین اختصاص می دهد، چیزی که در آخرین نسل تراشه های AMD و Nvidia نیز دیده ایم. با 288 گیگابایت، ظرفیت حافظه نسبت به سری 960 تغییر چندانی نخواهد کرد، اما هوآوی ادعا می کند که انتظار دارد پهنای باند حافظه را تا 14.4 ترابایت بر ثانیه افزایش دهد که می تواند به طور قابل توجهی از استنتاج هوش مصنوعی بهره مند شود.
تا سال 2029، هواوی انتظار دارد عملکرد را دوباره دو برابر کند و به 7.2 petaFLOPS FP8 و 28 petaFLOPS FP4 برسد، در حالی که ظرفیت حافظه را به 384 گیگابایت و پهنای باند حافظه 38.4 ترابایت بر ثانیه افزایش دهد. با این اوصاف، سه سال زمان زیادی برای انتظار است و ما از دیدن تغییرات قابل توجهی در نقشه راه هواوی پیش از آن تعجب نخواهیم کرد. ®
متن اصلی (انگلیسی)
Huawei's next-gen Ascend NPUs could become China's best option
960DT is set to arrive early, boasting performance far exceeding anything the West could offer the Middle Kingdom