پرش به محتوای اصلی

سفر Epyc به ونیز: هر کاری که ما در مورد چیپ هیولایی 256 هسته ای AMD انجام می دهیم و نمی دانیم

دِ رجیستر۱۴۰۵ مهر ۱, چهارشنبه، ساعت ۱۹:۲۱حدود 12 دقیقه مطالعه

16 کانال DDR5، سرعت کلاک 5 گیگاهرتز و پشتیبانی از جعبه های حافظه خدای CXL 3.1؟ چه چیزی را دوست ندارد؟

Venice Epycs AMD بزرگترین تغییر معماری این سازنده تراشه در طراحی CPU را از زمانی که رم در سال 2019 آغاز کرد، نشان می‌دهد. علاوه بر این، مجموعه محصولات مبتنی بر Zen 6 AMD در حال شکل‌گیری به عنوان گسترده‌ترین مجموعه CPU تا کنون است که شامل پلتفرم‌های هدف کلی، HPC و هوش مصنوعی است. AMD کاملا آماده نیست که تمام دانه‌ها را روی هسته‌های Zen نسل ششم خود بریزد، اما در این مرحله کمتر از ما درباره ونیز نمی‌دانیم.

اواخر هفته گذشته، AMD با یک کاغذ سفید [PDF] که به وضوح با هدف از بین بردن روایت انویدیا غول‌آمیز بازاریابی پیرامون پردازنده‌های Vera خود، کمی بیشتر به ما داد. ما کمی به ادعاهای عملکرد مطرح شده در کاغذ سفید می پردازیم، اما با توجه به انتشار جزئی اطلاعات در مورد ونیز تا این مرحله، زمان آن رسیده است که نگاهی دقیق تر به معماری CPU بیندازیم که نقشه راه AMD را برای چند سال آینده زیربنا خواهد داشت.

کمی از همه چیز به طور کلی، نسل ششم AMD را می توان به چهار سطل تقسیم کرد - عملکرد بالا، سازمانی، HPC و AI - که هر کدام ویژگی های خاص خود را دارند. ما کارها را با قطعات بهینه‌سازی عملکرد AMD آغاز خواهیم کرد، زیرا این قطعات در واقع در سال 2026 عرضه خواهند شد. تقریبا همه چیزهای دیگر در طول سال 2027 عرضه خواهند شد. پلتفرم Epyc 9006 SP7 همان چیزی است که AMD واقعا در سال گذشته درباره آن صحبت کرده است. این دستگاهی است که حداکثر 256 هسته، 16 کانال DDR5 و 128 خط اتصال سریع PCIe 6.0 سازگار با CXL 3.1 را ارائه می دهد.

اما اینها فقط مشخصات اصلی هستند و درست مانند قطعات تورین سال گذشته، ونیز در واقع در دو طعم مجزا عرضه خواهد شد: قطعات بهینه تراکم و بهینه سازی فرکانس. نسخه 256 هسته ای، اگر تا به حال حدس نمی زدید، قسمت بهینه سازی تراکم است. در کنار آن، AMD دارای یک قطعه 96 هسته ای است که می تواند تا 5 گیگاهرتز را افزایش دهد. با جدا کردن پخش کننده حرارت، می بینیم که AMD چگونه این کار را مدیریت کرده است. هر دو تراشه دارای یک جفت قالب ورودی/خروجی هستند که توسط هشت قالب پیچیده هسته ای (CCD) احاطه شده اند. این دو برابر ورودی/خروجی است، اما نیمی از سیلیکون محاسباتی که در تورین دیدیم، با این حال تعداد هسته‌ها افزایش یافته است.

اما بسته به تراشه، این CCD ها بسیار متفاوت هستند. برای این نسل، AMD تعداد هسته های محاسباتی در هر چیپلت را دو برابر کرده و به 32 عدد و L3 مشترک را از 32 مگابایت در هر چیپ به 128 مگابایت، چهار برابر کرده است. این بدان معناست که CPUهای ونیز کاملا بارگذاری شده AMD اکنون دارای یک گیگابایت L3 داخلی هستند. برای قطعات بهینه‌سازی فرکانس، AMD کارها را کمی ایمن‌تر انجام داده است. تعداد هسته‌ها و حافظه‌های نهان L3 تنها حدود 50 درصد نسبت به نسل گذشته افزایش یافته‌اند و 12 هسته و 48 مگابایت L3 در هر چیپلت دارند.

تعداد هسته‌های بالاتری که چیپ‌لت‌های جدید AMD ارائه می‌کنند مرتب هستند، اما مسلما تغییر جالب‌تر سلسله‌مراتب حافظه پنهان است - به جز سرعت ساعت، دیگر هیچ تفاوتی بین هسته Zen 6C و هسته Zen 6 وجود ندارد. در نسل‌های قبل، CCD‌های ZenC AMD همان 32 مگابایت ذخیره L3 را با Zen CCD‌های استاندارد خود داشتند، که به این معنی بود که قطعات با مشخصات بالای آن، نصف L3 هر هسته آن نسبت به کلاک بالاتر، اما قطعات با تعداد هسته کمتر داشتند. این دیگر در مورد ونیز صدق نمی کند. صرف نظر از اینکه از کدام CCD استفاده می شود، حداقل 4 مگابایت L3 مشترک در هر هسته تغذیه کننده آن وجود دارد.

تنها تفاوت در حال حاضر، به نظر می رسد، انتخاب بین تعداد هسته و چگالی هسته است. این زمانی است که باید به مردم یادآوری کنیم که هسته های فشرده Zen AMD با هسته های کارآمد اینتل یکسان نیستند. اینتل از ریزمعماری های کاملا متفاوت با مجموعه ویژگی ها و سلسله مراتب کش های مختلف برای هسته های P و E خود استفاده می کند. AMD به سادگی سرعت ساعت را با یک فاکتور فرم فشرده تر معاوضه می کند - ISA یکسان است. با این موضوع، بیایید صحبت کنیم I/O میمیرد زیرا این تغییر دیگری است. همانطور که قبلا اشاره کردیم، اکنون دو مورد از آنها وجود دارد.

اگر مجبور بودیم حدس بزنیم، دلیل این امر به اتصال متقابل مورد استفاده برای اتصال CCD ها به زیرسیستم ورودی/خروجی مربوط می شود. اگر متوجه نشده بودید، این بار قالب ها درست در مقابل یکدیگر قرار می گیرند. در هر صورت، خود I/O تا حد زیادی بدون تغییر است. ما 128 خط اتصال PCIe را دریافت می کنیم - مانند چند نسل گذشته Epyc. با این حال، این خطوط به لطف اتصال 5.0 به 6.0 دو برابر سریعتر هستند.

این تراشه‌ها همچنین از اتصال CXL 3.1 پشتیبانی می‌کنند، به این معنی که مشتریان اکنون می‌توانند از مزیت جعبه‌های خدای حافظه برای جمع‌آوری و اشتراک حافظه بین آن‌ها استفاده کنند. اگر کنجکاو هستید که چگونه این دستگاه های حافظه متصل به شبکه کار می کنند، در اینجا به طور طولانی درباره این فناوری بحث کردیم. در کنار ورودی/خروجی سریع‌تر، دای‌ها از 16 کانال حافظه DDR5 8000 MT/s یا 12800 MT/s با استفاده از MRDIMM پشتیبانی می‌کنند.

این به Venice پهنای باند عظیم 1.6 ترابایت بر ثانیه، تقریبا 3 برابر تورین، می‌دهد و در آزمایش‌های دنیای واقعی، AMD می‌گوید که می‌تواند تقریبا به 1.3 ترابایت بر ثانیه در STREAM Triad برسد، معیاری برای ارزیابی پهنای باند آزمایش شده در زمان. ما هنوز تمام جزئیات مربوط به ریزمعماری Zen 6 AMD را در اختیار نداریم، اما لیست تا حد زیادی کاملی از سری SP7 آن را داریم که در زیر آورده ایم.

تراشه‌های Epyc X AMD بازگشته‌اند قبل از اینکه به عرضه‌های اصلی Epyc AMD برویم، باید کمی بیشتر در مورد قطعات Venice-X مبتنی بر HPC آن صحبت کنیم که سوکت SP7 را به اشتراک می‌گذارند، اما حافظه نهان L3 را در هر هسته به 12 مگابایت یا 1152 مگابایت در هر سوکت می‌رسانند. همانند تراشه های X قبلی، AMD با قرار دادن SRAM در بالای CCD های خود با استفاده از فناوری بسته بندی 3D V-Cache به این مهم دست می یابد. این همان فناوری مورد استفاده در قطعات مصرفی مانند 5800X3D و 7800X3D است. برای Venice-X، AMD تا 8 کاشی SRAM 96 مگابایتی را بین CCD های 12 هسته ای خود و بسته برای مجموع 144 مگابایت L3 قرار می دهد.

این حافظه پنهان اضافه شده، این تراشه ها را برای بارهای کاری HPC محور مانند دینامیک سیالات محاسباتی، تجزیه و تحلیل المان محدود، اتوماسیون طراحی الکترونیکی و سایر بارهای کاری علمی و مهندسی جذاب می کند. این تراشه از بسیاری جهات برای AMD که از نسخه X برای نسل تورین صرف نظر کرده بود، بازگشتی به فرم است. با این اوصاف، در مقایسه با آخرین تراشه Epyc X، تراشه جدید ظرفیت حافظه نهان L3 یا تعداد هسته بالاتری را ارائه نخواهد کرد.

کاری که Venice X انجام خواهد داد این است که سرعت کلاک بسیار بالاتری را ارائه می دهد و به لطف قرار دادن کاشی SRAM در زیر CCD به جای بالای آن، به 5.15 گیگاهرتز می رسد. سازمانی همه چیزهایی که تا این لحظه در مورد آن صحبت کرده‌ایم، برنامه‌های کاربردی با عملکرد بالا و HPC را هدف قرار داده‌اند - نه چیزی که اکثر شرکت‌ها در نهایت آن را خریداری می‌کنند. برای موارد استفاده اصلی تر، مانند ذخیره سازی، پایگاه داده یا سرورهای مجازی سازی، AMD نسخه کوتاه شده Venice Epycs خود را با هشت تا 128 هسته و هشت کانال حافظه DDR5 ارائه می دهد.

در حالی که پهنای باند حافظه یک گلوگاه بزرگ برای هوش مصنوعی و HPC است، برای اکثر برنامه‌های کاربردی سازمانی تقریبا به آن مهم نیست، بنابراین منطقی است که در اینجا کاهش یابد. در واقع، اینتل همین کار را با قطعات سری Xeon 6 6700P خود انجام داد، که در 8 کانال نیز در صدر قرار گرفت. از رندرهای قالبی که دیده‌ایم، به نظر می‌رسد که AMD از یک قالب ورودی/خروجی کمی متفاوت استفاده می‌کند، که منطقی است با توجه به اینکه نیازی به سر و کار داشتن با داده‌های زیادی ندارد. آنها همچنین از یک سوکت SP8 متفاوت استفاده خواهند کرد، اما از همان CCD های مورد استفاده در قطعات SP7 استفاده خواهند کرد.

بخش هشت هسته ای با توجه به اینکه حداقل تعداد هسته در هر CCD اکنون 12 است، تصمیم عجیبی است، اما این اولین باری نیست که AMD bin silicon را می بینیم که با ترکیب کردن هسته ها، تقسیم بندی بیشتری را ارائه می دهد. در همین حال، بخش 128 هسته ای از چهار CCD 32 هسته ای برای رسیدن به هدف شمارش هسته خود استفاده می کند. همانطور که ممکن است انتظار داشته باشید، سری 9006 SP8 AMD کمی بزرگتر است و بیش از 20 SKU با سرعت کلاک تا 5 گیگاهرتز را در بر می گیرد، بنابراین در حالی که ممکن است برخی از کانال های حافظه را برای انتخاب قطعات کنار بگذارید، لزوما از هیچ عملکرد محاسباتی صرف نظر نمی کنید.

در اینجا خلاصه ای کامل آورده شده است: AMD Vera را در معرض خطر قرار می دهد ونیز تنها تراشه ای نخواهد بود که AMD با هسته های Zen 6 خود در زیر کاپوت عرضه می کند. در حالی که رک‌های نسل اول Helios از یک قطعه 96 هسته‌ای Venice و DDR5 DIMM استاندارد استفاده می‌کنند، طراحی‌های آینده از یک CPU بسیار متفاوت استفاده می‌کنند که شباهت بیشتری به Vera انویدیا دارد. این تراشه با نام رمز Verano دارای حداکثر 72 هسته (احتمالا در شش چیپلت 12 هسته ای) با فرکانس 5 گیگاهرتز خواهد بود، اما به جای DDR5 از 24 کانال حافظه LPDDR5x به همراه لینک های xGMI سریع تر 112 GT/s استفاده می کند که AMD می گوید باید به اتصال CPU-GPU کمک کند.

Vera برای مرجع دارای 88 هسته است و تا 1.5 ترابایت LPDDR5x را بسته بندی می کند که برای 1.2 ترابایت بر ثانیه پهنای باند مناسب است. AMD بخشی را که قرار است در نیمه دوم سال 2027 راه اندازی شود، به عنوان یک پردازنده میزبان ایده آل برای سرورهای GPU قرار می دهد. از آنچه ما جمع آوری کرده ایم، تصمیم به استفاده از LPDDR5x نسبت به DDR5 RDIMM تا حد زیادی به قدرت بستگی دارد. LP وجود دارد نشان دهنده قدرت کم است. AMD چیز زیادی در مورد تراشه ورودی/خروجی تراشه نگفته است، اما ما گمان می کنیم که جادوی واقعی در اینجا نهفته است.

شاید شاهد یک ورودی/خروجی حذف شده باشیم که فقط برای پشتیبانی از دو تا چهار پردازنده گرافیکی لازم است؟ با کاهش توان مصرفی CPU، AMD می‌تواند ظرفیت پردازنده‌های گرافیکی بیشتر یا سریع‌تر و داغ‌تر را آزاد کند و این امکان را به آن می‌دهد تا با انویدیا در ارزش رقابت شدیدتری داشته باشد. Venice vs Vera در جدیدترین وایت پیپر AMD، این شرکت نقطه مقابل ادعاهای عملکرد خود انویدیا را ارائه کرد که نشان می‌داد هسته Olympus Vera در مقایسه با تورین، عملکرد هر هسته را 1.7-1.8 برابر افزایش می‌دهد، بخشی که تقریبا دو سال پیش به مردم یادآوری می‌کنیم.

طبق گفته‌های AMD، در چهار معیار SPEC 2026، Venice 96 هسته‌ای آن بین یک تا 12 درصد عملکرد بالاتری نسبت به Vera ارائه می‌دهد، در حالی که در بنچ‌شماری عدد صحیح SPECrate 2026، Zen 6 آن ظاهرا با 20 درصد برتری پیشروی کرده است. در نهایت از نظر توان عملیاتی، آنچه ما فرض می‌کنیم این بود که بخش 256 هسته‌ای AMD به‌طور قابل‌توجهی بر Vera 88 هسته‌ای شکست خورد و برتری 2.24 برابری را به ارمغان آورد. اینجا جای تعجب واقعی نیست هسته های بیشتر معمولا معادل با توان بالاتر است. این ادعاها را با یک دانه نمک در نظر بگیرید.

- انتخاب معیارهای ارائه شده توسط فروشنده بسیار آسان است - اما پیشنهاد ما در واقع بسیار ساده است و احتمالا آن چیزی نیست که AMD ممکن است به آن امیدوار باشد. بنچمارک‌های خود AMD نشان می‌دهد که هسته‌های Olympus Vera در حداقل برخی از معیارها به طرز شگفت‌آوری توانمند هستند - AMD فقط تعداد بیشتری از آنها را در هر سوکت و SKUهای بیشتری برای رسیدگی به طیف وسیع‌تری از موارد استفاده دارد. CPU ها به ندرت در همه سناریوها برنده هستند. ما شکی نداریم که ورا در برخی از حجم کاری ها و ونیز در برخی دیگر برتری خواهند داشت. ما دوباره آن را می گوییم، اما هرگز یک CPU وجود نداشته است که همه آنها را در مرکز داده اداره کند و نخواهد بود.

البته انویدیا بزرگترین رقیب AMD در فضای CPU دیتاسنتر نیست. این می تواند اینتل باشد. خوشبختانه برای House of Zen، این بار رقابت چندانی با Chipzilla نخواهد داشت، حداقل نه در بازار شرکت های بزرگ. همانطور که در ماه گذشته بحث کردیم، پردازنده‌های Diamond Rapids Xeon 7 اینتل دارای مشخصات قابل مقایسه با حداکثر ۲۵۶ هسته و ۱۶ کانال با ظرفیت سریع DDR5 و MRDIMM هستند. اما بر خلاف نسل های قبلی، آنها کاملا قطعات HPC محور هستند - این بار بدون SKUهای SP.

بنابراین، در حالی که اینتل می تواند یک چالش در سطح بسیار بالا ایجاد کند، AMD در بیشتر سال 2027 از مزیت حجم برخوردار خواهد بود. آنچه ونیز در مورد Zen روی دسکتاپ به ما می گوید با همه این موارد، بیایید نگاهی بیندازیم به آنچه که آخرین Epycs AMD در مورد نسل بعدی محصولات Ryzen و Threadripper به ما می گوید. از لحاظ تاریخی، پردازنده‌های دسکتاپ Ryzen AMD، CCD‌ها را از Epycs بازیافت کرده‌اند یا بالعکس. با فرض اینکه این تغییر نمی کند و AMD موفق می شود دو CCD را در یک سوکت AM5 قرار دهد، احتمالا بین هشت تا 24 هسته روی پلت فرم دسکتاپ را بررسی می کنیم.

با این فرض که AMD فقط از چیپلت های بهینه سازی فرکانس خود استفاده می کند. اگر یک CCD بهینه شده با چگالی واحد را انتخاب کند، می تواند تعداد هسته ها را به 32 برساند، اگرچه ما شک داریم. سرعت کلاک سوال باز است، اما با توجه به اینکه Zen 5 در حدود 5.7 گیگاهرتز بالاتر است، ساعت های تقویتی 6 گیگاهرتز نباید کسی را شگفت زده کند. پردازنده‌های رایزن AMD به طور سنتی از ورودی‌های ورودی/خروجی متفاوتی استفاده می‌کنند و دلیلی وجود ندارد که فکر کنیم سری 10000 آن - یا هر چیزی که در نهایت آنها را نام می‌برند - متفاوت باشد. ما فقط می‌توانیم در مورد خطوط PCIe و ویژگی‌های چیپ‌ست حدس بزنیم، اما می‌توان فرض کرد که DDR5 8000 MT/s باید پایدار باشد.

با این اوصاف، با توجه به کمبود حافظه فعلی، حافظه سریع ممکن است برای علاقه مندان کمی یک نهنگ سفید باشد. باز هم، ما فقط در حال حدس و گمان هستیم. AMD با انتشار بعدی Ryzen خود می تواند در مسیری کاملا متفاوت حرکت کند. این فقط بسیار غیرعادی خواهد بود. Threadripper کمی ساده تر است. بخش‌ها از لحاظ تاریخی، قفل Epycs را باز کرده‌اند، معمولا با ساعت‌های بوست بالاتر خارج از جعبه.

به‌روزرسانی بعدی Threadripper AMD بدون شک 96 هسته Zen 6 با فرکانس بیش از 5 گیگاهرتز، PCIe بیشتر از آنچه می‌توانستید مصرف کند، و ظرفیت‌های حافظه‌ای که حتی برای سرگرم کردن نیاز به وام مسکن دوم دارد، ارائه می‌کند. سوالی که به نظر می رسد این باشد که آیا AMD برای اولین بار شاهد استقرار هسته های Zen 6C خود بر روی Threadripper خواهیم بود یا خیر.

آنها برای اولین بار به راحتی 128 هسته را در دسترس کاربران دسکتاپ قرار می دهند، اما این به معنای امتیاز دادن به عملکرد هر هسته و خارج از تعداد معدودی مشاغل است، تعداد کاربرانی که واقعا به آن محاسبات روی میز خود نیاز دارند احتمالا بسیار کم است. با این حال، دیدنی است. هنوز سوالاتی بدون پاسخ باقی مانده است.

ما هنوز تصویر روشنی از تغییرات معماری که زیربنای هسته Zen 6 یا CCD ها هستند، نداریم، و همچنین AMD در مورد اینکه چرا بسته بندی بسیار متفاوت از نسل های قبلی پردازنده های Epyc به نظر می رسد، دقت نکرده است. با این حال، ما لیست های جامع SKU، بینش عمیقی در مورد ترکیب تراشه، سرعت ساعت و ارقام اولیه عملکرد نسبت به رقیب اصلی AMD این بار داریم. امیدواریم در اواخر امسال اطلاعات بیشتری در مورد هسته Zen 6 بدست آوریم، یعنی نزدیک به زمانی که اولین CPU های Venice شروع به ارسال به مشتریان می کنند. ®

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

An Epyc trip to Venice: Everything we do and don't know about AMD's 256-core monster chip

16 channels of DDR5, 5 GHz clock speeds, and support for CXL 3.1 memory god boxes? What's not to like?

همه‌ی اخبار فناوری