باگ شدید انویدیا میتواند نظارت بر GPU را در سرورهای در معرض خرابی خراب کند
غول پردازنده گرافیکی اصلاحی برای این نقص منتشر کرد که با نام CVE-2026-47483 ردیابی شد.
محققان هزاران سرور GPU را یافتند که صادرکننده DCGM انویدیا را در معرض اینترنت قرار میدهند، صدها مورد به طور بالقوه در برابر نقصی با شدت بالا آسیبپذیر هستند که میتواند به مهاجمان احراز هویت نشده اجازه دهد سرویس نظارت بر GPU را خراب کنند و بارهای کاری هوش مصنوعی را مختل کنند. صادرکنندگان DCGM، تله متری را از پردازندههای گرافیکی روی میزبان میخوانند، از جمله سختافزار، استفاده، مصرف حافظه، مصرف انرژی و رویدادهای خطا. هر GPU شناسه یا UUID منحصربهفرد خود را دارد و همه این معیارها به صورت متن ساده از طریق HTTP نمایش داده میشوند.
این قرار گرفتن در معرض اطلاعات دقیق و مفید برای شناسایی، از جمله نقشهبرداری زیرساختهای GPU، شناسایی سیستمهای بالقوه آسیبپذیر و نظارت بر فعالیتهای بار کاری، به مهاجمان احتمالی میدهد. مایکل کاتچینسکی، محقق در استارتاپ امنیت مرکز داده Lava، باگ را در سرویس نظارت بر سلامت و عملکرد GPU پیدا کرد و گزارش داد. در ماه سپتامبر، غول پردازندههای گرافیکی انویدیا، اصلاحی را برای این نقص منتشر کرد که بهعنوان CVE-2026-47483 ردیابی شد و امتیاز 8.2 CVSS را با شدت بالا به آن داد.
زمانی که متوجه شدیم این نقاط پایانی چقدر آشکار می شوند، سوال بعدی این بود: چه تعداد از آنها در معرض اینترنت هستند؟ کاتچینسکی در یک وبلاگ پنجشنبه گفت. بنابراین محققان شروع به اسکن اینترنت برای صادرکنندگان DCGM در معرض دید کردند. او نوشت و مقیاس قرار گرفتن در معرض "بخصوص مهم" بود. در طول چهار اسکن بین مارس و می، شکارچیان تهدید حدود 2100 سرور GPU را پیدا کردند که معیارهای صادرکننده DCGM را در معرض اینترنت باز قرار میدادند. این شامل 12000 UUID GPU بود. هیچ کدام از این موارد نیاز به احراز هویت ندارند.
به گفته Katchinskiy، میزبان ها به حدود 300 سازمان تعلق داشتند و تقریبا نیمی - 5274 GPU در معرض نمایش یا 44 درصد از کل - در ایالات متحده قرار داشتند. این پردازندههای گرافیکی حدود 100 میلیون دلار سختافزار داشتند و شامل پردازندههای گرافیکی Nvidia Blackwell Ultra B300، H200s و H100s - مورد استفاده برای اجرای بارهای کاری هوش مصنوعی در مقیاس بزرگ - بهعلاوه سیستمهای RTX 5090 و 4090 مصرفکننده بودند. در حین بررسی سیستمهای در معرض دید، تیم Lava متوجه شد که حدود 25 درصد از میزبانهای DCGM در معرض نمایش دادههای ابزار پروفایل داخلی /debug/pprof/ Go را نیز آشکار کردند.
نمایه ساز داده های عملکرد زمان اجرا مانند استفاده از پردازنده و حافظه را برای اجرای برنامه های Go جمع آوری و در معرض دید قرار می دهد. این شامل استفاده از CPU، تخصیص حافظه، حالتهای گوروتین و مسدود کردن رویدادها میشود. Katchinskiy نوشت: «با درخواستهای همزمان تأیید نشده کافی، صادرکننده ممکن است حافظهاش تمام شود و از کار بیفتد و دید به سلامت و فعالیت GPU قطع شود». CPU و فشار حافظه همچنین می تواند بر تمرینات هوش مصنوعی یا بارهای کاری استنتاج تأثیر بگذارد. انویدیا این مشکل را در نسخه 4.8.2 برطرف کرده است و اپراتورها باید به آن نسخه یا نسخه جدیدتر ارتقا دهند.
لاوا علاوه بر تلهمتری GPU، به Prometheus Node Exporter نیز توجه کرد که سختافزار سرور و سیستمهای عامل را نظارت میکند و همچنین معیارها را از طریق HTTP نشان میدهد. این تیم ۱۲۰۹۶ میزبان Node Exporter عمومی را پیدا کرد که دادههای مربوط به مدلهای سرور، سیستمعاملها، نسخههای میانافزار، نامهای میزبان، مسیرهای ذخیرهسازی و سختافزار شبکهای که معمولا در خوشههای GPU استفاده میشوند را در معرض نمایش قرار میدهند. این اطلاعات نشان میدهد که چگونه محیطها ساخته و پیکربندی میشوند، که همچنین میتوانند توسط مهاجمان برای شناسایی مورد استفاده قرار گیرند و سیستم را با آسیبپذیریهای شناخته شده تطبیق دهند.
سرویسهای نظارتی که بهصورت عمومی در معرض دید عموم قرار گرفتهاند، زیرساختهای مشتریان را در سراسر ارائهدهندگان ابر نئوکلاد و GPU از جمله Nebius، Voltage Park، Lambda، Northern Data و DigitalOcean تحت تأثیر قرار میدهند. Lava همه اینها را به ارائه دهندگان آسیب دیده گزارش کرد و Katchinskiy می گوید که این ارائه دهندگان با مشتریان برای رسیدگی به مواجهه ها کار کردند. برای اپراتورها: فروشگاه امنیتی می گوید که خدمات Nvidia DCGM Exporter، Node Exporter و Prometheus نباید مستقیما از اینترنت عمومی قابل دسترسی باشند و توصیه می کند آنها را به زیرساخت نظارت مجاز محدود کنید.
Katchinskiy نوشت: «یافتهها شکاف امنیتی فزاینده در زیرساختهای هوش مصنوعی را برجسته میکنند: شرکتها میلیونها دلار را برای پردازندههای گرافیکی هزینه میکنند در حالی که سیستمهای حیاتی را در معرض دید قرار میدهند. این قرار گرفتن در معرض میتواند نشان دهد که محیطهای هوش مصنوعی چگونه ساخته شدهاند و در برخی موارد به مهاجمان اجازه میدهند تا آنها را مختل کنند.» ®
متن اصلی (انگلیسی)
High-severity Nvidia bug could crash GPU monitoring on exposed servers
The GPU giant released a fix for the flaw, tracked as CVE-2026-47483