پرش به محتوای اصلی

باگ شدید انویدیا می‌تواند نظارت بر GPU را در سرورهای در معرض خرابی خراب کند

دِ رجیستر۱۴۰۵ مهر ۱۶, پنجشنبه، ساعت ۲۱:۴۷حدود 3 دقیقه مطالعه

غول پردازنده گرافیکی اصلاحی برای این نقص منتشر کرد که با نام CVE-2026-47483 ردیابی شد.

محققان هزاران سرور GPU را یافتند که صادرکننده DCGM انویدیا را در معرض اینترنت قرار می‌دهند، صدها مورد به طور بالقوه در برابر نقصی با شدت بالا آسیب‌پذیر هستند که می‌تواند به مهاجمان احراز هویت نشده اجازه دهد سرویس نظارت بر GPU را خراب کنند و بارهای کاری هوش مصنوعی را مختل کنند. صادرکنندگان DCGM، تله متری را از پردازنده‌های گرافیکی روی میزبان می‌خوانند، از جمله سخت‌افزار، استفاده، مصرف حافظه، مصرف انرژی و رویدادهای خطا. هر GPU شناسه یا UUID منحصربه‌فرد خود را دارد و همه این معیارها به صورت متن ساده از طریق HTTP نمایش داده می‌شوند.

این قرار گرفتن در معرض اطلاعات دقیق و مفید برای شناسایی، از جمله نقشه‌برداری زیرساخت‌های GPU، شناسایی سیستم‌های بالقوه آسیب‌پذیر و نظارت بر فعالیت‌های بار کاری، به مهاجمان احتمالی می‌دهد. مایکل کاتچینسکی، محقق در استارتاپ امنیت مرکز داده Lava، باگ را در سرویس نظارت بر سلامت و عملکرد GPU پیدا کرد و گزارش داد. در ماه سپتامبر، غول پردازنده‌های گرافیکی انویدیا، اصلاحی را برای این نقص منتشر کرد که به‌عنوان CVE-2026-47483 ردیابی شد و امتیاز 8.2 CVSS را با شدت بالا به آن داد.

زمانی که متوجه شدیم این نقاط پایانی چقدر آشکار می شوند، سوال بعدی این بود: چه تعداد از آنها در معرض اینترنت هستند؟ کاتچینسکی در یک وبلاگ پنجشنبه گفت. بنابراین محققان شروع به اسکن اینترنت برای صادرکنندگان DCGM در معرض دید کردند. او نوشت و مقیاس قرار گرفتن در معرض "بخصوص مهم" بود. در طول چهار اسکن بین مارس و می، شکارچیان تهدید حدود 2100 سرور GPU را پیدا کردند که معیارهای صادرکننده DCGM را در معرض اینترنت باز قرار می‌دادند. این شامل 12000 UUID GPU بود. هیچ کدام از این موارد نیاز به احراز هویت ندارند.

به گفته Katchinskiy، میزبان ها به حدود 300 سازمان تعلق داشتند و تقریبا نیمی - 5274 GPU در معرض نمایش یا 44 درصد از کل - در ایالات متحده قرار داشتند. این پردازنده‌های گرافیکی حدود 100 میلیون دلار سخت‌افزار داشتند و شامل پردازنده‌های گرافیکی Nvidia Blackwell Ultra B300، H200s و H100s - مورد استفاده برای اجرای بارهای کاری هوش مصنوعی در مقیاس بزرگ - به‌علاوه سیستم‌های RTX 5090 و 4090 مصرف‌کننده بودند. در حین بررسی سیستم‌های در معرض دید، تیم Lava متوجه شد که حدود 25 درصد از میزبان‌های DCGM در معرض نمایش داده‌های ابزار پروفایل داخلی /debug/pprof/ Go را نیز آشکار کردند.

نمایه ساز داده های عملکرد زمان اجرا مانند استفاده از پردازنده و حافظه را برای اجرای برنامه های Go جمع آوری و در معرض دید قرار می دهد. این شامل استفاده از CPU، تخصیص حافظه، حالت‌های گوروتین و مسدود کردن رویدادها می‌شود. Katchinskiy نوشت: «با درخواست‌های همزمان تأیید نشده کافی، صادرکننده ممکن است حافظه‌اش تمام شود و از کار بیفتد و دید به سلامت و فعالیت GPU قطع شود». CPU و فشار حافظه همچنین می تواند بر تمرینات هوش مصنوعی یا بارهای کاری استنتاج تأثیر بگذارد. انویدیا این مشکل را در نسخه 4.8.2 برطرف کرده است و اپراتورها باید به آن نسخه یا نسخه جدیدتر ارتقا دهند.

لاوا علاوه بر تله‌متری GPU، به Prometheus Node Exporter نیز توجه کرد که سخت‌افزار سرور و سیستم‌های عامل را نظارت می‌کند و همچنین معیارها را از طریق HTTP نشان می‌دهد. این تیم ۱۲۰۹۶ میزبان Node Exporter عمومی را پیدا کرد که داده‌های مربوط به مدل‌های سرور، سیستم‌عامل‌ها، نسخه‌های میان‌افزار، نام‌های میزبان، مسیرهای ذخیره‌سازی و سخت‌افزار شبکه‌ای که معمولا در خوشه‌های GPU استفاده می‌شوند را در معرض نمایش قرار می‌دهند. این اطلاعات نشان می‌دهد که چگونه محیط‌ها ساخته و پیکربندی می‌شوند، که همچنین می‌توانند توسط مهاجمان برای شناسایی مورد استفاده قرار گیرند و سیستم را با آسیب‌پذیری‌های شناخته شده تطبیق دهند.

سرویس‌های نظارتی که به‌صورت عمومی در معرض دید عموم قرار گرفته‌اند، زیرساخت‌های مشتریان را در سراسر ارائه‌دهندگان ابر نئوکلاد و GPU از جمله Nebius، Voltage Park، Lambda، Northern Data و DigitalOcean تحت تأثیر قرار می‌دهند. Lava همه اینها را به ارائه دهندگان آسیب دیده گزارش کرد و Katchinskiy می گوید که این ارائه دهندگان با مشتریان برای رسیدگی به مواجهه ها کار کردند. برای اپراتورها: فروشگاه امنیتی می گوید که خدمات Nvidia DCGM Exporter، Node Exporter و Prometheus نباید مستقیما از اینترنت عمومی قابل دسترسی باشند و توصیه می کند آنها را به زیرساخت نظارت مجاز محدود کنید.

Katchinskiy نوشت: «یافته‌ها شکاف امنیتی فزاینده در زیرساخت‌های هوش مصنوعی را برجسته می‌کنند: شرکت‌ها میلیون‌ها دلار را برای پردازنده‌های گرافیکی هزینه می‌کنند در حالی که سیستم‌های حیاتی را در معرض دید قرار می‌دهند. این قرار گرفتن در معرض می‌تواند نشان دهد که محیط‌های هوش مصنوعی چگونه ساخته شده‌اند و در برخی موارد به مهاجمان اجازه می‌دهند تا آنها را مختل کنند.» ®

خواندن متن کامل در دِ رجیستربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

High-severity Nvidia bug could crash GPU monitoring on exposed servers

The GPU giant released a fix for the flaw, tracked as CVE-2026-47483

همه‌ی اخبار فناوری