NVIDIA DCGM Exporter: Lücke kann GPU-Überwachung lahmlegen
Eine schwerwiegende Sicherheitslücke im DCGM Exporter von NVIDIA (CVE-2026-47483) erlaubt es Angreifern ohne Authentifizierung, den Dienst zur GPU-Überwachung lahmzulegen. Zudem kann sie KI-Workloads stören, die auf demselben Rechner laufen. Entdeckt hat die Schwachstelle Lava. Die Forscher stießen dabei auch auf Hunderte GPU-Server, die offen im Internet erreichbar sind.
Lava meldete das Problem an NVIDIA. Der Hersteller bewertete die Lücke mit einem CVSS-Wert von 8,2 und veröffentlichte am 28. Juli 2026 ein Sicherheitsbulletin.
Was der Exporter preisgibt
GPU-Server sind Rechner, die auf Grafikprozessoren aufbauen und für KI, maschinelles Lernen und wissenschaftliches Rechnen eingesetzt werden. Der DCGM Exporter liest Daten direkt aus den GPUs eines Hosts aus, etwa Temperatur, Auslastung, Speicherbelegung, Stromverbrauch und Fehlerereignisse. Diese Daten stellt er per HTTP bereit, meist auf Port 9400, damit Werkzeuge wie Prometheus sie einsammeln können.
Die Ausgabe enthält außerdem das genaue GPU-Modell und eine eindeutige Kennung (UUID) für jede Karte. Laut Lava-Forscher Michael Katchinskiy reicht das aus, damit ein Angreifer erfährt, welche Hardware auf einem Server läuft, wie stark er ausgelastet ist und ob er Fehler meldet. Das brachte ihn zu der Frage: "Wie viele davon sind aus dem Internet erreichbar?"
Tausende Server, keine Authentifizierung
Das Team fand mehr als 2.000 Server, auf denen der Exporter öffentlich zugänglich war. Bei vier Scans zwischen März und Mai 2026 meldeten diese Server mehr als 12.000 einzelne GPUs mit einem geschätzten Wert von 100 Millionen US-Dollar.
"Jeder Host lieferte Metriken über unverschlüsseltes HTTP, und keiner verlangte eine Authentifizierung", schrieb Katchinskiy.
Zur offen zugänglichen Hardware gehörten NVIDIAs GPUs Blackwell Ultra B300, H200 und H100, die für große KI-Workloads gedacht sind, aber auch Consumer-Karten vom Typ RTX 5090 und 4090. Betroffen waren fast 300 Organisationen. Auf die USA entfielen 5.274 der offenen GPUs (44 Prozent), vor Rumänien mit 2.054 und China mit 1.967.
Einige Exporter liefen auf Kundeninfrastruktur bei GPU-Cloud-Anbietern, darunter Voltage Park, Lambda, Northern Data und DigitalOcean. Den größten Anteil hatte Voltage Park mit 672 öffentlichen Node-Exporter-Hosts und 71 öffentlichen DCGM-Exporter-Hosts. Das Unternehmen erklärte, die meisten Node-Exporter-Instanzen und sämtliche DCGM-Exporter-Instanzen seien von Kunden eingerichtet worden. Das eigene Sicherheitsteam habe die Kunden kontaktiert.
Debug-Endpunkte öffnen die Tür für Abstürze
Rund ein Viertel der offenen Hosts stellte neben /metrics auch die Profiling-Endpunkte /debug/pprof/ von Go bereit. Einige dieser Endpunkte halten eine Anfrage so lange offen, wie der Aufrufer es vorgibt. Viele gleichzeitige Anfragen ohne Authentifizierung treiben den Speicherverbrauch in die Höhe.
Zunächst gingen die Forscher von einer Fehlkonfiguration durch die Betreiber aus. Dann konnten sie das Verhalten mit dem offiziellen, unveränderten DCGM-Exporter-Container von NVIDIA nachstellen. Jede Installation, die den Exporter auf einer routbaren Schnittstelle anbietet, könnte also auch /debug/pprof/ offenlegen.
"Mit genügend gleichzeitigen Anfragen ohne Authentifizierung konnte dem Exporter der Speicher ausgehen, sodass er abstürzte. Damit fiel der Einblick in Zustand und Aktivität der GPUs weg", erklärte Katchinskiy. Die zusätzliche Last auf CPU und Arbeitsspeicher könnte zudem den Host ausbremsen und Trainings- oder Inferenzjobs stören, vor allem dort, wo strikte Ressourcenlimits fehlen.
Node Exporter liefert weitere Details
Lava nahm sich auch den Prometheus Node Exporter vor, der Hardware und Betriebssystem eines Servers überwacht. Die Forscher fanden 12.096 öffentliche Hosts, die Metriken von InfiniBand- und RoCE-Netzwerkadaptern von NVIDIA/Mellanox meldeten, darunter Modelle, Firmware-Versionen, Verbindungsstatus und Fabric-Aktivität. Manche gaben Hostnamen, Betriebssystem- und Kernelversionen sowie BIOS-Details preis. Ein einziger Endpunkt verriet einen Dell PowerEdge XE9680 mit Ubuntu 22.04.5 LTS und einem aktiven 400-Gb/s-Port.
"Mit exakten Versionsangaben kann ein Angreifer direkt nach passenden bekannten Schwachstellen suchen", so Katchinskiy.
Abhilfe
Nutzer sollten den DCGM Exporter auf Version 4.8.2 oder neuer aktualisieren und das Flag -enable-pprof deaktiviert lassen, sofern kein Profiling nötig ist. In aktuellen Versionen muss Profiling ausdrücklich eingeschaltet werden. Lava rät, Node Exporter, DCGM Exporter und Prometheus vom öffentlichen Internet fernzuhalten, Exporter nur an Loopback- oder private Schnittstellen zu binden und den Zugriff per Firewall-Regeln oder Sicherheitsgruppen einzuschränken. Die Abfrage-APIs und Target-Seiten von Prometheus brauchen denselben Schutz.
Unsere Einschätzung
Die CVE sorgt für die Schlagzeile, das größere Problem in Lavas Ergebnissen ist aber die offene Erreichbarkeit. Überwachungswerkzeuge gelten oft als harmlose Infrastruktur im Hintergrund. Hier lieferten sie jedem, der danach fragte, eine kostenlose Landkarte teurer KI-Hardware, von Softwareversionen und Netzwerkdetails. Das passt zu einem breiteren Muster: Angreifer nehmen schlecht gesicherte KI-Infrastruktur ins Visier, etwa die Malware PoeLLM, die offene KI-Server kapert, um Kryptowährung zu schürfen.
Der Fall Voltage Park deutet zudem darauf hin, dass vielen Teams unklar ist, wo die Verantwortung des Anbieters endet und die des Kunden beginnt. Es lohnt sich zu beobachten, ob GPU-Cloud-Anbieter öffentliche Monitoring-Ports künftig standardmäßig sperren und wie schnell die offenen Hosts gepatcht oder vom Netz genommen werden.
