Faille NVIDIA DCGM Exporter : la supervision GPU menacée
Une vulnérabilité de gravité élevée dans DCGM Exporter de NVIDIA (CVE-2026-47483) permet à des attaquants non authentifiés de mettre hors ligne le service de supervision des GPU et pourrait perturber les charges de travail d'IA qui tournent sur la même machine. La découverte vient de Lava, qui a également repéré des centaines de serveurs GPU exposés sur Internet.
Lava a signalé le problème à NVIDIA. Le fabricant lui a attribué un score CVSS de 8,2 et a publié un bulletin de sécurité le 28 juillet 2026.
Ce que révèle l'exporteur
Les serveurs GPU sont des machines construites autour de processeurs graphiques et servent à l'IA, à l'apprentissage automatique et au calcul scientifique. DCGM Exporter lit directement les données des GPU d'un hôte : température, taux d'utilisation, consommation mémoire, consommation électrique et événements d'erreur. Il publie ces données en HTTP, généralement sur le port 9400, pour que des outils comme Prometheus puissent les collecter.
Ces données comprennent aussi le modèle exact de chaque GPU et un identifiant unique (UUID) pour chaque carte. Selon Michael Katchinskiy, chercheur chez Lava, cela suffit à un attaquant pour savoir quel matériel fait tourner un serveur, à quel point il est sollicité et s'il remonte des erreurs. D'où sa question : "Combien d'entre eux sont exposés sur Internet ?"
Des milliers de serveurs, aucune authentification
L'équipe a trouvé plus de 2 000 serveurs exposant publiquement l'exporteur. Au fil de quatre analyses menées entre mars et mai 2026, ces serveurs ont remonté plus de 12 000 GPU uniques, d'une valeur estimée à 100 millions de dollars.
"Chaque hôte renvoyait ses métriques en HTTP non chiffré, et aucun n'exigeait d'authentification", écrit Katchinskiy.
Parmi le matériel exposé figuraient des GPU Blackwell Ultra B300, H200 et H100 de NVIDIA, conçus pour les grosses charges d'IA, mais aussi des cartes grand public RTX 5090 et 4090. Près de 300 organisations étaient concernées. Les États-Unis totalisaient 5 274 des GPU exposés (44 %), devant la Roumanie avec 2 054 et la Chine avec 1 967.
Certains exporteurs tournaient sur l'infrastructure de clients de fournisseurs de cloud GPU, dont Voltage Park, Lambda, Northern Data et DigitalOcean. Voltage Park arrivait en tête, avec 672 hôtes Node Exporter publics et 71 hôtes DCGM Exporter publics. L'entreprise a indiqué que la plupart des instances Node Exporter et la totalité des instances DCGM Exporter avaient été déployées par des clients, et que son équipe de sécurité les avait contactés.
Des points de terminaison de débogage qui ouvrent la voie aux plantages
Environ un quart des hôtes exposés servaient aussi les points de terminaison de profilage /debug/pprof/ de Go à côté de /metrics. Certains d'entre eux maintiennent une requête ouverte aussi longtemps que l'appelant le demande, et de nombreuses requêtes simultanées non authentifiées font grimper la consommation de mémoire.
Les chercheurs ont d'abord cru à une erreur de configuration des opérateurs. Ils ont ensuite reproduit le comportement avec le conteneur officiel DCGM Exporter de NVIDIA, sans aucune modification. Tout déploiement exposant l'exporteur sur une interface routable pouvait donc aussi exposer /debug/pprof/.
"Avec suffisamment de requêtes simultanées non authentifiées, l'exporteur pouvait manquer de mémoire et planter, ce qui coupait toute visibilité sur l'état et l'activité des GPU", explique Katchinskiy. La pression supplémentaire sur le processeur et la mémoire vive pouvait aussi ralentir l'hôte et perturber des tâches d'entraînement ou d'inférence, surtout en l'absence de limites strictes sur les ressources.
Node Exporter en dit encore plus
Lava s'est aussi penché sur Prometheus Node Exporter, qui surveille le matériel et le système d'exploitation d'un serveur. Il a trouvé 12 096 hôtes publics remontant des métriques de cartes réseau NVIDIA/Mellanox InfiniBand et RoCE, avec modèles, versions de firmware, état des liens et activité de la fabric. Certains laissaient fuiter des noms d'hôtes, des versions de système d'exploitation et de noyau, ainsi que des informations sur le BIOS. Un seul point de terminaison permettait d'identifier un Dell PowerEdge XE9680 sous Ubuntu 22.04.5 LTS doté d'un port actif à 400 Gb/s.
"Avec les versions exactes, un attaquant peut aller droit aux vulnérabilités connues correspondantes", souligne Katchinskiy.
Correctifs
Les utilisateurs doivent mettre à jour DCGM Exporter vers la version 4.8.2 ou ultérieure et laisser l'option -enable-pprof désactivée sauf si le profilage est nécessaire. Dans les versions actuelles, le profilage doit être activé explicitement. Lava recommande de garder Node Exporter, DCGM Exporter et Prometheus hors de l'Internet public, de lier les exporteurs à l'interface de bouclage ou à des interfaces privées, et de restreindre l'accès avec des règles de pare-feu ou des groupes de sécurité. Les API de requête et les pages de cibles de Prometheus doivent bénéficier de la même protection.
Notre analyse
La CVE fait les gros titres, mais le vrai problème que révèlent les découvertes de Lava, c'est l'exposition. Les outils de supervision sont souvent vus comme une simple tuyauterie sans danger. Ici, ils offraient à quiconque le demandait une carte gratuite du matériel d'IA coûteux, des versions logicielles et des détails réseau. Cela s'inscrit dans une tendance plus large d'attaquants qui ciblent des infrastructures d'IA mal sécurisées, comme le malware PoeLLM qui détourne des serveurs d'IA exposés pour miner de la cryptomonnaie.
Le cas Voltage Park laisse aussi penser que beaucoup d'équipes ne savent pas bien où s'arrête la responsabilité du fournisseur et où commence celle du client. Reste à voir si les fournisseurs de cloud GPU vont se mettre à bloquer par défaut les ports de supervision publics, et à quelle vitesse les hôtes exposés seront corrigés ou retirés d'Internet.
