Fallo en NVIDIA DCGM Exporter deja sin monitorizar las GPU

Fallo en NVIDIA DCGM Exporter deja sin monitorizar las GPU

Una vulnerabilidad de gravedad alta en DCGM Exporter de NVIDIA (CVE-2026-47483) permite a atacantes no autenticados tumbar el servicio de monitorización de GPU y podría afectar a las cargas de trabajo de IA que se ejecutan en la misma máquina. La investigación es obra de Lava, que además encontró cientos de servidores de GPU expuestos en internet.

Lava comunicó el problema a NVIDIA. La compañía le asignó una puntuación CVSS de 8,2 y publicó un boletín de seguridad el 28 de julio de 2026.

Lo que revela el exporter

Los servidores de GPU son máquinas construidas en torno a unidades de procesamiento gráfico y se utilizan para IA, aprendizaje automático y computación científica. DCGM Exporter lee los datos directamente de las GPU de un equipo, como la temperatura, el uso, el consumo de memoria, el consumo eléctrico y los eventos de error. Publica estos datos por HTTP, normalmente en el puerto 9400, para que herramientas como Prometheus puedan recogerlos.

La salida incluye también el modelo exacto de GPU y un identificador único (UUID) para cada tarjeta. Según el investigador de Lava Michael Katchinskiy, eso basta para que un atacante sepa qué hardware usa un servidor, cuánta carga tiene y si está registrando errores. Lo que le llevó a preguntarse: "¿Cuántos de ellos están expuestos a internet?"

Miles de servidores, sin autenticación

El equipo encontró más de 2.000 servidores que exponían el exporter públicamente. En cuatro escaneos realizados entre marzo y mayo de 2026, estos servidores reportaron más de 12.000 GPU únicas, con un valor estimado de 100 millones de dólares.

"Todos los equipos devolvían métricas por HTTP en texto plano y ninguno exigía autenticación", escribió Katchinskiy.

Entre el hardware expuesto figuraban las GPU Blackwell Ultra B300, H200 y H100 de NVIDIA, diseñadas para grandes cargas de trabajo de IA, así como tarjetas de consumo RTX 5090 y 4090. Casi 300 organizaciones se vieron afectadas. Estados Unidos concentraba 5.274 de las GPU expuestas (44%), por delante de Rumanía, con 2.054, y China, con 1.967.

Algunos exporters funcionaban en infraestructura de clientes de proveedores de nube de GPU, como Voltage Park, Lambda, Northern Data y DigitalOcean. Voltage Park tenía la mayor cuota, con 672 equipos públicos con Node Exporter y 71 con DCGM Exporter. La empresa afirmó que la mayoría de las instancias de Node Exporter y todas las de DCGM Exporter las habían desplegado los clientes, y que su equipo de seguridad se puso en contacto con ellos.

Los endpoints de depuración abren la puerta a caídas

Alrededor de una cuarta parte de los equipos expuestos también servían los endpoints de perfilado /debug/pprof/ de Go junto a /metrics. Algunos de estos endpoints mantienen una petición abierta tanto tiempo como indique quien la hace, y muchas peticiones simultáneas sin autenticar disparan el uso de memoria.

Al principio, los investigadores pensaron que se trataba de un error de configuración de los operadores. Después reprodujeron el comportamiento con el contenedor oficial de DCGM Exporter de NVIDIA, sin modificar. Cualquier despliegue que exponga el exporter en una interfaz enrutable podría exponer también /debug/pprof/.

"Con suficientes peticiones simultáneas sin autenticar, el exporter podía quedarse sin memoria y caerse, lo que eliminaba la visibilidad sobre el estado y la actividad de las GPU", explicó Katchinskiy. La presión adicional sobre la CPU y la RAM también podría ralentizar el equipo y entorpecer trabajos de entrenamiento o inferencia, sobre todo donde no hay límites de recursos estrictos.

Node Exporter aporta aún más detalle

Lava también examinó Prometheus Node Exporter, que monitoriza el hardware y el sistema operativo de un servidor. Encontró 12.096 equipos públicos que reportaban métricas de adaptadores de red InfiniBand y RoCE de NVIDIA/Mellanox, incluidos modelos, versiones de firmware, estado del enlace y actividad de la red de interconexión. Algunos filtraban nombres de host, versiones del sistema operativo y del kernel, y datos de la BIOS. Un solo endpoint permitía identificar un Dell PowerEdge XE9680 con Ubuntu 22.04.5 LTS y un puerto activo de 400 Gb/s.

"Las versiones exactas permiten a un atacante ir directamente a las vulnerabilidades conocidas que les corresponden", señaló Katchinskiy.

Soluciones

Los usuarios deben actualizar DCGM Exporter a la versión 4.8.2 o posterior y mantener desactivada la opción -enable-pprof salvo que necesiten el perfilado. En las versiones actuales, el perfilado hay que activarlo expresamente. Lava recomienda mantener Node Exporter, DCGM Exporter y Prometheus fuera de internet, vincular los exporters a la interfaz de loopback o a interfaces privadas y restringir el acceso con reglas de cortafuegos o grupos de seguridad. Las API de consulta de Prometheus y las páginas de targets necesitan la misma protección.

Nuestra opinión

El CVE es lo que acapara los titulares, pero el problema de fondo en los hallazgos de Lava es la exposición. Las herramientas de monitorización suelen verse como simple fontanería inofensiva. Aquí, en cambio, regalaban a cualquiera que preguntara un mapa de hardware de IA carísimo, versiones de software y detalles de red. Encaja en una tendencia más amplia de atacantes que van a por infraestructura de IA mal protegida, como el malware PoeLLM que secuestra servidores de IA expuestos para minar criptomonedas.

El caso de Voltage Park también apunta a que muchos equipos no tienen claro dónde acaba la responsabilidad del proveedor y dónde empieza la del cliente. Habrá que ver si los proveedores de nube de GPU empiezan a bloquear por defecto los puertos públicos de monitorización y con qué rapidez se parchean o se desconectan los equipos expuestos.