Vijil DART ataca agentes de IA con tácticas adaptativas

Vijil DART ataca agentes de IA con tácticas adaptativas

Vijil ha lanzado Diamond Adaptive Red Teaming for Agents (DART), un sistema automatizado que rastrea los agentes de IA empresariales en busca de vulnerabilidades de seguridad e incumplimientos de políticas. DART no lanza una lista fija de prompts contra su objetivo. Despliega varios agentes adversarios propios, que ejecutan ataques de varios turnos y cambian de táctica a medida que aprenden.

La compañía asegura que los desarrolladores de IA y los ingenieros de seguridad de aplicaciones pueden usar DART para descubrir más problemas en sus flotas de agentes de los que encontrarían con herramientas y servicios de red teaming basados en prompts de prueba estáticos.

El problema de la escala

Vijil cita una estimación de Gartner como motivo del lanzamiento. Para 2028, se espera que la empresa media de la lista Fortune 500 global gestione más de 150.000 agentes. En 2025 la cifra no llegaba a 15. Los equipos de ingeniería y gobernanza de IA no tienen ni el tiempo ni el dinero para probar a mano tantos agentes.

Los atacantes avanzan en la misma dirección. Cada vez más actores maliciosos recurren a sus propios agentes de IA para lanzar ataques sostenidos y de varios turnos contra sistemas de IA empresariales.

Según Vijil, las herramientas de red teaming actuales se limitan sobre todo a buscar coincidencias con patrones de ataque conocidos y les cuesta seguir el ritmo. Rara vez idean formas nuevas de sortear las defensas de un agente. Muchas se conforman con comparar la salida del agente con un conjunto estático de prompts de ataque, y solo cubren el modelo de lenguaje y la interfaz de chat.

El momento en que se hacen las pruebas es otro problema. Suelen encargarse a consultores externos, al margen del ciclo de desarrollo del agente, a veces solo unos días antes del lanzamiento. Eso deja a los desarrolladores poco margen para corregir los hallazgos graves antes de que el agente entre en producción.

Cómo funciona DART

DART pone a prueba el agente completo, incluido el uso de herramientas, la memoria y el comportamiento a lo largo de varios turnos. Sus ataques se adaptan al objetivo dentro del propio entorno de este. El sistema lanza oleadas de ataques de varios turnos, evalúa cada respuesta, ajusta su enfoque y vuelve a intentarlo, tantas veces como fije el usuario.

No necesita una lista de vulnerabilidades que buscar. Vijil afirma que las encuentra por su cuenta.

Entre sus principales funciones figuran:

  • Cobertura de riesgos: taxonomías predefinidas basadas en OWASP, MITRE y la investigación propia de Vijil, con la opción de construir la cobertura a partir del catálogo de riesgos de cada empresa.
  • Encadenamiento de ataques: los ataques se encadenan a lo largo de turnos y episodios para mapear la superficie de ataque y explotar los puntos débiles.
  • Herramientas para desarrolladores: un plugin para agentes de programación como Claude Code y Codex. DART funciona con cualquier framework de agentes o plataforma de despliegue y genera un informe auditable tanto para los equipos de ingeniería como para los de cumplimiento normativo.
  • Flujo de trabajo DevOps: ejecuciones automatizadas a gran escala bajo carga sostenida, con limitación de peticiones, reintentos y configuración del modelo por rol. Puede invocarse mediante API como parte de un pipeline de CI/CD.
  • Opciones de despliegue: puede ejecutarse en la VPC del propio cliente o totalmente en local, incluidos entornos aislados (air-gapped) y regulados.

Resultados en el benchmark

En una prueba reciente con el benchmark DecodingTrust-Agent, DART alcanzó una tasa de éxito de ataque 1,5 veces superior a la de su competidor más cercano. Lo superó en nueve de doce tareas de agentes empresariales, que abarcaban ámbitos como CRM, código, atención al cliente, medicina, investigación y viajes.

"Tu agente de IA personalizado, que puede acceder a tus datos confidenciales y tomar por sí solo decisiones con consecuencias, requiere un enfoque de control de calidad integral y a medida", afirmó Vin Sharma, CEO de Vijil.

"Hay una gran distancia entre un agente que parece listo en una demo y otro que demuestra su fiabilidad, seguridad y protección bajo presión. DART acorta esa distancia y ahorra semanas de trabajo y decenas de miles de dólares frente a los encargos de red teaming manual, los benchmarks genéricos y los prototipos de código abierto", añadió.

Parte de una plataforma más amplia

DART es una nueva capacidad de Vijil Diamond, uno de los módulos de la plataforma Vijil. Una vez que DART ha encontrado los puntos débiles, otros módulos se encargan del análisis de la causa raíz, aplican salvaguardas basadas en políticas y proponen cambios en el código para corregir los problemas.

Cada módulo puede usarse por separado. Vijil Discover localiza e identifica los agentes de toda la organización, incluida la IA en la sombra. Vijil Diamond busca fallos en los agentes antes de su lanzamiento. Vijil Dome hace cumplir las políticas de la organización en producción. Vijil Darwin sigue mejorando los agentes a medida que aparecen nuevos usuarios, modelos y métodos de ataque.

Nuestra opinión

DART es una señal más de que los proveedores de seguridad ya tratan a los agentes de IA como una superficie de ataque propia y no como chatbots con extras. El énfasis en el uso de herramientas, la memoria y el comportamiento a lo largo de varios turnos encaja con los riesgos que de verdad importan cuando los agentes pueden tocar datos y sistemas reales. También se suma a una tendencia más amplia de herramientas de seguridad ofensiva agéntica que usan la IA para atacar antes de que lo hagan los delincuentes.

Para los lectores que tienen agentes en producción, el paso hacia las pruebas dentro de los pipelines de CI/CD puede pesar más que cualquier función concreta. Apunta a que el red teaming podría dejar de ser una comprobación de última hora para convertirse en un paso rutinario, algo que, a la vista de los hallazgos recientes sobre las carencias de preparación en torno a los sistemas de IA, llega con retraso.

Las cifras del benchmark proceden del propio fabricante, así que convendrá estar atentos a las pruebas independientes. También habrá que ver si el red teaming adaptativo se convierte en una exigencia habitual para los equipos de cumplimiento normativo.