Vijil DART : du red teaming adaptatif pour les agents IA

Vijil DART : du red teaming adaptatif pour les agents IA

Vijil a lancé Diamond Adaptive Red Teaming for Agents (DART), un système automatisé qui traque les failles de sécurité et les violations de politiques dans les agents IA des entreprises. DART ne se contente pas d'envoyer une liste figée de prompts à sa cible. Il déploie ses propres agents offensifs, qui mènent des attaques sur plusieurs échanges et ajustent leur tactique au fil de ce qu'ils apprennent.

Selon l'éditeur, les développeurs IA et les ingénieurs en sécurité applicative peuvent ainsi détecter davantage de problèmes dans leurs parcs d'agents qu'avec des outils et services de red teaming fondés sur des prompts de test statiques.

Un problème d'échelle

Vijil justifie ce lancement par une estimation de Gartner. D'ici 2028, une entreprise du Fortune 500 mondial devrait exploiter en moyenne plus de 150 000 agents. En 2025, elle en comptait moins de 15. Les équipes d'ingénierie et de gouvernance de l'IA n'ont ni le temps ni le budget pour tester autant d'agents à la main.

Les attaquants suivent la même voie. Les acteurs malveillants recourent de plus en plus à leurs propres agents IA pour mener des attaques soutenues, sur plusieurs échanges, contre les systèmes d'IA des entreprises.

D'après Vijil, les outils de red teaming actuels se bornent pour l'essentiel à reconnaître des schémas d'attaque connus et peinent à suivre le rythme. Ils inventent rarement de nouvelles façons de contourner les défenses d'un agent. Beaucoup se contentent de comparer les réponses d'un agent à un jeu statique de prompts d'attaque, et ne couvrent que le modèle de langage et l'interface de chat.

Le calendrier pose aussi problème. Ces tests sont souvent confiés à des consultants externes, en dehors du cycle de développement de l'agent, parfois quelques jours seulement avant la mise en service. Les développeurs ont alors peu de marge pour corriger les failles graves avant le lancement.

Comment fonctionne DART

DART teste l'agent dans son ensemble, y compris l'utilisation d'outils, la mémoire et le comportement sur plusieurs échanges. Ses attaques s'adaptent à la cible, dans l'environnement de celle-ci. Le système lance des vagues d'attaques sur plusieurs échanges, évalue chaque réponse, ajuste son approche et recommence, autant de fois que l'utilisateur le souhaite.

Il n'a pas besoin d'une liste de vulnérabilités à rechercher. Selon Vijil, il les trouve tout seul.

Parmi les principales fonctionnalités :

  • Couverture des risques : des taxonomies prédéfinies fondées sur l'OWASP, MITRE et les recherches de Vijil, avec la possibilité de bâtir la couverture à partir du propre catalogue de risques de l'entreprise.
  • Enchaînement d'attaques : les attaques sont enchaînées d'un échange et d'un épisode à l'autre pour cartographier la surface d'attaque et exploiter les points faibles.
  • Outils pour développeurs : un plugin pour les agents de programmation comme Claude Code et Codex. DART fonctionne avec n'importe quel framework d'agents ou plateforme de déploiement et produit un rapport vérifiable destiné aux équipes d'ingénierie comme de conformité.
  • Intégration DevOps : des exécutions automatisées à grande échelle sous charge soutenue, avec limitation de débit, nouvelles tentatives et configuration des modèles par rôle. Il peut être appelé via des API dans le cadre d'une chaîne CI/CD.
  • Options de déploiement : il peut tourner dans le propre VPC du client ou entièrement sur site, y compris dans des environnements isolés et réglementés.

Résultats des tests

Lors d'un test récent sur le benchmark DecodingTrust-Agent, DART a obtenu un taux de réussite des attaques 1,5 fois supérieur à celui de son concurrent le plus proche. Il a devancé ce concurrent sur neuf des douze tâches d'agents d'entreprise, dans des domaines comme le CRM, le code, le service client, le médical, la recherche et le voyage.

"Votre agent IA sur mesure, qui peut accéder à vos données confidentielles et agir seul avec des conséquences réelles, exige une approche complète et personnalisée du contrôle qualité", a déclaré Vin Sharma, PDG de Vijil.

"Il y a un vrai fossé entre un agent qui semble prêt lors d'une démo et un agent qui prouve sa fiabilité, sa sécurité et sa sûreté sous pression. DART comble ce fossé et fait économiser des semaines de travail et des dizaines de milliers de dollars par rapport aux missions de red teaming manuelles, aux benchmarks génériques et aux prototypes open source", a-t-il ajouté.

Une brique d'une plateforme plus large

DART est une nouvelle fonctionnalité de Vijil Diamond, l'un des modules de la plateforme Vijil. Une fois que DART a repéré des faiblesses, d'autres modules en analysent les causes profondes, appliquent des garde-fous définis par des politiques et proposent des modifications de code pour corriger les problèmes.

Chaque module peut être utilisé séparément. Vijil Discover détecte et identifie les agents dans toute l'organisation, y compris le shadow AI. Vijil Diamond teste les agents à la recherche de failles avant leur mise en production. Vijil Dome fait respecter les politiques de l'organisation en production. Vijil Darwin continue d'améliorer les agents à mesure qu'apparaissent de nouveaux utilisateurs, de nouveaux modèles et de nouvelles méthodes d'attaque.

Notre analyse

DART est un signe de plus que les éditeurs de sécurité considèrent désormais les agents IA comme une surface d'attaque à part entière, et non comme des chatbots avec quelques options en plus. L'accent mis sur l'utilisation d'outils, la mémoire et le comportement sur plusieurs échanges correspond aux risques qui comptent vraiment dès que les agents peuvent toucher à des données et à des systèmes réels. Il s'inscrit aussi dans une tendance plus large d'outils de sécurité offensive agentique qui utilisent l'IA pour attaquer avant que les criminels ne le fassent.

Pour les lecteurs qui exploitent des agents en production, l'évolution vers des tests intégrés aux chaînes CI/CD compte peut-être davantage que n'importe quelle fonctionnalité prise isolément. Elle laisse penser que le red teaming pourrait passer d'une vérification de dernière minute à une étape de routine, ce que les récentes conclusions sur le manque de préparation face aux attaques visant les systèmes d'IA rendent plus qu'urgent.

Les chiffres du benchmark émanent de l'éditeur lui-même : des tests indépendants seront donc à surveiller. Reste aussi à voir si le red teaming adaptatif deviendra une exigence standard pour les équipes de conformité.