Gremlin Foresight AI : risques détectés, correctifs testés

Gremlin Foresight AI : risques détectés, correctifs testés

Gremlin a rendu Gremlin Foresight AI disponible pour tous après une phase bêta. L'outil passe au crible les systèmes de production à la recherche de risques pour la fiabilité, propose un correctif, puis relance le test initial pour vérifier que ce correctif a bien fait son travail.

L'entreprise s'adresse aux équipes d'ingénierie qui livrent désormais du code plus vite grâce à l'IA et qui craignent que ce gain de vitesse se traduise par davantage de pannes, de services dégradés et de clients mécontents.

Un code plus rapide, plus d'occasions de tomber en panne

Pour Kolton Andrus, PDG de Gremlin, le risque augmente au même rythme que la vitesse.

"Le développement piloté par l'IA, c'est livrer du code 10 fois plus vite ; c'est aussi 10 fois plus d'occasions de bugs, de risques et de pannes", a-t-il déclaré.

Andrus a également comparé le produit aux outils d'AI SRE désormais sur le marché. SRE signifie site reliability engineering, la discipline qui consiste à assurer le bon fonctionnement des services en ligne. Selon lui, ces outils aident les équipes à réagir plus vite aux incidents, mais ils n'entrent en jeu qu'une fois que quelque chose a lâché.

"L'essor des outils d'AI SRE est une excellente chose pour aider les équipes à réagir plus vite aux incidents, mais cela reste du nettoyage après la casse. Gremlin Foresight AI détecte les risques de manière proactive, fournit le correctif et vérifie qu'il a fonctionné en relançant le test. Les équipes obtiennent ainsi les garanties dont elles ont besoin pour avancer en toute confiance", a expliqué Andrus.

Fondé sur dix ans de données de pannes

L'outil repose sur le Failure Atlas propriétaire de Gremlin, un ensemble de plus de dix ans de données de cause à effet sur la façon dont les systèmes en ligne tombent en panne. Selon Gremlin, ses recommandations s'appuient donc sur des schémas de pannes réels et sur l'expérience opérationnelle plutôt que sur des bonnes pratiques génériques.

Chaque correctif est contrôlé à l'aide du test qui a mis le problème en évidence au départ : le processus va ainsi du repérage d'une faiblesse jusqu'à la démonstration qu'elle a disparu.

Gremlin met en avant quatre fonctionnalités principales :

  • Détection proactive des risques : repérer les faiblesses et les conditions de panne avant qu'elles ne deviennent des incidents
  • Remédiation guidée : recommander et fournir un correctif précis, sous forme de patch de configuration ou de modification d'infrastructure as code
  • Validation continue : relancer le test initial pour confirmer que le correctif fonctionne, et répéter les tests au fil de l'évolution des systèmes
  • Résilience mesurable : suivre des scores de fiabilité par service et par équipe pour mesurer les progrès et décider où investir ensuite

De Chaos Monkey à la résilience agentique

Andrus travaille sur ce problème depuis longtemps. Avant de fonder Gremlin, il était responsable de la disponibilité du site marchand d'Amazon. Il est ensuite passé chez Netflix, où il a conçu la deuxième génération d'outils d'injection de fautes de l'entreprise, après le succès du projet open source de Netflix, Chaos Monkey. L'injection de fautes consiste à casser volontairement certaines parties d'un système pour voir comment le reste encaisse le choc.

Gremlin affirme avoir depuis fait sortir le Chaos Engineering du cadre des expériences ponctuelles pour en faire une approche plus large de la gestion de la fiabilité. Sa plateforme permet aux équipes de mener des expériences planifiées, de limiter le "rayon d'impact" de chaque test et de recourir à des tests automatisés en continu pour vérifier que les correctifs tiennent dans la durée. Les scores de fiabilité fournissent un référentiel commun à toute l'organisation et donnent aux dirigeants une vision claire des investissements à prioriser et de la manière de responsabiliser les équipes.

Mike Dauber, General Partner chez Amplify Partners, estime que de nombreuses équipes manquaient de temps ou d'expertise pour mener ce type d'expériences de façon régulière.

"Foresight AI, c'est comme un coach qui fait les répétitions à votre place. Vos systèmes se renforcent sans que votre équipe ait à faire tout le travail manuel", a déclaré Dauber.

Gremlin qualifie le résultat de "résilience agentique" : l'outil repère plus tôt les risques pour la fiabilité et automatise les correctifs lorsque c'est pertinent.

Notre avis

Foresight AI s'inscrit dans une tendance que nous observons sans cesse. Les éditeurs ne se contentent plus d'une IA qui se borne à trouver les problèmes. Ils veulent qu'elle les corrige aussi, à l'image de l'agent de Legit Security pour les dépendances open source. Le choix de Gremlin de relancer le test initial mérite d'être souligné, car un correctif automatisé non vérifié peut lui-même provoquer de nouvelles pannes.

Pour les équipes de sécurité, la disponibilité fait partie du métier, et mettre les systèmes à l'épreuve avant que des attaquants ou des déploiements ratés ne le fassent rejoint les tests d'intrusion par IA encadrés. Reste à voir quel degré de contrôle les organisations seront prêtes à confier à un agent qui pousse des modifications d'infrastructure en production, et si elles voudront pouvoir revenir sur les actions des agents IA en cas de problème. Les promesses de Gremlin autour du Failure Atlas devront aussi être confirmées par des résultats indépendants chez les clients avant de pouvoir être jugées.