Gremlin Foresight AI vindt betrouwbaarheidsrisico's

Gremlin Foresight AI vindt betrouwbaarheidsrisico's

Gremlin heeft Gremlin Foresight AI na een bètafase algemeen beschikbaar gemaakt. De tool doorzoekt productiesystemen op betrouwbaarheidsrisico's, stelt een oplossing voor en voert daarna de oorspronkelijke test opnieuw uit om te bevestigen dat de oplossing haar werk heeft gedaan.

Het bedrijf richt zich op engineeringteams die dankzij AI-ondersteuning nu sneller code opleveren en vrezen dat die extra snelheid meer storingen, slechter presterende diensten en ontevreden klanten met zich meebrengt.

Snellere code, meer kans op fouten

Gremlin-CEO Kolton Andrus ziet het risico meegroeien met de snelheid.

"AI-gedreven ontwikkeling betekent code opleveren met 10X de snelheid; het betekent ook 10x zoveel kans op bugs, risico's en storingen," zei hij.

Andrus vergeleek het product ook met de AI SRE-tools die nu op de markt zijn. SRE staat voor site reliability engineering, de praktijk om onlinediensten draaiende te houden. Volgens hem helpen deze tools teams om sneller op incidenten te reageren, maar komen ze nog altijd pas in actie nadat er iets is misgegaan.

"Hoewel de opkomst van AI SRE-tools geweldig is om teams te helpen sneller op incidenten te reageren, blijft het opruimwerk nadat er iets kapot is gegaan. Gremlin Foresight AI vindt risico's proactief, levert de oplossing en controleert of de oplossing heeft gewerkt door de test opnieuw uit te voeren. Dat geeft teams de zekerheid die ze nodig hebben om met vertrouwen verder te gaan," legde Andrus uit.

Gebouwd op tien jaar aan storingsdata

De tool is gebouwd op Gremlins eigen Failure Atlas, een verzameling van meer dan tien jaar aan oorzaak-en-gevolgdata over hoe onlinesystemen bezwijken. Volgens Gremlin zijn de aanbevelingen daardoor gebaseerd op echte storingspatronen en operationele ervaring in plaats van op algemene best practices.

Elke oplossing wordt gecontroleerd met dezelfde test die het probleem in eerste instantie aan het licht bracht, zodat het proces loopt van het opsporen van een zwakke plek tot en met het aantonen dat die verdwenen is.

Gremlin noemt vier belangrijke functies:

  • Proactieve risicodetectie: zwakke plekken en storingsomstandigheden vinden voordat ze tot incidenten leiden
  • Begeleid herstel: een specifieke oplossing aanbevelen en leveren, als configuratiepatch of als wijziging in infrastructure-as-code
  • Doorlopende validatie: de oorspronkelijke test opnieuw uitvoeren om te bevestigen dat de oplossing werkt, en tests herhalen wanneer systemen veranderen
  • Meetbare veerkracht: betrouwbaarheidsscores bijhouden voor diensten en teams om voortgang te meten en te bepalen waar de volgende investering naartoe gaat

Van Chaos Monkey naar agentische veerkracht

Andrus houdt zich al lang met dit probleem bezig. Voordat hij Gremlin oprichtte, was hij verantwoordelijk voor de beschikbaarheid van de retailsite van Amazon. Later stapte hij over naar Netflix, waar hij de tweede generatie fault-injectiontools van het bedrijf bouwde nadat Netflix' opensourceproject Chaos Monkey populair was geworden. Bij fault injection worden onderdelen van een systeem bewust onklaar gemaakt om te zien hoe de rest daarmee omgaat.

Volgens Gremlin heeft het bedrijf Chaos Engineering sindsdien verder gebracht dan losse experimenten en er een bredere aanpak voor betrouwbaarheidsbeheer van gemaakt. Met het platform kunnen teams geplande experimenten uitvoeren, de "blast radius" van elke test beperken en met doorlopende geautomatiseerde tests nagaan of oplossingen ook op termijn blijven werken. Betrouwbaarheidsscores geven de hele organisatie een gedeelde maatstaf en geven leidinggevenden inzicht in waar ze investeringen op moeten richten en hoe ze teams verantwoordelijk kunnen houden.

Mike Dauber, General Partner bij Amplify Partners, zei dat veel teams de tijd of expertise misten om zulke experimenten consequent uit te voeren.

"Foresight AI is als een trainer die de herhalingen voor je doet. Je systemen worden sterker zonder dat je team al het handwerk hoeft te doen," zei Dauber.

Gremlin omschrijft het resultaat als "agentische veerkracht": het signaleert betrouwbaarheidsrisico's eerder en automatiseert oplossingen waar dat zinvol is.

Onze kijk

Foresight AI past in een patroon dat we steeds vaker zien. Leveranciers nemen geen genoegen meer met AI die alleen problemen vindt. Ze willen dat die ze ook oplost, net als de agent van Legit Security voor opensourceafhankelijkheden. Dat Gremlin ervoor kiest de oorspronkelijke test opnieuw uit te voeren, is het vermelden waard, want een niet-gecontroleerde automatische oplossing kan zelf weer nieuwe storingen veroorzaken.

Voor securityteams hoort beschikbaarheid bij het werk, en systemen onder druk testen voordat aanvallers of slechte deployments dat doen, overlapt met gecontroleerde AI-penetratietests. Het is de moeite waard om te volgen hoeveel controle organisaties willen overlaten aan een agent die infrastructuurwijzigingen naar productie doorvoert, en of ze manieren willen hebben om acties van AI-agents terug te draaien als er iets misgaat. Ook zijn er onafhankelijke resultaten van klanten nodig voordat Gremlins claims over de Failure Atlas op waarde kunnen worden geschat.