Gremlin Foresight AI findet Ausfallrisiken, prüft Fixes
Gremlin hat Gremlin Foresight AI nach einer Betaphase allgemein verfügbar gemacht. Das Tool durchsucht Produktivsysteme nach Zuverlässigkeitsrisiken, schlägt eine Korrektur vor und führt anschließend den ursprünglichen Test erneut aus, um zu bestätigen, dass die Korrektur gewirkt hat.
Das Unternehmen zielt auf Entwicklerteams, die dank KI-Unterstützung inzwischen schneller Code ausliefern und befürchten, dass das höhere Tempo mehr Ausfälle, eingeschränkte Dienste und unzufriedene Kunden mit sich bringt.
Schnellerer Code, mehr Gelegenheiten zum Scheitern
Gremlin-CEO Kolton Andrus sieht das Risiko mit dem Tempo wachsen.
"KI-gestützte Entwicklung bedeutet, Code mit zehnfacher Geschwindigkeit auszuliefern; sie bedeutet aber auch zehnmal so viele Gelegenheiten für Bugs, Risiken und Ausfälle", sagte er.
Andrus verglich das Produkt außerdem mit den KI-SRE-Tools, die derzeit auf dem Markt sind. SRE steht für Site Reliability Engineering, also die Disziplin, Onlinedienste am Laufen zu halten. Diese Tools helfen Teams zwar, schneller auf Vorfälle zu reagieren, greifen aber nach wie vor erst, wenn bereits etwas ausgefallen ist, so Andrus.
"Der Aufstieg von KI-SRE-Tools ist großartig, um Teams schneller auf Vorfälle reagieren zu lassen, aber es bleibt Aufräumarbeit, nachdem etwas kaputtgegangen ist. Gremlin Foresight AI findet Risiken proaktiv, liefert die Korrektur und überprüft durch erneutes Ausführen des Tests, ob sie funktioniert hat. Das gibt Teams die Sicherheit, die sie brauchen, um zuversichtlich voranzugehen", erklärte Andrus.
Aufgebaut auf zehn Jahren Ausfalldaten
Das Tool basiert auf Gremlins proprietärem Failure Atlas, einer Sammlung von mehr als zehn Jahren Ursache-Wirkungs-Daten darüber, wie Onlinesysteme ausfallen. Laut Gremlin stammen die Empfehlungen damit aus echten Ausfallmustern und Betriebserfahrung statt aus allgemeinen Best Practices.
Jede Korrektur wird mit demselben Test geprüft, der das Problem ursprünglich aufgedeckt hat. Der Prozess reicht also vom Erkennen einer Schwachstelle bis zum Nachweis, dass sie behoben ist.
Gremlin nennt vier zentrale Funktionen:
- Proaktive Risikoerkennung: Schwachstellen und Fehlerbedingungen finden, bevor sie zu Vorfällen werden
- Geführte Behebung: eine konkrete Korrektur empfehlen und liefern, entweder als Konfigurations-Patch oder als Infrastructure-as-Code-Änderung
- Kontinuierliche Validierung: den ursprünglichen Test erneut ausführen, um die Wirksamkeit der Korrektur zu bestätigen, und Tests wiederholen, wenn sich Systeme ändern
- Messbare Resilienz: Zuverlässigkeitswerte über Dienste und Teams hinweg verfolgen, um Fortschritte zu messen und zu entscheiden, wo als Nächstes investiert werden soll
Von Chaos Monkey zur agentenbasierten Resilienz
Andrus beschäftigt sich schon lange mit diesem Problem. Bevor er Gremlin gründete, war er für die Verfügbarkeit von Amazons Einzelhandelsseite verantwortlich. Später wechselte er zu Netflix, wo er die zweite Generation der Fault-Injection-Werkzeuge des Unternehmens entwickelte, nachdem das Open-Source-Projekt Chaos Monkey von Netflix populär geworden war. Fault Injection bedeutet, gezielt Teile eines Systems lahmzulegen, um zu sehen, wie der Rest damit zurechtkommt.
Nach eigenen Angaben hat Gremlin Chaos Engineering seither über einmalige Experimente hinaus zu einem umfassenderen Ansatz für das Zuverlässigkeitsmanagement weiterentwickelt. Mit der Plattform können Teams geplante Experimente durchführen, den "Explosionsradius" jedes Tests begrenzen und mit kontinuierlichen automatisierten Tests überprüfen, ob Korrekturen dauerhaft funktionieren. Zuverlässigkeitswerte geben der gesamten Organisation einen gemeinsamen Maßstab und verschaffen Führungskräften den Überblick, wohin Investitionen fließen sollten und wie sich Teams in die Verantwortung nehmen lassen.
Mike Dauber, General Partner bei Amplify Partners, sagte, vielen Teams fehle die Zeit oder das Fachwissen, um solche Experimente konsequent durchzuführen.
"Foresight AI ist wie ein Trainer, der die Wiederholungen für dich übernimmt. Deine Systeme werden stärker, ohne dass dein Team die ganze Handarbeit erledigen muss", sagte Dauber.
Gremlin beschreibt das Ergebnis als "agentenbasierte Resilienz": Das Tool erkennt Zuverlässigkeitsrisiken früher und automatisiert Korrekturen, wo es sinnvoll ist.
Unsere Einschätzung
Foresight AI passt in ein Muster, das wir immer wieder beobachten. Hersteller geben sich nicht mehr mit KI zufrieden, die Probleme nur findet. Sie soll sie auch beheben, ganz ähnlich wie der Agent von Legit Security für Open-Source-Abhängigkeiten. Bemerkenswert ist Gremlins Entscheidung, den ursprünglichen Test erneut auszuführen, denn eine ungeprüfte automatische Korrektur kann selbst neue Ausfälle verursachen.
Für Sicherheitsteams gehört Verfügbarkeit zum Job, und Systeme unter Belastung zu testen, bevor Angreifer oder fehlerhafte Deployments es tun, überschneidet sich mit kontrollierten KI-Penetrationstests. Spannend wird, wie viel Kontrolle Unternehmen einem Agenten zugestehen, der Infrastrukturänderungen in die Produktion schiebt, und ob sie Möglichkeiten wollen, Aktionen von KI-Agenten zurückzuspulen, wenn etwas schiefgeht. Auch Gremlins Aussagen zum Failure Atlas brauchen erst unabhängige Ergebnisse von Kunden, bevor man sie bewerten kann.
