Gremlin Foresight AI detecta riesgos y verifica arreglos

Gremlin Foresight AI detecta riesgos y verifica arreglos

Gremlin ha lanzado de forma general Gremlin Foresight AI tras una fase beta. La herramienta busca riesgos de fiabilidad en los sistemas de producción, propone una solución y después vuelve a ejecutar la prueba original para confirmar que la solución ha funcionado.

La empresa se dirige a los equipos de ingeniería que ahora publican código más rápido con ayuda de la IA y temen que esa velocidad extra traiga más caídas, servicios degradados y clientes descontentos.

Código más rápido, más ocasiones de fallar

El consejero delegado de Gremlin, Kolton Andrus, cree que el riesgo crece al mismo ritmo que la velocidad.

"El desarrollo impulsado por IA significa publicar código a una velocidad 10 veces mayor; también significa 10 veces más oportunidades para errores, riesgos y fallos", afirmó.

Andrus también comparó el producto con las herramientas de AI SRE que ya hay en el mercado. SRE son las siglas de site reliability engineering (ingeniería de fiabilidad de sitios), la disciplina que se ocupa de mantener en marcha los servicios en línea. Según él, estas herramientas ayudan a los equipos a responder más rápido a los incidentes, pero solo entran en acción cuando algo ya ha fallado.

"Aunque el auge de las herramientas de AI SRE es estupendo para ayudar a los equipos a responder más rápido a los incidentes, sigue siendo limpiar después de que algo se rompa. Gremlin Foresight AI encuentra los riesgos de forma proactiva, entrega la solución y comprueba que ha funcionado volviendo a ejecutar la prueba. Así los equipos tienen las garantías que necesitan para avanzar con confianza", explicó Andrus.

Construido sobre una década de datos de fallos

La herramienta se basa en Failure Atlas, una colección propia de Gremlin con más de diez años de datos de causa y efecto sobre cómo fallan los sistemas en línea. Según Gremlin, esto significa que sus recomendaciones salen de patrones de fallo reales y de experiencia operativa, no de buenas prácticas genéricas.

Cada solución se comprueba con la misma prueba que destapó el problema, de modo que el proceso va desde detectar un punto débil hasta demostrar que ha desaparecido.

Gremlin destaca cuatro capacidades principales:

  • Detección proactiva de riesgos: encontrar puntos débiles y condiciones de fallo antes de que se conviertan en incidentes
  • Corrección guiada: recomendar y entregar una solución concreta, ya sea como parche de configuración o como cambio de infraestructura como código
  • Validación continua: volver a ejecutar la prueba original para confirmar que la solución funciona y repetir las pruebas a medida que cambian los sistemas
  • Resiliencia medible: seguir las puntuaciones de fiabilidad de servicios y equipos para medir el progreso y decidir dónde invertir a continuación

De Chaos Monkey a la resiliencia agéntica

Andrus lleva mucho tiempo trabajando en este problema. Antes de fundar Gremlin, era el responsable de la disponibilidad de la web de venta de Amazon. Después pasó a Netflix, donde creó la segunda generación de herramientas de inyección de fallos de la empresa, tras la popularidad de Chaos Monkey, el proyecto de código abierto de Netflix. La inyección de fallos consiste en romper deliberadamente partes de un sistema para ver cómo aguanta el resto.

Gremlin asegura que desde entonces ha llevado la ingeniería del caos más allá de los experimentos puntuales y la ha convertido en un enfoque más amplio de gestión de la fiabilidad. Su plataforma permite a los equipos ejecutar experimentos planificados, limitar el "radio de impacto" de cada prueba y usar pruebas automatizadas continuas para comprobar que las soluciones siguen funcionando con el tiempo. Las puntuaciones de fiabilidad dan a toda la organización un estándar común y permiten a los directivos ver hacia dónde dirigir la inversión y cómo pedir cuentas a los equipos.

Mike Dauber, socio general de Amplify Partners, señaló que muchos equipos no tenían tiempo ni conocimientos para hacer este tipo de experimentos de forma constante.

"Foresight AI es como un entrenador que hace las repeticiones por ti. Tus sistemas se hacen más fuertes sin que tu equipo tenga que hacer todo el trabajo manual", dijo Dauber.

Gremlin describe el resultado como "resiliencia agéntica": detecta antes los riesgos de fiabilidad y automatiza las soluciones cuando procede.

Nuestra opinión

Foresight AI encaja en una tendencia que vemos una y otra vez. A los fabricantes ya no les basta con una IA que solo encuentre problemas. Quieren que también los arregle, al estilo del agente de Legit Security para dependencias de código abierto. Merece la pena destacar que Gremlin haya optado por volver a ejecutar la prueba original, porque una solución automática sin verificar puede provocar nuevos fallos por sí misma.

Para los equipos de seguridad, la disponibilidad forma parte del trabajo, y someter los sistemas a pruebas de estrés antes de que lo hagan los atacantes o un despliegue mal hecho tiene mucho en común con las pruebas de penetración con IA controladas. Habrá que ver cuánto control están dispuestas a ceder las organizaciones a un agente que lleva cambios de infraestructura a producción, y si querrán formas de deshacer las acciones de los agentes de IA cuando algo salga mal. Las afirmaciones de Gremlin sobre Failure Atlas también necesitarán resultados independientes de clientes antes de poder valorarlas.