Gemini 4 Argon: IA de Google halla y corrige fallos críticos
Google ha presentado Gemini 4 Argon, un nuevo modelo de IA de frontera que, según la compañía, es capaz de encontrar, validar y corregir vulnerabilidades críticas de software sin intervención humana. Los primeros en usarlo serán un grupo de defensores de ciberseguridad de confianza inscritos en el Fairwind Program de Google.
Esos defensores, junto con los equipos internos de Google, recibirán una versión de Argon sin las salvaguardas de ciberseguridad. El acceso general llegará más tarde. Los clientes de pago de la API y los suscriptores de Google AI Ultra serán los primeros, seguidos de desarrolladores, empresas y consumidores en general.
Google sostiene que este despliegue por fases es necesario para lanzar con seguridad capacidades de este nivel. La compañía sigue ajustando sus salvaguardas a partir de los comentarios de los primeros probadores. También participa en el proceso voluntario del Gobierno de Estados Unidos que permite a las autoridades acceder a los modelos antes de su lanzamiento.
Salvaguardas antes del lanzamiento general
Antes de la disponibilidad general, Google afirma que está reforzando las protecciones contra el uso indebido en ciberseguridad y contra los abusos químicos, biológicos, radiológicos y nucleares (QBRN). Equipos rojos internos y externos, grupos encargados de atacar un sistema para descubrir sus puntos débiles, han puesto a prueba estas salvaguardas. Google añade que hay sistemas de supervisión que siguen el razonamiento y las acciones de Argon y que pueden detener su ejecución cuando sea necesario.
De fallos en software sanitario a reescrituras en Rust
Uno de los mayores cambios técnicos es el límite de salida, la cantidad máxima de texto que el modelo puede generar en una sola respuesta. Pasa de 64.000 tokens a un millón. Según Google, esto permite a Argon razonar y escribir a lo largo de cientos de miles de tokens de una sola vez.
La empresa de seguridad en la nube Wiz ya utiliza el modelo en su programa Scan for Good, que busca exposiciones de alto riesgo en infraestructuras públicas críticas y las corrige de forma gratuita. Google asegura que Argon descubrió un fallo crítico en un software sanitario utilizado por hospitales de todo el mundo. El fallo dejaba expuesta información personal sensible y había pasado desapercibido para modelos de frontera anteriores. Google no ha revelado el nombre del producto ni ha aclarado si ya existe un parche.
Dentro de Google, los agentes de Argon han desplegado optimizaciones de memoria en los centros de datos de la compañía y han liberado más de 300 TiB de memoria. También han sustituido 32.000 líneas de código SIMD del decodificador de vídeo libgav1 por Rust, un lenguaje diseñado para evitar errores de memoria. El nuevo decodificador es 2,7 veces más rápido que la anterior adaptación a Rust y genera exactamente la misma salida de vídeo.
Otros agentes están convirtiendo código C y C++ a Rust, entre ellos más de 800.000 líneas del núcleo Fuchsia Zircon. Ninguna de estas reescrituras está todavía en producción. Siguen pasando por auditorías, pruebas de emulación y revisiones.
Resultados en las pruebas de rendimiento
Google informa de las siguientes puntuaciones:
- 77,9 % en DeepSWE v1.1, una prueba extensa de ingeniería de software, resultado que Google califica como el mejor del sector
- 51,3 % en AutomationBench de Zapier, en primera posición
- 91,7 % en LVBench, una prueba con vídeos largos, también presentado como el mejor del sector
- 68 % en CWE-bench v1, que mide la capacidad de corregir vulnerabilidades de seguridad, empatado en primer lugar
Los datos sobre descubrimiento de vulnerabilidades proceden de pruebas internas. La evaluación propia de Google abarca bases de código complejas en 20 lenguajes de programación. En una prueba de penetración de caja negra realizada por Wiz, en la que el modelo ataca sistemas web en funcionamiento sin ver el código fuente, Argon superó a 3.8 Flash Cyber a la hora de mapear la superficie de ataque, encontrar fallos y aportar pruebas de concepto.
Precios
Argon se lanza con una tarifa promocional de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Los tokens de entrada en caché son un 95 % más baratos que los de entrada estándar. Cuando termine el periodo promocional, los precios se duplicarán hasta 4 y 20 dólares.
Nuestra opinión
Argon encaja en una tendencia que llevamos meses siguiendo: la IA está acortando el tiempo que pasa desde que existe un fallo hasta que alguien lo encuentra. Hace poco contamos que las divulgaciones de vulnerabilidades se han duplicado a medida que la IA acelera su explotación, y un modelo capaz de localizar y corregir fallos por sí solo podría disparar esa cifra todavía más.
La decisión de entregar una versión sin salvaguardas a defensores seleccionados indica que Google apuesta por que dar ventaja a los buenos compensa el riesgo. Ese enfoque depende en gran medida de compromisos voluntarios, al igual que el impulso más amplio a la autorregulación del sector en Estados Unidos.
Conviene estar atentos a si el fallo sanitario sin nombre llega a divulgarse y corregirse, a si las pruebas independientes confirman los resultados internos de Google y a cuánto aguantan las salvaguardas una vez que Argon llegue a los clientes de pago.
