Gemini 4 Argon : l'IA Google trouve et corrige des failles
Google a présenté Gemini 4 Argon, un nouveau modèle d'IA de pointe qui, selon l'entreprise, sait trouver, valider et corriger des vulnérabilités logicielles critiques sans intervention humaine. Les premiers utilisateurs sont un groupe de cyberdéfenseurs de confiance inscrits au programme Fairwind de Google.
Ces défenseurs, ainsi que les équipes internes de Google, recevront une version d'Argon débarrassée de ses garde-fous en matière de cybersécurité. L'accès plus large viendra ensuite. Les clients payants de l'API et les abonnés Google AI Ultra passent en premier, suivis plus largement par les développeurs, les entreprises et le grand public.
Google estime que ce déploiement par étapes est nécessaire pour mettre en circulation des capacités de ce niveau en toute sécurité. L'entreprise ajuste encore ses garde-fous en fonction des retours des premiers testeurs. Elle participe aussi au dispositif volontaire du gouvernement américain qui donne aux autorités accès aux modèles avant leur sortie.
Des protections avant le lancement général
Avant la disponibilité générale, Google affirme renforcer ses protections contre les détournements à des fins cyber et contre les usages abusifs de nature chimique, biologique, radiologique et nucléaire (NRBC). Des red teams internes et externes, des équipes chargées d'attaquer un système pour en révéler les points faibles, ont testé ces garde-fous. Google ajoute que des systèmes de surveillance suivent le raisonnement et les actions d'Argon et peuvent interrompre l'exécution si nécessaire.
Des bugs dans la santé aux réécritures en Rust
L'un des plus gros changements techniques concerne la limite de sortie, c'est-à-dire la quantité maximale de texte que le modèle peut produire en une seule réponse. Elle passe de 64 000 jetons à 1 million. Selon Google, Argon peut ainsi raisonner et écrire sur des centaines de milliers de jetons en une seule passe.
L'entreprise de sécurité cloud Wiz utilise déjà le modèle dans son programme Scan for Good, qui recherche les expositions à haut risque dans les infrastructures publiques critiques et les corrige gratuitement. Google indique qu'Argon a mis au jour une faille critique dans un logiciel de santé utilisé par des hôpitaux du monde entier. Le bug exposait des données personnelles sensibles et avait échappé aux précédents modèles de pointe. Google n'a pas nommé le produit ni précisé si un correctif est disponible.
Chez Google, des agents Argon ont déployé des optimisations de mémoire dans les centres de données de l'entreprise, libérant plus de 300 Tio de mémoire. Ils ont aussi remplacé 32 000 lignes de code SIMD du décodeur vidéo libgav1 par du Rust, un langage conçu pour empêcher les erreurs de mémoire. Le nouveau décodeur tourne 2,7 fois plus vite que le précédent portage en Rust et produit une sortie vidéo identique.
D'autres agents convertissent du code C et C++ en Rust, dont plus de 800 000 lignes pour le noyau Zircon de Fuchsia. Aucune de ces réécritures n'est encore en production. Elles passent toujours par des audits, des tests en émulation et des relectures.
Résultats aux benchmarks
Google annonce les scores suivants :
- 77,9 % sur DeepSWE v1.1, un test d'ingénierie logicielle sur la durée, que Google qualifie d'état de l'art
- 51,3 % sur AutomationBench de Zapier, à la première place
- 91,7 % sur LVBench, un benchmark de vidéos longues, là encore revendiqué comme état de l'art
- 68 % sur CWE-bench v1, qui mesure la capacité à corriger des vulnérabilités de sécurité, à égalité pour la première place
Les chiffres sur la découverte de vulnérabilités proviennent de tests internes. L'évaluation de Google porte sur des bases de code complexes dans 20 langages de programmation. Lors d'un test d'intrusion en boîte noire mené par Wiz, où le modèle attaque des systèmes web en production sans voir le code source, Argon a fait mieux que 3.8 Flash Cyber pour cartographier la surface d'attaque, trouver des failles et produire des preuves de concept.
Tarifs
Argon est lancé à un tarif de lancement de 2 dollars par million de jetons en entrée et de 10 dollars par million de jetons en sortie. Les jetons d'entrée mis en cache coûtent 95 % moins cher que l'entrée standard. Une fois la période de lancement terminée, les prix doublent pour passer à 4 et 20 dollars.
Notre analyse
Argon s'inscrit dans une tendance que nous suivons depuis des mois : l'IA réduit le délai entre l'existence d'un bug et sa découverte. Nous avons récemment rapporté que les divulgations de vulnérabilités ont doublé à mesure que l'IA accélère l'exploitation, et un modèle capable de localiser et de corriger des failles tout seul pourrait faire grimper ce chiffre encore davantage.
Le choix de confier une version sans garde-fous à des défenseurs sélectionnés laisse penser que Google parie sur le fait que donner une longueur d'avance aux gentils l'emporte sur le risque. Cette approche repose largement sur des engagements volontaires, à l'image de la démarche plus large d'autorégulation du secteur aux États-Unis.
Il faudra voir si la faille non nommée dans le logiciel de santé sera divulguée et corrigée, si des tests indépendants confirmeront les résultats internes de Google, et combien de temps les garde-fous tiendront une fois Argon entre les mains des clients payants.
