Gemini 4 Argon: Google-AI vindt en dicht kritieke lekken
Google heeft Gemini 4 Argon gepresenteerd, een nieuw frontier-AI-model dat volgens het bedrijf zonder menselijke tussenkomst kritieke kwetsbaarheden in software kan vinden, valideren en verhelpen. De eerste gebruikers zijn een groep vertrouwde cyberverdedigers die deelnemen aan Google's Fairwind Program.
Die verdedigers krijgen, net als Google's interne teams, een versie van Argon zonder de cyberbeveiligingsgrenzen. Bredere toegang volgt later. Betalende API-klanten en abonnees van Google AI Ultra zijn als eersten aan de beurt, daarna volgen ontwikkelaars, bedrijven en consumenten in bredere zin.
Volgens Google is de gefaseerde uitrol nodig om mogelijkheden van dit niveau veilig beschikbaar te maken. Het bedrijf stelt zijn beveiligingsgrenzen nog bij op basis van feedback van de eerste testers. Daarnaast doet Google mee aan het vrijwillige proces van de Amerikaanse overheid waarbij ambtenaren vóór de lancering toegang krijgen tot modellen.
Beveiliging vóór de brede lancering
In aanloop naar de algemene beschikbaarheid zegt Google de bescherming tegen cybermisbruik en tegen chemisch, biologisch, radiologisch en nucleair (CBRN) misbruik aan te scherpen. Interne en externe red teams, groepen die een systeem aanvallen om de zwakke plekken bloot te leggen, hebben deze beveiligingen getest. Google voegt eraan toe dat monitoringsystemen de redenering en acties van Argon volgen en de uitvoering zo nodig kunnen stopzetten.
Van bugs in zorgsoftware tot herschrijvingen in Rust
Een van de grootste technische veranderingen is de outputlimiet, de maximale hoeveelheid tekst die het model in één antwoord kan genereren. Die stijgt van 64.000 tokens naar 1 miljoen. Volgens Google kan Argon daardoor in één run redeneren en schrijven over honderdduizenden tokens.
Cloudbeveiliger Wiz gebruikt het model al in zijn Scan for Good-programma, dat zoekt naar risicovolle blootstellingen in kritieke publieke infrastructuur en die gratis verhelpt. Google zegt dat Argon een kritiek lek heeft ontdekt in zorgsoftware die door ziekenhuizen over de hele wereld wordt gebruikt. De bug stelde gevoelige persoonsgegevens bloot en was door eerdere frontier-modellen over het hoofd gezien. Google noemde het product niet en zei niet of er een oplossing beschikbaar is.
Binnen Google hebben Argon-agents geheugenoptimalisaties doorgevoerd in de datacenters van het bedrijf, waardoor meer dan 300 TiB aan geheugen vrijkwam. Ook vervingen ze 32.000 regels SIMD-code in de videodecoder libgav1 door Rust, een taal die is ontworpen om geheugenfouten te voorkomen. De nieuwe decoder is 2,7 keer zo snel als de vorige Rust-port en levert identieke videobeelden op.
Andere agents zetten C- en C++-code om naar Rust. Het gaat onder meer om meer dan 800.000 regels voor de Fuchsia Zircon-kernel. Geen van deze herschrijvingen draait al in productie. Ze worden nog geaudit, in emulatie getest en beoordeeld.
Benchmarkresultaten
Google meldt de volgende scores:
- 77,9% op DeepSWE v1.1, een uitgebreide test voor software-engineering, wat Google state of the art noemt
- 51,3% op Zapier's AutomationBench, goed voor de eerste plaats
- 91,7% op LVBench, een benchmark voor lange video's, eveneens geclaimd als state of the art
- 68% op CWE-bench v1, dat meet hoe goed een model beveiligingslekken kan verhelpen, gedeeld eerste
De cijfers over het vinden van kwetsbaarheden komen uit interne tests. Google's eigen evaluatie omvat complexe codebases in 20 programmeertalen. In een black-box-penetratietest van Wiz, waarbij het model live websystemen aanvalt zonder de broncode te zien, presteerde Argon beter dan 3.8 Flash Cyber bij het in kaart brengen van het aanvalsoppervlak, het vinden van lekken en het leveren van proof-of-concept-bewijs.
Prijzen
Argon start met een introductietarief van 2 dollar per miljoen inputtokens en 10 dollar per miljoen outputtokens. Gecachete inputtokens zijn 95% goedkoper dan standaardinput. Na de introductieperiode verdubbelen de prijzen naar 4 en 20 dollar.
Onze analyse
Argon past in een patroon dat we al maanden volgen: AI verkort de tijd tussen het bestaan van een bug en het moment dat iemand hem vindt. We meldden onlangs dat het aantal gemelde kwetsbaarheden is verdubbeld nu AI misbruik versnelt, en een model dat zelfstandig lekken kan opsporen en dichten, zou dat aantal nog verder kunnen opdrijven.
De keuze om een versie zonder beveiligingsgrenzen aan geselecteerde verdedigers te geven, wijst erop dat Google erop gokt dat een voorsprong voor de goeien zwaarder weegt dan het risico. Die aanpak leunt sterk op vrijwillige toezeggingen, net als de bredere roep om zelfregulering door de sector in de VS.
Het is de moeite waard om te volgen of het niet bij naam genoemde lek in de zorgsoftware openbaar wordt gemaakt en wordt verholpen, of onafhankelijke tests de interne resultaten van Google bevestigen, en hoe lang de beveiligingsgrenzen standhouden zodra Argon bij betalende klanten terechtkomt.
