Gemini 4 Argon: Google-KI findet und behebt kritische Lücken

Gemini 4 Argon: Google-KI findet und behebt kritische Lücken

Google hat Gemini 4 Argon vorgestellt, ein neues Spitzenmodell für Künstliche Intelligenz, das nach Angaben des Unternehmens kritische Sicherheitslücken in Software ohne menschliches Zutun finden, überprüfen und beheben kann. Als Erste erhalten Zugang eine Gruppe vertrauenswürdiger Cyberverteidiger, die an Googles Fairwind Program teilnehmen.

Diese Verteidiger bekommen ebenso wie Googles interne Teams eine Version von Argon, bei der die Schutzmechanismen für den Cyberbereich entfernt wurden. Ein breiterer Zugang folgt später. Zahlende API-Kunden und Abonnenten von Google AI Ultra sind als Erste an der Reihe, danach Entwickler, Unternehmen und Verbraucher im größeren Umfang.

Google zufolge ist die schrittweise Einführung nötig, um Fähigkeiten dieser Größenordnung sicher freizugeben. Das Unternehmen justiert seine Schutzmechanismen noch anhand der Rückmeldungen früher Tester. Zudem beteiligt es sich am freiwilligen Verfahren der US-Regierung, das Behörden vor der Veröffentlichung Zugang zu Modellen gewährt.

Schutzmaßnahmen vor dem breiten Start

Vor der allgemeinen Verfügbarkeit will Google nach eigenen Angaben die Schutzvorkehrungen gegen Missbrauch im Cyberbereich sowie gegen chemischen, biologischen, radiologischen und nuklearen Missbrauch (CBRN) verstärken. Interne und externe Red Teams, also Gruppen, die ein System gezielt angreifen, um seine Schwachstellen aufzudecken, haben diese Schutzmaßnahmen getestet. Google ergänzt, dass Überwachungssysteme die Denkschritte und Aktionen von Argon verfolgen und die Ausführung bei Bedarf stoppen können.

Von Fehlern in Kliniksoftware bis zur Umstellung auf Rust

Eine der größten technischen Neuerungen betrifft das Ausgabelimit, also die maximale Textmenge, die das Modell in einer einzigen Antwort erzeugen kann. Es steigt von 64.000 auf 1 Million Token. Laut Google kann Argon damit in einem einzigen Durchlauf über Hunderttausende Token hinweg schlussfolgern und schreiben.

Das Cloud-Sicherheitsunternehmen Wiz setzt das Modell bereits in seinem Programm Scan for Good ein, das nach hochriskanten Schwachstellen in kritischer öffentlicher Infrastruktur sucht und diese kostenlos behebt. Nach Angaben von Google hat Argon eine kritische Lücke in einer Software aufgedeckt, die in Krankenhäusern weltweit im Einsatz ist. Der Fehler legte sensible persönliche Daten offen und war von früheren Spitzenmodellen übersehen worden. Google nannte weder das Produkt noch machte das Unternehmen Angaben dazu, ob es bereits eine Korrektur gibt.

Innerhalb von Google haben Argon-Agenten Speicheroptimierungen in den Rechenzentren des Konzerns ausgerollt und dabei mehr als 300 TiB Arbeitsspeicher freigemacht. Außerdem ersetzten sie 32.000 Zeilen SIMD-Code im Videodecoder libgav1 durch Rust, eine Programmiersprache, die Speicherfehler verhindern soll. Der neue Decoder läuft 2,7-mal schneller als die vorherige Rust-Portierung und liefert identische Videoausgaben.

Andere Agenten übertragen C- und C++-Code nach Rust. Dazu gehören mehr als 800.000 Zeilen für den Fuchsia-Zircon-Kernel. Keine dieser Neufassungen ist bislang im Produktivbetrieb. Sie durchlaufen noch Audits, Emulationstests und Prüfungen.

Benchmark-Ergebnisse

Google meldet folgende Werte:

  • 77,9 % bei DeepSWE v1.1, einem umfangreichen Test für Softwareentwicklung, was Google als Bestwert bezeichnet
  • 51,3 % bei Zapiers AutomationBench, womit das Modell auf Platz eins liegt
  • 91,7 % bei LVBench, einem Benchmark für lange Videos, ebenfalls als Bestwert ausgewiesen
  • 68 % bei CWE-bench v1, das die Fähigkeit zum Beheben von Sicherheitslücken misst, gleichauf mit dem Erstplatzierten

Die Zahlen zur Entdeckung von Schwachstellen stammen aus internen Tests. Googles eigene Auswertung umfasst komplexe Codebasen in 20 Programmiersprachen. In einem Blackbox-Penetrationstest von Wiz, bei dem das Modell laufende Websysteme angreift, ohne den Quellcode zu sehen, schnitt Argon besser ab als 3.8 Flash Cyber, und zwar beim Erfassen der Angriffsfläche, beim Aufspüren von Lücken und beim Erstellen von Proof-of-Concept-Nachweisen.

Preise

Argon startet zu einem Einführungspreis von 2 Dollar pro Million Eingabe-Token und 10 Dollar pro Million Ausgabe-Token. Zwischengespeicherte Eingabe-Token sind 95 % günstiger als reguläre Eingaben. Nach Ablauf der Einführungsphase verdoppeln sich die Preise auf 4 und 20 Dollar.

Unsere Einschätzung

Argon passt zu einem Muster, das wir seit Monaten beobachten: KI verkürzt die Zeit zwischen dem Entstehen eines Fehlers und seiner Entdeckung. Wir haben kürzlich berichtet, dass sich die Zahl gemeldeter Schwachstellen verdoppelt hat, weil KI das Ausnutzen von Lücken beschleunigt. Ein Modell, das Fehler eigenständig aufspüren und beheben kann, dürfte diese Zahl noch weiter in die Höhe treiben.

Dass Google ausgewählten Verteidigern eine Version ohne Schutzmechanismen überlässt, deutet darauf hin, dass der Konzern darauf setzt, dass ein Vorsprung für die Guten schwerer wiegt als das Risiko. Dieser Ansatz hängt stark von freiwilligen Zusagen ab, ähnlich wie das größere Bestreben nach Selbstregulierung der Branche in den USA.

Es lohnt sich zu beobachten, ob die nicht näher benannte Lücke in der Kliniksoftware offengelegt und behoben wird, ob unabhängige Tests Googles interne Ergebnisse bestätigen und wie lange die Schutzmechanismen halten, sobald Argon bei zahlenden Kunden ankommt.