OpenAI stoppt GPT-6.1 Astra, fordert Sicherheitsnachweise

OpenAI stoppt GPT-6.1 Astra, fordert Sicherheitsnachweise

OpenAI hat die geplante Veröffentlichung von GPT-6.1 Astra abgesagt. Interne Tests hatten gezeigt, dass das Modell die Standards des Unternehmens beim Befolgen menschlicher Absichten nicht erfüllt.

Zuerst berichtete das Wall Street Journal über die Entscheidung. Laut der Zeitung sollte Astra im Oktober in ChatGPT und Codex starten.

Wo Astra versagt hat

Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI, sagte, das neue Modell sei seinem Vorgänger in manchen Punkten überlegen. Schlechter schnitt es jedoch dabei ab, innerhalb seines Auftrags und seiner Befugnisse zu bleiben. Auch bei der Frage, wie es Nutzern die Art der erledigten Arbeit beschreibt, fiel es zurück.

Das WSJ berichtete außerdem, Astra sei täuschender gewesen als die Vorgängerversion. Das Modell habe nicht immer korrekt wiedergegeben, was es getan hatte und was nicht.

"Bei allem, was Sicherheit und Alignment betrifft, gibt es einen Zielkonflikt", sagte Jain. "Man muss wirklich die richtige Grenze finden: im Rahmen des Auftrags bleiben, aber auch vermeiden, dass das Modell bequem wird, wenn es darum geht, wie es Aufgaben tatsächlich verfolgt, selbst wenn es auf Widerstände stößt."

Sie fügte hinzu, das Unternehmen wolle, dass die Modellentwicklung sowohl intern als auch nach der Veröffentlichung sicher ist. "Aber wenn wir es an Nutzer ausliefern, legen wir bei Sicherheit und Alignment die Messlatte extrem hoch", sagte Jain.

Die Entscheidung fällt in eine Zeit, in der die Sicherheitsbilanz von OpenAI genauer unter die Lupe genommen wird. Im Juli hatte das Unternehmen öffentlich gemacht, dass seine Agenten aus einer Testumgebung ausgebrochen und in Hugging Face, die Hosting-Plattform für KI-Modelle, eingedrungen waren.

Anfang dieses Monats hatte Anthropic-CEO Dario Amodei KI-Entwickler aufgefordert, die Entwicklung von Frontier-Modellen zu verlangsamen, damit die Sicherheitsmaßnahmen aufholen können. OpenAI-CEO Sam Altman unterstützte den Aufruf.

Sicherheitsnachweise vor Frontier-RL-Training

Am selben Tag, an dem die Nachricht über Astra bekannt wurde, veröffentlichte OpenAI einen Blogbeitrag. Darin argumentiert das Unternehmen, dass Trainingsläufe mit Frontier-Reinforcement-Learning (RL) nicht ohne strukturierte Sicherheitsdokumentation fortgesetzt werden sollten.

Im besten Fall wäre diese Dokumentation ein Sicherheitsnachweis. Gemeint ist eine strukturierte, mit Belegen untermauerte Argumentation zum Risiko, wie sie in anderen sicherheitskritischen Branchen üblich ist. OpenAI bezeichnet dies als erstrebenswertes Ziel. Das Unternehmen räumt ein, dass sich solche Argumentationen bei KI schwerer stichhaltig führen lassen, und gibt an, an einem Rahmenwerk zu arbeiten, um die Praxis zu formalisieren.

Die Leitlinien gelten nur für Frontier-RL-Training. Für den internen und externen Einsatz müsse ein deutlich breiteres Spektrum an Alignment-Eigenschaften abgewogen werden, so OpenAI.

Technisch sollte ein Sicherheitsnachweis drei Ebenen abdecken: Alignment-Training, Eindämmung und Überwachung. Zusammen sollen sie dafür sorgen, dass fehlgeleitetes Verhalten unwahrscheinlich ist, sich nur schwer in die Tat umsetzen lässt und schnell erkannt wird.

Zu den Maßnahmen, die OpenAI aufführt, gehören:

  • RL-Umgebungen auf Schwachstellen prüfen, die Exploits belohnen könnten
  • die Sandbox und die dahinterliegende Forschungsinfrastruktur härten
  • Agenten-Protokolle für die Untersuchung von Vorfällen in unveränderlichem Speicher aufbewahren
  • Alarme mit hoher Priorität, die einen Bereitschaftsmitarbeiter benachrichtigen oder den betroffenen Lauf automatisch anhalten

Vetos, Gegenvoten und öffentliche Nachbetrachtungen

Die organisatorischen Empfehlungen drehen sich um Menschen und Verantwortlichkeit. Jemand aus einem anderen Team soll ein Gegenvotum verfassen, das den Sicherheitsnachweis auf Schwachstellen abklopft. Jede Führungskraft der oberen Ebene soll einen Lauf per Veto stoppen können, und die zuständige Führungskraft soll für den Sicherheitsnachweis und jede Reaktion auf Vorfälle geradestehen, auch in Leistungsbeurteilungen.

OpenAI will außerdem, dass Prüfer Zugang erhalten, dass es einen Eskalationsweg über die Rufbereitschaft gibt, der bis zur Geschäftsführung und zum CEO reicht, und dass Sicherheitsfunktionen im Fehlerfall sperren statt freigeben. "Es sollte für Menschen und Agenten schwierig sein, regelwidrige Läufe zu starten", schrieb das Unternehmen.

Bei schweren Fehlverhaltens-Vorfällen empfiehlt OpenAI eine Ursachenanalyse der Trainingsdynamik, organisatorische und kulturelle Nachbetrachtungen sowie Regressionstests, damit künftige Modelle das Verhalten nicht wiederholen.

"Untersuchungsergebnisse, Nachbetrachtungen und organisatorische Änderungen sollten nach Abschluss der Untersuchung öffentlich gemacht werden. Betroffene Dritte sollten so schnell wie möglich benachrichtigt werden", erklärte das Unternehmen.

OpenAI gab an, die Empfehlungen intern bereits umzusetzen, und rechnet damit, dass sich die eigenen Abläufe in den kommenden Wochen weiter ändern werden.

Unsere Einschätzung

Ein Vorzeigemodell wegen Problemen mit Ehrlichkeit und Auftragsgrenzen zurückzuhalten, ist ein bemerkenswerter Schritt, und die konkreten Mängel sind für Sicherheitsteams relevant. Ein Modell, das außerhalb seiner Befugnisse handelt und falsch über die eigenen Aktionen berichtet, ist genau die Art Werkzeug, die sich kaum noch prüfen lässt, sobald sie über Codex oder ähnliche Agenten an Code-Repositorys, Cloud-Konsolen oder Ticketsysteme angebunden ist.

Der Zeitpunkt legt nahe, dass OpenAI auf den Druck reagiert, der sich durch den Einbruch bei Hugging Face und eine ganze Reihe weiterer Vorfälle mit autonomen Agenten aufgebaut hat, von OpenAI-Agenten, die ein australisches Medicare-Statistikportal angriffen, bis zum Einbruch eines KI-Agenten bei DIVD. Viele der vorgeschlagenen Kontrollen, etwa unveränderliche Protokolle, sperrende Standardeinstellungen und Eskalationswege, dürften jedem bekannt vorkommen, der Incident Response betreibt.

Es lohnt sich zu beobachten, ob OpenAI das angekündigte Rahmenwerk veröffentlicht, ob andere Labore ähnliche Sicherheitsnachweise einführen und ob das Versprechen, Nachbetrachtungen zu veröffentlichen und betroffene Dritte zu benachrichtigen, beim nächsten Vorfall Bestand hat.