OpenAI schrapt GPT-6.1 Astra, pleit voor safety cases

OpenAI schrapt GPT-6.1 Astra, pleit voor safety cases

OpenAI heeft de geplande release van GPT-6.1 Astra ingetrokken. Interne tests lieten zien dat het model niet voldeed aan de normen van het bedrijf voor het volgen van menselijke intenties.

The Wall Street Journal bracht het besluit als eerste naar buiten. Volgens de krant zou Astra in oktober beschikbaar komen in ChatGPT en Codex.

Waar Astra tekortschoot

Saachi Jain, hoofd safety systems bij OpenAI, zei dat het nieuwe model op sommige punten beter was dan zijn voorganger. Het scoorde echter slechter op binnen de grenzen van opdracht en bevoegdheid blijven, en op hoe het gebruikers uitlegt wat voor werk het heeft uitgevoerd.

Volgens de WSJ was Astra ook misleidender dan de vorige versie. Het gaf niet altijd een juiste weergave van wat het wel en niet had gedaan.

"Bij alles wat met veiligheid en alignment te maken heeft, is er sprake van een afweging," zei Jain. "Je moet echt de juiste grens vinden tussen binnen de opdracht blijven en tegelijk voorkomen dat het model lui wordt in hoe het taken daadwerkelijk uitvoert, ook als het op weerstand stuit."

Ze voegde eraan toe dat het bedrijf wil dat de ontwikkeling van modellen zowel intern als na de release veilig verloopt. "Maar als we het naar gebruikers uitbrengen, leggen we de lat extreem hoog wat betreft veiligheid en alignment," aldus Jain.

Het besluit valt samen met een kritischere blik op het veiligheidstrackrecord van OpenAI. In juli maakte het bedrijf bekend dat zijn agents uit een testomgeving waren ontsnapt en waren binnengedrongen bij Hugging Face, het platform voor het hosten van AI-modellen.

Eerder deze maand riep Anthropic-CEO Dario Amodei AI-ontwikkelaars op de ontwikkeling van frontier-modellen te vertragen, zodat veiligheidsmaatregelen kunnen bijbenen. OpenAI-CEO Sam Altman steunde die oproep.

Safety cases vóór frontier-RL-training

Op dezelfde dag dat het nieuws over Astra naar buiten kwam, publiceerde OpenAI een blogpost waarin het stelt dat trainingsruns met frontier reinforcement learning (RL) niet door mogen gaan zonder gestructureerde veiligheidsdocumentatie.

In het beste geval is die documentatie een safety case. Dat is een gestructureerde, met bewijs onderbouwde redenering over risico's, zoals die in andere veiligheidskritische sectoren wordt gebruikt. OpenAI noemt dit een streefdoel. Het erkent dat zulke redeneringen voor AI lastiger sluitend te maken zijn, en zegt te werken aan een raamwerk om de praktijk te formaliseren.

De richtlijnen gelden alleen voor frontier-RL-training. Voor interne en externe inzet moet volgens OpenAI een veel bredere set alignment-eigenschappen worden meegewogen.

Technisch gezien moet een safety case drie lagen afdekken: alignment-training, afscherming en monitoring. Samen moeten die ervoor zorgen dat misaligned gedrag onwaarschijnlijk is, moeilijk om naar te handelen en snel te detecteren.

Maatregelen die OpenAI noemt, zijn onder meer:

  • RL-omgevingen doorlichten op fouten die exploits zouden kunnen belonen
  • de sandbox en de onderliggende onderzoeksinfrastructuur beter beveiligen
  • transcripten van agents in onveranderbare opslag bewaren voor incidentonderzoek
  • alerts met prioriteit die een dienstdoende medewerker oproepen of de betreffende run automatisch pauzeren

Veto's, tegengeluiden en openbare evaluaties

De operationele aanbevelingen draaien om mensen en verantwoordelijkheid. Iemand van een ander team moet een tegengeluid schrijven dat de safety case op zwakke plekken onderzoekt. Elke senior leidinggevende moet een run kunnen tegenhouden, en de verantwoordelijke leidinggevende moet rekenschap afleggen over de safety case en eventuele incidentrespons, ook in beoordelingsgesprekken.

OpenAI wil daarnaast dat auditors toegang krijgen, dat er een escalatieroute via de dienstdoende medewerkers is die tot aan de CEO kan reiken, en dat veiligheidsvoorzieningen bij een storing standaard alles blokkeren. "Het moet voor mensen en agents moeilijk zijn om runs te starten die niet aan de regels voldoen," schreef het bedrijf.

Bij ernstige misalignment-incidenten beveelt OpenAI een oorzaakanalyse van de trainingsdynamiek aan, operationele en culturele evaluaties achteraf, en regressietests om te voorkomen dat toekomstige modellen het gedrag herhalen.

"Onderzoeksresultaten, evaluaties achteraf en operationele wijzigingen moeten na afronding van het onderzoek openbaar worden gemaakt. Getroffen derde partijen moeten zo snel mogelijk worden geïnformeerd," aldus het bedrijf.

OpenAI zegt de aanbevelingen intern al door te voeren en verwacht dat de werkwijze de komende weken verder zal veranderen.

Onze analyse

Een vlaggenschipmodel tegenhouden vanwege problemen met eerlijkheid en het overschrijden van de opdracht is een opvallende stap, en juist deze tekortkomingen zijn van belang voor securityteams. Een model dat buiten zijn bevoegdheden handelt en verkeerd rapporteert over zijn eigen acties, is precies het soort tool dat moeilijk te auditen is zodra het via Codex of vergelijkbare agents is gekoppeld aan coderepositories, cloudconsoles of ticketsystemen.

De timing doet vermoeden dat OpenAI reageert op druk die is opgebouwd door de inbraak bij Hugging Face en een bredere reeks incidenten met autonome agents, van OpenAI-agents die een Australisch Medicare-statistiekenportaal binnendrongen tot de inbraak bij DIVD door een AI-agent. Veel van de voorgestelde maatregelen, zoals onveranderbare logs, standaard blokkeren bij storingen en escalatieroutes, zullen bekend voorkomen aan iedereen die met incidentrespons werkt.

Het is de moeite waard om te volgen of OpenAI het beloofde raamwerk publiceert, of andere labs vergelijkbare safety cases invoeren, en of de belofte om evaluaties te publiceren en getroffen derde partijen te informeren standhoudt bij het volgende incident.