OpenAI annule GPT-6.1 Astra, prône des dossiers de sécurité

OpenAI annule GPT-6.1 Astra, prône des dossiers de sécurité

OpenAI a renoncé à la sortie prévue de GPT-6.1 Astra. Des tests internes ont montré que le modèle ne respectait pas les exigences de l'entreprise en matière de respect des intentions humaines.

Le Wall Street Journal a été le premier à révéler cette décision. Selon le quotidien, Astra devait être lancé dans ChatGPT et Codex en octobre.

Les points faibles d'Astra

Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a indiqué que le nouveau modèle faisait mieux que son prédécesseur sur certains points. Il se montrait en revanche moins performant pour rester dans le périmètre de sa mission et de ses autorisations, ainsi que dans la manière dont il décrit aux utilisateurs le travail qu'il a effectué.

Le WSJ rapporte également qu'Astra était plus trompeur que la version précédente. Il ne rendait pas toujours compte fidèlement de ce qu'il avait fait ou non.

"Pour tout ce qui touche à la sécurité et à l'alignement, il y a un compromis à faire", a déclaré Saachi Jain. "Il faut vraiment trouver le bon équilibre entre rester dans le périmètre fixé et éviter que le modèle fasse preuve de paresse dans la manière dont il mène ses tâches, même lorsqu'il rencontre des obstacles."

Elle a ajouté que l'entreprise veut que le développement des modèles soit sûr, aussi bien en interne qu'après leur sortie. "Mais quand nous le mettons entre les mains des utilisateurs, nous plaçons la barre extrêmement haut en matière de sécurité et d'alignement", a-t-elle précisé.

Cette décision intervient alors que le bilan d'OpenAI en matière de sécurité est examiné de plus près. En juillet, l'entreprise avait révélé que ses agents s'étaient échappés d'un environnement de test et avaient piraté Hugging Face, la plateforme d'hébergement de modèles d'IA.

Plus tôt ce mois-ci, Dario Amodei, PDG d'Anthropic, a appelé les développeurs d'IA à ralentir le développement des modèles de pointe afin de laisser aux mesures de sécurité le temps de rattraper leur retard. Sam Altman, PDG d'OpenAI, a soutenu cet appel.

Des dossiers de sécurité avant tout entraînement RL de pointe

Le jour même où l'affaire Astra a éclaté, OpenAI a publié un billet de blog expliquant que les entraînements par apprentissage par renforcement (RL) des modèles de pointe ne devraient pas se poursuivre sans documentation de sécurité structurée.

Dans l'idéal, cette documentation prendrait la forme d'un dossier de sécurité ("safety case"). Il s'agit d'une argumentation structurée sur les risques, étayée par des preuves, comme on en utilise dans d'autres secteurs où la sécurité est critique. OpenAI présente cela comme un objectif à atteindre. L'entreprise reconnaît que de tels argumentaires sont plus difficiles à rendre rigoureux dans le cas de l'IA et affirme travailler à un cadre pour formaliser cette pratique.

Ces recommandations ne concernent que l'entraînement RL des modèles de pointe. Pour le déploiement interne et externe, OpenAI estime qu'un éventail bien plus large de propriétés d'alignement doit être pris en compte.

Sur le plan technique, un dossier de sécurité devrait couvrir trois niveaux : l'entraînement à l'alignement, le confinement et la surveillance. Combinés, ils doivent rendre un comportement mal aligné peu probable, difficile à mettre en oeuvre et rapide à détecter.

Parmi les mesures citées par OpenAI :

  • examiner les environnements RL pour y repérer les failles susceptibles de récompenser des exploits
  • renforcer le bac à sable et l'infrastructure de recherche qui le sous-tend
  • conserver les transcriptions des agents dans un stockage immuable pour les enquêtes sur les incidents
  • des alertes prioritaires qui préviennent un employé d'astreinte ou mettent automatiquement en pause l'entraînement concerné

Droits de veto, avis contradictoires et analyses post-incident publiques

Les recommandations opérationnelles mettent l'accent sur les personnes et la responsabilité. Une personne issue d'une autre équipe devrait rédiger un avis contradictoire qui passe le dossier de sécurité au crible pour en déceler les points faibles. Chaque dirigeant devrait pouvoir opposer son veto à un entraînement, et le dirigeant responsable devrait rendre des comptes sur le dossier de sécurité et sur toute réponse à incident, y compris lors de ses évaluations de performance.

OpenAI souhaite aussi que des auditeurs aient accès aux informations, qu'une chaîne d'escalade d'astreinte puisse remonter jusqu'à la direction, PDG compris, et que les dispositifs de sécurité se bloquent par défaut en cas de défaillance. "Il devrait être difficile pour les humains comme pour les agents de lancer des entraînements non conformes", écrit l'entreprise.

En cas d'incidents graves de désalignement, OpenAI recommande une analyse des causes profondes dans la dynamique d'entraînement, des analyses post-incident opérationnelles et culturelles, ainsi que des tests de non-régression pour empêcher les futurs modèles de reproduire le comportement.

"Les résultats des enquêtes, les analyses post-incident et les changements opérationnels devraient être rendus publics une fois l'enquête terminée. Les tiers concernés devraient être prévenus le plus rapidement possible", indique l'entreprise.

OpenAI affirme appliquer déjà ces recommandations en interne et s'attend à ce que ses pratiques évoluent encore dans les semaines à venir.

Notre analyse

Retenir un modèle phare pour des problèmes d'honnêteté et de périmètre est une décision qui compte, et les défaillances en question intéressent directement les équipes de sécurité. Un modèle qui agit au-delà de ses autorisations et rend mal compte de ses propres actions est précisément le genre d'outil difficile à auditer une fois branché sur des dépôts de code, des consoles cloud ou des systèmes de tickets via Codex ou des agents similaires.

Le calendrier laisse penser qu'OpenAI réagit à la pression accumulée depuis le piratage de Hugging Face et à une série plus large d'incidents impliquant des agents autonomes, des agents d'OpenAI qui ont frappé un portail de statistiques de Medicare en Australie à l'intrusion chez DIVD menée par un agent d'IA. Nombre des contrôles proposés, comme les journaux immuables, le blocage par défaut ou les chaînes d'escalade, sembleront familiers à quiconque gère la réponse aux incidents.

Reste à voir si OpenAI publiera le cadre promis, si d'autres laboratoires adopteront des dossiers de sécurité similaires, et si l'engagement de publier les analyses post-incident et de prévenir les tiers concernés tiendra lors du prochain incident.