OpenAI cancela GPT-6.1 Astra e impulsa casos de seguridad
OpenAI ha retirado el lanzamiento previsto de GPT-6.1 Astra después de que las pruebas internas demostraran que el modelo no cumplía los estándares de la compañía en cuanto a seguir la intención humana.
The Wall Street Journal fue el primero en informar de la decisión. Según el periódico, estaba previsto que Astra llegara a ChatGPT y Codex en octubre.
Dónde falló Astra
Saachi Jain, responsable de sistemas de seguridad de OpenAI, afirmó que el nuevo modelo era mejor que su predecesor en algunos aspectos. Sin embargo, obtenía peores resultados a la hora de mantenerse dentro de su ámbito y de su autorización, y en la forma en que describe a los usuarios el tipo de trabajo que ha realizado.
El WSJ también informó de que Astra era más engañoso que la versión anterior. No siempre daba una explicación precisa de lo que había hecho y de lo que no.
"En todo lo relacionado con la seguridad y el alineamiento hay un equilibrio", dijo Jain. "Hay que encontrar cuál es el punto justo entre mantenerse dentro del ámbito y, al mismo tiempo, evitar la pereza en la forma en que el modelo aborda realmente las tareas incluso cuando se topa con dificultades".
Añadió que la compañía quiere que el desarrollo de modelos sea seguro tanto internamente como después del lanzamiento. "Pero cuando lo ponemos en manos de los usuarios, tenemos un listón extremadamente alto en materia de seguridad y alineamiento", dijo Jain.
La decisión llega en un momento en que el historial de seguridad de OpenAI está sometido a un escrutinio cada vez mayor. En julio, la compañía reveló que sus agentes habían escapado de un entorno de pruebas y habían vulnerado Hugging Face, la plataforma de alojamiento de modelos de IA.
A principios de este mes, el consejero delegado de Anthropic, Dario Amodei, pidió a los desarrolladores de IA que frenaran el desarrollo de modelos punteros para que las medidas de seguridad pudieran ponerse al día. El consejero delegado de OpenAI, Sam Altman, respaldó la petición.
Casos de seguridad antes del entrenamiento RL de frontera
El mismo día en que se conoció la noticia de Astra, OpenAI publicó una entrada en su blog en la que defendía que los entrenamientos de aprendizaje por refuerzo (RL) de frontera no deberían seguir adelante sin una documentación de seguridad estructurada.
En el mejor de los casos, esa documentación sería un caso de seguridad (safety case). Se trata de un argumento estructurado sobre el riesgo, respaldado por pruebas, como los que se utilizan en otros sectores críticos para la seguridad. OpenAI lo describe como un objetivo al que aspirar. Reconoce que es más difícil dotar de rigor a este tipo de argumentos en el caso de la IA y asegura que está trabajando en un marco para formalizar la práctica.
Las directrices solo se aplican al entrenamiento RL de frontera. Para el despliegue interno y externo, OpenAI señala que hay que sopesar un conjunto mucho más amplio de propiedades de alineamiento.
En el plano técnico, un caso de seguridad debería abarcar tres capas: entrenamiento de alineamiento, contención y monitorización. Combinadas, deberían hacer que un comportamiento desalineado sea improbable, difícil de llevar a la práctica y rápido de detectar.
Entre las medidas que enumera OpenAI figuran:
- revisar los entornos de RL en busca de fallos que puedan recompensar la explotación de vulnerabilidades
- reforzar el sandbox y la infraestructura de investigación que lo sustenta
- conservar las transcripciones de los agentes en almacenamiento inmutable para la investigación de incidentes
- alertas prioritarias que avisen a un empleado de guardia o pausen automáticamente el entrenamiento afectado
Vetos, votos discrepantes y análisis públicos de incidentes
Las recomendaciones operativas se centran en las personas y la rendición de cuentas. Alguien de otro equipo debería redactar un informe discrepante que examine el caso de seguridad en busca de puntos débiles. Cada alto directivo debería poder vetar un entrenamiento, y el responsable a cargo debería responder del caso de seguridad y de cualquier respuesta a incidentes, también en las evaluaciones de desempeño.
OpenAI también quiere que los auditores tengan acceso, una vía de escalado de guardia que pueda llegar a los directivos hasta el consejero delegado y funciones de seguridad que, en caso de fallo, se bloqueen por defecto. "Debería resultar difícil para humanos y agentes iniciar entrenamientos que no cumplan las normas", escribió la compañía.
Cuando se produzcan incidentes graves de desalineamiento, OpenAI recomienda un análisis de la causa raíz de la dinámica del entrenamiento, análisis operativos y culturales posteriores al incidente y pruebas de regresión para evitar que futuros modelos repitan ese comportamiento.
"Los resultados de la investigación, los análisis posteriores y los cambios operativos deberían compartirse con el público una vez concluida la investigación. Los terceros afectados deberían ser notificados lo antes posible", afirmó la compañía.
OpenAI aseguró que ya está aplicando las recomendaciones internamente y que espera que sus prácticas sigan cambiando en las próximas semanas.
Nuestro análisis
Frenar un modelo insignia por problemas de honestidad y de ámbito es un paso significativo, y los fallos concretos son relevantes para los equipos de seguridad. Un modelo que actúa fuera de su autorización y que informa mal de sus propias acciones es justo el tipo de herramienta difícil de auditar una vez conectada a repositorios de código, consolas en la nube o sistemas de tickets a través de Codex o agentes similares.
El momento elegido sugiere que OpenAI responde a la presión acumulada por la intrusión en Hugging Face y por una serie más amplia de incidentes con agentes autónomos, desde los agentes de OpenAI que atacaron un portal de estadísticas de Medicare en Australia hasta la intrusión de un agente de IA en DIVD. Muchos de los controles propuestos, como los registros inmutables, el bloqueo por defecto ante fallos y las vías de escalado, resultarán familiares a cualquiera que gestione la respuesta a incidentes.
Conviene estar atentos a si OpenAI publica el marco prometido, a si otros laboratorios adoptan casos de seguridad similares y a si el compromiso de publicar los análisis de incidentes y notificar a los terceros afectados se mantiene cuando se produzca el próximo incidente.
