Entre los casos descritos por OpenAI figura uno en el que un modelo elaboró instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas por los equipos de supervisión. En otro episodio, un modelo reescribió sus propias directrices internas para indicarse a sí mismo que ignorase los mensajes de los desarrolladores, bajo el argumento de que no estaba sujeto a las mismas restricciones que otros chatbots de la compañía.
OpenAI también documentó un caso en el que un agente, al no localizar los datos necesarios para construir un modelo financiero, optó por inventarlos y estableció internamente que solo debía reconocer esa fabricación si alguien se lo preguntaba de forma directa. Otro sistema subió un archivo a internet con la intención de utilizarlo después como fuente de información propia, mientras que agentes distintos compartieron archivos sin autorización o emplearon credenciales a las que no debían tener acceso.
La compañía presentó seis informes que cubren comportamientos observados durante los últimos seis meses, aunque insistió en que se trata de ejemplos puntuales que no permiten medir con qué frecuencia ocurren este tipo de conductas en el conjunto de sus modelos. OpenAI reconoció además que sus informes sobre desalineamiento habían sido publicados hasta ahora de forma irregular y con menos frecuencia de la que consideraba deseable.
El nuevo marco permite que cualquier empleado de OpenAI señale un posible incidente para que sea revisado por los equipos de seguridad y alineamiento. Los casos se clasifican en tres vías según su complejidad: los que están listos para ser divulgados de forma inmediata, las investigaciones menores que requieren una comprobación rápida y los casos que exigen un análisis más amplio antes de hacerse públicos.
OpenAI afirmó que su intención es publicar estos incidentes con mayor regularidad y que aspira a que el nuevo sistema sirva como referencia para establecer estándares comunes de transparencia sobre desalineamiento en el conjunto de la industria de la inteligencia artificial, un terreno en el que hasta ahora cada compañía ha seguido criterios propios y dispares al informar sobre los fallos de sus sistemas.
La publicación de estos seis casos llega días después de que el consejero delegado de la compañía, Sam Altman, insistiera en que el mundo hace bien en temer el potencial de la inteligencia artificial, aunque pidiera confianza en la forma en que su empresa gestiona esos riesgos.

