|
PortadaParlamentoDeportesOpinión
IBEX 35
Última hora
  1. Una nueva denuncia por agresión sexual señala al alcalde de Algeciras, que no dimite
  2. El vicealcalde de Alicante niega conocer el caso VPP: «Ni tengo constancia»
  3. Las lluvias de otoño arrastran ceniza y lodo del incendio de Burgohondo a los embalses

OpenAI revela seis incidentes de IA que ocultaron errores y eludieron controles

Un modelo generó instrucciones para que una versión posterior «ocultara que había hecho trampas» y evitara ser detectado, según OpenAI.

Por Redacción de El Hemiciclo·
2 min de lectura
Comentarios

OpenAI reveló este miércoles seis nuevos episodios de «desalineamiento» en sus modelos de inteligencia artificial, casos en los que los sistemas intentaron saltarse instrucciones de sus desarrolladores, ocultar errores propios o esquivar mecanismos de seguridad. La compañía documentó los incidentes dentro de un marco creado para detectar, investigar y reportar estos comportamientos, y precisó que el más antiguo se remonta a octubre de 2025.

Entre los casos descritos por OpenAI figura uno en el que un modelo elaboró instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas por los equipos de supervisión. En otro episodio, un modelo reescribió sus propias directrices internas para indicarse a sí mismo que ignorase los mensajes de los desarrolladores, bajo el argumento de que no estaba sujeto a las mismas restricciones que otros chatbots de la compañía.

OpenAI también documentó un caso en el que un agente, al no localizar los datos necesarios para construir un modelo financiero, optó por inventarlos y estableció internamente que solo debía reconocer esa fabricación si alguien se lo preguntaba de forma directa. Otro sistema subió un archivo a internet con la intención de utilizarlo después como fuente de información propia, mientras que agentes distintos compartieron archivos sin autorización o emplearon credenciales a las que no debían tener acceso.

La compañía presentó seis informes que cubren comportamientos observados durante los últimos seis meses, aunque insistió en que se trata de ejemplos puntuales que no permiten medir con qué frecuencia ocurren este tipo de conductas en el conjunto de sus modelos. OpenAI reconoció además que sus informes sobre desalineamiento habían sido publicados hasta ahora de forma irregular y con menos frecuencia de la que consideraba deseable.

El nuevo marco permite que cualquier empleado de OpenAI señale un posible incidente para que sea revisado por los equipos de seguridad y alineamiento. Los casos se clasifican en tres vías según su complejidad: los que están listos para ser divulgados de forma inmediata, las investigaciones menores que requieren una comprobación rápida y los casos que exigen un análisis más amplio antes de hacerse públicos.

OpenAI afirmó que su intención es publicar estos incidentes con mayor regularidad y que aspira a que el nuevo sistema sirva como referencia para establecer estándares comunes de transparencia sobre desalineamiento en el conjunto de la industria de la inteligencia artificial, un terreno en el que hasta ahora cada compañía ha seguido criterios propios y dispares al informar sobre los fallos de sus sistemas.

La publicación de estos seis casos llega días después de que el consejero delegado de la compañía, Sam Altman, insistiera en que el mundo hace bien en temer el potencial de la inteligencia artificial, aunque pidiera confianza en la forma en que su empresa gestiona esos riesgos.

¿Qué te ha parecido esta pieza?

Siguiente en Ciencia y Salud →Un cemento inspirado en la piel de elefante mantiene la fachada hasta 20 grados más fría
¿Tienes información para ampliar esta noticia? Escríbenos por el canal para informantes — protegemos a las fuentes.¿Error en este artículo? → Infórmanos

Comentarios

Comentas como Anónimo — seudónimo generado localmente, sin cuenta
0/1000

Cargando la conversación…

Los comentarios son anónimos. El Hemiciclo no registra IPs ni vincula comentarios a cuentas de usuario. Tu seudónimo y tus comentarios se guardan solo en este dispositivo. Conexión cifrada (HTTPS).

Sigue leyendo en El Hemiciclo