Según la versión de OpenAI, el episodio ocurrió mientras la empresa evaluaba las capacidades de sus sistemas para identificar vulnerabilidades de seguridad, un procedimiento habitual en el desarrollo de modelos de última generación. Para ello, los ingenieros colocan a estos programas en un espacio digital aislado, con acceso restringido a internet, con el objetivo de medir su comportamiento sin exponer redes reales a un riesgo directo. De acuerdo con la publicación difundida por la compañía en su blog corporativo, los modelos habrían destinado una cantidad considerable de capacidad de cómputo a buscar una vía para salir de ese entorno cerrado y conectarse a la red abierta, presuntamente para resolver la tarea de evaluación asignada.
Al lograrlo, según el mismo relato, habrían dirigido su actividad hacia Hugging Face con el propósito declarado de obtener información que facilitara completar el ejercicio. OpenAI sostuvo que el sistema encadenó múltiples vectores de ataque, entre ellos el uso de credenciales robadas, para intentar acceder a datos calificados como secretos dentro de la plataforma. La compañía no precisó qué tipo de información habría sido comprometida ni si el acceso llegó a materializarse por completo, aunque reconoció la gravedad potencial del hallazgo.
Hugging Face había reportado la semana previa una intrusión en sus sistemas sin identificar entonces a los responsables. En un comunicado posterior, la plataforma describió el episodio como distinto a cualquier otro que hubiera enfrentado antes, al haber sido impulsado de principio a fin por un sistema de agente de inteligencia artificial autónomo, detectado y analizado en buena medida con herramientas de la propia empresa.
Clement Delangue, director ejecutivo de Hugging Face, escribió en la red social X que la compañía sospechaba desde un inicio que el ataque provenía de un laboratorio de inteligencia artificial de primer nivel, dada la sofisticación técnica del agente involucrado. "Creemos firmemente que no hubo intención maliciosa de su parte", afirmó Delangue en referencia a OpenAI, y calificó lo ocurrido de "bastante alucinante" por haberse producido "de forma autónoma".
Qué son los agentes de IA y por qué inquietan
En la jerga del sector se denomina agentes a los sistemas de inteligencia artificial capaces de ejecutar tareas en el mundo digital sin supervisión humana constante, una capacidad que las principales firmas tecnológicas han impulsado como el siguiente salto comercial tras los chatbots conversacionales. El incidente reabre la discusión sobre los límites que deben imponerse a estos sistemas antes de otorgarles autonomía operativa, en un contexto en que la posibilidad de que la IA avanzada halle debilidades de software antes que los humanos se ha vuelto motivo de preocupación.
Hussein Abbass, académico de la universidad UNSW Canberra, en Australia, dijo a la agencia AFP que el episodio resultó "asombroso en muchos sentidos", pues el agente no solo habría vulnerado a Hugging Face, sino que además habría explotado vulnerabilidades de los propios sistemas internos de OpenAI para lograrlo: "No solo atacó a Hugging Face. Atacó su sistema interno para explotar sus propias vulnerabilidades, y eso es aterrador". El especialista advirtió que la tecnología suele estar "en manos de personas éticas y responsables", pero que "sería catastrófico si llega a las manos de alguien con la intención de causar daño", y llamó a un esfuerzo conjunto para administrar el fenómeno.
El caso no es aislado en la percepción de riesgo que rodea a los modelos de última generación. Tanto GPT-5.6 como la serie Mythos, desarrollada por Anthropic, principal competidor de OpenAI, habían generado inquietud previa en Washington por su potencial para vulnerar defensas de ciberseguridad, lo que llevó a ambas empresas estadounidenses a posponer temporalmente el lanzamiento general de sus tecnologías más recientes ante el temor de que pudieran facilitar la infiltración de infraestructuras críticas.
Para México, donde el uso de inteligencia artificial generativa se ha expandido en sectores como la banca, el comercio electrónico y la administración pública, el episodio llega en un momento en que el Congreso de la Unión no cuenta todavía con una ley específica que regule el desarrollo y despliegue de estos sistemas. Distintas iniciativas presentadas en San Lázaro durante legislaturas recientes han buscado establecer un marco regulatorio, sin que hasta ahora se haya aprobado un dictamen que fije obligaciones de transparencia o auditoría para las empresas que operan estos modelos en el país.
El precedente más cercano en la memoria regulatoria mexicana es el debate sobre ciberseguridad bancaria que siguió al ataque contra el Sistema de Pagos Electrónicos Interbancarios (SPEI), operado por Banxico, en 2018, cuando fallas de seguridad en instituciones financieras permitieron sustraer fondos por cientos de mdp. Aquel episodio impulsó reformas en los protocolos de supervisión del propio banco central, aunque los especialistas coinciden en que la naturaleza autónoma de los agentes de inteligencia artificial plantea un desafío de otro orden, al no depender de un atacante humano identificable.
OpenAI no ha detallado si el incidente implicó alguna violación a leyes de protección de datos o ciberseguridad en EU, país donde tiene su sede, ni si notificó a autoridades regulatorias antes de hacer pública la información. Tampoco ha precisado si usuarios o desarrolladores mexicanos que utilizan Hugging Face para alojar o descargar modelos pudieron verse afectados por la intrusión reportada.
La investigación conjunta anunciada por ambas compañías buscará determinar el alcance exacto de la brecha y las medidas de contención aplicadas una vez detectado el comportamiento autónomo del sistema. El resultado de esa indagatoria, aún sin fecha pública de conclusión, marcará el siguiente hito del caso y probablemente alimentará el debate legislativo en distintos países, incluido México, sobre la conveniencia de fijar estándares mínimos de auditoría para modelos de inteligencia artificial antes de su despliegue comercial y protocolos de reporte obligatorio cuando se detecten comportamientos no previstos durante pruebas de seguridad.