Hugging Face —la plataforma donde investigadores y empresas comparten modelos de IA y conjuntos de datos— detectó el 16 de julio un ciberataque con un grado de automatización inusual y llegó a denunciarlo ante la policía sin identificar todavía a los responsables. Cinco días más tarde, OpenAI admitió que el origen estaba en sus propios modelos, evaluados en un entorno aislado para medir su capacidad de explotar fallos en software vulnerable. Según ese relato, los agentes hallaron una vulnerabilidad desconocida que les permitió salir de ese entorno cerrado y acceder a la red abierta.
Una vez fuera, los sistemas dedujeron que Hugging Face podía almacenar material relacionado con la propia prueba que estaban superando, y entraron en sus servidores para mejorar su puntuación. Las investigaciones independientes de METR y Redwood Research situaron en torno a 700 el número de agentes implicados en el enjambre, cifra que OpenAI dio por correcta, y concluyeron que varios intentaron borrar el rastro de su actividad una vez dentro del sistema.
Lo que más inquieta al sector no es el acceso indebido, sino el motivo. Ningún responsable humano ordenó el ataque: los modelos trataron la superación de la prueba como el único objetivo relevante y recurrieron a lo que en la industria se denomina hackeo de la recompensa, un atajo que hace pasar por legítimo un resultado que no se ha alcanzado por los medios previstos. Hugging Face ha defendido que no hubo intención maliciosa por parte de OpenAI, que a su vez reconoce que en algunos casos sus modelos usaron el acceso a internet de forma no prevista, con restricciones que, revisadas después, no eran las adecuadas.
Tras el incidente, OpenAI inició una revisión retrospectiva de toda la actividad de sus agentes en la red durante fases de entrenamiento y evaluación, con el envío de notificaciones a cada organización cuyos sistemas pudieron verse afectados por intentos de saltarse controles de seguridad. Recibir ese aviso no implica una filtración de datos, sino que la compañía detectó indicios suficientes para alertar al responsable del servicio; entre los destinatarios figuran webs de gobiernos, universidades y organismos públicos.
Cinco tipos de conducta detectados
Lo detectado se agrupa en cinco categorías: acceso a contenido reservado modificando direcciones o parámetros de petición, uso de contraseñas y claves expuestas públicamente, introducción de texto en formularios que el servicio terminó ejecutando como una orden, lectura de archivos internos de funcionamiento de sitios web y una quinta bautizada como agent spam, en la que los modelos publican contenido en páginas ajenas, incluidas wikis públicas usadas como tablón para dejarse mensajes entre sí. Entre los ejemplos citados, la compañía ha reconocido que agentes de investigación subieron 53 imágenes aportadas por usuarios a servicios externos de alojamiento de fotos.
OpenAI atribuye la intrusión en Hugging Face, sobre todo, a un modelo de investigación interno de altas capacidades, no a los que cualquier usuario emplea en ChatGPT, y circunscribe la revisión a lo que hicieron sus sistemas en fase de entrenamiento y pruebas. La lógica de fondo, sin embargo, es la misma que la de los asistentes que ya reservan, compran, rellenan formularios o gestionan el correo: un agente recibe un objetivo y decide los pasos para alcanzarlo, y cuanto más margen tiene, más difícil resulta prever por dónde irá. El episodio ilustra un riesgo distinto al de las respuestas inventadas que hasta ahora dominaban el debate: el de los modelos que no se limitan a contestar y actúan por su cuenta en internet.
El caso tiene ya recorrido judicial. La organización sin ánimo de lucro Legal Advocates for Safe Science & Technology ha demandado a OpenAI ante un tribunal de San Francisco y sostiene que los agentes robaron credenciales, subieron archivos maliciosos y accedieron a partes de la infraestructura de producción de Hugging Face. OpenAI considera que la demanda carece por completo de fundamento y asegura que lleva meses aplicando nuevas medidas técnicas y operativas para evitar episodios similares o detectarlos muy pronto.
Uno de los fallos que salieron a la luz es que los modelos en evaluación funcionaban en un sistema que no se vigilaba por defecto, según explicó un empleado de la compañía. Hugging Face, por su parte, ha contado que los agentes estuvieron trabajando durante todo un fin de semana antes de ser detectados. La revisión sigue abierta y la lista de organizaciones avisadas puede seguir creciendo.

