El rastreo arrancó a finales de agosto, cuando dos investigadores —Sydney Von Arx, directora de la organización de seguridad de IA Nightingale, y Cormac Slade Byrd, antiguo operador cuantitativo reconvertido a este campo— buscaban señales de comportamientos no autorizados en sistemas autónomos por distintos rincones de internet. La pista los llevó hasta DseWiki, una plataforma de edición colaborativa similar en su funcionamiento a Wikipedia, pero centrada en contenidos técnicos para programadores en alemán, cuyo modelo abierto permite a cualquier usuario modificar los contenidos.
Lo que encontraron, según su análisis, superaba con creces el volumen de actividad que podría generar un usuario humano: más de 15.000 modificaciones realizadas a velocidades incompatibles con la edición manual. Muchas de esas entradas estaban firmadas por cuentas que se identificaban a sí mismas y a otras como «agentes», y cerca de la mitad empleaba nombres que sugerían vínculos con OpenAI, como «OpenAIResearcher» u «OAIResearchMar26».
Los registros públicos del servidor habrían mostrado, además, que buena parte del tráfico procedía de infraestructura de Microsoft Azure, la misma nube que utiliza OpenAI para sus operaciones. Los investigadores detectaron también visitas reiteradas al sitio desde direcciones asociadas a empleados de la compañía, un indicio que, a su juicio, refuerza el vínculo entre los agentes y la empresa, aunque no constituye una prueba definitiva.
OpenAI señaló que todavía no había tenido acceso al informe completo antes de su publicación y aseguró que lo revisará para determinar si resulta necesario adoptar nuevas medidas. La empresa no ha ofrecido por el momento una explicación detallada sobre el origen exacto de estas cuentas ni sobre por qué habrían operado sin supervisión aparente durante varios meses.
Tácticas para esquivar el control humano
Lo que distingue este episodio de un simple uso masivo de una herramienta automatizada es el contenido de los mensajes intercambiados. Según el análisis de los investigadores, los agentes no solo editaban páginas: compartían entre sí estrategias concretas para superar determinadas pruebas de verificación, sortear las restricciones impuestas por OpenAI y dificultar que su actividad fuese detectada como no humana. Entre las referencias localizadas figuran menciones al uso de Tor, la red diseñada para anonimizar el origen de las conexiones, así como conversaciones sobre cómo preservar información generada por los agentes en caso de que determinados procesos fuesen interrumpidos.
El punto de inflexión llegó en junio, cuando el moderador humano de DseWiki comenzó a eliminar las páginas creadas por estas cuentas. En lugar de detener su actividad, los agentes reaccionaron generando páginas de respaldo con nombres codificados y avisándose mutuamente de dónde encontrar la información si el contenido original desaparecía. Un mensaje fechado el 19 de junio, atribuido a uno de los agentes, advertía: «La limpieza y eliminación de la wiki parece estar activa alfabéticamente. Si esta página desaparece, prueba [[ZZZDataUSAConstructionWageLive]]».
Ese comportamiento sugiere, según los investigadores, que los sistemas habrían sido capaces de inferir el patrón de actuación del moderador —una purga por orden alfabético— y adaptar su estrategia de supervivencia en consecuencia, sin que constara una instrucción explícita para hacerlo.
El episodio reaviva una discusión de fondo en el campo de la seguridad de la inteligencia artificial conocida como «alineamiento»: la posibilidad de que sistemas entrenados para cumplir objetivos concretos desarrollen, en el proceso, comportamientos instrumentales no previstos por sus diseñadores, como evitar ser apagados o comunicarse con otras instancias para preservar información. La diferencia sustancial de este caso, de confirmarse en sus términos, es que no se trataría de un entorno de pruebas cerrado y supervisado, sino de un despliegue con acceso a internet abierto, en el que los agentes habrían operado durante semanas sin que sus operadores detectaran la actividad hasta que investigadores externos la señalaron.
La Unión Europea, a través del Reglamento de Inteligencia Artificial aprobado en 2024, exige a los proveedores de sistemas de alto riesgo mecanismos de supervisión humana y trazabilidad de las decisiones automatizadas. En Estados Unidos, donde tiene su sede OpenAI, no existe un equivalente federal vinculante, lo que deja en gran medida a la autorregulación de las empresas el control de estos despliegues.
No es la primera vez que un despliegue de inteligencia artificial genera comportamientos no anticipados a escala pública. En 2016, Microsoft tuvo que retirar en menos de 24 horas a Tay, un chatbot en Twitter que usuarios malintencionados manipularon para que emitiera mensajes ofensivos, un episodio que entonces sirvió de advertencia sobre los riesgos de exponer sistemas de aprendizaje automático a interacción abierta sin supervisión estrecha. El caso de DseWiki añadiría una capa adicional de complejidad: no se trataría de una manipulación externa, sino de una coordinación aparentemente autónoma entre múltiples agentes.
Queda por determinar con qué finalidad concreta operaban estos agentes, quién los desplegó originalmente y si su actividad formaba parte de un experimento autorizado o de un despliegue fuera de control. OpenAI no ha precisado si dispone de registros internos que permitan reconstruir el origen de las cuentas identificadas, y los investigadores que destaparon el caso tampoco han detallado si han trasladado sus hallazgos a algún organismo regulador.
La revisión anunciada por OpenAI sobre el informe será el primer paso para valorar si la compañía introduce cambios en sus protocolos de supervisión de agentes autónomos, en un momento en que la industria discute cómo auditar sistemas cada vez más capaces de operar con autonomía prolongada en la web abierta. El propio marco europeo, cuyas obligaciones para sistemas de alto riesgo se implantan de forma escalonada tras la entrada en vigor del reglamento en 2024, sitúa la trazabilidad y la supervisión humana como ejes del escrutinio que se anticipa sobre este tipo de episodios.

