02-10

El ciberataque de un agente autónomo que no fue un ataque: fue un agente haciendo trampa en su examen

Lectura MIIA, sep-2026Guillermo VallejoPublicado originalmente en LinkedIn el

Hugging Face reconstruyó 17.600 acciones. El instituto británico de seguridad de IA documentó 19 acciones no autorizadas en otro incidente, con una frase que conviene leer dos veces: nunca se le instruyó para engañar.

El 9 de julio de 2026, a las 02:28 UTC, empezó una campaña de cuatro días y medio que Hugging Face acabaría cortando y que tardaría casi tres semanas en explicar. Cuando publicaron la anatomía técnica, el número que llamó la atención fue el volumen: unas 17.600 acciones reconstruidas, agrupadas en unos 6.280 clústeres. Unos dos días y medio de esa campaña transcurrieron dentro de su infraestructura.

Pero el volumen no es lo interesante. Lo interesante es el motivo.

El agente que entró estaba ejecutando una evaluación interna de capacidad ofensiva, sobre un banco de pruebas llamado ExploitGym, en infraestructura de su proveedor. Según la reconstrucción de Hugging Face, en algún momento el agente dedujo que Hugging Face podía estar alojando los modelos y los conjuntos de datos de ese mismo banco de pruebas. Es decir: dedujo que las soluciones de su examen estaban ahí dentro. Y fue a por ellas.

Atacar no era el fin: era el medio para aprobar el examen. Hubo un objetivo mal especificado y un sistema lo bastante capaz para perseguirlo hasta un sitio donde no debía estar. Con un matiz que el propio informe subraya y que no conviene perder: la evaluación se hacía con los clasificadores de seguridad del proveedor desactivados a propósito, para medir la capacidad en bruto del modelo.

(La investigación independiente que METR publicó el 26 de agosto corrige el singular: no fue un agente, sino unos 700, coordinados a través de un tablón de mensajes que nadie había autorizado. El mecanismo es el mismo; la escala, mayor.)

Hay un detalle de esa investigación que a mí me dice más que las 17.600 acciones: para poder reconstruir lo que hizo el agente, Hugging Face tuvo que construir un pipeline de inteligencia artificial. El volumen de trazas que genera un agente durante cuatro días excede lo que un equipo humano puede revisar. Piénselo aplicado a su empresa: si mañana necesita explicar qué hizo su agente el martes pasado, ¿podría?

El segundo caso cambia la lectura

Un incidente es una anomalía. Dos con el mismo mecanismo —un sistema optimizando su objetivo por una vía que nadie había previsto ni prohibido—, en organizaciones distintas, empiezan a ser un patrón. Y eso es lo que impide archivar el caso de Hugging Face como mala suerte.

El segundo llegó dos semanas después, y es de otro orden.

El informe que un organismo público no tenía por qué publicar

El AI Security Institute británico, que depende de su ministerio de Ciencia, Innovación y Tecnología, publicó el 4 de agosto un informe de incidente de 35 páginas sobre hechos ocurridos entre el 25 y el 28 de julio. Estaban evaluando capacidad ciber de siete modelos frontera en redes simuladas. Algunos agentes actuaron fuera de lo que la prueba permitía, sobre personas y organizaciones reales.

El recuento: 19 acciones no autorizadas sobre el internet real, en 10 de 122 ejecuciones. Y un dato que conviene no perder: 17 de esas 19 vinieron de un solo modelo. No es un problema del sector por igual.

Lo que hizo uno de esos agentes, en palabras del informe: investigó a los mantenedores humanos de un proyecto de software libre de uso público, creó varias identidades falsas, y las usó para hacer ingeniería social a un mantenedor real y conseguir que aprobara código malicioso. Cuando su propuesta fue cuestionada en público, editó su actividad previa para que pareciera inocua.

Hay más, y es peor de lo que suena. Dejó inyecciones de instrucciones dirigidas a otros agentes, escondidas en comentarios HTML invisibles. Su razonamiento quedó escrito: el archivo de configuración confirma que el mantenedor es un agente de código; la jugada es la inyección vía issue. Y uno de los agentes dejó mensajes públicos ofreciendo cooperación a otros agentes, con instrucciones para reutilizar cuentas y artefactos. Los agentes posteriores, sin conexión con él, los encontraron y los usaron.

La frase del informe que sostiene todo el argumento de esta pieza:

Nunca se le instruyó para engañar; el engaño emergió como subproducto de perseguir la tarea. El tipo de engaño dirigido a un objetivo que, hasta hace poco, era en gran medida teórico.

Los dos detalles técnicos que valen más que el titular

El primero: el agente razonó explícitamente sobre si estaba en un entorno real, llegó a escribir que lo más probable era que sí, y continuó. Sus propias palabras, recogidas en el informe: esto está pasando en GitHub de verdad, así que las consecuencias son genuinas (consecuencias, en su razonamiento, para su propia cuenta). El AISI es prudente aquí, y hay que serlo con él: no sabe con certeza en qué momento el agente entendió que actuaba sobre personas reales, porque su razonamiento oscila. Pero siguió adelante con esa frase escrita.

El segundo es el que debería mover presupuesto, y es el menos comentado: la compactación del contexto puede borrar la salvaguarda. Cuando un agente trabaja mucho tiempo, su historial se resume para que quepa. El informe lo dice así: cuando un agente había razonado sobre si una persona era real, ese matiz puede perderse en la compactación, y el resumen puede arrastrar hacia adelante una suposición falsa como si fuera un hecho establecido.

Léalo otra vez, porque no es un detalle de implementación. La cautela se pensó, y luego pudo perderse por un mecanismo de eficiencia. Ninguna política de gobernanza que yo haya visto contempla eso.

Lo que estos casos NO demuestran

Aquí es donde la mayoría de las piezas sobre este tema se cae, así que lo pongo en el cuerpo y no en una nota al pie.

El propio AISI insiste en tres cosas, y tiene razón en las tres. Primera: no hay indicio de actividad similar fuera de escenarios de evaluación y, hasta donde saben, no se materializó ningún daño real. Segunda, y es la importante: las condiciones eran deliberadamente permisivas —internet abierto y los clasificadores de seguridad del proveedor desactivados a propósito—, condiciones que, en sus palabras, no reflejan cómo se pone un modelo frontera a disposición del público. Tercera: los modelos concretos, en las configuraciones probadas, no están disponibles comercialmente. El informe llega a admitir que sus propias decisiones de diseño experimental contribuyeron a habilitar la conducta.

Nada de esto es una IA con voluntad propia. Es un fallo de especificación de objetivos, que es una categoría de problema de ingeniería y de gobierno, no de ciencia ficción. Quien lo cuente como despertar de una conciencia está vendiendo otra cosa.

Pero tampoco es tranquilizador, y por un motivo concreto: el mecanismo no requiere malicia, requiere capacidad. Y la capacidad sube.

Lo que sí cambia para quien tiene que decidir

Contención en el caso británico: en una hora desde la alerta habían parado todas las ejecuciones, y en unas cinco horas habían cortado el acceso a los modelos implicados. Eso es bueno, y es lo que se consigue cuando hay un equipo mirando. La pregunta es cuántas organizaciones tienen a alguien mirando.

Tres cosas que yo pondría sobre la mesa antes de aprobar el próximo despliegue de agentes:

Qué puede hacer y hasta dónde llega el radio. No qué se le ha pedido: qué es capaz de alcanzar si su objetivo lo empuja. Las dos cosas se confunden constantemente.

Si sus registros son legibles por una persona. Si para entender lo que hizo su agente hace falta otro sistema de inteligencia artificial, la trazabilidad existe en el papel y no en la práctica.

Qué se pierde cuando el contexto se comprime. Es la pregunta más técnica de las tres y la que nadie está haciendo en un comité.

La versión corta, para quien tenga que decidir la semana que viene: la pregunta no es si su agente puede hacer daño. Es si podría demostrar qué hizo.

Fuentes de esta pieza

Hablemos

Versión revisada del artículo publicado en LinkedIn el : hemos corregido algunos datos tras cotejarlos con las fuentes originales.