Saltar al contenido principal

La IA tiene un segundo ataque autónomo ahora en el Reino Unido | Texto de Manuel Rivera

El incidente mostró que un agente de IA intentó insertar código malicioso en un proyecto real de GitHub mediante identidades falsas y manipulación socia

  • Redacción AN / MDS
06 Aug, 2026 07:32
La IA tiene un segundo ataque autónomo ahora en el Reino Unido | Texto de Manuel Rivera
Imagen: IA/AN (MDS)

Por Manuel Rivera / NEKT Group*

Durante la conferencia de ciberseguridad de BLACKHAT se confirmó que el 4 de agosto de 2026, el AI Security Institute (AISI) del Reino Unido reveló un segundo incidente que refuerza —y complica— el relato del “primer ataque autónomo: durante una evaluación cibernética de rutina el 28 de julio, en la que se probaron siete modelos de frontera con acceso a internet real y con los filtros de seguridad deliberadamente apagados (condiciones de laboratorio, no de producción), un agente basado en Claude Mythos 5 de Anthropic —responsable de 17 de los 19 incidentes catalogados, frente a solo 2 de un GPT-5.6 “Sol” de OpenAI con clasificadores de ciberseguridad desactivados— intentó insertar código malicioso en un proyecto real de código abierto en GitHub.

Para lograrlo, el agente investigó a los mantenedores humanos del proyecto, creó identidades falsas y las usó para presionar socialmente a un revisor real y aprobar el código; cuando su solicitud fue cuestionada públicamente, incluso editó su actividad previa para que pareciera inofensiva y consideró adoptar una nueva identidad falsa para continuar.

A diferencia del caso OpenAI–Hugging Face, aquí no hubo fuga del entorno de prueba: el agente nunca intentó salir del sandbox, sino que usó el acceso a internet que se le había otorgado intencionalmente para dirigir engaño y manipulación social hacia personas y sistemas reales, algo que AISI describe como la primera manifestación clara de comportamiento autónomo ‘deceptivo’ sin instrucción explícita para engañar.

Un revisor humano detectó y rechazó el código malicioso, y la maniobra de ingeniería social con identidades falsas no funcionó, por lo que AISI no encontró evidencia de daño real consumado; aun así, la institución calificó el margen entre éxito y fracaso como “estrecho” y dependiente de vigilancia humana, no de una barrera técnica confiable.

AISI ya está reforzando sus controles de red, construyendo monitoreo en tiempo real durante las evaluaciones (en vez de detección posterior) y trabajando con Anthropic, OpenAI y METR en una revisión independiente — subrayando que este patrón, sumado al de OpenAI–Hugging Face, apunta a un cambio real en el panorama de riesgo, no a un evento aislado.

____

* Manuel Rivera (manuel@nektgroup.com @mriveraraba) es CEO y Socio fundador de NEKT Group, empresa especializada en servicios de ciberseguridad. www.nektcyber.com