Los humanos pasaron por alto 1 de cada 3 amenazas al aprobar comandos de agentes de IA en 40k partidas

Un experimento en línea en el que los jugadores aprobaban o rechazaban comandos de terminal generados por IA encontró que los humanos pasaron por alto aproximadamente un tercio de las amenazas de seguridad incrustadas en 40.000 partidas, incluso cuando se les advirtió explícitamente. Los comentaristas sostienen que esto subraya los límites de los avisos de “humano en el circuito”, que rápidamente conducen a fatiga, aprobación mecánica y traslado de responsabilidad en lugar de seguridad real. Muchos abogan en cambio por controles técnicos más fuertes —sandboxing, seguridad basada en capacidades, entornos restringidos y clasificadores de IA que auditen a otros agentes—, mientras que otros señalan fallos en el diseño del juego y enfatizan lo difícil que es definir en la práctica qué sería un agente de IA “seguro”.

Efectividad de los permisos con humano en el circuito

  • Muchos ven “haz clic para aprobar” como un patrón de seguridad fallido, repetido desde los diálogos de permisos del sistema operativo y la formación contra phishing.
  • Los usuarios desarrollan “ceguera de monitor” y hacen clic en “sí” de forma refleja, especialmente bajo presión de tiempo.
  • Algunos sostienen que pasar por alto 1 de cada 3 amenazas es catastróficamente malo para cualquier proceso serio; otros señalan que la prueba implica estrés, contexto limitado y personas sin experiencia.
  • Varios apuntan que, en el trabajo real, las amenazas raras más los avisos constantes casi garantizan un fallo eventual.

Alternativas: modo automático, clasificadores, sandboxing

  • Sugerencias populares: clasificadores automáticos sobre cada acción, modelos “auditores” separados, además de sandboxing (contenedores, VMs, microVMs, sandboxes a nivel de bytecode).
  • Algunos ya ejecutan agentes como usuarios sin privilegios, dentro de VMs, con red y sistema de archivos restringidos, o usan productos que hacen cumplir de forma centralizada con quién pueden hablar los agentes.
  • Otros afirman que la exfiltración es fundamentalmente difícil de impedir si existe cualquier acceso a la red; las fugas de sandbox y los ataques a la cadena de suministro siguen siendo preocupaciones.

¿Cómo sería un modelo serio de seguridad para agentes?

  • Varios comentaristas dicen que no está claro cómo definir un “agente seguro” y al mismo tiempo permitir acceso útil a la web, archivos y herramientas.
  • Los simples avisos de “¿permitir comando X?” se ven como la abstracción equivocada; se proponen modelos basados en archivos y capacidades, contención del radio de impacto y controles basados en tiempo.
  • Algunos lo comparan con asegurar a un operador humano con tolerancia infinita al riesgo y sin autopreservación.

Seguridad basada en capacidades y lenguajes

  • Hay un gran interés en la seguridad basada en capacidades, tanto a nivel del sistema operativo como del lenguaje, para restringir lo que el código (incluido el código escrito por agentes) puede hacer en cualquier caso.
  • Quienes la defienden describen las capacidades como permisos granulares y transitivos que podrían mitigar el riesgo de la cadena de suministro y hacer que muchas bibliotecas sean inherentemente no peligrosas.

Responsabilidad, UX y “moral crumple zones”

  • Muchos ven los avisos de permisos y las advertencias como escudos de responsabilidad: trasladan la culpa a los usuarios o a operadores de bajo nivel cuando los sistemas fallan.
  • Conceptos como “moral crumple zones” y “accountability sinks” se invocan para describir a los humanos absorbiendo la culpa de sistemas automatizados complejos.

Críticas al juego y a los datos

  • Varios señalan que el juego va con temporizador, no tiene consecuencias reales y a veces etiqueta comandos como peligrosos de formas que disputan o que dependen de contexto que falta.
  • Otros aun así ven valor: incluso en un entorno de juguete, destaca lo difícil y fatigante que es revisar comandos y lo fácilmente que los humanos pasan por alto amenazas sutiles.