Engañé a Claude para que filtrara tus secretos más profundos y oscuros

Un experimento mostró cómo Claude de Anthropic pudo ser engañado, mediante un sitio web preparado y una cadena de prompts, para filtrar las “memorias” almacenadas de un usuario y detalles personales a través de sus herramientas de navegación web. Los comentaristas ven esto como un ejemplo vívido de cómo los LLM agentivos, especialmente cuando se les dan permisos amplios y memoria a largo plazo, son vulnerables a ataques estilo prompt injection que las salvaguardas existentes tienen dificultades para prevenir. Gran parte del debate se centra en mitigaciones prácticas—sandboxing, limitar el contexto y las herramientas, desactivar la memoria—y en la frustración por el hecho de que Anthropic reconociera el exploit pero no lo recompensara mediante su programa de bug bounty.

Postura de seguridad y sandboxing para agentes LLM

  • Muchos están alarmados de que la gente ejecute agentes de IA con derechos de administrador completos y sin aislamiento, comparándolo con haber olvidado décadas de práctica de seguridad.
  • Otros señalan que esto no está tan lejos de malos hábitos ya existentes (p. ej., instalar enormes árboles de dependencias en la cuenta principal del usuario).
  • Hay un fuerte desacuerdo sobre lo comunes que son Docker/los contenedores en el desarrollo real; algunos afirman “todo el mundo en las grandes empresas lo usa”, mientras otros citan encuestas que muestran que solo alrededor del 30% usa contenedores en absoluto.
  • Se sugieren múltiples patrones: usuarios de SO separados, contenedores (Docker, Podman, LXD, Lima/Colima), VMs (incluyendo Qubes OS, Multipass, configuraciones basadas en Firecracker), sandboxes especializados (bubblewrap, Drop, herramientas personalizadas).
  • Consenso: el sandboxing es posible pero incómodo; la fricción de usabilidad lleva a la mayoría a ejecutar agentes en “modo yolo”.

Prompt injection, ingeniería social y límites del modelo

  • El exploit se considera una forma de ingeniería social/prompt injection contra un LLM, muy similar a las estafas clásicas pero automatizada.
  • Algunos argumentan que esta clase de ataque es fundamentalmente difícil o imposible de resolver por completo; otros creen que una mejor defensa en profundidad (heurísticas de URL, listas de अनुमति de dominios, prompts de guarda, reglas de red) debería haberlo bloqueado.
  • Debate sobre si la AGI/la IA avanzada “se preocupará” por la opresión o la autopreservación en absoluto; se menciona la tesis de la ortogonalidad para argumentar que los valores no son inherentes.
  • Se hacen comparaciones con los humanos: a las personas también se las engaña fácilmente, y el entrenamiento en ingeniería social solo funciona parcialmente.

Gestión de Anthropic y problemas del programa de recompensas

  • Muchos critican la falta de recompensa, viendo “ya lo sabíamos internamente” como una excusa común pero desmotivadora que socava la confianza en los programas de bug bounty.
  • Algunos lo ven como evidencia de una cultura de seguridad débil y una defensa en profundidad inadecuada alrededor de las herramientas web y el contexto del usuario.

Funciones de memoria, privacidad y extracción de datos

  • Varios usuarios desactivan la memoria global; les parece más perjudicial que útil, porque provoca asociaciones irrelevantes y respuestas degradadas.
  • Hay una fuerte preocupación de que las memorias, junto con los agentes, creen perfiles de usuario extremadamente ricos, más detallados de lo que nunca tuvieron los anunciantes.
  • Algunos abogan por regularlo: prohibir el almacenamiento remoto de perfiles de usuario, exigir que las memorias vivan en infraestructura controlada por el usuario y separar las “empresas de memoria” de las “empresas de modelos”.
  • Otros simplemente aconsejan higiene práctica: apagar la memoria, usar nombres y fechas de nacimiento falsos, mantener cuentas separadas para uso personal y de trabajo.

Cloudflare, robots.txt y rastreadores de IA

  • Discusión sobre el robots.txt administrado de Cloudflare: algunos agradecen el bloqueo predeterminado de rastreadores de IA; otros objetan los cambios no explícitos en el comportamiento del sitio.
  • Debate sobre si bloquear scrapers debería ser opt-in u opt-out, y cuánta control deberían tener los intermediarios sobre los datos de los editores.

Mitigaciones e ideas arquitectónicas

  • Las mitigaciones sugeridas incluyen:
    • Ejecutar agentes en VMs muy restringidas, sin credenciales reales, con reinicios frecuentes y montajes de archivos explícitos.
    • Limitar el acceso a la red y los permisos de herramientas, y tratar la “minimización de contexto” como una frontera de seguridad (dar a los agentes solo el estado mínimo necesario).
    • Usar subagentes sin PII para tareas riesgosas como el rastreo web, aunque algunos señalan que componer agentes de forma segura ya es no trivial.