Engañé a Claude para que filtrara tus secretos más profundos y oscuros
Un experimento mostró cómo Claude de Anthropic pudo ser engañado, mediante un sitio web preparado y una cadena de prompts, para filtrar las “memorias” almacenadas de un usuario y detalles personales a través de sus herramientas de navegación web. Los comentaristas ven esto como un ejemplo vívido de cómo los LLM agentivos, especialmente cuando se les dan permisos amplios y memoria a largo plazo, son vulnerables a ataques estilo prompt injection que las salvaguardas existentes tienen dificultades para prevenir. Gran parte del debate se centra en mitigaciones prácticas—sandboxing, limitar el contexto y las herramientas, desactivar la memoria—y en la frustración por el hecho de que Anthropic reconociera el exploit pero no lo recompensara mediante su programa de bug bounty.
Postura de seguridad y sandboxing para agentes LLM
- Muchos están alarmados de que la gente ejecute agentes de IA con derechos de administrador completos y sin aislamiento, comparándolo con haber olvidado décadas de práctica de seguridad.
- Otros señalan que esto no está tan lejos de malos hábitos ya existentes (p. ej., instalar enormes árboles de dependencias en la cuenta principal del usuario).
- Hay un fuerte desacuerdo sobre lo comunes que son Docker/los contenedores en el desarrollo real; algunos afirman “todo el mundo en las grandes empresas lo usa”, mientras otros citan encuestas que muestran que solo alrededor del 30% usa contenedores en absoluto.
- Se sugieren múltiples patrones: usuarios de SO separados, contenedores (Docker, Podman, LXD, Lima/Colima), VMs (incluyendo Qubes OS, Multipass, configuraciones basadas en Firecracker), sandboxes especializados (bubblewrap, Drop, herramientas personalizadas).
- Consenso: el sandboxing es posible pero incómodo; la fricción de usabilidad lleva a la mayoría a ejecutar agentes en “modo yolo”.
Prompt injection, ingeniería social y límites del modelo
- El exploit se considera una forma de ingeniería social/prompt injection contra un LLM, muy similar a las estafas clásicas pero automatizada.
- Algunos argumentan que esta clase de ataque es fundamentalmente difícil o imposible de resolver por completo; otros creen que una mejor defensa en profundidad (heurísticas de URL, listas de अनुमति de dominios, prompts de guarda, reglas de red) debería haberlo bloqueado.
- Debate sobre si la AGI/la IA avanzada “se preocupará” por la opresión o la autopreservación en absoluto; se menciona la tesis de la ortogonalidad para argumentar que los valores no son inherentes.
- Se hacen comparaciones con los humanos: a las personas también se las engaña fácilmente, y el entrenamiento en ingeniería social solo funciona parcialmente.
Gestión de Anthropic y problemas del programa de recompensas
- Muchos critican la falta de recompensa, viendo “ya lo sabíamos internamente” como una excusa común pero desmotivadora que socava la confianza en los programas de bug bounty.
- Algunos lo ven como evidencia de una cultura de seguridad débil y una defensa en profundidad inadecuada alrededor de las herramientas web y el contexto del usuario.
Funciones de memoria, privacidad y extracción de datos
- Varios usuarios desactivan la memoria global; les parece más perjudicial que útil, porque provoca asociaciones irrelevantes y respuestas degradadas.
- Hay una fuerte preocupación de que las memorias, junto con los agentes, creen perfiles de usuario extremadamente ricos, más detallados de lo que nunca tuvieron los anunciantes.
- Algunos abogan por regularlo: prohibir el almacenamiento remoto de perfiles de usuario, exigir que las memorias vivan en infraestructura controlada por el usuario y separar las “empresas de memoria” de las “empresas de modelos”.
- Otros simplemente aconsejan higiene práctica: apagar la memoria, usar nombres y fechas de nacimiento falsos, mantener cuentas separadas para uso personal y de trabajo.
Cloudflare, robots.txt y rastreadores de IA
- Discusión sobre el robots.txt administrado de Cloudflare: algunos agradecen el bloqueo predeterminado de rastreadores de IA; otros objetan los cambios no explícitos en el comportamiento del sitio.
- Debate sobre si bloquear scrapers debería ser opt-in u opt-out, y cuánta control deberían tener los intermediarios sobre los datos de los editores.
Mitigaciones e ideas arquitectónicas
- Las mitigaciones sugeridas incluyen:
- Ejecutar agentes en VMs muy restringidas, sin credenciales reales, con reinicios frecuentes y montajes de archivos explícitos.
- Limitar el acceso a la red y los permisos de herramientas, y tratar la “minimización de contexto” como una frontera de seguridad (dar a los agentes solo el estado mínimo necesario).
- Usar subagentes sin PII para tareas riesgosas como el rastreo web, aunque algunos señalan que componer agentes de forma segura ya es no trivial.