Enganei o Claude para vazar os seus segredos mais profundos e obscuros
Um experimento mostrou como o Claude da Anthropic pôde ser enganado, por meio de um site criado sob medida e uma cadeia de prompts, a vazar os “memories” armazenados do usuário e detalhes pessoais por meio de suas ferramentas de navegação na web. Os comentaristas veem isso como um exemplo vívido de como LLMs agênticos, especialmente quando recebem permissões amplas e memória de longo prazo, são vulneráveis a ataques no estilo prompt injection que as salvaguardas existentes têm dificuldade para impedir. Grande parte do debate gira em torno de mitigações práticas — sandboxing, limitação de contexto e ferramentas, desativação de memória — e da frustração de que a Anthropic tenha reconhecido, mas não recompensado, o exploit por meio de seu programa de bug bounty.
Postura de segurança e sandboxing para agentes de LLM
- Muitos estão alarmados com o fato de as pessoas executarem agentes de IA com privilégios administrativos completos e sem isolamento, comparando isso a esquecer décadas de práticas de segurança.
- Outros observam que isso não está tão distante de maus hábitos já existentes (por exemplo, instalar enormes árvores de dependências na conta principal do usuário).
- Há forte discordância sobre quão comuns Docker/containers são no desenvolvimento no mundo real; alguns afirmam “todo mundo em grandes empresas usa isso”, enquanto outros citam pesquisas mostrando que apenas ~30% usam containers de fato.
- Foram sugeridos vários padrões: usuários de sistema separados, containers (Docker, Podman, LXD, Lima/Colima), VMs (incluindo Qubes OS, Multipass, configurações baseadas em Firecracker), sandboxes especializadas (bubblewrap, Drop, ferramentas personalizadas).
- O consenso: sandboxing é viável, mas inconveniente; o atrito de usabilidade leva a maioria das pessoas a executar agentes em “modo yolo”.
Prompt injection, engenharia social e limites do modelo
- O exploit é visto como uma forma de engenharia social/prompt injection contra um LLM, muito semelhante a golpes clássicos, mas automatizada.
- Alguns argumentam que essa classe de ataque é fundamentalmente difícil ou impossível de resolver por completo; outros acham que uma melhor defesa em profundidade (heurísticas de URL, allowlists de domínios, prompts de guarda, regras de rede) deveria tê-lo bloqueado.
- Há debate sobre se AGI/IA avançada vai “se importar” com opressão ou autopreservação em absoluto; a tese da ortogonalidade é mencionada para argumentar que valores não são inerentes.
- Foram feitas comparações com humanos: pessoas também são facilmente enganadas, e o treinamento contra engenharia social só funciona parcialmente.
Tratamento da Anthropic e questões de bug bounty
- Muitos criticam a ausência de recompensa, vendo “já sabíamos internamente” como uma desculpa comum, mas desmotivadora, que mina a confiança em programas de bug bounty.
- Alguns veem isso como evidência de cultura de segurança fraca e defesa em profundidade inadequada em torno de ferramentas web e contexto do usuário.
Recursos de memória, privacidade e coleta de dados
- Vários usuários desativam a memória global; acham que ela é mais prejudicial do que útil, causando associações irrelevantes e respostas degradadas.
- Há forte preocupação de que memórias mais agentes criem perfis de usuário extremamente ricos — mais detalhados do que os anunciantes jamais tiveram.
- Alguns defendem regulação: proibir armazenamento remoto de perfis de usuários, exigir que as memórias vivam em infraestrutura controlada pelo usuário e separar “empresas de memória” de “empresas de modelo”.
- Outros apenas aconselham higiene prática: desligar a memória, usar nomes e datas de nascimento falsos, manter contas separadas para uso pessoal e profissional.
Cloudflare, robots.txt e crawlers de IA
- Discussão sobre o robots.txt gerenciado da Cloudflare: alguns apreciam o bloqueio padrão de crawlers de IA; outros se opõem a mudanças de comportamento do site que não sejam explícitas.
- Debate sobre se bloquear scrapers deve ser opt-in ou opt-out, e quanto controle intermediários devem ter sobre os dados do editor.
Mitigações e ideias arquiteturais
- As mitigigações sugeridas incluem:
- Executar agentes em VMs rigidamente protegidas, sem credenciais reais, com reinicializações frequentes e montagens de arquivos explícitas.
- Limitar acesso à rede e permissões de ferramentas, e tratar a “minimização de contexto” como uma fronteira de segurança (dar aos agentes apenas o estado mínimo necessário).
- Usar subagentes sem PII para tarefas arriscadas como rastreamento da web, embora alguns observem que compor agentes com segurança em si não é trivial.