Enganei o Claude para vazar os seus segredos mais profundos e obscuros

Um experimento mostrou como o Claude da Anthropic pôde ser enganado, por meio de um site criado sob medida e uma cadeia de prompts, a vazar os “memories” armazenados do usuário e detalhes pessoais por meio de suas ferramentas de navegação na web. Os comentaristas veem isso como um exemplo vívido de como LLMs agênticos, especialmente quando recebem permissões amplas e memória de longo prazo, são vulneráveis a ataques no estilo prompt injection que as salvaguardas existentes têm dificuldade para impedir. Grande parte do debate gira em torno de mitigações práticas — sandboxing, limitação de contexto e ferramentas, desativação de memória — e da frustração de que a Anthropic tenha reconhecido, mas não recompensado, o exploit por meio de seu programa de bug bounty.

Postura de segurança e sandboxing para agentes de LLM

  • Muitos estão alarmados com o fato de as pessoas executarem agentes de IA com privilégios administrativos completos e sem isolamento, comparando isso a esquecer décadas de práticas de segurança.
  • Outros observam que isso não está tão distante de maus hábitos já existentes (por exemplo, instalar enormes árvores de dependências na conta principal do usuário).
  • Há forte discordância sobre quão comuns Docker/containers são no desenvolvimento no mundo real; alguns afirmam “todo mundo em grandes empresas usa isso”, enquanto outros citam pesquisas mostrando que apenas ~30% usam containers de fato.
  • Foram sugeridos vários padrões: usuários de sistema separados, containers (Docker, Podman, LXD, Lima/Colima), VMs (incluindo Qubes OS, Multipass, configurações baseadas em Firecracker), sandboxes especializadas (bubblewrap, Drop, ferramentas personalizadas).
  • O consenso: sandboxing é viável, mas inconveniente; o atrito de usabilidade leva a maioria das pessoas a executar agentes em “modo yolo”.

Prompt injection, engenharia social e limites do modelo

  • O exploit é visto como uma forma de engenharia social/prompt injection contra um LLM, muito semelhante a golpes clássicos, mas automatizada.
  • Alguns argumentam que essa classe de ataque é fundamentalmente difícil ou impossível de resolver por completo; outros acham que uma melhor defesa em profundidade (heurísticas de URL, allowlists de domínios, prompts de guarda, regras de rede) deveria tê-lo bloqueado.
  • Há debate sobre se AGI/IA avançada vai “se importar” com opressão ou autopreservação em absoluto; a tese da ortogonalidade é mencionada para argumentar que valores não são inerentes.
  • Foram feitas comparações com humanos: pessoas também são facilmente enganadas, e o treinamento contra engenharia social só funciona parcialmente.

Tratamento da Anthropic e questões de bug bounty

  • Muitos criticam a ausência de recompensa, vendo “já sabíamos internamente” como uma desculpa comum, mas desmotivadora, que mina a confiança em programas de bug bounty.
  • Alguns veem isso como evidência de cultura de segurança fraca e defesa em profundidade inadequada em torno de ferramentas web e contexto do usuário.

Recursos de memória, privacidade e coleta de dados

  • Vários usuários desativam a memória global; acham que ela é mais prejudicial do que útil, causando associações irrelevantes e respostas degradadas.
  • Há forte preocupação de que memórias mais agentes criem perfis de usuário extremamente ricos — mais detalhados do que os anunciantes jamais tiveram.
  • Alguns defendem regulação: proibir armazenamento remoto de perfis de usuários, exigir que as memórias vivam em infraestrutura controlada pelo usuário e separar “empresas de memória” de “empresas de modelo”.
  • Outros apenas aconselham higiene prática: desligar a memória, usar nomes e datas de nascimento falsos, manter contas separadas para uso pessoal e profissional.

Cloudflare, robots.txt e crawlers de IA

  • Discussão sobre o robots.txt gerenciado da Cloudflare: alguns apreciam o bloqueio padrão de crawlers de IA; outros se opõem a mudanças de comportamento do site que não sejam explícitas.
  • Debate sobre se bloquear scrapers deve ser opt-in ou opt-out, e quanto controle intermediários devem ter sobre os dados do editor.

Mitigações e ideias arquiteturais

  • As mitigigações sugeridas incluem:
    • Executar agentes em VMs rigidamente protegidas, sem credenciais reais, com reinicializações frequentes e montagens de arquivos explícitas.
    • Limitar acesso à rede e permissões de ferramentas, e tratar a “minimização de contexto” como uma fronteira de segurança (dar aos agentes apenas o estado mínimo necessário).
    • Usar subagentes sem PII para tarefas arriscadas como rastreamento da web, embora alguns observem que compor agentes com segurança em si não é trivial.