Os classificadores que a Anthropic coloca na frente do Fable são excessivamente zelosos
O novo modelo Fable da Anthropic é amplamente elogiado como um avanço em capacidade em relação ao seu predecessor, mas muitos usuários relatam que ele fica incapacitado por classificadores de segurança hiperagressivos que rebaixam ou recusam prompts relacionados a biologia, cibersegurança, ferramentas de ML ou até consultas médicas e matemáticas inocentes. Comentaristas argumentam que esse “teatro de segurança” torna o sistema inutilizável para áreas inteiras, como bioinformática e pesquisa em segurança, levanta preocupações sobre retenção de dados e marcações indevidas, e mostra como modelos proprietários de “fronteira”, rigidamente controlados, podem se tornar abruptamente pouco confiáveis para trabalho sério. Outros contra-argumentam que guardrails excessivamente cautelosos são uma resposta previsível à pressão regulatória e a bans de exportação, mas alertam que, se esse padrão continuar, usuários avançados migrarão cada vez mais para modelos menos restritos ou abertos.
Escopo e Comportamento dos Classificadores do Fable
- Muitos comentaristas relatam que o classificador de segurança do Fable é “sensível demais”, especialmente para biologia, cibersegurança, pesquisa em ML, infraestrutura e autenticação.
- Filtragem biológica extremamente ampla: até prompts sobre células, digestão, frequência cardíaca ao correr, CO₂ em ambientes internos, abstinência de nicotina, curiosidades de zoologia, “planta”, perguntas inocentes sobre enguias e tópicos médicos básicos são rebaixados.
- Ferramentas de cibersegurança e ML também acionam recusas: e-mails de pentest, revisões OWASP, auditorias de segurança, código de SDN/autenticação, mudanças em GPU/vLLM, pipelines de ML, código de libtorch/OpenCL e até bibliotecas ou nomes de variáveis que contenham “bio” ou “DNA”.
- Algumas perguntas puramente matemáticas ou de teoria da computação são bloqueadas, aparentemente porque o modelo as mapeia internamente para contextos de bio/filogenética (“complexity safety”).
Experiência do Usuário e Casos de Uso
- Usuários de bioinformática, biologia, medicina, neuroimagem e física médica dizem que o Fable é, na prática, inutilizável para seu trabalho profissional, às vezes até para atualizar um currículo.
- Outros relatam nenhuma recusa para arquitetura de software em larga escala, depuração e programação geral, sugerindo domínios diferentes ou pontuações/históricos de segurança distintos.
- Alguns acham o Fable excelente para matemática, revisão de nível de pesquisa, conselhos de vida e verificações de “passagem final”, superando claramente o Opus 4.8 quando consegue rodar.
- Vários observam consumo severo de tokens e tempo; um único prompt pode esgotar limites diários ou horários sem gerar valor proporcional.
Rebaixamentos, “Jail” da Conta e Opus
- Quando acionado, o Fable faz downgrade transparente para o Opus 4.8 com um banner visível; alguns temem que também existam rebaixamentos silenciosos (isso não ficou claro no tópico).
- Alguns especulam que tentativas repetidas de “sanitizar” prompts podem colocar contas em um estado de “jail” mais sensível, no qual o classificador dispara ainda mais facilmente.
- As experiências variam muito: para alguns, apenas ~15% das tarefas acionam o filtro; para outros, 80–90% dos prompts de revisão de código ou relacionados a ML fazem isso.
Motivações, Alinhamento e Assimetria de Poder
- As causas propostas incluem pressão do governo dos EUA/controles de exportação, uma cultura de segurança “longtermist” excessivamente cautelosa e medo de bioterrorismo; outros veem “teatro de segurança” e narrativas de desastre impulsionadas por PR.
- Alguns acham que o Fable é um campo de testes para guardrails que mais tarde ficarão na frente de outros modelos; outros especulam sobre versões restritas de alta capacidade para фарма ou “parceiros confiáveis”.
- Discussão mais ampla: dificuldade de alinhamento com morais humanas inconsistentes; analogia com armas de fogo/segredos de Estado, em que civis recebem ferramentas “nerfadas” enquanto os Estados mantêm o poder total.
- Preocupação de que futuros modelos SOTA sejam rigidamente controlados por governos e por algumas corporações, aumentando a assimetria de poder; contraponto de que incentivos de lucro e modelos concorrentes (incluindo estrangeiros e abertos) limitarão isso.
Privacidade, Retenção e Risco de Negócio
- Política destacada: o conteúdo de sessões sinalizadas pode ser retido por até 2 anos e as pontuações de segurança por até 7 anos; falsos positivos do classificador, portanto, ampliam a retenção de dados no longo prazo.
- Dados sinalizados podem ser usados para treinar sistemas de segurança mesmo quando se aplicam as opções normais de exclusão do treinamento, o que preocupa usuários que fazem trabalho “sensível, mas legítimo”.
- Alguns concluem que depender de IA proprietária e controlada centralmente é arriscado porque capacidades e acesso podem mudar subitamente; outros respondem que todos os modelos de ponta hoje são proprietários, embora já existam alternativas abertas fortes.