Queimei todos os meus tokens pesquisando como economizar tokens
Os esforços para reduzir os custos de grandes modelos de linguagem (LLMs) estão revelando uma troca incômoda: muitas técnicas para “economizar tokens” acrescentam complexidade, quebram o cache de contexto ou apenas deslocam o desperdício em vez de eliminá-lo. Os comentaristas comparam estratégias como pipelines com múltiplos modelos, prompts fixos versus dinâmicos e implantações locais versus na nuvem, com alguns argumentando que as APIs em nuvem continuam mais baratas e mais capazes do que a maioria das soluções on-premises, exceto quando privacidade ou escala justificam investimento em hardware. Por trás dos detalhes técnicos, há uma tensão mais ampla sobre se código e produtos assistidos por LLM são realmente valiosos ou apenas “slop” impraticável, e como medir ganhos reais de produtividade além de relatos anedóticos.
Estratégias para economizar tokens e fluxos de pesquisa
- Muitos descrevem experiências semelhantes às do artigo: os LLMs não são “ignorantes”, mas carecem de disciplina, gastando tokens em becos sem saída repetidos. O objetivo passa a ser reduzir becos sem saída repetidos, não a exploração em si.
- Pipeline sugerido: começar com modelos mais baratos/menores para geração de hipóteses e exploração ampla, depois passar os resultados destilados para modelos mais fortes. Hipóteses paralelas de baixo custo podem superar uma única chamada cara.
- Preços em lote e trabalhos “overnight” são propostos para reduzir custos quando a latência é aceitável.
- Alguns sugerem misturar modelos de múltiplos fornecedores nas etapas iniciais para obter diversidade.
Contexto, cache e design de prompt
- Vários relatam que truques engenhosos para economizar tokens muitas vezes quebram o cache de prefixo de contexto, tornando tudo mais caro no geral.
- Prefixos fixos, um pouco maiores, mais sumarizações ocasionais podem superar esquemas dinâmicos de recuperação e poda.
- Deixar o modelo gerenciar a compactação (por exemplo, via integrações com editores) funciona surpreendentemente bem para alguns; muitas vezes basta permitir que o contexto se preencha e depois resumir.
- Roteamento adaptativo de modelos por dificuldade é discutido; os problemas incluem reproduzir históricos inteiros ao trocar de modelo e a incompatibilidade de caches de atenção entre modelos.
Modelos locais vs nuvem e economia
- Há uma visão forte de que, para a maioria das pessoas, modelos na nuvem são mais baratos e melhores do que os locais, a menos que você já tenha hardware substancial ou necessidades rígidas de privacidade.
- Outros argumentam que modelos locais fazem sentido para organizações com muitos usuários intensivos ou computação existente, ou como proteção contra dependência de fornecedor e mudanças de restrições.
- Um padrão “90% local / 10% frontier” é proposto, mas identificar quando mudar é visto como algo não trivial.
Ferramentas, agentes e como evitar trabalho repetido
- Diversas ferramentas são mencionadas: MCPs de memória/cache, arquivos de skills e fluxos de trabalho que atualizam periodicamente “rules/skills” com base em conversas passadas para impedir que os mesmos passos sejam refeitos.
- Surge a preocupação de que muitos agentes e produtos continuam resolvendo os mesmos problemas; propõem-se bases de conhecimento compartilhadas para agentes convergirem em soluções reutilizáveis.
Entrega, “slop” e valor no mundo real
- Debate acalorado sobre se projetos assistidos por IA são realmente úteis ou apenas “slop”.
- Alguns relatam entregar ferramentas internas, migrações, jogos e hardware mais rapidamente com LLMs.
- Outros questionam o valor de entregar coisas que os próprios usuários agora poderiam construir e criticam projetos de IA com documentação escrita por bots.
- As definições de “entregue” (usuários pagantes vs ferramentas pessoais vs OSS) são contestadas.
Alucinações e confiabilidade
- Há ceticismo de que alucinações possam ser eliminadas por regras ou pipelines; elas são vistas como intrínsecas aos modelos atuais.
- Afirmações de “sem alucinações” são contestadas como exageradas.