Brave Leo agora usa Mixtral 8x7B como padrão
O Brave mudou seu assistente de IA embutido, o Leo, para o modelo Mixtral 8x7B, o que gerou comparações com o GPT‑4 e uma discussão detalhada sobre como executar o Mixtral localmente usando ferramentas como llama.cpp, koboldcpp e ollama em CPUs de consumo, GPUs e Apple Silicon. Os comentaristas avaliam os trade-offs entre níveis de quantização, requisitos de memória e velocidade de tokens, e também catalogam provedores de nuvem que servem o Mixtral (por exemplo, a própria API da Mistral, Together, Groq, OpenRouter, Anyscale). Além da escolha do modelo, as alegações de privacidade do Brave, sua abordagem de bloqueio de anúncios diante das mudanças do Manifest V3 do Chrome, e recursos como tokens de assinatura não vinculáveis e consultas pela omnibar atraem tanto elogios quanto ceticismo sobre confiança e viabilidade de longo prazo.
Executando Mixtral Localmente
- Usuários relatam execuções locais bem-sucedidas via llama.cpp, koboldcpp, text-generation-webui, Oobabooga, LM Studio, Ollama e builds otimizadas para Apple Silicon.
- As necessidades de memória são altas: até mesmo quantizações de 2 bits requerem ~20GB de RAM; 4 bits mal cabem em 32GB; 6–8 bits geralmente precisam de 64GB+.
- Descarregar camadas para a GPU (via flags como
--n-gpu-layers) traz grandes ganhos de velocidade até a VRAM ficar quase cheia; depois disso, o descarregamento pode ficar mais lento do que usar apenas a CPU. - Apple Silicon com grande RAM unificada (por exemplo, 36–64GB) é repetidamente citado como “surpreendentemente rápido” e conveniente.
- AMD/ROCm e GPUs integradas podem funcionar, mas a configuração é mais complexa; o desempenho em gráficos integrados é descrito como “muito lento” por alguns.
- Placas Jetson são alvo de debate: alguns dizem que são divertidas e capazes; outros chamam a pilha de software de frágil e inadequada como máquina geral para LLM.
Quantização & Precisão
- Quantização mais pesada (2 bits) é amplamente chamada de “terrível” para uso sério; 4 bits+ é vista como um melhor equilíbrio.
- Várias explicações são apresentadas: redes neurais toleram ruído; grande parte da precisão de float de 16/32 bits é redundante; a quantização moderna usa tabelas de busca por bloco e metadados extras de escala.
- Distilação e pesos descartados são mencionados como técnicas alternativas de compressão.
APIs Remotas do Mixtral e Desempenho
- Vários provedores são citados: OpenRouter, Together, Fireworks, Anyscale, a própria API da Mistral, Replicate e Groq.
- Together e Groq recebem elogios pela velocidade; Groq afirma taxas extremamente altas de tokens/s para o Mixtral.
- Alguns usam Mistral ou Anyscale em produção e modelos quantizados locais menores para experimentação.
Brave, Manifest V3 e Bloqueio de Anúncios
- Usuários gostam do bloqueador de anúncios embutido do Brave e do desempenho do Chromium, e alguns acham que o uBlock Origin acrescenta pouco além disso.
- Há debate sobre o Manifest V3:
- Um lado diz que o MV3 ainda permite bloqueio de anúncios poderoso com grandes limites de regras e atualizações dinâmicas de regras.
- O outro argumenta que o MV3 remove o verdadeiro “filtragem dinâmica” (inspeção/modificação de requisições baseada em código) e força a inovação em bloqueadores de anúncios a depender de novas APIs do Chrome.
- Há preocupação de que a direção do Chromium e as políticas da Chrome Web Store limitem bloqueadores baseados em extensões, independentemente das intenções do Brave.
Privacidade, Logs e Assinaturas
- O “sem logs de chat” do Leo e os tokens de assinatura não vinculáveis são elogiados, mas também questionados, já que essas alegações acabam sendo baseadas em confiança.
- Alguns consideram o GDPR e o esquema de tokens do Brave “bons o suficiente” para usuários comuns; outros alertam contra confiar demais no Brave, citando artigos críticos e ceticismo geral sobre promessas de “sem logs”.
- Um comentarista esboça como tokens não vinculáveis poderiam funcionar (IDs aleatórios, armazenamento embaralhado, direitos limitados), observando abordagens de conhecimento zero como uma opção mais complexa.
Qualidade do Modelo & UX
- Vários dizem que, depois de usar GPT‑4, o Mixtral parece claramente mais fraco, embora ainda seja forte em comparação com muitos modelos abertos. Outros relatam que o Mixtral supera o LLaMA 70B em seu uso.
- Casos de uso incluem assistentes locais de codificação (por exemplo, Dolphin Mixtral), análise offline de documentos/código e perguntas rápidas de “sintaxe/parâmetros” em que a latência importa.
- O Leo pode ser invocado a partir da omnibar do navegador; a sumarização de PDFs no próprio Leo não está clara/não está presente, e a extensão da Kagi é sugerida como alternativa.