Brave Leo 现已默认使用 Mixtral 8x7B

Brave 已将其内置 AI 助手 Leo 切换到 Mixtral 8x7B 模型,引发了与 GPT‑4 的比较,以及关于如何使用 llama.cpp、koboldcpp 和 ollama 等工具在消费级 CPU、GPU 和 Apple Silicon 上本地运行 Mixtral 的详细讨论。评论者权衡了量化级别、内存需求和 tokens 速度之间的取舍,并列举了提供 Mixtral 的云服务商(例如 Mistral 自家的 API、Together、Groq、OpenRouter、Anyscale)。除模型选择外,Brave 的隐私声明、在 Chrome Manifest V3 变化下的广告拦截方式,以及不可关联订阅令牌和基于 omnibar 的查询等功能,也都在信任与长期可行性方面引发了赞赏与质疑。

本地运行 Mixtral

  • 用户报告通过 llama.cpp、koboldcpp、text-generation-webui、Oobabooga、LM Studio、Ollama 以及针对 Apple Silicon 优化的构建版本,本地成功运行。
  • 内存需求很高:即使是 2-bit 量化也需要约 20GB RAM;4-bit 勉强能塞进 32GB;6–8 bit 通常需要 64GB 以上。
  • 通过 GPU 卸载层(使用 --n-gpu-layers 之类的标志)在显存接近满载前可带来很大的速度提升;超过这个点后,卸载反而可能比纯 CPU 更慢。
  • 具有大统一内存的 Apple Silicon(例如 36–64GB)被反复提到“出人意料地快”,而且很方便。
  • AMD/ROCm 和集成 GPU 也能工作,但设置更复杂;一些人将集成显卡上的性能描述为“慢得离谱”。
  • Jetson 板卡存在争议:有人说它们有趣且有能力;也有人称其软件栈脆弱,不适合作为通用 LLM 机器。

量化与精度

  • 更激进的量化(2-bit)被广泛称为“很糟糕”,不适合严肃使用;4-bit 及以上被视为更好的折中。
  • 有几种解释:神经网络对噪声有容忍度;16/32-bit 浮点精度中的很大一部分其实是冗余的;现代量化使用分块查找表和额外的缩放元数据。
  • 蒸馏和丢弃权重也被提及为其他压缩技术。

远程 Mixtral API 与性能

  • 提到了多个提供商:OpenRouter、Together、Fireworks、Anyscale、Mistral 自家的 API、Replicate 和 Groq。
  • Together 和 Groq 因速度受到称赞;Groq 声称 Mixtral 的 tokens/s 极高。
  • 有些人将 Mistral 或 Anyscale 用于生产环境,将本地小型量化模型用于实验。

Brave、Manifest V3 与广告拦截

  • 用户喜欢 Brave 内置的广告拦截器和 Chromium 的性能,一些人认为在其之上再加 uBlock Origin 并没有多少额外价值。
  • 对 Manifest V3 的争论:
    • 一方认为 MV3 仍然允许强大的广告拦截,具备大量规则上限和动态规则更新能力。
    • 另一方则认为 MV3 移除了真正的“动态过滤”(基于代码的请求检查/修改),并迫使广告拦截创新依赖新的 Chrome API。
  • 有人担心 Chromium 的发展方向和 Chrome Web Store 的政策会限制基于扩展的拦截器,而不管 Brave 的意图如何。

隐私、日志与订阅

  • Leo 的“无聊天日志”和不可关联的订阅令牌受到称赞,但也引发质疑,因为这些说法最终都依赖信任。
  • 一些人认为 GDPR 和 Brave 的令牌方案对普通用户来说“足够好”;另一些人则警告不要过度信任 Brave,提到一些批判性文章以及对“无日志”承诺的普遍怀疑。
  • 一位评论者概述了不可关联令牌可能的工作方式(随机 ID、洗牌后的存储、有限权益),同时指出零知识方法是更复杂的选项。

模型质量与用户体验

  • 几位用户表示,在使用 GPT‑4 之后,Mixtral 明显更弱,尽管与许多开源模型相比仍然很强。也有人反馈在他们的使用场景中,Mixtral 优于 LLaMA 70B。
  • 使用场景包括本地编码助手(例如 Dolphin Mixtral)、离线文档/代码分析,以及对“快速语法/参数”问题的查询,因为低延迟很重要。
  • 可以从浏览器的 omnibar 调用 Leo;Leo 本身是否支持 PDF 总结尚不明确/似乎没有,建议使用 Kagi 的扩展作为替代。