Grok 4.6 在 Artificial Analysis Intelligence Index 上得分 61

Grok 4.6 是 xAI 的最新大语言模型,因其在编码和推理上接近前沿水平,但相比许多 Anthropic 和 OpenAI 方案拥有更低的 token 成本和更高的使用限额而受到关注,尤其是在通过 Cursor 这类工具捆绑使用时。评论者一方面看重它的优势——速度、简洁的沟通风格和慷慨的补贴访问;另一方面也指出它在复杂任务上仍落后于 Anthropic Fable 5 和 GPT‑5.6 等顶级模型,并进一步讨论 Musk 的政治立场、激进的数据中心扩张、碳排放影响,以及在强势开源权重替代方案不断施压的市场中,第三或第四个封闭前沿模型是否还能维持可行的生态位。

模型质量与基准测试

  • 很多人认为 Grok 4.5 算是“尚可的前沿模型”,但仍低于 Fable/Opus 5/Sol/GPT‑5.6 这类顶级模型;一些人推测 4.6 实际表现大约接近 Opus 4.8,但仍不及最新的 Anthropic/OpenAI 档位。
  • 一些日常用户表示 Grok 4.5/4.6 速度快、简洁,而且对工程任务来说“已经够用”;他们看重更短的回答和更简单、更像人的代码。
  • 也有人说它的速度在某种程度上只是错觉:它经常只处理任务的一小部分就过早宣称完成,而且输出质量弱于 Anthropic/OpenAI。
  • 与 Kimi K3 相比,Grok 通常被描述为更好也更便宜;在某些编码任务上比 Gemini 更强,但整体并非同类最强。
  • 4.6 被认为比 4.5 更偏向工具使用/验证(例如对 UI 截图),但也不再像以前那样“飞快”。

定价、token 效率与订阅

  • Grok 一再被描述为非常划算,尤其是通过 Cursor 和 xAI 订阅。有些人觉得一个 $30 的订阅替代了其他地方成百上千美元的按 token 支出。
  • 线程中引用的基准测试声称 Grok 的 token 使用量与近期 OpenAI 模型相当,且单 token 成本更低;也有人反驳说 GPT 仍然是推理效率最高的。
  • Grok 4.5 标价为输入 $2 / 输出 $6,而 Opus 4.8 为 $5 / $25。4.6 的 cache read 价格据说从 $0.30 涨到 $0.50,用户表示这会严重影响 agentic coding 成本。
  • Cursor:提供慷慨的 Grok/Composer 使用额度,再加上大约 $20 的非第一方 credits;有人称这是用 Grok 做编码最便宜的方式。
  • OpenAI 订阅的“重置”行为让试图控制预算的人很恼火;一些人则会转而追逐当前补贴力度最大的前沿模型。

使用模式与工作流

  • 与“没人用 Grok”的说法相反,多位评论者把它当作主力编码模型,或作为多模型工作流的一部分(例如用 Fable 做规划,用 Grok 做快速迭代/调试)。
  • 它被用于 Cursor、Grok CLI/Build、Copilot(历史上)以及自定义 harness(如 OpenCode、Pi coding agent),这些系统会把任务路由到不同模型。
  • 一些团队表示整体 AI 支出实际上几乎没有上限,但仍会选择 Grok,因为它的风格和速度,而不只是价格。
  • 在安全工作中,用户说 Grok 和一些中文模型会做漏洞分析和 PoC,而 Anthropic/OpenAI 会阻止或大幅净化这类内容。

伦理、政治与抵制

  • 相当一部分人拒绝使用 Grok/xAI,理由包括:
    • 其所有者据称的纳粹式敬礼、干预选举、在多个国家支持极右翼、在外国援助和乌克兰问题上的行为,以及整体治理风格。
    • 担心 Grok 的 system prompt 和政治倾向会直接受这些观点影响。
  • 另一些人认为几乎所有有钱人都会“干预”选举;如果自己也使用中国或其他有争议的供应商,那么抵制就不一致;还有人把产品质量和所有者政治分开看待。
  • 有些人偏好 Grok,因为他们认为 OpenAI/Anthropic 偏进步,并声称 Grok 更接近“中间派”,而另一些人则质疑“中间派”到底意味着什么。

商业策略、算力与竞争

  • 讨论中提出 xAI/SpaceX 即使面对强势 incumbents 仍重金投入 Grok 的原因:
    • 通过向其他实验室出租多余 GPU 容量来变现,同时持续扩大需求。
    • 用于内部垂直整合(例如 Tesla、机器人、跨行星目标),避免依赖 OpenAI/Anthropic。
    • 下注于他们凭借大量算力、资本和训练数据(包括 Cursor 的数据集)能够达到或超越前沿水平。
    • 哲学动机,以及希望拥有一个政治取向不同的模型家族。
  • 怀疑者质疑商业逻辑:消费和企业市场已经被占据,开源权重模型正在挤压低端市场,而且最终很可能走向整合。有些人把这称为 FOMO 或由投资者驱动的泡沫行为。
  • 关于基础设施的争论:
    • xAI/SpaceX 因拥有数据中心并计划自研芯片而受到称赞,这可能带来更便宜的 token。
    • 也有人怀疑芯片工厂时间表(尤其是 EUV/FEL 路线),注意到监管捷径(例如燃气轮机数据中心),并质疑自报指标的可靠性。

环境与附带说明

  • 一张被引用的图表(来自 Stanford HAI,经媒体报道)将 Grok 训练描述为尤其高耗 CO₂,因为使用了便携式燃气发电机;据称其效率低于其他大型部署;有人总体上认为 AI 碳排放争论被夸大了,但 Grok 的情况确实如此。
  • Grok 的 Imagine 2.0 图像/视频生成被描述为质量较低,而且“塑料感”很强。
  • 一些用户称赞 Grok 的沟通风格胜过 ChatGPT 的冗长和 Claude 的修辞习气,并看重在 Anthropic、OpenAI 和 Gemini 之外拥有一个不同的“模型家族”用于创意任务。