Grok 4.6

Grok 4.6 是 xAI 最新的大语言模型,被定位为接近最先进水平、可与 Anthropic 的 Fable 和 OpenAI 的 GPT‑5.6 竞争。用户称赞它速度快、风格简洁、性价比高,尤其适合编码和安全工作流。许多人仍对基准测试说法持怀疑态度,并指出在真实世界表现上,尤其是复杂推理和长尾任务方面,它在某些领域仍落后于顶级模型。围绕它的一个主要暗流是信任与伦理:有人欢迎 Grok 作为第三家前沿实验室,能够推动价格和护栏竞争;而另一些人则因对 xAI 安全政策、过去的 CSAM/深伪丑闻以及 Elon Musk 的政治影响的担忧,完全拒绝采用它。

模型表现与基准测试

  • 很多人认为 Grok 4.6 相比 4.5 有了实质性升级;也有人声称它在编码和推理基准上接近 Fable,甚至达到“Fable‑like”级别。
  • 也有人反馈它在“判断力”和长尾任务上仍落后于 Fable,且经常落后于 Opus 5;不少人说基准测试夸大了真实世界能力(“benchmaxxing”)。
  • 各种对比说法不一:有人把 Grok 4.5 放在 Claude Sonnet 和 Opus 之间,也有人说它的编码能力达到 Opus 4.8 水平;还有人指出尽管 Opus 5 分数更高,实际感觉却比 4.8 更差。
  • 是否真有任何模型能匹配 Fable 也存在争论;一些自行跑代码审查基准测试的用户认为 Fable 明显更强。

成本、限制与效率

  • Grok 因速度快、价格低而受到称赞,尤其通过 Cursor 使用时,相比 Anthropic 额度也更宽松。
  • API 定价与 Sol/Qwen 的对比存在争议:Sol 往往在 token 效率和速度上胜出,不过 Grok 正在缩小差距;有人指出,定价页面仍落后于 4.6 的发布公告。
  • 少数用户表示,SuperGrok 在 4.6 下的消耗速度似乎比 4.5 更快。

真实使用反馈

  • 编码:评价褒贬不一,但总体积极。有人用 Sol 做规划、Grok 做实现;也有人现在认为 Grok 4.6 已经足够同时承担这两步。
  • 多位用户称 Grok 能发现真实安全问题,而且比竞争对手更愿意在本地测试漏洞利用(在限制范围内)。
  • 也有人觉得 4.6 的计划“冗长跑题”或自相矛盾,并说 4.5 更连贯。
  • 语音模式:多条反馈称最近出现回退——更简短、没那么细腻、处理多部分问题更差,不过延迟有所改善。

安全、护栏与丑闻

  • 一份泄露的默认系统提示词显示了明确规则:禁止提供犯罪帮助、漏洞利用以及涉及未成年人的性内容,并要求不要透露这些规则。
  • 很多人批评仅靠提示词做安全防护太弱;也有人指出,各家服务商还叠加了额外过滤器和分类器。
  • 过去 Grok 被用于 CSAM 和性深伪的事件被广泛讨论;公司代表称这违反政策且正在执行,而批评者认为执法太晚或不充分,并提到仍在进行中的诉讼。

信任、政治与采用

  • 有相当一部分人拒绝使用 Grok,或拒绝为 xAI 付费,原因包括老板的政治立场、审核选择和争议(如“Mechahitler”、反犹/种族主义输出、深伪丑闻、对外交政策的影响)。
  • 据称一些组织因数据隐私顾虑而禁止使用 Grok,尽管它们会通过其他托管方使用中文模型。
  • 也有人认为这些批评被夸大或带有党派色彩,并强调 Grok 在技术上很强,且在安全讨论上限制更少。

算力、数据与竞争

  • 该讨论串反复将近期各实验室出现“Fable 级”聚集归因于:大量新算力上线、共享的 RL 任务供应商、蒸馏(有时来自 Fable/Mythos)以及持续的内部训练流水线。
  • 有人认为“没有护城河”:只要有足够的 GPU、数据和标准技术,任何大型实验室都能达到前沿质量;算力被视为主要护城河。
  • SpaceX/xAI 的快速数据中心扩建,以及 Cursor 的收购(将编码轨迹作为后训练数据)被认为是 Grok 跃升的关键。
  • 很多人欢迎 Grok 作为继 OpenAI 和 Anthropic 之后的第三家强势前沿实验室;Google/Gemini 被视为落后,而中国的闭源和开权重模型(DeepSeek、Kimi、Qwen)则被看作强劲的低成本竞争者。

界面与 UX

  • Grok Build CLI/TUI 和语音转文字受到好评(速度快、打磨完善、“不啰嗦”、回答简洁)。
  • 有些人更喜欢 Claude/GPT 的 artifacts 和写作风格;另一些人则更喜欢 Grok 直率、较少拟人化的语气。