问 HN:你默认使用哪个模型,为什么?

AI 重度用户正在围绕成本、速度与能力之间的权衡来选择各自的“默认”语言模型,而不是单纯看基准分数。许多人偏爱 DeepSeek Flash、GLM 5.3、Gemini Flash 或 Luna 这类更便宜且更快的模型来处理日常编码和自动化任务,同时把 Opus、Fable、Sol 或 Astra 这类更昂贵的前沿模型留给复杂规划与审查——或者因为它们过于冗长、token 成本太高而干脆不用。一个反复出现的主题是将多种模型(有时还包括本地开源权重方案)组合进工作流,以平衡隐私、可靠性和预算;也有人认为,如今比起追逐“最聪明”的单一模型,更重要的是精心设计 harness 和测试。

模型选择与使用场景

  • 选择非常多样;没有单一的“默认”赢家。
  • 常见“主力”模型:DeepSeek v4.1 Flash、GLM‑5.3‑Flash、GPT 5.6 Luna/Terra、Gemini 3.x Flash、Composer、Muse Spark。
  • 前沿模型(Opus、Fable、Astra、Sol、Grok)大多仅用于规划、疑难 bug,或审查大型代码库。
  • 有些人把便宜/快速模型用于日常编码和日志处理,只有在卡住时才切换到 Opus/Fable/Sol/Astra。
  • 也有少数人完全不使用 LLM。

成本、token 使用量与定价上的不满

  • 许多人会针对性价比做优化;预算较小的个人更偏好 DeepSeek、GLM、Luna、Qwen、Gemma、本地模型。
  • 对 token 限额的体验差异很大:有人连大号“20x”之类的套餐都用不完,另一些人则会在一天内因多智能体工厂和持续 devops 把额度烧光。
  • 几位发言者认为,面向常见开发任务时,高端 Anthropic 产品贵得离谱;也有人愿意为便利和美国本土供应商买单。

速度、能力与冗长程度

  • 响应速度非常受重视;DeepSeek、GLM、Gemini Flash 被称为“快得飞起”,对大多数 Web/移动端或 SWE 工作来说已经“够用”。
  • 对新版 Claude/Opus 写作风格的反感明显:过于冗长、辞藻华丽、过分谨慎,而且难以阅读;很多人更偏好旧版 Opus。
  • GPT Sol/Luna、Astra,以及部分开源权重模型因输出更简洁、更加实事求是而受到称赞。
  • 有些人反馈前沿模型虽然能通过测试,但仍会埋下隐蔽的技术债;因此 harness/test 设计被认为至关重要。

工作流与编排模式

  • 常见模式:用便宜模型做主代理 + 用更聪明的模型做规划/审查/顾问。
  • 编排器、子代理和“软件工厂”的使用正在增长,但也可能让 token 消耗暴涨。
  • 几位用户更偏好“半人马”模式:保持严格的人类控制,而不是完全自治的代理。

本地部署 vs 托管、信任与伦理

  • 一些人转向本地的 Qwen/Gemma/GLM/DeepSeek,以获得更好的隐私、凭证处理,并避免他们认为的监控或政策问题。
  • 另一些人在工作中被禁止使用中文模型,但私下仍会使用。
  • 讨论涉及环境影响以及美国与中国 AI 实验室的地缘政治立场;没有共识。

总体情绪

  • 这条讨论显示出极端碎片化:可用的默认模型很多,个人偏好很强,而模型选择往往不如工作流、引导方式和成本纪律重要。