Claude 2.1

Anthropic 发布了 Claude 2.1,这是一款拥有 200k token 上下文窗口并减少幻觉的大语言模型,人们正在把它与 OpenAI 的 GPT‑4/Turbo 在编码能力、推理深度、速度和可靠性方面进行比较。许多评论者认为 Claude 在复杂编程和通用知识任务上不如 GPT‑4,但赞赏它的长上下文和语气,尤其是在通过 AWS Bedrock 使用时。一个主要的挫败来源是 Anthropic 限制性的访问、地区限制(尤其是欧盟和加拿大)以及激进的安全过滤器,它们会对看似无害的查询频繁触发拒绝,这引发了人们对其作为主要开发平台实用性的担忧。

发布日期时机与竞争背景

  • 许多人指出,Claude 2.1 在 OpenAI 动荡之际发布是“恰到好处”的时机,认为这为吸引规避风险的企业客户提供了机会。
  • 也有人认为,这个时机主要只是巧合,或只是围绕感恩节做了一个小的排期调整。

模型质量 vs GPT-4 等

  • 一些发帖者表示,Claude 2/2.1 在实际编码和推理任务上明显不如 GPT-4(有时甚至不如 GPT-3.5);会给出更多伪代码、忘记约束、输出不完整。
  • 少数人表示结果很好,尤其是在总结或审阅多篇学术论文以及一般聊天等任务上,有时甚至更喜欢它的语气而不是 GPT-4。
  • 有些人觉得开源模型(例如 Mistral、Llama 变体)在他们的用途上已经具有竞争力,甚至更好。

拒绝、安全与“过度对齐”

  • 一个主要主题是对频繁、甚至有些怪异的拒绝感到沮丧:假设性问题、考试准备、与“意识形态”相关的词汇、无害的安全/健康问题、会中断流程的命令等。
  • 批评者把 Claude 描述为说教式的、好争辩的,或者“像家长一样”,让它很难作为工具使用。
  • 维护者说,他们在狭窄领域里很少看到拒绝(代码、基于文档的 RAG),并且更愿意接受谨慎拒答,而不是胡编乱造。
  • 也有人认为,对于真正危险的领域(生物武器、严重伤害),强大的护栏是可以接受的,甚至是必要的。

上下文窗口、幻觉与准确性

  • 200k 上下文被视为很有前景,但需要独立测试;人们指出,之前的长上下文模型在大约 32k token 后就会退化。
  • Anthropic 自己关于更少幻觉和更诚实拒答的图表被认为是积极的,但并没有解决审查上的“假阳性”问题。

访问、地理限制与 API

  • 许多人抱怨根本拿不到 API 访问权限,或者要等几周/几个月;申请表单让人觉得不透明、令人望而却步。
  • 在欧盟、加拿大、巴西等地区不可用,再加上电话号码限制,是反复出现的痛点。
  • 有些人通过 AWS Bedrock 绕过这些限制,并报告获得了快速、自动化的访问;但其他人仍然面临延迟。
  • 还有几个人表示,这使得 Claude 作为平台的风险比 OpenAI 那种容易访问的 API 大得多。

系统提示词、预填与控制

  • 新的系统提示词和 Anthropic 的“prefill”能力引起了高级用户的兴趣,既可用于自定义行为,也可能用于减少拒绝。
  • 另一些人担心这种提示词设计会增加提示注入风险,并指出 OpenAI 实际上也是以类似方式把系统文本和用户文本连接起来。