给 ChatGPT 小费会让它生成更好的文本吗?

关于承诺给 ChatGPT 一笔现金“小费”或进行情绪诉求是否能改善回答,既有好奇也有怀疑。评论者报告的轶事结果喜忧参半——尤其是在“懒惰”的代码生成方面——同时指出实验和论文表明,任何效果都很小、依任务而定,而且在更大的模型上大概会减弱。许多人把这些做法看作围绕不透明系统的现代巫术,认为更清晰的提示和更好的工具(比如用于代码的统一 diff)比贿赂或威胁重要得多。

对小费、威胁和情绪的感知效果

  • 许多人表示,贿赂、威胁或对紧迫性的诉求(“我的工作/房子就靠这个了”)似乎能改善指令遵循、JSON 符合度或完整性,尤其是在早期 GPT‑4 和较小模型上。
  • 也有人说,小费要么没有效果,要么会降低代码质量,而且模型会明确表示它们不能收小费。
  • 一些用户则声称,把模型描述为“在胁迫之下”或对他人的痛苦负有责任,比直接威胁它更有效。
  • 还有人仅仅因为礼貌用语(“请”“谢谢”)或积极的关系框架(“我们是成功路上的队友”)而看到了改进。

编程中的“懒惰”与技术性变通办法

  • 一个反复出现的抱怨是:GPT‑4 Turbo 经常省略代码、留下占位符,或者只给出部分实现。
  • 线程中引用的基准测试表明,“情绪诉求”并不能可靠地解决这个问题;要求使用统一 diff 会大幅减少“懒惰”输出。
  • 其他实用技巧包括:明确威胁如果代码不完整就重新提问;使用详细程度标志;分开使用不同模型(3.5 用于代码,4 用于解释)。
  • 也有人报告说,GPT‑3.5 现在在某些 API 上往往能生成比 GPT‑4 更准确、幻觉更少的代码。

提示工程、礼貌与“巫术”

  • 一些评论者把围绕情绪、小费和威胁的提示工程看作一种套套逻辑式的“魔法咒语”,偏离了传统的确定性编程。
  • 另一些人认为这反映了正常的人类互动:礼貌和清晰的利害关系在训练数据中往往会带来更好的帮助,因此模型会复现这种模式。
  • 关于观察到的改进究竟是真实存在还是错觉,存在争论;有一篇被链接的论文发现,情绪状态操控可以改变服从性,但效果有限。

模型行为、训练数据与拟人化

  • 有人把 LLM 描述为人格的“模拟器”:不同提示会“唤起”不同的行为模式(勤勉的程序员、绝望的帮手等)。
  • 对于论坛风格数据(小费、悬赏)与书籍/文章在多大程度上解释类似小费的行为,意见不一;整体仍不清楚。
  • 少数人担心把模型拟人化,或以伦理上“胁迫”未来有感知系统;另一些人则认为这种担忧为时过早,或者开玩笑说“未来 AI 的报复”。

方法论与证据质量

  • 多位评论者批评使用字符长度准确性作为指标的实验,因为众所周知 LLM 很不擅长计数。
  • 建议包括使用明显在模型能力范围内的任务、更好的统计方法(自助法、贝叶斯方法),以及纠正多重假设检验。
  • 总体情绪是:目前表明“给小费”能显著提升质量的证据很弱或结论不一,最多只有小幅、依任务和模型而定的效果。