AI 建议让人更不准确,但更自信——研究
一项研究表明,AI 驱动的建议会让人更自信,但准确性更低:接触 LLM 的参与者即使面对经常出错的模型,也大幅减少了说“I don’t know”的倾向。评论者质疑研究设计——认为类似效应也可能来自任何看起来权威但有缺陷的来源——但普遍同意这凸显了自动化偏差和对 AI 的过度信任。许多人指出 Reddit、工作聊天和技术论坛等现实场景里,用户把未经核实的 AI 输出当作自己的内容,进而引发对信息质量下降、批判性思维流失,以及需要更好规范和模型行为的担忧。
研究链接与基本发现
- 评论者找到了实际的预印本并分享了它;有些人更愿意直接阅读原文,而不是看二手报道。
- 标题式总结被反复提到:AI 建议减少了“I don’t know”回答和总体准确率,同时提高了自信心。
- 有人指出,参与者在经济上有答对的激励,但仍然会跟随糟糕的 AI 答案。
对研究设计和范围的批评
- 许多人认为,这个实验并没有把任何独特的“AI”因素单独分离出来:它本质上就是“带着一个有缺陷的参考资料的开卷考试”。
- 所使用的模型(Step 3.5 Flash)是经过刻意选择并被提示去在冷门电影视觉 trivia 上答错的;批评者说这与正常的 AI 使用并不相同,而且会严重偏置结果。
- 缺少对照组:没有与非 AI 工具比较(例如一本糟糕的教材或糟糕的搜索结果),所以这个效应可能只是通用的“自动化偏差”。
- 也有人反驳说,这仍然很有相关性:LLM 在许多事实性问题上确实不可靠,而“人们过度信任看起来权威但实际错误的工具”这一发现无论如何都很重要。
关于现实性和风险程度的问题
- 这些问题只是平庸的电影细节;几位评论者怀疑,在低风险 trivia 上的行为能否映射到重要的现实世界决策。
- 也有人建议,更高的金钱激励或更明确的警告(“这个 AI 在这里经常出错”)可能会改变行为,并且应该进行测试。
拟人化、谄媚性与产品设计
- 讨论了营销、UI,以及“礼貌、自信”的风格如何让人们把 LLM 当作聪明的同事,而不是会犯错的工具。
- 对于人类是否不可避免地倾向于拟人化,还是设计和文化能够在多大程度上缓解这一点,展开了争论。
对线上建议与文化的影响
- 基本形成共识:建议/信息类 subreddit 和一些论坛正被未经核实的 LLM 复制粘贴内容淹没,导致质量下降。
- 人们描述了工作场所和社区规范正在形成:不鼓励原样倒贴 AI 内容,要求加入个人综合判断,并把未标注的 AI 文本视为不诚实或不尊重。
- 还有担忧认为,AI 生成的垃圾内容会反过来进入训练数据,造成信息质量的恶性循环。
更广泛的担忧与建议的应对方式
- 担心出现“AI 辅助型邓宁-克鲁格效应”:知识更少,自信更强。
- 建议包括:避免在安全关键场景中使用 LLM,让专家参与其中,强调 grounding 和验证,并把“批判 AI”作为一项技能来教授。