AI“幻觉”出现在加拿大不列颠哥伦比亚省法院提交的虚假法律案例,系加拿大首例

AI 生成的“幻觉”法律引文出现在加拿大法庭文件中,引发了关于律师应如何(以及不应如何)使用大语言模型的讨论。评论者一方面对比 AI 的低成本和生产力提升,另一方面指出它会编造看似合理却虚假的信息,认为人类复核、更好的工具(如检索增强系统)以及更清晰的职业责任都至关重要。更广泛地说,这场讨论反映出人们对公众过度信任 AI、它对民主和职业标准的影响,以及把它当作人类疏忽替罪羊的担忧。

事件范围

  • 核心问题:律师提交了包含 AI 编造法律案例的法庭文件,这反映的是对通用 LLM 的误用,而不是模型出现了令人意外的行为。
  • 有人认为这相当于“水是湿的”(LLM 天生就会产生幻觉);也有人强调这仍然具有新闻价值,因为法律体系和公众仍然把电脑输出视为天然准确。

责任与制裁

  • 强硬观点:提交虚假引文是严重失职;几位评论者认为这类律师应该被吊销律师资格,尤其是在引用自己从未读过的案例时。
  • 更宽容的观点:早期用户可能确实没有理解 AI 会编造内容;最初的个案用罚款就足够,不必上升到毁掉职业生涯的制裁,但如今这种风险已广为人知,处罚应当升级。
  • 更广泛的担忧:AI 会被用作推卸责任的新方式(“是 AI 干的”),延续了长期以来把责任归咎于“电脑”的趋势。

LLM 应该如何使用,以及不该如何使用

  • 推荐用途:起草模板文本、改写、总结、从已核实来源中综合信息;不适合作为法律检索的主要工具。
  • 一些人报告称,在客户支持等领域可显著节省成本(人力成本的 10–50%),但也承认幻觉和细微错误仍然存在。
  • 对编程能力存在强烈分歧:有人说 LLM 无法可靠地构建完整应用;也有人报告在人工监督下能做出简单且可运行的应用,但承认它不适合复杂系统,还会带来技术债务。

幻觉、真实性与核查

  • 对术语存在争论:几位更喜欢用“编造性联想(confabulation)”而不是“幻觉(hallucination)”。
  • 提出的缓解办法包括:检索增强生成(RAG)、领域特定微调,或二级“检查器”代理;也有人指出,当需要创造力时,幻觉实际上是一种“特性”。
  • 共识:在法律这类关键领域,人类专家必须核实引文及其对应的原始案例。

更广泛的社会与政治担忧

  • 人们普遍担心,由于 LLM 语言流畅、语气不带评判,人们会过度信任它们,尤其是在一个充斥错误信息的环境中。
  • 有人预见 AI 会加速代码质量的“逐底竞争”,并削弱自由民主;也有人认为这种末日论被夸大了,社会会像适应互联网一样逐渐适应。
  • 猜想从 AI 治理的乌托邦到反乌托邦结果都有,而普遍共识是,当前模型距离那个阶段还很遥远。