GenAI 和错误的医学引用
大型语言模型正越来越多地被用于医疗查询,甚至用于诊断支持,但它们无法可靠地引用和证实医学主张,这正在引发严重的安全与责任问题。评论者将 LLM 的表现与现实世界中的医学进行对比——后者同样会出错,但运行在受监管、以指南为基础的体系中——并认为当前的 GenAI 工具应只限于狭窄的辅助角色(如结构化数据提取,或在经过审核的语料上做 RAG),而不应成为独立的临床决策者。帖子还强调了:可被提示、且语气权威的输出如何强化患者错误信息;高质量检索与评估层的重要性;以及已获认证的医疗 AI 工具与临床医生正在非正式使用的通用聊天机器人之间的监管鸿沟。
LLM 在临床实践中的作用
- 目前建议最安全的用途:提取实体(症状、体征、检验结果)并将其输入透明的临床评分(例如 Wells、Centor),而不是直接诊断。
- 许多人预计未来会出现可解释的多诊断模型,但也一致认为目前还不存在。
- 一些人将 LLM 视为“专家助手”,可帮助受过训练的临床医生更快地查找和综合参考资料,而不是独立工具。
与人类医生的比较
- 讨论的焦点在于:LLM 无法为其主张提供依据,这是否比医生更糟糕——医生通常也不会当场引用文献,而且经常遵循指南算法/流程图。
- 有人提到医学错误的巨大估计值,认为这正是尝试 AI 的理由;也有人质疑这些统计,并指出许多错误是系统性的,而 LLM 并不能解决。
- 还有一种观点认为,医学的复杂性要么是避免使用不受信任工具的理由,要么是欢迎更好工具的理由。
诊断准确性与轶事
- 引用的研究声称 GPT‑4 在某些特定诊断任务上可以与专家持平甚至更好,但也有人指出训练泄漏、场景狭窄以及作者自身的警告。
- 一些轶事:GPT‑4 正确诊断出被遗漏的疾病,并提供了有效的情感支持;也有人警告不要过度泛化。
- 怀疑者强调,LLM 无法对患者进行实际体检,而且任何“超人类”说法都不同寻常。
引用、RAG 与幻觉
- 讨论中的研究测试了 GPT‑4 的网页浏览功能(使用 Bing),发现约 30% 的陈述缺乏所提供来源的支持;有人认为这更多是在批评那种 RAG 设置,而不是在批评 LLM 本身。
- 多位发帖者指出,朴素的 RAG 很难做好;文档筛选和低层级调优非常重要。
- 还提到一些专门系统(例如药物相互作用工具、大型医疗模型初创公司)据称在受限领域实现了非常低甚至零错误。
- 有人建议使用第二个 LLM 来验证每一对主张-来源;也有人指出验证模型同样会产生幻觉。
患者行为与风险放大
- 担忧在于:LLM 像一面镜子——在带有引导性的提示下,会强化用户偏见,尤其是疑病症患者或保健品爱好者。
- 一些人认为传统网页搜索也能做到这一点,但另一些人说,LLM 比零散的搜索结果更流畅、更快,也更有说服力。
- 令人担心的是,那些看似合理、措辞得体但缺乏依据的解释,会让非专家很难分辨真伪。
监管、责任与公平性
- 提供医疗 AI 的初创公司报告说,认证负担非常重;他们也对通用 LLM 在医疗中被使用却没有类似监管感到不满。
- 一方认为责任在于忽视警告并滥用非医疗工具的临床医生;另一方则认为,这对大型 LLM 提供商构成了不公平的竞争优势。
医学知识中的保守与进步
- 一些用户觉得 GPT‑4 现在对主流来源(例如 Mayo、Cleveland Clinic)过于受限,不愿引用较不正统或处于早期阶段的研究。
- 他们认为这可能会巩固当前教条并放缓科学进步,更倾向于让模型呈现更广泛的证据,然后由用户自行判断。
- 另一些人则认为,强约束是减少伤害、法律风险和公众反弹所必需的。
新兴与提议中的用例
- 除了诊断之外,讨论的用途还包括:药物相互作用检查、挖掘大规模患者事件历史,以及“资源路由器”(例如,一个癌症机器人不直接给出医学答案,而是链接到资助、指南和支持资源)。
- 总体共识是:LLM 很可能会成为更大医疗工具链中的一个组成部分,而不是临床医生的替代品。