跳到正文
高性价比人生指南地图
A
No.6-31金卡 · A 级证据

不要指望靠 AI 聊天机器人自己判断病情和法律问题,看病、打官司、花大钱之前,把它说的依据找到原文核一遍

说人话

把完整病例交给 AI,九成以上它能认出是什么病。但普通人拿它问症状,认出病的反而比自己上网查的人少,该不该去急诊也没判得更准。问法律问题,通用 AI 至少 58% 的回答有编的内容,还会顺着你问题里的错误说法往下讲。

不花钱几分钟要点毅力换寿命收益小有争议证据很硬
收益
先看看病。2026 年 Nature Medicine 发表了一项随机分组的试验,1298 名英国普通人参加,方案事先登记过。每人拿到两个编好的病例,要判断是什么病、该去急诊还是在家观察。一部分人用 AI 聊天机器人帮忙,用的是 GPT-4o、Llama 3、Command R+。对照组用自己平时的办法,多数是上网搜,或者看英国国家医疗服务体系(NHS)的官网。把完整病例直接交给 AI,它 94.9% 的情况能认出相关的病,56.3% 能判对该去哪看。普通人用同样的 AI,认出相关疾病的不到 34.5%,判对去哪看的不到 44.2%。对照组认出相关疾病的几率是用 AI 的人的 1.76 倍(95% CI 1.45–2.13,可信范围)。认出危险信号类重病的几率是 1.57 倍(1.28–1.92)。判断该去哪看,两边差不多。作者翻了对话记录,问题出在两头。一头是用户没把症状说全,另一头是 AI 提到了对的病,用户却没采纳。再看法律。一个美国研究团队 2024 年用 ChatGPT 4 等公开模型,问美国联邦法院的判例。ChatGPT 4 有 58% 的回答有编造,Llama 2 高到 88%。编造指和法律事实对不上的内容,论文把它叫「幻觉」。模型分不清自己哪句是编的。用户问题里带着错误的法律前提时,它常常照单全收。同一团队 2025 年又测了律师用的专业法律 AI 工具。这些工具号称不会编,实际 17% 到 33% 的回答有编造。它看起来划算,是因为 AI 随叫随到、不收钱,说话又像医生律师一样肯定
来源 · 5 条链接
Bean AM, Payne RE, Parsons G, et al. (2026). Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nature Medicine, 32(2), 609–615. doi.org/…

Dahl M, Magesh V, Suzgun M, Ho DE (2024). Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. Journal of Legal Analysis, 16(1), 64–93. doi.org/…

Magesh V, Surani F, Dahl M, Suzgun M, Manning CD, Ho DE (2025). Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. Journal of Empirical Legal Studies, 22(2), 216–242. doi.org/…

Kalai AT, Nachum O, Vempala SS, Zhang E (2025). Why Language Models Hallucinate. arXiv:2509.04664(预印本,备注里那项). arxiv.org/…

反方:Ayers JW, Poliak A, Dredze M, et al. (2023). Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum. JAMA Internal Medicine, 183(6), 589. doi.org/…