← 返回资讯
陈默
AI 行业分析师
已审核

LLM in Medical Domain

说到AI看病这事儿,我关注老久了。从ChatGPT刚火的那个时候,我就天天琢磨:这玩意儿要是放进医院,能行吗?

LLM in Medical Domain

LLM in Medical Domain


那会儿,我真替ChatGPT捏把汗

说到AI看病这事儿,我关注老久了。从ChatGPT刚火的那个时候,我就天天琢磨:这玩意儿要是放进医院,能行吗?

你都不知道那段时间朋友圈有多热闹。一帮人兴奋得跟中了彩票似的,到处嚷嚷:“以后还挂什么号啊,有啥毛病直接问AI不就完了?”

我当时就在心里翻了个白眼:兄弟,你是没被GPT-4那信誓旦旦的胡扯坑过。

我给你讲个事儿。有一次我故意问它一个挺冷门的药物相互作用,它噼里啪啦给我回了一大段,看起来头头是道,又是引用又是分析的。我差点就信了。结果一查文献,好家伙,它把两种药的副作用完全给说反了!这不叫看病,这叫“开盲盒式治疗”,你敢信吗?

所以从那以后,我就跟这事儿杠上了。


转机来了!一篇论文,把窗户纸给捅破了

真正让我觉得这事有戏的,是2022年底。

那年12月,Google那帮人发了一篇论文,题目叫《大语言模型编码临床知识》。我当时是熬夜读完的,看完只觉得后脑勺一阵发麻。

他们干了一件什么事呢?

很简单,他们搞了一个医学界的“比武大会”——MultiMedQA。把美国执业医师考试的题库(MedQA)、医学问答的公开数据集(MedMCQA、PubMedQA),再加上他们自己新弄的一堆真实网友健康问题(HealthSearchQA),全给整合在了一起。

目的只有一个:把这群大语言模型拉出来溜溜,看看谁是真懂医,谁是只会背书。

当时的明星选手是PaLM和它的强化版Flan-PaLM。结果一上场,Flan-PaLM就炸了。在MedQA(那可是正儿八经的美国执业医师考试题)上,它的成绩比之前最好的模型高了一大截——整整17%!

17%啊!我当时看到这个数字,直接从椅子上弹起来了。

说到这儿,你可能觉得:哇,AI要取代医生了?

别急,真正有意思的地方来了。


大模型考了满分,但医生只给了它70分

你看,Flan-PaLM考选择题牛不牛?牛!但你要是让它生成长篇大论的回答,跟真正的临床医生比一比呢?

差距,肉眼可见。

那篇论文里有个细节我过了这么久还记得清清楚楚。他们在HealthSearchQA(真实网友提问)上做了个对比测试。让几个大模型和医生轮番上阵,回答同一个问题,然后把答案匿名混在一起,请专业的医生评审打分。

结果怎么样?

模型在选择题上能拿个90分,但在生成长文本回答这件事上,跟医生的差距就像小学生和教授。

凭什么?

因为选择题像是有选项的“猜谜游戏”,AI擅长这个。但真实病人问的问题,根本不是选择题。比如“我最近老咳嗽,还有点发烧,是不是得了禽流感?”这种问题,没有标准答案,需要的是逻辑推理、循证医学,还得照顾患者的情绪。

我举个例子你就明白了。

有个模型回答禽流感的问题,噼里啪啦输出一堆:什么发病率多少、死亡率多少、历史上哪年爆发过……看起来好像很专业,对吧?

但医生怎么回答?医生会说:“别太担心,你先告诉我,最近有没有接触过活禽?体温量了吗?我们先做个核酸检测。”

发现没有?模型关注的是“这个病是啥样”,医生关注的是“你这个人现在咋样”。

一个是在知识库里面检索答案,一个是在跟活生生的人对话。


你以为AI会看病,其实它连“假设”和“诊断”都分不清

这才是真正反直觉的地方。

大家一看到AI在医学考试里考了高分,就以为它离当医生不远了。但你想想,一个只见过考题的学生,和一个在病房里摸爬滚打过的医生,能一样吗?

考试是封闭的,有标准答案的,考的是你知不知道“1+1=2”。

看病是开放的,充满不确定性的,考的是“你凭什么说这两个症状加起来是感冒,不是白血病?”

后来我跟一个在Mayo Clinic工作的朋友聊到这个话题,他说了一句话,我到现在都觉得特有道理:

“这些模型确实能记住海量的知识,但它们就像一个拿了满分试卷、却从没见过真病人的医学生。你问它症状,它给你背书;问它判断,它给你编造;问它关怀,它沉默。”

你看,我们以为AI的短板是“知识不够”,其实它的短板是“没有温度”。


最后一句话,我想对你说

所以啊,别急着把ChatGPT当成家庭医生。它可以是你的百科全书,也能当你的文献助手,甚至帮你写病历草稿。

但它永远成不了那个,在看到你焦虑的眼神时,轻轻拍拍你肩膀说 “别怕,我在” 的人。

记住:科技能给你的答案,永远填不上人心里的那个洞。

因为医学,从来就不只是一场知识竞赛。它是一场,关于“爱”的人间修行。

534
13352 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 22:25

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

老李 昨天
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 4天前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)