LLM in Medical Domain
那会儿,我真替ChatGPT捏把汗
说到AI看病这事儿,我关注老久了。从ChatGPT刚火的那个时候,我就天天琢磨:这玩意儿要是放进医院,能行吗?
你都不知道那段时间朋友圈有多热闹。一帮人兴奋得跟中了彩票似的,到处嚷嚷:“以后还挂什么号啊,有啥毛病直接问AI不就完了?”
我当时就在心里翻了个白眼:兄弟,你是没被GPT-4那信誓旦旦的胡扯坑过。
我给你讲个事儿。有一次我故意问它一个挺冷门的药物相互作用,它噼里啪啦给我回了一大段,看起来头头是道,又是引用又是分析的。我差点就信了。结果一查文献,好家伙,它把两种药的副作用完全给说反了!这不叫看病,这叫“开盲盒式治疗”,你敢信吗?
所以从那以后,我就跟这事儿杠上了。
转机来了!一篇论文,把窗户纸给捅破了
真正让我觉得这事有戏的,是2022年底。
那年12月,Google那帮人发了一篇论文,题目叫《大语言模型编码临床知识》。我当时是熬夜读完的,看完只觉得后脑勺一阵发麻。
他们干了一件什么事呢?
很简单,他们搞了一个医学界的“比武大会”——MultiMedQA。把美国执业医师考试的题库(MedQA)、医学问答的公开数据集(MedMCQA、PubMedQA),再加上他们自己新弄的一堆真实网友健康问题(HealthSearchQA),全给整合在了一起。
目的只有一个:把这群大语言模型拉出来溜溜,看看谁是真懂医,谁是只会背书。
当时的明星选手是PaLM和它的强化版Flan-PaLM。结果一上场,Flan-PaLM就炸了。在MedQA(那可是正儿八经的美国执业医师考试题)上,它的成绩比之前最好的模型高了一大截——整整17%!
17%啊!我当时看到这个数字,直接从椅子上弹起来了。
说到这儿,你可能觉得:哇,AI要取代医生了?
别急,真正有意思的地方来了。
大模型考了满分,但医生只给了它70分
你看,Flan-PaLM考选择题牛不牛?牛!但你要是让它生成长篇大论的回答,跟真正的临床医生比一比呢?
差距,肉眼可见。
那篇论文里有个细节我过了这么久还记得清清楚楚。他们在HealthSearchQA(真实网友提问)上做了个对比测试。让几个大模型和医生轮番上阵,回答同一个问题,然后把答案匿名混在一起,请专业的医生评审打分。
结果怎么样?
模型在选择题上能拿个90分,但在生成长文本回答这件事上,跟医生的差距就像小学生和教授。
凭什么?
因为选择题像是有选项的“猜谜游戏”,AI擅长这个。但真实病人问的问题,根本不是选择题。比如“我最近老咳嗽,还有点发烧,是不是得了禽流感?”这种问题,没有标准答案,需要的是逻辑推理、循证医学,还得照顾患者的情绪。
我举个例子你就明白了。
有个模型回答禽流感的问题,噼里啪啦输出一堆:什么发病率多少、死亡率多少、历史上哪年爆发过……看起来好像很专业,对吧?
但医生怎么回答?医生会说:“别太担心,你先告诉我,最近有没有接触过活禽?体温量了吗?我们先做个核酸检测。”
发现没有?模型关注的是“这个病是啥样”,医生关注的是“你这个人现在咋样”。
一个是在知识库里面检索答案,一个是在跟活生生的人对话。
你以为AI会看病,其实它连“假设”和“诊断”都分不清
这才是真正反直觉的地方。
大家一看到AI在医学考试里考了高分,就以为它离当医生不远了。但你想想,一个只见过考题的学生,和一个在病房里摸爬滚打过的医生,能一样吗?
考试是封闭的,有标准答案的,考的是你知不知道“1+1=2”。
看病是开放的,充满不确定性的,考的是“你凭什么说这两个症状加起来是感冒,不是白血病?”
后来我跟一个在Mayo Clinic工作的朋友聊到这个话题,他说了一句话,我到现在都觉得特有道理:
“这些模型确实能记住海量的知识,但它们就像一个拿了满分试卷、却从没见过真病人的医学生。你问它症状,它给你背书;问它判断,它给你编造;问它关怀,它沉默。”
你看,我们以为AI的短板是“知识不够”,其实它的短板是“没有温度”。
最后一句话,我想对你说
所以啊,别急着把ChatGPT当成家庭医生。它可以是你的百科全书,也能当你的文献助手,甚至帮你写病历草稿。
但它永远成不了那个,在看到你焦虑的眼神时,轻轻拍拍你肩膀说 “别怕,我在” 的人。
记住:科技能给你的答案,永远填不上人心里的那个洞。
因为医学,从来就不只是一场知识竞赛。它是一场,关于“爱”的人间修行。
读者评论 2