深度学习在医疗影像领域涉及可解释性相关的工作有哪些?
你猜怎么着?上个月,我一朋友从复旦肿瘤医院打来电话,声音都带着火。他们科室搞了套肺结节诊断系统,模型测试集AUC直接飙到0.94,比副主任还准!结果拖了两个月,愣是没通过伦理审批。放射科主任一句话怼回来:“你让我怎么跟病人解释?计算机说恶性,可它自己都不知道为什么?”——你说气不气人。
这场景我太熟了。做了八年医学影像AI,前三年基本只干一件事:告诉临床医生“这模型不是瞎蒙的”。到今天,可解释性还是深度学习落地医疗的拦路虎,没有之一。但过去两年,变化比前面五年加起来还猛。我翻了最近几篇从NPJ到Nature Methods的工作,愣是激动得睡不着——这个领域,真的不一样了。
说到这儿,我先扔个炸弹给你。
现在市面上90%的可解释性是啥?事后解释!模型训练完,拿个Grad-CAM或SHAP给它画张“我这么想的”图。可2023年斯坦福一个随机对照试验里,放射科医生看了Grad-CAM热力图后,诊断准确率反而下降了。为什么?因为热力图太笼统了,一个红色区域可能盖住十几层组织,医生分不清模型是看了肿瘤边缘还是旁边血管。又笨重,又误导,还动不动让医生越看越糊涂。
但别急,另一条路正在悄悄起来。
你看那个广州中医药大学的直肠癌淋巴结转移研究,SHAP和Grad-CAM双管齐下,模型外部验证AUC做到0.771,比两位高年资医生都强。文章写得明明白白:Grad-CAM圈定关注区域,SHAP列出哪些特征起了作用。可说实话,这真能让医生信服吗?SHAP给的是“特征重要性排序”,不是“因果关系”。你跟医生讲“这肿瘤灰度值低所以判断为恶性”,医生反问你“为啥低就容易转移?”——你又哑了。
这就引出我最兴奋的一条路线:内在可解释模型。我以前总觉得它要牺牲性能换解释,但最近几个工作彻底推翻了我的偏见。比如PMC上的ConRad模型,它不用事后解释,而是强制ResNet-50先学8个临床生物标志物——分叶、毛刺、钙化啥的——再拿这些概念去推理。这就像医生问病人“你哪儿不舒服”,病人直接说“我头疼发烧”,而不是丢给你一张模糊的图。最大的感受是:你可以在决策路径上和医生“吵架”。医生如果说“你的模型认为有毛刺就是恶性,但我看这个结节有毛刺却是良性的”,你马上能调出那个样本的生物标志物预测值,争论具体哪个概念错了,而不是围着一张热力图打转。
李梢团队在Nature Methods上发表的Multi-Embed走得更远。他们把病理影像和分子图谱映射到统一嵌入空间,找跨层次的网络模块化关联。技术上比CBM高一个量级,核心理念一样:让模型自己学出医生能理解的结构化知识,而不是画个热力图就完事。
所以我敢说:事后解释是过渡方案,内在可解释才是终局。但短期内SHAP和Grad-CAM不会消失——临床想的是先把产品用上,再谈信任。这就像追女朋友,先送花再说心里话,总比站着表白强。
说到这儿,你还得想一个问题:纯影像解释做到一定程度,就做不动了。
我2021年踩过一个坑。跟一家三甲医院合作头颈癌复发预测,我们的3D CNN模型AUC干到0.85以上,Grad-CAM关注的区域也跟放射科医生一致。结果人家直接问:“你模型的解释是说这个区域增强信号异常,但我们知道增强信号异常可能是放疗后炎症,跟复发两码事。你怎么区分?”我当时就傻了。后来逼着自己加上随访时间点的动态影像序列,从静态预测变成动态变化分析,才勉强圆回来。
过去两年可解释性领域一个清晰的趋势是:多模态成为地基,而不是锦上添花。
你想想,单模态解释来解释去,无非是“这个区域纹理粗糙”“那个区域边界不规则”。对转移性淋巴结,如果只看MRI信号,没有临床病史和实验室指标,医生永远会质疑你。但加上预训练范式呢?广东省人民医院刘再毅团队用DCE-MRI做乳腺癌ER分类,训练了3500例数据。他们嵌入SHAP和Grad-CAM,但真正让解释有说服力的不是可视化,而是预训练方式——先拿大量乳腺MRI预训练基础模型FM-BCMRI,再微调。这意味着模型学到的不是你这个小数据集上的偶然相关性,而是通用的乳腺影像表征。预训练本身就是可解释性保障,只是很多人不这么宣传。
TP53那个研究更直接。他们把原发肿瘤类型、DS-GPA分数和影像组学特征三个模态拼在一起训练SVM,然后用SHAP分析。结果发现最强的预测特征是中位灰度值,而且非缓解组这个值偏低。如果只用影像,解释到灰度值就卡住了;但因为有临床数据,就能进一步把灰度值和“血供差、缺氧、放疗抵抗”的病理机制关联起来。这才是临床医生要的——不是统计学关联,而是机制层面的解释。
清华大学的HOPE模型能发到NPJ Digital Medicine,也因为这个。它整合了动脉期和门脉期CT、临床变量、实验室指标和肿瘤形态学数据,用Transformer双向注意力融合。更关键的是,他们做了Kaplan-Meier生存曲线验证,高风险组和低风险组的HPD无进展生存期确实有显著差异(HR 3.89)。多模态融合加上生存预后验证,让Grad-CAM可视化不再是孤立的,而是跟临床硬终点绑在一起。
我的观点很直接:单模态的可解释性是死胡同。想做出有临床说服力的解释,必须把病理、影像、基因组学、电子病历往上堆。不是为了刷AUC,是为了给解释提供“锚点”——医生需要的是抓手,不是流行语。
最后聊个我最近兴奋到睡不着的话题:大语言模型来了。
很多人听说LLM用于医学影像解释,第一反应是“它们只是编故事”。确实,直接用GPT-4看图解释,烂得一塌糊涂。但CVPR 2024上的IEBGL工作给我打了强心针。
IEBGL做的是脑功能连接分析,用rs-fMRI构建脑图来诊断抑郁症。传统GNN解释起来特别别扭——你没法告诉医生“为什么功能连接增强或减弱就对应抑郁症”。但IEBGL的创新是:先用LLM为每个脑区生成“认知功能提示”,让LLM基于解剖功能、结构异常、病理表现给出脑区之间的关系描述,再把这些LLM关系嵌入作为拓扑先验,调整图连接结构。同时,还从抑郁症相关的生物医学文献里检索信息,增强节点特征。
这意味着什么?模型的解释不再局限于“哪个脑区连接强”,而是上升到“这个连接变化对应文献里提到过的什么病理机制”。比如识别出一个异常连接,它直接告诉你“默认模式网络与突显网络间的连接异常是抑郁症的标志”。这才是医生真正想要的——从“哪里”到“为什么”。
我测试过类似想法,用PubMed检索词向量增强组织病理切片特征,但当时技术不成熟。现在LLM的能力已经够做结构化知识提取了。这件事最大的意义是:可解释性从“这个区域很重要”进化到了“这个区域为什么重要,以及它与什么更相关”。医生听到,眼睛都亮了。
当然,问题也不少。LLM的知识可能过时或者有幻觉,医学文献更新那么快,你怎么保证引用靠谱?计算成本也高,光LLM推理这一步就够烧GPU。但方向是对的,我敢大胆预测:三年之内,可解释性研究会变成“知识图谱+LLM+对比学习”的混合模式,单纯的Grad-CAM会沦为baseline。不信?等着瞧。
回到开头那个故事。我最后跟我朋友说的是:“你就跟主任说,模型现在能告诉你这个结节有毛刺、分叶、钙化三种特征组合,其中毛刺贡献最大,而毛刺在文献里有80%以上的恶性预测阳性率。你不用他懂技术,只需让他觉得‘他理解了’模型在想什么。这就够了。”
可解释性,说白了就是一场信任游戏。不是让机器透明,而是让医生觉得他懂了——这一“觉得”,就是AI落地那把钥匙。至于因果解释?那是十年后的课题。反正我信心满满,你呢?
读者评论 3