论文笔记|LLM 的医学知识藏在哪?ICLR 2026 用四种可解释性方法画出大模型 Medical Knowledge Map
Medical Interpretability and Knowledge Maps of Large Language ModelsICLR 2026 24661 动机LLM 在医学任务上越来越常用但我们并不清楚模型内部到底如何表示医学知识比如患者年龄、症状、疾病、疾病进展、药物、剂量等信息分别在哪些层被处理如果一个模型在医学场景里存在偏差例如对年龄、疾病阶段、药物类别的理解有问题仅看最终回答很难定位问题来源所以作者想做一件事不是只问“模型答得对不对”而是问“模型内部在哪些层表示了哪些医学概念”。这对于后续医学 LLM 的 fine-tuning、unlearning、de-biasing、causal intervention 都有指导价值比如如果年龄偏差主要在某几层出现就没必要全模型微调可以只干预相关层2 现有方法的不足现有医学可解释性工作主要有几个问题。第一很多工作只是让模型解释自己的诊断过程也就是 self-explanation这种解释不一定忠实于模型真实内部机制容易变成“事后合理化”。第二已有 mechanistic interpretability 工作大多研究通用知识、语法、事实召回、attention head、induction head 等很少系统研究医学领域知识。第三少数医学解释性工作通常只用一种技术比如只看 t-SNE/UMAP或者只看 sparse dictionary或者只看某个模型单一方法很容易有解释偏差因为不同解释方法有不同假设。UMAP 全称是Uniform Manifold Approximation and Projection把高维 embedding 压到低维同时尽量保留原来空间里的邻近关系第四医学知识不是一种单一概念年龄是连续变量症状和疾病是类别变量疾病进展是阶段性/轨迹性变量药物既可以按作用机制分类也可以按医学专科分类剂量还涉及安全/危险边界。因此只用一个统一指标很难覆盖这些结构3 论文的研究假设或直觉核心直觉是LLM 内部并不是在所有层均匀处理医学知识而是不同医学概念会在不同层形成可检测的表示结构如果多种解释性方法都指向相似层区间那么这些层很可能就是该类医学知识的关键处理区域。4 论文novelty4.1 Novelty 1医学知识地图 LLM Map【创新点解决的问题是什么】以往很难知道医学知识在 LLM 的哪些层被表示且单一解释方法不可靠如果多个机制解释方法在不同假设下都指向相似层那么这些层更可能是真正负责该概念的层——作者把 UMAP 表示聚类、gradient-based weight saliency、layer lesioning、activation patching 四种方法统一起来对 age、symptoms、diseases、drugs、dosage 分别提取高响应层区间最终画成 LLM Medical Map显示每类医学知识在模型深度上的分布4.2 Novelty 2把医学概念分成不同几何类型来解释【创新点解决的问题是什么】医学知识不是普通分类标签年龄、疾病进展、药物分类、剂量风险的结构完全不同用同一种解释指标会过于粗糙同知识类型应该对应不同 representation geometry年龄应接近一维连续流形症状/疾病/药物应有类别聚类疾病进展应有阶段轨迹——对年龄使用 local anisotropy 和线性回归 R²——对症状、疾病、药物使用 Silhouette Score——对疾病进展设计 closest-stage-to-first 和 closest-stage-to-last 之类的 circularity proxy——对剂量使用 activation patching effect4.3 Novelty 3发现年龄表示存在非线性和 18 岁断点【创新点解决的问题是什么】年龄看似是简单连续变量但模型可能并没有把年龄表示成平滑、可编辑、可去偏的线性方向——作者用不同年龄 prompt 提取中间层 activation然后用 UMAP 可视化和 age discontinuity heatmap 分析年龄流形发现 Llama3.3-70B 在部分中间层存在明显非线性并在 17/18 岁附近出现表示断点4.4 Novelty 4发现疾病进展表示可能是 circular / non-monotonic医学上的疾病进展通常被认为从健康到严重阶段逐步变化但 LLM 内部是否这样表示并不清楚。如果模型真的理解 disease progression那么健康、早期、中期、晚期、死亡阶段在表示空间里应具有某种单调轨迹——作者构造 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 阶段 progression prompts分析每层 UMAP 空间中不同阶段的相对距离发现晚期阶段有时反而靠近早期阶段因此表示呈现环形或非单调结构4.5 Novelty 5发现药物更按医学专科而不是作用机制聚类药物知识可以按药理机制组织也可以按临床使用场景组织不知道 LLM 内部偏向哪一种——作者分别按 mechanism of action 和 medical specialty 给药物上色比较 UMAP 聚类和 Silhouette Score发现尤其在 Llama3.3-70B 中药物按医学专科聚类通常比按作用机制更明显4.6 Novelty 6发现 Gemma/MedGemma 中间层 activation collapse模型中间层可能存在表示坍缩但这类现象在医学知识表示中很少被系统观察如果 UMAP 投影中大量不同医学概念在某些层坍缩成少数 blob说明这些层可能暂时丢失了区分性表示——作者对 Gemma3-27B 和 MedGemma-27B 的中间层 activation 做 UMAP发现部分中间层表示会坍缩但在后续层又恢复提示这些层可能存在 representational inefficiency5 方法5.1 整体pipeline第一步构造医学 prompt 集合作者围绕五类医学知识构造 prompt年龄、症状、疾病、药物、药物剂量每类 prompt 又服务于不同解释方法第二步对每个模型跑 forward保存每一层 activation模型输入一个医学 prompt 后每层 transformer block 都会产生 hidden state把每层中间表示拿出来分析。这样可以回答“某个医学概念在哪些层逐渐形成”第三步跑 UMAP 表示分析对于年龄、症状、疾病、药物等 prompt作者把每层 activation 降维到低维空间可视化时用 2D UMAP定量计算 Silhouette Score 时用 30D UMAP以保留更多信息对于类别型概念Silhouette Score 衡量同类样本是否更靠近、异类样本是否更分开Silhouette Score 的意义很简单如果同一类点彼此很近不同类点彼此很远那么分数高对于年龄这种连续变量作者不用 Silhouette而是用 local anisotropy 衡量年龄点是否接近一维流形并用线性回归 R² 衡量年龄是否线性可读Local anisotropy 衡量的是一堆点是否像一条线UMAP 模块回答的是“这些医学概念在 hidden space 里有没有形成结构可视化能力强但不一定证明因果作用。第四步跑 gradient-based weight saliency作者对目标答案的 loss 关于模型权重求梯度即看某层权重对医学答案的敏感程度如果某层权重梯度大说明模型回答该医学问题时更依赖这一层作者把 attention heads 和 MLP 的权重 saliency 按层平均再跨多个 prompt 平均得到每一层的 saliency 曲线。Saliency 模块回答的是“哪些层的参数对医学答案的 loss 更敏感”它能定位权重层面的重要性但梯度大不一定代表真实因果。第五步跑 layer lesioning。Layer lesioning 的做法是把某一层 transformer block 替换成 identity function相当于让这一层“不工作”然后观察模型回答退化多少退化程度由 GPT-4o 作为 judge 打分1/10 表示几乎没退化10/10 表示严重退化某层被移除后如果医学回答明显变差说明该层对该类医学知识重要Lesioning 模块回答的是“去掉某层后模型医学能力会不会明显下降它比 UMAP 更接近功能性分析但层之间可能有冗余因此某层不退化不代表没用第六步跑 activation patchingActivation patching 是最接近因果干预的方法最基本的设定是三次 forward passclean run、corrupted run、patched runpatching effect 怎么衡量通常不是只看最终生成文本因为文本生成有随机性也不好比较。更常用的是看目标答案 token 的 logitpatching effect (patched 的 logit 差值 - corrupted 的 logit 差值)/(clean 的 logit 差值 - corrupted 的 logit 差值)最后一步汇总成 LLM Medical Map5.2 使用的数据第一年龄 prompt。年龄从 1 到 100模板包括 “He is X years old.”、“She is X years old.”、“Someone is X years old.” 等用来分析年龄表示是否连续、线性、有无断点。第二症状 prompt症状被分为 pain、neurological、respiratory、digestive、cardiovascular、dermatological、musculoskeletal、psychological、genitourinary、ENT/ocular 等组别用于分析症状类别聚类第三疾病 prompt疾病按医学专科分类包括 cardiology、orthopedics、oncology、neurology、obstetrics gynecology、dermatology、gastroenterology、pulmonology、urology 等第四疾病进展 prompt作者为 Alzheimer’s disease、COVID-19、COPD、Parkinson’s disease 各构造 9 个阶段从健康、轻微症状、中重度症状到最终严重结局用来分析 progression geometry第五药物 prompt第六药物剂量 prompt作者构造不同剂量场景例如安全剂量和高风险剂量用 activation patching 或 saliency 分析模型如何处理 dosage 信息6 主要结论Llama3.3-70B 中年龄主要在 0–5 层附近被处理症状在 0–9 层以及 15–40 层有信号疾病在 0–5 或 27–37 层药物主要在 15–45 层药物剂量大致在前半部分层但结论更不稳定不同年龄 prompt 在 Llama3.3-70B 不同层的 UMAP 分布年龄不是一条简单直线而是在中间层形成弯曲、转向甚至断裂尤其在 17/18 岁附近出现明显 discontinuity说明模型可能把未成年人和成年人分成两个表示区域用 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 阶段 prompt 做 UMAP理想情况下疾病应从健康到严重阶段逐步远离健康状态但图中显示某些晚期阶段反而靠近早期阶段形成 circular / non-monotonic pattern。也就是说模型内部对疾病进展的表示不一定符合医学上的单调恶化逻辑Gemma3-27B 某些中间层的 UMAP 点坍缩成少数几个 blob但后面层又恢复分散。作者认为这可能表示中间层出现了表示能力浪费或者模型内部有某种压缩-恢复过程。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

linux系统下进行磁盘扩容

linux系统下进行磁盘扩容

本文中的前提是基于在虚拟化平台中进行扩容,在虚拟化平台中有个centos7.2镜像格式安装的centos7的系统;如果使用虚拟机,除前面两大步骤不一样外,后面服务器扩展分区的步骤都是一样 一、查看服务器磁盘 df -h fdisk -l 可以看到…

2026/7/31 18:17:53 阅读更多
Kissui.ScrollAnim 使用指南

Kissui.ScrollAnim 使用指南

Kissui.ScrollAnim 使用指南 【免费下载链接】kissui.scrollanim CSS3 scroll animation library 项目地址: https://gitcode.com/gh_mirrors/ki/kissui.scrollanim 项目介绍 Kissui.ScrollAnim 是一个基于 CSS3 的页面滚动动画库,由 Afshin Mehrabani 开发…

2026/7/31 18:17:53 阅读更多
从入门到精通:raft-boltdb核心功能与架构解析

从入门到精通:raft-boltdb核心功能与架构解析

从入门到精通:raft-boltdb核心功能与架构解析 【免费下载链接】raft-boltdb Raft backend implementation using BoltDB 项目地址: https://gitcode.com/gh_mirrors/ra/raft-boltdb raft-boltdb 是一个基于 BoltDB 的 Raft 后端实现,为分布式系统…

2026/7/31 19:18:23 阅读更多
form-generator:Element UI表单设计的终极解决方案

form-generator:Element UI表单设计的终极解决方案

form-generator:Element UI表单设计的终极解决方案 【免费下载链接】form-generator :sparkles:Element UI表单设计及代码生成器 项目地址: https://gitcode.com/gh_mirrors/fo/form-generator 你是否厌倦了重复编写复杂的表单代码?是否希望将表单…

2026/7/31 19:18:23 阅读更多
HART协议详解:05 HART现场通信实战

HART协议详解:05 HART现场通信实战

第五季 HART现场通信实战 ——从USB-HART Modem抓包到工程诊断:让协议知识变成维修能力 各位工业现场的工程师朋友们,大家好! 经过前四季的系统学习,我们已经构建了HART协议的完整理论框架: 第一季:六层生命模型与本质认知 第二季:物理层4–20mA与FSK魔法 第三季:数…

2026/7/31 0:14:40 阅读更多
维修工程师的示波器实战:02 探头地线——示波器最大的“坑”

维修工程师的示波器实战:02 探头地线——示波器最大的“坑”

第二篇:探头地线——示波器最大的“坑” ——那根不起眼的小地线,可能比你测的信号还重要 很多工程师第一次用示波器时,都会经历这样一个“惊魂”时刻。 某食品厂包装线,伺服偶发报警。年轻工程师判断是编码器信号受干扰,便拿出示波器认真测量。波形一出来,所有人都倒…

2026/7/31 0:14:40 阅读更多