ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

基于Agentic RAG与LLM的智能临床决策支持系统:多发性骨髓瘤病程推理实践

基于Agentic RAG与LLM的智能临床决策支持系统:多发性骨髓瘤病程推理实践 1. 项目概述当AI“医生”遇上多发性骨髓瘤的漫长病程最近在医疗AI圈子里一个词儿被反复提及Agentic。它不再是科幻小说里的概念而是实实在在地开始介入像多发性骨髓瘤Multiple Myeloma, MM这类复杂血液肿瘤的临床决策支持中。我花了几个月时间深度参与并复盘了一个名为“基于纵向骨髓瘤记录的智能体临床推理”的回顾性研究项目。简单说这个项目就是尝试用具备“智能体”Agent特性的大语言模型LLM去“阅读”一位多发性骨髓瘤患者长达数年的、包含门诊记录、化验单、影像报告、治疗方案和疗效评估的“病历小说”然后像一位经验丰富的血液科专家一样去推理病情演变、评估当前状态、甚至预判后续治疗方向。这听起来很酷但挑战巨大。多发性骨髓瘤的治疗本身就是一场“持久战”患者会经历诱导治疗、巩固治疗、维持治疗、复发后再治疗等多个阶段治疗方案组合如蛋白酶体抑制剂、免疫调节剂、单抗、CAR-T等繁多疗效评估指标如M蛋白、游离轻链、骨髓浆细胞比例、影像学改变复杂且动态变化。传统的临床决策支持系统CDSS往往基于规则或简单的机器学习模型难以处理这种高维度、长时序、非结构化的文本数据。而LLM特别是具备“智能体”能力的LLM给我们提供了新的可能性它能理解自然语言描述能进行多步推理能根据新信息调整判断就像一个不知疲倦的、能同时阅读成千上万份病历的“超级住院医”。我们这个项目的核心目标就是验证这种“智能体临床推理”在真实世界回顾性数据上的有效性。我们不是要取代医生而是想回答在一个严格设计的、与专家共识进行盲法对比的测试中AI智能体在解读复杂病程、识别关键治疗节点、判断疗效和疾病状态方面能达到什么水平这对于缓解顶尖医疗资源分布不均、辅助基层医生制定规范化治疗方案、乃至未来实现更精细化的个体化治疗都有着潜在的重大意义。2. 核心设计构建一个能“读懂”病程的AI智能体要让LLM变成一个合格的“血液科AI智能体”远不是丢给它一堆病历PDF那么简单。整个系统的设计思路可以概括为“一个核心两大支柱三层推理”。2.1 核心架构从RAG到Agentic RAG的演进项目初期我们首先尝试了经典的检索增强生成RAG框架。我们把所有患者的纵向记录文本进行分块、向量化存入向量数据库。当针对某个患者提问时例如“该患者2023年6月的疾病状态是什么”系统会检索相关的文本块连同问题一起送给LLM生成答案。但很快我们发现了问题。骨髓瘤的记录是时序性的且信息高度耦合。例如判断“疾病进展PD”需要同时满足多个条件M蛋白上升超过25%且绝对值增加5g/L或出现新的骨病变或浆细胞瘤。这些信息可能散落在不同时间点的“血清蛋白电泳报告”、“影像学报告”和“体格检查记录”中。简单的RAG检索出的片段可能是孤立的缺乏时序关联和逻辑串联LLM容易给出片面或矛盾的答案。因此我们转向了Agentic RAG的设计。这里的“智能体Agent”特性主要体现在两个方面自主规划与工具调用AI智能体不再被动地等待一个问题然后检索-生成。它被赋予一个高层目标例如“梳理患者张三从确诊到2024年5月的完整治疗史与疗效评估”。为了实现这个目标智能体会自主规划一系列子任务先调取患者基本信息然后按时间线获取关键化验结果接着提取各阶段的治疗方案再对照疗效标准进行判断最后综合生成一份病程摘要。每个子任务都可能触发对向量数据库、结构化实验室数据库如LIS甚至知识图谱的查询工具调用。迭代式推理与反思智能体具备“思考-行动-观察-再思考”的循环能力。例如在判断疗效时它可能先根据M蛋白变化初步判断为“非常好的部分缓解VGPR”但随后在检索到的“骨髓穿刺报告”中发现浆细胞比例仍偏高这会触发它的反思机制重新评估是否符合VGPR的严格定义要求骨髓浆细胞5%从而可能将结论修正为“部分缓解PR”。2.2 两大支柱高质量知识库与专业化提示工程支柱一领域知识深度嵌入。LLM本身具有广泛的医学知识但对于多发性骨髓瘤这种专科疾病其深度和准确性远远不够。我们构建了多层知识体系权威指南与共识将国际骨髓瘤工作组IMWG、美国国家综合癌症网络NCCN等的最新诊疗指南、疗效标准如IMWG统一疗效标准全文进行结构化处理作为核心知识源。本院诊疗规范与路径融合了项目合作医院的内部诊疗路径、常用方案组合如VRd, DRd, Dara-based regimens和不良反应处理常规让AI的推理更“接地气”。医学本体与知识图谱建立了针对骨髓瘤的轻量级知识图谱链接了疾病、症状、检查、药物、疗效术语等实体及其关系。例如“来那度胺”与“深静脉血栓”之间存在“可能引起不良反应”的关系这能帮助AI在解读病历中“患者出现下肢肿胀”时联想到药物不良反应的可能性。这些知识并非简单堆砌而是通过微调Fine-tuning和检索Retrieval两种方式注入系统。对核心的、不变的疗效标准我们采用轻量级微调让模型底层理解这些概念。对动态的、具体的患者数据则通过检索方式在推理时实时提供。支柱二精细化、链条式的提示词设计。这是将LLM“引导”成专科医生的关键。我们摒弃了单一的、笼统的提示设计了一套分阶段、角色明确的提示词链Prompt Chain信息提取与标准化提示首先让模型扮演“病历信息提取员”。提示词明确要求它从一段自由文本记录中按预设结构时间、检查项目、数值、结论提取关键信息。例如“从以下‘2023-08-15门诊记录’中提取所有与多发性骨髓瘤相关的实验室检查结果并以JSON格式输出包含字段date,test_name,result_value,unit。”时序重建与摘要提示接着让模型扮演“病程整理师”。将提取出的标准化信息按时间线排列并生成一段连贯的病程摘要。提示词会强调突出关键治疗事件如方案变更、干细胞移植和疗效转折点。临床推理与判断提示最后也是核心的一步让模型扮演“血液科会诊专家”。此时提供的提示词包含了具体的推理框架。例如“你是一名血液科专家。请基于以下患者时序数据应用IMWG 2016疗效标准逐步推理并判断患者在target_date的疾病状态。请按步骤展示你的推理a) 确认可评估指标b) 对比基线值和当前值c) 逐条对照疗效标准CR, VGPR, PR, SD, PDd) 给出最终判断及主要依据。”注意提示词中必须明确指令模型“逐步推理”Chain-of-Thought并要求其输出判断依据。这不仅是提高透明度的需要更是后续与专家共识进行比对、分析错误来源的关键材料。我们发现强制模型输出推理过程其最终结论的可靠性显著高于直接要求输出结论。2.3 三层推理框架的实现基于以上设计我们实现了从微观到宏观的三层推理数据层推理解决“病历里写了什么”的问题。利用信息提取提示从非结构化文本中准确抓取实体和数值。这里最大的挑战是表述多样性比如“M蛋白 25g/L”、“M蛋白浓度25g/dl”、“M蛋白升高至25g/L”模型必须归一化。事件层推理解决“发生了什么”的问题。将提取的数据点串联成临床事件如“2023年3月完成4周期VRd方案诱导治疗疗效评估为VGPR”。这需要模型理解治疗周期、方案缩写和疗效术语之间的关联。决策层推理解决“这意味着什么下一步该怎么办”的问题。这是智能体的核心价值。例如基于“患者维持治疗期间M蛋白水平在连续三次评估中呈缓慢上升趋势但未达到PD标准”模型应能推理出“疾病可能处于生化复发早期建议缩短随访间隔并评估是否需进行二代测序NGS检测克隆演变”。3. 实操要点从数据准备到评估闭环3.1 数据治理高质量输入的基石医疗AI项目七分靠数据三分靠算法。我们处理的是真实的、脱敏后的历史电子病历EMR数据涵盖了超过300例多发性骨髓瘤患者平均随访时间超过3年。第一步数据脱敏与清洗。脱敏严格去除所有个人身份信息PHI包括姓名、身份证号、住址、电话号码等。日期保留相对时间如以首次确诊日为D0或偏移处理。清洗这是最耗时但至关重要的环节。EMR文本充满噪音医生的口语化描述“病人今天感觉还行”、大量缩写“CTX”可能指环磷酰胺也可能指CT检查、不一致的术语“浆细胞”与“骨髓瘤细胞”混用、以及扫描件OCR识别错误。我们组建了由医学生和低年资医生组成的标注团队在资深专家指导下对文本进行校正和标准化注释。第二步纵向记录切片与对齐。病历不是一整篇文档而是按次就诊、按次住院产生的多条记录。我们以“患者”为中心将所有记录按时间戳严格排序形成一条纵向时间轴。每条记录都打上类型标签门诊病历、入院记录、病程记录、出院小结、检查报告、化疗记录单等。这为后续的时序理解奠定了基础。第三步关键信息结构化抽取预标注。为了训练和评估信息提取模型我们对部分数据进行了精细标注。例如在一份“血清免疫固定电泳”报告中我们会标注出{ 检测项目: 血清免疫固定电泳, 检测时间: 2023-10-11, M蛋白类型: IgG-κ型, M蛋白浓度: 12.5 g/L, 结论: 检测到单克隆免疫球蛋白条带 }这部分结构化数据既用于微调专用的信息提取模型也作为金标准用于评估我们智能体在“数据层推理”的准确性。3.2 智能体工作流的具体实现我们以开源框架如LangChain、LlamaIndex为基础构建了智能体工作流。以下是一个简化的核心流程说明用户提问用户输入查询如“患者P001在2024年1月是否达到完全缓解CR请说明理由。”智能体初始化与规划系统根据问题初始化一个专用于“疗效评估”的智能体。智能体内部规划任务链确定患者 - 获取该时间点前后所有相关数据 - 提取关键疗效指标 - 对照CR标准逐项核对 - 综合判断并生成解释。工具调用与信息收集智能体调用“患者ID查询工具”将“P001”转换为内部唯一标识。调用“时序数据检索工具”以2024年1月为锚点检索前后3个月内的所有病历片段、实验室结果和影像报告。调用“知识检索工具”获取最新的IMWG CR标准定义需满足血清和尿免疫固定电泳阴性软组织浆细胞瘤消失骨髓中浆细胞5%。迭代推理与生成智能体将收集到的信息患者数据知识标准填入设计好的“临床推理提示词”模板中。LLM我们主要测试了GPT-4、Claude 3和微调后的Llama 3模型根据提示进行逐步推理。推理过程会被记录。如果发现信息矛盾如一份报告提示“血免疫固定电泳阴性”但另一份同期“尿本周蛋白阳性”智能体会触发反思可能重新检索或要求澄清。输出与格式化最终智能体输出结构化的答案例如判断未达到完全缓解CR。主要依据根据2024-01-15的血清免疫固定电泳报告结果为“阴性”符合CR标准第一条。根据2024-01-10的骨髓穿刺报告骨髓浆细胞比例为3%5%符合CR标准第二条。关键不符点2024-01-12的尿常规检查显示“尿本周蛋白弱阳性”。根据IMWG标准CR要求血和尿免疫固定电泳均阴性。尿本周蛋白阳性提示可能存在游离轻链需进行尿免疫固定电泳确认。但现有记录中未见尿免疫固定电泳阴性报告。结论因缺乏尿免疫固定电泳阴性的关键证据且尿本周蛋白阳性故不能判定为CR。建议完善尿免疫固定电泳检查。3.3 评估体系如何与专家共识“对标”项目的核心是“回顾性评估”评估标准就是“专家共识”。我们设计了双盲、分层的评估方案专家共识形成我们邀请了3位来自合作医院的、具有10年以上骨髓瘤诊疗经验的副主任及以上级别医师组成专家小组。从测试集中随机抽取50例复杂病例涵盖初治、复发难治、治疗相关并发症等多种场景。每位专家独立、完整地阅读病例的所有纵向原始资料脱敏后并回答一套标准化问题如指定时间点的疗效、疾病状态、后续治疗建议等。专家们背对背给出答案和推理过程。对于答案不一致的病例专家小组进行面对面讨论直至达成一致意见形成最终的“专家共识金标准”。智能体评估同样的50例病例同样的标准化问题交由我们训练的AI智能体系统作答。系统输出的答案包括最终判断和推理链被记录下来所有可识别系统特征的标识被移除。比对与度量终点判断一致性比较AI与专家共识在最终结论如CR, PR, PD, SD上的一致性。采用精确匹配和Cohen‘s Kappa系数来衡量。推理过程可接受度这是更重要的维度。由另一位未参与共识形成的高年资医生对AI输出的推理链进行盲审评分0-5分评估其逻辑的合理性、证据引用的完整性以及结论推导的严谨性。即使最终判断与专家略有出入但如果推理过程合理且证据充分也会获得较高分数。错误根因分析对所有不一致的案例进行深入分析归类错误来源数据提取错误AI误读了化验单上的数值或结论。知识应用错误AI错误应用了疗效标准例如将“VGPR”的标准误用于“PR”。逻辑推理错误AI正确提取了数据也知晓标准但在综合判断时出现逻辑谬误。信息缺失导致的不确定专家根据临床经验对缺失信息进行了合理推断而AI严格基于现有文本给出了“信息不足”或更保守的判断。4. 实战复盘结果、挑战与深度思考经过严格的回顾性评估我们的智能体系统在一些核心任务上展现出了令人鼓舞的潜力但也暴露了诸多亟待解决的深层次问题。4.1 核心结果与亮点在50例测试病例上系统主要表现如下评估任务与专家共识的精确匹配率Cohen‘s Kappa系数推理过程平均可接受度5分制疗效评估CR/VGPR/PR/SD/PD78%0.71 (良好一致性)3.8疾病状态判断活动/稳定/复发/进展82%0.75 (良好一致性)4.0关键治疗事件识别如方案变更、移植95%0.90 (几乎完全一致)4.5下一步治疗建议大类方向65%0.55 (中等一致性)3.2亮点分析信息提取与事件识别准确率高对于相对客观的信息治疗方案名称、用药时间、具体的实验室数值和明确的事件AI智能体的表现非常出色甚至能发现一些人工浏览时可能忽略的、记录在角落里的关键数据。这证明了其在处理海量文本信息方面的效率优势。结构化推理任务表现稳健在应用IMWG等有明确条文规定的疗效标准进行判断时只要输入数据准确AI的推理过程严谨、一致与专家共识的一致性较高。它不会像人类医生那样因疲劳或先入为主而产生偏差。推理链提供可解释性系统输出的逐步推理过程不仅让医生能够理解AI的“思考”路径便于验证和信任更重要的是当出现判断不一致时医生可以快速定位分歧点是数据理解不同还是标准应用有歧义从而将讨论聚焦在真正的临床疑点上提升了人机协作的效率。4.2 遭遇的典型挑战与解决方案挑战一病历文本的模糊性与隐含信息。这是导致错误的主要原因之一。医生记录病历时会默认很多临床共识。案例病历写道“患者一般情况可继续原方案治疗”。AI可能据此判断“疾病稳定”。但专家结合上下文之前疗效已达VGPR本次血常规提示轻度骨髓抑制认为这暗示“治疗耐受性良好疗效维持”甚至可能隐含“疗效已达平台期”的考量。AI缺乏这种深层次的语境和临床经验。应对策略我们尝试在提示词中增加“上下文解读”的指令并引入“临床情境嵌入”模块。例如在分析某条记录前先让模型生成一份“当前患者临床情境摘要”如处于移植后维持治疗阶段既往对来那度胺耐受良好再将此摘要作为背景知识融入后续具体记录的解读中。这在一定程度上提升了模型对隐含信息的感知能力。挑战二复杂、矛盾与不完整的数据。真实病历常出现数据矛盾不同科室报告数值略有差异或时序不连续关键检查缺失。案例判断是否“复发”需要连续监测的M蛋白数据但患者某次复查只做了血常规未做蛋白电泳。AI可能因缺乏关键数据而无法判断或误判。而专家可能会参考其他间接指标如血红蛋白下降、钙离子升高或根据经验推断“很可能已生化复发”。应对策略我们增强了智能体的“不确定性量化”和“信息请求”能力。当关键数据缺失或矛盾时系统不再强制给出一个“硬判断”而是输出如“判断置信度低。因缺乏[具体检查项目]在[时间点]的数据无法根据IMWG标准明确判断复发。建议优先完善[具体检查项目]。”同时系统可以生成一个“为明确诊断所需补充信息清单”辅助医生决策。挑战三医学知识的快速更新与个体化差异。诊疗指南每年都可能更新新药、新方案不断涌现。此外标准指南无法覆盖所有个体情况如高龄、严重合并症患者。案例对于“肾功能不全的骨髓瘤患者”一线治疗方案的选择可能与标准指南不同。AI如果仅基于过时的或通用的知识库可能给出不合适的建议。应对策略我们设计了动态知识更新管道。一方面定期自动抓取和解析最新发布的指南、重要临床研究经专家审核后注入知识库。另一方面系统支持“本地化知识注入”合作医院可以将自己的专家共识、特殊病例处理经验作为“本地知识”增强给智能体使其推理更符合本机构的临床实践。挑战四计算成本与响应速度。Agentic RAG涉及多轮LLM调用、多次向量检索对于一份长达数年的复杂病历进行深度推理耗时可能达到数十秒甚至分钟级这在临床实时场景下是不可接受的。应对策略我们采用了混合策略。对于高频、模式固定的查询如“提取本次化验的M蛋白值”训练了轻量级的专用微调模型速度极快。对于复杂的综合推理则采用异步任务队列处理医生提交问题后系统在后台运行完成后通过消息通知。同时我们对检索范围进行优化利用患者时间轴元数据预先缩小检索窗口减少不必要的向量计算。4.3 对未来技术路线的思考通过这个项目我对Agentic AI在复杂医疗场景下的应用有了更现实的看法。“大模型小模型”混合架构是必由之路不要指望一个通用LLM解决所有问题。未来的系统应该是分层的底层由高效、精准的小模型如信息抽取模型、术语标准化模型处理结构化任务中层由具备强大推理能力的LLM如GPT-4、Claude担任“临床推理引擎”顶层则由一个“智能体调度中心”来规划任务、管理工具调用和迭代反思。这种架构在准确性、速度和成本间能取得更好平衡。人机协作的界面CHI至关重要AI不应是一个黑箱。我们的评估显示医生最看重的不是AI的“绝对正确率”这短期内很难超越顶尖专家而是其推理过程的可视化、可质疑和可修正。未来的系统需要提供强大的交互界面允许医生点击AI推理链中的任何一步查看其依据的数据来源和知识条目并能手动修正或补充信息让AI在此基础上重新推理。AI扮演的是“超级助理”或“第二意见提供者”的角色。评估标准需超越简单的一致性与专家共识的匹配率只是一个起点。更重要的评估维度应包括AI是否帮助医生发现了被忽略的关键信息是否缩短了医生阅读病历的时间是否在疑难病例的讨论中提供了新的、合理的思考角度这些“增值效应”才是AI临床助理真正的价值所在。数据质量与标准化是天花板本项目再次印证AI的上限由数据质量决定。推动电子病历的语义化、结构化录入比追求更复杂的算法更有长远价值。如果未来病历能部分采用结构化表单与自由文本相结合的方式并强制关键疗效指标的标准编码如LOINC, SNOMED CT那么AI智能体的准确性和实用性将得到质的飞跃。这个项目像是一次深入的“压力测试”让我们看清了Agentic Clinical Reasoning的曙光与荆棘。它绝不仅仅是简单的问答而是构建一个能够理解临床叙事、遵循医学逻辑、并与人类专家协同工作的认知系统。路还很长但方向已经清晰以临床价值为核心以可解释、可交互为设计原则踏踏实实地解决每一个具体问题。在这个过程中AI不是替代医生而是在帮助医生尤其是资源不足地区的医生去更好地践行那些他们早已熟稔于心的医学知识与仁心仁术。
返回列表