
文章主要内容和创新点主要内容本文聚焦生物医学多模态大型语言模型(MLLMs)的安全保护问题,针对训练数据中可能包含的私人信息和错误知识导致的隐私泄露或不安全输出,提出了基于机器遗忘(Machine Unlearning, MU)技术的解决方案。问题背景:生物医学MLLMs训练数据来源复杂,易混入私人信息(如患者数据)和错误知识(如过时诊断指南),而重新训练模型成本极高,机器遗忘技术可选择性移除有害知识同时保留必要能力。核心贡献:构建了首个生物医学多模态遗忘基准MLLMU-Med,涵盖两个关键场景(隐私保护、错误知识移除),通过创新的数据生成流程整合合成私人数据和错误事实;提出遗忘效率评分(Unlearning Efficiency Score, UES),作为统一指标量化遗忘效果(需同时考虑遗忘集、保留集和测试集的表现);在MLLMU-Med上评估了5种主流遗忘方法,发现现有方法在生物医学MLLMs中移除有害知识的效果有限,存在较大改进空间。创新点首个生物医学多模态遗忘基准MLLMU-Med:针对隐私泄露(患者信息误录入)和错误知识(不可靠来源的医学信息)两个高风险场景,基于SLAKE和MM-Skin数据集构建,包含遗忘集、保留集和测试集,支持系统评估遗忘方法。统一评