ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

学术速递 | AAAI 2026 Accepted Papers For Image Fusion @ 请选出你心中的最佳论文!

学术速递 | AAAI 2026 Accepted Papers For Image Fusion @ 请选出你心中的最佳论文! 检索说明本文的检索方式是在 AAAI 官网 Main Track Schedules 页面中分别在 Oral 和 Poster 页面中以 “Image Fusion” 作为关键词进行检索共检索到 15 篇相关论文。其中Oral 论文 4 篇Poster 论文 11 篇。文末有投票请为你心中的最佳论文投上一票❤️ 后续将进一步分享大家所喜欢的最佳论文。检索网址为HTTPS://aaai.org/conference/aaai/aaai-26/main-technical-track/趣味问答 QA01Oral 论文分别来自哪些团队武汉大学RFC大连民族大学M²-CoFS厦门大学 / 香港科技大学 /中国科学技术大学SMC-Mamba吉林大学、大连民族大学ControlFuse02哪所高校论文数量最多大连民族大学3 篇天津大学2 篇东南大学2 篇吉林大学2 篇大连理工大学2 篇03哪个小方向中稿数量最多一面向真实复杂场景的退化鲁棒性二文本、语言、指令、掩码等交互式控制三与检测、分割等下游任务深度耦合四统一模型与跨任务泛化能力。04今年最明显的技术关键词是什么从这 15 篇论文来看AAAI 2026 图像融合方向的关键词可以概括为语言引导、可控融合、退化感知、自监督学习、Mamba、统一模型、高光谱融合、域自适应、任务协同、下游感知。Oral Talk01-Oral-Paper ID: 5718题目Robust Fusion Controller: Degradation-Aware Image Fusion with Fine-Grained Language Instructions | 鲁棒融合控制器基于细粒度语言指令的退化感知图像融合作者Hao Zhang*, Yanping Zha*, Qingwei Zhuang, Zhenfeng Shao, Jiayi Ma†单位武汉大学代码HTTPS://GitHub.com/HaoZhang1018/RFC下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38240摘要当前图像融合方法在适应真实世界环境时仍面临困难尤其是这些环境通常包含具有空间变化特性的多样化退化。为应对这一挑战我们提出了一种鲁棒融合控制器Robust Fusion Controller, RFC该方法能够通过细粒度语言指令实现退化感知的图像融合从而保证其在恶劣环境中的可靠应用。具体而言RFC 首先解析语言指令并创新性地推导出功能条件和空间条件前者用于指定需要去除的退化类型后者用于定义该退化的空间覆盖范围。随后通过一个多条件耦合网络生成复合控制先验实现从抽象语言指令到潜在控制变量的无缝转换。接着我们设计了一种基于混合注意力的融合网络用于聚合多模态信息。其中所获得的复合控制先验被深度嵌入网络中以对中间融合特征进行线性调制。为确保语言指令与控制结果之间的一致性我们进一步引入了一种新的语言-特征对齐损失用于约束特征级增益与复合控制先验之间的一致性。在公开数据集上的大量实验表明所提出的 RFC 能够有效应对多种复合退化尤其在极具挑战性的眩光场景下表现出较强的鲁棒性。02-Oral-Paper ID: 21844题目Breaking Task Boundaries: A Unified Model for 3D Medical Image Fusion and Segmentation Guided by Manifold Perspective | 打破任务边界流形视角引导下的三维医学图像融合与分割统一模型作者 Zeyu Wang, Jiayu Wang, Haiyu Song*单位大连民族大学代码HTTPS://GitHub.com/Wangjiayu0512/M2-CoFS下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38008摘要三维医学图像融合Medical Image Fusion, MIF与三维医学图像分割Medical Image Segmentation, MIS是医学图像分析中至关重要且具有内在协同性的任务。然而从根本上将二者进行统一建模仍然极具挑战性原因在于有效的协同范式仍然较为稀缺并且二者的优化目标存在本质差异。此外现有持续学习技术仍无法在共享权重的条件下同时使两个任务达到真正先进的性能。为应对上述挑战我们提出了 M²-CoFS这是一种能够联合处理三维医学图像融合与分割任务的统一模型。我们的核心贡献是一种“网络引导网络学习”network-guided network learning范式旨在打破任务边界。具体而言我们将 MIF 与 MIS 的权重空间建模为高维流形并创新性地使用一个轻量级神经网络隐式构建共享流形。值得注意的是该网络能够为两个任务输出统一权重。为确保共享流形保留两个原始流形的内在几何结构我们将流形距离嵌入该网络的损失函数中作为约束。此外围绕上述核心贡献我们设计了一种定制化的三阶段训练范式。第一阶段侧重于独立任务优化以获得高质量权重第二阶段通过跨任务权重适配策略降低任务之间的权重空间距离第三阶段则对应本文的核心创新。实验结果表明M²-CoFS 在 MIF 和 MIS 两个任务上均持续优于当前最先进的对比模型。03-Oral-Paper ID: 5867题目Self-supervised Multiplex Consensus Mamba for General Image Fusion | 面向通用图像融合的自监督多路共识 Mamba作者Yingying WangRongjin ZhuangHui ZhengXuanhua HeKe CaoXiaotong Tu*Xinghao Ding单位厦门大学香港科技大学中国科学技术大学下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38932摘要图像融合旨在整合来自不同模态的互补信息生成高质量融合图像从而增强目标检测、语义分割等下游任务。不同于主要关注模态间信息整合的任务特定方法通用图像融合需要覆盖更广泛的融合任务并在不增加复杂度的前提下提升性能。为此本文提出 SMC-Mamba即一种面向通用图像融合的自监督多路共识 Mamba 框架。具体而言模态无关特征增强模块MAFE通过自适应门控保留精细细节并通过空间-通道扫描与频率-旋转扫描增强全局表征。多路共识跨模态 Mamba 模块MCCM能够实现多个专家之间的动态协作并通过达成共识高效整合多模态互补信息。MCCM 中的跨模态扫描进一步增强了模态间特征交互促进来自不同源图像的关键信息无缝融合。此外本文引入双层自监督对比学习损失BSCL在不增加计算开销的情况下保留高频信息同时提升下游任务性能。大量实验表明该方法在红外-可见光融合、医学图像融合、多聚焦融合、多曝光融合以及下游视觉任务中均优于现有先进图像融合算法。04-Oral-Paper ID: 19964题目ControlFuse: Instruction-guided Multi-Granularity Controllable Image Fusion | ControlFuse指令引导的多粒度可控图像融合作者Libo ZhaoXiaoli ZhangZeyu Wang*单位吉林大学大连民族大学代码HTTPS://GitHub.com/zhaolb4080/ControlFuse下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38321**摘要**红外与可见光图像融合Infrared and Visible Image Fusion, IVIF通过融合互补视觉信息生成增强图像。然而现有大多数方法生成的是固定输出无法灵活适应用户的特定需求。近年来文本引导方法提供了一定程度的可控性但其控制能力主要局限于全局或语义层面缺乏实例级控制。这一限制主要源于两个挑战第一缺少能够直接关联文本指令与对应空间标注的数据集第二现有粗粒度跨模态对齐方法难以将文本指令与视觉特征进行精确匹配。为解决这些问题本文提出 ControlFuse一种由用户指令引导的可控 IVIF 框架能够在全局、语义和实例三个层面实现多粒度融合。首先本文构建了一个自动化多粒度数据集在上述三个层级上提供显式的文本—掩码对应关系。其次受流形几何启发本文设计了多模态特征交互模块Multimodal Feature Interaction Module, MFIM该模块由特征流形转换器Feature Manifold Converter, FMC和曲率引导交互模块Curvature-Guided Interaction, CGI组成。FMC 将文本特征与视觉特征投影到统一流形空间中而 CGI 则利用流形曲率作为几何线索以细化跨模态对齐。大量实验验证了 ControlFuse 的有效性表明其在鲁棒性和灵活性方面优于现有先进方法。☆ Poster Presentations☆05-Paper ID: 542 Hall3题目A Hybrid Space Model for Misaligned Multi-modality Image Fusion | 面向未配准多模态图像融合的混合空间模型作者Yi Xiao*Jia Wang*Zhu LiuDi WangJinyuan LiuRisheng Liu†单位大连理工大学中国民航大学代码HTTPS://GitHub.com/xiao-eee/HMMF.git下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38078摘要红外与可见光图像融合旨在整合互补信息例如红外图像中的热显著性信息和可见光图像中的细粒度纹理细节。然而真实世界中的多模态错位与几何形变往往会引入严重伪影。现有大多数方法主要关注欧氏空间中的特征提取因而忽略了多模态表征中固有的层次结构。欧氏空间擅长保留局部结构细节并支持高效计算而双曲空间由于其几何特性天然适合建模层次关系。基于这一观察本文提出一种通过双空间架构联合优化图像配准与融合的统一框架。该架构协同结合了欧氏几何的局部保真能力与双曲几何的层次建模能力以增强多模态表征学习。具体而言本文提出双曲耦合对比学习优化Hyperbolic Coupled Contrastive Learning Optimization, HCCLO用于在双曲空间中对齐并优化红外与可见光嵌入的层次结构。此外本文设计了一种任务自适应双空间特征融合机制能够动态平衡并融合欧氏局部特征与双曲层次表征从而提升对下游任务的适应能力。在未配准多模态数据集上的大量实验表明本文方法取得了当前先进性能并能够有效捕获空间依赖关系与层次语义信息。06-Paper ID: 648 Hall3题目NODiff: Neural Operator Diffusion for Multispectral Image Fusion | NODiff面向多光谱图像融合的神经算子扩散模型作者Junming Hou*Ran Ran*Sixing ChenZihao ChenXiaofeng CongJunling Li†Liang-Jian Deng†单位东南大学电子科技大学四川省多灾种早期预警重点实验室代码HTTPS://GitHub.com/coder-JMHou/NODiff下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/42477摘要全色锐化是一种通过融合低分辨率多光谱图像LRMS与纹理丰富的全色图像PAN生成高分辨率多光谱图像HRMS的重要技术能够有效缓解卫星传感器物理成像条件的限制。尽管近年来生成式扩散模型在该领域取得了显著性能提升但其高昂的计算需求和训练成本限制了其在资源受限遥感卫星系统中的实际应用。为此本文提出 NODiff一种新的扩散框架用神经算子替代传统基于注意力机制的去噪主干网络将算子学习与生成建模无缝结合形成一种高效且有效的全色锐化解决方案。具体而言本文采用两阶段学习范式实现该方法首先预训练所提出的基于神经算子的扩散模型以学习全色锐化所需的高分辨率纹理先验随后冻结预训练参数并设计轻量级条件细节引导适配器以高效微调用于生成目标 HRMS 图像。同时本文引入时间感知低秩适配机制用于动态细化可能受到频谱模式截断影响的高频细节。多个基准数据集上的大量实验表明NODiff 在显著降低训练和推理成本的同时取得了具有竞争力的全色锐化性能。此外本文方法也为构建资源高效型生成模型提供了新的思路。07-Paper ID: 817 Hall3题目MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics | MdaIF语言驱动语义引导的鲁棒一站式多退化感知图像融合作者Jing LiYifan WangJiafeng YanRenlong ZhangBin Yang*单位华东师范大学中央财经大学湖南大学代码HTTPS://GitHub.com/doudou845133/MdaIF下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/37548摘要红外与可见光图像融合旨在将互补的多模态信息整合到单一融合结果中。然而现有方法存在两个主要问题其一未能充分考虑恶劣天气条件下可见光图像的退化从而损害融合性能其二依赖固定网络架构限制了其对多样化退化场景的适应能力。为解决上述问题本文提出一种由大语言模型驱动的面向多退化场景的一站式退化感知图像融合框架 MdaIF。考虑到雾、雨、雪等不同退化场景在大气传输中具有不同的散射特性本文引入混合专家Mixture-of-Experts, MoE系统以处理多退化场景下的图像融合问题。为自适应提取多样化的天气感知退化知识与场景特征表示即语义先验本文在框架中采用预训练视觉语言模型Vision-Language Model, VLM。在语义先验的引导下本文提出退化感知通道注意力模块Degradation-aware Channel Attention Module, DCAM通过退化原型分解促进通道域中的多模态特征交互。此外为实现有效的专家路由本文利用语义先验和通道域调制特征共同引导 MoE使模型能够在复杂退化场景下实现鲁棒图像融合。大量实验验证了 MdaIF 的有效性并表明其性能优于现有先进方法。08-Paper ID: 783 Hall3题目Revisiting Network Inertia: Dynamic Inertia Inhibition Coupled Multidimensional Periodicity for Infrared and Visible Image Fusion | 重新审视网络惯性动态惯性抑制耦合多维周期性的红外与可见光图像融合作者Yufeng ChenYuan SunHao PanXujian ZhaoJian DaiZhenwen Ren*Xingfeng Li*单位西南科技大学四川大学西南自动化研究所代码HTTPS://GitHub.com/YufengChen1113/AIDFusion下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/37309摘要红外与可见光图像融合Infrared and Visible Image Fusion, IVIF技术能够整合多源信息已成为备受关注的前沿方向。然而深度网络中权重更新逐渐减缓的现象即“网络惰性”现象使现有方法远未充分发挥网络的表征潜力。为此本文提出一种面向 IVIF 的轻量级融合方法 Anti-Inert Dynamic FusionAIDFusion旨在充分利用网络各层级的潜能。具体而言本文通过渐进式调控网络中多层级预测的协同学习过程提出动态惯性抑制学习策略Dynamic Inertia Inhibition Learning Strategy, DIILS以自适应且高效地抑制惯性累积。随后为深入挖掘网络表征潜力并突破性能瓶颈本文提出轻量级多维调制融合模块Multi-dimensional Modulation Fusion Module, MMFM用于高效捕获全面的多视角、多尺度特征。最后考虑到 DIILS 预测图与 MMFM 融合特征之间存在语义偏差本文在特征恢复阶段设计傅里叶分析卷积Fourier Analysis Convolution, FAConv作为预测与融合之间的桥梁以完成隐式周期建模。基于上述设计在三个公开 IVIF 数据集上的大量实验表明与当前先进基线方法相比AIDFusion 在融合性能和计算开销方面均具有双重优势。09-Paper ID: 773 Hall3题目CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion | CtrlFuse掩码提示引导的可控红外与可见光图像融合作者Yiming SunYuan RuanQinghua HuPengfei Zhu*单位东南大学天津大学雄安国家创新中心雄安国创蓝天科技有限公司代码HTTPS://GitHub.com/Sevryy/CtrlFuse下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38321摘要红外与可见光图像融合通过结合互补模态生成具备全天候感知能力的图像从而增强智能无人系统的环境感知能力。现有方法要么侧重于像素级融合而忽略下游任务适应性要么通过级联检测或分割模型隐式学习固定语义难以交互式地满足多样化语义目标感知需求。为此本文提出 CtrlFuse一种由掩码提示引导的可控图像融合框架能够实现交互式动态融合。该模型集成了多模态特征提取器、参考提示编码器Reference Prompt Encoder, RPE和提示语义融合模块Prompt-Semantic Fusion Module, PSFM。其中RPE 通过输入掩码引导对预训练分割模型进行微调动态编码任务特定的语义提示PSFM 则将这些语义信息显式注入融合特征。通过对并行分割分支和融合分支进行协同优化本文方法实现了任务性能与融合质量的相互增强。实验结果表明该方法在融合可控性和分割精度方面均取得了当前先进性能并且适配后的任务分支甚至优于原始分割模型。10-Paper ID: 802 Hall3题目Dream-IF: Dynamic Relative EnhAnceMent for Image Fusion | Dream-IF面向图像融合的动态相对增强作者Xingxin XuBing Cao*DongDong LiQinghua HuPengfei Zhu*单位天津大学雄安国家创新中心雄安国创蓝天科技有限公司国防科技大学代码HTTPS://GitHub.com/jehovahxu/Dream-IF下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38126摘要图像融合旨在整合来自多源图像的综合信息。然而由不同传感器采集的图像往往会遭遇多种退化从而影响融合质量。传统融合方法通常将图像增强与图像融合视为两个独立过程忽略了二者之间的内在关联尤其是融合图像中某一模态的优势区域往往指示了另一模态可能需要增强的区域。受此观察启发本文提出用于图像增强的优势区域概念并提出面向图像融合的动态相对增强框架 Dream-IF。该框架能够量化不同层级中各模态的相对优势并利用该信息促进跨模态的相互增强。通过融合过程中得到的相对优势信息本文方法不仅支持图像复原也可扩展到更广泛的图像增强应用。此外本文采用基于提示的编码方式捕获退化特定细节动态引导复原过程并促进多模态图像融合与图像增强场景中的协同增强。大量实验结果表明Dream-IF 持续优于现有对比方法。11-Paper ID: 632 Hall3题目CO²IF: Language-Bridging Hyperspectral-Multispectral Image Fusion with Coordinated and Cross-modal Optimal Transport | CO²IF基于协同与跨模态最优传输的语言桥接高光谱-多光谱图像融合作者Mingjin ZhangZhongkai Yang*Fei Gao*单位西安电子科技大学代码HTTPS://GitHub.com/yzkLearning/CO2IF下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38261摘要由于直接获取高分辨率高光谱图像HR-HSI存在困难低分辨率高光谱图像LR-HSI与高分辨率多光谱图像HR-MSI的融合已成为一种有效方案。现有方法虽然利用了来自 HR-MSI 的图像级先验但通常缺乏显式语义引导难以实现精确的细节重建。鉴于文本场景描述包含有价值的目标属性与上下文信息本文提出首个面向高光谱与多光谱图像融合的语言桥接框架 CO²IF。CO²IF 将语言语义作为先验知识显式引导重建过程。为弥合文本描述与高维高光谱数据之间的模态差异本文设计了跨模态最优传输模块Cross-modal Optimal Transport, COT用于在语言特征与各个光谱波段的视觉线索之间建立精确的语义对应关系。在语义对齐的基础上本文进一步提出多模态协同状态空间模型Multimodal Coordinated State Space Model, CoMamba有效融合来自语言的先验、HR-MSI 的空间信息以及 LR-HSI 的光谱信息。该语言引导重建机制显著增强了关键空间-光谱细节的提取能力从而生成具有更高保真度的 HR-HSI。此外本文为三个常用数据集补充了文本描述。公开数据集上的定性与定量实验结果表明所提出方法相比现有先进方法具有明显优势。12-Paper ID: 925 Hall3题目Domain Adaptation Guided Infrared and Visible Image Fusion | 域自适应引导的红外与可见光图像融合作者Tianwei GuanHaozhen WeiYuhan ZhouJun MaZecheng XuZhiying JiangJinyuan LiuXingyuan Li*单位香港中文大学大连理工大学浙江大学北京交通大学大连海事大学代码HTTPS://GitHub.com/wellwhz/DAFusion下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/42435摘要红外与可见光图像融合Infrared and Visible Image Fusion, IVIF旨在整合不同模态中的互补信息以提升图像质量。然而在新的天气或场景等未见条件下现有方法的效果往往会下降这主要源于可见光模态数据分布变化带来的域偏移而红外模态相对稳定。为解决图像融合过程中由模态不平衡引起的域偏移问题本文提出一种域自适应引导的红外与可见光图像融合方法 DAFusion。该方法利用双秩域适配器使模型能够在图像融合过程中快速适应多样化恶劣条件。具体而言本文分别采用可训练的低秩与高秩嵌入空间来捕获跨域共享知识和目标域特有知识。为更有效地利用双秩适配器本文进一步设计了稳态知识分配策略根据目标域的不确定性动态整合不同类型的知识。由于域自适应通常侧重于跨域特征对齐并强调不变性而图像融合目标则要求保留具有判别性和互补性的特征两者之间存在优化冲突。为协调这一问题本文进一步采用双层优化框架从结构上解耦域自适应目标与图像融合目标使融合模块能够引导自适应过程并反过来受益于域对齐后的表征。在三个基准数据集上的实验结果表明本文方法显著优于现有先进方法不仅提升了融合质量也改善了后续高级视觉任务的性能。13-Paper ID: 855 Hall3题目PIF-Net: Ill-Posed Prior Guided Multispectral and Hyperspectral Image Fusion via Invertible Mamba and Fusion-Aware LoRA | PIF-Net基于可逆 Mamba 与融合感知 LoRA 的病态先验引导多光谱与高光谱图像融合作者Baisong LiXingwang Wang*Haixiao Xu单位吉林大学代码HTTPS://GitHub.com/oldsweet/PIF-Net下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/37519摘要多光谱与高光谱图像融合Multispectral and Hyperspectral Image Fusion, MHIF的目标是生成同时具备丰富光谱信息和精细空间细节的高质量图像。然而由于光谱信息与空间信息之间固有的权衡关系以及观测数据的有限性该任务本质上是一个病态问题。以往研究尚未有效解决由数据错位引起的病态性。为应对这一挑战本文提出一种名为 PIF-Net 的融合框架将病态先验显式引入多光谱图像与高光谱图像融合过程。为平衡全局光谱建模能力与计算效率本文设计了一种基于可逆 Mamba 架构的方法在特征变换与融合过程中保持信息一致性从而确保稳定的梯度流和过程可逆性。此外本文提出一种新的融合模块即融合感知低秩适配模块Fusion-Aware Low-Rank Adaptation, Fusion-Aware LoRA能够在保持模型轻量化的同时动态校准光谱特征与空间特征。多个基准数据集上的大量实验表明PIF-Net 在保持模型效率的同时相比当前先进方法取得了显著更优的图像复原性能。14-Paper ID: 477 Hall3题目SigFusion: Unified Signal-Level Self-Supervised Learning Paradigm for Image Fusion | SigFusion面向图像融合的统一信号级自监督学习范式作者Zeyu WangJiawei FengJiayu WangPengjie WangHaiyu Song*单位大连民族大学代码HTTPS://GitHub.com/fengjiawei123/SigFusion下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/38009摘要图像融合Image Fusion, IF旨在将来自多个源图像的互补特征整合到单幅图像中。然而该领域面临的一个关键挑战是缺乏大规模真实世界训练数据集。现有模型通常依赖小规模数据集或依赖合成但真实性较弱的数据集。为解决这一问题本文提出 SigFusion一种面向多种图像融合任务的统一信号级自监督学习范式。其核心思想是利用信号级伪标签生成网络Pseudo-Label Generation Networks, PLGN从海量无标注自然图像中自动合成具有真实多源信号特征的训练集与伪标签。PLGN 包含两个关键组件可学习的一维信号调制器Signal Modulator, SM和 SigFormer。SM 学习不同源图像中的隐式一维信号模式并将其嵌入自然图像中从而减小合成数据集与真实数据集之间的域差距。SigFormer 将 Transformer 与信号处理方法相结合为 SM 构建合适的信号表征空间其级联式多层设计能够从粗到细地进行层次化特征学习。此外由于 SigFormer 遵循经典的分解—重建范式因此也可以作为灵活的图像融合骨干网络。实验结果表明SigFusion 在多个图像融合任务上均达到当前先进性能包括医学图像融合、红外—可见光图像融合、多聚焦图像融合和多曝光图像融合。15-Paper ID: 793 Hall3题目Text-Guided Channel Perturbation and Pre-Trained Knowledge Integration for Unified Multi-Modality Image Fusion | 文本引导通道扰动与预训练知识集成的统一多模态图像融合作者Xilai LiXiaosong Li*Weijun Jiang单位佛山大学代码HTTPS://GitHub.com/ixilai/UP-Fusion下载HTTPS://ojs.aaai.org/index.PHP/AAAI/article/view/37581摘要多模态图像融合通过结合互补信息来增强场景感知。统一模型旨在为多模态图像融合任务共享参数但不同模态之间的显著差异往往会引发梯度冲突从而限制模型性能。部分方法通过引入模态特定编码器来增强特征感知能力并提升融合质量但这种策略会削弱模型在不同融合任务之间的泛化能力。为解决这一问题本文提出一种基于通道扰动与预训练知识集成的统一多模态图像融合框架 UP-Fusion。为抑制冗余模态信息并突出关键特征本文提出语义感知通道剪枝模块Semantic-Aware Channel Pruning Module, SCPM利用预训练模型的语义感知能力对多模态特征通道进行筛选与增强。进一步地本文提出几何仿射调制模块Geometric Affine Modulation Module, GAM利用原始模态特征对初始融合特征进行仿射变换以保持特征编码器的模态判别能力。最后本文在解码阶段引入文本引导通道扰动模块Text-Guided Channel Perturbation Module, TCPM用于重塑通道分布降低模型对模态特定通道的依赖。大量实验表明所提出算法在多模态图像融合任务和下游任务上均优于现有方法。往期推荐请投票选出你心中的最佳论文可在对应公众号完成投票。
返回列表