TPAMI 2025 | 基于协同高阶交互作用多模态图像融合
论文信息
题目:Probing Synergistic High-Order Interaction for Multi-Modal Image Fusion
探索多模态图像融合中的协同高阶交互作用
论文创新点
- 提出SHIP范式:论文提出了协同高阶交互范式(SHIP),创新性地在空间和通道维度引入高阶交互作用,系统地研究多模态图像在空间细粒度和全局统计方面的协作关系,从而全面探索多模态间的协同效应。
- 设计高效高阶空间交互:通过将频域融入自注意力机制,把矩阵乘法的计算复杂度降低为更高效的逐元素运算,进而实现从二阶交互扩展到任意阶(N阶)交互,有效捕捉不同粒度的互补信息,丰富特征多样性。
- 设计高阶通道交互:对Squeeze-and-Excitation(SE)块进行扩展,使其从一阶通道交互提升为高阶通道交互,基于全局统计探索源图像间的协同相关性,深入区分不同模态间复杂的相互依赖关系。
- 改进提出SHIP++:对SHIP模型进行改进,提出SHIP++,通过残差信息记忆机制、交叉阶信息整合机制以及交叉阶注意力进化机制,增强跨模态信息交互表示,进一步提升模型性能。
摘要
多模态图像融合旨在通过整合和区分来自多个源图像的跨模态互补信息,生成融合图像。虽然具有全局空间交互的交叉注意力机制前景看好,但它仅捕捉二阶空间交互,忽略了空间和通道维度上的高阶交互。这一限制阻碍了多模态之间协同效应的挖掘。为了弥合这一差距,作者引入了协同高阶交互范式(SHIP),旨在从两个基本维度系统地研究多模态图像之间的空间细粒度和全局统计协作:1)空间维度:作者通过逐元素乘法构建空间细粒度交互,这在数学上等同于全局交互,然后通过迭代聚合和演化互补信息来促进高阶形式,提高效率和灵活性。2)通道维度:在基于一阶统计量(均值)扩展通道交互的基础上,作者设计了高阶通道交互,以基于全局统计促进源图像之间相互依赖关系的识别。作者进一步引入了SHIP模型的增强版本,称为SHIP++,它通过跨阶注意力演化机制、跨阶信息整合和残差信息记忆机制,增强了跨模态信息交互表示。利用高阶交互显著提高了模型挖掘多模态协同效应的能力,在两个重要的多模态图像融合任务——全色锐化和红外与可见光图像融合中,通过各种基准测试的综合实验表明,其性能优于现有方法。
四、方法
(一)总体框架
如图2所示,所提出的范式操作如下:给定一幅红外图像和一幅可见光图像,作者使用针对每个模态的单独卷积层提取相应的浅层特征,得到和。然后,这些模态感知特征经历一系列核心的协同高阶交互范式(SHIP),同时纳入空间和通道维度。这个过程探索两个模态在空间细粒度细节和全局统计方面的协同作用。最后,这些特征被投影回图像空间,生成融合结果。
融合过程特别针对YCbCr颜色空间中的Y通道,遵循先前工作[68], [69]的方法。总之,该范式可以表述如下:
其中,和表示特征提取器,L表示作者的SHIP的迭代次数。在全色锐化中,该范式表示为。
(二)高阶空间交互
- 回顾自注意力:自注意力机制是Transformer[16]的关键组成部分,通过键、查询和值组件之间的矩阵乘法促进二阶空间交互。这个过程使模型能够基于查询模态动态区分和聚合互补信息。对于红外与可见光图像融合,查询Q、键K和值V通过以下方式推导得出:
其中,、和表示应用于投影模态感知特征表示的线性变换。以输入为中心捕获二阶空间交互的自注意力机制,通过这些组件之间的点积运算实现:
其中,表示键的维度,表示点积运算,是相关矩阵,表示自注意力模块的输出,捕获关于输入特征的二阶空间交互。
然而,尽管点积运算有效,但由于其二次时间复杂度,会带来巨大的计算开销,使得在级联自注意力机制中进行高阶操作不切实际。
- 等效高效形式:A的每个元素可以通过内积重新定义:,,,表示内积。卷积定理指出,两个信号在空间域中的相关性或卷积等同于它们在频域中的哈达玛积,如图4所示。

为了利用这一性质,作者将频域整合到自注意力机制中,将矩阵乘法的计算复杂度降低为更高效的逐元素操作。首先,作者使用快速傅里叶变换(FFT)将模态感知特征和变换到频域。相关性计算如下:
其中,和分别表示FFT和逆FFT,表示哈达玛积,表示共轭转置操作。此外,获得具有二阶空间交互的整合特征:
其中,Norm表示应用于A的层归一化。
- 深入高阶形式:最近的方法,如[70], [71],强烈倾向于采用自注意力机制。然而,这些方法,常见于级联自注意力块中,往往围绕查询特征生成多个二阶交互,而不是实现高阶建模。形式上,L个级联自注意力的递归格式可以表示为:
其中,。显然,这个过程仅捕获关于输入特征的二阶交互,同时带来巨大的计算成本。
相比之下,基于等效高效形式,作者超越二阶交互,在保持效率的同时将范围扩展到任意阶交互(N阶)。具体来说,对于每个第i次迭代,作者将(5)扩展为以下高阶公式:
其中,。这个公式使作者能够有效地捕获高达N阶的交互。
一般来说,对于图3中具有L的传统Transformer链,序列展开如下:
相比之下,作者的高阶建模将其替换为:
实际上,这种修改使作者能够在每次迭代中捕获高达N阶的交互。如图5所示,每个空间高阶交互中的不同阶整合了不同粒度的互补信息。此外,不同迭代的交互表现出判别性响应,在迭代过程中丰富了特征多样性。
(三)高阶通道交互
- 回顾挤压与激励块:挤压与激励(SE)块[66]利用一阶全局统计量(均值)对通道交互进行建模。这种方法使SE块能够明确捕获输入特征通道之间的相互依赖关系。对于红外与可见光图像融合,SE块将第i次高阶空间交互中红外和可见光特征之间的依赖关系表述如下:
其中,,表示一阶统计量,表示Sigmoid函数。包括两个线性变换和一个ReLU函数。
- 深入高阶形式:与高阶空间交互类似,作者扩展SE块以实现高阶通道交互:
最后,一个卷积层将整合到融合模态中,产生整合特征。
通过在L次迭代中进行N阶空间和通道交互,交互链可以用数学表达式表示如下:
作者分析了第2次通道高阶交互沿通道维度的通道响应。与不同阶的一致响应相反,作者的高阶建模自适应地区分源模态之间的相互依赖关系,如图7所示。
(四)SHIP++的重新开发组件
- 残差信息记忆:VIF致力于将红外图像中的显著成分聚合到可见光图像中,并生成增强的可见光图像。同样,全色锐化旨在在纹理丰富的PAN图像的指导下对低分辨率MS图像进行超分辨率。在这两种情况下,VIF中的可见光图像和全色锐化中的MS图像作为主要模态,包含任务所需的关键信息。鉴于它们的重要性,在网络的学习过程中保留这些模态的信息至关重要。然而,在作者的更新过程中,主导模态仅参与最终学习阶段,这导致在中间步骤中其信息保留不佳。为了保留重要细节,作者在突出模态中实现了残差信息记忆机制,如图6(a)所示:

-
跨阶信息整合:作者通过以跨阶方式整合不同信息,增强了跨模态交互的表示,如图6(b)所示。这种改进利用了不同阶倾向于捕获不同且互补模式的观察结果,从而生成更具信息性的表示,如图5所示:
-
跨阶注意力演化机制:从演化注意力中获得灵感,作者引入了一种跨阶注意力演化机制,如图6(c)所示。该机制促进不同层注意力图之间的共同知识共享。因此,前层的注意力可以通过残差连接引导后层的注意力,从而能够捕获精确的模式:
(五)全色锐化的损失函数
设IF和GT分别表示网络输出和相应的地面真值。为了提高全色锐化结果的清晰度,作者使用L1损失:
五、可见光与红外图像融合实验













如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐




所有评论(0)