Chenfiona的个人博客分享 http://blog.sciencenet.cn/u/Chenfiona

博文

北京交通大学赵耀团队 | 基于多模态图像融合抵御对抗攻击

已有 237 次阅读 2026-8-27 16:50 |个人分类:好文推荐|系统分类:论文交流

新新新新新新标签.jpg

随着生成式人工智能快速发展,多模态感知在构建高鲁棒性智能系统中承担愈发关键的作用。多模态图像融合技术在抵御对抗扰动方面具备巨大潜力,但现有方案存在两大核心缺陷,导致防御效果薄弱:一是融合过程缺少攻击感知机制;二是整套融合流程未搭建一体化多阶段防御体系。针对上述问题,北京交通大学张淳杰教授团队提出一种具备攻击感知能力的多模态融合模型,通过嵌入分层防御策略提升模型对抗鲁棒性。具体而言,在特征提取阶段引入预训练去噪自编码器,抑制输入图像噪声,输出清晰度更高、鲁棒性更强的特征表征;融合阶段设计攻击感知融合模块,动态估算各模态所含扰动强度,并自适应调整融合权重,降低不可靠模态输入的权重占比;模型训练阶段搭配对抗训练,进一步增强模型对各类攻击的抵御能力。各模块协同构成分层防御体系,提升模型整体稳定性。实验结果表明,在图像描述、语义分割、目标检测等主流视觉任务中,即便处于对抗攻击环境下,本文所提方法的鲁棒性表现显著优于现有基线方法。相关成果已发表于MIR 2026年第4期专题。

640.jpeg

图片来自Springer

全文下载:

Countering Adversarial Attacks with Multimodal Image Fusion

Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang & Yao Zhao

https://link.springer.com/article/10.1007/s11633-025-1613-x

https://www.mi-research.net/article/doi/10.1007/s11633-025-1613-x

全文导读

过去数年,人工智能系统在图像理解、内容生成、语义分割等任务上取得了显著进展。随着此类系统落地各类实际场景,对抗攻击已然成为威胁模型稳定性与安全性的主要风险来源。在单模态视觉任务中,即便向图像施加极其微小的扰动,也会大幅偏移模型的分类决策边界,造成精度与鲁棒性大幅衰减。学界虽已提出对抗训练、数据增广等方案用于提升模型抗攻击能力,但面对复杂多变的新型攻击时依旧防御失效。该现象的核心根源在于单模态输入信息本身存在固有信息缺失问题。

为克服单模态方案的上述缺陷,多模态信息融合成为近年来的研究热点。多模态融合系统整合多类传感器采集的数据(可见光相机、红外相机、深度相机等),或是语音、文本等不同模态信息,构建信息更完整、具备互补性的特征表征,以此提升模型在复杂环境下的鲁棒性与稳定性。例如自动驾驶领域,深度融合图像与激光雷达特征能够提升系统在恶劣工况及对抗攻击下的稳定运行能力;音视频相关任务中,融合音频与图像模态可提升感知精度,尤其在嘈杂环境下鲁棒性提升显著。现有研究证实,多模态融合能够充分利用各模态信息互补的特性,在提升感知精度的同时增强系统抵御对抗攻击的能力 (见图 1)。尽管如此,现有的多模态图像融合算法在对抗攻击防御层面仍存在诸多难题。如何有效融合异构模态数据、提升模型对抗鲁棒性,是当前亟待解决的研究难题。

640 (1).jpeg

图 1 多模态融合可提升模型抵御对抗扰动的鲁棒性。(a)(b) 两组子图表明,可见光、红外单模态图像在施加对抗扰动后,模型识别结果出现错误。与之对比,图 (c) 多模态融合输出结果可正确识别全部三个人,表明多模态信息融合能够增强模型的抗攻击能力。

现有多模态图像融合方法在抵御对抗攻击方面存在两大核心短板。第一,模型缺少攻击感知机制,无法精准识别并量化各模态遭受的扰动程度。这就导致融合阶段模型难以区分受扰动与未受扰动的数据源,只能对所有模态特征无差别融合。该方式会混入受损模态带来的误导性特征,同时掩盖干净模态中可靠的语义信息,最终造成模型整体鲁棒性下降。以 PAIF为例,该算法虽引入下游语义反馈以优化融合效果,但融合流程不具备攻击感知能力,极易被异常模态的错误信息干扰,进而损害系统整体性能。第二,现有方法大多仅采用单阶段防御机制,缺少覆盖完整融合流程的系统化鲁棒性框架。这类算法的防御设计多集中于模型训练或特征提取环节,很少考量融合阶段存在的模态差异与扰动传递问题,各阶段防御策略无法协同配合。例如 A2RNet通过引入对抗样本提升模型鲁棒性,但其防御机制仅适配特定类型扰动,不具备扰动感知与自适应调整能力,面对复杂攻击模式时防御效果十分有限。

为解决上述难题,本文提出一种融合攻击感知机制与分层防御策略的多模态融合模型。该模型在融合流程的特征提取、特征融合、模型训练三大关键阶段均嵌入针对性鲁棒性模块,构建端到端协同防御体系。各模块分别针对不同薄弱点设计,彼此互补协同,全方位提升模型整体对抗鲁棒性。具体实现方案如下:在特征提取阶段接入预训练去噪自编码器,抑制输入噪声,提升特征质量与固有鲁棒性;特征融合阶段设计攻击感知融合模块,动态评估各模态的扰动强度,并依据评估结果自适应调节融合权重,放大可靠模态的贡献、削弱易受攻击模态的影响;训练阶段采用对抗训练方案,引导模型学习抗干扰能力更强的特征表征。本文在图像描述、语义分割、目标检测等任务上开展大量对比实验,验证了所提方法具备更优越的综合性能。

核心创新点

本文的核心创新点总结如下:

1) 本文提出一种搭载分层防御策略、具备攻击感知能力的多模态融合模型。该模型在完整融合流程中集成三大组件:用于噪声抑制的去噪自编码器、实现权重自适应调节的攻击感知融合模块,以及用于提升整体鲁棒性的对抗训练策略。

2) 本文在图像描述、语义分割、目标检测等多项视觉任务上完成实验验证,证明该方法能够有效提升模型的对抗鲁棒性与泛化能力。

全文下载:

Countering Adversarial Attacks with Multimodal Image Fusion

Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang & Yao Zhao

https://link.springer.com/article/10.1007/s11633-025-1613-x

https://www.mi-research.net/article/doi/10.1007/s11633-025-1613-x

BibTex:

@Article {MIR-2025-06-276,

author={Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang, Yao Zhao},

journal={Machine Intelligence Research},

title={Countering Adversarial Attacks with Multimodal Image Fusion},

year={2026},

volume={23},

issue={4},

pages={916-930},

doi={10.1007/s11633-025-1613-x}}

屏幕截图 2026-08-27 164921.png

特别感谢本文作者团队对以上内容的审阅和修改!

纸刊免费寄送

Machine Intelligence Research

MIR为所有读者提供免费寄送纸刊服务,如您对本篇文章感兴趣,请点击下方链接填写收件地址,编辑部将尽快为您免费寄送纸版全文!

说明:如遇特殊原因无法寄达的,将推迟邮寄时间,咨询电话010-82544737

收件信息登记:

https://lcn76mgd97vz.feishu.cn/share/base/form/shrcnsQ6cmRjqoxPF5WDowSBFVr



https://blog.sciencenet.cn/blog-749317-1549818.html

上一篇:澳门理工大学袁小晨团队 | 潜域印记: 面向潜扩散模型的鲁棒模型水印方案




    
收藏 IP: 159.226.177.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-3 20:15

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部