多模态融合总是有效吗?我院纪淑娟教授指导研究生在虚假新闻检测领域取得新进展
近日,我院纪淑娟教授团队与齐鲁工业大学(山东省科学院)合作完成的论文“Does Multi-modal Fusion Always Work — A Multi-modal Decoupled Learning Neural Network (MDLNN) for the Detection of Fake News”被多媒体领域国际权威期刊 IEEE Transactions on Multimedia(IEEE TMM)录用并在线发表。山东科技大学为第一完成单位,论文第一作者为我院2022 级博士研究生吕建东,通讯作者为纪淑娟教授,李豪杰教授为共同作者,合作者还包括齐鲁工业大学(山东省科学院)博士研究生刘芝润等人。
IEEE Transactions on Multimedia 创刊于 1999 年,由电气电子工程师学会(IEEE)主办,是多媒体信号处理、多媒体内容分析与理解领域最具影响力的国际学术期刊之一,为中科院大类分区计算机科学一区 TOP 期刊、JCR Q1 期刊,也是中国计算机学会(CCF)推荐的计算机图形学与多媒体领域 A 类期刊,最新影响因子 9.7。该刊以录用标准严格、对成果原创性与实验充分性要求高著称。
社交媒体已成为公众获取和传播新闻的重要渠道,但缺乏可靠的自动核验机制,使虚假新闻得以快速扩散,对公共安全与公共舆论环境构成威胁。特别地,带有图像内容的帖子转发量约为纯文本帖子的11倍。多模态内容因此成为检测的关键线索。然而,现有多模态检测方法大多默认“图文融合必然带来增益”,或侧重跨模态互补性建模,或侧重模态内不确定性度量,忽视了多模态内容自身的耦合性与动态性,也未刻画模态之间真实存在的多重交互机制,导致融合过程引入冲突干扰、可信度不足。论文标题中的设问“多模态融合总是有效吗”,正是对这一惯性假设的直接回应。
针对上述问题,团队从人类逻辑推理认知行为出发——人在理解图文信息时,先读取一致信息,再读取不一致信息,最后建立异化信息之间的关联——提出了多模态解耦学习神经网络 MDLNN,包含三个核心模块:多模态解耦学习特征提取模块(MDL)通过一致性约束与对抗性约束增强注意力机制,将异构特征解耦为承载一致信息的模态共享特征与承载不一致信息的模态特有特征,在特征层面实现可信融合;门控单元多模态特征融合模块(MGU)显式建模强相关域内的共享机制、弱相关域向强相关域的补充机制、弱相关域内的矛盾机制这三类细粒度交互机制,在决策层面实现可信融合;虚假新闻检测模块(FND)负责生成检测结果,并通过事件判别器保证多模态联合特征的事件不变性。
在源自微博与Twitter的两个真实社交媒体数据集上,团队与Att-RNN、EANN、MVAE、CAFE、MM-ULN、KAMP、CMMTN等十余个代表性方法进行了系统对比。MDLNN在Twitter与微博数据集上的检测准确率分别达到96.4%与92.6%,较同类最优方法相对提升1.6%与4.8%;相较生成式多模态基线,准确率相对提升幅度分别达28.6%与9.3%。定性与定量实验共同表明,MDLNN能够显式呈现异构模态内容“如何融合、为何融合”,具备较好的可解释性与鲁棒性。团队同时指出,随着模态数量增加,模型的计算复杂度与显存开销将相应上升,后续将进一步研究可依模态特性动态调整的自适应解耦策略。
论文链接:https://ieeexplore.ieee.org/document/11543203/
DOI:10.1109/TMM.2026.3699021

相关新闻
最近更新
136
102
149
229