背景
论文速递丨ACL 2026:面向多模态立场检测的双推理框架 MIND
2026-06-23 15:34 HITSZ-HLT    (浏览量)

论文题目:MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection

会议:ACL 2026

作者:Bingbing Wang#, Zhengda Jin#, Bin Liang, Wenjie Li, Jing Li*, Ruifeng Xu*, Min Zhang

1


动机

多模态立场检测(Multimodal Stance Detection, MSD)旨在结合文本与图像信息,识别用户对特定目标的态度,是理解社交媒体公共舆论的重要任务。现有方法虽已从静态融合逐步演进至动态交互,但总体上仍停留在“学习融合(learning to fuse)”的范式,更侧重于衡量模态特征的重要性,却缺乏显式、高层次的推理过程。因此,当面对反讽、模态冲突、文化隐喻等复杂表达时,模型仍容易出现误判。
这种局限至少体现在两个方面:一是跨模态反讽,即文本和图像表面上看似支持同一立场,实际却通过隐含语义表达相反态度;二是模态内逻辑陷阱,即模型易被表层关键词误导,而忽略句式结构与真实语义。为此,本文受双系统认知理论启发,提出将多模态立场检测从“学习融合(learning to fuse)”推进至“学习推理(learning to reason)”,并设计了一种元认知驱动的直觉-反思双推理框架 MIND。
图1展示了现有融合式方法与 MIND 的差异:相比仅依据表层线索进行模态融合,MIND 通过“直觉推理 + 反思推理”的双阶段机制,显式建模模态间动态关系与深层语义,从而更准确地完成立场判断。

            图片                                

图 1:两个对比示例,紫色部分为现有方法(学习融合),粉色部分为本文所提方法(学习推理)。

2


方法

为了解决多模态立场检测中“只融合、不推理”的问题,本文提出了 MIND 框架,如图2所示。MIND 受人类认知中“快思考—慢思考”机制启发,整体由三个核心部分组成:多模态知识感知、经验驱动的直觉推理,以及元认知反思推理。三者共同构成一个持续迭代的自我优化闭环。  

图片

图 2:面向多模态立场检测的 MIND 框架流程概览

1. 多模态知识感知

为后续推理建立语义基础,本文首先从文本和图像中提取并补充知识信息。对于文本,使用多模态大模型识别关键语义实体,并从 Wikipedia 检索相关背景知识,进一步压缩为语义摘要;对于图像,同样先生成图像描述、提取视觉实体,并结合外部知识形成视觉知识表示。进一步地,本文利用 SAM 对图像中的实体区域进行开放词汇分割,从而获得与语义实体对齐的细粒度视觉信息。通过该阶段,模型不仅获取高层概念信息,也获得了贴近视觉细节的证据支撑。

2. 经验驱动的直觉推理

在直觉推理阶段,MIND 通过查询两个经验池快速形成初步判断:模态经验池(MEP)用于积累不同模态贡献方式的经验;语义经验池(SEP)用于积累深层语义理解的经验。本文设计了模态协同检索机制,将当前样本的文本与视觉表示同经验池中的历史经验进行匹配,检索最相关的经验作为上下文示例。在此基础上,框架分别从文本视角、视觉视角和多模态联合视角生成初始立场预测及对应理由,从而得到面向后续反思的中间推理结果。

3. 元认知反思推理

为进一步提升判断质量,MIND 在第二阶段引入元认知反思推理,对初始预测进行审视与修正。其中,模态思维链(Modality-CoT)重点分析文本、图像及多模态初步预测的成败原因,总结更适用于未来样本的模态交互策略;语义思维链(Semantic-CoT)则将模型内部生成的理由与外部检索的文本知识、视觉知识相结合,识别浅层理解或语义偏差,并提炼深层语义经验。随后,新经验将回写至经验池以实现持续更新,构成自我演进机制。这意味着 MIND 不仅对当前样本进行判断,还能在训练与推理过程中持续积累并优化推理经验。

3


实验

本文在 MMSD 基准数据集上验证了 MIND 的有效性。该数据集包含多个不同领域与目标,论文分别在 in-target 和 zero-shot 两种设置下进行评测,并采用 Macro-F1 作为主要评价指标。实现上,MIND 以 Qwen-2.5-VL-32B 为主干模型,并将 Wikipedia 作为外部知识来源。

1. In-target 实验结果

在 in-target 设置下,MIND 在多个目标与领域上取得最优或具有竞争力的结果,并在多种场景下超越 GPT-4、GPT-4V 等强基线。相比传统融合方法,MIND 能够根据具体样本动态重估不同模态的贡献权重,因此在复杂、多变的立场表达中更具优势。             图片 表 1:In-target结果(%)。最优与次优得分分别以加粗和下划线标注。∗表示本研究提出的 MIND 模型显著优于基线模型(p < 0.05)。虚线将微调方法与非微调方法区分开。w / 代表主干网络,↑表示相较于原始多模态大语言模型的性能提升

2. Zero-shot 实验结果

在 zero-shot 设置下,依赖域内训练的模型普遍出现性能波动,即便是强大的大模型基线,在面对未见目标时也存在明显不稳定性。相比之下,MIND 在多数测试场景中展现出更强的泛化能力,表明其经验驱动与反思更新机制有效提升了模型在未知目标上的鲁棒性。

图片

表2:Zero-shot结果(%)。最优与次优得分分别以粗体和下划线标出。表示本文提出的 MIND 模型显著优于基线模型(p < 0.05)。虚线将微调方法与非微调方法区分开。w / 代表主干网络,表示相较于原始多模态大模型(MLLM)的提升幅度。

3.消融实验结果

消融实验表明,完整 MIND 在 in-target 与 zero-shot 设置下均优于去除任一模块的变体。其中,移除模态经验池(w/o MEP)导致性能下降最显著,尤其在 zero-shot 场景下;移除语义经验池(w/o SEP)同样大幅削弱模型表现;去除反思推理模块(w/o CoT)后性能亦出现回落,证实经验池与反思机制对最终性能均具有关键作用。

图片

表3:针对in-target 与 zero-shot多模态立场检测的消融实验结果(%)

4.相关性阈值分析

本文进一步分析了经验检索中的相关性阈值设置。结果表明:过低阈值易引入噪声经验,干扰推理质量;过高阈值则导致可用经验匮乏。整体而言,阈值设定在 0.7 左右时效果最优,体现了经验质量与数量之间的有效平衡。

图片

图3:不同相关性阈值下的结果

5.案例分析

案例分析显示,直接使用 CoT 的方法易受表层词汇或视觉表象误导,例如将含反讽意味的文本误判为支持立场,或将客观政策描述错误识别为主观赞同。相比之下,MIND 能结合历史经验、背景知识与模态贡献分析,更准确地识别反讽、隐含语义与中性表达,展现出更强的可解释性与鲁棒性。

图片

图4:在相同大模型基座下,MIND 与直接思维链方法的案例对比

4


结论

本文提出了一种面向多模态立场检测的双推理框架 MIND。该方法受人类双系统认知理论启发,将经验驱动的直觉推理与元认知反思推理相结合,实现了从“学习融合”到“学习推理”的范式转变。MIND 通过多模态知识感知、双经验池检索与反思式 CoT 更新机制,能够动态建模不同模态对立场表达的实际贡献,并持续积累、优化自身推理经验。在 MMSD 数据集上的实验表明,MIND 在 in-target 和 zero-shot 设置下均表现出优异性能与强泛化能力,为多模态立场检测提供了新的研究思路。


初审:王冰冰
复审:王   丹
终审:徐睿峰



打印    收藏
关闭窗口

Return Top