2026年4月,研究团队硕士生林靖杰的多模态推理论文《Enhancing Multimodal Reasoning via Visual Semantic Summarization》获音频、语音与语言处理领域顶级国际期刊IEEE Transactions on Audio, Speech, and Language Processing(IEEE TASLP)录用。IEEE TASLP由IEEE信号处理学会主办,涵盖音频技术、语音处理及语言计算三大方向。该刊2025年影响因子为5.1,位列JCR Q1区,是中国计算机学会CCF推荐的B类期刊,同时是中国人工智能学会CAAI和清华大学推荐的A类期刊。
多模态推理是多模态大模型领域的一项重要任务,旨在融合文本、图像等多源信息完成推理决策。现有多模态大模型虽在预训练下取得了显著进展,但仍存在明显局限:(1)视觉特征在映射到语言表示空间时容易被压缩或扭曲,导致细粒度视觉语义丢失;(2)即使模型能够识别部分视觉线索,也难以将其有效关联到参数中存储的背景知识,从而产生幻觉或错误推理结果。为此,本文提出一种基于视觉语义摘要的多模态推理增强框架。具体而言,该框架首先通过摘要生成模型为图像生成候选视觉语义摘要,并利用多模态推理模型的反馈区分偏好与拒绝摘要;接着,通过直接偏好优化提升摘要生成质量,使其保留与推理相关的细粒度视觉线索;随后,将贪心解码生成的视觉语义摘要作为辅助文本注入多模态推理模型,并通过监督微调增强模型对摘要的利用能力。最后,框架通过摘要生成与推理模型利用两个阶段的交替优化,实现视觉语义提炼能力与多模态推理性能的协同提升。
本文在问答、细粒度情感分析、仇恨模因检测三个公开多模态推理任务上的实验结果表明,该框架相比现有基于多模态大模型的方法取得了更优性能,进一步验证了视觉语义摘要在细粒度视觉感知、知识激活和可靠推理中的有效性。
论文信息:
Jingjie Lin, Qianlong Wang*, Keyang Ding, Bingbing Wang, Xintong Song, Wenpeng Lu, Ruifeng Xu*, Min Zhang. Enhancing Multimodal Reasoning via Visual Semantic Summarization. IEEE Transactions on Audio, Speech and Language Processing. 2026.