背景
论文速递|ACL 2026 ArgGenBench:复杂控制论辩生成评测基准
2026-05-15 15:38 HITSZ-HLT    (浏览量)

论文题目ArgGenBench: Benchmarking the Complex Controlled Argument Generation Capability of Large Language Models

类型ACL 2026主会

作者:靳伯骏#、鲍建竹#、孙洋、张义策、徐睿峰*


图片    

No.1

动机


大语言模型(LLMs)在文本生成领域已取得显著进展,但在自动生成高质量、强说服力论点方面仍存在较大挑战。现有论辩生成(Argument Generation)研究大多仅聚焦主题、立场或关键内容要点等少量且单一的控制信号。然而真实的人类论辩具备高度复杂性,高质量、高说服力的论点构建,需要综合运用论辩策略、语气风格,并适配特定目标受众。目前,针对这类复杂多维可控论辩生成的研究仍较为匮乏,且行业内缺少适配该任务的评测基准数据集,成为该领域发展的主要瓶颈。为此,本文构建了一个全新评测基准ArgGenBench。该数据集融合多维控制要素,包含主题、立场、文本长度、输入论点、论辩策略、语言风格、目标受众、关键要点,旨在精准测评大语言模型在复杂可控论辩生成任务中的真实性能。样本示例如图1所示。


图片


1 ArgGenBench样本示例


图片    

No.2

方法


为保障基准数据集质量,本文设计了严谨的多阶段构建流程。ArgGenBench的搭建主要分为两大核心阶段:指令构建(Instruction Creation)与参考论点编撰(Reference Argument Curation)。最终,每条数据样本均包含一条逻辑清晰、约束复杂且可执行的指令,以及一条经过人工校验优化的高质量参考论点,用于客观评测大模型的复杂可控论辩生成能力。数据集构建流程如图2所示。

图片

2 ArgGenBench构建流程示意图

1、指令创建阶段

本阶段首先确定指令基础语境,明确数据样本的主题、目标立场与文本长度要求;同时为覆盖论点支持与论点反驳两类任务场景,增设可选输入论点。确定基础语境后,本文从风格、论辩策略、目标受众、关键要点四个维度采样控制信号,组合生成丰富多样的约束条件。随后依托GPT-4.1将多维度控制要素整合为自然语言复杂指令,并通过人工审核剔除表述模糊、逻辑不合理的无效指令。

2、参考论点构建阶段

为给模型评测提供高质量、高可信度的参照标准,本文采用人在回路(human-in-the-loop)的方式构建参考论点。针对每条指令,通过调用Claude-Sonnet-4GPT-4.1Gemini-2.5-Pro三款主流先进大模型,分别生成候选论点。同时,为保证论点事实准确、提升论证说服力,生成过程中引入Kialo辩论平台及互联网检索的外部知识。最终,具备计算辩论学专业背景的标注人员,从指令遵循度(Instruction Following)和论点质量(Argument Quality)两大维度对候选论点打分筛选,择优保留最优样本,并在必要时进一步进行人工精修优化,形成最终的高质量参考论点。


图片    

No.3

数据统计


1、质量分析

ArgGenBench数据集共包含803条高质量实例。在指令筛选阶段,人工验证通过率达94.3%。候选论点中的指令遵循度(IF)人工评分平均88.5%、论点质量评分平均分72.6%,评测表现优异。此外,41%的参考论点经过人工修改优化,严格贴合指令约束,保障数据集整体论点质量。

2、复杂性分析

如图3所示,本文依据控制信号数量划分难度等级:简单(0-3个控制信号)、中等(4-6个控制信号)、困难(7-9个控制信号),数据集内不同难度指令分布均衡。样本平均控制信号数量达4.2个,相较于传统仅含1-2个约束条件的同类数据集,复杂度与测评难度显著提升。

图片

3 不同难度级别的指令数量分布

3、多样性分析

ArgGenBench涵盖政治、经济、社会、科学、健康等多个领域,共计82个争议性话题。在控制维度层面,数据集均匀覆盖各类论辩风格与论辩策略;同时针对单一话题定制差异化目标受众与关键论证要点,能够全面测评大语言模型在多元化论辩场景下的能力。


图片    

No.4

实验


本文基于零样本(Zero-Shot)、有监督微调(SFT)、直接偏好优化(DPO)三种实验设置,对15款主流开源及闭源大模型开展综合评测。评测指标包含ROUGE-L、长度遵循度(LF)、指令遵循度(IF)、论点质量(Quality)及总体质量(Overall)。

1 不同模型的性能

图片

模型综合性能结果如表1所示:即便综合表现最优的Claude-Sonnet-4,相较于人工校验的参考论点,综合胜率(Overall Win rate)仅为42.7%,证明现有大模型在复杂可控论辩生成任务中存在明显短板。此外,推理型模型(Thinking Models),如Claude-Sonnet-4/3.7Qwen3-32B,在指令遵循度与论点质量上普遍优于非推理型模型,究其原因,思维链能够辅助模型规划论辩结构、梳理逻辑关系。本文进一步对比Qwen3-8BLlama-3.1-8B微调前后的性能差异,实验显示SFTDPO优化方式均可显著提升模型的指令遵循能力与论点生成质量。特别是经过DPO优化的Qwen3-8B-Base的性能反超参数量更大的Qwen3-14B推理模型,验证了DPO算法在复杂可控论辩生成任务中的优化潜力。

2 模型在不同难度指令上的性能

图片

本文进一步探究模型在简单、中等、困难三类指令下的性能差异,实验结果如表2所示。随着指令内控制信号数量增加、难度提升,绝大多数模型的失败率显著上升。这表明现有大语言模型难以适配多约束叠加的复杂论辩指令,任务适配能力存在明显不足。

图片

4 模型处理不同控制信号的性能

为探究模型对不同控制维度的适配差异,本文针对单一控制信号指令开展消融测试。由图4结果可知,大多数模型在论辩策略(Argumentative Strategy)维度表现最差。经分析推测,语言风格、目标受众、关键要点可通过表层词汇、语气调整实现适配,而论辩策略(如Causal Reasoning因果推理、Concession and Rebuttal让步反驳)要求模型具备深层逻辑推理与篇章结构规划能力,因此该维度对大模型的生成难度更高。


图片    

No.5

结论


本文构建了专为复杂可控论辩生成任务设计的评测基准ArgGenBench,用于全面测评大语言模型理解多维复杂指令、生成高质量论点的综合能力。通过对多款主流先进大模型的大规模评测,本文发现现有大语言模型在长度精准控制、复杂指令遵从、高质量论点生成方面仍存在显著缺陷,最优模型综合胜率尚未过半;同时验证了SFTDPO等优化算法可有效提升模型的论辩生成性能。本文希望ArgGenBench能够为行业提供标准化评测平台,推动高可控、高智能的论辩生成系统迭代优化。



初审:王冰冰
复审:王   丹
终审:徐睿峰



打印    收藏
关闭窗口

Return Top