论文题目:ArgGenBench: Benchmarking the Complex Controlled Argument Generation Capability of Large Language Models
类型:ACL 2026主会
作者:靳伯骏#、鲍建竹#、孙洋、张义策、徐睿峰*
大语言模型(LLMs)在文本生成领域已取得显著进展,但在自动生成高质量、强说服力论点方面仍存在较大挑战。现有论辩生成(Argument Generation)研究大多仅聚焦主题、立场或关键内容要点等少量且单一的控制信号。然而真实的人类论辩具备高度复杂性,高质量、高说服力的论点构建,需要综合运用论辩策略、语气风格,并适配特定目标受众。目前,针对这类复杂多维可控论辩生成的研究仍较为匮乏,且行业内缺少适配该任务的评测基准数据集,成为该领域发展的主要瓶颈。为此,本文构建了一个全新评测基准ArgGenBench。该数据集融合多维控制要素,包含主题、立场、文本长度、输入论点、论辩策略、语言风格、目标受众、关键要点,旨在精准测评大语言模型在复杂可控论辩生成任务中的真实性能。样本示例如图1所示。
图 1 ArgGenBench样本示例
为保障基准数据集质量,本文设计了严谨的多阶段构建流程。ArgGenBench的搭建主要分为两大核心阶段:指令构建(Instruction Creation)与参考论点编撰(Reference Argument Curation)。最终,每条数据样本均包含一条逻辑清晰、约束复杂且可执行的指令,以及一条经过人工校验优化的高质量参考论点,用于客观评测大模型的复杂可控论辩生成能力。数据集构建流程如图2所示。

图 2 ArgGenBench构建流程示意图
1、指令创建阶段
本阶段首先确定指令基础语境,明确数据样本的主题、目标立场与文本长度要求;同时为覆盖论点支持与论点反驳两类任务场景,增设可选输入论点。确定基础语境后,本文从风格、论辩策略、目标受众、关键要点四个维度采样控制信号,组合生成丰富多样的约束条件。随后依托GPT-4.1将多维度控制要素整合为自然语言复杂指令,并通过人工审核剔除表述模糊、逻辑不合理的无效指令。
2、参考论点构建阶段
为给模型评测提供高质量、高可信度的参照标准,本文采用人在回路(human-in-the-loop)的方式构建参考论点。针对每条指令,通过调用Claude-Sonnet-4、GPT-4.1、Gemini-2.5-Pro三款主流先进大模型,分别生成候选论点。同时,为保证论点事实准确、提升论证说服力,生成过程中引入Kialo辩论平台及互联网检索的外部知识。最终,具备计算辩论学专业背景的标注人员,从指令遵循度(Instruction Following)和论点质量(Argument Quality)两大维度对候选论点打分筛选,择优保留最优样本,并在必要时进一步进行人工精修优化,形成最终的高质量参考论点。
1、质量分析
ArgGenBench数据集共包含803条高质量实例。在指令筛选阶段,人工验证通过率达94.3%。候选论点中的指令遵循度(IF)人工评分平均88.5%、论点质量评分平均分72.6%,评测表现优异。此外,41%的参考论点经过人工修改优化,严格贴合指令约束,保障数据集整体论点质量。
2、复杂性分析
如图3所示,本文依据控制信号数量划分难度等级:简单(0-3个控制信号)、中等(4-6个控制信号)、困难(7-9个控制信号),数据集内不同难度指令分布均衡。样本平均控制信号数量达4.2个,相较于传统仅含1-2个约束条件的同类数据集,复杂度与测评难度显著提升。

图 3 不同难度级别的指令数量分布
3、多样性分析
ArgGenBench涵盖政治、经济、社会、科学、健康等多个领域,共计82个争议性话题。在控制维度层面,数据集均匀覆盖各类论辩风格与论辩策略;同时针对单一话题定制差异化目标受众与关键论证要点,能够全面测评大语言模型在多元化论辩场景下的能力。
本文基于零样本(Zero-Shot)、有监督微调(SFT)、直接偏好优化(DPO)三种实验设置,对15款主流开源及闭源大模型开展综合评测。评测指标包含ROUGE-L、长度遵循度(LF)、指令遵循度(IF)、论点质量(Quality)及总体质量(Overall)。
表 1 不同模型的性能

模型综合性能结果如表1所示:即便综合表现最优的Claude-Sonnet-4,相较于人工校验的参考论点,综合胜率(Overall Win rate)仅为42.7%,证明现有大模型在复杂可控论辩生成任务中存在明显短板。此外,推理型模型(Thinking Models),如Claude-Sonnet-4/3.7、Qwen3-32B,在指令遵循度与论点质量上普遍优于非推理型模型,究其原因,思维链能够辅助模型规划论辩结构、梳理逻辑关系。本文进一步对比Qwen3-8B与Llama-3.1-8B微调前后的性能差异,实验显示SFT与DPO优化方式均可显著提升模型的指令遵循能力与论点生成质量。特别是经过DPO优化的Qwen3-8B-Base的性能反超参数量更大的Qwen3-14B推理模型,验证了DPO算法在复杂可控论辩生成任务中的优化潜力。
表 2 模型在不同难度指令上的性能

本文进一步探究模型在简单、中等、困难三类指令下的性能差异,实验结果如表2所示。随着指令内控制信号数量增加、难度提升,绝大多数模型的失败率显著上升。这表明现有大语言模型难以适配多约束叠加的复杂论辩指令,任务适配能力存在明显不足。

图 4 模型处理不同控制信号的性能
为探究模型对不同控制维度的适配差异,本文针对单一控制信号指令开展消融测试。由图4结果可知,大多数模型在论辩策略(Argumentative Strategy)维度表现最差。经分析推测,语言风格、目标受众、关键要点可通过表层词汇、语气调整实现适配,而论辩策略(如Causal Reasoning因果推理、Concession and Rebuttal让步反驳)要求模型具备深层逻辑推理与篇章结构规划能力,因此该维度对大模型的生成难度更高。
本文构建了专为复杂可控论辩生成任务设计的评测基准ArgGenBench,用于全面测评大语言模型理解多维复杂指令、生成高质量论点的综合能力。通过对多款主流先进大模型的大规模评测,本文发现现有大语言模型在长度精准控制、复杂指令遵从、高质量论点生成方面仍存在显著缺陷,最优模型综合胜率尚未过半;同时验证了SFT、DPO等优化算法可有效提升模型的论辩生成性能。本文希望ArgGenBench能够为行业提供标准化评测平台,推动高可控、高智能的论辩生成系统迭代优化。