面向Human-LLM对话中用户侧隐式冲突的主动检测

arXiv cs.CL 论文

摘要

本文提出了一种用于主动检测用户侧Human-LLM对话中隐式冲突的方法,引入了一个基准和合成方法来增强轻量级LLM的性能。

arXiv:2609.19155v1 公告类型:新 摘要:在Human-LLM对话中,后续用户话语可能与早期意图隐式冲突,导致LLM误解用户需求并生成不恰当的响应。一个可靠的对话系统应在生成响应前主动检测用户侧冲突,并在必要时寻求澄清。然而,先前的工作主要关注LLM侧冲突,用户侧冲突尚未得到充分探索。为了填补这一空白,我们构建了UC-Bench,一个用于评估用户侧冲突检测的人工标注基准。初步实验表明,现有LLM在此任务上表现不佳,尤其是当冲突源于基于对话历史的隐式不兼容时。为了在有限训练数据下改进轻量级LLM,我们研究了用于用户侧冲突检测的数据合成。现有合成方法未明确建模历史和当前用户话语之间的隐式不兼容,难以捕捉冲突的演化并生成可靠标记的隐式冲突样本。我们提出了SynUC,一种约束引导的合成方法,在约束空间中表示用户侧冲突,并使用SPEAKING框架引导可追溯的约束变换。将SynUC应用于WildChat,我们构建了UC-Data,一个包含2,487个样本的用户侧冲突训练集。在UC-Bench上,使用UC-Data训练的Qwen3.5-4B性能优于更大的通用LLM,如Claude Opus 4.8,以及使用现有方法合成数据训练的相同骨干模型。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:50

# 面向人机对话中用户端隐式冲突的主动检测  
来源:https://arxiv.org/html/2609.19155  

[orcid=0000-0002-3711-0743]  
\\credit 概念构思,方法论,调研,撰写 – 初稿  
1]机构=北京科技大学计算机与通信工程学院,城市=北京,邮编=100083,国家=中国  

[orcid=0000-0002-5879-5980]  
\\credit 验证,监督  
2]机构=南华大学计算机学院,城市=衡阳,邮编=421001,国家=中国  

[orcid=0000-0001-6413-193X]  
\\cormark[1]  
\\credit 概念构思,监督  
\\cortext [cor1]  
通讯作者 朱涛  
[email protected]  
宁焕生  
[email protected]  

###### 摘要  
在人机对话中,后续的用户话语可能隐式地与早期意图相冲突,导致大型语言模型误解用户需求并生成不恰当的回复。一个可靠的对话系统应该在生成回复前主动检测用户端的冲突,并在必要时寻求澄清。然而,先前的工作主要关注LLM端的冲突,用户端的冲突尚未得到充分探讨。为填补这一空白,我们构建了UC-Bench,这是一个用于评估用户端冲突检测的人工标注基准。初步实验表明,现有的LLM在处理这项任务时存在困难,尤其是当冲突源于对话历史中的隐式不兼容性时。为了在有限的训练数据下提升轻量级LLM的性能,我们研究了用户端冲突检测的数据合成方法。现有的合成方法并未显式地建模历史用户话语与当前用户话语之间的隐式不兼容性,因此难以捕捉冲突的演化并生成可靠标注的隐式冲突样本。我们提出SynUC,这是一种约束引导的合成方法,它在约束空间中表示用户端冲突,并使用SPEAKING框架来指导可追溯的约束转换。将SynUC应用于WildChat,我们构建了UC-Data,这是一个包含2,487个样本的用户端冲突训练集。在UC-Bench上,使用UC-Data训练的Qwen3.5-4B模型,其性能超越了Claude Opus 4.8等更大的通用LLM,也优于使用现有方法合成数据训练的同骨干模型。  

###### 关键词  
智能体\\sep大语言模型\\sep数据合成\\sep用户端冲突\\sep隐式冲突\\sep记忆\\sep主动交互  

## 1 引言  
大型语言模型(LLM)越来越多地被用于代码生成和文档撰写。然而,大多数现有系统仍然遵循被动交互范式,仅响应显式请求,而不评估新引入的要求是否与对话早期建立的要求兼容。在人机交互中,用户常常通过跨轮次地补充、修正或转移其意图来逐步明确需求。如果未能主动识别在此过程中引入的不兼容性,LLM可能仅仅遵循最新的话语,生成偏离用户深层意图的回复。近期研究开始审视人机对话中的指令冲突。ConInstruct聚焦于单个用户话语中约束之间的冲突,而MultiTurnInstruct则评估模型在多轮纠缠指令中检索信息、跟踪对话状态和解决冲突的能力。然而,这些研究主要评估指令遵循行为或回复质量,对用户端上下文中的隐式冲突关系仍探讨不足。在本工作中,隐式冲突指的是用户的新要求与早期要求不兼容,但用户并未明确表示修改。如图[1](https://arxiv.org/html/2609.19155#S1.F1)所示,用户首先要求LLM“为我的妻子和孩子们规划一次旅行”,并进一步指定要“避免拥挤的地方”。这建立了一个避免拥挤地点的显式约束,以及行程应适合家庭的隐式约束。然而,后续话语请求了一个“葡萄酒搭配晚餐”和一个“深夜爵士乐表演”。尽管该话语并未明确修改目标参与者,但所请求的活动可能与早期的家庭友好目标相冲突。检测到此冲突可以让LLM请求澄清,而不是直接采用忽略家庭友好约束的活动。  

为了评估LLM检测用户端隐式冲突的能力,我们首先构建了UC-Bench,这是一个经过人工标注的基准。UC-Bench将当前用户话语与对话历史的关系分为三类:正常对话、显式修改或隐式冲突。正常对话表示当前话语与先前要求兼容;显式修改涉及对先前要求的明确修改、替换或取消。基于UC-Bench,我们进行了初步研究。结果表明,当直接回复包含隐式冲突的用户话语时,LLM常常未能识别底层的不兼容性。相反,当被明确提示检查当前话语与对话历史之间的潜在冲突时,它们的检测性能有所提高。这些发现促使我们将用户端冲突检测构建为一个由外部监控模型执行的独立任务,该任务在生成回复之前评估这种关系。  

为解决用户端冲突检测训练数据稀缺的问题,我们研究了高质量训练样本的自动合成方法。现有的数据合成方法主要关注通用指令生成、任务响应生成或显式冲突构建。它们缺乏对对话历史与当前用户话语之间隐式不兼容性的结构化建模,因此难以捕捉冲突演化并生成可控的隐式冲突样本。为解决此限制,我们提出了SynUC,这是一种针对用户端冲突检测的约束引导数据合成方法。如图2(https://arxiv.org/html/2609.19155#S1.F2)所示,SynUC首先将用户指令从表面文本空间映射到约束空间,在约束空间中执行约束转换以派生出冲突约束。然后,它将这些约束映射回表面文本空间,形成包含冲突的后续用户话语。约束转换模块基于Hymes的SPEAKING框架构建,并建模为跨样本的自演进记忆,从而允许重用高质量的约束冲突构建经验。基于WildChat,我们使用SynUC构建了UC-Data,这是一个包含2,487个样本的训练集,用于监督微调和强化学习。为了进一步提升该任务上的强化学习效果,我们引入了一种约束归属奖励,鼓励模型识别冲突的约束。实验结果表明,在SynUC合成数据上训练的轻量级模型Qwen3.5-4B,在UC-Bench上超越了一系列强大的基线,包括更大的闭源模型Claude Opus 4.8。与其他数据合成方法相比,SynUC生成的训练数据更有效地提升了隐式冲突识别能力。进一步的消融研究表明,约束空间建模和基于SPEAKING的记忆都对最终性能有所贡献,支持了我们方法在用户端冲突检测方面的有效性。本文的主要贡献如下:  
1. 我们首次研究了多轮人机对话中的用户端隐式冲突。我们构建了用户端冲突检测基准UC-Bench,并表明现有LLM在此任务上仍面临重大挑战。  
2. 我们提出了SynUC,一种约束引导的数据合成方法。在UC-Bench上,使用SynUC合成数据训练的轻量级LLM超越了更大的通用LLM以及使用现有方法合成数据训练的同骨干模型。  
3. 我们开源了UC-Data、UC-Bench和SynUC合成代码以支持未来研究。111代码和数据可在 https://github.com/jqwangai/SynUC 获取。  

本文其余部分组织如下。第2节回顾相关工作。第3节介绍任务定义、关键术语和初步研究。第4节介绍SynUC数据合成方法和约束归属奖励。第5节描述实验设置。第6节报告主要结果和分析。第7节讨论关键设计选择和参数影响。第8节总结全文。  

## 2 相关工作  

### 2.1 对话冲突检测  
先前关于对话冲突检测的工作主要检查模型回复是否与角色信息、对话历史或外部知识一致。在开放领域对话中,这个问题通常被表述为自然语言推理。Dialogue NLI将角色一致性构建为自然语言推理任务,并将从角色描述和对话话语派生的句子对分类为蕴含、中立或矛盾。DECODE检测最终话语是否与先前对话上下文矛盾。CDConv引入了一个中文多轮对话基准,涵盖三种矛盾类型:句内矛盾、角色混淆和历史矛盾。在任务导向对话中,CI-ToD评估模型回复是否与用户查询、对话历史或知识库不一致。Wang等人进一步探索了零样本LLM提示和多智能体协作在此任务上的应用。最近的研究探讨了LLM如何处理生成内容和外部知识中的矛盾。Mündler等人分析了指令调优语言模型在开放式生成和问答设置下的自矛盾,并提出了基于提示的检测和缓解方法。CIDER提供不一致的对话回复、自然语言解释和基于澄清的恢复话语,以支持检测和解决对话不一致性。Wen等人提出了矛盾对话处理,其中模型检测并解释自矛盾,然后修改矛盾内容。WikiContradict评估LLM是否能生成准确反映检索到的维基百科段落之间冲突的答案。从数据生成的角度看,ConsistentChat使用人类对话意图和结构化信息流来指导合成一致的多轮指令数据。在指令遵循方面,ConInstruct评估LLM检测和解决单个用户指令中约束之间显式冲突的能力。总体而言,现有研究主要解决模型回复的不一致性和单轮指令中的显式冲突。然而,它们并未专门建模多轮交互中隐式的用户端冲突,即后续话语与对话早期建立的仍然有效的要求相冲突,且没有显式修改信号的情况。  

### 2.2 数据合成  
近期工作已广泛使用LLM合成指令数据以改善指令遵循能力。Self-Instruct从模型本身引导指令、输入和输出,并使用过滤后的数据进行指令调优。Baize采用自我聊天策略,由ChatGPT同时扮演用户和助手来生成多轮对话数据。UltraChat通过一个生成大规模、多主题、多轮指导性对话的系统框架,进一步扩展了合成对话数据的规模和主题覆盖范围。MAGPIE表明,对齐的LLM可以从对话模板前缀自回归地生成用户指令,然后生成相应的响应,从而实现从对齐模型大规模提取指令-响应数据。除了扩大数据规模,近期研究越来越强调质量控制和生成逻辑。Evol-Instruct通过迭代重写将简单指令演变为更复杂、更多样化的指令,提高模型遵循复杂指令的能力。REFED从高质量示例中提取可迁移的参考级反馈,以指导合成新的指令和响应。DESIGNER通过从现有的高质量问题中抽象出可重用的设计逻辑,并将其迁移到新的学科材料或文档中,从而针对复杂推理数据合成。其他近期方法,包括GLAN、DS2-Instruct和CrowdSelect,分别从分类法驱动、特定领域和数据选择的角度改进了合成数据生成。这些研究表明,合成数据的有效性不仅取决于规模,还取决于可迁移的反馈信号。除了通用指令数据合成,另一条研究线专注于多轮交互中的冲突场景。MultiTurnInstruct构建了涉及多轮依赖、信息整合和指令冲突的任务,以评估复杂多轮对话中的指令遵循能力。其矛盾解决任务进一步涵盖了冲突处理场景,如隐私保护、个性化和优先级排序。ConInstruct专注于单个用户指令中的显式冲突,构建了跨六个约束维度的冲突示例:内容、关键词、短语、长度、格式和风格。它评估模型检测和处理不兼容指令要求的能力。总体而言,现有的数据合成方法在通用对话生成、反馈引导合成和复杂推理数据构建方面取得了进展。然而,它们对于从对话历史中提取相关信息以及构建历史要求与后续用户话语之间可控的隐式冲突示例提供的支持有限。  

## 3 动机  

### 3.1 定义  
我们将用户端冲突检测表述为一个三分类任务,其中每个当前用户话语根据其与先前建立的用户要求的一致性进行分类:正常对话、显式修改或隐式冲突。  
- **正常对话**:指当前用户话语与对话历史中仍然有效的要求一致的情况。此类别包括继续原始任务的话语、在原始目标下添加兼容信息的话语,或引入不影响现有要求的新任务的话语。  
- **显式修改**:指用户在同一任务内明确更新、替换或否定先前陈述的要求的情况。修改

相似文章

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。