意图胜于言语:超越响应模仿的可控用户模拟
摘要
本文介绍了UserIDA,一种用于可控用户模拟的方法,将交互意图与语言表达分离,在LMSYS-USP基准上实现了比基线显著更高的意图准确率和响应质量。
查看缓存全文
缓存时间: 2026/08/11 06:20
论文页面 - 意图胜于言语:超越响应模仿的可控用户模拟
来源:https://huggingface.co/papers/2608.09420
摘要
用户模拟器被广泛用作训练和评估交互式助手的可扩展环境。生成下一轮用户话语本质上是多对一的:相同的用户画像和对话上下文可能支持多种合理的延续,且各自带有不同的局部交互意图。因此,一个流畅的响应可能会通过不恰当的意图推进对话,例如选择接受而非修复。我们的关键见解是,可控的用户模拟应将在下一轮用户话语中应实现的局部交互意图,与该意图在语言中的表达方式分离开来。我们提出了UserIDA(用户意图-指令对齐,UserIntent-DirectiveAlignment),它将交互意图作为每轮显式的指令暴露给模型。UserIDA定义了一个六类意图接口,通过监督微调学习基于指令的条件生成,并在基于分组的强化学习中使用意图校准的策略优化。其奖励在保持综合响应质量的同时,确保在混合分组中违反意图的候选排在被遵循指令的候选之后。在LMSYS-USP上,UserIDA实现了86.6%的意图准确率,比最强的专用用户模拟器基线高出24.3个百分点,同时提升了语义和风格相似度。在上下文内干预测试中,它在91.7%的评估对话状态下实现了六种目标意图中的至少四种,而最强外部基线仅为22.9%。这些结果确立了每轮意图控制作为用户模拟中响应保真度的补充维度。
查看arXiv页面 (https://arxiv.org/abs/2608.09420)查看PDF (https://arxiv.org/pdf/2608.09420)GitHub1 (https://github.com/ptwang773/UserIDA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.09420)
在您的agent中获取此论文:
hf papers read 2608\.09420
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
在模型README.md中引用arxiv.org/abs/2608.09420即可从此页面链接该模型。
引用此论文的数据集0
暂无数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2608.09420即可从此页面链接该数据集。
引用此论文的Space0
暂无Space关联此论文
在Space README.md中引用arxiv.org/abs/2608.09420即可从此页面链接该Space。
包含此论文的收藏集0
暂无收藏集包含此论文
将这篇论文添加到收藏集 (https://huggingface.co/new-collection)中即可从此页面链接该论文。
相似文章
RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距
本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。
Enjoy Your Talk: 一个以人为中心的多轮对话基准,采用解耦的用户模拟、目标建模与评判
本文介绍了EYT-Bench,一个以人为中心的基准,用于评估多轮对话中的LLM,采用了解耦的用户模拟、目标建模和评判设计。它揭示了闭源和开源模型在客观意图追踪上差异显著,但在主观维度上相似;推理能力提升了客观追踪,而人物角色格式强烈影响轨迹分布。
INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.
对话推荐系统中用户模拟的提示优化:一个多目标框架
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。