意图胜于言语:超越响应模仿的可控用户模拟

Hugging Face Daily Papers 论文

摘要

本文介绍了UserIDA,一种用于可控用户模拟的方法,将交互意图与语言表达分离,在LMSYS-USP基准上实现了比基线显著更高的意图准确率和响应质量。

用户模拟器被广泛用作训练和评估交互式助手的可扩展环境。生成下一轮用户话语本质上是一对多的:相同的用户画像和对话上下文可能支持多种具有不同局部交互意图的合理延续。因此,一个流畅的响应可能会通过不恰当的意图推进对话,例如接受而不是修复。我们的关键见解是,可控用户模拟应将下一轮用户话语应实现的局部交互意图与该意图在语言中的表达方式分离开来。我们提出了UserIDA(用户意图-指令对齐),它将交互意图作为每一轮的显式指令来呈现。UserIDA定义了一个六类意图接口,通过监督微调学习以指令为条件的生成,并在基于分组的强化学习中使用意图校准的策略优化。奖励机制在保持综合响应质量的同时,确保在混合分组中违反意图的候选排在符合意图的备选之下。在LMSYS-USP上,UserIDA实现了86.6\%的意图准确率,比最强的专用用户模拟器基线高出24.3个百分点,同时提高了语义和风格相似度。在上下文内干预中,它在91.7\%的评估对话状态下实现了六个目标意图中的至少四个,而最强的外部基线仅为22.9\%。这些结果确立了逐轮意图控制作为用户模拟中响应保真度的补充维度。
查看原文
查看缓存全文

缓存时间: 2026/08/11 06:20

论文页面 - 意图胜于言语:超越响应模仿的可控用户模拟

来源:https://huggingface.co/papers/2608.09420

摘要

用户模拟器被广泛用作训练和评估交互式助手的可扩展环境。生成下一轮用户话语本质上是多对一的:相同的用户画像和对话上下文可能支持多种合理的延续,且各自带有不同的局部交互意图。因此,一个流畅的响应可能会通过不恰当的意图推进对话,例如选择接受而非修复。我们的关键见解是,可控的用户模拟应将在下一轮用户话语中应实现的局部交互意图,与该意图在语言中的表达方式分离开来。我们提出了UserIDA(用户意图-指令对齐,UserIntent-DirectiveAlignment),它将交互意图作为每轮显式的指令暴露给模型。UserIDA定义了一个六类意图接口,通过监督微调学习基于指令的条件生成,并在基于分组的强化学习中使用意图校准的策略优化。其奖励在保持综合响应质量的同时,确保在混合分组中违反意图的候选排在被遵循指令的候选之后。在LMSYS-USP上,UserIDA实现了86.6%的意图准确率,比最强的专用用户模拟器基线高出24.3个百分点,同时提升了语义和风格相似度。在上下文内干预测试中,它在91.7%的评估对话状态下实现了六种目标意图中的至少四种,而最强外部基线仅为22.9%。这些结果确立了每轮意图控制作为用户模拟中响应保真度的补充维度。

查看arXiv页面 (https://arxiv.org/abs/2608.09420)查看PDF (https://arxiv.org/pdf/2608.09420)GitHub1 (https://github.com/ptwang773/UserIDA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.09420)

在您的agent中获取此论文:

hf papers read 2608\.09420

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文

在模型README.md中引用arxiv.org/abs/2608.09420即可从此页面链接该模型。

引用此论文的数据集0

暂无数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2608.09420即可从此页面链接该数据集。

引用此论文的Space0

暂无Space关联此论文

在Space README.md中引用arxiv.org/abs/2608.09420即可从此页面链接该Space。

包含此论文的收藏集0

暂无收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection)中即可从此页面链接该论文。

相似文章

RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距

arXiv cs.AI

本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。