LLMs在追踪不断演变的用户意图时迷失方向

arXiv cs.LG 论文

摘要

本文提出一个框架,将静态任务转化为动态的多轮对话,以评估LLMs追踪不断演变的用户意图的能力,结果发现强大的静态性能并不能迁移到动态场景中。

arXiv:2607.20734v1 公告类型: 新发布 摘要:随着LLMs能力不断增强,它们越来越多地被部署为协作代理,通过迭代交互承担用户委托的任务。然而,真正的交互本质上是动态的:用户很少提前明确自己的意图,而是在对话过程中逐步透露、修改和重塑意图。尽管如此,LLMs仍然主要在单轮、完全指定的场景中进行评估或训练,这留下了一个根本性问题:当用户意图在对话过程中演变时,LLMs能在多大程度上追踪并据此行动?为了研究这一点,我们引入了一个框架,将静态的单轮任务转化为动态的多轮对话,其中用户的意图在不同轮次间演变——逐步透露、修改,有时在对话中途转变方向——同时保留每个任务的原始评估协议,使得现有基准可以在无需新标注的情况下作为受控测试平台重复使用。在多个任务上,我们观察到一致的现象:强大的静态性能并不能迁移到演变意图的场景中,各模型系列的性能均出现大幅下降。我们的研究结果揭示了一个根本性差距:当前的LLMs尚未能忠实地追踪并依据用户不断演变的意图行动,这一能力在静态评估中不可见,但对于未来的协作代理至关重要。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:14

# LLMs在用户意图演变中迷失
来源:https://arxiv.org/abs/2607.20734
查看 PDF(https://arxiv.org/pdf/2607.20734)

> 摘要:随着LLMs能力不断增强,它们越来越多地被部署为协作代理,通过迭代交互承担用户委托的任务。然而,真正的交互本质上是动态的:用户很少提前说明自己的意图,而是在对话过程中逐步披露、修正并重塑意图。尽管如此,LLMs目前仍然主要在单轮、完全指定的设置中进行评估或训练,这留下了一个根本性问题:当用户意图在对话过程中演变时,LLMs能否很好地跟踪并据此行动?为了研究这一问题,我们引入了一个框架,将静态的单轮任务转化为动态的多轮对话——用户意图在轮次之间演变(逐步揭示、修正,有时在对话中途转向)——同时保留每个任务原有的评估协议,使得现有基准无需新的标注即可被复用为受控测试平台。在多个任务中,我们观察到一致的现象:强静态设置下的表现并不能迁移到意图演变场景中,各模型家族均出现大幅下降。我们的发现指向一个根本性的差距:如今的LLMs尚未能忠实地跟踪并响应用户不断演变的意图——这一能力在静态评估中不可见,但对未来的协作代理至关重要。

## 提交历史

来自:Jihoon Tack [查看邮箱](https://arxiv.org/show-email/30f6ac23/2607.20734) **\[v1\]**2026年7月22日星期三21:14:44 UTC(1,802 KB)

相似文章

LLM的未来发展方向

Reddit r/artificial

文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。