LLMs在追踪不断演变的用户意图时迷失方向
摘要
本文提出一个框架,将静态任务转化为动态的多轮对话,以评估LLMs追踪不断演变的用户意图的能力,结果发现强大的静态性能并不能迁移到动态场景中。
arXiv:2607.20734v1 公告类型: 新发布
摘要:随着LLMs能力不断增强,它们越来越多地被部署为协作代理,通过迭代交互承担用户委托的任务。然而,真正的交互本质上是动态的:用户很少提前明确自己的意图,而是在对话过程中逐步透露、修改和重塑意图。尽管如此,LLMs仍然主要在单轮、完全指定的场景中进行评估或训练,这留下了一个根本性问题:当用户意图在对话过程中演变时,LLMs能在多大程度上追踪并据此行动?为了研究这一点,我们引入了一个框架,将静态的单轮任务转化为动态的多轮对话,其中用户的意图在不同轮次间演变——逐步透露、修改,有时在对话中途转变方向——同时保留每个任务的原始评估协议,使得现有基准可以在无需新标注的情况下作为受控测试平台重复使用。在多个任务上,我们观察到一致的现象:强大的静态性能并不能迁移到演变意图的场景中,各模型系列的性能均出现大幅下降。我们的研究结果揭示了一个根本性差距:当前的LLMs尚未能忠实地追踪并依据用户不断演变的意图行动,这一能力在静态评估中不可见,但对于未来的协作代理至关重要。
查看缓存全文
缓存时间: 2026/07/24 05:14
# LLMs在用户意图演变中迷失 来源:https://arxiv.org/abs/2607.20734 查看 PDF(https://arxiv.org/pdf/2607.20734) > 摘要:随着LLMs能力不断增强,它们越来越多地被部署为协作代理,通过迭代交互承担用户委托的任务。然而,真正的交互本质上是动态的:用户很少提前说明自己的意图,而是在对话过程中逐步披露、修正并重塑意图。尽管如此,LLMs目前仍然主要在单轮、完全指定的设置中进行评估或训练,这留下了一个根本性问题:当用户意图在对话过程中演变时,LLMs能否很好地跟踪并据此行动?为了研究这一问题,我们引入了一个框架,将静态的单轮任务转化为动态的多轮对话——用户意图在轮次之间演变(逐步揭示、修正,有时在对话中途转向)——同时保留每个任务原有的评估协议,使得现有基准无需新的标注即可被复用为受控测试平台。在多个任务中,我们观察到一致的现象:强静态设置下的表现并不能迁移到意图演变场景中,各模型家族均出现大幅下降。我们的发现指向一个根本性的差距:如今的LLMs尚未能忠实地跟踪并响应用户不断演变的意图——这一能力在静态评估中不可见,但对未来的协作代理至关重要。 ## 提交历史 来自:Jihoon Tack [查看邮箱](https://arxiv.org/show-email/30f6ac23/2607.20734) **\[v1\]**2026年7月22日星期三21:14:44 UTC(1,802 KB)
相似文章
LLMs何时能取代微调NLU?生产会话系统中意图检测的决策框架
该论文评估了零样本LLM何时能在生产环境中取代微调NLU分类器进行意图检测,突出了LLM在超出范围检测、ASR鲁棒性和动态模式方面的优势,并为实践者提供了决策框架。
LLM的未来发展方向
文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析
本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。
大多数大语言模型评估工具是否仍然过于侧重提示词?
作者质疑当前的 LLM 评估工具是否过于关注孤立的提示词,而忽视了完整的工作流程和智能体交互,并指出逐步的准确性可能会掩盖生产环境中整体行为的偏差。