UserToolBench:工具使用大语言模型中个性化决策的用户画像隐藏基准

arXiv cs.LG 论文

摘要

UserToolBench 是一个新的基准,用于评估工具使用大语言模型中的个性化决策,测试模型是否能在信息不完整的情况下推断潜在用户偏好、决定何时澄清,并生成与用户一致的工具调用轨迹。实验表明,当前模型在多工具协调和长期一致性方面存在困难。

arXiv:2608.10042v1 公告类型:新 摘要:工具使用的大语言模型(LLMs)越来越需要代表用户采取行动,但现有基准通常侧重于个人资料回顾、风格模仿、通用工具使用或响应级个性化。我们推出了 UserToolBench,这是一个用于评估工具使用 LLMs 中个性化决策的基准。UserToolBench 测试模型能否从交互历史中推断潜在的用户偏好,识别何时需要澄清,并在信息不完整的情况下生成与用户对齐的工具调用轨迹。该基准基于隐私清洗后的真实交互痕迹构建,结合了结构化人物画像、公共 API 风格的工具生态系统以及长跨度多轮轨迹。它包含 10 个用户画像、36 个工具集、1,065 轮交互、170 个独特工具,以及涵盖信息缺失、单工具和多工具设置的评估导向任务类型。对强大工具使用 LLMs 的实验表明,当前模型在个性化委托方面仍存在困难。多工具协调、缺失约束推断和长跨度行为一致性仍然是主要瓶颈。这些结果表明,个性化评估应超越输出是否听起来用户专属的问题,转而关注 LLMs 是否为其所代表的用户做出正确的决策。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:27

# UserToolBench:面向工具使用大语言模型的用户画像隐藏式个性化决策基准
来源:https://arxiv.org/html/2608.10042
Xuexiong Yin¹,Zechuan Chen¹,Yongsen Zheng²,Yuxiang Zhang³,Jingyuan Yang³,Bin Wang³,Yubin Wang³,†,Keze Wang¹,†
¹中山大学
²南洋理工大学
³华为诺亚方舟实验室
†通讯作者

###### 摘要

工具使用大语言模型越来越需要代表用户执行操作,但现有基准通常侧重于画像回忆、风格模仿、通用工具使用或响应级别的个性化。我们引入了 UserToolBench,一个用于评估工具使用大语言模型中个性化决策能力的基准。UserToolBench 测试模型是否能够从交互历史中推断潜在的用户偏好,识别何时需要澄清,并在信息不完整的情况下生成与用户对齐的工具调用轨迹。该基准基于经过隐私净化的真实交互痕迹构建,并结合了结构化用户画像、公共 API 风格的工具生态系统以及长时间跨度的多轮轨迹。它包含 10 个用户画像、36 个工具集、1,065 轮对话、170 个独特工具,以及涵盖信息缺失、单工具和多工具设置的评估导向型任务类型。对强工具使用大语言模型的实验表明,当前模型在个性化委托方面仍存在困难。多工具协调、缺失约束推断和长时间跨度行为一致性仍然是主要瓶颈。这些结果表明,个性化评估应超越"输出是否听起来像用户特有"的问题,转而关注大语言模型是否为其所代表的用户做出了正确的决策。代码和资源可在 https://github.com/xxy212/UserToolBench 获取。

## 1 引言

工具使用大语言模型越来越被视为个人助理,需要代表用户进行搜索、规划、协调服务并调用外部工具。在这些场景中,个性化不仅关乎生成用户特有的响应,还关乎为持久用户做出正确的个性化决策。用户的请求可能省略决策关键约束,如预算、位置偏好、日程安排习惯或服务风格。一个可靠的助理必须从先前的交互中恢复此类偏好,决定是否需要澄清,并生成与用户既有行为一致的工具调用轨迹。我们将这种能力称为*个性化决策*。

现有基准为此问题提供了重要基础。个性化基准评估基于画像的条件生成、推荐和响应适应(Salemi et al., 2024; Jiang et al., 2025; Zhao et al., 2025; Gao et al., 2024; Li et al., 2024; Aroca-Ouellette et al., 2025),而工具使用基准则评估工具选择、参数构造和基于 API 的任务完成(Li et al., 2023; Qin et al., 2024; Tang et al., 2023; Yu et al., 2026)。交互式基准进一步引入了真实环境和长时间跨度的任务执行(Yao et al., 2024; Xiu et al., 2026),而近期的个性化工具使用基准将用户画像或历史与工具调用联系起来(Xu et al., 2025; Huang et al., 2025; Cheng et al., 2025; Hao et al., 2025)。然而,如表 1 所总结的,这些工作尚未联合评估个性化委托的核心四个要求:可执行的工具调用、持久的用户画像、长时间跨度的推理以及真实的用户-助手交互。这留下了一个悬而未决的问题:大语言模型能否利用交互历史做出对其所代表的特定用户而言正确的可执行决策?

表 1:UserToolBench 与代表性个性化或工具使用基准的比较。**工具使用**表示基准是否评估可执行的工具/API 调用。**固定画像**表示任务是否基于持久的用户画像。**长时间跨度**表示评估是否需要跨扩展的多轮或跨主题交互轨迹进行推理。**真实交互**表示交互轨迹是否旨在反映真实的用户-助手沟通风格,而非孤立的完全指定指令。

我们引入 UserToolBench,一个用于评估工具使用大语言模型中个性化决策能力的基准。UserToolBench 的核心设计是一个*画像隐藏*评估协议。参考轨迹在可访问持久用户画像的条件下构建和验证,因此目标决策基于稳定的用户偏好。在评估期间,被测大语言模型看不到显式画像。它只接收累积的交互历史、当前请求和可用的工具模式,并且必须推断出执行所需的用户特定约束。这种画像隐藏设置将个性化委托操作化为基于历史记录的可执行决策制定。由于显式画像是隐藏的,模型不能依赖直接的画像复制;它们必须从先前的交互中恢复相关偏好。由于评估基于工具调用轨迹,个性化通过工具选择、参数值、澄清行为和多步行动序列来衡量,而非表面层面的文本适应。由于决策嵌入在长时间跨度的交互中,该基准测试模型是否能够随时间保持行为一致的用户对齐。因此,UserToolBench 在单个评估设置中整合了不完整信息下的偏好推断、工具使用规划和长时间跨度个性化。

**贡献。** 本工作做出三项贡献。首先,我们将个性化决策定义为基于持久用户行为的不完整信息工具使用问题,并引入 UserToolBench 来评估这一设置。其次,我们提出了一种画像隐藏的评估协议,用于测试大语言模型是否能够从交互历史中推断潜在的用户偏好,并通过可执行的工具调用轨迹表达这些偏好。第三,我们评估了强工具使用大语言模型,并表明当前模型在可靠的个性化委托方面仍然存在困难,尤其是在多工具协调、缺失约束推断和长时间跨度行为一致性方面。

## 2 相关工作

#### 个性化语言建模。
个性化语言建模研究模型如何将生成文本适应到个体用户。LaMP 评估个性化生成任务,如引文预测、新闻标题生成和评论生成(Salemi et al., 2024)。其他工作研究了动态画像构建、基于画像的响应生成以及偏好感知对齐(Jiang et al., 2025; Zhao et al., 2025; Gao et al., 2024; Li et al., 2024; Aroca-Ouellette et al., 2025)。这些研究展示了用户特定上下文的价值,但其评估在很大程度上仍是响应层面的,并未直接测试代表用户做出的可执行决策。

#### 工具使用大语言模型。
工具使用基准评估大语言模型是否能够选择工具、构造有效参数并完成多步任务。API-Bank、ToolLLM、ToolAlpaca 和 WildToolBench 以越来越大的规模和真实感研究 API 和工具调用(Li et al., 2023; Qin et al., 2024; Tang et al., 2023; Yu et al., 2026)。诸如 τ-bench 和 ASTRA-bench 之类的交互式基准进一步在模拟服务或应用环境中评估智能体(Yao et al., 2024; Xiu et al., 2026)。Mem2ActBench 评估智能体是否能够在跨中断交互中主动应用长期记忆进行工具选择和参数落地(Shen et al., 2026)。这些设置确立了重要的工具使用和记忆能力,但通常不联合测试完整工具轨迹是否对持久用户的潜在偏好敏感,而该用户的结构化画像是隐藏的。

#### 个性化工具使用与以用户为中心的评估。
近期工作将个性化与基于大语言模型的助手中的工具使用联系起来。PEToolBench、PTBench、ToolSpectrum 和 ETAPP 在用户画像、历史或环境下评估个性化工具调用或主动工具增强智能体(Xu et al., 2025; Huang et al., 2025; Cheng et al., 2025; Hao et al., 2025)。其他基准将个性化扩展到网页导航、移动环境、购物、旅行规划、推荐和模拟(Cai et al., 2025; Yang et al., 2025; Kim et al., 2026a, b; Li et al., 2026; Wang et al., 2026b; Singh et al., 2024; Shao et al., 2025; Luo et al., 2025; Huang et al., 2026; Wang et al., 2026a; Kim et al., 2025)。UserToolBench 的不同之处在于,它聚焦于画像隐藏的偏好推断、澄清行为、偏好敏感的工具调用轨迹以及长时间跨度行为一致性,并将这些整合在面向工具使用大语言模型的单一个性化决策设置中。如表 1 所总结的,现有基准通常只覆盖该设置的一部分。有些评估个性化但不涉及工具执行,有些评估工具调用但没有持久画像,还有一些缺乏长时间跨度或真实的用户-助手交互轨迹。UserToolBench 旨在同时评估所有四个方面。

## 3 UserToolBench

### 3.1 任务表述

我们将个性化决策定义为不完整信息下的序列化工具使用问题。在该设置中,大语言模型根据稳定偏好代表用户行事,而不是简单地执行一个完全指定的指令。设 \(p \in \mathcal{P}\) 表示持久用户画像,\(h \in \mathcal{H}\) 表示历史交互轨迹,\(q\) 表示当前请求,\(T \in \mathcal{T}\) 表示可用的工具生态系统。我们将基于画像的参考构建与画像隐藏评估区分开来。参考轨迹在可访问 \(p\) 的条件下生成,而被评估的大语言模型只观察 \((h, q, T)\),并且必须从历史中推断用户特定的约束。形式上,参考决策轨迹在
\[
y^{\star} = f_{\mathrm{ref}}(p, h, q, T), \tag{1}
\]
下生成,其中 \(p\) 对参考生成器和验证器可见。被评估的大语言模型产生
\[
\hat{y} = f_{\theta}(h, q, T), \tag{2}
\]
其中 \(p\) 是隐藏的。这种不对称性是基准的核心:模型不能复制显式画像,而必须从更早的交互中恢复相关偏好,并将它们应用于当前决策。

预测轨迹 \(\hat{y} = \{a_1, \dots, a_N\}\) 可以包括澄清查询、带参数的工具调用、工具反馈的解释以及最终的面向用户的响应。当需要工具使用时,决策过程可能涉及与外部环境的一系列交互:
\[
\tau = \{a^T_1, e_1, a^T_2, e_2, \dots, a^T_S, e_S\}, \tag{3}
\]
其中 \(a^T_s\) 表示大语言模型在第 \(s\) 步发出的工具动作,\(e_s\) 表示相应的环境反馈。在参考构建期间,最终响应是在可访问用户画像、交互历史、当前请求和累积的环境观测的条件下生成的。在评估期间,被测大语言模型不观察用户画像,必须依赖交互历史、当前请求、可用工具及其推断出的用户特定偏好。由于 \(q\) 可能省略决策关键约束,大语言模型必须选择是请求澄清、从 \(h\) 推断缺失约束,还是利用现有信息继续执行。这与评估显式指令执行的常规工具使用基准不同,因为此处的成功取决于工具编排、偏好推断和行为一致性的共同作用。

### 3.2 数据来源与合成流程

见图 1 标题:UserToolBench 构建流程概览。持久用户画像在数据合成期间对用户模拟器和参考轨迹生成器均可见。用户模拟器生成与画像一致的多轮请求,而参考生成器在相同画像的访问权限下生成画像感知的工具调用轨迹。

我们使用基于画像的数据合成流程来构建 UserToolBench,以实现真实的决策制定。每条轨迹都与一个持久的用户身份相关联:一个基于角色条件的用户模拟器生成与画像一致的请求,而一个参考轨迹生成器在相同画像的访问权限下生成画像感知的工具调用。图 1 展示了构建过程和一个多轮轨迹示例。

#### 用户画像来源。
每个基准实例都与一个基于隐私净化后的真实交互痕迹构建的持久用户画像相关联。我们不保留原始对话,而是使用大语言模型辅助的抽象过程将痕迹转换为结构化角色表示,其中包含人口统计描述符、语言背景、沟通风格、人格特质、偏好类别以及反复出现的任务相关约束。敏感或可识别的细节在任务构建不必要时会被移除、泛化或抽象。在生成和验证期间,我们关注非识别性的决策相关信号,如预算习惯、旅行风格、日程安排惯例、服务偏好和沟通规范。角色画像选择、模式结构和隐私处理的详细信息见附录 B。

#### 工具生态系统来源。
我们遵循先前工具使用基准的构建实践(如 ToolAlpaca (Tang et al., 2023)),从公共 API 风格能力构建工具环境

相似文章

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。