APeB:大型语言模型智能体个性化能力的基准测试

arXiv cs.AI 论文

摘要

提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。

arXiv:2607.03162v1 Announce Type: new 摘要:当用户提出原始且不明确的查询时,基于LLM的智能体在个性化方面表现不佳。在这种情况下,智能体必须推断潜在意图,从含噪声的交互历史中提取偏好,并在多个备选项中做出选择。现有基准很少测试这一能力,因为它们通常依赖于用户细化后的查询或简化后的历史。我们引入了个性化产品搜索(PPS),一个用于在原始查询和多样化历史下测试智能体个性化的试验平台。我们利用行动日志构建了智能体个性化基准(APeB),将不明确的意图与丰富的历史记录及用户浏览过的候选物品配对。通过多步智能体工作流程评估最先进的LLM,我们发现模型能很好地处理明确查询,但在需要意图和偏好发现的初期查询上表现欠佳。评分标准分析将这一差距主要归因于历史信息使用不当。一个简单的历史感知查询细化流程VQRA带来了持续改进,突显了在个性化智能体中需要专门的历史利用模块。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:34

# Benchmarking Personalization Ability of Large Language Model Agents 来源:https://arxiv.org/html/2607.03162 Garry Yang¹,\* (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Zizhe Chen¹,\* (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Xinru Chen² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Yongqiang Chen¹ (https://arxiv.org/html/2607.03162v1/mailto:[email protected]) Jianxiang Wang² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Deyu Zou¹ (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Linyi Ding² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Jialiang Wu² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]) Yunzhong He² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Yu Gong² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),James Cheng¹,† (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Huaixiao Tou²,† (https://arxiv.org/html/2607.03162v1/mailto:[email protected]) ¹香港中文大学 ²字节跳动 ###### 摘要 基于大语言模型(LLM)的智能体在用户提出原始、模糊的查询时,往往难以实现个性化。在这种情况下,智能体必须推断潜在意图,从含噪声的交互历史中提取偏好,并在相互竞争的多个选项中做出选择。现有基准测试很少能真正检验这种能力,因为它们常常依赖用户精炼后的查询或简化后的历史记录。我们引入个性化产品搜索(PPS)作为在原始查询和多样化历史条件下测试智能体个性化能力的实验平台。我们基于行为日志构建了 AgentPersonalizedBenchmark(APeB),将模糊意图与丰富的历史记录及用户浏览过的候选商品配对。在评估采用多步智能体工作流的最先进 LLM 时,我们发现模型能够很好地处理明确查询,但在需要意图和偏好发现的早期查询上表现不佳。评分标准分析表明,这种差距主要源于对历史数据的低效利用。一个简单的历史感知查询精炼流水线 VQRA 取得了持续改进,这凸显了在个性化智能体中开发专用历史利用模块的必要性。 APeB:评估大语言模型智能体个性化能力的基准测试 Garry Yang¹,\* (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Zizhe Chen¹,\* (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Xinru Chen² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Yongqiang Chen¹ (https://arxiv.org/html/2607.03162v1/mailto:[email protected]) Jianxiang Wang² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Deyu Zou¹ (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Linyi Ding² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Jialiang Wu² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]) Yunzhong He² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Yu Gong² (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),James Cheng¹,† (https://arxiv.org/html/2607.03162v1/mailto:[email protected]),Huaixiao Tou²,† (https://arxiv.org/html/2607.03162v1/mailto:[email protected]) ¹香港中文大学 ²字节跳动 ¹¹footnotetext:同等贡献。 ²²footnotetext:通讯作者。 ## 1 引言 参见图注 图 1:智能体面临的个性化挑战:从多样化历史中推断意图和偏好,以做出符合偏好的决策。 表 1:现有基准测试在是否以及如何捕捉核心个性化挑战方面的比较。 基于大语言模型(LLM)的智能体通过为基础模型添加记忆、规划和执行等额外模块,使其能够在长上下文中进行多步、目标导向的推理 (Peng et al. (https://arxiv.org/html/2607.03162#bib.bib37); Wang et al. (https://arxiv.org/html/2607.03162#bib.bib58); Zhang et al. (https://arxiv.org/html/2607.03162#bib.bib76); Hu et al. (https://arxiv.org/html/2607.03162#bib.bib20))。如图 1 (https://arxiv.org/html/2607.03162#S1.F1) 所示,基于 LLM 的智能体面临的一个核心挑战是**个性化**:用户目标并未明确指定;偏好是隐式的,仅通过历史部分可观察;正确性是以用户为中心的,而非全局最优 (Russell (https://arxiv.org/html/2607.03162#bib.bib46))。在实践中,用户会隐式地基于自身过往经验进行推理,将模糊意图转化为具体标准,并在多个可能选项中做出区分 (Downey et al. (https://arxiv.org/html/2607.03162#bib.bib11); Punj and Moore (https://arxiv.org/html/2607.03162#bib.bib39); Liu et al. (https://arxiv.org/html/2607.03162#bib.bib26))。因此,个性化智能体应将其规划和行动内在地与特定用户的意图对齐,而非在完全指定的目标下生成泛化响应 (Zhang et al. (https://arxiv.org/html/2607.03162#bib.bib76))。因此,我们提出以下问题: > *我们如何衡量 LLM 面向智能体(agentic)的个性化能力?* 据我们所知,现有基准测试各自仅针对其中一两个维度,但从未将含噪的异构历史、模糊到精炼的搜索轨迹以及高度相近的候选选项结合在一起。 *推荐基准测试*将个性化视为基于历史信号预测下一步动作,侧重于偏好推导而非目标理解 (Zhu et al. (https://arxiv.org/html/2607.03162#bib.bib78); Liu et al. (https://arxiv.org/html/2607.03162#bib.bib25))。 *推理依据预测基准测试*评估局部的推理能力,侧重于孤立地生成中间解释,而非达成与用户对齐的结果 (Wang et al. (https://arxiv.org/html/2607.03162#bib.bib62); Yang et al. (https://arxiv.org/html/2607.03162#bib.bib68))。 *多轮记忆基准测试*将个性化建模为在基本同质的对话上进行,评估提取相关信息的能力,而非在模糊情境下推断意图 (Hu et al. (https://arxiv.org/html/2607.03162#bib.bib20); Huang et al. (https://arxiv.org/html/2607.03162#bib.bib21))。 总之,这些基准测试避开了对含噪历史、未经精炼的用户查询以及高度相近的候选选项进行联合推理的需求。因此,它们也无法评估智能体流水线(例如 ReAct)是否有助于意图推断和符合偏好的行动 (Du et al. (https://arxiv.org/html/2607.03162#bib.bib12))。 受这些局限性驱动,我们构建了 APeB(AgentPersonalizedBenchmark),通过**个性化产品搜索(PPS)**任务来评估智能体的个性化能力。PPS 将个性化定义为:在购物意图和长期行为偏好的条件下,用户在相互竞争的产品中做出特定选择 (Robertson and Zaragoza (https://arxiv.org/html/2607.03162#bib.bib45); Duan and Zhai (https://arxiv.org/html/2607.03162#bib.bib13))。在线平台上,用户行为跨领域充满噪声,购物意图常常模糊且处于早期阶段,并且购买只有在比较相似产品后才发生 (Liu et al. (https://arxiv.org/html/2607.03162#bib.bib27); Reddy et al. (https://arxiv.org/html/2607.03162#bib.bib42); Downey et al. (https://arxiv.org/html/2607.03162#bib.bib11); Rendle et al. (https://arxiv.org/html/2607.03162#bib.bib43))。然而,先前的 *PPS 基准测试*依赖于经过清理的历史、明确化的查询以及易于区分的候选 (Liu et al. (https://arxiv.org/html/2607.03162#bib.bib26); Hou et al. (https://arxiv.org/html/2607.03162#bib.bib19)),从而未能评估在模糊、需要深度推理的条件下的个性化能力。这种符合偏好的购买也与**通用购物基准测试**形成对比,后者侧重于孤立的子任务(例如产品匹配),而不将决策植根于用户特定的意图和历史中 (Jin et al. (https://arxiv.org/html/2607.03162#bib.bib24); Yao et al. (https://arxiv.org/html/2607.03162#bib.bib70))。与相关基准测试的比较见表 1 (https://arxiv.org/html/2607.03162#S1.T1)。完整相关工作见附录 A (https://arxiv.org/html/2607.03162#A1)。 相应地,APeB 包含了来自一个具有购物功能的领先内容平台的复杂案例。它包含来自 10 多个类别的 5,648 个案例,这些案例采集自一个 30 天保留会话窗口,并具有最多 60 天的会话前历史(第 3 节 (https://arxiv.org/html/2607.03162#S3))。用户主要消费视频和直播,但可以在同一平台内无缝过渡到产品搜索、浏览和购买。这种端到端流程产生了丰富、异构的交互历史,捕捉了现实世界中的个性化挑战(见附录 B.1 (https://arxiv.org/html/2607.03162#A2.SS1))。我们将用户行为区分为长期历史期和个性化购物会话,以用户发起搜索的时间戳为界(第 2.1.1 节 (https://arxiv.org/html/2607.03162#S2.SS1.SSS1))。会话仅在搜索导致经过深度推理浏览后的查询对齐购买时保留(第 2.1.2 节 (https://arxiv.org/html/2607.03162#S2.SS1.SSS2))。历史期包含与产品及上下文内容(例如视频和直播)的多样化交互,提供长期个性化信号(第 2.2.1 节 (https://arxiv.org/html/2607.03162#S2.SS2.SSS1))。购物会话包含从原始意图到精炼关键词的用户搜索(第 2.2.2 节 (https://arxiv.org/html/2607.03162#S2.SS2.SSS2)),以及一组被大量浏览的竞争性候选(第 2.2.3 节 (https://arxiv.org/html/2607.03162#S2.SS2.SSS3))和最终的购买商品,从而实现意图评估和可验证的以用户为中心的评估。 我们评估个性化智能体能否首先从模糊意图和历史线索中推断用户潜在偏好(*规划*),然后在用户面临相近选择时代表用户做出决策(*动作*)(图 1 (https://arxiv.org/html/2607.03162#S1.F1) 中定义的流水线)。我们在 APeB 上使用最新 LLM 及智能体工作流进行测试。评估涵盖**意图**和**精炼**查询,包含随机和困难候选,并与 PPS 模型 UniSAR 进行比较 (Shi et al. (https://arxiv.org/html/2607.03162#bib.bib51))。结果表明:(1) 在语义对齐主导而非个性化主导的设置中(精炼查询或随机候选),LLM 显著优于 UniSAR,ReAct 工作流进一步提升性能;(2) 对于需要用户建模和意图精炼的任务(使用困难候选的意图查询),LLM 的表现降至零样本 UniSAR 的水平,ReAct 工作流的提升有限;(3) 评分标准分析表明,意图查询暴露了弱意图和历史归因问题,ReAct 则因多步规划不佳而进一步损害性能;(4) 我们发现一个简单的基于历史信息的模糊查询精炼智能体(VQRA)流水线在意图条件下改善了意图推断和 Hit@1。总体而言,APeB 可作为在现实个性化约束下评估智能体系统的测试平台。 ## 2 APeB 构建 参见图注 图 2:APeB 的构建流水线:从行为日志到基准测试组件:精选的异构交互、非平凡的购物会话发现(搜索精炼、广泛浏览和意图-订单对齐),以及意图/精炼查询-候选对识别。APeB 针对基于整体用户行为的具有挑战性的个性化。 我们引入 APeB,一个旨在评估 PPS 任务上**智能体个性化能力**的基准测试。为了保留那些个性化决策耗时且交互密集的案例(第 2.1.2 节 (https://arxiv.org/html/2607.03162#S2.SS1.SSS2)),我们收集**非平凡的购物会话**,其中包含从整体用户行为日志中挖掘出的异构历史(附录 B (https://arxiv.org/html/2607.03162#A2))。如图 2 (https://arxiv.org/html/2607.03162#S2.F2) 所示,一个*会话*被定义为一个有时间界定的搜索到订单窗口,以搜索开始,以购买结束(第 2.1.1 节 (https://arxiv.org/html/2607.03162#S2.SS1.SSS1))。非平凡会话涉及查询重构和广泛的产品比较,然后才做出符合意图的订单(第 2.1.2 节 (https://arxiv.org/html/2607.03162#S2.SS1.SSS2)),这反映了用户历史如何塑造查询表述、探索和决策 (Shang et al. (https://arxiv.org/html/2607.03162#bib.bib48); Zuo et al. (https://arxiv.org/html/2607.03162#bib.bib81))。这些会话本质上要求智能体联合推理长期用户偏好、原始查询意图和细粒度的候选差异,而非依赖表面层面的语义匹配。对于过滤后的会话,我们构建三个基准测试组件:(i) 异构历史——偏好信号(图 2 (https://arxiv.org/html/2607.03162#S2.F2) 左侧,第 2.2.1 节 (https://arxiv.org/html/2607.03162#S2.SS2.SSS1));(ii) 用户发出的**意图**(模糊、早期阶段)和**精炼**(明确、后期阶段)查询——不同级别的查询具体性(图 2 (https://arxiv.org/html/2607.03162#S2.F2) 右侧,第 2.2.2 节 (https://arxiv.org/html/2607.03162#S2.SS2.SSS2));(iii) **困难候选集**——用户考虑过的产品,以及**观察到的已购商品**(图 2 (https://arxiv.org/html/2607.03162#S2.F2) 右侧,第 2.2.3 节 (https://arxiv.org/html/2607.03162#S2.SS2.SSS3))。 ### 2.1 非平凡购物会话发现 为了从行为日志中识别*非平凡购物会话*,我们首先保留在 60 天窗口内具有足够交互密度的用户(见附录 B.2 (https://arxiv.org/html/2607.03162#A2.SS2))。遵循长期-短期划分范式 (Liu et al. (https://arxiv.org/html/2607.03162#bib.bib25)),我们通过以搜索时间戳为锚定边界,提取**搜索到订单的会话**。从这些会话中,我们进一步选择具有查询演变、广泛内容浏览以及在个性化购买决策前进行跨产品比较的*非平凡案例*。 #### 2.1.1 搜索到订单会话的分离 我们通过搜索动作时间戳(图 2 中的‘{’)分离每个用户的交互序列。对于用户 uu,令 Iu={(xuk,tuk)}k=1Nu\mathcal{I}_{u}=\{(x_{u}^{k},t_{u}^{k})\}_{k=1}^{N_{u}} 表示按时间顺序排列的交互日志,其中 xukx_{u}^{k} 是一个动作,tukt_{u}^{k} 是其时间戳。我们考虑在时间 tumt_{u}^{m} 的初始搜索动作 xum=query(q)x_{u}^{m}=\mathrm{query}(q)和在时间 tunt_{u}^{n} 的最终购买动作 xun=order(p)x_{u}^{n}=\mathrm{order}(p)。如果在搜索后固定时间窗口 Δ=30\Delta=30 分钟内发生购买,则识别出一个*搜索到订单的会话*:tun−tum≤Δt_{u}^{n}-t_{u}^{m}\leq\Delta。没有任何此类会话的用户将被移除;如果存在多个会话,则为每个用户保留一个。对于每个保留的会话,搜索时间 tumt_{u}^{m} 和购买时间 tunt_{u}^{n} 定义了分离边界: Hu\displaystyle\mathcal{H}_{u}  # 任务:结构化产品推荐(精确 5 项) 你的目标是从以下数据中推荐精确的 5 个产品,使其最能匹配用户的明确需求: (1

相似文章

PM-Bench:评估LLM智能体的前瞻记忆能力

arXiv cs.AI

提出了PM-Bench,这是一个受认知科学启发、用于评估LLM智能体前瞻记忆能力的基于文本的基准测试。实验表明,即使是最佳方法(GPT-5.4智能体)也仅达到65.1%的F1分数,表明在可靠的意图执行方面存在重大挑战。