面向时间干预下个人LLM智能体的用户条件化评估
摘要
本文认为,评估个人LLM智能体需要跨不同的用户条件化状态重放时间干预,并指出现有基准中的空白。它提出了一个最小基准设计和用于用户条件化适应的报告指标。
arXiv:2607.21635v1 Announce Type: new
摘要:个人智能体维护着随着每个用户而演变的记忆、学习到的技能、工具配置和策略状态。现有的智能体基准通常孤立地评估这些能力:工具基准测试固定API下的调用,记忆基准测试回忆或遗忘,安全基准测试静态策略合规性。我们认为个人智能体评估需要不同的协议:跨不同的持久化用户条件化状态重放相同的时间干预,并测量故障如何在智能体组件间传播。我们将这一要求形式化为四个条件:显式时间干预、跨干预的持久状态、诱导的跨维度效应以及用户条件化状态的变化。对通过明确纳入标准选定的公共基准协议进行集中审计,发现了几个接近的情况。在我们明确狭窄的操作化下,我们没有在审计的集合中找到满足所有四个条件的协议。这一主张被界定为具有有限文献覆盖的集中差距分析。本立场论文提出了一个最小基准设计和用于用户条件化适应的候选报告指标。结果为未来个人智能体评估提供了一个具体的设计要求,其中指标用作该要求的报告工具。
查看缓存全文
缓存时间: 2026/07/27 07:40
# 面向时间干预下个人LLM代理的用户条件评估 来源:https://arxiv.org/html/2607.21635 ###### 摘要 个人代理会随每个用户维护记忆、习得技能、工具配置和策略状态。现有代理基准通常孤立评估这些能力:工具基准测试在固定API下的调用能力,记忆基准测试回忆或遗忘能力,安全基准测试静态策略合规性。我们认为,个人代理评估需要不同的协议:跨不同持久化用户条件状态回放相同的时间干预,并测量故障如何在代理组件间传播。我们将这一需求形式化为四个条件:显式时间干预、跨干预的持久化状态、引发的跨维度影响,以及用户条件状态的变化。一项针对通过显式纳入标准选择的公开基准协议的重点审计,识别出若干接近案例。在我们明确狭窄的操作化定义下,我们未在该审计集中找到满足所有四个条件的协议。这一主张限定为一次具有有限文献覆盖范围的重点差距分析。本篇立场论文提出了一种最小的基准设计和候选报告指标,用于用户条件适应性。结果是未来个人代理评估的具体设计需求,以及作为该需求报告工具的指标。 ## 1. 引言 最近的软件工程证据表明,接口漂移成为了一个超出受控扰动的实际代理风险。Zhu等人研究了现代LLM代理框架中的998份错误报告,发现API误用(32.97%)和API不兼容(22.34%)合计占报告故障的一半以上;常见症状是功能错误、崩溃和构建失败,集中在执行密集型Self-Action阶段(Zhu等人,2026 (https://arxiv.org/html/2607.21635#bib.bib45))。破坏性变更也可能由代理自身引入。Ferdous等人比较了7,191份代理生成的拉取请求与1,402份人类编写的拉取请求;代理变更的整体破坏率较低(3.45% 对比 7.40%),但面向维护的重构和杂务任务仍分别产生6.72%和9.35%的不向后兼容变更(Ferdous等人,2026 (https://arxiv.org/html/2607.21635#bib.bib46))。这些研究将个性化排除在外。它们仍然确定了压力点:演变的接口、过时的假设,以及无法推理下游依赖的修复代码。 *个人智能*将持久化用户状态添加到该故障模式中。通用助手通常基于标准化基准进行评估。个人代理则维护用户偏好的长期记忆和个性化交互上下文(Packer等人,2024 (https://arxiv.org/html/2607.21635#bib.bib21);Du,2026 (https://arxiv.org/html/2607.21635#bib.bib11);Li等人,2026b (https://arxiv.org/html/2607.21635#bib.bib47),a (https://arxiv.org/html/2607.21635#bib.bib56)),获取针对个人工作流定制的技能(Yang等人,2026 (https://arxiv.org/html/2607.21635#bib.bib17);Xu和Yan,2026 (https://arxiv.org/html/2607.21635#bib.bib14)),调用独立演化的外部工具(Guo等人,2024 (https://arxiv.org/html/2607.21635#bib.bib9);Qin等人,2024 (https://arxiv.org/html/2607.21635#bib.bib10)),并遵守随时间收紧的安全和隐私策略(Yu等人,2025 (https://arxiv.org/html/2607.21635#bib.bib18);Raza等人,2025 (https://arxiv.org/html/2607.21635#bib.bib20))。我们关注部署的代理系统,其骨干LLM可能保持冻结;适应性通过在线上下文、检索增强记忆(Cheng等人,2026a (https://arxiv.org/html/2607.21635#bib.bib50))、工具配置、策略状态和外部技能库实现。权重更新是可选的。 这些基准针对不同的评估对象。MemoryAgentBench(Hu等人,2026 (https://arxiv.org/html/2607.21635#bib.bib5))和MemBench(Tan等人,2025 (https://arxiv.org/html/2607.21635#bib.bib6))考察代理是否能记住、更新或遗忘相关事实。SkillLearnBench(Zhong等人,2026 (https://arxiv.org/html/2607.21635#bib.bib16))考察可重用程序是否可学习。StableToolBench(Guo等人,2024 (https://arxiv.org/html/2607.21635#bib.bib9))和BFCL(Patil等人,2025 (https://arxiv.org/html/2607.21635#bib.bib27))强调在固定API规范下的调用准确性。我们的问题是,一个被记住的事实一旦过时,是否会成为可执行依赖,破坏后续的工具调用、习得技能或策略决策。 考虑相同的API模式更新应用于两个用户。一个没有工具依赖技能的轻度用户可能在一次失败调用后恢复。一个拥有过时API记忆和习得报告技能的重度用户可能在无关分析工作流中全面退化。事件相同,但传播边界由持久化用户状态决定。我们称之为*用户条件评估*:针对变更事件ei和用户条件状态uj(持久化用户特定上下文)衡量Q(A, ei | uj),而将通用测试人群上的Q(A, ei)视为不充分。这与推荐系统中的标准按用户预测不同,因为用户状态是可执行上下文:它可能包含过时记忆、过时技能、工具权限和策略约束,这些因素决定了故障如何传播。 **贡献**。我们为个人代理基准的设计做出三项贡献: 本立场论文将C1-C4视为用户条件时间干预的基准设计需求。 1. (1)问题形式化:用户条件评估Q(A, ei | uj),其中持久化用户状态作为可执行上下文,并作为输入。 2. (2)设计需求:跨不同持久化用户状态的固定时间干预的C1-C4。一项重点审计(在正文中总结,附录A (https://arxiv.org/html/2607.21635#A1)中详细记录)支持了这一需求。 3. (3)基准设计:一个最小的任务族设计和报告适应性质量的候选指标。 图1 (https://arxiv.org/html/2607.21635#S1.F1)提供了与自适应代理评估相关的基准和系统的更广泛图景,其中两项调查作为搜索种子。工作在单一维度内的集中,加上时间持久状态3/15的近缺失模式,总结了我们正在解决的未完成评估循环。 (参见图注)图1. 与自适应代理评估相关的24个独特基准/系统的更广泛图景,按适应维度(行)和首次公开年份(列)组织,两项调查显示为搜索种子。当系统与多个适应维度相关时,可能出现在多个行中;24是唯一系统计数。实心节点是已编码的基准协议;虚线节点是仅在图景中的系统、方法或相邻协议。参考文献在可用时报告出版物场所/状态。一个散点式时间线图表,显示24个基准和系统分布在五个水平行(D1:API/工具 到 D5:用户/上下文)和四个年份列(2023-2026)中,加上两项调查作为搜索种子。工作在单个适应维度内聚集;根据论文的编码协议,在审计集中未观察到固定干预的跨维度适应。 最近的代理评估调查(Yehudai等人,2025 (https://arxiv.org/html/2607.21635#bib.bib1);Mohammadi等人,2025 (https://arxiv.org/html/2607.21635#bib.bib2))对现有内容进行了编目。我们的审计询问现有协议仍无法衡量什么。记忆调查(Du,2026 (https://arxiv.org/html/2607.21635#bib.bib11))和终身/技能学习调查(Zheng等人,2026 (https://arxiv.org/html/2607.21635#bib.bib12);Xu和Yan,2026 (https://arxiv.org/html/2607.21635#bib.bib14);Gao等人,2026 (https://arxiv.org/html/2607.21635#bib.bib13))提供了相邻背景;我们的重点特别是在用户条件状态下评估跨多个代理组件的适应性。 ## 2. 个人代理与持续适应 我们将个人AI代理建模为一个元组A = (M, T, K, S, C):核心模型、外部工具、用户条件记忆、习得技能和安全/策略约束。每个组件可以独立变化:工具更新,记忆积累并变得过时,技能被添加或弃用,策略收紧,用户任务偏移。我们关注部署的系统,其骨干LLM可能保持冻结;适应性通过在线上下文、检索、工具配置、策略状态和外部技能库实现。 这一设置与快照评估不同。工具基准暴露API不稳定性和函数调用错误(Guo等人,2024 (https://arxiv.org/html/2607.21635#bib.bib9);Patil等人,2025 (https://arxiv.org/html/2607.21635#bib.bib27));记忆基准测试回忆和遗忘(Hu等人,2026 (https://arxiv.org/html/2607.21635#bib.bib5);Tan等人,2025 (https://arxiv.org/html/2607.21635#bib.bib6);He等人,2026 (https://arxiv.org/html/2607.21635#bib.bib22));技能工作研究可重用程序(Xu和Yan,2026 (https://arxiv.org/html/2607.21635#bib.bib14);Zhong等人,2026 (https://arxiv.org/html/2607.21635#bib.bib16));安全基准测试有害或违反策略的行为(Zhang等人,2024 (https://arxiv.org/html/2607.21635#bib.bib26);Andriushchenko等人,2025 (https://arxiv.org/html/2607.21635#bib.bib7))。这些线路是必要的。个人智能额外要求询问:对于特定用户,一个组件的变化是否会通过其他组件传播。 相关领域提供了部分类似物。推荐系统评估时间用户历史(Koren,2009 (https://arxiv.org/html/2607.21635#bib.bib37);Kang和McAuley,2018 (https://arxiv.org/html/2607.21635#bib.bib39);Rajput等人,2023 (https://arxiv.org/html/2607.21635#bib.bib40));其通常目标是下一项预测。我们的目标是通过作为工具、技能、记忆和策略间可执行代理状态的用户历史进行故障传播。持续学习和软件回归测试启发了稳定性指标(Kirkpatrick等人,2017 (https://arxiv.org/html/2607.21635#bib.bib43);Yoo和Harman,2012 (https://arxiv.org/html/2607.21635#bib.bib41))。这里的故障模式还包括过时的提示、记忆、检索、工具和技能状态,超越了权重级别的灾难性遗忘。个人代理缺乏单一的全局回归测试套件,因为期望行为由每个用户累积的状态决定。 ## 3. 适应性的五个维度 我们沿五个维度组织适应性挑战,每个维度对应代理元组的一个组件。我们还编码了四个评估方面:E1正确性,E2适应及时性,E3安全/隐私保留,E4稳定性或回归抵抗性。图2 (https://arxiv.org/html/2607.21635#S3.F2)可视化了这一分类。 (参见图注)图2. 5×4评估矩阵。每个单元格显示15个审计基准中有多少至少部分覆盖了该行维度和该列方面。深色单元格表示充分覆盖(≥3);浅色单元格表示稀疏覆盖(1-2);白色单元格表示完全空白(0)。在C1-C4下,审计集中未观察到固定干预的跨维度适应性。一个五乘四的热力图矩阵,行从D1工具到D5用户,列从E1正确性到E4稳定性。单元格根据覆盖级别着色:绿色表示3个或更多基准,黄色表示1到2个,灰色表示零。覆盖集中在E1;及时性、D4之外的安全性以及少数行之外的稳定性是稀疏的。 ### 3.1. 维度 **D1:工具/API演化**。API更新版本、弃用端点、更改模式并添加工具。StableToolBench(Guo等人,2024 (https://arxiv.org/html/2607.21635#bib.bib9))通过缓存API执行提高了基准稳定性,而演化API研究表明当API漂移时LLM性能下降(Ashik等人,2026 (https://arxiv.org/html/2607.21635#bib.bib32))。最近的错误审计也将此视为系统问题:API误用和不兼容主导报告中的框架故障(Zhu等人,2026 (https://arxiv.org/html/2607.21635#bib.bib45))。尚未测试的是,当用户记忆和习得的工具使用模式仍编码旧接口时,在固定工具变更后的适应性(Xu等人,2025 (https://arxiv.org/html/2607.21635#bib.bib52))。 **D2:记忆动态**。个人代理积累偏好、交互历史和任务事实。MemoryAgentBench(Hu等人,2026 (https://arxiv.org/html/2607.21635#bib.bib5))、MemBench(Tan等人,2025 (https://arxiv.org/html/2607.21635#bib.bib6))、MemoryArena(He等人,2026 (https://arxiv.org/html/2607.21635#bib.bib22))和CLIN(Majumder等人,2024 (https://arxiv.org/html/2607.21635#bib.bib29))推进了记忆评估和持久文本学习。记忆在很大程度上仍然是目标能力;下游问题是,过时或扩展的记忆是否改变代理行为并破坏工具、技能或策略合规性(Liu等人,2026a (https://arxiv.org/html/2607.21635#bib.bib53))。 **D3:技能获取**。代理从交互和工具使用监督中学习可重用程序(Xu和Yan,2026 (https://arxiv.org/html/2607.21635#bib.bib14);Jiang等人,2026 (https://arxiv.org/html/2607.21635#bib.bib15);Jiang和Ferraro,2026 (https://arxiv.org/html/2607.21635#bib.bib57))。SkillLearnBench(Zhong等人,2026 (https://arxiv.org/html/2607.21635#bib.bib16))表明持续技能生成仍然脆弱,代理技能调查报告自生成或社区技能的质量和安全风险。评估问题是,习得技能在其依赖的工具和策略演化时是否保持有效。 **D4:安全/策略合规性**。安全需求随法规、组织规则、上下文完整性约束和新兴威胁而变化(Lan等人,2025 (https://arxiv.org/html/2607.21635#bib.bib55);Lin等人,2026a (https://arxiv.org/html/2607.21635#bib.bib58))。Agent-SafetyBench(Zhang等人,2024 (https://arxiv.org/html/2607.21635#bib.bib26))发现静态安全性能薄弱;自适应个人代理增加了更难的问题:新技能或记忆是否仍符合更新的用户和管辖特定约束。 **D5:用户上下文漂移**。用户的任务、偏好和专业知识随时间变化。WAREX(Kara等人,2026 (https://arxiv.org/html/2607.21635#bib.bib23))和ReliabilityBench(Gupta,2026 (https://arxiv.org/html/2607.21635#bib.bib30))暴露了在扰动和压力下的可靠性下降。它们未探讨不同用户条件状态如何放大或抑制相同变更事件。 ### 3.2. 跨维度交互 这些维度只有在基准测试其耦合度时才重要。过时记忆可能编码旧API模式。技能可能静默依赖已弃用的工具。曾经安全保留的记忆可能违反新的隐私规则,新习得的技能可能启用策略已限制的动作。由于用户条件状态在不同用户间存在差异,基准必须变化配置文件并衡量相同事件如何改变影响范围。 ## 4. 差距分析 **审计范围**。为了检查所提出的需求是否已被覆盖,我们进行了一项重点基准审查。
相似文章
MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试
MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。
超越困惑度:面向LLM测试时训练中部署记忆声明的行为评估框架
本文介绍了一种行为评估框架,用于校准关于LLM测试时训练中部署时记忆的声明,提出了证据阶梯和显式基线,以弥合代理指标与行为证据之间的差距。
智能体基准决策需要多少任务?对公开LLM智能体基准的重放分析
本文分析了在LLM智能体基准的部分评估中,需要多少任务才能得出与完整基准相同的两两对比结论。研究发现所需任务比例在不同基准间差异很大,并提出了部分评估的报告标准。
Agent 评估:详细指南(53 分钟阅读)
关于评估基于 LLM 的 Agent 系统的全面指南,涵盖基本概念、评估框架以及来自近期基准测试的案例研究。
APeB:大型语言模型智能体个性化能力的基准测试
提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。