PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试
摘要
PersonaTrail 是一个用于个性化网络代理的基准测试,它利用真实的浏览轨迹来评估代理推断用户偏好和回忆过去信息的能力。该论文还提出了 PACMem,一个在两项任务上都优于现有基线方法的内存框架。
arXiv:2607.20482v1 公告类型:新
摘要:大语言模型的最新进展使得网络代理能够自主执行复杂任务。在实际应用中,用户经常提供不明确的指令,要求代理从其原始浏览历史中推断缺失的上下文。现有的基准测试未能捕捉这种个性化形式,因为它们要么将任务限制为完全明确的提示,要么将网络交互历史抽象为简化形式。为了弥合这一差距,我们引入了 PersonaTrail,这是一个针对在受控开放网络环境中运行的个性化网络代理的基准测试。通过利用真实的浏览轨迹作为用户历史,PersonaTrail 评估代理推断用户偏好和从过去的浏览会话中回忆信息的能力。我们进一步提出了偏好感知上下文记忆(PACMem),一个将原始浏览历史分解为两种结构化记忆的框架:总结单个会话的事实记忆和提炼重复行为模式的偏好记忆。在推理时,代理从这些记忆中检索最相关的条目以指导个性化导航。大量实验表明,PACMem 在两项任务上始终优于现有的基于记忆的基线方法。
查看缓存全文
缓存时间: 2026/07/24 05:01
# PersonaTrail:通过浏览轨迹对个性化网页代理进行基准测试 来源:https://arxiv.org/abs/2607.20482 查看PDF (https://arxiv.org/pdf/2607.20482) > 摘要:大语言模型的最新进展使网页代理能够自主执行复杂任务。在实践中,用户常常提供不明确的指令,要求代理从其原始浏览历史中推断缺失的上下文。现有的基准测试未能捕捉这种个性化形式,因为它们要么将任务限制在完全明确的提示中,要么将网页交互历史抽象为简化形式。为了弥补这一差距,我们引入了PersonaTrail,这是一个在受控开放网络环境中运行的个性化网页代理基准测试。通过利用真实的浏览轨迹作为用户历史,PersonaTrail评估代理从过去的浏览会话中推断用户偏好和回忆信息的能力。我们进一步提出了偏好感知上下文记忆(PACMem),这是一个将原始浏览历史分解为两种结构化记忆的框架:事实记忆(总结单个会话)和偏好记忆(提炼重复的行为模式)。在推理时,代理从这些记忆中检索最相关的条目来引导个性化导航。大量实验表明,PACMem在这两项任务上均始终优于现有的基于记忆的基线方法。 ## 提交历史 来自:Seungbin Yang [查看电子邮件 (https://arxiv.org/show-email/8128ca15/2607.20482)] **\[v1\]** 2026年5月30日星期六 13:27:55 UTC(13,178 KB)
相似文章
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试
MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。
PAST-Bench:对个人智能体中递归自我改进基础的基准测试
介绍了 PAST-Bench,一个用于评估个人 AI 智能体是否能够通过跨会话保留的经验得到改进的基准,以及 Hermes+,一个带有针对性干预措施的扩展。发现改进是真实的,但在不同能力和模型之间并不均衡。
超越借用历史:面向交互式角色扮演评估的个性化用户模拟
介绍了PALATE,一个可扩展的基准,用于评估角色扮演智能体,使用个性化对齐的LLM模拟用户和个性化评分标准,解决了固定历史评估的局限性。
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
Introduces FinPerMA, an event-grounded benchmark for evaluating personalized memory in LLM agents for financial advising, showing that current models and memory systems remain far from saturated.