PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试

arXiv cs.AI 论文

摘要

PersonaTrail 是一个用于个性化网络代理的基准测试,它利用真实的浏览轨迹来评估代理推断用户偏好和回忆过去信息的能力。该论文还提出了 PACMem,一个在两项任务上都优于现有基线方法的内存框架。

arXiv:2607.20482v1 公告类型:新 摘要:大语言模型的最新进展使得网络代理能够自主执行复杂任务。在实际应用中,用户经常提供不明确的指令,要求代理从其原始浏览历史中推断缺失的上下文。现有的基准测试未能捕捉这种个性化形式,因为它们要么将任务限制为完全明确的提示,要么将网络交互历史抽象为简化形式。为了弥合这一差距,我们引入了 PersonaTrail,这是一个针对在受控开放网络环境中运行的个性化网络代理的基准测试。通过利用真实的浏览轨迹作为用户历史,PersonaTrail 评估代理推断用户偏好和从过去的浏览会话中回忆信息的能力。我们进一步提出了偏好感知上下文记忆(PACMem),一个将原始浏览历史分解为两种结构化记忆的框架:总结单个会话的事实记忆和提炼重复行为模式的偏好记忆。在推理时,代理从这些记忆中检索最相关的条目以指导个性化导航。大量实验表明,PACMem 在两项任务上始终优于现有的基于记忆的基线方法。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:01

# PersonaTrail:通过浏览轨迹对个性化网页代理进行基准测试
来源:https://arxiv.org/abs/2607.20482
查看PDF (https://arxiv.org/pdf/2607.20482)

> 摘要:大语言模型的最新进展使网页代理能够自主执行复杂任务。在实践中,用户常常提供不明确的指令,要求代理从其原始浏览历史中推断缺失的上下文。现有的基准测试未能捕捉这种个性化形式,因为它们要么将任务限制在完全明确的提示中,要么将网页交互历史抽象为简化形式。为了弥补这一差距,我们引入了PersonaTrail,这是一个在受控开放网络环境中运行的个性化网页代理基准测试。通过利用真实的浏览轨迹作为用户历史,PersonaTrail评估代理从过去的浏览会话中推断用户偏好和回忆信息的能力。我们进一步提出了偏好感知上下文记忆(PACMem),这是一个将原始浏览历史分解为两种结构化记忆的框架:事实记忆(总结单个会话)和偏好记忆(提炼重复的行为模式)。在推理时,代理从这些记忆中检索最相关的条目来引导个性化导航。大量实验表明,PACMem在这两项任务上均始终优于现有的基于记忆的基线方法。

## 提交历史

来自:Seungbin Yang [查看电子邮件 (https://arxiv.org/show-email/8128ca15/2607.20482)] **\[v1\]** 2026年5月30日星期六 13:27:55 UTC(13,178 KB)

相似文章

PAST-Bench:对个人智能体中递归自我改进基础的基准测试

Hugging Face Daily Papers

介绍了 PAST-Bench,一个用于评估个人 AI 智能体是否能够通过跨会话保留的经验得到改进的基准,以及 Hermes+,一个带有针对性干预措施的扩展。发现改进是真实的,但在不同能力和模型之间并不均衡。