追求人类购物行为的忠实模拟

Hugging Face Daily Papers 论文

摘要

RecVerse 是一个基于 GUI 的模拟代理,采用分层记忆和轨迹级强化学习来模拟现实的多轮电子商务购物流程,解决了现有模拟器的记忆和优化挑战。

模拟真实的用户购物行为是电子商务场景中离线评估和强化学习的基础。虽然近期基于大型语言模型(LLM)和视觉语言模型(VLM)的模拟器取得了令人鼓舞的进展,但重现真实的浏览会话仍然困难,原因有二。(i) 记忆挑战:一个购物会话跨越数十个页面,但现有代理要么丢弃长期观察历史,丢失不断演变的用户状态,要么简单地连接它们,压垮上下文窗口,甚至降低模拟质量。(ii) 优化挑战:当前的用户模拟器通常通过模仿或逐步奖励来监督匹配每个记录的操作;因此会话往往显示出不现实的模式,如过度探索或过度被动,这些是逐步监督无法检测或纠正的。 为解决上述挑战,我们提出了 RecVerse,一个基于 GUI 的模拟代理,通过截图感知页面并生成逼真的多轮轨迹。针对记忆挑战,RecVerse 采用了受认知启发的分层记忆:工作记忆用于短期聚焦,情景记忆用于会话内痕迹,偏好记忆用于高级意图,并将记忆更新视为动作,使代理自适应地学习何时以及记忆什么。针对优化挑战,RecVerse 使用轨迹级强化学习目标进行优化,该目标对整个会话进行评分,将宏观操作类型分布和微观购物意图与真实用户对齐。我们进一步发布了 USB(用户模拟基准),一个用于多轮用户模拟的交互式电子商务 GUI 轨迹数据集。实验表明,RecVerse 在行为保真度和意图一致性方面均显著优于现有基线。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:39

论文页面 - 实现忠实的人类购物行为模拟

来源:https://huggingface.co/papers/2608.20707 作者:

摘要

RecVerse是一个基于图形用户界面的智能体,采用分层记忆和轨迹级强化学习来模拟真实的多轮电商购物流程。

模拟真实的用户购物行为是电商场景下离线评估与强化学习的基础。尽管近期基于大语言模型和视觉语言模型的模拟器取得了令人鼓舞的进展,但复现真实的浏览会话仍面临两大挑战:(一)记忆挑战:一个购物会话涉及数十个页面,而现有智能体要么丢弃长期观察历史导致用户状态演化信息丢失,要么简单拼接历史数据,导致上下文窗口过载甚至降低模拟质量。(二)优化挑战:当前用户模拟器通常通过模仿学习或逐步奖励来监督匹配每个记录动作,生成的会话常表现出不真实的行为模式(如过度探索或过度被动),而逐步监督机制无法检测或纠正这类问题。

为应对上述挑战,我们提出RecVerse——一个通过截图感知页面并生成忠实多轮轨迹的图形用户界面模拟智能体。针对记忆挑战,RecVerse采用受认知科学启发的分层记忆架构:工作记忆(短期焦点)、情景记忆(会话内轨迹)与偏好记忆(高层意图),并将记忆更新视为动作,使智能体能自适应地学习记忆时机与内容。针对优化挑战,RecVerse通过轨迹级强化学习目标函数进行优化,该函数对整个会话评分,同时对齐宏观动作类型分布与微观购物意图与真实用户行为。

我们进一步发布USB(用户模拟基准),这是一个用于多轮用户模拟的交互式电商图形用户界面轨迹数据集。实验表明,RecVerse在行为保真度和意图一致性方面显著优于现有基线。

查看arXiv页面(https://arxiv.org/abs/2608.20707)查看PDF(https://arxiv.org/pdf/2608.20707)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.20707)

在您的智能体中获取论文:

hf papers read 2608.20707

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.20707以从本页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.20707以从本页面链接。

引用此论文的Spaces0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.20707以从本页面链接。

包含此论文的合集0

无合集包含此论文

将此论文添加至合集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

Ecom-RLVE:面向电商对话代理的自适应可验证环境

Hugging Face Blog

Huggingface 推出 EcomRLVE-GYM,这是一个提供八个可验证环境的框架,用于在复杂电商任务上训练强化学习智能体。该工具具备自适应难度课程和算法化奖励机制,以提升购物助手的任务完成率,并已通过训练 Qwen 3 8B 模型进行了验证。