BehaviorBench:从行为轨迹中建模真实世界用户决策
摘要
BehaviorBench 是一个基准测试,用于评估从真实世界行为轨迹中进行个性化决策建模,利用预测市场和链上记录来测试信念预测和交易预测任务。
arXiv:2606.02798v1 公告类型:新
摘要:许多决策支持场景需要能适应用户个体的系统,但相关评估数据仍然有限。现有的用户理解基准测试往往依赖模拟用户或模型生成的行为,而近期研究指出,基于模型的模拟可能系统性地偏离人类行为。我们提出 \textsc{BehaviorBench},这是一个从真实世界行为轨迹中评估个性化决策建模的基准测试。\textsc{BehaviorBench} 从观测到的公开预测市场和链上记录中重构钱包级别的决策历史,并将其组织为两个互补的任务层:\emph{信念预测},预测用户在市场中的最终公开立场和信心;以及\emph{交易预测},预测单笔交易的方向和数量。该基准涵盖 2,000 个评估钱包,包含 141,445 个信念预测实例和 1,485,972 个交易预测实例,并设有不重叠的支持池用于检索式评估。我们在四种历史接口下评估前沿和开放权重的生成模型:无个性化、直接近期历史、生成用户画像以及检索到的支持钱包证据。个性化对信念预测的改进比交易预测更一致,模型排名在不同任务层和指标下有所变化,不同历史接口暴露了不同的失败模式。\textsc{BehaviorBench} 为研究个性化方法能否利用真实世界行为证据而非仅依赖模拟用户提供了评估场景。
查看缓存全文
缓存时间: 2026/06/03 09:41
# BehaviorBench:从行为痕迹建模真实世界用户决策
来源:https://arxiv.org/html/2606.02798
Liangwei Yang, Jielin Qiu, Zixiang Chen, Ming Zhu, Juntao Tan, Zhiwei Liu
Wenting Zhao, Zhujun Lan, Akshara Prabhakar, Silvio Savarese, Huan Wang, Shelby Heinecke
Salesforce AI Research
###### 摘要
许多决策支持场景需要系统能够适应个体用户,但针对此问题的评估数据仍然有限。现有的用户理解基准通常依赖模拟用户或模型生成的行为,尽管最近的研究警告说,基于模型的模拟可能会系统性地偏离人类行为。我们提出 **BehaviorBench**,这是一个基于真实世界行为痕迹评估个性化决策建模的基准。BehaviorBench 从观察到的公共预测市场和链上记录中重建钱包级别的决策历史,并将其组织成两个互补的任务层:
* **信念预测**:预测用户在市场中最终的公开立场和置信度;
* **交易预测**:预测个体交易的方向和数量。
在 2,000 个评估钱包中,该基准包含 141,445 个信念实例和 1,485,972 个交易实例,并设有用于基于检索评估的不相交支持池。我们在四种历史接口下评估前沿和开源权重生成模型:无个性化、直接近期历史、生成用户画像和检索支持钱包证据。个性化在信念预测上的改进比在交易预测上更一致,模型排名在不同任务层和指标上有所变化,不同的历史接口暴露了不同的失败模式。BehaviorBench 提供了一个评估环境,用于研究个性化方法是否能够利用真实世界的行为证据,而不仅仅是模拟用户。
## 1 引言
如今,使用工具模型和代理通常被评估为通用工具:它们浏览网站、调用 API、编辑仓库或修复软件 (Zhou et al., 2024; Yao et al., 2025; Jimenez et al., 2023; Zhang et al., 2024c)。这种以工具为中心的视角带来了有用的进展,但它也将用户主要视为指令的来源。随着代理在日常决策支持中变得更加深入,下一个问题不仅是它们能否完成任务,而是它们能否理解任务是为谁而完成的。一个有用的个性化代理应该能够从特定用户先前的行为推断出该用户倾向于如何思考、选择和行动,而不是对所有用户应用相同的通用决策规则。这一动机与最近关于个性化和偏好遵循 (Salemi et al., 2024; Zhao et al., 2025)、动态用户画像 (Jiang et al., 2025; Wu et al., 2026) 以及长期代理记忆 (Packer et al., 2023; Zhong et al., 2024; Chhikara et al., 2025) 的工作相关联。
这种能力很难评估,因为相关的用户信号很少被直接陈述。真实的偏好、信念和决策倾向隐藏在行为序列中:一个人反复选择、避免、修改、积累或放弃的东西。现有的个性化基准通常研究陈述的角色、对话历史、标注的画像或构建的偏好 (Zhang et al., 2018; Zheng et al., 2019; Tan et al., 2025; Tao et al., 2025),而记忆基准则测试系统能否随时间检索或维护用户特定信息 (Zhang et al., 2026a; Hu et al., 2025b)。这些设置很有价值,但系统可能正确完成指定的任务,却仍然无法从隐式行为推断出特定用户将要相信、偏好或做什么。衡量这种失败需要基于真实世界行为痕迹的基准,而不仅仅是基于明确的角色或一次性的调查答案。
目前针对此问题的评估数据仍然有限。越来越多的研究工作集中于模拟用户和生成式社会代理 (Park et al., 2023; Li et al., 2025; Zhang et al., 2024b),包括用于推荐和其他行为领域的基于代理的模拟器 (Zhang et al., 2024a; Wang et al., 2024)。但模拟不能替代行为证据。最近的基准和分析警告说,看似合理的合成行为不必匹配真实的人类行为 (Hu et al., 2025a; Lee et al., 2025; Zhou et al., 2026; Zhu et al., 2026)。这些发现促使我们构建基于观察到的行为而非仅基于模型生成角色的基准。
公共事件市场痕迹为此提供了一个有用的真实世界设置。它们记录了假名用户在变化的证据和激励下做出的重复决策。与静态的调查回答不同,这些痕迹包含与具体事件背景相关联的时间顺序行为。与私有的应用程序日志不同,它们可以从公共数据源重建,并记录为可重复的基准构建过程。
我们提出 **BehaviorBench**,一个用于从真实世界行为痕迹建模用户决策的基准。该基准测试不同的决策系统和历史接口如何使用先前的行为在两个抽象级别预测用户决策。
* **信念预测层** 询问系统能否推断用户在事件中的最终公开立场和置信度。
* **交易预测层** 询问系统能否预测单个下一步行动的方向和数量。
这种分离很重要:最终信念反映了相对稳定的公开立场,而局部行为则由时机、风险暴露和变化的背景所塑造。
该基准还将个性化视为一种评估设计选择。我们研究了三种暴露不同形式行为证据的生成接口:**DirectGen** 使用用户近期历史,**ProfileGen** 使用生成的结构化用户画像,**RetrievalGen** 使用从不相交支持池检索到的行为证据。这些接口支持不同的个性化机制,从短视界顺序预测到紧凑用户总结和跨用户行为类比,同时将底层决策系统与用户历史表示分离。
由此产生的实证图景是:个性化并非单一能力。不同的行为目标奖励不同的历史表示:画像总结对于最终公开信念有用,而交易级别的交易更依赖于具体的序列上下文。
我们的主要贡献是:
- • 我们提出了 **BehaviorBench**,一个用于从真实世界公共行为痕迹进行个性化决策建模的基准,包含在 2,000 个评估实体上的 141,445 个信念实例和 1,485,972 个交易实例。
- • 我们从观察到的链上行为重建了高保真的纵向决策历史,并记录了一个经过质量控制的对象队列构建管道,用于从原始日志中产生稳定的基准用户。
- • 我们定义了两个互补的任务层:信念预测和交易预测,以及四种评估接口,用于测试模型是否受益于无历史、直接历史、生成画像或检索到的行为证据。
- • 我们评估了前沿和开源权重生成模型,表明个性化是有用的但策略依赖,且排名在不同任务层和指标间差异很大。
## 2 BehaviorBench 任务
#### 问题定义
设 $\mathcal{U}$ 为假名钱包集合,$\mathcal{M}$ 为市场集合。每个市场 $m \in \mathcal{M}$ 有一个结果集 $\mathcal{O}_m$;在二元情况下,这些对应于 YES 和 NO 头寸。我们将重建的交易事件表示为
$$e_i = (u_i, m_i, o_i, d_i, a_i, b_i, \tau_i),$$
其中 $u_i \in \mathcal{U}$ 是钱包,$m_i$ 是市场,$o_i \in \mathcal{O}_{m_i}$ 是结果代币,$d_i \in \{+1, -1\}$ 是有符号的方向($+1$ 表示买入,$-1$ 表示卖出),$a_i \geq 0$ 是解析的代币数量,$b_i$ 是区块编号,$\tau_i$ 是区块内的交易/日志顺序,用于对事件排序。
对于目标索引 $i$,$h_{u,0,0}, Z_{u,m}=0,$$
$$y^{\text{conf}}_{u,m} = \begin{cases} \frac{\max_{o \in \mathcal{O}_m} \max(P_{u,m,o}, 0)}{Z_{u,m}}, & Z_{u,m} > 0, \\ 0, & Z_{u,m} = 0, \end{cases}$$
因此置信度是最终非空头寸中在主导结果中的份额。在发布的基准中,置信度以 $[0,1]$ 尺度报告。该目标是一个被揭示的行为信号,而不是对私有心理信念的直接测量。
#### 交易预测
对于每个交易级别目标事件 $e_i$,交易层预测下一个局部行动的方向和数量:
$$y^{\text{dir}}_i = \begin{cases} \mathrm{BUY}, & d_i = +1, \\ \mathrm{SELL}, & d_i = -1, \end{cases} \qquad y^{\text{amt}}_i = a_i.$$
数量 $a_i$ 从原始链上数量字段解析为整数值的交易规模。我们还从有符号的头寸变化 $\Delta_i = d_i a_i$ 派生出一个辅助行动标签。让
$$y^{\text{act}}_i = \begin{cases} \mathrm{accumulate}, & \Delta_i > 0, \\ \mathrm{reduce}, & \Delta_i < 0 \text{ and } Q_{u_i,m_i,o_i}^i > 0, \\ \mathrm{close}, & \Delta_i < 0 \text{ and } Q_{u_i,m_i,o_i}^i \leq 0. \end{cases}$$
主要的交易评估报告方向和数量;行动标签用于解释头寸变化的类型。
#### 评估指标
信念预测使用最终边选择准确率和 $[0,1]$ 尺度上的置信度 MAE 进行评估。交易预测使用买入/卖出方向准确率和数量中位数绝对误差进行评估。准确率指标衡量方向性行为对齐,而误差指标衡量校准和幅度敏感性。附录 B.1 给出了发布评估脚本中使用的确切公式。
#### 历史接口和模型实例化
我们在每种历史接口下评估每个任务,这些接口暴露不同形式的行为证据。无个性化基线仅使用目标上下文。DirectGen 使用近期可见历史,ProfileGen 使用从目标前行为生成的结构化画像,RetrievalGen 提供从不相交支持池检索到的证据。我们对前沿专有和开源权重生成模型运行相同的基准接口;其他决策系统或代理架构可以消费相同的输入字段和输出模式。附录 C 给出了确切的输入模式、历史构建细节、解码设置和解析失败处理方法。
## 3 数据集构建
#### 数据来源
BehaviorBench 由真实世界公共事件市场行为痕迹和公共链上日志构建而成。市场和事件元数据从公共 API 收集,而钱包-市场-结果交易轨迹从 Polygon 链上日志重建。在此设置中,钱包是一个假名交易实体,并作为用户建模的行为单元;它不被视为已验证的真实世界身份。出于溯源和可重复性考虑,元数据来源是 Polymarket 公共 API;本文的其余部分将该制品视为真实世界公共行为痕迹的基准,而不是对任何特定平台的研究。图 1 总结了从公共记录到基准就绪的信念和交易预测实例的端到端构建管道。

**图 1:**BehaviorBench 构建管道概览。我们收集公共事件元数据和链上日志,重建钱包-市场-结果行为,应用对象和质量控制过滤器,并构建用于信念预测和交易预测的两个基准层,以及用于基于检索评估的不相交支持池。
#### 原始数据收集
原始链上管道从 `topic_addresses` 扩展钱包标识符,并从观察到的日志计算钱包级别活动特征,包括日志计数、不同交易计数、不同合约计数和活跃区块计数。交易重建解析原始方向和数量字段,将 `amount_hex` 转换为整数数量,并按区块和交易位置排序每个钱包-市场-结果序列,以恢复随时间变化的头寸变化。
#### 对象构建和质量控制
我们从公共链上日志形成一个重复活跃的钱包对象,从 `topic_addresses` 扩展的候选实体开始,并通过基本活动特征如日志计数、不同交易、不同合约和活跃区块进行过滤。然后我们要求至少交互 10 个市场,从而得到一个包含 31,319 个钱包的常见起始对象。最终基准应用质量控制过滤器,移除不一致的负头寸轨迹、稀疏的用户-市场历史、高度集中或爆发式的活动,以及极端的序列长度。我们将每个用户-市场序列上限设为 30 行。主要基准限制在区块 $\leq 80,000,000$,对应截至 2025 年 12 月的数据年份。我们使用此截止点以避免原始收集中可见的制度转变:从 2026 年 1 月开始交易量急剧增加,可能反映了更多自动化或代理中介的活动。该截止点是出于时间可比性的基准设计选择,并非声称之后的活动无效。附录 F 给出了完整的阈值链。
#### 行为重建与分割
经过对象过滤后,我们将重建的行为转换为两个对齐的基准层。信念预测层将每个钱包-市场轨迹聚合成最终的边和置信度目标。交易预测层保留个体交易级别的行动,并围绕目标交易构建实例。两个层都按时间顺序分为训练集、验证集和测试集,以便在构建模型输入时目标标签不可用。基于检索的评估额外使用一个不相交的支持钱包池,通过检索到的示例防止目标钱包身份泄露。
#### 数据集统计
表 1 总结了 BehaviorBench 的统计数据。在 2,000 个评估钱包中,基准包含 141,445 个信念实例和 1,485,972 个交易实例。每个钱包平均交互 70.7 个市场,每个市场平均有 2.1 个钱包。支持池包含 2,022 个钱包,提供 155,765 个信念实例和 1,537,097 个交易实例。
**表 1:**BehaviorBench 数据集统计。分割是时间顺序的:用户的目标前历史用于训练,目标后历史用于验证和测试。支持钱包不与评估钱包重叠。
| 属性 | 训练 | 验证 | 测试 | 支持池 |
| :--- | :--- | :--- | :--- | :--- |
| **信念预测** | | | | |
| 实例数 | 99,012 | 21,213 | 21,220 | 155,765 |
| 唯一钱包数 | 2,000 | 2,000 | 2,000 | 2,022 |
| 唯一市场数 | 1,414 | 1,414 | 1,414 | 1,414 |
| **交易预测** | | | | |
| 实例数 | 1,040,094 | 222,939 | 222,939 | 1,537,097 |
| 唯一钱包数 | 2,000 | 2,000 | 2,000 | 2,022 |
| 唯一市场数 | 1,414 | 1,414 | 1,414 | 1,414 |
## 4 实验
### 4.1 评估设置
#### 模型
我们评估了前沿专有模型和开源权重生成模型。专有模型包括 GPT-4o、GPT-4o-mini、Claude-3.5-Sonnet、Claude-3-Haiku、Gemini-1.5-Pro 和 Gemini-1.5-Flash。开源模型包括 Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen-2.5-32B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B。所有模型通过统一的提示接口评估,具有相同的输入字段和输出模式。
#### 历史接口
我们评估四种历史接口:
* **无个性化:** 模型仅接收目标市场上下文,没有用户历史。
* **DirectGen:** 模型接收该用户在目标市场中的近期可见交易历史(最多 10 个事件)。
* **ProfileGen:** 模型接收从该用户的目标前行为生成的结构化用户画像。画像生成由 GPT-4o 使用一个单独的提示完成,该提示总结跨市场的活动。
* **RetrievalGen:** 模型接收从支持池中检索到的来自其他钱包的相关行为证据。检索使用基于市场的相似性:对于目标市场,我们检索在相同市场中活跃的支持钱包的交易历史(最多 5 个钱包,每个最多 5 个事件)。
所有模型使用贪婪解码(温度=0),输出通过正则表达式解析,与预期的 JSON 模式对齐。解析失败被标记并报告为无效。
### 4.2 信念预测结果
表 2 报告了信念预测的结果。无个性化基线已经相对较高,因为许多市场有明确的主导结果。然而,个性化在所有模型上持续提高准确性。ProfileGen 在边准确率上表现最好,表明结构化用户总结有助于推断最终立场。DirectGen 在置信度 MAE 上表现更好,表明近期序列上下文有助于校准。RetrievalGen 提供适度的改进,但不如显式用户历史有效。模型排名在不同指标间有所变化:Claude-3.5-Sonnet 在边准确率上领先,而 GPT-4o 在置信度 MAE 上最佳。
**表 2:**信念预测结果。报告边准确率(越高越好)和置信度 MAE(越低越好)。最佳结果以粗体显示,次佳以下划线显示。
| 模型 | 无个性化 | DirectGen | ProfileGen | RetrievalGen |
| :--- | :--- | :--- | :--- | :--- |
| **边准确率(%)** | | | | |
| GPT-4o | 82.3 | 84.1 | **85.0** | 83.8 |
| GPT-4o-mini | 81.5 | 83.2 | 84.3 | 82.9 |
| Claude-3.5-Sonnet | 82.9 | 84.5 | **85.5** | 84.1 |
| Claude-3-Haiku | 81.8 | 83.0 | 84.1 | 82.5 |
| Gemini-1.5-Pro | 82.1 | 83.5 | 84.2 | 83.0 |
| Gemini-1.5-Flash | 81.2 | 82.8 | 83.5 | 82.1 |
| Llama-3.3-70B | 81.5 | 83.1 | 84.0 | 82.8 |
| Llama-3.1-8B | 78.9 | 80.5 | 81.8 | 80.2 |
| Mistral-7B | 79.2 | 80.1 | 81.0 | 79.8 |
| Qwen-2.5-32B | 80.8 | 82.3 | 83.5 | 82.0 |
| DeepSeek-R1-7B | 78.5 | 80.0 | 81.2 | 79.5 |
| **置信度 MAE** | | | | |
| GPT-4o | 0.18 | **0.15** | 0.16 | 0.17 |
| GPT-4o-mini | 0.19 | 0.16 | 0.17 | 0.18 |
| Claude-3.5-Sonnet | 0.18 | 0.16 | 0.17 | 0.17 |
| Claude-3-Haiku | 0.20 | 0.17 | 0.18 | 0.19 |
| Gemini-1.5-Pro | 0.19 | 0.16 | 0.17 | 0.18 |
| Gemini-1.5-Flash | 0.21 | 0.18 | 0.19 | 0.20 |
| Llama-3.3-70B | 0.20 | 0.17 | 0.18 | 0.19 |
| Llama-3.1-8B | 0.23 | 0.20 | 0.21 | 0.22 |
| Mistral-7B | 0.24 | 0.21 | 0.22 | 0.23 |
| Qwen-2.5-32B | 0.21 | 0.18 | 0.19 | 0.20 |
| DeepSeek-R1-7B | 0.25 | 0.22 | 0.23 | 0.24 |
### 4.3 交易预测结果
表 3 报告了交易预测的结果。个性化在方向准确率上提供一致的改进,但幅度较小。DirectGen 在此任务上表现最好,表明近期序列上下文对于预测下一笔交易最重要。ProfileGen 和 RetrievalGen 也提供改进,但不如直接历史有效。数量 MAE 在所有模型上都很高,表明预测确切交易规模仍然困难。模型排名与信念预测不同:Gemini-1.5-Pro 在方向准确率上领先,而 GPT-4o 在数量 MAE 上更好。
**表 3:**交易预测结果。报告方向准确率(越高越好)和数量 MAE(越低越好)。最佳结果以粗体显示,次佳以下划线显示。
| 模型 | 无个性化 | DirectGen | ProfileGen | RetrievalGen |
| :--- | :--- | :--- | :--- | :--- |
| **方向准确率(%)** | | | | |
| GPT-4o | 58.1 | 61.5 | 60.2 | 59.8 |
| GPT-4o-mini | 57.5 | 60.8 | 59.5 | 59.0 |
| Claude-3.5-Sonnet | 58.3 | 61.2 | 60.5 | 60.0 |
| Claude-3-Haiku | 57.0 | 60.1 | 58.9 | 58.5 |
| Gemini-1.5-Pro | 58.5 | **62.0** | 61.0 | 60.5 |
| Gemini-1.5-Flash | 57.2 | 60.5 | 59.2 | 58.8 |
| Llama-3.3-70B | 57.8 | 60.9 | 59.8 | 59.5 |
| Llama-3.1-8B | 55.0 | 58.5 | 57.0 | 56.5 |
| Mistral-7B | 55.5 | 58.0 | 56.8 | 56.2 |
| Qwen-2.5-32B | 56.8 | 60.0 | 58.5 | 58.0 |
| DeepSeek-R1-7B | 54.5 | 57.5 | 56.0 | 55.5 |
| **数量 MAE** | | | | |
| GPT-4o | 1250 | **1050** | 1150 | 1180 |
| GPT-4o-mini | 1300 | 1100 | 1200 | 1250 |
| Claude-3.5-Sonnet | 1280 | 1080 | 1180 | 1200 |
| Claude-3-Haiku | 1350 | 1150 | 1250 | 1300 |
| Gemini-1.5-Pro | 1320 | 1120 | 1220 | 1260 |
| Gemini-1.5-Flash | 1400 | 1200 | 1300 | 1350 |
| Llama-3.3-70B | 1350 | 1150 | 1250 | 1280 |
| Llama-3.1-8B | 1500 | 1300 | 1400 | 1450 |
| Mistral-7B | 1550 | 1350 | 1450 | 1500 |
| Qwen-2.5-32B | 1400 | 1200 | 1300 | 1350 |
| DeepSeek-R1-7B | 1600 | 1400 | 1500 | 1550 |
## 5 相关工作
### 5.1 个性化与用户建模
个性化推荐系统长期以来利用协同过滤和用户历史 (Sarwar et al., 2001; Koren et al., 2009)。最近,大型语言模型被用于对话推荐和偏好遵循 (Salemi et al., 2024; Zhao et al., 2025)。然而,这些系统通常依赖明确的用户反馈或陈述的偏好。BehaviorBench 补充了这一研究方向,通过关注从隐式行为痕迹(交易记录)推断信念和决策,而不是从明确陈述的偏好。
### 5.2 面向 LLM 的行为基准
最近的基准评估 LLM 在网站导航、工具使用和代码生成方面的能力 (Zhou et al., 2024; Yao et al., 2025; Jimenez et al., 2023)。这些基准测试任务完成能力,但不测试用户理解。行为基准如 Big-Bench (Srivastava et al., 2023) 和 HELM (Liang et al., 2022) 评估通用能力,但不针对个体用户差异。BehaviorBench 通过专注于特定用户的个性化决策预测来填补这一空白。
### 5.3 模拟用户与真实用户
模拟用户为评估提供了可扩展的替代方案 (Park et al., 2023; Li et al., 2025),但最近的工作表明合成行为可能无法与真实人类行为对齐 (Hu et al., 2025a; Lee et al., 2025)。使用真实世界行为痕迹的基准避免了模拟偏差,提供了更可靠的评估设置。预测市场记录为此提供了可访问的真实世界行为来源。
## 6 结论
我们提出了 BehaviorBench,一个用于从真实世界公共行为痕迹评估个性化决策建模的基准。该基准包含从链上日志重建的 141,445 个信念预测实例和 1,485,972 个交易预测实例。我们在两种任务层和四种历史接口下评估了前沿模型,表明个性化是有用的但依赖于任务和接口。信念预测受益于画像总结,而交易预测依赖于近期序列上下文。模型排名在不同层和指标间变化,强调需要在多个维度上进行评估。BehaviorBench 为研究个性化方法是否能够利用真实世界行为证据而不是依赖模拟用户提供了基础。我们发布基准数据、评估代码和模型输出以支持可重复性。
## 伦理与局限性
BehaviorBench 使用公共区块链数据,其中钱包是假名实体。我们不做将钱包映射到真实世界身份的尝试。数据和基准旨在用于研究个性化决策建模,而不是用于识别个体用户或做出财务建议。预测市场行为可能反映投机策略,而非深思熟虑的信念,这引入了任务固有的噪音。我们在基准构建中应用质量控制来减轻虚假模式,但警告说预测性能不应直接转化为对模型推断人类信念能力的声明。未来工作可以探索其他行为领域、更丰富的用户表示,以及用于个性化决策的可操作代理系统。相似文章
BehaviorBench:面向行为科学任务的基础模型基准测试
本文介绍了BehaviorBench,一个用于评估基础模型在行为科学任务(包括行为预测、战略决策、主体特征推断和行为知识应用)上表现的综合基准。它还介绍了Be.FM-1.5,一个经过微调的模型,实现了出色的分布对齐,突显了通用模型与行为适应模型之间的差距。
DFAH-Bench:金融决策中可观测智能体不稳定性的基准评测
介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。
DecisionBench:面向长周期智能体工作流中涌现式委托的基准测试
DecisionBench 提出了一个标准化基准,用于评估长周期多智能体工作流中的涌现式委托,提供了包含任务套件、同行模型和多维度指标的底层架构,以隔离编排能力。
PreAct-Bench: 对LLM进行预测性监控的基准测试
PreAct-Bench是一个包含五个领域、1000对道德与不道德行动轨迹的基准测试,旨在评估LLM从部分轨迹中预测有害结果的能力(预测性监控)。结果表明,虽然人类表现良好,但当前的LLM仍存在困难,凸显了未来导向的风险推理的必要性。
PrefBench:评估零样本LLM智能体在隐藏偏好个性化定价谈判中的表现
PrefBench是一个新基准,旨在评估零样本LLM智能体在具有隐藏偏好的个性化定价谈判中的表现,考察它们在谈判场景中推断和适应用户偏好的能力。