DFAH-Bench:金融决策中可观测智能体不稳定性的基准评测
摘要
介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。
arXiv:2607.20491v1 公告类型:新
摘要:标准评估基准衡量的是工具使用智能体做出的决策,而不是它是否每次都通过相同的过程得出该决策。我们提出DFAH-Bench,一个重放基准,通过三个渠道衡量金融智能体决策中的可观测行为不稳定性——工具调用轨迹、证据接触和决策集中度——所有这些都不需要访问隐藏的推理文本。在涵盖10个模型和3个金融任务的8,127次重放实验中,我们发现仅凭结果一致性是不完整的不稳定性信号:前沿模型可以在95%的时间内达成一致的决策,但仅77%的时间遵循相同的工具路径——这是一个18个百分点的差距(95%置信区间:[0.14, 0.22]),仅评估结果的评测完全忽略了这一点。在具有高决策一致性的前沿模型案例组中,超过55%表现出有意义的轨迹分歧。我们识别出三种行为特征:模式匹配者(通过忽略输入而收敛到单一输出来实现近乎完美的一致性)、稳定执行者(具有相对一致的工具使用过程)和轨迹分歧者(通过实质上不同的工具路径和证据接触得出相同的结论)。基准代码、指标脚本、重放日志、基准卡、数据集README和发布清单已随附在源码仓库中发布。
查看缓存全文
缓存时间: 2026/07/24 05:02
# DFAH-Bench:金融决策中可观测智能体不稳定性的基准测试 来源:https://arxiv.org/abs/2607.20491 查看PDF (https://arxiv.org/pdf/2607.20491) > **摘要:** 标准评估基准衡量的是工具使用智能体**做出什么决定**,而不关心它是否每次都通过相同过程得出该决定。我们提出DFAH-Bench,一个重放基准,通过三个通道衡量金融智能体决策中的可观测行为不稳定性——工具调用轨迹、证据接触和决策集中度——这些都不需要访问隐藏的推理文本。在涵盖10个模型和3个金融任务的8,127次重放回合中,我们发现仅靠结果一致性并非完整的稳定性信号:前沿模型在95%的情况下能就决策达成一致,但仅77%的情况下遵循相同的工具路径——这存在18个百分点的差距(95%置信区间:\[0.14, 0.22\]),而仅关注结果的评估完全忽略了这一点。在具有高决策一致性的前沿模型案例组中,超过55%表现出显著的轨迹分歧。我们识别出三种行为特征:模式匹配者(通过无论输入如何都坍缩到单一输出来实现近乎完美的一致性)、稳定执行者(具有相对一致的工具使用过程)以及轨迹分歧者(通过实质上不同的工具路径和证据接触得出相同结论)。基准代码、度量脚本、重放日志、基准卡、数据集README和发布清单均在随附仓库中提供。 ## 提交历史 来自:Raffi Khatchadourian [查看电子邮件](https://arxiv.org/show-email/8855438b/2607.20491) **\[v1\]** 2026年6月10日星期三 03:31:09 UTC (67 KB)
相似文章
FinPersona-Bench: 自主金融代理纵向心理测量稳定性基准
介绍了FinPersona-Bench,这是一个用于衡量自主金融代理如何随时间保持其指定行为指令的基准,揭示了任务显著性衰减(MSD),这种衰减随时间距离增加而加剧,并因模型和代理特征而异。
FM-Bench:一个针对竞争代理长期管理的基准测试
FM-Bench 是一个新的基准测试,用于评估管理足球俱乐部20年的LLM代理的长期决策能力。研究显示,管理行为比模型规模或token花费更能驱动性能。
DecisionBench:面向长周期智能体工作流中涌现式委托的基准测试
DecisionBench 提出了一个标准化基准,用于评估长周期多智能体工作流中的涌现式委托,提供了包含任务套件、同行模型和多维度指标的底层架构,以隔离编排能力。
BehaviorBench:从行为轨迹中建模真实世界用户决策
BehaviorBench 是一个基准测试,用于评估从真实世界行为轨迹中进行个性化决策建模,利用预测市场和链上记录来测试信念预测和交易预测任务。
LongDS-Bench:论长时域智能体数据分析的失败
介绍LongDS,一个用于评估LLM智能体在长时域、多轮数据分析任务上的基准。评估表明,即使最佳模型也仅达到48.45%的准确率,性能随轮次急剧下降,凸显出维护分析状态是关键瓶颈。