DFAH-Bench:金融决策中可观测智能体不稳定性的基准评测

arXiv cs.AI 论文

摘要

介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。

arXiv:2607.20491v1 公告类型:新 摘要:标准评估基准衡量的是工具使用智能体做出的决策,而不是它是否每次都通过相同的过程得出该决策。我们提出DFAH-Bench,一个重放基准,通过三个渠道衡量金融智能体决策中的可观测行为不稳定性——工具调用轨迹、证据接触和决策集中度——所有这些都不需要访问隐藏的推理文本。在涵盖10个模型和3个金融任务的8,127次重放实验中,我们发现仅凭结果一致性是不完整的不稳定性信号:前沿模型可以在95%的时间内达成一致的决策,但仅77%的时间遵循相同的工具路径——这是一个18个百分点的差距(95%置信区间:[0.14, 0.22]),仅评估结果的评测完全忽略了这一点。在具有高决策一致性的前沿模型案例组中,超过55%表现出有意义的轨迹分歧。我们识别出三种行为特征:模式匹配者(通过忽略输入而收敛到单一输出来实现近乎完美的一致性)、稳定执行者(具有相对一致的工具使用过程)和轨迹分歧者(通过实质上不同的工具路径和证据接触得出相同的结论)。基准代码、指标脚本、重放日志、基准卡、数据集README和发布清单已随附在源码仓库中发布。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:02

# DFAH-Bench:金融决策中可观测智能体不稳定性的基准测试
来源:https://arxiv.org/abs/2607.20491
查看PDF (https://arxiv.org/pdf/2607.20491)

> **摘要:** 标准评估基准衡量的是工具使用智能体**做出什么决定**,而不关心它是否每次都通过相同过程得出该决定。我们提出DFAH-Bench,一个重放基准,通过三个通道衡量金融智能体决策中的可观测行为不稳定性——工具调用轨迹、证据接触和决策集中度——这些都不需要访问隐藏的推理文本。在涵盖10个模型和3个金融任务的8,127次重放回合中,我们发现仅靠结果一致性并非完整的稳定性信号:前沿模型在95%的情况下能就决策达成一致,但仅77%的情况下遵循相同的工具路径——这存在18个百分点的差距(95%置信区间:\[0.14, 0.22\]),而仅关注结果的评估完全忽略了这一点。在具有高决策一致性的前沿模型案例组中,超过55%表现出显著的轨迹分歧。我们识别出三种行为特征:模式匹配者(通过无论输入如何都坍缩到单一输出来实现近乎完美的一致性)、稳定执行者(具有相对一致的工具使用过程)以及轨迹分歧者(通过实质上不同的工具路径和证据接触得出相同结论)。基准代码、度量脚本、重放日志、基准卡、数据集README和发布清单均在随附仓库中提供。

## 提交历史

来自:Raffi Khatchadourian [查看电子邮件](https://arxiv.org/show-email/8855438b/2607.20491) **\[v1\]** 2026年6月10日星期三 03:31:09 UTC (67 KB)

相似文章

LongDS-Bench:论长时域智能体数据分析的失败

arXiv cs.LG

介绍LongDS,一个用于评估LLM智能体在长时域、多轮数据分析任务上的基准。评估表明,即使最佳模型也仅达到48.45%的准确率,性能随轮次急剧下降,凸显出维护分析状态是关键瓶颈。