对于金融智能体,严格通过是比局部完成更优的度量标准

Reddit r/AI_Agents 新闻

摘要

本文主张采用严格通过指标而非部分得分来评估金融AI智能体,并借助Ling-3.0-flash-Fin的发布,以提升在复杂、多步骤任务中的可靠性。

金融智能体可以检索正确的文件,正确计算模型的大部分内容,但仍然可能失败,因为一个损坏的公式会使交付物无效。Ling-3.0-flash-Fin版本使用严格通过规则描述了金融智能体v1.1和v2的结果:任务只有在满足所有评分标准时才通过。为了减少运行间的噪声,报告的v1.1分数平均10次运行,v2平均20次。这对于长期智能体来说,比跨步骤平均部分得分更有用。例如,在杠杆收购工作流中,运营费用影响EBITDA、自由现金流、债务偿还和IRR。如果债务时间表或敏感性分析表与基本假设脱节,那么看似合理的最终IRR是毫无价值的。在生产评估中,智能体记分卡可以报告:重复运行的完整任务通过率;状态首次无效的阶段;智能体是否检测到自身失败;对公式和文件结构的工件级检查;需要人工修复的运行百分比;安全交接是否保留了证据和中间状态。发布的演示不是独立验证,财务结论仍需专业审查。但严格通过指出了正确的一点:智能体的可靠性取决于其最薄弱的必要步骤。
查看原文

相似文章

FinanceHarness:自主金融深度研究框架

arXiv cs.CL

本文介绍了FinanceHarness,一个由LLM智能体驱动的端到端自动化金融深度研究框架,以及FinanceGym,一个可验证的时间点基准。专家验证显示通过率为82%,而领先模型得分低于40%,FinanceHarness将开源权重基座模型的性能从25.3%提升至32.4%。