标签
介绍了CreditCardQA,这是一个基于真实信用卡协议的金融素养数值推理基准。评估了在思维链(Chain-of-Thought)和程序思维(Program-of-Thought)提示下的LLM,发现程序思维带来持续提升,错误源于金融规则误用而非算术错误。
RePoT通过基于检查点的修复,使得从无效动作中进行确定性恢复成为可能,从而改进了Program-of-Thought,在多个模型和基准测试中取得了更高的成功率。
本文介绍了 FinAgent-RAG,这是一个用于金融文档问答的代理式框架,它结合了迭代检索、程序化思维推理和自适应资源分配,以提高准确性并降低成本。