基于多动作会计日志的中小企业财务指导的观测策略排序
摘要
本文介绍了CAR-PL,一种利用多动作会计日志向中小企业推荐业务变更的观测策略排序方法,并在财务KPI预测上将其与多个基线进行了比较。
arXiv:2608.10050v1 公告类型:新
摘要:中小企业需要及时的财务指导,但历史会计日志记录的是自我选择的且经常同时发生的业务变更,而非随机化的推荐。我们将该场景形式化为观测策略排序:根据决策前的财务信息,策略从34个由账簿导出的业务变更类别中为目标财务KPI选择一个。使用来自7,505家企业的85,078条公司-月观测数据,我们引入了协变量调整残差策略学习(CAR-PL),这是一种直接作用于多热日志的动作级R学习器,并通过观测支持度对选择进行正则化。我们在公司不相交的留出企业上,采用共享的模型辅助评分规则,将CAR-PL与提升T学习器、保守情境价值模型、零样本LLM以及非个性化参考进行对比。CAR-PL的毛利点估计最高(0.084),T学习器的收入点估计最高(0.085),情境价值模型的速动比率点估计最高(0.062)。在匹配的公司聚类比较中,CAR-PL和T学习器在任一增长KPI上均无统计显著差异,而CAR-PL选择33-34个类别,并在整个目录中产生更不集中的选择。仅使用结果模型的评分在KPI层面保持相同的点估计领先者或前两名,当全零处理参考被最常见的训练共动作模式替代时,类别排序保持相似。这些发现支持从多动作会计日志中对中小企业财务指导进行目标特定的排序。
查看缓存全文
缓存时间: 2026/08/12 08:27
# 面向多动作会计日志的中小企业财务指导的观测策略排序
来源:https://arxiv.org/html/2608.10050
Vignesh SubrahmaniamForesight-AI, IntuitVikas RaturiForesight-AI, IntuitKamalika DasForesight-AI, IntuitXiang GaoForesight-AI, IntuitKratika GuptaForesight-AI, IntuitRuocheng GuoForesight-AI, IntuitPadmaja JonnalageddaForesight-AI, IntuitAnanya PramodForesight-AI, IntuitSricharan KumarForesight-AI, Intuit
(2026年8月)
###### 摘要
中小企业需要及时的财务指导,然而历史会计日志记录的是企业自我选择且经常同时发生的业务变更,而非随机化的建议。我们将这一场景形式化为观测策略排序:基于决策前的财务信息,策略从34个由账目导出的业务变更类别中,为某个目标财务KPI选择一个类别。我们使用来自7,505家企业的85,078条公司-月度观测,提出了协变量调整残差策略学习(CAR-PL),一种直接作用于多热日志并依据观测支持度对选择进行正则化的逐动作R学习器。我们在公司不相交的留出企业上,将CAR-PL与增益T学习器、保守情境价值模型、零样本LLM以及非个性化参照在共享模型辅助评分规则下进行比较。CAR-PL在毛利上具有最高的点估计(0.084),T学习器在收入上具有最高的点估计(0.085),情境价值模型在速动比率上具有最高的点估计(0.062)。在匹配的公司聚类比较中,CAR-PL与T学习器在任一增长KPI上均无统计显著差异,而CAR-PL选择了33–34个类别,并在目录上产生更为分散的选择。仅使用结果模型评分时,KPI层面的点估计领先者或前两名保持不变;当全零处理参照被最常见的训练共现动作模式替代时,类别排序仍保持相似。这些发现支持基于目标KPI的中小企业财务指导排序,依据多动作会计日志进行。
关键词:观测策略排序;财务决策支持;多动作日志;模型辅助比较。
CCS概念:计算方法学 – 机器学习方法;应用计算 – 经济学。
## 1 引言
中小企业在财务问题变得严重之前往往需要建议,然而专家咨询能力成本高昂且难以规模化。随机化咨询项目表明,外部指导可以改变企业实践和结果,但此类项目在大范围推广时成本高昂[1 (https://arxiv.org/html/2608.10050#bib.bib1)]。会计系统提供了一种互补的证据来源:详细的财务历史以及企业随后做出的业务变更。将这些历史转化为候选指导,需要从观测性、多动作记录中学习,而非从随机化的推荐标签中学习。
我们将该任务形式化为*观测策略排序*。在潜在的决策边界,策略观察截至月份t+0的可用信息,从固定的34类别目录中选择一个类别,并以后续财务KPI为目标。历史类别是在t+1月份检测到的由账目导出的业务变更代理;结果从t+2到t+12测量。动作月份被排除在状态和结果之外,从而为每个公司-月度决策产生清晰的前瞻性时间线。
该任务的三个特性使其困难:(1)类别出现强烈依赖于状态,造成系统性选择;(2)同一月份可能同时出现多个类别,使焦点动作的归因复杂化;(3)观测支持度在34个类别间差异悬殊,使得策略的argmax对稀有类别噪声敏感。因此,学习者必须估计条件对比,并在观测不均的候选项中稳定地进行选择。在每个KPI内,可信的比较在策略族之间保持动作空间、保留测试行、结果定义和评分规则固定。
我们比较了一个保守情境价值模型、一个增益T学习器,以及CAR-PL——一种带支持度收缩的协变量调整逐动作R学习器。零样本LLM、众数常数策略和频率加权随机参照提供了补充比较。在每个KPI内,所有方法使用相同的目录和保留的公司不相交测试行。一个共享的模型辅助焦点动作评分将结果模型对比与倾向加权残差证据相结合。
点估计模式因KPI而异:CAR-PL在毛利上具有最高的点估计,T学习器在收入上具有最高的点估计,情境价值模型在速动比率上具有最高的点估计。在匹配的公司聚类比较中,CAR-PL与T学习器在任一增长KPI上均无统计显著差异。在这些KPI上,它们仅在12.8–14.2%的公司-月度状态上一致,而CAR-PL选择了33–34个类别。因此,可比较的聚合得分可能源于截然不同的状态到类别映射,这使得推荐集中度成为策略比较的一个重要维度。
我们的贡献有三方面。首先,我们形式化了基于多动作会计日志的前瞻性策略排序,具有固定的决策前、动作和结果时间线,并在7,505家企业上进行公司不相交评估。其次,我们提出了CAR-PL,它将逐动作R学习与支持度收缩相结合,以稳定34选1的选择,同时保留原始的多热观测。第三,我们在单一冻结评分器下对学习型、零样本和非个性化策略进行基准测试,并报告依赖KPI的点估计领先者、跨评分变体的稳健性,以及差异显著的推荐集中度特征。
## 2 相关工作
观测策略学习。策略学习方法使用观测数据,在显式调整和重叠假设下优化处理规则。Athey和Wager开发了针对二元处理的高效观测策略学习,而Zhou、Athey和Wager将双重稳健策略学习扩展到多动作[2 (https://arxiv.org/html/2608.10050#bib.bib2), 3 (https://arxiv.org/html/2608.10050#bib.bib3)]。我们的场景提供了一个大型工业应用,其中记录表示为多热,策略输出一个可解释类别。关于处理多版本的研究为定义焦点效应提供了概念基础,当观测到的处理类别出现在异质组合中时[4 (https://arxiv.org/html/2608.10050#bib.bib4)]。
异质效应与支持度感知选择。元学习器通过将异质效应估计简化为监督学习来估计条件处理-对照对比[5 (https://arxiv.org/html/2608.10050#bib.bib5)]。R学习将结果和处理都针对处理前协变量进行残差化,并估计剩余的调节变量条件效应信号[6 (https://arxiv.org/html/2608.10050#bib.bib6)]。CAR-PL在此构造基础上增加了逐动作头和基于支持度的收缩步骤,专为多类别上的argmax选择而设计。这补充了显式惩罚弱支持决策的不确定性感知和悲观策略学习方法[7 (https://arxiv.org/html/2608.10050#bib.bib7)]。
离线价值学习与财务决策。离线强化学习解决从固定日志中进行策略优化的问题,并且必须控制对不支持动作的过估计[8 (https://arxiv.org/html/2608.10050#bib.bib8), 9 (https://arxiv.org/html/2608.10050#bib.bib9)]。CQL通过保守价值惩罚实现了这一原则[10 (https://arxiv.org/html/2608.10050#bib.bib10)];我们将其单步目标作为情境价值基线。机器学习越来越多地用于信贷和财务决策系统[11 (https://arxiv.org/html/2608.10050#bib.bib11), 12 (https://arxiv.org/html/2608.10050#bib.bib12)],语言模型也正在被探索用于推荐和财务建议[13 (https://arxiv.org/html/2608.10050#bib.bib13), 14 (https://arxiv.org/html/2608.10050#bib.bib14)]。我们研究中的零样本策略衡量了预训练商业知识所诱导的排序,而不拟合历史结果。
作为决策支持的中小企业指导。财务推荐不同于传统产品推荐,因为其输出是运营业务变更,结果在后续会计期间展开。已有工作研究了针对小企业的咨询干预[1 (https://arxiv.org/html/2608.10050#bib.bib1)]、算法信贷决策[11 (https://arxiv.org/html/2608.10050#bib.bib11), 12 (https://arxiv.org/html/2608.10050#bib.bib12)]以及来自语言模型的财务建议[14 (https://arxiv.org/html/2608.10050#bib.bib14)]。我们的研究将这些线索汇集到重复公司-月度设置中,具有前瞻性时序和共同的可解释目录。它针对这些线索留下的空白组合:多热观测动作、单一可解释策略输出,以及在未见企业上的KPI特定评估。
决策前状态与基线t−10,...,t+0账本检测到的焦点暴露动作月份t+1动作后KPI结果t+2,...,t+12财务报表与先前动作历史叙事嵌入策略状态XX候选策略选择a∈A\mathcal{A}共享评分规则对于所选类别平均所选类别模型辅助得分
图1:前瞻性时序与共享比较流水线。任何动作月份或动作后信息都不会进入策略状态。每个策略输出相同的34个类别之一,并且在每个KPI内,对相同的保留测试行上的所选类别应用相同的评分规则。
## 3 数据与任务
### 3.1 决策时序、状态与数据划分
令A={1,...,34}表示受支持的策略目录,X表示策略状态空间。每个观测是一个公司-月度对ii,具有策略状态Xi和动作月份暴露向量Ti∈{0,1}34。语料库包含来自7,505家企业的85,078条观测,每家公司中位数为12个决策月份。图1 (https://arxiv.org/html/2608.10050#S2.F1)显示了固定的时序约定。策略状态和奖励基线使用截至t+0的信息;业务变更在t+1期间被检测;从t+2到t+12的月度KPI值决定奖励。动作月份被排除。具有空先前或结果窗口的观测在应用KPI特定分母过滤器之前被移除。
一个冻结的、版本化的报告流水线首先从多个决策前财务报告中推导结构化事实和诊断信息,包括KPI轨迹、产品、客户和供应商集中度、应收应付、现金流和债务趋势,以及检测到的异常。然后,多个LLM调用将这些中间摘要综合为最终的自然语言状态文档,其中还包含逐月历史KPI表。这种分阶段构造可以容纳较长的报告历史,而无需将完整的原始报告集传递给单个模型调用。该流水线在策略训练之前已固定,既不接收动作标签也不接收决策后结果,并排除动作月份交易。这些是大量的状态文档(中位数约23,000个字符),同时保留了高层解释和详细历史轨迹。Qwen3-Embedding-0.6B模型将每个文档编码为768维[15 (https://arxiv.org/html/2608.10050#bib.bib15)]。一个44维二元历史块记录来自完整检测器词汇表的先前月份活动。低于策略输出支持阈值的十个标签仅作为滞后状态协变量,永远不是符合条件的策略输出。拼接产生策略状态Xi∈X⊆R812,策略学习器使用该状态。记录在建模前被去标识化,在批准的分析环境中处理,并且仅以汇总形式报告。
企业标识符由确定性伪随机哈希分配,因此划分与结果无关且可复现。哈希保留留出的测试企业,约对应保留行的10%,并将剩余开发企业划分为训练和验证分区。训练行拟合策略参数和辅助函数。验证行选择模型配置、早停和CAR-PL的收缩强度。所有分区、辅助交叉拟合折和早停划分都在企业层面定义,因此一个企业的所有月份都保留在同一个分区中。测试集仅用于报告的策略得分和置信区间。表1 (https://arxiv.org/html/2608.10050#S3.T1)将训练和验证联合报告为开发总体。
表1:奖励构造和过滤后的KPI特定样本量。行数为公司-月度观测。开发组合了公司不相交的训练和验证分区;最后一列报告在KPI特定过滤后表示的独特企业数量。
### 3.2 动作目录
提取层产生44个原始账本导出标签。一个与结果无关的支持规则保留训练中至少有100个处理和100个对照观测的34个标签;这些定义了公共策略目录。表2 (https://arxiv.org/html/2608.10050#S3.T2)将它们分为十个运营领域。代表性类别包括增加广告支出、取消订阅、替换供应商、增加培训支出、获得融资、要求预付定金、切换支付处理商以及采用时间跟踪。方向性变化在适用时表示为单独的类别。共享词汇为所有策略族提供了可解释的动作层。
表2:十个语义目录领域及代表性类别。提取层基于规则。它通过账户代码变动、供应商或支付处理商的出现和消失、循环支付模式、复式记账特征,以及相对于滚动历史基线的变化,将动作月份账目证据映射到类别。检测器使用动作月份的账目活动,但不使用定义策略结果的后续KPI窗口。定义在策略训练之前固定,并在KPI之间共享。证据族涵盖支出、供应商、融资结构、循环支付和运营工具的变化,使目录在企业间具有一致的会计解释。历史标签是由账目导出的业务变更代理;对于类别a,Ti,a=1表示相应检测器在动作月份触发。该表示为多热,因为多个类别可能同时被检测到。
在一项独立的面向精度的审计中,一个根据人工标签校准的评审LLM针对底层账目证据审查了1,000个阳性公司-月度/类别检测样本。由此得到的审计精度为95%。该仅阳性审计估计检测精度,并不估计召回率。在推理时,相同的词汇作为候选指导呈现,每个策略在测试集评分前被掩码到34个受支持类别。支持规则与结果无关,并在KPI之间共享。相似文章
用于财务建议生成的GRPO:在CATE评估中超越商业LLM
本文提出了一种方法,使用组相对策略优化(GRPO)对开放权重语言模型进行微调,以生成可操作的财务建议,在独立于评判者的CATE评估中优于商业LLM,同时满足安全标准。
BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计
BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。
APPO: 智能体过程策略优化
APPO通过使用细粒度决策点和过程级优势缩放来改进分支决策和信用分配,从而提升LLM智能体的多轮工具使用能力,在13个基准测试中比基线高出近4个百分点。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
快速A/B/n测试:通过树耦合反馈共享进行精确多策略比较
介绍树耦合A/B测试(TCAB),一种精确的反馈共享设计,通过更少的奖励查询比较多个自适应策略,同时保留每个策略的轨迹分布。