无真值的信用分配:基于执行重放审计LLM代理中的步骤级信用分配

arXiv cs.LG 论文

摘要

本文使用执行重放的因果真值来审计LLM代理中的步骤级信用分配,发现常见的信用信号在识别因果重要步骤方面未能优于随机水平,这对训练方法具有启示意义。

arXiv:2608.19760v1 公告类型:新 摘要:在单一代理工具环境(ALFWorld)中,针对执行重放的因果真值进行审计,用于训练LLM代理的步骤级信用信号——LLM评判分数、基于结果的对数概率比率或策略自身的置信度——在识别因果重要步骤方面均未能优于随机水平。现有评估基于标注的步骤*正确性*对这些信号进行评分;而我们针对步骤*贡献*进行审计——即在每个决策点重新采样策略自身的替代方案并向前推进实际对结果产生的变化——两者并不一致。真值本身是结构化的:因果贡献是稀疏的(在定义了真值的决策点中,30.5%具有可测量效应),且可测量性依赖于模型——两个相似规模策略中,没有策略支持的反事实的点的比例相差两倍(13.1% vs. 26.8%)。失败模式可识别:隐式信用反映策略的流畅性(中位秩相关+0.75,在第二个家族中通过校正工具复制为+0.70),而基于结果的条件不增加因果信息(偏相关-0.004,Qwen)。仅基于置信度的路由器以随机水平恢复关键步骤,但将评判成本降低13.1%每回合(14.0%每轨迹)。在一项预先注册的七臂训练实验中,没有臂可靠地优于未训练策略,且检查点的表观工具签名完全由训练剂量解释——更稀疏的信用保留更少示例,优化器步数相差一个数量级——而非信用内容。因此,信用规则的比较必须匹配有效样本量,否则他们测量的是剂量,而非信用。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:27

# 无基准真相的信用分配:针对执行重放对LLM智能体的步级信用分配审计  
来源:https://arxiv.org/html/2608.19760  
Heady Zhang  
所属机构:南加州大学  
所属机构:美国加利福尼亚州洛杉矶市  
电子邮件:[haiyuez@usc\.edu](mailto:)  

###### 摘要  
针对单智能体工具环境(ALFWorld)中执行重放的因果基准真相进行审计发现,用于训练LLM智能体的步级信用信号——LLM裁判评分、基于结果的对数概率比或策略自身的置信度——均无法比随机猜测更好地识别哪些步骤具有因果重要性。现有评估根据标注的步骤*正确性*对这些信号进行评分;而我们审计的是步骤*贡献度*——即在每个决策点重新采样策略自身的替代选项并向前推演后,实际结果会如何变化——二者并不相同。基准真相本身具有结构性:因果贡献是稀疏的(30.5%具有定义基准真相的决策点存在可测量效应),且可测量性具有模型依赖性——两个规模相近的策略在无策略支持反事实的决策点比例上相差一倍(13.1% vs. 26.8%)。其失效模式可识别:隐式信用很大程度上反映策略自身的流畅度(中位秩相关+0.75,在第二族模型经校正工具下复制为+0.70),而基于结果的条件信息并未增加因果信息(偏相关−0.004,Qwen)。仅基于置信度的路由器以随机水平恢复关键步骤,但每轮将裁判成本降低13.1%(每轨迹降低14.0%)。在一项七组预注册训练实验中,没有一组能可靠超越未经训练的策略,检查点表现出的明显工具特征完全由训练剂量解释——更稀疏的信用保留了更少的样本,优化器步数存在数量级差异——而非信用内容。因此,信用规则的比较必须匹配有效样本量,否则衡量的是剂量而非信用。  

图1:审计结论:在两个模型族中,信用与其自身的随机打乱对照组无显著差异。  
每个模型族针对执行重放基准真相的秩保真度估计(族内轨迹中位Spearman相关 vs. \(A_{\mathrm{replay}}\),第2节 [https://arxiv.org/html/2608.19760#S2];实心标记)与该族*自身*经边际匹配的随机打乱对照组(空心标记,族内配对;图中仅绘制秩保真度——第4节 [https://arxiv.org/html/2608.19760#S4] 讨论的精确度提升是不同统计量且未绘制):  
Qwen2\.5\-7B 隐式信用:0\.0193 [−0\.109,0\.081](\(n_{\mathrm{eff}}=37\),共50条轨迹;自身对照组 [0\.005,0\.114])  
裁判信用:0\.1142 [0\.027,0\.168](\(n=37\),32条可计算;自身对照组 [−0\.049,0\.117])  
数据路径:dataruns/collect\_v2/analysis\_summary\.json;  
Llama\-3\.1\-8B 隐式信用(经校正工具):−0\.043 [−0\.125,−0\.016](28条轨迹中保留21条;自身对照组 [−0\.102,\+0\.24])  
数据路径:dataruns/xfam\_ext/redo/redo\_family\_analysis\.json,覆盖率88\.3%(注1)。  
在冻结对照优先的判决顺序下,每个模型族-对照组对在该顺序下重叠:结论均为H3(安慰剂水平,冻结判决顺序,第4节 [https://arxiv.org/html/2608.19760#S4]);关键比较是每个模型族与其自身对照组。  

## 1 引言  
智能体强化学习正聚焦于一个核心方向:通过为每个步骤而非仅结果进行评分来训练LLM智能体进行长程工具使用。步级信用信号——LLM裁判对轮次评分、基于结果的对数概率比、策略自身置信度——正从评估工具迁移至训练循环中(Tan et al\. 2025 [https://arxiv.org/html/2608.19760#bib.bib8]; Li et al\. 2026b [https://arxiv.org/html/2608.19760#bib.bib3]; Tan et al\. 2026 [https://arxiv.org/html/2608.19760#bib.bib7]; Chen et al\. 2026 [https://arxiv.org/html/2608.19760#bib.bib1]; Zhang et al\. 2026 [https://arxiv.org/html/2608.19760#bib.bib11]),且相关综述收录了数十种基于这些信号的方法(Zhang 2026 [https://arxiv.org/html/2608.19760#bib.bib10])。这一方向依赖于一个尚未被验证的假设:即这些信号分配给某步骤的信用能反映该步骤对实际结果的贡献。C3针对智能体自身的重放优势进行多智能体信用审计(Chen et al\. 2026 [https://arxiv.org/html/2608.19760#bib.bib1]);而将已用于LLM智能体训练的信号与外部执行的因果基准真相进行比对评估,则是另一项研究(附录L [https://arxiv.org/html/2608.19760#A12])。现有评估衡量的是其他指标:步级基准测试根据*标注的步骤正确性*对信用信号进行评分(Zhang et al\. 2025 [https://arxiv.org/html/2608.19760#bib.bib9]; Liu et al\. 2026 [https://arxiv.org/html/208.19760#bib.bib4])。但一个正确的步骤可能毫无贡献(轨迹早已被决定),而一个错误的步骤可能至关重要(它开启了恢复状态的路径);正确性与贡献度是不同维度,而训练循环仅奖励后者。要审计领域实际训练中使用的信号,必须拥有贡献度本身的基准真相。我们通过执行重放构建此基准真相:在每个收集轨迹的决策点,我们重新采样策略自身支持的替代动作,分别推演至终点,并测量结果分布的偏移——这是一种具有估计噪声阈值和明确分辨率限制的逐步因果效应。构建过程不涉及待审计的信用信号。基准真相本身是首个发现:因果贡献是稀疏的——不到三分之一的决策点具有可测量效应——且*可测量性具有模型依赖性*:两个规模相近的策略在无反事实比例上相差一倍。在此基准下,审计的零假设经受住了所有检验:无论使用哪种工具生成方式,信用信号在任一模型族中均未能比其自身经边际匹配的随机打乱对照组更好地排序步骤。其机制可识别:隐式信用很大程度上反映策略自身的流畅度(中位秩相关+0\.75,在两个模型族中复制),而基于结果的条件信息并未增加因果信息。在一项七组预注册训练实验中,信用规则之间的表面差异完全由训练*剂量*解释——更稀疏的信用意味着更少的优化器步数——而非信用内容。  

我们的贡献按类型分为:  
1. **度量**。在可重放单智能体工具环境中构建了因果基准真相的可测量性图谱:贡献是稀疏的,且可测量性本身具有双向模型依赖性——步骤因策略无替代选项或结果已被吸收而不可测量。  
2. **审计**。在可重放单智能体工具环境中,现成信号——裁判评分、隐式基于结果的对数概率比、基于结果的条件化或策略自身置信度——均无法比随机猜测更好地识别具有因果重要性的步骤。  
3. **机制**。隐式信用的分数是流畅度的回声,在三个预注册支持上的两个模型族中复制;基于结果的增量不携带因果信息,主要证据来自Qwen策略。  
4. **决策规则(仅限成本)**。冻结的置信度路由规则将每轮裁判调用减少13\.1%(每轨迹减少14\.0%)——两种粒度变化相反且始终一同报告——关键步骤召回率处于随机水平,路由的前瞻性部署未被评估。  
5. **方案**。信用比较的命名工具集:剂量匹配、对照组的可测量扰动强度、读取训练零结果的MDE阶梯,以及四维完整性分类法及其事件目录。我们的方法级贡献在于决策规则和方案,而非端到端系统。  

## 2 通过执行重放度量因果基准真相  
我们的工具是执行重放:在每个收集轨迹的决策点,我们基于采样替代动作重新执行环境,并测量结果分布如何偏移。我们在ALFWorld中实例化该工具,这是一个可重放的单智能体工具环境,策略为Qwen2\.5\-7B\-Instruct:在收集前冻结的任务列表上运行50条轨迹,温度0\.7下采样,使用HCAPO方法发布的ALFWorld智能体模板(Tan et al\. 2026 [https://arxiv.org/html/2608.19760#bib.bib7]),完全摘自论文附录。收集前已验证环境确定性,并在所有接触数据的主机上重新验证(一条轨迹哈希值,四个独立环境)。并行的同工具形式化通过植入效应验证了其有效性(Shah 2026 [https://arxiv.org/html/2608.19760#bib.bib5]);对比见附录L。  

待审计信号是智能体RL流程训练的两类步级信用。*隐式*信用是HCAPO的基于结果的令牌对数概率比\(\rho_t\),完全按已发布方式计算;其评分器是策略检查点本身(HCAPO的设计),工具常数、事后注入构建及匹配的*策略*评分模式详见附录G。某轮的基准真相是两个结果分布之间的对比,而非单一续写。在每个动作轮次\(t\),我们至少三次重放真实动作,并从同一策略快照(收集温度下,最多300次有种子抽样)采样\(K=4\)个不同的可行替代选项,每个替代选项至少推演三次至终止;重放优势为\(A_{\mathrm{replay}}(t)=\operatorname{mean}(\text{outcome}\mid\text{真实重放于 }t)-\operatorname{mean}(\text{outcome}\mid\text{替代推演于 }t)\)。原始轨迹的实现续写从不作为真实估计使用。若无法从策略中采样四个不同的可行替代选项,则该轮次策略支持的反事实*未定义*;此类轮次被排除并计数而非填补。在Qwen2\.5\-7B下,2,034个干预轮次中保留1,768个完整轮次;排除比例本身即是一项发现(第3节)。在整个扫描中前缀恢复确定性保持一致:20,538次重放推演中零发散。相同的真实重复为估计器提供了噪声阈值和分辨率。每轮\(\sigma_{\mathrm{floor}}(t)\)是真实重放结果的标准差,当\(A_{\mathrm{replay}}(t)\neq0\)(基于字面存储值)时,该轮即为*关键*步骤——无显著性过滤,无阈值。由于结果是离散且重复次数少,精确零值常见:69\.5%的完整轮次\(A_{\mathrm{replay}}=0\),对于1,184个双臂全为零的轮次,数据仅排除单侧95%置信水平下\(|\Delta p|>0.632\)的情况。因此本文中的每个零值都是受分辨率限制的陈述——“在已实现抽样分辨率下与真实动作无显著差异”——而绝非无因果效应的主张。  

保真度在信用被使用的场景中评分:轨迹内部。对每个信用族,我们计算信用值与\(A_{\mathrm{replay}}\)在轨迹内的Spearman相关性,聚合为轨迹中位数(10,000次重抽样Bootstrap区间);统计量退化的轨迹(少于四个完整轮次或\(A_{\mathrm{replay}}\)恒定)仅在此次计算中排除(对称跨族处理)并计数。随机、均匀及轨迹内信用打乱(保持每条轨迹的边际完全一致)通过相同流水线在同一批次中运行。判决顺序冻结,且对照组门控优先:若某信用族的区间与其自身打乱对照组重叠,则无论点估计如何,均属安慰剂水平。所有六个族级假设在Holm校正下进行三项结构性偏差测试;其中T3具有预注册的方向性预测——对隐式信用为正——即流畅、高概率的动作无论因果效应如何都会获得虚高信用。阈值、排除规则和判决顺序在收集前已冻结并签名(不可变标签);此处所有数字均由脚本从原始产物重新生成,从不转录;检查点在任何阶段加载前均经逐分片内容验证(第8节)。  

审计在第二模型族Llama\-3\.1\-8B\-Instruct中重复。对隐式信用族,替换同时改变了度量对象、评分工具和标尺——HCAPO的评分器*即*策略,且重放真相基于策略自身的动作分布定义——因此跨族测试检验了系统级主张:策略自身的隐式信用无法追踪其自身因果基准真相,在第二系统下进行;它无法也并未独立于策略评估评分工具。Llama组收集28条轨迹,排除1条后27条进入分析集。其重放层在发现并量化聊天模板缺陷后,经校正工具完全重新执行(第8节);重新执行的覆盖率此处说明一次(注1:88\.3%,1,082/1,225个可解析轮次)。缺失数据集中于长(\(\geq4\)轮)轨迹(28条中13条部分覆盖;短/中组100%)。分析集外的143个轮次——142个在容量上限未生成 + 1个不可解析——未重新运行,依据预注册先例(预期转化率约1%)。长度敏感量继承此注意事项(门控披露:第8节),且继承至论文中所有Llama侧数据。  

## 3 因果基准真相的结构  
### 3\.1 可测量性图谱  
在询问信用是否追踪因果贡献之前,我们先问:因果贡献在何处可被测量?答案是基准真相是稀疏且大多沉默的。在Qwen2\.5\-7B下,30\.5%的完整轮次是关键步骤(\(n=1,768\)):不到三分之一的决策点对任何结果具有可测量因果效应。动态过程具有强吸收性——86\.0%的完整轮次\(\sigma_{\mathrm{floor}}=0\)——且每个\(A_{\mathrm{replay}}\)精确为零的轮次都带有第2节的分辨率限制:数据仅排除\(|\Delta p|>0.632\)的情况。轨迹大部分处于因果惰性;信用信号仅通过发现少数非惰性轮次才能证明其价值。  

### 3\.2 可测量性具有模型依赖性——且双向依赖  
在相同环境、相同\(K=4\)替代选项和相同15次推演预算下,策略支持的反事实在13\.1%的干预

相似文章