治理记录作为监督:验证器选择的自训练用于结构化工作流修复
摘要
本文研究了利用机器可验证工作流的治理记录作为监督信号,训练语言模型执行结构化工作流修复,证明验证器选择的自训练能提升执行效率和有效性。
查看缓存全文
缓存时间: 2026/08/20 10:09
# 治理记录作为监督:用于结构化工作流修复的验证器选择自训练 来源:https://arxiv.org/html/2608.18324 Jesus Salas 致谢:作者受雇于微软。此项工作独立于其雇佣范围之外,使用个人时间和设备完成。不代表微软公司的观点或立场。 所属机构:独立研究员 邮箱:[[email protected]](mailto:[email protected]) 2026年8月 ###### 摘要 机器可验证的工作流会产生治理记录,这些记录关联了任务契约、模型尝试、验证器决策、接受的输出和目标来源。我们测试这些记录是否能够监督有界模型,将偶发的或昂贵的能力整合为可靠的一次性执行能力。在全新的、结构上与已有问题不相交的 PlanBench 重规划案例中,Qwen3-14B 的思考模式生成了 24 个被独立编写的 VAL 验证器接受的计划。这些计划被用于训练同一检查点以执行非思考模式,无需预言机目标或更强的教师模型。在 80 个未公开案例中,VAL 接受的计划从 1 个增加到 57 个,其中 56 个是配对提升,且无退化;思考模式达到了 30 个。适配器在所有案例上均符合模式要求,且平均延迟仅为思考模式的约 1/56。独立的配对接口修复门未能通过。一项匹配的消融实验固定了源案例、52 个候选池、24 个目标数量、模型、配方和种子,仅改变目标选择方式。在 160 个新案例上,基础模型、模式选择、模型自选择和 VAL 选择的执行分别达到了 1、55、69 和 102 个被接受的计划。VAL 选择优于自选择,配对净增 +33(p=1.96×10⁻⁶),在两个难度层级上均有提升。因此,在此测试范围内,独立的语义选择相对于匹配的备选方案具有关键作用。一个配套的 Phi 强教师实验将基础 Phi-4 的被接受计划从 2 个提升至 51 个,符合模式要求的输出从 35 个提升至 80 个。早期的合成实验验证了可教学性、累积学习、构建鲁棒性和停止边界。结果支持对有界、机器可检查能力使用验证器选择监督,而非任意规划、企业有效性或无限制的自我改进。 ## 1 引言 语言模型代理越来越多地产生的工作的有效性并非纯粹是语言层面的。一个工作流可能要求每个义务恰好执行一次、限制分配给每个任务的工具、施加排序和时间窗口,或满足可执行的规划模型。该提案是概率性的,但许多故障可以在机制上被识别。大多数系统仅在推理时使用此信号:拒绝无效计划,返回错误,然后重试。我们询问由此产生的运行时记录是否也能成为训练后的资产。基本转换是: \( \text{contract},\ \text{invalid plan},\ \text{verifier signal} \longrightarrow \text{verified target plan} \)。(1) 我们称此元组为*治理记录*,当它保留声明的契约、模型尝试、验证器结果、接受的输出、生产者和学生谱系以及适用的门控结果时。如果此类记录可重用,低秩自适应可以将反复出现的经过验证的行为整合到一个有界执行器中,而外部验证器仍然作为验收控制。此术语建立在先前工作的基础上,这些工作通过决策、执行和变更谱系(13(https://arxiv.org/html/2608.18324#bib.bib21))将任务正确性与受控执行分离开来。那项工作将谱系视为可审计的控制状态。在这里,我们关注一个更窄的、机器可验证的执行记录,并询问其验证器接受的输出是否也能成为训练监督。这种解释取决于目标的来源。验证器可以选择一个有效的候选而不必创建它。一个程序化生成器可能已经包含了答案。一个推理机制可能暴露出一个更便宜的服务机制很少产生的行为。因此,我们区分预言机目标 SFT、同检查点验证器选择自蒸馏和更强教师验证器选择蒸馏。我们的主要结果使用外部的 PlanBench Blocksworld 重规划表面和固定的 VAL 计划验证(17(https://arxiv.org/html/2608.18324#bib.bib16); 9(https://arxiv.org/html/2608.18324#bib.bib19))。该领域、任务语义和验证器并非为本项目编写。我们生成了新的案例,排除了与已发布和先前实验问题在结构上的重叠,保持了采集和评估分区不相交,并且从未将预言机替换计划序列化为目标工件。在此表面上,Qwen3-14B 思考模式从 32 个采集案例中生成了 24 个验证器接受的计划。一个 LoRA 被用于训练同一检查点以执行非思考模式。在 80 个未公开案例上,基础非思考模式、基础思考模式和训练的非思考适配器分别达到了 1、30 和 57 个验证器接受的计划。相对于廉价的基础模型,适配器获得了 56 个配对案例的提升且无退化,并在 5 块和 6 块层级上均有改善。它在所有 80 个案例上均符合模式要求,平均延迟约为思考模式的 1/56,完成令牌数约为思考模式的 1/86。57 对 30 的比较在操作上是重要的,但属于描述性的,因为适配器优于思考模式并未预先注册。一项匹配的目标选择消融实验隔离了该流程中先前未解决的部分。从相同的 52 个冻结的 Qwen 模式有效候选池中,我们训练了三个 24 目标适配器,分别由 VAL、盲化的 Qwen 自选择或仅模式有效性选择。案例 ID、候选池、目标数量、检查点、训练配方和种子都是固定的。在 160 个新案例上,三个适配器分别达到 102、69 和 55 个 VAL 接受的计划,而基础模型达到 1 个。相对于模型自选择,验证器选择获得了 33 个配对案例的提升,并在两个块数层级上均有改善。这表明,在此测试范围内,相对于匹配的备选方案,语义目标选择具有关键作用。一个前瞻性冻结的配套实验改变了来源。Phi-4-reasoning 生成了 24 个计划,由 VAL 选择后用于训练基础 Phi-4。基础模型、教师和蒸馏学生分别达到 2、30 和 51 个验证器接受的计划。学生在所有 80 个案例上均符合模式要求,而基础模型为 35 个,推理教师为 41 个。这是强教师蒸馏,而非无教师自训练。Qwen 分支仍然是机制可以在没有预言机或更强模型情况下工作的关键证据。先前的合成程序提供了此外部结果背后的开发链。预言机目标实验验证了可教学性。模型生成的目标随后在两种工作流构建中产生累积收益,在第三种构建中进行构建分离的复制,在固定基准上进行 Phi 自训练复制、选择性转移,以及当另一轮增加没有测量到的信息时冻结停止。这些实验仍然重要,但它们不再承载论文的外部有效性结论。我们的贡献是: - • 一份来源明确的记录,分离了契约、失败的尝试、验证器决策、接受的目标、目标生产者和训练接收者; - • 外部同检查点自蒸馏,其中独立验证的 Qwen 思考输出用于训练廉价的非思考执行,无需预言机或更强教师; - • 一项匹配的目标选择消融实验,表明独立的语义验证在全新案例上优于盲化的模型自选择和仅模式选择; - • 一项来源分离的 Phi 蒸馏分支,表明相同的流程可以将更强推理模型的接受输出转化为可靠的基准模型专家;以及 - • 关于可教学性、累积学习、构建鲁棒性、前沿移动、选择性转移和特定测量停止的合成证据。 算法上,该方法是有监督的过滤训练,类似于离线奖励过滤自训练和强化学习用于推理(5(https://arxiv.org/html/2608.18324#bib.bib5); 14(https://arxiv.org/html/2608.18324#bib.bib6); 3(https://arxiv.org/html/2608.18324#bib.bib7));我们不声称这是一个新的优化器。核心主张更窄:在机器可验证的任务契约内,验证器选择的模型输出可以成为监督,将偶发展示或昂贵的能力整合为可靠的一次性执行。Qwen 在没有预言机标签或更强教师的情况下确立了这一点。Phi 确立了互补的强教师路径。外部证据仍然是一个合成规划领域、一个测试的难度范围和每个分支一个训练种子,而非独立编写的机构工作。 ## 2 问题公式化 ### 2.1 可验证的结构化修复 设公开契约 \( C \) 定义所需任务、允许的动作、依赖关系、状态转换、资源约束或完成条件。候选计划 \( y \) 由确定性验证器 \( V(C, y) \) 评估,它返回一个传输裁决、一个语义通过/失败裁决和一组失败检查项: \( V(C, y) = (t, p, F), \quad F = \{f_1, \ldots, f_k\} \)。(2) 当模型接收到公开契约和任务状态(可选地包括格式错误的先前计划 \( y^- \))后,发出 \( \hat{y} \) 使得 \( V(C, \hat{y}) \) 传输有效且 \( F = \emptyset \) 时,修复是成功的。评估允许一次模型响应且不允许重试。这使得自适应而非推理时的搜索深度成为测量的处理变量。验证器仅在其声明的契约内定义正确性。它不建立契约对于真实机构工作是否完整。我们始终使用*验证器确认*而非客观正确性。 ### 2.2 三种监督面 实验区分了通常被混淆的三种输入: 1. 1. **裁决**:先前计划无效。 2. 2. **局部治理跟踪**:确切的失败检查标识符、规则引用和观察到的违规。 3. 3. **经过验证的目标**:一个完整的计划 \( y^+ \),使得 \( V(C, y^+) \) 通过。 局部反馈可以通过命名残余来减少搜索问题。正确目标可能直接教会完整的输出分布。主要的 LoRA 处理同时包含两者,因此需要一项匹配的消融实验来归因它们的作用。 ### 2.3 目标来源 目标有效性和目标来源是独立的变量。我们使用以下分类法: - **程序化预言机目标**:由有权直接访问有效计划的生成器或作者构建,然后由验证器检查。 - **验证器选择的目标**:在没有目标访问权的情况下生成,仅在通过独立验证器后被接受。 - **同检查点自蒸馏目标**:由一种推理机制生成,用于训练同一检查点的另一种服务机制。 - **更强教师蒸馏目标**:由单独训练的教师生成,用于训练一个不同的学生检查点。 - **诊断引导目标**:通过一个序列生成,在该序列中每个失败的候选通过新的验证器残余改变下一个提示。 - **人类裁决的目标**:由授权人类在记录的机构政策下修正或批准。 合成前驱使用程序化预言机目标。后来的目标隐藏工作流研究在 Qwen 或 Phi 上使用他们自己的验证器选择输出进行训练。外部 Qwen 研究使用从思考到非思考执行的同检查点自蒸馏。外部 Phi 研究使用单独训练的推理教师。此区分控制了哪些结果支持无教师主张,哪些仅支持蒸馏。 ### 2.4 研究问题 **RQ1:外部无教师整合。** 一个检查点的思考输出(仅由外部验证器接受)能否训练同一检查点,在全新的外部案例上实现更可靠的非思考执行? **RQ2:选择策略。** 当候选池和训练曝光固定时,独立的语义验证是否比盲化的模型自选择或仅模式选择选择出更有用的目标? **RQ3:来源途径。** 当目标生产者是一个单独的更强推理模型时,相同的治理选择流程是否也有效? **RQ4:合成机制。** 预言机目标的可教学性、模型生成的目标来源和累积学习是否能在受控工作流契约下复现? **RQ5:边界。** 迭代、搜索可达性、跨构建转移、接口可靠性和冻结延续门控在何处停止支持更广泛的主张? RQ1 对外部语义整合是积极的,对独立的配对接口修复目标是消极的。RQ2 相对于两种匹配的备选方案是积极的。RQ3 在强教师分类下是积极的。RQ4 在预言机前驱和三种自构建中得到支持。RQ5 受限于选择性转移、饱和的测量、非实质性的后续轮次、一个外部规划范围、每个适配器一个种子以及机构工作的缺失。 ## 3 治理记录作为监督 ### 3.1 治理记录 每个保留的记录链接五个对象: \( R = (C,\ y,\ V(C,y),\ o,\ g) \),(3) 其中 \( C \) 是声明的契约,\( y \) 是模型输出,\( V(C,y) \) 是验证器结果,\( o \) 记录目标来源和模型谱系,\( g \) 记录适用的实验门控。一个通过的输出只有在来源对于所述主张是可接受时,才能成为训练目标。失败的输出仍然是谱系跟踪的一部分,但不能作为接受目标进入训练。验证器对于录取是关键性的,但它并不编写候选或建立契约是否捕捉了机构真相。训练执行整合。匹配的选择消融隔离了语义录取相对于模型自选择和仅模式选择的价值,但它并未将全部训练效果仅归因于验证器。 ### 3.2 合成工作流表面 每个合成案例定义一个工作流词汇表,而不是自然语言答案键。公开契约声明任务和字段,足以让验证器检查: - • 必需任务覆盖和唯一性; - • 依赖排序; - • 允许的工具分配; - • 资源容量限制; - • 执行窗口;以及 - • 同批次和不同批次关系。 生成器首先构建一个有效的标准计划,然后推导出一个接受它的契约。训练和评估行是通过对该计划应用八种单一或四种复合突变族之一来创建的。未改变的标准计划成为有监督的助手目标。验证器评估格式错误的先前计划和目标,该行记录目标的来源。这个顺序很重要。验证器在评估时是独立的验收函数,但它不是前驱训练标签的来源。标签存在于验证之前。这些研究验证了可教学性和信号归因,而非无预言机学习。 ### 3.3 合成示例构建 一个局部跟踪示例包含: \( x_{\mathrm{local}} = [C,\ y^-,\ \mathrm{id}(F),\ \mathrm{rules}(F),\ \mathrm{observations}(F)] \),(4) 目标为 \( y^+ \)。一个仅裁决示例保持 \( C \), \( y^- \) 和 \( y^+ \) 固定,但将详细残余替换为通用失败陈述: \( x_{\mathrm{verdict}} = [C,\ y^-,\ \text{"the plan is invalid; repair it"}] \)。
相似文章
AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification
This paper introduces AutoSupervision, a benchmark and method for verifying whether manuscript revisions actually address reviewer concerns using grounded evidence from peer-review records. Experiments on 56,000 Nature Communications articles show LLMs can summarize reviewer concerns but still struggle with evidence-based verification.
LLM治理的机械执行:金融决策系统中治理-任务解耦的证据
本文引入了五项治理指标,用于在受监管金融工作流程中量化LLM在决策理由层面的政策合规性。研究发现,机械执行(在模型解释循环之外操作)将无信息的延迟决策减少了73%,并揭示了治理-任务解耦:纯文本治理在压力下两个维度均退化,而机械执行即使在任务性能下降时仍能保持治理质量。
我们向AI智能体展示了它自己的治理记录,结果它开始用了起来
一项针对AI编码智能体的本地治理框架实验表明,当智能体自身的治理记录在其上下文中呈现时,智能体会开始自我纠偏,遵循策略并请求意图声明,而无需强制执行。
训练模型而非读者:可验证激活解释的可解码性监督
本文表明,基于重建的激活解释测试可能被操纵,从而在特定主张仍然错误的情况下获得高分。论文提出了RECAP方法,该方法与目标模型一起训练线性头,使指定的内部内容能够可靠解码并独立于探针进行验证,从而改进安全审计。
Learn-by-Wire 训练控制治理:压力下实现稳定与高效的受限自主训练
本文介绍了 LBW-Guard,一个位于 AdamW 优化器之上的受限自主训练控制治理层,用于监测遥测数据并在训练过程中施加受限控制,展示了在压力条件下困惑度的改善和训练速度的提升。