CLAP:领域智能体后训练的闭环训练、评估与发布控制
摘要
CLAP提出了一种面向领域智能体后训练的闭环方法,将含噪业务数据转化为结构化的SFT和偏好样本,并结合奖励/KL诊断、离线门控以及应用链路重放来决定适配器是否发布。在五个制造批次上的实验显示平均增益适度,并强调回归和高KL风险需要集成的数据-训练-评估-发布循环,而非依赖单一评分。
arXiv:2607.01846v1 公告类型:新
摘要:领域智能体常面临含噪业务数据、后训练收益不确定、离线/应用不匹配以及适配器发布风险等问题。本文提出CLAP(闭环智能体后训练),一种将业务数据转化为结构化SFT样本、决策偏好样本、保留集、风险诊断和发布门控记录的闭环方法。CLAP结合数据验证、目标/证据归一化、奖励/KL诊断、离线门控和应用链路重放,以判断适配器是否适用于目标应用链路。在五个匿名制造场景批次上,采用QLoRA风格的LoRA-SFT取得了适中的平均增益:总体评分提升0.0098,通过率提升0.0240,证据准确性提升0.0280,同时幻觉和错误事实减少。但5个批次中仅有3个有所改进,部分批次出现退化,且GRPO暴露出高KL风险。应用链路重放进一步表明,RAG对于事实提取是必要的;在相同3B基座模型和100个重放案例下,面向应用RAG的LoRA-SFT适配器相比基座+RAG在价值、核心字段以及答案-证据文档/页面匹配方面有所提升,但增加了延迟。这些结果支持通过集成的数据-训练-评估-发布循环来管理领域智能体后训练,而非依赖训练完成或单一离线评分。
查看缓存全文
缓存时间: 2026/07/03 05:46
# CLAP: 面向领域智能体后训练的闭环训练、评估与发布控制
来源:https://arxiv.org/html/2607.01846
李芳菲赵晨阳王龙矩源矩阵矩阵矩阵中国中国中国lifangfei@matrixorigin\.cnzhaochenyang@matrixorigin\.cnwanglong@matrixorigin\.io田峰郑志远郭律∗矩阵源矩阵源矩阵源美国中国中国tianfeng@matrixorigin\.cnzhengzhiyue@matrixorigin\.cnguolv@matrixorigin\.cn∗
###### 摘要
领域智能体常面临业务数据噪声大、后训练收益不确定、离线/应用不匹配以及适配器发布风险等问题。本文提出 CLAP(闭环智能体后训练),一种将业务数据转化为结构化 SFT 样本、决策偏好样本、留出集、风险诊断和发布门控记录的闭环方法。CLAP 结合数据验证、目标/证据规范化、奖励/KL 诊断、离线门控和应用链回放,以判断适配器是否适用于目标应用链。在五个匿名的制造场景批次上,QLoRA 风格的 LoRA-SFT 取得了适中的平均增益:总体得分提升 0.0098,通过率提升 0.0240,证据准确率提升 0.0280,同时幻觉和错误事实减少。但 5 个批次中仅 3 个有提升,部分批次出现倒退,GRPO 暴露出高 KL 风险。应用链回放进一步表明,RAG 对于事实提取是必要的;在相同的 3B 主干和 100 个回放案例下,面向应用 RAG 的 LoRA-SFT 适配器在数值、核心字段和答案-证据文档/页面匹配上优于基础模型+RAG,但增加了延迟。这些结果支持通过集成的数据-训练-评估-发布循环来管理领域智能体后训练,而不是依赖训练完成或单一的离线评分。
关键词:智能体后训练、闭环控制、发布门控、监督微调、应用链评估
## 1\. 引言
领域智能体越来越多地用于数据问答、合同查询、文档问答和流程辅助。RAG 是一种将 LLM 应用与外部证据结合起来的常见方式。\[1\]\[9\] LoRA 和 QLoRA 使得参数高效的领域适应变得可行。\[2\]\[5\]指令微调、偏好优化和 RLHF 进一步推动了针对应用行为的后训练控制。\[3\]\[4\]推理与行动智能体、基准化的智能体行为、工具使用智能体以及自动化后训练流程进一步表明,智能体适配必须在其目标应用工作流中进行评估。\[15\]\[16\]\[17\]\[18\]此类系统积累了领域数据和交互痕迹,但原始业务信号并不能直接作为后训练的可用资产:它们通常包含噪声字段、不一致的格式、不完整的证据以及不稳定的标注约定。训练好的适配器是否能提升业务能力,也需要可复现的评估和发布门控。
本文研究如何将真实的业务数据转化为可训练、可诊断、可评估、可发布的后训练资产,以及如何判断训练好的适配器是否适用于目标应用链。与纯粹的算法工作不同,我们侧重于系统方法以及在真实业务数据上的实验。以匿名的制造场景数据作为案例研究,我们设计并验证了 CLAP 后训练工作流,包括数据构建、SFT/GRPO 训练、奖励/KL 风险检查、留出评估、适配器门控和应用链回放。
主要贡献有四点:我们为领域智能体后训练提出了一个闭环训练、评估和发布控制工作流;设计了针对噪声结构化提取目标的目标/证据规范化;在五批真实的制造领域数据上进行了基础模型 vs QLoRA 风格的 LoRA-SFT 实验;并通过批次级别的回归、GRPO 失败边界实验和应用链回放,说明了为什么领域后训练需要诊断、防护、应用链验证和回退机制,而非无条件推广。
## 2\. 相关工作与定位
领域智能体优化通常结合 RAG、SFT 和偏好/RL 风格的训练。RAG 提供了业务证据,但其本身无法教授稳定的输出格式或决策偏好。\[1\]\[9\] SFT 和 PEFT 改善了格式遵循能力,但当目标和评估不一致时,它们可能发生倒退。\[2\]\[5\] DPO/GRPO 风格的方法能够表达偏好,但对奖励设计、rollout 质量、KL 漂移和样本分布敏感。\[4\]\[13\]近期关于大型语言模型和检索增强生成国际期刊的调查进一步推动了这种面向治理的定位。\[8\]\[9\]关于幻觉、参数高效微调和人类反馈学习的调查也表明,模型适配必须与事实性、风险和反馈信号一起评估。\[10\]\[11\]\[12\]\[14\]CLAP 并未提出新的模型架构,也未声称在全参数微调、RAFT 或 Self-RAG 上具有算法优越性。\[6\]\[7\]它解决的是一个生产问题:如何将真实的业务数据转化为训练资产,诊断训练风险,门控适配器发布,并将失败的案例反馈到下一轮的数据和训练迭代中。
## 3\. CLAP 方法与系统架构
### 3\.1 任务与资产定义
给定领域业务数据集合 \(D\),CLAP 将其转化为后训练资产集:
\[
A = \{D_{\mathrm{sft}}, D_{\mathrm{grpo}}, D_{\mathrm{eval}}, C, G, R\}.
\tag{1}
\]
其中 \(D_{\mathrm{sft}}\) 表示监督微调数据,\(D_{\mathrm{grpo}}\) 表示偏好或决策训练数据,\(D_{\mathrm{eval}}\) 表示留出评估数据,\(C\) 表示数据构建和训练配置,\(G\) 表示门控规则,\(R\) 表示训练和评估记录。系统目标不是最大化单一训练损失,而是使得适配器发布有条件地满足门控约束:
\[
\mathrm{promote}(M') \Leftarrow \mathrm{quality}(M') \geq \mathrm{quality}(M) \land \mathrm{risk}(M') \leq \tau.
\tag{2}
\]
其中 \(M\) 是基础模型或之前的适配器,\(M'\) 是候选适配器,quality/risk 由留出指标、事实错误、KL、延迟和回归情况衡量。否则,候选适配器将被保留、作为金丝雀发布或拒绝。
### 3\.2 训练准入与发布门控
CLAP 将训练分解为两个门控。训练前门控检查训练/评估重叠、目标/证据可验证性、GRPO 奖励方差以及 chosen/rejected 排序。训练后门控使用可配置的策略(涉及质量、风险、延迟和关键回归)将候选适配器与基线进行比较。
对于 SFT,本文侧重于结构化提取中的字段、数值和证据一致性。对于 GRPO,该方法要求训练前准入和运行时防护措施一起使用,因此不能仅从静态奖励分布推断发布就绪状态;具体风险在实验中进行了检验。
与检查单一最终得分的单点门控不同,CLAP 在资产验证、训练准入、运行时诊断、留出回归检查、应用链回放以及发布/回退记录中组织发布控制。其决策对象是一个可追溯的证据包,包括数据集版本、训练配置、适配器产物、评估记录和回退样本。这样,适配器发布就变成了可追溯的风险决策,而非一次性打分。
### 3\.3 方法模块与决策逻辑
CLAP 可总结为一个面向控制的闭环后训练方法:
\[
\mathrm{assetize} \rightarrow \mathrm{materialize} \rightarrow \mathrm{admit} \rightarrow \mathrm{train} \rightarrow \mathrm{evaluate} \rightarrow \mathrm{gate} \rightarrow \mathrm{app\ validate} \rightarrow \mathrm{release/fallback}.
\tag{3}
\]
表 1 (https://arxiv.org/html/2607.01846#S3.T1) 列出了每个模块的输入、输出和决策角色。
表 1: CLAP 方法模块、输入、输出和决策角色。主要决策规则很简洁:非零的训练/评估重叠阻塞正式训练;不可验证的目标或证据进入数据修复;GRPO 奖励差距弱或排序质量低导致仅使用 SFT 或保留;运行时 KL、奖励下降或长度异常停止训练;留出回归或延迟/错误违规阻止推广。如果仅使用适配器的回放无法恢复事实数值或证据,则该适配器被视为结构化输出增强组件,而非 RAG 的替代品。
### 3\.4 系统架构
CLAP 实现为一个后训练资产化和发布控制系统,而非单个训练脚本。它通过四个层将数据流与控制流分离:资产层、物化层、训练控制层和评估/发布层。数据流将原始业务记录和 RAG 块转换为数据集提交、样本索引、特定任务的训练/评估文件和适配器产物;控制流记录准入、配方、KL/奖励/长度风险、基线比较以及推广/金丝雀/保留/拒绝/回滚决策。版本化数据管理或类似 Git 的数据库基础设施可以托管数据集版本、实验快照和回滚点,但本文不评估数据库层本身。失败案例被反馈以更新下一轮迭代中的数据构建规则、奖励目标和门控阈值。
参见图注
图 1: CLAP 后训练控制循环。本文研究的智能体是用于数据问答、合同查询和基于 RAG 的 QA 的业务辅助智能体。我们并未声称基于在线轨迹的完全自进化循环;实验侧重于离线后训练资产构建、评估和发布前回放。
## 4\. 数据与实验设置
### 4\.1 结构化 SFT 数据
结构化 SFT 样本基于来自匿名制造商的 RAG 文档块构建。每个样本包含源材料、目标约束和预期的 JSON 输出,字段包括实体、指标、周期、数值、单位和证据。在早期的数据构建中,某些指标标签包含数值,例如“6,076.97,原材料采购总额占比”。这种携带数值的指标标签使得目标不稳定并影响留出评估。
因此,v3 数据构建引入了目标/证据规范化:它从指标标签中剥离前导数值,要求预期值和关键指标术语在输入材料中可验证,并移除训练和评估拆分之间的 ID 或输入重叠。
### 4\.2 决策 GRPO 数据
决策样本基于业务记录构建,例如物料积压和质量损失报告。GRPO 数据被组织成组。每组包含一个基于原始情况的 chosen 候选、近 miss 候选和 rejected 候选。奖励设计侧重于行为是否来自原始处理建议、理由是否引用原始原因字段、以及风险焦点是否遵循业务规则。
在本文中,GRPO 并未用作主要的正面结果。它被用作失败边界和防护必要性的证据。
### 4\.3 应用链评估数据
为了检查适配器边界,我们将 batch_05 作为发布前应用链验证进行回放。所有回放组使用相同的 100 个案例。新的受控应用侧 ABCD 实验使用相同的本地 3B 主干:A 为 3B 基础模型+RAG,B 为 3B 应用 RAG 导向的 LoRA-SFT+RAG,C 为 3B 仅基础模型,D 为 3B 仅 LoRA-SFT。这种设计区分了两个问题:RAG 对于事实提取是否必要,以及在相同的 3B 主干下,面向应用的 LoRA-SFT 适配器是否能在检索到的证据基础上改善综合输出。早期的结构化 SFT 适配器仅作为训练目标/应用目标不匹配的参考案例保留,不作为主表组。
### 4\.4 数据版本与配置
主要实验使用 `enterprise_manufacturing_v3`。它包含五批结构化 SFT 数据,每批有 100 个留出样本。经过重叠清理后,每批训练拆分为 359–360 个样本。
SFT 配置使用学习率 2e-5,一个 epoch,每设备训练批次大小 2,梯度累积步数 8,评估配置为 `manufacturing_structured`。SFT 条件使用 Unsloth/PEFT,加载 4 位基础模型并训练 LoRA 适配器。LoRA rank 为 16,alpha 为 32,因此我们将其描述为 QLoRA 风格的 LoRA-SFT。它不是全参数微调,也不构成与 RAFT 或 Self-RAG 的算法比较。
### 4\.5 评估指标
离线结构化评估指标包括总体得分、通过率、字段准确率、数值准确率、证据准确率、幻觉率、目标匹配率、错误事实率和 p95 延迟。幻觉率和错误事实率越低越好;其他质量指标越高越好。应用链指标包括答案 JSON 可解析性、数值精确匹配、周期精确匹配、所有核心字段精确匹配、证据块/文档/页面精确匹配、检索到的目标块和检索到的目标文档/页面。
## 5\. 结果
### 5\.1 组件级解读
本节回答三个 CLAP 决策:数据是否可训练和可评估,增益是否在各批次间保持,以及候选适配器是否适用于目标应用链。因此,我们报告数据质量、批次级别回归、GRPO 运行时风险和 ABCD 应用链回放,而不仅仅是平均得分。
数据质量验证确认了正式实验条件:对于所有五个 v3 批次,留出大小为 100,训练大小为 359–360,ID 重叠、输入重叠、噪声指标标签和缺失证据在清理后均为零。
表 2 (https://arxiv.org/html/2607.01846#S5.T2) 将 CLAP 模块映射到本文中观察到的风险类型。我们不将这些结果解释为每个模块的严格消融最优性。相反,它们表明,如果没有相应的模块,特定类别的后训练风险可能在数据、训练或应用链中仍然不可见。
表 2: CLAP 模块与观察到的风险和证据的映射。
### 5\.2 主要基础模型 vs SFT 结果
表 3: 五个 v3 批次的平均结构化提取结果。箭头表示更优方向。如表 3 (https://arxiv.org/html/2607.01846#S5.T3) 所示,SFT 在 5 个批次中的 3 个上提升了总体得分,并在总体、通过率、数值、证据和目标匹配上产生了微小的平均增益,同时减少了幻觉和错误事实。最明显的增益与证据相关:证据准确率提高了 0.0280,幻觉率从 0.0260 下降到 0.0180。P95 延迟减少了约 297ms,但服务路径的差异使其不能被视为独立的稳定增益。各批次总体得分变化为 batch_01 到 batch_05 分别是 -0.0101、-0.0006、+0.0076、+0.0183 和 +0.0336。前两个批次表明,仅凭平均改进不能推断每个业务子领域都可发布;CLAP 将此类回归转化为保留、修复、重新物化或金丝雀发布决策。
### 5\.3 风险边界与应用链消融回放
静态的组感知准入通过了所有五个 GRPO 批次,排名通过率等于 1.0,奖励边界均值约为 0.224–0.226,奖励标准差约为 0.332–0.334。然而,实际的 GRPO 训练仍然对配方高度敏感。相似文章
CLaaS:面向样本高效在线学习的持续学习即服务
CLaaS是一个系统,用于对部署中的LLM智能体进行持续学习,利用经验回放实现样本高效的在线适应。
AgentCL: 面向语言代理中持续学习的严谨评估
提出了一个全面的评估框架,用于语言代理中的持续学习,强调受控任务流和记忆设计分析,以更好地评估可复用经验和学习稳定性。
SEAL: 智能体与学习环境的协同共演化
SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。
基于奖励门控的CLIP选择性测试时去偏
介绍了奖励门控测试时自适应(RG-TTA),这是一个强化学习框架,根据输入的偏差敏感性选择性地对CLIP模型应用去偏,解决了公平性与效用之间的权衡问题。
智能体优化器能否实现累积提升?——基于 Terminal-Bench 2.0 的持续学习评估
本文在 Terminal-Bench 2.0 上引入了一个两阶段持续学习评估,用以检验智能体优化方法的增益在递归应用时是否能够累积。结果发现,只有包含回归控制的 RELAI-VCL 方法实现了累积性改进。