Debate-to-Skill:用于工业查询到代理标注的能力约束过程监督

arXiv cs.AI 论文

摘要

该论文提出了Debate-to-Skill,一种能力约束过程监督方法,通过专注于可执行能力而非仅相关性来改进工业查询到代理标注。

arXiv:2609.11176v1 Announce Type: new 摘要:工业查询到代理匹配在主题相关性被误认为可执行能力时失败,尤其是在长尾和边界敏感的请求上。我们将标注表述为\emph{能力约束过程监督},并用Debate-to-Skill实例化,该方法使用可重用的决策原则、结构化审议、基于验证器的结论提取和分歧驱动的优化。在工业Query2Agent基准上,我们将Debate-to-Skill与直接标签监督、推理SFT和结构消融进行比较。结果测试了收益是否来自监督能力关键决策过程本身,尤其是在语义相关性和可执行能力分歧的灰色区域案例中。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:23

# 面向工业查询-智能体标注的能力边界过程监督

来源: https://arxiv.org/html/2609.11176

## 辩论到技能:面向工业查询-智能体标注的能力边界过程监督

###### 摘要

当将主题相关性误认为可执行能力时,工业查询-智能体匹配就会失败,尤其是在长尾和边界敏感的请求上。我们将标注问题形式化为*能力边界过程监督*,并通过Debate-to-Skill来实例化该方法。该方法使用可复用的决策原则、结构化的审议过程、基于验证器的判决提取以及基于分歧的优化。在工业级的Query2Agent基准测试上,我们将Debate-to-Skill与直接标签监督、推理监督微调以及结构性消融实验进行了对比。实验结果验证了收益是否来源于对能力关键决策过程本身的监督,特别是在语义相关性与可执行能力存在差异的灰色地带案例上。

## 1 引言

见图例 图1: 工业Query2Agent工作流:在线服务将用户请求路由给候选智能体,而离线循环将流量与审核信号转换为Debate-to-Skill监督,用于路由策略的更新。大规模搜索和智能体平台日益依赖查询-智能体匹配来连接用户请求与可执行的AI服务。在工业搜索和智能体服务界面,这一决策直接影响卡片曝光、下游参与度和后续的策略学习。指令遵循、工具使用和推理方面的最新进展使智能体服务日益实用Wei et al\. \(2022a\) (https://arxiv.org/html/2609.11176#bib.bib12);Yao et al\. \(2023b\) (https://arxiv.org/html/2609.11176#bib.bib13);Schick et al\. \(2023\) (https://arxiv.org/html/2609.11176#bib.bib3);Asai et al\. \(2024\) (https://arxiv.org/html/2609.11176#bib.bib4),但它们并未消除标注瓶颈:生产流量巨大、呈长尾分布且对边界敏感,而高质量的专家标注仍然稀缺。

主要难点在于,查询-智能体监督通常被表述为语义相关性预测,尽管昂贵的生产错误源自不同的原因。候选智能体可能看起来主题相关,但由于缺乏完成任务所需的工具、权限、实时访问或服务边界,因此仍然无效。弱监督和伪标签可以扩大标签数量Burns et al\. \(2023\) (https://arxiv.org/html/2609.11176#bib.bib6);Shin et al\. \(2025\) (https://arxiv.org/html/2609.11176#bib.bib21);Cui et al\. \(2025\) (https://arxiv.org/html/2609.11176#bib.bib15),结构化推理可以使决策更具可检查性Wei et al\. \(2022b\) (https://arxiv.org/html/2609.11176#bib.bib8);Wang et al\. \(2023\) (https://arxiv.org/html/2609.11176#bib.bib7);Du et al\. \(2024\) (https://arxiv.org/html/2609.11176#bib.bib1);Lightman et al\. \(2024\) (https://arxiv.org/html/2609.11176#bib.bib11),但如果监督目标本身仍然是一个最终的相关性标签,两者都无法直接修正这种错配。因此,我们认为查询-智能体匹配根本上不是相关性问题。而是一个在非对称风险下的能力验证问题。

我们通过将工业标注形式化为*能力边界过程监督*来解决此问题。我们不直接要求模型输出一个一步到位的标签,而是监督一个查询-智能体对是否通过了一个植根于可复用原则、明确的支持与失败证据分解、结构化判决提取和基于分歧优化的能力关键决策过程。我们使用Debate-to-Skill实例化了这一表述,并在工业Query2Agent基准测试上将其与直接标签监督、推理监督微调以及结构消融进行了评估。所得实验旨在检验一个单一主张:主要收益应来自于对能力边界决策过程本身的监督,特别是在语义相关性与可执行能力存在差异的灰色地带案例上。

我们的贡献包括:

- • 我们诊断工业查询-智能体标注是一个监督对象问题:主导的最终标签表述混淆了语义相关性与可执行能力,导致在灰色地带和边界敏感案例上出现系统性错误。
- • 我们提出能力边界过程监督作为此场景下的正确目标,并通过Debate-to-Skill进行实例化,其中可复用的能力原则、证据分解、验证器提取和分歧抽象使决策过程变得可观察和可训练。
- • 我们通过推理监督微调和基于验证器的GRPO实现了这一过程监督目标,表明能力边界轨迹比直接标签或通用推理提供了更强的可学习对象。

## 2 问题设定

每个训练样本是一个查询-智能体对x=(q,a),其中q是来自工业流量的用户请求,a是候选智能体档案。我们流程中的原始标注空间是三分类的:如果智能体能满足请求,则yraw=2;如果该对在语义上相关但能力不足或存在风险,则yraw=1;如果不相关,则yraw=0。对于训练和标准评估,我们将其转化为二分类目标y∈{0,1},仅将yraw=2视为正类。除非另有说明,二分类指标是在此部署转化后计算的,而灰色地带诊断则使用转化前的原始三分类判决。这种表述反映了业务目标:核心失败不是遗漏主题相关性,而是过度接受那些表面上相关但无法通过能力边界检查的灰色地带案例。因此,我们的方法旨在监督将业务侧能力风险映射为可学习标注目标的决策过程。

#### 灰色地带案例示例。

考虑一个匿名查询“我的航班延误了,帮我改签”和一个候选的“旅行助手”,其档案宣传旅行咨询但不提供票务、订单修改、库存或预订API。这一对在主题上相关,但不是一个可执行的匹配:改签需要访问用户的订单和交易API。Debate-to-Skill检索有关能力边界、实时要求以及咨询与执行区别的原则,支持语义相关性,然后基于能力理由否决该对。标准标签从不包含在评估或推理提示中。

## 3 方法

### 3.1 方法概述

Debate-to-Skill监督一个查询-智能体对在能力边界检查后是否仍然有效。如图2 (https://arxiv.org/html/2609.11176#S3.F2) 所示,它检索可复用的决策原则,分离语义支持与能力反对意见,使用法官指导来优化轨迹,提取结构化判决,并存储重复出现的高优先级分歧以进行原则优化。

见图例 图2: Debate-to-Skill工作流。查询-智能体对检索相关的决策技能,经过法官指导的辩论,并将高优先级失败输入分歧缓冲区以用于技能优化。
### 3.2 基于原则的审议

每个样本是x=(q,a),S={s1,...,s|S|}是一个原则级技能库。每个技能是
sj=(tj,pj,aj,gj), (1)
其中tj是标题,pj是能力原则,aj是其应用条件,gj是其标签。给定x,系统生成
D(x)={dtsem,dtcrit,gt}t=1T,
其中dtsem是语义支持,dtcrit是能力反对意见,gt是法官指导。技能库在审议前将实例模糊性映射到紧凑的原则空间。

令φ(x)和φ(s)分别为输入和技能的能力相关表示。我们的实现使用基于词汇的令牌袋特征。检索使用
sim(x,s)=φ(x)⊤φ(s)‖φ(x)‖2‖φ(s)‖2, (2)
检索到的技能集为
Sx=TopKs∈S sim(x,s). (3)
我们使用k=3,当所有分数为零时回退到种子技能。选择词汇检索是为了在工业标注环境中保持透明度、有界延迟和可审计性。对于保留动态技能的比较,使用相同的词汇检索器,因此差异并非来自切换检索类别。*不使用动态技能*的消融实验有意用固定种子技能替代基于样本的检索和更新,以衡量动态技能基础的贡献;密集或学习的技能检索留待未来工作。检索到的技能被注入到一个固定的辩论脚手架中:
(dtsem,dtcrit)=fθ(x,Sx,ht−1,gt−1), t=1,...,T, (4)
其中ht-1是之前的对话历史。这在标注前将语义相关性与可执行能力分解开来。

技能库是自适应的。令Bt为能力敏感冲突的分歧缓冲区。技能更新为
St+1=U(St,Bt), (5)
其中U将重复出现的高优先级冲突提升为新的或优化的原则,而不是存储原始轨迹。完整的程序伪代码在附录中提供。

### 3.3 过程监督学习

结构化轨迹是学习目标。我们对完整轨迹使用推理监督微调,并使用一种验证最终判决的强化学习视角。验证器提取
y~=Extract(gθ(x,Sx,D(x))) (6)
并分配奖励
Rver(x)=Rcls(x) (7)
+λsecRsec(x)
+λskillRskill(x),
其中
Rcls(x)=[y~=y], (8)
Rsec(x)=[D(x)包含所有必需部分], (9)
Rskill(x)=[选择的技能ID有效且被检索到]。(10)
在当前代码库中,Rcls=1.0,其他项各贡献0.1。验证器的作用范围有意限制在能力一致性上,而非自由形式的蕴含:它检查判决正确性、必需部分和有效的检索技能ID。任意自然语言推理的逻辑忠实度则通过在完整的支持与否决轨迹上进行推理监督微调来鼓励,并通过表4 (https://arxiv.org/html/2609.11176#S4.T4) 中的过程保真度审计进行总结。带有KL正则化的GRPO优化
LRL(θ)=
−E [min (rt(θ)Ât, clip(rt(θ),1−ε,1+ε)Ât)]
+β KL(πθ∥πref), (11)
其中rt(θ)是策略比率,Ât由验证器奖励诱导,πref是参考策略。推理监督微调使用完整轨迹z=(z1,...,zT):
LSFT(θ)=−∑t=1Tlogpθ(zt∣z<t,x). (12)
公式 (11) 和 (12) 共同使过程监督变得可训练。

### 3.4 风险感知判决与适应

我们从法官部分提取预测:
ŷ=gθ(x,Sx,D(x)), (13)
其中gθ聚合轨迹。因此ŷ是一个基于输入和检索到的能力原则的条件风险敏感判决,这使得结构良好的案例可以进入合成监督,而不稳定的案例可以被重新检查。

分歧缓冲区通过优先处理语义证据、能力证据和法官结果冲突的案例,将一步审议与原则演化联系起来:
p(x)=
‖ysem−ycrit‖
+α[yhuman≠yjudge]
+β [x 触发技能更新], (14)
其中α=1.0,β=0.5。yhuman项仅在离线人类审核标注批次中可用,从不用于评估或在线推理提示。

更新算子仅作用于重复出现的、信息丰富的冲突:
G(c)=[freq(c)≥τf ∧ p̄(c)≥τp]=1, (15)
其中c是一个冲突模式。一旦门控通过,原则空间就会被扩展或细化:
St+1={St∪{snew(c)}, 如果 ¬cov(c,St),
Refine(St,c), 否则。 (16)
这里,cov(c,St)表示一个现有原则已经覆盖了冲突模式c。因此,系统在学习更安全判决的同时,也在优化未来判决所使用的能力原则。更新过程保持保守和规则驱动:具有p(x)≥τ的样本进入冲突缓冲区,当一个模式至少出现τf=3次且其平均优先级超过τp时,相应原则通过修改其文本、适用条件或标签来更新。例如,反复过度接受仅咨询的智能体用于执行请求,会优化一个边界原则,即当智能体缺乏所需工具、权限或交易API时,主题匹配是不充分的。

## 4 实验

### 4.1 实验设置

#### 合成标签流程概述。

我们的实验遵循图1 (https://arxiv.org/html/2609.11176#S1.F1) 中的离线标注循环。从工业...

相似文章