基于未来反馈预测的可验证开放式对话技能自我进化
摘要
本文介绍了一种利用未来反馈预测实现开放式对话技能自我进化的方法,将对话反馈转化为固定的离线目标,从而无需实时流量即可进行可复现的技能优化。该方法在保护隐私的销售助手数据集上实现了超过75%的预测准确率。
arXiv:2607.18973v1 公告类型: 新
摘要: 文本技能提供了一种轻量级的方式来改进冻结的语言模型代理,但其自我进化通常需要一个稳定的验证信号。这种信号在数学或代码领域是自然的,因为答案在改变后可以被检查,但在开放式对话中却存在问题:改变助理的响应也会改变用户的下一个反应,因此记录的反应无法直接评估反事实的响应。我们提出了未来反馈技能进化,该方法首先将自我进化从规定当前答案转变为预测观察到的答案是否会导致后续用户信号为正或负。这个预测任务可以在固定的记录元组上进行验证,因此支持基于验证的文本优化。进化后的反馈技能捕捉了响应质量的可解释标准,并可以随后作为答案技能的诊断和优化目标。在一个专有的、保护隐私的销售助手数据集上,经过仔细的质量过滤和平衡的已解决/未解决划分,预测准确率超过了75%。除了这一结果外,核心贡献在于提出了一种将原本动态的对话反馈转化为固定离线学习目标的公式,从而实现了无需将每个候选技能投入实时流量即可进行可复现的技能进化。我们讨论了观察性验证与反事实有效性之间的界限,并将该方法定位为离线优化阶段,而非最终人工或在线评估的替代。
查看缓存全文
缓存时间: 2026/07/22 08:24
# 面对开放式对话技能的可验证自我进化:基于未来-反馈预测
来源:https://arxiv.org/html/2607.18973
ChaoJin Zhao 字节跳动 zhaochaojin@bytedance\.com & Xuan Jiang 字节跳动 jiangxuan\.1217@bytedance\.com
###### 摘要
文本技能提供了一种轻量级的方式来改进冻结的语言模型智能体,但其自我进化通常需要一个稳定的验证信号。在数学或代码领域,这类信号自然存在,因为答案改变后可以对其进行检查;但在开放式对话中却存在问题:改变助手回复也会改变用户的下一个反应,因此记录的反应无法直接评估一个反事实的回复。我们提出*未来-反馈技能进化*,它首先将自我进化从规定当前答案转向预测观察到的答案是否会带来正面或负面的后续用户信号。这个预测任务在固定的记录元组上是可验证的,因此支持基于验证门的文本优化。进化后的反馈技能捕捉了回复质量的可解释标准,并随后可作为答案技能诊断和优化的目标。在一个专有、隐私保护的销售助手数据集上,经过仔细的质量过滤和平衡的已解决/未解决划分,预测准确率超过75%。除这一结果外,核心贡献在于提出一种将原本动态的对话反馈转化为固定离线学习目标的形式化方法,使得技能进化可复现,无需将每个候选技能置于在线流量中。我们讨论了观测验证与反事实有效性之间的界限,并将该方法定位为离线优化阶段,而非最终人工或在线评估的替代。
*关键词* 智能体技能进化·用户反馈预测·对话评估·语言模型智能体
## 1 引言
大型语言模型(LLM)智能体越来越受控于文本*技能*:编码领域流程、质量标准以及工具使用策略的持久指令。与参数训练相比,技能编辑成本低、可检查,且无需改变底层模型即可部署。最近的工作如SkillOpt 将这一思想形式化为文本空间优化:优化器提出对技能的有限编辑,并且仅当编辑能改善保留集上的分数时才保留该编辑 (Yang et al., 2026 (https://arxiv.org/html/2607.18973#bib.bib1))。
验证分数是关键假设。在可验证的领域中,即使回复被改变,仍可对照一个稳定的目标进行检查。数学证明可以重新评估,代码可以执行,结构化输出可以与已知答案进行比较 (Gao et al., 2023 (https://arxiv.org/html/2607.18973#bib.bib7))。开放式对话缺乏这种不变性。考虑一个记录下的交互
x = \( \mathcal{C}, \mathcal{H}, Q_{1}, A, Q_{2} \),其中 \(\mathcal{C}\) 是上下文和用户信息,\(\mathcal{H}\) 是对话历史,\(Q_{1}\) 是当前请求,\(A\) 是助手回复,\(Q_{2}\) 是用户后续的话语或行为反馈。如果一个回答技能将 \(A\) 改变为 \(A'\),那么原始的 \(Q_{2}\) 就不再是必然跟随的反应。因此,用记录的 \(Q_{2}\) 来评分 \(A'\) 会混淆事实观测与未观测的反事实情况。
这为对话技能进化带来了实际障碍。没有固定的离线目标,每个候选回答技能理想情况下都需要人工判断或在线 A/B 测试流量。迭代部署缓慢、昂贵且有风险;此外,它无法提供一个干净的验证门控来判断文本自我进化是否已收敛。
我们引入了一个学习目标的转变。我们不再首先进化一个告诉助手*如何回答*的技能,而是进化一个反馈预测技能,该技能估计*用户将如何对已经观察到的答案作出反应*。给定 \((\mathcal{C}, \mathcal{H}, Q_{1}, A)\),预测器估计下一个信号是表示已解决/已接受还是未解决/被拒绝。与反事实答案评估不同,这个任务可以对照一个固定的记录标签进行衡量。失败的预测被总结为对反馈技能的有限添加、删除或替换;只有当候选能改善保留集性能时才被接受。
由此产生的反馈技能除了分类之外也很有用。为了预测用户是否会接受一个答案,它必须编码表面上合理回复与真正解决问题回复之间的操作性区别:工具成功不等于用户采纳,勉强的确认不等于接受,通用建议不等同于可操作计划,回复必须涵盖用户独立的决策点。这些理由为改进回答技能提供了具体方向。
我们的贡献是:
- • 我们形式化了移动目标问题,该问题阻止直接复用记录的下轮反馈来对开放式回答技能进行离线进化。
- • 我们提出基于验证门的未来-反馈技能进化,将记录下的人类和行为信号转化为文本技能优化的固定、可验证目标。
- • 我们识别了反馈-生成二重性:为了预测不满所需学习的可解释规则,同时也为回答生成提供了可操作的诊断信息。
- • 我们报告了一个工业案例研究,其中经过清洗的高质量数据和平衡的已解决/未解决评估取得了超过75%的准确率,同时明确区分了观测预测准确率与反事实保证。
参考图1的说明:两种技能的验证方式不同。修改 \(S_A\) 会得到新答案 \(A'\) 和未知的后续信号 \(Q_2'\),因此记录的 \(Q_2\) 无法验证候选。修改 \(S_Q\) 保持 \((Q_1, A, Q_2)\) 固定,从而每个预测都能与观察到的 \(Q_2\) 进行比较。图1 (https://arxiv.org/html/2607.18973#S1.F1) 明确了这一界限。保留的日志数据验证了反馈预测技能本身的进化。其学到的标准可以指导回答技能编辑,但由此产生的反事实答案需要全新的人工判断或在线交互;原始的记录反应对于它们来说并非有效标签。
## 2 相关工作
#### 文本技能与提示优化。
文本制品可以作为冻结模型的外部、可编辑状态。SkillOpt 通过有限编辑、保留集验证以及拒绝非改进候选,将优化器式的纪律应用于这一领域 (Yang et al., 2026 (https://arxiv.org/html/2607.18973#bib.bib1))。我们的工作采用了这种验证门控视角,但针对的是验证目标本身会随生成回复变化而变化的领域。
#### 用户满意度估计。
用户满意度长期以来被研究作为对话系统的自动评估信号。USS 基准提供了跨多个领域的轮次级和对话级满意度标注 (Sun et al., 2021 (https://arxiv.org/html/2607.18973#bib.bib4))。SPUR 使用监督的迭代提示从标注样例中学习可解释的满意度评分标准 (Lin et al., 2024 (https://arxiv.org/html/2607.18973#bib.bib2))。这些研究确立了满意度相关模式可以从对话中学习。我们的重点不仅仅是估计满意度;而是使用可验证的反馈预测任务作为自我进化文本技能的优化基板。
#### 预测未来不满。
See 和 Manning (2021 (https://arxiv.org/html/2607.18973#bib.bib3)) 预测用户是否会在下一轮表达不满,并使用该信号对聊天机器人回复进行排序。这与我们的预测目标密切相关。我们的不同之处在于将预测器的文本策略本身视为验证门控进化的对象,并将其学到的失败理由提取为可复用的技能知识。
#### 学习奖励及其局限性。
人类反馈学习使用学习的偏好或奖励模型来优化模型行为 (Ouyang et al., 2022 (https://arxiv.org/html/2607.18973#bib.bib6))。此类模型可能在分布偏移下失败或被优化所利用。我们的提议有意更为狭窄:日志数据目标验证了反馈技能在观测交互上的进化。它本身并不证明任何针对该技能优化的任意答案都能让用户满意。最终部署仍需人工或在线确认。
## 3 问题形式化
### 3.1 记录的对话反馈
令
\( D = \{ (X_i, A_i, Y_i) \}_{i=1}^{N}, \quad X_i = (\mathcal{C}_i, \mathcal{H}_i, Q_{1,i}) \),
其中 \( Y_i \in \{0,1\} \) 来源于后续用户话语或行为信号。在我们的应用中,\( Y=1 \) 表示已采纳或已解决,\( Y=0 \) 表示未解决。
一个回答技能 \( \mathcal{S}_A \) 诱导出回复分布
\( A \sim p_{\theta}(A \mid X, \mathcal{S}_A) \),
用于一个冻结的目标模型(参数为 \( \theta \))。一个新答案的真实效用取决于未知的反应:
\( U(A') = \mathbb{E}[Y' \mid X, A'] \).
对于包含 \( A \) 的记录,只观测到 \( Y \)。用 \( A' \) 替换 \( A \) 并不能保留标签,因为通常
\( p(Y \mid X, A) \neq p(Y \mid X, A') \).
因此,一个固定数据集无法直接为 \( \mathcal{S}_A \) 的任意修改提供无偏的验证分数。
### 3.2 一个可验证的替代任务
我们转而优化一个反馈技能 \( \mathcal{S}_F \),预测观测到的标签:
\( \hat{Y} = f_{\theta}(X, A; \mathcal{S}_F) \).
对于每个候选 \( \mathcal{S}_F' \),保留集分数
\( J(\mathcal{S}_F') = \frac{1}{|D_{\mathrm{val}}|} \sum_{(X,A,Y) \in D_{\mathrm{val}}} \mathbb{1}[f_{\theta}(X,A; \mathcal{S}_F') = Y] \)
无需改变交互即可测量。其他部署相关的指标,如假正例的不对称成本,也可以纳入 \( J \) 中。
这种转变并不会使反馈模型成为一个完美的反事实预言机。但它确实使其*自身的进化*在固定数据上可复现且可拒绝,这正是文本优化所需遵守的纪律。
## 4 方法
### 4.1 概述
图2 (https://arxiv.org/html/2607.18973#S4.F2) 对比了直接回答技能进化与我们的方法。直接进化试图重用附着于旧答案的反应。未来-反馈进化保持记录的答案固定,学习一个经过验证的预测技能,然后使用其可解释的标准来诊断回答质量。
参考图2的说明:与固定日志的形式化比较。进化 \( S_A \) 会改变 \( A \) 并留下未知的后续 \( Q_2' \)。进化 \( S_Q \) 预测记录的 \( Q_2 \),因此每次编辑在相同的保留数据上仍然可测试。
### 4.2 反馈标签与数据构建
信号可能来源于显式用户反馈、文本接受或拒绝,以及产品端的行为事件。实现将可用证据映射为二元的已解决/未解决标签。当含义模糊时,排除静默终止;这避免了噪声标签,但引入了选择偏差,将在第7节 (https://arxiv.org/html/2607.18973#S7) 讨论。
数据质量至关重要。原始生产日志包含不完整的轮次、主动外联而非响应用户问题的消息、重复或格式错误的记录、弱支持的标签以及缺失的对话上下文。我们应用质量过滤器,确保每个保留的示例具有清晰的轮次边界、可用的回复以及高置信度的后续标签。然后我们构建训练和测试分区,已解决/未解决比例大致为 \(1:1\)。这防止了多数类准确率掩盖技能是否同时学习了两类结果。
### 4.3 验证门控技能进化
从一个初始的反馈技能 \( \mathcal{S}_F^{(0)} \) 开始,预测器为每个训练示例生成一个标签和理由。在第 \( t \) 轮迭代中,一个优化器模型接收高价值失败(尤其是自信的假正例)并提出一个有限的文本编辑 \( \Delta^{(t)} \):
\( \tilde{\mathcal{S}}_F^{(t+1)} = \operatorname{Edit}(\mathcal{S}_F^{(t)}, \Delta^{(t)}) \).
当前技能和候选技能都在保留集上进行评估。仅当候选技能改进了主要验证目标时才被接受,否则被拒绝:
\( \mathcal{S}_F^{(t+1)} = \begin{cases} \tilde{\mathcal{S}}_F^{(t+1)}, & J(\tilde{\mathcal{S}}_F^{(t+1)}) > J(\mathcal{S}_F^{(t)}), \\ \mathcal{S}_F^{(t)}, & \text{otherwise.} \end{cases} \)
一个词典序的变体可以在仅当非对称业务效用改善时才保留相等准确率的候选。当将用户标记为满意但实际上问题未解决的成本高于保守预测未解决时,对假正例施加更强惩罚是有用的。
### 4.4 从预测理由到回答指导
进化后的技能学习了可复用的区分标准。代表性规则包括:
- • 成功的工具执行或消息投递并不表示用户采纳了结果;
- • 问候、产品推荐、报告和行动号召本身并不能解决用户需求;
- • 诸如“OK”之类的勉强确认可能表示收到而非接受;
- • 参数建议应指定一个动作及至少一个可操作锚点,例如数值、界面、时间窗口或重新评估条件;
- • 回复应涵盖用户最新请求中的独立决策点。
这些规则可以转化为对 \( \mathcal{S}_A \) 的诊断。例如,一个建议用户“观察几天并适当调整参数”的回复看起来有用,但缺乏目标值和触发进一步调整的条件。反馈技能预测未解决并解释了缺失的可操作性;该解释随后可以提炼为回答技能指令。在本文中,我们在概念上并通过观察到的学习规则建立了这座桥梁,但并未声称 \( \mathcal{S}_A \) 有单独测量的端到端改进。
## 5 工业案例研究
### 5.1 设定
我们在生产环境销售助手场景的隐私保护交互中评估该方法。输入包括可用上下文、对话历史、工具使用摘要以及助手当前的回复。标签指示后续用户或行为证据是否支持已解决/已采纳与未解决/未采纳。所有示例和操作标识符均已脱敏,不发布原始对话。
最新评估使用一个精心策划的高质量子集,而非早期的未过滤提取。训练集和测试集被精确划分并平衡,使正负样本比例大致相等。由于本文强调形式化方法且数据是专有的,我们报告了经过验证的总体结果,而不披露敏感计数或流量统计。
### 5.2 结果
在平衡的测试集上,经过仔细质量过滤和构建的反馈预测任务达到了超过75%的准确率。这一数字是在一个严格的保留集上通过验证门控进化过程获得的。准确率并非完美,但结合可解释的失败理由,足以指导回答技能的诊断。我们强调,这一准确率衡量的是*观测预测*,而非*反事实有效性*;后者的保证仍需要在线验证。该结果进一步确认,在现有数据上学会用户采纳信号是可行的,并且进化框架是稳定的。相似文章
OpenSkill:LLM智能体的开放世界自进化
OpenSkill是一个框架,让LLM智能体能够从开放世界资源中自进化技能和验证信号,无需目标任务监督,在多个基准测试中实现高性能。
SkillAudit:基于成对轨迹审计的无真值技能进化
SkillAudit 引入了一个框架,通过成对轨迹审计和对比评估,在没有真实反馈的情况下进化 LLM 智能体技能。该框架在 89 个任务上实现了 73.9% 的平均任务奖励,优于基线方法。
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
GrowLoop: 由人类初始化的自我进化对话评估
本文介绍了GrowLoop,一个用于评估开放式对话中人类相似度的自我进化评估系统。它利用最少的人类种子标注,迭代优化评估标准,解决了隐性知识、人类意见分歧和模型能力进化等挑战。
SkillOpt:自我进化智能体技能的执行策略
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。