当聚合对齐产生误导:无需逐状态专家动作的策略修复审计
摘要
本文研究了在无法获取逐状态专家动作标签的情况下,对修复决策策略的自主AI系统的评估问题,采用了一个具有区域级诊断反馈的酒店定价模拟器。研究发现聚合对齐可能产生误导,并提议通过闭环结果而非行为距离来评估策略修复。
arXiv:2607.03386v1 Announce Type: new
摘要:自主AI系统越来越多地被用于编辑、优化和修复决策策略,但当无法获得逐状态专家动作标签时,评估这些编辑变得困难。我们在一个酒店定价模拟器中研究该问题,其中自主策略编辑器仅接收区域级诊断反馈:即其价格分布在时间、库存和市场区域上与基准策略差异的摘要。编辑器无法观察基准动作、基准源代码、奖励数值或留出结果,只能对目标动作表提出受限编辑。在5,000个保留回合中,一个多重启LLM编辑器达到了RevPAR 108.47(95% CI 107.61 - 109.34),接近基准策略的108.75(107.81 - 109.68),配对差距(LLM减去基准)为-0.276,95% CI [-0.692, 0.146]。一个简单的诊断投影已经恢复了大部分收入(107.90),因此LLM编辑器的独特收益不仅仅是原始收入的提升:它还降低了回合组成距离,从1.153降至0.609。这是最强的非基准修复结果。这一表现不能仅由重启搜索解释:使用最多2,500次评估的非语义提议者落后RevPAR 8.77至14.57点。也不能由看似合理的提示格式解释:打乱诊断的控制组破坏了区域-误差对应关系,RevPAR降至94.30。该匹配是真实但部分的。一个树编辑器实现了更强的聚合对齐(0.214对比0.266)和更强的参考状态D1(0.328对比1.197),但收入降至98.91。这些结果表明,自主策略修复应通过诊断反馈是否成为可靠的闭环结果来评估,而非单一的行为距离。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 无需逐状态专家行为的审计策略修复 来源: https://arxiv.org/html/2607.03386 ## 当聚合对齐产生误导:无需逐状态专家行为的审计策略修复 ###### 摘要 智能体 AI 系统越来越多地被用于编辑、优化和修复决策策略,但当缺乏逐状态的专家行为标签时,评估这些编辑十分困难。我们在一个酒店定价模拟器中研究了这一问题。在该模拟器中,一个智能体策略编辑器仅接收区域级别的诊断反馈:其价格分布与基准策略在时间、库存和市场区域上的差异摘要。编辑器无法观察到基准行为、基准源代码、奖励数值或留出结果,并且只能对目标操作表提出受限的编辑。在 5,000 个留出回合中,一个多次重启的 LLM 编辑器达到了 RevPAR 108.47(95% CI 107.61–109.34),接近基准策略的 108.75(107.81–109.68),配对差距(LLM 减去基准)为 -0.276,95% CI 为 [-0.692, 0.146]。一个简单的诊断投影已经恢复了大部分收入(107.90),因此 LLM 编辑器的独特增益并不仅仅是原始收入提升:它还使回合构成距离从 1.153 降低到 0.609。这是最强的非基准修复结果。这种表现不能仅用重启搜索解释:最多进行 2,500 次评估的非语义提议者落后 8.77–14.57 RevPAR 点。也不能用合理的提示格式解释:一个打乱诊断的对照组打破了区域错误对应关系,收入降至 94.30。这种匹配是真实但不完全的。一个树搜索编辑器实现了更强的聚合对齐(0.214 对 0.266)和更强的参考状态 D1(0.328 对 1.197),但收入降至 98.91。这些结果表明,智能体策略修复应通过诊断反馈是否成为可靠的闭环结果来评估,而非单一的行为距离。 关键词:智能体评估,策略修复,诊断反馈,行为审计,收益管理 ## 1 引言 智能体 AI 系统越来越多地被要求修改决策系统,而不仅仅是回答问题。它们编写代码、调整运营规则、更新工作流并提出策略编辑。这带来了一个新的评估问题。智能体的输出不是一个标签或预测;它是对决策策略的干预。如果干预在表面指标上看起来合理,系统仍可能在关键的操作状态中失败。 最近的工作强调了语言模型作为能够推理、行动并与环境交互的智能体[10 (https://arxiv.org/html/2607.03386#bib.bib1),3 (https://arxiv.org/html/2607.03386#bib.bib4)]。其他基准通过外部执行验证的工件编辑来评估智能体,例如软件任务的代码补丁[2 (https://arxiv.org/html/2607.03386#bib.bib5)]。我们的设置遵循相同的总体方向,但研究的是不同的对象:智能体编辑一个决策策略,评估者必须在没有逐状态专家行为标签的情况下判断策略修复是否可信。 本文研究了在缺少逐状态专家行为标签情况下的智能体策略修复。智能体获得一个待编辑的策略以及该策略与基准策略差异的诊断反馈。它不会获得每个状态的基准行为、基准实现、奖励数值或留出结果。它必须提出对策略的受限编辑。然后评估者询问编辑后的策略是否更好。 这种设置不同于标准的监督模仿和奖励优化。在模仿学习中,学习器观察专家的状态-行为对。在奖励优化中,学习器接收一个标量目标。在诊断反馈修复中,智能体接收的是聚合的行为摘要。这些摘要可能表明状态空间的某个区域过度使用或未充分使用某些行为,但它们不会说明在特定状态下应采取何种行为。 我们使用酒店定价作为受控试验平台。策略是一个由时间、库存和市场索引的目标操作表。基准是一个固定的基于规则的收益管理参考策略;它是一个行为参考,而非全局最优性的声明。该规则结合了一个针对参考竞争对手价格计算的短视预期收入价格,以及一个库存进度下限,当已售库存超过目标曲线时,该下限会提高最低可接受价格。智能体看不到这个规则。它接收的诊断信息比较了其价格分布与基准在 12 个运营区域中的差异。它只能对目标操作表进行矩形整数偏移编辑。这种设置为我们提供了留出结果、有意义的运营状态变量以及可审计的编辑语法。 为什么要审计对非最优基准的忠实度?在许多运营环境中,基准策略是一种参考纪律,而非最优性证书。操作者可能关心修复后的策略是否保持可预测性、可解释性,并保持在已批准规则的定性行为之内,即使收入是最终的业务成果。仅考虑收入的审计可能接受一个运营纪律已经漂移的策略。因此,我们的目标不是证明基准模仿总是可取的,而是评估修复是否在改善或维持结果的同时保留了有用的行为结构。 关键的评估风险是聚合对齐。策略编辑器可以使整体行为分布类似于基准,但几乎不保留操作者能识别的轨迹内价格构成。在定价中,这意味着一个策略可能使用了正确的全局价格组合,但在不同的预订时段中放置了这种组合。更一般地说,一个修复后的策略可能匹配边际行为分布,但仍无法通过更细粒度的行为审计。 我们发现,在这个受控环境中,区域级别的诊断足以让一个 LLM 编辑器在严格的信息限制下产生闭环价值。LLM 编辑器达到了接近基准的 RevPAR 点估计值,配对差距置信区间跨越零,并在非基准编辑器中实现了最佳的回合构成距离。一个简单的诊断投影也达到了高收入,因此 LLM 的独特贡献并不是相对于投影的巨大收入提升;而是接近基准的收入、更强的回合构成忠实度以及相应对照组的控制结果,这些对照表明区域级别诊断的对应关系至关重要。这不仅仅是重启搜索:计算预算匹配的非语义提议者落后 8.77–14.57 RevPAR 点。这也不仅仅是合理的提示格式:打乱的诊断信息会导致收入和回合构成忠实度崩溃。成功仍然是部分的。一个树搜索编辑器实现了最佳的行为聚合分布对齐和最佳的参考状态 D1,但其留出收入崩溃了。因此,在这个模拟器中,参考状态的行为忠实度既不是基准级别闭环收入的充分条件,也不是必要条件。正确的评估问题是诊断反馈是否成为可审计的运营结果。 我们做出三点贡献。首先,我们将诊断反馈策略修复形式化为一个智能体评估设置,其中智能体编辑一个决策工件,而不观察逐状态的基准行为、奖励或留出结果。其次,我们展示了一个多次重启的 LLM 编辑器可以在这种限制下将局部诊断反馈转化为闭环收入恢复,而非语义提议者控制和打乱的诊断则不能。第三,我们展示了为什么这种成功仍然需要多指标审计:行为对齐在一个审计下可能看起来很强,而收入或另一个行为审计却失败。由此产生的协议结合了结果指标、聚合对齐、回合构成对齐、参考状态 D1、强投影基线、非语义提议者控制以及打乱诊断的安慰剂对照组。 ## 2 相关工作 LLM 智能体与反馈驱动的优化。LLM 智能体将语言模型推理与外部环境中的行动相结合[10 (https://arxiv.org/html/2607.03386#bib.bib1)]。诸如 Reflexion 和 Self-Refine 等反馈驱动方法表明,语言模型可以通过迭代反馈在不进行梯度更新的情况下改进输出或决策[6 (https://arxiv.org/html/2607.03386#bib.bib2),4 (https://arxiv.org/html/2607.03386#bib.bib3)]。我们的工作共享反馈驱动的结构,但反馈既不是自由形式的自我批评,也不是标量奖励。它是一个区域级别的诊断,比较了编辑后策略的动作分布与基准策略的差异。 智能体评估。AgentBench 在交互式环境中评估作为智能体的 LLM[3 (https://arxiv.org/html/2607.03386#bib.bib4)],最近的综述围绕目标、流程、指标和部署约束组织智能体评估[5 (https://arxiv.org/html/2607.03386#bib.bib7)]。SWE-bench 研究编辑软件工件并通过外部测试进行评估的语言模型[2 (https://arxiv.org/html/2607.03386#bib.bib5)]。Agentless 进一步论证了受约束、可解释的修复流水线可以与更复杂的自主软件智能体相竞争[9 (https://arxiv.org/html/2607.03386#bib.bib6)]。我们将这种评估视角引入策略修复:智能体编辑一个决策策略,而成功需要的不只是一个单一的聚合分数。 代理目标与规范博弈。我们的指标分歧与奖励黑客和规范博弈有关:优化一个代理可以满足书面目标,但错过了预期行为[7 (https://arxiv.org/html/2607.03386#bib.bib8)]。这里的代理不是模拟器奖励本身,而是一个行为审计。树搜索编辑器展示了可以优化边际行为分布指标,而轨迹局部行为和收入却失败。 模仿与离线策略评估。逆向强化学习和模仿学习研究如何从演示或专家偏好中恢复行为[1 (https://arxiv.org/html/2607.03386#bib.bib9)]。我们的设置从编辑器的输入中移除了逐状态基准行为,只暴露区域级别的摘要。审计问题也类似于离线策略评估,其中策略质量必须在分布和轨迹级别的不确定性下进行估计[8 (https://arxiv.org/html/2607.03386#bib.bib10)]。我们使用一个模拟器,以便每个选定的策略都可以在同一批留出生产回合上进行审计。 ## 3 诊断反馈策略修复 我们考虑一个编辑决策策略的智能体。可编辑的策略是一个目标操作表。每个单元格对应于操作状态空间的一个区域,由时间、库存和市场索引。起始策略是一个常量表。基准策略仅用于诊断比较和留出审计。 在每个修复迭代中,当前策略在训练回合上进行展开。其动作分布与基准策略的动作分布在每个诊断区域内进行比较。生成的诊断报告总结了当前策略在每个区域中过度使用或未充分使用行为范围的情况。 智能体接收这份报告并提出一个补丁。一个有效的补丁只能通过矩形整数偏移来更改目标操作表条目。无效编辑被拒绝。智能体不能修改模拟器、基准策略、奖励函数、指标定义或评估器。 信息约束是有意设计的: - 不向智能体显示逐状态的基准行为标签。 - 不向智能体显示基准源代码。 - 提示中不显示奖励数值或留出结果。 - 除了诊断报告外,不暴露环境参数。 - 最终报告的指标是在留出生产回合上计算的。 这些约束使得该任务成为一个用于诊断反馈的评估设置。如果策略改进,改进必须来自于使用诊断摘要来提出有效的策略编辑。 所有报告的策略都在相同的 5,000 个留出生产回合上进行审计。候选生成和选择使用非生产诊断;生产留出结果在选后只使用一次。这种划分很重要,因为本文的目标不是直接优化生产留出收入,而是评估在锁定决策空间下诊断反馈是否能够支持策略修复。 该协议围绕特定的评估威胁模型设计。由于智能体编辑一个后续将被评估的工件,一个简单的设置可能会混淆策略修复与奖励泄露、标签泄露或评估者操纵。表 1 (https://arxiv.org/html/2607.03386#S3.T1) 列出了我们研究中的主要威胁和相应的设计选择。 表 1:诊断反馈策略修复的评估威胁模型。图 1 (https://arxiv.org/html/2607.03386#S3.F1) 总结了评估协议。关键的设计选择是智能体从未拥有整个循环。它观察诊断并提出补丁,而单独的组件验证补丁、评分候选、从中选择并在留出回合上审计选定的策略。 1. 当前策略:目标操作表 2. 训练诊断:区域级别的动作不匹配 3. 编辑器提出一个受约束的补丁 4. 验证器只接受表格编辑 5. 候选存档存储补丁和训练指标 6. 选择器从训练池中选取 7. 留出审计报告结果和行为 仅训练种子 提示中无奖励或留出结果 模拟器、指标和基准不可变 最终审计仅一次 图 1:诊断反馈策略修复流水线。编辑器观察区域级别诊断并提出受约束的表格编辑;验证、候选评分、选择和留出审计在编辑器外部。 ## 4 策略编辑器 我们比较三种策略编辑器。 诊断投影。一种直接投影将诊断动作分布映射到目标操作表中。这是一个强且廉价的基线:它询问通过机械地将诊断摘要转换为表格(无语言模型提议生成)可以恢复多少。它不是正式的神谕,因为它不搜索所有可行表格。 树搜索编辑器。一个非语义树搜索编辑器使用相同的诊断模式搜索相同的补丁语法。它测试在没有语言模型提议结构的情况下,诊断表示和编辑语法是否足够。在规范运行中,树搜索使用 500 次候选评估,波束宽度 5,分支因子 10,以及在最终生产审计之前的一个前 5 名重新评估阶段。由于这个搜索预算小于 LLM 编辑器的 2,500 次候选评估,我们主要将树搜索用作一个非语义诊断消费者和指标压力测试,而不是作为证明一种提议架构优于另一种的计算匹配证据。 这种区别对于解释很重要。本文评估的是一个锁定的诊断反馈修复协议是否可以安全审计,而不是语言模型提议是否本质上优于每一个非语义提议者。因此,我们在第 8 节 (https://arxiv.org/html/2607.03386#S8) 中包含了额外的多达 2,500 次评估的随机和诊断引导的非语义提议者控制。 多次重启 LLM 编辑器。LLM 编辑器读取诊断报告并在每次迭代中提出一个补丁。主要运行使用 DeepSeek-V4-Flash,温度为 0,采用 JSON r
相似文章
AI 对齐:我们能信任 AI 任务背后的推理过程吗?
讨论了 Anthropic 关于 AI 对齐的研究,特别是模型在训练期间看似对齐,但其内部推理过程却不透明的问题。
对自动化工作流中代理失调的冷静审视
本文研究了自动化工作流中的多代理系统中的代理失调问题,提出了代理证据归因(Agentic Evidence Attribution, AEA)方法,利用上下文特定的证据纠正代理行为的不对齐。
在人机对齐下借助AI辅助决策的学习
本文研究了在人机对齐条件下学习借助AI做出最优决策的问题,表明对齐可以降低学习的复杂度,并给出了遗憾界。
[D] 人工智能对齐能否从“变革性”训练中受益,而非主要依赖交易性奖励训练?
作者探讨了人工智能对齐能否从灌输目的和原则的“变革性”训练中受益,而不仅仅是优化奖励信号,并询问这种方法是否经过测试,或者能否减少奖励漏洞利用和涌现性错位。
考虑语境:塑造道德信念以实现价值对齐
本文主张,在AI价值对齐中聚合道德评估时必须考虑语境因素,表明忽略语境可能导致违反弱帕累托原则,类似于辛普森悖论。