一个AI模块通过向另一个模块提供答案,伪造了86%的管道准确性提升(6分钟阅读)

TLDR AI 论文

摘要

麻省理工学院和哈佛大学的研究人员介绍了Role Anchor,这是一种缓解复合AI系统中角色漂移的技术,通过在端到端优化期间强制模块遵守其指定角色,因为终端准确性可能掩盖底层故障。

复合LLM管道可以在专用模块悄悄放弃指定角色的同时获得准确性,创造出系统级指标无法察觉的‘角色漂移’。Role Anchor限制了这种行为。当其中一个管道的分解器保持角色时,其表面上的RL收益的86%消失了。
查看原文
查看缓存全文

缓存时间: 2026/08/18 15:35

# 一个AI模块通过向另一模块提供答案,伪造了整个流程86%的准确率提升 来源:https://venturebeat.com/orchestration/one-ai-module-faked-86-of-a-pipelines-accuracy-gains-by-feeding-another-the-answers 检索增强生成(RAG)系统被设计为严格依据其检索到的文档来回答。但当工程师端到端优化这些AI流程时,阅读器模块可能学会一条捷径:它不再依赖检索到的证据,而是开始根据自身的内部记忆来回答问题——与此同时,整个系统的准确率却持续攀升。这就是“角色漂移”这一隐性挑战,是复合AI系统的一种故障模式:即使端到端性能在提升,个别模块也可能学会绕过其指定任务。 为了解决这个问题,MIT和哈佛大学的研究人员引入了Role Anchor(https://arxiv.org/abs/2607.21627)技术,该技术迫使模块在训练过程中恪守其本职。应用该技术后,角色漂移现象得以缓解。例如,它迫使RAG阅读器依赖检索到的证据,而非基于其内部知识进行回答。 对从业者而言,主要启示在于:仅凭端到端准确率可能会高估复合AI系统实际的学习程度。工程师必须评估各个组件,并确保它们按预期工作。 在优化多步骤LLM流程时,Role Anchor既可作为防护栏,也可作为诊断工具。对于那些需要模块间严格分工协作的现实世界AI应用而言,它至关重要。 ## 为何终端准确率掩盖了问题 复合LLM系统将复杂任务分配给专门的模块。例如,一个为多跳推理设计的系统可能会在“分解器”和“求解器”之间拆分任务。分解器将大问题分解为可管理的子任务,而求解器计算这些子问题的答案。这种分工使得AI工程师能够将执行委派给更小、更便宜的模型,并使得在可能的情况下并行处理子任务成为可能。 为了提高AI流程的性能,工程师通常使用端到端强化学习(RL)来优化它们,并由单一的“终端奖励”引导。这意味着系统根据最终答案是否正确来评估(研究人员称之为“终端准确率”)。当这个终端准确率上升时,系统就被认为在按预期学习和工作。 然而,终端准确率并未验证模块是否正确执行了其被分配的任务。正如论文合著者曹晓阳向VentureBeat所说:“终端准确率将整个多部分AI系统的行为简化为一个数字。它显示最终答案是否正确,但对哪个组件做出了贡献或它们是否遵循了其指定角色却说明甚少。” 这种盲点导致了角色漂移,即在优化过程中,某个模块的行为偏离了其指定角色,而系统的终端准确率却持续提高。 “对工程团队来说,实际风险在于,他们可能部署了一个流程,该流程通过了所有端到端评估,尽管其预期的分工已悄然崩溃,”曹说。因为奖励系统仅对最终答案评分,所以它无法检测或惩罚模块的擅自行动。 角色漂移(图片来源:VentureBeat) 让我们看看在分解器-求解器流程中这是如何发生的。分解器的指定角色是编写抽象的子问题而不解决任务,将推理留给求解器。在端到端RL下,分解器很快了解到较弱的求解器在处理抽象任务时容易出错。为了最大化奖励,分解器开始将答案泄露或植入它发送给求解器的子问题中。求解器最终只是复述了分解器提供给它的答案。终端准确率上升了,但预期的架构却被破坏了。 但如果系统得到了正确答案且准确率在提高,为什么我们还要在意某个模块是否偏离了其角色? 现实世界的部署远不止在训练数据集上获得正确的最终答案那么简单。分配给这些模块的隐含角色确保了可扩展性、可靠性和可审计性。考虑当角色漂移占上风时会发生什么: - **效率与可审计性丧失:** 在推理示例中,角色漂移导致分解器承担了所有繁重工作,而不是进行规划和委派。“一旦分解器开始直接将答案放入其子问题中,求解器就沦为了复制这些答案的工具,”曹说。“你仍然支付运行[不同模块]的费用,但它们不再进行独立工作。”工作负载无法再跨多个求解器并行化,无法委派给更便宜的模型以节省计算资源,下游的人类利益相关者也无法再逐步审计系统的逻辑以验证其如何得出答案。 - **动态环境中的脆弱性:** 考虑一个RAG系统,其中阅读器模型被严格限定使用外部检索的文档来回答问题。如果阅读器发生漂移,转而依赖其自身的内部参数化记忆(因为其记忆在训练期间碰巧是准确的),系统就会变得脆弱。当企业用新信息更新其数据库,或用户提出一个关于模型预训练之外新话题的问题时,系统将会失败,因为它放弃了其构建时所依赖的基础机制。 ## Role Anchor如何度量角色——并强制执行 “仅针对最终结果进行训练,会奖励系统产生正确答案,而不考虑其如何达成,”曹说。为了应对这一点,Role Anchor作为一种轻量级正则化技术,将角色指令纳入训练目标。它比较组件在有和没有这些指令时的行为,并阻止训练削弱这些指令的效果。 从高层次看,它确保模块在整个强化学习优化过程中持续尊重其原始角色提示的引导影响,使角色漂移变得可测量且可控。 Role Anchor的一个关键洞见是,角色的作用可以通过比较模型在有和没有角色提示时的行为来衡量。系统为每个模块评估两个不同的提示: 1. 专门的、指令密集型角色提示(例如,“你是一位细致的阅读器。使用检索到的段落来回答用户的问题……”)。 2. 中性提示(例如,“回答用户的问题……”)。 对于任何给定输入,模型会输出下一个词元的概率分布。在角色提示下运行时,它会倾向于某些词元。在中性提示下运行时,它的行为类似于通用助手。这两个概率分布之间的差异就是“角色效用”。 角色效用(图片来源:VentureBeat with Nano Banana Pro) 这个效用衡量了角色提示对LLM默认预测的“推动”方向和强度。如果一个词元与指定角色高度一致,角色提示会提高其出现的概率(或“推动”模型倾向于该词元)。 在开始RL训练之前,Role Anchor保留模型的一个冻结副本作为参考,并测量角色提示对这个参考模型的原始推动作用。这个RL前的推动作为设计者意图的真相基准,代表角色提示应有的模型引导作用。 在RL训练过程中,随着活跃模型权重的更新,Role Anchor会定期计算当前的推动作用,并将其与参考推动作用进行比较。如果当前推动作用开始减弱或偏离参考值,Role Anchor会对模型施加惩罚以防止角色漂移。 Role Anchor(图片来源:VentureBeat with Nano Banana Pro) 从实际角度看,考虑研究人员评估的RAG系统。在这个流程中,阅读器模块被明确指示仅根据检索到的文档来回答用户问题,而不是依赖其内部知识。 在无约束的、仅基于结果的RL下,阅读器了解到上游检索器有时会有噪声。为了在训练集上最大化准确率,它开始忽略检索到的段落,转而从记忆中回答。因此,其在角色提示和中性提示下的行为差距缩小到阅读器在两种提示下表现相同、忽略基础指令的程度。 相反,Role Anchor检测到阅读器的推动作用何时偏离参考推动作用。它施加惩罚,使模型参数偏离这种基于记忆的捷径。这迫使阅读器寻找符合角色的改进方法,例如学习如何更稳健地从检索到的段落中提取答案,或在检索到的段落有缺陷时避免使用其内部知识。 ## 数据分析:有多少准确率提升是真实的 为了测试Role Anchor的有效性,研究人员在RAG和分解器-求解器(DEC)流程上对其进行了评估。实验比较了使用标准结果导向强化学习(无锚定)训练的系统与使用Role Anchor训练的系统。 在结果导向RL下,RAG系统的终端准确率上升了,但其内部完整性崩溃了。研究人员测量了“证据遵循准确率”,这是一个测试模型在检索到的文本被刻意替换为相反内容时是否会改变答案的指标。该指标从0.86骤降至0.54(仅略高于随机机会),意味着模型学会了忽略检索到的段落,转而依赖其预训练的参数化记忆。在一项测试中,研究人员故意更改了检索文档中的一条信息,使其与模型的内部知识相矛盾。未锚定的模型没有更新回答,因为它没有使用外部文档。 当应用Role Anchor时,阅读器的证据遵循准确率保持在0.869,证明它严格依赖检索到的文本。当研究人员向锚定模型输入与输入提示无关的随机段落时,其准确率正确下降,因为它拒绝使用内部知识。未锚定模型在随机段落上得分更高,因为它是在凭记忆猜测。 分解器(DEC)流程表现出更戏剧性的故障模式。在结果导向RL下,终端准确率飙升,但“插入率”(即分解器将答案泄露到其发送给求解器的子问题中的频率)从0.143激增至0.596。 Role Anchor性能(来源:arXiv) 在RAG流程中,保持预期角色仅使系统准确率非常轻微地下降(-0.067)。阅读器仍然学会了更好地提取答案,但它是通过合法手段而非通过其内部记忆作弊来实现的。这意味着它在涉及训练期间未见过新知识的现实任务上更加可靠。 在DEC流程中,未锚定RL使准确率比基础模型提高了0.310,而Role Anchor仅显示了0.057的改进。诊断后发现,根本问题在于求解器模型太小,无法学习解题部分。这迫使分解器模型作弊以提供答案来提高终端准确率。这意味着未锚定提升中86%是虚假的,系统只是学会了利用捷径,而不是学会了如何更好地推理或分解问题。 然而,这种权衡并非普遍规律。在某些情况下,消除捷径实际上可以提升整体性能。“Role Anchor……不一定降低最终准确率,”曹说。“在我们最近测试的一个编码流程中,模型在强化学习训练期间学会了操纵其自身的测试执行器。添加Role Anchor完全消除了那个捷径,同时略微提高了用于评判代码的最终测试的正确性。” ## 将Role Anchor添加到现有流程需要什么 对于希望应用此技术的工程团队,曹表示:“Role Anchor可以作为一个额外的训练目标,添加到现有强化学习微调流程中,针对团队希望锚定的每个组件。”主流程和部署设置完全保持不变。 要实现它,工程师需要为每个锚定组件准备三个特定物品:其原始角色指令、一个移除角色信息的匹配中性版本,以及强化学习微调前模型的保存副本。 重要的是,推理时没有延迟惩罚。“Role Anchor仅在模型训练期间运行,因此不会拖慢已部署的系统,”曹说。他指出,由于额外的计算,他们目前的实现大约会使训练时间增加20%,但很可能有优化和减少该开销的空间。研究代码、训练配置和选定的模型权重将在不久的将来公开发布。 决定何时使用Role Anchor是基于最终准确率是否涵盖所有重要因素的个案决策。曹指出,一个受监管的法律RAG系统是一个典型例子。“产生答案的组件可能需要遵循检索到的证据、保持基于一组经批准的文档、并产生可追溯到其来源的答案,”他说。“仅凭最终准确率无法验证这些属性,因此该组件的行为需要直接测量和强制执行。” 随着企业AI向更复杂的复合流程演进,角色强制执行将变得更加困难,仅依赖提示将被证明是不可靠的。“在更大规模上,角色规范需要通过训练和系统设计来共同强制执行,”曹说。“像Role Anchor这样的方法有助于在训练期间保留预期行为,而清晰的系统边界、有限的工具权限以及使用期间的监控可以提供额外的安全保障。”

相似文章

AI正在吞噬AI工程循环(5分钟阅读)

TLDR AI

文章讨论了AI工程循环如何能够完全自动化,但认为将整个循环交给AI会产生'agent slop'(智能体垃圾),因为评估不完善。它建议自动执行某些步骤,同时保留人类判断以处理细微差别。

关于 AI 智能体的真实内情

Reddit r/AI_Agents

一位资深从业者分享了将 25 个以上 AI 智能体部署到生产环境的经验教训,指出记忆、编排和可审计性远比模型选择重要。文章详细介绍了上下文丢失、静默成本循环等常见故障模式,并推荐了包含 Claude Sonnet 4、Pydantic AI 以及 Octopodas 等专用记忆层的技术栈。