PatchOptic:面向共享状态LLM工作流的投影视图与验证的结构化更新

arXiv cs.LG 论文

摘要

介绍了PatchOptic,这是一种用于共享状态LLM工作流的接口,它采用投影读取和验证的结构化补丁来确保更新的有效性。通过PatchBench对46个案例进行了评估,结果显示在保持质量的同时减少了token成本和泄漏。

arXiv:2607.05483v1 公告类型:新提交 摘要:代理工作流通常操作于共享的结构化状态。由于LLM上下文窗口有限,每次模型调用通常只会显示当前工作流步骤所需的状态片段,这种模式通常称为渐进式披露。现代系统通过类似于grep的关键词搜索、检索增强生成(RAG)、抽象语法树(AST)查询以及特定任务的代理技能来构建此类面向模型的视图。这些方法使读取端变得可管理,但它们并未定义局部提出的重写在应用于完整状态后何时有效。缺失的环节是局部更新与全局有效性之间的契约。我们提出PatchOptic,这是一种受光学启发的共享状态LLM工作流接口。光学器件是可组合的双向访问器,用于描述如何读取和更新结构化数据的视图。PatchOptic借鉴了这种视图/更新直觉,并通过投影读取和验证的结构化补丁实现了它。每个工作流步骤声明一个投影读取视图、一个授权的写入区域和一个补丁源区域。除了运行时强制执行外,相同的声明还提供了一个路径级足迹,支持委派、子工作流组合以及同一阶段内独立步骤重排序的静态证书。我们通过PatchBench(一个包含46个跨领域案例的基准测试)评估了这种设计。结果表明,在强执行者下,投影读取减少了报告的泄漏和token成本,同时保持了可接受输出的质量。运行时验证在提交前阻止声明的工作流契约违规,补丁读取执行会拒绝使用隐藏来源的受损补丁构件。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:44

# 面向共享状态 LLM 工作流的 PatchOptic:投影视图与验证的结构化更新

Source: https://arxiv.org/html/2607.05483

Zhaoyu Bai\*
Department of Particle Physics and Astrophysics, Weizmann Institute of Science, Rehovot, Israel, 7610001
Jiaqi Cai
Corresponding authors' emails: [email protected]; [email protected]
Department of Physics, Massachusetts Institute of Technology, Cambridge, MA, USA, 02139 (2026-06-30)

###### 摘要

智能体工作流通常操作共享的结构化状态[37](https://arxiv.org/html/2607.05483#bib.bib20), [47](https://arxiv.org/html/2607.05483#bib.bib21), [33](https://arxiv.org/html/2607.05483#bib.bib23)。由于 LLM 的上下文窗口有限,每次模型调用通常只显示当前工作流步骤所需的状态片段,这种模式通常被称为渐进式披露。现代系统通过类 grep 的关键字搜索、检索增强生成(RAG)、抽象语法树(AST)查询以及特定任务的智能体技能来构建此类模型视图。这些方法使得读取侧变得可管理,但它们并未定义局部提出的写入在应用到完整状态后何时有效。缺失的部分是局部更新与全局有效性之间的契约。我们提出 PatchOptic,一种面向共享状态 LLM 工作流的光学启发式接口。光学器件是可组合的双向访问器,描述了结构化数据的视图如何被读取和更新。PatchOptic 借用了这种视图/更新的直觉,并通过投影读取和验证的结构化补丁来实现。每个工作流步骤声明一个投影读取视图、一个授权写入区域和一个补丁源区域。执行者仅看到投影视图,而验证器在提交前检查每个提出的补丁与完整状态。除了运行时强制,相同的声明还会产生一个路径级足迹,支持委派、子工作流组合以及同一阶段内独立步骤的静态可重排序证书。我们通过 PatchBench 评估了这一设计,该基准包含跨越多个领域的 46 个案例。结果表明,投影读取在强执行者下减少了报告的泄漏和令牌成本,同时保持了可接受输出的质量。运行时验证在提交前阻止了声明的工作流契约违规,而补丁读取强制执行拒绝了使用隐藏源的受损补丁工件。这些结果共同为在大型共享状态系统中安全使用 LLM 工作流智能体铺平了道路,其中局部操作可以通过显式的工作流足迹进行组合、委派和验证。

## 1 引言

渐进式披露在智能体工作流中现已很常见。由于 LLM 的上下文窗口有限,系统通常仅将当前步骤所需的完整状态片段暴露给每个模型调用。例如,RAG 检索相关的语料段落,智能体技能提供特定任务的工具和指令,而语法感知的 AST 查询暴露相关的代码结构。这些技术使得读取侧变得可管理[21](https://arxiv.org/html/2607.05483#bib.bib49), [39](https://arxiv.org/html/2607.05483#bib.bib46), [12](https://arxiv.org/html/2607.05483#bib.bib50), [24](https://arxiv.org/html/2607.05483#bib.bib24), [45](https://arxiv.org/html/2607.05483#bib.bib47), [32](https://arxiv.org/html/2607.05483#bib.bib48)]。写入侧则尚未解决。在共享结构化状态的多步骤工作流[37](https://arxiv.org/html/2607.05483#bib.bib20), [47](https://arxiv.org/html/2607.05483#bib.bib21), [33](https://arxiv.org/html/2607.05483#bib.bib23)中,智能体通常仅基于它被显示的片段提出更新。仅凭该片段,智能体可能忽略所提出的写入与状态其余部分的关系,包括依赖关系、模式、阶段、引用和权限。从局部视图判断全局有效性给智能体带来了沉重的认知负担。最近的智能体基准评估了这种多步骤有状态机制[24](https://arxiv.org/html/2607.05483#bib.bib24), [40](https://arxiv.org/html/2607.05483#bib.bib26), [46](https://arxiv.org/html/2607.05483#bib.bib25), [50](https://arxiv.org/html/2607.05483#bib.bib28), [26](https://arxiv.org/html/2607.05483#bib.bib42)]。提示注入工作研究了相关的一类失败,其中不可信的上下文影响智能体行为[17](https://arxiv.org/html/2607.05483#bib.bib30), [10](https://arxiv.org/html/2607.05483#bib.bib33), [48](https://arxiv.org/html/2607.05483#bib.bib32)]。现有的控制手段仅覆盖了该问题的一部分。模式验证器可以检查输出结构和一些局部值约束,但它们本身并不能确定这些值在语义上正确或源自授权的状态[43](https://arxiv.org/html/2607.05483#bib.bib3)]。受约束解码可以限制生成字符串的语法,但它不会验证用于构造该字符串的状态值的来源或授权[38](https://arxiv.org/html/2607.05483#bib.bib14), [4](https://arxiv.org/html/2607.05483#bib.bib18)]。单独使用时,这些机制仍局限于生成的工件或单个转换。我们仍然需要一种方法来判断局部写入相对于整个状态的正确性,并将这种判断扩展到多步骤、多智能体的工作流。填补这两个空白需要一个连接局部改写与全局有效性,并能跨步骤组合的契约。

我们提出 PatchOptic,一种面向共享状态工作流的光学启发式步骤接口。光学器件是可组合的双向访问器,描述了结构化数据的视图如何被读取和更新[15](https://arxiv.org/html/2607.05483#bib.bib13), [5](https://arxiv.org/html/2607.05483#bib.bib43)]。PatchOptic 借用了这种视图/更新的直觉,然后通过投影视图和补丁验证来实现。对于每个工作流步骤,执行者接收一个局部视图,而其提出的写入在提交前会针对整个状态进行检查。在运行时,PatchOptic 仅将投影视图提供给模型用于其步骤。模型返回一个补丁,验证器在提交前针对整个状态检查该补丁。相同的步骤契约决定了接口的两侧。它包含一个光学启发的权限三元组以及阶段约束、模式、适用性检查和不变谓词。权限三元组定义了投影读取视图、写入范围和补丁源路径(图 1 (https://arxiv.org/html/2607.05483#S3.F1))。对于静态推理,每个步骤也有一个*足迹*,记录投影读取、写入和补丁源路径。足迹支持用于委派的限制和用于对等组合的并集。它们还在两个步骤具有不相交的写入且彼此不读取对方写入时,给出一个静态交换检查。

贡献。(i) 一种运行时机制,将投影视图与共享状态上的验证 JSON Patch 写入相结合,并带有结构化轨迹,记录投影视图、提出的补丁、验证器决策和拒绝诊断信息。(ii) 一种用于声明的投影读取、写入和补丁源区域的足迹代数。它支持委派限制、通过并集的对等组合、数据相关区域以及同一阶段内可重排序证书。(iii) PatchBench,一个包含 46 个案例、跨越六个领域的基准测试,以及一个将实时执行者运行与无模型受损工件测试分离的评估协议。在 GPT-5-mini 下,投影读取设置将可接受输出的语义通过率从约 0.61 提升到 0.78–0.80。PatchOptic 将此读取侧优势与运行时验证相结合,将泄漏运行减少到每轮 0.1 次,并在遏制测试中拒绝所有隐藏源补丁工件。

论文的其余部分组织如下。第 2 节 (https://arxiv.org/html/2607.05483#S2) 定义了共享状态工作流设置、必须保护的隐藏源以及本文考虑的工作流风险。第 3 节 (https://arxiv.org/html/2607.05483#S3) 介绍了 PatchOptic 设计,包括给执行者投影视图并在提交前检查 JSON Patch 的运行时路径,以及支持委派、工作流组合和独立同阶段步骤安全重排序的足迹代数。第 4 节 (https://arxiv.org/html/2607.05483#S4) 描述了 PatchBench 和评估协议,包括实时执行者运行与使用受损工件(无模型)测试之间的分离。第 5 节 (https://arxiv.org/html/2607.05483#S5) 报告了实证结果,侧重于输出质量、报告泄漏、运行时强制和令牌成本。第 6 节 (https://arxiv.org/html/2607.05483#S6) 讨论了结果如何与论文的运行时、代数和基准贡献相关,将工作置于先前系统环境中,并概述了局限性和未来工作。第 7 节 (https://arxiv.org/html/2607.05483#S7) 总结。

## 2 共享状态工作流设置与失败模型

在多步骤共享结构化状态工作流中,会出现两大类失败。首先,状态可能包含与给定步骤无关的私有值。如果这些值进入步骤的视图,轻微的提示扰动或受损指令可能导致执行者泄露它们。我们将这类失败称为秘密泄露。其次,不受信任或不可靠的执行者可能返回一个对于工作流不合法的补丁。该补丁可能格式错误、针对错误的阶段、写入步骤范围之外、违反模式,或者从步骤不允许使用的源路径构建更新。我们将这类失败称为提交合法性失败。另一种语义输出错误的类别仍然可能发生,即执行者虚构了一个契约有效但错误的值。

我们重点关注在共享状态工作流中由不受信任的 LLM 调用导致的失败。步骤提示、执行者或返回的补丁可能有缺陷、受损或被篡改。它可能泄露隐藏信息、提出超出预期任务的写入、在错误的工作流阶段行动,或者从不应影响该步骤的状态构建更新。我们假设工作流策略本身是可信的,并在第 6 节 (https://arxiv.org/html/2607.05483#S6) 中将策略错误作为局限性进行讨论。这种框架遵循保护系统中的最小权限和中介访问传统[23](https://arxiv.org/html/2607.05483#bib.bib5), [35](https://arxiv.org/html/2607.05483#bib.bib6)]。在我们的设置中,受保护的资源是共享的工作流状态。

表 1 (https://arxiv.org/html/2607.05483#S2.T1) 总结了本文考虑的各种失败。

表 1:失败模型总结。

## 3 PatchOptic 设计

### 3.1 步骤接口与运行时路径

PatchOptic 通过一个单一的声明式步骤接口来解决这些失败模式,该接口在提示时间和提交时间均被使用。在运行时,投影限制了对执行者可见的信息,而验证则在提交前检查提出的突变。声明的区域还支持在工作流运行前对委派、组合和同阶段重排序进行静态检查。

正式地,步骤契约包含一个光学启发的权限三元组 Is=(Os,Ws,Ps),以及阶段约束、模式、适用性检查、不变式和可选的前置条件或后置条件。其中 Os 是共享状态上的投影,Ws 是写入区域,Ps 是补丁源区域。投影将完整状态 x 映射到步骤局部视图 Os(x)。Ws 定义了补丁可以修改的目标,Ps 定义了补丁操作在应用过程中可能读取的当前状态路径。当投影可路径化时,我们将 Rs 表示为 Os 暴露的叶子路径集合。下面使用的静态足迹即为 (Rs,Ws,Ps)。光学术语借鉴了透镜和视图更新工作[15](https://arxiv.org/html/2607.05483#bib.bib13), [5](https://arxiv.org/html/2607.05483#bib.bib43)]。在 PatchOptic 中,此权限三元组作为工作流契约的一部分。投影和验证因此从一个步骤声明出发,而不声称实现了一个完整范畴的光学器件。

图 1 (https://arxiv.org/html/2607.05483#S3.F1) 总结了由此产生的运行时路径。对于步骤 s,执行者接收投影视图 Os(x),执行局部任务,并返回一个突变提议 p。该接口独立于任何特定的补丁表示。在当前原型中,提议表示为 JSON Patch[6](https://arxiv.org/html/2607.05483#bib.bib2),使用 JSON Pointer 路径[7](https://arxiv.org/html/2607.05483#bib.bib1),这使得提议的状态更改在提交前是显式的。

共享状态 x -> 投影视图 Os(x) -> LLM 执行者 -> 补丁提议 p -> 验证器(作用域、模式、阶段、不变式) -> 验证 p 与当前 x -> 若所有门通过则提交: x←p(x);若任何门失败则拒绝: x 不变 -> 突变

图 1:操作工作流与检查点。运行时保存完整的共享状态 x;模型仅看到投影视图 Os(x),隐藏字段缺失。每个步骤返回一个 JSON-Patch 提议 p,该提议通过一个具有四个门的单一验证器:写入/补丁源作用域、模式、阶段和不变式。仅当每个门都通过时状态才发生突变;否则提议被拒绝并记录在审计日志中。

突变提议在状态发生任何更改之前必须通过验证器。验证解释声明的写入和补丁源区域 (Ws, Ps),然后检查提议的状态转换是否可接受。为此,验证器评估提议的目标以及补丁操作符引用的任何源路径。对于 `move` 操作,`from` 路径也是一个写入效果,因为 JSON Patch 在将其添加到目标之前会移除该值。验证器还检查阶段约束、写入作用域、补丁适用性、模式有效性和工作流不变式。任何检查未通过的提议都会使共享状态保持不变。

表 2 (https://arxiv.org/html/2607.05483#S3.T2) 总结了这些检查。

表 2:任何突变提交前执行的验证器检查。图 1 (https://arxiv.org/html/2607.05483#S3.F1) 中的四个门(作用域、模式、阶段、不变式)对这六行进行了分组:“作用域”涵盖写入作用域和补丁源作用域,“模式”涵盖适用性加输出形状,而“阶段”和“不变式”与此处的每一行一一对应。

该实现还支持可选的前置条件和后置条件,分别在作用域验证前和不变式验证后进行检查。它们在下面的结果中不作为单独的基准维度使用。

除了强制执行,PatchOptic 还会发出审计跟踪。运行时记录投影视图、突变提议、验证器结果和谱系边。这些跟踪支持调试和审计,但它们不影响运行时的接受/拒绝决策。

### 3.2 用于静态检查的足迹

上面的运行时路径解释了一个提议的更新在提交前如何被检查。相同的步骤声明也在任何执行者运行之前被使用。其声明的读取、写入和补丁源区域给出了该步骤的足迹。PatchOptic 比较这些足迹,以在工作流运行前检查委派、子工作流组合、局部执行者替换以及同阶段重排序。我们现在定义用于这些静态检查的足迹。

我们将步骤策略与每个设置使用的提示输入分开。静态比较声明式结构化状态的区域。令 L 表示状态表示使用的位置,令 ⪯ 表示位置之间的包含关系。我们使用稳定的名称来表示这些位置。

相似文章

LLM生成代码中的拼凑问题

arXiv cs.AI

本文形式化描述了'拼凑问题'——即LLM生成的代码在局部正确但在整个代码库中结构上不连贯的现象,提出了一个八类故障分类法和一个混合验证框架,并证明许多故障能够避开现有工具。

TRACE:基于轨迹的LLM训练后重对齐安全补丁学习

arXiv cs.LG

TRACE提出了一种基于轨迹的安全补丁学习框架,用于LLM训练后重对齐。该框架学习一个插件式补丁,在任务相关方向上干扰最小,同时果断控制不安全行为,在基准测试中实现接近100%的安全性,同时保持实用性。

HyperPatch:面向n元结构漂移的序列知识编辑

arXiv cs.CL

HyperPatch提出了一种参数保持框架,用于处理n元结构漂移下的序列知识编辑,利用超图神经网络维护事件完整性。在MQuAKE-CF和MQuAKE-T基准上,逐跳准确率分别相对提升96.24%和21.06%。