ContractEval:查询条件下的执行匹配与过程指令符合性评估

arXiv cs.AI 论文

摘要

ContractEval是一个诊断框架,用于评估LLM代理中的过程符合性,通过明确化活跃义务并与证据进行匹配,检测传统评判者遗漏的失败。

arXiv:2609.09458v1 Announce Type: new 摘要:随着LLM代理从回答问题转向执行程序,失败可能并非明显错误,而是不合理:最终响应看似可接受,但系统跳过了使答案合理化的检查、分支、依赖关系或不变量。仅输出评估只看答案,而追踪感知评判看到活动,但都不识别哪些义务对查询是活跃的。我们引入CONTRACTEVAL,一个用于明确这些活跃义务的诊断框架。它将过程指令表示为查询活跃义务,并与响应或追踪证据进行匹配,将遗漏、错误分支、排序错误、额外动作、不变量违反和输出合同违规转化为不同的符合性失败。在一组受控的审计过程合同中,仅输出和追踪感知的LLM评判遗漏了许多注入的结构失败;在黄金期望和观察图下,ContractEval检测并定位了所有这些失败。基于LLM的提取保留了大部分这种信号,但仍然对校准敏感。因此,ContractEval不是合规保证;它使过程符合性可审计,而不是隐含在最终答案质量中。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:37

# ContractEval:基于查询的执行匹配与程序性指令一致性
来源:https://arxiv.org/html/2609.09458
Shanu Kumar 机构:Oracle Health AI MBZUAI,Akshat Agarwal,Ganesh Kumar

###### 摘要

随着大型语言模型智能体从回答问题转向执行流程,其失败可能并非明显错误,而是暗藏缺陷:最终响应看似合理,但系统可能跳过了使答案成立所需的检查、分支、依赖关系或不变式。仅输出评估能看到答案,感知执行轨迹的评估能看到活动过程,但两者都无法识别针对该查询的具体义务。我们提出 **ContractEval** 诊断框架,用于明确这些激活的义务。该框架将流程指令表示为查询激活的义务,并将其与响应或执行轨迹证据进行匹配,将遗漏、错误分支、顺序错误、冗余操作、不变式违反和输出合同违规转化为不同类型的一致性失败。在经过审计的流程合同控制套件中,仅输出型和轨迹感知型的大型语言模型评判者遗漏了大量注入的结构性故障;而在金标准预期图和观测图的条件下,ContractEval 能检测并定位所有故障。基于大型语言模型的提取方法保留了部分信号,但对校准仍较敏感。因此,ContractEval 并非合规性保证,而是使流程一致性从隐含于最终答案质量变为可审计的状态。

图1:ContractEval 流程。核心评估对象是基于查询激活的预期图:只有将指令工件基于用户查询进行条件化后,才能将观测到的响应或轨迹证据与应支持的义务进行匹配。## 1引言

现代大型语言模型系统不仅被要求回答问题,还越来越多地被要求执行流程。提示、策略、评分标准或标准操作流程可能要求系统检查证据、满足前提条件、选择正确分支、遵守依赖关系,并保持如隐私、不确定性、格式或语气等不变式。在此类场景中,最终答案仅是被评估行为的一部分。响应可能在表面上有用,却跳过了必需的验证、选择了错误分支、颠倒了依赖关系、添加了不支持的中间操作,或违反了使答案成立的不变式。

这些失败往往隐藏在看似合理的输出背后,因此难以察觉。客服助手可能给出合理的退款回答却从未检查资格;医疗或法律助手可能陈述看似合理的结论却省略了必需的来源检查;智能体轨迹可能包含多次工具调用却绕过了前提步骤。仅输出的基准测试和整体性大型语言模型评判者可能接受此类案例,因为答案读起来顺畅。轨迹感知型评判者能看到更多活动,但活动并非分母:轨迹本身无法说明哪些义务应适用于此查询,哪个分支处于激活状态,或哪些观测到的操作算作满足了流程要求。

这使得流程评估变成了与答案评分不同的问题:不仅要看响应是否可接受,还要看它是否得到了必需流程的支持。若无明确的激活义务,评估者只能从他们正在评判的响应或轨迹中推断该流程。

我们提出 **ContractEval** 框架,通过明确分母来评估流程一致性。ContractEval 将指令工件视为语义合同,基于输入查询进行条件化,并将产生的激活义务与从响应或轨迹中提取的证据进行比较。其核心理念是可证伪的:模型应基于针对此查询激活的义务进行评估,这样失败才能追溯到缺失或违反的义务,而非不透明的评判者偏好。

这无需假设每个有效行为都遵循单一的表面轨迹。基于查询条件化的预期图是语义义务的部分有序表示:排除不激活的分支,保留必需的依赖关系,并且观测到的行为可以在适当的抽象层次上匹配义务。因此,ContractEval 并不要求智能体必须生成完全相同的轨迹;它考察的是轨迹或响应是否包含满足必需义务的证据。

我们通过一个围绕隐藏失败模式设计的控制性有效性套件来验证这一想法。从10个经过审计的流程合同和200个干净的基于查询条件化的执行中,我们创建了配对案例,其中合同、查询和基础证据保持固定,同时一个已知的义务被遗漏、错误分支、重新排序、用额外操作补充,或通过不变式或输出合同被违反。此设置提出一个简单问题:当答案或轨迹仍然看似合理时,评估者能否识别出失败的义务?在四个评判模型中,仅输出型大型语言模型评判者平均检测率为0.495,定位率为0.400;轨迹感知型评判者检测率为0.570,定位率为0.468;最强的轨迹感知型评判者仍遗漏了29.0%的扰动案例。在经过审计的预期图和观测图下,ContractEval 作为构念效度检查,检测并定位了所有受控扰动,而基于大型语言模型的观测图提取保留了大量信号,但暴露出提取器校准是当前的规模化瓶颈。

我们的贡献包括:(1) 将流程一致性形式化为查询激活义务与观测行为的匹配;(2) 一种查询条件化程序,仅评估由查询激活的义务,同时保留必需的依赖关系;(3) 用于测试隐藏结构性故障的受控扰动基准;(4) 对仅输出型、轨迹感知型、预期图型、神谕型和基于大型语言模型的评估者机制的经验比较;(5) 一项将声明合同编译、预期子图提取和观测图提取分离的组件研究。我们将发布该框架、经过审计的合同、提示和基准工件,以支持关于语义一致性评估的可重复研究。

## 2相关工作

指令遵循与标准操作流程评估。指令遵循基准测试已超越单一答案准确性的范畴,通过测试模型是否满足明确约束来评估。IFEval 关注可验证的指令约束(Zhou等,2023);FollowBench、InfoBench 和 ComplexBench 研究日益复杂的多层次指令遵循(Jiang等,2024;Qin等,2024a;Wen等,2024);SOPBench 和 LongProc 将评估扩展到更长的流程工件(Nandi等,2026;Ye等,2025)。SAGE 进一步将服务标准操作流程表示为对话图,以评估逻辑合规性和路径覆盖(Shi等,2026)。这些基准测试确立了指令遵循比最终答案正确性更具结构性。ContractEval 则探讨了不同的问题:给定特定查询和观测到的响应或轨迹,工件中的哪些义务被激活,观测到的行为是否满足了它们?这将评估对象从输出遵循或路径覆盖转向将激活的预期义务与执行证据进行匹配。

基于大型语言模型的评判者与评估可靠性。基于大型语言模型的评估因其能应用灵活评分标准并处理语义变化而被广泛用于开放式生成。G-Eval、MT-Bench、Chatbot Arena 和 Prometheus 风格的评估器就是此范式的例证(Liu等,2023;Zheng等,2023;Kim等,2024a;Kim等,2024b),而综述也记录了其有用性以及对提示、展示和评分标准设计的敏感性(Gu等,2025)。ContractEval 的动机源于整体性判断定义不足的场景:评判者可能看到看似合理的最终答案,甚至轨迹,却没有明确的分母来说明应适用什么流程。因此,我们在需要时使用大型语言模型作为结构化预期与观测协议内的提取器或语义验证器,而非作为最终一致性判断的唯一来源。

智能体轨迹、工具与流程证据。智能体和工具使用基准测试评估模型是否能通过API行动、浏览、解决软件任务或完成模拟任务(Yao等,2023;Schick等,2023;Qin等,2024b;Liu等,2024;Zhou等,2024;Xie等,2024;Jimenez等,2024;Yao等,2025;Lu等,2025;Patil等,2025)。近期工作也直接评估轨迹,包括问题定位、目标-计划-行动对齐和基于轨迹的合规性(Deshpande等,2025;Jia等,2026;Atf与Lewis,2025)。这些场景提供了流程证据,但证据不等于协议。轨迹可能冗长、看似合理或工具丰富,却仍然遗漏了必需的验证或遵循了不激活的分支。ContractEval 将轨迹视为观测图的证据,并仅在将工件条件化为查询激活义务后才对其评估;表1总结了这种差距。

表1:ContractEval 与相近评估族系的区别。一致性检查、层次任务网络与图匹配。ContractEval 借鉴了流程挖掘和一致性检查中的思想,其中事件日志与流程模型进行比较(van der Aalst,2016;Carmona等,2018),也借鉴了层次任务网络(Erol等,1994)和基于分配的图匹配(Kuhn,1955;Munkres,1957;Riesen与Bunke,2009)的思想。其技术设置有两点不同:首先,流程模型并非人工编写的形式化工作流,而是必须表示为语义义务的自然语言指令工件;其次,观测到的执行可能隐含在自然语言响应或噪声智能体轨迹中。ContractEval 通过构建基于查询条件化的预期图并将其与基于证据的观测行为相匹配,将一致性推理适应于此场景。

## 3问题设置

前述章节将流程评估框定为一个关于合法性的问题:行为是否满足使答案成立的义务?我们将其形式化为针对自然语言指令工件条件化的响应或轨迹的一致性评估。评估者接收工件A、查询q和观测行为O,必须确定O是否满足A为q激活的义务。仅看似合理是不够的:一个流畅甚至事实正确的结论,如果遗漏了必需检查、遵循了错误分支或在此过程中违反了不变式,仍然可能失败。

指令工件。工件A可以是提示、标准操作流程、策略、评分标准、基准指令或工作流描述。它可以指定操作、前提条件、决策、分支条件、拒绝、输出模式和全局约束。某些义务天然具有图结构,例如“批准前验证资格”。其他义务则是响应级别的,如隐私、不确定性、格式、非虚构或语气。ContractEval 在评估目标中保留这两类义务,但以不同方式表示其结构。

声明合同。我们将A中的静态义务表示为一个声明的层次任务网络:
GD = (VD, ED, HD, ID),其中VD包含语义义务,ED包含有向依赖边,HD是父级-子级层次结构,ID是全局不变式集合。每个节点记录一个语义类型、描述、必要性和来源证据范围。层次结构允许工件表达粗粒度任务和更细的子步骤,而无需强制每次评估都在一个固定粒度上进行。

基于查询的分母。GD中只有部分与特定查询相关。因此,ContractEval 诱导出一个预期图:
GE(q) = (VE, EE, HE, IE),通过保留激活的义务、其先决条件、必要的层次上下文和适用的不变式,同时剪枝不激活的分支。一致性的分母是GE(q),而非完整的声明合同。关键的是,GE(q)不是单一的规定执行轨迹。它是针对此查询具有规范性的语义义务的部分有序结构。一个有效的系统可以合并相邻步骤、使用不同措辞或提供更丰富的证据,只要所需的义务和依赖关系得到满足。明确的替代程序可以在匹配前表示为分支或等效义务集。例如,如果退款标准操作流程要求在批准前验证资格,那么GE(q)要求在批准分支之前有该检查的证据,而不是特定的措辞。

观测行为。对于观测到的响应或轨迹O,我们构建一个观测执行图:
GO = (VO, EO, HO),其节点是基于证据的行为,其边捕获观测到的排序或依赖关系。在神谕实验中,GO 源于经过审计的金标准执行和受控扰动。在可扩展实验中,GO 从响应或轨迹文本中提取。

一致性目标。然后评估询问GO是否可以与GE(q)对齐。对齐 M ⊆ VE × VO 将预期义务映射到观测证据,可能跨越层次任务网络的相邻层次。未匹配的必需预期节点对应遗漏;未匹配的观测节点对应冗余操作;被违反的预期边表示依赖或排序失败;不正确的分支选择或不变式违反则单独评分。下一节描述ContractEval如何构建这些对象并将对齐转化为诊断指标。

## 4ContractEval方法

ContractEval 将问题设置操作化为一个分阶段的评估流程(图1)。其设计分离了整体性评判常混淆的问题:工件声明了哪些义务,哪些义务对此查询被激活,以及观测行为提供了什么证据。

相似文章

Contract2Tool:学习前提与效果以实现可靠的工具增强型LLM代理

arXiv cs.AI

本文介绍了Contract2Tool,一个从工具元数据、文档和执行轨迹中自动推断轻量级工具契约(前提条件、效果、风险)的框架,为LLM代理实现可靠的因果工具过滤。实验表明,学习到的契约在下游多步骤代理任务中达到了接近黄金契约的性能,同时显著减少了token使用量。

Evaluating Rational Contracting in Natural Language

arXiv cs.AI

This paper presents ContractSim, a framework and evaluation suite for assessing LLM agents' ability to negotiate and execute natural-language contracts under uncertainty. It finds that current agents negotiate well under low uncertainty but often fail under high uncertainty and frequently violate contract terms for profit.

EarlyEval:通过早期结果预测实现更低成本的智能体评估

Hugging Face Daily Papers

EarlyEval引入了一个轻量级框架,通过中间行为预测LLM智能体的结果,以高准确率提前终止运行来降低评估成本。在SWE-bench Verified、TerminalBench和Toolathlon等基准测试中,它可以消除13%-26%的智能体步骤和最高44%的输入令牌。