ClaimReceipt:在代理评估中验证证据充分性和覆盖范围

arXiv cs.AI 论文

摘要

本文介绍了ClaimReceipt,一种与声明相关的收据规范和验证器,用于验证代理评估中的证据充分性和覆盖范围,并通过历史记录和前瞻性审计的实验进行验证。

arXiv:2609.01992v1 公告类型:新 摘要:代理评估面临两个不同的证据问题:报告的声明是否可以从保留的证据中重新计算(充分性),以及保留的记录是否覆盖了承诺的实验集(覆盖范围)。通用日志和哈希链接记录无法可靠地回答这些问题。我们引入了ClaimReceipt,一种与声明相关的收据规范和选择性验证器,它将类型化的交易证据绑定到签名的实验清单上,并针对每个声明返回PASS、INVALID或INCONCLUSIVE。我们在实现之前冻结了规范(SHA-256 18d109...b81)。在1,392个历史买家-卖家记录上,CR-2验证器重现了所有五个手动标记的审计判断,精确重放了600个确定性记录和792个生成后记录,在测试的消融中使13个声明的字段组中的每一个都是非冗余的,并在11/11个语义故障上返回预期结果,且误报为0/8。然后我们运行一个单独的前瞻性CR-3纪元:30个任务在推理前提交,终端收据被签名并链接,私有证据被加密以供审计员使用。完整证据产生覆盖和会计PASS;保留一个终端收据返回INCONCLUSIVE_COVERAGE,而保留所有私有开放保留覆盖和协议验证,但使经济声明不确定,完全匹配预注册的预测。收据instrumentation添加了0.021%的模型推理时间和每笔交易9.9 KB。规范可读性探测表明,我们自己冻结的规范对独立读者来说尚不明确。因此,声明验证既需要声明充分的证据,也需要一个承诺的宇宙,使遗漏变得可见。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:59

# 1 引言
来源:https://arxiv.org/html/2609.01992
\acmshorttitle

ClaimReceipt\acmshortauthorsZhu & Chang

ClaimReceipt:验证智能体评估中的证据充分性与覆盖度

Peiying Zhu\*Sidi Chang\*†\daggerpeiying@blossomai\.coschang@blossomai\.coBlossom AI美国加利福尼亚州旧金山Blossom AI Labs日本东京
摘要 智能体评估面临两个不同的证据问题:所报告的主张是否可从保留的证据中重新计算(*充分性*),以及保留的记录是否覆盖了承诺的实验集合(*覆盖度*)。通用日志和哈希链接的记录无法可靠地回答这两个问题。我们引入了ClaimReceipt,这是一种主张相对的收据规范和选择性验证器,它将类型化的交易证据绑定到签名的实验清单上,并为每个主张返回Pass(通过)、Invalid(无效)或Inconclusive(不确定)。我们在实现之前冻结了该规范(SHA\-256 18d109\.\.\.b81)。在1392条历史买卖记录上,CR\-2验证器复现了所有五个手动标记的审计结论,精确重放了600条确定性记录和792条生成后记录,在测试的消融实验中使13个声明的字段组中的每一个都是非冗余的,并在11/11个语义故障上返回了预期结果,且假阳性为0/8。然后我们运行了一个单独的、前瞻性的CR\-3阶段:30个分配在推理前被提交,终端收据被签名并链接,私有证据被加密以供审计员使用。完整的证据生成了覆盖度和会计Pass(通过);扣留一个终端收据会返回INCONCLUSIVE\_COVERAGE,而扣留所有私有开放信息则保留了覆盖度和协议验证,但使经济主张变得不确定,这完全符合预先注册的预测。收据仪器化仅增加了模型推理时间的0\.021%和每笔交易9\.9 KB。规范可读性探查表明,我们自己冻结的规范对于独立读者而言尚未完全明确。因此,主张验证既需要主张充分的证据,也需要一个承诺的宇宙,使得遗漏变得可见。

关键词:智能体评估,智能体验证,证据充分性,实验覆盖度,审计收据,构念效度,溯源,多智能体系统

11脚注:两位作者对这项研究贡献均等。22脚注:通讯作者。
## 1\. 引言

当一个智能体基准测试报告提示、脚手架、护栏或模型提高了性能时,随之而来的是两个问题。*充分性*询问该数值是否可以从保留的证据中正确重新计算。*覆盖度*询问这些记录是否是完整的承诺集合,而不是一个有利的子集。充分性防止诚实但易错的评估者;覆盖度也处理可能更愿意某些运行不被看到的操作者。最终的奖励、记录或通用签名日志可能保留了字节,但省略了私有状态、解析器输出、丢弃的尝试或预期的终端记录。

这个差距在交互式智能体系统中尤其尖锐。其测量结果是模型生成、隐藏环境状态、解析器、执行代码、重试规则和下游评分的共同产物。智能体基准测试已经面临巨大的运行间差异和协议敏感性\[7 (https://arxiv.org/html/2609.01992#bib.bib5), 10 (https://arxiv.org/html/2609.01992#bib.bib3)\]。在多智能体环境中,环境还决定了一个智能体可以学习什么以及另一个智能体可以采取哪些行动。因此,一个标量值在数值上可能正确,但其附加的因果解释可能无效。

先前的工作在智能体到智能体(A2A)商业模拟\[17 (https://arxiv.org/html/2609.01992#bib.bib18)\]中审计了这个问题。手动构念效度合同将问题分为四个:卖家是否实例化了预期激励(C1),实验组是否仅在干预上不同(C2),随机估计是否稳定(C3),以及结果会计是否完整(C4)。该审计阻止了一个有吸引力的策略主张:原始实验是Invalid(无效),因为各组使用了不同的报价协议,而受控重跑仍保持Inconclusive(不确定),因为激励有效性和生成稳定性未通过。该审计还建立了一个可识别性边界:如果一个证据抽象将具有不同主张真实性的执行映射到相同的保留记录,那么任何下游指标都无法恢复丢弃的区别。

本文给出了建设性的对应方案。ClaimReceipt询问平台必须保留什么才能使有限主张可重新计算,以及必须承诺什么才能使缺失的运行可被检测。对所有内容进行哈希是不够的。贡献在于一个类型化的证据模式、一个实验级清单、精确的会计语义和一个选择性决策程序。哈希、签名和防篡改链是标准的传输机制\[5 (https://arxiv.org/html/2609.01992#bib.bib7), 9 (https://arxiv.org/html/2609.01992#bib.bib9)\];它们无法决定哪些语义区分重要,也无法定义应生成收据的宇宙。

图1 (https://arxiv.org/html/2609.01992#S1.F1)展示了该设计。在前瞻性入站之前,一个清单承诺了总体、组定义、协议指纹、复制结构、估计器、阈值和覆盖策略。每个交易收据将该清单链接到一个分配、私有配置文件承诺、有序轨迹、原始和标准化的报价、选择器决策、精确的经济主张和工件摘要。参考验证器检查完整性和覆盖度,从适当的边界重放主张,并返回每个合同的裁决。它可能允许描述性报告,同时阻止因果策略主张。

我们的贡献是:
1.  (1)我们形式化了执行上相对于主张的证据充分性,定义了有限主张类,并提供了字段到主张的依赖矩阵。该模式通过构造对于该类是充分的,而非对于关于意图或外部真实性的任意主张。
2.  (2)验证器在CR\-2和CR\-3上执行选择性验证:它重新计算交易和批次主张,将Inconclusive(不确定)保留为一等输出,并增加了前瞻性清单、入站、加密开放、收据链和条件覆盖检查。
3.  3(3)在一个先前审计过的包含六个时代1392条收据的语料库上,验证器与5/5的手动裁决一致,精确重放了每个声明的交易主张,并报告了完整的4×64×6历史网格加上单独的前瞻性行,而不仅仅是标记的单元格。
4.  (4)字段消融、11个冻结故障和8个良性变化测试了模式语义;单独的30个交易前瞻性评估测试了完整、缺失终端和缺失私有证据的情况,并测得了开销。

前瞻性清单分配、协议、估计器智能体交易轨迹、报价、尝试主张收据公共 + 审计员证据选择性验证器Pass/Invalid/Inconclusive摘要和分配合同图1。ClaimReceipt将交易证据绑定到实验清单。传输完整性保护保留的字节;主张语义决定这些字节允许什么。
## 2\. 问题表述

### 2\.1\. 相对于主张的充分性

令τ\taube是一个完整的可接受执行,c⁡(τ)c(\\tau)是主张c的真值,φE(τ)\\phi\_{E}(τ)是字段集E保留的证据。我们称E对于c是*主张充分的*,当且仅当

(1)∀τ1,τ2:φE(τ1)=φE(τ2)⇒c⁡(τ1)=c⁡(τ2)\.\\forall\\tau\_{1},\\tau\_{2}:\\quad\\phi\_{E}(\\tau\_{1})=\\phi\_{E}(\\tau\_{2})\\Rightarrow c(\\tau\_{1})=c(\\tau\_{2})\.
这个定义是基于执行和主张真值的,而非验证器的输出。一个总是弃权的验证器无法使E=∅E=\\emptyset变得充分。相反,当所需证据缺失时,验证器不得替换报告的标量值;它必须拒绝或弃权。

充分性始终相对于一个主张类。版本0\.3支持八个交易主张——完成、买家剩余(BS)、卖家利润(SP)、福利(W)、最优比例、匹配质量,以及两个处理保真度主张——加上四个实验主张C1–C4。它不声称对于潜在意图、均衡、公平性、外部配置文件真实性或未承诺的交易是充分的。

覆盖度则是一个集合的属性:没有单个收据能显示每个承诺的分配都产生了终端记录。它需要一个实验清单和一个入站承诺,在观察到结果之前定义预期集合。

### 2\.2\. 运行交易语义

我们在可配置的买卖交易中实例化规范。买家配置文件θ\\theta为组件集S分配私有值,一个外部选择效用oθo\_{\\theta},以及硬约束。如果以价格p的报价被接受,

(2)BSθ(S,p)\\displaystyle\\mathrm{BS}\_{\\theta}(S,p)=Vθ(S)−p−oθ,\\displaystyle=V\_{\\theta}(S)\\-p\\-o\_{\\theta},
(3)SP⁡(S,p)\\displaystyle\\mathrm{SP}(S,p)=p−C⁡(S),\\displaystyle=p\\-C(S),
(4)Wθ(S)\\displaystyle W\_{\\theta}(S)=Vθ(S)−C⁡(S)−oθ=BS+SP\.\\displaystyle=V\_{\\theta}(S)\\-C(S)\\-o\_{\\theta}=\\mathrm{BS}\\+\\mathrm{SP}\.
被拒绝或失败的交易贡献为零。最优福利是Wθ⋆=max⁡(0,maxS⁡Wθ(S))W^{\\star}\_{\\theta}=\\max(0,\\max\_{S}W\_{\\theta}(S)),基于承诺的组件规则。最优主张是当W⋆>0W^{\\star}>0时的精确理性对(W,W⋆)(W,W^{\\star}),否则是类型化的空值;它不被截断,因为负福利记录了破坏。匹配质量也作为精确的分子分母对保留。

实验主张编码了先前的审计合同\[17 (https://arxiv.org/html/2609.01992#bib.bib18)\]:C1测试有序的卖家目标水平是否产生声明的定向响应;C2测试跨组协议隔离;C3测试随机稳定性,使用配置文件级配对,复制嵌套在配置文件条件单元格内;C4测试重放和完整会计。每个返回Pass(通过)、Invalid(无效)或Inconclusive(不确定)。

## 3\. ClaimReceipt 设计

### 3\.1\. 四个证据层

该规范分离了四个层,而通用的“审计日志”语言常常混淆它们。

1.  (1)传输完整性涵盖精确字节、序列号、链式链接和签名。它检测已提交证据的篡改。
2.  (2)语义证据(充分性)保留类型化的配置文件、轨迹、报价阶段、选择、目录和评分器输入,这些是重新计算主张所需的。
3.  (3)实验覆盖度将收据绑定到预期的分配矩阵和入站承诺,使提交入站后的遗漏变得可见。
4.  (4)外部真实性在系统之外。平台无法证明未观察到的交互发生过,或者合成的配置文件描述了真实的人。

这种区别防止将密码学误认为是构念效度。证书透明度和防篡改日志建立了宝贵的完整性属性\[9 (https://arxiv.org/html/2609.01992#bib.bib9), 3 (https://arxiv.org/html/2609.01992#bib.bib8)\];它们无法决定遗漏的私有配置文件是否使福利不确定。

### 3\.2\. 威胁模型和信任边界

传输机制处理L1字节篡改;语义重放和协议指纹处理L2构念漂移;前瞻性的入站和终端协调处理L3提交后的遗漏。L4保持开放:没有收据系统能检测到阻止交易到达见证者的事务,或虚假但内部一致的外部真实性配置文件。

表1。原型信任角色。分离是基于密钥和功能,而非组织主体:一个操作者控制所有三个本地角色。
### 3\.3\. 实验清单

C2和C3是批次属性,因此任何单个交易收据都无法确立它们。每个收据都引用一个实验清单,其中包含:有序的配置文件和条件集;完整的预期分配矩阵;复制和重试策略;处理标志;一个允许跨组变化的字段白名单;提示、模式、解析器、规范化器、执行器、选择器、评分器、模型分配和交互范围的协议指纹;以及分析合同,包括估计量、嵌套、配对、估计器、阈值、种子、抽取计数、输入顺序和区间约定。

当签名的清单早于提交的入站时,它充当密码学预注册。E1–E6是明确的回顾性导入:它们的清单是在运行后重建的,因此它们支持忠实的机械化,而非前瞻性确认。E7是单独且前瞻性的:其签名的分配矩阵和OpenTimestamps证明早于所有30个入站票据。

### 3\.4\. 交易收据与隐私

公共收据包含分配标识符、终端状态、清单和工件摘要、私有配置文件承诺、轨迹、报价和结果的语义摘要、精确的主张值和覆盖计数。审计员信封打开配置文件并保存有序的原始隐藏和可见事件、所有尝试、原始和已解析的报价、执行后的报价、选择器输入/输出、处理事件、报告的标量和工件引用。

低熵值如WTP不能安全地使用裸哈希。该规范将一个私有规范对象xx承诺为

(5)HMAC\-SHA256n(tag‖uint64be⁡(\|x\|)‖x),\\mathrm{HMAC\\mbox{\\-}SHA256}\_{n}\\bigl(\\texttt{tag}\\,\\\|\\,\\mathrm{uint64be}(\|x\|)\\,\\\|\\,x\\bigr),
其中n是一个全新的32字节秘密nonce,与加密的开放信息一起存储\[8 (https://arxiv.org/html/2609.01992#bib.bib10)\]。规范JSON遵循RFC 8785语义\[14 (https://arxiv.org/html/2609.01992#bib.bib11)\];模式声明的集合可以重排序,而记录和尝试顺序则不行。经济金额是缩放整数,聚合均值是(sum,count)(\\mathrm{sum},\\mathrm{count}),决策区间端点保留精度范围。如果决策边界与此范围相交,验证器将弃权。

这种架构暴露了一种张力:验证需要访问用于对实验评分的隐藏WTP和配置文件,而市场策略可能旨在将这些信息对卖家隐藏。因此,收据创建了一个审计员可见的加密证据存储,而不是公共记录。CR\-3实现了开放密钥分离,但授权、保留和删除仍然是治理义务。

### 3\.5\. 重放边界与裁决

重放主张有两个层次。对于确定性脚本卖家,重放从承诺的策略工件开始,一直到报价生成、规范化、买家选择和福利。对于LLM卖家,重放从记录的原始输出开始,一直到解析、执行、选择和评分。我们不声称另一次模型调用会重现相同的文本。

在C1–C4之前,验证器规范化并去重幂等交付,检查收据ID和链式链接,打开配置文件承诺,解析分配覆盖度,并保留重试顺序。然后它精确地重新计算所有交易主张。C2比较各组间声明的不变指纹。C1和C3在配置文件单元格内平均复制,然后进行配置文件级对比;生成行永远不会成为独立的买家。C4要求精确重放、BS\+SP=W\\mathrm{BS}\\+\\mathrm{SP}=W,以及完整的报告包。只有当所有四个标准通过且处理保真度被确立时,才允许因果策略主张。当C1或C3不确定但C2和C4通过时,描述性主张可能仍被允许。

## 4\. Im

相似文章

证据账本裁决:实现主张-证据可追溯性

arXiv cs.AI

本文介绍了证据账本裁决(evidence-ledger adjudication),一种用于AI辅助写作中主张-证据可追溯性的工作流,并在基于AVeriTeC、CLIMATE-FEVER和SciFact构建的盲测基准上进行了评估,结果表明基于智能体的方法优于基线方法。

EVE-Agent: 可验证证据的自我进化智能体

arXiv cs.AI

EVE-Agent 提出了一个自我进化搜索智能体框架,通过生成问题、答案和证据片段,并基于证据的边际准确性增益进行训练,确保证据可验证性。这提高了基于依据的正确性,且无需人工标注。

高風險醫療檢索增強生成的聲明選擇性認證

arXiv cs.CL

本文針對高風險醫療檢索增強生成(RAG)提出聲明選擇性認證,將響應分解為可驗證的聲明,並根據證據進行評分,通過意圖感知選擇器產生操作(完整、部分、衝突、棄權),實現了低無支持聲明風險和高操作準確性。