面向自主科学代理的以工件为中心的主张感知可观测性

arXiv cs.CL 论文

摘要

本文提出了一种针对自主科学代理的主张感知可观测性框架,强调工件沿袭和审计关系,以提高科学工作流程的透明度和错误检测能力。

arXiv:2608.18312v1 公告类型:新 摘要:自主科学代理现在越来越多地提出想法、编写代码、运行实验、分析结果,甚至起草论文。观察和审计这些代理是必要的,但仅记录每次模型调用是不够的;科学家还需要检查系统产生的工件和主张及其关系。这是由于科学代理系统的故障往往分布在多个对象中。一篇手稿的主张可能引用错误的证据,搜索过程可能选择退化的候选方案,实验室新颖性主张可能依赖于未说明的规则,或多个代理计划可能在没有明显触发因素的情况下改变。现有的跟踪、实验跟踪和归档来源工具很有价值,但它们的固有对象并未使这些科学审计关系成为一等公民。我们认为,自主科学系统应发出可移植的、主张感知的工件沿袭,作为最小审计层。我们提出一个紧凑的可观测性框架,围绕个体、操作符、适应度记录、沿袭、归档、运行、流和引导命令组织。在此框架中,科学主张是普通的个体,具有明确的证据绑定和验证记录。该框架旨在作为补充当前遥测和来源标准的语义层。执行细节可以保留在OpenTelemetry中。最终包可以导出到PROV-O或RO-Crate标准。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:08

# 以制品为中心的声明感知可观测性:面向自主科学智能体
来源:https://arxiv.org/html/2608.18312
政府许可

提交的稿件由阿贡国家实验室(“阿贡”)的运营方芝加哥阿贡有限责任公司创建。阿贡是美国能源部科学办公室实验室,在合同编号DE-AC02-06CH11357下运营。美国政府为自身及代表其行事的其他方保留该文章的已支付、非独占、不可撤销的全球许可,可复制、准备衍生作品、向公众分发副本,以及由政府或代表政府公开表演和公开展示。能源部将根据《能源部公共访问计划》公开提供这些联邦资助研究的结果。http://energy.gov/downloads/doe-public-access-plan

明杜,迈克尔·H·普林斯,马修·J·丘鲁卡拉
阿贡国家实验室先进光子源,美国伊利诺伊州莱蒙特
机构:[email protected]; [email protected]
\[0.75em\] 被2026年语言建模会议(COLM)的LM4Sci研讨会接收

###### 摘要

自主科学智能体现在越来越多地提出想法、编写代码、运行实验、分析结果,甚至起草论文。观察和审计这些智能体是必要的,但仅仅记录每一次模型调用还不够,科学家还需要检查系统生成的制品和声明及其相互关系。这源于一个事实:科学智能体系统中的故障通常分布于多个对象之间。手稿中的一个声明可能引用了错误的证据,搜索过程可能选择了退化的候选方案,一个实验室新颖性声明可能依赖于未说明的规则,或者一个多智能体计划可能在没有明显触发因素的情况下发生了改变。现有的追踪、实验跟踪和归档溯源工具很有价值,但其原生对象并未将这些科学审计关系视为一等公民。我们认为,自主科学系统应发出可移植的、声明感知的制品谱系作为最小审计层。我们提出了一个围绕个体、算子、适应度记录、谱系、归档、运行、流和引导命令组织的紧凑可观测性配置文件。在该配置文件中,科学声明是具有明确证据绑定和验证记录的普通个体。该配置文件旨在作为一个语义层,补充当前的遥测和溯源标准。执行细节可保留在OpenTelemetry中。最终包可导出为PROV-O或RO-Crate标准。

## 1 审计单元是制品

自主科学智能体正从回答问题的助手,向帮助执行研究工作流的系统转变。最近的系统表明,它们可以自动化论文写作流程、对研究想法进行智能体化树搜索、为实验生成代码、进行文献综合、规划实验室,并实现闭环化学或材料工作流(12 (https://arxiv.org/html/2608.18312#bib.bib16);25 (https://arxiv.org/html/2608.18312#bib.bib1);18 (https://arxiv.org/html/2608.18312#bib.bib17);17 (https://arxiv.org/html/2608.18312#bib.bib18);14 (https://arxiv.org/html/2608.18312#bib.bib19);4 (https://arxiv.org/html/2608.18312#bib.bib21);5 (https://arxiv.org/html/2608.18312#bib.bib22);20 (https://arxiv.org/html/2608.18312#bib.bib23))。这种转变改变了观察科学计算系统的含义。记录提示词、补全、工具调用和时间戳的日志是必要的,但还不够。科学家还需要知道智能体产生了哪个制品,哪些早期的制品导致了它,哪些证据支持每个声明,哪个评估器接受或拒绝了它,以及哪个分支或人类干预改变了轨迹。

我们认为,自主科学智能体系统应将制品谱系和声明-证据绑定作为一等可观测性记录。跨度树和运行日志不应是唯一的可移植审计跟踪。科学智能体的最小跟踪应包括候选制品、派生它们的算子、附加到这些制品的评估器输出、归档或选择决策、人类引导事件,以及表示为具有证据绑定的可检查制品的声明。

这种区分很重要,因为科学智能体最具破坏性的故障通常并非局限于单个模型/工具调用。对自动化研究产生的手稿的审计报告了编码错误、虚构或内部不一致的数值结果,以及格式错误或不受支持的声明(2 (https://arxiv.org/html/2608.18312#bib.bib2);24 (https://arxiv.org/html/2608.18312#bib.bib24))。在自主材料合成系统中,新颖性和产率声明在系统完成其循环后需要后续纠正或质疑(21 (https://arxiv.org/html/2608.18312#bib.bib3);10 (https://arxiv.org/html/2608.18312#bib.bib4);22 (https://arxiv.org/html/2608.18312#bib.bib5))。此类情况需要将声明与证据、评估者和谱系联系起来的审计跟踪。跨度树可以告诉我们发生了哪些调用。它本身无法识别科学声明、将声明与测量绑定,或显示后续草稿重用了无效结果。

图1:可观测性转变。运行时跨度记录嵌套调用和计时。声明感知的制品可观测性记录候选制品、派生它们的算子、评估器输出、归档决策和声明的证据链接。图1 (https://arxiv.org/html/2608.18312#S1.F1)总结了这种转变。左侧类似于传统跟踪:调用的有序树。右侧显示了科学检查单元:制品、谱系、评估和证据。我们的提议不是取代跟踪、实验跟踪或归档溯源,而是添加缺失的语义层,使自主研究系统能够在运行时回答科学审计问题,并在之后编译更丰富的归档包。

## 2 为什么当前基础设施可能遗漏科学审计对象

当前基础设施提供了几种部分视图。针对LLM应用的跟踪系统记录跨度:提示词、补全、工具调用、延迟、令牌计数和嵌套调用结构(7 (https://arxiv.org/html/2608.18312#bib.bib7);8 (https://arxiv.org/html/2608.18312#bib.bib8);1 (https://arxiv.org/html/2608.18312#bib.bib9);23 (https://arxiv.org/html/2608.18312#bib.bib11))。实验跟踪器记录运行、参数、指标、制品,有时也记录模型谱系(13 (https://arxiv.org/html/2608.18312#bib.bib10);23 (https://arxiv.org/html/2608.18312#bib.bib11))。溯源和研究对象标准,如W3C PROV-O、PROV-DM和RO-Crate,记录实体、活动、代理、派生关系和捆绑的研究制品,以便后续共享和重现性(9 (https://arxiv.org/html/2608.18312#bib.bib12);3 (https://arxiv.org/html/2608.18312#bib.bib15);19 (https://arxiv.org/html/2608.18312#bib.bib13))。用于代码和数据的版本控制系统,如git、git-LFS和DVC,将谱系跟踪为具有分支和合并结构的、基于内容寻址的提交图(6 (https://arxiv.org/html/2608.18312#bib.bib25))。这些工具是有用的、成熟的,应该被重用。

差距在于主要单元不匹配。一个以跨度为中心的系统会问:“下一个发生的调用是哪个?”一个实验跟踪器会问:“哪个运行产生了这个指标?”一个归档包会问:“这个最终对象是如何派生的?”一个版本控制系统会问:“这两个文件树之间改变了哪些行?”而审计自主系统的科学家会问不同的问题:哪个候选方案包含这个声明?它读取了哪些证据?哪个评估器接受了它?哪个分支选择了它?这些关系可以编码在标签、元数据、文件路径或提交消息中,但约定是局部且脆弱的。两个团队都可以记录每次模型调用,但仍然无法交换能回答相同声明查询的跟踪记录。

三个审计场景说明了这个问题。首先,一个撰写论文的智能体可能报告一个与实验日志矛盾的数值改进。审计对象不是写那个句子的提示词。它是声明、它引用的证据制品、提取的值和验证结果。其次,一个进化或树搜索系统在表现改善时,可能其种群已坍缩为利用基准测试漏洞的近乎重复的方案。审计对象是候选种群的谱系和适应度,而不是任何单一的模型补全。第三,一个闭环实验室可能发出延迟的物理测量、样本标识符、仪器文件和操作员批准。审计对象跨越软件决策和物理证据,可能无法与同步调用边界对齐。

元数据约定不足以用于科学审查。父程序ID可以存储为跨度属性、提交消息中的令牌、数据库行或文件名。声明的证据可以存储为引用字符串、笔记本路径、检索片段或表格坐标。所有这些在单个实验室内部都是可行的。但它们都无法为审查者、基准测试或下游归档提供一种简单且可移植的方式来提出常见的审计问题:显示所有无支持的声明,将结果追溯到其证据,找到人类干预改变了计划的分支,或列出后来在手稿中被重用的归档成员。

## 3 审计问题揭示了可观测性要求

声明感知的制品可观测性始于科学家、审查者和安全监控员需要提出的问题。这些问题混合了不同的关系类型。有些询问溯源,例如哪个父制品产生了一个子制品。有些询问认知支持,例如哪个测量或文献项目支持一个声明。有些询问控制历史,例如哪个人类指令或自动化策略改变了搜索。可观测性契约应将这些关系区分开来,而不是将它们压缩成一个通用的依赖边。

表1:源自科学审计问题的设计要求。该配置文件将派生、证据、评估和引导分开,因为每一类都支持不同类型的审查。表1 (https://arxiv.org/html/2608.18312#S3.T1)也解释了为什么简单的文件溯源是不够的。一个生成的句子可以从草稿派生,而不一定得到其提到的数据的支持。一个代码候选方案可能源自一个强大的父方案,而其报告的分数来自一个不稳定的评估器。一个计划修订可能在因果上是一个人类指令的下游,但仍然未能保留用户预期的约束。因此,可查询性模式必须将派生、证据、适应度和引导表示为可单独查询的事实。

当审查者评估科学智能体的输出时,这一点最为重要。审查者可能不需要重放整个运行过程。他们可能需要检查一些高风险声明:数值比较、新颖性断言、安全相关的实验决策,或可能是虚构的文献声明。一种暴露这些对象的跟踪格式使审查变得有针对性而非取证式的。审查者无需阅读成千上万的跨度,而是可以询问所有缺少证据的最终声明、所有没有独立评估器的被接受候选方案,或所有在干预后做出的归档决策。

## 4 声明感知的可观测事件跟踪配置文件

跟踪是一个仅追加的事件日志。派生视图(当前归档成员、最佳谱系路径、评估器仪表板、声明图和工作者利用率)是从事件跟踪序列计算得出的。这种设计避免将最新的仪表板状态视为科学记录。如果系统从归档中移除了一个候选方案、修订了一个声明或改变了计划,那么导致改变的事件仍然是可检查的。

提出的配置文件包含五个科学抽象和三个结构性记录。一个**个体**是正在检查的任何候选制品:程序、手稿草稿、表格、方案、计划、样本、分子、图表、声明或智能体版本。一个**算子**是一个事件,它从零个或多个父个体派生一个或多个子个体,或对现有记录执行操作。一个**适应度记录**是附加到特定个体的评估器输出:标量分数、通过/失败结果、结构化审查、证明检查状态、湿实验室测量、新颖性分类或声明验证判断。**谱系**是由算子诱导的父子图。一个**归档**是可选的策展集,例如精英集、帕累托前沿、接受的声明集、保留的样本列表或MAP-Elites网格。三个结构性记录完善了配置文件。一个**运行**框架化一个自主过程。一个**流**标识一个工作者、智能体角色、仪器、工具子系统或人类接口。一个**引导命令**记录一次人类或外部干预,并在应用时链接到改变运行的算子。

该配置文件刻意保持精简(附录A (https://arxiv.org/html/2608.18312#A1)给出了事件契约和结构不变式)。它没有规定如何存储显微镜图像、衍射图样、分子图、证明对象、代码库或手稿。相反,它要求每个领域有效负载都可通过引用和哈希寻址,每个科学相关的转换都表示为对个体的操作。结果是一个可移植的查询表面:尽管有效负载是领域特定的,但亲子关系、证据、评估、选择和干预具有稳定的含义。

### 4.1 声明作为个体

科学智能体可观测性的一个核心要求是声明检查。生成的论文、报告或实验室笔记带有一种特殊的风险:不受支持的声明可能看起来很精致,并通过下游审查,即使它们是错误的。因此,我们将科学声明视为一个普通的个体,而不是嵌入手稿内部的特殊注释。一个声明个体具有文本或结构化内容、证据引用、可选的证据绑定,以及验证者产生的适应度记录。

证据引用列出声明指向的制品:测量、表格、代码输出、文献项目、人类审阅者笔记、仪器文件或先前的声明。证据绑定可选地记录证据的使用方式:读取了哪个字段、提取了哪个值、进行了什么比较,以及为什么该证据支持或削弱了该声明。然后验证者发出一个适应度记录,例如**支持的**、**不支持的**、**矛盾的**或**需要人工审查**。后续的手稿草稿通过普通的算子继承、修订或拒绝声明个体。

这种设计使得论文写作中的故障变得可查询。审查者或算子可以询问最终草稿中所有证据不存在、提取值与引用指标不同,或其验证者失败的声明。它还避免了为声明溯源建立单独的系统。声明可以被选择进入归档,被新证据取代,或追溯到早期的草稿,就像其他制品一样。因为声明验证可能是部分的,该配置文件不假设存在完美的验证者。它只是使验证目标和结果变得明确。

一个声明个体不是真理的保证。它是一个用于审查的稳定句柄。验证者可以是自动脚本、检索增强的检查器、领域模型、定理证明器、人类审阅者或后续的实验室测量。重要的不变式是,声明、其证据和验证结果仍然是可单独识别的。这允许后续系统在不重写历史的情况下使一个声明无效。旧的声明保留在日志中,一个新的适应度记录捕获了矛盾,而一个修订算子可以产生一个修正。

相似文章

大多数智能体可观测性感觉像是崩溃录像

Reddit r/AI_Agents

作者认为,当前的智能体可观测性提供了行动轨迹,但缺乏运行时对行动为何被允许的合理性说明,这对于涉及金钱、数据或通信的生产部署至关重要。

DocOps: 面向复杂文档操作中自主智能体的可验证基准

Hugging Face Daily Papers

本文介绍了DocOps,这是一个确定可验证的基准,用于评估自主智能体在复杂文档操作上的表现,揭示了关键失败模式,如长期状态跟踪崩溃、浅层语义验证以及对结构元数据的破坏性编辑。

对自动化工作流中代理失调的冷静审视

arXiv cs.AI

本文研究了自动化工作流中的多代理系统中的代理失调问题,提出了代理证据归因(Agentic Evidence Attribution, AEA)方法,利用上下文特定的证据纠正代理行为的不对齐。