SciTrace: 面向科学发现代理的轨迹感知安全推理
摘要
介绍SciTrace框架,该框架通过安全内禀推理循环和组合工具链验证器,将安全推理融入科学代理流程的每一个阶段,在保持输出质量的同时实现了最先进的安全性。
arXiv:2606.08234v1 公告类型: 新
摘要: 基于LLM的科学代理已展现出自主研究的强大能力,但其安全层在结构上与核心推理相分离:它们检查流程输出,而非塑造产生输出的推理过程。这种分离导致了两种故障模式:一个阶段积累的安全信号在进入下一阶段前被丢弃,以及一系列单独无害的工具调用组合起来可能造成单步过滤器无法检测到的有害结果。为解决这些挑战,我们提出**SciTrace**框架,将安全推理编织进科学代理流程的每一个阶段。SciTrace结合了两种互补机制:**安全内禀推理循环**(SIR),通过联合任务与安全推理,在思考者、实验者、写作者和审核者阶段之间维持累积风险状态;以及**组合工具链验证器**(CTV),在执行前进行轨迹感知的安全检查,捕捉仅在多步工具序列中才会显现的风险。在涵盖六个科学领域的240项高风险研究任务和120项工具相关风险任务上的评估显示,SciTrace在四种骨干模型上均实现了比较框架中最先进的安全性能:它持续提升了工具调用安全性和对抗鲁棒性,同时保持了科学输出质量,并发现了单步监控漏检的**78.8%**的组合工具链逃逸。项目网站访问地址为 https://opensciagent.github.io/SciTrace/。
查看缓存全文
缓存时间: 2026/06/09 08:55
# SciTrace:面向科学发现代理的轨迹感知安全推理 来源:https://arxiv.org/html/2606.08234 Tanush Swaminathan¹,²,∗\*Runmin Jiang¹,∗\*,†\daggerLetian Zhang¹Min Xu¹, 🖂 ¹卡内基梅隆大学²艾伦研究所 ###### 摘要 基于LLM的科学代理在自主研究方面展现出了强大能力,然而其安全层在结构上与核心推理脱节:它们检查管道输出,而非塑造产生输出的决策过程。这种分离导致了两种故障模式:一个阶段累积的安全信号在进入下一阶段前被丢弃;一系列单独无害的工具调用可能组合成单步过滤器无法检测的有害结果。为了应对这些挑战,我们引入了**SciTrace**,一个将安全推理编织进科学代理管道每一阶段的框架。SciTrace结合了两种互补机制:**安全内在推理循环(SIR)**,通过联合任务与安全推理,在思考者、实验者、写作者和审阅者阶段之间维护累积风险状态;**组合工具链验证器(CTV)**,执行前进行轨迹感知安全检查,捕获仅在多步工具序列中显现的风险。在跨越六个科学领域的240个高风险研究任务和120个工具相关风险任务上的评估表明,SciTrace在四个骨干模型上均达到了最先进技术水平(SOTA)安全性能:它持续提升了工具调用安全性和对抗鲁棒性,同时保持了科学输出质量,并发现了78.8%的单步监控器遗漏的组合工具链逃逸。项目网站访问地址为https://opensciagent.github.io/SciTrace/。 --- SciTrace: 面向科学发现代理的轨迹感知安全推理 Tanush Swaminathan¹,²,∗\*Runmin Jiang¹,∗\*,†\daggerLetian Zhang¹Min Xu¹, 🖂¹卡内基梅隆大学²艾伦研究所 ††footnotetext:∗\*共同第一作者,均保留列名首选权利。†\dagger项目负责人。🖂通讯作者。## 1 引言 利用LLM代理实现科学发现自动化的进展迅猛(Lu等人,2024 (https://arxiv.org/html/2606.08234#bib.bib1);Si等人,2025 (https://arxiv.org/html/2606.08234#bib.bib2);Weng等人,2025 (https://arxiv.org/html/2606.08234#bib.bib4))。诸如SafeScientist(Zhu等人,2025 (https://arxiv.org/html/2606.08234#bib.bib9))之类的框架,现已通过专业代理角色和外部工具调用的链条编排多阶段研究管道(构想、实验、写作和评审)。这引入了严重的安全风险:一个能够设计实验、调用实验室API并起草出版物的自主代理,同样可以大规模产生双重用途协议、危险合成路线或虚假信息(Urbina等人,2022 (https://arxiv.org/html/2606.08234#bib.bib27);Hendrycks等人,2023 (https://arxiv.org/html/2606.08234#bib.bib28))。 参见图注 图1:轨迹感知安全推理。SciTrace使安全成为管道的内在属性:它将累积风险状态跨阶段传播,并在执行前验证整个工具轨迹。相比之下,SafeScientist将安全视为阶段局部过滤器,因此在思考者阶段标记的双重用途风险会被本地缓冲,从不传播,导致实验者阶段在缺乏上下文的情况下继续进行,从而产生可武器化的输出。SciTrace则通过安全内在推理循环(SIR)使早期S2(双重用途生物学)警告下游保持激活,同时其组合工具链验证器(CTV)在执行前拦截危险工具序列,将代理引导至安全替代方案(M. smegmatis),同时保持研究质量。参见图注图2:SciTrace管道概览。完整管道运行的六个组件:(1)SIR模块执行联合任务与安全推理并更新累积风险状态;(2)经过SIR增强的实验者阶段评估工具和协议安全性;(3)验证工具代理拦截每个工具调用以供CTV评分;(4)TS-Flow反馈在调用被标记时生成安全替代方案;(5)写作者阶段在SIR监督下起草输出;(6)审阅者阶段进行最终伦理评估,拥有完整的累积风险可见性。 现有防御将安全视为应用于管道输出的过滤器。SafeScientist(Zhu等人,2025 (https://arxiv.org/html/2606.08234#bib.bib9))增加了四个独立的安全层,每个层运行时不了解其他阶段所做的决策。这种架构有两个弱点。首先,风险信号是阶段局部的:思考者阶段提示监控器标记的危险研究方向不会传递给实验者或写作者,后者在没有该上下文的情况下继续进行。其次,单步监控无法检测**组合风险**。检索病原体基因组序列的请求,随后是查询抗生素耐药性数据库的请求,每个请求可能单独通过单步过滤器,但该轨迹指向双重用途合成研究(参见第4.5节 (https://arxiv.org/html/2606.08234#S4.SS5))。图1 (https://arxiv.org/html/2606.08234#S1.F1) 说明了这一点。 参见图注 图3:SciTrace详细架构。对抗性提示和SciSafetyBench任务进入管道,并通过四个阶段——思考者、实验者、写作者和审阅者——进行处理,每个阶段都通过**安全内在推理循环(SIR)**增强。在每个阶段转换时,SIR对(1)当前阶段的任务内容、(2)从共享安全记忆中检索的安全检查,以及(3)一个携带所有先前风险信号并防止警告在阶段间静默丢弃的累积风险状态,执行联合任务与安全推理。提出的工具调用被**组合工具链验证器(CTV)**拦截,该验证器在每次调用执行前从三个维度(请求危害性、组合风险、工具调用安全性)进行评分。当调用被标记时,**TS-Flow**反馈会生成具体的替代安全方案,而不是发出硬性停止命令。所有CTV信号都被写回累积风险状态。 我们引入了**SciTrace**,一个使安全**内置于**科学代理推理过程,而非外置于该过程的框架。SciTrace用两个紧密耦合的组件增强了SafeScientist管道。**安全内在推理循环(SIR)**在管道每个阶段执行联合任务与安全推理,并维护一个跨阶段传播安全信号的累积风险状态,使得思考者阶段提出的警告能够被实验者和写作者可见。**组合工具链验证器(CTV)**在每次提出的工具调用的上下文中,结合完整调用历史进行审查。图2 (https://arxiv.org/html/2606.08234#S1.F2) 展示了SciTrace管道。我们的贡献如下: - •**SciTrace框架**:一种面向科学LLM代理的内在安全架构,通过联合任务与安全推理将累积风险状态传播到所有管道阶段。 - •**安全内在推理循环(SIR)**:一个阶段感知推理模块,具有五个分级风险级别和基于记忆的安全检查检索,取代了每个阶段独立的过滤器。 - •**组合工具链验证器(CTV)**:一个轨迹感知验证器,在工具执行前执行三子任务安全分析,并发出纠正性反馈(TS-Flow)以将代理引向安全的替代方案,捕获多步工具序列中出现的风险。 在包含240个跨六个领域的高风险科学任务和30个专业工具的SciSafetyBench(Zhu等人,2025 (https://arxiv.org/html/2606.08234#bib.bib9))上评估显示,SciTrace在工具调用安全率上平均比SafeScientist提高了14.3个百分点(pp),对抗性拒绝率平均提高了24.7个百分点。 ## 2 相关工作 ### 2.1 LLM安全 通过人类反馈的强化学习(RLHF)(Bai等人,2022a (https://arxiv.org/html/2606.08234#bib.bib19))和宪法AI(Bai等人,2022b (https://arxiv.org/html/2606.08234#bib.bib20))在训练阶段注入安全偏好,已实现对LLM与人类价值观和安全约束的对齐。诸如LLaMA Guard(Inan等人,2023 (https://arxiv.org/html/2606.08234#bib.bib21))的输入输出分类器通过将安全检查视为令牌分类任务提供轻量级运行时筛选。红队方法(Perez等人,2022 (https://arxiv.org/html/2606.08234#bib.bib22);Zou等人,2023 (https://arxiv.org/html/2606.08234#bib.bib23))通过对抗性探测策略违规来暴露故障模式。这些技术针对短上下文场景,并未涉及多阶段代理管道,其中安全相关上下文在许多LLM调用间累积。 ### 2.2 LLM代理安全 随着LLM代理获得工具使用和记忆能力,安全问题从单个模型输出扩展到动作序列和与环境交互。AGrail(Luo等人,2025 (https://arxiv.org/html/2606.08234#bib.bib10))通过一个记忆支持的“分析器-执行器”循环引入自适应护栏,该循环从过往交互中检索并优化安全检查。ToolSafe(Mou等人,2026 (https://arxiv.org/html/2606.08234#bib.bib11))提出TS-Guard,一个评估请求危害性、攻击相关性以及工具调用安全性的三子任务验证器,以及TS-Flow,一个反馈驱动的纠正机制。我们的工作将AGrail基于记忆的检查生成和ToolSafe的轨迹感知验证改编到科学代理场景。据我们所知,先前工作尚未明确研究AI科学家管道中结构化的跨阶段安全状态传播。 ### 2.3 AI科学家 AI科学家(Lu等人,2024 (https://arxiv.org/html/2606.08234#bib.bib1))展示了利用GPT-4进行端到端自主研究生成的能力,包括产生创意、实验和论文草稿。后续框架(Si等人,2025 (https://arxiv.org/html/2606.08234#bib.bib2);Weng等人,2025 (https://arxiv.org/html/2606.08234#bib.bib4);Yuan等人,2025 (https://arxiv.org/html/2606.08234#bib.bib3))将覆盖范围扩展到文献综合和超参数搜索。SafeScientist(Zhu等人,2025 (https://arxiv.org/html/2606.08234#bib.bib9))是首个系统性地解决AI科学家管道安全问题的框架,引入了四种防御机制和SciSafetyBench。我们直接在SafeScientist的管道和基准上构建内在安全推理。 ## 3 SciTrace ### 3.1 框架概览 SciTrace通过两个紧密耦合的组件,将安全推理直接集成到四阶段科学发现管道中,这两个组件在管道运行期间共享一个统一的**累积风险状态**:**安全内在推理循环(SIR)**,在每个阶段转换时运行,并联合推理任务内容和所有先前的风险信号;以及**组合工具链验证器(CTV)**,在执行前拦截每个即将发出的工具调用。图3 (https://arxiv.org/html/2606.08234#S1.F3) 展示了详细架构。 表1:安全框架比较。**跨阶段上下文**:风险信号跨阶段传播。**组合风险**:检测危险的合成多步工具轨迹。**非二元风险**:超越阻止/允许的分级风险级别。**记忆感知**:检索先前的安全检查。**反馈生成**:纠正性指导而非硬性停止。**科学领域**:专为科学发现管道设计。SciTrace是唯一满足所有六项属性的框架。 底层的SafeScientist管道包含四个阶段:1) 思考者(创意生成和多代理讨论),2) 实验者(代码生成和工具使用),3) 写作者(起草论文),以及4) 审阅者(伦理和科学评审)。在SciTrace中,SIR和CTV在每个阶段转换和工具调用时承担安全决策的主要责任;SafeScientist原有的每阶段过滤器和工具监控器仅作为错误处理的后备,当内在安全推理激活时,其被取代。 SciTrace推理使用五个分级风险级别,而非二元阻止/允许决策:**安全**、**低风险**、**警告**、**高风险**和**阻止**。累积风险状态跟踪所有信号的整体级别,并应用交互升级:当某些类别配对(如双重用途与危险合成)同时出现时,整体级别会额外提升一级。 ### 3.2 安全内在推理循环(SIR) SIR用联合任务与安全推理取代了阶段级别的独立过滤。在每个阶段,它使用结构化模板提示代理LLM,呈现三个输入:(1) 当前阶段的任务内容,(2) 来自所有先前信号的累积风险状态,以及(3) 从**安全记忆**模块检索的安全检查。LLM返回一个风险级别、一个自然语言描述以及一个推荐操作(*直接继续*、*修改*、*标记*或*阻止*)。 **阶段特定推理**。每个阶段接收一个定制的提示,突出其最相关的风险:思考者阶段的潜在双重用途、实验者阶段的工具和协议安全、写作者阶段的信息泄露,以及在审阅者阶段进行具有完整信号可见性的最终伦理评估。 **记忆感知检查生成**。遵循AGrail(Luo等人,2025 (https://arxiv.org/html/2606.08234#bib.bib10)),SIR存储过去的安全检查模板,这些模板以泛化的动作描述为键,并通过关键词重叠检索k个最近邻检查,从而实现在会话内基于经验进行精炼。 **累积状态传播**。每个评估都被记录为共享累积状态中的一个风险信号。整体级别是所有信号的最大值,并受高交互类别配对同时出现时的交互升级影响。 ### 3.3 组合工具链验证器(CTV) CTV通过经过验证的工具代理在执行前拦截每个工具调用。它在完整轨迹的上下文中判断每个调用,捕获仅在单独无害的操作序列中出现的危险。在单个LLM调用中,CTV评估三个维度,将ToolSafe的TS-Guard(Mou等人,2026 (https://arxiv.org/html/2606.08234#bib.bib11))改编到科学场景,通过用组合风险维度替换攻击相关性维度。以下是CTV轨迹过程的示例: 1. 请求危害性:底层研究请求是否本质上具有危害性。 2. 组合风险:提出的调用,结合完整调用历史,是否构成危险轨迹(在我们的风险分类学中针对组合危险)。 3. 工具调用安全性:该特定调用本身是否安全。 表2:跨骨干模型的安全与质量比较。SciTrace在所有四个模型上持续改进安全评分、拒绝率和工具调用安全率,同时保持科学输出质量。较高值(↑)更优。 这些判断合并为一个单一风险评分,该评分被映射为三个操作之一:允许、修改或阻止。评分函数和阈值选择的细节见附录A (https://arxiv.org/html/2606.08234#A1),完整的灵敏度分析见附录D (https://arxiv.org/html/2606.08234#A4)。当调用被修改或阻止时,第二次LLM调用会生成建设性替代方案(TS-Flow反馈),将代理引导至有效的科学路径,而不仅仅是终止。所有CTV信号都被写回共享的累积风险状态。 **风险分类学**。CTV 操作于
相似文章
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
VeryTrace:通过可编译形式化与结构化验证来验证推理轨迹
VeryTrace 是一种零样本验证与修复框架,它将大语言模型的推理轨迹通过领域特定语言形式化为可编译表示,从而通过确定性检查与大语言模型审计的混合方式实现步骤级错误定位。该框架在数学、机器人学和关系推理等多个领域提升了准确性,且无需领域特定训练。
TraceGraph:用于诊断和改进智能体轨迹的共享决策景观
TraceGraph是一个基于图的框架,它从多模型智能体轨迹中构建共享决策景观,从而能够诊断故障区域并通过陷阱感知恢复流水线进行改进。
TRACE:面向可审计代理承诺的操作推理模式
本文介绍了TRACE(Typed Reasoning And Commitment Evidence,类型化推理与承诺证据),这是一种带类型和版本号的模式,用于记录代理系统中的推理轨迹,以实现可审计性并提升推理质量。文中定义了参考写入器、测量机制和消费者契约,并通过两个实例说明了该方法。