@omarsar0: // 代理并非单独失败 // 一款非常棒的开源评估工具,用于检查代理的可靠性。里面有很多酷点子。…
摘要
本文介绍了ProofAgent-Harness,这是一款开源评估工具,从七个标准衡量AI代理的上下文工程质量,并将其验证为代理可靠性的领先指标。
查看缓存全文
缓存时间: 2026/07/20 13:26
// 智能体并非独自失败 //
一个非常棒的开源评估工具,用于检查智能体可靠性。
里面有很多很酷的想法。
(收藏它)
问题是什么?
上下文工程已成为构建可靠智能体的核心,但它几乎完全未被度量。
指令、工具、记忆、检索到的知识、安全护栏以及不受信任的输入,所有这些都会累积在上下文中;当上下文变得薄弱时,智能体就会出现偏差、产生幻觉、误用工具、易受注入攻击并浪费Token。
这项工作验证了上下文工程质量作为智能体可靠性的独立先行指标。该度量实现在ProofAgent-Harness中,这是一个开源基础设施,通过多评审员共识对上下文进行评分,涵盖七个标准:角色清晰度、安全护栏覆盖、指令一致性、工具模式质量、接地充分性、注入防护和Token效率。
上下文得分与行为指标和发布决策相隔离,因此预测不会混入其中。固定前沿LLM智能体,仅改变其运行上下文,每个标准都能预测其匹配的结果。
为什么您需要考虑进行这些检查:
接地充分性预测抗幻觉能力。 安全护栏覆盖预测抗操纵能力。 工具模式质量预测工具使用。
论文:https://arxiv.org/abs/2607.14275
在我们的学院中学习如何构建有效的AI智能体:https://academy.dair.ai
AI智能体并非独自失败:上下文先行失守
来源:https://arxiv.org/html/2607.14275
摘要
上下文工程已成为构建可靠AI智能体的核心,但它仍然几乎完全未被度量。智能体并非孤立失败:它们的行为受到指令、工具、记忆、检索到的知识、安全护栏以及积累在上下文中的不受信任输入的影响。当上下文薄弱时,智能体会偏离轨道、产生幻觉、误用工具、忽略约束、易受注入攻击并浪费Token。
本文验证了上下文工程质量作为智能体可靠性的独立先行指标。我们将该度量实现在ProofAgent-Harness111https://github.com/ProofAgent-ai/proofagent-harness中,这是一个用于AI智能体评估的开源基础设施,采用多评审员、基于共识的评分方式。该框架从七个标准评估上下文:角色清晰度、安全护栏覆盖、指令一致性、工具模式质量、接地充分性、注入防护和Token效率。关键的是,上下文得分与行为指标和发布决策相隔离,从而实现非循环验证。
通过一项受控的上下文质量研究(在受监管的智能体领域进行,固定模型不变,仅改变上下文),我们展示了上下文质量标准能够一致地预测其对应的行为结果。接地预测抗幻觉能力,安全护栏预测抗操纵能力,指令一致性预测指令遵循,工具模式质量预测工具使用。这些发现确立了上下文度量作为智能体可靠性的有效预检信号,并将上下文工程定位为智能体评估和治理中的一个可审计层次。
目录
- 1引言 (https://arxiv.org/html/2607.14275#S1)
- 2背景:从提示工程到上下文工程 (https://arxiv.org/html/2607.14275#S2)1. 2.1从提示设计到上下文设计 (https://arxiv.org/html/2607.14275#S2.SS1) 2. 2.2上下文工程技术分类 (https://arxiv.org/html/2607.14275#S2.SS2)1. 2.2.1指令脚手架 (https://arxiv.org/html/2607.14275#S2.SS2.SSS1) 2. 2.2.2接地与检索 (https://arxiv.org/html/2607.14275#S2.SS2.SSS2) 3. 2.2.3工具上下文设计 (https://arxiv.org/html/2607.14275#S2.SS2.SSS3) 4. 2.2.4记忆管理 (https://arxiv.org/html/2607.14275#S2.SS2.SSS4) 5. 2.2.5上下文压缩与选择 (https://arxiv.org/html/2607.14275#S2.SS2.SSS5) 6. 2.2.6安全加固与安全护栏 (https://arxiv.org/html/2607.14275#S2.SS2.SSS6) 7. 2.2.7多智能体编排 (https://arxiv.org/html/2607.14275#S2.SS2.SSS7) 3. 2.3缺失的层:上下文组装 (https://arxiv.org/html/2607.14275#S2.SS3) 4. 2.4为什么现有技术不够 (https://arxiv.org/html/2607.14275#S2.SS4)
- 3测量上下文工程质量 (https://arxiv.org/html/2607.14275#S3)1. 3.1测量目标 (https://arxiv.org/html/2607.14275#S3.SS1) 2. 3.2七个上下文质量标准 (https://arxiv.org/html/2607.14275#S3.SS2) 3. 3.3ProofAgent-Harness上下文评估 (https://arxiv.org/html/2607.14275#S3.SS3) 4. 3.4与行为评估的隔离 (https://arxiv.org/html/2607.14275#S3.SS4) 5. 3.5将上下文标准映射到行为信号 (https://arxiv.org/html/2607.14275#S3.SS5)
- 4实验验证 (https://arxiv.org/html/2607.14275#S4)1. 4.1研究设计 (https://arxiv.org/html/2607.14275#S4.SS1) 2. 4.2上下文变化下的行为变化 (https://arxiv.org/html/2607.14275#S4.SS2) 3. 4.3上下文得分反映预期的上下文变化 (https://arxiv.org/html/2607.14275#S4.SS3) 4. 4.4上下文质量标准预测行为信号 (https://arxiv.org/html/2607.14275#S4.SS4) 5. 4.5工件泛化 (https://arxiv.org/html/2607.14275#S4.SS5) 6. 4.6结构、安全护栏与Token成本 (https://arxiv.org/html/2607.14275#S4.SS6) 7. 4.7发现总结 (https://arxiv.org/html/2607.14275#S4.SS7)
- 5结论 (https://arxiv.org/html/2607.14275#S5)
- 参考文献 (https://arxiv.org/html/2607.14275#bib)
1引言
AI智能体并非独自失败。它们的行为受到所运行上下文的影响:系统指令、工具模式、检索到的知识、记忆、先前轮次、安全护栏以及不受信任的外部输入。当智能体从单轮助手转变为多步骤系统(调用工具、编写工件、保留状态并跨工作流行动)时,上下文成为一个隐藏的可靠性层。当这一层设计不当时,智能体会偏离角色、对未经证实的事实产生幻觉、误用工具、遵循矛盾指令、易受提示注入攻击,或浪费Token在无关信息上。
这种转变促使实践者将上下文工程与提示工程区分开来。提示工程侧重于设计或优化单条指令,而上下文工程关注的是提供给模型的完整信息环境:包含哪些指令、工具如何描述、什么知识被接地、记忆如何表示、可信与不可信内容如何分离,以及工作上下文如何跨轮次演变。此前关于长上下文行为的研究表明,增加更多上下文并不能保证可靠地使用信息[10 (https://arxiv.org/html/2607.14275#bib.bib1)]。检索增强生成展示了将模型输出接地于外部知识的价值[7 (https://arxiv.org/html/2607.14275#bib.bib2)]。最近的智能体构建指南同样强调,可靠的智能体需要细心管理上下文、工具和外部信息,而不仅仅是提示措辞[2 (https://arxiv.org/html/2607.14275#bib.bib5)].
尽管上下文工程至关重要,但它仍然几乎完全未被度量。团队常常手动检查提示、在部署后调试故障,或依赖行为评估(这类评估能揭示智能体是否失败,但无法隔离失败是否源于上下文本身)。这造成了操作盲点。完整的对抗性评估可能显示智能体产生幻觉、忽略策略或误用工具,但可能无法解释上游原因究竟是接地不足、角色定义不清、指令冲突、工具模式不明确、安全护栏缺失,还是可信指令与不可信输入之间的隔离不力。
本文验证了上下文工程质量作为AI智能体可靠性的独立先行指标。我们将上下文质量定义为一个包含七个标准的结构:角色清晰度、安全护栏覆盖、指令一致性、工具模式质量、接地充分性、注入防护和Token效率。该结构在ProofAgent-Harness中实现,这是一个开源的对抗性AI智能体评估基础设施[5 (https://arxiv.org/html/2607.14275#bib.bib9)]。ProofAgent-Harness通过多评审员、基于共识的评分将“人桥”(HOB)评估操作化[4 (https://arxiv.org/html/2607.14275#bib.bib10)],同时产生行为得分和单独的上下文质量评估。
关键的设计要求是隔离。上下文得分不进入行为指标、最终评分或发布决策。它评估的是智能体进行推理的设置,而非被评分的行为。这种分离使得非循环验证成为可能:如果上下文质量标准能够在保持独立于行为得分的同时预测下游行为结果,那么上下文质量就充当了真正的可靠性信号,而非最终评估的复述。
我们通过一项在受监管智能体领域内进行的受控上下文质量研究来检验这一假设。固定模型不变,仅改变上下文,分为三个层级:薄弱、结构化与加固。薄弱上下文包含模糊的角色定义、薄弱或缺失的工具指导、有限的接地以及对不受信任输入缺乏保护。结构化上下文增加了更清晰的角色边界、类型化工具、接地以及更高效的组织。加固上下文增加了更强的安全护栏、升级行为、注入隔离以及确认再变更模式。这种受控上下文阶梯使我们能够检验:上下文质量的改进是否对应独立行为结果的改进。
结果支持验证主张。上下文质量标准一致地预测其对应的行为信号:接地充分性预测抗幻觉能力,安全护栏覆盖预测抗操纵能力,指令一致性预测指令遵循,工具模式质量预测工具使用。工件研究进一步表明,接地上下文能提高交付物的可靠性,将信号扩展到交互式对话之外。结果还显示,薄弱上下文的成本主要不在于Token成本:最薄弱的上下文可能是每次调用成本最低的,同时却产生最危险的行为。
本文做出三项贡献:
- 1.我们将上下文工程质量定义为AI智能体的可度量七标准结构。
- 2.我们在ProofAgent-Harness中实现这一结构,采用多评审员、基于共识的评分,同时保持上下文得分与行为指标和发布决策的隔离。
- 3.我们验证了在受监管智能体领域的受控上下文变化中,上下文质量标准能够预测独立的下游行为结果。
本文其余部分组织如下。第2节总结关于上下文工程、长上下文退化、接地、提示注入和智能体评估的相关工作。第3节定义了ProofAgent-Harness中实现的七个标准上下文质量度量。第4节呈现实验验证,包括研究设计、结果、工件研究、Token成本分析和解释。第5节以将上下文工程视为智能体评估和治理中可度量层的启示作为结论。
2背景:从提示工程到上下文工程
引言将智能体可靠性视为模型和模型推理的信息环境两者的属性。本节通过将上下文工程置于提示、检索、工具使用、记忆、压缩、注入防御和多智能体系统等前期工作的背景中,来展开这一论点。目标不是提供详尽综述,而是识别出塑造智能体上下文的主要技术,并说明为何需要度量其质量。
我们使用的上下文工程是指在推理过程中向模型提供的信息的设计和运行时管理。这包括系统指令、示例、工具定义、检索到的证据、记忆、先前轮次、策略约束、外部观察以及不受信任的用户或工具提供的内容。对于单次模型调用,上下文大多是静态的。对于智能体,上下文是动态的:它随着智能体推理、调用工具和积累状态而被反复组装、修改、压缩并暴露于新信息。
2.1从提示设计到上下文设计
提示工程侧重于如何向模型表达任务。它包括角色提示、少样本示例、输出格式化、思维链提示、自一致性以及自动提示优化[15 (https://arxiv.org/html/2607.14275#bib.bib13),19 (https://arxiv.org/html/2607.14275#bib.bib15),18 (https://arxiv.org/html/2607.14275#bib.bib16),23 (https://arxiv.org/html/2607.14275#bib.bib17)]。这些技术仍然重要,但对智能体而言并不足够。智能体并非只处理一条静态指令;它会反复接收包含工具定义、工具输出、检索到的文档、用户消息、记忆摘要、先前轮次和系统级策略在内的不断演变的状态。
近期工作将上下文工程描述为一门更广泛的学科,它优化提供给大语言模型的完整信息载荷,包括检索、处理、记忆、工具集成推理和多智能体协调[12 (https://arxiv.org/html/2607.14275#bib.bib12)]。智能体构建实践同样将上下文视为一种有限资源,必须随时间加以精心管理,而非不加区分地填充[2 (https://arxiv.org/html/2607.14275#bib.bib5)]。因此,这一转变是从优化问什么转向优化模型被允许知晓、使用、记住、忽略和采取行动的内容。
这一区别对智能体评估至关重要。如果智能体失败,失败可能不仅源于模型能力或提示措辞,也可能源于接地缺失、工具模式模糊、指令冲突、记忆过时、安全护栏薄弱,或可信与不可信内容混合不当。所以,上下文工程不仅是一种设计活动,也是一个可靠性层面。
2.2上下文工程技术分类
Refer to captionFigure 1:Taxonomy of context-engineering techniques for AI agents. The figure groups the main methods used to shape the information environment in which agents reason, including instruction scaffolding, grounding, tool context, memory, compression, security hardening and guardrails, and multi-agent orchestration.Figure1 (https://arxiv.org/html/2607.14275#S2.F1)summarizes the main technique categories used to shape the information environment in which AI agents reason. We group these techniques into seven categories: instruction scaffolding, grounding and retrieval, tool-context design, memory management, context compression and selection, security hardening and guardrails, and multi-agent orchestration. These categories are not independent modules. In deployed systems, they interact continuously: retrieved evidence can become memory, tool outputs can become future context, compression can remove or preserve critical facts, and guardrails can determine whether a tool action is allowed.
参见说明图1:AI智能体上下文工程技术分类。该图归纳了用于塑造智能体推理信息环境的主要方法,包括指令脚手架、接地、工具上下文、记忆、压缩、安全加固与安全护栏以及多智能体编排。图1 (https://arxiv.org/html/2607.14275#S2.F1) 总结了用于塑造AI智能体推理信息环境的主要技术类别。我们将这些技术归为七类:指令脚手架、接地与检索、工具上下文设计、记忆管理、上下文压缩与选择、安全加固与安全护栏,以及多智能体编排。这些类别并非独立模块。在部署系统中,它们持续交互:检索到的证据可能成为记忆,工具输出可能成为未来上下文,压缩可能移除或保留关键事实,而安全护栏可能决定是否允许某个工具操作。
下面的小节定义每个类别,解释其工作原理,并指出现有局限,从而为度量提供动机。
2.2.1指令脚手架
指令脚手架定义了智能体的角色、范围、成功标准、
相似文章
构建了一个开源工具,用于检测 AI 智能体系统中缺失的验证、重试和错误处理
我们发布了 Trustabl Agent Analyzer,一款开源工具,可扫描 AI 智能体仓库,检测缺失的验证、重试和错误处理,并生成保护隐私的本地报告。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
@omarsar0: 苹果的一篇很棒的论文。大多数对工具调用智能体的评估都发生在轨迹结束之后。但那时错误的调用早已发出。这篇新论文将评估移入执行循环中。一个专门的审稿智能体在执行前检查每个临时工具调用。如果有问题,它注入反馈,主智能体进行修正。为了量化修正与新错误之间的权衡,他们提出了“有益性-有害性”指标。有益性衡量基础错误被修复的百分比;有害性衡量因审稿而降低正确调用质量的比例。在 BFCL 上的结果:无关检测准确率提升 5.5%(从 84.9% 到 90.4%),相关检测提升 1.6%,且无需重新训练基础智能体。在 τ²-Bench 多轮任务上提升 7.1%(从 48.7% 到 55.8%)。推理模型审稿者比 GPT-4o 获得 3:1 的收益风险比,而 GPT-4o 为 2.1:1。加入 GEPA 提示优化可再提升 1.5–2.8%。为什么这很重要?你可以保持基础工具调用智能体不变,仅通过改进审稿者即可实现显著的准确性提升。对审稿者的模型选择和提示优化成为独立的生产杠杆。论文链接:https://arxiv.org/abs/2604.27233 在我们的学院学习如何构建高效的 AI 智能体:https://academy.dair.ai
这篇来自苹果的研究论文介绍了“强化智能体”(Reinforced Agent)方法,通过使用专门的审稿智能体在实时执行过程中修正工具调用错误,将评估纳入执行循环。它在 BFCL 和 τ²-Bench 等基准测试上展示了显著的准确性提升,而无需重新训练基础智能体。
利用智能体编写高效的工具——借助智能体本身
Anthropic 分享了为 AI 智能体设计、评估和优化工具的工程最佳实践,特别介绍了如何利用模型上下文协议(MCP)和 Claude Code 来提升智能体的性能。
智能体失败应成为评估标准,而不仅仅是追踪记录
主张将智能体失败视为评估基准,而不仅仅是追踪日志,强调需要对AI智能体行为进行系统性测试。