标签
本文介绍了一个确定性测试平台,用于评估LLM评判器在智能体轨迹上的表现,表明仅基于结果的评判器会遗漏静默故障,而基于步骤的评判器能达到更高的召回率并具有更好的校准。
本文介绍了OAT,一种用于基于LLM的智能体系统的轻量级故障归因工具。它仅使用成功轨迹进行训练,并利用神经控制微分方程检测错误步骤,在速度和精度上以数量级优势超越昂贵基线。
IdeaTrail是一个多轮过程轨迹数据集,用于科学构思,通过Generator--Advisor循环从证据收集到提案构建合成研究过程,以确保依据充分。
本文介绍了Simple Strands Agent (SSA),这是一个最小化的框架,旨在缩小AI模型与其智能体行为之间的意图-执行差距,并通过分析各类模型家族的138k条轨迹,揭示细粒度的行为差异。
BraveGuard 是一个自我演化的防御框架,通过利用开放世界威胁信号和真实的代理轨迹来训练防护模型,从而提升计算机使用代理的安全检测能力,在 AgentHazard 基准上取得了显著的准确率提升。
TraceGraph是一个基于图的框架,它从多模型智能体轨迹中构建共享决策景观,从而能够诊断故障区域并通过陷阱感知恢复流水线进行改进。
本文介绍了一个以声明为中心的审计框架,用于识别深度研究Agent轨迹中的错误跨度,并提出了新基准TELBench,改进了过程级可靠性评估。
智能体上下文编译(ACC)通过将多轮智能体轨迹转化为结构化问答对,增强了大语言模型的长上下文推理能力,使得无需额外标注即可直接监督远距离上下文整合。