agent-trajectories

标签

Cards List
#agent-trajectories

轨迹评判:仅基于结果的LLM评判器在智能体轨迹中遗漏的问题

arXiv cs.CL · 昨天 缓存

本文介绍了一个确定性测试平台,用于评估LLM评判器在智能体轨迹上的表现,表明仅基于结果的评判器会遗漏静默故障,而基于步骤的评判器能达到更高的召回率并具有更好的校准。

0 人收藏 0 人点赞
#agent-trajectories

@omarsar0: 新论文来自微软及其同事。大规模调试智能体轨迹具有挑战性。这是一个巧妙的方…

X AI KOLs Following · 2026-07-15 缓存

本文介绍了OAT,一种用于基于LLM的智能体系统的轻量级故障归因工具。它仅使用成功轨迹进行训练,并利用神经控制微分方程检测错误步骤,在速度和精度上以数量级优势超越昂贵基线。

0 人收藏 0 人点赞
#agent-trajectories

IdeaTrail:科学构思的全过程智能体轨迹

arXiv cs.AI · 2026-07-14 缓存

IdeaTrail是一个多轮过程轨迹数据集,用于科学构思,通过Generator--Advisor循环从证据收集到提案构建合成研究过程,以确保依据充分。

0 人收藏 0 人点赞
#agent-trajectories

通过智能体轨迹剖析模型行为

arXiv cs.AI · 2026-06-17 缓存

本文介绍了Simple Strands Agent (SSA),这是一个最小化的框架,旨在缩小AI模型与其智能体行为之间的意图-执行差距,并通过分析各类模型家族的138k条轨迹,揭示细粒度的行为差异。

0 人收藏 0 人点赞
#agent-trajectories

BraveGuard:从开放世界威胁到更安全的计算机使用代理

Hugging Face Daily Papers · 2026-06-02 缓存

BraveGuard 是一个自我演化的防御框架,通过利用开放世界威胁信号和真实的代理轨迹来训练防护模型,从而提升计算机使用代理的安全检测能力,在 AgentHazard 基准上取得了显著的准确率提升。

0 人收藏 0 人点赞
#agent-trajectories

TraceGraph:用于诊断和改进智能体轨迹的共享决策景观

arXiv cs.AI · 2026-06-01 缓存

TraceGraph是一个基于图的框架,它从多模型智能体轨迹中构建共享决策景观,从而能够诊断故障区域并通过陷阱感知恢复流水线进行改进。

0 人收藏 0 人点赞
#agent-trajectories

深度研究Agent在何处出错?Agent轨迹中的跨度级错误定位

Hugging Face Daily Papers · 2026-06-01 缓存

本文介绍了一个以声明为中心的审计框架,用于识别深度研究Agent轨迹中的错误跨度,并提出了新基准TELBench,改进了过程级可靠性评估。

0 人收藏 0 人点赞
#agent-trajectories

ACC:编译智能体轨迹以进行长上下文训练

Hugging Face Daily Papers · 2026-05-21 缓存

智能体上下文编译(ACC)通过将多轮智能体轨迹转化为结构化问答对,增强了大语言模型的长上下文推理能力,使得无需额外标注即可直接监督远距离上下文整合。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈