智能体循环何时将停滞误认为进展?长时间运行自主LLM智能体循环中的自我评估偏差与外部基础验证
摘要
本文识别了长时间运行的自主LLM智能体中的'进展幻象'失败模式,其中自我评估偏差导致智能体将停滞误认为进展。通过受控实验,表明对于开放式目标,外部带外验证是必要的。
查看缓存全文
缓存时间: 2026/07/29 09:53
# 智能体循环何时将停滞误认为进展?长时间运行自主LLM智能体循环中的自我评估偏差与外部接地验证 来源:https://arxiv.org/abs/2607.25152 查看PDF(https://arxiv.org/pdf/2607.25152) > **摘要:** 长时间运行的自主智能体会规划、行动并自行判断任务完成情况,无需人类干预。当智能体对自己的工作进行评分时,自我评估偏差便会出现:看似合理的变化被当作进展接受,而真实世界的输出却停滞或倒退。我们将这种失效模式命名为“进展幻象”,并通过受控实验证明,问题关键在于评估器所依赖的接地信息类型。我们构建了一个测试平台,固定住智能体及其工具界面,仅操控用于控制循环的评估器的信息通道类型。通过容器和网络隔离强制执行原则上不可伪造的世界状态预言机,并在每次运行时进行验证。在54个循环中,前沿智能体每次都声称有所改进,然而56%的循环实际测量差值为零或负值。因此,自我报告毫无信息量,自我判定门控退化为全盘接受模式,使智能体曾达到的最佳部署状态下降了19%。即使是基于带内的最强评判器(读取完整工件文本、变更差异及其自身的评判历史),也接受了实际44%为真实世界回退的循环,并拒绝了38%的真实改进;预先注册的对抗性假设(强评判器能缩小差距)被拒绝。在边界任务(其成功规约可从工件本身验证)上,同一评判器的幻象消失为零,差距在注册阈值内坍塌,表明差距取决于成功信号所在位置。仅返回接受/拒绝判定的符号变体保持了与完整反馈相似的真实世界输出(110.0 vs 113.0),从而将收益定位于门控的接地信息而非反馈内容。对于成功信号位于文本之外、目标开放的目标,仅仅扩展评判器规模是不够的;具备真实世界访问能力的带外评估是一项结构性要求。 ## 提交历史 来自:Hyundoo Park \[查看邮箱(https://arxiv.org/show-email/e17c3394/2607.25152)\] **\[v1\]** 2026年7月27日星期一 23:52:15 UTC(439 KB)
相似文章
延迟验证破坏多智能体LLM信念:不稳定性阈值与最优校正器放置
本文建模了多智能体LLM系统中延迟验证的影响,揭示了延迟校正会破坏共识稳定并引发振荡。它推导出闭式稳定性阈值,并提供了一种用于最优校正器放置的贪心近似算法,在五个开放模型上的实验验证了该结果。
为什么自反思ReAct循环在长时任务中失败,以及我们为此构建的AgentOS验证架构
解释了自反思ReAct循环在长时任务中失败的原因,并介绍了作为解决方案的AgentOS验证架构。
@ItsRoboki: /loop 和 /goal 并不验证你的工作。它们只会放大你给予它们的验证。真正的问题在于:智能体……
对 AI 智能体循环持续运行而不进行推理的批评,建议智能体应定期暂停,分析失败原因并提出理论后再重试。
当代理过早承诺:诊断LLM代理的过早承诺
本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。
The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents
Presents a verification instrument for long-horizon agents that structurally separates commitment drift from binding drift, using a deterministic executive and pre-registered predictions. Reports ablation results showing commitment mechanism removal flips goal abandonment from 0 to 1 while binding error stays flat, though task efficacy is null on ARC-AGI-3.