智能体循环何时将停滞误认为进展?长时间运行自主LLM智能体循环中的自我评估偏差与外部基础验证

arXiv cs.AI 论文

摘要

本文识别了长时间运行的自主LLM智能体中的'进展幻象'失败模式,其中自我评估偏差导致智能体将停滞误认为进展。通过受控实验,表明对于开放式目标,外部带外验证是必要的。

arXiv:2607.25152v1 Announce Type: new 摘要:长时间运行的自主智能体规划、行动并判断自身的完成情况,无需人工干预。当智能体评估自身工作时,自我评估偏差便会出现:看似合理的变更被接受为进展,而真实世界的结果停滞或倒退。我们将这种失败模式命名为进展幻象,并通过受控测量表明,这取决于评估者的基础所在。我们构建了一个测试平台,固定了智能体及其工具接口,仅操控用于控制循环的评估者的信息通道类型。一个原则上不可伪造的世界状态预言机,通过容器和网络隔离强制执行,并在每次运行时验证。在54个周期中,一个前沿智能体每次都声称有改进,但56%的测量变化量小于等于零。因此自我报告没有信息量,自我裁决门退化成了全接受,使其达到的最佳部署状态下降了19%。即使是最强的带内裁判,读取完整工件文本、变更差异及其自身裁决历史,接受的周期中44%是真实世界的退化,拒绝了38%的真实改进;预注册的对抗性假设——强大的裁判能够缩小差距——被拒绝了。在一个边界任务上,其成功规范可从工件本身验证,同一裁判的幻象消失为零,差距缩小到预注册阈值之内,表明差距取决于成功信号所在。仅返回接受裁决的符号变体使真实世界输出与完整反馈相似(110.0对113.0),将收益定位于门的接地而非反馈内容。对于成功信号存在于记录之外的开放式目标,扩增裁判是不够的;具有真实世界访问权限的带外评估是一个结构性要求。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:53

# 智能体循环何时将停滞误认为进展?长时间运行自主LLM智能体循环中的自我评估偏差与外部接地验证  
来源:https://arxiv.org/abs/2607.25152  
查看PDF(https://arxiv.org/pdf/2607.25152)

> **摘要:** 长时间运行的自主智能体会规划、行动并自行判断任务完成情况,无需人类干预。当智能体对自己的工作进行评分时,自我评估偏差便会出现:看似合理的变化被当作进展接受,而真实世界的输出却停滞或倒退。我们将这种失效模式命名为“进展幻象”,并通过受控实验证明,问题关键在于评估器所依赖的接地信息类型。我们构建了一个测试平台,固定住智能体及其工具界面,仅操控用于控制循环的评估器的信息通道类型。通过容器和网络隔离强制执行原则上不可伪造的世界状态预言机,并在每次运行时进行验证。在54个循环中,前沿智能体每次都声称有所改进,然而56%的循环实际测量差值为零或负值。因此,自我报告毫无信息量,自我判定门控退化为全盘接受模式,使智能体曾达到的最佳部署状态下降了19%。即使是基于带内的最强评判器(读取完整工件文本、变更差异及其自身的评判历史),也接受了实际44%为真实世界回退的循环,并拒绝了38%的真实改进;预先注册的对抗性假设(强评判器能缩小差距)被拒绝。在边界任务(其成功规约可从工件本身验证)上,同一评判器的幻象消失为零,差距在注册阈值内坍塌,表明差距取决于成功信号所在位置。仅返回接受/拒绝判定的符号变体保持了与完整反馈相似的真实世界输出(110.0 vs 113.0),从而将收益定位于门控的接地信息而非反馈内容。对于成功信号位于文本之外、目标开放的目标,仅仅扩展评判器规模是不够的;具备真实世界访问能力的带外评估是一项结构性要求。

## 提交历史

来自:Hyundoo Park \[查看邮箱(https://arxiv.org/show-email/e17c3394/2607.25152)\] **\[v1\]** 2026年7月27日星期一 23:52:15 UTC(439 KB)

相似文章

当代理过早承诺:诊断LLM代理的过早承诺

Hugging Face Daily Papers

本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

arXiv cs.AI

Presents a verification instrument for long-horizon agents that structurally separates commitment drift from binding drift, using a deterministic executive and pre-registered predictions. Reports ablation results showing commitment mechanism removal flips goal abandonment from 0 to 1 while binding error stays flat, though task efficacy is null on ARC-AGI-3.