当代理过早承诺:诊断LLM代理的过早承诺
摘要
本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。
查看缓存全文
缓存时间: 2026/06/23 17:43
论文页面 - 当智能体过早承诺时:诊断LLM智能体的过早承诺
来源:https://huggingface.co/papers/2606.22936
长程智能体可能因过早定型而失败。本文引入了表征性承诺:跨运行隐藏状态的收敛性,用于诊断智能体是否已锁定某一轨迹。
关键发现是,承诺能够预测轨迹一致性,而非正确性。错误承诺的运行与正确承诺的运行可能共享相同的收敛特征。因此,跨运行间的一致并不总是智能体正确的证据;它可能仅意味着智能体已变得自信且定型。
实际用途在于监控:检测智能体何时已定型,然后决定是否需要验证、重新采样或延期处理——而非将一致性视为信任。
相似文章
The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents
Presents a verification instrument for long-horizon agents that structurally separates commitment drift from binding drift, using a deterministic executive and pre-registered predictions. Reports ablation results showing commitment mechanism removal flips goal abandonment from 0 to 1 while binding error stays flat, though task efficacy is null on ARC-AGI-3.
延迟验证破坏多智能体LLM信念:不稳定性阈值与最优校正器放置
本文建模了多智能体LLM系统中延迟验证的影响,揭示了延迟校正会破坏共识稳定并引发振荡。它推导出闭式稳定性阈值,并提供了一种用于最优校正器放置的贪心近似算法,在五个开放模型上的实验验证了该结果。
基于LLM的多智能体系统中作为收敛压力的关系先验
本文研究了在基于LLM的多智能体系统中,使智能体间关系语义显式化如何充当收敛压力,提高一致性但并不稳定地提升准确性。作者认为,关系先验应被诊断性地、针对具体任务地使用,而非作为默认附加项。
智能体循环何时将停滞误认为进展?长时间运行自主LLM智能体循环中的自我评估偏差与外部基础验证
本文识别了长时间运行的自主LLM智能体中的'进展幻象'失败模式,其中自我评估偏差导致智能体将停滞误认为进展。通过受控实验,表明对于开放式目标,外部带外验证是必要的。
SafeCommit:认证记忆接地智能体何时可以安全行动
SafeCommit 提出一个风险控制层,认证记忆接地的大语言模型智能体何时可以安全行动,使用共形行动证书来限制不安全承诺的概率,并提供一个带有公开代码的模拟器。