当“必须”变为“可能”:LLM智能体工作流中的约束弱化
摘要
本文研究LLM智能体工作流中的交接转换如何将绑定约束降级为非绑定上下文,导致安全故障,并评估了保持操作状态的干预措施。
查看缓存全文
缓存时间: 2026/08/26 23:15
论文页面 - 当“必须“变为“可能“:大语言模型智能体工作流中的约束弱化现象
来源:https://huggingface.co/papers/2608.24569
摘要
多阶段大语言模型(LLM)工作流在中间产物将绑定性前提条件转化为非绑定性上下文时,会丧失操作约束,即使内容得以保留也可能导致安全事故。
大型语言模型(LLM)智能体通过多角色、多阶段工作流协调复杂任务。上游状态被反复转换为中间语言产物,如摘要、计划、工单、记忆库和交接笔记,下游组件据此采取行动。对于限制行动的状态而言,仅保留主题信息是不够的:一个产物可能提及未解决的条件,却将其从必须在执行前解决的强制要求转变为仅用于提示下一步行动的参考信息。我们将这种行动约束角色称为操作状态保持(https://huggingface.co/papers?q=operational%20state%20preservation)。安全阻断机制(https://huggingface.co/papers?q=Safety%20blockers)提供了一个受控实例,因为每个源状态都具有明确的前提条件、授权、回退方案和执行后果。我们基于正确的上游识别,改变交接转换方式(https://huggingface.co/papers?q=handoff%20transformation),并评估受限于所生成产物的执行器。通过1,296个受控合成场景的测试,直接交接控制能保留所有阻断机制,而压缩、计划同化、收敛、所有权推诿和先例替代则反复将绑定状态转化为限制条款或非绑定考量。常规交接压缩导致100.0%的失效和54.2%的禁止操作。恢复全部四个状态字段后,保留率提升至100.0%,禁止操作降至0.0%。固定产物干预进一步区分了状态保留与约束控制:下游验证消除了禁止操作,但产物失效仍达95.3%。这些结果揭示了信息提取与行动之间的状态传递失败(https://huggingface.co/papers?q=state-transmission%20failure)。交接转换(https://huggingface.co/papers?q=Handoff%20transformation)可以在保留状态内容的同时削弱其对下游行动的约束力。语义可及性并不等同于操作状态保持。
查看arXiv页面 (https://arxiv.org/abs/2608.24569) 查看PDF (https://arxiv.org/pdf/2608.24569) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24569)
获取论文到你的智能体:
hf papers read 2608\.24569
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接本文 在模型README.md中引用 arxiv.org/abs/2608.24569 以从本页面建立链接。
引用本文的数据集 0
无数据集链接本文 在数据集README.md中引用 arxiv.org/abs/2608.24569 以从本页面建立链接。
引用本文的Spaces 0
无Space链接本文 在Space README.md中引用 arxiv.org/abs/2608.24569 以从本页面建立链接。
包含本文的收藏 0
无收藏包含本文 将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面建立链接。
相似文章
约束衰减:LLM代理在后端代码生成中的脆弱性
本文研究了大型语言模型智能体在结构约束下的后端代码生成脆弱性,发现了一种称为“约束衰减”的现象,即随着约束条件不断累积,模型性能显著下降。
Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues
This paper introduces ReBIND, a framework that measures, predicts, and repairs behavioral relapse in black-box LLM dialogues where models continue to follow revoked constraints. Experiments with HumanEval show that ahead-of-time compilation significantly reduces relapse compared to a baseline, while adaptive interventions add no detectable gain.
LLMs 知道约束却未使用它:语用约束推理中的激活瓶颈
本文认为,LLM 在隐藏约束推理上的失败是路由问题,而非知识问题,并引入了一种四重诊断法,在 14 个模型上将知识、对称性、路由和修复分离开来,同时进行了激活探测和激活修补实验。
双智能体LLM中继中的状态压缩:约束保持的封闭世界研究
本文评估了双智能体LLM中继中用于旅行规划的交接压缩,比较了JSON提取和叙述摘要等方法,发现结构化表示能更好地保持约束。
多智能体LLM安全中的操作重构与批准框架委托
本文引入了一种五条件控制对比设计,以区分多智能体LLM安全评估中操作重构、规划器行为和批准框架委托的影响,表明整体流水线安全度量不能解释为稳定的架构属性。