当“必须”变为“可能”:LLM智能体工作流中的约束弱化

Hugging Face Daily Papers 论文

摘要

本文研究LLM智能体工作流中的交接转换如何将绑定约束降级为非绑定上下文,导致安全故障,并评估了保持操作状态的干预措施。

大语言模型(LLM)智能体通过多角色、多阶段的工作流协调复杂任务。上游状态被反复转换为中间语言工件,如摘要、计划、工单、记忆和交接备注,下游组件基于这些工件行动。对于动作约束状态,主题保留不足:一个工件可能提到一个未解决的条件,同时将其从执行前必须解决的要求,变为仅可能为下一个动作提供信息的信息。我们将这种动作绑定角色研究为操作状态保持。安全阻止器提供了一个受控实例,因为每个源状态都有明确的先决条件、权限、回退和执行后果。我们以正确的上游识别为条件,改变交接转换,并评估受限于所得工件的执行器。在1,296个受控合成情节中,直接交接控制保留了每个阻止器,而压缩、计划同化、收敛、所有权推迟和先例替代反复将绑定状态转变为警告或非绑定考虑。正常交接压缩导致100.0%的停用和54.2%的禁止动作。恢复所有四个状态字段将保持率提高到100.0%,并将禁止动作减少到0.0%。固定工件干预进一步分离了保持与遏制:下游验证消除了禁止动作,而工件停用保持在95.3%。这些结果识别了信息提取与动作之间的状态传输失败。交接转换可以保留状态内容,同时削弱其对下游动作的约束。语义可用性并不能保证操作保持。
查看原文
查看缓存全文

缓存时间: 2026/08/26 23:15

论文页面 - 当“必须“变为“可能“:大语言模型智能体工作流中的约束弱化现象

来源:https://huggingface.co/papers/2608.24569

摘要

多阶段大语言模型(LLM)工作流在中间产物将绑定性前提条件转化为非绑定性上下文时,会丧失操作约束,即使内容得以保留也可能导致安全事故。

大型语言模型(LLM)智能体通过多角色、多阶段工作流协调复杂任务。上游状态被反复转换为中间语言产物,如摘要、计划、工单、记忆库和交接笔记,下游组件据此采取行动。对于限制行动的状态而言,仅保留主题信息是不够的:一个产物可能提及未解决的条件,却将其从必须在执行前解决的强制要求转变为仅用于提示下一步行动的参考信息。我们将这种行动约束角色称为操作状态保持(https://huggingface.co/papers?q=operational%20state%20preservation)。安全阻断机制(https://huggingface.co/papers?q=Safety%20blockers)提供了一个受控实例,因为每个源状态都具有明确的前提条件、授权、回退方案和执行后果。我们基于正确的上游识别,改变交接转换方式(https://huggingface.co/papers?q=handoff%20transformation),并评估受限于所生成产物的执行器。通过1,296个受控合成场景的测试,直接交接控制能保留所有阻断机制,而压缩、计划同化、收敛、所有权推诿和先例替代则反复将绑定状态转化为限制条款或非绑定考量。常规交接压缩导致100.0%的失效和54.2%的禁止操作。恢复全部四个状态字段后,保留率提升至100.0%,禁止操作降至0.0%。固定产物干预进一步区分了状态保留与约束控制:下游验证消除了禁止操作,但产物失效仍达95.3%。这些结果揭示了信息提取与行动之间的状态传递失败(https://huggingface.co/papers?q=state-transmission%20failure)。交接转换(https://huggingface.co/papers?q=Handoff%20transformation)可以在保留状态内容的同时削弱其对下游行动的约束力。语义可及性并不等同于操作状态保持。

查看arXiv页面 (https://arxiv.org/abs/2608.24569) 查看PDF (https://arxiv.org/pdf/2608.24569) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24569)

获取论文到你的智能体:

hf papers read 2608\.24569

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接本文 在模型README.md中引用 arxiv.org/abs/2608.24569 以从本页面建立链接。

引用本文的数据集 0

无数据集链接本文 在数据集README.md中引用 arxiv.org/abs/2608.24569 以从本页面建立链接。

引用本文的Spaces 0

无Space链接本文 在Space README.md中引用 arxiv.org/abs/2608.24569 以从本页面建立链接。

包含本文的收藏 0

无收藏包含本文 将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面建立链接。

相似文章

多智能体LLM安全中的操作重构与批准框架委托

arXiv cs.AI

本文引入了一种五条件控制对比设计,以区分多智能体LLM安全评估中操作重构、规划器行为和批准框架委托的影响,表明整体流水线安全度量不能解释为稳定的架构属性。