ORDDAR:观测驱动的失真鲁棒决策、行动与认知恢复推理

arXiv cs.AI 论文

摘要

ORDDAR是一个推理框架,通过建模认知状态转换来检测和修复局部失真,从而在不同基准测试中提升AI推理的质量和可解释性。

arXiv:2608.28704v1 公告类型:新 摘要:AI代理日益执行长期推理、规划、工具使用、记忆整合和自主决策,但错误的中间状态可能传播并导致不一致的决策和不可靠的输出。现有的推理方法主要依赖于迭代规划、自我反思、增强记忆或验证,但很少本地化并选择性修复错误推理。我们提出ORDDAR(Observation-Driven Reasoning for Distortion-Resilient Decision, Action, and Cognitive Recovery),这是一个推理框架,将推理建模为认知状态转换,检测局部失真,从先前经验中检索相关推理,并仅修复受影响的状态。因此,ORDDAR在局部推理转换级别执行恢复,而不是重新生成完整轨迹。在数学、常识、多跳和临床推理基准测试中的实验表明,与多个评估的推理基线相比,ORDDAR提升了推理质量、恢复能力和可解释性。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:38

# ORDDAR:面向抗畸变决策、行动与认知恢复的观测驱动推理
来源:https://arxiv.org/html/2608.28704
作者:Anant Nawalgaria (单位:Google Research, 德国),Shyamal Kumar Das Mandal (单位:Indian Institute of Technology Kharagpur, 印度)

###### 摘要

AI智能体越来越多地执行长期推理、规划、工具使用、记忆整合与自主决策,但错误的中间状态可能传播并导致决策不一致与输出不可靠。现有推理方法主要依赖迭代规划、自我反思、增强记忆或验证机制,但很少能定位并选择性修复故障推理。我们提出ORDDAR(观测驱动推理框架,用于抗畸变决策、行动与认知恢复),该框架将推理建模为认知状态转移,检测局部畸变,从先验经验中检索相关推理,并仅修复受影响的状态。因此,ORDDAR在局部推理转移层面执行恢复,而非重新生成完整轨迹。在数学、常识、多跳及临床推理基准测试中的实验表明,ORDDAR在推理质量、恢复能力和可解释性方面优于多个被评估的推理基线。

## 1 引言

智能体AI正成为下一个计算范式,其中智能体能够感知环境、规划未来行动、使用外部工具、记忆信息并执行复杂工作流,无需人类干预(Xu等人, 2026)。然而,稳健推理仍具挑战。推理某个阶段的错误可能导致诸如上下文漂移、记忆使用不一致、观察冲突和错误决策等问题。近期基准测试也表明,即使当前最先进的智能体模型在现实环境中处理复杂指令和多重约束时也会推理失败(Qi等人, 2026)。

已有多项推理范式被提出以改进自主智能体推理。ReAct将推理与环境交互结合(Yao等人, 2022),思维树(ToT)通过深思熟虑的搜索探索多个推理分支(Yao等人, 2023),而Reflexion通过自我反思和情景记忆增强推理,无需模型重训练(Shinn等人, 2023)。尽管有这些进展,推理稳定性仍是主要挑战,因为中间推理状态的错误会在后续推理轨迹中传播(Yeo等人, 2025; Gan等人, 2025)。现有方法主要依赖通过重复细化或重新生成推理来迭代自我纠正(Madaan等人, 2023),但其有效性因模型、任务和反馈设置而异(Kamoi等人, 2024)。此外,尽管现代AI智能体展示了强大的规划、工具使用和记忆能力,但当前架构缺乏诊断局部推理故障的机制,无法在不重新生成整个推理轨迹的情况下选择性修复仅受损的推理状态(Wang等人, 2024)。因此,一个用于推理畸变检测、推理状态诊断和选择性认知恢复的有原则框架仍然缺失。为弥补这一空白,我们提出了ORDDAR(观测驱动推理框架,用于抗畸变决策、行动与认知恢复)。

图1:ORDDAR概览。该框架检测推理畸变,通过认知镜检索恢复补全,选择性修复受损推理状态,并预测最终决策。

为解决这些局限,我们提出ORDDAR(观测驱动推理框架,用于抗畸变决策、行动与认知恢复),一种新颖的观测驱动推理系统,它将推理视为一系列认知状态转移(图1)。该系统识别局部推理畸变,通过认知镜结合畸变记忆与补全推理来分析推理状态中的故障,并仅修复故障的推理转移,无需重建整个推理路径。我们研究的主要贡献可总结如下:首先,我们提出将推理视为认知状态转移并定义局部推理畸变的ORDDAR模型。其次,我们提出一个认知镜,它整合畸变记忆与补全推理检索,以识别推理故障并仅恢复受损的推理转移状态。第三,我们设计了一个端到端的推理流水线,包含推理畸变检测、推理状态诊断、补全推理检索和选择性认知恢复。

## 2 相关工作

随着大语言模型的快速进展,智能体现在能够在变化环境中执行推理、规划、工具使用、记忆整合和决策(Wang等人, 2024; Xu等人, 2026)。然而,近期的基准测试工作,如AgentBench、TheAgentCompany和AGENTIF,揭示尽管有显著改进,最先进的智能体在遵循指令、满足约束和执行一致性决策方面仍面临困难(Liu等人, 2024; Xu等人, 2026; Qi等人, 2026)。此外,OpenHands、AutoGen和MetaGPT等框架利用软件工程、工具协作和多智能体协调的技术增强了智能体的能力(Wang等人, 2025; Wu等人, 2024; Hong等人, 2024)。同时,包括MLAgentBench和ScienceAgentBench在内的特定领域基准测试评估了自主智能体在机器学习和科学发现任务上的表现,强调了在推理稳健性和一致性方面的持续挑战(Huang等人, 2023; Chen等人, 2025)。

迭代规划和自我纠正极大地促进了推理的改进。ReAct将推理与环境交互结合,ToT探索各种推理路径,Reflexion和Self-Refine通过反思和细化来改善推理(Yao等人, 2022; Yao等人, 2023; Shinn等人, 2023; Madaan等人, 2023)。然而,最近研究人员发现,更长的推理路径并不总是能提高可靠性,因为中间推理错误倾向于传播并最终污染后续推理步骤(Yeo等人, 2025; Gan等人, 2025)。此外,当前的自我纠正方法对模型、任务和反馈极为敏感(Kamoi等人, 2024)。因此,大多数自我纠正方法要么生成整个推理路径,要么细化整个推理路径,而不是修复受损的推理路径。推理畸变可描述为连续认知阶段之间存在异常的语义偏移。推理畸变在引入新信息时不保持语义完整性,而有效推理则如此。因此,语义差异被用作局部推理畸变的指标。ORDDAR框架专门识别推理畸变并修复受损的推理路径,而非生成整个推理路径。

## 3 方法论

自主AI智能体在长期规划、工具利用、决策制定和终身学习等领域取得了许多进展,范围从具身智能体到网络智能体,从软件工程到自主数据科学(Zhou等人, 2024; Zhang等人, 2025; Xie等人, 2024; Park等人, 2023; Luo等人, 2025; Wang等人, 2023)。但它们的推理容易出现局部错误,这些错误会在其推理轨迹中造成损害并损害最终决策。为弥补这一弱点,ORDDAR提出了一种新的基于转移的认知修复方法。

图2:ORDDAR的整体数学工作流程。从输入查询开始,ORDDAR构建观测驱动的推理状态,检测局部推理畸变,编码紧凑的畸变签名,使用提出的加权相似性规则从认知镜检索最相关的恢复补全,选择性修复畸变的推理状态,用成功的恢复模式更新记忆,并执行最终预测。

### 3.1 问题形式化

自主AI智能体通过顺序推理解决复杂任务,其中观测在决策制定前逐渐转化为认知状态。这些转移过程中产生的错误会通过后续推理传播并降低最终决策质量。ORDDAR通过恢复局部推理错误而非重新生成整个推理轨迹来解决此问题。

给定输入查询 \( q \in \mathcal{Q} \),自主AI智能体通过顺序推理生成输出 \( y \in \mathcal{Y} \)。ORDDAR将此过程建模为一系列认知状态转移,其中观测逐渐转化为中间推理状态。ORDDAR并非在失败后重新生成整个推理轨迹,而是识别并选择性修复局部推理畸变。

输入查询首先被转化为结构化观测集
\[ O = \phi(q) = \{o_1, o_2, \ldots, o_m\}, \tag{1} \]
其中 \(\phi(\cdot)\) 表示观测提取函数,\(o_i\) 表示从输入中提取的第 \(i\) 个推理观测。基于观测序列,推理引擎构建认知状态轨迹
\[ R = \{s_1, s_2, \ldots, s_T\}, \tag{2} \]
其中每个认知状态递归更新为
\[ s_t = f(s_{t-1}, o_t), \tag{3} \]
其中 \(f(\cdot)\) 表示推理转移函数。ORDDAR的目标是学习一个恢复函数
\[ \mathcal{F}: R \to \hat{R}, \tag{4} \]
其中 \(\hat{R}\) 表示恢复的推理路径。推理被定义为由观测驱动的认知状态变化(公式2-3)。通过检测推理畸变、获取补全推理并修复认知状态以进行预测,可以捕获并检测用于畸变恢复的中间推理。为进行局部推理分析,ORDDAR定义了围绕当前检查的推理转移的认知窗口 \(W_t = \{s_t, s_{t+1}\}\)。该窗口沿轨迹顺序移动,使得在单个转移层面进行畸变检测和恢复,同时保持其余推理状态。

### 3.2 推理畸变检测与签名编码

ORDDAR通过测量连续认知状态在语义嵌入空间和认知锚点空间中的联合位移来检测局部推理故障。每个认知状态 \(s_t\) 由语义嵌入 \(E(s_t)\) 和归一化的认知锚点分布 \(\psi_t\) 表示。对于每个转移 \(e_t = (s_t, s_{t+1})\),语义转移距离定义为
\[ d_t^{\mathrm{sem}} = 1 - \cos\left(E(s_t), E(s_{t+1})\right), \tag{5} \]
其中 \(E(\cdot)\) 表示由预训练句子编码器产生的语义嵌入。我们评估了三种现成的句子编码器,即MPNet、all-MiniLM-L6-v2和BAAI/bge-base-en-v1.5,未进行任务特定的微调。基于其最佳的初步检索性能,MPNet被选为主要编码器,同时评估MiniLM和BGE以评估所提出的畸变表示对语义嵌入空间选择的鲁棒性。

\[ d_t^{\mathrm{anchor}} = \left\|\psi_t - \psi_{t+1}\right\|_2. \tag{6} \]
由于这两个距离捕获了推理转移的互补方面,它们在轨迹内被归一化并使用平方根和公式组合:
\[ D_t = \sqrt{\left(\tilde{d}_t^{\mathrm{sem}}\right)^2 + \left(\tilde{d}_t^{\mathrm{anchor}}\right)^2}, \tag{7} \]
其中 \(\tilde{d}_t^{\mathrm{sem}}\) 和 \(\tilde{d}_t^{\mathrm{anchor}}\) 分别表示归一化的语义和锚点空间距离。得到的联合畸变分数 \(D_t\) 捕获了连续认知状态在语义内容和推理结构上的变化。对于每个推理轨迹,我们定义轨迹自适应畸变阈值为其连续状态转移的联合畸变分数的均值:
\[ \tau_R = \frac{1}{T-1} \sum_{t=1}^{T-1} D_t. \tag{8} \]
当以下条件满足时,该转移被视为畸变:
\[ z_t = \begin{cases} 1, & D_t > \tau_R, \\ 0, & \text{otherwise}. \end{cases} \tag{9} \]
这里,\(\tau_R\) 表示轨迹自适应畸变阈值,\(z_t\) 指示该转移是否被识别为畸变。仅 \(z_t = 1\) 的转移被转发进行签名编码。每个检测到的畸变编码为
\[ k_t = \{\psi^{\mathrm{shift}}, A^{\mathrm{gain}}, A^{\mathrm{loss}}\}, \tag{10} \]
其中 \(\psi^{\mathrm{shift}}\) 表示语义转移偏移,\(A^{\mathrm{gain}}\) 表示新引入的推理锚点,\(A^{\mathrm{loss}}\) 表示被丢弃的推理锚点。偏移-增益-损失签名表征了检测到的畸变的性质,并支持恢复补全检索。所得签名支持高效检索和认知恢复(图2)。一个替代设计是采用额外的草稿生成器或验证器LLM来评估中间推理状态的正确性,这在精神上类似于基于验证器的推测解码。我们考虑了这种可能性,但未在ORDDAR中引入额外的LLM验证器。与推测解

相似文章

Orc(暂定名)- 可审计且声明式的 AI 工作流

Reddit r/LocalLLaMA

开发者正在寻求关于"ORC"的反馈,这是一个早期的“编排即代码”工具,使用声明式 DSL 来定义、验证和版本控制 LLM 工作流。旨在服务于结合本地和云端模型的用户,它用可审计的、类似 Terraform 的定义取代了复杂的 Python 脚本,用于代理和工具执行。