主动推理作为AI代理的上下文获取机制

arXiv cs.AI 论文

摘要

本文提出将主动推理作为一种框架,使AI代理能够通过平衡信息增益与成本来高效获取上下文,并在语言模型上建立基准测试,应用于问题提出和提示优化。

arXiv:2608.19202v1 公告类型:新 摘要:交互式AI代理必须尽可能高效地获取正确上下文。当用户省略约束条件、偏好、文件或任务变量时,代理可以继续使用默认假设,或花费token进行澄清提问、检索调用、工具调用或提示试验。我们将这种权衡形式化为用于上下文获取的主动推理。内部推理步骤更新对潜在任务状态的信念,外部决策选择下一个上下文动作、任务动作或停止动作,以最小化成本下的预期自由能。在确定性设置中,认知项简化为预期信息增益,可选择按token成本进行归一化。我们在最优问题提出中实例化该框架,使用精确后验和动态规划预言机,并在25到300个候选的二元和多类别任务上对前沿语言模型进行基准测试。我们还研究了token预算下的生成前澄清和自动提示优化。该公式与模型无关,将主动推理视为AI代理上下文获取层的设计原则。
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:53

# 主动推理作为AI代理的上下文获取机制  
来源:https://arxiv.org/html/2608.19202  
\\nameSanchayan Dutta\\emaildutta@ucdavis\.edu  
\\addrDepartment of Mathematics, University of California, Davis  
\\nameSai Niranjan Ramachandran\\emailsainiranjan\.ramachandran@tum\.de  
\\addrTechnical University of Munich, Garching, Germany  
\\nameSuvrit Sra\\emails\.sra@tum\.de  
\\addrTechnical University of Munich, Garching, Germany  

###### 摘要  
交互式AI代理必须尽可能高效地获取正确上下文。当用户省略约束条件、偏好、文件或任务变量时,代理可以选择默认假设,或通过澄清提问、检索调用、工具调用或提示试验消耗推理资源(token)。我们将此权衡建模为基于主动推理的上下文获取过程:内部推理步骤更新对潜在任务状态的信念,外部决策则选择下一个上下文动作、任务动作或终止动作,以在成本约束下最小化期望自由能。在确定性环境中,认知价值项简化为期望信息增益,可选择用token成本进行归一化处理。我们在最优提问(OQA)框架中实例化该理论,通过精确后验和动态规划预言机,在25至300个候选项目的二分类与多分类任务上对前沿语言模型进行基准测试。同时研究了基于token预算的生成前澄清机制与自动化提示优化。该建模方法具有模型无关性,将主动推理视为AI代理上下文获取层的设计原则。  

## 1 引言  
AI系统用户很少会预先说明所有信息。约束条件可能被遗漏,偏好可能未明确表达。面对此类输入,系统若过早决策则可能出错,因此需要先获取更多上下文。上下文动作可能包括澄清提问、检索调用、工具调用、提示评估或视觉检查,每个动作都有其代价——消耗token、增加延迟,并可能需要用户或环境付出额外努力。  

我们采用主动推理研究此权衡问题。设$x$为潜在任务状态(如意图、目标、偏好、缺失约束或最佳提示),$a$为上下文动作或任务动作,$o$为相应的回复、轨迹或观测值,由概率模型$p(o \mid x, a)$描述。对于每个候选动作,内部推理步骤根据可能观测更新对$x$的信念,外部步骤则选择能最小化期望自由能的动作,该能量包含风险、认知价值和成本。在精确推理与确定性观测条件下,认知价值项等价于期望信息增益。  

核心规则简明:仅当相关不确定性的预期降低值得付出成本时,才应获取更多上下文。为使不确定性可量化,我们在最优提问(OQA)框架中实例化该思想。OQA将提问转化为基于有限属性表的受控“二十个问题”游戏(Jedynak等,2012)。隐藏目标均匀随机采样,代理每回合针对一个属性提问,通过表格查询获取二值回答(是/否)或分类值。每次对话生成剩余一致集合$C_t$,当多个项目具有相同属性向量时表现为等价类。无噪回答下后验分布在$C_t$上均匀,不确定性精确为熵值$\log_2|C_t|$。  

我们还使用动态规划计算相同允许查询下的最优预期问题数,从而获得相对于预言机的直接规划差距。随后在两种token预算受限的提示工作流中检验相同分析视角:在提示自动补全中,模型可在撰写最终描述前进行多轮澄清;在自动化提示优化中,模型将固定评估预算分配给不同提示变体,通过结果推断最优提示。两种情况下,token均用于购买与隐藏选择相关的证据,该选择对最终决策至关重要。  

此框架接近强化学习与控制即推断(Levine, 2018; Millidge等, 2020)。我们不将主动推理视为RL的竞争对手,其区别在于操作层面:在上下文获取场景中,代理可选择后续观测方式,从而在行动前塑造证据流。期望自由能为此选择提供了紧凑的语言描述。  

### 1.1 主要贡献  
- **上下文获取作为主动推理**:将提问、检索、工具调用、提示试验和检查建模为旨在任务执行前改善信念的动作。  
- **双层单步公式化**:将假设观测下的内部信念更新与外部选择(最小化成本下期望自由能的上下文动作、任务动作或停止动作)分离。  
- **OQA基准测试**:引入最优提问(OQA)——一个确定性属性表基准,模型通过提问识别隐藏目标。  
- **预言机基线与停止规则**:对固定表格使用动态规划计算最优提问策略,并给出上下文获取值得其成本的信息价值条件。  
- **两个基于token预算的提示案例研究**:将同一分析视角应用于生成前澄清与自动化提示优化,将token支出视为主动实验选择。  

我们通过API在OQA上对七个前沿模型(GPT-5、GPT-4.1、Gemini 2.5 Pro、Gemini 2.0 Flash、Claude Sonnet 4.5、Claude Haiku 4.5、Grok 4)进行实证验证,并在两个提示研究中验证想法。附录讨论了单步主动推理的双层视角如何数学建模自适应提示攻击及可能防御,并比较了主动推理与双层强化学习的结构异同。  

## 2 相关工作  
主动推理(Friston等, 2017; Parr & Friston, 2019)通过融入控制理论思想扩展了经典推断。核心思想是选择能最大化信息增益的动作,通过对隐含状态偏好和认知不确定性的显式分解实现。这一信息论视角连接了最优查询与探索的丰富文献:期望信息增益是贝叶斯实验设计的基础(Lindley, 1956; Chaloner & Verdinelli, 1995; Rainforth等, 2024),并通过类似互信息目标驱动主动学习和贝叶斯优化中的动作选择(Houlsby等, 2011; Hennig & Schuler, 2012)。类似地,赌博机中的信息导向采样在遗憾与信息获取间取得平衡(Russo & Van Roy, 2014)。密切相关的工作将交互停止规则构建为查询成本的函数(Haertel等, 2008; Bloodgood & Vijay-Shanker, 2009)。  

#### LLM信息寻求与澄清  
近期工作开始将大语言模型视为主动信息寻求者而非被动响应者。UoT利用不确定性感知模拟和信息增益激励奖励选择后续问题(Hu等, 2024)。主动偏好推断使用LLM提示诱导的概率模型提问信息性偏好问题(Piriyakulkij等, 2023)。CLAMBER评估模型检测和澄清模糊信息需求的能力(Zhang等, 2024),而Ask-when-Necessary研究模糊指令下的工具使用失败(Wang等, 2024)。主动任务消歧与BED-LLM都将澄清建模为LLM代理的贝叶斯实验设计(Kobalczyk等, 2025; Choudhury等, 2025)。关于终止的互补工作(如CaRT)研究代理何时收集足够信息以停止并行动(Liu等, 2025)。  

我们将这些方向与主动推理期望自由能分解相联系,并通过OQA添加精确预言机诊断。OQA在二十问题框架中实例化这些思想,其中连续查询分割假设集直至仅剩目标(Jedynak等, 2012)。广义二分搜索在确定性回答下提供最优分割策略(Nowak, 2011),其扩展处理噪声响应和群组识别(Nowak, 2009; Bellala等, 2010)。算法上,我们的方法类似于元学习的双层优化结构:内循环根据答案更新信念,外循环选择最大化期望效用的问题(Colson等, 2007; Franceschi等, 2018)。这类似于RL中的内在动机,其中信息增益驱动探索(Houthooft等, 2016; Pathak等, 2017),以及在离散或连续提示空间中搜索的提示优化方法(Shin等, 2020; Zhou等, 2023)。主动推理代理已部署于类似场景,从OpenAI Gym环境(Cullen等, 2018)到视觉搜索的认知模型(Cullen等, 2020)。  

#### 主动推理与强化学习  
将主动推理与RL严格对立会有误导性。“控制即推断”展示了RL目标如何表示为概率推断问题(Levine, 2018),Millidge等人指出主动推理与控制即推断主要区别在于奖励、目标或偏好在图形模型中的编码方式(Millidge等, 2020; Millidge, 2021)。Millidge的回顾以通俗语言重申此观点,同时强调期望自由能目标突出了信息增益和探索(Millidge, 2024; Millidge等, 2021)。  

因此我们的贡献并非声称主动推理与RL本质不同,而是主张主动推理分解为可选择行动前购买何种证据的LLM系统提供了紧凑的设计语言。  

**表1:本文使用的操作区分。区别非绝对:RL可包含信息奖励,主动推理可使用RL求解器。**  

## 3 单步主动推理作为双层优化  
在单步主动推理中,我们将信念更新与动作选择分离。设$x \in \mathcal{X}$为潜在状态,$a \in \mathcal{A}$为动作,$o \in \mathcal{O}$为下一个观测。给定似然$p_\theta(o \mid x,a)$和当前信念$q_t(x)$,定义预测分布:  

$$q_t(o \mid a) = \int p_\theta(o \mid x,a) \, q_t(x) \, dx,$$  
$$q_t(x \mid o,a) = \frac{p_\theta(o \mid x,a) \, q_t(x)}{q_t(o \mid a)},$$  

假设相关$o$满足$q_t(o \mid a) > 0$。离散情况下可用求和替代积分。除特别说明外,$\log$表示自然对数,KL散度与互信息单位为纳特;OQA报告熵单位为比特。  

固定$(a,o)$,设$q(x) \in \mathcal{Q}$为候选后验,定义变分自由能:  

$$F_t(q; a,o) = \mathbb{E}_{q(x)} \Big[ \log q(x) - \log p_\theta(o \mid x,a) - \log q_t(x) \Big]$$  
$$= -\log q_t(o \mid a) + \mathrm{KL}\big(q(x) \,\|\, q_t(x \mid o,a)\big).$$  

内部更新为:  

$$q_{t+1}^{\star}(\cdot; a,o) \in \arg\min_{q \in \mathcal{Q}} F_t(q; a,o).$$  

若$\mathcal{Q}$包含$q_t(\cdot \mid o,a)$,则$q_{t+1}^{\star}(x; a,o) = q_t(x \mid o,a)$。在概念验证实验中,$\mathcal{Q}$包含精确后验,故内部更新为闭式解。  

观测偏好由分布$p^{\star}(o)$表示。标准单步期望自由能包含通过$H(o \mid x,a)$惩罚观测模型模糊性的项。在OQA使用的确定性回答场景中,该模糊项为零,动作评分可写为:  

$$G_t(a) = \underbrace{\mathbb{E}_{o \sim q_t(\cdot \mid a)} \big[-\log p^{\star}(o) \big]}_{\text{期望风险}} - \underbrace{\mathbb{E}_{o \sim q_t(\cdot \mid a)} \Big[ \mathrm{KL}\big(q_{t+1}^{\star}(\cdot; a,o) \,\|\, q_t(\cdot)\big) \Big]}_{\text{期望信念KL变化}}.$$  

精确内部更新下,第二项为信息增益项,如下明确:  

###### 命题3.1(互信息形式与确定性特例)  
假设内部解精确,$q_{t+1}^{\star}(x; a,o) = q_t(x \mid o,a)$,预测分布$q_t(o \mid a)$由式(1)给出。则:  

$$\mathbb{E}_{o \sim q_t(\cdot \mid a)} \Big[ \mathrm{KL}\big(q_{t+1}^{\star}(\cdot; a,o) \,\|\, q_t(\cdot)\big) \Big] = I_{q_t}(x; o \mid a),$$  

其中$I_{q_t}(x; o \mid a)$为联合$q_t(x) p_\theta(o \mid x,a)$下的互信息。若$p^{\star}$为常数,式(6)中的风险项与$a$无关,故:  

$$a^{\star} \in \arg\min_a G_t(a) \quad \Longleftrightarrow \quad a^{\star} \in \arg\max_a I_{q_t}(x; o \mid a).$$

相似文章

AI智能体的有效上下文工程

Anthropic Engineering

Anthropic发布指南,将上下文工程定义为提示工程的演进,侧重于为AI智能体筛选最优上下文token,以在多轮推理过程中保持性能和专注度。

基于主动信息搜索的上下文训练

Hugging Face Daily Papers

本文介绍了一种上下文优化方法,该方法通过维基百科搜索和浏览器工具进行主动信息搜索,并结合基于搜索的训练流程,在无需更新模型权重的情况下,在多个领域实现了稳健的性能提升。

AIPO:通过与主动交互学习推理

arXiv cs.CL

本文介绍了 AIPO,一种强化学习框架,通过允许模型在探索过程中主动咨询协作智能体,从而克服能力边界,提升大语言模型的推理能力。

Agent Context

Product Hunt

Agent Context 是一款开发者工具,可让用户将参考项目附加到 AI 编程助手。