InsightEmb:学习面向智能体洞察检索的动作意图嵌入

arXiv cs.CL 论文

摘要

InsightEmb 是一种用于智能体洞察检索的对比嵌入框架,仅通过数学推理数据即可学习面向进展的检索几何结构,从而在无需环境特定训练的情况下改进 LLM 智能体的检索效果。

arXiv:2608.04761v1 公告类型:新 摘要:自我改进型智能体会从先前的轨迹中积累可复用的洞察,这使得检索在将积累的经验转化为可执行的指导方面变得越来越重要。在每个决策步骤中,检索正确的洞察可以帮助智能体朝着目标前进,我们将这种设置称为智能体洞察检索。然而,现有的检索方法主要建模语义相似性,而忽略了检索到的洞察是否解决了智能体当前的决策瓶颈。我们提出了 InsightEmb,这是一种对比嵌入框架,仅使用数学推理数据即可学习可迁移的、面向进展的检索几何结构。InsightEmb 联合学习将具体情境与抽象启发式规则对齐,并将具有相似进展结构的推理轨迹进行聚类。我们在动态智能体任务和一个静态技能检索基准上评估了 InsightEmb。在没有任何环境特定训练的情况下,InsightEmb 在所有评估中均取得了改进,超越了现有推理嵌入模型的性能。这些结果表明,状态-洞察匹配的几何结构可以跨领域迁移,从而能够利用公开可用的推理数据进行有效训练,而无需昂贵的环境特定监督。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:50

# 学习用于智能体洞察检索的动作意图嵌入
来源:https://arxiv.org/html/2608.04761
Tsz Ting Chung¹ Jiangnan Li² Jie Zhou² Mo Yu²,†  
† ¹香港科技大学 ²腾讯微信AI

###### 摘要

自我改进的智能体会从先前的轨迹中积累可复用的洞察,这使得检索在将积累的经验转化为可执行的指导时变得越来越重要。在每个决策步骤中,检索到正确的洞察能够帮助智能体朝着目标前进,我们将这一设定称为**智能体洞察检索**。然而,现有检索方法主要建模语义相似性,而忽略了所检索到的洞察是否解决了智能体当前的决策瓶颈。我们提出**InsightEmb**,一种对比嵌入框架,它**仅**使用数学推理数据就能学习可迁移的、面向进度的检索几何结构。InsightEmb 联合学习将具体情境与抽象启发式规则对齐,并将具有相似进度结构的推理轨迹聚类。我们在动态智能体任务和一个静态技能检索基准上对 InsightEmb 进行了评估。在没有任何环境特定训练的情况下,InsightEmb 在所有评估中均取得了改进,超过了现有推理嵌入模型的性能。这些结果表明,状态与洞察匹配的几何结构可以跨领域迁移,从而能够仅依靠公开可用的推理数据进行有效训练,而无需昂贵的环境特定监督。

## 1 引言

基于 LLM 的智能体在交互式环境中(例如网页导航(Yao等人, 2022 https://arxiv.org/html/2608.04761#bib.bib32)、具身任务(Shridhar等人, 2021 https://arxiv.org/html/2608.04761#bib.bib23)和工具使用(Schick等人, 2023 https://arxiv.org/html/2608.04761#bib.bib21))通过 ReAct(Yao等人, 2023 https://arxiv.org/html/2608.04761#bib.bib33)等框架将推理与行动交织在一起。它们必须在巨大的动作空间中做出选择,而最优策略往往依赖于抽象推理,而非表层模式匹配。为智能体提供**洞察**——从过往经验中提炼出的抽象规则(例如“在随机探索之前先检查可能存在的位置”)——已被证明是有效的(Majumder等人, 2023 https://arxiv.org/html/2608.04761#bib.bib19;Wang等人, 2024 https://arxiv.org/html/2608.04761#bib.bib28;Zhao等人, 2024 https://arxiv.org/html/2608.04761#bib.bib29),但智能体必须在每一步动态地检索出最相关的洞察。我们聚焦于这个未被充分界定的检索问题:相关洞察是指给定智能体当前的状态、目标和动作历史,**在当前操作上最有用的那一个**。

图1:InsightEmb 检索的是能够解决智能体**当前**流程瓶颈的洞察,而不仅仅是主题重叠。左图:数学任务与具身任务之间的抽象鸿沟以及共享的情境到洞察结构。右图:在 ALFWorld 的“烫手山芋”任务中,Base 在找到物体之前倾向于检索加热规则,而 InsightEmb 则检索先搜索的指导。

这种动态检索带来了我们称之为**抽象鸿沟**的挑战:查询(智能体当前的观察和动作历史)与目标(抽象洞察)处于不同的抽象层级,而相关性取决于智能体的**下一步意图**(在进展之前需要解决什么瓶颈),而非主题相似性。标准嵌入模型匹配的是表层语义,因此现成的检索器会返回主题相关但在流程上为时过早的洞察,例如在智能体尚未定位到目标物体时返回状态转换规则(图1 https://arxiv.org/html/2608.04761#S1.F1)。我们的关键观察是,这种**情境到洞察**的匹配问题并非领域特定的:无论是数学查询(例如将“P(至少一个红色)”与补集计数相匹配,二者没有词汇重叠),还是具身任务(在加热或放置类洞察适用之前,首先解决**定位物体**的瓶颈),都需要推断具体情境背后的潜在瓶颈,并检索出能够促成下一步有效动作的抽象规则。

我们提出**InsightEmb**,一个利用这种跨领域结构的对比训练框架。InsightEmb 分两个阶段训练嵌入模型,**完全基于公开可用的数学推理数据**:(1) **情境到洞察匹配** 通过将数学问题和(部分的)思维链轨迹映射到相关的启发式规则,教会模型弥合抽象鸿沟。(2) **情境到经验匹配** 教授推理轨迹之间的结构相似性识别,强化模型识别不同表象下需要相同底层策略的能力。在推理时,训练好的模型为 ALFWorld(Shridhar等人, 2021 https://arxiv.org/html/2608.04761#bib.bib23)、WebShop(Yao等人, 2022 https://arxiv.org/html/2608.04761#bib.bib32)和 ScienceWorld(Wang等人, 2022b https://arxiv.org/html/2608.04761#bib.bib24)中的 LLM 智能体检索洞察,并使用 SRA-Bench 作为静态技能检索诊断。这些评估在没有任何环境特定训练数据的情况下,检验了动态状态条件检索和静态技能适用性。

我们的贡献有三点:
- 我们将智能体洞察检索形式化为目标条件下的动作意图匹配。相关性由洞察是否解决当前瓶颈并促成进展来定义,而不仅仅依赖语义相似性。
- 我们引入了 InsightEmb,一种用于面向动作的检索几何结构的跨领域对比训练框架,并进行了实证验证。
- 我们在静态和动态评估中的实证结果表明,InsightEmb 在更少步数内就能达到有效性能。分析进一步表明,性能提升来自面向动作意图的检索。

## 2 相关工作

##### 检索增强的 LLM 智能体。
RAG(Lewis等人, 2020 https://arxiv.org/html/2608.04761#bib.bib18;Guu等人, 2020 https://arxiv.org/html/2608.04761#bib.bib15)已被扩展到能够检索过往经验(Shinn等人, 2023 https://arxiv.org/html/2608.04761#bib.bib22;Majumder等人, 2023 https://arxiv.org/html/2608.04761#bib.bib19;Packer等人, 2023 https://arxiv.org/html/2608.04761#bib.bib55)、工具文档(Qin等人, 2024 https://arxiv.org/html/2608.04761#bib.bib20)和技能(Wang等人, 2024 https://arxiv.org/html/2608.04761#bib.bib28)的智能体。这些系统面向的是**具体**的产物,表面相似性通常已足够;而我们检索的是**抽象**的启发式规则,几乎没有词汇重叠,标准检索器在此失效,现成的或领域内的嵌入器也会错失智能体目标。另一条互补的研究线索是管理已检索到的上下文本身,例如提示压缩(Chung等人, 2024 https://arxiv.org/html/2608.04761#bib.bib11)和长上下文激活近似(Li等人, 2026b https://arxiv.org/html/2608.04761#bib.bib5),这与**该检索哪条**洞察的问题是正交的。

##### 基于经验的智能体学习。
Reflexion(Shinn等人, 2023 https://arxiv.org/html/2608.04761#bib.bib22)、CLIN(Majumder等人, 2023 https://arxiv.org/html/2608.04761#bib.bib19)和 Voyager(Wang等人, 2024 https://arxiv.org/html/2608.04761#bib.bib28)积累情景记忆、因果抽象或技能,而 ExpeL(Zhao等人, 2024 https://arxiv.org/html/2608.04761#bib.bib29)和 AutoGuide(Fu等人, 2024 https://arxiv.org/html/2608.04761#bib.bib56)在不进行权重更新的情况下将轨迹提炼为文本规则。它们关注的是**存储什么**,而我们解决的是**何时**检索正确的已存知识,并且不关心洞察是如何产生的。大规模上下文学习进一步凸显了呈现正确先前经验的价值,因为所检索的示范能够带来学习增益(Chung等人, 2026 https://arxiv.org/html/2608.04761#bib.bib12)。

##### 面向推理的稠密检索。
稠密检索器(Karpukhin等人, 2020 https://arxiv.org/html/2608.04761#bib.bib16;Xiong等人, 2021 https://arxiv.org/html/2608.04761#bib.bib31;Wang等人, 2022a https://arxiv.org/html/2608.04761#bib.bib27;Su等人, 2023 https://arxiv.org/html/2608.04761#bib.bib26;Xiao等人, 2023 https://arxiv.org/html/2608.04761#bib.bib57)以及 MTEB(Muennighoff等人, 2023 https://arxiv.org/html/2608.04761#bib.bib52)和 BRIGHT(Su等人, 2025 https://arxiv.org/html/2608.04761#bib.bib48)等基准表明,即便有了强大的语义匹配,推理密集型检索也远未解决。ReasonIR(Shao等人, 2025 https://arxiv.org/html/2608.04761#bib.bib49)、Llama-NV-Embed-Reasoning(NVIDIA, 2026 https://arxiv.org/html/2608.04761#bib.bib50)(BRIGHT 上表现最佳的开源**单模型**嵌入器)和 ReasonEmbed(Chen等人, 2025 https://arxiv.org/html/2608.04761#bib.bib51)为静态查询-段落支持训练对比嵌入器。其他工作通过嵌入模型(Wu等人, 2025c https://arxiv.org/html/2608.04761#bib.bib1;2025b https://arxiv.org/html/2608.04761#bib.bib2)和内存感知重排序(Li等人, 2025 https://arxiv.org/html/2608.04761#bib.bib3;2026a https://arxiv.org/html/2608.04761#bib.bib4)使检索具有**上下文感知**能力,但那里的相关性仍然定义为匹配固定查询,而不是判断检索到的条目是否推动智能体朝目标前进。我们的目标则是在演化的智能体状态下关注**下一步效用**:洞察是否解决当前瓶颈,而不仅仅是它是否蕴含固定查询。

##### 智能体基准。
ALFWorld(Shridhar等人, 2021 https://arxiv.org/html/2608.04761#bib.bib23)、WebShop(Yao等人, 2022 https://arxiv.org/html/2608.04761#bib.bib32)、ScienceWorld(Wang等人, 2022b https://arxiv.org/html/2608.04761#bib.bib24)、Mind2Web(Deng等人, 2023 https://arxiv.org/html/2608.04761#bib.bib13)和 WebArena(Zhou等人, 2024 https://arxiv.org/html/2608.04761#bib.bib14)在状态条件查询下评估具身、科学和网页控制,AgentBench(Liu等人, 2024 https://arxiv.org/html/2608.04761#bib.bib46)则覆盖更多交互式环境。此前的评估工作大致分为两个阵营:长上下文上的检索(Yu等人, 2025a https://arxiv.org/html/2608.04761#bib.bib7)以及推理或理解基准(Yu等人, 2025b https://arxiv.org/html/2608.04761#bib.bib8;Chung等人, 2025 https://arxiv.org/html/2608.04761#bib.bib9;Wu等人, 2025a https://arxiv.org/html/2608.04761#bib.bib10)。一个同时针对**面向推理和行动指导的检索**的基准在很大程度上仍是空白。BRIGHT(Su等人, 2025 https://arxiv.org/html/2608.04761#bib.bib48)和 SRA-Bench(Su等人, 2026 https://arxiv.org/html/2608.04761#bib.bib47)开始填补这一空白,后者在混合了黄金技能与干扰技能的情况下测试静态任务到技能的检索,并通过将检索与在线执行相分离来补充动态智能体基准。

## 3 方法

### 3.1 问题设定

一个 LLM 智能体在交互式环境中运行,在每一步 \(t\),它观察到状态 \(s_{t}\)(任务描述、动作历史、当前观察),并且必须按照推理-行动循环(Yao等人, 2023 https://arxiv.org/html/2608.04761#bib.bib33)朝着目标 \(g\) 选择动作 \(a_{t}\)。智能体可以访问一个洞察语料库 \(\mathcal{I}=\{I_{1},\ldots,I_{N}\}\),其中每条洞察 \(I_{i}\) 都是对抽象规则和策略的自然语言描述。我们将这一任务视为**目标条件下的溯因检索**:给定当前状态和目标,检索出最能识别出哪种干预能够促成进展的洞察。我们对相关性的定义是**面向进度的**:如果一条洞察预期能够缩小与目标之间的差距,它就是有用的,而不仅仅是因为它与查询在语义上相似。我们将这一目标表示为:

\[
I^{*}=\arg\max_{I\in\mathcal{I}}\;\mathbb

相似文章

InSight-doc:面向长文档理解的智能体视觉感知

Hugging Face Daily Papers

InSight-doc 是一个面向长文档理解的智能体视觉感知框架,在推理过程中自适应地分配视觉分辨率,在提高文档 VQA 基准准确率的同时减少幻觉和推理延迟。该论文发布了 8B 模型、数据集和代码。

Q-RAG:通过基于价值的 Embedder 训练实现长上下文多步检索

Hugging Face Daily Papers

Q-RAG 引入了一种基于强化学习的 Embedder 模型微调方法,以实现高效的多步检索,并在长达 10M token 的长上下文基准测试中取得了最先进的结果。该方法为微调小型 LLM 以处理复杂的多步搜索任务提供了一种资源高效的替代方案。