智能体模型在信息抽取中的行为可控性:从固定工作流到反思型智能体

arXiv cs.AI 论文

摘要

本文以会议论文数据集抽取为测试平台,研究反思与记忆等智能体机制是否能在学术PDF信息抽取中,相对于固定LLM工作流带来可控的改进。

arXiv:2607.15715v1 公告类型:新 摘要:大型语言模型(LLM)智能体越来越多地被用于复杂的信息抽取任务,但尚不清楚反思与记忆等智能体组件是否能在固定LLM工作流之上带来可观察且可控的改进。我们通过会议论文数据集抽取来研究这一问题,该方法需要系统识别学术PDF中提及的数据集并生成结构化记录。我们将固定工作流基线方案与反思型智能体变体进行比较,并指定了一种优化的智能体条件(S2),该条件通过更丰富的PDF工具和动态工具选择扩展了相同任务。我们的评估侧重于过程级行为——包括工具执行、重试、反思、记忆使用、运行时间和故障恢复——同时将抽取覆盖率和字段完整性作为次要结果指标。本文描述了智能体机制在何种情况下改变系统行为、这些改变是否能改善任务完成,以及观察到的故障模式如何在同一评估框架下促使优化智能体设计。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:22

# 信息提取中智能体模型的行为可控性:从固定工作流到反思型智能体
来源:https://arxiv.org/html/2607.15715
###### 摘要

大型语言模型(LLM)智能体越来越多地被用于复杂的信息提取任务,然而目前尚不清楚反思和记忆等智能体组件是否能比固定LLM工作流带来可观察和可控的改进。我们通过会议论文数据集提取来研究这个问题,系统需要识别学术PDF中提到的数据集并生成结构化记录。我们比较了一个固定工作流基线与反思型智能体变体,并指定了一个优化智能体条件(S2),该条件通过更丰富的PDF工具和动态工具选择扩展了相同任务。我们的评估强调过程级行为——包括工具执行、重试、反思、记忆使用、运行时和故障恢复——同时将提取覆盖率和字段完整性作为次要结果指标。本文描述了智能体机制何时改变系统行为,这些变化是否改善任务完成,以及观察到的故障模式如何在同一评估框架下激发优化的智能体设计。

## 1 引言

大型语言模型(LLM)越来越多地被嵌入到不仅仅是生成对单个提示的单一回复的系统中。现代智能体系统将LLM连接到外部工具,维护中间状态,将任务分解为多个动作,反思失败或不完整的输出,有时还通过记忆重用先前的经验(Yao等人2023(https://arxiv.org/html/2607.15715#bib.bib1);Schick等人2023(https://arxiv.org/html/2607.15715#bib.bib2);Shinn等人2023(https://arxiv.org/html/2607.15715#bib.bib3);Packer等人2023(https://arxiv.org/html/2607.15715#bib.bib7))。这些能力对于复杂的信息提取任务尤其有吸引力,在这些任务中,所需的证据可能分布在长文档中,而单个提示不太可能捕获所有相关上下文。

与此同时,很难确定智能体组件是否真的使此类系统更可控。像AgentBench和WebArena这样的智能体基准表明,使用工具的智能体可以在交互环境中进行评估,但它们也揭示了自主执行与可靠任务完成之间的持续差距(Liu等人2024(https://arxiv.org/html/2607.15715#bib.bib8);Zhou等人2023(https://arxiv.org/html/2607.15715#bib.bib9))。一个固定的LLM工作流已经可以成为一个强大的基线:它可以解析文档,应用精心设计的提示,验证结构化输出,并以可重复的顺序保存记录。相比之下,智能体可能会执行额外的动作,重试不确定的步骤,查阅记忆,或在继续之前调用反思。这些行为可能会改善覆盖率或从错误中恢复,但也可能增加运行时,放大错误,或创建更难调试的执行轨迹。因此,关键问题不仅仅在于智能体是否提取了更多记录,而在于它的行为是否以对任务有用且可观察、可配置和可重复的方式发生变化。

我们在学术数据集提取的场景中研究这个问题。先前的科学文本挖掘资源和数据集提及研究表明,学术文档包含丰富的元数据、解析后的全文以及需要检测和链接的模糊数据集提及(Lo等人2020(https://arxiv.org/html/2607.15715#bib.bib10);Pan等人2023(https://arxiv.org/html/2607.15715#bib.bib11);Heddes等人2021(https://arxiv.org/html/2607.15715#bib.bib12))。给定会议论文PDF及相关元数据,系统必须识别每篇论文中提到的数据集,并生成包含数据集名称、描述、任务或领域、论文引用、来源链接和平台等字段的结构化数据集记录。这个任务是智能体信息提取的现实测试平台。数据集证据可能出现在摘要、方法章节、实验、表格、标题、附录、参考文献、代码链接或补充材料中。提及可能是缩写、模糊、不完整,或者与模型名称和基准套件混合在一起。遵循固定序列的工作流可能会错过其初始提取范围之外的证据,而智能体有机会通过扩展搜索、使用不同提示重试或利用先前论文的经验来对低质量的中间结果做出反应。

参见标题图1:引言动机。数据集证据分散在论文各个部分、表格、图表、参考文献和URL中。固定工作流可能会错过其初始提取路径之外的证据,而反思型智能体可以重试、查阅记忆,并使恢复行为可观察。我们使用这个任务来检验*行为可控性*:系统决策和适应的可观察性、可配置性、可重复性和跨实验条件的可比性程度。可观察性要求暴露工具调用、中间输出、反思事件、重试、记忆访问、错误和停止决策的轨迹。可配置性要求明确的参数,如重试限制、反思设置、记忆注入和质量阈值。可重复性要求记录提示、模型设置、工具行为和运行元数据。可比性要求工作流和智能体系统在相同的文档、输出模式及评估程序上运行。

因此,我们的实证重点是以过程为中心。我们将一个固定工作流基线与实现ReAct式工具使用、反思、重试策略和记忆的智能体变体进行比较,并定义了一个优化的S2智能体,该智能体拥有十二个原子工具和动态规划,在相同的语料库和模式上运行。我们测量最终输出,如数据集记录数和字段完整性,但仅将其视为证据的一部分。主要证据来自执行轨迹:动作序列、工具使用、反思频率、重试行为、记忆注入、故障恢复、运行时间和可重复性产物。

这一框架引出了三个研究问题:

- •RQ1:在相同的提取任务上,智能体的决策过程与固定工作流有何不同?
- •RQ2:反思和记忆是否在工具使用、重试、错误恢复和提取结果方面产生可测量的变化?
- •RQ3:观察到的反思型提取智能体的行为提示了哪些系统级优化?

本文做出以下贡献:

- •我们在共享的语料库、输出模式和执行框架下,提出了固定工作流与智能体数据集提取系统的受控比较。
- •我们提出了一个以过程为中心的评估框架,除了最终提取结果外,还测量可观察的智能体行为。
- •我们分析了反思、记忆、质量感知重试和工具策略如何影响提取轨迹、恢复行为、运行时间和结果集。
- •我们指定了一个拥有十二个原子工具和动态规划的S2优化智能体,并在相同语料库、模式和日志框架下,给出了S0–S1b的实证结果及其评估协议。
- •我们得出了构建学术提取智能体的实用设计经验,这些智能体的行为不仅有能力,而且可检查、可调校、可重复。

## 2 相关工作

### LLM智能体与工具使用

越来越多的工作将LLM视为交织语言推理与外部动作的控制器。ReAct(Yao等人2023(https://arxiv.org/html/2607.15715#bib.bib1))在交错循环中生成推理轨迹和工具调用,与仅推理或仅动作的基线相比,提高了可解释性并减少了错误传播。Toolformer(Schick等人2023(https://arxiv.org/html/2607.15715#bib.bib2))表明,模型可以通过自监督过滤候选工具调用来学习何时以及如何调用API,而无需针对特定任务的微调。这些系统与固定提取流水线的不同之处在于,动作选择可以依赖于中间观察结果,而不是预定的阶段顺序。我们的S1智能体采用ReAct式模式——观察、思考、行动和反思——而S0在相同的工具和模式上仍然是固定工作流。像AgentBench(Liu等人2024(https://arxiv.org/html/2607.15715#bib.bib8))和WebArena(Zhou等人2023(https://arxiv.org/html/2607.15715#bib.bib9))这样的基准在多环境和现实网络设置中评估自主智能体,但主要报告最终任务的成功,而不是我们可控性分析所关心的内部决策轨迹。

### 反思与自我修正

反思和迭代优化旨在在初始生成后改进输出。Reflexion(Shinn等人2023(https://arxiv.org/html/2607.15715#bib.bib3))将口头自我批评存储在情景记忆中,并在多个试验中重用它们而无需权重更新,在编程和决策任务中取得了巨大收益。Self-Refine(Madaan等人2023(https://arxiv.org/html/2607.15715#bib.bib4))在多样化的生成任务中,使用相同的LLM交替反馈和优化步骤。我们的S1a/S1b条件通过基于规则和基于LLM的反思(结合质量感知重试)实现了相关模式。然而,Huang等人(2024(https://arxiv.org/html/2607.15715#bib.bib5))认为,内在的自我修正——仅使用模型自身的判断进行修正,缺乏可靠的外部反馈——在推理任务上常常失败,甚至可能降低性能;报告中的收益通常依赖于反馈步骤中的标签或更强的提示。这一警告与我们的实证发现一致:在固定的重试预算下,LLM反思会显著改变过程信号,但输出增益却很小。

### 记忆与经验重用

长时程智能体需要保留和检索过去上下文的机制。生成式智能体(Park等人2023(https://arxiv.org/html/2607.15715#bib.bib6))维护自然语言记忆流,定期综合更高层次的反思,并检索记忆以在交互式沙盒中规划社交行为。MemGPT(Packer等人2023(https://arxiv.org/html/2607.15715#bib.bib7))采用受操作系统启发的虚拟上下文管理器,在工作上下文和外部存储之间分页信息,使得在模型的原生上下文窗口之外也能进行文档分析和多会话聊天。我们的智能体存储短期和长期的提取经验,并可选地将检索到的记忆注入提示,这更接近Reflexion风格的情景重用,而非MemGPT的分页架构。这两条先行工作都强调了过时、不相关或错误记忆的风险;因此,我们的S2设计将记忆过滤和压缩作为明确目标。

### 学术信息提取

科学文本挖掘长期以来依赖于结构化语料库和专门的提及检测器。S2ORC(Lo等人2020(https://arxiv.org/html/2607.15715#bib.bib10))提供大规模的学术元数据、解析后的全文以及链接的行内引用、图表和表格——这些基础设施激励了比整文档摘要更丰富的PDF工具。对于以数据集为中心的提取,DMDD(Pan等人2023(https://arxiv.org/html/2607.15715#bib.bib11))提供了最大的公开语料库,用于数据集提及检测和链接,包含弱监督的文本内跨度以及人工标注的评估集;它突显了数据集、方法和任务名称之间的模糊性以及实体链接的需求。更早的工作由Heddes等人(2021(https://arxiv.org/html/2607.15715#bib.bib12))将数据集名称识别视为对会议论文句子的命名实体识别,并发布了带有长枚举标签序列的黄金标准标注集。这些研究侧重于提及检测准确性和语料库构建,而我们的任务还要求结构化记录生成、链接验证以及在初始提取不完整时的智能体恢复。PDF布局、表格、标题、参考文献和外部URL仍然是实践中的瓶颈,与我们案例研究中观察到的证据验证差距相一致。

### 智能体评估与可控性

智能体基准越来越强调长时程、现实的任务。AgentBench(Liu等人2024(https://arxiv.org/html/2607.15715#bib.bib8))在八个交互环境中使用可比较的成功指标评估LLM智能体,揭示了不同模型和设置之间的巨大能力差距。WebArena(Zhou等人2023(https://arxiv.org/html/2607.15715#bib.bib9))提供可重复、功能完整的网站和编程验证器,用于功能任务正确性,表明即使强大的LLM智能体在日常网页任务上仍远低于人类表现。这些基准对于衡量智能体完成了什么至关重要,但对重试、工具选择策略、记忆注入和故障恢复的可见性有限。我们的工作通过一个以过程为中心的框架补充了面向结果的评估,该框架在受控干预(S0与S1a/S1b与S2)下记录动作轨迹、反思事件、重试决策和运行清单。我们认为,行为可控性——可观察性、可配置性、可重复性和可比性——本身就是学术提取智能体的一个评估目标,而不仅仅是最终记录数量。

## 3 任务与实验框架

### 任务定义

该任务的输入是一组会议论文PDF及其可用的论文元数据,例如标题、会议、年份、作者和来源URL。输出是一个JSONL文件,包含每篇处理论文的零个或多个数据集记录。每条记录包括数据集标识符、数据集名称、自由文本的数据集描述、结构化的类型/领域/字段标签、论文引用元数据、发现时的数据集链接以及诸如GitHub、HuggingFace、OpenML或未指定的平台标签。工作流基线和智能体系统使用相同的输出模式,以便差异可以归因于系统行为而非下游格式化。

分析单元是多层次的。在结果层面,我们统计最终数据集记录、覆盖的唯一论文数、字段完整性、链接可用性和结果集重叠。在过程层面,我们分析PDF解析、LLM提取调用、反思事件、重试、记忆注入、工具执行统计和运行元数据。这一区分很重要,因为该项目不仅被设计为数据集构建流水线;它还是一个观察智能体机制如何改变信息提取系统行为的评估框架。

### 实验条件

我们在相同的NeurIPS 2024提取设置下比较四种条件:

- •S0 工作流:一个在`main_neurips.py`中实现的固定提取工作流。它遵循预定的顺序:下载或加载论文,解析PDF,提取论文元数据,提取数据集名称,提取数据集详细信息,并将记录追加到输出JSONL文件中。没有反思,没有记忆,也没有智能体级别的重试策略。
- •S1a 规则反思智能体:一个在`main_agent.py`中实现的智能体系统。它使用ReAct式控制器、工具管理器、基于规则的反思、质量感知重试和记忆注入,基于LLM的反思被禁用。
- •S1b LLM反思智能体:与S1a相同的智能体框架,但在规则反思之外启用基于LLM的反思。
- •S2 优化智能体:一个在`main_agent_s2.py`中实现的扩展智能体。它保留S1的反思、记忆和

相似文章

科学领域的代理型AI实验

arXiv cs.AI

本文介绍了两个代理型AI框架:DeepTS/DeepCollector和DeepScribe,它们利用混合本地-云端架构和大语言模型,自动化科学工作流程,包括时间序列数据整理以及将物理讲座转化为结构化报告。

对自动化工作流中代理失调的冷静审视

arXiv cs.AI

本文研究了自动化工作流中的多代理系统中的代理失调问题,提出了代理证据归因(Agentic Evidence Attribution, AEA)方法,利用上下文特定的证据纠正代理行为的不对齐。

学习构建实用的智能体系统

arXiv cs.LG

本文提出了设计和优化实用智能体LLM系统的原则性方法,引入了一个包含伪工具和固定工作流的框架,以提高模块化、成本效益和跨多种任务的准确性。