技能契约型智能体用于证据感知材料文献分析

arXiv cs.CL 论文

摘要

本文介绍了AlphaAgent,一个面向证据感知材料文献分析的技能驱动智能体框架,该框架将基于检索的问答与报告生成解耦,并在40个材料科学问题上优于基线系统。

arXiv:2607.20431v1 公告类型:新 摘要:材料科学文献分析需要同时关注成分、加工、表征和性能关系,然而传统的检索增强生成流水线难以在单一的“检索-生成”架构中协调异构任务。本文提出了AlphaAgent,一个技能驱动的智能体框架,通过显式的技能契约将基于检索的问答与论文级报告生成相解耦。专门的检索技能将用户请求重写为材料特定的搜索意图,查询来自期刊引证报告冶金与冶金工程类别中精心策划的30多万篇论文索引,并在初始证据不足时重新制定查询。独立的报告生成技能解析全文本PDF,生成结构化的单篇论文分析报告和跨论文摘要。在对40个材料科学问题的盲评中(其中一半需要深度分析推理),AlphaAgent在底层模型、文档索引和检索规模相匹配的情况下显著优于基线系统,在机械解释和可信度边界意识方面提升最大。这些结果表明,明确的任务分离、精细化的搜索意图和证据感知的生成能够改进基于大语言模型的材料研究文献分析。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:15

# Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis
Source: https://arxiv.org/html/2607.20431
###### 摘要

材料科学文献分析需要同时关注成分、加工、表征和性能之间的关系,然而传统的检索增强生成流程难以在单一的检索-生成架构中协调异构任务。本文提出AlphaAgent,一个技能驱动的智能体框架,通过明确的技能契约将基于检索的问答与论文级报告生成解耦。专用检索技能将用户请求重写为材料特定的搜索意图,查询来自《期刊引用报告》冶金与冶金工程类别的超过30万篇论文的精选索引,并在初始证据不足时重新表述查询。独立的报告生成技能解析全文PDF,生成结构化的单篇论文分析报告和跨论文摘要。在40个材料科学问题的盲评中,其中一半需要深度分析推理,AlphaAgent显著优于具有相同底层模型、文档索引和检索规模的基线系统,在机理解释和可信度边界意识方面提升最大。这些结果表明,明确的任务分离、精细化的检索意图和证据感知的生成方式能改善基于大语言模型的材料研究文献分析。

## I. 引言

材料科学的进步依赖于对已发表证据的累积性解读。材料科学中的许多问题并非由单一研究解决;它们需要比较成分、加工历史、表征和测试条件,所有这些都会影响对报告机理或特性的解读方式[15 (https://arxiv.org/html/2607.20431#bib.bib19),13 (https://arxiv.org/html/2607.20431#bib.bib20)]。材料文献的加速增长使得这种证据综合成为实际瓶颈[2 (https://arxiv.org/html/2607.20431#bib.bib23)],尤其是对于需要事实检索和多研究间机理比较的问题。大语言模型(LLMs)的最新进展为材料文献分析创造了新机遇[17 (https://arxiv.org/html/2607.20431#bib.bib3),5 (https://arxiv.org/html/2607.20431#bib.bib1),4 (https://arxiv.org/html/2607.20431#bib.bib2),8 (https://arxiv.org/html/2607.20431#bib.bib4)]。与传统的检索或特定任务文本挖掘流程不同,LLM能够以问题为条件读取非结构化科学文本,关联以不同术语和报告风格表达的证据,并将相关发现组织成连贯的回应,供下游解读。当与外部源检索结合时,它们为能够以现代材料科学的规模和复杂性运行的文献分析系统提供了实用基础。

当前基于LLM的方法在科学文献分析中仍面临重要限制。没有外部基础,通用LLM可能产生事实无支持的陈述,这一限制在材料科学中尤其成问题,因为解读在很大程度上依赖于实验上下文[7 (https://arxiv.org/html/2607.20431#bib.bib5)]。基于网页浏览和搜索的系统通过将答案链接到在线来源来降低这一风险[14 (https://arxiv.org/html/2607.20431#bib.bib6),18 (https://arxiv.org/html/2607.20431#bib.bib22)],但开放网络搜索无法始终区分同行评审的原始研究、未经评审的预印本以及二次或通俗化摘要。基于精选文档索引的检索增强生成(RAG)解决了源控制问题的部分[9 (https://arxiv.org/html/2607.20431#bib.bib7),6 (https://arxiv.org/html/2607.20431#bib.bib25)],但材料科学文献分析中仍存在重要困难。材料术语具有很强的上下文依赖性:相同的相名、加工术语或性能描述符在不同材料体系和表征设置中可能具有不同含义,给语义检索引入歧义[19 (https://arxiv.org/html/2607.20431#bib.bib24)]。另一个困难出现在排序阶段,匹配的段落通常不成比例地来自引言和摘要,导致LLM将其答案基于宽泛浅层的摘要而非更具体的分析证据[11 (https://arxiv.org/html/2607.20431#bib.bib8)]。除检索之外,当前系统在所提供的科学综合形式上也仍然有限。大多数RAG流程或通用LLM返回简短的回答式摘要,但材料科学中的严格文献工作通常需要对完整论文进行结构化、信息感知的阅读,包括从正文、图表和标题中提取实验方案、微观结构证据和机理解读[21 (https://arxiv.org/html/2607.20431#bib.bib11),1 (https://arxiv.org/html/2607.20431#bib.bib12)]。

本文介绍AlphaAgent,一个用于材料科学文献分析的技能驱动框架,将基于检索的问答与结构化论文级阅读相结合。AlphaAgent将文献工作分解为两个受契约约束的技能:一个检索技能,从精选文献索引中产生受证据控制的答案;一个报告生成技能,将经过验证的论文集转化为文档级分析报告[22 (https://arxiv.org/html/2607.20431#bib.bib13),16 (https://arxiv.org/html/2607.20431#bib.bib14),10 (https://arxiv.org/html/2607.20431#bib.bib26),3 (https://arxiv.org/html/2607.20431#bib.bib10)]。检索技能将用户问题转换为材料特定的搜索意图,在检索过程中保持目标材料体系、实验上下文、关注的性能和分析焦点的关联。然后它评估返回的证据是否充分符合这一意图,并在证据过于宽泛、浅层或科学不匹配时,基于原始意图和观察到的证据差距重新表述查询。报告生成技能进而将经过验证的论文集扩展为结构化阅读输出,通过解析全文PDF并生成单篇论文分析报告和跨论文综合。这些报告组织报告发现、证据范围和阅读路径,以支持超越简短摘要式输出的证据基础解读。我们在40个材料科学问题上评估AlphaAgent生成的答案,涵盖一般概念性任务和深度分析任务。在匹配条件下——相同的模型、文档索引和检索规模——AlphaAgent在深度分析问题上显著优于传统RAG基线,在机理解释和可信度边界意识方面提升最大。这些结果共同表明,明确的任务分离、检索意图细化和证据感知的答案生成能使基于LLM的文献分析对材料研究更加可靠。

## II. 框架概述与技能驱动设计

### II-A 系统组织

AlphaAgent是用于材料科学文献分析的任务执行器。运行环境解释用户请求并将其路由到技能,技能的契约定义了预期输入、输出工件、允许的工具和失败行为。该框架提供两大核心能力:基于检索的问答将用户问题转化为面向搜索的查询,从材料文献索引中检索证据,并将答案基于片段和论文元数据;论文报告生成在文档级别分析选定论文,产生单篇论文报告和跨论文摘要。这两个技能组成一个流程,其中检索先于报告生成,生成的查询记录为报告阶段提供论文引用和文档标识符。此设计基于最近关于工具使用语言模型和智能体工作流的研究[22 (https://arxiv.org/html/2607.20431#bib.bib13),16 (https://arxiv.org/html/2607.20431#bib.bib14),20 (https://arxiv.org/html/2607.20431#bib.bib9)],技能边界围绕文献工作的实际结构塑造。

技能是由语义输入契约、输出工件模式、允许的证据源和工具、验证条件以及失败行为定义的有界智能体能力。工作流排序操作;技能契约约束哪些证据可以使用、哪些中间状态有效以及下游阶段如何使用所产生的工件。这一区分对科学文献分析很重要,因为它保留了从源材料到最终输出整个过程中结论的证据基础。通过将每个阶段绑定到明确的证据约束,该框架保持了从源材料到最终输出的解读链的完整性。

### II-B 技能契约

每个技能在契约下运行,契约规定了它可以读取什么、必须写入什么工件以及哪些操作在其范围之外。检索技能产生一个查询结果,包含原始用户问题、重写的检索查询、片段、论文元数据、文档引用和引文信息。当进行多次检索尝试时,智能体选择最匹配的证据作为“提升的查询结果”。该工件包含原始问题、重写的检索意图、选定的片段和论文记录、文档引用、引文元数据以及证据评估结果。只有这个提升的工件支持答案生成或为报告生成提供论文引用。

报告生成技能接受提升的查询结果、论文引用和文档标识符,然后产生一个批次报告记录、每个论文的深度报告草稿、渲染的报告,以及在足够多的单独报告成功时生成的查询级摘要。这种基于契约的设计将语义决策与运行时机制分开。智能体解释用户请求、编写检索意图并组织报告内容;运行时实现查询尝试、解析PDF位置、准备文档分析工作区、验证草稿并渲染HTML输出。这种分离确保报告仅从经过验证的中间状态生成,保留了从用户问题到最终输出的清晰审计线索。

### II-C 工作流组合

AlphaAgent将直接问题路由到检索技能并返回基于源的答案。对于明确要求深度报告的请求,系统先执行检索,然后将查询结果、论文引用和文档标识符传递给报告生成技能。报告技能重用现有查询结果进行论文选择,保持用户原始问题、检索证据和后续文档级分析之间的清晰联系。此设计强制执行明确边界:如果检索未产生有效证据,则报告生成不进行;无法解析的单篇论文不会使其余报告失效。技能组合实现了模块化和一致输出行为,如图1 (https://arxiv.org/html/2607.20431#S2.F1)所示。

*参见说明文字*
图1:用于技能驱动材料文献分析的AlphaAgent架构。智能体运行环境通过明确契约将用户请求从请求层路由到有界技能。基于检索的问答和报告生成保持独立的执行路径,但可以通过将查询结果、论文引用和文档标识符从检索传递到文档级报告生成来组合。

## III. 意图驱动的迭代检索

### III-A 检索意图构建

检索技能将用户请求重写为英文检索意图,遵循检索增强LLM查询重写的更广泛动机[12 (https://arxiv.org/html/2607.20431#bib.bib18)]。它去除对话性措辞,将复合问题压缩为面向搜索的表达,并保留材料特定实体,包括合金牌号、相名、加工参数、温度范围、性能术语和标准。重写的意图与原始问题一起存储,以便答案生成保持与原始请求一致。这种双存储设计防止多轮检索中的语义漂移,并确保最终答案可追溯到用户的初始目标。通过将面向搜索的表达与任务级引用分开,该框架在多次查询迭代中保持检索精度和响应保真度。如果没有这种分离,密集检索倾向于过于宽泛的术语,而答案生成则失去了触发查询的特定材料体系或性能权衡。

材料科学中微小的词汇变化可能大幅改变检索到的文献范围,因为相同的相名或性能描述符在不同合金体系和表征设置中可能具有不同含义。当问题被转换为检索意图时,它必须保留其变形机制、温度区间和微观结构演化路径。例如,关于超合金蠕变抗性的查询必须明确位错攀移、扩散和γ′ γ′筏化。重写的查询还必须保持简洁,以便密集检索仍然有效。因此,AlphaAgent使用重写的意图作为搜索文本,同时保留原始问题作为任务级引用,在材料特定细节的需求与密集向量搜索的约束之间取得平衡。过于冗长的意图会稀释密集向量搜索中的信号;过于抽象的意图会产生缺乏材料特定答案所需的机理细节的段落。

### III-B 迭代检索与尝试选择

传统RAG通常在从返回的段落生成答案之前执行单次检索传递,这限制了其在初始证据不完整或目标偏离时恢复的能力。AlphaAgent用受有界检索循环替换这种单次传递设计,受主动检索策略启发,允许系统在做出答案前检查并优化其搜索意图。每次尝试后,智能体评估返回的片段、元数据和论文记录是否在四个维度上与用户请求整体对齐:材料体系、性能、加工条件和分析焦点。如果任何维度缺失或不对齐,智能体将证据视为不足,并触发重新表述而非继续进行生成。此检查步骤在材料科学中至关重要,因为单次传递可能检索到提及正确合金家族但讨论无关加工路线的段落。通过在生成前验证对齐并限制总尝试次数,系统避免了不匹配证据和不受控制的搜索扩展。

如果第一次尝试失败,智能体重新表述检索意图并再次查询索引,利用观察到的证据差距指导修正。重新表述可能缩小材料体系范围、添加缺失的加工条件,或调整机理和性能术语,使下一次搜索针对更具体的语言。尝试次数受限于防止无限循环;到达上限后,智能体使用最佳可用证据继续

相似文章

agentskills/agentskills

GitHub Trending (daily)

Agent Skills 是 Anthropic 提出的一项开放标准,用于将专业知识和工作流程打包到可移植、版本控制的文件夹中,AI 代理可以按需加载这些文件夹,从而在最小化上下文开销的情况下实现领域专业知识和可重复执行的任务。

EVE-Agent: 可验证证据的自我进化智能体

arXiv cs.AI

EVE-Agent 提出了一个自我进化搜索智能体框架,通过生成问题、答案和证据片段,并基于证据的边际准确性增益进行训练,确保证据可验证性。这提高了基于依据的正确性,且无需人工标注。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387

X AI KOLs Timeline

本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。