基于规则与LLMs的代理框架:用于描述性文档布局的嵌入与注释——植物科学应用案例

arXiv cs.AI 论文

摘要

本文提出一种结合规则与LLMs的代理框架,用于植物科学中文档布局的嵌入和注释,实现了可扩展的性状提取并提升了注释覆盖度。

arXiv:2608.14587v1 公告类型:新 摘要:背景:信息检索(IR)的最新进展利用稠密和稀疏表示、大型语言模型(LLMs)和专门检索模型,以提高排序准确性、相关性和跨语言性能。补充技术如段落索引、文档布局分析和语义知识表示,通过捕获细粒度上下文和结构信息,进一步增强检索效果。新兴的代理LLM框架通过启用规划、迭代推理、工具使用和多代理协作来扩展这些能力,从而在不同领域扩大应用范围。这些框架还强调严格评估、伦理考虑和可信度,确保在现实世界中的负责任部署。我们提出一种模块化的、基于代理的管道,用于植物性状提取。光学字符识别(OCR)将PDF转换为机器可读文本,而分段和索引按属和种组织内容。基于规则的解析器提取结构化植物性状,大型语言模型(LLMs)的集成扩展性状词汇并解决歧义。这种方法确保准确的物种识别、可扩展的注释和可解释的文本植物描述整合,使得跨大型植物语料库的鲁棒和可解释数据提取成为可能。结果:使用三个区域性植物数据集,我们的系统在4,961个物种中提取了55,737个性状注释,平均每物种9.1个性状。基于LLM的丰富度整合提高了75%性状的覆盖度,总注释增加了59%。虽然OCR引擎的选择对物种识别影响较小,但整体注释数量保持稳定,展示了该管道在大规模植物性状提取中的鲁棒性、可扩展性和可靠性。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:49

# 基于规则与大语言模型的智能体框架:用于描述性文档布局的嵌入与标注——植物科学应用案例
来源:https://arxiv.org/abs/2608.14587
查看PDF (https://arxiv.org/pdf/2608.14587)

> 摘要:背景:信息检索(IR)的最新进展同时利用了稠密与稀疏表示、大语言模型(LLMs)及专用检索模型,以提升排序准确性、相关性和跨语言性能。段落索引、文档布局分析、语义知识表示等互补技术,通过捕捉细粒度上下文与结构信息,进一步增强了检索效果。新兴的大语言模型智能体框架通过实现规划、迭代推理、工具调用和多智能体协作,扩展了这些能力,从而拓宽了在各领域的应用范围。这些框架还强调严格评估、伦理考量和可信度,确保在现实场景中负责任地部署。我们提出一种用于植物性状提取的模块化智能体流水线。光学字符识别(OCR)将PDF转换为机器可读文本,而分割与索引则按属和种组织内容。基于规则的解析器提取结构化植物性状,大语言模型(LLMs)集成则扩展性状词汇并解决歧义。该方法确保准确的物种识别、可扩展的标注,以及文本植物描述的可解释集成,从而在大型植物语料库中实现稳健且可解释的数据提取。结果:利用三个区域性植物数据集,我们的系统在4,961个物种中提取了55,737个性状标注,平均每个物种9.1个性状。基于大语言模型的富集整合提升了75%性状的覆盖率,使总标注量增加了59%。虽然OCR引擎的选择对物种识别影响较小,但整体标注数量保持稳定,证明了该流水线在大规模植物性状提取中的稳健性、可扩展性和可靠性。

## 提交历史

来自:Nicolas Turenne \[查看邮件 (https://arxiv.org/show-email/c0eda81f/2608.14587)\] **\[v1\]** 2026年6月19日(星期五)11:50:27 UTC(2,002 KB)

相似文章

前沿基于LLM的智能体能够克服自然表型的本体策展瓶颈

arXiv cs.AI

本文表明,当提供源出版物、注释指南和本体时,前沿基于LLM的智能体在执行表型注释方面的能力可与训练有素的人类策展人相媲美,显著优于先前的自然语言处理工具,从而克服了比较形态学数据整合中的关键瓶颈。

学习构建实用的智能体系统

arXiv cs.LG

本文提出了设计和优化实用智能体LLM系统的原则性方法,引入了一个包含伪工具和固定工作流的框架,以提高模块化、成本效益和跨多种任务的准确性。