标签
Jev Reviewer 是一个开源工具,通过使用 AI 从研究文章中提取直接引用来帮助系统综述者,支持多种文件类型,并确保所有处理都在浏览器本地进行。
作者正在构建一个工具,该工具从公共网站创建持久化的API,使AI代理和应用能够以编程方式与网页数据交互,例如生成用于搜索和视频详情的YouTube API。
LlamaIndex已训练新的AI模型,用于解析来自任何尺寸和形状表单的复选框,将它们转换为结构化JSON,以便在保险和税务处理等应用程序中进行编程使用。
SciLitBench是一个用于评估LLMs在系统化文献综述中表现的多阶段基准,涵盖标题/摘要筛选、全文筛选和数据提取,并已发布数据和代码。
本文基于作者在30多个生产系统中的经验,描述了AI自动化中五个常见的故障点,并分享了避免重复处理和静默错误等实际问题的实用模式。
论文评估了一个可配置的多智能体系统(nMAS),用于从碎片化的临床文档中提取结构化的肿瘤学数据,与基线模型相比取得了高性能。
作者正在开发一个信用承保AI代理,并寻求开源本地部署方法,从多样化的印度银行对账单PDF中提取结构化交易表格,面临布局变化的挑战,需要可靠的提取方法。
WaterCrawl是一个开源Web应用,它爬取网站以将提取的内容转换为适用于大语言模型(LLM)的数据结构,使用Python、Django、Scrapy和Celery构建。
IBM推出Docling,一个开源Python库,旨在将文档转换为结构化数据。
这篇文章介绍了如何为AI代理提供针对每个网站的类型化工具,这些工具通过LLM派生并缓存提取模式,从而超越通用刮刀,使调用更具确定性、成本更低、更可靠,同时通过将数据锚定在源HTML中来防止幻觉。
本文介绍了一种利用AI工具从博主内容中提取思想并形成可复用技能流程的方法。
Rox 使用 Tavily 的搜索和提取服务来驱动其 AI 代理进行销售自动化,显著将账户研究时间从几周缩短到几秒。该案例研究强调了 Tavily 在提供实时数据方面的可靠性、成本效益和准确性。
本文讨论了浏览器代理在数据提取中的挑战,例如不完整的表格,并介绍了 Thunderbit 的解决方案,该方案提供源 URL 和可审查的表格,以实现透明度和信任。
谷歌的开源工具‘langextract’利用大语言模型从非结构化文本中提取结构化数据,并保留原始字符位置,已在GitHub上获得超过3.7万星标。
本文介绍了一种自动化方法,从76,000篇能源系统研究中提取定量技术经济数据,整理出320万个结构化数据点。由此产生的FAIR数据库能够分析文献趋势,并为能源模型提供输入数据。
介绍DECODEM,这是一个基准数据集,用于评估使用大型语言模型从法律文档中自动提取公司治理变量的方法,结果显示对许多条款具有高准确性。
Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。
本文分类整理了14个爬虫工具,分为AI新物种、工程级框架、浏览器自动化、国内平台专用和现代轻量型五类,并附有真实案例和选型建议。