标签
本文基于作者在30多个生产系统中的经验,描述了AI自动化中五个常见的故障点,并分享了避免重复处理和静默错误等实际问题的实用模式。
论文评估了一个可配置的多智能体系统(nMAS),用于从碎片化的临床文档中提取结构化的肿瘤学数据,与基线模型相比取得了高性能。
作者正在开发一个信用承保AI代理,并寻求开源本地部署方法,从多样化的印度银行对账单PDF中提取结构化交易表格,面临布局变化的挑战,需要可靠的提取方法。
WaterCrawl是一个开源Web应用,它爬取网站以将提取的内容转换为适用于大语言模型(LLM)的数据结构,使用Python、Django、Scrapy和Celery构建。
IBM推出Docling,一个开源Python库,旨在将文档转换为结构化数据。
这篇文章介绍了如何为AI代理提供针对每个网站的类型化工具,这些工具通过LLM派生并缓存提取模式,从而超越通用刮刀,使调用更具确定性、成本更低、更可靠,同时通过将数据锚定在源HTML中来防止幻觉。
本文介绍了一种利用AI工具从博主内容中提取思想并形成可复用技能流程的方法。
Rox 使用 Tavily 的搜索和提取服务来驱动其 AI 代理进行销售自动化,显著将账户研究时间从几周缩短到几秒。该案例研究强调了 Tavily 在提供实时数据方面的可靠性、成本效益和准确性。
本文讨论了浏览器代理在数据提取中的挑战,例如不完整的表格,并介绍了 Thunderbit 的解决方案,该方案提供源 URL 和可审查的表格,以实现透明度和信任。
谷歌的开源工具‘langextract’利用大语言模型从非结构化文本中提取结构化数据,并保留原始字符位置,已在GitHub上获得超过3.7万星标。
本文介绍了一种自动化方法,从76,000篇能源系统研究中提取定量技术经济数据,整理出320万个结构化数据点。由此产生的FAIR数据库能够分析文献趋势,并为能源模型提供输入数据。
介绍DECODEM,这是一个基准数据集,用于评估使用大型语言模型从法律文档中自动提取公司治理变量的方法,结果显示对许多条款具有高准确性。
Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。
本文分类整理了14个爬虫工具,分为AI新物种、工程级框架、浏览器自动化、国内平台专用和现代轻量型五类,并附有真实案例和选型建议。
来自@ecommartinez的推文,列出了10个用于网络爬虫的GitHub仓库,可从任何网站提取干净数据。
Datalab 的平衡模式提取在内部基准测试中实现了 95.9% 的准确率,超越 Reducto Deep Extract(95.1%),而价格不到其一半,并提供包含引用和推理的完整验证。
Liquid AI 发布 LFM2.5-230M,这是一款轻量级基础模型,可在从云端 GPU 到 CPU 乃至 Raspberry Pi 的设备上运行,在工具使用和数据提取任务上表现出色。
MinerU 是一款免费开源工具,可从 PDF 和扫描文档中提取文本、表格和公式,支持109种语言和批量处理,节省数小时的手动工作。