data-extraction

标签

Cards List
#data-extraction

我在30多个AI自动化中不断解决相同的5个问题。以下是其中的规律。

Reddit r/AI_Agents · 2026-09-01

本文基于作者在30多个生产系统中的经验,描述了AI自动化中五个常见的故障点,并分享了避免重复处理和静默错误等实际问题的实用模式。

0 人收藏 0 人点赞
#data-extraction

从数据分析到肿瘤委员会:一种基于证据的多智能体工作流用于肿瘤学特征提取

arXiv cs.AI · 2026-09-01 缓存

论文评估了一个可配置的多智能体系统(nMAS),用于从碎片化的临床文档中提取结构化的肿瘤学数据,与基线模型相比取得了高性能。

0 人收藏 0 人点赞
#data-extraction

如何从印度银行对账单PDF中提取交易表格?寻找开源/本地部署方案

Reddit r/AI_Agents · 2026-08-29

作者正在开发一个信用承保AI代理,并寻求开源本地部署方法,从多样化的印度银行对账单PDF中提取结构化交易表格,面临布局变化的挑战,需要可靠的提取方法。

0 人收藏 0 人点赞
#data-extraction

@tom_doerr: 爬取网站以将提取的网页内容转换为适用于大语言模型(LLM)的数据结构。 https://github.com/watercrawl/WaterC…

X AI KOLs Timeline · 2026-08-27 缓存

WaterCrawl是一个开源Web应用,它爬取网站以将提取的内容转换为适用于大语言模型(LLM)的数据结构,使用Python、Django、Scrapy和Celery构建。

0 人收藏 0 人点赞
#data-extraction

@mdancho84: 突发新闻:IBM推出免费Python库,可将任何文档转换为数据 介绍Docling。这是你需要知道的…

X AI KOLs Timeline · 2026-08-21 缓存

IBM推出Docling,一个开源Python库,旨在将文档转换为结构化数据。

0 人收藏 0 人点赞
#data-extraction

为代理提供每个网站的类型化工具优于通用刮刀——文章

Reddit r/AI_Agents · 2026-08-21

这篇文章介绍了如何为AI代理提供针对每个网站的类型化工具,这些工具通过LLM派生并缓存提取模式,从而超越通用刮刀,使调用更具确定性、成本更低、更可靠,同时通过将数据锚定在源HTML中来防止幻觉。

0 人收藏 0 人点赞
#data-extraction

@binghe: 其实想“蒸馏”某位博主的思想非常容易 。 1,找到他的文章转成.md 文件存着。 2,找到他的短视频(或长视频)平台,用 Get笔记(现在叫得到大脑)Cli ,批量的采回所有视频口播文字稿。如果是长视频使用yt-dlp开源工具下载回来,转…

X AI KOLs Timeline · 2026-08-20 缓存

本文介绍了一种利用AI工具从博主内容中提取思想并形成可复用技能流程的方法。

0 人收藏 0 人点赞
#data-extraction

@tavilyai: @Rox_ai 代理帮助将你的业务流程置于自动驾驶状态。但这需要他们知道当前账户的动态…

X AI KOLs Following · 2026-08-18 缓存

Rox 使用 Tavily 的搜索和提取服务来驱动其 AI 代理进行销售自动化,显著将账户研究时间从几周缩短到几秒。该案例研究强调了 Tavily 在提供实时数据方面的可靠性、成本效益和准确性。

0 人收藏 0 人点赞
#data-extraction

在你信任它生成的表格之前,浏览器代理应该展示什么?

Reddit r/AI_Agents · 2026-08-18

本文讨论了浏览器代理在数据提取中的挑战,例如不完整的表格,并介绍了 Thunderbit 的解决方案,该方案提供源 URL 和可审查的表格,以实现透明度和信任。

0 人收藏 0 人点赞
#data-extraction

Mindcase

Product Hunt · 2026-08-14

Mindcase是一个在Product Hunt上推出的工具,能够在网络上的任何地方快速提取数据。

0 人收藏 0 人点赞
#data-extraction

@DataScienceDojo: 谷歌的𝐥𝐚𝐧𝐠𝐞𝐱𝐭𝐫𝐚𝐜𝐭在GitHub上已突破3.7万星标。核心理念:将LLM对准非结构化文本,然后提…

X AI KOLs Timeline · 2026-07-22 缓存

谷歌的开源工具‘langextract’利用大语言模型从非结构化文本中提取结构化数据,并保留原始字符位置,已在GitHub上获得超过3.7万星标。

0 人收藏 0 人点赞
#data-extraction

从76,000篇能源系统研究中自动提取技术经济数据

arXiv cs.CL · 2026-07-22 缓存

本文介绍了一种自动化方法,从76,000篇能源系统研究中提取定量技术经济数据,整理出320万个结构化数据点。由此产生的FAIR数据库能够分析文献趋势,并为能源模型提供输入数据。

0 人收藏 0 人点赞
#data-extraction

DECODEM: 通过增强方法从公司组织文档中提取数据

arXiv cs.CL · 2026-07-20 缓存

介绍DECODEM,这是一个基准数据集,用于评估使用大型语言模型从法律文档中自动提取公司治理变量的方法,结果显示对许多条款具有高准确性。

0 人收藏 0 人点赞
#data-extraction

Launch HN: Context.dev (YC S26) – 从任意网站获取结构化数据的API

Hacker News Top · 2026-07-09 缓存

Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。

0 人收藏 0 人点赞
#data-extraction

@yhslgg: https://x.com/yhslgg/status/2072243790044442961

X AI KOLs Timeline · 2026-07-01 缓存

本文分类整理了14个爬虫工具,分为AI新物种、工程级框架、浏览器自动化、国内平台专用和现代轻量型五类,并附有真实案例和选型建议。

0 人收藏 0 人点赞
#data-extraction

Context.dev

Product Hunt · 2026-07-01

Context.dev 提供单一 API,用于从互联网抓取、丰富和提取数据。

0 人收藏 0 人点赞
#data-extraction

@ecommartinez: 10个用于抓取整个互联网的GitHub仓库。全部保存。每个都能从任何网站提取干净数据。…

X AI KOLs Timeline · 2026-06-28 缓存

来自@ecommartinez的推文,列出了10个用于网络爬虫的GitHub仓库,可从任何网站提取干净数据。

0 人收藏 0 人点赞
#data-extraction

@VikParuchuri: Datalab 平衡模式提取现已在内部基准测试中达到 95.9% 的准确率——比 Reducto Deep Extract 更精准(…

X AI KOLs Timeline · 2026-06-27 缓存

Datalab 的平衡模式提取在内部基准测试中实现了 95.9% 的准确率,超越 Reducto Deep Extract(95.1%),而价格不到其一半,并提供包含引用和推理的完整验证。

0 人收藏 0 人点赞
#data-extraction

Liquid AI 发布 Liquid Foundation Models 2.5 230M(3分钟阅读)

TLDR AI · 2026-06-26 缓存

Liquid AI 发布 LFM2.5-230M,这是一款轻量级基础模型,可在从云端 GPU 到 CPU 乃至 Raspberry Pi 的设备上运行,在工具使用和数据提取任务上表现出色。

0 人收藏 0 人点赞
#data-extraction

@heynavtoor:曼哈顿的一位律师收到一份500页的合同。每一条款都必须可搜索。手动处理:一周。一位会计师…

X AI KOLs Timeline · 2026-06-24 缓存

MinerU 是一款免费开源工具,可从 PDF 和扫描文档中提取文本、表格和公式,支持109种语言和批量处理,节省数小时的手动工作。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈