structured-data

标签

Cards List
#structured-data

超越上下文窗口:数据智能体的持久发现上下文

arXiv cs.AI · 昨天 缓存

本文介绍了持久发现上下文,这是一个为数据智能体设计的轻量级记忆层,用于存储先前的意图到对象的映射,以增强跨任务的检索质量,在结构化数据环境中展示了改进。

0 人收藏 0 人点赞
#structured-data

@freeCodeCamp: 获取你的应用程序真正能信任的结构化数据可能很棘手。在这篇教程中,Vineeth解释了如何设计模式…

X AI KOLs Timeline · 6天前 缓存

这篇来自freeCodeCamp的教程解释了如何设计模式、验证输出,并处理故障,以从LLMs中可靠地提取结构化数据,涵盖了约束输出、重试循环和流式处理等技术。

0 人收藏 0 人点赞
#structured-data

@jerryjliu0:我们已在LlamaParse中引入了原生的、代理式电子表格提取功能。电子表格与PDF(或其他文档格式)截然不同……

X AI KOLs Timeline · 2026-08-27 缓存

LlamaParse引入了原生的代理式电子表格提取功能,使用经过调优的模型和框架进行模式引导的提取,能够将资产负债表等密集表格转换为清晰的结构化字段。

0 人收藏 0 人点赞
#structured-data

@tom_doerr: HyperExtract 使用大型语言模型将非结构化文档转换为结构化的知识图谱、超图和列表…

X AI KOLs Timeline · 2026-08-27 缓存

HyperExtract 是一个基于 LLM 的框架,用于将非结构化文档转换为结构化的知识图谱、超图和列表,简化知识提取和管理。

0 人收藏 0 人点赞
#structured-data

超越原始转录:基于LLM的数字孪生的结构化人格提取

arXiv cs.CL · 2026-08-24 缓存

本文提出了一种用于提取基于LLM的数字孪生人格信息的结构化方法,证明了结构化表示相比原始转录能提升预测精度,并提出了一个可适应不同任务的自动流程。

0 人收藏 0 人点赞
#structured-data

@llama_index: 大多数解析器将修订跟踪视为噪音。结果:一个被删除的条款会作为活跃文本返回,而你的流水线读取…

X AI KOLs Timeline · 2026-08-18 缓存

LlamaParse 现在处理文档中的修订跟踪,提供最终状态的干净 markdown 以及编辑、删除和评论的结构化数据,解决解析器误解修订跟踪的问题。

0 人收藏 0 人点赞
#structured-data

@XAMTO_AI: AnakinScraper OSS,专为AI打造的开源网页抓取API。 一键把任意网站转成干净的Markdown或结构化JSON,直接喂给RAG、AI Agent使用。 亮点: 反检测浏览器(Camoufox Firefox)、 智能代理…

X AI KOLs Timeline · 2026-08-18 缓存

AnakinScraper OSS is an open-source web scraping API designed for AI applications, converting websites to clean Markdown or structured JSON for use in RAG pipelines and AI agents.

0 人收藏 0 人点赞
#structured-data

HERMES:用于地球科学中超长文档结构化知识提取的多代理框架

arXiv cs.CL · 2026-08-17 缓存

HERMES是一个可扩展的多代理框架,用于从地球科学中超长科学文档中提取结构化知识,实现了高准确度和相对于人工方法六倍的效率提升。

0 人收藏 0 人点赞
#structured-data

@llama_index:你不需要视觉模型就能知道 PDF 中有复选框。LiteParse 现在可以直接从……提取结构化数据

X AI KOLs Following · 2026-08-03 缓存

LiteParse 现在支持从 PDF 中提取结构化数据——表单字段、复选框状态、注释、图像、矢量图形和词级边界框——无需视觉模型,并提供复杂度信号,将更困难的页面路由到 LlamaParse 等工具。

0 人收藏 0 人点赞
#structured-data

@DanKornas: 为网站添加对话界面无需重建其内容层。NLWeb 是一个……

X AI KOLs Timeline · 2026-07-28 缓存

NLWeb 是一套开源协议和 Python 工具集合,允许开发者利用现有的 Schema.org 或 RSS 数据为网站添加自然语言界面,而无需重建内容层。

0 人收藏 0 人点赞
#structured-data

Microformats – 数据丰富网页的构建模块

Lobsters Hottest · 2026-07-25 缓存

一篇介绍如何在个人网站上消费和使用Microformats 2数据的文章,涵盖解析器选择、获取注意事项和数据存储策略。

0 人收藏 0 人点赞
#structured-data

认证不等于授权——当智能体与智能体对话时,授权应该如何运作?

Reddit r/AI_Agents · 2026-07-16

文章认为,在智能体之间的通信中,仅靠认证不足以实现授权;相反,需要关于意图、身份和权限的结构化、可审查的声明,而人类仍然是最终权威。

0 人收藏 0 人点赞
#structured-data

@github: 借助 GitHub Issue Fields,你可以向问题添加结构化、类型化的元数据(如优先级、工作量、日期和自定义值)……

X AI KOLs Timeline · 2026-07-12 缓存

GitHub Issue Fields 现已全面上市,允许用户向跨仓库的问题添加优先级、工作量、日期等结构化元数据。

0 人收藏 0 人点赞
#structured-data

Launch HN: Context.dev (YC S26) – 从任意网站获取结构化数据的API

Hacker News Top · 2026-07-09 缓存

Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。

0 人收藏 0 人点赞
#structured-data

@lionel_mora: 继昨天 Marble Curriculum 获得热烈反响后,我们决定将其开源。一切……

X AI KOLs Timeline · 2026-07-08 缓存

Marble Curriculum 是一个全面的开源数据集,涵盖1,590个小学概念,跨8个学科共3,221个连接,已发布用于构建学习路径和AI驱动的教育工具。

0 人收藏 0 人点赞
#structured-data

如何让本地代理读取CVE和SEC申报而不头疼

Reddit r/AI_Agents · 2026-07-03

一个实用的解决方案,使用AnySearch让本地AI代理高效查询多个专业来源(CVE、SEC申报),返回结构化JSON/Markdown,避免速率限制和破损的SDK。

0 人收藏 0 人点赞
#structured-data

Object Aligner:一种可配置的JSON Schema图相似度评分,应用于LLM提示优化

arXiv cs.CL · 2026-07-03 缓存

Object Aligner 是一个开源的 Python 库,通过递归对齐两棵 JSON 对象的树结构,对无序集合使用匈牙利算法、对有序集合使用序列对齐,从而确定性评分。它引入了针对图/超图的引用对齐,并可作为 LLM 提示优化中的奖励函数。

0 人收藏 0 人点赞
#structured-data

结构化数据的进化特征工程

arXiv cs.LG · 2026-07-03 缓存

介绍进化特征工程(EFE),一种利用基于LLM的进化来自动发现结构化数据预处理变换的框架,在保持可解释性的同时提高时间序列预测和表格预测的准确性。

0 人收藏 0 人点赞
#structured-data

SchemaRAG: 面向LLM驱动的结构化信息提取的动态大规模模式简化

arXiv cs.AI · 2026-07-02 缓存

SchemaRAG是一个检索增强生成框架,能够动态缩减面向LLM驱动的结构化信息提取的输出模式空间,在医疗健康和电子商务数据集上实现了性能提升和效率优化。

0 人收藏 0 人点赞
#structured-data

从词汇到AI:面向低资源语言专业对话系统的结构化数据流水线

arXiv cs.CL · 2026-06-26 缓存

提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈