标签
本文介绍了持久发现上下文,这是一个为数据智能体设计的轻量级记忆层,用于存储先前的意图到对象的映射,以增强跨任务的检索质量,在结构化数据环境中展示了改进。
这篇来自freeCodeCamp的教程解释了如何设计模式、验证输出,并处理故障,以从LLMs中可靠地提取结构化数据,涵盖了约束输出、重试循环和流式处理等技术。
LlamaParse引入了原生的代理式电子表格提取功能,使用经过调优的模型和框架进行模式引导的提取,能够将资产负债表等密集表格转换为清晰的结构化字段。
HyperExtract 是一个基于 LLM 的框架,用于将非结构化文档转换为结构化的知识图谱、超图和列表,简化知识提取和管理。
本文提出了一种用于提取基于LLM的数字孪生人格信息的结构化方法,证明了结构化表示相比原始转录能提升预测精度,并提出了一个可适应不同任务的自动流程。
LlamaParse 现在处理文档中的修订跟踪,提供最终状态的干净 markdown 以及编辑、删除和评论的结构化数据,解决解析器误解修订跟踪的问题。
AnakinScraper OSS is an open-source web scraping API designed for AI applications, converting websites to clean Markdown or structured JSON for use in RAG pipelines and AI agents.
HERMES是一个可扩展的多代理框架,用于从地球科学中超长科学文档中提取结构化知识,实现了高准确度和相对于人工方法六倍的效率提升。
LiteParse 现在支持从 PDF 中提取结构化数据——表单字段、复选框状态、注释、图像、矢量图形和词级边界框——无需视觉模型,并提供复杂度信号,将更困难的页面路由到 LlamaParse 等工具。
NLWeb 是一套开源协议和 Python 工具集合,允许开发者利用现有的 Schema.org 或 RSS 数据为网站添加自然语言界面,而无需重建内容层。
一篇介绍如何在个人网站上消费和使用Microformats 2数据的文章,涵盖解析器选择、获取注意事项和数据存储策略。
文章认为,在智能体之间的通信中,仅靠认证不足以实现授权;相反,需要关于意图、身份和权限的结构化、可审查的声明,而人类仍然是最终权威。
GitHub Issue Fields 现已全面上市,允许用户向跨仓库的问题添加优先级、工作量、日期等结构化元数据。
Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。
Marble Curriculum 是一个全面的开源数据集,涵盖1,590个小学概念,跨8个学科共3,221个连接,已发布用于构建学习路径和AI驱动的教育工具。
一个实用的解决方案,使用AnySearch让本地AI代理高效查询多个专业来源(CVE、SEC申报),返回结构化JSON/Markdown,避免速率限制和破损的SDK。
Object Aligner 是一个开源的 Python 库,通过递归对齐两棵 JSON 对象的树结构,对无序集合使用匈牙利算法、对有序集合使用序列对齐,从而确定性评分。它引入了针对图/超图的引用对齐,并可作为 LLM 提示优化中的奖励函数。
介绍进化特征工程(EFE),一种利用基于LLM的进化来自动发现结构化数据预处理变换的框架,在保持可解释性的同时提高时间序列预测和表格预测的准确性。
SchemaRAG是一个检索增强生成框架,能够动态缩减面向LLM驱动的结构化信息提取的输出模式空间,在医疗健康和电子商务数据集上实现了性能提升和效率优化。
提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。