标签
文章认为,在智能体之间的通信中,仅靠认证不足以实现授权;相反,需要关于意图、身份和权限的结构化、可审查的声明,而人类仍然是最终权威。
GitHub Issue Fields 现已全面上市,允许用户向跨仓库的问题添加优先级、工作量、日期等结构化元数据。
Context.dev 是一个获得 YC 支持的 API,允许开发者和 AI 代理从任意网站抓取、爬取和提取结构化数据,支持 Markdown、HTML、站点地图、截图和品牌智能等功能,旨在简化网络数据集成。
Marble Curriculum 是一个全面的开源数据集,涵盖1,590个小学概念,跨8个学科共3,221个连接,已发布用于构建学习路径和AI驱动的教育工具。
一个实用的解决方案,使用AnySearch让本地AI代理高效查询多个专业来源(CVE、SEC申报),返回结构化JSON/Markdown,避免速率限制和破损的SDK。
Object Aligner 是一个开源的 Python 库,通过递归对齐两棵 JSON 对象的树结构,对无序集合使用匈牙利算法、对有序集合使用序列对齐,从而确定性评分。它引入了针对图/超图的引用对齐,并可作为 LLM 提示优化中的奖励函数。
介绍进化特征工程(EFE),一种利用基于LLM的进化来自动发现结构化数据预处理变换的框架,在保持可解释性的同时提高时间序列预测和表格预测的准确性。
SchemaRAG是一个检索增强生成框架,能够动态缩减面向LLM驱动的结构化信息提取的输出模式空间,在医疗健康和电子商务数据集上实现了性能提升和效率优化。
提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。
Hyper-Extract 是一款命令行工具,可将凌乱的非结构化文档转化为结构化知识,如知识图谱、超图、时间/空间图及Obsidian vault,支持本地LLM推理与MCP集成。
对50个SaaS网站的分析揭示了AI就绪度的常见失败点:爬虫访问权限差、首页文案过于模糊、缺少结构化数据。文章认为,随着AI工具成为产品发现的主要渠道,SaaS公司需要优化其网站以获得AI可见性。
将基金经理郑希的公开季报、手记、采访整理为结构化语料库,并做成跨AI平台的可溯源技能,用于真实语料驱动的投研问答与基金分析。
本指南介绍了如何为个人网站添加 JSON-LD 结构化数据,以提升 SEO 和获得更丰富的链接预览,涵盖基础知识和常见 Schema 类型的可复制粘贴示例。
Vik Paruchuri 正在开源一个9B模型,该模型可以从文档中提取结构化数据,性能接近前沿水平(在其基准测试中达到90.2%,而Gemini 3.5 Flash为91.3%)。
作者构建了一个健康食品MCP服务器,并发现智能体使用多个狭窄、受限的工具比使用一个灵活的工具表现更好,强调需要一个枯燥的工具表面来减少大语言模型的幻觉。
本文介绍了一种技术,利用PDF规范中的替换文本属性,在PDF内部嵌入隐藏的Markdown结构,使得LLMs能够提取干净、结构化的数据,而人类看到的仍然是相同的视觉文档。
作者重建了博客,加入了完整的结构化数据标记(JSON-LD、微格式),并配备了一个由提示词引导的AI协作写作助手,该提示词避免了常见的LLM模式,同时通过CI验证防止数据损坏。
本文认为,AI代理无法通过人类情感策略进行营销;相反,品牌必须提供结构化、机器可读的数据。文章指出了被AI提及(引用)与被AI选中(选择)之间的差距,并提出了一个由五个文件组成的框架,用于提供代理可读的品牌信息。
CRAFT是一个统一的反事实推理框架,通过构建原始陈述和反事实变体,从双向推理路径中提取证据,并通过加权机制进行整合,从而提升了表格问答和事实验证的效果。在WikiTQ和TabFact数据集上的实验表明,该框架持续优于基线方法。
BigSet 是一个开源工具,输入一句话描述所需数据,它会派出多个 AI Agent 并行在网络上调研,自动推断 schema、去重、验证并生成结构化表格,支持定时刷新。