标签
本文介绍了一个生产级抽取层,利用本地托管的经过调优的Qwen大语言模型,将异构文档转换为与本体对齐的知识图谱,并采用本体引导的提示、多阶段去重和基于嵌入的解析。在情报语料上的评估表明,搜索召回率从约70%提升到95%,且没有错误合并。
本文分享了在六个基准测试上构建和评估自服务实体解析管线时得出的三条实用经验:没有一种匹配算法能通吃所有场景,精确率和召回率需要分别修复,假阳性链接可能链式合并无关实体。
一篇教程,解释程序化广告以及如何使用Python建模物理广告,涵盖实体解析、受众数据、可用性和动态定价。
文章认为智能体记忆的默认方法(保存所有消息并使用 RAG)由于缺乏抑制、身份和关系追踪而失败,并提议改用轻量级时序知识图谱来建模用户的世界。
本文提出一个两阶段实体解析流水线,将Sanadset语料库中的传述者姓名链接到两个传记数据库,从而构建一个富含跨源元数据的大型传述图谱。
一份关于为AI智能体优化知识图谱摄入的详细指南,提出了一个五步流水线(提取、解析、嵌入、去重、路由),以防止图谱损坏并提高检索质量。
本文提出结构引导实体解析(SGER)框架,通过课程学习微调大语言模型,在语言多样化环境中实现鲁棒的人名匹配,在印度身份数据上达到99.02%准确率,并已在Dream11部署。
本帖子讨论了使用知识图谱构建统一记忆层的最佳实践,强调将实体解析(命名)与去重(身份)分离,以避免图污染。还重点介绍了使用像 PrefectIO 这样的编排工具,通过检查点和缓存来管理昂贵的 LLM 提取管道。
一位开发者分享了一种使用Neo4j知识图谱的架构,包含类型化实体和去重,解决了AI代理跨会话遗忘实体身份的问题,超越了平面文件和向量存储。