deduplication

标签

Cards List
#deduplication

一种面向异构文档知识图谱构建的本体引导、去重感知抽取层

arXiv cs.AI · 14小时前 缓存

本文介绍了一个生产级抽取层,利用本地托管的经过调优的Qwen大语言模型,将异构文档转换为与本体对齐的知识图谱,并采用本体引导的提示、多阶段去重和基于嵌入的解析。在情报语料上的评估表明,搜索召回率从约70%提升到95%,且没有错误合并。

0 人收藏 0 人点赞
#deduplication

Vacuum 16T

Reddit r/LocalLLaMA · 昨天

一个故意为空的16.5万亿参数模型被上传到Hugging Face,暴露了参数量仅由safetensors头部计算得出,且Xet的内容定义去重极大减少了上传带宽,但存储配额仍按完整逻辑大小计费。

0 人收藏 0 人点赞
#deduplication

Hugging Face Storage Buckets(网站)

TLDR AI · 3天前 缓存

Hugging Face 推出 Storage Buckets,这是一项面向 AI 团队的可扩展对象存储服务,采用按 TB 计费、Xet 去重、内置 CDN,且无 git 开销,专为数据集、模型检查点和 ML 工件设计。

0 人收藏 0 人点赞
#deduplication

@jchudnov: 飞往 #ICML2026 展示 Oral 论文《Internal Data Repetition Destroys Language Models》,在 Foundations of Deep Gen Models Workshop 上

X AI KOLs Following · 2026-07-04 缓存

一项新研究量化了语言模型预训练中重复数据造成的损害,表明即使是激进的去重也会留下有害的重复,可能浪费多达三分之一的算力 FLOPs。

0 人收藏 0 人点赞
#deduplication

内部数据重复破坏语言模型

arXiv cs.LG · 2026-06-25 缓存

本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。

0 人收藏 0 人点赞
#deduplication

@pauliusztin_: 我花了几个月优化GraphRAG检索。但结果发现我优化错了方向……最大的知识…

X AI KOLs Timeline · 2026-06-10 缓存

一份关于为AI智能体优化知识图谱摄入的详细指南,提出了一个五步流水线(提取、解析、嵌入、去重、路由),以防止图谱损坏并提高检索质量。

0 人收藏 0 人点赞
#deduplication

@pauliusztin_: 两个月前,我开始使用知识图谱构建统一记忆层。以下是我最常被问到的问题……

X AI KOLs Timeline · 2026-05-23 缓存

本帖子讨论了使用知识图谱构建统一记忆层的最佳实践,强调将实体解析(命名)与去重(身份)分离,以避免图污染。还重点介绍了使用像 PrefectIO 这样的编排工具,通过检查点和缓存来管理昂贵的 LLM 提取管道。

0 人收藏 0 人点赞
#deduplication

@ClementDelangue: 很高兴看到@CommonCrawl 使用并推荐 @huggingface Buckets 用于大规模不断演变的训练数据集!…

X AI KOLs Following · 2026-05-22 缓存

Hugging Face 宣布推出 Storage Buckets,这是一种适用于大规模不断演变的训练数据集的存储解决方案,内置 CDN 和去重功能,并获得 CommonCrawl 的推荐。

0 人收藏 0 人点赞
#deduplication

Velonus – 开源应用安全扫描器,去重SAST噪声

Hacker News Top · 2026-05-15 缓存

Velonus 是一个面向 Python 的开源应用安全扫描器,可通过一条命令运行五种安全工具,标准化发现结果并去重噪声,支持 SARIF 输出和 CI 集成。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈