deduplication

标签

Cards List
#deduplication

GVD:文档仓库的受控版本管理与去重

arXiv cs.AI · 5天前 缓存

GVD 引入了一个用于文档仓库中受控版本管理与去重的统一框架,通过使用双向规则对齐和冲突解决策略,结合本地编码器模型,在企业数据上实现高性能。

0 人收藏 0 人点赞
#deduplication

我们尝试让AI验证器减少阅读。如何在不悄无声息地遗漏证据的情况下降低成本?

Reddit r/AI_Agents · 6天前

本文描述了在AI验证管道中测试降低阅读成本的方法,同时保持高召回率和少数证据,指出了当前方法的挑战,并邀请社区参与。

0 人收藏 0 人点赞
#deduplication

@ZyphraAI:Zyphra Research 发布 PUFFER,一种用于大规模语言模型数据集的新型增量模糊去重系统。PUFFER 运行……

X AI KOLs Timeline · 2026-09-01 缓存

Zyphra Research 发布 PUFFER,这是一种针对大规模语言模型数据集的增量模糊去重系统,完全在 CPU 上运行,比现有方法快 11-35 倍,已根据 Apache 2.0 协议开源。

0 人收藏 0 人点赞
#deduplication

卡车司机打造AI新闻聚合器

Reddit r/artificial · 2026-08-25

一位没有编程背景的卡车司机使用Next.js和Supabase构建了一个AI新闻聚合器,能够从多个来源汇总和去重新闻。

0 人收藏 0 人点赞
#deduplication

我构建的每个新闻阅读智能体都会永久重复获取相同文章。这是我最终采用的内存层方案。

Reddit r/AI_Agents · 2026-08-23

作者描述为新闻阅读AI智能体构建了一个内存层,以处理去重问题并提升跨会话连续性,采用了SQLite、向量存储以及Python API、CLI和MCP服务器。

0 人收藏 0 人点赞
#deduplication

大规模语言模型预训练中可扩展的频次与长度感知子文档去重

arXiv cs.CL · 2026-08-05 缓存

提出了一种用于LLM预训练的可扩展子文档去重框架,将重复检测与副本保留分离,采用频次与长度感知策略。在FineWeb-Edu和代码网页语料上的实验表明,模型性能得到提升。

0 人收藏 0 人点赞
#deduplication

帧选择就是一切:让LLM看视频的笔记

Hacker News Top · 2026-08-03 缓存

面向LLM视频输入的帧选择优化工程笔记,涵盖场景检测、去重策略以及token预算管理。

0 人收藏 0 人点赞
#deduplication

一种面向异构文档知识图谱构建的本体引导、去重感知抽取层

arXiv cs.AI · 2026-08-03 缓存

本文介绍了一个生产级抽取层,利用本地托管的经过调优的Qwen大语言模型,将异构文档转换为与本体对齐的知识图谱,并采用本体引导的提示、多阶段去重和基于嵌入的解析。在情报语料上的评估表明,搜索召回率从约70%提升到95%,且没有错误合并。

0 人收藏 0 人点赞
#deduplication

Vacuum 16T

Reddit r/LocalLLaMA · 2026-08-02

一个故意为空的16.5万亿参数模型被上传到Hugging Face,暴露了参数量仅由safetensors头部计算得出,且Xet的内容定义去重极大减少了上传带宽,但存储配额仍按完整逻辑大小计费。

0 人收藏 0 人点赞
#deduplication

Hugging Face Storage Buckets(网站)

TLDR AI · 2026-07-31 缓存

Hugging Face 推出 Storage Buckets,这是一项面向 AI 团队的可扩展对象存储服务,采用按 TB 计费、Xet 去重、内置 CDN,且无 git 开销,专为数据集、模型检查点和 ML 工件设计。

0 人收藏 0 人点赞
#deduplication

@jchudnov: 飞往 #ICML2026 展示 Oral 论文《Internal Data Repetition Destroys Language Models》,在 Foundations of Deep Gen Models Workshop 上

X AI KOLs Following · 2026-07-04 缓存

一项新研究量化了语言模型预训练中重复数据造成的损害,表明即使是激进的去重也会留下有害的重复,可能浪费多达三分之一的算力 FLOPs。

0 人收藏 0 人点赞
#deduplication

内部数据重复破坏语言模型

arXiv cs.LG · 2026-06-25 缓存

本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。

0 人收藏 0 人点赞
#deduplication

@pauliusztin_: 我花了几个月优化GraphRAG检索。但结果发现我优化错了方向……最大的知识…

X AI KOLs Timeline · 2026-06-10 缓存

一份关于为AI智能体优化知识图谱摄入的详细指南,提出了一个五步流水线(提取、解析、嵌入、去重、路由),以防止图谱损坏并提高检索质量。

0 人收藏 0 人点赞
#deduplication

@pauliusztin_: 两个月前,我开始使用知识图谱构建统一记忆层。以下是我最常被问到的问题……

X AI KOLs Timeline · 2026-05-23 缓存

本帖子讨论了使用知识图谱构建统一记忆层的最佳实践,强调将实体解析(命名)与去重(身份)分离,以避免图污染。还重点介绍了使用像 PrefectIO 这样的编排工具,通过检查点和缓存来管理昂贵的 LLM 提取管道。

0 人收藏 0 人点赞
#deduplication

@ClementDelangue: 很高兴看到@CommonCrawl 使用并推荐 @huggingface Buckets 用于大规模不断演变的训练数据集!…

X AI KOLs Following · 2026-05-22 缓存

Hugging Face 宣布推出 Storage Buckets,这是一种适用于大规模不断演变的训练数据集的存储解决方案,内置 CDN 和去重功能,并获得 CommonCrawl 的推荐。

0 人收藏 0 人点赞
#deduplication

Velonus – 开源应用安全扫描器,去重SAST噪声

Hacker News Top · 2026-05-15 缓存

Velonus 是一个面向 Python 的开源应用安全扫描器,可通过一条命令运行五种安全工具,标准化发现结果并去重噪声,支持 SARIF 输出和 CI 集成。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈