data-quality

标签

Cards List
#data-quality

企业AI项目失败真的是因为AI不够好吗?

Reddit r/artificial · 9小时前

本文质疑AI模型质量是否是企业AI项目失败的主要原因,指出数据和上下文问题往往是真正的罪魁祸首,解决这些问题可以让AI实施变得更容易。

0 人收藏 0 人点赞
#data-quality

营销人员沉迷于坏数据(2020年)

Hacker News Top · 4天前 缓存

本文批评营销人员依赖坏数据,强调了广告拦截器、误导性指标和欺诈受众等问题,这些问题导致营销决策无效。

0 人收藏 0 人点赞
#data-quality

随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值?

Reddit r/artificial · 5天前

一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。

0 人收藏 0 人点赞
#data-quality

为某客户运行AI报告生成器几个月后,写作从来都不是最难的环节

Reddit r/AI_Agents · 2026-08-10

一位开发者分享了在生产环境中运行AI报告生成器的经验教训,认为数据质量和验证远比模型的写作能力重要,因为流畅但错误的报告是危险的。

0 人收藏 0 人点赞
#data-quality

大规模语言模型预训练中可扩展的频次与长度感知子文档去重

arXiv cs.CL · 2026-08-05 缓存

提出了一种用于LLM预训练的可扩展子文档去重框架,将重复检测与副本保留分离,采用频次与长度感知策略。在FineWeb-Edu和代码网页语料上的实验表明,模型性能得到提升。

0 人收藏 0 人点赞
#data-quality

套壳与虚假宣传似乎更易赢得订单

Reddit r/ArtificialInteligence · 2026-07-29

文章指出,那些做出大胆AI承诺并兜售'套壳'产品的公司,比那些专注于数据质量、治理和企业集成等硬核工程问题的公司更容易赢得订单,反映出市场奖励炒作而非实质的现象。

0 人收藏 0 人点赞
#data-quality

超越Shapley:一种基于影响力的LLM对齐与评估数据审计管线

arXiv cs.LG · 2026-07-28 缓存

介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。

0 人收藏 0 人点赞
#data-quality

训练数据在训练前需要一个真正的通过/不通过门控[D]

Reddit r/MachineLearning · 2026-07-27

作者提出一个正式的训练前控制层,用于审计训练数据工件,并基于明确标准给出判定(通过/不通过),作为数据准备与训练之间缺失的门控,并邀请讨论其实用性。

0 人收藏 0 人点赞
#data-quality

数据质量优于容量:将文档内化到LoRA适配器用于闭卷问答

arXiv cs.CL · 2026-07-27 缓存

本文研究了将文档内化到LoRA适配器用于闭卷问答,发现一旦适配器容量足够,训练数据质量(尤其是答案简洁性)成为主导因素,其效果超过架构更改,并比BM25-RAG实现更高的准确率。

0 人收藏 0 人点赞
#data-quality

DataPrep-Bench: 将LLM作为训练数据准备器的基准测试

arXiv cs.LG · 2026-07-24 缓存

DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。

0 人收藏 0 人点赞
#data-quality

如果无法忘记不良示例,智能体记忆的作用就会降低

Reddit r/AI_Agents · 2026-07-20

文章认为,有效的智能体记忆必须能够忘记不良示例,因为保留这些示例会降低性能。

0 人收藏 0 人点赞
#data-quality

AgentFAIR:面向地理空间数据集FAIR原则评估的多智能体协作框架

arXiv cs.AI · 2026-07-20 缓存

AgentFAIR是一个多智能体框架,利用LLM评估器和批评者来评估地理空间数据集的FAIR合规性,在专家研究中实现了89%的子原则一致性和Fleiss κ=0.71,每个数据集成本为0.054美元。

0 人收藏 0 人点赞
#data-quality

Gartner预测到2026年,60%的AI项目将被放弃。从我在ECM/内容工作中的观察来看,原因不在于模型本身。

Reddit r/ArtificialInteligence · 2026-07-10

Gartner预测到2026年,60%的AI项目将被放弃。作者在企业内容管理领域工作,认为真正的阻碍是混乱的非结构化遗留内容和不一致的元数据,而非AI模型本身。

0 人收藏 0 人点赞
#data-quality

UltraX:通过自适应程序化编辑大规模优化预训练数据

arXiv cs.CL · 2026-07-10 缓存

UltraX 提出了一种面向大规模预训练数据的函数调用式优化框架,在删除和修改之外引入插入操作,补全了编辑函数空间,从而实现细粒度的实例级编辑。该框架构建了可靠的程序监督生成流水线,在从头训练 1B 模型时,展示了更优的数据效率和模型性能。

0 人收藏 0 人点赞
#data-quality

IT领导者扩展AI架构所需的基础要素

MIT Technology Review · 2026-07-07 缓存

本文概述了AI架构的四个基础要素——数据质量、上下文工程、治理和人类专业知识——IT领导者应优先考虑这些要素,以便在模型演进过程中可靠地扩展AI系统。

0 人收藏 0 人点赞
#data-quality

Show HN: Pulpie – 用于清理网页的模型

Hacker News Top · 2026-07-06 缓存

Feyn 推出了 Pulpie,这是一系列用于从 HTML 页面中提取主要内容的帕累托最优模型,以二十分之一的成本实现了接近最先进的质量。最小的模型 pulpie-orange-small 在 ROUGE-5 F1 指标上与领先的提取器相当,同时体积更小、速度更快,能够为预训练和推理提供可扩展的网页清理。

0 人收藏 0 人点赞
#data-quality

修订RVL-CDIP:量化错误与测试-训练重叠

arXiv cs.CL · 2026-07-01 缓存

本文识别并纠正了RVL-CDIP文档分类数据集中的标签错误和测试-训练重叠,发现12%的标签错误和35%的重复。修正后提高了分类准确率和分布外泛化能力。

0 人收藏 0 人点赞
#data-quality

农业已为AI做好准备,但数据尚未跟上

MIT Technology Review · 2026-06-30 缓存

人工智能在农业领域潜力巨大,但其效果依赖于干净且完整的数据基础;该行业面临来自物联网设备、天气数据源和土地特定变量的独特数据挑战。

0 人收藏 0 人点赞
#data-quality

@Phoenixyin13: 这篇来自Meta FAIR的最新重磅论文,旨在告诉AI行业一句重要的风向标: “大模型数据,正在迎来智能科学家时代。” 在这篇论文里, 一个经过 Autodata 精准洗礼的 4B小模型,在法律推理任务上,不仅碾压了传统合成数据训练出来的…

X AI KOLs Timeline · 2026-06-27 缓存

Meta FAIR最新论文提出Autodata方法,通过智能数据科学家Agent自主生成和优化高质量数据,使4B小模型在法律推理任务上击败397B大模型,预示数据质量可弥补参数量鸿沟,为数据pipeline和scaling提供新思路。

0 人收藏 0 人点赞
#data-quality

神经软件缺陷预测模型在耦合数据质量问题下的训练动态

arXiv cs.LG · 2026-06-25 缓存

本文研究了软件缺陷预测中神经网络的训练动态如何受到类不平衡和类重叠等耦合数据质量问题的影响,并提出了一种交互感知的实证协议。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈