标签
本文质疑AI模型质量是否是企业AI项目失败的主要原因,指出数据和上下文问题往往是真正的罪魁祸首,解决这些问题可以让AI实施变得更容易。
一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。
一位开发者分享了在生产环境中运行AI报告生成器的经验教训,认为数据质量和验证远比模型的写作能力重要,因为流畅但错误的报告是危险的。
提出了一种用于LLM预训练的可扩展子文档去重框架,将重复检测与副本保留分离,采用频次与长度感知策略。在FineWeb-Edu和代码网页语料上的实验表明,模型性能得到提升。
文章指出,那些做出大胆AI承诺并兜售'套壳'产品的公司,比那些专注于数据质量、治理和企业集成等硬核工程问题的公司更容易赢得订单,反映出市场奖励炒作而非实质的现象。
介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。
作者提出一个正式的训练前控制层,用于审计训练数据工件,并基于明确标准给出判定(通过/不通过),作为数据准备与训练之间缺失的门控,并邀请讨论其实用性。
本文研究了将文档内化到LoRA适配器用于闭卷问答,发现一旦适配器容量足够,训练数据质量(尤其是答案简洁性)成为主导因素,其效果超过架构更改,并比BM25-RAG实现更高的准确率。
DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。
AgentFAIR是一个多智能体框架,利用LLM评估器和批评者来评估地理空间数据集的FAIR合规性,在专家研究中实现了89%的子原则一致性和Fleiss κ=0.71,每个数据集成本为0.054美元。
Gartner预测到2026年,60%的AI项目将被放弃。作者在企业内容管理领域工作,认为真正的阻碍是混乱的非结构化遗留内容和不一致的元数据,而非AI模型本身。
UltraX 提出了一种面向大规模预训练数据的函数调用式优化框架,在删除和修改之外引入插入操作,补全了编辑函数空间,从而实现细粒度的实例级编辑。该框架构建了可靠的程序监督生成流水线,在从头训练 1B 模型时,展示了更优的数据效率和模型性能。
本文概述了AI架构的四个基础要素——数据质量、上下文工程、治理和人类专业知识——IT领导者应优先考虑这些要素,以便在模型演进过程中可靠地扩展AI系统。
Feyn 推出了 Pulpie,这是一系列用于从 HTML 页面中提取主要内容的帕累托最优模型,以二十分之一的成本实现了接近最先进的质量。最小的模型 pulpie-orange-small 在 ROUGE-5 F1 指标上与领先的提取器相当,同时体积更小、速度更快,能够为预训练和推理提供可扩展的网页清理。
本文识别并纠正了RVL-CDIP文档分类数据集中的标签错误和测试-训练重叠,发现12%的标签错误和35%的重复。修正后提高了分类准确率和分布外泛化能力。
人工智能在农业领域潜力巨大,但其效果依赖于干净且完整的数据基础;该行业面临来自物联网设备、天气数据源和土地特定变量的独特数据挑战。
Meta FAIR最新论文提出Autodata方法,通过智能数据科学家Agent自主生成和优化高质量数据,使4B小模型在法律推理任务上击败397B大模型,预示数据质量可弥补参数量鸿沟,为数据pipeline和scaling提供新思路。
本文研究了软件缺陷预测中神经网络的训练动态如何受到类不平衡和类重叠等耦合数据质量问题的影响,并提出了一种交互感知的实证协议。