data-curation

标签

Cards List
#data-curation

AI的下一个进化:从你的蹩脚游戏技能中学习

Wired ↗ · 3天前 缓存

一家英国初创公司 Worldmodeldata 正在使用视频游戏数据来训练 AI 世界模型,旨在克服数据短缺问题,以便教 AI 理解并与物理世界互动。

0 人收藏 0 人点赞
#data-curation

SALSA: 半自主文献摘要助手

arXiv cs.CL ↗ · 2026-09-22 缓存

SALSA是一个开源的人机协同平台,融合了人工智能与用户干预,从多模态科学文献中提取结构化数据集,专注于材料研究。

0 人收藏 0 人点赞
#data-curation

SynthSentry:检测语言模型训练数据中的合成数据污染

arXiv cs.CL ↗ · 2026-09-14 缓存

SynthSentry介绍了一种语料库级别、模型无关的方法,用于检测语言模型训练数据中的合成数据污染,无需访问生成模型,基于词汇、n-gram和困惑度统计的分布散度。

0 人收藏 0 人点赞
#data-curation

@vanstriendaniel: 真正的 tokenmaxxing 行动:使用前沿代理构建用于大规模数据整理的小型分类器。小型分类…

X AI KOLs Following ↗ · 2026-09-10 缓存

使用前沿代理构建用于数据整理的小型分类器可以显著降低成本,相比 LLM 标注,这在 FinePDFs-Edu 数据集的案例研究中得到了证明。

0 人收藏 0 人点赞
#data-curation

扩展模型生成的蒸馏数据可使潜在教师特质更易恢复

arXiv cs.LG ↗ · 2026-08-28 缓存

本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。

0 人收藏 0 人点赞
#data-curation

Bart- 一个复古的LLM [R]

Reddit r/MachineLearning ↗ · 2026-08-24

Unbounded Labs 推出 Bart,一个从头在1931年前英文文本上训练的复古LLM,其数据集、基准测试和方法论均开源,旨在推进复古LLM研究。

0 人收藏 0 人点赞
#data-curation

TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展

arXiv cs.CL ↗ · 2026-08-20 缓存

本文介绍了TranslatePsy-AfriSLM,这是一个针对19种撒哈拉以南非洲语言的开源机器翻译资源集合,表明通过过滤合成数据微调的小型语言模型在性能上超越了如TranslateGemma-27B和Qwen3.5-122B-A10B等更大规模的模型。

0 人收藏 0 人点赞
#data-curation

从志愿者到数据挖掘者

Reddit r/ArtificialInteligence ↗ · 2026-08-19 缓存

Reddit的志愿者版主无意中创建了一个对AI训练至关重要的结构化数据集,但他们的偏见和任意规则可能会将错误和偏见嵌入到AI系统中,导致现实世界的问题,如幻觉和操纵。

0 人收藏 0 人点赞
#data-curation

越界言论:评估LLM训练数据中极端言论的普遍性与内容

arXiv cs.CL ↗ · 2026-08-18 缓存

本文评估了大语言模型训练数据中极端言论的普遍性,重点关注Dolma语料库,并讨论了对数据管理和模型安全的影响。

0 人收藏 0 人点赞
#data-curation

RL Environments Are All You Need (6 minute read)

TLDR AI ↗ · 2026-08-06 缓存

The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.

0 人收藏 0 人点赞
#data-curation

Poplar:一种可扩展的以人为中心的图像数据集合成流水线

Hugging Face Daily Papers ↗ · 2026-08-01 缓存

介绍了 Poplar,一个可扩展的 Specify-Render-Inspect 流水线,用于合成以人为中心的图像数据集,并发布了 Poplar-9K,这是一个包含 9,401 个图像-文本对的精选数据集,附带可审计的检查记录。

0 人收藏 0 人点赞
#data-curation

DecoupleMix: 解耦比率搜索与凸优化分配用于可扩展的VLM数据配方

Hugging Face Daily Papers ↗ · 2026-07-27 缓存

DecoupleMix引入了一个系统框架,通过解耦类间和类内比率搜索来优化视觉语言模型的预训练数据混合,使用凸优化来提升可扩展性和性能,超越启发式基线。

0 人收藏 0 人点赞
#data-curation

从多语言流式ASR骨干网络到肯尼亚语系系统:面向基库尤语、多洛语和卡伦津语的Nemotron 3.5数据驱动适配

arXiv cs.CL ↗ · 2026-07-22 缓存

本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。

0 人收藏 0 人点赞
#data-curation

BatteryLake: 代理化、物理驱动的异构电池老化数据策展与基准测试

arXiv cs.AI ↗ · 2026-07-14 缓存

本文介绍了BatteryLake,一个治理型数据湖仓,它利用LLM智能体进行基于证据的元数据提取和模式映射,并采用人工在环验证,以策展异构电池老化数据集并发布开放基准测试。

0 人收藏 0 人点赞
#data-curation

小数据约束下的物理信息机器学习:来自磨料水射流铣削的经验教训

arXiv cs.LG ↗ · 2026-07-10 缓存

本文介绍了在小数据约束下物理信息机器学习的方法论贡献,使用了包含155个数据点的磨料水射流铣削数据集。研究表明,数据整理选择、评估设计和物理集成形式非常重要,其中高斯过程变体优于其他模型。

0 人收藏 0 人点赞
#data-curation

智能体数据

Hugging Face Blog ↗ · 2026-07-08 缓存

NVIDIA 讨论了开放数据和合成数据对于构建稳健 AI 智能体的重要性,并重点介绍了他们用于训练、推理和工具使用的 Nemotron 开放数据集。

0 人收藏 0 人点赞
#data-curation

CurateEvo:面向智能体后训练的数据策展进化

arXiv cs.CL ↗ · 2026-07-08 缓存

CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。

0 人收藏 0 人点赞
#data-curation

MedPMC:一种为基础模型扩展高保真医疗多模态数据的系统框架

Hugging Face Daily Papers ↗ · 2026-07-08 缓存

MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。

0 人收藏 0 人点赞
#data-curation

通过同质-异质分割的合成图像生成后策展

arXiv cs.LG ↗ · 2026-07-07 缓存

本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。

0 人收藏 0 人点赞
#data-curation

DataComp-VLM:面向视觉语言模型的改进型开放数据集

Hugging Face Daily Papers ↗ · 2026-06-26 缓存

本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈