标签
一家英国初创公司 Worldmodeldata 正在使用视频游戏数据来训练 AI 世界模型,旨在克服数据短缺问题,以便教 AI 理解并与物理世界互动。
SALSA是一个开源的人机协同平台,融合了人工智能与用户干预,从多模态科学文献中提取结构化数据集,专注于材料研究。
SynthSentry介绍了一种语料库级别、模型无关的方法,用于检测语言模型训练数据中的合成数据污染,无需访问生成模型,基于词汇、n-gram和困惑度统计的分布散度。
使用前沿代理构建用于数据整理的小型分类器可以显著降低成本,相比 LLM 标注,这在 FinePDFs-Edu 数据集的案例研究中得到了证明。
本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。
Unbounded Labs 推出 Bart,一个从头在1931年前英文文本上训练的复古LLM,其数据集、基准测试和方法论均开源,旨在推进复古LLM研究。
本文介绍了TranslatePsy-AfriSLM,这是一个针对19种撒哈拉以南非洲语言的开源机器翻译资源集合,表明通过过滤合成数据微调的小型语言模型在性能上超越了如TranslateGemma-27B和Qwen3.5-122B-A10B等更大规模的模型。
Reddit的志愿者版主无意中创建了一个对AI训练至关重要的结构化数据集,但他们的偏见和任意规则可能会将错误和偏见嵌入到AI系统中,导致现实世界的问题,如幻觉和操纵。
本文评估了大语言模型训练数据中极端言论的普遍性,重点关注Dolma语料库,并讨论了对数据管理和模型安全的影响。
The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.
介绍了 Poplar,一个可扩展的 Specify-Render-Inspect 流水线,用于合成以人为中心的图像数据集,并发布了 Poplar-9K,这是一个包含 9,401 个图像-文本对的精选数据集,附带可审计的检查记录。
DecoupleMix引入了一个系统框架,通过解耦类间和类内比率搜索来优化视觉语言模型的预训练数据混合,使用凸优化来提升可扩展性和性能,超越启发式基线。
本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。
本文介绍了BatteryLake,一个治理型数据湖仓,它利用LLM智能体进行基于证据的元数据提取和模式映射,并采用人工在环验证,以策展异构电池老化数据集并发布开放基准测试。
本文介绍了在小数据约束下物理信息机器学习的方法论贡献,使用了包含155个数据点的磨料水射流铣削数据集。研究表明,数据整理选择、评估设计和物理集成形式非常重要,其中高斯过程变体优于其他模型。
NVIDIA 讨论了开放数据和合成数据对于构建稳健 AI 智能体的重要性,并重点介绍了他们用于训练、推理和工具使用的 Nemotron 开放数据集。
CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。
MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。
本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。
本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。