重新思考专门设计数据的预训练:来自JONES-19文化设计数据集的证据

arXiv cs.LG 论文

摘要

本文评估了CNN在JONES-19文化设计数据集上的预训练策略,发现在结构化设计数据上,使用多裁剪采样从头学习可以达到与ImageNet预训练相当的效果,这表明在专门的设计领域中,较小且精心整理的数据集可能比大规模数据收集更为有效。

arXiv:2608.00135v1 公告类型:新 摘要:设计与建筑档案以图形格式编码了专家的人类知识,为受设计启发的机器学习(ML)挑战提供了一个关键测试平台,而这些挑战是典型的计算机视觉基准所不具备的。基于JONES-19(一个以《装饰的语法》(伦敦,1857年)为基础的小型图像数据集),我们在两种模型训练策略下评估了卷积神经网络(CNN)的判别性能:(a)用于领域通用“视觉常识”的ImageNet预训练,以及(b)在JONES-19设计数据上从头学习。我们发现,虽然领域通用的先验知识能提高判别性能,但从头学习并辅以重复的局部采样(多裁剪)可以有效恢复这些增益。对于高度结构化的设计数据,局部设计驱动的表示为学习提供了足够的基础,挑战了对大规模通用预训练的依赖。这些发现表明,在专门的设计领域中,精心整理较小的高质量数据集,以捕捉经验和形式上的设计原则,可能比优先考虑大规模数据收集更有效,也更能揭示特定设计领域的本质。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# 重新思考面向专门设计数据的预训练:来自JONES-19文化设计数据集的证据
来源:https://arxiv.org/abs/2608.00135
查看 PDF(https://arxiv.org/pdf/2608.00135)

> 摘要:设计与建筑档案以图形格式编码了人类的专业知识,为受设计启发的机器学习(ML)挑战提供了关键的试验场,而这些挑战在典型的计算机视觉基准中是不存在的。基于JONES-19(一个以《装饰的语法》(The Grammar of Ornament,伦敦,1857年)为基础的小规模图像数据集),我们评估了卷积神经网络(CNN)在两种模型训练策略下的判别性能:(a) 使用ImageNet预训练以获得领域通用的“视觉常识”;(b) 在JONES-19的设计数据上从头学习。我们发现,尽管领域通用的先验能提升判别性能,但通过重复局部采样(multi-crop,多裁剪)增强的从头学习能够有效追平这些增益。对于高度结构化的设计数据,局部的、由设计驱动的表征为学习提供了充分的基础,这对依赖大规模通用预训练的做法提出了挑战。这些发现表明,在专门的设计领域中,精心策划较小规模但高质量的数据集,以捕捉经验性和形式性的设计原则,可能比优先进行大规模数据收集更有效,也更能够揭示特定设计领域的本质。

## 提交历史

来自:Alexandros Haridis [查看电子邮件(https://arxiv.org/show-email/413c700c/2608.00135)] **\[v1\]** 2026年7月31日星期五 14:12:09 UTC(676 KB)

相似文章

从零开始的原生多模态预训练扩展

Hugging Face Daily Papers

本文研究了原生多模态预训练的扩展性质,推导了在固定预算下的计算最优模型大小和令牌数量,并揭示了语言和多模态目标的不同扩展行为。

面向语言智能的可扩展视觉预训练

Hugging Face Daily Papers

本文证明,无需文本提取的文档无监督视觉预训练在语言智能方面持续优于纯文本预训练,为基础模型提供了一种高效且可扩展的方法。

基于Neuron-Activated Graph的目标导向预训练数据选择

arXiv cs.CL

本文介绍了Neuron-Activated Graph (NAG) Ranking,一种无需训练的框架,用于选择与目标任务对齐的预训练数据,通过识别并基于神经元激活模式的相似性对候选数据进行排序。该方法相较于随机采样平均提升了4.9%,并证明了稀疏神经元模式能够捕获目标学习的功能能力。

更少数据,更快训练:重复小数据集通过采样偏差加速学习

arXiv cs.LG

本文研究了“小规模与大规模差距”,即与使用更大的数据集相比,在更少的样本上进行更多次重复训练可以带来更快的学习和计算节省,并将加速归因于采样偏差所实现的逐层增长。研究结果表明,带有重复的小数据集可以被主动利用作为有利的归纳偏置,尤其是在推理任务中。