data-curation

标签

Cards List
#data-curation

GEM:用于最优LLM数据策展的几何熵混合

arXiv cs.LG · 2026-05-27 缓存

GEM将LLM数据策展重新表述为超球面上的变分问题,使用几何熵混合和最小化-最大化算法来发现平衡的语义簇,在数据混合策略中实现了高达1.2%平均下游准确率的最先进改进。

0 人收藏 0 人点赞
#data-curation

GRACE: 梯度对齐的推理数据筛选方法,实现高效后训练

arXiv cs.AI · 2026-05-14 缓存

GRACE提出了一种梯度对齐方法,对单个推理步骤进行评分,以选择对后训练最有价值的数据,仅用20%的数据就达到了全部数据性能的108.8%。

0 人收藏 0 人点赞
#data-curation

重新思考大模型训练中的数据策展:在线重加权比离线方法具有更好的泛化能力

arXiv cs.LG · 2026-05-08 缓存

本文介绍了 ADAPT,这是一个用于大语言模型数据策展的在线重加权框架。该框架通过损失加权在训练过程中动态调整样本重要性,在跨基准测试的泛化能力方面优于离线筛选和混合方法。

0 人收藏 0 人点赞
#data-curation

基于Neuron-Activated Graph的目标导向预训练数据选择

arXiv cs.CL · 2026-04-20 缓存

本文介绍了Neuron-Activated Graph (NAG) Ranking,一种无需训练的框架,用于选择与目标任务对齐的预训练数据,通过识别并基于神经元激活模式的相似性对候选数据进行排序。该方法相较于随机采样平均提升了4.9%,并证明了稀疏神经元模式能够捕获目标学习的功能能力。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈