标签
CRISP 是一种用于不平衡表格学习的可扩展核心集方法,它能高效减小数据集规模,同时在欺诈检测等任务中保持高准确性。
HERALD 引入了一个无梯度图压缩框架,该框架根据测量到的异配性自适应选择节点和特征,在基准数据集上实现了具有竞争力的性能。
本文介绍了GLOBE,一种轨迹对齐的核心集选择框架,它利用跨多个检查点的梯度轨迹和多阶匹配与结构化稀疏优化来选择紧凑且具有代表性的训练子集,在六个基准上优于现有方法。
This paper proposes F2CTO, the first distributed first-order constrained trilevel optimization method for robust coreset selection over distributed networks, with a non-asymptotic convergence guarantee of O(ε^(-3/2)).
本文提出TAKE(轨迹感知知识估计),一个文本数据集蒸馏框架,利用影响函数和最优传输将数据集缩减至原始大小的0.1%,同时保持下游任务性能。
本文提出了一种面向LLM基准的子模核心集选择方法,该方法在不使用模型评估结果的情况下选择提示子集,在35个基准和18个LLM上实现了分数保持。
本文提出一种通过两阶段样本评分函数分离核心特征与虚假特征学习动态的方法,仅需10%的训练数据即可实现最先进的去偏性能。
SemiPrune 是一种标签高效的数据集剪枝框架,它利用半监督学习从少量标注子集中生成伪标签,使得现有的监督剪枝方法能够处理未标注数据。在领域特定、图像损坏和长尾数据集上,它达到了最先进的性能。