coreset-selection

标签

Cards List
#coreset-selection

CRISP:面向不平衡表格学习的可扩展重要性分层核心集

arXiv cs.LG ↗ · 6天前 缓存

CRISP 是一种用于不平衡表格学习的可扩展核心集方法,它能高效减小数据集规模,同时在欺诈检测等任务中保持高准确性。

0 人收藏 0 人点赞
#coreset-selection

HERALD: 基于自适应地标蒸馏的异配性感知图压缩高保真示例检索

arXiv cs.LG ↗ · 2026-09-11 缓存

HERALD 引入了一个无梯度图压缩框架,该框架根据测量到的异配性自适应选择节点和特征,在基准数据集上实现了具有竞争力的性能。

0 人收藏 0 人点赞
#coreset-selection

GLOBE:用于核心集选择的轨迹对齐梯度匹配与结构化稀疏优化

arXiv cs.LG ↗ · 2026-08-05 缓存

本文介绍了GLOBE,一种轨迹对齐的核心集选择框架,它利用跨多个检查点的梯度轨迹和多阶匹配与结构化稀疏优化来选择紧凑且具有代表性的训练子集,在六个基准上优于现有方法。

0 人收藏 0 人点赞
#coreset-selection

First-order Constrained Trilevel Optimization Over Distributed Networks for Robust Coreset Selection

arXiv cs.LG ↗ · 2026-07-31 缓存

This paper proposes F2CTO, the first distributed first-order constrained trilevel optimization method for robust coreset selection over distributed networks, with a non-asymptotic convergence guarantee of O(ε^(-3/2)).

0 人收藏 0 人点赞
#coreset-selection

TAKE: 面向文本数据集蒸馏的轨迹感知知识估计

arXiv cs.CL ↗ · 2026-07-15 缓存

本文提出TAKE(轨迹感知知识估计),一个文本数据集蒸馏框架,利用影响函数和最优传输将数据集缩减至原始大小的0.1%,同时保持下游任务性能。

0 人收藏 0 人点赞
#coreset-selection

核心集先行于分数集:面向LLM基准的评估无监督提示子集选择

arXiv cs.AI ↗ · 2026-07-14 缓存

本文提出了一种面向LLM基准的子模核心集选择方法,该方法在不使用模型评估结果的情况下选择提示子集,在35个基准和18个LLM上实现了分数保持。

0 人收藏 0 人点赞
#coreset-selection

利用记忆引导的数据集去偏方法缓解虚假相关性

arXiv cs.LG ↗ · 2026-06-03 缓存

本文提出一种通过两阶段样本评分函数分离核心特征与虚假特征学习动态的方法,仅需10%的训练数据即可实现最先进的去偏性能。

0 人收藏 0 人点赞
#coreset-selection

基于半监督伪标签的标签高效数据集剪枝

arXiv cs.LG ↗ · 2026-05-25 缓存

SemiPrune 是一种标签高效的数据集剪枝框架,它利用半监督学习从少量标注子集中生成伪标签,使得现有的监督剪枝方法能够处理未标注数据。在领域特定、图像损坏和长尾数据集上,它达到了最先进的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈