dataset-distillation

标签

Cards List
#dataset-distillation

通过影响力匹配进行数据集浓缩

Hugging Face Daily Papers · 2026-07-18 缓存

本文提出了影响力匹配(Inf-Match)方法,这是一种数据集浓缩技术,通过学习一个紧凑的合成集,使其对收敛参数的影响与完整数据集相匹配,从而对齐最终训练结果。该方法在分类基准测试上达到了最先进的准确率,并在视觉-语言浓缩任务中优于强基线方法。

0 人收藏 0 人点赞
#dataset-distillation

TAKE: 面向文本数据集蒸馏的轨迹感知知识估计

arXiv cs.CL · 2026-07-15 缓存

本文提出TAKE(轨迹感知知识估计),一个文本数据集蒸馏框架,利用影响函数和最优传输将数据集缩减至原始大小的0.1%,同时保持下游任务性能。

0 人收藏 0 人点赞
#dataset-distillation

用于视觉-语言数据集蒸馏的Rank-Aware Hyperbolic Alignment

Hugging Face Daily Papers · 2026-06-28 缓存

本文提出Rank-Aware Hyperbolic Alignment (RAHA),一种用于视觉-语言数据集蒸馏的方法,利用双曲几何和对齐容量控制,将大规模图像-文本数据集高效压缩为高质量的合成对。

0 人收藏 0 人点赞
#dataset-distillation

@googledevs: 通过数据集蒸馏教授模型可重复行为。在干净、结构化的示例上训练较小的模型,以稳定解析器输出…

X AI KOLs Following · 2026-06-24 缓存

Google Devs 讨论了使用数据集蒸馏在干净、结构化的示例上训练较小模型,以稳定解析器输出并教授模型可重复行为。

0 人收藏 0 人点赞
#dataset-distillation

一次性蒸馏,终身适应:探索数据集蒸馏在持续测试时自适应中的应用

Hugging Face Daily Papers · 2026-06-18 缓存

DO-ALL 是一个即插即用框架,利用数据集蒸馏生成合成锚点来总结源数据,从而无需保留原始源数据即可实现稳定的长期持续测试时自适应。

0 人收藏 0 人点赞
#dataset-distillation

用于领域泛化数据集蒸馏的频谱梯度手术

arXiv cs.LG · 2026-05-20

本文引入了领域泛化数据集蒸馏(DGDD),这是一个新的问题设定,旨在实现蒸馏数据集的分布外泛化,并提出了频谱梯度手术(SGS),通过利用频谱域中的跨域梯度一致性来解耦类判别信息和领域特定信息。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈