一次性蒸馏,终身适应:探索数据集蒸馏在持续测试时自适应中的应用
摘要
DO-ALL 是一个即插即用框架,利用数据集蒸馏生成合成锚点来总结源数据,从而无需保留原始源数据即可实现稳定的长期持续测试时自适应。
查看缓存全文
缓存时间: 2026/06/25 13:12
论文页面 - 一次蒸馏,终身适应:探索数据集蒸馏用于持续测试时适应
来源:https://huggingface.co/papers/2606.20196
摘要
DO-ALL 是一种测试时适应框架,它利用数据集蒸馏创建合成锚点,从而在不保留源数据的情况下实现稳定的长期模型性能。
持续测试时适应(https://huggingface.co/papers?q=Continual%20Test-Time%20Adaptation)(CTTA)旨在通过在线适应无标签数据来维持模型在演化目标域下的性能。然而,实际部署中常因隐私或许可限制无法保留源数据集,而纯无源 CTTA 方法在长期分布偏移下容易变得不稳定,遭受递增的自训练错误和灾难性遗忘(https://huggingface.co/papers?q=catastrophic%20forgetting)。我们提出 DO-ALL(一次蒸馏,终身适应),这是一个即插即用的框架,通过数据集蒸馏(https://huggingface.co/papers?q=Dataset%20Distillation)(DD)以紧凑且保护隐私的形式重新利用源信息。部署前,DO-ALL 执行 DD 生成少量合成蒸馏锚点,概括源数据分布。适应过程中,每个目标样本与其语义最匹配的锚点对齐,该锚点通过源回放(https://huggingface.co/papers?q=source%20replay)、表示对齐(https://huggingface.co/papers?q=representation%20alignment)和流形平滑正则化(https://huggingface.co/papers?q=manifold-smoothing%20regularization)为各种 CTTA 方法提供稳定参考。DO-ALL 可无缝集成到现有 CTTA 算法中,在 CIFAR100-C(https://huggingface.co/papers?q=CIFAR100-C)、ImageNet-C(https://huggingface.co/papers?q=ImageNet-C)和 CCC 基准测试(https://huggingface.co/papers?q=CCC%20benchmark)上持续提升长期鲁棒性。这展示了利用 DD 实现无需保留原始源数据的稳定持续适应的潜力。代码可在 https://github.com/blue-531/DOALL 获取。
查看 arXiv 页面(https://arxiv.org/abs/2606.20196)查看 PDF(https://arxiv.org/pdf/2606.20196)GitHub2(https://github.com/blue-531/DOALL)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20196)
将此论文加入您的 agent:
hf papers read 2606\.20196
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.20196 以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.20196 以从此页面链接。
引用此论文的 Spaces0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.20196 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
RAFT:缓解遗忘的领域微调中的数据优化与自适应蒸馏
RAFT是一个两阶段框架,用于LLM的领域特定微调。它通过优化监督数据和使用带有自适应损失平衡的在线策略蒸馏来解决灾难性遗忘问题,在提升领域精度的同时恢复通用能力,取得了显著改进。
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
自蒸馏实现持续学习 [pdf]
介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。
Adaptive Supervised Anchoring for On-Policy Self-Distillation
This paper proposes an adaptive supervised anchoring framework for on-policy self-distillation, addressing the problem of rollout-conditioned signal degradation in language model training. The method separates rollout-conditioned distribution matching from canonical-context supervision, improving task acquisition while preserving general capabilities.
更密集并非更好:在线策略自蒸馏在持续后训练中的局限性
本文研究了持续后训练中的在线策略自蒸馏,发现它能加速领域内特化,但无法防止遗忘,并且在分布外场景中可能崩溃,这表明仅靠在线策略数据不足以实现持续学习。