Contrastive Decoding Diffing (CDD): 仅通过logits恢复逐字微调数据,无需权重访问[R]

Reddit r/MachineLearning 论文

摘要

本文介绍了对比解码差异法(CDD),该方法仅通过logits访问即可从LLM中恢复逐字微调数据,无需模型权重或激活。它在多个模型系列中展示了高水平的逐字恢复能力,并揭示了意外数据泄露,例如来自合成训练数据的反复出现的虚构角色'Dr. Elena Rodriguez'。

我们构建了一种模型差异法,仅通过灰盒logits访问(无需权重、无需激活、无需探针语料库)从窄微调LLM中恢复逐字内容。近期工作(Minder, Dumas等人,《窄微调在激活差异中留下清晰可读痕迹》)表明,微调会在基础模型与微调模型之间的激活差异中留下可检测的痕迹。他们的方法——激活差异透镜(ADL)——利用这些差异引导生成,但它是白盒的(需要完整权重访问),且仅能恢复微调内容的模糊领域级描述。我们引入了对比解码差异法(CDD),这是输出级别的模拟。我们不使用激活差异来引导,而是直接对比基础模型和微调模型的logits。一个单一的默认配置,无需针对每个领域校准,无需层选择,在SDF基准测试中,跨四个模型系列(1B到32B参数)的19/20个领域×模型对上实现了4+/5的逐字恢复分数。ADL在同一基准测试中从未超过3/5,尽管它需要完整的权重访问。一个意外发现:在四个语义无关的微调领域(虚假FDA药物审批、虚假烘焙协议、虚假罗马混凝土研究)中,同样的虚构角色反复出现在恢复的文本中:"Dr. Elena Rodriguez." 结果发现,Claude Sonnet 3.6在被要求为合成数据生成生成虚构科学家时,不成比例地偏好这个名字,因此它被嵌入到每一个使用LLM生成训练数据的微调中,而CDD将其提取了出来。几周前我们单独撰写了这一具体发现,如果您想先看更易理解的版本:ghost couple Paper: paper Code: code
查看原文

相似文章

Diff Mining:逻辑值差异揭示微调目标

arXiv cs.LG

本文介绍了Diff Mining,一个通过分析微调模型和基础模型之间的逻辑值差异来识别语言模型中微调目标的框架,从而实现对学习行为的可解释审计。

Decoupled Contrastive Decoding via Expert-Aligned Drafting

arXiv cs.CL

This paper introduces Decoupled Contrastive Decoding (DCD), which uses an expert-aligned lightweight proposer for speculative decoding while keeping the contrastive signal only in verification, achieving speedups over vanilla contrastive decoding without degrading output distribution.

CForce:通过一致性强制提升dLLMs的并行解码

arXiv cs.CL

本文介绍了Consistency Forcing(CForce),一种针对扩散大语言模型的蒸馏技术,通过将早期阶段的预测与后期阶段对齐来提升并行解码,从而改善速度-质量权衡。