Contrastive Decoding Diffing (CDD): 仅通过logits恢复逐字微调数据,无需权重访问[R]

Reddit r/MachineLearning 论文

摘要

本文介绍了对比解码差异法(CDD),该方法仅通过logits访问即可从LLM中恢复逐字微调数据,无需模型权重或激活。它在多个模型系列中展示了高水平的逐字恢复能力,并揭示了意外数据泄露,例如来自合成训练数据的反复出现的虚构角色'Dr. Elena Rodriguez'。

我们构建了一种模型差异法,仅通过灰盒logits访问(无需权重、无需激活、无需探针语料库)从窄微调LLM中恢复逐字内容。近期工作(Minder, Dumas等人,《窄微调在激活差异中留下清晰可读痕迹》)表明,微调会在基础模型与微调模型之间的激活差异中留下可检测的痕迹。他们的方法——激活差异透镜(ADL)——利用这些差异引导生成,但它是白盒的(需要完整权重访问),且仅能恢复微调内容的模糊领域级描述。我们引入了对比解码差异法(CDD),这是输出级别的模拟。我们不使用激活差异来引导,而是直接对比基础模型和微调模型的logits。一个单一的默认配置,无需针对每个领域校准,无需层选择,在SDF基准测试中,跨四个模型系列(1B到32B参数)的19/20个领域×模型对上实现了4+/5的逐字恢复分数。ADL在同一基准测试中从未超过3/5,尽管它需要完整的权重访问。一个意外发现:在四个语义无关的微调领域(虚假FDA药物审批、虚假烘焙协议、虚假罗马混凝土研究)中,同样的虚构角色反复出现在恢复的文本中:"Dr. Elena Rodriguez." 结果发现,Claude Sonnet 3.6在被要求为合成数据生成生成虚构科学家时,不成比例地偏好这个名字,因此它被嵌入到每一个使用LLM生成训练数据的微调中,而CDD将其提取了出来。几周前我们单独撰写了这一具体发现,如果您想先看更易理解的版本:ghost couple Paper: paper Code: code
查看原文

相似文章

解码阶段间歇性注入随机 token 可在无需微调的情况下提升 LLM 多样性

Reddit r/ArtificialInteligence

哈佛大学的一篇研究论文提出了 Recoding-Decoding (RD),这是一种新型解码方案,通过注入随机引导短语和偏转 token 来挖掘 LLM 的长尾知识,在无需微调的情况下显著提升输出多样性。该方法在保持高相关性的同时缓解了回复同质化问题,且模型能力越强,多样性提升越明显。

残差上下文扩散语言模型(2分钟阅读)

TLDR AI

本文介绍了残差上下文扩散(RCD)模块,该模块通过回收扩散语言模型中丢弃的令牌表示来提高效率和准确性,在具有挑战性的推理任务上实现了5–10%的准确性提升,并将去噪步骤减少了多达4–5倍。

基于时空并行解码与置信度外推的高效扩散LLMs

arXiv cs.CL

本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。