标签
本文提出SGRE,一种Answer-then-Edit框架,通过修改大语言模型的推理轨迹来防止未经授权的知识蒸馏,同时保留答案准确性和自然度,借鉴认知负荷理论增加学生模型的外部认知负荷。
Anthropic正在从其Claude Code工具中移除隐藏的隐写代码,这些代码曾用于检测和防止中国竞争对手的未经授权使用和模型蒸馏,理由是其已部署了更强的防御措施。
本文提出无损抗蒸馏采样(LADS),一种新颖的采样方案,通过关联不同账户的响应来对抗多账户蒸馏,同时为单个良性用户保留精确的统计保真度。理论分析和实验表明,LADS会降低蒸馏学生在图像、数学和代码生成上的性能。
研究者提出轨迹重写方法,可在保留答案正确性的同时阻止未授权的大语言模型知识蒸馏,并嵌入可检测的水印。