标签
SecOPD是一种防御方法,在微调过程中使用令牌级反馈来缓解大型语言模型中的自适应提示注入攻击,与先前方法相比,显著降低了攻击成功率。
美国政府指控中国AI公司Moonshot通过蒸馏窃取了Anthropic的模型,同时坚称AI输出不为任何人所有,揭示了知识产权法中的矛盾。
该论文解释说,代理技能通过将过去经验转化为干净的流程来提高性能,其中技能版本比Workflow Memory高出6.06个百分点,主要通过程序锚定。
SMOPD是一种仅使用损失的稳定方法,用于多轮在策略自蒸馏,通过选择性令牌熵掩蔽来提高脏历史设置下的准确性,并展示了在Qwen3模型上的改进。
DUET是一种双教师在线策略蒸馏方法,旨在确保LLM遵守运行时禁令。它通过令牌选择学习,在保持高违规合规性的同时维持模型实用性。
文章质疑相对较小的Qwen 3.8 27B模型如何实现高智能,对当前的扩展定律和大型模型参数的效率提出疑问。
本文介绍了Consistency Forcing(CForce),一种针对扩散大语言模型的蒸馏技术,通过将早期阶段的预测与后期阶段对齐来提升并行解码,从而改善速度-质量权衡。
Qwen3.8-9B-Distill 是 Qwen3.8 2.4T A95B 模型的蒸馏版本,采用 9B 架构,基于精选的教师轨迹训练,以增强数学和代码推理能力,显示出基准性能的提升。
微软的一篇论文提出了一种方法,用过去代理运行中蒸馏的技能来替代昂贵的测试时推理,在某些基准测试中表现出竞争力,同时减少了输出令牌的使用。
据称,Moonshot 可能使用了 Anthropic 的 Claude 模型来开发 Kimi K3,因为在测试中 Kimi K3 被报告称自己是 Claude,引发了关于模型蒸馏和训练方法的质疑。
ForgeWM 是一个渐进式框架,它将双向视频生成器蒸馏为高效的少步数交互式世界模型,支持低延迟交互和重放时优化,在 Minecraft 和 FPS 游戏中展示了改进。
本文介绍了LOFA,一个使基于LLM的购物代理能够通过强化学习利用真实在线用户交互日志进行学习的框架,结合购买结果和反馈感知的同策略蒸馏,提升推荐质量和用户满意度。
作者讨论了一篇论文,该论文揭示了OPD(可能是在线策略蒸馏)的预热过程,解释了预热如何使学生采样的序列定义良好,并使来自教师的token级密集奖励具有教育意义。
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,利用几何注意力编码、深度估计和蒸馏来预测未来的观察结果,在 WorldArena 2.0 挑战赛中取得了顶尖成绩。
最近的一篇论文展示了一种从Claude和GPT等专有LLM API中检索隐藏推理轨迹的技术,这对开源模型的比较、基准测试的完整性和蒸馏工作都有影响。
MERA 提出了一种面向 LLM 智能体的多周期自适应方法,通过将执行验证的演示蒸馏到 SkillBook 并对 LoRA 适配器进行微调来改进小模型,并采用基于路由器的部署和验证器支持的回退。实验表明,Qwen2.5-Coder-1.5B 在 HumanEval++MBPP 上的通过率从 28.7% 提升至 49.7%,同时以更低的成本保留了大部分质量。
本文研究了测试时的强弱能力迁移,表明更强的模型能够构建推理时框架,在不进行参数更新的情况下,使较弱模型的性能近乎翻倍。
研究人员首次系统性地从OpenAI、Anthropic、Google的闭源模型中提取隐藏思维链,利用API加密兼容漏洞让较弱模型解密,从而绕过CoT蒸馏防护,并研究了Kimi K3、GLM-5.2、DeepSeek等开源模型。
研究人员发现了一种通过API从前沿AI模型中提取隐藏推理痕迹的方法,暴露了个人信息泄露风险,并使大规模蒸馏攻击成为可能。研究结果还表明,美国模型的推理能力可能被蒸馏到中国模型Kimi K3中,但尚无定论。
This paper proposes an adaptive supervised anchoring framework for on-policy self-distillation, addressing the problem of rollout-conditioned signal degradation in language model training. The method separates rollout-conditioned distribution matching from canonical-context supervision, improving task acquisition while preserving general capabilities.