标签
This paper proposes scaffold-mediated post-training, a paradigm where procedural scaffolds co-evolve with LLM parameters through discovery, distillation, and dynamic recompilation. On FeatureBench, automatically discovered skills improve pass rate by 8.1pp, with a 27.7% pass rate after distillation.
本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。
StepReflect将移动智能体的逐步GUI反思重构为监督式结构化预测,在AndroidWorld上实现了比GPT-5.2更高的转换准确率,同时降低了API成本。
Proposes Woodpecker Distillation, a weak-to-strong training framework that uses weak probe models to identify and repair local reasoning bugs in stronger models via contrastive local interventions, improving performance on math reasoning benchmarks.
黄仁勋被问及开源模型公司是否应被允许蒸馏闭源模型,他表示蒸馏不是抄袭,而是智能的基本方式。
本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。
一位独立开发者更新了 AttnRes 项目:用基于注意力的路由替代标准残差流,通过渐进式切换计划和 top-K logits 从 Gemma 4 31b 进行蒸馏,并计划推出一个 Apache 2.0 社区模型。
介绍了TQLite,一种利用多LRM评审团训练小型语言模型进行基于MQM的实时翻译质量评估的蒸馏框架,其性能远超现成的SLM,同时保持成本效益。
本文介绍了OPTD,一种用于少步扩散语言模型的、具有一致性引导自适应压缩的在策略转移蒸馏方法,在四个推理和代码生成基准上改善了质量-效率权衡。
ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。
Poly-OPD 是一个框架,用于将异构文生图流模型的互补优势蒸馏到一个紧凑的流匹配学生模型中,通过像素桥和梯度兼容适配器实现。它在提升 GenEval 和 DrawBench 得分的同时,整合了多个教师模型的能力。
作者观察到,像Qwen和Kimi这样的中国AI模型生成的前端代码比OpenAI和Anthropic的产品更美观,并思考这是否归因于蒸馏或其他技术。
SERL-SQL提出了一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架,利用教师-学生似然差距对SQL动作token上的GRPO优势进行重新加权。该方法在BIRD和Spider基准上取得了强劲的结果。
本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。
Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。
JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。
本文认为,美国应制裁那些从事欺诈性窃取美国AI商业秘密的中国AI实验室,同时区分合法的蒸馏技术,并避免禁止开放权重模型。文章重点提及了涉及Moonshot AI和Anthropic的Fable模型的最新事件。
This paper introduces Maga, a method for consolidating domain-specific GUI agents into a single cross-platform policy via structured action distillation, reallocating training signals to focus on erroneous actions. It achieves strong success rates across mobile, web, and desktop benchmarks.
本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。
EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。