distillation

标签

Cards List
#distillation

Scaffold-Mediated Post-Training: Co-Evolving Model Parameters and Procedural Scaffold Graphs

arXiv cs.CL · 2天前 缓存

This paper proposes scaffold-mediated post-training, a paradigm where procedural scaffolds co-evolve with LLM parameters through discovery, distillation, and dynamic recompilation. On FeatureBench, automatically discovered skills improve pass rate by 8.1pp, with a 27.7% pass rate after distillation.

0 人收藏 0 人点赞
#distillation

阈下学习是非语义蒸馏

arXiv cs.AI · 2天前 缓存

本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。

0 人收藏 0 人点赞
#distillation

StepReflect:面向移动GUI智能体的结构化UI转换反思

arXiv cs.AI · 2天前 缓存

StepReflect将移动智能体的逐步GUI反思重构为监督式结构化预测,在AndroidWorld上实现了比GPT-5.2更高的转换准确率,同时降低了API成本。

0 人收藏 0 人点赞
#distillation

Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models

arXiv cs.AI · 2天前 缓存

Proposes Woodpecker Distillation, a weak-to-strong training framework that uses weak probe models to identify and repair local reasoning bugs in stronger models via contrastive local interventions, improving performance on math reasoning benchmarks.

0 人收藏 0 人点赞
#distillation

@FinanceYF5: Jensen Huang 谈 Distillation 1/ Jensen Huang 被问:开源模型公司该不该被允许蒸馏闭源模型? 他的回答直接把很多人绕开的问题讲透了——蒸馏不是抄袭,是智能的基本方式。

X AI KOLs Timeline · 3天前 缓存

黄仁勋被问及开源模型公司是否应被允许蒸馏闭源模型,他表示蒸馏不是抄袭,而是智能的基本方式。

0 人收藏 0 人点赞
#distillation

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers · 3天前 缓存

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。

0 人收藏 0 人点赞
#distillation

Gemma 4 31b AttnRes 项目

Reddit r/LocalLLaMA · 3天前

一位独立开发者更新了 AttnRes 项目:用基于注意力的路由替代标准残差流,通过渐进式切换计划和 top-K logits 从 Gemma 4 31b 进行蒸馏,并计划推出一个 Apache 2.0 社区模型。

0 人收藏 0 人点赞
#distillation

TQLite:多LLM评审团引导的蒸馏,用于实时MQM翻译质量评估

arXiv cs.CL · 4天前 缓存

介绍了TQLite,一种利用多LRM评审团训练小型语言模型进行基于MQM的实时翻译质量评估的蒸馏框架,其性能远超现成的SLM,同时保持成本效益。

0 人收藏 0 人点赞
#distillation

OPTD:面向少步扩散语言模型的基于一致性引导自适应压缩的在策略转移蒸馏

arXiv cs.CL · 4天前 缓存

本文介绍了OPTD,一种用于少步扩散语言模型的、具有一致性引导自适应压缩的在策略转移蒸馏方法,在四个推理和代码生成基准上改善了质量-效率权衡。

0 人收藏 0 人点赞
#distillation

ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频生成

Hugging Face Daily Papers · 4天前 缓存

ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。

0 人收藏 0 人点赞
#distillation

Poly-OPD:面向能力可选的流模型的异构多教师同策略蒸馏

Hugging Face Daily Papers · 4天前 缓存

Poly-OPD 是一个框架,用于将异构文生图流模型的互补优势蒸馏到一个紧凑的流匹配学生模型中,通过像素桥和梯度兼容适配器实现。它在提升 GenEval 和 DrawBench 得分的同时,整合了多个教师模型的能力。

0 人收藏 0 人点赞
#distillation

为什么中国模型在前端方面比西方顶尖实验室更好*?

Reddit r/LocalLLaMA · 4天前

作者观察到,像Qwen和Kimi这样的中国AI模型生成的前端代码比OpenAI和Anthropic的产品更美观,并思考这是否归因于蒸馏或其他技术。

0 人收藏 0 人点赞
#distillation

SERL-SQL:面向Text-to-SQL强化智能体学习的选择性事后蒸馏

arXiv cs.CL · 5天前 缓存

SERL-SQL提出了一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架,利用教师-学生似然差距对SQL动作token上的GRPO优势进行重新加权。该方法在BIRD和Spider基准上取得了强劲的结果。

0 人收藏 0 人点赞
#distillation

@furongh:RL 与蒸馏可能是一个伪二分法。一种后训练抽象:将 RL 视为监督的编译器。使用策略…

X AI KOLs Timeline · 5天前 缓存

本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。

0 人收藏 0 人点赞
#distillation

Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型

Hugging Face Daily Papers · 5天前 缓存

Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。

0 人收藏 0 人点赞
#distillation

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Hugging Face Daily Papers · 5天前 缓存

JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。

0 人收藏 0 人点赞
#distillation

@RyanFedasiuk: 蒸馏是一种AI训练技术。Moonshot对Anthropic的所作所为是欺诈。在为@WarOnTheRocks撰写的新文章中……

X AI KOLs Following · 5天前 缓存

本文认为,美国应制裁那些从事欺诈性窃取美国AI商业秘密的中国AI实验室,同时区分合法的蒸馏技术,并避免禁止开放权重模型。文章重点提及了涉及Moonshot AI和Anthropic的Fable模型的最新事件。

0 人收藏 0 人点赞
#distillation

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

arXiv cs.AI · 6天前 缓存

This paper introduces Maga, a method for consolidating domain-specific GUI agents into a single cross-platform policy via structured action distillation, reallocating training signals to focus on erroneous actions. It achieves strong success rates across mobile, web, and desktop benchmarks.

0 人收藏 0 人点赞
#distillation

DAPD:双锚定策略蒸馏

Hugging Face Daily Papers · 6天前 缓存

本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。

0 人收藏 0 人点赞
#distillation

[论文] EdgeRazor:一种基于混合精度量化感知蒸馏的大语言模型轻量级框架

Reddit r/LocalLLaMA · 6天前

EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈