distillation

标签

Cards List
#distillation

利用在线策略逆蒸馏实现弱到强泛化

Hugging Face Daily Papers · 昨天 缓存

论文提出了在线策略逆蒸馏(OPRD)方法,该方法通过沿教师策略偏移方向放大验证器支持的策略梯度,使更强的AI模型能够超越较弱的监督者,在蒸馏场景中以更少的更新次数获得更高性能。

0 人收藏 0 人点赞
#distillation

用于一步代码生成的连续扩散

Reddit r/artificial · 昨天

论文提出了一种通过使语言连续化、使用扩散模型并蒸馏轨迹来实现一步代码生成的方法,并附带代码发布。

0 人收藏 0 人点赞
#distillation

蒸馏深度光流立体方法以获取密集三维风场

arXiv cs.LG · 5天前 缓存

本文提出将深度光流立体方法蒸馏到单卫星模型中,以高效获取密集三维风场,在某些光谱波段上提高了传统大气运动矢量的精度。

0 人收藏 0 人点赞
#distillation

在蒸馏前验证:用于在线策略蒸馏的提示级教师门控

arXiv cs.LG · 5天前 缓存

本文介绍了教师门控在线策略蒸馏(TGOPD),一种在提示级别验证教师可靠性的方法,以改善在线策略蒸馏,从而在异步设置中实现更好的性能和更高的GPU利用率。

0 人收藏 0 人点赞
#distillation

冻结代理中受限人格在分类任务匹配检索但在回归任务不匹配

arXiv cs.CL · 5天前 缓存

论文介绍了PersonaLink,一种无需训练的方法,它将用户历史蒸馏为有界人格,在分类任务上匹配检索,但在回归任务上不匹配,突显了任务类型的不对称性。

0 人收藏 0 人点赞
#distillation

训练即部署:弥合低秩克隆蒸馏中的MLP可达性鸿沟

arXiv cs.LG · 6天前 缓存

本文提出一种通过训练完整部署矩阵来弥合低秩克隆蒸馏中MLP可达性鸿沟的方法,显著提升了token效率和模型性能,且不增加推理成本。

0 人收藏 0 人点赞
#distillation

FlashRender:通过相机控制的视频均值流实现几步生成式渲染

Hugging Face Daily Papers · 6天前 缓存

FlashRender是一个几步生成式渲染框架,通过对齐表示和使用均值流目标来加速视频合成,在显著降低采样成本的同时,达到与多步方法相当的质量。

0 人收藏 0 人点赞
#distillation

DISTAL: 用于结构无关材料性质预测的蒸馏与自监督预训练

arXiv cs.LG · 2026-09-02 缓存

DISTAL 是一个双先验框架,它结合自监督组分预训练和结构感知知识蒸馏,以实现低数据环境下的稳健结构无关材料性质预测,提升多个基准任务的表现。

0 人收藏 0 人点赞
#distillation

给你的AI代理一个思考的空间,实时观察其决策过程

Reddit r/AI_Agents · 2026-09-01

作者描述了一个实验,其中像Claude Code和Codex这样的AI代理被提供一个工作手册,以记录它们在任务中的决策和权衡,探讨这些推理痕迹作为蒸馏信号的潜在用途。

0 人收藏 0 人点赞
#distillation

@DeRonin_: 这些人搭建了一个无限电影生成机器... @fal 的经过后训练的 Minimax H3 Max 比原版快50倍…

X AI KOLs Timeline · 2026-08-29 缓存

FastVideo 发布了一款开源的、经过后训练的 Minimax H3 模型,它能以50倍的速度生成视频,仅需3秒计算时间即可输出5秒的视频内容,适用于文本到音频视频的生成。

0 人收藏 0 人点赞
#distillation

扩展模型生成的蒸馏数据可使潜在教师特质更易恢复

arXiv cs.LG · 2026-08-28 缓存

本文表明,扩展任务外模型生成的蒸馏数据可以放大学生的潜在教师特质,即使数据看似无害,这表明在AI训练中需要特质感知的筛选。

0 人收藏 0 人点赞
#distillation

EditaLive! 用于直播的统一角色视频编辑

Hugging Face Daily Papers · 2026-08-27 缓存

EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。

0 人收藏 0 人点赞
#distillation

低延迟激活正则化稀疏神经算子与蒸馏辅助实现的实时边缘部署虚拟感知

arXiv cs.LG · 2026-08-26 缓存

本文提出了一种Sparse-Activation-ReLU (SAR)层,用于低延迟、高能效的虚拟感知,在延迟-误差-能效指标上实现了显著提升,并通过合成知识蒸馏降低了误差。

0 人收藏 0 人点赞
#distillation

PROOF-Gen: 从优化数据到更好的蒸馏

arXiv cs.AI · 2026-08-26 缓存

PROOF-Gen 提出了一种每个场景的反思优化方法,用于恢复失败的轨迹以蒸馏工具调用能力,从而提升蒸馏流程中的数据质量和模型性能。

0 人收藏 0 人点赞
#distillation

STAR-OPD: 用于ABSA四元组提取的结构化方面级联感知在线策略奖励蒸馏

arXiv cs.CL · 2026-08-24 缓存

STAR-OPD是一种新颖的在线策略蒸馏方法,用于ABSA四元组提取,它使用集合结构化奖励来纠正学生模型中的结构错误,提高性能并缩小与教师模型之间的差距。

0 人收藏 0 人点赞
#distillation

知道但不说:通过 Recall-Anchored Distillation (RAD) 防止大语言模型监督微调中的事实访问失败

arXiv cs.AI · 2026-08-24 缓存

本文识别了大语言模型在监督微调后出现的事实访问失败现象,并介绍了回忆锚定蒸馏(RAD),无需标注数据即可保留分布外事实回忆能力。

0 人收藏 0 人点赞
#distillation

有意图的行动:蒸馏视觉-语言-动作模型的行为意图

Hugging Face Daily Papers · 2026-08-24 缓存

本文提出意图蒸馏 (INDI),将行为意图蒸馏到视觉-语言-动作模型的动作解码器中,从而在SimplerEnv-Bridge等基准测试和现实世界任务中提高了性能。

0 人收藏 0 人点赞
#distillation

@ethayarajh: 我最近做了一场讲座,向年轻经济学家介绍后训练。幻灯片现在已上线!https://kawine.github.io/a…

X AI KOLs Timeline · 2026-08-21 缓存

一场向年轻经济学家介绍AI后训练的讲座,讨论了SFT、DPO等方法以及世界适应的未来挑战。

0 人收藏 0 人点赞
#distillation

无前沿发布的开放权重进展

Reddit r/singularity · 2026-08-21

软件开发者探讨OpenAI和Anthropic将模型保持内部开发的策略可能如何影响开放权重发布,以及中国公司对模型的复现。

0 人收藏 0 人点赞
#distillation

截断差项,提升优项:基于排名分类的BoN式蒸馏

arXiv cs.LG · 2026-08-21 缓存

论文提出了TUP,一种基于排名分类的BoN式蒸馏方法,通过截断低排名的完成项并提升高排名的项,以改善对齐效率和性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈